AI Briefing

TabPFN - 정형 데이터를 위한 파운데이션 모델

·2026.05.21 09:46

TabPFN이 정형 데이터용 파운데이션 모델과 확장 기능을 공개했다.

TabPFN은 정형(tabular) 데이터 전용 파운데이션 모델로, fit / predict 방식의 scikit-learn 스타일 인터페이스로 분류와 회귀를 바로 수행할 수 있다.

기본 모델인 TabPFN-2.6순수 합성 데이터로 학습됐고, 처음 실행할 때 체크포인트를 자동 다운로드한다. 별도 학습 파이프라인이 필요 없으며, 스케일링이나 원-핫 인코딩 같은 전처리 없이 원본 데이터를 그대로 넣는 방식이다. 결측값도 자체 처리한다.

운영 측면에서는 GPU 사용을 권장하며, 대략 8GB VRAM 이상이 필요하다. CPU에서는 약 1,000개 샘플 이하 수준만 실용적이고, GPU가 없는 환경을 위해 TabPFN Client의 클라우드 추론도 제공한다.

사용 방식에 제약도 명확하다. predict를 샘플 단위로 반복 호출하면 학습 세트를 매번 다시 계산해 단일 호출 대비 약 100배 느려질 수 있어, 테스트 세트는 1,000개 단위 배치로 나누는 것이 권장된다. 성능 범위는 10만 샘플, 2,000 피처 이하가 중심이며, 5만~10만 샘플ignore_pretraining_limits=True 설정을, 10만 초과는 별도 Large Datasets Guide를 따른다.

주변 생태계도 함께 제공된다.

  • TabPFN Extensions: SHAP 해석, 이상치 탐지, 합성 데이터 생성, 임베딩 추출, 하이퍼파라미터 최적화, Post-Hoc 앙상블
  • HuggingFace 체크포인트: 대규모 피처용, 대규모 샘플용, 소규모 샘플용, 실제 데이터 파인튜닝 버전
  • Enterprise Edition: 증류 엔진 기반 저지연 추론, 최대 1,000만 행 지원, 상용 라이선스
  • TabPFN UX: 코드 없이 쓰는 그래픽 인터페이스

라이선스는 **Prior Labs License(Apache 2.0 + 귀속 요건)**가 적용되며, TabPFN-2.5/2.6 가중치비상업적 라이선스로 제공된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.