TabFM: 정형 데이터를 위한 Zero-shot Foundation Model
·2026.07.01 07:08
구글이 정형 데이터의 분류 및 회귀 작업을 위해 별도의 학습 없이 예측 가능한 TabFM 모델을 공개했다.
기존의 XGBoost나 Random Forest 같은 트리 기반 알고리즘은 새로운 데이터셋에 적용할 때마다 복잡한 하이퍼파라미터 최적화와 피처 엔지니어링이 필요하다는 단점이 있습니다.
TabFM은 이러한 과정을 생략하기 위해 In-Context Learning(ICL) 방식을 정형 데이터에 도입한 새로운 파운데이션 모델입니다. 모델은 별도의 가중치 업데이트 없이, 데이터셋 전체를 하나의 프롬프트로 받아 행과 열 사이의 관계를 직접 해석하여 예측을 수행합니다.
이 모델은 다음과 같은 세 가지 핵심 메커니즘을 통해 작동합니다:
- Alternating row and column attention: 행과 열에 대해 교차 어텐션을 적용하여 복잡한 피처 간 상호작용을 학습합니다.
- Row compression: 각 행의 풍부한 정보를 하나의 밀집된 벡터(dense vector)로 압축합니다.
- In-context learning: 압축된 벡터 시퀀스에 트랜스포머를 적용하여 계산 효율성을 높이고 대규모 데이터셋에서도 빠른 예측을 가능하게 합니다.
TabFM은 현재 Hugging Face와 GitHub를 통해 공개되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.