LG AI Research, Tabular 데이터용 경량 파운데이션 모델 'EXAONE Tabular' 공개
핵심 내용
LG AI Research가 실제 데이터 없이 사전학습된 경량 Tabular 파운데이션 모델 EXAONE Tabular을 공개했다.
자세히 보기
LG AI Research가 구조화된(tabular) 데이터를 위한 분류 및 회귀 파운데이션 모델 **'EXAONE Tabular'**을 공개했다. 이 모델은 기존 Tree-based boosting(XGBoost, LightGBM 등)의 한계인 데이터셋별 재학습과 높은 리소스 소모 문제를 해결하기 위해 개발되었다.
핵심 아키텍처 및 학습 방식
EXAONE Tabular은 실제 Tabular 데이터가 아닌 Structural Causal Models(SCM) 기반의 합성 데이터(synthetic data)만으로 사전학습을 수행했다. 이를 통해 특정 도메인 의존성을 제거하고 unseen 데이터셋에 대한 일반화 능력을 확보했다.
- Cross-Axis Summary Transformer(CAST): Feature-axis와 sample-axis attention을 교대로 수행하여 feature interaction과 support-set context를 정제한다.
- In-context Learning: labeled support set과 unlabeled query set을 입력하면 parameter update 없이 즉시 예측을 수행한다.
- Robustness: 사전학습 시 결측치와 오류 패턴을 포함하여, 별도 imputation 없이 결측치가 포함된 데이터를 직접 입력해도 안정적인 예측이 가능하다.
성능 및 효율성
모델 크기는 분류 20.8M, 회귀 21.11M 파라미터로 매우 경량화되었다. TabArena 벤치마크에서 튜닝 없이도 종합 1위를 기록했으며, Google의 TabFM(1.64B 파라미터)과 비교해 동등한 성능을 내면서도 inference 비용은 약 1/11 수준이다.
- 분류 성능: TabPFN-3 대비 Elo 점수 약 125점 우위, AutoGluon AutoML 파이프라인보다 성능 우수.
- 회귀 성능: TabFM을 상회하며, ScoringBench에서 예측 불확실성 포착 능력(CRPS 지표)까지 입증했다.
- 추론 속도: 1,000 샘플당 0.605초의 낮은 지연 시간을 기록하여 실시간 배포에 적합하다.
배포 및 활용
현재 배터리 셀 결함 감지 등 제조 공정에서 제품 품질 예측 및 잠재적 결함 조기 경고용으로 이미 배포되었다. LG AI Research는 GitHub와 Hugging Face에 연구/교육용 inference software를 공개했으며, 상업용은 별도 라이선스를 제공한다. 향후 biotech, healthcare, finance 분야로 응용 범위를 확대할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.