LG AI연구원, 합성 데이터만으로 학습한 정형 데이터 파운데이션 모델 'EXAONE Tabular' 공개
핵심 내용
LG AI연구원이 실제 데이터 없이 합성 데이터만으로 사전 학습된 정형 데이터 파운데이션 모델 'EXAONE Tabular'를 공개했다.
자세히 보기
LG AI연구원이 정형 데이터의 분류 및 회귀 예측을 위한 파운데이션 모델 **'EXAONE Tabular'**를 공개했다. 기존 트리 기반 부스팅 모델과 달리, 새로운 데이터셋마다 별도 학습이 필요 없는 In-context Learning 방식을 채택해 재학습 부담을 제거했다.
이 모델은 실제 표 데이터를 단 한 건도 사용하지 않고, 인과 그래프 기반의 합성 데이터만으로 사전 학습되었다. 특히 학습 단계에서 결측치 패턴을 포함시켜, 실제 현장의 불완전한 데이터에서도 강건한 예측 성능을 보인다. 분류 모델은 약 2,080만, 회귀 모델은 약 2,111만 파라미터의 초경량 구조로 설계되었다.
벤치마크 결과, 정형 데이터 평가 지표인 TabArena에서 분류 부문 1위를 기록했으며, 추론 비용은 구글의 'TabFM' 대비 약 1/11 수준으로 낮췄다. 또한 4시간 소요되는 AutoML 파이프라인 성능을 상회하며, 1,000개 샘플당 0.605초의 빠른 추론 속도를 달성했다. BCCO, TALENT 등 4개 공개 벤치마크에서도 파라미터 규모 대비 압도적인 효율성을 입증했다.
핵심 기술로는 행과 열 축의 어텐션을 교차 수행하는 Cross-Axis Summary Transformer(CAST) 구조를 적용했다. 이를 통해 셀 단위의 표현을 유지하면서 특성 간 상호작용과 문맥 정보를 정교하게 처리한다. 추론 코드는 GitHub와 Hugging Face에 공개되며, 향후 바이오, 금융, 제조 분야 실증을 통해 현장 적용을 확대할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.