AI Briefing

LG AI연구원, 합성 데이터만으로 학습한 정형 데이터 파운데이션 모델 'EXAONE Tabular' 공개

·2026.09.09 09:00

핵심 내용

LG AI연구원이 실제 데이터 없이 합성 데이터만으로 사전 학습된 정형 데이터 파운데이션 모델 'EXAONE Tabular'를 공개했다.

1 / 4

자세히 보기

LG AI연구원이 정형 데이터의 분류 및 회귀 예측을 위한 파운데이션 모델 **'EXAONE Tabular'**를 공개했다. 기존 트리 기반 부스팅 모델과 달리, 새로운 데이터셋마다 별도 학습이 필요 없는 In-context Learning 방식을 채택해 재학습 부담을 제거했다.

이 모델은 실제 표 데이터를 단 한 건도 사용하지 않고, 인과 그래프 기반의 합성 데이터만으로 사전 학습되었다. 특히 학습 단계에서 결측치 패턴을 포함시켜, 실제 현장의 불완전한 데이터에서도 강건한 예측 성능을 보인다. 분류 모델은 약 2,080만, 회귀 모델은 약 2,111만 파라미터의 초경량 구조로 설계되었다.

벤치마크 결과, 정형 데이터 평가 지표인 TabArena에서 분류 부문 1위를 기록했으며, 추론 비용은 구글의 'TabFM' 대비 약 1/11 수준으로 낮췄다. 또한 4시간 소요되는 AutoML 파이프라인 성능을 상회하며, 1,000개 샘플당 0.605초의 빠른 추론 속도를 달성했다. BCCO, TALENT 등 4개 공개 벤치마크에서도 파라미터 규모 대비 압도적인 효율성을 입증했다.

핵심 기술로는 행과 열 축의 어텐션을 교차 수행하는 Cross-Axis Summary Transformer(CAST) 구조를 적용했다. 이를 통해 셀 단위의 표현을 유지하면서 특성 간 상호작용과 문맥 정보를 정교하게 처리한다. 추론 코드는 GitHub와 Hugging Face에 공개되며, 향후 바이오, 금융, 제조 분야 실증을 통해 현장 적용을 확대할 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.