AI Briefing

LG AI Research 387

·2026.07.16 09:00

핵심 내용

LG AI연구원이 NeurIPS 2023에서 정형 데이터(Tabular Data)의 딥러닝 성능을 높이기 위한 새로운 학습 방법론을 발표했다.

1 / 2

자세히 보기

정형 데이터(Tabular Data)는 행과 열로 구성된 테이블 형태의 데이터로, 이미지나 텍im, 음성과 같은 비정형 데이터에 비해 딥러닝 적용 시 성능을 내기 어렵다. 이는 딥 네트워크가 복잡하고 매끄러운(Smooth) 함수를 학습하는 데 특화되어 있어, 불연속적인 특성을 가진 정형 데이터의 Irregular Function을 학습하는 데 한계가 있기 때문이다.

LG AI연구원의 DI Lab은 이를 극복하기 위해 Binning as a Pretext Task라는 방법론을 제안했다. 이 방식은 연속(Continuous) 변수를 불연속(Discrete) 변수로 변환하는 Binning Algorithm을 활용하며, Autoencoder 구조를 통해 입력값 대신 입력값의 Binning Class를 예측하도록 설계되었다.

이 방식의 주요 장점은 다음과 같다:

  • Inductive Bias 부여: 타겟을 불연속 변수로 변경하여 Irregular Function 학습을 돕는다.
  • 데이터 통합: 수치형과 이산형 변수가 혼재된 환경에서 모든 변수를 Bin으로 설정해 효과적으로 처리한다.
  • 노이즈 억제: 유사한 값을 그룹화하고 미세한 오류(Minor Error)를 무시할 수 있다.
  • 유연성: 기존 Encoder 네트워크나 Augmentation, Loss Function을 자유롭게 결합할 수 있다.

실험 결과, 이 방법론은 25개의 데이터셋에서 Binary/Multiclass Classification 및 Regression 태스크에 대해 우수한 성능을 보였으며, 최신 Tree-based 알고리즘과 비교해도 대등하거나 더 나은 성능을 기록했다.

또한, 본 글은 NeurIPS 2023에서 발표된 다른 연구들도 소개한다. 특히 GBDTs(CatBoost, LightGBM, XGBoost)와 Neural Networks(TabPFN, FT-Transformer 등) 간의 성능 차이를 대규모로 분석한 연구를 다루며, GBDTs가 불규칙한 데이터나 대규모 데이터셋에서 여전히 강력한 성능을 보인다는 점을 시사한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.