LG AI Research 387
핵심 내용
LG AI연구원이 NeurIPS 2023에서 정형 데이터(Tabular Data)의 딥러닝 성능을 높이기 위한 새로운 학습 방법론을 발표했다.
자세히 보기
정형 데이터(Tabular Data)는 행과 열로 구성된 테이블 형태의 데이터로, 이미지나 텍im, 음성과 같은 비정형 데이터에 비해 딥러닝 적용 시 성능을 내기 어렵다. 이는 딥 네트워크가 복잡하고 매끄러운(Smooth) 함수를 학습하는 데 특화되어 있어, 불연속적인 특성을 가진 정형 데이터의 Irregular Function을 학습하는 데 한계가 있기 때문이다.
LG AI연구원의 DI Lab은 이를 극복하기 위해 Binning as a Pretext Task라는 방법론을 제안했다. 이 방식은 연속(Continuous) 변수를 불연속(Discrete) 변수로 변환하는 Binning Algorithm을 활용하며, Autoencoder 구조를 통해 입력값 대신 입력값의 Binning Class를 예측하도록 설계되었다.
이 방식의 주요 장점은 다음과 같다:
- Inductive Bias 부여: 타겟을 불연속 변수로 변경하여 Irregular Function 학습을 돕는다.
- 데이터 통합: 수치형과 이산형 변수가 혼재된 환경에서 모든 변수를 Bin으로 설정해 효과적으로 처리한다.
- 노이즈 억제: 유사한 값을 그룹화하고 미세한 오류(Minor Error)를 무시할 수 있다.
- 유연성: 기존 Encoder 네트워크나 Augmentation, Loss Function을 자유롭게 결합할 수 있다.
실험 결과, 이 방법론은 25개의 데이터셋에서 Binary/Multiclass Classification 및 Regression 태스크에 대해 우수한 성능을 보였으며, 최신 Tree-based 알고리즘과 비교해도 대등하거나 더 나은 성능을 기록했다.
또한, 본 글은 NeurIPS 2023에서 발표된 다른 연구들도 소개한다. 특히 GBDTs(CatBoost, LightGBM, XGBoost)와 Neural Networks(TabPFN, FT-Transformer 등) 간의 성능 차이를 대규모로 분석한 연구를 다루며, GBDTs가 불규칙한 데이터나 대규모 데이터셋에서 여전히 강력한 성능을 보인다는 점을 시사한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.