LG AI Research 387
LG AI연구원이 NeurIPS 2023에서 정형 데이터(Tabular Data)의 딥러닝 성능을 높이기 위한 새로운 학습 방법론을 발표했다.
정형 데이터(Tabular Data)는 행과 열로 구성된 테이블 형태의 데이터로, 이미지나 텍im, 음성과 같은 비정형 데이터에 비해 딥러닝 적용 시 성능을 내기 어렵다. 이는 딥 네트워크가 복잡하고 매끄러운(Smooth) 함수를 학습하는 데 특화되어 있어, 불연속적인 특성을 가진 정형 데이터의 Irregular Function을 학습하는 데 한계가 있기 때문이다.
LG AI연구원의 DI Lab은 이를 극복하기 위해 Binning as a Pretext Task라는 방법론을 제안했다. 이 방식은 연속(Continuous) 변수를 불연속(Discrete) 변수로 변환하는 Binning Algorithm을 활용하며, Autoencoder 구조를 통해 입력값 대신 입력값의 Binning Class를 예측하도록 설계되었다.
이 방식의 주요 장점은 다음과 같다:
- Inductive Bias 부여: 타겟을 불연속 변수로 변경하여 Irregular Function 학습을 돕는다.
- 데이터 통합: 수치형과 이산형 변수가 혼재된 환경에서 모든 변수를 Bin으로 설정해 효과적으로 처리한다.
- 노이즈 억제: 유사한 값을 그룹화하고 미세한 오류(Minor Error)를 무시할 수 있다.
- 유연성: 기존 Encoder 네트워크나 Augmentation, Loss Function을 자유롭게 결합할 수 있다.
실험 결과, 이 방법론은 25개의 데이터셋에서 Binary/Multiclass Classification 및 Regression 태스크에 대해 우수한 성능을 보였으며, 최신 Tree-based 알고리즘과 비교해도 대등하거나 더 나은 성능을 기록했다.
또한, 본 글은 NeurIPS 2023에서 발표된 다른 연구들도 소개한다. 특히 GBDTs(CatBoost, LightGBM, XGBoost)와 Neural Networks(TabPFN, FT-Transformer 등) 간의 성능 차이를 대규모로 분석한 연구를 다루며, GBDTs가 불규칙한 데이터나 대규모 데이터셋에서 여전히 강력한 성능을 보인다는 점을 시사한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.