AI Briefing

LightGBM 피처 중요도의 함정

Why our #1 LightGBM feature by importance made predictions worse [D]

·2026.06.02 03:20

핵심 내용

타겟 인코딩 피처가 높은 중요도를 보였음에도 일반화에 실패한 사례를 분석했다.

자세히 보기

LightGBM quantile regression을 사용하는 가격 예측 엔진에서 피처 중요도가 높음에도 예측 성능이 저하되는 현상이 발생했다.

Variant-conditioned Bayesian target encoder를 도입했을 때, 이 피처는 모든 시드 실행에서 q90 기준 압도적인 feature importance 1위를 기록했다.

하지만 검증 데이터셋 테스트 결과, MAPE(Mean Absolute Percentage Error)가 0.28pp 상승하며 오히려 성능이 저하되었다.

원인은 인코더가 제품 상태, 판매자 행동 등 피처로 포착할 수 없는 **비가역적 라벨 분산(irreducible label variance)**을 학습하여 과적합되었기 때문이다. 이는 피처 중요도가 높더라도 모델의 일반화 성능을 보장하지 않음을 보여주는 사례다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.