[ICML 2022] 1편: Long-Tail Distribution Learning
·2026.07.16 09:00
데이터 불균형 문제를 해결하기 위한 Long-Tail Distribution 학습의 개념과 다양한 방법론을 살펴본다.
실제 산업 현장의 데이터는 특정 클래스의 샘플은 많고(Head-class), 특정 클래스는 매우 적은(Long-tail-class) Long-Tail Distribution(LTD) 특성을 갖는 경우가 많습니다. 이러한 데이터 불균형은 모델이 다수 클래스에 편향되게 학습되어 소수 클래스에서 성능 저하를 일으키는 원인이 됩니다.
이를 해결하기 위한 방법론은 크게 다섯 가지로 분류할 수 있습니다.
- Re-Sampling: 데이터 수준의 접근법으로, 샘플 수를 맞추기 위해 데이터를 제거하는 Under-Sampling이나 복제/생성하는 Over-Sampling이 있습니다.
- Cost-Sensitive Learning: 알고리즘 수준에서 클래스별 Loss 값에 차등을 두어 모델의 일반화 성능을 높이는 방식입니다.
- Transfer Learning: 학습된 지식을 활용하는 방식입니다.
- Representation Learning: 특징 추출 능력을 개선하는 방식입니다.
- Decoupled Training: 학습 과정을 분리하여 최적화하는 방식입니다.
본 글에서는 이러한 전통적 기법부터 최신 Deep Learning 모델의 SOTA 방법론까지 다루며, 특히 ICML 2022에서 발표된 PASCL(Partial and Asymmetric Supervised Contrastive Learning) 논문을 소개합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.