LG AI Research: 비정형 데이터셋에서의 신경 상호 정보량 추정 평가를 위한 벤치마크 스위트
LG AI Research는 기존 가우시안 데이터 중심의 한계를 넘어 비정형 데이터에서 상호 정보량(MI) 추정 성능을 검증할 수 있는 새로운 벤치마크를 제안했다.
NeurIPS 2024에서 발표된 LG AI Research의 Data Intelligence(DI) Lab 연구는 딥러닝 연구에서 간과되기 쉬운 상호 정보량(Mutual Information, MI) 추정의 신뢰성 문제를 다룬다.
MI는 두 확률 변수 간의 관계를 측정하는 핵심 지표로, Representation Learning, Self-supervised Learning, Reinforcement Learning 등 다양한 분야에서 활용된다. 하지만 실제 세계의 데이터는 복잡한 비정형 데이터인 반면, 기존의 MI 추정 기술들은 주로 Gaussian Multivariates 벤치마크에서만 검증되어 실제 데이터(이미지, 텍스트 등)에서의 성능을 보장하기 어려웠다.
본 연구는 다음과 같은 세 가지 핵심 기여를 한다:
- 임의의 데이터셋에서도 정확한 True MI 값을 알 수 있도록 데이터를 생성하는 방법론 제안
- 가우시안, 이미지, 문장 임베딩을 포함한 다양한 환경에서 MI 추정기의 정확도를 평가할 수 있는 벤치마크 스위트 구축
- 7가지 시나리오를 바탕으로 한 MI 추정기 성능 비교 및 실험 결과 요약
정확한 MI 값을 생성하기 위해 연구팀은 Same-class sampling을 활용한 positive pairing 기법을 사용했다. 이를 통해 클래스 정보만을 공유하는 데이터셋을 구성함으로써, 이론적인 MI 값이 클래스 변수의 엔트로피와 일치하도록 설계하여 추정기의 성능을 엄밀하게 검증할 수 있는 기반을 마련했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.