[NAACL 2025 Best Paper Award] BiGGen Bench: 정밀한 인간 평가 기준을 반영한 LLM 평가 프레임워크
LG AI연구원이 인간의 정밀한 평가 기준을 LLM에 반영한 새로운 벤치마크 BiGGen Bench를 개발해 NAACL 2025 Best Paper를 수상했다.
기존 LLM 벤치마크는 선호도나 유용성 같은 추상적인 기준에 의존하여 모델의 성능을 정밀하게 구분하는 데 한계가 있었습니다. LG AI연구원 Super Intelligence Lab은 이러한 문제를 해결하고자 인간 전문가의 세밀한 판단 기준을 LLM이 자동 평가에 활용할 수 있는 BiGGen Bench를 개발했습니다.
BiGGen Bench는 LLM의 9가지 핵심 능력(Instruction Following, Grounding, Reasoning 등)을 진단하기 위해 77개의 세부 과제와 775개의 문항, 그리고 구체적인 Scoring Rubric을 구축했습니다. 이를 통해 단순한 선호도 측정을 넘어 논리적 타당성이나 연산 정확도와 같은 정밀한 평가가 가능해졌습니다.
이번 연구는 자연어 처리 분야 최고 권위 학회인 NAACL 2025에서 단 한 편에게 주어지는 Best Paper Award로 선정되며 연구적 가치를 입증했습니다. 이는 과거 ELMo나 BERT가 수상했던 사례와 비견될 만큼 의미 있는 성과로 평가받습니다.
실제 성능 검증 결과, LG AI연구원의 EXAONE 3.5 모델은 BiGGen Bench 기준 평균 4.189점을 기록하며 최신 Non-Thinking 모델들 중 상위권의 성능을 보여주었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.