[NAACL 2025 Best Paper Award] BiGGen Bench: 정밀한 인간 평가 기준을 반영한 LLM 평가 프레임워크
핵심 내용
LG AI연구원이 인간의 정밀한 평가 기준을 LLM에 반영한 새로운 벤치마크 BiGGen Bench를 개발해 NAACL 2025 Best Paper를 수상했다.
자세히 보기
기존 LLM 벤치마크는 선호도나 유용성 같은 추상적인 기준에 의존하여 모델의 성능을 정밀하게 구분하는 데 한계가 있었습니다. LG AI연구원 Super Intelligence Lab은 이러한 문제를 해결하고자 인간 전문가의 세밀한 판단 기준을 LLM이 자동 평가에 활용할 수 있는 BiGGen Bench를 개발했습니다.
BiGGen Bench는 LLM의 9가지 핵심 능력(Instruction Following, Grounding, Reasoning 등)을 진단하기 위해 77개의 세부 과제와 775개의 문항, 그리고 구체적인 Scoring Rubric을 구축했습니다. 이를 통해 단순한 선호도 측정을 넘어 논리적 타당성이나 연산 정확도와 같은 정밀한 평가가 가능해졌습니다.
이번 연구는 자연어 처리 분야 최고 권위 학회인 NAACL 2025에서 단 한 편에게 주어지는 Best Paper Award로 선정되며 연구적 가치를 입증했습니다. 이는 과거 ELMo나 BERT가 수상했던 사례와 비견될 만큼 의미 있는 성과로 평가받습니다.
실제 성능 검증 결과, LG AI연구원의 EXAONE 3.5 모델은 BiGGen Bench 기준 평균 4.189점을 기록하며 최신 Non-Thinking 모델들 중 상위권의 성능을 보여주었습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.