[NAACL 2025 최우수 논문상] BiGGen Bench: 언어 모델의 세밀한 평가를 위한 원칙적 벤치마크 - LG AI Research 블로그
·2026.07.16 09:00
LG AI Research가 언어 모델의 역량을 정밀하게 진단하기 위한 새로운 벤치마크 BiGGen Bench를 개발해 NAACL 2025 최우수 논문상을 수상했다.
기존의 언어 모델 벤치마크는 선호도나 유용성 같은 추상적인 기준에 의존하여 모델의 역량을 세밀하게 구분하는 데 한계가 있었다. 이를 해결하기 위해 LG AI Research의 Super Intelligence Lab은 KAIST 서민준 교수 연구팀 및 글로벌 대학들과 협력하여 BiGGen Bench를 개발했다.
BiGGen Bench는 언어 모델의 9가지 핵심 역량과 77개의 세부 작업 유형을 정의하며, 총 775개의 프롬프트와 그에 따른 평가 루브릭(Rubric)을 설계했다. 이 연구는 자연어 처리 분야의 권위 있는 학회인 NAACL 2025에서 2,000개 이상의 논문 중 단 하나뿐인 Best Paper Award를 수상하며 그 가치를 인정받았다.
이 벤치마크는 다음과 같은 하이브리드 평가 프레임워크를 제안한다.
- 인간(Human): 도메인 및 작업 유형별로 상세한 평가 루브릭을 정의하여 신뢰성 확보
- LLM: 정의된 루브릭을 바탕으로 평가를 수행하여 확장성(Scalability) 확보
또한, LG AI Research의 LLM인 EXAONE 3.5를 이 벤치마크로 평가한 결과, 추론(Reasoning) 모델을 제외한 최신 비추론 모델 중 최고 수준인 평균 4.189점을 기록하며 뛰어난 성능을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.