AI Briefing

[NAACL 2025 최우수 논문상] BiGGen Bench: 언어 모델의 세밀한 평가를 위한 원칙적 벤치마크 - LG AI Research 블로그

·2026.07.16 09:00

핵심 내용

LG AI Research가 언어 모델의 역량을 정밀하게 진단하기 위한 새로운 벤치마크 BiGGen Bench를 개발해 NAACL 2025 최우수 논문상을 수상했다.

자세히 보기

기존의 언어 모델 벤치마크는 선호도나 유용성 같은 추상적인 기준에 의존하여 모델의 역량을 세밀하게 구분하는 데 한계가 있었다. 이를 해결하기 위해 LG AI Research의 Super Intelligence Lab은 KAIST 서민준 교수 연구팀 및 글로벌 대학들과 협력하여 BiGGen Bench를 개발했다.

BiGGen Bench는 언어 모델의 9가지 핵심 역량과 77개의 세부 작업 유형을 정의하며, 총 775개의 프롬프트와 그에 따른 평가 루브릭(Rubric)을 설계했다. 이 연구는 자연어 처리 분야의 권위 있는 학회인 NAACL 2025에서 2,000개 이상의 논문 중 단 하나뿐인 Best Paper Award를 수상하며 그 가치를 인정받았다.

이 벤치마크는 다음과 같은 하이브리드 평가 프레임워크를 제안한다.

  • 인간(Human): 도메인 및 작업 유형별로 상세한 평가 루브릭을 정의하여 신뢰성 확보
  • LLM: 정의된 루브릭을 바탕으로 평가를 수행하여 확장성(Scalability) 확보

또한, LG AI Research의 LLM인 EXAONE 3.5를 이 벤치마크로 평가한 결과, 추론(Reasoning) 모델을 제외한 최신 비추론 모델 중 최고 수준인 평균 4.189점을 기록하며 뛰어난 성능을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.