AISI·EvalEval, LLM 평가 재현성 표준화 협력
How UK AISI and EvalEval Are Making Benchmark Results Reproducible
핵심 내용
영국 AISI와 EvalEval이 Every Eval Ever 스키마를 통해 LLM 평가 결과의 재현성과 검증 가능성을 강화하는 협력 체계를 구축했다.
자세히 보기
영국 AI 보안 연구소(AISI)와 EvalEval Coalition이 협력하여 LLM 평가 결과의 재현성과 검증 가능성을 높이는 인프라를 구축했다. 이번 협력은 NeurIPS 2025 워크숍을 기반으로 하며, AISI의 피드백을 반영해 Every Eval Ever(EEE) 스키마를 형성했다.
표준화된 평가 데이터 공개
AISI는 Evaluation Cards를 통해 주요 실험 데이터를 공개하며, 이는 연구자들이 개별 연구를 심층 분석하고 생태계 전반의 결과를 비교하는 기준점(reference point) 역할을 한다. 공개된 데이터는 다음과 같다.
- 주요 벤치마크 5종: HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0
- 대상 모델 6종: Claude Opus 4, 4.5, 4.6, GPT-5, 5.2, 5.4
- 사이버 평가 2종: Cyber CTFs, The Last Ones
- 데이터 출처: AISI 논문 'How Inference Compute Shapes Frontier LLM Evaluation' (추론 시 컴퓨팅 자원과 평가 프로토콜이 성능에 미치는 영향 연구)
평가 프로토콜의 중요성 강조
공개된 데이터는 평가 설정에 따라 성능이 크게 달라질 수 있음을 보여준다. 예를 들어, Humanity's Last Exam에서는 Oracle로부터 정답 피드백을 받을 경우 토큰 사용량 증가에 따라 추가 문제를 해결할 수 있는 것으로 나타났다. 또한 Terminal-Bench 2.0의 경우 다른 평가 설정에서의 결과와 비교가 가능하도록 제공되어, 설정 선택이 성능 보고에 미치는 영향을 이해하는 데 도움을 준다.
EvalEval Coalition의 목표
EvalEval Coalition은 평가 생태계를 위한 과학적 연구와 견고한 배포 인프라를 개발하는 커뮤니티다. 주요 목표는 평가 과학 개선, 평가 적용성 문서화 합의 부족 해결, 정책 분석 관련 영향 범위 확대다. Every Eval Ever는 평가 결과를 위한 공유 스키마 및 저장소를 제공하고, Evaluation Cards는 벤치마크 메타데이터, 평가 실행 데이터, 모델 메타데이터를 결합하여 유사한 점수라도 조건이 다르면 명확히 구분할 수 있게 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.