GoBench 공개, LLM 추론 능력 평가 지표로 주목
GoBench: Evaluating LLMs on the game of Go [R]
·2026.09.17 03:54
핵심 내용
LLM의 바둑 실력을 평가하는 GoBench가 공개되었으며, ARC-AGI 2와 높은 상관관계를 보여 추론 능력 지표로 주목받는다.
자세히 보기
LLM의 일반 추론 능력을 평가하기 위한 새로운 벤치마크 GoBench가 공개되었습니다. 이 벤치마크는 KataGo의 다양한 수준(무작위부터 초인적 수준까지)의 상대와 9x9 바둑 대국을 진행하여 모델을 평가합니다.
주요 특징 및 결과는 다음과 같습니다:
- 높은 상관관계: GoBench 점수는 복잡한 추론 능력을 측정하는 ARC-AGI 2 벤치마크와 r=0.83의 강한 상관관계를 보입니다.
- 미포화 상태: 기존 벤치마크들이 포화 상태에 접어든 것과 달리, GoBench는 여전히 높은 변별력을 유지하고 있습니다.
- 모델 성능: GPT-6 Astra max는 2500 Elo를 기록했으며, 이는 최상급 KataGo의 4400 Elo보다 훨씬 낮은 수치입니다. 다만, 코딩 도구와 2시간의 사전 준비를 허용한 Codex with Astra는 3560 Elo까지 도달했습니다.
개발자는 벤치마크가 포화되지 않는 한 리더보드를 지속적으로 업데이트할 계획입니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.