GLM-5.3, CivBench서 Opus-5.5 제쳐
A benchmark for LLMs playing Civilization V. GLM-5.3 is ahead of Opus-5.5, and Qwen-3.8-27B holds up surprisingly well.
핵심 내용
CivBench에서 GLM-5.3이 Opus-5.5를 앞섰고 Qwen-3.8-27B는 과학 승리를 거뒀다.
자세히 보기
업데이트된 CivBench 프레임워크는 대형 언어 모델이 50~100턴 이상 결과가 드러나지 않는 장기 의사결정 능력을 평가하기 위해 Civilization V 전체 게임을 수행하도록 설계됐다. 최신 통제된 실행 결과, GLM-5.3이 Opus-5.5보다 우세한 것으로 보고됐으며 Qwen-3.8-27B도 강력한 성능을 입증했다.
벤치마크 방법론
평가는 모델이 동일한 세 가지 고정된 시작 조건을 번갈아 수행하는 통제된 환경에서 진행된다. 각 게임에는 8개 문명이 등장하며, 이 중 2개는 테스트 대상 LLM 전략가가, 나머지 6개는 표준 Vox Populi AI가 통제한다. LLM은 고차원 전략을 수립하고, 게임 내 기존 AI가 저차원 실행을 담당한다.
주요 결과 및 접근성
- GLM-5.3: 중국으로 문화 승리 달성
- Opus-5.5: 모로코로 문화 승리 달성
- Qwen-3.8-27B: 중국으로 과학 승리 달성, 파라미터 수 대비 강력한 성능 입증
이 프로젝트는 Vox Deorum을 통해 오픈소스로 공개됐으며, 사용자는 LLM이 통제하는 문명과 대결하거나 AI 간 대전을 관전할 수 있다. 로컬 OpenAI 호환 서버와 Claude 또는 Codex 기존 구독을 지원하며, 게임당 플레이어당 예상 API 비용은 약 $0.5다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.