LLM 게임 내비게이션 벤치마크 공개
DungeonBench - testing LLMs at simple games
·2026.09.04 00:02
핵심 내용
LLM의 단순 던전 게임 내비게이션 능력을 평가하는 오픈소스 벤치마크 DungeonBench가 공개되었다.
자세히 보기
LLM이 복잡한 수학적 추론에는 강하지만, 아이가 풀 수 있는 수준의 단순한 던전 게임 내비게이션에서는 얼마나 잘하는지 평가하는 벤치마크 DungeonBench가 공개되었습니다.
평가 방식 및 기준
- 과제: 10x10 그리드 맵에서 벽을 피하고, '무기 수집 > 몬스터 처치 > 출구 이동' 순서대로 목표를 달성해야 합니다.
- 실패 조건: 3번의 불법적인 이동(illegal move)을 하면 해당 런은 실패로 간주됩니다.
- 설정: 모든 모델은 추론(reasoning) 기능을 활성화한 상태로 테스트되었습니다.
주요 모델 성능 결과
- DeepSeek-V4-Pro (high): 12/12의 완벽한 점수와 0번의 불법 이동을 기록하며 1위를 차지했습니다. 모든 맵에서 효율적이고 정확한 계획을 수립했습니다.
- Gemma-4-31B-it, Qwen-3.8-27B, GLM-5.3-Flash: 11/12의 점수를 기록하며 상위권에 랭크되었습니다. 특히 Qwen은 많은 추론 시간을 소요했으나 결국 문제를 해결하는 끈질긴 모습을 보였습니다.
- Muse-Glimmer-30B, DeepSeek-V4-Flash: 10/12의 점수를 기록했습니다.
- Nemotron-3.5-Lightning-30B: 7번의 불법 이동을 범하며 5/12로 최하위권에 머물렀습니다.
이 벤치마크는 LLM의 공간적 추론 및 계획 수립 능력의 한계를 드러내며, 코드는 GitHub에서 공개되어 누구나 직접 테스트할 수 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.