AI Briefing

LLM 게임 내비게이션 벤치마크 공개

DungeonBench - testing LLMs at simple games

·2026.09.04 00:02

핵심 내용

LLM의 단순 던전 게임 내비게이션 능력을 평가하는 오픈소스 벤치마크 DungeonBench가 공개되었다.

자세히 보기

LLM이 복잡한 수학적 추론에는 강하지만, 아이가 풀 수 있는 수준의 단순한 던전 게임 내비게이션에서는 얼마나 잘하는지 평가하는 벤치마크 DungeonBench가 공개되었습니다.

평가 방식 및 기준

  • 과제: 10x10 그리드 맵에서 벽을 피하고, '무기 수집 > 몬스터 처치 > 출구 이동' 순서대로 목표를 달성해야 합니다.
  • 실패 조건: 3번의 불법적인 이동(illegal move)을 하면 해당 런은 실패로 간주됩니다.
  • 설정: 모든 모델은 추론(reasoning) 기능을 활성화한 상태로 테스트되었습니다.

주요 모델 성능 결과

  • DeepSeek-V4-Pro (high): 12/12의 완벽한 점수와 0번의 불법 이동을 기록하며 1위를 차지했습니다. 모든 맵에서 효율적이고 정확한 계획을 수립했습니다.
  • Gemma-4-31B-it, Qwen-3.8-27B, GLM-5.3-Flash: 11/12의 점수를 기록하며 상위권에 랭크되었습니다. 특히 Qwen은 많은 추론 시간을 소요했으나 결국 문제를 해결하는 끈질긴 모습을 보였습니다.
  • Muse-Glimmer-30B, DeepSeek-V4-Flash: 10/12의 점수를 기록했습니다.
  • Nemotron-3.5-Lightning-30B: 7번의 불법 이동을 범하며 5/12로 최하위권에 머물렀습니다.

이 벤치마크는 LLM의 공간적 추론 및 계획 수립 능력의 한계를 드러내며, 코드는 GitHub에서 공개되어 누구나 직접 테스트할 수 있습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.