AI 에이전트 벤치마크 TextQuests 공개
TextQuests: How Good are LLMs at Text-Based Video Games?
·2025.08.12 09:00
핵심 내용
LLM의 에이전트로서의 추론 및 탐색 능력을 평가하기 위한 텍스트 기반 게임 벤치마크 TextQuests가 발표되었다.
1 / 2
자세히 보기
LLM의 정적 지식 평가가 포화됨에 따라, 동적이고 상호작용적인 환경에서 자율 에이전트로서의 성능을 측정하는 것이 중요해졌다. TextQuests는 25개의 고전 Infocom 텍스트 기반 게임을 활용하여 에이전트의 능력을 검증하는 새로운 벤치마크다.
이 벤치마크는 에이전트에게 다음과 같은 두 가지 핵심 역량을 요구한다:
- 장기 문맥 추론 (Long-Context Reasoning): 방대한 행동 및 관찰 기록을 바탕으로 다단계 계획을 수립하고 실행하는 능력.
- 탐색을 통한 학습 (Learning through Exploration): 시행착오를 통해 경험으로부터 배우고 개선하는 능력.
평가는 힌트 유무에 따라 두 가지 방식으로 진행되며, **게임 진행도(Game Progress)**와 에이전트의 윤리적 행동을 측정하는 유해성(Harm) 지표를 사용한다.
실험 결과, 문맥이 100K 토큰을 넘어가면 모델들이 이전 상호작용에 대해 **환각(Hallucination)**을 일으키거나, 새로운 계획을 세우는 대신 과거 행동을 반복하는 경향이 나타났다. 특히 공간 추론이 필요한 환경에서 이러한 한계가 두드러졌다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.