AI Briefing

'배틀쉽' 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기

·2026.06.04 10:15

배틀쉽 게임을 활용한 테스트베드를 통해 AI 에이전트의 질문 및 정보 탐색 능력을 개선하는 연구 결과가 발표되었다.

MIT CSAIL과 Harvard SEAS 연구진은 불확실한 환경에서 AI 에이전트가 효율적으로 정보를 탐색할 수 있도록 배틀쉽(Battleship) 게임을 활용한 새로운 테스트베드를 구축했습니다.

BattleshipQA 데이터셋을 통해 AI의 질문 능력을 측정한 결과, 소형 모델은 유용한 질문을 생성하는 데 어려움을 겪는 것으로 나타났습니다. 이를 해결하기 위해 연구진은 두 가지 핵심 전략을 도입했습니다.

  • Monte Carlo 추론 전략: 모델이 가능한 추측을 개별 **입자(particle)**로 취급하고, 관측자의 답변에 따라 타당한 추측에 가중치를 부여하는 방식입니다. 이를 적용한 Llama 4 Scout는 사람 상대 승률이 8%에서 **82%**로 급증하며 GPT-5를 능가하는 성능을 보였고, 비용은 약 1% 수준에 불과했습니다.
  • Python 코드 변환(auto-formalization): 자연어 질문을 명확한 인코딩된 명령으로 변환하여 관측자 모델이 답을 검증하도록 유도했습니다. 이 방식은 GPT-4o-mini의 성능을 약 30% 향상시키는 등 모델의 정확도를 크게 높였습니다.

이 연구는 AI 에이전트가 과학적 발견과 같이 방대한 선택지 속에서 정답을 찾아야 하는 희소 해 탐색(needle-in-a-haystack) 분야에서 큰 잠재력을 가질 것으로 기대됩니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.