'배틀쉽' 게임을 활용해 AI 에이전트에게 더 나은 질문법 가르치기
·2026.06.04 10:15
핵심 내용
배틀쉽 게임을 활용한 테스트베드를 통해 AI 에이전트의 질문 및 정보 탐색 능력을 개선하는 연구 결과가 발표되었다.
자세히 보기
MIT CSAIL과 Harvard SEAS 연구진은 불확실한 환경에서 AI 에이전트가 효율적으로 정보를 탐색할 수 있도록 배틀쉽(Battleship) 게임을 활용한 새로운 테스트베드를 구축했습니다.
BattleshipQA 데이터셋을 통해 AI의 질문 능력을 측정한 결과, 소형 모델은 유용한 질문을 생성하는 데 어려움을 겪는 것으로 나타났습니다. 이를 해결하기 위해 연구진은 두 가지 핵심 전략을 도입했습니다.
- Monte Carlo 추론 전략: 모델이 가능한 추측을 개별 **입자(particle)**로 취급하고, 관측자의 답변에 따라 타당한 추측에 가중치를 부여하는 방식입니다. 이를 적용한 Llama 4 Scout는 사람 상대 승률이 8%에서 **82%**로 급증하며 GPT-5를 능가하는 성능을 보였고, 비용은 약 1% 수준에 불과했습니다.
- Python 코드 변환(auto-formalization): 자연어 질문을 명확한 인코딩된 명령으로 변환하여 관측자 모델이 답을 검증하도록 유도했습니다. 이 방식은 GPT-4o-mini의 성능을 약 30% 향상시키는 등 모델의 정확도를 크게 높였습니다.
이 연구는 AI 에이전트가 과학적 발견과 같이 방대한 선택지 속에서 정답을 찾아야 하는 희소 해 탐색(needle-in-a-haystack) 분야에서 큰 잠재력을 가질 것으로 기대됩니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.