하이브리드 AI 스웜, 탐정 사건 96% 해결로 단일 모델 압도
[Research] Can a swarm of Jev catch a murderer?
·2026.10.11 15:35
핵심 내용
LMGame 팀의 하이브리드 AI 스웜이 일반 사건에서 96% 성공률로 단일 모델의 57%를 크게 앞섰다.
자세히 보기
LMGame 팀은 빅토리아 시대 런던을 배경으로 한 절차적 탐정 게임을 개발해 AI 에이전트 스웜과 단일 대형 모델의 성능을 비교했습니다. 이 벤치마크는 100개 주소, 10명 용의자, 주소당 단서 하나를 포함하며, 시뮬레이션된 사건 시간 12시간 내에 범인, 동기, 은신처를 찾아야 합니다.
성능 지표
추론 엔진으로 GPT6-Astra를, 검색 작업으로 Jev 에이전트를 사용해 세 가지 아키텍처를 비교했습니다.
- Holmes (GPT6-Astra) + Jev Swarm: 일반 사건 96/100, 위장 사건(증인이 거짓말함) 93/100 성공
- Rule-based Holmes + Jev Swarm: 일반 사건 95/100, 위장 사건 0/100 성공
- The Lone Genius (GPT6-Astra): 일반 사건 57/100, 위장 사건 59/100 성공
- Jev Swarm (리더 없음): 일반 사건 38/100, 위장 사건 42/100 성공
주요 발견
- 분할 정복: 스웜은 증거 수집(분할 단계)에 강점을 보이며, 리더 모델은 추론(정복 단계)을 담당합니다.
- 스웜의 취약점: 리더 없는 스웜은 오류 전파로 인해 잘못된 답에 너무 빨리 수렴합니다. 다만 가장 빠른 방법(중간값 2.2 사건 시간)입니다.
- 리더의 필요성: 단순 규칙 기반 리더는 정직한 증거에서는 GPT6-Astra와 비슷한 성능을 내지만, 속임수에는 완전히 실패합니다. 위장 시나리오에서 거짓말을 감지하고 올바른 범인을 식별하려면 강력한 추론 모델이 필수입니다.
- 단일 모델의 한계: 단일 모델은 공간적 커버리지에 어려움을 겪으며, 제한 시간 내 방문하지 않은 주소의 중요한 단서를 놓치는 경우가 많습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.