AI21, 검증 가능성에 따른 에이전트 아키텍처 설계 가이드 제안
핵심 내용
AI21이 검증 가능성에 따라 에이전트 자원 배분을 결정하는 가이드라인을 제시했다.
자세히 보기
AI21 연구진이 에이전트 아키텍처 설계를 위한 검증 가능성 리트머스 테스트를 제안했다. 핵심은 후보 답변이 명시된 조건으로 검증 가능한지 여부다. 검증 가능하면 검증 및 선택에, 불가능하면 다양성 및 집계에 자원을 배분해야 한다. 이는 태스크 구조에 따른 비효율적 예산 배분을 방지하기 위함이다.
에이전틱 검색: 검증이 우위
단일 엔티티와 명시적 조건을 가진 에이전틱 검색 태스크에서는 검증이 효율적이다. AI21은 다수결 투표 대신 독립 검증기를 사용할 때 정확도가 크게 향상됨을 입증했다. 8B 검증기를 학습시켜 프런티어 검증기 품질을 3.2배 낮은 비용으로 달성했다. 오픈소스 앙상블에서는 단순 다수결 대비 정확도를 28% 높였고, 프런티어 검증기 성능의 80% 이상을 약 1/100 비용으로 구현했다.
딥 리서치: 다양성과 병합
딥 리서치 태스크는 정답 사실의 사전 정의가 없어 완전성 검증이 불가능하다. 오라클 실험 결과, 단일 최상위 보고서 선택은 SOTA 성능 아래에서 한계에 부딪혔다. 반면, 여러 에이전트 보고서를 병합하면 이 한계를 넘어서는 것으로 나타났다. AI21은 하위 랭킹 에이전트 7개의 출력을 결합해 DeepResearch Bench II에서 1위를 차지했으며, 개별 에이전트와 기존 SOTA를 모두 능가했다.
RAG 인덱싱과 코딩: 혼합된 검증 가능성
RAG 인덱싱은 쿼리 전에 청크 크기를 결정해야 하므로 독특한 과제를 안고 있다. 단일 청크 크기로는 리콜의 20-40%가 손실될 수 있어 비용이 더 들더라도 다중 해상도 인덱싱이 필요하다. 에이전틱 코딩은 최종 테스트 통과 여부는 이진 검증이 가능하지만, 과정 중에는 검증이 불가능하다. AI21은 주니어 모델(MiniMax-M3)이 리포지토리를 탐색하고, 시니어 모델(GPT-5.2)이 결과를 추출하며, 프런티어 모델이 패치를 작성하는 계층적 접근법을 사용했다. 이 파이프라인은 SWE-Bench Pro에서 80.8% 해결률을 기록했으며, 태스크당 비용은 $5.99로 단일 프런티어 에이전트($18.28)보다 저렴했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.