AI Briefing

AI21, 검증 가능성에 따른 에이전트 아키텍처 설계 가이드 제안

·2026.10.06 09:00

핵심 내용

AI21이 검증 가능성에 따라 에이전트 자원 배분을 결정하는 가이드라인을 제시했다.

1 / 6

자세히 보기

AI21 연구진이 에이전트 아키텍처 설계를 위한 검증 가능성 리트머스 테스트를 제안했다. 핵심은 후보 답변이 명시된 조건으로 검증 가능한지 여부다. 검증 가능하면 검증 및 선택에, 불가능하면 다양성 및 집계에 자원을 배분해야 한다. 이는 태스크 구조에 따른 비효율적 예산 배분을 방지하기 위함이다.

에이전틱 검색: 검증이 우위

단일 엔티티와 명시적 조건을 가진 에이전틱 검색 태스크에서는 검증이 효율적이다. AI21은 다수결 투표 대신 독립 검증기를 사용할 때 정확도가 크게 향상됨을 입증했다. 8B 검증기를 학습시켜 프런티어 검증기 품질을 3.2배 낮은 비용으로 달성했다. 오픈소스 앙상블에서는 단순 다수결 대비 정확도를 28% 높였고, 프런티어 검증기 성능의 80% 이상을 약 1/100 비용으로 구현했다.

딥 리서치: 다양성과 병합

딥 리서치 태스크는 정답 사실의 사전 정의가 없어 완전성 검증이 불가능하다. 오라클 실험 결과, 단일 최상위 보고서 선택은 SOTA 성능 아래에서 한계에 부딪혔다. 반면, 여러 에이전트 보고서를 병합하면 이 한계를 넘어서는 것으로 나타났다. AI21은 하위 랭킹 에이전트 7개의 출력을 결합해 DeepResearch Bench II에서 1위를 차지했으며, 개별 에이전트와 기존 SOTA를 모두 능가했다.

RAG 인덱싱과 코딩: 혼합된 검증 가능성

RAG 인덱싱은 쿼리 전에 청크 크기를 결정해야 하므로 독특한 과제를 안고 있다. 단일 청크 크기로는 리콜의 20-40%가 손실될 수 있어 비용이 더 들더라도 다중 해상도 인덱싱이 필요하다. 에이전틱 코딩은 최종 테스트 통과 여부는 이진 검증이 가능하지만, 과정 중에는 검증이 불가능하다. AI21은 주니어 모델(MiniMax-M3)이 리포지토리를 탐색하고, 시니어 모델(GPT-5.2)이 결과를 추출하며, 프런티어 모델이 패치를 작성하는 계층적 접근법을 사용했다. 이 파이프라인은 SWE-Bench Pro에서 80.8% 해결률을 기록했으며, 태스크당 비용은 $5.99로 단일 프런티어 에이전트($18.28)보다 저렴했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.