검증기가 필요하다
·2026.08.19 21:11
핵심 내용
독립 검증기를 도입해 에이전트 검색의 정답 선택율을 높여 기존 SOTA를 경신했다.
1 / 2
자세히 보기
에이전트 검색 시스템에서 정답을 생성하는 것보다 정답을 선택하는 것이 더 큰 병목이다. 동일한 질문에서 모델이 실패와 성공을 반복하는 비결정적 특성 때문에, 다수결 투표는 인기 있는 오답을 오히려 인증하는 한계가 있다.
AI21은 이 문제를 해결하기 위해 후보 답안마다 독립적으로 재조사하여 오답을 거부하는 **독립 검증기(Verifier)**를 도입했다. FACTS-Search 벤치마크에서 클로드 오퍼스 검증기를 적용한 결과, 기존 공개 SOTA(89.4)를 상회하는 93.4의 점수를 기록했다.
특히 저비용 오픈소스 모델 풀(Qwen3-14B 등)의 경우, 다수결 투표 시 60.1에 불과했던 점수가 검증기 적용으로 80.4까지 상승했다. 이는 검증기가 모델의 종류와 관계없이 시스템 성능을 전반적으로 끌어올린다는 것을 증명한다.
- 비용 효율성: 자체 학습한 8B 검증기를 사용하면 추가 비용이 거의 들지 않으면서도 92.9의 높은 점수를 달성했다.
- 범용성: 특정 생성기 풀에 종속되지 않으며, 새로운 벤치마크와 검색 도구로도 일반화된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.