AI Briefing

Auto-BenchMax 공개, MCP 점수 2배

Auto-BenchMax: 벤치마크와 같은 분포로 데이터를 합성해 MCP-Atlas 점수를 2배로 올린 파이프라인

·2026.09.04 07:00

핵심 내용

벤치마크 채점 방식에 맞춘 데이터 합성 파이프라인 'Auto-BenchMax'가 공개되어 MCP-Atlas 점수를 2배 이상 개선했다.

1 / 4

자세히 보기

도구 호출 에이전트 학습용 데이터 부족 문제를 해결하기 위해, 벤치마크의 구조적 분포를 정밀하게 모방하는 데이터 합성 파이프라인 Auto-BenchMax가 공개되었습니다. 기존 방식처럼 단순히 과제를 단순화하여 대량 생성할 경우 원본 벤치마크와의 구조적 불일치로 인해 성능이 오히려 저하되는 문제를 지적하며, 이를 해결하기 위한 방법론을 제시합니다.

핵심 원리: 구조 분포 일치

Auto-BenchMax는 생성 전후의 구조 히스토그램을 비교하여 원본 벤치마크와 합성 데이터 간의 차이를 최소화하는 것을 원칙으로 합니다. 특히 벤치마크의 채점 방식에 따라 두 가지 합성 경로를 구분합니다.

  • 규칙 기반 채점 (방식 B): 미리 정답을 구성하고 평가기를 통해 검증한 후 과제로 채택합니다.
  • 심판 모델 채점 (방식 A): 실제 환경에서 실행된 강한 모델의 답변에서 사실을 추출하여 정답으로 삼습니다.

성능 개선 효과

Qwen3-Coder-30B-A3B 모델을 기준으로 한 번의 반복 학습을 수행했을 때, MCP-Atlas 공개 세트 점수가 19.1에서 40.4로, Tau2-bench의 통신 영역 점수가 35.96에서 85.09로 대폭 상승했습니다. 저자는 추가 반복을 통해 MCP-Atlas 점수를 50 이상으로 올릴 수 있다고 전망했습니다.

활용 및 한계

이 프로젝트는 특정 데이터셋이 아닌, 벤치마크의 채점 코드를 분석하여 적절한 합성 경로를 선택하는 절차와 코드를 제공합니다. 다만, 재현을 위해서는 단일 노드 8 GPU와 DeepSpeed ZeRO-3 설정 등 높은 컴퓨팅 자원이 필요하며, 저장소 내 LICENSE 파일 부재로 상업적 이용 시 주의가 요구됩니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.