AI Briefing

APEX-Agents 개발 세트 학습에 따른 일반화 성능 결과

·2026.04.02 09:00

APEX-Agents 개발 세트로 학습된 **AC-Small**이 주요 벤치마크에서 뛰어난 일반화 성능 향상을 입증했다.

GLM-4.7APEX-Agents 개발 세트로 사후 학습(post-training)하여 제작한 AC-Small 모델이 단순 벤치마크 점수 향상을 넘어 실제 능력의 일반화(generalization)를 달성했는지 검증했다.

검증 결과, 미학습(held-out) 산업 벤치마크 전반에서 성능이 대폭 향상되었다:

  • APEX: +5.7점 향상
  • Toolathalon: +8.0점 향상
  • GDPVal: +7.7%p 향상

GDPVal 벤치마크에서 AC-Small은 기존 7위에서 5위로 상승하며 Claude Opus 4.5를 추월했다. 이는 경제적 가치가 있는 전문 업무 수행 능력이 실질적으로 개선되었음을 의미한다.

Toolathalon에서는 도구 사용(tool-use) 능력이 크게 향상되어 34.6%를 기록, Claude-4-Sonnet, Kimi-K2.5, Grok-4 등을 제치고 순위가 4계단 상승했다.

APEX 벤치마크에서는 전문적 추론 능력이 개선되었으며, 특히 법률, 컨설팅, 금융 데이터로만 학습했음에도 불구하고 의학(Medicine) 분야에서 4위를 기록하는 놀라운 성과를 보였다. 이는 모델이 진단 보고서 작성 시 세부 사항을 놓치지 않고 정확하게 기술하는 등 업무 프로세스 자체가 정교해졌기 때문이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.