AI Briefing

AI evals가 새로운 compute 병목이 되고 있다

·2026.04.30 02:00

정적 벤치마크는 압축되지만, agent·training eval은 비용이 급등한다.

정적 benchmark는 여전히 100~200배까지 압축할 수 있지만, agent benchmark와 training-in-the-loop로 갈수록 비용 절감 폭이 급격히 줄어든다.

  • HAL은 9개 모델과 9개 benchmark에서 21,730 rollouts에 약 $40,000를 썼고, 단일 GAIA run은 frontier model 기준 $2,829까지 올라갔다.
  • Exgentic$22,000 sweep은 동일 task에서 33배 비용 차를 보여, scaffold 선택이 1차 비용 요인임을 드러냈다.
  • 같은 benchmark 안에서도 model × scaffold × token budget 조합에 따라 비용이 3~4자릿수까지 벌어진다.
  • The Well은 새 architecture 1개 평가에 960 H100-hours(약 $2,400), 전체 4-baseline sweep에 3,840 H100-hours(약 $9,600)가 필요하다.
  • PaperBench, MLE-Bench, ResearchGym, RE-Bench처럼 실제 작업에 가까운 벤치마크는 평가비가 수천~수만 달러로 치솟는다.

반복 실행으로 신뢰도를 확보하면 비용은 더 커진다. 벤치마크가 실제 작업에 가까워질수록 evaluation 자체가 새로운 compute bottleneck이 된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.