AI Briefing

AI 에이전트 성능 향상의 실체: 알고리즘 vs 모델

How much of MLE-Bench's gains are the algorithm vs. better models + more search? [R]

·2026.06.01 23:34

MLE-Bench의 성능 향상이 알고리즘 발전보다 모델 성능 및 탐색량 증가에 기인한다는 분석과 함께 신규 벤치마크 FML-Bench가 공개되었다.

최근 2년 사이 MLE-Bench 점수가 30%에서 80%로 급증했으나, 이러한 성과가 실제 알고리즘의 발전인지 아니면 단순히 더 나은 베이스 모델과 탐색(search)량 증가, 혹은 과적합(overfitting)에 의한 것인지에 대한 분석이 제시되었습니다.

동일한 스텝 예산(step budget)과 모델을 기준으로 통제했을 때, 2년 전의 AIDE 알고리즘이 최신 에이전트 및 진화적 탐색(evolutionary search) 시스템과 대등한 성능을 보이는 것으로 나타났습니다. 이는 최근의 성능 향상이 알고리즘 자체의 혁신보다는 모델의 발전과 탐색량 확대에 더 크게 의존하고 있음을 시사합니다.

이와 함께 에이전트의 알고리즘적 효율성(탐색 및 메모리)을 정밀하게 측정하기 위한 새로운 자동화 ML 연구 벤치마크인 FML-Bench가 공개되었습니다. FML-Bench는 코드 편집 에이전트, 스텝 정의, 검증/테스트 분할을 통합하여 알고리즘의 순수 효율성을 평가하도록 설계되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.