AI Briefing

MLE-bench: 머신러닝 엔지니어링 역량을 평가하는 머신러닝 에이전트 벤치마크

·2024.10.10 19:00

OpenAI가 AI 에이전트의 머신러닝 엔지니어링 능력을 측정하기 위한 벤치마크인 MLE-bench를 공개했다.

AI 에이전트가 실제 머신러닝 엔지니어링(MLE) 업무를 얼마나 잘 수행하는지 측정하기 위한 MLE-bench를 도입한다. 이 벤치마크는 Kaggle의 75개 머신러닝 관련 경진대회를 기반으로 구축되었으며, 모델 학습, 데이터셋 준비, 실험 실행 등 실무적인 기술을 테스트한다.

각 경진대회의 공개 리더보드를 활용해 인간의 기준점(baseline)을 설정했다. 여러 프론티어 언어 모델을 평가한 결과, OpenAI의 o1-previewAIDE scaffolding을 결합한 설정이 가장 뛰어난 성능을 보였으며, 전체 경진대회의 16.9%에서 최소 Kaggle bronze medal 수준의 성과를 달성했다.

또한 에이전트의 리소스 스케일링 방식과 사전 학습(pre-training) 데이터 오염의 영향을 조사했다. 향후 AI 에이전트의 ML 엔지니어링 역량 연구를 돕기 위해 벤치마크 코드를 오픈 소스로 공개했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.