MLE-bench: 머신러닝 엔지니어링 역량을 평가하는 머신러닝 에이전트 벤치마크
·2024.10.10 19:00
핵심 내용
OpenAI가 AI 에이전트의 머신러닝 엔지니어링 능력을 측정하기 위한 벤치마크인 MLE-bench를 공개했다.
자세히 보기
AI 에이전트가 실제 머신러닝 엔지니어링(MLE) 업무를 얼마나 잘 수행하는지 측정하기 위한 MLE-bench를 도입한다. 이 벤치마크는 Kaggle의 75개 머신러닝 관련 경진대회를 기반으로 구축되었으며, 모델 학습, 데이터셋 준비, 실험 실행 등 실무적인 기술을 테스트한다.
각 경진대회의 공개 리더보드를 활용해 인간의 기준점(baseline)을 설정했다. 여러 프론티어 언어 모델을 평가한 결과, OpenAI의 o1-preview와 AIDE scaffolding을 결합한 설정이 가장 뛰어난 성능을 보였으며, 전체 경진대회의 16.9%에서 최소 Kaggle bronze medal 수준의 성과를 달성했다.
또한 에이전트의 리소스 스케일링 방식과 사전 학습(pre-training) 데이터 오염의 영향을 조사했다. 향후 AI 에이전트의 ML 엔지니어링 역량 연구를 돕기 위해 벤치마크 코드를 오픈 소스로 공개했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.