머신러닝 엔지니어링 에이전트 학습을 위한 합성 샌드박스
·2026.04.08 09:00
SandMLE는 소규모 합성 데이터를 활용해 MLE 에이전트 학습에 필요한 검증 시간을 13배 이상 단축했다.
머신러닝 엔지니어링(MLE) 에이전트의 동작을 검증하는 작업은 소프트웨어 엔지니어링(SWE)보다 훨씬 많은 비용이 소요된다. SWE는 빠른 유닛 테스트로 검증이 가능하지만, MLE는 데이터 전처리, 모델 학습, 지표 평가를 포함한 전체 파이프라인을 매 단계 실행해야 하기 때문이다. 이로 인해 기존의 온폴리시(on-policy) 강화학습(RL) 방식은 속도 문제로 인해 적용이 어려웠다.
SandMLE는 이러한 병목 현상을 해결하기 위해 제안된 멀티 에이전트 프레임워크다. 소수의 시드 태스크로부터 다양하고 검증 가능한 합성 MLE 환경을 생성하며, 데이터셋 규모를 50~200개의 샘플로 제한하는 마이크로 스케일 방식을 채택했다.
실험 결과, SandMLE는 실행 시간을 13배 이상 단축하여 MLE 분야에서 대규모 온폴리시 RL을 가능하게 했다. MLE-bench-lite에서 Qwen3 모델들을 대상으로 실험했을 때, SFT 베이스라인 대비 메달 획득률이 20.3%에서 66.9%까지 향상되었으며, MLE-Dojo에서도 높은 일반화 성능을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.