AutoGluon Assistant: 멀티에이전트 협업으로 구현한 노코드 AutoML
핵심 내용
AutoGluon Assistant는 멀티에이전트 LLM으로 코딩 없이 모델 학습을 자동화한다.
자세히 보기
기존 AutoML은 모델 선택과 하이퍼파라미터 튜닝은 자동화했지만, 여전히 사용자가 코드를 작성하고 데이터를 정리해야 했다. AutoGluon Assistant는 이 마지막 장벽까지 없애기 위해 MLZero라는 멀티에이전트 시스템을 기반으로 자연어 설명만으로 tabular, image, text, time series 데이터의 학습 파이프라인을 구성한다.
이 시스템은 2024 Kaggle AutoML Grand Prix에서 완전 자동 프레임워크로 10위에 오르며, 대회에서 점수를 기록한 유일한 자동 에이전트가 됐다. 또한 Multimodal AutoML Agent Benchmark에서 92% 성공률, 외부 벤치마크인 MLE-bench Lite에서 86% 성공률을 기록하며 솔루션 품질과 성공률 모두에서 강한 성능을 보였다.
핵심은 네 개의 모듈이 역할을 분담하는 구조다.
- perception: 파일 구조와 내용을 해석해 데이터 형태와 과제를 파악한다. CSV처럼 목표 변수가 명확하지 않은 경우에도 컬럼 분포와 의미를 분석해 분류, 회귀, 세분화 같은 문제 유형을 추론한다.
- semantic memory: AutoGluon의 기능, API 패턴, 모범 사례를 구조화해 보관한다. 이를 바탕으로 semantic-segmentation 같은 작업에 맞는 도구를 선택한다.
- episodic memory: 실행 이력과 성공/실패 사례를 누적해 디버깅 문맥을 제공한다. 에러가 나면 이전 시도와 결과를 참조해 다음 수정 방향을 잡는다.
- iterative coding: 생성한 코드를 실행하고, 결과나 오류를 반영해 반복적으로 개선한다. 성공하거나 최대 반복 횟수에 도달할 때까지 피드백 루프를 유지한다.
저자들은 의료용 X-ray와 segmentation mask 예시를 통해, 사용자가 "병변 부위를 찾아라"라고만 입력해도 perception이 과제를 이해하고, semantic memory가 적절한 MultiModalPredictor를 고르며, iterative coding이 마스크 형식 불일치를 고쳐 학습을 완료하는 흐름을 설명한다. 이 과정에서 사용자는 코드를 쓰지 않아도 되지만, 필요할 경우 반복 단계마다 도메인 지식을 입력해 보정할 수 있다.
평가는 두 축으로 진행됐다. MLE-bench Lite는 이전 Kaggle 대회 21개 과제를 포함한 외부 표준 벤치마크로, AutoGluon Assistant는 21개 중 18개를 성공적으로 제출해 가장 높은 86% 성공률을 기록했고, 평균 순위 1.43으로 전체 솔루션 품질도 1위를 차지했다. 자체 벤치마크인 Multimodal AutoML Agent Benchmark는 더 원시적인 데이터와 더 높은 잡음, 포맷 불일치, 다국어·멀티테이블·대규모 데이터까지 포함한 25개 과제로 구성되며, 여기서도 92% 성공률을 달성했다.
리소스 제약이 있는 환경에서도 성능은 유지됐다. 8B급 소형 LLM으로 구현해도 45.3% 성공률을 기록해, 더 큰 모델을 쓰는 많은 에이전트보다 효율적이라는 점을 보여줬다.
접근 방식은 CLI, Python API, Web UI, MCP까지 지원해 기존 워크플로에 쉽게 붙일 수 있게 설계됐다. 오픈소스로 공개됐으며, 기술 상세는 NeurIPS 2025 paper로 정리됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.