AI Briefing

AutoGluon Assistant: 멀티에이전트 협업으로 구현한 노코드 AutoML

·2025.12.06 00:24

핵심 내용

AutoGluon Assistant는 멀티에이전트 LLM으로 코딩 없이 모델 학습을 자동화한다.

자세히 보기

기존 AutoML은 모델 선택과 하이퍼파라미터 튜닝은 자동화했지만, 여전히 사용자가 코드를 작성하고 데이터를 정리해야 했다. AutoGluon Assistant는 이 마지막 장벽까지 없애기 위해 MLZero라는 멀티에이전트 시스템을 기반으로 자연어 설명만으로 tabular, image, text, time series 데이터의 학습 파이프라인을 구성한다.

이 시스템은 2024 Kaggle AutoML Grand Prix에서 완전 자동 프레임워크로 10위에 오르며, 대회에서 점수를 기록한 유일한 자동 에이전트가 됐다. 또한 Multimodal AutoML Agent Benchmark에서 92% 성공률, 외부 벤치마크인 MLE-bench Lite에서 86% 성공률을 기록하며 솔루션 품질과 성공률 모두에서 강한 성능을 보였다.

핵심은 네 개의 모듈이 역할을 분담하는 구조다.

  • perception: 파일 구조와 내용을 해석해 데이터 형태와 과제를 파악한다. CSV처럼 목표 변수가 명확하지 않은 경우에도 컬럼 분포와 의미를 분석해 분류, 회귀, 세분화 같은 문제 유형을 추론한다.
  • semantic memory: AutoGluon의 기능, API 패턴, 모범 사례를 구조화해 보관한다. 이를 바탕으로 semantic-segmentation 같은 작업에 맞는 도구를 선택한다.
  • episodic memory: 실행 이력과 성공/실패 사례를 누적해 디버깅 문맥을 제공한다. 에러가 나면 이전 시도와 결과를 참조해 다음 수정 방향을 잡는다.
  • iterative coding: 생성한 코드를 실행하고, 결과나 오류를 반영해 반복적으로 개선한다. 성공하거나 최대 반복 횟수에 도달할 때까지 피드백 루프를 유지한다.

저자들은 의료용 X-ray와 segmentation mask 예시를 통해, 사용자가 "병변 부위를 찾아라"라고만 입력해도 perception이 과제를 이해하고, semantic memory가 적절한 MultiModalPredictor를 고르며, iterative coding이 마스크 형식 불일치를 고쳐 학습을 완료하는 흐름을 설명한다. 이 과정에서 사용자는 코드를 쓰지 않아도 되지만, 필요할 경우 반복 단계마다 도메인 지식을 입력해 보정할 수 있다.

평가는 두 축으로 진행됐다. MLE-bench Lite는 이전 Kaggle 대회 21개 과제를 포함한 외부 표준 벤치마크로, AutoGluon Assistant는 21개 중 18개를 성공적으로 제출해 가장 높은 86% 성공률을 기록했고, 평균 순위 1.43으로 전체 솔루션 품질도 1위를 차지했다. 자체 벤치마크인 Multimodal AutoML Agent Benchmark는 더 원시적인 데이터와 더 높은 잡음, 포맷 불일치, 다국어·멀티테이블·대규모 데이터까지 포함한 25개 과제로 구성되며, 여기서도 92% 성공률을 달성했다.

리소스 제약이 있는 환경에서도 성능은 유지됐다. 8B급 소형 LLM으로 구현해도 45.3% 성공률을 기록해, 더 큰 모델을 쓰는 많은 에이전트보다 효율적이라는 점을 보여줬다.

접근 방식은 CLI, Python API, Web UI, MCP까지 지원해 기존 워크플로에 쉽게 붙일 수 있게 설계됐다. 오픈소스로 공개됐으며, 기술 상세는 NeurIPS 2025 paper로 정리됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.