MixAtlas: 멀티모달 LLM 미드트레이닝을 위한 불확실성 인식 데이터 혼합 최적화
·2026.04.16 09:00
핵심 내용
작은 proxy 모델과 Gaussian-process로 멀티모달 데이터 혼합을 1/100 비용으로 최적화했다.
자세히 보기
MixAtlas는 멀티모달 LLM 미드트레이닝에서 데이터 미xture를 단순히 감으로 맞추지 않고, 불확실성 인식 방식으로 체계적으로 최적화하는 프레임워크다. 기존에는 데이터 포맷이나 태스크 유형 같은 한 가지 관점만 보고 혼합 비율을 조정했지만, 이 방법은 image concepts와 task supervision 두 축으로 데이터를 분해해 더 해석 가능한 mixture control을 가능하게 한다.
작은 proxy model과 Gaussian-process surrogate를 활용해 전체 학습 비용의 1/100 수준으로 mixture 공간을 탐색한다. 이렇게 찾은 혼합 비율은 실제 대규모 학습에도 전달되어, 효율성과 정확도 향상을 함께 유지한다.
성과도 분명하다.
- 기존 방식보다 최대 3배 빠른 수렴을 보였다.
- 여러 벤치마크에서 **2~5%**의 일관된 성능 향상을 기록했다.
- 특히 텍스트가 많은 벤치마크에서 강했다: ChartQA +10%, TextVQA +13%.
저자들은 이 접근이 멀티모달 데이터 혼합 최적화를 실용적이면서도 해석 가능하게 만든다고 강조한다. 또한 NADPFM at ICLR 2026 워크숍에 채택되며, 차세대 MLLM 학습을 위한 구체적인 레시피로 제시됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.