샤오미, MOPD로 MiMo-V2.6 도구 호출 반복 문제 해결… 비용 9만 달러
핵심 내용
샤오미가 MOPD로 MiMo-V2.6 반복 문제를 약 9만 달러에 해결했다.
자세히 보기
MiMo-V2.6 공개 이후 MiMo Desktop과 MiMo Code 등 에이전트 환경에서 도구 호출 반복 문제가 주요 사용자 경험 이슈로 부상했다. 내부 평가 결과 응답 단위 반복률이 **0.05%**를 초과했으며, OpenCode 하네스에서는 Flash 모델의 반복률이 **1.02%**까지 치솟았다. 모델이 동일하거나 유사한 도구 호출을 반복해 컨텍스트와 시간을 낭비하는 현상이 발생했다.
RL 보상 구조의 사각지대 진단
문제의 원인은 강화학습(RL) 보상 구조의 사각지대로 지목됐다. 한 턴에서 32회 이상 호출하는 '도구 호출 홍수(tool-call flooding)'에 대한 페널티는 존재했으나 기준이 너무 느슨했다. 학습 로그 분석 결과 초기에는 페널티가 거의 발동되지 않았지만, RL step 0에서 step 20으로 갈수록 한 턴당 8회 이상 호출하는 사례 비중이 꾸준히 증가했다. 32회 미만 호출은 페널티를 받지 않아 학습 중 이 행동이 강화됐고, 결국 심각한 홍수와 반복으로 이어졌다.
별도 실험에서 페널티 임계값을 8회로 낮추면 홍수를 억제할 수 있었지만, MixRL 학습 20단계를 재시작해야 하며 비용은 약 231만 달러로 추정됐다. 또한 이 환경 레벨 수정은 일반화 성능이 낮아 반복률을 **13.45%**에서 **3.83%**로 줄이는 데 그쳤고, 문제를 완전히 해결하지 못했다.
MOPD 기반 해결책
샤오미는 효율적인 해결을 위해 Multi-teacher On-Policy Distillation (MOPD) 방식을 채택했다. 먼저 내부 수집한 반복 사례를 사용해 단일 턴 RL 교사를 학습시켰다. 이 교사는 약 7,000개 사례로 12단계만 학습해 학습 데이터와 검증 데이터 모두에서 반복을 0으로 만들었다. 교사는 도구 호출을 계속 생성하는 대신 턴 종료 토큰에 높은 확률을 할당하는 방식을 학습했다.
이후 MOPD를 통해 전문 교사를 메인 모델에 병합했다. 최종 학습 비용은 약 9만 달러로, MixRL 재시작 추정 비용의 4% 수준이다. MOPD 적용 후 MiMo-V2.6-Pro와 MiMo-V2.6-Flash 모두 다양한 에이전트 하네스와 컨텍스트 길이에서 반복률이 대폭 감소했으며, 전반적인 벤치마크 성능은 안정적으로 유지됐다.
릴리스 및 사용자 영향
샤오미는 최신 MOPD 체크포인트를 Hugging Face에 오픈소스로 공개했으며, 모델명에는 MOPD 접미사가 포함된다. 업데이트된 mimo-v2.6-pro와 mimo-v2.6-flash는 **9월 25일 06:00 (UTC+8)**에 API 플랫폼에서 제공됐다. 이전 문제 사과 차원에서 현재 사용 기간 내 모든 MiMo Desktop 사용자의 잔여 할당량이 초기화된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.