AI Briefing

MiMo-V2.5 — Xiaomi의 오픈소스 옴니모달 AI 모델

·2026.04.29 11:22

Xiaomi가 텍스트·이미지·비디오·오디오를 통합 처리하는 MiMo-V2.5를 공개했다.

Xiaomi가 MiMo-V2.5를 공개했다. 텍스트·이미지·비디오·오디오를 하나의 아키텍처에서 처리하는 네이티브 옴니모달 모델로, 에이전트 작업에 맞춰 설계됐다. MIT 라이선스라 상용 배포와 파인튜닝도 가능하다.

  • MiMo-V2.5: 310B 파라미터 중 15B만 활성화하는 Sparse MoE 구조
  • MiMo-V2.5-Pro: 1.02T/42B 규모의 Pro 버전으로, 장기 일관성과 복잡한 소프트웨어 엔지니어링에 초점을 맞췄다.
  • Hybrid Attention(SWA + GA 5:1, window 128): KV-cache 저장량을 약 6배 줄이면서 최대 1M 토큰 컨텍스트를 지원한다.
  • 전용 인코더: 729M ViT 비전 인코더와 261M 오디오 인코더를 탑재했다.
  • MTP(Multi-Token Prediction): 3개 레이어로 speculative decoding 추론 가속과 RL 효율을 높였다.
  • 학습: 약 48T 토큰으로 FP8 mixed precision 학습 후 SFT, 대규모 에이전트 RL, **Multi-Teacher On-Policy Distillation(MOPD)**를 적용했다.
  • 배포: SGLangvLLM 공식 지원, **Base(256K)**와 Full(1M) 두 버전을 제공한다.

VentureBeat가 소개한 ClawEval 결과에서 Pro 모델은 오픈소스 분야 선두 수준인 63.8% 성공률을 기록했다. Claude Opus 4.6, Gemini 3.1 Pro, GPT-5.4 대비 40~60% 적은 토큰으로 비슷한 결과를 냈고, **GDPVal-AA(Elo)**에서는 1581점을 받아 Kimi K2.6과 GLM 5.1을 앞섰다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.