AI Briefing

Xiaomi MiMo V2.5 Pro 공개

MIMO V2.5 PRO

·2026.04.28 02:57

Xiaomi가 1.02T 파라미터 MoE 모델 MiMo-V2.5-Pro를 공개했다.

Xiaomi MiMo가 MiMo-V2.5-Pro를 공개했다. 총 1.02T 파라미터, 활성 42B 파라미터의 MoE 언어모델로, 최대 1M 토큰 컨텍스트를 지원한다.

  • 하이브리드 어텐션: SWA와 GA를 6:1 비율로 섞고, 128 슬라이딩 윈도우를 사용해 KV 캐시 저장을 줄였다.
  • 3개 MTP 모듈: 추론 속도와 RL 롤아웃 효율을 높이도록 설계했다.
  • 학습 규모: 27T 토큰으로 FP8 혼합 정밀도, native 32k 시퀀스 길이로 사전학습했다.
  • 후처리: SFT, 도메인 특화 RL, MOPD를 거쳐 agentic·코딩·장기 추론 성능을 강화했다.

벤치마크에서는 Base 모델 기준 MMLU 89.4, GSM8K 99.6, MATH 86.2, SWE-Bench (AgentLess) 35.7을 기록했다. 장문맥 평가에서는 128k를 넘는 구간에서 이전 V2가 급격히 붕괴한 반면, V2.5 Pro는 512k에서 BFS 0.56 / Parents 0.92, 1M에서 0.37 / 0.62를 유지했다고 밝혔다.

배포 가이드는 SGLang 기준으로 제공되며, 모델 다운로드는 Hugging Face에서 가능하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.