추천MiMo-V2.6-Flash-RL: 텍스트 넘어 영상·오디오까지 이해하는 159B 멀티모달 LLM
XiaomiMiMo/MiMo-V2.6-Flash-RL
·2026.09.22 11:49
프로젝트 소개
텍스트뿐 아니라 이미지, 오디오, 영상까지 입력으로 받아 처리하는 멀티모달 언어 모델이다. 시각적 정보와 음성 데이터를 동시에 해석할 수 있어 단순 텍스트 생성을 넘어선 복합적인 이해가 가능하다.

약 159B 파라미터 규모로, 긴 문맥을 효과적으로 처리하는 long-context 기능을 지원한다. 에이전트(agent) 태스크 수행에 특화되어 있어 외부 도구 호출 및 복잡한 추론 과정에 활용하기 적합하다.
영어와 중국어 기반이며, FP8 및 8-bit 정밀도 양자화를 지원해 배포 환경에 따른 유연성을 확보했다. Transformers 라이브러리를 통해 쉽게 로드할 수 있으며 MIT 라이선스로 오픈소스 생태계에서 자유롭게 활용 가능하다.
HuggingFace 모델
XiaomiMiMo/MiMo-V2.6-Flash-RL
원문에 등록된 설명이 없습니다.
text-generation
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.