AI Briefing

Mistral Small 4 공개

Mistral Small 4 119B-2603

·2026.04.29 13:39

Mistral Small 4가 119B MoE·256k 멀티모달 추론 모델로 공개됐다.

Mistral Small 4가 Instruct, Reasoning(Magistral), Devstral 능력을 하나로 묶은 하이브리드 모델로 공개됐다.

  • MoE 128 experts / 4 active, 총 119B 파라미터, 토큰당 6.5B 활성화
  • 256k context텍스트+이미지 입력을 지원하고, 텍스트 출력을 생성
  • 요청별 reasoning_effort로 즉시 응답과 추론 모드를 전환할 수 있으며, 시스템 프롬프트·함수호출·JSON 출력도 지원
  • 복잡한 작업에는 reasoning_effort='high', 가벼운 작업에는 none 모드를 권장하고 temperature 가이드를 함께 제시함
  • 영어, 프랑스어, 스페인어, 독일어, 중국어, 일본어, 한국어 등 다국어를 지원하고 Apache 2.0으로 배포됨

성능 설명에 따르면 latency-optimized 설정에서는 end-to-end 완료 시간이 40% 줄었고, throughput-optimized 설정에서는 Mistral Small 3 대비 초당 요청 처리가 3배 늘었다.

효율을 더 높이기 위한 파생 체크포인트도 함께 제시됐다.

  • mistralai/Mistral-Small-4-119B-2603-eagle: speculative decoding용
  • mistralai/Mistral-Small-4-119B-2603-NVFP4: 4-bit NVFP4 양자화 체크포인트

벤치마크 비교에서는 reasoning 모드가 GPT-OSS 120B와 경쟁하거나 상회했고, AA LCR 0.721.6K characters 출력으로 달성했다고 밝혔다. 같은 수준의 성능을 내기 위해 Qwen 계열은 5.8K~6.1K 출력이 필요했고, LiveCodeBench에서는 GPT-OSS 120B보다 높은 결과를 내면서 출력량은 20% 적었다.

배포는 vLLM, llama.cpp, LM Studio, SGLang, transformers를 지원하며, 문서 이해·이미지 분석·코딩 에이전트·연구 보조·파인튜닝 용도로 활용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.