AI Briefing

Mistral Small 4 공개

·2026.03.16 09:00

Mistral Small 4가 추론, 멀티모달, 코딩을 하나로 묶어 공개됐다.

Mistral Small 4Magistral의 추론, Pixtral의 멀티모달, Devstral의 에이전트형 코딩 능력을 하나의 모델로 통합한 Mistral의 새 주력 모델이다. Apache 2.0 라이선스로 공개되며, 빠른 instruct 모델과 강한 reasoning 엔진, 멀티모달 어시스턴트 사이를 오갈 필요 없이 하나의 모델로 대응할 수 있게 했다.

이 모델은 textimage 입력을 모두 지원하는 하이브리드 구조로 설계됐고, Mixture of Experts(MoE) 아키텍처를 사용한다. 전체 128 experts 중 토큰당 4개 expert만 활성화되며, 119B 총 파라미터와 토큰당 6B active parameters(embedding과 output layer 포함 시 8B)를 갖고, 256k context window로 긴 문서와 장문 대화도 처리한다.

핵심 기능은 reasoning_effort 파라미터로 조절된다. reasoning_effort="none"은 Mistral Small 3.2 수준의 빠르고 가벼운 응답을, reasoning_effort="high"는 이전 Magistral 모델과 비슷한 깊이의 단계적 추론을 제공한다.

성능 측면에서는 내부 비교 기준으로 40% end-to-end completion time 감소3x requests per second 향상을 제시했다. 추론을 켠 상태에서도 GPT-OSS 120B와 비교해 세 벤치마크에서 경쟁력 있는 점수를 내면서 더 짧은 출력을 생성했고, AA LCR에서는 1.6K characters0.72를 기록해 Qwen 계열보다 훨씬 적은 출력으로 비슷한 성능을 냈다. LiveCodeBench에서는 GPT-OSS 120B를 앞서면서 출력은 20% 적었다.

배포 관점에서는 최소 구성으로 4x NVIDIA HGX H100, 2x NVIDIA HGX H200, 또는 1x NVIDIA DGX B200을 제시했고, 권장 구성은 4x HGX H100, 4x HGX H200, 또는 2x DGX B200이다. 모델은 vLLM, llama.cpp, SGLang, Transformers 등에서 사용할 수 있으며, NVIDIA NIM으로도 day-0 배포가 가능하다.

주요 활용처는 다음과 같다.

  • Developers: 코드 자동화, codebase 탐색, agentic coding workflow
  • Enterprises: 일반 chat assistant, 문서 이해, 멀티모달 분석
  • Researchers: 수학, 연구, 복잡한 추론

핵심 메시지는 분명하다. instruct, reasoning, multimodal을 하나로 합친 Mistral Small 4는 오픈소스 기반의 유연성과 기업용 효율성을 동시에 노린 모델이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.