AI Briefing

주요 오픈 웨이트 모델 25종 출시

Big week for open AI, with 25+ notable open-weight drops across every modality (from Victor M on 𝕏)

·2026.06.06 18:53

LLM, 이미지, 오디오, 비디오 등 다양한 분야에서 25개 이상의 새로운 오픈 웨이트 모델이 공개되었습니다.

LLM (대규모 언어 모델)

  • NVIDIA Nemotron 3 Ultra: 550B 규모의 하이브리드 Mamba-MoE 모델로, 1M 컨텍스트를 지원하며 MMLU 89.1을 기록했습니다.
  • Google Gemma 4 12B: 텍스트, 이미지, 오디오, 비디오를 모두 지원하는 any-to-any 모델로, 256k 컨텍스트와 140개 이상의 언어를 지원합니다.
  • StepFun Step-3.7-Flash: 198B sparse MoE VLM입니다.
  • Liquid AI LFM2.5-8B-A1B: 1.5B 활성 파라미터를 가진 에지(edge)용 MoE 모델입니다.
  • JetBrains Mellum2-12B-A2.5B-Thinking: 코딩 성능이 뛰어난 JetBrains의 첫 오픈 MoE 모델입니다.

이미지 생성

  • Ideogram 4: Ideogram의 첫 오픈 웨이트 모델로, 9.3B flow-matching DiT를 사용하며 텍스트 포함 이미지 생성 능력이 매우 강력합니다.

오디오 및 음성

  • Boson Higgs Audio v3 4B: 102개 언어와 21가지 감정을 지원하는 TTS 모델입니다.
  • RedNote dots.tts: 코덱 없는 완전 연속형 오픈 TTS 파이프라인입니다.
  • Google Magenta RealTime 2: 200ms 미만 지연 시간의 실시간 음악 생성 모델입니다.
  • NVIDIA Nemotron-3.5 ASR: 높은 동시 스트리밍 성능을 제공하는 ASR 모델입니다.

비전 및 비디오

  • PaddleOCR-VL-1.6: 1B 파라미터 규모의 SOTA 문서 파싱 모델입니다.
  • Baidu NAVA: 6.3B 규모의 오디오-비디오 결합 생성 모델입니다.
  • NVIDIA Cosmos3-Super: 물리적 AI를 위한 64B 규모의 옴니모달 월드 모델입니다.
  • JD JoyAI-Echo: 최대 5분 길이의 멀티샷 텍스트-비디오 생성 모델입니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.