Qwen3-Omni-Flash-2025-12-01: 더 똑똑하게 듣고, 보고, 따르는 업그레이드
핵심 내용
**Qwen3-Omni-Flash-2025-12-01**은 음성·시각·텍스트 전반을 더 안정적으로 다루도록 업그레이드됐다.
자세히 보기
Qwen3-Omni-Flash-2025-12-01은 텍스트, 이미지, 오디오, 비디오를 함께 처리하는 멀티모달 모델 Qwen3-Omni의 업그레이드 버전이다. 실시간 스트리밍으로 텍스트와 자연스러운 speech를 동시에 생성하며, 이번 버전은 성능과 효율을 함께 끌어올렸다.
가장 큰 변화는 audio-visual interaction의 개선이다. 일상적인 대화형 장면에서 흔히 나타나던 “지능 저하” 문제를 줄였고, 멀티턴 audio-visual 대화의 안정성과 일관성을 높여 더 자연스럽게 이어지는 상호작용을 지원한다.
system prompt control도 강화됐다. 이제 시스템 프롬프트를 완전히 커스터마이즈할 수 있어, 성격 스타일(예: sweet, cool, anime-inspired), 구어체 톤, 출력 길이 같은 세부 항목까지 세밀하게 제어할 수 있다.
언어 대응력도 넓어졌다. 텍스트 기반 상호작용은 119개 언어, speech recognition은 19개 언어, speech synthesis는 10개 언어를 지원하며, 이전 버전에서 보였던 언어 준수 불안정성은 해결됐다고 설명한다.
speech synthesis는 더 사람 같은 발화에 초점을 맞췄다. 말이 느리거나 기계적으로 들리던 문제를 줄이고, 텍스트 맥락에 맞춰 speaking rate, pause, intonation을 조절해 더 자연스럽고 표현력 있는 음성을 만든다.
성능 측면에서도 전 모달에서 개선이 보고됐다.
- 텍스트 이해·생성: ZebraLogic +5.6, LiveCodeBench-v6 +9.3, MultiPL-E +2.7, WritingBench +2.2
- 음성 이해: Fleurs-zh에서 word error rate 감소, VoiceBench +3.2
- 이미지 이해: MMMU +4.7, MMMU-Pro +4.8, MathVision_full +2.2
- 비디오 이해: MLVU +1.6 및 audio-visual synchronization 강화
향후에는 multi-speaker ASR, video OCR, audio-visual proactive learning을 더 발전시키고, agent-based workflows와 function calling 지원도 확장할 계획이다. 핵심 메시지는 **“Hear You. See You. Follow Smarter.”**로, 더 자연스럽고 정밀한 멀티모달 상호작용을 지향한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.