AI Briefing

Qwen2.5 Omni: 보고, 듣고, 말하고, 쓰는 올인원 멀티모달 모델

·2025.03.27 01:00

Qwen 시리즈의 새로운 플래그십 모델인 Qwen2.5-Omni는 텍스트, 이미지, 오디오, 비디오를 통합 처리하는 엔드투엔드 멀티모달 모델이다.

Qwen 시리즈의 새로운 플래그십 모델인 Qwen2.5-Omni는 텍스트, 이미지, 오디오, 비디오 등 다양한 입력을 통합적으로 처리하는 엔드투엔드 멀티모달 모델이다. 실시간 스트리밍 방식으로 텍스트 생성과 자연스러운 음성 합성을 동시에 제공한다.

핵심은 Thinker-Talker 아키텍처다. Thinker는 다양한 모달리티의 입력을 이해하고 고차원 표현과 텍스트를 생성하는 '두뇌' 역할을 하며, Talker는 이를 받아 실시간으로 자연스러운 음성을 출력하는 '입' 역할을 수행한다. 특히 비디오 입력과 오디오의 타임스탬프를 동기화하기 위해 TMRoPE(Time-aligned Multimodal RoPE)라는 새로운 위치 임베딩 방식을 도입했다.

주요 특징은 다음과 같다:

  • 실시간 음성 및 비디오 채팅: 청크 단위 입력과 즉각적인 출력을 지원하여 완전한 실시간 상호작용이 가능하다.
  • 강력한 멀티모달 성능: 오디오 능력 면에서 Qwen2-Audio를 능가하며, Qwen2.5-VL-7B와 대등한 성능을 보여준다.
  • 탁월한 음성 지시 이행: MMLU, GSM8K 등의 벤치마크에서 텍스트 입력과 유사한 수준의 음성 지시 이행 능력을 입증했다.

OmniBench에서 최첨단(SOTA) 성능을 달성했으며, 음성 인식(Common Voice), 이미지 추론(MMMU), 비디오 이해(MVBench) 등 다양한 단일 모달리티 작업에서도 뛰어난 성과를 기록했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.