AI Briefing

Qwen3.5-Omni 기술 보고서

·2026.04.22 09:00

핵심 내용

Qwen3.5-Omni가 256k 컨텍스트와 1억 시간+ 오디오·비주얼 데이터로 SOTA를 달성했다.

자세히 보기

Qwen3.5-Omni는 Qwen Team의 최신 fully omnimodal LLM으로, 텍스트·이미지·오디오·오디오·비주얼을 함께 이해하고 생성한다. 수천억 파라미터 규모와 256k context를 지원하며, 이종 text-vision pair와 1억 시간 이상의 오디오·비주얼 데이터를 바탕으로 사전학습됐다.

모델 라인은 Plus와 Flash로 나뉘고, 모두 instruct 모델이다. 보고서는 Qwen3.5-Omni-Plus가 215개 오디오·오디오비주얼 이해, 추론, 상호작용 서브태스크와 벤치마크에서 SOTA를 기록했다고 밝히며, 주요 audio 작업에서는 Gemini-3.1 Pro를 앞섰고 종합 audio-visual 이해에서는 그 수준에 도달했다고 설명한다.

아키텍처는 기존 Thinker-Talker를 유지하면서 양쪽에 Hybrid-Attention MoE를 적용했다. 이 설계는 긴 시퀀스 추론 효율을 높여 10시간 이상 오디오 이해와 400초 분량의 720P 비디오(1 FPS) 처리까지 가능하게 만든다.

음성 생성 쪽에서는 multi-codebook codec representation으로 단일 프레임 즉시 합성을 지원한다. 스트리밍 speech synthesis의 불안정성과 부자연스러움을 줄이기 위해 **ARIA (Adaptive Rate Interleave Alignment)**를 넣었고, 텍스트와 speech unit의 속도 차이를 동적으로 맞춰 자연스러운 prosody와 안정성을 개선하면서도 지연 증가는 최소화했다.

멀티링구얼 범위도 넓다. 음성 생성은 10개 언어에서 감정 뉘앙스를 살려 동작하고, 학습 범위는 113개 언어·방언의 ASR과 36개 음성 합성까지 확장됐다. 사용자 샘플만으로 목소리를 맞추는 zero-shot voice customization도 가능하다.

주요 신규 기능은 다음과 같다.

  • Controllable audio-visual captioning: 자동 segmentation, timestamp, 인물 관계까지 포함한 구조화 캡션과 screenplay 수준 설명
  • Real-time interaction: semantic interruption, 볼륨·속도·감정 제어, voice cloning
  • Native omnimodal agent behavior: WebSearch, 복잡한 FunctionCall, 그리고 오디오·비주얼 지시만으로 실행 가능한 코드를 생성하는 Audio-Visual Vibe Coding

무엇보다 텍스트와 비전 성능이 같은 크기의 단일모달 Qwen 계열 대비 저하되지 않았다는 점이 중요하다. 공개 API로 제공되며, Qwen3.5-Omni가 오디오 SOTA, 실시간 대화, 에이전트형 행동을 하나의 모델로 묶으려는 방향을 분명히 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.