Qwen3.5: 네이티브 멀티모달 에이전트를 향해
Qwen3.5-397B-A17B가 공개됐고, 397B 중 17B만 활성화되는 네이티브 멀티모달 모델이다.
Qwen3.5-397B-A17B가 Qwen3.5 시리즈의 첫 오픈웨이트 모델로 공개됐다. 네이티브 vision-language 모델로서 추론, 코딩, 에이전트 능력, 멀티모달 이해 전반에서 강한 성능을 내며, 총 397B 파라미터 중 17B만 활성화되는 구조로 효율도 높였다.
핵심 아키텍처는 Gated Delta Networks 기반 linear attention과 sparse MoE를 결합한 하이브리드 설계다. 이를 통해 속도와 비용을 줄이면서도 성능 저하를 억제했고, 언어·방언 지원도 119개에서 201개로 확대했다.
성능표에서는 언어, STEM, reasoning, general agent, search agent, multilingual, coding agent, vision language, video understanding, visual agent, medical VQA 등 광범위한 벤치마크를 비교한다. 여러 항목에서 최상위권을 기록했고, 특히 멀티모달 과제와 에이전트형 작업에서 개선 폭을 강조한다.
프리트레이닝은 세 축으로 정리된다.
- Power: Qwen3 대비 훨씬 더 큰 규모의 visual-text token으로 학습해, Qwen3.5-397B-A17B가 1T+ 파라미터급 Qwen3-Max-Base에 필적하는 수준에 도달했다.
- Efficiency: Qwen3-Next 아키텍처를 기반으로 더 높은 sparsity의 MoE, Gated DeltaNet + Gated Attention 하이브리드, 안정화 최적화, multi-token prediction을 적용했다.
- Versatility: 텍스트-비전 조기 융합으로 네이티브 멀티모달을 구현하고, visual/STEM/video 데이터를 확장했으며, 250k vocab으로 인코딩·디코딩 효율을 높였다.
추론 효율도 크게 개선됐다. 32k/256k 컨텍스트에서 Qwen3.5-397B-A17B의 디코딩 처리량은 Qwen3-Max 대비 각각 8.6x/19.0x, Qwen3-235B-A22B 대비 3.5x/7.2x 수준이라고 밝힌다.
강화학습 쪽에서는 가능한 한 많은 RL 태스크와 환경을 확장해 일반 에이전트 능력을 끌어올렸다고 설명한다. 또한 비동기 RL framework와 완전 분리형 training-inference 구조를 도입해 하드웨어 활용률, 부하 분산, 장애 복구를 개선했고, 전체적으로 3x~5x 엔드투엔드 속도 향상을 달성했다고 주장한다.
제품 측면에서는 Qwen Chat에서 auto, thinking, fast 3가지 모드를 제공한다. Qwen3.5-Plus는 Alibaba Cloud Model Studio에서 사용할 수 있으며, enable_thinking과 enable_search로 reasoning, web search, Code Interpreter 기능을 활성화할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.