AI Briefing
추천

Qwen, 실시간 오디오-비주얼 상호작용 및 에이전트 기능 강화한 Qwen3.8-Omni-Flash 공개

·2026.09.18 02:25

핵심 내용

Qwen이 실시간 오디오-비주얼 상호작용과 에이전트 기능을 강화한 Qwen3.8-Omni-Flash를 공개했으며, 관련 오픈소스 도구도 함께 공개했다.

1 / 5

자세히 보기

Qwen Team이 텍스트, 이미지, 오디오, 비디오를 포함한 완전한 오디오-비주얼 콘텐츠에 대한 심층 이해와 생성을 위해 Qwen3.8-Omni-Flash를 출시했다. 이 모델은 저지연 실시간 상호작용을 위해 Qwen3.8-Omni-Flash-Realtime을 추가로 도입하여, 라이브 오디오-비주얼 스트림을 수신하면서 도구를 호출하고 작업을 수행할 수 있게 했다. 특히 음성 인식과 생성을 통해 발음과 의미를 결합하여 모델링하고, 공간 오디오 인식을 통해 소리만으로 대상을 위치시키는 기능을 지원한다.

에이전트 성능 및 벤치마크

벤치마크 결과에 따르면, 멀티모달 도구 사용 평가인 WildClawBench-MM에서 71.0점, AgenticVBench에서 36.8점을 기록하며 이전 모델(Qwen3.5-Omni-Plus) 대비 성능이 개선되었다. 또한 웹 검색 능력 평가인 OmniGAIA에서 74.0점을 달성했다.

오픈소스 생태계 확장

Qwen은 에이전트 스킬 생성을 위한 Omni Skill Creator를 Qwen-MM-Plugins의 새로운 오픈소스 기능으로 공개했다. 이를 통해 시연 영상에서 표준 운영 절차(SOP)를 추출하거나 전문가의 도구 사용법과 의사결정 기준을 학습하여 재사용 가능한 에이전트 스킬을 만들 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.