Qwen, 실시간 오디오-비주얼 상호작용 및 에이전트 기능 강화한 Qwen3.8-Omni-Flash 공개
핵심 내용
Qwen이 실시간 오디오-비주얼 상호작용과 에이전트 기능을 강화한 Qwen3.8-Omni-Flash를 공개했으며, 관련 오픈소스 도구도 함께 공개했다.
자세히 보기
Qwen Team이 텍스트, 이미지, 오디오, 비디오를 포함한 완전한 오디오-비주얼 콘텐츠에 대한 심층 이해와 생성을 위해 Qwen3.8-Omni-Flash를 출시했다. 이 모델은 저지연 실시간 상호작용을 위해 Qwen3.8-Omni-Flash-Realtime을 추가로 도입하여, 라이브 오디오-비주얼 스트림을 수신하면서 도구를 호출하고 작업을 수행할 수 있게 했다. 특히 음성 인식과 생성을 통해 발음과 의미를 결합하여 모델링하고, 공간 오디오 인식을 통해 소리만으로 대상을 위치시키는 기능을 지원한다.
에이전트 성능 및 벤치마크
벤치마크 결과에 따르면, 멀티모달 도구 사용 평가인 WildClawBench-MM에서 71.0점, AgenticVBench에서 36.8점을 기록하며 이전 모델(Qwen3.5-Omni-Plus) 대비 성능이 개선되었다. 또한 웹 검색 능력 평가인 OmniGAIA에서 74.0점을 달성했다.
오픈소스 생태계 확장
Qwen은 에이전트 스킬 생성을 위한 Omni Skill Creator를 Qwen-MM-Plugins의 새로운 오픈소스 기능으로 공개했다. 이를 통해 시연 영상에서 표준 운영 절차(SOP)를 추출하거나 전문가의 도구 사용법과 의사결정 기준을 학습하여 재사용 가능한 에이전트 스킬을 만들 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.