AI Briefing

Qwen2-Audio: 목소리로 대화하기

·2024.08.09 17:18

Qwen의 차세대 오디오 모델인 **Qwen2-Audio**가 음성 및 텍스트 입력을 지원하며 공개되었다.

AGI 시스템 구축을 위해 멀티모달 이해 능력은 필수적이다. 기존 Qwen 모델을 시각과 오디오로 확장했던 Qwen-VL, Qwen-Audio에 이어 차세대 모델인 Qwen2-Audio가 출시되었다.

Qwen2-Audio는 오디오와 텍스트 입력을 받아 텍스트로 응답하는 모델로, 다음과 같은 핵심 기능을 제공한다.

  • Voice Chat: 별도의 ASR(Automatic Speech Recognition) 모듈 없이 사용자의 음성 명령을 직접 이해한다.
  • Audio Analysis: 음성, 소리, 음악 등 다양한 오디오 정보를 텍스트 지시사항에 따라 분석한다.
  • Multilingual: 중국어, 영어, 광둥어, 프랑스어, 이탈리아어, 스페인어, 독일어, 일본어 등 8개 이상의 언어와 방언을 지원한다.

현재 Qwen2-Audio-7BQwen2-Audio-7B-Instruct 모델이 Hugging Face와 ModelScope에 오픈 웨이트(open-weight)로 공개되었다. 이 모델은 화자 식별, 음성 번역, 배경 소음 감지, 오디오 기반 스토리텔링 등 폭넓은 작업에서 뛰어난 성능을 보여준다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.