AI Briefing

텐센트, 초고속 음성 편집 AI AuK-Flash 공개

tencent/AuK-Flash · Hugging Face

·2026.09.12 22:17

핵심 내용

텐센트가 4단계 추론으로 빠른 음성 생성과 편집을 지원하는 1.5B 파라미터의 AuK-Flash 모델을 공개했다.

자세히 보기

텐센트(Tencent)가 음성 생성 및 편집을 위한 1.5B 파라미터 기반의 파운데이션 모델 AuK의 증류(distilled) 버전인 AuK-Flash를 공개했다. 이 모델은 자연어 지시문을 통해 다양한 음성 작업을 수행할 수 있으며, 원본 모델의 증류를 통해 4단계 추론만으로 고품질 음성 생성이 가능하도록 추론 속도를 개선했다.

주요 특징 및 성능

  • 초고속 추론: AuK-Flash는 원본 모델의 증류 버전으로, 단 4단계(4-step) 추론만으로 음성 생성이 가능하여 inference 속도가 크게 향상되었다.
  • 통합 인터페이스: 제로샷 TTS, 지시 기반 TTS, 내용 편집, 음향 편집, 감정 편집, 음성 향상, 소스 분리 등 모든 작업을 자연어 지시문 하나로 처리할 수 있다.

지원 작업 범위

AuK-Flash는 다음과 같은 다양한 음성 조작 기능을 지원한다:

  • 음성 생성: 참조 음성을 활용한 제로샷 TTS, 음성 설명만으로 생성하는 Instruct TTS
  • 내용 및 음향 편집: 텍스트 교체/삽입/삭제, 피치/속도/볼륨 조절, 가사 편집
  • 패럴링구이스틱 편집: 감정 변경, 음색(timbre) 변경, 억양 제거, 비언어적 소리(숨소리, 웃음 등) 추가/제거, 속삭임 변환
  • 향상 및 분리: 잡음 제거 및 잔향 제거, 화자 분리, 음악에서 보컬 추출, 특정 화자 추출

가중치는 Hugging Face와 ModelScope에서 다운로드 가능하며, GitHub와 프로젝트 페이지를 통해 CLI 및 Python 예제 코드를 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.