AI Briefing

StepAudio 3 Gen, RVQ 기반 디스크리트 생성으로 TTS 및 멀티모달 오디오 생성 SOTA 달성

·2026.09.15 09:00

핵심 내용

StepAudio 3 Gen이 RVQ 토큰 기반 디스크리트 생성 아키텍처로 TTS와 멀티모달 오디오 생성에서 SOTA를 달성했다.

자세히 보기

StepAudio 3 Gen은 일반 목적 오디오 생성 모델로, zero-shot TTS, 음성 디자인, 보컬, 효과음, 음악 등 다양한 기능을 통합 지원한다. 이 모델은 기존 diffusion Transformer 기반의 연속 생성 패러다임에서 벗어나, RVQ(residual vector quantization) 토큰 위에서 오디오를 직접 모델링하는 discrete autoregressive generator 아키텍처를 채택했다.

핵심 구성 요소인 StepAudio Tokenizer는 12.5 Hz 주파수에서 일반 오디오를 표현하며, 16 x 2048 크기의 공유 residual code space를 사용한다. semantic 및 waveform-level acoustic features를 공동 양자화하여 각 code layer가 두 가지 정보를 모두 보존하도록 설계되었다.

생성 메커니즘은 백본이 시간 축에서 첫 번째 codebook을 autoregressive 방식으로 예측하고, 나머지 15개 codebook은 codebook 축에서 lightweight causal Transformer가 완료하는 방식이다. 모델 개발에는 LLM의 텍스트 능력을 보존하며 오디오 능력을 습득하기 위한 interference-aware progressive pretraining, 다중 codebook 통합을 위한 RVQ Adaptor, 그리고 도메인 간 공유 표현을 위한 discrete autoregressive modeling 등 3가지 핵심 설계 원칙이 적용되었다.

학습 과정은 interference-aware progressive pretraining, multi-task instruction training, supervised fine-tuning 순으로 진행되었다. 그 결과 TTS 및 voice design 분야에서 state-of-the-art 성능을 달성했으며, speech, vocals, sound effects, music 전반에서 강력한 생성 능력을 유지한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.