연속적 확산 기반 음성 언어 모델의 스케일링 특성
·2026.07.06 09:00
연속적 확산(Continuous Diffusion) 기반 음성 모델이 스케일링 법칙을 따르며 효율적인 추론 가능성을 보여주었다.
기존의 이산적 자기회귀(AR) 방식 음성 모델은 연속적인 음성을 이산화하는 과정에서 병목 현상이 발생한다. 이를 해결하기 위해 연속적 확산(Continuous Diffusion, CD) 기반의 음성 언어 모델(SLM)의 효율성을 탐구했다.
연구 결과, CD SLM은 검증 손실(Validation Loss)과 pJSD(phoneme Jensen-Shannon divergence) 지표 모두에서 **스케일링 법칙(Scaling Laws)**을 따르는 것으로 나타났다. 모델의 파라미터 대비 최적의 토큰 비율은 연산량이 증가함에 따라 감소하며, 이는 더 빠른 추론이 가능함을 시사한다.
16B 파라미터 규모와 수천만 시간의 대화 데이터를 활용해 학습한 결과, 다음과 같은 성능을 확인했다.
- 감정이 풍부한(Emotive) 음성 생성
- 운율(Prosodic) 및 다중 화자(Multi-speaker) 지원
- 다국어(Multilingual) 음성 생성
다만, 긴 문맥에서의 일관성(Long-form coherence)을 유지하는 문제는 여전히 해결해야 할 주요 과제로 남아있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.