적대적 포스트트레이닝으로 빠른 텍스트-오디오 생성
·2025.05.13 16:24
ARC post-training으로 44.1kHz 스테레오 12초를 H100에서 75ms에 생성한다.
Text-to-audio 시스템은 성능은 좋아졌지만 추론 속도가 느려, 창작용으로는 지연이 큰 문제가 됐다. 이를 해결하기 위해 Adversarial Relativistic-Contrastive(ARC) post-training이 제안되며, diffusion/flow 모델에 적용되는 첫 번째 비-distillation 기반 적대적 가속법이라고 밝힌다.
ARC는 두 가지를 결합한다.
- 최근의 relativistic adversarial formulation을 diffusion/flow post-training으로 확장
- contrastive discriminator objective를 새로 도입해 프롬프트 적합성을 더 높이도록 유도
여기에 Stable Audio Open에 대한 여러 최적화를 더해, 44.1kHz stereo audio 약 12초 분량을 H100에서 약 75ms에 생성하는 모델을 만들었다. 모바일 엣지 디바이스에서도 약 7초 수준을 달성해, 작성 시점 기준 가장 빠른 text-to-audio 모델이라고 주장한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.