AI Briefing

적대적 포스트트레이닝으로 빠른 텍스트-오디오 생성

·2025.05.13 16:24

핵심 내용

ARC post-training으로 44.1kHz 스테레오 12초를 H100에서 75ms에 생성한다.

자세히 보기

Text-to-audio 시스템은 성능은 좋아졌지만 추론 속도가 느려, 창작용으로는 지연이 큰 문제가 됐다. 이를 해결하기 위해 Adversarial Relativistic-Contrastive(ARC) post-training이 제안되며, diffusion/flow 모델에 적용되는 첫 번째 비-distillation 기반 적대적 가속법이라고 밝힌다.

ARC는 두 가지를 결합한다.

  • 최근의 relativistic adversarial formulation을 diffusion/flow post-training으로 확장
  • contrastive discriminator objective를 새로 도입해 프롬프트 적합성을 더 높이도록 유도

여기에 Stable Audio Open에 대한 여러 최적화를 더해, 44.1kHz stereo audio 약 12초 분량을 H100에서 약 75ms에 생성하는 모델을 만들었다. 모바일 엣지 디바이스에서도 약 7초 수준을 달성해, 작성 시점 기준 가장 빠른 text-to-audio 모델이라고 주장한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.