AI Briefing

동결된 latent text-to-audio 모델을 영상에 맞게 정렬하는 Foley Control

·2025.10.28 03:10

Foley Control은 동결된 T2A 모델에 작은 video cross-attention만 붙여 영상 동기화를 학습한다.

Foley Control은 사전학습된 단일 모달 모델은 그대로 freeze하고, 두 모델 사이에 작은 cross-attention bridge만 학습하는 가벼운 video-guided Foley 접근법이다.

V-JEPA2의 video embeddings를 frozen Stable Audio Open DiT text-to-audio(T2A) 모델에 연결하고, 기존 text cross-attention 뒤에 compact한 video cross-attention을 삽입한다. 이렇게 하면 프롬프트가 전체 의미를 정하고, 영상은 timinglocal dynamics를 더 정밀하게 맞춘다.

핵심은 오디오 prior를 다시 학습하지 않고도 audio-video dependency만 학습한다는 점이다. 동결된 백본은 각각의 강한 marginals, 즉 video 자체text 조건부 audio를 유지하면서 동기화에 필요한 결합만 브리지로 보완한다.

학습 안정성과 메모리 절감을 위해 video tokens pooling도 적용한다. 그 결과, 더 적은 trainable parameters로도 최근의 멀티모달 시스템들과 경쟁력 있는 temporal alignmentsemantic alignment를 보이면서, 프롬프트 기반 제어와 모듈식 확장성도 유지한다.

  • 장점: 엔드투엔드 재학습 없이 encoder나 T2A backbone을 교체·업그레이드하기 쉬움
  • 적용 범위: 우선은 Video-to-Foley에 집중하지만, 같은 bridge 설계를 speech 같은 다른 오디오 모달리티로도 확장할 수 있음

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.