고급 모달리티 조건 및 상호작용을 통한 텍스트 기반 오디오 동기화 비디오 생성 제어
·2026.07.07 09:00
텍스트로부터 오디오와 비디오가 동기화된 영상을 생성할 때 발생하는 모달리티 간 간섭과 캡션 불일치 문제를 해결하는 연구를 발표했다.
텍스트 기반 오디오 동기화 비디오 생성(T2SV)은 텍스트 조건에 맞춰 오디오와 비디오가 정렬된 영상을 만드는 기술이다. 하지만 기존 방식은 두 가지 핵심 과제에 직면해 있다.
첫째는 **텍스트 조건화(Text Conditioning)**의 병목 현상이다. 학습 시 사용하는 공유 캡션이 모달리티 간 간섭을 유발하며, 학습용 상세 캡션과 실제 추론 시 사용되는 간결한 프롬프트 사이의 간극이 존재한다. 둘째는 교차 모달리티 특징 상호작용을 위한 최적의 융합 메커니즘이 불분명하다는 점이다.
이를 해결하기 위해 CRR(Cross-Referential Rewriter) 캡션 프레임워크를 제안한다. 이 프레임워크는 두 개의 에이전트로 구성된 파이프라인이다.
- Semantic Checker: 근거가 명확한 Semantic Anchors를 추출한다.
- Cross-Modal Rewriter: 분리된 형태의 캡션 쌍(TV 및 TA)을 생성한다.
이러한 접근을 통해 모달리티 간 간섭을 제거하고 학습과 추론 사이의 간극을 해소한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.