보정된 희소 어텐션을 통한 텍스트-비디오 생성 가속화
·2026.07.21 09:00
CalibAtt는 비디오 생성 모델의 어텐션 연산 중 불필요한 연결을 식별하여 속도를 최대 1.58배 높이는 기술이다.
최근 확산 모델(Diffusion Models)은 고품질 비디오 생성을 가능하게 했으나, Transformer 기반 백본의 시공간 어텐션(Spatiotemporal Attention) 연산 병목 현상으로 인해 실행 속도가 느리다는 단점이 있다.
연구진은 토큰 간 연결 중 상당수가 다양한 입력에서도 일관되게 무시할 수 있는 수준의 낮은 점수를 기록하며, 이 패턴이 반복된다는 점에 주목했다. 이를 바탕으로 별도의 학습이 필요 없는 CalibAtt 기술을 제안한다.
CalibAtt의 주요 특징은 다음과 같다:
- 오프라인 보정(Offline Calibration): 입력값에 관계없이 안정적인 블록 단위 희소성 및 반복 패턴을 식별한다.
- 최적화된 연산: 식별된 패턴을 각 레이어, 헤드, 확산 타임스텝별로 최적화된 어텐션 연산으로 컴파일한다.
- 효율적 추론: 추론 시 중요한 연결은 밀도 있게 계산하고, 불필요한 연결은 하드웨어 효율적인 방식으로 건너뛴다.
Wan 2.1 14B, Mochi 1 및 몇 단계 증류(few-step distilled) 모델을 대상으로 실험한 결과, 비디오 생성 품질과 텍스트-비디오 정렬 성능을 유지하면서도 기존 방식 대비 최대 1.58배의 엔드 투 엔드(end-to-end) 속도 향상을 달성했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.