AI Briefing

Descript, 대규모 다국어 비디오 더빙 기술 구현 방식

·2026.03.06 09:00

Descript는 OpenAI 추론 모델을 활용해 의미와 영상 길이를 동시에 최적화하는 대규모 다국어 비디오 더빙 기술을 구현했다.

AI 네이티브 비디오 에디터인 DescriptOpenAIWhisperGPT 모델을 기반으로 트랜스크립션, 편집, 오디오 클리닝 등 복잡한 워크플로우를 지원해 왔다. 최근에는 단순 자막 번역을 넘어, 영상의 흐름을 해치지 않는 고품질 다국어 더빙(Dubbing) 기술 구현에 집중하고 있다.

더빙에서 가장 까다로운 과제는 **길이 준수(Duration Adherence)**다. 언어마다 동일한 의미를 전달하는 데 필요한 음절 수가 다르기 때문이다. 예를 들어 독일어는 영어보다 음절 수가 많아, 기존 방식대로 번역 후 길이를 맞추려 하면 음성이 지나치게 빨라지거나 느려져 부자연스러운 결과물이 발생했다.

Descript는 이를 해결하기 위해 OpenAI의 추론 모델을 활용하여 번역 파이프라인을 재설계했다. 기존에는 번역을 먼저 수행한 뒤 길이를 맞추려 시도했지만, 새로운 시스템은 생성 단계에서부터 의미적 충실도길이 준수를 동시에 최적화한다.

특히 GPT-5 시리즈 모델의 향상된 추론 능력을 활용해 음절 수를 정확히 계산하고 제약 조건을 추적함으로써, 번역 과정에서 자연스럽게 길이를 조절하도록 설계했다. 이를 통해 도입 후 30일 만에 더빙 수출량이 15% 증가했으며, 언어에 따라 길이 준수율이 13~43%포인트 향상되는 성과를 거두었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.