Descript, 대규모 다국어 비디오 더빙 기술 구현 방식
Descript는 OpenAI 추론 모델을 활용해 의미와 영상 길이를 동시에 최적화하는 대규모 다국어 비디오 더빙 기술을 구현했다.
AI 네이티브 비디오 에디터인 Descript는 OpenAI의 Whisper와 GPT 모델을 기반으로 트랜스크립션, 편집, 오디오 클리닝 등 복잡한 워크플로우를 지원해 왔다. 최근에는 단순 자막 번역을 넘어, 영상의 흐름을 해치지 않는 고품질 다국어 더빙(Dubbing) 기술 구현에 집중하고 있다.
더빙에서 가장 까다로운 과제는 **길이 준수(Duration Adherence)**다. 언어마다 동일한 의미를 전달하는 데 필요한 음절 수가 다르기 때문이다. 예를 들어 독일어는 영어보다 음절 수가 많아, 기존 방식대로 번역 후 길이를 맞추려 하면 음성이 지나치게 빨라지거나 느려져 부자연스러운 결과물이 발생했다.
Descript는 이를 해결하기 위해 OpenAI의 추론 모델을 활용하여 번역 파이프라인을 재설계했다. 기존에는 번역을 먼저 수행한 뒤 길이를 맞추려 시도했지만, 새로운 시스템은 생성 단계에서부터 의미적 충실도와 길이 준수를 동시에 최적화한다.
특히 GPT-5 시리즈 모델의 향상된 추론 능력을 활용해 음절 수를 정확히 계산하고 제약 조건을 추적함으로써, 번역 과정에서 자연스럽게 길이를 조절하도록 설계했다. 이를 통해 도입 후 30일 만에 더빙 수출량이 15% 증가했으며, 언어에 따라 길이 준수율이 13~43%포인트 향상되는 성과를 거두었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.