AI Briefing

Amazon, AI로 TV·영화 대사를 또렷하게 하는 Dialogue Boost 공개

·2025.12.11 00:22

핵심 내용

Amazon이 TV·영화 대사를 키우고 배경음을 낮추는 on-device AI를 공개했다.

자세히 보기

Amazon은 Echo smart speakers와 Fire TV 기기에 탑재되는 Dialogue Boost를 공개했다. 이 기능은 영화·드라마·팟캐스트의 대사를 선명하게 만들고, 배경 음악과 효과음을 적응적으로 억제한다. 특히 전 세계 인구의 약 **20%**로 언급한 청력 저하 사용자에게 유용하다.

처음에는 Prime Video에서 2022년에 제공됐지만, 이번 버전은 deep-neural-network compression을 활용해 기기 안에서 직접 실행된다. 덕분에 Netflix, YouTube, Disney+ 같은 모든 미디어에 적용할 수 있다.

대사 향상은 여러 단계의 sound source separation으로 이뤄진다.

  • 입력 오디오는 먼저 시간-주파수 표현으로 변환돼 각 주파수 대역의 에너지를 시간축에 따라 분석한다.
  • 이후 수천 시간 분량의 발화 조건으로 학습한 neural network가 실시간으로 음성과 다른 소리를 구분한다.
  • 최종적으로는 대사 중심 채널 식별, 소스 분리, 음성 명료도에 중요한 주파수 대역 강조, 원본 오디오와의 리믹스를 결합한 intelligent mixing이 적용된다.

핵심은 sub-band processing과 pseudo-labeling이다. 기존처럼 전체 주파수를 한 번에 처리하는 대신, 오디오 스펙트럼을 sub-band로 나눠 병렬 추론을 가능하게 했고, 가벼운 bridging module로 band 간 일관성도 높였다. 이 구조는 이전 state-of-the-art와 경쟁하면서도 연산량은 1% 미만, 모델 파라미터는 2% 수준만 사용한다.

학습에서는 합성 데이터에만 의존하지 않고, 실제 미디어 콘텐츠에 대해 모델이 스스로 만든 라벨을 다시 학습에 활용하는 pseudo-labeling을 사용했다. 먼저 큰 모델을 합성 데이터로 학습한 뒤 실제 데이터에서 speech signal을 추출하고, 이를 다시 합성 데이터와 섞어 재학습한다. 마지막에는 knowledge distillation으로 실시간 실행이 가능한 소형 모델로 압축해 기기 제약 안에서 구동한다.

효과도 분명하다. 분별적 청취 테스트에서 참가자의 86% 이상이 미처리 오디오보다 Dialogue Boost가 더 명확하다고 답했고, 청력 저하 사용자 대상 조사에서는 100% feature approval이 나왔다. whispered conversation, 다양한 액센트, 액션 장면, 야간 시청처럼 대사가 묻히기 쉬운 상황에서 특히 유용하다고 Amazon은 설명했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.