Amazon, AI로 TV·영화 대사를 또렷하게 하는 Dialogue Boost 공개
핵심 내용
Amazon이 TV·영화 대사를 키우고 배경음을 낮추는 on-device AI를 공개했다.
자세히 보기
Amazon은 Echo smart speakers와 Fire TV 기기에 탑재되는 Dialogue Boost를 공개했다. 이 기능은 영화·드라마·팟캐스트의 대사를 선명하게 만들고, 배경 음악과 효과음을 적응적으로 억제한다. 특히 전 세계 인구의 약 **20%**로 언급한 청력 저하 사용자에게 유용하다.
처음에는 Prime Video에서 2022년에 제공됐지만, 이번 버전은 deep-neural-network compression을 활용해 기기 안에서 직접 실행된다. 덕분에 Netflix, YouTube, Disney+ 같은 모든 미디어에 적용할 수 있다.
대사 향상은 여러 단계의 sound source separation으로 이뤄진다.
- 입력 오디오는 먼저 시간-주파수 표현으로 변환돼 각 주파수 대역의 에너지를 시간축에 따라 분석한다.
- 이후 수천 시간 분량의 발화 조건으로 학습한 neural network가 실시간으로 음성과 다른 소리를 구분한다.
- 최종적으로는 대사 중심 채널 식별, 소스 분리, 음성 명료도에 중요한 주파수 대역 강조, 원본 오디오와의 리믹스를 결합한 intelligent mixing이 적용된다.
핵심은 sub-band processing과 pseudo-labeling이다. 기존처럼 전체 주파수를 한 번에 처리하는 대신, 오디오 스펙트럼을 sub-band로 나눠 병렬 추론을 가능하게 했고, 가벼운 bridging module로 band 간 일관성도 높였다. 이 구조는 이전 state-of-the-art와 경쟁하면서도 연산량은 1% 미만, 모델 파라미터는 2% 수준만 사용한다.
학습에서는 합성 데이터에만 의존하지 않고, 실제 미디어 콘텐츠에 대해 모델이 스스로 만든 라벨을 다시 학습에 활용하는 pseudo-labeling을 사용했다. 먼저 큰 모델을 합성 데이터로 학습한 뒤 실제 데이터에서 speech signal을 추출하고, 이를 다시 합성 데이터와 섞어 재학습한다. 마지막에는 knowledge distillation으로 실시간 실행이 가능한 소형 모델로 압축해 기기 제약 안에서 구동한다.
효과도 분명하다. 분별적 청취 테스트에서 참가자의 86% 이상이 미처리 오디오보다 Dialogue Boost가 더 명확하다고 답했고, 청력 저하 사용자 대상 조사에서는 100% feature approval이 나왔다. whispered conversation, 다양한 액센트, 액션 장면, 야간 시청처럼 대사가 묻히기 쉬운 상황에서 특히 유용하다고 Amazon은 설명했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.