AI Briefing

자원 제약 디바이스에서의 실시간 다국어 영상 자막 탐지

·2026.03.05 00:00

핵심 내용

삼성은 TV용 온디바이스 자막 spotting으로 7개 언어, 97%+ 정확도와 200ms 미만 지연을 달성했다.

1 / 2

자세히 보기

온디바이스 실시간 자막 spotting을 위해 콘텐츠 분류, 자막 추적, 텍스트 라인 탐지, 텍스트 인식, TTS로 이어지는 5단계 파이프라인을 설계했다.

입력 프레임이 자막이 있는 영화·엔터테인먼트 콘텐츠인지 먼저 걸러 비자막 화면에서의 오탐지와 불필요한 연산을 줄였고, 두 연속 프레임을 이용한 subtitle tracker로 새 자막의 등장 시점을 감지했다.

자막 위치 탐지는 SSD + MobileNetV3 backbone 기반으로 구성했으며, quantization-aware training(QAT) 을 적용해 라운딩 오차를 줄이면서도 경량화를 유지했다. 탐지된 텍스트 라인은 높이 48px 기준으로 정규화해 인식기로 넘겼다.

텍스트 인식에는 CRNN-CTC 구조를 사용하고, probabilistic language model과 token-passing algorithm을 결합해 문맥 보정을 수행했다. CNN 쪽은 MobileNetV3-small에서 마지막 5개 레이어를 제거하고 X축 sequence 길이를 8배 줄이도록 스트라이드를 조정했다.

학습 데이터는 자체 생성한 synthetic dataset으로 구성했다.

  • 콘텐츠 분류용 데이터는 타깃 콘텐츠 약 200만 프레임, 비타깃 콘텐츠 약 60만 프레임을 포함했다.
  • tracker는 연속 프레임 쌍으로 만든 이진 분류 데이터셋을 사용했다.
  • 탐지용 데이터는 자막 레이아웃 메타데이터와 참조 텍스트를 담은 JSON으로 정리했다.
  • 인식 모델은 언어별로 6개 합성 데이터셋을 만들고, 일부 영어 데이터를 다른 언어 학습에 활용했다.

평가는 TV 세트에서 언어별 독립 테스트셋으로 진행했으며, 각 테스트셋은 5분짜리 64개 영상과 8가지 자막 스타일로 구성됐다. 전체 결과는 7개 언어에서 E2E word accuracy 97%+ 수준을 달성했고, 지연 시간은 200ms 미만이었다.

이 기술은 이미 Samsung TV의 Audio Subtitles와 Live Translate 서비스에 상용화됐으며, 향후 IoT 기기와 다른 디지털 가전으로 확장 가능성을 제시한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.