AI Briefing

인프런, 영상 화면 속 글자까지 번역하는 '영상 화면 번역' 기능 개발

·2026.09.10 10:36

핵심 내용

인프런이 영상 화면의 텍스트를 인식해 번역 텍스트를 겹쳐 보여주는 '영상 화면 번역' 기능을 개발 중이다.

1 / 8

자세히 보기

인프런이 영상 재생 시 화면 속 글자를 인식하고 번역 텍스트를 겹쳐 보여주는 '영상 화면 번역' 기능을 개발하고 있다. 이 기능은 DeNA × AI Day 2026 등 일부 강의에 실험적으로 적용되었으며, 원본 영상 위에 배경색 박스와 번역문을 그리는 오버레이 방식을 채택했다.

기술 구현 방식

기존 인코딩 방식과 달리, 원문 글자 영역을 배경색 박스로 가린 뒤 그 위에 번역 텍스트를 렌더링하는 3레이어 구조를 사용한다. 이 방식은 언어 추가가 용이하고 번역 데이터 수정만으로 품질 개선이 가능하며, 네트워크 전송 부담이 적다는 장점이 있다. 데이터는 JSON 형식으로 저장되며, 화면 구성 유지 시간(events)과 텍스트 위치(bbox), 색상 정보(texts)를 포함한다.

텍스트 추출 및 전처리

기본 파이프라인은 OCR(텍스트 인식) 후 번역 및 위치 오버레이로 구성된다. UI 버튼이나 코드 등 불필요한 텍스트를 제외하고 문단 단위로 묶어 번역의 자연스러움을 높이기 위해 VLM(Vision Language Model)을 활용한다. 기존 문서 레이아웃 분석 모델이 영상에 부적합한 문제를 해결하기 위해, 1984년의 XY Cut 알고리즘으로 화면을 블록 단위로 분할한 후 VLM이 문단 묶음 여부를 판단한다.

프레임 처리 최적화

1시간 영상 기준 약 3,600프레임의 처리 부담과 오버레이 깜빡임 문제를 해결하기 위해 재사용 전략을 도입했다. 직전 프레임과 픽셀이 거의 동일하거나, 텍스트 유사도(≥0.85) 및 IoU(≥0.5) 기준을 충족하면 이전 결과를 재사용한다. 또한 숫자나 기호만 있는 박스는 모델 호출 없이 제외하고, VLM은 화면 변화 시에만 호출하여 안정성을 확보한다.

색상 추출 및 번역 단계

배경색과 글자색은 박스 내부 픽셀을 샘플링해 RGB 공간에서 k-means(k=2) 클러스터링을 수행하여 추정한다. 픽셀 수가 많은 그룹을 배경색, 적은 그룹을 글자색으로 분류한다. 번역 단계에서는 중복을 제거한 원문 텍스트를 LLM에 일괄 요청하며, 영상 제목 등 주변 텍스트를 프롬프트에 포함해 용어 불일치를 방지한다. 다만, 사진이나 그라데이션 배경 위 텍스트 처리에는 한계가 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.