AI Briefing

영상 검색을 뒷받침하는 멀티모달 인텔리전스

·2026.04.04 09:44

핵심 내용

Netflix는 Cassandra-Kafka-Elasticsearch 파이프라인으로 실시간 멀티모달 영상 검색을 구현했다.

1 / 2

자세히 보기

영상 검색은 단순 키워드 매칭으로 풀 수 없다. 장면, 인물, 객체, 대사처럼 서로 다른 모델이 만든 신호를 하나의 시간축에 맞춰 정렬하고, 이를 실시간 질의 가능한 구조로 바꿔야 한다.

이를 위해 Netflix는 원시 모델 출력을 곧바로 검색하지 않고 3단계 파이프라인으로 분리했다. 먼저 annotation service가 Cassandra에 원본 주석을 고속으로 영속화하고, 이후 Kafka 이벤트가 오프라인 처리 작업을 트리거한다.

오프라인 fusion은 연속적인 탐지를 1초 단위 temporal bucket으로 쪼개 겹치는 구간을 결합한다. 예를 들어 캐릭터 **"Joey"**가 2~8초, 장면 **"kitchen"**이 4~9초에 검출되면, 4~5초 구간은 두 annotation이 결합된 하나의 레코드가 되고, 이 enriched record를 다시 Cassandra에 저장한다.

이 구조는 2,000시간 규모의 제작 아카이브가 2억 1,600만 프레임 이상으로 커지는 상황에서도 시간 정합성과 쓰기 성능을 유지하게 한다. 이후 같은 asset ID + time bucket을 composite key로 사용해 upsert함으로써 중복 없이 단일 source of truth를 만들고, 최종적으로 Elasticsearch에 적재해 초 단위 검색 인덱스를 구성한다.

검색 단계에서는 질의를 먼저 해석해 query type detection, filter extraction, vector transformation을 수행한다. 그다음 exact k-NN과 ANN(HNSW), cosine similarity와 Euclidean distance를 상황에 맞게 조합해, 텍스트 조건과 벡터 임베딩을 함께 반영한 프레임 단위 결과를 빠르게 반환한다.

핵심은 하나의 모델이 아니라 여러 특화 모델의 출력을 시간축, 텍스트, 벡터라는 공통 표현으로 묶는 데 있다. 그렇게 해서 탐색은 느린 수작업에서 벗어나고, 창작자는 복잡한 영상 아카이브 안에서도 원하는 순간을 거의 즉시 찾아낼 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.