Netflix의 미디어 이해를 위한 멀티모달 AI 파운데이션 모델 MediaFM
핵심 내용
Netflix는 audio·video·text를 결합한 MediaFM으로 샷 수준 콘텐츠 이해를 강화했다.
자세히 보기
Netflix는 방대한 카탈로그와 새로 유입되는 라이브 이벤트, 팟캐스트까지 미디어를 기계적으로 이해하는 능력이 점점 더 중요해지자, 자체 멀티모달 콘텐츠 임베딩 모델 MediaFM을 만들었다.
MediaFM은 Netflix 카탈로그의 일부를 사용해 사전학습한 첫 tri-modal 모델로, audio·video·text를 함께 반영해 영화나 에피소드 안의 shot 단위 표현을 학습한다. 핵심은 Transformer 기반 encoder이며, shot들 사이의 시간적 관계와 서사 구조를 함께 담아내는 데 초점을 맞췄다.
입력은 shot boundary detection으로 분할한 shot을 기준으로 구성된다. 각 shot마다 다음 세 가지 embedding을 만든다.
- Video: Netflix 내부 모델 SeqCLIP으로 프레임을 인코딩
- Audio: Meta FAIR의 wav2vec2로 오디오를 인코딩
- Timed text: OpenAI의 text-embedding-3-large로 자막, audio description, subtitle 등을 인코딩
이 세 임베딩을 이어 붙여 2304차원 fused embedding을 만들고, 최대 512 shots까지의 시간 순서 시퀀스로 Transformer에 넣는다. 여기에 title-level metadata를 [GLOBAL] 토큰으로 주입해 전체 작품 수준의 맥락도 함께 제공한다.
모델 구조는 BERT와 유사한 encoder 방식이다. 먼저 fused shot embedding을 hidden dimension으로 projection한 뒤, 맨 앞에 learnable [CLS] 토큰을 붙이고, 그 뒤에 title-level embedding을 projection해 [GLOBAL] 토큰으로 삽입한다. 이후 positional embedding과 Transformer stack을 거쳐 contextualized representation을 만들고, 마지막에 다시 2304차원 공간으로 되돌려 예측한다.
학습 목표는 Masked Shot Modeling(MSM) 이다. 각 시퀀스에서 shot의 **20%**를 랜덤하게 [MASK] embedding으로 바꾸고, 원래의 fused embedding을 복원하도록 학습한다. 손실은 예측값과 정답 embedding 사이의 cosine distance를 최소화하는 방식이다. 저자들은 hidden parameter에는 Muon, 나머지 파라미터에는 AdamW를 사용했고, Muon으로 전환한 뒤 성능이 눈에 띄게 좋아졌다고 밝혔다.
평가는 frozen representation 위에 task-specific linear layer를 얹는 linear probe 방식으로 진행했다. 특히 clip-level 태스크에서는, clip만 따로 인코딩하는 것보다 더 큰 sequence 안에서 embedding을 뽑는 방식이 더 잘 작동했다. 이는 주변 shot의 맥락이 clip 이해에 큰 영향을 준다는 뜻이다.
대표 태스크는 다음과 같다.
- Ad relevancy: 광고 배치에 적합한 clip을 고르는 multilabel 분류, Average Precision 측정
- Clip popularity ranking: CTR 기준 상대적 인기도를 예측, Kendall’s tau로 평가
- Clip tone: 100개 tone 카테고리 분류, micro Average Precision 사용
- Clip genre: 11개 장르 분류, macro Average Precision 사용
- Clip retrieval: clip-worthy 여부를 분류, Average Precision 측정
결과적으로 MediaFM은 Netflix 내부의 SeqCLIP, Google VertexAI multimodal embeddings, TwelveLabs Marengo 2.7 embeddings보다 모든 태스크에서 더 좋은 성능을 보였다. 특히 주변 문맥이 중요한 ad relevancy 같은 문제에서 향상이 더 컸고, 저자들은 멀티모달 결합 자체보다도 contextualization이 성능 개선의 핵심이라고 정리했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.