AI Briefing

비디오 LMM 벤치마크 'TimeScope' 공개

TimeScope: How Long Can Your Video Large Multimodal Model Go?

·2025.07.23 09:00

핵심 내용

긴 영상의 시간적 이해도를 측정하기 위한 오픈소스 벤치마크 TimeScope가 공개되었다.

자세히 보기

최근 비디오 대규모 멀티모달 모델(LMM)들이 긴 컨텍스트를 처리할 수 있다고 주장하지만, 실제로는 단순한 시각적 검색(Visual Search) 수준에 머무는 경우가 많다.

TimeScope는 1분에서 8시간에 이르는 긴 영상 속에 5~10초 분량의 짧은 **비디오 클립(Needle)**을 삽입하여 모델의 실질적인 시간적 이해 능력을 평가하는 오픈소스 벤치마크다.

주요 평가 항목은 다음 세 가지 핵심 역량에 집중한다:

  • Localized Retrieval: 방대한 영상 내 특정 구간을 찾아내고 질문에 답하는 능력
  • Information Synthesis: 타임라인 전반의 여러 세부 정보를 수집하고 정리하는 능력
  • Fine-Grained Temporal Perception: 밀도 높은 프레임 샘플링이 필요한 동작 및 사건을 정밀하게 분석하는 능력

이 벤치마크는 모델이 단순히 프레임을 훑는 것을 넘어, 영상의 흐름과 사건의 인과관계를 진정으로 이해하는지 검증하는 데 목적이 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.