비디오 LMM 벤치마크 'TimeScope' 공개
TimeScope: How Long Can Your Video Large Multimodal Model Go?
·2025.07.23 09:00
핵심 내용
긴 영상의 시간적 이해도를 측정하기 위한 오픈소스 벤치마크 TimeScope가 공개되었다.
자세히 보기
최근 비디오 대규모 멀티모달 모델(LMM)들이 긴 컨텍스트를 처리할 수 있다고 주장하지만, 실제로는 단순한 시각적 검색(Visual Search) 수준에 머무는 경우가 많다.
TimeScope는 1분에서 8시간에 이르는 긴 영상 속에 5~10초 분량의 짧은 **비디오 클립(Needle)**을 삽입하여 모델의 실질적인 시간적 이해 능력을 평가하는 오픈소스 벤치마크다.
주요 평가 항목은 다음 세 가지 핵심 역량에 집중한다:
- Localized Retrieval: 방대한 영상 내 특정 구간을 찾아내고 질문에 답하는 능력
- Information Synthesis: 타임라인 전반의 여러 세부 정보를 수집하고 정리하는 능력
- Fine-Grained Temporal Perception: 밀도 높은 프레임 샘플링이 필요한 동작 및 사건을 정밀하게 분석하는 능력
이 벤치마크는 모델이 단순히 프레임을 훑는 것을 넘어, 영상의 흐름과 사건의 인과관계를 진정으로 이해하는지 검증하는 데 목적이 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.