AI Briefing

LVSum: 타임스탬프 인지형 긴 영상 요약을 위한 벤치마크

·2026.07.20 09:00

긴 영상의 시간적 정확도를 평가하기 위해 인간이 주석을 단 LVSum 벤치마크가 공개되었다.

멀티모달 거대 언어 모델(MLLM)이 긴 영상을 요약할 때 시간적 충실도를 유지하고 의미적·시간적 근거를 갖춘 요약을 생성하는 것은 매우 어려운 과제입니다.

이를 해결하기 위해 LVSum이 도입되었습니다. LVSum은 13개 분야, 평균 16분 길이의 다양한 영상 72개를 포함하며, 각 영상에는 시간적 참조 정보가 포함된 인간 작성 요약본이 최대 10개씩 포함되어 있습니다.

주요 실험 결과는 다음과 같습니다:

  • 텍스트의 중요성: 시각적 프레임보다 **Transcript(전사 데이터)**가 요약 품질 향상에 훨씬 더 크게 기여함
  • 성능 격차: 모델이 생성한 요약과 인간이 작성한 요약 사이에 여전히 상당한 성능 차이가 존재함
  • MLLM의 한계: 현재의 MLLM은 Temporal Grounding(시간적 근거 제시), 지시 이행, 그리고 교차 모달 일관성 측면에서 체계적인 약점을 보임

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.