AI Briefing

1인칭 시점 비디오 이해 모델의 시간적 인지 능력 향상을 위한 유인책 연구

·2026.07.09 09:00

MLLM의 1인칭 시점 비디오 이해력을 높이기 위해 시간적 추론을 강화하는 TGPO 알고리즘을 제안한다.

최근 **Multimodal Large Language Models (MLLMs)**는 시각적 이해 분야에서 뛰어난 성능을 보여주고 있으나, 사건의 순서와 변화를 파악해야 하는 1인칭 시점(Egocentric) 환경에서는 시간적 인지 능력이 부족하다는 한계가 있다.

이러한 문제는 기존 학습 목표가 시간적 추론을 명시적으로 보상하기보다 프레임 단위의 공간적 지름길(Spatial shortcuts)에 의존하기 때문에 발생한다. 이를 해결하기 위해 본 연구에서는 **Temporal Global Policy Optimization (TGPO)**를 제안한다.

TGPO는 다음과 같은 특징을 가진다.

  • RLVR (Reinforcement Learning with Verifiable Rewards) 알고리즘 기반
  • 모델이 시간적 추론을 수행하도록 명시적인 보상을 제공
  • 1인칭 비디오의 복잡한 사건 흐름을 정확히 파악하도록 유도

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.