1인칭 시점 비디오 이해 모델의 시간적 인지 능력 향상을 위한 유인책 연구
·2026.07.09 09:00
핵심 내용
MLLM의 1인칭 시점 비디오 이해력을 높이기 위해 시간적 추론을 강화하는 TGPO 알고리즘을 제안한다.
자세히 보기
최근 **Multimodal Large Language Models (MLLMs)**는 시각적 이해 분야에서 뛰어난 성능을 보여주고 있으나, 사건의 순서와 변화를 파악해야 하는 1인칭 시점(Egocentric) 환경에서는 시간적 인지 능력이 부족하다는 한계가 있다.
이러한 문제는 기존 학습 목표가 시간적 추론을 명시적으로 보상하기보다 프레임 단위의 공간적 지름길(Spatial shortcuts)에 의존하기 때문에 발생한다. 이를 해결하기 위해 본 연구에서는 **Temporal Global Policy Optimization (TGPO)**를 제안한다.
TGPO는 다음과 같은 특징을 가진다.
- RLVR (Reinforcement Learning with Verifiable Rewards) 알고리즘 기반
- 모델이 시간적 추론을 수행하도록 명시적인 보상을 제공
- 1인칭 비디오의 복잡한 사건 흐름을 정확히 파악하도록 유도
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.