AI Briefing

비주얼 CoT를 넘어: 능동적 비디오 추론을 위한 내재화된 시각적 사고

·2026.08.24 09:00

핵심 내용

Apple이 추론 시 시각적 사고를 내재화해 지연 시간을 5배 이상 줄이는 IVT 프레임워크를 제안했다.

자세히 보기

멀티모달 대규모 언어 모델(LLM)은 공간, 시간, 그리고 물리적 환경을 이해하기 위해 시각적 사고의 사슬(Visual CoT)을 활용한다. 하지만 중간 추론 이미지를 생성하는 방식은 추론 시 큰 계산 오버헤드를 유발하며, 이는 능동적 비디오 추론에서 특히 치명적인 문제다.

Apple 연구진은 학습 단계에서 시각적으로 사고하고, 추론 단계에서는 직접 답을 생성하는 Internalized Visual Thinking(IVT) 프레임워크를 도입했다. IVT는 라벨이 없는 비디오 데이터를 활용해 텍스트 예측과 다음 임베딩 예측을 동시에 최적화한다. 이를 통해 모델은 부분적으로 관찰된 비디오에 대해 미래 프레임의 잠재적 표현과 최종 텍스트 답변을 함께 예측하도록 학습된다.

추론 시 IVT는 미래 프레임을 합성하거나 재인코딩하지 않고 바로 답변을 생성한다. 이를 통해 Visual CoT와 동등하거나 더 나은 성능을 유지하면서, 종단 간 지연 시간을 5배 이상 단축했다. 연구 결과는 명시적인 픽셀 공간 생성이 능동적 비디오 추론에 필수적이지 않으며, 예측적 세계 모델링을 학습 시 내재화하면 정확도와 효율성을 모두 갖춘 멀티모달 추론기가 될 수 있음을 시사한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.