AI Briefing

구글, Gemini에 에이전틱 영상 이해 기능 출시… 토큰 88% 절감

·2026.09.02 09:00

핵심 내용

Google이 Gemini 모델에 동적 영상 분석 기능을 도입해 토큰 소비를 최대 88% 줄이고 정확도를 7% 높였다.

1 / 3

자세히 보기

Google DeepMind가 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 모델에 agentic video understanding 기능을 출시했다. 이 기능은 고정된 프레임 비율로 영상을 처리하던 기존 방식과 달리, 모델이 목표 세그먼트를 동적으로 검색하고 스캔하는 능동적 추론을 수행한다.

효율성 및 성능 향상

표준 벤치마크 기준, agentic video understanding 적용 시 토큰 소비량이 최대 88% 감소하고 분석 비용이 최대 66% 절감되며, 정확도는 최대 7% 향상된다. 특히 10분짜리 가이드부터 수 시간 분량의 롱폼 영상에서 정적 처리 방식의 한계를 극복하며 효율적인 분석을 제공한다.

주요 기능 및 작동 원리

Gemini의 네이티브 비디오 도구를 활용해 프레임, 오디오, 자막 등 필요한 모달리티만 선택적으로 가져온다. 이를 통해 다음과 같은 정밀한 작업이 가능해진다:

  • Sub-second moment retrieval: 1 FPS로 놓치기 쉬운 찰나의 상태 변화나 편집 지점을 정확히 포착한다.
  • Anomaly detection: 의심스러운 시간 창을 동적으로 재샘플링하여 미세한 이상 징후를 탐지한다.
  • Needle-in-a-haystack search: 수백만 토큰을 소모하지 않고도 긴 영상 내 복잡한 질문에 답변한다.

적용 및 확장

해당 기능은 Google AI Studio와 Gemini Enterprise Agent Platform의 API에서 활성화할 수 있으며, 추가 비용 없이 기존 토큰 단가로 이용 가능하다. 향후 Gemini 앱의 Flash 모델과 YouTube의 시각적 질의응답 기능에도 순차적으로 적용될 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.