NVIDIA, VSS 3.3으로 영상 AI 개발·운영 비용 절감 기술 공개
NVIDIA VSS 3.3: 영상 AI 에이전트를 프롬프트로 조립하고, 변하지 않은 화면의 VLM 토큰은 줄이기 (feat. Adaptive EVS)
핵심 내용
Adaptive EVS로 VLM 입력 토큰 80% 감소 및 동시 스트림 처리량 46% 향상
자세히 보기
NVIDIA가 영상 검색 및 요약 참조 아키텍처인 VSS(NVIDIA Metropolis Blueprint for Video Search and Summarization)의 3.3 버전을 공개하며, 개발 효율성과 운영 비용을 대폭 줄이는 두 가지 핵심 기능을 소개했다.
Build Vision Agent 스킬
개발자가 코딩 에이전트(Claude Code, Codex 등)를 통해 검증된 프로필 기반의 Docker Compose 배포를 자동으로 생성할 수 있게 한다. 요청에 따라 필요한 서비스만 추가하거나 통합하여 중복을 제거하고, 아키텍처 다이어그램 검토 후 배포 계획을 수립한다. NVIDIA 측 측정 결과, RTX PRO 6000 Blackwell GPU 2장 환경에서 녹화 기반 빌드가 30분 미만으로 완료되었다.
Adaptive EVS (Adaptive Efficient Video Sampling)
영상 프레임 중 변화가 없는 영역의 토큰을 동적으로 제거하여 VLM 처리 비용을 절감하는 기술이다. 패치별 코사인 유사도를 활용해 직전 프레임과 비교하며, 이벤트 인식 배치를 통해 남은 토큰 비율에 따라 클립을 묶거나 버린다.
주요 성능 지표 (RTX PRO 6000 Blackwell, Cosmos 3 Super Reasoner FP8 기준):
- VLM 입력 토큰 감소: 60분 영상 요약 시 입력 토큰 80% 감소, 처리 시간 약 절반으로 단축
- 동시 처리량 증가: 실시간 VLM 스트림 수 13개에서 19개로 46% 증가
- 지연 시간 개선: 경보 맥락화 지연 1,021ms에서 844ms로 17% 감소
적용 및 주의사항:
- 상세 캡션, 긴 영상 요약, 경보 검증 등 입력 프레임이 많고 출력이 짧은 작업에 효과적이다.
- 현재 Qwen3-VL 구조 기반의 로컬 vLLM 호환 모델만 지원하며, 원격 엔드포인트나 Omni 모델은 지원되지 않는다.
- 기능은 기본 비활성화 상태이며, 설정 변경 시 RT-VLM 재시작이 필요하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.