Jetson에서 구동한 Gemma 4 VLA
Gemma 4 VLA Demo on Jetson Orin Nano Super
·2026.04.23 00:40
핵심 내용
Jetson Orin Nano Super에서 Gemma 4 VLA를 로컬로 구동하는 절차를 공개했다.
자세히 보기
**NVIDIA Jetson Orin Nano Super(8GB)**에서 Gemma 4를 로컬로 돌려, 웹캠을 볼지 여부까지 모델이 스스로 판단하는 VLA 데모 구성을 소개했다.
구성은 Parakeet STT → Gemma 4 → 웹캠 호출(필요 시) → Kokoro TTS 흐름이며, SPACE 키로 녹음 시작과 종료를 제어한다. 키워드 매칭이나 하드코딩 규칙 없이, 질문 문맥에 따라 모델이 직접 look_and_answer 도구를 호출하는 방식이다.
재현을 위해 다음 정보가 함께 제공된다.
- 필수 하드웨어: Jetson Orin Nano Super 8GB, Logitech C920 웹캠, USB 스피커, USB 키보드
- 로컬 실행 환경:
llama.cpp를 CUDA로 빌드하고, Gemma 4 E2B-it Q4_K_M GGUF와 mmproj 파일을 다운로드 - 메모리 여유가 부족할 경우: swap 추가, Docker/불필요한 프로세스 종료, 필요 시 Q3 양자화로 다운그레이드
- 서버 설정 예시:
--image-min-tokens 70,--image-max-tokens 70,-ngl 99,--flash-attn on,--jinja
또한 텍스트 전용으로는 Jetson AI Lab의 Docker 이미지로 더 간단히 테스트할 수 있지만, 이 경로는 vision projector를 로드하지 않아 VLA 데모 용도에는 맞지 않는다. 웹캠 포함 전체 데모는 네이티브 llama.cpp 구성을 사용해야 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.