AI Briefing

로컬 LLM VSCode

Gemma-4-26B-A4B-IT-Q8_0 results with VSCode (long post)

·2026.04.23 20:57

llama.cpp와 VSCode 연동으로 Gemma-4-26B-A4B-IT-Q8_0를 돌린 설정과 성능이 공개됐다.

Intel i7-9700, 32GB DDR4, Radeon AI PRO R9700 기반 Ubuntu 24.04 시스템에서 **llama.cpp server(vulkan)**로 Gemma-4-26B-A4B-it-Q8_0.gguf를 구동했다.

서버 설정은 --ctx-size 80000, --threads 7, --gpu-layers 99, --batch-size 2048, --ubatch-size 512, --cache-type-k q8_0, --cache-type-v q8_0, --cache-ram 8192 등을 사용했고, 업데이트된 chat template을 적용했다.

이 구성에서 GPU VRAM 사용률은 약 83%, CPU 사용률은 10% 미만이었고, 속도는 prompt 1600 tps, response 60 tps 수준이었다. 컨텍스트가 커지면 성능은 다소 떨어진다고 밝혔다.

VSCode 쪽은 Continue 확장 대신 johnny-zhao.oai-compatible-copilot 확장을 사용해 로컬 LLM을 Copilot 방식으로 연결했고, Agent / Plan / Ask 모드가 모두 동작한다고 전했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.