AI Briefing

Gemma 4 31B 최적화 추론 엔진 'Gewell' 공개

Gewell - Gemma4 inference engine

·2026.09.21 18:56

핵심 내용

Gemma 4 31B 모델의 손실 없는 KV 캐시 절감 기법을 적용한 추론 엔진 'Gewell'이 공개되어 Blackwell GPU 환경에서 VRAM 효율과 처리량을 개선했다.

자세히 보기

Gemma 4 31B 모델의 아키텍처 특성을 극대화한 추론 엔진 Gewell이 공개되었습니다. 기존 vLLM이나 llama.cpp가 활용하지 못했던 Gemma의 손실 없는(lossless) KV cache 절감 기능을 구현하여, Blackwell GPU 및 대규모 동시성 워크로드에 최적화되었습니다.

핵심 기술: KV 캐시 VRAM 절감

Gemma는 Global attention layer에서 K와 V 가중치를 tie하고 RoPE가 K의 25%만 회전시키는 구조를 가집니다. Gewell은 이 특성을 이용해 전체 K와 V를 저장하는 대신 V와 K의 25%만 저장함으로써 VRAM 사용량을 0.625배로 줄입니다. 이는 수학적 손실 없이 메모리 효율을 높이는 방식이며, Blackwell의 높은 연산량과 낮은 VRAM 대역폭 특성상 메모리 읽기 감소 효과가 계산 부하 증가를 압도합니다.

캐시 관리 및 성능 특성

vLLM의 LRU 정책은 반복 프롬프트가 있는 워크로드에서 비효율적이지만, Gewell은 명시적 cache hints와 스마트한 eviction 정책을 지원합니다. 예를 들어, Writer-Critic 루프처럼 히스토리를 공유하는 워크로드에서 불필요한 evict를 방지하고 채팅 세션을 warm 상태로 유지합니다. 설계된 워크로드(동시에 활성화되지 않는 성장하는 다수 프롬프트)에서는 vLLM보다 전반적인 처리량(t/s)이 더 높으나, 대규모 배치의 TTFT(Time To First Token)는 약간 느릴 수 있습니다.

양자화 및 제한사항

자체적인 mixed precision quant format을 사용하며, 기본 설정(G0)은 약 6bpw를 사용합니다. Attention과 Global-attention-adjacent MLP에 대부분의 비트를 할당하여 품질을 유지합니다. 현재 sampler 지원이 rudimentary(temp, top-k, top-p)하고 chat template override가 불가한 등 인터페이스 측면의 제한이 있으며, Windows 및 RTX 5090 환경은 검증되지 않았습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.