AI Briefing

Fast Gemma의 검증된 추론 최적화 레시피 (7분 읽기)

·2026.08.04 09:00

VIDRAFT 팀이 A10G에서 품질을 유지하며 Gemma 추론 속도를 510.58 TPS까지 끌어올렸다.

VIDRAFT 팀은 Fast Gemma Challenge에서 단일 NVIDIA A10Ggoogle/gemma-4-E4B-it의 추론 속도를 최적화했다. 최종 검증 결과는 510.58 TPS, PPL 2.3930으로, 품질 기준을 통과한 결과 중 가장 빠른 수준을 기록했다.

원시 TPS만 보면 535.91을 기록한 실행도 있었지만 PPL이 2.44 이상으로 품질 기준을 넘지 못해 검증되지 않았다. VIDRAFT 팀은 속도보다 품질을 유지한 검증 결과에 초점을 맞췄다고 설명했다.

공개된 manifest.json은 전체 재현 환경을 담고 있다. 핵심 설정은 다음과 같다.

  • vLLM 0.22.1rc1.dev307, Transformers 5.9.0 사용
  • sliding_window=188과 FlashAttention sliding-window 패치 적용
  • CENTROID_TOP_K=49 설정
  • MTP 방식의 speculative decoding과 7개 speculative token 사용
  • LM head pruning 및 int4 keep-set 적용
  • 64개 프롬프트와 1개 토큰을 사용하는 synthetic warmup bridge
  • CUDA graph, fused sparse argmax, Split-KV verification 활성화
  • end-only detokenization과 fast rendering 적용

실행에는 serve.py와 관련 패치 파일, warmup bridge, drafter 및 가중치 버킷이 필요하다. GPU 메모리 사용률은 0.90, 최대 배치 토큰은 512, 최대 시퀀스 수는 1로 설정했으며, 생성 결과의 일관성을 위해 temperature 0, top-p 1, top-k 0을 사용했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.