Gemma-4 조합, 200tok/s
Speculative decoding with Gemma-4-31B + Gemma-4-E2B enables 120 - 200 tok/s output speed for specific tasks
·2026.04.26 22:13
RTX 5090에서 Gemma-4 조합으로 120~200 tok/s를 기록했다.
RTX 5090에서 Gemma-4-31B-it Q6_K_L와 Gemma-4-E2B-it Q8_0를 speculative decoding으로 묶어 테스트한 결과, 출력 속도는 130~200 tok/s 수준으로 나왔다.
- 사용 목적은 법률 문서 인용 추출, 분류, 제목 변환 같은 비에이전트형 LLM 작업이었다.
- 입력 컨텍스트는 보통 2K~6K 토큰, 최대 8K 토큰 범위였다.
- 설정상 31.5GB VRAM을 사용해 GPU에 거의 꽉 차게 올라갔다.
- 작성자는 동일 작업에서 Gemini 2.5 Flash-lite보다 품질이 좋고 더 빠르며, 로컬에서 돌릴 수 있다고 밝혔다.
초기 소규모 테스트 기준이지만, 비영어권 언어 처리와 구조화 JSON 응답이 중요한 가벼운 워크플로에서는 클라우드 API 없이도 대체 가능성이 있다고 평가했다.
함께 제시된 실행 예시는 llama-server로 bartowski/google_gemma-4-31B-it-GGUF:Q6_K_L를 불러오는 방식이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.