Gemma-4 조합, 200tok/s
Speculative decoding with Gemma-4-31B + Gemma-4-E2B enables 120 - 200 tok/s output speed for specific tasks
·2026.04.26 22:13
핵심 내용
RTX 5090에서 Gemma-4 조합으로 120~200 tok/s를 기록했다.
자세히 보기
RTX 5090에서 Gemma-4-31B-it Q6_K_L와 Gemma-4-E2B-it Q8_0를 speculative decoding으로 묶어 테스트한 결과, 출력 속도는 130~200 tok/s 수준으로 나왔다.
- 사용 목적은 법률 문서 인용 추출, 분류, 제목 변환 같은 비에이전트형 LLM 작업이었다.
- 입력 컨텍스트는 보통 2K~6K 토큰, 최대 8K 토큰 범위였다.
- 설정상 31.5GB VRAM을 사용해 GPU에 거의 꽉 차게 올라갔다.
- 작성자는 동일 작업에서 Gemini 2.5 Flash-lite보다 품질이 좋고 더 빠르며, 로컬에서 돌릴 수 있다고 밝혔다.
초기 소규모 테스트 기준이지만, 비영어권 언어 처리와 구조화 JSON 응답이 중요한 가벼운 워크플로에서는 클라우드 API 없이도 대체 가능성이 있다고 평가했다.
함께 제시된 실행 예시는 llama-server로 bartowski/google_gemma-4-31B-it-GGUF:Q6_K_L를 불러오는 방식이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.