AI Briefing

H100서 Gemma 4 E2B 우세

Qwen 3.6 27B vs Qwen 3.6 35B A3B vs Gemma 4 models Throughput on H100

·2026.04.26 18:06

단일 H100 80GB 벤치마크에서 Gemma 4 E2B와 Qwen 3.6 A3B FP8의 우위가 확인됐다.

단일 H100 80GB에서 vLLM 0.19.1vllm bench serve로 8개 소형·중형 모델을 비교했다. 각 실행은 100 prompts, 128 in / 128 out tokens, concurrency 1/4/8/16 조건으로 측정했고, 지표는 **throughput(tok/s)**와 **TTFT(ms)**였다.

동시성 c=16 기준 처리량은 Gemma 4 E2B-it 3180 tok/s가 가장 높았고, 이어 Gemma 4 E4B-it 2015, Qwen 3.6 35B-A3B-FP8 1243, Gemma 4 26B-A4B-it 1033, Qwen 3.6 35B-A3B 718, Qwen 3.6 27B-FP8 557, Qwen 3.6 27B 439, Gemma 4 31B-it 226 순이었다.

핵심 결론은 세 가지다.

  • 작은 expert 모델이 dense 대형 모델을 압도했다. Gemma 4 E2B는 같은 GPU에서 Gemma 31B dense보다 14배 높은 처리량과 훨씬 낮은 지연을 보였다.
  • FP8은 MoE에서 특히 효과적이었다. Qwen 35B-A3B는 FP8 적용 시 BF16 대비 +73% 처리량을 기록했고, Qwen 27B dense+27% 향상에 그쳤다.
  • 30B급 dense 모델은 단일 H100 서빙에 불리했다. Gemma 4 31B-it는 동시성 증가에 따라 TTFT가 130ms에서 4159ms까지 급증했다.

저자는 MoE 계열은 HBM 대역폭 병목이 커서 FP8이 기본 선택지가 될 수 있고, dense 27B·31B급은 배치 처리용에 가깝다고 정리했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.