AI Briefing

H100 Qwen·Gemma 성능 비교

Throughput and TTFT comparisons of Qwen 3.6 27B, Qwen 3.6 35B A3B and Gemma 4 models on H100

·2026.04.25 19:00

H100 단일 GPU 벤치에서 Gemma 4 E2B-it이 처리량과 TTFT 모두 가장 좋았다.

H100 80GB 한 장과 vLLM 0.19.1, vllm bench serve8개 모델을 비교했다.

  • 조건: 100 prompts, 입력 128토큰 / 출력 128토큰
  • 동시성: 1, 4, 8, 16 요청
  • 지표: **throughput(TPS)**와 TTFT(time to first token)

결과에서 Gemma 4 E2B-it이 가장 강했다. 동시 요청 16개에서 3,180 TPS를 기록했고, Gemma 4 31B dense226 TPS에 그쳤다. TTFT도 55ms4.1초로 크게 벌어졌다.

FP8 양자화 효과도 뚜렷했다.

  • Qwen 3.6 35B MoE FP8은 BF16 대비 73% 빨라졌다.
  • 같은 방식의 dense Qwen 27B27% 개선에 그쳤다.
  • MoE 모델은 전문가 가중치 이동이 병목이라 FP8이 메모리 절감뿐 아니라 실제 속도 향상에도 유리하다는 해석이다.

또한 Gemma 4 31B dense는 낮은 동시성에서는 쓸 만하지만, 4명 이상에서 지연이 급격히 악화됐다. 단일 H100에서 30B급 모델을 서비스하려면 dense보다 MoE가 더 적합하다는 결론이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.