AI Briefing

Qwen3.6 35B 속도 테스트

how fast can qwen3.6 35b get

·2026.04.28 11:32

핵심 내용

단일 H100에서 Qwen3.6 35B가 250~400tok/s를 기록했다.

자세히 보기

단일 H100에 SGLang을 올려 Qwen3.6 35B FP8를 서빙하고, OpenAI 호환 API와 Claude Code용 Anthropic 호환 라우팅을 붙였다.

성능은 여러 설정 스윕으로 끌어올렸다.

  • decode 설정, cache 설정, speculative decoding 변형, backend 조합을 비교했다.
  • 가장 효과가 컸던 조합은 dflash speculative decoding과 matched draft model이었다.
  • FP8 weights와 FP8 KV cache로 메모리 압박을 낮췄다.
  • prefix caching, faster attention, MoE backend도 H100에서 의미 있는 차이를 만들었다.
  • prefill과 decode는 서로 다른 튜닝이 필요했다.

최고 성능은 일반 문장 생성에서 250+ tok/s, 코드 스타일 생성에서 400+ tok/s였다. 작성자는 아직 더 깊은 speculative decoding 탐색과 커널 최적화 여지가 있지만, 현재 버전은 여기서 멈춘다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.