AI Briefing

Qwen3.6-27B 80 tps

Qwen3.6-27B at ~80 tps with 218k context window on 1x RTX 5090 served by vllm 0.19

·2026.04.25 19:21

RTX 5090 1장과 vLLM 0.19.1rc1로 Qwen3.6-27B를 218k 컨텍스트에서 초당 약 80토큰으로 돌렸다고 밝혔다.

Qwen3.6-27BRTX 5090 1장에서 vLLM 0.19.1rc1로 서빙해 약 80 tps를 기록했다.

  • 컨텍스트 윈도우: 218k
  • 모델/가중치: Qwen3.6-27B Text NVFP4 MTP 버전
  • 서빙 스택: 최신 vLLM 0.19 빌드
  • 재현성 포인트: 이전에 올린 Qwen3.5-27B 설정과 같은 레시피를 그대로 적용했다고 설명했다.

HF에 올라온 NVFP4 MTP 체크포인트와, 이전 Qwen3.5-27B 테스트 글을 함께 링크해 같은 방식으로 성능을 재현할 수 있음을 시사했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.