AI Briefing

Qwen3.6-27B 80 tps

Qwen3.6-27B at ~80 tps with 218k context window on 1x RTX 5090 served by vllm 0.19

·2026.04.25 19:21

핵심 내용

RTX 5090 1장과 vLLM 0.19.1rc1로 Qwen3.6-27B를 218k 컨텍스트에서 초당 약 80토큰으로 돌렸다고 밝혔다.

자세히 보기

Qwen3.6-27B를 RTX 5090 1장에서 vLLM 0.19.1rc1로 서빙해 약 80 tps를 기록했다.

  • 컨텍스트 윈도우: 218k
  • 모델/가중치: Qwen3.6-27B Text NVFP4 MTP 버전
  • 서빙 스택: 최신 vLLM 0.19 빌드
  • 재현성 포인트: 이전에 올린 Qwen3.5-27B 설정과 같은 레시피를 그대로 적용했다고 설명했다.

HF에 올라온 NVFP4 MTP 체크포인트와, 이전 Qwen3.5-27B 테스트 글을 함께 링크해 같은 방식으로 성능을 재현할 수 있음을 시사했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.