RTX 5080서 Qwen3.6 128K 30 t/s
Long-context coding on RTX 5080 16GB: Qwen3.6-35B-A3B holds 30 t/s at 128K (89 t/s fresh), no quality drop
·2026.05.01 05:19
RTX 5080 16GB에서 Qwen3.6-35B-A3B가 128K에 30 t/s, 새 토큰 89 t/s를 기록했다.
RTX 5080 16GB, Ryzen 9700X, 96GB DDR5, Windows 11 환경에서 Qwen3.6-35B-A3B를 로컬 llama.cpp로 서빙해 Claude Code용 장문 코딩 워크플로를 구성했다.
- Claude Code는 Anthropic 호환
/v1/messages엔드포인트로 연결했고, 목표는 65K~128K 컨텍스트를 안정적으로 유지하는 것이었다. - 사용 포크는
Madreag/turbo3-cuda계열의craftogrammer/llama.cpp-adaptive-turboquant였고, KV cache에 TurboQuant/TCQ를 적용했다. - CUDA 12.9.1이 필수였으며, CUDA 13.x는 깨진 출력이 나왔고 13.1은 MMQ 커널에서 세그폴트가 발생했다.
결과는 128K 컨텍스트에서 30 t/s, 새 토큰 구간에서 89 t/s였다. 작성자는 긴 컨텍스트에서도 코딩 품질 저하를 체감하지 않았다고 보고했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.