AI Briefing

RTX 5080서 Qwen3.6 128K 30 t/s

Long-context coding on RTX 5080 16GB: Qwen3.6-35B-A3B holds 30 t/s at 128K (89 t/s fresh), no quality drop

·2026.05.01 05:19

핵심 내용

RTX 5080 16GB에서 Qwen3.6-35B-A3B가 128K에 30 t/s, 새 토큰 89 t/s를 기록했다.

자세히 보기

RTX 5080 16GB, Ryzen 9700X, 96GB DDR5, Windows 11 환경에서 Qwen3.6-35B-A3B를 로컬 llama.cpp로 서빙해 Claude Code용 장문 코딩 워크플로를 구성했다.

  • Claude Code는 Anthropic 호환 /v1/messages 엔드포인트로 연결했고, 목표는 65K~128K 컨텍스트를 안정적으로 유지하는 것이었다.
  • 사용 포크는 Madreag/turbo3-cuda 계열의 craftogrammer/llama.cpp-adaptive-turboquant였고, KV cache에 TurboQuant/TCQ를 적용했다.
  • CUDA 12.9.1이 필수였으며, CUDA 13.x는 깨진 출력이 나왔고 13.1은 MMQ 커널에서 세그폴트가 발생했다.

결과는 128K 컨텍스트에서 30 t/s, 새 토큰 구간에서 89 t/s였다. 작성자는 긴 컨텍스트에서도 코딩 품질 저하를 체감하지 않았다고 보고했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.