4060 Ti 괴물속도
Qwen3.5-35B running well on RTX4060 Ti 16GB at 60 tok/s
핵심 내용
RTX 4060 Ti 16GB에서 Qwen3.5-35B를 64k로 40~60 tok/s 구동한 튜닝 기록.
자세히 보기
Windows 11의 i7-13700F·64GB RAM·RTX 4060 Ti 16GB 환경에서 llama.cpp를 튜닝해 Qwen3.5-35B-A3B-UD-Q4_K_L GGUF를 64k context로 안정적으로 구동했다.
핵심 preset은 ctx-size=65536, threads=6, threads-batch=8, n-cpu-moe=11, batch-size=1024, ubatch-size=512, parallel=2, kv-unified=true, ngl=99, fa=on, ctk/ctv=q8_0다.
llama-server.exe --models-preset models.ini --models-max 1 --host 0.0.0.0 --webui-mcp-proxy --port 8080로 띄웠고, Docker Desktop이 돌아가는 상태에서도 실사용 기준 40~60 tok/s를 확보했다.
로그 예시는 56.41 tok/s, 46.84 tok/s, 44.97 tok/s, 41.21 tok/s, 42.71 tok/s 수준이다.
작성자는 단순한 최고점보다 n_parallel, kv_unified, n_ctx_seq, n_ctx_slot, n_batch, n_ubatch 같은 실제 runtime shape를 보는 것이 더 중요했고, VRAM 압박을 낮추는 쪽이 체감 성능에 더 크게 작용했다고 정리한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.