AI Briefing

4060 Ti 괴물속도

Qwen3.5-35B running well on RTX4060 Ti 16GB at 60 tok/s

·2026.04.16 07:58

핵심 내용

RTX 4060 Ti 16GB에서 Qwen3.5-35B를 64k로 40~60 tok/s 구동한 튜닝 기록.

자세히 보기

Windows 11의 i7-13700F·64GB RAM·RTX 4060 Ti 16GB 환경에서 llama.cpp를 튜닝해 Qwen3.5-35B-A3B-UD-Q4_K_L GGUF를 64k context로 안정적으로 구동했다.

핵심 preset은 ctx-size=65536, threads=6, threads-batch=8, n-cpu-moe=11, batch-size=1024, ubatch-size=512, parallel=2, kv-unified=true, ngl=99, fa=on, ctk/ctv=q8_0다.

llama-server.exe --models-preset models.ini --models-max 1 --host 0.0.0.0 --webui-mcp-proxy --port 8080로 띄웠고, Docker Desktop이 돌아가는 상태에서도 실사용 기준 40~60 tok/s를 확보했다.

로그 예시는 56.41 tok/s, 46.84 tok/s, 44.97 tok/s, 41.21 tok/s, 42.71 tok/s 수준이다.

작성자는 단순한 최고점보다 n_parallel, kv_unified, n_ctx_seq, n_ctx_slot, n_batch, n_ubatch 같은 실제 runtime shape를 보는 것이 더 중요했고, VRAM 압박을 낮추는 쪽이 체감 성능에 더 크게 작용했다고 정리한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.