96GB면 122B 간다
96GB Vram. What to run in 2026?
·2026.04.10 14:07
핵심 내용
96GB VRAM에선 Qwen 3.5 122B와 27B 사이가 실전 선택지로 정리됐다.
자세히 보기
96GB VRAM 환경에선 Qwen 3.5 122B가 현실적인 상한선으로 거론됐다. AWQ / GPTQ / NVFP4로 올리면 200K+ 컨텍스트에서도 vLLM에서 110+ tps가 가능하다는 경험담이 나왔다.
반대로 Qwen 27B는 일부 작업에서 122B MoE에 근접하지만, 체감상 속도는 더 느리다는 의견이 있었다. 96GB는 대형 모델을 아주 넉넉하게 돌리기엔 부족하고, 중형 모델엔 과한 애매한 구간이라는 문제의식도 공유됐다.
실사용 예시로는:
- Qwen3.5-122B-A10B를 vLLM에서 tensor parallel 4로 구동
max-num-seqs 2,max-num-batched-tokens 4096,attention-backend flashinfer같은 설정으로 효율을 끌어올림Intel/...AutoRound보다 AWQ가 TP=4 지원과 품질 측면에서 낫다는 평가
또 다른 응답에선 96GB면 high KV cache 기준으로 120B+까지 가능하다고 정리됐다. 이미지 생성 쪽에선 HunyuanImage-3도 96GB급 장비에서 무난하게 돌아간다는 경험이 언급됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.