AI Briefing

96GB면 122B 간다

96GB Vram. What to run in 2026?

·2026.04.10 14:07

핵심 내용

96GB VRAM에선 Qwen 3.5 122B와 27B 사이가 실전 선택지로 정리됐다.

자세히 보기

96GB VRAM 환경에선 Qwen 3.5 122B가 현실적인 상한선으로 거론됐다. AWQ / GPTQ / NVFP4로 올리면 200K+ 컨텍스트에서도 vLLM에서 110+ tps가 가능하다는 경험담이 나왔다.

반대로 Qwen 27B는 일부 작업에서 122B MoE에 근접하지만, 체감상 속도는 더 느리다는 의견이 있었다. 96GB는 대형 모델을 아주 넉넉하게 돌리기엔 부족하고, 중형 모델엔 과한 애매한 구간이라는 문제의식도 공유됐다.

실사용 예시로는:

  • Qwen3.5-122B-A10B를 vLLM에서 tensor parallel 4로 구동
  • max-num-seqs 2, max-num-batched-tokens 4096, attention-backend flashinfer 같은 설정으로 효율을 끌어올림
  • Intel/...AutoRound보다 AWQ가 TP=4 지원과 품질 측면에서 낫다는 평가

또 다른 응답에선 96GB면 high KV cache 기준으로 120B+까지 가능하다고 정리됐다. 이미지 생성 쪽에선 HunyuanImage-3도 96GB급 장비에서 무난하게 돌아간다는 경험이 언급됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.