3090서 Qwen3.6 218K 확장
Follow-up: Qwen3.6-27B on 1× RTX 3090 — pushing to ~218K context + ~50–66 TPS, tool calls now stable (PN12 fix)
핵심 내용
RTX 3090 한 장에서 Qwen3.6-27B의 218K context와 도구 호출 안정성을 확보했다.
자세히 보기
단일 RTX 3090에서 Qwen3.6-27B를 더 밀어 올려 약 218K context와 50~66 TPS를 기록했다.
비전 입력에서도 약 198K context + 51~68 TPS가 나왔고, 25K 토큰 규모의 tool output도 OOM 없이 완료됐다.
이전에는 긴 tool output이 계속 크래시했는데, 원인은 Genesis patch의 PN12가 vLLM dev205+에서 실제 코드 경로에 적용되지 않던 문제였다. apply_all은 성공으로 표시됐지만, anchor drift 때문에 패치가 바뀌지 않았고, 이를 수정한 뒤 tool-prefill OOM이 사라졌다.
목표는 최대 TPS나 최대 context 중 하나가 아니라, 단일 3090에서 다음을 함께 만족시키는 것이다.
- 200K+ context
- 실사용 가능한 throughput
- 안정적인 tool-agent 작업
제약도 남아 있다. 단일 GPU의 single-prompt 워크로드에는 약 50~60K 부근의 또 다른 메모리 클리프가 있으며, 이는 2×3090 tensor parallelism에서는 적용되지 않는다. 결과는 양자화와 설정에 크게 좌우된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.