AI Briefing

3090서 Qwen3.6 218K 확장

Follow-up: Qwen3.6-27B on 1× RTX 3090 — pushing to ~218K context + ~50–66 TPS, tool calls now stable (PN12 fix)

·2026.05.01 05:20

RTX 3090 한 장에서 Qwen3.6-27B의 218K context와 도구 호출 안정성을 확보했다.

단일 RTX 3090에서 Qwen3.6-27B를 더 밀어 올려 약 218K context50~66 TPS를 기록했다.

비전 입력에서도 약 198K context + 51~68 TPS가 나왔고, 25K 토큰 규모의 tool output도 OOM 없이 완료됐다.

이전에는 긴 tool output이 계속 크래시했는데, 원인은 Genesis patch의 PN12가 vLLM dev205+에서 실제 코드 경로에 적용되지 않던 문제였다. apply_all은 성공으로 표시됐지만, anchor drift 때문에 패치가 바뀌지 않았고, 이를 수정한 뒤 tool-prefill OOM이 사라졌다.

목표는 최대 TPS나 최대 context 중 하나가 아니라, 단일 3090에서 다음을 함께 만족시키는 것이다.

  • 200K+ context
  • 실사용 가능한 throughput
  • 안정적인 tool-agent 작업

제약도 남아 있다. 단일 GPU의 single-prompt 워크로드에는 약 50~60K 부근의 또 다른 메모리 클리프가 있으며, 이는 2×3090 tensor parallelism에서는 적용되지 않는다. 결과는 양자화와 설정에 크게 좌우된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.