AI Briefing

MoE가 뒤집었다

Qwen 3.6-35B-A3B on dual 5060 Ti with --cpu-moe: 21.7 tok/s at 90K context, with benchmarks vs dense 3.5 and Coder variant

·2026.04.18 02:43

핵심 내용

듀얼 RTX 5060 Ti에서 Qwen 3.6-35B-A3B가 90K 컨텍스트 21.7 tok/s를 기록했다.

자세히 보기

듀얼 RTX 5060 Ti(총 32GB VRAM)와 64GB 시스템 RAM 환경에서 --cpu-moe 하이브리드 오프로딩을 시험했다.

동일한 벤치 하네스로 세 구성을 연속 비교했고, MoE는 ghcr.io/ggml-org/llama.cpp:server-cuda13, dense는 TurboQuant 빌드를 사용했다. 설정은 10회 시퀀셜 실행, 4 concurrent workers 스트레스 테스트, 128/256 max tokens, 2 warmup, 5분 측정이었다.

  • Qwen 3.5-27B dense: 생성 18.3 tok/s, P50 7,196 ms, 스트레스 10.4 tok/s, 52 req/5min
  • Qwen 3-Coder-30B-A3B: 생성 31.1 tok/s, P50 2,286 ms, 스트레스 12.0 tok/s, 113 req/5min
  • Qwen 3.6-35B-A3B: 생성 21.7 tok/s, P50 6,160 ms, 스트레스 6.8 tok/s, 38 req/5min

핵심은 --cpu-moe가 dense 3.5보다 훨씬 효율적이지만, Qwen 3.6은 총 파라미터가 더 커서 Coder variant보다 느렸다는 점이다. 반면 품질 지표는 더 강했다. 작성자는 SWE-bench Verified 73.4% vs 50.3%, Terminal-Bench 2.0 +11점을 근거로, 에이전트형·다단계 작업에는 3.6, 빠른 코드 완성에는 Coder를 추천했다.

추가로 프롬프트 처리 속도는 dense가 160 tok/s로 가장 빨랐고, hybrid runs는 30-95 tok/s 수준이라 장문 RAG나 대량 프롬프트 적재에는 dense 쪽이 유리하다는 결론이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.