AI Briefing

MoE 54% 역전

RTX 5070 Ti + 9800X3D running Qwen3.6-35B-A3B at 79 t/s with 128K context, the --n-cpu-moe flag is the most important part.

·2026.04.18 16:40

핵심 내용

RTX 5070 Ti에서 --n-cpu-moe로 Qwen3.6-35B-A3B 속도를 54% 끌어올림.

자세히 보기

RTX 5070 Ti(16GB), Ryzen 9800X3D, 32GB RAM, llama.cpp b8829(CUDA 13.1, Windows x64)에서 Qwen3.6-35B-A3B GGUF UD-Q4_K_M(22.1GB)을 튜닝한 결과다.

핵심은 --cpu-moe 대신 --n-cpu-moe 20을 쓰는 것.

  • --cpu-moe: MoE expert를 전부 CPU로 보내 VRAM은 3.5GB만 사용
  • --n-cpu-moe 20: 40층 기준 앞 20층만 CPU, 나머지를 GPU로 올려 VRAM을 12.7GB까지 활용
  • --n-cpu-moe 20 + -np 1 + 128K ctx: 생성 79.3 t/s, 프롬프트 135.8 t/s, VRAM 13.2GB

300토큰 생성 기준으로 --cpu-moe의 51.2 t/s 대비 --n-cpu-moe 20은 78.7 t/s로 54% 빨라졌고, 프롬프트 속도도 87.9 t/s에서 100.6 t/s로 올랐다.

128K 컨텍스트는 -np 1로 recurrent-state 메모리를 줄여 사실상 공짜에 가깝게 붙였고, 실행 예시는 -ngl 99, -fa on, -ctk q8_0, -ctv q8_0, --reasoning-budget -1 등을 포함한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.