AI Briefing

vllm-xtu-moe, 2×A100에서 748B MoE 실행

Vllm with GPU/CPU fused to run a 748B MoE on 2×A100-40GB

·2026.09.29 14:18

핵심 내용

vllm-xtu-moe가 CPU-GPU 융합 실행으로 2×A100에서 748B MoE 추론을 지원한다.

자세히 보기

vllm-xtu-moe 프로젝트는 라우팅된 전문가(expert) 가중치를 VRAM에 올리지 않고 2×A100-40GB GPU에서 748B MoE 모델 실행을 가능하게 한다. 이 시스템은 전문가 가중치를 CPU 물리 토폴로지에 따라 분할하여 메모리에 사본을 하나만 유지하고, NUMA 바인딩과 first-touch를 통해 노드 로컬 읽기를 수행해 머신의 총 DRAM 대역폭에 가까운 성능을 낸다.

성능 및 아키텍처

아키텍처는 AMD EPYC nps=4와 SM 8.x 컴퓨팅 능력( 30 시리즈(SM86) 포함)을 지원한다. 긴 프롬프트는 이중 버퍼링(ping/pong)을 사용해 가중치를 GPU로 스트리밍하며 어텐션과 오버랩하여, 중간 길이 컨텍스트에서 CPU 경로 대비 ~20배 빠른 prefill, 긴 컨텍스트에서 2~3배 빠른 성능을 달성한다. 짧은 프롬프트는 CPU에서 직접 prefill한다.

VRAM 할당은 KV 풀 → GPU prefill 스테이징 → draft 가중치 → 활성화 작업 공간 순서로 고정 우선순위를 따른다. VRAM이 부족하면 GPU prefill을 먼저 제거하고 순수 CPU prefill로 폴백한다. 공간이 허용되면 추측 디코딩(speculative decoding)을 활성화하며, MiMo-V2.6 MTP k=1은 83%의 첫 위치 수락률과 +19%의 디코드 속도 향상을 기록한다(DSpark 앵커 기준 +20%).

벤치마크

2×A100-40GB 환경에서 TP=2로 vllm bench serve를 사용해 측정했다:

  • GLM-5.3-Flash: prefill 115.2 tok/s (140 prompt, C=1), decode 22.0 tok/s.
  • DeepSeek-V4.1-Flash: prefill 903.9 tok/s (16,384 prompt, C=1), decode 19.3 tok/s.
  • MiMo-V2.6-Flash-RL: prefill 1,455.3 tok/s (16,384 prompt, C=2), decode 39.6 tok/s.

이 시스템은 CPU prefill에서 ~33k expert-tokens/s의 대역폭을 포화시키며, bf16 KV로 704K 최대 컨텍스트를 지원한다. 메인라인 vLLM용 패치 시리즈 및 플러그인으로 Apache-2.0 라이선스를 따른다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.