AI Briefing

8x MI50에서 64 tok/s 피크

Bench 8xMI50 MiniMax M2.7 AWQ @ 64 tok/s peak (vllm-gfx906-mobydick)

·2026.04.17 02:39

핵심 내용

8x MI50 32GB에서 MiniMax M2.7 AWQ를 피크 64 tok/s로 돌린 벤치다.

자세히 보기

8x MI50 32GB 환경에서 MiniMax-M2.7-AWQ-4bit를 vllm-gfx906-mobydick 포크로 서빙한 뒤 벤치마크를 돌린 결과다.

  • 사용한 양자화 모델: cyankiwi/MiniMax-M2.7-AWQ-4bit
  • 사용한 엔진: vllm-gfx906-mobydick 포크
  • 실행 환경: ROCm 기반 Docker, tensor parallel size 8, 최대 컨텍스트 길이 196,608

벤치 설정은 랜덤 입력 10,000 토큰, 출력 1,000 토큰, 4 prompts, 요청률 10,000 RPS였다.

결과는 성공 4건 / 실패 0건, 총 40,000 input tokens와 400 generated tokens, 벤치 시간 125.90초로 기록됐다.

핵심 포인트는 gfx906 계열 MI50에서 돌아가는 ROCm vLLM 포크의 실제 구동 사례와, 이 조합에서의 64 tok/s peak 성능이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.