AI Briefing

Kimi K2.6, MI50 32개 9.7tok/s

Final Monster: 32x AMD MI50 32GB at 9.7 t/s (TG) & 264 t/s (PP) with Kimi K2.6

·2026.05.01 07:24

32개 AMD MI50 2노드에서 Kimi K2.6 int4가 출력 9.7 tok/s, 입력 263 tok/s를 기록했다.

32개 AMD MI50 32GB를 2노드로 묶어 moonshotai/Kimi-K2.6 int4를 실행했고, 출력 136토큰 기준 9.7 tok/s, 입력 14,564토큰 기준 263 tok/s를 기록했다.

  • 실행 스택: vllm-gfx906-mobydick
  • 구성: 16 GPU x 2노드, 10G 이더넷 연결
  • 전력 소모: 대기 약 640W, 추론 피크 약 4,800W
  • 관련 코드: ai-infos/vllm-gfx906-mobydick
  • 서버 스크립트: 공식 vLLM 예제를 바탕으로 한 openai_server_kimi.py 수정본

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.