AI Briefing

MiniMax-M2.7, 5090 혼합 구성 실험

[Research use case] MiniMax-M2.7 with small context, CPU+GPU (5090) setup on Llama.cpp

·2026.04.30 16:41

RTX 5090 Llama.cpp 실험에서 MiniMax-M2.7은 100k context에도 22 tps 처리, 3~4 tps 생성에 그쳤다.

느린 생성과 컴팩션 지연을 밤새 돌리는 방식으로 상쇄할 수 있는지 보기 위해, MiniMax-M2.7 229B 양자화 모델을 RTX 5090 32GB VRAM + 64GB RAM 환경의 Llama.cpp에서 시험했다.

검색형 연구 워크플로에는 60k context가 필요하고, 40k 미만은 위험하다는 판단을 내렸다. Hermes 같은 harness는 시작만 해도 10k context를 쓰고, 검색 결과 하나당 10k context가 필요하다고 봤다.

초기 설정은 --fit-ctx 40000, --no-mmap, --parallel 1이었고, 첫 실행에서는 GPU 18층 / CPU 45층, 100k context, SSD mmap 기반의 progressive weights loading을 함께 사용했다.

결과는 다음과 같았다.

  • 검색 툴이 붙은 BF6 출시 시점 질의에서 결과가 잘리며 오답이 발생했다.
  • Hermes 기반의 로컬LLaMA 서브레딧 24시간 트렌드 수집은 30분 이상 타임아웃됐다.
  • 처리 속도는 22 tps, 생성 속도는 3~4 tps였다.

결론적으로 SSD를 확장 메모리처럼 쓰는 방식은 실용적이지 않다는 판단이 나왔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.