mistral.rs, CUDA 추론 성능 대폭 개선
mistral.rs v0.8.2: up to 2.8x faster CUDA inference than llama.cpp on GB10, B200, and H100
·2026.06.01 23:10
mistral.rs v0.8.2가 출시되어 H100 및 B200 등 최신 GPU에서 llama.cpp보다 최대 2.8배 빠른 CUDA 추론 성능을 제공한다.
mistral.rs v0.8.2 업데이트를 통해 **CUDA 처리량(throughput)**이 크게 개선되었다. 벤치마크 결과, Gemma 4(Dense 및 MoE 모델)를 GB10, H100, B200 GPU에서 구동했을 때 llama.cpp보다 모든 구간에서 더 빠른 성능을 기록했다.
주요 성과는 다음과 같다:
- 최대 2.8배 빠른 속도: GB10 및 B200 환경에서 압도적인 추론 성능을 입증했다.
- 범용성: 다양한 양자화 방식(eQ8_0, Q4K)과 모델 구조(Dense, MoE)에서 성능 우위를 유지한다.
- 기능 확장: OpenAI 호환 서버 및 에이전트 기능이 내장된 웹 채팅 UI를 지원한다.
상세한 벤치마크 결과와 재현 방법은 해당 프로젝트의 GitHub 리포지토리에서 확인할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.