GLM 5.1 로컬 40tps
GLM 5.1 Locally: 40tps, 2000+ pp/s
·2026.04.26 01:31
4장 RTX 6000 Pro에서 GLM 5.1을 40tps 이상으로 돌렸다.
sglang 패치를 거친 reap-ed nvfp4 버전을 4 x RTX 6000 Pro 환경에서 안정적으로 구동했다. 전력은 카드당 350W 제한이었다.
프리필 기준 처리량은 4096 토큰에서 2229.0 pp/s, 생성 처리량은 512 토큰에서 42.03 tps를 기록했다.
컨텍스트가 길어질수록 성능은 점진적으로 떨어졌지만, 64K 컨텍스트에서도 863.5 pp/s / 35.87 tps를 유지했다.
- 0 context: 2229.0 pp/s, 42.03 tps
- 4K: 1943.6 pp/s, 41.41 tps
- 16K: 1558.9 pp/s, 39.72 tps
- 32K: 1234.2 pp/s, 38.19 tps
- 64K: 863.5 pp/s, 35.87 tps
작성자는 오픈코드(opencode) 경험이 Sonnet + Claude Code에 가깝다고 평가했고, 100~200k 세션도 안정적이라고 밝혔다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.