oMLX, DFlash로 토큰 속도 급상승
DFlash is real: x2 tg on small context with oMLX
·2026.04.16 01:09
핵심 내용
oMLX 최신 커밋에서 DFlash 최적화로 작은 컨텍스트 tg TPS가 크게 올랐다.
자세히 보기
DFLASH_MAX_CTX=8192를 켠 최신 oMLX 커밋에서 DFlash가 실제로 효과를 내는 벤치마크가 공개됐다.
- 모델: Qwen3.5-35B-A3B-MLX-MXFP4-FP16
- 핵심 변화: 작은 컨텍스트 구간에서 tg TPS가 약 2배 수준으로 개선
- 공개된 성능 예시:
- pp1024/tg128: 145.3 tok/s tg TPS, 489.8 tok/s throughput, 21.24 GB peak mem
- pp4096/tg128: 149.0 tok/s tg TPS, 523.3 tok/s throughput, 23.49 GB peak mem
- pp8192/tg128: 70.8 tok/s tg TPS, 537.4 tok/s throughput, 21.51 GB peak mem
- pp16384/tg128: 58.9 tok/s tg TPS, 594.0 tok/s throughput, 22.76 GB peak mem
작성자는 이 결과를 최신 커밋에서 바로 재현했다고 밝히며, 더 많은 벤치마크는 GitHub discussion에 올렸다고 덧붙였다.
작은 프롬프트 구간에서 지연과 토큰 생성 속도를 동시에 끌어올린 사례라, Mac용 LLM 서빙 최적화에 관심 있는 사람에게는 꽤 직접적인 신호다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.