AI Briefing

oMLX, DFlash로 토큰 속도 급상승

DFlash is real: x2 tg on small context with oMLX

·2026.04.16 01:09

핵심 내용

oMLX 최신 커밋에서 DFlash 최적화로 작은 컨텍스트 tg TPS가 크게 올랐다.

자세히 보기

DFLASH_MAX_CTX=8192를 켠 최신 oMLX 커밋에서 DFlash가 실제로 효과를 내는 벤치마크가 공개됐다.

  • 모델: Qwen3.5-35B-A3B-MLX-MXFP4-FP16
  • 핵심 변화: 작은 컨텍스트 구간에서 tg TPS가 약 2배 수준으로 개선
  • 공개된 성능 예시:
    • pp1024/tg128: 145.3 tok/s tg TPS, 489.8 tok/s throughput, 21.24 GB peak mem
    • pp4096/tg128: 149.0 tok/s tg TPS, 523.3 tok/s throughput, 23.49 GB peak mem
    • pp8192/tg128: 70.8 tok/s tg TPS, 537.4 tok/s throughput, 21.51 GB peak mem
    • pp16384/tg128: 58.9 tok/s tg TPS, 594.0 tok/s throughput, 22.76 GB peak mem

작성자는 이 결과를 최신 커밋에서 바로 재현했다고 밝히며, 더 많은 벤치마크는 GitHub discussion에 올렸다고 덧붙였다.

작은 프롬프트 구간에서 지연과 토큰 생성 속도를 동시에 끌어올린 사례라, Mac용 LLM 서빙 최적화에 관심 있는 사람에게는 꽤 직접적인 신호다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.