LFM2.5, DSpark로 추론 3.2배 가속
Up to 3.2x Faster Inference with LFM2.5-DSpark
·2026.08.21 01:52
핵심 내용
LFM2.5 모델에 DSpark 스펙ulative decoding 적용으로 GPU 및 온디바이스 추론 속도 최대 3.2배 향상.
자세히 보기
LFM2.5 모델 계열(1.2B, 2.6B, 8B-A1B)에 DSpark 드래프트 모델 체크포인트가 공개되어 추론 속도가 크게 향상되었습니다.
DSpark 기술 특징
- 스펙ulative decoding: 경량 드래프트 모델이 후보 토큰을 생성하고 타겟 모델이 검증하여 메모리 부하를 줄임.
- 구성 요소: DFlash 스타일 병렬 백본, 마르코프 체인 기반 시퀀셜 헤드, 신뢰도 기반 검증기.
- 품질 유지: 그리디 디코딩 시 출력 결과가 기존과 동일하여 벤치마크 정확도 변화 없음.
성능 향상 수치
- GPU (H100): 최대 3.18배 처리량 향상.
- 온디바이스 (M4 Max): 최대 2.87배 처리량 향상.
- 지연 시간 감소: LFM2.5-2.6B 기준 함수 호출(function-calling) 지연 시간이 평균 57% 감소.
호환성 및 배포
- llama.cpp 및 SGLang에 대한 첫날 지원(day-one support) 제공.
- DSpark 통합 코드가 오픈소스로 공개되어 즉시 활용 가능.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.