Liquid AI, VLM 추측 디코딩 모델 LFM2.5-VL-3B-DSpark 공개
Liquid AI, VLM 디코딩 속도를 2.66~3.13배 가량 높인 LFM2.5-VL-3B-DSpark 모델 공개
·2026.09.28 16:30
핵심 내용
Liquid AI가 VLM 모델 LFM2.5-VL-3B의 추측 디코딩을 위한 초안 모델 LFM2.5-VL-3B-DSpark를 공개했으며, Apple M5 Max에서 디코딩 속도를 최대 3.13배까지 향상시켰다.
1 / 9
자세히 보기
Liquid AI가 자사의 비전-언어 모델(VLM) LFM2.5-VL-3B를 위한 추측 디코딩(Speculative Decoding) 초안 모델 'LFM2.5-VL-3B-DSpark'를 공개했다. 이 모델은 DeepSeek-AI와 베이징대 연구팀의 DSpark 방식을 기반으로 하며, 약 280M 파라미터 규모로 본 모델 대비 8.9%의 파라미터 증가 비용으로 출력 품질을 유지하면서 디코딩 속도를 크게 높인다.
성능 및 하드웨어별 향상
- Apple M5 Max: MLX-VLM을 사용할 때 디코딩 속도가 최대 3.13배 향상된다.
- NVIDIA H100: SGLang을 사용할 때 디코딩 속도가 최대 2.66배 향상된다.
- 채택 토큰 수: 검증 1회당 평균 3.2~4.5개의 토큰이 채택되어 효율적인 추론을 지원한다.
기술 구조 및 구현
DSpark 방식은 병렬 백본과 순차 헤드(Markov Chain)를 결합한 반자기회귀 구조를 사용한다. 이미지 패치와 텍스트 토큰이 같은 차원으로 투영되므로, 텍스트 모델과 동일한 추론 알고리즘을 적용할 수 있다.
지원 환경 및 주의사항
- llama.cpp: PR #29339 이후 빌드 필요하며, Apple Silicon에서는 블록 크기 8을 권장한다.
- SGLang: v0.5.19 이상을 요구하지만, LFM2-VL용 지원은 현재 main 브랜치에만 존재한다.
- MLX-VLM: v0.7.2 이상에서 지원되며, 현재는 탐욕적 샘플링(greedy sampling)만 가능하다.
- 라이선스: LFM Open License v1.0 적용, 연 매출 1,000만 달러 미만 기업에 한해 상업적 이용이 허용된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.