Liquid AI, LFM2.5-VL 추론 가속하는 LFM2.5-VL-DSpark 공개
Accelerating vision-language models with LFM2.5-VL-DSpark
핵심 내용
Liquid AI가 LFM2.5-VL-3B 추론을 최대 3.13배 가속하는 280M 파라미터 드래프트 모델을 공개했다.
자세히 보기
Liquid AI가 LFM2.5-VL-3B 비전 언어 모델(VLM)의 추론 속도를 높이기 위한 실험적 드래프트 모델 LFM2.5-VL-DSpark를 공개했다. 이 모델은 추측 디코딩(speculative decoding)을 통해 출력 품질 저하 없이 280M 파라미터(타겟 모델 대비 8.9% 증가)의 최소한의 메모리 오버헤드로 성능을 향상시킨다.
성능 벤치마크
일반 VQA, 이미지 캡셔닝, 복잡한 추론 등 6가지 비전 기반 작업을 대상으로 다양한 하드웨어 환경에서 추론 속도 향상을 검증했다.
- 온디바이스(Apple Silicon): M5 Max에서 MLX 사용 시 디코딩 속도가 2.30배에서 3.13배까지 향상되며, 엔드투엔드 지연 시간은 1.56배에서 2.62배 개선된다. M3 Ultra에서 llama.cpp 사용 시 디코딩은 1.57배에서 2.14배 빨라진다.
- GPU(H100): 디코딩 속도가 2.04배에서 2.66배 향상되고, 엔드투엔드 성능은 1.64배에서 2.27배 개선된다.
아키텍처 및 구현
DSpark 드래프터는 4개 레이어와 권장 블록 크기 8 또는 9를 사용하는 단순화된 어텐션 전용 아키텍처를 채택했다. 타겟 모델의 고정된 레이어에서 숨겨진 상태(hidden states)를 포착하여 이를 기반으로 후보 토큰을 생성한다. 이미지 패치와 텍스트 토큰이 동일한 벡터 차원의 공유 표현으로 투영되므로, 드래프터는 멀티모달 입력을 처리하면서도 텍스트 전용 모델과 동일한 추론 알고리즘을 유지한다.
통합 및 한계
llama.cpp, MLX-VLM, SGLang에서 출시 당일 지원이 가능하다. 추측 디코딩은 생성 단계의 속도를 크게 높이지만, 비전 인코딩이나 프리필(prefill) 단계는 가속하지 않는다. 따라서 컴퓨팅 파워가 낮아 프리필이 지연의 큰 비중을 차지하는 엣지 디바이스에서는 아마다의 법칙(Amdahl's law)으로 인해 엔드투엔드 속도 향상이 제한되어, 순수 디코딩 가속률보다 전체적인 성능 개선 폭이 작다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.