LFM2.5-VL-3B, 엣지 비전 강화
LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
핵심 내용
Liquid AI가 화면 이해와 도구 사용을 강화한 3.1B 비전언어 모델을 공개했다.
자세히 보기
Liquid AI가 온디바이스 실행을 겨냥한 3.1B 파라미터 비전언어 모델 LFM2.5-VL-3B를 공개했다. 추론 과정을 길게 출력하지 않고 직접 답하도록 설계해 실시간 애플리케이션에서 빠른 응답을 목표로 한다.
주요 개선점은 다음과 같다.
- 다양한 기기의 화면·UI 이해
- 자연어 질의 기반 객체 탐지 및 grounding
- 여러 이미지 간 정보 비교와 이해
- 텍스트·이미지 상황을 모두 지원하는 function calling
모델은 SigLIP2 400M NaFlex 비전 인코더와 LFM2.5-2.6B 텍스트 모델의 사전학습 백본을 결합했다. 약 34조 토큰으로 사전학습했으며, 이전 버전보다 비전 데이터를 4배 늘렸다. 비라틴 문자를 지원하기 위해 토크나이저 어휘도 128K로 확장했다.
후처리는 대형 교사 모델을 활용한 지식 증류와 SFT, Antidoom 학습을 거친 뒤 다중 보상 강화학습으로 진행됐다. 공식 비교 평가에서 전체 비전 태스크 평균 점수는 69.4점으로 이전 LFM2-VL-3B의 57.2점보다 높았다.
특히 ScreenSpot-v2에서 데스크톱 78.7점, 모바일 81.2점, 웹 82.2점을 기록했고, RefCOCO grounding은 87.9점이었다. 도구 사용 평가에서는 ToolSandbox 59.5점, BFCL V4 32.5점을 기록해 소형 모델의 에이전트 활용 가능성을 강조했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.