AI Briefing

LFM2.5-VL-3B, 엣지 비전 강화

LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

·2026.08.12 23:00

핵심 내용

Liquid AI가 화면 이해와 도구 사용을 강화한 3.1B 비전언어 모델을 공개했다.

자세히 보기

Liquid AI가 온디바이스 실행을 겨냥한 3.1B 파라미터 비전언어 모델 LFM2.5-VL-3B를 공개했다. 추론 과정을 길게 출력하지 않고 직접 답하도록 설계해 실시간 애플리케이션에서 빠른 응답을 목표로 한다.

주요 개선점은 다음과 같다.

  • 다양한 기기의 화면·UI 이해
  • 자연어 질의 기반 객체 탐지 및 grounding
  • 여러 이미지 간 정보 비교와 이해
  • 텍스트·이미지 상황을 모두 지원하는 function calling

모델은 SigLIP2 400M NaFlex 비전 인코더와 LFM2.5-2.6B 텍스트 모델의 사전학습 백본을 결합했다. 약 34조 토큰으로 사전학습했으며, 이전 버전보다 비전 데이터를 4배 늘렸다. 비라틴 문자를 지원하기 위해 토크나이저 어휘도 128K로 확장했다.

후처리는 대형 교사 모델을 활용한 지식 증류와 SFT, Antidoom 학습을 거친 뒤 다중 보상 강화학습으로 진행됐다. 공식 비교 평가에서 전체 비전 태스크 평균 점수는 69.4점으로 이전 LFM2-VL-3B의 57.2점보다 높았다.

특히 ScreenSpot-v2에서 데스크톱 78.7점, 모바일 81.2점, 웹 82.2점을 기록했고, RefCOCO grounding은 87.9점이었다. 도구 사용 평가에서는 ToolSandbox 59.5점, BFCL V4 32.5점을 기록해 소형 모델의 에이전트 활용 가능성을 강조했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.