AI Briefing

LensVLM-9B: 텍스트를 이미지로 압축해 컨텍스트 한계를 넘어서는 VLM

apple/LensVLM-9B

·2026.09.27 05:52

텍스트를 이미지로 변환해 압축하는 'visual-text-compression' 기법을 적용한 9B 파라미터 모델이다. 긴 문서를 이미지로 인코딩해 처리함으로써 기존 VLM의 컨텍스트 윈도우 한계를 우회한다.

Qwen3.5-9B를 기반으로 파인튜닝되었으며, 이미지와 텍스트를 동시에 입력받아 응답하는 멀티모달 구조를 갖췄다. 긴 문맥을 다루는 long-context 기능과 대화형 상호작용을 지원한다.

Apple의 AMLR 라이선스 하에 공개되며, Transformers 라이브러리를 통해 손쉽게 배포할 수 있다. 대용량 텍스트 데이터를 이미지 형태로 효율적으로 처리해야 하는 RAG나 문서 분석 작업에 적합하다.

HuggingFace
HuggingFace 모델

apple/LensVLM-9B

원문에 등록된 설명이 없습니다.

image-text-to-text

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.