LensVLM-9B: 텍스트를 이미지로 압축해 컨텍스트 한계를 넘어서는 VLM
apple/LensVLM-9B
·2026.09.27 05:52
프로젝트 소개
텍스트를 이미지로 변환해 압축하는 'visual-text-compression' 기법을 적용한 9B 파라미터 모델이다. 긴 문서를 이미지로 인코딩해 처리함으로써 기존 VLM의 컨텍스트 윈도우 한계를 우회한다.
Qwen3.5-9B를 기반으로 파인튜닝되었으며, 이미지와 텍스트를 동시에 입력받아 응답하는 멀티모달 구조를 갖췄다. 긴 문맥을 다루는 long-context 기능과 대화형 상호작용을 지원한다.
Apple의 AMLR 라이선스 하에 공개되며, Transformers 라이브러리를 통해 손쉽게 배포할 수 있다. 대용량 텍스트 데이터를 이미지 형태로 효율적으로 처리해야 하는 RAG나 문서 분석 작업에 적합하다.
HuggingFace 모델
apple/LensVLM-9B
원문에 등록된 설명이 없습니다.
image-text-to-text
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.