추천
Apple, 압축된 텍스트 이미지 처리하는 LensVLM-9B 공개
·2026.09.24 05:35
핵심 내용
Qwen3.5-9B 기반의 LensVLM은 4.3배 압축률에서 원문 수준 정확도를 유지하며 최대 10.1배까지 성능을 입증했다.
자세히 보기
Apple 연구진이 텍스트를 렌더링된 이미지로 처리하는 Vision-Language Models(VLMs)의 한계를 극복하기 위해 LensVLM을 공개했다. 기존 VLM은 텍스트를 이미지로 변환할 때 압축률이 높아지면 문자가 시각 인코더의 해상도 한계로 인해 판별 불가능해져 정확도가 급격히 떨어지는 문제가 있었다.
LensVLM은 압축된 이미지를 스캔한 후, 학습된 도구를 통해 관련 부분만 선택적으로 원본 해상도로 확장하는 추론 프레임워크와 포스트 트레이닝 기법을 적용했다. Qwen3.5-9B-Base를 기반으로 개발된 이 모델은 4.3배의 유효 압축률에서 원문 텍스트 상한선과 유사한 정확도를 유지하며, 7개의 텍스트 QA 벤치마크에서 10.1배 압축률까지 기존 검색 기반 및 시각 압축 베이스라인을 능가한다.
이 접근법은 렌더링 선택에 대한 시각 압축의 강건성을 높이고, 압축률이 증가할수록 모델이 신뢰할 수 없는 시각 읽기 대신 확장된 콘텐츠에 의존하도록 유도한다. 분석 결과, 렌더링된 텍스트에는 텍스트 확장이, 레이아웃 정보가 중요한 네이티브 문서에는 고해상도 이미지 확장이 더 적합하다는 실용적인 가이드라인도 제시했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.