AI Briefing

NVIDIA, 문서 특화 VLM 공개

Welcome the NVIDIA Llama Nemotron Nano VLM to Hugging Face Hub

·2025.06.28 06:09

NVIDIA가 문서 이해 및 OCR 성능이 강화된 8B 규모의 VLM인 Llama Nemotron Nano를 공개했다.

Llama Nemotron Nano VL은 지능형 문서 처리(IDP)와 OCR에 최적화된 **8B 규모의 시각 언어 모델(VLM)**이다.

인보이스, 영수증, 계약서 등 복잡한 문서에서 텍스트, 표, 차트, 다이어그램을 정확하게 추출하고 이해하는 데 특화되어 있다. OCRBench v2 벤치마크에서 높은 성능을 입증했으며, 다음과 같은 핵심 기능을 제공한다:

  • 텍스트 인식 및 요소 파싱: 문서 내 텍스트와 표, 차트, 이미지 등 주요 요소를 정확히 식별한다.
  • 표 추출: 재무제표와 같은 복잡한 표 데이터를 높은 정확도로 추출한다.
  • Grounding: 쿼리 및 출력 시 바운딩 박스(Bounding Box)를 지원하여 모델 응답의 해석력을 높인다.

이 모델은 Llama-3.1-8B-Instruct와 고해상도 시각 특징 추출을 위한 C-RADIOv2-VLM-H Vision Transformer를 기반으로 설계되었다. 사용자는 Hugging Face에서 모델을 즉시 사용할 수 있으며, NVIDIA NeMo를 활용해 자체 데이터셋으로 추가 학습(Post-training)을 진행할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.