AI Briefing

Google, PaliGemma 2 Mix 공개

PaliGemma 2 Mix - New Instruction Vision Language Models by Google

·2025.02.19 09:00

Google이 다양한 시각-언어 작업에 최적화된 PaliGemma 2 Mix 모델을 출시했다.

Google이 기존 PaliGemma 2 사전 학습(pt) 모델을 다양한 시각-언어(VLM) 작업에 맞춰 미세 조정(fine-tuning)한 PaliGemma 2 mix 모델을 공개했다.

이 모델들은 OCR, 캡셔닝, 시각적 질의응답(VQA), 문서 이해, 객체 탐지 및 세그멘테이션 등 광범위한 작업을 수행할 수 있도록 설계되었다.

주요 특징은 다음과 같다:

  • 다양한 모델 규모: 3B, 10B, 28B 파라미터 크기와 224, 448 해상도 조합을 제공한다.
  • 광범위한 작업 지원: 일반적인 VQA부터 인포그래픽/차트 이해, 텍스트 인식, 객체 탐지 및 세그멘테이션까지 지원한다.
  • 성능 가이드 역할: 사전 학습된 모델을 다양한 학술 데이터셋으로 미세 조정했을 때 기대할 수 있는 성능을 보여준다.

사용자는 Hugging Face TransformersJAX 프레임워크를 통해 모델을 활용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.