Google, PaliGemma 2 Mix 공개
PaliGemma 2 Mix - New Instruction Vision Language Models by Google
·2025.02.19 09:00
Google이 다양한 시각-언어 작업에 최적화된 PaliGemma 2 Mix 모델을 출시했다.
Google이 기존 PaliGemma 2 사전 학습(pt) 모델을 다양한 시각-언어(VLM) 작업에 맞춰 미세 조정(fine-tuning)한 PaliGemma 2 mix 모델을 공개했다.
이 모델들은 OCR, 캡셔닝, 시각적 질의응답(VQA), 문서 이해, 객체 탐지 및 세그멘테이션 등 광범위한 작업을 수행할 수 있도록 설계되었다.
주요 특징은 다음과 같다:
- 다양한 모델 규모: 3B, 10B, 28B 파라미터 크기와 224, 448 해상도 조합을 제공한다.
- 광범위한 작업 지원: 일반적인 VQA부터 인포그래픽/차트 이해, 텍스트 인식, 객체 탐지 및 세그멘테이션까지 지원한다.
- 성능 가이드 역할: 사전 학습된 모델을 다양한 학술 데이터셋으로 미세 조정했을 때 기대할 수 있는 성능을 보여준다.
사용자는 Hugging Face Transformers 및 JAX 프레임워크를 통해 모델을 활용할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.