AI Briefing

Google, PaliGemma 2 Mix 공개

PaliGemma 2 Mix - New Instruction Vision Language Models by Google

·2025.02.19 09:00

핵심 내용

Google이 다양한 시각-언어 작업에 최적화된 PaliGemma 2 Mix 모델을 출시했다.

자세히 보기

Google이 기존 PaliGemma 2 사전 학습(pt) 모델을 다양한 시각-언어(VLM) 작업에 맞춰 미세 조정(fine-tuning)한 PaliGemma 2 mix 모델을 공개했다.

이 모델들은 OCR, 캡셔닝, 시각적 질의응답(VQA), 문서 이해, 객체 탐지 및 세그멘테이션 등 광범위한 작업을 수행할 수 있도록 설계되었다.

주요 특징은 다음과 같다:

  • 다양한 모델 규모: 3B, 10B, 28B 파라미터 크기와 224, 448 해상도 조합을 제공한다.
  • 광범위한 작업 지원: 일반적인 VQA부터 인포그래픽/차트 이해, 텍스트 인식, 객체 탐지 및 세그멘테이션까지 지원한다.
  • 성능 가이드 역할: 사전 학습된 모델을 다양한 학술 데이터셋으로 미세 조정했을 때 기대할 수 있는 성능을 보여준다.

사용자는 Hugging Face Transformers 및 JAX 프레임워크를 통해 모델을 활용할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.