AI Briefing

Google, 오픈 VLM PaliGemma 공개

PaliGemma – Google's Cutting-Edge Open Vision Language Model

·2024.05.14 09:00

Google이 SigLIP과 Gemma를 결합한 새로운 오픈 비전 언어 모델(VLM) PaliGemma를 공개했다.

Google이 SigLIP-So400m 이미지 인코더와 Gemma-2B 텍스트 디코더를 결합한 새로운 비전 언어 모델(VLM) 제품군인 PaliGemma를 출시했다.

모델은 용도에 따라 세 가지 체크포인트로 제공된다:

  • PT (Pretrained): 특정 작업에 맞춰 미세 조정(Fine-tuning)하기 위한 사전 학습 모델
  • Mix: 일반적인 추론 및 연구를 위해 다양한 작업이 혼합된 모델
  • FT (Fine-tuned): 특정 학술 벤치마크에 특화된 미세 조정 모델

사용자는 224x224, 448x448, 896x896의 세 가지 해상도와 다양한 정밀도(bfloat16, float16, float32)를 선택할 수 있다. 고해상도 모델은 OCR과 같은 세밀한 작업에 유리하지만 더 많은 메모리를 요구한다.

PaliGemma는 대화형 모델보다는 이미지 캡셔닝, 시각적 질의응답(VQA), 객체 탐지(Detection), 세그멘테이션(Segmentation) 등 특정 작업에 맞춰 미세 조정하여 사용할 때 최적의 성능을 발휘하도록 설계되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.