Google, 차세대 VLM PaliGemma 2 출시
Welcome PaliGemma 2 – New vision language models by Google
·2024.12.05 09:00
Google이 Gemma 2를 기반으로 한 새로운 시각 언어 모델(VLM) PaliGemma 2를 공개했다.
PaliGemma 2는 SigLIP 이미지 인코더와 Gemma 2 텍스트 디코더를 결합한 차세대 시각 언어 모델(VLM)이다.
주요 특징은 다음과 같다:
- 다양한 모델 크기: 3B, 10B, 28B 파라미터 모델을 제공하여 사용자의 필요에 따라 성능과 효율성 사이의 균형을 선택할 수 있다.
- 유연한 해상도 지원: 224x224, 448x448, 896x896의 세 가지 입력 해상도를 지원한다.
- 미세 조정 최적화: 다운스트림 작업에 쉽게 적응할 수 있도록 설계되었으며, DOCCI 데이터셋으로 미세 조정된 3B 및 10B 모델도 함께 공개되어 정교한 캡셔닝 성능을 제공한다.
해당 모델은 Gemma 라이선스를 따르므로 상업적 이용, 재배포 및 미세 조정이 가능하다. Hugging Face를 통해 모델 저장소, Transformers 통합, 미세 조정 스크립트 및 VQAv2 데모가 즉시 제공된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.