Google, SigLIP 2 비전-언어 인코더 공개
SigLIP 2: A better multilingual vision language encoder
·2025.02.21 09:00
핵심 내용
Google이 성능과 다국어 능력을 개선한 새로운 비전-언어 인코더 SigLIP 2를 공개했다.
자세히 보기
Google이 기존 SigLIP의 시그모이드 손실(sigmoid loss)을 확장하여 의미론적 이해, 로컬라이제이션, 조밀한 특징(dense features) 추출 능력을 강화한 SigLIP 2 모델군을 출시했다.
SigLIP 2는 제로샷 분류, 이미지-텍스트 검색, VLM(Vision-Language Model)을 위한 시각적 표현 추출 등 모든 주요 벤치마크에서 이전 모델보다 뛰어난 성능을 보인다.
주요 특징은 다음과 같다:
- 다국어 지원: 다국어 환경에서 더욱 강력한 비전-언어 정렬 성능을 제공한다.
- 다양한 모델 규모: Base(86M)부터 Large(303M), Shape Optimized(400M), Giant(1B)까지 다양한 크기를 지원한다.
- naflex(Dynamic Resolution): 종횡비와 해상도에 민감한 다운스트림 태스크를 위해 동적 해상도를 지원하는 변형 모델을 포함한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.