AI Briefing

Google, SigLIP 2 비전-언어 인코더 공개

SigLIP 2: A better multilingual vision language encoder

·2025.02.21 09:00

Google이 성능과 다국어 능력을 개선한 새로운 비전-언어 인코더 SigLIP 2를 공개했다.

Google이 기존 SigLIP의 시그모이드 손실(sigmoid loss)을 확장하여 의미론적 이해, 로컬라이제이션, 조밀한 특징(dense features) 추출 능력을 강화한 SigLIP 2 모델군을 출시했다.

SigLIP 2는 제로샷 분류, 이미지-텍스트 검색, VLM(Vision-Language Model)을 위한 시각적 표현 추출 등 모든 주요 벤치마크에서 이전 모델보다 뛰어난 성능을 보인다.

주요 특징은 다음과 같다:

  • 다국어 지원: 다국어 환경에서 더욱 강력한 비전-언어 정렬 성능을 제공한다.
  • 다양한 모델 규모: Base(86M)부터 Large(303M), Shape Optimized(400M), Giant(1B)까지 다양한 크기를 지원한다.
  • naflex(Dynamic Resolution): 종횡비와 해상도에 민감한 다운스트림 태스크를 위해 동적 해상도를 지원하는 변형 모델을 포함한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.