AI Briefing

Google, SigLIP 2 비전-언어 인코더 공개

SigLIP 2: A better multilingual vision language encoder

·2025.02.21 09:00

핵심 내용

Google이 성능과 다국어 능력을 개선한 새로운 비전-언어 인코더 SigLIP 2를 공개했다.

자세히 보기

Google이 기존 SigLIP의 시그모이드 손실(sigmoid loss)을 확장하여 의미론적 이해, 로컬라이제이션, 조밀한 특징(dense features) 추출 능력을 강화한 SigLIP 2 모델군을 출시했다.

SigLIP 2는 제로샷 분류, 이미지-텍스트 검색, VLM(Vision-Language Model)을 위한 시각적 표현 추출 등 모든 주요 벤치마크에서 이전 모델보다 뛰어난 성능을 보인다.

주요 특징은 다음과 같다:

  • 다국어 지원: 다국어 환경에서 더욱 강력한 비전-언어 정렬 성능을 제공한다.
  • 다양한 모델 규모: Base(86M)부터 Large(303M), Shape Optimized(400M), Giant(1B)까지 다양한 크기를 지원한다.
  • naflex(Dynamic Resolution): 종횡비와 해상도에 민감한 다운스트림 태스크를 위해 동적 해상도를 지원하는 변형 모델을 포함한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.