AI Briefing

clip-vit-base-patch32: 라벨 없이 이미지 분류하는 CLIP의 경량화 버전

openai/clip-vit-base-patch32

·2026.09.04 08:23

학습된 클래스 목록에 없는 이미지도 텍스트 설명만으로 분류한다. ViT-B/32 구조를 채택해 경량화된 이 모델은 이미지와 텍스트의 유사도를 계산해 Zero-shot 분류를 수행한다.

PyTorch, TensorFlow, JAX 등 주요 프레임워크를 모두 지원한다. Transformers 라이브러리의 AutoProcessor와 AutoModel을 통해 손쉽게 연동할 수 있으며, 월 2천만 회 이상의 다운로드를 기록하며 활발히 사용되고 있다.

OpenAI가 컴퓨터 비전의 일반화 능력을 검증하기 위해 공개한 연구용 모델이다. 상업적 배포보다는 연구 및 프로토타이핑 목적에 적합하며, 영어 데이터셋 기반이라 비영어권 작업에는 주의가 필요하다.

HuggingFace
HuggingFace 모델

openai/clip-vit-base-patch32

원문에 등록된 설명이 없습니다.

zero-shot-image-classification

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.