clip-vit-base-patch32: 라벨 없이 이미지 분류하는 CLIP의 경량화 버전
openai/clip-vit-base-patch32
·2026.09.04 08:23
프로젝트 소개
학습된 클래스 목록에 없는 이미지도 텍스트 설명만으로 분류한다. ViT-B/32 구조를 채택해 경량화된 이 모델은 이미지와 텍스트의 유사도를 계산해 Zero-shot 분류를 수행한다.
PyTorch, TensorFlow, JAX 등 주요 프레임워크를 모두 지원한다. Transformers 라이브러리의 AutoProcessor와 AutoModel을 통해 손쉽게 연동할 수 있으며, 월 2천만 회 이상의 다운로드를 기록하며 활발히 사용되고 있다.
OpenAI가 컴퓨터 비전의 일반화 능력을 검증하기 위해 공개한 연구용 모델이다. 상업적 배포보다는 연구 및 프로토타이핑 목적에 적합하며, 영어 데이터셋 기반이라 비영어권 작업에는 주의가 필요하다.
HuggingFace 모델
openai/clip-vit-base-patch32
원문에 등록된 설명이 없습니다.
zero-shot-image-classification
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.