all-MiniLM-L6-v2: 월 2.5억 다운로드, 384차원 벡터로 문장 의미 잡는 초경량 임베딩
sentence-transformers/all-MiniLM-L6-v2
·2026.09.02 23:21
프로젝트 소개
문장이나 짧은 단락을 384차원 밀집 벡터로 변환해 의미 유사도 계산과 시맨틱 검색을 수행한다. 입력 텍스트가 256 word pieces를 넘으면 잘려 나가므로, 긴 문서보다는 문장 단위 처리에 최적화되어 있다.
11억 개 이상의 문장 쌍으로 구성된 대규모 데이터셋을 통해 자기 지도 대조 학습 방식으로 훈련됐다. Reddit 댓글, Stack Exchange, MS MARCO 등 다양한 출처의 데이터를 학습해 일상 대화부터 기술 문서까지 폭넓은 맥락을 이해한다.
22.7M 파라미터의 경량 구조로 PyTorch, TensorFlow, ONNX 등 여러 프레임워크를 지원한다. 월 2억 5천만 회 이상의 다운로드를 기록하며, RAG 파이프라인의 검색 단계나 클러스터링 작업에서 빠른 추론 속도를 요구할 때 표준처럼 쓰인다.
HuggingFace 모델
sentence-transformers/all-MiniLM-L6-v2
원문에 등록된 설명이 없습니다.
sentence-similarity
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.