distilbert-base-uncased: BERT의 40% 경량화, 67M 파라미터로 NLP 태스크 수행
distilbert/distilbert-base-uncased
·2026.09.03 14:21
프로젝트 소개
BERT base 모델의 지식을 증류해 크기를 줄이고 추론 속도를 높인 Transformer 기반 언어 모델이다. 원본 BERT의 40% 수준인 67M 파라미터로 구성됐으며, BookCorpus와 영어 Wikipedia 데이터를 기반으로 사전 학습됐다.
마스크된 단어를 예측하는 Fill-Mask 기능을 기본으로 제공한다. 문장 분류, 토큰 분류, 질의응답 등 전체 문맥을 이해해야 하는 작업에 적합하며, 텍스트 생성에는 권장되지 않는다. 대소문자를 구분하지 않는 uncased 버전으로 영어 처리에 특화됐다.
Glue 벤치마크에서 SST-2 태스크 91.3점, QNLI 89.2점 등 높은 성능을 기록하며 원본 모델의 능력을 상당 부분 유지한다. PyTorch, TensorFlow, JAX 등 주요 프레임워크를 지원하며, Apache 2.0 라이선스로 상업적 활용이 가능하다.
HuggingFace 모델
distilbert/distilbert-base-uncased
원문에 등록된 설명이 없습니다.
fill-mask
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.