Transformers v5 토크나이저 구조 개편
Tokenization in Transformers v5: Simpler, Clearer, and More Modular
·2025.12.18 09:00
Transformers v5는 토크나이저 설계와 학습된 어휘를 분리하여 모듈성과 커스텀 편의성을 대폭 강화했다.
Transformers v5는 토크나이저의 작동 방식을 근본적으로 재설계하여 더 단순하고 명확한 구조를 제공한다.
가장 핵심적인 변화는 **토크나이저 설계(Architecture)**와 **학습된 어휘(Trained Vocabulary)**를 분리한 것이다. 이는 PyTorch가 신경망 구조와 학습된 가중치를 분리하는 방식과 유사하며, 이를 통해 사용자는 토크나이저를 더 쉽게 검사, 커스텀 및 처음부터 학습할 수 있다.
토큰화 파이프라인은 다음과 같은 단계로 구성된다:
- Normalizer: 텍스트 표준화 (소문자화, 유니코드 정규화 등)
- Pre-tokenizer: 텍스트를 예비 청크로 분할
- Model: BPE, Unigram 등 토큰화 알고리즘 적용
- Post-processor: 특수 토큰(BOS, EOS, Padding) 추가
- Decoder: 토큰을 다시 텍스트로 변환
이번 개편을 통해 기존의 '블랙박스' 같았던 토크나이저를 벗어나, 더 명확한 클래스 계층 구조와 단일화된 고속 백엔드를 활용할 수 있게 되었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.