Hugging Face, tokenizers v1 공개 예정
tokenizers v1: encode, decode and scaling, measured
·2026.09.21 09:00
핵심 내용
Hugging Face가 GPU 유휴 시간을 줄이고 최대 30배의 처리 속도 향상을 목표로 하는 tokenizers v1을 공개할 예정이다.
자세히 보기
Hugging Face가 tokenizers v1을 공개할 예정이며, v0.23 대비 최대 30배의 성능 향상을 목표로 한다. 이번 릴리스는 토크나이저 처리 지연으로 인한 GPU 유휴 시간을 최소화하는 데 초점을 맞췄으며, v1은 기존 라이브러리와 동일한 토큰 ID를 생성한다.
핵심 기술 개선
- SIMD 기반 Pre-tokenization: BPE의 고정 regex를 bitstream 연산으로 대체하여 처리 속도를 높였다.
- Thread-local Word Cache: 반복되는 단어를 즉시 매핑하여 병합 프로세스를 생략하고 캐시 적중률을 극대화했다.
- 메모리 및 병렬 처리 최적화: Flat array와 branchless loop를 적용하고, native thread를 활용해 단일 락 대기 시간을 제거했다.
성능 및 향후 계획
Apple M4 Max 기준 벤치마크에서 t5-base 모델은 약 3배, gpt2 모델은 최대 30배 빨라졌으며, 8스레드 환경에서 76%의 선형 확장성을 보였다. 향후 1.0.0 버전에서는 GPU 인코딩 및 batch decoding 실험, llama.cpp와 ExecuTorch용 C/C++ 바인딩 지원 등이 탐색 및 프로토타이핑 단계에 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.