Liquid AI, 토크나이저 재학습 없이 확장
Tokenizer Expansion: Upgrading a Model's Tokenizer in Place - LFM2.5-8B-A1B
·2026.07.22 19:28
Liquid AI가 LFM2.5-8B-A1B 모델의 어휘 사전을 65K에서 128K로 처음부터 재학습 없이 확장하는 기법을 공개했다.
Liquid AI가 토크나이저 인플레이스 확장(Tokenizer Expansion) 기법을 공개했다. 기존 사전학습 모델의 토크나이저를 재학습 없이 업그레이드할 수 있는 방법론으로, LFM2.5-8B-A1B 모델에 적용됐다.
핵심 변경 사항:
- 어휘 사전 크기를 65K → 128K로 두 배 확장
- 기존 토크나이저가 지나치게 세분화(over-segmentation)하던 언어들의 처리 품질 개선
- 처음부터 재학습 없이 기존 모델 가중치 재활용
기술 보고서는 arXiv(2607.15232)에, 모델은 Hugging Face(LiquidAI/LFM2.5-8B-A1B)에 공개됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.