AI Briefing

Claude 토크나이저, 약 1.5만 개 엔트리로 재현… Anthropic, Vocab 축소 전략

·2026.08.26 09:00

핵심 내용

Claude 토크나이저가 약 15,000개 엔트리로 재현되며, Anthropic이 Vocab을 축소하는 이유와 이점이 분석되었다.

자세히 보기

토크나이저 연구자 Sander Land가 Claude의 현재 토크나이저를 재현한 결과, 약 15,000개의 엔트리만 존재하는 것으로 확인되었다. 이는 약 250,000개 토큰을 가진 Qwen 3.8 등 최근 트렌드와 상반되는 수치다.

Gradient Bottleneck 이론

이러한 작은 Vocab의 배경에는 LM Head의 그라디언트 병목 현상이 있다. 모델의 잠재 공간 차원(D)에서 훨씬 큰 어휘 공간(V)으로 투사할 때, 역전파 과정에서 정보가 손실되는 압축이 발생한다.

  • Qwen 2.4T 모델의 경우 D는 8,192이고 V는 250,000이다.
  • V가 D보다 훨씬 클수록 학습 신호가 희소해져 모델이 임의의 D-sized 부분집합만 샘플링하게 된다.

Anthropic의 전략적 이점

Anthropic은 Claude 3의 약 50,000개에서 현재 약 16,000개로 Vocab을 줄였다. 이는 다음과 같은 이점을 제공한다.

  • 큰 메모리 공간을 투사할 필요가 없어 Chunked CE kernels 같은 복잡한 최적화가 불필요하다.
  • 모든 토큰이 학습되므로 Glitch tokens 같은 오류가 발생하지 않는다.
  • 희소 토큰이나 다른 언어는 Subword tokens와 UTF-8 폴백으로 처리한다.

이 방식은 입력 텍스트당 토큰 수를 약 1.2~2배 증가시켜 실행 비용과 주의력(attention) 비용을 높이지만, 그라디언트 병목으로 인한 학습 효율 저하를 피할 수 있어 전체적으로 더 나은 트레이드오프를 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.