Hugging Face, 동적 추측 디코딩 기술 도입
Faster Assisted Generation with Dynamic Speculation
·2024.10.08 09:00
핵심 내용
Intel Labs와 Hugging Face가 개발한 동적 추측 디코딩이 Transformers 라이브러리에 적용되어 생성 속도를 최대 2.7배 높인다.
1 / 2
자세히 보기
Speculative Decoding(추측 디코딩)은 가벼운 드래프트(draft) 모델이 토큰을 먼저 생성하고, 대규모 타겟(target) 모델이 이를 병렬로 검증하여 LLM의 추론 속도를 높이는 기술이다.
기존 방식은 추측하는 토큰의 수인 **Speculation Lookahead(SL)**를 고정된 값이나 단순한 휴리스틱에 의존했기 때문에, 매 단계마다 변하는 최적의 성능을 끌어내기 어려웠다.
Intel Labs와 Hugging Face가 공동 개발한 Dynamic Speculative Decoding은 각 반복 단계에서 최적의 드래프트 토큰 수를 동적으로 조정하여 추론 효율을 극대화한다.
이 기술은 작업에 따라 텍스트 생성 속도를 최대 2.7배까지 가속화할 수 있으며, 현재 Transformers 라이브러리의 Assisted Generation 기본 동작 모드로 통합되었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.