AI Briefing

Hugging Face, 동적 추측 디코딩 기술 도입

Faster Assisted Generation with Dynamic Speculation

·2024.10.08 09:00

Intel Labs와 Hugging Face가 개발한 동적 추측 디코딩이 Transformers 라이브러리에 적용되어 생성 속도를 최대 2.7배 높인다.

Speculative Decoding(추측 디코딩)은 가벼운 드래프트(draft) 모델이 토큰을 먼저 생성하고, 대규모 타겟(target) 모델이 이를 병렬로 검증하여 LLM의 추론 속도를 높이는 기술이다.

기존 방식은 추측하는 토큰의 수인 **Speculation Lookahead(SL)**를 고정된 값이나 단순한 휴리스틱에 의존했기 때문에, 매 단계마다 변하는 최적의 성능을 끌어내기 어려웠다.

Intel Labs와 Hugging Face가 공동 개발한 Dynamic Speculative Decoding은 각 반복 단계에서 최적의 드래프트 토큰 수를 동적으로 조정하여 추론 효율을 극대화한다.

이 기술은 작업에 따라 텍스트 생성 속도를 최대 2.7배까지 가속화할 수 있으며, 현재 Transformers 라이브러리의 Assisted Generation 기본 동작 모드로 통합되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.