추측 디코딩, 연산량 늘려 유휴 GPU 자원 활용으로 LLM 추론 가속
핵심 내용
추측 디코딩은 연산량을 늘려 유휴 컴퓨트를 활용함으로써 LLM 추론을 가속화한다.
자세히 보기
추측 디코딩(Speculative Decoding)은 LLM 추론 속도를 높이기 위해 연산량을 줄이는 것이 아니라, 오히려 총 부동소수점 연산량(FLOPs)을 증가시킨다. 표준 단일 토큰 디코딩은 GPU가 모든 활성 파라미터(예: Qwen3.5-27B의 경우 27B)를 매 단계 스트리밍해야 하는 메모리 바운드(memory bound) 상태여서 산술 유닛이 유휴 상태로 남는다. 작은 초안 모델이 토큰을 제안하고 대형 모델이 이를 병렬로 검증하는 방식은 한 번의 순방향 패스(forward pass)에서 여러 토큰을 처리하게 한다. 이는 저배치(batch size) 환경에서 '무료'로 남아 있는 연산 용량을 활용하기 위해 시퀀스 수(너비) 대신 단일 시퀀스 내 토큰 수(깊이)를 늘리는 전략이다.
하지만 이러한 효율성은 컨텍스트에 따라 달라진다. 높은 배치 크기에서는 GPU가 컴퓨트 바운드(compute bound) 상태가 되며, 특히 초안 토큰이 거부될 경우 추측 디코딩은 자원을 낭비할 수 있다. 이에 따라 vLLM과 같은 프레임워크는 --speculative-disable-by-batch-size 파라미터를 통해 높은 처리량에서 추측 기능을 비활성화할 수 있게 한다. 또한 실시간 배치 크기와 가용 연산량에 따라 추측 깊이를 조정하는 dSpark 같은 동적 전략 연구도 진행되고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.