AI Briefing

JetSpec, LLM 추론 속도 최대 9.64배 향상

[Research] JetSpec: Speculative Decoding with Parallel Tree Drafting Enables up to 9.64x Lossless LLM Inference Speedup with more than 1000TPS

·2026.06.26 06:55

병렬 트리 드래프팅 기술을 통해 LLM 추론 속도를 비약적으로 높인 JetSpec 연구가 공개되었습니다.

JetSpec은 Causal Parallel Tree Drafting 기술을 사용하여 추론 비용과 품질을 동시에 최적화하는 새로운 Speculative Decoding 방식을 제안합니다.

기존 방식들이 가지는 한계인 '트리 깊이에 따른 비용 증가'와 '분기 간 불일치 문제'를 해결하기 위해, 단 한 번의 패스로 인과성을 유지하는 트리를 생성합니다.

주요 성능 지표:

  • MATH-500 데이터셋 기준 최대 9.64배의 엔드투엔드 속도 향상
  • Open-ended chat 기준 4.58배 속도 향상
  • 무손실(Lossless) 추론 유지
  • CUDA Graph 및 커널 최적화를 통해 단일 B200 GPU에서 약 1000 TPS 달성

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.