Arbitrage: 모델 우위를 고려한 speculative decoding 기반 효율적 추론
·2026.08.07 09:00
핵심 내용
ARBITRAGE가 모델 우위를 예측해 수학 추론 latency를 최대 2배 줄였다.
자세히 보기
ARBITRAGE는 빠르지만 부정확한 draft 모델과 성능이 높은 target 모델의 상대적 우위를 판단해 추론 경로를 동적으로 선택하는 step-level speculative generation 프레임워크다. 기존 speculative decoding은 token 불일치로 의미상 동등한 reasoning step까지 거부하는 문제가 있었다.
기존 step-level 방식도 거부된 단계를 반복 생성하면서 target 모델의 연산을 낭비했다. ARBITRAGE는 고정된 acceptance threshold 대신, target 모델이 의미 있게 더 나은 reasoning step을 생성할 가능성을 예측하는 경량 router를 사용한다.
이 router는 항상 더 높은 품질의 단계를 선택하는 이상적인 ARBITRAGE Oracle을 근사한다. 그 결과 여러 수학 추론 benchmark에서 기존 step-level speculative decoding 기법을 일관되게 앞섰으며, 동일한 정확도에서 inference latency를 최대 약 2배 줄였다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.