AI Briefing

Arbitrage: 모델 우위를 고려한 speculative decoding 기반 효율적 추론

·2026.08.07 09:00

핵심 내용

ARBITRAGE가 모델 우위를 예측해 수학 추론 latency를 최대 2배 줄였다.

자세히 보기

ARBITRAGE는 빠르지만 부정확한 draft 모델과 성능이 높은 target 모델의 상대적 우위를 판단해 추론 경로를 동적으로 선택하는 step-level speculative generation 프레임워크다. 기존 speculative decoding은 token 불일치로 의미상 동등한 reasoning step까지 거부하는 문제가 있었다.

기존 step-level 방식도 거부된 단계를 반복 생성하면서 target 모델의 연산을 낭비했다. ARBITRAGE는 고정된 acceptance threshold 대신, target 모델이 의미 있게 더 나은 reasoning step을 생성할 가능성을 예측하는 경량 router를 사용한다.

이 router는 항상 더 높은 품질의 단계를 선택하는 이상적인 ARBITRAGE Oracle을 근사한다. 그 결과 여러 수학 추론 benchmark에서 기존 step-level speculative decoding 기법을 일관되게 앞섰으며, 동일한 정확도에서 inference latency를 최대 약 2배 줄였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.