에이전트형 Test-Time Scaling GitHub 저장소
AutoTTS는 오프라인 replay 환경에서 코드 탐색만으로 Test-Time Scaling 정책을 찾는다.
AutoTTS는 사람이 휴리스틱을 직접 짜는 대신, 오프라인 replay 환경에서 코드 편집만으로 Test-Time Scaling 컨트롤러를 자동 탐색한다. 인간은 상태·행동·피드백·목표를 정의한 뒤 캐시된 추론 궤적을 재생하는 환경만 만들고, 코딩 에이전트가 그 안에서 정책 코드를 반복 수정한다.
환경은 각 질의에 대해 여러 reasoning trace를 미리 수집한 뒤, 이를 고정 길이 세그먼트와 probe 응답으로 분해해 replay store에 저장한다. 이후 후보 정책은 observe/step만으로 평가되며, discovery 단계의 LLM 호출은 0회다. 정책 내부의 모든 하이퍼파라미터는 단일 스칼라 β로 결정돼, 탐색이 사실상 β 스윕으로 수렴하도록 설계됐다.
최적화는 AIME24 replay 구성에서 진행되고, 평가는 AIME25와 HMMT25 held-out benchmark에서 수행됐다. 대상 백본은 Qwen3의 네 가지 규모이며, 발견된 컨트롤러는 SC@64, ASC, ESC, Parallel-Probe 같은 수작업 baseline보다 더 좋은 accuracy-token trade-off를 보였다.
- β=0.5에서는 SC@64 대비 토큰 사용량을 약 69.5% 줄이면서 네 가지 backbone scale 전반에서 held-out 평균 정확도를 맞췄다.
- 한 번의 discovery run은 약 $39.9와 160분이 들었고, 평가 단계에서는 0 LLM calls로 replay만 사용했다.
- β=1.0에서는 프로젝트 표의 8개 비교 셀 중 5개에서 handcrafted baseline을 넘어서는 최고 정확도를 기록했다.
발견된 정책은 **Confidence Momentum Controller(CMC)**다. 풀 confidence의 EMA와 추세를 함께 보고 순간적인 스파이크에 반응해 멈추지 않으며, confidence가 정체되면 branch를 넓히고 alignment가 맞는 branch에는 더 많은 depth를 배분한다. 반대로 지속적으로 어긋나는 branch는 보수적으로 버려 width와 depth를 함께 조절한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.