SWE-bench를 위한 Test-Time Compute
핵심 내용
AI21 Maestro는 구조화된 계획과 병렬 실행으로 SWE-bench 성능을 끌어올린다.
자세히 보기
AI21 Maestro는 **test-time compute(TTC)**를 실행 중에 동적으로 배분하는 범용 agentic framework로, SWE-bench-verified에서 성능을 크게 끌어올린다. 핵심은 LLM 추론만 믿는 대신, 오케스트레이션 자체를 구조화해 더 긴 작업에서 계산 자원을 효율적으로 쓰는 데 있다.
SWE-bench에서는 Maestro에 bash access만 주고, SWE-bench의 ReAct 기반 mini-swe-agent와 같은 모델·도구 조건으로 비교했다. 결과적으로 GPT-5와 GPT-5 mini 모두에서 성능이 개선됐고, Maestro를 붙인 GPT-5는 공개 결과 기준 Claude 4.5 Opus와 Gemini 3 Pro 수준까지 올라섰다.
Maestro의 효과는 크게 세 가지에서 나온다.
-
Horizontal scaling: 더 싼 모델을 여러 번 병렬로 돌려도, 올바른 출력만 잘 고르면 더 높은 정확도를 더 낮은 비용으로 얻을 수 있다. 예를 들어 gpt-5-mini를 8개 trajectory로 돌리면 gpt-5 1회 실행보다 더 좋은 점수와 더 낮은 비용을 낼 수 있다.
-
Maestro는 각 branch의 기대 비용과 가치를 사전 시뮬레이션 학습 priors나 개발자 입력으로 모델링해, 가치가 있을 때만 자동으로 병렬화한다. branch 종료 시 validator와 reducer가 최종 후보를 고르고, 한 branch가 성공하면 나머지를 멈추거나 stuck된 agent를 끊을 수 있다. 상태를 바꾸는 작업까지도 충돌 없이 병렬화할 수 있게 설계했다.
-
Structured plans: 기존 ReAct agent는 계획·판단·실행이 모두 토큰 생성에 섞여 있어, 마치 프로그램처럼 보이지만 실제로는 확률적 과정이라 비용·지연·정확도 변동이 크다. Maestro는 Plan Definition Language(PDL) 로 계획을 코드처럼 표현해 병렬 실행, 단계별 TTC, 명시적 data/control flow, 계획 강제, Python 친화적 생성, 최소 문법 기반의 보안성을 확보한다.
-
Exploring the action space: Maestro는 단일 ‘최적 행동’ 대신, 서로 다른 모델·비용 프로필·계획 방식을 아우르는 포트폴리오를 구성해 문제 공간을 탐색한다. 목표는 각 과제에서 성공하는 가장 싼 실행 경로에 가까워지는 것이며, 이를 통해 단일 agent의 한계를 orchestration으로 보완한다.
구조화된 계획은 SWE-bench에서 두 방식으로 평가됐다. 하나는 mini-swe-agent 프롬프트를 닮은 user-created plan, 다른 하나는 각 항목마다 런타임에 생성되는 planner model이다. 두 방식 모두 같은 모델의 ReAct agent보다 우수했고, 병렬 실행을 키울수록 개선 폭도 더 커졌다.
실행 궤적을 보면 차이가 분명하다. ReAct agent는 충분한 이해 없이 일찍 패치에 들어가는 false “aha” moment에 빠진 뒤 수정과 테스트를 반복하다 실패하는 경우가 많았다. 반면 structured execution은 먼저 맥락을 쌓고 테스트를 작성하는 데 더 많은 계산을 쓰며 결국 해결에 도달했다.
전체적으로 이 접근은 모델을 더 크게 만들거나 생각 토큰을 더 쓰는 대신, 기존 능력을 더 잘 조율해 Pareto frontier를 이동시키는 방식이다. 즉, TTC를 단순한 “더 많이 생각하기”가 아니라, 실행 중에 자원과 경로를 구조적으로 배분하는 문제로 재정의한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.