AI Briefing

장기 코딩 에이전트 확장

·2026.04.27 09:00

요약·투표·재정제를 결합해 장기 코딩 에이전트 성능을 끌어올렸다.

Test-time scaling은 짧고 비교 가능한 출력에서는 잘 작동하지만, 장기 코딩 에이전트는 행동·관찰·오류·부분 진전이 이어지는 긴 롤아웃을 남긴다. 이 환경에서는 더 많은 시도보다, 이전 경험을 선택하고 재사용할 수 있는 표현이 핵심이 된다.

각 롤아웃은 구조화된 요약으로 압축돼 핵심 가설, 진행 상황, 실패 모드만 남기고 잡음이 많은 실행 세부를 제거한다. 이 표현을 바탕으로 두 가지 추론 확장 방식이 가능해진다.

  • 병렬 확장: **Recursive Tournament Voting (RTV)**가 작은 그룹 비교를 재귀적으로 반복해 후보를 점점 좁힌다.
  • 순차 확장: **Parallel-Distill-Refine (PDR)**가 이전 시도에서 증류한 요약을 조건으로 새 롤아웃을 생성한다.

이 방식은 SWE-Bench VerifiedTerminal-Bench v2.0에서 전반적인 코딩 에이전트 성능을 꾸준히 끌어올렸다. 예를 들어 Claude-4.5-Opusmini-SWE-agent 기준 SWE-Bench Verified에서 70.9%에서 77.6%로, Terminus 1 기준 Terminal-Bench v2.0에서 46.9%에서 59.1%로 상승했다.

결국 장기 에이전트의 test-time scaling은 더 많은 롤아웃을 쌓는 문제가 아니라, 경험을 얼마나 잘 표현·선택·재사용하느냐의 문제로 정리된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.