UiPath, 에이전트 작업 길이별 Claude 모델 성능 격차 공개
Haiku is 6 points behind Sonnet on SWE-bench and 44 points behind on our internal agent tasks. But on short tasks they tie.
·2026.09.22 21:49
핵심 내용
에이전트 작업이 길어질수록 Claude Haiku의 성공률이 급감하며 Sonnet과의 격차가 커진다는 분석이 나왔다.
자세히 보기
UiPath 엔지니어링 팀이 자체 에이전트 태스크 벤치마크를 통해 Claude Haiku 4.5와 Sonnet 4.6의 성능 차이를 분석했다. SWE-bench Verified에서는 두 모델의 점수 차이가 6점(73.3% vs 79.6%)에 불과했지만, 실제 에이전트 태스크에서는 43.6% 포인트(42.0% vs 85.6%)의 큰 격차가 발생했다.
작업 길이에 따른 성능 변화
작업의 복잡도를 Sonnet이 필요로 한 명령어 개수로 분류했을 때, Haiku의 성능 저하가 두드러졌다.
- 1-2개 명령어: Haiku 89.5%, Sonnet 89.5% (동률)
- 3-5개 명령어: Haiku 70.7%, Sonnet 98.3%
- 11-20개 명령어: Haiku 46.2%, Sonnet 90.8%
- 41개 이상: Haiku 21.2%, Sonnet 78.8%
작업 길이가 두 배로 늘어날 때마다 Haiku의 성공 확률은 절반으로 떨어지는 반면, Sonnet은 전체 범위에서 11포인트만 감소했다.
벤치마크의 한계
SWE-bench는 테스트 실행 후 오류를 수정할 수 있는 환경이지만, UiPath의 내부 체크는 숨겨져 있어 초기 단계의 오류가 최종 실패로 이어진다. 이는 짧은 태스크에서는 Haiku도 충분히 경쟁력이 있으나, 다단계 에이전트 작업에서는 상위 모델의 필요성이 급격히 높아짐을 시사한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.