AI Briefing

Real-SWE 벤치마크, AI 코딩 에이전트의 불명확한 요구사항 처리 한계 드러나

·2026.09.14 09:00

핵심 내용

Real-SWE 벤치마크 평가 결과, AI 코딩 에이전트들이 불명확한 요구사항 처리에서 검증되지 않은 가정과 요구사항 누락으로 인해 낮은 해결률을 보인 것으로 나타났다.

1 / 2

자세히 보기

Real-SWE 벤치마크는 실제 엔터프라이즈 코드베이스 환경에서 AI 코딩 에이전트의 성능을 평가했다. 평가에 사용된 태스크들은 Multi-region sweep, Tax jurisdiction, Analytics stream reducer 등 복잡한 비즈니스 로직을 포함하며, 모델들은 명시되지 않은 요구사항을 추론해야 하는 상황에 직면했다.

실패 분석 결과, 가장 빈번한 실패 원인은 '검증되지 않은 가정(Unverified assumption)'과 '요구사항 누락(Missed requirement)'으로 나타났다. 태스크별 해결률(Task Resolution Rate)을 살펴보면, Multi-region sweep에서는 67.2%의 비교적 높은 해결률을 보였으나, Tax jurisdiction(3.1%), Analytics stream reducer(0.0%) 등 복잡한 태스크에서는 해결률이 급락했다. 특히 일부 태스크에서는 모든 모델이 실패하거나 극히 일부만 성공했다.

모델별 성능을 비교하면, GPT-6 Astra와 Gemini 3.8 Flash는 Multi-region sweep에서 8/8의 해결률을 기록하며 높은 성능을 보인 반면, GLM 5.3과 Kimi K3는 같은 태스크에서 2/8의 낮은 해결률을 기록했다. Grok 4.6은 Linearizable scan과 Analytics stream reducer에서 각각 261k, 315k의 높은 토큰 사용량을 기록했으나 해결에는 실패하거나 낮은 성능을 보였다. 이는 모델이 복잡한 추론 과정에서 과도한 토큰을 소모하면서도 불명확한 요구사항을 정확히 처리하지 못하는 한계를 시사한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.