SlopCodeBench 연구: AI 생성 코드는 인간 코드 대비 중복·복잡도 2배 높아
·2026.09.10 09:00
핵심 내용
SlopCodeBench 연구 결과, AI 에이전트 생성 코드는 인간 코드보다 중복과 복잡도가 약 2배 높으며 최신 모델도 엄격한 테스트에서 0% 통과율을 기록함.
자세히 보기
AI 코딩 도구가 확산되면서 코드 생성 정확도는 높아졌으나, 불필요한 추상화, 중복, 잘못된 의사결정 등 'sloppiness(부정확성/지저분함)' 문제가 대두되고 있다. Sebastian(Earendil)은 물리학 배경을 바탕으로 이러한 코드 품질 저하를 정량적으로 측정하는 SlopCodeBench 프레임워크를 제안했다.
새로운 측정 지표: Verbosity와 Erosion
기존의 'vibes based' 평가 방식의 한계를 극복하기 위해 두 가지 객관적 지표를 도입했다.
- Verbosity(장황함): AST-Grep으로 검출된 라인 및 중복(clone) 라인의 비율을 측정한다. 공식은
(AST-Grep flagged lines ∪ clone lines) / LOC이다. - Erosion(침식): 코드베이스의 질량(mass)이 복잡하고 큰 함수에 얼마나 집중되어 있는지를 나타낸다. 질량
mass(f) = CC(f) * √SLOC(f)(CC: 순환 복잡도, SLOC: 소스 라인 수)로 정의되며,CC>10인 함수들의 질량 합 대 전체 질량 합으로 계산된다.
평가 결과: AI 코드의 품질 열위 확인
SlopCodeBench를 통해 기존 레거시 저장소(Repos)와 AI 에이전트 생성 코드(Agents)를 비교한 결과, AI 코드가 인간 코드보다 평균적으로 약 2배 더 verbose하고 eroded한 것으로 나타났다.
- Verbosity: Repos 0.15 ± 0.06 vs Agents 0.33 ± 0.10
- Erosion: Repos 0.31 ± 0.17 vs Agents 0.68 ± 0.20
또한, 실제 인간 개발자의 반복적인 코딩 프로세스를 모방하여 여러 라운드에 걸쳐 지시사항을 주고 컨텍스트를 지우는 방식으로 테스트한 결과, GPT 5.6 sol xhigh 등 최신 SOTA 모델조차 모든 체크포인트에서 테스트를 통과하는 **Strict solve rate가 0%**를 기록했다. 이는 AI가 생성한 코드가 시간이 지남에 따라 나쁜 결정이 누적되어 품질이 급격히 저하될 수 있음을 시사한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.