AI Briefing

SlopCodeBench 연구: AI 생성 코드는 인간 코드 대비 중복·복잡도 2배 높아

·2026.09.10 09:00

핵심 내용

SlopCodeBench 연구 결과, AI 에이전트 생성 코드는 인간 코드보다 중복과 복잡도가 약 2배 높으며 최신 모델도 엄격한 테스트에서 0% 통과율을 기록함.

자세히 보기

AI 코딩 도구가 확산되면서 코드 생성 정확도는 높아졌으나, 불필요한 추상화, 중복, 잘못된 의사결정 등 'sloppiness(부정확성/지저분함)' 문제가 대두되고 있다. Sebastian(Earendil)은 물리학 배경을 바탕으로 이러한 코드 품질 저하를 정량적으로 측정하는 SlopCodeBench 프레임워크를 제안했다.

새로운 측정 지표: Verbosity와 Erosion

기존의 'vibes based' 평가 방식의 한계를 극복하기 위해 두 가지 객관적 지표를 도입했다.

  • Verbosity(장황함): AST-Grep으로 검출된 라인 및 중복(clone) 라인의 비율을 측정한다. 공식은 (AST-Grep flagged lines ∪ clone lines) / LOC이다.
  • Erosion(침식): 코드베이스의 질량(mass)이 복잡하고 큰 함수에 얼마나 집중되어 있는지를 나타낸다. 질량 mass(f) = CC(f) * √SLOC(f) (CC: 순환 복잡도, SLOC: 소스 라인 수)로 정의되며, CC>10인 함수들의 질량 합 대 전체 질량 합으로 계산된다.

평가 결과: AI 코드의 품질 열위 확인

SlopCodeBench를 통해 기존 레거시 저장소(Repos)와 AI 에이전트 생성 코드(Agents)를 비교한 결과, AI 코드가 인간 코드보다 평균적으로 약 2배 더 verbose하고 eroded한 것으로 나타났다.

  • Verbosity: Repos 0.15 ± 0.06 vs Agents 0.33 ± 0.10
  • Erosion: Repos 0.31 ± 0.17 vs Agents 0.68 ± 0.20

또한, 실제 인간 개발자의 반복적인 코딩 프로세스를 모방하여 여러 라운드에 걸쳐 지시사항을 주고 컨텍스트를 지우는 방식으로 테스트한 결과, GPT 5.6 sol xhigh 등 최신 SOTA 모델조차 모든 체크포인트에서 테스트를 통과하는 **Strict solve rate가 0%**를 기록했다. 이는 AI가 생성한 코드가 시간이 지남에 따라 나쁜 결정이 누적되어 품질이 급격히 저하될 수 있음을 시사한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.