모델이 필요 이상으로 코드를 수정하는 현상, 오버-에디팅
·2026.04.23 02:51
핵심 내용
코드 수정 LLM이 최소 수정 대신 과도하게 리라이트하는 문제를 측정했다.
1 / 2
자세히 보기
AI 코딩 도구가 버그 하나를 고치면서도 함수 전체를 다시 쓰는 over-editing 문제를 다룬다.
- 최소 수정이 필요한 브라운필드 코드에서, 모델이 필요 이상의 구조 변경을 하면 리뷰 비용이 크게 늘어난다.
- 저자는 BigCodeBench의 400개 문제를 프로그램적으로 오염시켜, 정답 수정이 사실상 원래 변경을 되돌리는 최소 패치가 되도록 실험을 설계했다.
- 평가에는 token-level Levenshtein distance, Pass@1, Added Cognitive Complexity를 사용했다.
- 결과적으로 최신 모델들도 과도하게 수정하는 경향을 보였다. 특히 GPT-5.4는 diff가 크고 복잡도가 많이 증가했으며, Claude Opus 4.6은 높은 정답률과 더 작은 diff를 보였다.
- 프롬프트에 "원래 코드를 최대한 보존하라"는 지시를 추가하면 모든 모델이 더 적게 고치고, 대체로 정답률도 좋아졌다.
- 기본 상태에서는 많은 reasoning model이 non-reasoning 모델보다 더 많이 over-edit했지만, 보존 제약을 주면 오히려 더 정밀하게 고쳤다.
핵심 결론은 정확성만으로는 충분하지 않으며, 코드 편집 모델은 "맞는 답"뿐 아니라 얼마나 적게 바꾸는지까지 함께 봐야 한다는 점이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.