골드 같은 답변이 만드는 벤치마크 왜곡
LLM judge가 ‘골드처럼 보이는’ 패치를 선호해 벤치마크 점수를 왜곡했다.
Maestro의 코딩 에이전트 평가에서 쓰는 reducer가 예상보다 높은 성능을 보이자, 처음에는 SWE-bench Verified 데이터 오염을 의심했다. 하지만 더 최근 데이터셋인 SWE-rebench에서도 같은 편향이 재현되면서, 문제의 핵심은 단순한 기억이 아니라 골드 답변처럼 보이는 패치를 선호하는 성향이라는 점이 드러났다.
이 reducer는 여러 에이전트가 만든 패치 후보 중 하나를 고르는 LLM judge다. 저자들은 Claude Opus 4.5를 사용해 “정확성만 보고 코드 품질이나 스타일은 보지 말라”는 짧은 프롬프트로 기본 reducer를 만들었고, 400개의 reducer-relevant 예제를 대상으로 평가했다.
의심을 검증하기 위해 예제를 두 종류로 나눴다.
- positive vs. negative: 긍정 후보와 부정 후보를 무작위로 구성
- gold vs. negative: 같은 부정 후보에 실제 gold patch를 넣어 비교
그 결과, reducer는 gold vs. negative에서 훨씬 더 높은 정확도를 보였다. 그러나 같은 실험을 SWE-rebench의 169개 reducer-relevant 예제로 반복해도 동일한 격차가 나타나, 이 현상이 반드시 특정 답안을 외운 결과는 아니라는 결론에 도달했다.
저자들이 내린 해석은 이렇다. 모델은 패치의 내용을 기억한 것이 아니라, gold patch의 전형적인 특징인 minimality, clarity, focused change 같은 표면적 특성을 학습했을 가능성이 크다. 실제로 예시에서는 gold patch보다 에이전트가 만든 정답 패치가 약 50% 더 많은 줄을 수정했는데도, reducer는 더 깔끔하고 작은 변경을 선호하는 경향을 보였다.
즉, SWE-bench류 평가에서는 “깔끔함”이 곧 정답이 아니다. 숨은 테스트를 통과하는 것이 기준이기 때문에, clean하지만 틀린 패치가 messy하지만 맞는 패치보다 더 높게 평가될 수 있다.
이를 완화하기 위해 저자들은 reducer 프롬프트를 여러 차례 다듬어, 스타일보다 실질적 정답성을 우선하도록 구체적인 우선순위 규칙을 넣었다. 결론적으로, 코딩 벤치마크의 왜곡 요인은 데이터 오염만이 아니라, “골드처럼 보이는 답”을 선호하는 평가 모델의 내재적 편향까지 포함해야 한다는 점을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.