Senior SWE-Bench의 LOC 임계값과 LLM 채점 분산, napkin-math의 SSD 성능 수치 비판
핵심 내용
Senior SWE-Bench의 LOC 임계값 효과와 LLM 채점의 높은 분산, napkin-math의 비현실적인 SSD 성능 수치를 비판하며 벤치마크 신뢰성 문제를 제기했다.
자세히 보기
AI 벤치마크 Senior SWE-Bench와 하드웨어 성능 계산 도구 napkin-math의 데이터 정확성 및 평가 방식에 대한 비판적 분석이 제시되었다. 저자는 Senior SWE-Bench의 LOC(코드 줄 수) 기반 평가가 임의적인 임계값으로 인해 연속적인 코드 품질을 이진 분류로 왜곡한다고 지적한다. 예를 들어, 참조 코드가 61 LOC일 때 121 LOC는 통과하지만 122 LOC는 실패로 처리되는 불연속적 컷오프가 존재한다. 또한, LLM 기반 채점의 높은 분산을 지적하며, 동일한 조건에서 채점을 반복할 경우 공식 결과와 다른 점수가 나올 확률이 약 20%에 달한다고 밝혔다. 이는 Claude Fable 5, Opus 4.8, GPT-5.6 Sol 등 주요 모델 평가에서 일관성 없는 결과를 초래할 수 있다.
napkin-math 도구의 경우, 랜덤 SSD 읽기 성능을 100 us / 70 MB/s로 제시한 것이 부적절하다고 비판한다. 저자는 Kioxia CD9P-R 등 고속 SSD가 약 30 us의 지연을 보이며, queue depth와 job 수에 따라 편차가 크다는 점을 근거로 단순화된 수치가 유용하지 않다고 주장한다. 특히 Google Cloud의 c4-standard-48-lssd 측정치인 8 GiB/s는 공식 문서의 최대 5000 MiB/s 대비 과도하게 높아, 측정 과정에서 오류나 캐시 읽기 등이 발생했을 가능성을 시사한다. 이러한 수치적 문제와 평가 방식의 한계는 벤치마크 헤드라인 점수의 신뢰성을 떨어뜨린다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.