METR AI 발전 그래프 오류 지적
The famous METR AI time horizons graph contains numerous severe errors
·2026.05.27 14:43
AI 발전 속도 논의의 핵심 근거인 METR 그래프가 심각한 방법론적 오류를 포함하고 있다는 비판이 제기되었다.
AI의 급격한 발전을 뒷받침하는 근거로 자주 인용되는 METR의 Long Tasks 벤치마크 그래프가 신뢰할 수 없다는 지적이 나왔다.
NYU Stern의 연구 작가 Nathan Witkin은 해당 그래프가 복합적인 오류로 인해 유의미한 결론을 도출하기 불가능하다고 비판했다. 주요 오류 사항은 다음과 같다.
- 표본의 일반화 오류: 소수의 연구진 동료로부터 수집된 데이터를 전체 데이터로 일반화함.
- 검증되지 않은 휴먼 베이스라인: 일부 인간 기준 데이터가 실제 측정된 것이 아니라 저자들에 의해 추정됨.
- 데이터 편향: 인간 벤치마커들에게 시간당 보상을 지급함으로써, 작업 완료 시간에 대한 데이터가 인센티브에 의해 왜곡됨.
Witkin은 이 그래프가 지나치게 매끄럽고 복잡해 보이지만, 오류가 너무 많아 폐기하고 더 높은 품질의 정보를 찾아야 한다고 주장했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.