METR AI 타임 호라이즌 그래프의 심각한 오류 지적
The famous METR AI time horizons graph contains numerous severe errors [D]
·2026.05.26 03:30
METR의 AI 타임 호라이즌 그래프가 데이터 편향 및 측정 오류 등 심각한 결함을 가지고 있다는 비판이 제기되었다.
NYU Stern의 연구원 Nathan Witkin은 Substack의 'Transformer'를 통해 **METR(Model Evaluation and Threat Research)**의 'Long Tasks' 벤치마크 그래프가 신뢰할 수 없다고 강력히 비판했다.
주요 지적 사항은 다음과 같다:
- 데이터 일반화 오류: 소수의 연구진 동료로부터 수집된 데이터를 전체 인류의 데이터로 일반화함.
- 근거 없는 휴먼 베이스라인: 일부 인간 기준 데이터가 실제 측정값이 아닌 추측에 기반함.
- 측정 방식의 결함: 인간 벤치마커에게 시간당 임금을 지급함으로써, 작업 시간을 의도적으로 늘리도록 유도함.
- 표본 편향: 벤치마커 샘플이 METR 직원의 지인이나 동료로 구성되어 대표성이 결여됨.
Witkin은 이러한 오류들이 복합적으로 작용하여 결과의 신뢰성을 완전히 무너뜨린다고 주장하며, 해당 연구를 바탕으로 결론을 도출하는 것을 경계해야 한다고 강조했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.