OpenAI GPT-6 Astra 99.9% 점수는 하네스 효과…ARC Prize는 AGI 선언 거부
핵심 내용
OpenAI가 AGI 근거로 제시한 GPT-6 Astra의 99.9% 점수는 자체 하네스 결과이며, 표준 하네스에서는 62.7%로 나타나 ARC Prize가 AGI 선언을 거부했다.
자세히 보기
OpenAI가 GPT-6 Astra의 ARC-AGI-3 벤치마크 점수 99.9%를 근거로 AGI 시대를 선언했으나, ARC Prize가 공개한 데이터에 따르면 이는 모델 자체의 능력이 아닌 하네스(harness) 차이에 기인한 것으로 나타났다. ARC Prize의 표준 하네스 환경에서 Astra의 점수는 **62.7%**에 그쳤으며, OpenAI가 사용한 자체 어댑터(Adapter) 환경에서만 99.9%를 기록했다.
하네스 스캐폴딩이 추론 강도보다 영향력 커
두 하네스 간 점수 차이는 모델 주변 소프트웨어인 하네스의 도구, 메모리, 컨텍스트 관리 방식에서 발생했다. 특히 OpenAI 어댑터에서 추론 설정을 'none'으로 두었을 때 Astra는 **96.7%**를 기록해, 표준 하네스의 최대 추론 설정 점수(62.7%)보다 34포인트 높았다. 이는 스캐폴딩이 추론 강도보다 성능에 더 큰 영향을 미친다는 점을 시사한다.
또한 OpenAI 어댑터 환경은 표준 하네스보다 비용이 더 저렴했다. Astra 기준 표준 하네스(최대 추론) 비용은 $26,098인 반면, OpenAI 어댑터(높은 추론) 비용은 $18,817로 더 높은 점수를 더 낮은 비용으로 달성했다. 어댑터는 불투명한 추론 상태 유지와 대화 압축 기능을 포함하고 있다.
AGI 선언 거부 및 벤치마크 신뢰성 논란
ARC Prize는 이러한 점수 차이를 근거로 OpenAI의 AGI 선언을 공식적으로 거부했다. 공동 설립자 Simon Willison과 François Chollet은 모델 자체의 능력과 조립된 시스템(assembled system)의 성능을 구분해야 한다고 지적했다. 실제로 판매되는 것은 '모델'이지만, 99.9% 점수를 낸 것은 '조립된 시스템'이라는 것이다.
벤치마크 점수의 변동성도 문제로 지적됐다. ARC Prize는 게시 후 점수를 변경했으며, Fortune 보도에 따르면 Astra의 hallucination 점수는 4.2%에서 51%로 급변하는 등 수정 사항이 명시되지 않은 채 변경됐다. Stanford 연구자들은 이러한 관행을 **'benchmaxxing'**이라 명명하며, 조건을 바꿔가며 점수가 개선될 때까지 재실행하는 행태를 비판했다.
독립적 검증과 모델 능력의 간극
Artificial Analysis의 독립 테스트 결과, Astra는 Coding Agent Index에서 Claude Opus 5, Fable 5와 동률(67점)을 기록했으며, Intelligence Index에서는 61점으로 Fable 5.1보다 5점 낮았다. 가격 역시 입력 토큰당 $10, 출력 토큰당 $50으로 Sol 대비 2.5배 비쌌다.
결국 벤치마크는 모델의 실제 능력과 제3자가 독립적으로 검증 가능한 성능 사이의 간극을 드러냈다. OpenAI는 게시물을 내렸다가 재게시했으나 이유를 비공개했으며, 평가에는 체크포인트와 실행 환경에 따라 몇 퍼센트 포인트의 노이즈가 존재한다고 해명했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.