AI Briefing

GPT-6 Astra, 로봇 조작 태스크에서 Claude Fable 대비 성공률 95%·비용 2.3배 절감

·2026.09.04 09:00

핵심 내용

GPT-6 Astra가 로봇 블록 넣기 태스크에서 95% 성공률과 2.3배 낮은 비용으로 Claude Fable 5.1을 앞섰다.

자세히 보기

OpenAI의 GPT-6 Astra가 로봇 조작 벤치마크에서 Anthropic의 Claude Fable 5.1 대비 압도적인 성능과 효율성을 입증했다. Bowl 태스크(블록을 그릇에 넣기)에서 Astra는 95%(19/20)의 성공률을 기록한 반면, Fable 5.1은 40%(8/20), Fable 5는 5%(1/20)에 그쳤다.

성능 및 비용 효율성

Astra는 작업 완료율뿐만 아니라 자원 사용량에서도 큰 우위를 점했다. Bowl 태스크 기준 Astra의 평균 소요 시간은 2.5분, 토큰 사용량은 2.1k였으며, 비용은 $0.94로 집계됐다. 이는 Fable 5.1의 6.8분, 12.9k 토큰, $2.12 비용 대비 각각 2.4배 높은 완료율과 2.3배 낮은 비용을 의미한다.

복잡한 태스크에서의 한계

반면 Puzzle 태스크(퍼즐 조각을 홈에 끼우기)에서는 두 모델 모두 낮은 성공률을 보였다. Astra와 Fable 5.1 모두 10%(2/20)의 성공률을 기록했으며, Fable 5는 0%였다. 다만 Astra는 여전히 Fable 5.1 대비 더 적은 토큰(2.7k vs 12.9k)과 낮은 비용($1.36 vs $2.18)을 소요했다.

실험 환경 및 제한 사항

실험은 Inspect Robots 0.58.0 하네스와 YAM arms(6-DoF, 병렬 집게)를 사용하여 진행됐다. 각 모델은 태스크당 20회 시도를 수행했으며, 정책은 'medium thinking'과 20회 LLM 호출 예산으로 설정됐다. 다만 Astra와 Fable의 실행 시차가 존재하고 Bowl 태스크 비교 시 로봇 리그(rig)가 달라 비대칭적이라는 점, 그리고 평가자의 무의식적 편향 가능성이 제한 사항으로 지적됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.