AI Briefing

AI 에이전트 실전력

ClawBench: Can AI Agents Complete Everyday Online Tasks? 153 tasks, 144 live websites, best model at 33.3% [R]

·2026.04.15 02:21

핵심 내용

153개 웹 작업 벤치마크에서 최고 모델도 33.3%에 그쳤다.

자세히 보기

ClawBench는 AI agents가 일상적인 온라인 작업을 실제 웹 환경에서 얼마나 수행하는지 평가하는 benchmark다.

153개 task와 144개 live websites를 사용해, 단순한 정적 테스트가 아니라 실제 서비스 상호작용 능력을 본다.

결과는 꽤 냉정하다. **최고 모델의 성공률은 33.3%**로, 현재 에이전트가 실사용 수준의 웹 작업을 안정적으로 끝내기엔 아직 부족하다는 점을 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.