Ora, Vercel에서 주요 AI 에이전트 모두 벤치마킹하는 방법
핵심 내용
Ora는 Vercel 인프라 위에서 주요 AI 에이전트를 실시간 웹사이트에서 비교 테스트하는 플랫폼을 구축했다.
자세히 보기
Ora는 AI 에이전트가 실제 웹사이트에서 제품 가입, 통합, 결제까지 수행할 수 있도록 지시하고, 실패 원인을 분석하는 벤치마킹 플랫폼이다. 공동 창업자 Assaf Elovic는 에이전트가 웹을 탐색하는 것만으로는 부족하며, 실제로 제품을 사용할 수 있는지를 측정해야 한다고 판단해 Ora를 설립했다.
Ora는 Claude Code, ChatGPT, Gemini, Hermes, OpenClaw, 그리고 Vercel의 에이전트 프레임워크인 eve를 포함해 주요 에이전트들을 동시에 테스트한다. 각 에이전트(하니스)는 고유한 인프라와 실행 환경을 요구하므로, Ora는 각각 독립된 런타임을 운영하며 모든 단계를 추적한다. 이를 통해 고객이 에이전트가 어떤 단계에서 실패했는지 명확히 파악할 수 있다.
전체 시스템은 Vercel 위에 구축되어 프론트엔드, 백엔드, 에이전트 런타임이 동일한 배포 경로, 로그, 인증 체계를 공유한다. Vercel이 eve를 출시했을 때 Ora는 다른 에이전트와 동일한 조건으로 벤치마크를 진행했다.
eve와 Claude Code를 비교한 결과, eve는 다음과 같은 성과를 보였다:
- 목표 달성까지 7% 적은 단계
- 웹 검색으로 전환하지 않고 고객 사이트에서 직접 완료한 비율이 2배 높음
- 실제로 호출 가능한 유효한 엔드포인트 발견률이 9% 높음
벤치마크 과정에서 발견된 프롬프트 캐싱 문제를 수정한 후, eve의 총 비용은 약 15% 감소했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.