AI Briefing

Ora, Vercel에서 주요 AI 에이전트 모두 벤치마킹하는 방법

·2026.08.22 03:31

핵심 내용

Ora는 Vercel 인프라 위에서 주요 AI 에이전트를 실시간 웹사이트에서 비교 테스트하는 플랫폼을 구축했다.

자세히 보기

Ora는 AI 에이전트가 실제 웹사이트에서 제품 가입, 통합, 결제까지 수행할 수 있도록 지시하고, 실패 원인을 분석하는 벤치마킹 플랫폼이다. 공동 창업자 Assaf Elovic는 에이전트가 웹을 탐색하는 것만으로는 부족하며, 실제로 제품을 사용할 수 있는지를 측정해야 한다고 판단해 Ora를 설립했다.

Ora는 Claude Code, ChatGPT, Gemini, Hermes, OpenClaw, 그리고 Vercel의 에이전트 프레임워크인 eve를 포함해 주요 에이전트들을 동시에 테스트한다. 각 에이전트(하니스)는 고유한 인프라와 실행 환경을 요구하므로, Ora는 각각 독립된 런타임을 운영하며 모든 단계를 추적한다. 이를 통해 고객이 에이전트가 어떤 단계에서 실패했는지 명확히 파악할 수 있다.

전체 시스템은 Vercel 위에 구축되어 프론트엔드, 백엔드, 에이전트 런타임이 동일한 배포 경로, 로그, 인증 체계를 공유한다. Vercel이 eve를 출시했을 때 Ora는 다른 에이전트와 동일한 조건으로 벤치마크를 진행했다.

eve와 Claude Code를 비교한 결과, eve는 다음과 같은 성과를 보였다:

  • 목표 달성까지 7% 적은 단계
  • 웹 검색으로 전환하지 않고 고객 사이트에서 직접 완료한 비율이 2배 높음
  • 실제로 호출 가능한 유효한 엔드포인트 발견률이 9% 높음

벤치마크 과정에서 발견된 프롬프트 캐싱 문제를 수정한 후, eve의 총 비용은 약 15% 감소했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.