AI 스타트업 Hark, 첫 제품 공개: 저렴하고 빠른 컴퓨터 사용 에이전트 Hark Handoff (7분 읽기)
핵심 내용
AI 스타트업 Hark가 웹 작업을 자동화하는 컴퓨터 사용 에이전트 Handoff를 공개했다.
자세히 보기
AI 스타트업 Hark가 사용자를 대신해 웹사이트를 탐색하고 작업을 수행하는 컴퓨터 사용 에이전트(CUA) Hark Handoff를 공개했다. Handoff는 DoorDash에서 음식 주문, United·Delta 항공편 예약, LinkedIn 구직자 메시지 발송 등을 처음부터 끝까지 자율적으로 처리한다. 공개 가입은 Hark.com에서 시작됐으며, 초기 소프트웨어 플랫폼은 이달 말 출시될 예정이다.
Hark에 따르면 Handoff는 웹 에이전트 벤치마크 **Online-Mind2Web(OM2W)**에서 97.7점을 기록했다.
- Handoff: 97.7점
- OpenAI GPT 5.4: 92.8점
- Anthropic Claude Opus 4.8: 84.1점
- Google Gemini 2.5 Pro: 69점
모델 제공 비용은 입력 토큰 100만 개당 0.18달러, 출력 토큰 100만 개당 2.37달러로, Hark가 비교한 GPT 5.5의 5달러·30달러보다 낮다. 턴당 모델 지연 시간은 0.8초라고 회사는 설명했다.
각 요청마다 Handoff는 브라우저, 파일 시스템, 터미널을 갖춘 전용 가상 컴퓨터를 생성한다. 사용자는 기존 계정을 연결해 저장된 주소, 결제 수단, 이용 기록을 활용하도록 할 수 있다. Hark는 일상적인 스크린타임의 75%가 브라우저에서 발생하지만, 공개 API를 제공하는 웹사이트는 1,000곳 중 1곳도 되지 않아 에이전트 자동화가 어렵다고 지적했다.
다만 성능 비교에는 한계가 있다. Hark가 제시한 OM2W 비교에는 최신 모델인 OpenAI GPT-5.6과 Anthropic Opus 5, DeepSeek V4·Kimi K3·Qwen3.8-Max 등이 포함되지 않았다. 이들 모델의 OM2W 결과가 공개되지 않았기 때문에 Hark의 ‘역대 최고’ 주장은 현재 최강 시스템과 직접 검증하기 어렵다.
Hark 자체 비교에서도 WebTailBench v2에서는 GPT 5.5가 72.3점으로 Handoff의 68.6점을 앞섰다. 또한 WebTailBench와 내부 평가 중 두 가지는 Hark의 자체 테스트 환경과 내부 LLM 평가자를 사용했으며, 경쟁 모델의 지연 시간 역시 Hark가 자체 환경에서 가장 느린 추론 설정으로 측정했다.
가격 경쟁력은 비교적 명확하다. Anthropic의 최신 Opus 5도 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러 수준이므로, Handoff가 제시한 비용 절감 효과는 최신 모델과 비교해도 유지될 가능성이 있다. Hark는 사전 지도학습과 GRPO 알고리즘을 활용한 비동기 강화학습을 결합해 모델을 훈련했다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.