AI Briefing

Anthropic, 지연 시간과 비용 절감하는 커머스 에이전트 가이드 및 구현체 공개

·2026.09.02 09:00

핵심 내용

Anthropic이 지연 시간과 비용을 줄이는 단일 에이전트 기반 커머스 에이전트 가이드를 공개했다.

1 / 9

자세히 보기

Anthropic이 온라인 구매 및 판매를 간소화하는 commerce agent 구축을 위한 종합 가이드와 참고 구현체를 공개했습니다. 핵심 아키텍처 권장 사항은 intent router나 subagent 대신 agent skills를 갖춘 single-agent model을 사용하는 것입니다. 이 방식은 다중 턴 대화에서 공유된 컨텍스트를 유지하여 subagent 전환 시 발생하는 상태 손실, 토큰 비용 증가, 지연 시간을 방지합니다.

아키텍처 및 툴링

가이드는 빈도 기준으로 system prompt와 skills를 구분합니다. 트래픽의 3분의 1 이상과 관련된 내용은 system prompt에 포함하고, 롱테일 기능은 skills로 로드합니다. UI 상호작용의 경우 커스텀 마크업 대신 UI components를 tools로 취급할 것을 권장합니다(예: present_products). 이를 통해 서버가 데이터를 검증 및 보강하고, 메시지 히스토리의 네이티브 포맷팅을 보장하며, 에이전트가 후속 참조를 위해 화면 상태를 추적할 수 있습니다.

지연 시간 및 비용 최적화

end-to-end latency를 최소화하기 위해 턴 수 감소, 빠른 툴, 빠른 토큰 생성이라는 세 가지 레버를 제시합니다. 예상 컨텍스트 사전 로드, 병렬 툴 호출, 인자 스트리밍 시 툴 즉시 디스패치 등의 전략을 사용합니다. perceived latency를 개선하려면 컴포넌트 형성 시 스트리밍하고 컨텍스트 수집 중 진행 상황 라인을 표시하는 것이 좋습니다. Prompt caching은 가장 큰 비용 절감 기회로, 캐시된 입력 토큰 비용은 신규 토큰의 1/10 수준입니다. 요청을 Global, Session, Volatile 세그먼트로 구조화하여 90–99% cache hit rate를 달성하는 것이 최적 배포의 목표입니다.

프로덕션 운영

프로덕션 환경에서는 대화 지연 시간에 영향을 주지 않도록 memory를 외부에 저장하고 비동기적으로 기록해야 하며, 항상 컨텍스트 포함, 사전 페치, 조회 툴의 3단계 읽기 전략을 사용합니다. Safety 강제 사항은 프롬프트가 아닌 harness에서 이루어져야 합니다. 모델이 작업을 제안하면 서버 발급 ID와 엄격한 검증을 통해 인간 또는 정책이 이를 적용합니다. Evals는 에이전트 경로가 아닌 최종 상태와 렌더링된 응답에 초점을 맞춰야 하며, 스냅샷 기반 테스트와 시뮬레이션 사용자 검사를 통해 커버리지 공백을 확인합니다. 가이드는 SME와의 협업을 통해 핵심 요청, 컨텍스트 의존성, 안전성, 다중 기능 시나리오를 포함해 사용자 플로우당 50–100개의 eval 케이스를 구축할 것을 강조합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.