안전 제어장치
핵심 내용
ElevenLabs가 음성 에이전트용 Guardrails 2.0으로 실시간 안전·준수 통제를 강화했다.
자세히 보기
ElevenAgents의 Guardrails 2.0은 음성 에이전트가 대화 중에 안전성, 브랜드 일관성, 규정 준수를 유지하도록 돕는 새 제어층이다. 시스템 프롬프트만으로는 부족하므로, 사용자 입력과 에이전트 응답을 독립적으로 점검하는 다층 방어 구조를 전제로 설계됐다.
기본 제공 보호 기능은 세 가지다.
- Focus Guardrail: 시스템 프롬프트를 보강해 응답이 목표와 지침에서 벗어나지 않게 유지
- Manipulation Guardrails: 프롬프트 인젝션이나 지시 덮어쓰기 시도를 탐지하고 차단
- Content Guardrails: 민감하거나 위험한 콘텐츠를 여러 범주로 검사하고, 임계값을 세밀하게 조정
여기에 Custom Guardrails를 더해 자연어로 정의한 도메인 정책을 모든 호출에 자동 적용할 수 있다. 경량 모델이 각 응답을 별도로 평가해 allow / block 결정을 내리며, 응답 생성과 병렬로 동작해 지연을 최소화한다.
운영 방식도 세밀하게 조정할 수 있다. 가드레일을 응답과 함께 실행해 거의 지연 없이 처리하거나, 완전히 통과한 뒤 응답을 내보내는 방식으로 strictness와 latency를 맞바꿀 수 있다. 위반 시에는 대화 종료, 다른 에이전트로 전환, 사람에게 에스컬레이션, 수정 지시를 붙여 재시도 같은 exit strategy를 선택할 수 있다.
또한 Content sensitivity levels, 개별 가드레일의 활성화/비활성화, 에이전트별 상이한 설정, 트리거와 조치 로그를 남기는 complete visibility도 제공한다. 대화가 끝난 뒤에는 전사본·녹음·웹훅 payload에서 민감 정보를 Conversation History Redaction으로 마스킹할 수 있고, 이는 Zero Retention Mode와 함께 더 강한 컴플라이언스 요구에 대응한다.
이 기능들은 enterprise 고객 대상이며, 현재 alpha로 제공된다. Security 탭에서 켜거나 API로 설정할 수 있고, 더 넓게는 AIUC-1 인증과 에이전트 보험 프로그램 지원 기반에도 해당한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.