AI Briefing

ServiceNow-AI, 에이전트용 안전 모델 AprielGuard 공개

AprielGuard: A Guardrail for Safety and Adversarial Robustness in Modern LLM Systems

·2025.12.23 23:07

에이전트 워크플로우의 보안과 안전을 위해 설계된 8B 파라미터 가드레일 모델 AprielGuard가 공개되었다.

LLM이 단순 텍스트 어시스턴트를 넘어 도구 사용 및 추론이 가능한 에이전트(Agentic) 시스템으로 진화함에 따라, 기존의 단일 메시지 기반 안전 분류기로는 대응하기 어려운 새로운 위협이 등장하고 있습니다.

AprielGuard는 이러한 변화에 대응하기 위해 설계된 8B 파라미터 규모의 안전 및 보안 가드레일 모델입니다.

주요 기능 및 특징:

  • 광범위한 탐지 범위: 16가지 안전 위험 카테고리(독성, 허위 정보, 불법 활동 등)와 프롬프트 인젝션, 탈옥(Jailbreak), 메모리 포이즈닝, 도구 조작 등 다양한 적대적 공격을 탐지합니다.
  • 에이전트 워크플로우 최적화: 단순 프롬프트뿐만 아니라 멀티턴 대화, 긴 컨텍스트, 도구 호출(Tool calls), 추론 과정(Reasoning traces)을 포함한 복잡한 에이전트 환경을 지원합니다.
  • 두 가지 운영 모드: 설명 가능한 분류가 필요한 경우를 위한 Reasoning 모드와 프로덕션 환경의 저지연성을 위한 Non-reasoning 모드를 모두 제공합니다.

이 모델은 현대적인 LLM 에이전트 생태계에서 발생하는 복잡한 보안 위협을 통합적으로 관리할 수 있는 솔루션을 제공합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.