AI Briefing

제품 전반에서 Claude를 격리하는 방식들

·2026.06.05 09:02

Anthropic이 Claude 에이전트의 오작동과 오용에 따른 피해를 방지하기 위해 적용 중인 세 가지 격리 아키텍처를 설명한다.

에이전트의 능력이 커질수록 잠재적 피해 반경이 확대되므로, Anthropic은 행동을 감독하는 Human-in-the-loop 방식의 한계(승인 피로 등)를 극복하기 위해 에이전트의 권한 자체를 제한하는 Containment(봉쇄) 아키텍처를 구축하고 있다.

위험 유형 및 방어 계층 위험은 사용자 오용, 모델 오작동, 외부 공격자로 분류된다. 이를 방어하기 위해 세 가지 계층을 활용한다:

  • 실행 환경: 샌드박스, VM, 파일시스템 경계 및 이그레스(egress) 제어를 통해 물리적/논리적 경계를 설정한다.
  • 모델 계층: 시스템 프롬프트와 학습을 통해 모델의 경향성을 조정한다.
  • 외부 콘텐츠: MCP 서버나 서드파티 플러그인 등 외부 소스가 컨텍스트에 주입될 때의 위험을 관리한다.

제품별 격리 패턴

  • 임시 컨테이너 (claude.ai): 코드 실행 시 gVisor 컨테이너를 사용하여 서버 측에서 격리된 환경을 제공한다. 파일시스템은 세션별로 **휘발성(ephemeral)**으로 운영되어 피해 반경을 최소화한다.
  • 사람 개입 샌드박스 (Claude Code): 사용자 로컬 환경에서 실행되는 특성을 고려하여 macOS의 Seatbelt, Linux의 bubblewrap 같은 OS 수준의 샌드박스를 도입했다. 이를 통해 권한 승인 프롬프트를 84% 감소시키며 승인 피로도를 해결했다.

핵심 교훈은 모델 계층보다 환경 계층에서 먼저 봉쇄를 설계해야 하며, 직접 만든 커스텀 구성 요소가 보안의 가장 취약한 지점이 될 수 있다는 점이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.