AI Briefing

Anthropic의 책임 있는 스케일링 정책 (Responsible Scaling Policy)

·2026.05.29 12:00

Anthropic이 AI의 파괴적 위험을 관리하기 위해 AI 안전 등급(ASL)을 도입하는 '책임 있는 스케일링 정책(RSP)'을 발표했다.

Anthropic은 AI 모델의 능력이 향상됨에 따라 발생할 수 있는 **파괴적 위험(catastrophic risks)**을 관리하기 위한 **책임 있는 스케일링 정책(RSP)**을 발표했다. 이 정책은 테러리스트의 생화학 무기 제조 활용이나 AI의 자율적인 통제 불능 상태와 같은 대규모 재앙을 방지하는 데 초점을 맞춘다.

핵심 프레임워크인 **AI 안전 등급(ASL, AI Safety Levels)**은 생물학적 위험 관리 기준인 BSL(Biosafety Level)을 모델로 설계되었다. 모델의 잠재적 위험도에 따라 차등화된 안전 및 보안 표준을 요구한다.

ASL 등급 체계는 다음과 같다:

  • ASL-1: 유의미한 파괴적 위험이 없는 시스템 (예: 2018년형 LLM, 체스 AI)
  • ASL-2: 위험한 능력의 초기 징후가 보이나 아직 실용적이지 않은 단계 (현재 Claude를 포함한 대부분의 LLM이 해당)
  • ASL-3: 비 AI 기반 도구 대비 위험성이 크게 증가하거나 낮은 수준의 자율성을 보이는 단계. 매우 엄격한 보안과 레드팀 테스트를 통한 검증이 필수적이다.
  • ASL-4 이상: 아직 정의되지 않았으나, 파괴적 오용 가능성과 자율성이 질적으로 급증하는 단계를 의미한다.

Anthropic은 안전 조치가 스케일링 속도를 따라가지 못할 경우 모델 학습을 일시 중단할 수 있다. 이는 안전 문제를 해결해야만 더 강력한 모델을 개발할 수 있도록 유도하여, 안전 기술 발전과 모델 성능 향상 사이의 균형을 맞추는 것을 목표로 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.