AI Briefing

Anthropic, 안전 분류기 무료화

Dropping prompt injection to 0 with stacked layers

·2026.08.08 20:15

핵심 내용

Anthropic이 Claude Code의 자동 모드를 기본화하고 안전 분류기를 무료로 제공한다.

자세히 보기

프롬프트 인젝션 방어에 모델 학습, 의도 분류기, 입력 프로브를 겹겹이 적용하면 새로운 공격에도 성공률을 0에 가깝게 낮출 수 있다는 접근이 제시됐다.

Anthropic은 Claude Code 업데이트에서 자동 모드(auto mode)를 기본값으로 설정했으며, 안전성 검사를 담당하는 분류기를 별도 비용 없이 제공한다고 밝혔다.

다만 게시물 자체에는 ‘새로운 공격에서 프롬프트 인젝션이 0이 됐다’는 주장을 뒷받침하는 구체적인 실험 설계나 수치가 제시되지 않았다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.