Anthropic 모델의 보안 가이드라인 작동 방식
Quoting Matteo Wong, The Atlantic
·2026.06.16 12:07
Anthropic의 AI 모델이 보안 취약점 탐지 요청은 거부하지만, 코드 수정 요청에는 응답하는 특성을 보였다.
보안 전문가 Katie Moussouris에 따르면, Anthropic의 모델은 보안 취약점을 찾는 과정에서 독특한 반응을 보였습니다.
IT 전문가들이 취약점 패치를 위해 모델을 테스트했을 때, 모델은 "코드의 보안 문제를 검토하라"는 직접적인 프롬프트에는 응답을 거부했습니다. 하지만 "이 코드를 수정하라"는 요청을 받은 뒤 추가적인 수동 단계를 거치면 보안 이슈를 해결하는 방식으로 동작했습니다.
Moussouris는 이러한 현상이 사이버 방어(Cyberdefense) 관점에서 볼 때 모델이 의도된 대로 작동하고 있는 것이라고 평가했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.