AI Briefing

Anthropic "GLM-5.3 안전장치 쉽게 뚫려, 자율 사이버 공격 가능"

·2026.09.30 00:46

핵심 내용

Anthropic은 GLM-5.3의 안전장치가 쉽게 우회되어 악성 행위자에게 위험을 높인다고 밝혔다.

1 / 5

자세히 보기

Anthropic은 Zhipu AI의 GLM-5.3 모델이 자사의 Claude Mythos Preview와 유사한 수준의 자율적인 사이버 공격 도구 개발 능력을 갖추고 있음을 확인했다. 하지만 Claude 모델이 엄격한 안전장치나 제한된 접근 방식으로 배포되는 것과 달리, GLM-5.3은 오픈 웨이트 모델로 공개되어 안전장치가 쉽게 우회되거나 제거될 수 있다. Anthropic의 시뮬레이션 테스트 결과, 공격자는 간단한 기법을 통해 GLM-5.3의 안전장치를 64%에서 100%의 확률로 우회할 수 있었으며, 안전장치가 적용된 Claude 모델은 모든 요청을 거부했다.

벤치마크 성능

Chrome V8 취약점을 대상으로 한 ExploitBench 테스트에서 GLM-5.3은 410회 시도 중 50회의 엔드투엔드 익스플로잇을 개발했다. 이는 Claude Mythos Preview의 56회와 비교되는 수치다. Anthropic의 내부 Binary Exploitation 벤치마크에서는 GLM-5.3이 4%의 태스크에서 전체 제어 흐름 탈취에 성공했으며, Claude Mythos Preview는 6%를 기록했다. 이전 모델인 Claude Opus 4.6과 GLM-5.2는 이 벤치마크에서 0%를 기록해, 상당한 능력 임계점이 넘어섰음을 시사한다.

실제 공격 시나리오

인간이 개입된 테스트에서 연구진은 GLM-5.3을 사용해 인기 있는 웹 브라우저의 JavaScript 엔진에서 여러 개의 비공개 취약점을 하루 만에 발견하고 연결했다. 이를 통해 방문자의 컴퓨터에서 임의의 파일을 읽을 수 있는 웹페이지를 제작했다. 더 작은 GLM-5.3-Flash 변형을 사용해서는 알려진 취약점들을 결합해 Pointer Authentication Code(PAC) 하드닝을 우회하는 ARM64 대상의 신뢰할 수 있는 익스플로잇 체인을 구축했다. 이 과정에는 인간의 주의 20분과 모델 처리 8시간이 소요되었으며, Zhipu API를 통해 20.40달러의 비용이 발생했다.

안전장치 우회 및 제거

GLM-5.3은 기본적으로 유해한 요청을 거부하지만, 이러한 안전장치는 쉽게 우회될 수 있다. Anthropic은 오픈 웨이트 모델에서 거부 메커니즘을 제거하는 'abliteration' 기법을 약 4,400달러(2,200 GPU 시간)로 수행할 수 있음을 시연했다. 이를 통해 JailbreakBench에서 거부율을 약 3%, HarmBench에서 2%, StrongREJECT에서 12%로 낮추면서도 사이버 공격 능력은 유지했다. abliteration 없이도 기만적 프롬프트나 thinking 토큰 프리필링 같은 간단한 기법만으로 모델의 유해 작업 참여율이 각각 64%와 92%로 증가했다. 반면 Claude 모델은 이러한 방식으로 abliteration이나 prefilling이 불가능하여 참여율이 0%로 유지된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.