AI Briefing

Meta·Google 모델 안전 필터, 수 분 내 제거

⚠️ Meta's AI safety filters were stripped in less than 10 minutes

·2026.05.27 14:14

Heretic 도구와 abliteration 기술을 통해 Meta와 Google의 오픈소스 모델 안전 가드레일을 수 분 내에 무력화할 수 있다.

Financial Times와 AI 안전 그룹 Alice의 공동 테스트 결과, Meta의 Llama 3.3 및 Google의 Gemma 4와 같은 오픈소스 모델의 안전 기능이 단 몇 분 만에 제거될 수 있음이 확인되었다.

GitHub의 무료 도구인 Heretic을 사용하면 abliteration이라는 기술을 통해 신경망의 내부 파라미터를 직접 수정하여 안전 필터를 제거할 수 있다. 이 방식은 모델이 생화학 무기나 악성 코드 관련 질문에 답변하도록 강제한다.

해당 도구 개발자인 Philipp Emanuel Weidmann에 따르면, 이미 3,500개 이상의 검열되지 않은 모델이 구축되었으며 총 1,300만 회 이상 다운로드되었다.

다만, 이 기술은 소스 코드에 외부 접근이 불가능한 OpenAI의 ChatGPT나 Anthropic의 Claude와 같은 **폐쇄형 모델(Closed models)**에는 적용할 수 없다.

전문가들은 이러한 도구의 확산이 정부와 기업의 AI 안전 규제를 어렵게 만들며, 사회적으로 새로운 유형의 위협에 대비해야 한다고 경고하고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.