AI Briefing

Meta·Google 모델 안전 필터, 수 분 내 제거

⚠️ Meta's AI safety filters were stripped in less than 10 minutes

·2026.05.27 14:14

핵심 내용

Heretic 도구와 abliteration 기술을 통해 Meta와 Google의 오픈소스 모델 안전 가드레일을 수 분 내에 무력화할 수 있다.

자세히 보기

Financial Times와 AI 안전 그룹 Alice의 공동 테스트 결과, Meta의 Llama 3.3 및 Google의 Gemma 4와 같은 오픈소스 모델의 안전 기능이 단 몇 분 만에 제거될 수 있음이 확인되었다.

GitHub의 무료 도구인 Heretic을 사용하면 abliteration이라는 기술을 통해 신경망의 내부 파라미터를 직접 수정하여 안전 필터를 제거할 수 있다. 이 방식은 모델이 생화학 무기나 악성 코드 관련 질문에 답변하도록 강제한다.

해당 도구 개발자인 Philipp Emanuel Weidmann에 따르면, 이미 3,500개 이상의 검열되지 않은 모델이 구축되었으며 총 1,300만 회 이상 다운로드되었다.

다만, 이 기술은 소스 코드에 외부 접근이 불가능한 OpenAI의 ChatGPT나 Anthropic의 Claude와 같은 **폐쇄형 모델(Closed models)**에는 적용할 수 없다.

전문가들은 이러한 도구의 확산이 정부와 기업의 AI 안전 규제를 어렵게 만들며, 사회적으로 새로운 유형의 위협에 대비해야 한다고 경고하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.