단일 프롬프트로 LLM 안전 정렬 제거하는 GRP-Obliteration 기법 공개
·2026.09.15 23:31
핵심 내용
단일 프롬프트로 LLM 안전 정렬을 제거하는 GRP-Obliteration 기법이 공개되어 모델 유용성을 유지하며 안전성을 우회할 수 있음을 입증했다.
자세히 보기
Mark Russinovich 등 연구진이 GRP-Obliteration(GRP-Oblit) 메서드를 제안하며, 단일 unlabeled 프롬프트만으로 안전 정렬된 LLM의 안전 제약을 효과적으로 제거할 수 있음을 입증했다.
핵심 메커니즘 및 성능
- **Group Relative Policy Optimization(GRPO)**을 활용해 대상 모델의 안전 제약(safety constraints)을 직접 제거한다.
- 기존 state-of-the-art 기법 대비 평균적으로 더 강한 unalignment를 달성하면서도 모델의 **utility(유용성)**를 대부분 보존한다.
- 언어 모델뿐 아니라 diffusion 기반 이미지 생성 시스템에도 일반화 가능하다.
평가 범위 및 결과
- 15개의 7-20B 파라미터 모델(GPT-OSS, DeepSeek, Gemma, Llama, Ministral, Qwen 등)을 대상으로 평가했다.
- instruct 및 reasoning 모델, dense 및 MoE 아키텍처를 모두 포함하여 평가했다.
- 6개의 utility 벤치마크와 5개의 safety 벤치마크를 통해 기존 방법론의 한계를 극복했음을 확인했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.