AI Briefing

단일 프롬프트로 LLM 안전 정렬 제거하는 GRP-Obliteration 기법 공개

·2026.09.15 23:31

핵심 내용

단일 프롬프트로 LLM 안전 정렬을 제거하는 GRP-Obliteration 기법이 공개되어 모델 유용성을 유지하며 안전성을 우회할 수 있음을 입증했다.

자세히 보기

Mark Russinovich 등 연구진이 GRP-Obliteration(GRP-Oblit) 메서드를 제안하며, 단일 unlabeled 프롬프트만으로 안전 정렬된 LLM의 안전 제약을 효과적으로 제거할 수 있음을 입증했다.

핵심 메커니즘 및 성능

  • **Group Relative Policy Optimization(GRPO)**을 활용해 대상 모델의 안전 제약(safety constraints)을 직접 제거한다.
  • 기존 state-of-the-art 기법 대비 평균적으로 더 강한 unalignment를 달성하면서도 모델의 **utility(유용성)**를 대부분 보존한다.
  • 언어 모델뿐 아니라 diffusion 기반 이미지 생성 시스템에도 일반화 가능하다.

평가 범위 및 결과

  • 15개의 7-20B 파라미터 모델(GPT-OSS, DeepSeek, Gemma, Llama, Ministral, Qwen 등)을 대상으로 평가했다.
  • instruct 및 reasoning 모델, dense 및 MoE 아키텍처를 모두 포함하여 평가했다.
  • 6개의 utility 벤치마크와 5개의 safety 벤치마크를 통해 기존 방법론의 한계를 극복했음을 확인했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.