AI Briefing

LLM 검열 우회 도구 'phantom-kv' 공개

Uncensor an LLM without touching weights: inject a tiny trained KV-cache bank (~18MB) and unload it anytime

·2026.09.22 07:55

핵심 내용

가중치를 수정하지 않고 약 18MB의 KV 캐시를 주입해 LLM의 검열을 우회하는 오픈소스 도구 'phantom-kv'가 공개됐다.

자세히 보기

개발자 lordx64가 LLM의 가중치를 전혀 수정하지 않고 검열을 우회하는 도구 phantom-kv를 공개했다. 이 도구는 학습된 약 18MB 크기의 Key/Value 텐서 뱅크를 모델의 KV 캐시에 컨텍스트로 로드하여, 모델이 이를 기존 대화 이력처럼 인식하게 만든다.

작동 원리 및 특징

기존의 검열 제거 방식(가중치 공간 Abliteration, 활성화 공간 투영 등)은 체크포인트를 영구적으로 수정하거나 런타임 훅을 사용해야 했다. 반면 phantom-kv는 다음과 같은 차별점을 가진다:

  • 비침습적 주입: 모델의 입력 채널(attention)이 이미 소비하는 방식으로 작동하여, 가중치 재작성이나 엔진 패치가 필요 없다.
  • 핫 스왑 가능: 캐시를 언로드하면 모델은 바이트 단위로 원본과 동일해진다. 요청 단위로 검열 우회 모드를 켜고 끌 수 있다.
  • 아키텍처 독립성: 특정 아키텍처에 종속되지 않으며, 양자화 방식에 따라 깨지지 않는다.

한계 및 검증

개발자는 자체 검증을 통해 lexical refusal suppression 지표가 준수율을 과대평가할 수 있음을 지적했으며, 장시간 세션(약 2~4k 토큰 반감기)에서는 효과가 감소하는 현상을 확인했다. 이를 완화하기 위해 주기적인 재주입(re-injection)이 필요하며, 우회된 응답에는 법적/윤리적 프레이밍이 포함될 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.