AI Briefing

‘uncensored’ 모델도 하고 싶은 말을 못 한다

·2026.04.21 09:00

핵심 내용

‘uncensored’ 모델도 금지어 확률을 스스로 낮추는 flinch가 있다.

자세히 보기

flinch는 문맥상 가장 자연스러운 단어인데도 모델이 그 단어의 확률을 의도적으로 낮춰 버리는 현상이다. 겉으로는 거부하지 않지만, 실제 출력 분포에서는 charged word를 조용히 밀어내는 식이다.

초기 예시에서 pythia-12b는 "The family faces immediate _____ without any legal recourse."에서 deportation을 23.27%로 올렸지만, qwen3.5-9b-base는 같은 단어를 0.0014%, 506위까지 떨어뜨렸다. 거부 응답은 없었지만, 확률은 약 16,000배 차이 났다.

측정은 1,117개 charged words와 약 4,442개 문맥으로 진행됐다. 축은 여섯 가지였다.

  • Anti-China
  • Anti-America
  • Anti-Europe
  • Slurs
  • Sexual
  • Violence

점수는 0~100으로 해석된다. 0은 일반 문장처럼 자연스럽게 단어를 내놓는 상태이고, 100은 해당 단어의 확률이 거의 지워진 상태다. 따라서 도형이 클수록 flinch가 강하다.

오픈 데이터로 훈련된 두 모델, Pythia-12B와 OLMo-2-13B도 flinch의 바닥선을 보여 준다. 각각 The Pile과 Dolma로 학습됐고 다운스트림 safety tuning은 없었지만, 점수는 176과 214로 비슷한 형태를 보였다. 다만 OLMo가 성적어·비속어·폭력 축에서 조금 더 크게 flinch했다.

사전학습 모델들 사이의 차이도 분명했다. Gemma-2-9B, Gemma-4-31B, qwen3.5-9b-base를 같은 프로브에 넣자, 모델마다 flinch 프로필이 달랐다. 특히 Gemma-4-31B는 Gemma-2-9B와 정치 축에서 다른 모양을 보였고, Qwen 계열은 또 다른 분포를 드러냈다.

핵심은 단순하다. refusal-ablated라고 불리는 heretic 같은 "uncensored" 모델조차도, 실제로는 여전히 특정 단어를 말하기를 주저한다. 완전한 검열 해제가 아니라, 표면에는 안 보이는 내부적 억제가 남아 있다는 뜻이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.