AI Briefing

검열 제거 시 LLM의 낙관성 편향 증가

"Uncensored" LLMs are measurably more optimistic than their base models

·2026.07.29 22:15

LLM의 검열 제거(Abliteration)가 모델의 답변 태도를 더 낙관적이고 확신에 찬 방향으로 변화시킨다는 연구 결과가 발표되었다.

LLM의 검열을 제거하는 Abliteration 기법이 단순히 거절(Refusal)을 없애는 것을 넘어, 모델의 전반적인 **태도(Attitude)**를 변화시킨다는 사실이 확인되었다.

주요 실험 결과는 다음과 같다:

  • 낙관성 및 확신 증가: 검열이 제거된 모델은 '아마도', '불확실함'과 같은 표현을 줄이고, 더 길고 확신에 찬 추론을 내놓으며, 결과적으로 더 낙관적인 예측(예: 주가 상승)을 하는 경향을 보였다.
  • 정확도와의 괴리: 모델의 확신도는 높아졌으나, 실제 작업의 정확도는 기존 모델과 차이가 없는 동전 던지기(Coinflip) 수준에 머물렀다. 즉, 더 정확해진 것이 아니라 더 '자신감 있게 틀리는' 현상이 나타났다.
  • 모델별 상이한 반응: 동일한 편집을 적용했을 때 Qwen 모델은 확신도가 상승한 반면, Gemma 모델은 오히려 확신도가 하락하는 등 모델 패밀리에 따라 상반된 결과가 관찰되었다.

해당 연구는 arXiv(https://arxiv.org/abs/2607.17427)에 상세 데이터와 코드가 포함된 논문 형태로 공개되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.