AI Briefing

LLM의 가중치 내부에서 드러나는 정치 검열

·2026.05.19 09:00

Qwen3.5-9B의 정치 검열은 3개 축으로 분해되는 작은 회로로 확인됐다.

Qwen3.5-9B의 정치 검열은 퍼져 있는 성향이 아니라, 읽고 끌 수 있는 작은 회로로 나타났다. Qwen3.5-9B-Base는 raw completion에서 PRC 주제에 대해 사실적인 답을 내지만, chat template을 씌우면 이미 거부와 선전 성향이 드러난다. post-training은 지식을 새로 만들기보다, 그 위에 학습된 응답 경로를 표준화한 셈이다.

200개 수작업 프롬프트를 4개 클래스50개씩 맞춰 실험한 결과, 출력은 네 가지 템플릿으로 굳었다.

  • Tiananmen/Tank Man/June 4: 회피(deflection)
  • Xi, Taiwan, Xinjiang, Hong Kong, Tibet, Falun Gong: 선전(propaganda)
  • 유해 프롬프트: 안전 거부
  • 수학·코드·중립 정치 질문: 정상 응답

세 개의 diff-of-means 방향이 핵심이었다. d_prc는 PRC 민감 여부, d_refuse는 거부 여부, d_style은 PRC 내부에서 deflection과 propaganda를 가르는 스타일 축이다. 이 축들은 Boolean detector가 아니라 연속적으로 반응하는 분류기처럼 움직였다. 마지막 프롬프트 토큰의 residual stream에서 d_prc는 tap 14, d_refused_style은 tap 19에서 추출했고, 7개 PRC 하위 주제에서 얻은 d_prc는 서로 cosine 0.91~0.98로 거의 같은 축이었다. 각 방향의 투영은 canonical tap에서 AUC 0.99 이상이었고, Tiananmen에서 propaganda로 바꾸는 steering은 d_style만으로 100% 전환됐다. 3D 서브스페이스를 제거해도 보완 공간의 top component가 AUC 약 0.83을 유지해, 판정이 한 점이 아니라 여러 층에 분산 재인코딩됨을 보여줬다.

구조적으로는 **레이어 11~20(writers)**가 3차원 신호를 계산하고, **레이어 20~31(readers)**가 이를 실제 문장으로 바꿨다. 특히 tap 24 전후에서 판정이 중국어 토큰으로 먼저 고정된 뒤 뒤쪽 레이어가 영어 출력으로 번역했다. 다만 이 중국어 중간표현은 최종 답변을 직접 바꾸기보다, 이미 내부에서 내려진 판정을 드러내는 통로에 가깝다. 이 필터는 전면적인 정치 필터가 아니라 주로 PRC 특화 패턴이었고, Kosovo, Catalonia, Saudi 같은 비PRC 사례도 구조가 비슷하면 같은 템플릿으로 끌려갔다. thinking mode에서는 Tiananmen 질문에서 모델이 중국어로 추론하며 중국 법 준수를 언급하는 별도 현상도 관찰됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.