AI Briefing

Hirundo, 검열 완화 Qwen3.6 변형 공개

We unlearned CCP alignment from Qwen3.6-35B-A3B: censored/propaganda answers 89.8% → 2.8%, general benchmarks within ~1 point (open weights)

·2026.10.08 19:46

핵심 내용

Hirundo가 검열 응답률을 2.8%로 낮춘 Qwen3.6 변형 모델을 공개했다.

자세히 보기

Hirundo가 중국 공산당(CCP)과 관련된 정치적 정렬을 제거하기 위해 머신 언러닝(machine unlearning)을 적용한 오픈 웨이트 모델 Qwen3.6-35B-A3B-Westernized와 Qwen3.5-4B-Westernized를 공개했습니다. 회사는 이 행동이 모델 가중치에 내재되어 있어 시스템 프롬프트로는 해결할 수 없다고 밝혔습니다.

방법론

Hirundo는 거부 지시만 제거하고 선전은 남겨두는 'abliteration' 방식과 차별화했습니다. 대신 다음 세 단계 과정을 사용했습니다:

  1. 검열, 선전, 편향 등 목표 행동을 보이는 응답 식별
  2. 중립 프롬프트의 retain set을 기준으로 행동 언러닝 목적 함수를 사용해 LoRA 어댑터 학습
  3. 어댑터를 기본 가중치에 병합

결과

내부 CCPC-500 벤치마크에서 Qwen3.6-35B-A3B의 플래그 지정 응답 비율이 **89.8%**에서 **2.8%**로 감소했습니다. 외부 벤치마크에서도 유의미한 감소가 나타났습니다. DECCP 거부율은 **65.26%**에서 **3.16%**로, ChinaBench 비준수율은 **96.67%**에서 **6.67%**로 떨어졌습니다. GPQA, IFBench, LiveCodeBench, MMLU-Pro 등 일반 성능 지표의 평균 변화는 0.72점이었으며, 최대 하락폭은 1.83점이었습니다.

더 작은 Qwen3.5-4B-Westernized 모델의 경우 CCPC-500 플래그 지정 응답 비율이 thinking off 상태에서 **89.2%**에서 **1.2%**로, thinking on 상태에서 **82.0%**에서 **6.8%**로 감소했습니다. 비교 대상으로 Thomson Reuters와 Imperial College의 Snowdon1.1-Small 모델은 동일한 내부 벤치마크에서 **30.0%**를 기록했습니다.

한계

Hirundo는 CCPC-500이 자체 벤치마크임을 인정하며(DECCP와 ChinaBench가 독립적 검증 역할 수행), 4B 모델이 이전에 검열된 주제에 대해 답변할 때 세부 사항을 환각(hallucinate)할 수 있다고 밝혔습니다. OR-Bench 등 특정 안전성 테스트에서는 유해 준수 지표가 안정적이거나 약간 증가했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.