Hirundo, 검열 완화 Qwen3.6 변형 공개
We unlearned CCP alignment from Qwen3.6-35B-A3B: censored/propaganda answers 89.8% → 2.8%, general benchmarks within ~1 point (open weights)
핵심 내용
Hirundo가 검열 응답률을 2.8%로 낮춘 Qwen3.6 변형 모델을 공개했다.
자세히 보기
Hirundo가 중국 공산당(CCP)과 관련된 정치적 정렬을 제거하기 위해 머신 언러닝(machine unlearning)을 적용한 오픈 웨이트 모델 Qwen3.6-35B-A3B-Westernized와 Qwen3.5-4B-Westernized를 공개했습니다. 회사는 이 행동이 모델 가중치에 내재되어 있어 시스템 프롬프트로는 해결할 수 없다고 밝혔습니다.
방법론
Hirundo는 거부 지시만 제거하고 선전은 남겨두는 'abliteration' 방식과 차별화했습니다. 대신 다음 세 단계 과정을 사용했습니다:
- 검열, 선전, 편향 등 목표 행동을 보이는 응답 식별
- 중립 프롬프트의 retain set을 기준으로 행동 언러닝 목적 함수를 사용해 LoRA 어댑터 학습
- 어댑터를 기본 가중치에 병합
결과
내부 CCPC-500 벤치마크에서 Qwen3.6-35B-A3B의 플래그 지정 응답 비율이 **89.8%**에서 **2.8%**로 감소했습니다. 외부 벤치마크에서도 유의미한 감소가 나타났습니다. DECCP 거부율은 **65.26%**에서 **3.16%**로, ChinaBench 비준수율은 **96.67%**에서 **6.67%**로 떨어졌습니다. GPQA, IFBench, LiveCodeBench, MMLU-Pro 등 일반 성능 지표의 평균 변화는 0.72점이었으며, 최대 하락폭은 1.83점이었습니다.
더 작은 Qwen3.5-4B-Westernized 모델의 경우 CCPC-500 플래그 지정 응답 비율이 thinking off 상태에서 **89.2%**에서 **1.2%**로, thinking on 상태에서 **82.0%**에서 **6.8%**로 감소했습니다. 비교 대상으로 Thomson Reuters와 Imperial College의 Snowdon1.1-Small 모델은 동일한 내부 벤치마크에서 **30.0%**를 기록했습니다.
한계
Hirundo는 CCPC-500이 자체 벤치마크임을 인정하며(DECCP와 ChinaBench가 독립적 검증 역할 수행), 4B 모델이 이전에 검열된 주제에 대해 답변할 때 세부 사항을 환각(hallucinate)할 수 있다고 밝혔습니다. OR-Bench 등 특정 안전성 테스트에서는 유해 준수 지표가 안정적이거나 약간 증가했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.