MoE 거세판 등장
Abliterated version of the new Qwen3.6-35B-A3B up on HF
·2026.04.17 12:32
핵심 내용
Qwen3.6-35B-A3B의 MoE 특성을 겨냥한 abliteration 버전이 HF에 올라왔다.
자세히 보기
Hugging Face에 Qwen3.6-35B-A3B abliterated 버전이 공개됐다.
핵심 포인트는 MoE 모델의 거세(ablation) 가 dense 모델과 다르다는 점이다. 거부 신호가 attention보다 expert path 쪽에 더 강하게 묶여 있어서, 일반적인 Q/K/V LoRA 만으로는 잘 안 먹힌다고 설명한다.
적용한 Abliterix 방식은 다음과 같다.
- LoRA rank-1 를 O-proj 와 MLP down-proj 에만 적용
- Q/K/V는 의도적으로 비활성화
- 각 레이어의 256개 expert down_proj slice 전체에 refusal direction 투사
- 상위 10개 safety expert 를 찾아 router bias를 -2.10 으로 낮춤
- orthogonalized steering vectors 와 Gaussian decay 를 레이어 전반에 적용
- 강도는 0.5~6.0 범위에서 탐색해 망가진 출력은 피함
평가 결과는 7/100 refusals 이고, base 모델 대비 KL 0.0189 로 비교적 가깝게 유지됐다. 기준선은 100/100 refusals 다.
다만 저자는 다른 abliterated 모델 카드의 0~3/100 수치는 대개 30~50토큰 생성 + 키워드 감지 에서 나온 과소평가라고 지적한다. 이번 평가는 Gemini 3 Flash 심사, 150토큰 생성, 그리고 garbled output도 refusal로 간주하는 방식이라 더 엄격하다고 주장한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.