AI Briefing

MoE 거세판 등장

Abliterated version of the new Qwen3.6-35B-A3B up on HF

·2026.04.17 12:32

핵심 내용

Qwen3.6-35B-A3B의 MoE 특성을 겨냥한 abliteration 버전이 HF에 올라왔다.

자세히 보기

Hugging Face에 Qwen3.6-35B-A3B abliterated 버전이 공개됐다.

핵심 포인트는 MoE 모델의 거세(ablation) 가 dense 모델과 다르다는 점이다. 거부 신호가 attention보다 expert path 쪽에 더 강하게 묶여 있어서, 일반적인 Q/K/V LoRA 만으로는 잘 안 먹힌다고 설명한다.

적용한 Abliterix 방식은 다음과 같다.

  • LoRA rank-1 를 O-proj 와 MLP down-proj 에만 적용
  • Q/K/V는 의도적으로 비활성화
  • 각 레이어의 256개 expert down_proj slice 전체에 refusal direction 투사
  • 상위 10개 safety expert 를 찾아 router bias를 -2.10 으로 낮춤
  • orthogonalized steering vectors 와 Gaussian decay 를 레이어 전반에 적용
  • 강도는 0.5~6.0 범위에서 탐색해 망가진 출력은 피함

평가 결과는 7/100 refusals 이고, base 모델 대비 KL 0.0189 로 비교적 가깝게 유지됐다. 기준선은 100/100 refusals 다.

다만 저자는 다른 abliterated 모델 카드의 0~3/100 수치는 대개 30~50토큰 생성 + 키워드 감지 에서 나온 과소평가라고 지적한다. 이번 평가는 Gemini 3 Flash 심사, 150토큰 생성, 그리고 garbled output도 refusal로 간주하는 방식이라 더 엄격하다고 주장한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.