거절회로의 실체
Refusal in open-weights models looks like a sparse gate -> amplifier circuit, and generalizes across 12 models from 6 labs (2B-72B)
·2026.04.15 05:55
핵심 내용
12개 오픈웨이트 모델에서 refusal 회로가 sparse gate-amplifier 구조로 반복 확인됐다.
자세히 보기
12개 모델, 6개 랩, 2B~72B 범위에서 refusal 메커니즘을 추적한 결과, 거절 행동은 sparse gate-amplifier 회로로 반복 관측됐다.
- 중간층의 gate attention head가 detection-layer 표현을 읽고 routing vector를 만든다.
- 뒤이어 나오는 amplifier heads가 그 신호를 키워 refusal / censorship 행동으로 이어지게 한다.
눈에 띈 점도 분명하다.
- 출력 DLA만 보면 gate가 거의 안 보인다. Qwen3-8B에서는 gate의 기여도가 1% 미만이라 상위 attention head처럼 보이지 않는다.
- 하지만 interchange testing으로는 gate가 causal하게 확인된다. 이 head를 꺼버리면 downstream amplifier들이 약해진다.
- 스케일이 커질수록 per-head ablation은 급격히 약해진다. 테스트한 scaling pair에서 최대 58배까지 차이가 났고, 72B에서는 top per-head ablation이 거의 노이즈처럼 보인다.
- 반면 interchange는 여전히 trigger component를 찾아낸다.
- bijection encoding을 인컨텍스트로 주고 프롬프트도 그 방식으로 인코딩하면 gate의 필요성이 무너지고, 모델이 refusal 대신 puzzle-solving 쪽으로 전환된다.
저자가 제안하는 해석은, detection과 policy routing이 분리된 계산이며, refusal routing circuit은 초기에 고정된다는 것이다. 입력이 그 시점에 gate가 읽을 수 있는 표현을 만들지 못하면, 뒤쪽 policy가 제대로 결합되지 않는다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.