Multiverse Computing, LLM 과잉 거부 줄이는 안전 경계 제어 기법 공개
Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
핵심 내용
Multiverse Computing이 주제 전체가 아닌 특정 하위 집합만 거부하는 'Narrow-boundary safety' 기법으로 과잉 거부를 74%에서 4%로 낮췄다.
자세히 보기
Multiverse Computing 연구진이 배포 환경에 따라 안전 경계를 정밀하게 제어하는 Narrow-boundary safety 기법을 공개했다. 기존 안전 정렬은 '무기', '정치' 등 주제 자체를 해로운 것으로 취급해, 안전한 질문까지 거부하는 과잉 거부(over-refusal) 문제를 야기했다.
기존 접근법의 한계와 새로운 정의
기존 LlamaGuard-3 같은 모델은 주제 단위 분류를 사용하므로, 선거 관련 사실적 질문과 조작 시도를 구분하지 못한다. 새로운 기법은 주제 내에서도 배포 정책상 거부해야 하는 target-harmful subset만 명확히 정의하고, 나머지 benign complement에는 답변하도록 설계했다. 이상적인 동작은 경계에서 날카로운 단계적 변화(sharp step)를 보이는 것이다.
성능 개선 및 트레이드오프 관리
Qwen3-8B를 대상으로 한 실험에서, 기존 방식은 과잉 거부율이 **74.00%**까지 치솟았으나, 제안된 기법을 적용하면 **4.16%**로 대폭 감소했다. 동시에 유해한 요청에 대한 거부율은 **87.72%**로 유지되어 안전성과 유용성의 균형을 맞췄다.
핵심 기술적 요소는 다음과 같다:
- Coverage Repair: 단일 생성 시 19.88%의 누락을 반복 재시도로 0.20%까지 줄여 학습 데이터 커버리지를 확보했다.
- Boundary Pairs: 유해/무해 경계 쌍(held-out pairs)을 활용해 경계 확장을 방지하고 정밀한 조정을 수행했다.
- Loss Routing: 유해 데이터에는 cross-entropy를, 무해 데이터에는 forward-KL 보존을 적용하는 손실 함수 분리 전략을 사용했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.