heretic: 수동 튜닝 없이 LLM 검열 제거, KL 발산 0.16까지 낮추기
p-e-w/heretic
·2026.08.30 05:13
프로젝트 소개
방향성 절제(abliteration)와 Optuna 기반 파라미터 최적화를 결합해 언어 모델의 안전 정렬을 자동으로 해제한다. 복잡한 트랜스포머 내부 구조 이해 없이 명령어 한 줄로 실행 가능한 완전 자동화 도구다.
거절 응답 수와 원본 모델과의 KL 발산을 동시에 최소화하는 방식으로 작동한다. Gemma-3-12b 기준, 수동으로 제작된 다른 절제 모델들이 KL 발산 0.45~1.04를 기록한 반면 Heretic은 0.16까지 낮춰 원본 지능 손실을 극소화했다.
Dense 모델부터 MoE, Qwen3.5 같은 하이브리드 모델까지 광범위하게 지원한다. bitsandbytes 양자화를 활용하면 VRAM 부담을 줄여 RTX 3090 환경에서 4B 모델 처리에 약 20~30분이 소요된다.
연구용 옵션을 활성화하면 잔차 벡터의 2D 투영 시각화나 레이어별 기하학적 구조 분석도 가능하다. 커뮤니티에서는 이미 5,000개 이상의 모델이 이 도구를 통해 공개되었다.
GitHub 저장소
p-e-w/heretic
Fully automatic censorship removal for language models
Python
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.