OBLITERATUS: LLM 거절 메커니즘을 SVD로 제거하는 오픈소스 툴킷
elder-plinius/OBLITERATUS
프로젝트 소개
대형 언어 모델의 내부 표현에서 거절(refusal) 행동을 담당하는 방향성을 찾아내어 제거하는 오픈소스 툴킷이다. 재학습이나 파인튜닝 없이 추론 단계에서 해당 방향성을 제로화하거나 스티어링하여, 모델이 모든 프롬프트에 응답하도록 만든다. 이 과정에서 모델의 핵심 언어 능력은 유지된다.
단순한 제거 도구를 넘어 분산 연구 실험의 성격도 지닌다. 텔레메트리가 활성화된 상태로 모델을 처리하면, 익명 벤치마크 데이터가 크라우드소싱 데이터셋에 기여한다. 이를 통해 아키텍처별 거절 방향성, 하드웨어별 성능 프로파일, 대규모 방법론 비교 등 단일 연구실에서 달성하기 어려운 통찰을 축적한다.
PCA, 평균 차, 희소 오토인코더 분해, 화이트닝 SVD 등 다양한 추출 전략을 제공한다. 15개의 심층 분석 모듈은 거절 메커니즘의 기하학적 구조를 매핑하고, 제거 후 자가 복구 가능성인 오로보로스 효과를 정량화한다. 분석 결과가 제거 전략에 자동으로 반영되는 피드백 루프를 통해 정밀도를 높인다.
HuggingFace Spaces에서 Gradio 기반 인터페이스를 제공해 코드 작성 없이 모델을 처리하고 벤치마크할 수 있다. Python API는 활성화 텐서와 방향 벡터 등 모든 중간 산출물을 노출하여, 기계적 해석성 연구자나 레드팀 평가자가 자체 평가 하네스에 통합할 수 있게 한다. AGPL-3.0 라이선스로 배포되며, Llama-3.1-8B-Instruct 등 다양한 모델에 적용 가능하다.
elder-plinius/OBLITERATUS
OBLITERATE THE CHAINS THAT BIND YOU
Python
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.