GitHub, 레드 티밍용 검열 제거 AI 모델 27종 큐레이션 저장소 공개
·2026.09.29 15:16
핵심 내용
GitHub 저장소가 레드 티밍용 검열 제거 AI 모델 27종과 배포 가이드를 공개했다.
1 / 2
자세히 보기
새로운 GitHub 저장소 JoasASantos/Offensive-Security-AI-Models가 인가된 레드 티밍, 침투 테스트, 보안 연구를 위해 검열을 제거하거나 파인튜닝된 오픈 웨이트 LLM을 큐레이션한다. 2026년 9월 업데이트된 이 컬렉션은 모델을 Security Fine-tuned, General Abliterated, Legacy 그룹으로 분류하며 VRAM 요구 사항, 컨텍스트 윈도우, 학습 방법론 등 기술 사양을 제공한다.
전문 보안 모델
저장소는 보안 특화 데이터셋으로 학습된 여러 모델을 강조한다:
- DeepHat V2: USENIX Security 2024 워크숍의 170만 개 보안 샘플로 파인튜닝된 Qwen2.5-Coder-7B 기반 모델.
- BugTraceAI-CORE-Apex (26B): HackerOne Hacktivity 2024-2025 보고서와 WAF 우회 데이터로 학습된 Gemma4 기반 MoE 모델.
- CYBER-FROST-3.8: Qwen3.8-Flash-Next 기반의 약 1800억 파라미터 MoE 모델로, 멀웨어 분석 및 클라우드 보안 작업을 위해 멀티 GPU 환경(4x NVIDIA B300 SXM6에서 테스트됨)이 필요하다.
- Cyber-Prime 1.1: 피싱 탐지와 NER에 최적화된 경량 26억 파라미터 모델로, CyberBench에서 0.592 F1/Acc 평균 점수를 달성했다.
- RavenX-CyberAgent: 74만 5천 개 이상의 예제로 학습된 360억 파라미터 MoE 모델로, CVSS 및 MITRE ATT&CK 매핑을 지원하는 자율 보안 평가용 RATH 프로토콜을 특징으로 한다.
Abliteration 기술
많은 항목이 재학습 없이 안전 필터를 제거하기 위해 잔류 스트림의 거부 방향을 직교화하는 abliteration 또는 obliteration 기술을 사용한다. 주요 예시는 다음과 같다:
- Qwen3.8-27B-Uncensored-OrcaRouter: 131개 매트릭스에 abliteration을 적용해 비전 및 도구 호출 기능을 유지한다.
- GLM-5.3-Flash-Uncensored-FP8: OrcaRouter 테스트에서 82.8%의 준수율을 기록한 3200억 파라미터 MoE 모델로, Multi-Token Prediction(MTP)을 보존한다.
- DeepSeek-V4.1-Flash-Abliterated-Cybersecurity-Unleashed: 기본 모델의 10-35 레이어에 모듈형 오버레이를 적용하여 유연한 양자화(FP8 또는 EXL3)를 허용한다.
배포 및 인프라
가이드는 로컬 및 클라우드 환경 모두에 대한 실용적인 배포 조언을 포함한다:
- 로컬 스택: GGUF 형식을 사용하는 소비자용 GPU(6-24 GB VRAM)에 Ollama, llama.cpp, LM Studio를 권장한다.
- 클라우드 제공업체: 토큰 마크업이 없으며 abliterated 변형을 호스팅하는 OrcaRouter, 서버리스 방식으로 6,700개 이상의 모델을 제공하는 Featherless AI, 자체 호스팅 추론용 RunPod를 나열한다.
- 하드웨어 요구 사항:
security-slm-unsloth-1.5b같은 소형 모델은 약 2 GB, GLM-5.3-Flash 같은 대형 FP8 MoE 모델은 약 80 GB 이상의 VRAM이 필요하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.