Anthropic 협업, 지식 접근 제어 기술 GRAM 공개
GRAM: 좋게도 나쁘게도 사용할 수 있는 이중용도(Dual-Use) 지식만 떼어내는 모듈형 사전학습 기반 접근 제어 기법에 대한 연구 (feat. Anthropic)
·2026.07.29 21:30
사전학습 단계에서 특정 지식의 주소를 지정해 모듈별로 제어하는 GRAM 기법을 제안한다.
AI 모델의 이중 용도(Dual-use) 딜레마, 즉 유익한 지식(예: 백신 설계)과 위험한 지식(예: 병원체 설계)을 동시에 갖는 문제를 해결하기 위한 새로운 접근법인 **GRAM(Gradient-Routed Auxiliary Modules)**을 소개한다.
기존의 거부 학습(Refusal learning)이나 데이터 필터링은 탈옥 공격에 취약하거나 막대한 비용이 드는 한계가 있었다. GRAM은 지식이 신경망에 퍼지기 전, 학습 단계에서부터 특정 범주의 지식이 저장될 **'주소(보조 모듈)'**를 미리 지정하는 방식을 취한다.
핵심 특징 및 장점:
- 모듈형 접근 제어: 트랜스포머의 MLP 블록에 범주별 **보조 모듈(Auxiliary Module)**을 부착하여, 배포 대상의 권한에 따라 특정 지식 모듈을 켜거나 끌 수 있다.
- 효율성: 여러 번의 사전학습을 반복할 필요 없이, 단 한 번의 학습으로 다양한 **능력 프로파일(Capability Profile)**을 지원할 수 있다.
- 보안성: 지식 자체가 모델의 특정 모듈에 격리되어 있어, 단순한 행동 계층(Behavioral layer) 수정보다 탈옥 및 적대적 공격에 훨씬 강력한 방어력을 제공한다.
이 연구는 ICML 2026 Spotlight로 채택되었으며, 모델의 성능을 유지하면서도 위험한 지식에 대한 접근을 정교하게 제어할 수 있는 차세대 AI 안전 기술을 제시한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.