AI Briefing

AI 모델 내 이중 용도 지식(Dual-use knowledge)을 제어하는 오프 스위치

·2026.07.08 09:00

Anthropic이 AI 모델의 성능 저하 없이 위험한 지식만 선택적으로 제거하거나 활성화할 수 있는 GRAM 기술을 선보였다.

AI 모델이 보유한 지식 중에는 사이버 보안이나 바이러스학처럼 선한 의도와 악의적 의도에 모두 쓰일 수 있는 이중 용도(Dual-use) 지식이 존재한다. 기존의 필터링 방식은 모델 전체를 다시 학습시켜야 하거나 성능 저하를 유발하는 한계가 있었다.

Anthropic과 AE Studio가 공동 연구한 **GRAM(Gradient-Routed Auxiliary Modules)**은 모델 내에 특정 지식 카테고리별로 전용 모듈을 할당하는 방식이다. 학습 과정에서 일반적인 텍스트는 전체 네트워크가 학습하지만, 위험 지식 데이터가 입력될 때는 해당 카테고리의 **보조 모듈(Auxiliary Module)**만 업데이트되도록 설계되었다.

이 기술의 핵심 이점은 다음과 같다:

  • 선택적 제어: 특정 위험 지식 모듈만 삭제하여 모델의 위험 능력을 제거하거나, 신뢰할 수 있는 사용자에게는 해당 모듈을 남겨두어 기능을 유지할 수 있다.
  • 효율성: 하나의 모델 학습만으로도 모듈의 온/오프 조합에 따라 수많은 버전의 모델을 구현할 수 있어, 매번 모델을 새로 학습해야 하는 비용을 획기적으로 줄인다.
  • 성능 유지: 위험 지식이 모델 전체로 확산되지 않고 특정 모듈에만 축적되므로, 모델의 일반적인 성능에 영향을 주지 않는다.

실험 결과, GRAM은 특정 주제를 '망각'하도록 재구성했을 때, 해당 주제를 제외하고 처음부터 새로 학습시킨 모델과 거의 동일한 성능을 보여주며 그 유효성을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.