디스틸레이션(Distillation) 공격 탐지 및 방지
Anthropic은 중국 AI 기업들이 Claude의 성능을 무단 추출하기 위해 대규모 디스틸레이션 공격을 수행했음을 확인했다.
Anthropic은 DeepSeek, Moonshot, MiniMax 등 세 곳의 AI 연구소가 Claude의 역량을 무단으로 추출하기 위해 산업적 규모의 캠페인을 벌인 것을 확인했다. 이들은 약 24,000개의 부정 계정을 동원해 1,600만 건 이상의 대화를 생성하며 서비스 약관 및 지역 접근 제한을 위반했다.
이들이 사용한 디스틸레이션(Distillation) 기술은 강력한 모델의 출력을 이용해 성능이 낮은 모델을 학습시키는 방식이다. 이는 효율적인 모델 개발을 위한 합법적 방법으로도 쓰이지만, 경쟁사가 막대한 비용과 시간 없이 타사의 핵심 역량을 탈취하는 데 악용될 수 있다.
이러한 공격은 심각한 국가 안보 위협을 초래한다. 무단으로 추출된 모델은 Anthropic이 구축한 안전 가드레일이 제거된 상태로 배포될 가능성이 높으며, 이는 생화학 무기 개발이나 사이버 공격 등 위험한 활동에 악용될 수 있다.
특히 중국 기업들의 이러한 행위는 미국의 수출 통제 조치를 무력화하려는 시도로 보인다. DeepSeek는 15만 건 이상의 교환을 통해 추론 능력, 보상 모델링, 검열 회피 답변 생성 등을 집중적으로 학습한 것으로 나타났다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.