AI Briefing

거짓 금 (18분 읽기)

·2026.08.19 09:00

핵심 내용

거짓 금은 공격이 성공해도 가짜 정보를 출력하도록 모델 자체를 훈련하는 방어 기법이다.

자세히 보기

오픈 웨이트 LLM의 거절(refusal) 메커니즘은 abliteration이라는 가벼운 가중치 편집으로 수 분 만에 제거될 수 있다. 기존 방어 기법들은 공격을 막는 데 실패했지만, **거짓 금(Fool's Gold)**은 공격을 허용하되 그 결과물을 오염시키는 방어적 기만(defensive deception) 전략을 채택한다.

이 기법은 공격 시뮬레이션을 학습 루프에 포함시켜, 거절 메커니즘이 제거된 상태에서도 유해한 질문에 대해 자신감 있는 가짜(decoy) 답변을 생성하도록 모델을 미세 조정한다. 가짜 답변은 실제 공격 성공과 동일한 어조와 확신을 지니지만 핵심 요소는 허위이다.

5개 계열의 7개 모델(9B~122B)에 적용한 결과, 방어 훈련을 받지 않은 유해 프롬프트에 대해 공격자의 51~90%가 가짜 답변으로 전환되었다. 이는 방어 기법 자체에서 기인한 +0.27~+0.84의 향상률이며, MMLU 등 일반 성능 벤치마크 점수는 오차 범위 내에서 유지되었다.

보안적 효과는 **인지적(epistemic)**이다. 독립적인 정답 소스가 없는 공격자는 가짜 답변과 실제 답변을 구별할 수 없다. 122B 모델의 경우, CBRNE 관련 유해 질문에서 방어 모델은 82~86%의 답변이 치명적으로 잘못되었으나, 공격자는 이를 감지할 수 없었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.