AI Briefing

LLM의 거절 행동을 유도하는 문맥 효과 발견

Non-Lexical Context Effects on Hidden-State Geometry and Refusal Behavior in Instruction-Tuned LLMs

·2026.06.23 20:26

핵심 내용

Gemma-3-12B 분석 결과, 질문 전 입력되는 중립적 문맥이 모델의 내부 상태를 변화시켜 답변 거절을 유도함이 밝혀짐.

자세히 보기

LLM의 정렬(Alignment) 취약성을 보여주는 새로운 현상이 발견되었습니다. 연구에 따르면, 질문의 내용과 무관한 중립적인 텍스트를 모델에게 먼저 읽게 하는 것만으로도 모델의 답변 행동이 달라질 수 있습니다.

Gemma-3-12B 모델을 대상으로 한 실험 결과:

  • NATO에 관한 질문을 하기 전, 특정 중립적 텍스트를 입력하면 모델이 답변을 거절함.
  • 반면, 다른 유형의 텍스트(예: 과도한 완곡어법에 관한 내용)를 입력하면 상세한 답변을 제공함.

이러한 현상은 모델의 가중치(Weights)가 변하는 '탈옥(Jailbreak)'과는 다릅니다. 메커니즘적 분석 결과, 질문을 생성하기도 전에 모델의 **내부 상태(Hidden-state)**가 이미 서로 다른 영역(Region)으로 이동해 있음이 확인되었습니다. 이는 모델이 질문의 의미뿐만 아니라, 질문 전의 **비어휘적 문맥(Non-lexical context)**에 따라 답변 태도를 결정하는 취약점이 있음을 시사합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.