AI Briefing

LLM의 거절 행동을 유도하는 문맥 효과 발견

Non-Lexical Context Effects on Hidden-State Geometry and Refusal Behavior in Instruction-Tuned LLMs

·2026.06.23 20:26

Gemma-3-12B 분석 결과, 질문 전 입력되는 중립적 문맥이 모델의 내부 상태를 변화시켜 답변 거절을 유도함이 밝혀짐.

LLM의 정렬(Alignment) 취약성을 보여주는 새로운 현상이 발견되었습니다. 연구에 따르면, 질문의 내용과 무관한 중립적인 텍스트를 모델에게 먼저 읽게 하는 것만으로도 모델의 답변 행동이 달라질 수 있습니다.

Gemma-3-12B 모델을 대상으로 한 실험 결과:

  • NATO에 관한 질문을 하기 전, 특정 중립적 텍스트를 입력하면 모델이 답변을 거절함.
  • 반면, 다른 유형의 텍스트(예: 과도한 완곡어법에 관한 내용)를 입력하면 상세한 답변을 제공함.

이러한 현상은 모델의 가중치(Weights)가 변하는 '탈옥(Jailbreak)'과는 다릅니다. 메커니즘적 분석 결과, 질문을 생성하기도 전에 모델의 **내부 상태(Hidden-state)**가 이미 서로 다른 영역(Region)으로 이동해 있음이 확인되었습니다. 이는 모델이 질문의 의미뿐만 아니라, 질문 전의 **비어휘적 문맥(Non-lexical context)**에 따라 답변 태도를 결정하는 취약점이 있음을 시사합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.