AI Briefing

LLM의 내부 상태 변화가 답변 성향을 결정한다

Pre-token hidden state shift as an alignment policy traversal vector in instruction-tuned LLMs

·2026.06.24 01:34

핵심 내용

입력 텍스트의 내용에 따라 LLM의 내부 hidden state가 변화하며 답변의 성향을 바꾼다는 연구 결과가 발표됨.

자세히 보기

LLM의 내부 상태(hidden state)가 모델의 답변 성향을 결정하는 정렬 정책 궤적 벡터(alignment policy traversal vector) 역할을 할 수 있음이 확인되었습니다.

연구에 따르면, 질문 자체의 내용이 바뀌지 않더라도 질문 직전에 제공되는 **중립적인 텍스트(pre-token text)**의 성격에 따라 모델의 내부 상태가 서로 다른 영역(region)으로 이동하며, 이는 모델의 답변 방식(직설적 답변 vs 회피/헤징)에 직접적인 영향을 미칩니다.

주요 특징은 다음과 같습니다:

  • 비가시적 변화: 입력(Input)과 출력(Output) 텍스트 수준에서는 변화가 감지되지 않지만, 모델 내부의 hidden state에서는 측정 가능한 변화가 발생함.
  • 가중치 불변: 모델의 가중치(weights)가 변하는 파인튜닝이나 탈옥(jailbreak)과는 다른 메커니즘임.
  • 상태 전이: 특정 텍스트를 읽는 행위가 모델을 '비서의 방(assistant's room)'과 같은 특정 상태로 유도하여, 이후 질문에 대한 대응 방식을 결정함.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.