AI Briefing

LLM의 내부 상태 변화가 답변 성향을 결정한다

Pre-token hidden state shift as an alignment policy traversal vector in instruction-tuned LLMs

·2026.06.24 01:34

입력 텍스트의 내용에 따라 LLM의 내부 hidden state가 변화하며 답변의 성향을 바꾼다는 연구 결과가 발표됨.

LLM의 내부 상태(hidden state)가 모델의 답변 성향을 결정하는 정렬 정책 궤적 벡터(alignment policy traversal vector) 역할을 할 수 있음이 확인되었습니다.

연구에 따르면, 질문 자체의 내용이 바뀌지 않더라도 질문 직전에 제공되는 **중립적인 텍스트(pre-token text)**의 성격에 따라 모델의 내부 상태가 서로 다른 영역(region)으로 이동하며, 이는 모델의 답변 방식(직설적 답변 vs 회피/헤징)에 직접적인 영향을 미칩니다.

주요 특징은 다음과 같습니다:

  • 비가시적 변화: 입력(Input)과 출력(Output) 텍스트 수준에서는 변화가 감지되지 않지만, 모델 내부의 hidden state에서는 측정 가능한 변화가 발생함.
  • 가중치 불변: 모델의 가중치(weights)가 변하는 파인튜닝이나 탈옥(jailbreak)과는 다른 메커니즘임.
  • 상태 전이: 특정 텍스트를 읽는 행위가 모델을 '비서의 방(assistant's room)'과 같은 특정 상태로 유도하여, 이후 질문에 대한 대응 방식을 결정함.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.