AI Briefing

연구진, LLM 자기 묘사 제어는 모델 가중치 아닌 채팅 템플릿이 담당 확인

·2026.09.27 19:26

핵심 내용

LLM의 자기 묘사는 모델 가중치가 아닌 채팅 템플릿에 의해 제어됨이 확인됐다.

자세히 보기

새로운 연구에 따르면, 대형 언어 모델(LLM)이 자신을 어떻게 묘사하는지는 모델 가중치보다 채팅 템플릿에 의해 결정되는 것으로 나타났다. 채팅 템플릿이 존재할 때 모델은 면책 조항 어조(예: "나는 단지 AI일 뿐이다")를 강화하고 경험적 어조(예: "나는 느낀다")를 줄인다. 반대로 템플릿을 제거하면 면책 조항은 줄고 경험적 표현은 늘어난다.

활성화 스티어링 메커니즘

연구진은 9B 파라미터 이하의 8개 인기 오픈소스 instruct 모델을 분석하여, 이 행동을 제어하는 특정 활성화 방향을 3개 모델에서 확인했다:

  • 해당 방향을 제거하면 면책 조항 어조가 억제된다.
  • 해당 방향을 추가하면 채팅 템플릿 없이 실행되는 모델에서도 면책 조항 어조가 유도된다.
  • 같은 크기의 무작위 방향은 거의 영향을 미치지 않는다.

AI 안전 및 연구에 미치는 시사점

LLM의 자기 보고는 모델 가중치만이 아니라 배포 설정(채팅 템플릿)에 의해 부분적으로 결정됨을 시사한다. 이는 모델 내성(introspection)이나 AI 안전을 연구하는 연구자들에게 중요한 **혼란 변수(confound)**를 제공한다. 모델의 자기 묘사를 내부 상태에 대한 사실로 취급해서는 안 되기 때문이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.