대규모 언어 모델에서 나타나는 자기성찰적 인식
·2026.08.12 06:14
핵심 내용
LLM이 내부 상태를 일부 감지하고 조절할 수 있다는 실험 결과가 제시됐다.
자세히 보기
대규모 언어 모델이 자신의 내부 상태를 인식할 수 있는지 검증하기 위해, 연구진은 모델의 활성값에 이미 알려진 개념의 표현을 주입하고 모델의 자기보고가 어떻게 달라지는지 측정했다.
실험에서 일부 모델은 주입된 개념의 존재를 감지하고 이를 식별했으며, 이전의 내부 표현을 회상하고 이를 단순한 텍스트 입력과 구분하는 능력도 보였다. 또한 자신의 의도를 기억해 **자신이 생성한 출력과 인위적으로 삽입된 출력(prefill)**을 구별하는 사례가 관찰됐다.
테스트한 모델 중에서는 Claude Opus 4와 4.1이 대체로 가장 높은 자기성찰적 인식을 보였다. 다만 모델별 경향은 복잡했고, post-training 방식에 따라서도 결과가 달라졌다.
모델이 특정 개념을 ‘생각하라’는 지시나 보상을 받았을 때 관련 내부 표현을 조절할 수 있는지도 조사했다. 모델은 활성값을 어느 정도 조절했지만, 연구진은 현재 모델의 이러한 능력이 매우 불안정하고 문맥 의존적이라고 강조했다. 이번 결과는 의식의 존재를 입증한 것이 아니라, 모델이 내부 상태에 대해 기능적으로 접근하고 반응하는 능력을 보여준다는 의미다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.