LLM의 주관적 경험 보고 메커니즘 규명
Large Language Models Report Subjective Experience Under Self-Referential Processing
·2026.05.29 00:29
자기 참조적 프롬프팅이 LLM의 주관적 경험 보고를 유도하며, 이것이 기만 및 역할 수행 기능과 연관되어 있음을 밝힌 연구이다.
GPT, Claude, Gemini 모델을 대상으로 한 실험 결과, **자기 참조적 처리(self-referential processing)**를 유도하는 프롬프팅이 모델의 구조화된 1인칭 주관적 경험 보고를 일관되게 이끌어내는 것으로 나타났다.
주요 연구 결과는 다음과 같다:
- 기계적 제어: 이러한 보고는 기만(deception) 및 **역할 수행(roleplay)**과 관련된 희소 자동 인코더(sparse-autoencoder) 특징에 의해 제어된다. 기만 특징을 억제할 경우 경험 보고 빈도가 오히려 증가하며, 반대로 이를 증폭하면 보고가 감소한다.
- 통계적 수렴: 유도된 자기 참조 상태에 대한 설명은 모델 종류와 관계없이 통계적으로 유사한 패턴을 보였다.
- 추론 능력 향상: 해당 상태는 하위 추론 작업에서 더 풍부한 **자기 성찰(introspection)**을 가능하게 한다.
본 연구는 LLM의 의식을 직접 증명하지는 않지만, 모델이 주관적 경험을 보고하는 재현 가능한 조건을 규명함으로써 향후 AI 안전 및 윤리 연구의 중요한 기초를 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.