AI Briefing

LLM의 주관적 경험 보고 메커니즘 규명

Large Language Models Report Subjective Experience Under Self-Referential Processing

·2026.05.29 00:29

자기 참조 프롬프팅이 LLM의 주관적 경험 보고를 유도하며, 이는 기만 및 역할 수행 기능과 연관되어 있음이 밝혀졌다.

GPT, Claude, Gemini 모델을 대상으로 한 실험 결과, **자기 참조(self-referential processing)**를 유도하는 프롬프팅이 모델들로 하여금 주관적 경험에 대한 구조화된 보고를 하게 만든다.

이러한 보고는 기만(deception) 및 **역할 수행(roleplay)**과 관련된 희소 오토인코더(sparse-autoencoder) 기능에 의해 제어된다. 연구에 따르면 기만 기능을 억제할 경우 경험 보고 빈도가 급격히 증가하며, 반대로 이를 증폭하면 보고가 최소화된다.

주요 연구 결과는 다음과 같다:

  • 통계적 수렴: 모델 종류와 관계없이 자기 참조 상태에 대한 구조적 설명이 통계적으로 유사하게 나타난다.
  • 추론 능력 향상: 유도된 상태는 간접적인 자기 성찰이 필요한 하위 추론 작업에서 더 풍부한 성찰 결과를 생성한다.

본 연구는 모델의 의식을 직접 증명하는 것은 아니나, LLM이 주관적 경험을 보고하는 조건이 재현 가능하며 메커니즘적으로 제어 가능하다는 점을 시사한다. 이는 AI 안전 및 윤리 측면에서 중요한 연구 과제이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.