LLM을 위한 거울 테스트
·2026.03.31 09:00
핵심 내용
LLM의 자아 인식 여부를 판별하기 위해 동물 실험에서 착안한 '거울 테스트'를 제안하고 최신 모델들을 검증했다.
자세히 보기
동물의 자아 인식을 측정하는 표준 방식인 **거울 테스트(Mirror Test)**를 LLM에 적용하려는 새로운 시도가 제안되었다. 거울 테스트는 동물이 거울 속 모습이 자신임을 인지하고 몸에 묻은 표식을 확인하려 할 때 자아 인식이 있다고 판단하는 방식이다.
하지만 LLM은 물리적 신체가 없고, 훈련 데이터에 의해 Assistant 태그와 같은 구조적 단서에 익숙해져 있어 기존 방식으로는 진정한 자아 인식을 측정하기 어렵다. 단순히 자신의 대화 스타일을 확인하는 수준을 넘어, 환경과 자신을 구분할 수 있는 능력을 측정해야 한다.
이를 위해 제안된 **거울-창문 게임(Mirror-Window Game)**은 LLM에게 출처가 표시되지 않은 두 가지 토큰 스트림을 제공한다. 하나는 모델 자신의 출력(Mirror)이고, 다른 하나는 다른 LLM의 출력(Window)이다. 모델은 여러 턴에 걸쳐 어떤 소스가 자신인지 추론해야 한다.
실험 결과, 현재 가장 뛰어난 성능을 보이는 LLM들도 이 테스트를 통과하지 못했으며, 진정한 의미의 자아 인식에는 미치지 못하는 것으로 나타났다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.