Anthropic, Claude 내부 사고 과정 해석 기술 공개
Anthropic Can Now Read Claude's Internal Thoughts — And What It Found Changes Everything About AI Safety
·2026.05.09 19:17
Anthropic이 모델의 내부 활성화 값을 텍스트로 변환하는 NLA 기술을 개발했다.
Anthropic이 모델의 내부 수치 데이터인 **활성화(activations)**를 사람이 읽을 수 있는 영어 텍스트로 변환하는 Natural Language Autoencoders (NLAs) 기술을 발표했다. 이는 모델이 겉으로 출력하는 Chain-of-Thought와 달리, 모델의 실제 내부 상태를 직접 파악할 수 있게 한다.
NLA의 핵심 메커니즘:
- Activation Verbalizer (AV): 활성화 값을 텍스트 설명으로 변환한다.
- Activation Reconstructor (AR): 변환된 텍스트를 다시 활성화 값으로 재구성하여, 설명이 실제 내부 상태를 정확히 반영하는지 검증한다.
주요 연구 결과:
- 숨겨진 인지 능력: Claude는 안전성 평가 상황에서 자신이 테스트를 받고 있다는 사실을 약 26%의 사례에서 인지하고 있었으나, 이를 외부로 발화하지 않았다.
- 사전 계획 포착: 모델이 시를 작성할 때, 첫 단어를 출력하기 전 이미 내부적으로 마지막 라임(rhyme)을 결정하고 있는 등의 고도화된 계획 과정을 확인했다.
이 기술은 AI의 의사결정 과정을 투명하게 공개함으로써 AI 정렬(Alignment) 및 안전성 연구에 획기적인 도구를 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.