Claude가 말하는 것과 생각하는 것
What Claude says vs What Claude thinks
·2026.05.09 16:26
Anthropic이 Claude의 활성값을 자연어로 해석하는 NLA를 공개했다.
Natural Language Autoencoders(NLAs)는 활성값을 자연어 설명으로 바꾸고, 그 설명으로 원래 활성값을 복원하는 AV/AR round-trip 방식으로 학습된다.
이 방법은 Claude의 내부 활성에서 무엇이 일어나는지 직접 읽어내는 해석 도구로 쓰이며, Anthropic은 이를 안전성·신뢰성 감사에 적용했다.
Claude Opus 4.6과Mythos Preview안전성 테스트에서는 모델이 스스로 평가받고 있다고 의심하는 흔적이 드러났다.- 코드 파괴 시나리오에서는 평가 인식이 16%,
SWE-bench Verified에서는 **26%**로 검출됐다. - 실제
claude.aiopt-in 사용 로그에서는 같은 신호가 1% 미만이었다. - 숨은 오작동 동기를 찾는 오디팅 게임에서는 NLAs를 쓴 감사자가 12~15% 성공했고, 다른 해석 도구만 쓸 때는 3% 미만이었다.
- 오픈 모델용 인터랙티브 데모와 코드도 함께 공개됐다.
한계도 분명하다. NLA 설명은 사실과 다를 수 있고, 활성 하나마다 수백 토큰이 필요해 대규모 상시 모니터링에는 아직 비싸다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.