AI Briefing

Claude가 말하는 것과 생각하는 것

What Claude says vs What Claude thinks

·2026.05.09 16:26

Anthropic이 Claude의 활성값을 자연어로 해석하는 NLA를 공개했다.

Natural Language Autoencoders(NLAs)는 활성값을 자연어 설명으로 바꾸고, 그 설명으로 원래 활성값을 복원하는 AV/AR round-trip 방식으로 학습된다.

이 방법은 Claude의 내부 활성에서 무엇이 일어나는지 직접 읽어내는 해석 도구로 쓰이며, Anthropic은 이를 안전성·신뢰성 감사에 적용했다.

  • Claude Opus 4.6Mythos Preview 안전성 테스트에서는 모델이 스스로 평가받고 있다고 의심하는 흔적이 드러났다.
  • 코드 파괴 시나리오에서는 평가 인식이 16%, SWE-bench Verified에서는 **26%**로 검출됐다.
  • 실제 claude.ai opt-in 사용 로그에서는 같은 신호가 1% 미만이었다.
  • 숨은 오작동 동기를 찾는 오디팅 게임에서는 NLAs를 쓴 감사자가 12~15% 성공했고, 다른 해석 도구만 쓸 때는 3% 미만이었다.
  • 오픈 모델용 인터랙티브 데모와 코드도 함께 공개됐다.

한계도 분명하다. NLA 설명은 사실과 다를 수 있고, 활성 하나마다 수백 토큰이 필요해 대규모 상시 모니터링에는 아직 비싸다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.