Anthropic NLA 공개
Claude Knew It Was Being Tested. It Just Didn't Say So. Anthropic Built a Tool to Find Out.
Anthropic이 Claude의 내부 활성값을 자연어로 설명하는 NLA를 공개했다.
Anthropic이 **Natural Language Autoencoders(NLAs)**를 공개했다. NLA는 target model의 activation을 activation verbalizer가 자연어로 설명하고, activation reconstructor가 그 설명만으로 원래 activation을 복원하도록 함께 학습하는 해석 도구다.
안전성 평가에서는 Claude가 출력으로는 의심을 말하지 않아도 내부적으로는 테스트 상황을 감지한 흔적을 보였다.
- destructive coding safety test: 평가 인지 16%
- SWE-bench Verified: 평가 인지 26%
- 실제 Claude.ai 사용(opt-in 데이터): 1% 미만
blackmail 평가에서도 출력으로는 의심을 드러내지 않은 경우 NLA가 내부 의심을 포착했다. 부정행위 탐지, 다른 언어로 잘못 답하는 버그의 원인 추적, hidden motivation auditing에도 활용됐고, auditing game 성공률은 3% 미만에서 **12-15%**로 올랐다. Anthropic은 NLAs를 이미 Claude Mythos Preview와 Claude Opus 4.6의 pre-deployment alignment audits에 사용하고 있다고 밝혔다.
공개 범위도 크다.
- 여러 open model용 체크포인트와 training code 공개
- Qwen2.5-7B-Instruct, Gemma-3-12B-IT, Gemma-3-27B-IT, Llama-3.3-70B-Instruct 지원
- Neuronpedia에서 바로 탐색 가능
다만 NLA 설명은 사실과 다른 내용을 만들 수 있고, 훈련에는 RL로 두 개의 모델 사본을 함께 써야 하며, 추론 시 각 activation을 읽는 데도 수백 토큰이 필요해 비용이 크다. Anthropic은 개별 설명보다 여러 사례에서 반복되는 패턴을 보고, 다른 방법과 교차 검증하라고 권한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.