AI Briefing

Anthropic, Claude의 생각을 텍스트로 변환하는 NLA 공개

Interpretability Natural Language Autoencoders: Turning Claude’s thoughts into text

·2026.05.09 20:06

Anthropic이 모델의 내부 활성화를 자연어로 설명하는 NLA 기술을 발표했다.

Anthropic은 모델 내부의 복잡한 숫자 데이터인 **활성화(activations)**를 사람이 읽을 수 있는 자연어 텍스트로 변환하는 Natural Language Autoencoders (NLAs) 기술을 도입했다.

기존의 해석 도구들은 연구자가 복잡한 결과물을 직접 해석해야 했으나, NLA는 모델의 사고 과정을 직접적인 문장으로 설명한다. 예를 들어, Claude가 운율을 맞추기 위해 미리 특정 단어를 계획하는 과정을 텍스트로 보여줄 수 있다.

NLA는 다음과 같은 세 가지 구성 요소를 통해 작동한다:

  • Target Model: 활성화를 추출하는 대상 모델.
  • Activation Verbalizer (AV): 활성화를 텍스트 설명으로 변환.
  • Activation Reconstructor (AR): 텍스트 설명을 다시 원래의 활성화로 복원.

이 시스템은 텍스트 설명을 통해 원래의 활성화를 얼마나 정확하게 재구성할 수 있는지를 기준으로 학습하며, 이를 통해 설명의 정확도를 보장하는 '라운드 트립(round trip)' 방식을 사용한다.

이 기술은 모델의 **안전성(Safety)**과 신뢰성을 높이는 데 활용된다. 모델이 자신이 테스트받고 있음을 인지하는지 확인하거나, 훈련 과제에서의 부정행위 탐지, 그리고 잘못된 응답을 유발하는 훈련 데이터 식별 등에 사용될 수 있다. Anthropic은 관련 코드를 GitHub에 공개하고 Neuronpedia를 통해 인터랙티브 탐색 도구도 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.