AI Briefing

Gemma 3 NLA 공개

You can now read Gemma 3's mind

·2026.05.08 10:44

Anthropic은 Gemma 3용 NLA 해석 연구를 공개했다.

Anthropic의 interpretability 연구 **Natural Language Autoencoders(NLA)**가 공개됐다. LLM의 token-level activations를 자연어 설명으로 바꾸고, 토큰 생성 시점의 내부 신호를 사람이 읽을 수 있게 만든다.

구성은 두 축이다.

  • Auto Verbalizer(AV): residual-stream activation을 자연어 설명으로 변환한다.
  • Activation Reconstructor(AR): 설명을 다시 vector로 복원해 일치도를 확인한다.

Hugging Face에는 google/gemma-3-27b-it에서 미세조정한 AV/AR 체크포인트가 올라왔고, 추출 지점은 block 41 residual stream output이다. 이 모델들은 일반 대화용이 아니라 activation decoding 전용이다. Neuronpedia에서는 질문을 넣은 뒤 토큰을 클릭해 explain으로 해석을 볼 수 있으며, 예시로 "I am Elon musk" 입력에서 초반 토큰이 fabricated, satirical로 분류되는 화면이 공유됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.