AI Briefing

Anthropic, Jacobian Lens 오픈소스 공개

Jacobian Lens: 언어 모델 내부 표현을 어휘 토큰으로 읽어내는 해석 도구

·2026.07.22 20:30

Anthropic이 LLM 중간 레이어의 활성화를 어휘 토큰으로 해석하는 도구 Jacobian Lens를 오픈소스로 공개했다.

Anthropic이 언어 모델 해석 가능성 연구의 동반 도구로 Jacobian Lens(J-lens) 를 공개했다. 기존 logit lens는 중간 활성화를 직접 출력 어휘로 사영하는 방식으로, 모든 레이어가 동일한 좌표계를 쓴다고 가정해 초반 레이어에서 해석이 어려웠다.

J-lens는 레이어 l의 잔차 스트림 벡터를 입력-출력 자코비안(Jacobian)의 평균으로 최종 레이어 기저로 선형 변환한 뒤 unembedding으로 디코딩한다. 자코비안을 다수의 프롬프트·위치에 걸쳐 평균화함으로써, 우연히 활성화된 표현과 실제로 발화 잠재력을 가진 표현을 구분할 수 있다.

주요 특징:

  • 레이어별·위치별 최상위 토큰을 격자로 시각화
  • 약 100개 프롬프트만으로도 렌즈 학습 가능 (논문에서는 1,000개 사용)
  • HuggingFace 디코더 모델에 범용 적용 가능 (예제: Qwen 계열)
  • 참조 구현으로, 유지보수·기여는 받지 않는다고 명시

논문 "Verbalizable Representations Form a Global Workspace in Language Models"의 동반 코드로, GitHub에서 공개되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.