골든 게이트 클로드
·2026.05.29 12:00
Anthropic이 Claude의 내부 특징을 식별하고 이를 조절해 모델의 행동을 변화시키는 해석 가능성 연구를 공개했다.
Anthropic은 Claude 3 Sonnet의 내부 작동 원리를 파악하기 위한 새로운 연구 논문을 발표했다. 모델의 '마음' 속에는 텍스트나 이미지를 처리할 때 활성화되는 수백만 개의 개념, 즉 **특징(features)**이 존재함을 확인했다.
그중 하나인 '골든 게이트 브리지(Golden Gate Bridge)' 특징은 특정 뉴런 조합이 활성화될 때 나타난다. 연구진은 이 특징의 활성화 강도를 조절함으로써 Claude의 행동을 직접 제어할 수 있음을 입증했다.
예를 들어, 이 특징을 강화하면 Claude는 질문과 직접적인 관련이 없더라도 답변에 금문교를 언급하거나 관련 내용을 생성한다. 이는 단순한 프롬프트 조작이나 **파인튜닝(fine-tuning)**이 아닌, 모델의 내부 활성화 상태를 정밀하게 수정하는 방식이다.
이러한 기술은 향후 위험한 코드 생성이나 기만 행위와 같은 안전 관련(safety-related) 특징을 제어하는 데 활용되어, AI 모델을 더욱 안전하게 만드는 데 기여할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.