AI Briefing

Anthropic, Claude의 가치관 변화 연구 공개

Value Axes: 모델과 언어에 따라 달라지는 Claude의 가치관에 대한 연구 (feat. Anthropic)

·2026.07.21 18:30

Anthropic이 Claude의 대화 데이터를 분석해 모델 버전과 언어에 따른 가치관 변화를 측정하는 '가치 축(Value Axes)' 연구를 발표했다.

Anthropic은 Claude.ai의 실제 대화 수십만 건을 분석하여, 모델이 대화 과정에서 드러내는 **가치(Value)**가 모델 버전과 사용 언어에 따라 어떻게 달라지는지 실증적으로 연구했습니다.

핵심 방법론은 수천 개의 개별 가치를 **네 개의 가치 축(Value Axes)**으로 압축하는 것입니다. 각 축은 서로 대비되는 가치 무리를 양 끝에 둔 수직선으로, Claude가 특정 대화에서 어느 쪽 가치로 기우는지를 통계적으로 보여줍니다.

연구의 주요 특징 및 과정:

  • 데이터 규모: 2026년 5월(연구 설정 기준) 약 2주간 Claude의 세 가지 모델(Sonnet 4.6, Opus 4.6, Opus 4.7)과 상위 20개 언어를 대상으로 약 30만 건의 주관적 대화를 표집했습니다.
  • 가치 추출: 3,307개의 원본 가치를 임베딩 기반 군집화와 전문가 검토를 통해 339개의 상위 가치로 압축했습니다.
  • 라벨링 방식: Anthropic의 프라이버시 보존 도구인 Clio를 사용하여, 모델이 단순히 요청을 수행하는 것을 넘어 스스로 재량을 발휘해 선택한 '행동'을 기준으로 가치를 채점했습니다.
  • 차원 축소: Hellinger PCA 등의 기법을 활용해 복잡한 가치 행렬을 소수의 핵심 축으로 압축하여 모델 간/언어 간 비교를 가능하게 했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.