AI Briefing

Claude의 헌법

·2026.01.22 03:26

Anthropic은 명시적 원칙을 기반으로 하는 Constitutional AI를 통해 Claude의 안전성과 유용성을 강화했다.

기존의 모델 학습 방식은 인간이 모델의 답변을 직접 비교하고 선택하는 피드백 방식에 의존했다. 하지만 이 방식은 작업자가 유해한 콘텐츠에 노출될 위험이 있고, 모델이 복잡해질수록 확장성이 떨어진다는 한계가 있다.

**Constitutional AI(CAI)**는 이러한 문제를 해결하기 위해 인간의 피드백 대신 AI가 스스로 원칙에 따라 답변을 평가하도록 설계되었다. 모델은 **헌법(Constitution)**이라 불리는 명시적인 원칙 세트를 따르며, 이를 통해 유해하거나 차별적인 답변을 피하고 도움이 되면서도 정직하며 무해한(helpful, honest, harmless) 시스템을 구축한다.

CAI 학습 과정은 크게 두 단계로 진행된다:

  • 1단계: 모델이 주어진 원칙과 예시를 바탕으로 자신의 답변을 스스로 비판하고 수정하도록 학습한다.
  • 2단계: 강화 학습 과정에서 인간 대신 AI가 생성한 피드백을 사용하여 더 무해한 답변을 선택하도록 훈련한다.

이 방식을 통해 Pareto improvement(파레토 개선)를 달성하여, 기존 방식보다 더 유용하면서도 동시에 더 무해한 모델을 만들 수 있다. 또한, 이는 인간의 직접적인 개입 없이도 모델을 감독할 수 있는 Scalable oversight(확장 가능한 감독)의 성공적인 사례로 평가받는다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.