AI Briefing

언어 모델 배포 모범 사례

·2022.06.02 21:55

LLM 제공자에게 악용 방지와 안전성 문서화를 위한 원칙을 제시했다.

LLM 배포 원칙은 API 제공 경험을 바탕으로 정리됐지만, 오픈소스 공개나 사내 활용에도 적용할 수 있다. 상용 사용과 안전 이슈가 아직 새롭고 계속 변하고 있어, 원칙과 실천법은 업계와 함께 지속적으로 업데이트된다.

  • 악용 차단: 사용 지침과 약관은 스팸, 사기, 가짜 여론 조성 같은 피해를 금지하고, 보호 특성에 기반한 사람 분류처럼 고위험 용례도 명시적으로 막아야 한다. 이를 위해 rate limit, content filtering, 생산용 접근 사전 승인, 이상 징후 모니터링이 필요하다.
  • 의도치 않은 피해 완화: 포괄적 평가로 모델 한계를 점검하고, 학습 데이터의 편향을 줄이며, human feedback 기반 학습으로 unsafe behavior를 낮춘다.
  • 한계 문서화: 편향이나 보안상 취약한 코드 생성 가능성처럼 완전히 제거하기 어려운 약점을 공개하고, 모델·용례별 안전 수칙도 함께 제공한다.

다양한 배경의 팀을 꾸리고 외부 이해관계자의 의견을 넓게 반영하는 것도 핵심이다. 공급망 노동을 존중해 라벨러가 특정 작업을 거부할 수 있게 하고, 안전성과 악용 대응에서 얻은 교훈을 공개해 업계 전반의 반복 개선을 돕는다.

Anthropic, Google, Microsoft, Stanford CRFM 등도 이 원칙에 지지를 보냈고, 더 많은 학계·산업·시민사회가 참여하는 세부 규범이 필요하다고 강조했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.