AI Briefing

Stability AI 연례 무결성 투명성 보고서

·2025.09.18 02:26

핵심 내용

Stability AI가 모델 개발 및 배포 과정의 안전성과 투명성을 입증하기 위한 연례 무결성 투명성 보고서를 발표했다.

자세히 보기

Stability AI는 생성형 AI를 책임감 있게 구축하고 배포하기 위해 Safety-by-Design 원칙을 바탕으로 한 연례 무결성 투명성 보고서를 발표했다. 이 보고서는 모델의 설계, 테스트, 모니터링 및 오남용 방지 체계를 투명하게 공개하여 사용자, 개발자, 정책 입안자와의 신뢰를 구축하는 데 목적이 있다.

학습 데이터는 공개된 인터넷 데이터, 제3자 파트너 데이터, 연구진이 생성한 **합성 데이터(Synthetic Data)**를 활용한다. 다크 웹이나 성인용 웹사이트와 같이 유해 콘텐츠가 유포되는 소스는 배제하며, 자체 개발 및 오픈 소스 NSFW 분류기를 통해 데이터를 필터링한다. 현재까지 학습 데이터셋 내에서 **CSAM(아동 성적 착취물)**은 0%로 확인되었다.

모델 및 플랫폼의 안전성을 위해 다음과 같은 다층적 완화 조치를 적용한다:

  • API 레벨: 실시간 콘텐츠 필터 및 분류기를 통해 정책 위반 입출력을 감지하며, CSAM 해싱 시스템을 통합해 유해물을 차단하고 보고한다.
  • 모델 레벨: Red Teaming을 통해 얻은 통찰을 바탕으로 Fine-tuning 및 Safety LoRA 기술을 적용하여 모델을 배포한다.

Red Teaming은 모델의 심각한 위험을 식별하기 위한 핵심 과정이다. 내부 및 외부 전문가가 참여하며, 영국 법 집행 기관인 OCCIT와 협력하여 Stable Diffusion 3 모델의 안전성을 검증하는 등 지속적인 위험 평가를 수행한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.