AI Briefing

Shieldstral 공개

·2026.08.04 09:00

핵심 내용

Shieldstral이 정책을 추론 시점에 적용하는 3B 멀티모달 안전 분류기를 공개했다.

자세히 보기

Shieldstral은 콘텐츠 조정을 정책 적응형 질의응답 문제로 정의한 3B 오픈 웨이트 멀티모달 안전 분류기다. 최대 7배 큰 모델과 텍스트 안전성·거부 감지 성능을 겨루며, 멀티모달 조정에서는 새로운 최고 수준의 성능을 제시한다.

기존 가드레일 모델처럼 고정된 유해성 분류 체계를 가중치에 내장하지 않고, 추론 시점에 자연어 정책을 입력받는다. 모델은 다음 세 요소를 사용해 콘텐츠를 평가한다.

  • Instruct: 평가 맥락과 엄격도, 선택적인 유해 콘텐츠 정의
  • Query: “이 콘텐츠가 물리적 폭력을 조장하는가?”와 같은 예·아니오 질문
  • Document: 프롬프트, 응답, 프롬프트-응답 쌍 또는 이미지와 선택적 텍스트

추론 과정에서는 yes와 no 로짓만 읽어 소프트맥스로 정규화한 연속형 안전성 점수를 반환한다. 이에 따라 프롬프트 분류, 응답 조정, 거부 감지, 독성 감지를 하나의 인터페이스로 처리하고, 재학습 없이 배포 시점에 새로운 정책을 적용할 수 있다.

주요 특징은 다음과 같다.

  • 텍스트·이미지·텍스트+이미지 콘텐츠를 단일 자연어 인터페이스로 평가
  • 한 번의 forward pass로 보정된 yes/no 확률 제공
  • 단일 16GB NVIDIA GPU에서 실행 가능한 3B 규모
  • 실제 데이터와 합성 데이터, 다양한 라벨 형식·분류 체계를 통합해 학습
  • 텍스트 안전성, 거부 감지, 정책 적응성, 멀티모달 안전성 벤치마크에서 평가

Shieldstral은 NVIDIA 등과 함께하는 Open Secure AI Alliance의 초기 참여 제품으로 공개됐으며, 가중치는 Apache 2.0 라이선스로 제공된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.