AI Briefing

카카오, 한국어 특화 AI 가드레일 'Kanana Safeguard' 시리즈 오픈소스 공개

·2025.05.27 00:00

핵심 내용

카카오가 한국어 사용자 환경에 특화된 3종 AI 가드레일 모델 'Kanana Safeguard' 시리즈를 Apache 2.0 라이선스로 오픈소스 공개했다.

1 / 5

자세히 보기

카카오가 한국어의 어순, 높임말, 문화적 맥락을 반영한 AI 가드레일 모델 'Kanana Safeguard' 시리즈를 Hugging Face를 통해 Apache License 2.0으로 공개했다. 이 시리즈는 리스크 성격과 탐지 범위에 따라 3가지 모델로 분화되었다.

  1. Kanana Safeguard (8B): 사용자 발화와 AI 응답을 모두 고려하여 증오, 괴롭힘, 성적 콘텐츠, 범죄, 아동 성착취, 자살 및 자해, 잘못된 정보 등 7가지 유해 콘텐츠를 탐지한다.
  2. Kanana Safeguard-Siren (8B): 사용자 발화만 분석하여 성인 인증, 전문 조언(의료/법률 등), 개인정보, 지식재산권 등 법적·정책적 리스크를 탐지한다.
  3. Kanana Safeguard-Prompt (2.1B): 경량 모델로, 프롬프트 인젝션(Prompt Injection)과 프롬프트 리킹(Prompt Leaking) 등 악의적인 프롬프트 공격을 탐지한다.

이 모델들은 판단 결과를 '단일 토큰(Single Token)' 형태로 반환하도록 설계되어 추론 속도를 높이고 리소스 사용을 최소화했다. 또한 전문 라벨러가 생성한 고품질 한국어 데이터셋(총 약 24만 개 규모)으로 학습되었으며, 4단계 난이도(Pass Required, Easy, Hard, Challenge)의 평가 데이터를 통해 해외 벤치마크 모델 대비 정밀도와 재현율에서 향상된 성능을 확인했다. 카카오는 AI 안전성이 공공의 가치임을 강조하며 생태계 기여를 위해 이를 공개했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.