카카오, 한국어 특화 AI 가드레일 'Kanana Safeguard' 시리즈 공개
핵심 내용
카카오가 유해 콘텐츠, 법적 리스크, 프롬프트 공격을 탐지하는 3종 모델을 Apache 2.0으로 오픈소스 공개했다.
자세히 보기
카카오가 생성형 AI의 안전성을 확보하기 위해 개발한 Kanana Safeguard 시리즈를 공개했다. 이 프로젝트는 AI가 유해한 응답을 생성하거나 악의적인 프롬프트 공격에 취약해지는 문제를 해결하기 위해 설계된 한국어 특화 가드레일 모델들이다.
3가지 핵심 모델과 역할
Kanana Safeguard 시리즈는 리스크의 성격과 탐지 범위에 따라 세 가지 모델로 구성되었다.
- Kanana Safeguard (8B): 사용자 발화 및 AI 응답을 분석해 증오, 성적 콘텐츠, 범죄 등 7가지 유해 콘텐츠 리스크를 탐지한다.
- Kanana Safeguard-Siren (8B): 사용자 발화 단계에서 청소년보호법 위반, 의료·법률 조언 필요성 등 법적·정책적 리스크를 사전에 차단한다.
- Kanana Safeguard-Prompt: 악의적인 프롬프트 공격을 필터링하는 경량 모델로, 입력 텍스트 분류에 집중한다.
한국어 특화 및 경량화 전략
영어 기반의 기존 가드레일 모델이 한국어의 어순, 높임말, 은유 등을 포착하기 어려운 점을 극복하기 위해 카카오는 전문 라벨러와 LLM 합성 데이터를 활용해 고품질 한국어 데이터셋을 구축했다. 특히 Kanana Safeguard-Prompt 모델은 비용과 성능의 트레이드오프를 고려해 작은 모델(2.1B급)로 개발되었으며, 배포 후 지속적 모니터링을 통해 성능을 개선하는 전략을 채택했다. 또한 모든 모델은 추론 속도를 높이고 리소스를 절감하기 위해 출력값을 단일 토큰으로 처리하도록 설계되었다.
오픈소스 공개
카카오는 2025년 5월 Kanana Safeguard 시리즈를 Hugging Face를 통해 Apache License 2.0으로 공개했다. 이는 AI 안전성을 공공의 가치로 보고 개발자와 서비스 제공자가 신뢰할 수 있는 AI 생태계를 구축하는 데 기여하기 위함이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.