AI Briefing

오픈채팅 제목 및 설명 기반 유해 콘텐츠 탐지 모델 개발

·2026.08.25 16:00

핵심 내용

LINE이 오픈채팅 유해 콘텐츠 탐지를 위해 Granite Guardian 3.1 2B 모델을 활용한 모니터링 시스템을 구축했다.

자세히 보기

LINE AI 서비스 랩 팀은 오픈채팅방의 이름과 설명을 분석하여 유해 콘텐츠를 자동으로 판별하는 모델을 개발했다. 기존 모델이 일부 국가의 세분화된 판단 기준을 충족하지 못해 수동 검토가 필요했던 문제를 해결하기 위한 프로젝트다.

데이터 정제 단계에서는 동일한 이름과 설명에 대해 서로 다른 페널티가 부여된 사례를 처리했다. 가장 심각한 페널티가 2회 이상 부과된 경우 이를 최종 레이블로 채택하고, 1회만 부과된 경우 노이즈로 판단해 제외했다. 페널티 사유가 상이할 경우 데이터셋 전체에서 더 희소한 사유를 선택하는 TF-IDF 기반 접근법을 적용했다.

모델 선정 시 Granite Guardian 3.1 2B을 최종 선택했다. 이는 IBM Research에서 출시한 모델로, '입력이 유해한가?'라는 질문에 대한 'Yes' 또는 'No' 토큰의 생성 확률을 비교하여 유해성을 분류한다. 기존 인코더 모델 대신 디코더 모델을 선택한 이유는 최신 디코더 모델이 분류 작업에서도 강력한 성능을 보이기 때문이다. 또한 Apache 라이선스를 준수해 상업적 이용이 가능하고, 실시간 모니터링에 적합한 2B 규모의 경량 모델이라는 점이 선정 배경이 되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.