AI Briefing

OpenAI PII 필터 공개

New model for detecting and masking PII from OpenAI

·2026.04.26 15:40

OpenAI가 온프레미스용 PII 감지·마스킹 모델 Privacy Filter를 공개했다.

OpenAI가 Privacy Filter를 공개했다. 텍스트에서 PII를 찾아 마스킹하는 양방향 token-classification 모델로, 고속 데이터 정제 워크플로에 맞춰 설계됐다.

  • Apache 2.0 라이선스로 제공돼 실험, 커스터마이징, 상용 배포가 가능하다.
  • 1.5B 파라미터 규모이며 50M active parameters로 브라우저나 노트북에서도 구동할 수 있다.
  • 128,000 토큰 컨텍스트를 지원해 긴 문서를 chunking 없이 처리할 수 있다.
  • openai/privacy-filtergpt-oss와 유사한 구조를 기반으로, 이후 privacy label taxonomy에 맞춰 분류기로 전환·post-training됐다.

모델은 입력을 한 번에 라벨링한 뒤 constrained Viterbi decoding으로 BIOES span을 복원한다. 출력 라벨은 account_number, private_address, private_email, private_person, private_phone, private_url, private_date, secret8개 범주로 구성되며, 토큰 수준에서는 33개 클래스를 예측한다.

런타임에서는 정밀도·재현율과 마스킹 span 길이를 조절하는 운영점 설정이 가능하다. 다만 OpenAI는 이 모델을 익명화 보장 도구가 아니라 redaction 보조 수단으로 규정했고, 비영어권 텍스트·희귀 이름·도메인 특화 식별자에서는 성능 저하와 오탐/미탐이 발생할 수 있다고 밝혔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.