OpenAI PII 필터 공개
New model for detecting and masking PII from OpenAI
·2026.04.26 15:40
OpenAI가 온프레미스용 PII 감지·마스킹 모델 Privacy Filter를 공개했다.
OpenAI가 Privacy Filter를 공개했다. 텍스트에서 PII를 찾아 마스킹하는 양방향 token-classification 모델로, 고속 데이터 정제 워크플로에 맞춰 설계됐다.
- Apache 2.0 라이선스로 제공돼 실험, 커스터마이징, 상용 배포가 가능하다.
- 1.5B 파라미터 규모이며 50M active parameters로 브라우저나 노트북에서도 구동할 수 있다.
- 128,000 토큰 컨텍스트를 지원해 긴 문서를 chunking 없이 처리할 수 있다.
openai/privacy-filter는 gpt-oss와 유사한 구조를 기반으로, 이후 privacy label taxonomy에 맞춰 분류기로 전환·post-training됐다.
모델은 입력을 한 번에 라벨링한 뒤 constrained Viterbi decoding으로 BIOES span을 복원한다. 출력 라벨은 account_number, private_address, private_email, private_person, private_phone, private_url, private_date, secret의 8개 범주로 구성되며, 토큰 수준에서는 33개 클래스를 예측한다.
런타임에서는 정밀도·재현율과 마스킹 span 길이를 조절하는 운영점 설정이 가능하다. 다만 OpenAI는 이 모델을 익명화 보장 도구가 아니라 redaction 보조 수단으로 규정했고, 비영어권 텍스트·희귀 이름·도메인 특화 식별자에서는 성능 저하와 오탐/미탐이 발생할 수 있다고 밝혔다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.