OpenAI Privacy Filter 소개
핵심 내용
로컬에서 PII를 탐지·마스킹하는 오픈웨이트 모델을 공개했다.
자세히 보기
OpenAI가 Privacy Filter를 공개했다. 텍스트 속 개인식별정보(PII)를 탐지하고 마스킹하는 오픈웨이트 모델로, 로컬 환경에서 실행할 수 있어 데이터가 서버로 나가지 않아도 된다.
이 모델은 긴 입력을 빠르게 처리하는 고처리량 privacy 워크플로우용으로 설계됐고, 문맥을 반영해 unstructured text 안의 민감 정보를 한 번에 판별한다. OpenAI는 자체 privacy-preserving 워크플로우에도 이 모델의 fine-tuned 버전을 사용하고 있다고 밝혔다.
핵심 사양은 다음과 같다.
- 1.5B total parameters, 50M active parameters
- 128,000 tokens까지 지원하는 long-context
- bidirectional token-classification + constrained Viterbi span decoding
- BIOES span tags로 더 깔끔한 마스킹 경계 생성
탐지 범주는 총 8개다.
private_personprivate_addressprivate_emailprivate_phoneprivate_urlprivate_dateaccount_numbersecret
특히 account_number는 신용카드나 은행 계좌처럼 다양한 계정 번호를, secret은 비밀번호와 API key 같은 민감 정보를 가리도록 돕는다. 단순 규칙 기반 도구와 달리 문맥을 함께 보며, 공개 정보와 비공개 개인 정보를 구분하는 데 초점을 맞췄다.
성능 면에서는 PII-Masking-300k benchmark에서 **F1 96%**를 기록했고, 저자들이 확인한 annotation issue를 반영한 corrected version에서는 **F1 97.43%**까지 올랐다. precision과 recall은 각각 94.04%/98.04%, corrected version에서는 96.79%/98.08%였다.
학습 과정은 세 단계로 요약된다.
- privacy taxonomy를 먼저 설계해 탐지 범주를 정의
- pretrained language model을 token-classifier로 전환해 supervised objective로 post-training
- 공개 데이터와 synthetic data를 섞어 학습하고, 누락 라벨은 model-assisted annotation과 review로 보완
또한 적은 양의 도메인 데이터로도 fine-tuning 효과가 컸다. domain-adaptation benchmark에서 **F1 54% → 96%**로 개선됐고, 성능은 빠르게 포화에 가까워졌다.
다만 이 모델은 anonymization tool도, compliance certification도 아니며, 고위험 환경에서 policy review를 대체하지 않는다. 언어, 스크립트, 이름 규칙, 도메인에 따라 성능이 달라질 수 있고, 짧은 문맥에서는 과잉/과소 마스킹도 발생할 수 있다.
배포 측면에서는 Apache 2.0 라이선스로 Hugging Face와 GitHub에 공개됐다. OpenAI는 이를 실험, 커스터마이징, 상용 배포에 활용할 수 있다고 설명했고, architecture, label taxonomy, decoding controls, evaluation setup, known limitations까지 함께 제공했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.