AI Briefing

OpenAI·GLiNER PII 비교

OpenAI's Privacy Filter vs GLiNER on 600 PII samples

·2026.05.01 21:57

OpenAI privacy-filter가 CPU 속도는 앞섰지만 strict F1은 토크나이저 오프셋 때문에 낮았다.

openai/privacy-filterGLiNER large-v2.1600개 PII 샘플(영문 400, 다국어 200)로 비교했다.

  • openai/privacy-filter: 총 1.5B 파라미터, forward당 50M만 활성화되는 sparse MoE
  • GLiNER large-v2.1: 약 300M 파라미터의 zero-shot 모델
  • CPU 처리량: openai/privacy-filter 2.8 samples/sec, GLiNER 1.1 samples/sec

영어 macro F1은 strict exact match 기준 GLiNER 0.367, openai/privacy-filter 0.155였지만, boundary overlap 기준에서는 openai/privacy-filter 0.498로 GLiNER 0.416을 앞섰다. 격차의 대부분은 GPT식 BPE 토크나이저의 오프셋 1자 차이에서 생겨 실제 누락보다 span 정렬 문제에 가까웠다.

카테고리별 boundary 기준으로는 openai/privacy-filter가 PERSON, EMAIL, PHONE, DATE에서 우세했고, ADDRESS는 GLiNER가 앞섰다. 특히 EMAIL은 영어 0.987, 다국어 1.000으로 사실상 해결 수준이었다.

GLiNER는 기본 임계값 0.5보다 0.7에서 F1이 약 8점 더 높았다. 결론적으로, 누락 최소화가 중요하면 GLiNER, 정밀도와 CPU 처리량이 중요하면 openai/privacy-filter가 유리하며, 커스텀 엔티티 타입이 필요하면 GLiNER의 zero-shot 입력 방식이 더 적합하다.

다만 openai/privacy-filter는 trust_remote_code=True와 transformers 개발 브랜치를 요구해 아직 안정판에서 바로 쓰기 어렵다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.