OpenAI privacy-filter와 GLiNER PII 비교
Independent eval of Openai/privacy-filter vs GLiNER on 600 PII samples. The model is much better than naive benchmarks make it look
OpenAI privacy-filter가 600개 PII 샘플 평가에서 경계 기준으로 GLiNER를 앞섰다.
Apache 2.0로 공개된 OpenAI privacy-filter를 ai4privacy 600개 PII 샘플로 검증한 결과, strict exact span 기준만 보면 성능이 낮아 보였지만 경계가 1자씩 밀리는 tokenizer artifact를 보정하면 결과가 크게 달라졌다.
- 데이터셋: 영어 400개, 프랑스어·독일어·스페인어·이탈리아어·네덜란드어 200개
- Strict F1: GLiNER large-v2.1 0.367, privacy-filter 0.155
- Boundary F1: GLiNER 0.416, privacy-filter 0.498
영어 boundary F1은 다음과 같았다.
- EMAIL: privacy-filter 0.99, GLiNER 0.73
- PHONE: privacy-filter 0.67, GLiNER 0.51
- PERSON: privacy-filter 0.69, GLiNER 0.62
- DATE: privacy-filter 0.27, GLiNER 0.26
- ADDRESS: GLiNER 0.39, privacy-filter 0.37
privacy-filter는 GPT식 BPE tokenizer 때문에 토큰 경계가 문자 기준으로 어긋나며, strict exact span 매칭에서는 많은 정답 탐지가 오탐처럼 계산됐다. 반대로 boundary scoring에서는 EMAIL이 영어 0.987 F1, 다국어 1.000까지 올라갔다.
CPU 처리 속도도 privacy-filter가 초당 약 2.8샘플로 GLiNER의 1.1샘플/초보다 빨랐고, 작성자는 MoE sparse activation과 50M active parameters 구조를 이유로 들었다. 다국어 성능이 영어보다 더 강하게 나온 점도 눈에 띈다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.