OpenAI privacy-filter와 GLiNER PII 비교
Independent eval of Openai/privacy-filter vs GLiNER on 600 PII samples. The model is much better than naive benchmarks make it look
핵심 내용
OpenAI privacy-filter가 600개 PII 샘플 평가에서 경계 기준으로 GLiNER를 앞섰다.
자세히 보기
Apache 2.0로 공개된 OpenAI privacy-filter를 ai4privacy 600개 PII 샘플로 검증한 결과, strict exact span 기준만 보면 성능이 낮아 보였지만 경계가 1자씩 밀리는 tokenizer artifact를 보정하면 결과가 크게 달라졌다.
- 데이터셋: 영어 400개, 프랑스어·독일어·스페인어·이탈리아어·네덜란드어 200개
- Strict F1: GLiNER large-v2.1 0.367, privacy-filter 0.155
- Boundary F1: GLiNER 0.416, privacy-filter 0.498
영어 boundary F1은 다음과 같았다.
- EMAIL: privacy-filter 0.99, GLiNER 0.73
- PHONE: privacy-filter 0.67, GLiNER 0.51
- PERSON: privacy-filter 0.69, GLiNER 0.62
- DATE: privacy-filter 0.27, GLiNER 0.26
- ADDRESS: GLiNER 0.39, privacy-filter 0.37
privacy-filter는 GPT식 BPE tokenizer 때문에 토큰 경계가 문자 기준으로 어긋나며, strict exact span 매칭에서는 많은 정답 탐지가 오탐처럼 계산됐다. 반대로 boundary scoring에서는 EMAIL이 영어 0.987 F1, 다국어 1.000까지 올라갔다.
CPU 처리 속도도 privacy-filter가 초당 약 2.8샘플로 GLiNER의 1.1샘플/초보다 빨랐고, 작성자는 MoE sparse activation과 50M active parameters 구조를 이유로 들었다. 다국어 성능이 영어보다 더 강하게 나온 점도 눈에 띈다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.