OpenAI PII 필터 재학습
OpenAI's privacy-filter, retrained on NVIDIA's Nemotron data
OpenAI privacy-filter를 Nemotron PII 데이터로 재학습해 55개 세분 PII 레이블을 지원한다.
OpenAI privacy-filter를 NVIDIA Nemotron-PII로 풀 파인튜닝해, 기존 8개 대분류 PII 카테고리를 first_name, last_name, medical_record_number, credit_debit_card, ssn 같은 55개 세분 레이블로 확장한 OpenMed/privacy-filter-nemotron을 제공한다. 기반 모델은 1.4B 파라미터 MoE(토큰당 50M 활성)이며 BIOES 토큰 분류 헤드를 유지한다.
- 학습 데이터:
nvidia/Nemotron-PIItrain 10만 rows 전체 - 검증 데이터: test split에서 뽑은 1만 rows(label-stratified, 각 레이블 최소 229개 엔티티)
- 학습 설정:
opf train, full fine-tune, AdamW, lr 1e-4, 5 epochs, bf16, weight decay 0.0 - 출력 공간: 221 BIOES 클래스(O 1개 + 55개 범주의 B/I/E/S)
평가에서는 opf eval --decode-mode viterbi --eval-mode typed --span-metrics-space char 기준 macro B-F1 0.9533, token accuracy 0.9910를 기록했다. 46/55 라벨이 F1 0.90 이상이었고, 약한 라벨은 없었다.
mac_address, biometric_identifier, bank_routing_number, credit_debit_card는 0.99대 F1을 보였고, occupation 0.727, language 0.804, state 0.829, gender 0.841는 상대적으로 낮았다. OpenMed의 extract_pii() / deidentify()와 opf redact CLI로 바로 사용할 수 있으며, Apple Silicon용 MLX BF16 및 8-bit 변형도 함께 제공된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.