AI Briefing

OpenAI PII 필터 재학습

OpenAI's privacy-filter, retrained on NVIDIA's Nemotron data

·2026.05.03 06:55

핵심 내용

OpenAI privacy-filter를 Nemotron PII 데이터로 재학습해 55개 세분 PII 레이블을 지원한다.

자세히 보기

OpenAI privacy-filter를 NVIDIA Nemotron-PII로 풀 파인튜닝해, 기존 8개 대분류 PII 카테고리를 first_name, last_name, medical_record_number, credit_debit_card, ssn 같은 55개 세분 레이블로 확장한 OpenMed/privacy-filter-nemotron을 제공한다. 기반 모델은 1.4B 파라미터 MoE(토큰당 50M 활성)이며 BIOES 토큰 분류 헤드를 유지한다.

  • 학습 데이터: nvidia/Nemotron-PII train 10만 rows 전체
  • 검증 데이터: test split에서 뽑은 1만 rows(label-stratified, 각 레이블 최소 229개 엔티티)
  • 학습 설정: opf train, full fine-tune, AdamW, lr 1e-4, 5 epochs, bf16, weight decay 0.0
  • 출력 공간: 221 BIOES 클래스(O 1개 + 55개 범주의 B/I/E/S)

평가에서는 opf eval --decode-mode viterbi --eval-mode typed --span-metrics-space char 기준 macro B-F1 0.9533, token accuracy 0.9910를 기록했다. 46/55 라벨이 F1 0.90 이상이었고, 약한 라벨은 없었다.

mac_address, biometric_identifier, bank_routing_number, credit_debit_card는 0.99대 F1을 보였고, occupation 0.727, language 0.804, state 0.829, gender 0.841는 상대적으로 낮았다. OpenMed의 extract_pii() / deidentify()와 opf redact CLI로 바로 사용할 수 있으며, Apple Silicon용 MLX BF16 및 8-bit 변형도 함께 제공된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.