의료 NLP 스택 OpenMed 2.0 출시
A 279M model does multilingual PHI de-identification offline. OpenMed 2.0 is out, Apache-2.0.
·2026.07.29 07:08
의료 데이터 보호를 위한 오픈소스 NLP 스택 OpenMed 2.0이 다국어 PHI 비식별화 기능을 갖춰 출시되었다.
의료 NLP 스택인 OpenMed 2.0이 Apache-2.0 라이선스로 출시되었습니다. 이번 업데이트의 핵심은 클라우드 API에 데이터를 전송하지 않고도 로컬 환경에서 수행 가능한 PHI(개인건강정보) 비식별화 기능입니다.
주요 특징은 다음과 같습니다:
- 경량화된 모델: 279M 및 560M 파라미터 규모의 인코더를 사용하여 효율적인 비식별화 작업을 수행하며, 클라우드 기반 API보다 보안성이 높습니다.
- 다국어 지원 확대: 언어 커버리지가 23개에서 56개로 확대되었으며, 벵골어(279M), 중국어(560M), 타밀어(279M) PII 모델이 새롭게 추가되었습니다.
- 브라우저 실행 지원: Transformers.js를 통해 브라우저 환경에서도 직접 실행할 수 있는 아티팩트를 제공합니다.
- 식별자 검증: 51개의 국가 식별자(National Identifier) 검증 기능을 포함하며, 단순 정규표현식을 넘어 실제 체크섬(Checksum)을 사용하는 정교한 검증을 지원합니다.
- 데이터 익명화 리스크 관리: 단순 식별자 제거를 넘어, 데이터 결합을 통한 재식별 위험을 평가하고 이를 방지하기 위한 구조화된 릴리스 리스크 워크플로우를 도입했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.