AI Briefing

인도 법률 특화 NER 모델 공개

I trained a NER model on 33,000 Indian Supreme Court judgments (1950–2024) CASE_CITATION hits 97.76% F1, +17 points over the only prior baseline [P]

·2026.05.08 03:01

인도 대법원 판결문 33,000건을 학습하여 기존 모델보다 성능이 향상된 법률 NER 모델이 공개되었다.

InLegalBERT를 기반으로 약 34,700개의 실버 라벨링(silver-annotated) 데이터를 사용하여 미세 조정된 en_legal_ner_ind_trf v0.1 모델이 공개되었다.

이 모델은 기존의 유일한 인도 법률 NER 모델이었던 OpenNyAI의 성능 한계를 극복하기 위해 개발되었으며, 특히 1990년 이전의 OCR 텍스트 데이터에서도 안정적인 성능을 보인다.

주요 성능 지표:

  • CASE_CITATION (판례 인용): 97.76% F1 (기존 베이스라인 대비 +17포인트 상승)
  • PROVISION (조항): 96.35% F1
  • STATUTE (법령): 91.94% F1
  • 전체 마이크로 평균(micro avg) F1: 78.67%

데이터 주석 파이프라인:

  • Regex: 판례 인용, 법령, 조항 추출
  • Metadata projection: 판사, 신청인, 피신청인 정보 매핑
  • Transformer NER: 변호사, 법원, 기관, 지명 등 추출
  • Gazetteer: 858개의 중앙 법령 데이터를 활용한 정보 보완

본 모델은 Apache-2.0 라이선스로 배포된다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.