AI Briefing

2,000만 건 규모 인도 법률 데이터셋 공개

20M+ Indian legal documents with citation graphs and vector embeddings – potential uses for legal NLP? [D]

·2026.04.14 23:14

2,000만 건 이상의 인도 법률 문서와 인용 그래프, 벡터 임베딩을 포함한 대규모 데이터셋이 공개되었습니다.

인도 대법원, 25개 고등법원 및 14개 재판소의 판결문을 포함한 2,000만 건 이상의 법률 문서 데이터셋입니다. 지난 2년간의 구축을 통해 구조화된 메타데이터와 인용 관계를 확보했습니다.

핵심 구성 요소:

  • 구조화된 메타데이터: 법원, 재판부, 날짜, 당사자, 판사, 인용 조항, 관련 법률, 사건 유형 등을 포함합니다.
  • 인용 그래프(Citation Graph): 전체 코퍼스 내의 관계를 '구별(distinguished)', '파기(overruled)', '언급(mentioned)'으로 분류한 기계 판독 가능 그래프를 제공합니다.
  • 임베딩 및 교차 참조: Voyage AI(1024d dense)BM25(sparse) 벡터가 적용되었으며, 23,122개의 법령과 관련 판례를 교차 참조했습니다.

주요 활용 가능성:

  • 연구 및 예측: 그래프 신경망(GNN) 연구, 법률 결과 예측, 판결의 영향력 분석.
  • 언어 모델 고도화: 뉴스나 대화체가 아닌, 격식 있고 정밀한 법률 도메인 특화 인도 언어 모델 파인튜닝.
  • RAG 평가: 인용 관계를 정답(Ground Truth)으로 활용하여 법률 도메인에서의 검색 증강 생성(RAG) 성능 벤치마킹.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.