AI Briefing

2,000만 건 규모 인도 법률 데이터셋 공개

20M+ Indian legal documents with citation graphs and vector embeddings – potential uses for legal NLP? [D]

·2026.04.14 23:14

핵심 내용

2,000만 건 이상의 인도 법률 문서와 인용 그래프, 벡터 임베딩을 포함한 대규모 데이터셋이 공개되었습니다.

자세히 보기

인도 대법원, 25개 고등법원 및 14개 재판소의 판결문을 포함한 2,000만 건 이상의 법률 문서 데이터셋입니다. 지난 2년간의 구축을 통해 구조화된 메타데이터와 인용 관계를 확보했습니다.

핵심 구성 요소:

  • 구조화된 메타데이터: 법원, 재판부, 날짜, 당사자, 판사, 인용 조항, 관련 법률, 사건 유형 등을 포함합니다.
  • 인용 그래프(Citation Graph): 전체 코퍼스 내의 관계를 '구별(distinguished)', '파기(overruled)', '언급(mentioned)'으로 분류한 기계 판독 가능 그래프를 제공합니다.
  • 임베딩 및 교차 참조: Voyage AI(1024d dense) 및 BM25(sparse) 벡터가 적용되었으며, 23,122개의 법령과 관련 판례를 교차 참조했습니다.

주요 활용 가능성:

  • 연구 및 예측: 그래프 신경망(GNN) 연구, 법률 결과 예측, 판결의 영향력 분석.
  • 언어 모델 고도화: 뉴스나 대화체가 아닌, 격식 있고 정밀한 법률 도메인 특화 인도 언어 모델 파인튜닝.
  • RAG 평가: 인용 관계를 정답(Ground Truth)으로 활용하여 법률 도메인에서의 검색 증강 생성(RAG) 성능 벤치마킹.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.