2,000만 건 규모 인도 법률 데이터셋 공개
20M+ Indian legal documents with citation graphs and vector embeddings – potential uses for legal NLP? [D]
·2026.04.14 23:14
2,000만 건 이상의 인도 법률 문서와 인용 그래프, 벡터 임베딩을 포함한 대규모 데이터셋이 공개되었습니다.
인도 대법원, 25개 고등법원 및 14개 재판소의 판결문을 포함한 2,000만 건 이상의 법률 문서 데이터셋입니다. 지난 2년간의 구축을 통해 구조화된 메타데이터와 인용 관계를 확보했습니다.
핵심 구성 요소:
- 구조화된 메타데이터: 법원, 재판부, 날짜, 당사자, 판사, 인용 조항, 관련 법률, 사건 유형 등을 포함합니다.
- 인용 그래프(Citation Graph): 전체 코퍼스 내의 관계를 '구별(distinguished)', '파기(overruled)', '언급(mentioned)'으로 분류한 기계 판독 가능 그래프를 제공합니다.
- 임베딩 및 교차 참조: Voyage AI(1024d dense) 및 BM25(sparse) 벡터가 적용되었으며, 23,122개의 법령과 관련 판례를 교차 참조했습니다.
주요 활용 가능성:
- 연구 및 예측: 그래프 신경망(GNN) 연구, 법률 결과 예측, 판결의 영향력 분석.
- 언어 모델 고도화: 뉴스나 대화체가 아닌, 격식 있고 정밀한 법률 도메인 특화 인도 언어 모델 파인튜닝.
- RAG 평가: 인용 관계를 정답(Ground Truth)으로 활용하여 법률 도메인에서의 검색 증강 생성(RAG) 성능 벤치마킹.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.