103B-token Usenet corpus 공개
I spent years building a 103B-token Usenet corpus (1980–2013) and finally documented it [P]
·2026.05.02 03:01
핵심 내용
33년치 Usenet 103.1B-token 코퍼스와 정제 방식이 공개됐다.
자세히 보기
1980~2013년 Usenet 전체 아카이브를 묶은 103.1B 토큰 코퍼스가 정리됐다. 규모는 4억 800만 개 게시물, 1만 8,347개 뉴스그룹, 33년 연속 커버리지다.
정제 과정은 다음을 포함한다.
- 중복 제거
alt.binaries.*계층 제외- 인용문 처리
- 이메일 주소 마스킹
- Message-ID를 SHA-256으로 해시
- MBOX 원본을 gzip 압축 JSONL로 변환
모든 레코드에 Meta fastText LID-176을 적용한 결과, 전체의 **96.6%**가 영어였고 100개 이상 언어가 섞였다. 특히 soc.culture.* 그룹은 비영어 비중이 높다.
시계열적으로는 1986년 이전엔 희소하고, 1990년대 초부터 빠르게 늘어 1999~2000년에 정점을 찍은 뒤 포럼과 소셜미디어에 밀려 감소했다. 데이터카드, 정제 방법, 대표 샘플은 Hugging Face에 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.