AI Briefing

103B-token Usenet corpus 공개

I spent years building a 103B-token Usenet corpus (1980–2013) and finally documented it [P]

·2026.05.02 03:01

33년치 Usenet 103.1B-token 코퍼스와 정제 방식이 공개됐다.

1980~2013년 Usenet 전체 아카이브를 묶은 103.1B 토큰 코퍼스가 정리됐다. 규모는 4억 800만 개 게시물, 1만 8,347개 뉴스그룹, 33년 연속 커버리지다.

정제 과정은 다음을 포함한다.

  • 중복 제거
  • alt.binaries.* 계층 제외
  • 인용문 처리
  • 이메일 주소 마스킹
  • Message-ID를 SHA-256으로 해시
  • MBOX 원본을 gzip 압축 JSONL로 변환

모든 레코드에 Meta fastText LID-176을 적용한 결과, 전체의 **96.6%**가 영어였고 100개 이상 언어가 섞였다. 특히 soc.culture.* 그룹은 비영어 비중이 높다.

시계열적으로는 1986년 이전엔 희소하고, 1990년대 초부터 빠르게 늘어 1999~2000년에 정점을 찍은 뒤 포럼과 소셜미디어에 밀려 감소했다. 데이터카드, 정제 방법, 대표 샘플은 Hugging Face에 공개됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.