AI Briefing

103B-token Usenet corpus 공개

I spent years building a 103B-token Usenet corpus (1980–2013) and finally documented it [P]

·2026.05.02 03:01

핵심 내용

33년치 Usenet 103.1B-token 코퍼스와 정제 방식이 공개됐다.

자세히 보기

1980~2013년 Usenet 전체 아카이브를 묶은 103.1B 토큰 코퍼스가 정리됐다. 규모는 4억 800만 개 게시물, 1만 8,347개 뉴스그룹, 33년 연속 커버리지다.

정제 과정은 다음을 포함한다.

  • 중복 제거
  • alt.binaries.* 계층 제외
  • 인용문 처리
  • 이메일 주소 마스킹
  • Message-ID를 SHA-256으로 해시
  • MBOX 원본을 gzip 압축 JSONL로 변환

모든 레코드에 Meta fastText LID-176을 적용한 결과, 전체의 **96.6%**가 영어였고 100개 이상 언어가 섞였다. 특히 soc.culture.* 그룹은 비영어 비중이 높다.

시계열적으로는 1986년 이전엔 희소하고, 1990년대 초부터 빠르게 늘어 1999~2000년에 정점을 찍은 뒤 포럼과 소셜미디어에 밀려 감소했다. 데이터카드, 정제 방법, 대표 샘플은 Hugging Face에 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.