AI Briefing

103B 토큰 규모 Usenet 데이터셋 공개

I built a 103B-token Usenet corpus (1980–2013) — pre-web, human-only, zero AI contamination. Got strong traction on r/ML, thought this community would find it useful.

·2026.05.28 05:23

1980~2013년 사이의 Usenet 데이터를 활용한 103B 토큰 규모의 AI 오염 없는 데이터셋이 공개되었습니다.

1980년부터 2013년까지의 Usenet 코퍼스를 구축한 103.1B 토큰 규모의 데이터셋이 공개되었습니다. 이 데이터셋은 LLM이 등장하기 훨씬 이전의 순수 인간 작성 데이터로 구성되어 있어, 현대 웹 데이터의 특징인 AI 오염(AI contamination), GPT 특유의 말투, RLHF 편향 등을 피할 수 있다는 점이 핵심입니다.

데이터셋의 주요 특징은 다음과 같습니다:

  • AI 오염 제로: 모든 게시물이 LLM 시대 이전에 작성되어 모델의 거절 패턴이나 RLHF 아티팩트가 포함되지 않음.
  • 비(非) 알고리즘 데이터: SEO나 클릭 유도를 위한 최적화가 이루어지기 전의 길고 실질적인 글 위주로 구성.
  • 다양한 도메인 계층:
    • comp.*: 컴퓨팅 관련 (10.3B 토큰)
    • sci.*: 과학 관련 (3.3B 토큰)
    • rec.*: 취미, 스포츠, 예술 등 (16.5B 토큰)
    • humanities.*: 철학, 문학 등

데이터셋은 103.1B 토큰(cl100k_base 기준) 규모이며, 약 4억 800만 개의 게시물을 포함합니다. 중복 제거, 이메일 주소 삭제, 바이너리 제거 등의 전처리가 완료되었습니다. 현재 샘플 데이터는 무료로 다운로드할 수 있으며, 전체 코퍼스는 라이선스 계약을 통해 이용 가능합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.