AI Briefing

SupraLabs, 500만 건 규모의 추론 데이터셋 공개

[BIG DATASET RELEASE] - SupraLabs/reasoning-corpus-4K-5M-v1 - Train your tiny SLMs to think!

·2026.07.24 20:28

소형 언어 모델(SLM)의 추론 성능 향상을 위한 500만 건 규모의 Reasoning Corpus 데이터셋이 공개되었다.

SupraLabs에서 소형 언어 모델(SLM)의 **SFT(Supervised Fine-tuning)**를 위해 설계된 reasoning-corpus-4K-5M-v1 데이터셋을 Hugging Face에 공개했다.

이 데이터셋은 총 500만 개의 샘플로 구성되어 있으며, 주요 특징은 다음과 같다.

  • 데이터 구성: 사용자 프롬프트(user), 모델의 사고 과정(thought_trace), 최종 답변(assistant), 그리고 이를 통합한 ChatML 형식을 포함한다.
  • 학습 최적화: 모든 샘플은 5k 시퀀스 길이 이내로 구성되어 있어, 리소스가 제한된 소형 모델 학습에 최적화되어 있다.
  • 데이터 항목: 각 샘플은 출처(repo_id), 토큰 길이(tok_len), 사용자 입력, 사고 추적, 최종 답변 등의 메타데이터를 포함한다.

해당 데이터셋은 모델이 단계별 사고(Chain-of-Thought)를 통해 논리적 추론을 수행할 수 있도록 돕는 데 중점을 두고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.