AI Briefing

SupraLabs, 11.5만 건 규모의 대규모 Chat Title 데이터셋 공개

Worlds Biggest Chat Title Dataset From SupraLabs

·2026.06.20 19:24

SupraLabs가 인스트럭션 튜닝 및 벤치마킹을 위한 11.5만 건 규모의 대규모 채팅 제목 데이터셋을 공개했다.

SupraLabs가 기존의 주요 데이터셋인 ogrnz/chat-titles를 상회하는 규모의 Chat Title 생성 데이터셋을 Hugging Face에 공개했습니다.

이번 데이터셋은 기존 1만 건 수준에서 11.5만 건으로 규모를 대폭 확장했으며, 용도에 따라 두 가지 버전으로 제공됩니다.

  • Filtered 버전: SupraLabs/chat-titles-filtered-115K (일반적인 학습 및 튜닝 권장)
  • Unfiltered 버전: SupraLabs/chat-titles-unfiltered-150K (사용자 맞춤형 필터링용)

해당 데이터셋은 모델의 인스트럭션 튜닝(Instruction Tuning), 분류 스타일의 제목 생성, 그리고 소형 모델(Small Models)의 성능 벤치마킹을 목적으로 설계되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.