AI Briefing

Claude Opus 4.6/4.7 파인튜닝 데이터셋

Finetuning Dataset: Claude Opus 4.6/4.7 - 8.7k Chats

·2026.05.01 15:13

Claude Opus 4.6/4.7 기반 8,706건 합성 파인튜닝 데이터셋이 공개됐다.

Claude Opus 4.6/4.7로 생성한 synthetic fine-tuning dataset이 Hugging Face에 올라왔다.

  • 8,706개 예시, 추정 토큰 17,013,533개, 평균 1,954토큰/예시
  • Multi-turn3,454개(39.7%), single-turn은 5,252개(60.3%)
  • full_train.jsonl(전체 28개 카테고리), instruct_train.jsonl(24개 instructional 카테고리), roleplay_train.jsonl(창작 4개 카테고리), code_train.jsonl(coding+math)로 분리
  • 상위 카테고리는 coding(1,628), humanities(862), science(737)
  • 기본 정리만 거쳤고, refusal·safety 응답을 억제하는 방향으로 가공했다고 적었다

코딩, 수학, 과학, 인문학, 창작을 넓게 아우르는 파인튜닝용 합성 데이터셋으로 참고할 만하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.