Claude Opus 4.6/4.7 파인튜닝 데이터셋
Finetuning Dataset: Claude Opus 4.6/4.7 - 8.7k Chats
·2026.05.01 15:13
Claude Opus 4.6/4.7 기반 8,706건 합성 파인튜닝 데이터셋이 공개됐다.
Claude Opus 4.6/4.7로 생성한 synthetic fine-tuning dataset이 Hugging Face에 올라왔다.
- 총 8,706개 예시, 추정 토큰 17,013,533개, 평균 1,954토큰/예시
- Multi-turn은 3,454개(39.7%), single-turn은 5,252개(60.3%)
full_train.jsonl(전체 28개 카테고리),instruct_train.jsonl(24개 instructional 카테고리),roleplay_train.jsonl(창작 4개 카테고리),code_train.jsonl(coding+math)로 분리- 상위 카테고리는 coding(1,628), humanities(862), science(737) 순
- 기본 정리만 거쳤고, refusal·safety 응답을 억제하는 방향으로 가공했다고 적었다
코딩, 수학, 과학, 인문학, 창작을 넓게 아우르는 파인튜닝용 합성 데이터셋으로 참고할 만하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.