AI Briefing

Qwen3-1.7B 미세조정

Used a Claude Code skill to fine-tune Qwen3-1.7B from 327 noisy traces, matches GLM-5

·2026.04.28 01:30

327개 잡음 트레이스로 정제·합성해 Qwen3-1.7B가 GLM-5를 앞섰다.

327개의 노이즈가 섞인 생산 트레이스를 그대로 학습하지 않고, 먼저 정제한 뒤 그 결과를 바탕으로 합성 데이터를 생성해 Qwen3-1.7B를 미세조정했다.

  • 1단계: 관련 없는 트레이스를 제거해 오프토픽 항목을 걸러냈다.
  • 2단계: 4개 teacher LLM이 noisy output을 재라벨링하고, arbiter가 최종 후보를 골랐다.
  • 3단계: 정제된 트레이스를 컨텍스트로 사용해 약 1만 개 합성 예제를 만들었다.
  • 4단계: 학생 모델은 다중 턴 tool-calling 기준으로 학습했다.

78개 테스트셋에서 Qwen3-1.7B tuned는 LLM-as-a-Judge 0.846, staged_tool_call 0.769, function match 76/78을 기록했다.

비교 대상인 **GLM-5(744B teacher)**는 각각 0.808, 0.695, 69/78이었고, untuned Qwen3-1.7B는 0.513, 0.535, 45/78에 그쳤다.

핵심은 원시 로그를 그대로 증류하는 대신, 정제 신호를 바탕으로 합성 데이터를 만들고 그 데이터로 학생 모델을 학습시키는 파이프라인이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.