AI Briefing

Qwen 3.6 27B, FP8 CoT·Hermes SFT 공개

Qwen 3.6 27b S2 Opus + GLM + Kimi

·2026.04.28 18:17

Qwen 3.6 27B를 Opus CoT·Hermes tool-calling SFT로 개조해 FP8로 공개했다.

Qwen 3.6 27B를 2단계 SFT로 다듬고 FP8_DYNAMIC으로 양자화한 체크포인트다. 목표는 Claude Opus 4.6 스타일 CoT 추론과 Hermes 형식 tool-calling을 한 모델에 합치는 것이며, 최종본은 약 28GB로 단일 GPU 서빙을 겨냥했다.

같은 계열로 Stage-1 BF16 merged baseStage-2 LoRA adapter도 별도 공개됐다. 라인지는 Qwen3.6-27B → stage 1 LoRA → merge → stage 2 LoRA → merge → FP8_DYNAMIC quantization 순서다.

학습 구성은 다음과 같다.

  • Stage 1: LoRA r=64, α=64, 2 epoch, effective batch 72, ctx 8192, final loss 0.250
  • 데이터: nohurry/Opus-4.6-Reasoning-3000x-filtered 3,900행, khazarai/qwen3.6-plus-high-reasoning-500x 500행, Roman1111111/claude-opus-4.6-10000x 9,633행
  • Stage 2: LoRA r=16, α=16, 1 epoch, effective batch 32, ctx 16384, final loss 0.334
  • 데이터: DJLougen/hermes-agent-traces-filtered 3,679행. 원본 lambda/hermes-agent-reasoning-traces는 Kimi + GLM-5.1 설정 기반이며, JSON 검증에서 약 **13%**가 제외됐다.
  • 하드웨어: RTX PRO 6000 Blackwell 2장(각 96GB), DDP
  • 소프트웨어: PyTorch 2.8.0+cu128, Transformers 5.2.0, TRL 0.22.2, PEFT 0.19.1, Unsloth 2026.4.7, datasets 4.3.0
  • 양자화: 모든 Linear 레이어를 FP8(E4M3, dynamic per-token activation scale) 로 처리하고 lm_head는 BF16 유지

공개된 벤치마크는 BFCL V4 live_simple 한 개뿐이며, 81.40% (210/258) 를 기록했다. vLLM 0.19.1과 BFCL QwenFCHandler로 평가했고, 48개 실패 중 형식/JSON 오류는 0건이었다. 작성자는 AIME 2025, HMMT Feb 2026, MMLU-Pro, SuperGPQA, SWE-bench Verified, LiveCodeBench v6 등의 독립 평가를 요청하고 있다.

제한도 분명하다.

  • Qwen3.6의 거부 패턴과 토크나이저 편향을 그대로 상속한다.
  • 추론 스타일은 Claude Opus 4.6 증류 영향이 크다.
  • 도구 호출은 <tool_call>{...}</tool_call> 형식에 맞춰져 있어 다른 런타임은 어댑터가 필요하다.
  • RLHF/DPO는 없고, FP8 버전은 BF16 대비 일부 엣지 태스크에서 소폭 저하가 있다.
  • 고위험 분야에는 추가 평가 없이 쓰지 말라고 명시했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.