Qwen 3.6 27B, FP8 CoT·Hermes SFT 공개
Qwen 3.6 27b S2 Opus + GLM + Kimi
Qwen 3.6 27B를 Opus CoT·Hermes tool-calling SFT로 개조해 FP8로 공개했다.
Qwen 3.6 27B를 2단계 SFT로 다듬고 FP8_DYNAMIC으로 양자화한 체크포인트다. 목표는 Claude Opus 4.6 스타일 CoT 추론과 Hermes 형식 tool-calling을 한 모델에 합치는 것이며, 최종본은 약 28GB로 단일 GPU 서빙을 겨냥했다.
같은 계열로 Stage-1 BF16 merged base와 Stage-2 LoRA adapter도 별도 공개됐다. 라인지는 Qwen3.6-27B → stage 1 LoRA → merge → stage 2 LoRA → merge → FP8_DYNAMIC quantization 순서다.
학습 구성은 다음과 같다.
- Stage 1: LoRA
r=64,α=64, 2 epoch, effective batch 72, ctx 8192, final loss 0.250 - 데이터:
nohurry/Opus-4.6-Reasoning-3000x-filtered3,900행,khazarai/qwen3.6-plus-high-reasoning-500x500행,Roman1111111/claude-opus-4.6-10000x9,633행 - Stage 2: LoRA
r=16,α=16, 1 epoch, effective batch 32, ctx 16384, final loss 0.334 - 데이터:
DJLougen/hermes-agent-traces-filtered3,679행. 원본lambda/hermes-agent-reasoning-traces는 Kimi + GLM-5.1 설정 기반이며, JSON 검증에서 약 **13%**가 제외됐다. - 하드웨어: RTX PRO 6000 Blackwell 2장(각 96GB), DDP
- 소프트웨어: PyTorch 2.8.0+cu128, Transformers 5.2.0, TRL 0.22.2, PEFT 0.19.1, Unsloth 2026.4.7, datasets 4.3.0
- 양자화: 모든
Linear레이어를 FP8(E4M3, dynamic per-token activation scale) 로 처리하고lm_head는 BF16 유지
공개된 벤치마크는 BFCL V4 live_simple 한 개뿐이며, 81.40% (210/258) 를 기록했다. vLLM 0.19.1과 BFCL QwenFCHandler로 평가했고, 48개 실패 중 형식/JSON 오류는 0건이었다. 작성자는 AIME 2025, HMMT Feb 2026, MMLU-Pro, SuperGPQA, SWE-bench Verified, LiveCodeBench v6 등의 독립 평가를 요청하고 있다.
제한도 분명하다.
- Qwen3.6의 거부 패턴과 토크나이저 편향을 그대로 상속한다.
- 추론 스타일은 Claude Opus 4.6 증류 영향이 크다.
- 도구 호출은
<tool_call>{...}</tool_call>형식에 맞춰져 있어 다른 런타임은 어댑터가 필요하다. - RLHF/DPO는 없고, FP8 버전은 BF16 대비 일부 엣지 태스크에서 소폭 저하가 있다.
- 고위험 분야에는 추가 평가 없이 쓰지 말라고 명시했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.