UkisAI, Qwen 3.8 27B 추론 속도 1.95배 높인 Swift 모델 공개
UkisAI Swift-Qwen3.8-27B / -58.3% thinking, x1.95 speed while keeping the accuracy of xhigh
핵심 내용
UkisAI가 Qwen 3.8 27B의 불필요한 추론 토큰을 58% 줄이고 속도를 1.95배 높인 Swift 모델을 공개했다.
자세히 보기
UkisAI가 Qwen 3.8 27B를 기반으로 추론 효율을 극대화한 Swift-Qwen3.8-27B 모델을 공개했다. 이 모델은 과잉 추론(overthinking) 패턴을 식별하여 최적화함으로써, thinking 토큰을 58% 감소시키고 속도를 1.95배 향상시켰다. 대부분의 벤치마크에서 정확도 손실은 1% 미만으로 유지된다.
최적화 방식 및 성과
기존 추론 길이 강제 단축 방식과 달리, PTQ 및 BF16 모델에서 발견된 '불안한(anxiety-like)' 추론 루프에만 집중하여 페널티를 적용했다. 8xH100 환경에서 다양한 도메인 트레이스를 생성해 공통 토큰을 식별하고, LoRa SFT와 On-Policy Distillation을 통해 정확도를 복원했다.
주요 벤치마크 비교 결과:
- GPQA-Diamond: 정확도 88.4% → 88.3% (토큰 58% 감소)
- LiveCodeBench v6: 정확도 76.8% → 81.6% (토큰 46% 감소, 단 기본 잘림 현상으로 인한 수치로 순수 성능 향상은 아님)
- Terminal-Bench 2.1: 정확도 66.7% → 65.8% (토큰 39% 감소)
- MMLU-Pro: 정확도 85.5% → 85.0% (토큰 28% 감소)
배포 및 제한 사항
모델은 Hugging Face에서 공개되며, GGUF 및 NVFP4 등 다양한 양자화 버전과 OpenAI 호환 API가 제공된다. 다만 AIME 2026 벤치마크에서는 특정 토큰 페널티 버그로 인해 4.6%의 정확도 손실이 발생하여 향후 업데이트를 통해 수정될 예정이다. 이 방법은 reasoning effort 설정의 대체재가 아닌 보완재로, xhigh 수준의 정확도를 유지하면서 불필요한 thinking 부분만 제거하는 데 목적이 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.