0.32.41주 전
v0.32.4
Apple GPU를 위한 MLX 엔진 지원 및 Qwen3 MoE 성능 최적화가 포함된 v0.32.4 업데이트
신규 기능 및 성능 개선
- Apple GPU에서 MLX 엔진을 통한 Laguna 모델 지원
- Speculative decoding 시 드래프트 모델의 출력 헤드를 요청된 타입에 맞춰 양자화하도록 개선
- Qwen3 MoE 디코딩 시 서로 다른 양자화된 전문가(experts) 처리 방식 수정 및 packed gate/up projection 가속화 (M5 Max 기준 약 4–9% 성능 향상)
버그 수정
- Qwen3 MoE 모델의 디코딩 관련 오류 수정