APEX MoE 양자화 모델 30종 이상 확대
APEX MoE quants update: 25+ new models since the Qwen 3.5 post + new I-Nano tier
·2026.05.05 01:43
MoE 모델용 혼합 정밀도 양자화 전략인 APEX가 30종 이상의 모델로 확대되고 새로운 초압축 티어를 출시했다.
MoE(Mixture-of-Experts) 모델을 위한 혼합 정밀도 양자화 전략인 APEX의 업데이트 소식이다. 기존 Qwen 3.5 모델에 이어, 현재 30개 이상의 주요 MoE 모델이 APEX 방식으로 양자화되어 제공되고 있다.
주요 특징 및 피드백:
- 장문 컨텍스트 유지: APEX의 I-Balanced 및 I-Compact 방식은 공유 전문가(shared experts)와 에지 레이어(edge layers)의 정밀도를 높게 유지한다. 이를 통해 일반적인 Q4_K 양자화에서 발생하는 성능 저하 없이 32k 토큰 이상의 긴 컨텍스트에서도 높은 일관성을 유지하는 것으로 나타났다.
- 코딩 성능 우수: Qwen 3.6 35B-A3B 모델의 경우, I-Compact 및 I-Mini 티어가 실제 코딩 작업에서 FP16 모델에 근접한 성능을 보여준다.
새로 추가된 주요 모델:
- Qwen 계열: Qwen 3.5 (122B, 397B 등), Qwen 3.6 (35B-A3B), Qwen3-Coder 등
- 프론티어급 MoE: MiniMax-M2.5/M2.7 (최대 228B), Mistral-Small 4 (119B), NVIDIA Nemotron-3-Super (120B), GLM-4.7 Flash, Step-3.5 Flash, Nemotron-3-Nano (멀티모달 지원) 등
이번 업데이트를 통해 소비자용 GPU에서도 구동 가능한 I-Mini/I-Compact 티어의 활용도가 더욱 높아질 전망이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.