Command A+ 모델, MLX 지원
Command A+ (218B MoE) running on Apple Silicon — MLX port, PR open
·2026.05.24 05:14
Cohere의 218B MoE 모델인 Command A+를 Apple Silicon에서 구동할 수 있는 MLX 포트가 구현되었습니다.
Cohere의 Command A+ (218B MoE) 모델을 Apple Silicon에서 실행할 수 있도록 mlx-lm용 cohere2_moe 구현체가 개발되었습니다. 현재 ml-explore/mlx-lm에 Pull Request가 제출되어 리뷰 중입니다.
주요 아키텍처 특징:
- 공유 전문가(Shared Expert): 단일 공유 전문가와 라우팅된 출력을
(routed + shared)/2방식으로 결합합니다. - 라우팅: Softmax가 아닌 Sigmoid 라우팅을 사용하며, 상위 8개의 전문가를 정규화합니다.
- 슬라이딩 윈도우: 3:1 비율의 슬라이딩 윈도우를 적용하며, 슬라이딩 레이어에만 RoPE를 인터리브 방식으로 사용합니다.
- 병렬 구조: 동일한 LayerNorm에서 Attention과 MLP 블록이 병렬로 작동합니다.
성능 및 기술적 참고사항:
- W4A4 양자화 시 발생하는 편향(bias) 문제는 NVFP4 양자화 아티팩트로 확인되었으며,
sanitize()함수로 처리 가능합니다. - 대규모 메모리 환경 테스트 결과, 22.9 tok/s의 생성 속도와 57.6 tok/s의 프롬프트 처리 속도를 기록했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.