AI Briefing

Command A+ 모델, MLX 지원

Command A+ (218B MoE) running on Apple Silicon — MLX port, PR open

·2026.05.24 05:14

Cohere의 218B MoE 모델인 Command A+를 Apple Silicon에서 구동할 수 있는 MLX 포트가 구현되었습니다.

Cohere의 Command A+ (218B MoE) 모델을 Apple Silicon에서 실행할 수 있도록 mlx-lmcohere2_moe 구현체가 개발되었습니다. 현재 ml-explore/mlx-lm에 Pull Request가 제출되어 리뷰 중입니다.

주요 아키텍처 특징:

  • 공유 전문가(Shared Expert): 단일 공유 전문가와 라우팅된 출력을 (routed + shared)/2 방식으로 결합합니다.
  • 라우팅: Softmax가 아닌 Sigmoid 라우팅을 사용하며, 상위 8개의 전문가를 정규화합니다.
  • 슬라이딩 윈도우: 3:1 비율의 슬라이딩 윈도우를 적용하며, 슬라이딩 레이어에만 RoPE를 인터리브 방식으로 사용합니다.
  • 병렬 구조: 동일한 LayerNorm에서 Attention과 MLP 블록이 병렬로 작동합니다.

성능 및 기술적 참고사항:

  • W4A4 양자화 시 발생하는 편향(bias) 문제는 NVFP4 양자화 아티팩트로 확인되었으며, sanitize() 함수로 처리 가능합니다.
  • 대규모 메모리 환경 테스트 결과, 22.9 tok/s의 생성 속도57.6 tok/s의 프롬프트 처리 속도를 기록했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.