AI Briefing

Command A+ 모델, MLX 지원

Command A+ (218B MoE) running on Apple Silicon — MLX port, PR open

·2026.05.24 05:14

핵심 내용

Cohere의 218B MoE 모델인 Command A+를 Apple Silicon에서 구동할 수 있는 MLX 포트가 구현되었습니다.

자세히 보기

Cohere의 Command A+ (218B MoE) 모델을 Apple Silicon에서 실행할 수 있도록 mlx-lm용 cohere2_moe 구현체가 개발되었습니다. 현재 ml-explore/mlx-lm에 Pull Request가 제출되어 리뷰 중입니다.

주요 아키텍처 특징:

  • 공유 전문가(Shared Expert): 단일 공유 전문가와 라우팅된 출력을 (routed + shared)/2 방식으로 결합합니다.
  • 라우팅: Softmax가 아닌 Sigmoid 라우팅을 사용하며, 상위 8개의 전문가를 정규화합니다.
  • 슬라이딩 윈도우: 3:1 비율의 슬라이딩 윈도우를 적용하며, 슬라이딩 레이어에만 RoPE를 인터리브 방식으로 사용합니다.
  • 병렬 구조: 동일한 LayerNorm에서 Attention과 MLP 블록이 병렬로 작동합니다.

성능 및 기술적 참고사항:

  • W4A4 양자화 시 발생하는 편향(bias) 문제는 NVFP4 양자화 아티팩트로 확인되었으며, sanitize() 함수로 처리 가능합니다.
  • 대규모 메모리 환경 테스트 결과, 22.9 tok/s의 생성 속도와 57.6 tok/s의 프롬프트 처리 속도를 기록했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.