AI Briefing

Meta, 온디바이스 AI용 Muse Glimmer 공개

ExecuTorch에서 Muse Glimmer로 구현하는 빠른 온디바이스 에이전틱 AI | 파이토치 한국 사용자 모임

·2026.08.16 04:22

핵심 내용

Meta가 온디바이스 에이전틱 워크플로우를 위한 Muse Glimmer 모델과 ExecuTorch 지원을 공개했다.

자세히 보기

Meta가 온디바이스 에이전틱 워크플로우에 최적화된 300억 매개변수(30B) 규모의 오픈 웨이트 모델, Muse Glimmer를 공개했다. 이 모델은 Muse Spark에서 증류(distilled)되었으며, ExecuTorch를 통해 NVIDIA GPU와 Apple 실리콘 기반 Mac에서 엔드투엔드 실행을 지원한다.

ExecuTorch는 모델을 다른 언어로 재구현하는 대신, PyTorch에서 구현된 모델을 그대로 내보내(export) 백엔드별로 최적화하는 방식을 취한다. 이를 통해 CUDA 환경에서는 Triton을, Apple 실리콘에서는 MLX 및 Metal을 활용해 실행 경로 전체를 최적화한다.

주요 특징 및 기능:

  • 멀티모달 지원: 텍스트 및 이미지 입력 처리 가능
  • 고성능 디코딩: DFlash(확산 기반 병렬 추측 디코딩)를 적용하여 낮은 지연 시간 제공
  • 유연한 배포: GGUF 직접 내보내기 및 K-quant 네이티브 실행 지원
  • 대규모 컨텍스트: 128K 이상의 토큰 컨텍스트 지원

현재 Hugging Face를 통해 NVIDIA CUDA 및 Apple 실리콘용으로 검증된 PTE(PyTorch Executable) 아티팩트 번들이 공개되어 있어, 사용자는 이를 즉시 내려받아 실행할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.