Magnitude, 하드웨어 맞춤 최적화로 llama.cpp 대비 최대 2배 빠른 AI 추론 엔진 공개
·2026.10.01 02:37
핵심 내용
Magnitude가 하드웨어 맞춤 컴파일로 llama.cpp 대비 최대 2배 빠른 오픈소스 추론 엔진을 출시했다.
자세히 보기
자가 최적화 아키텍처
Magnitude는 AI 에이전트용으로 설계된 새로운 오픈소스 추론 엔진으로, 사용자의 하드웨어에 맞춰 스스로 최적화되는 점이 특징이다. 범용 엔진이 광범위한 하드웨어 클래스용 사전 컴파일 커널을 배포하는 것과 달리, Magnitude는 모델 실행 전 디바이스에서 커널을 컴파일하고 튜닝한다. 이 방식을 통해 오픈 웨이트 모델이 정확한 칩 아키텍처에 맞춰 훨씬 빠르게 실행될 수 있다.
성능 벤치마크
프로젝트 측은 llama.cpp 대비 최대 2배 빠른 추론 속도를 달성했다고 보고했다. 구체적인 벤치마크 지표는 다음과 같다:
- Metal (Apple Silicon): 디코딩 92% 빨라짐, 프리필 9% 빨라짐.
- CUDA (NVIDIA): 디코딩 19% 빨라짐, 프리필 23% 빨라짐.
- 메모리 효율성: 에이전트당 메모리 사용량 27% 감소, 에이전트 종료 시 메모리 해제.
에이전트 통합 및 호환성
Magnitude는 기존 AI 에이전트 워크플로우와 연결되도록 설계되었다. Pi, OpenCode, Hermes, Codex, Claude Code, OpenClaw, Oh My Pi, Cline 등 인기 있는 코딩 및 에이전트 도구들과 원클릭 통합을 지원한다. 기타 도구를 위해서는 OpenAI 호환 API를 제공한다.
엔진은 Apple Silicon, NVIDIA, AMD, CPU 전용 환경을 지원하며, 고정된 최소 하드웨어 요구 사항이 없다. macOS, Windows, Linux용 데스크톱 앱으로 배포되어 프롬프트, 파일, 모델이 로컬에 안전하게 보관된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.