초고속 추론 엔진 Atlas 오픈 소스 공개
The GB10 Solution Atlas is now open source, the inference engine made for the community with breakneck inference speeds (Qwen3.6-35B-FP8 100+ tok/s)
·2026.05.07 05:36
핵심 내용
Rust와 CUDA 기반의 고성능 추론 엔진 Atlas가 오픈 소스로 공개되었다.
자세히 보기
Atlas는 PyTorch나 Python 런타임 없이 Pure Rust와 CUDA로 구축된 고성능 추론 엔진이다. 기존 Python 기반 스택에서 발생하는 병목 현상을 제거하여, DGX Spark(GB10) 환경에서 Qwen3.5-35B 모델 기준 **111 tok/s(sustained)**의 속도를 기록하며 vLLM 대비 약 3배 이상의 성능을 보여준다.
주요 기술적 특징은 다음과 같다:
- Blackwell SM120/121 전용 커널: Attention, MoE, GDN, Mamba-2를 위한 핸드 튜닝된 CUDA 커널을 사용하여 범용 폴백 없이 최적화된 성능을 제공한다.
- 네이티브 데이터 타입 지원: NVFP4 및 FP8을 텐서 코어에서 직접 지원한다.
- MTP(Multi-Token Prediction): 투기적 디코딩(Speculative Decoding)을 통해 디코딩 처리량을 최대 3배까지 높였다.
- 높은 호환성: OpenAI 및 Anthropic API 규격을 지원하여 Claude Code, Cline, Open WebUI 등과 즉시 연동 가능하다.
개발팀은 향후 AMD Strix Halo 및 RTX 6000 Pro Blackwell에 대한 포팅도 계획하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.