초고속 추론 엔진 Atlas 오픈 소스 공개
The GB10 Solution Atlas is now open source, the inference engine made for the community with breakneck inference speeds (Qwen3.6-35B-FP8 100+ tok/s)
·2026.05.07 05:36
Rust와 CUDA 기반의 고성능 추론 엔진 Atlas가 오픈 소스로 공개되었다.
Atlas는 PyTorch나 Python 런타임 없이 Pure Rust와 CUDA로 구축된 고성능 추론 엔진이다. 기존 Python 기반 스택에서 발생하는 병목 현상을 제거하여, DGX Spark(GB10) 환경에서 Qwen3.5-35B 모델 기준 **111 tok/s(sustained)**의 속도를 기록하며 vLLM 대비 약 3배 이상의 성능을 보여준다.
주요 기술적 특징은 다음과 같다:
- Blackwell SM120/121 전용 커널: Attention, MoE, GDN, Mamba-2를 위한 핸드 튜닝된 CUDA 커널을 사용하여 범용 폴백 없이 최적화된 성능을 제공한다.
- 네이티브 데이터 타입 지원: NVFP4 및 FP8을 텐서 코어에서 직접 지원한다.
- MTP(Multi-Token Prediction): 투기적 디코딩(Speculative Decoding)을 통해 디코딩 처리량을 최대 3배까지 높였다.
- 높은 호환성: OpenAI 및 Anthropic API 규격을 지원하여 Claude Code, Cline, Open WebUI 등과 즉시 연동 가능하다.
개발팀은 향후 AMD Strix Halo 및 RTX 6000 Pro Blackwell에 대한 포팅도 계획하고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.