Paddock 추론 엔진 오픈소스 공개
We open-sourced Paddock, our Rust/C++ inference engine with its own CUDA kernels (MIT/Apache-2.0)
·2026.09.04 18:15
핵심 내용
자체 CUDA 커널을 적용한 Rust/C++ 추론 엔진 Paddock가 MIT/Apache-2.0 라이선스로 오픈소스화됐다.
자세히 보기
Rust와 C++로 개발된 추론 엔진 Paddock가 MIT 또는 Apache-2.0 라이선스로 오픈소스 공개됐다. 이 엔진은 자체 개발한 CUDA 커널을 포함하며, OpenAI 및 Anthropic 스타일의 API를 지원하는 단일 바이너리로 제공된다.
성능 및 호환성
- 성능: Qwen3.8-27B FP8 모델 기준, vLLM 대비 13개 테스트 항목 모두에서 1.02배에서 1.19배 더 빠른 처리 속도를 기록했다. llama.cpp Q8_0 대비로는 최대 37배까지 성능 우위를 보였다. 32개 클라이언트 동시 접속 시 초당 1062토큰을 처리하여 vLLM(958토큰)과 SGLang(844토큰)을 상회했다.
- 하드웨어 지원: Blackwell(5090, RTX PRO 시리즈, B200) 및 Ampere(A6000, 30시리즈) 아키텍처에서 검증 완료. Hopper 및 A100 커널은 코드에 포함되었으나 보드 검증은 미완료 상태다.
- 제약 사항: 현재 CUDA 전용으로 Windows와 Linux에서만 실행 가능하며, Mac, ROCm, Vulkan은 지원되지 않는다. 또한 GPU당 단일 모델만 로드할 수 있어 텐서 병렬 처리는 불가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.