백서: 효율적인 AI 추론을 위한 Backend.AI 기반 RNGD 벤치마킹
핵심 내용
RNGD가 RTX PRO 6000 대비 최대 44% 적은 전력으로 경쟁력 있는 추론 성능을 보였다.
자세히 보기
FuriosaAI와 Lablup이 RNGD 추론 가속기와 Backend.AI 오케스트레이션 플랫폼을 결합한 AI 추론 스택의 성능을 평가한 백서를 공동 발표했다. 테스트에서는 RNGD 4대와 베어메탈 환경의 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 4대를 비교했다.
Qwen3-32B(FP8) 모델을 사용한 평가에서 RNGD는 최대 동시 요청 256건에서 비교 시스템의 95%에 해당하는 처리량을 기록했다. 동시에 전력 소비는 30~44% 낮았으며, 모든 동시성 수준에서 와트당 처리량은 1.3~1.5배 높았다.
사용자 응답성 측면에서도 RNGD는 동시 요청 32건까지 **TTFT(Time to First Token)**를 1초 이내로 유지했다. 같은 조건에서 비교 시스템의 TTFT는 2.9초를 넘었다.
백서는 벤치마크뿐 아니라 RNGD와 Backend.AI를 활용한 대규모 AI 추론 인프라 운영 방식도 다룬다. Backend.AI는 GPU, NPU 등 다양한 가속기를 하나의 플랫폼에서 관리하며, 다음과 같은 운영 과제에 대응한다.
- 공랭식 냉각 제약
- 데이터센터 전력 밀도 증가
- Sovereign AI 규정 준수
- 프리필·디코드 단계가 혼합된 LLM 워크로드 관리
배포 전략에는 Backend.AI의 세션 실행 모델과 Sokovan 오케스트레이터가 활용된다. 이를 통해 서로 다른 가속기가 포함된 환경에서 생산 규모의 AI 추론 워크로드를 배포하고 관리할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.