AI Briefing

최신 SDK로 RTX Pro 6000을 앞서는 RNGD

·2026.04.02 09:00

RNGD는 최신 SDK로 15kW 랙당 사용자 수를 RTX Pro 6000의 최대 2배로 끌어올렸다.

FuriosaAIRNGD가 최신 SDK 최적화만으로 NVIDIA RTX Pro 6000보다 실사용 효율에서 앞섰다. 핵심 지표는 단일 사용자 최고 처리량이 아니라, 20~40 TPS/user SLO를 지키면서 랙당 얼마나 많은 사용자를 안정적으로 서비스할 수 있느냐였다.

Qwen3-32B 기준으로 SDK는 2026년 2월 14일 버전 대비 3월 13일 튜닝 버전에서 저배치 구간 성능을 크게 끌어올렸다. b64는 약 1,200 TPS → 1,500 TPS25%, b32는 약 750 TPS → 1,100 TPS47% 향상됐고, 특정 구간의 동시 서비스 가능 수는 5.8명 → 47.5명으로 8.2배 증가했다.

이 개선은 실제 서비스 구간인 batch 64, 32, 16, 8에 집중됐다. 그 결과 RNGD는 랙 전력 기준으로 20 TPS에서 1.8배, 30 TPS에서 1.9배, 40 TPS에서 2배 더 많은 사용자를 처리했다.

지연 시간에서도 RNGD가 우세했다. TPOT는 RTX Pro 6000과 비슷한 수준이었지만, TTFT는 전반적으로 더 낮았고 특히 b8~b64 구간에서 절반 수준에 가까웠다. 30 TPS/user SLO 기준으로 RTX Pro 6000의 첫 토큰은 2.7~4.4초였고, RNGD는 1.1~2.1초로 절반 이하였다.

전력 효율 차이는 랙 단위 확장성에서 더 크게 드러났다.

  • 8개 RNGD 서버: 약 3kW
  • 8개 RTX Pro 6000 서버: 약 6.6kW
  • 15kW 랙 기준: RNGD는 5대, RTX Pro 6000은 2대 설치 가능

이 때문에 카드 성능 차이와 서버 밀도 차이가 함께 작동해, 같은 랙에서 제공 가능한 사용자 수가 크게 벌어진다. 기사 기준으로 RNGD는 15kW 랙당 약 2.5배 수준의 운영 효율을 보여주며, 실제 데이터센터 공간과 TCO를 크게 줄인다.

예시로 든 사내 AI 어시스턴트 시나리오에서는 40 TPS/user에서 RNGD는 44대 / 9랙, RTX Pro 6000은 49대 / 25랙이 필요했다. 전자는 132kW, 후자는 323.4kW로, Multi-Agent 확산까지 감안하면 격차는 더 커진다.

핵심 메시지는 분명하다. 실시간 AI 서비스에서는 최고 처리량보다 SLO를 만족하는 동시 사용자 수전력 대비 서비스 밀도가 더 중요하며, RNGD는 소프트웨어 최적화만으로 그 지점을 빠르게 끌어올리고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.