AI Briefing

최신 SDK로 RTX Pro 6000을 앞서는 RNGD

·2026.04.02 09:00

핵심 내용

RNGD는 최신 SDK로 15kW 랙당 사용자 수를 RTX Pro 6000의 최대 2배로 끌어올렸다.

1 / 2

자세히 보기

FuriosaAI의 RNGD가 최신 SDK 최적화만으로 NVIDIA RTX Pro 6000보다 실사용 효율에서 앞섰다. 핵심 지표는 단일 사용자 최고 처리량이 아니라, 20~40 TPS/user SLO를 지키면서 랙당 얼마나 많은 사용자를 안정적으로 서비스할 수 있느냐였다.

Qwen3-32B 기준으로 SDK는 2026년 2월 14일 버전 대비 3월 13일 튜닝 버전에서 저배치 구간 성능을 크게 끌어올렸다. b64는 약 1,200 TPS → 1,500 TPS로 25%, b32는 약 750 TPS → 1,100 TPS로 47% 향상됐고, 특정 구간의 동시 서비스 가능 수는 5.8명 → 47.5명으로 8.2배 증가했다.

이 개선은 실제 서비스 구간인 batch 64, 32, 16, 8에 집중됐다. 그 결과 RNGD는 랙 전력 기준으로 20 TPS에서 1.8배, 30 TPS에서 1.9배, 40 TPS에서 2배 더 많은 사용자를 처리했다.

지연 시간에서도 RNGD가 우세했다. TPOT는 RTX Pro 6000과 비슷한 수준이었지만, TTFT는 전반적으로 더 낮았고 특히 b8~b64 구간에서 절반 수준에 가까웠다. 30 TPS/user SLO 기준으로 RTX Pro 6000의 첫 토큰은 2.7~4.4초였고, RNGD는 1.1~2.1초로 절반 이하였다.

전력 효율 차이는 랙 단위 확장성에서 더 크게 드러났다.

  • 8개 RNGD 서버: 약 3kW
  • 8개 RTX Pro 6000 서버: 약 6.6kW
  • 15kW 랙 기준: RNGD는 5대, RTX Pro 6000은 2대 설치 가능

이 때문에 카드 성능 차이와 서버 밀도 차이가 함께 작동해, 같은 랙에서 제공 가능한 사용자 수가 크게 벌어진다. 기사 기준으로 RNGD는 15kW 랙당 약 2.5배 수준의 운영 효율을 보여주며, 실제 데이터센터 공간과 TCO를 크게 줄인다.

예시로 든 사내 AI 어시스턴트 시나리오에서는 40 TPS/user에서 RNGD는 44대 / 9랙, RTX Pro 6000은 49대 / 25랙이 필요했다. 전자는 132kW, 후자는 323.4kW로, Multi-Agent 확산까지 감안하면 격차는 더 커진다.

핵심 메시지는 분명하다. 실시간 AI 서비스에서는 최고 처리량보다 SLO를 만족하는 동시 사용자 수와 전력 대비 서비스 밀도가 더 중요하며, RNGD는 소프트웨어 최적화만으로 그 지점을 빠르게 끌어올리고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.