AI Briefing

Furiosa SDK 2026.2, RNGD 처리량과 배포 속도 개선

·2026.05.01 06:15

SDK 2026.2는 RNGD 처리량을 평균 74.9% 높이고 배포 자동화를 강화했다.

FuriosaAIRNGDSDK 2026.2를 공개했다. RNGD가 양산 단계에 들어간 뒤 나온 이번 업데이트는 엔터프라이즈 고객이 에이전트형 AI, 코딩 에이전트, 고처리량 LLM을 대규모로 운용할 때 성능 튜닝과 배포 효율을 동시에 끌어올리는 데 초점을 맞췄다. 올해 들어서는 두 번째 RNGD SDK 릴리스다.

컴파일러 최적화와 하이브리드 KV cache 관리로 Qwen3EXAONE 4.0에서 이전 릴리스 대비 평균 **74.9%**의 처리량 향상을 냈다. 메모리를 prefill과 decode 단계 사이에서 더 잘 배분해, 전력 소모를 늘리지 않고도 기존 하드웨어의 서비스 용량을 사실상 두 배로 높였다고 설명했다.

운영 복잡도도 줄였다.

  • ArtifactBuilderPer-Model Bucket Presets로 prefill/decode 길이(bucket) 튜닝을 자동화해 수동 최적화를 없앴다.
  • Prefix-Aware DP Router는 요청의 토큰화된 prefix를 확인해 같은 prefix-cache를 가진 RNGD 복제본으로 보내 RAG와 에이전트 워크로드의 중복 계산을 줄인다.
  • Prefix Cache Hit Deferral은 인플라이트 prefix와 맞을 가능성이 큰 요청을 잠깐 지연해 캐시 적중률을 높이고 TTFT를 낮춘다.

RNGD는 180W TDP의 PCIe 카드와 턴키 서버 구성으로 제공되며, 표준 데이터센터 환경에서 H100 기반 시스템보다 최대 3.5배 높은 compute density를 제공한다고 밝혔다. 회사는 10~15kW 공랭식 랙 환경에서 동작하는 고성능 추론 플랫폼으로 RNGD를 계속 고도화하겠다고 강조했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.