AI Briefing

FuriosaAI SDK 2025.3, RNGD 성능 대폭 향상

·2025.09.25 09:00

SDK 2025.3로 RNGD가 Llama 3.3 70B에서 처리량 3배, TTFT 35% 개선.

Furiosa SDK 2025.3와 2025.3.1, 2025.3.2, 2025.3.3 업데이트가 RNGD의 성능과 효율을 크게 끌어올렸다. 특히 대규모 모델과 agentic AI 워크로드에서 개선 폭이 크며, Llama 3.3 70B 기준으로 평균 처리량은 최대 3배, **TTFT(Time to First Token)**는 평균 35% 줄었다.

가장 큰 변화는 여러 RNGD 카드를 묶는 inter-chip tensor parallelism 지원이다. PCIe Gen 5 기반 P2P(peer-to-peer) 통신으로 칩 간 데이터 전송을 양방향 64 GB/s까지 끌어올렸고, 경로 최적화와 고급 통신 스케줄링으로 멀티칩 확장성을 높였다. Furiosa는 8카드 RNGD 서버에서 Llama 3.3 70B를 돌릴 때 총 전력 소비가 경쟁 NVIDIA 솔루션의 절반도 되지 않는다고 밝혔다.

컴파일러와 런타임도 함께 손봤다.

  • Furiosa Compiler의 글로벌 최적화로 transformer 블록 간 SRAM reuse를 극대화
  • 런타임이 RNGD와 호스트 간 간섭을 줄여 오버헤드를 완화
  • inter-chip DMA와 연산을 명시적으로 겹치게 해 지연을 추가로 감소

이 조합은 실제 벤치마크에서도 드러났다. Llama 3.1 8B에서는 평균 처리량이 4.5% 증가했고, TTFT55% 감소했다.

모델 지원도 넓어졌다. Qwen 2Qwen 2.5를 추가로 지원하고, W8A16 quantization도 제공한다. Hugging Face Hub의 precompiled artifact는 최대 32K tokens 컨텍스트를 지원해 더 긴 문맥이 필요한 애플리케이션에 대응한다.

운영 편의성도 강화됐다. 프로덕션 메트릭은 /metrics 엔드포인트로 노출되며, 로그에는 평균 처리량, KV Cache 사용량, running/waiting 요청 정보가 표시된다. 개발자는 이를 통해 성능 병목과 추론 상태를 더 세밀하게 추적할 수 있다.

또한 SDK는 OpenAI가 API에 추가한 Structured Outputs 기능을 지원한다. JSON schema에 맞춰 출력을 강제할 수 있어 MCP(Model Context Protocol) 기반 도구 호출이나 agent가 API와 상호작용하는 작업에서 형식 안정성을 높인다.

Furiosa는 5월의 SDK 2025.2.0에서 Hugging Face Hub integration, reasoning model 지원, chunked prefill을 추가한 데 이어 빠른 릴리스를 이어가고 있다. 이 같은 개선은 LG AI Research가 EXAONE 모델 추론에 RNGD를 채택해 기존 GPU 대비 2.25배의 성능 대비 전력 효율을 달성한 사례와 함께, RNGD를 데이터센터 추론용 플랫폼으로 강화하고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.