FuriosaAI SDK 2025.3, RNGD 성능 대폭 향상
핵심 내용
SDK 2025.3로 RNGD가 Llama 3.3 70B에서 처리량 3배, TTFT 35% 개선.
자세히 보기
Furiosa SDK 2025.3와 2025.3.1, 2025.3.2, 2025.3.3 업데이트가 RNGD의 성능과 효율을 크게 끌어올렸다. 특히 대규모 모델과 agentic AI 워크로드에서 개선 폭이 크며, Llama 3.3 70B 기준으로 평균 처리량은 최대 3배, **TTFT(Time to First Token)**는 평균 35% 줄었다.
가장 큰 변화는 여러 RNGD 카드를 묶는 inter-chip tensor parallelism 지원이다. PCIe Gen 5 기반 P2P(peer-to-peer) 통신으로 칩 간 데이터 전송을 양방향 64 GB/s까지 끌어올렸고, 경로 최적화와 고급 통신 스케줄링으로 멀티칩 확장성을 높였다. Furiosa는 8카드 RNGD 서버에서 Llama 3.3 70B를 돌릴 때 총 전력 소비가 경쟁 NVIDIA 솔루션의 절반도 되지 않는다고 밝혔다.
컴파일러와 런타임도 함께 손봤다.
- Furiosa Compiler의 글로벌 최적화로 transformer 블록 간 SRAM reuse를 극대화
- 런타임이 RNGD와 호스트 간 간섭을 줄여 오버헤드를 완화
- inter-chip DMA와 연산을 명시적으로 겹치게 해 지연을 추가로 감소
이 조합은 실제 벤치마크에서도 드러났다. Llama 3.1 8B에서는 평균 처리량이 4.5% 증가했고, TTFT는 55% 감소했다.
모델 지원도 넓어졌다. Qwen 2와 Qwen 2.5를 추가로 지원하고, W8A16 quantization도 제공한다. Hugging Face Hub의 precompiled artifact는 최대 32K tokens 컨텍스트를 지원해 더 긴 문맥이 필요한 애플리케이션에 대응한다.
운영 편의성도 강화됐다. 프로덕션 메트릭은 /metrics 엔드포인트로 노출되며, 로그에는 평균 처리량, KV Cache 사용량, running/waiting 요청 정보가 표시된다. 개발자는 이를 통해 성능 병목과 추론 상태를 더 세밀하게 추적할 수 있다.
또한 SDK는 OpenAI가 API에 추가한 Structured Outputs 기능을 지원한다. JSON schema에 맞춰 출력을 강제할 수 있어 MCP(Model Context Protocol) 기반 도구 호출이나 agent가 API와 상호작용하는 작업에서 형식 안정성을 높인다.
Furiosa는 5월의 SDK 2025.2.0에서 Hugging Face Hub integration, reasoning model 지원, chunked prefill을 추가한 데 이어 빠른 릴리스를 이어가고 있다. 이 같은 개선은 LG AI Research가 EXAONE 모델 추론에 RNGD를 채택해 기존 GPU 대비 2.25배의 성능 대비 전력 효율을 달성한 사례와 함께, RNGD를 데이터센터 추론용 플랫폼으로 강화하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.