Furiosa SDK 2026.1: 하이브리드 배칭, prefix caching, 네이티브 Kubernetes 지원
Furiosa SDK 2026.1이 배칭·캐싱·Kubernetes 지원을 강화했다.
FuriosaAI가 SDK 2026.1을 공개하며 RNGD를 실험 단계에서 기업용 운영 단계로 끌어올릴 기반을 갖췄다. 이번 업데이트는 RAG와 agentic AI 워크로드를 위한 풀스택 인프라를 강조하며, Rust-native telemetry와 OpenTelemetry 지원으로 관측성을 강화했다.
서빙 계층에서는 핵심 성능 개선이 눈에 띈다. Hybrid Batching은 prefill과 decode 요청을 하나의 배치로 묶어 RPS를 최대 2배까지 높이고, Prefix Caching은 branch-compressed radix tree로 공통 프롬프트 접두어를 재사용해 TTFT를 줄인다.
기능 범위도 넓어졌다. Pooling model support로 임베딩, scoring, reranking을 지원하고, Advanced Quantization에서는 fine-grained dynamic FP8과 DeepSeek 스타일 2D-block weight quantization을 제공한다. 또한 ARM64 지원, EXAONE 4.0 및 Qwen3 패밀리 지원, 그리고 torch.compile 및 vLLM-compatible APIs까지 포함해 배포 선택지를 넓혔다.
클라우드 네이티브 운영 측면에서는 llm-d 프레임워크, NPU Operator, **Dynamic Resource Allocation(DRA)**가 추가됐다. 이를 통해 Kubernetes에서 disaggregated serving, 장치 자동 탐지, 펌웨어 수명주기 관리, PCIe 토폴로지 인식 배치가 가능해져 대규모 NPU 클러스터 운영을 단순화한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.