Furiosa SDK 2026.1: 하이브리드 배칭, prefix caching, 네이티브 Kubernetes 지원
핵심 내용
Furiosa SDK 2026.1이 배칭·캐싱·Kubernetes 지원을 강화했다.
자세히 보기
FuriosaAI가 SDK 2026.1을 공개하며 RNGD를 실험 단계에서 기업용 운영 단계로 끌어올릴 기반을 갖췄다. 이번 업데이트는 RAG와 agentic AI 워크로드를 위한 풀스택 인프라를 강조하며, Rust-native telemetry와 OpenTelemetry 지원으로 관측성을 강화했다.
서빙 계층에서는 핵심 성능 개선이 눈에 띈다. Hybrid Batching은 prefill과 decode 요청을 하나의 배치로 묶어 RPS를 최대 2배까지 높이고, Prefix Caching은 branch-compressed radix tree로 공통 프롬프트 접두어를 재사용해 TTFT를 줄인다.
기능 범위도 넓어졌다. Pooling model support로 임베딩, scoring, reranking을 지원하고, Advanced Quantization에서는 fine-grained dynamic FP8과 DeepSeek 스타일 2D-block weight quantization을 제공한다. 또한 ARM64 지원, EXAONE 4.0 및 Qwen3 패밀리 지원, 그리고 torch.compile 및 vLLM-compatible APIs까지 포함해 배포 선택지를 넓혔다.
클라우드 네이티브 운영 측면에서는 llm-d 프레임워크, NPU Operator, **Dynamic Resource Allocation(DRA)**가 추가됐다. 이를 통해 Kubernetes에서 disaggregated serving, 장치 자동 탐지, 펌웨어 수명주기 관리, PCIe 토폴로지 인식 배치가 가능해져 대규모 NPU 클러스터 운영을 단순화한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.