AI Briefing

Furiosa SDK 2026.1: 하이브리드 배칭, prefix caching, 네이티브 Kubernetes 지원

·2026.02.17 09:00

Furiosa SDK 2026.1이 배칭·캐싱·Kubernetes 지원을 강화했다.

FuriosaAISDK 2026.1을 공개하며 RNGD를 실험 단계에서 기업용 운영 단계로 끌어올릴 기반을 갖췄다. 이번 업데이트는 RAG와 agentic AI 워크로드를 위한 풀스택 인프라를 강조하며, Rust-native telemetryOpenTelemetry 지원으로 관측성을 강화했다.

서빙 계층에서는 핵심 성능 개선이 눈에 띈다. Hybrid Batching은 prefill과 decode 요청을 하나의 배치로 묶어 RPS를 최대 2배까지 높이고, Prefix Caching은 branch-compressed radix tree로 공통 프롬프트 접두어를 재사용해 TTFT를 줄인다.

기능 범위도 넓어졌다. Pooling model support로 임베딩, scoring, reranking을 지원하고, Advanced Quantization에서는 fine-grained dynamic FP8과 DeepSeek 스타일 2D-block weight quantization을 제공한다. 또한 ARM64 지원, EXAONE 4.0Qwen3 패밀리 지원, 그리고 torch.compilevLLM-compatible APIs까지 포함해 배포 선택지를 넓혔다.

클라우드 네이티브 운영 측면에서는 llm-d 프레임워크, NPU Operator, **Dynamic Resource Allocation(DRA)**가 추가됐다. 이를 통해 Kubernetes에서 disaggregated serving, 장치 자동 탐지, 펌웨어 수명주기 관리, PCIe 토폴로지 인식 배치가 가능해져 대규모 NPU 클러스터 운영을 단순화한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.