Furiosa SDK 2025.1.0 출시
·2025.02.27 09:00
Furiosa가 LLM 추론 성능을 최적화하고 Tool Calling을 지원하는 SDK 2025.1.0을 출시했다.
Furiosa SDK 2025.1.0은 RNGD를 위한 LLM 배포를 최적화하는 데 중점을 둔 이번 세 번째 SDK 업데이트다. 이번 릴리스는 LLM 배포를 위한 사용자 친화적인 API와 함께 대폭적인 성능 향상을 제공한다.
주요 업데이트 내용은 다음과 같다:
- LLM 지연 시간(Latency) 최적화: 대규모 입력(30K 토큰) 및 출력(1K 토큰) 환경에서 TTFT를 최대 11.66%, TPOT를 최대 11.45% 개선하여 고처리량 AI 워크로드의 효율성을 높였다.
- OpenAI API Tool Calling 지원: 모델이 외부 도구 및 함수와 상호작용할 수 있도록 지원하여, Agentic AI 애플리케이션 구축을 용이하게 한다.
- Hugging Face 모델 변환 간소화: 새로운
furiosa-llm build명령어를 통해 Hugging Face 모델을 RNGD용 최적화 모델 아티팩트로 쉽게 변환할 수 있다. - Blocked KV cache 할당 자동 최적화: 메모리 파편화를 줄여 KV cache 할당을 극대화함으로써, 별도의 수동 튜닝 없이도 최적의 성능을 제공한다.
향후 몇 달 내에 향상된 Tensor Parallelism, Speculative Decoding(Draft model 활용), Embeddings API 지원, torch.compile() 백엔드 등이 추가될 예정이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.