FuriosaAI, Llama 3.1 마일스톤 달성하며 2024년 마무리
FuriosaAI의 AI 추론 칩 **RNGD**가 **Llama 3.1** 모델에서 압도적인 처리량과 전력 효율성을 입증했다.
FuriosaAI의 AI 반도체 솔루션인 RNGD(Renegade)가 Llama 3.1 8B 및 70B 모델을 활용한 실전 기업 배포 환경에서 강력한 성능 지표를 기록하며 2024년을 마무리했다.
RNGD는 Llama 3.1-8B 실행 시 초당 3,200~3,300개의 토큰(TPS)을 처리하며, 단일 사용자 시나리오에서도 40~60 TPS를 안정적으로 제공한다. 또한 카드당 180W의 전력을 소비하며 뛰어난 전력 효율성을 보여준다.
Llama 3.1-70B 모델의 경우 단 2개의 RNGD 카드로 효과적인 실행이 가능하며, 8개의 카드를 장착한 서버에서는 초당 8,000 TPS 달성을 목표로 최적화가 진행 중이다.
소프트웨어 측면에서는 SDK v2024.3.0을 통해 tensor parallelism, torch.compile, HuggingFace Optimum 연동을 지원한다. 또한 SDK v2024.1.0은 PagedAttention, Block KV Cache, Continuous Batching 등 고성능 추론 기술을 포함하여 개발자에게 최적화된 환경을 제공한다.
아울러 FuriosaAI는 글로벌 시장 확대를 위해 NETINT Technologies 출신의 Alex Liu를 제품 및 비즈니스 부문 수석 부사장(SVP)으로 영입하며 리더십을 강화했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.