AI Briefing

RNGD를 활용한 RAG 애플리케이션 구축 | FuriosaAI

·2025.03.13 09:00

FuriosaAI의 **RNGD** 가속기를 활용해 고성능·저전력 **RAG** 애플리케이션을 구축하는 방법을 제시한다.

**RAG(Retrieval-Augmented Generation)**는 LLM의 사전 학습 지식에 의존하는 한계를 넘어, 최신 데이터와 도메인 특화 정보를 활용할 수 있는 핵심 기술이다. 하지만 RAG 시스템 구축에는 LLM, 임베딩 모델, 벡터 데이터베이스를 통합하는 과정에서 발생하는 복잡성, 지연 시간, 에너지 소비 문제가 따른다.

FuriosaAI의 RNGD는 이러한 문제를 해결하기 위해 설계된 고성능·저전력 추론 가속기다. Llama 3.1 8B 모델(FP8 정밀도) 구동 시 초당 3,200~3,300개의 토큰(TPS)을 처리하며, 단일 서버로 최대 60명의 동시 사용자를 수용할 수 있다.

특히 RNGD는 180W의 효율적인 전력 프로필과 48GB HBM3 메모리를 갖추고 있어, 기존 GPU 대비 훨씬 적은 전력으로 비용 효율적인 RAG 운영이 가능하다. 이는 온프레미스(On-premises) 솔루션이나 데이터 센터 구축 시 큰 강점이 된다.

실제 구현 사례로 오픈소스 RAG 프로젝트인 Kotaemon과의 통합을 보여준다. 기존의 OpenAI 클라우드 호출 방식 대신, 설정을 통해 RNGD를 로컬 엔드포인트로 사용하여 데이터 프라이버시를 강화하고 지연 시간을 줄일 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.