Dotwave 엔진, 실시간 AI 서빙 비용 98% 절감
Why real-time AI models cost up to 56× more than they should to serve, and how to fix it
핵심 내용
Dotwave 엔진이 H100 하나로 56개 동시 음성 세션을 처리하며 비용을 98% 절감했다.
자세히 보기
풀듀플렉스 음성 에이전트 등 실시간 AI 모델은 모델이 동시에 듣고 말하며 상태를 유지해야 하므로, 모든 오디오 프레임에 대해 엄격한 80 ms 마감 시간을 충족해야 합니다. vLLM, SGLang, TensorRT-LLM, Triton 같은 기존 요청 기반 추론 서버는 전체 세션이 끝날 때까지 기다릴 수 없는 배치 처리 방식에 의존하기 때문에 이 워크로드에 적합하지 않습니다. NVIDIA의 Nemotron VoiceChat 11B 참조 스택에서는 이 문제로 GPU 유휴 시간이 **75%**에 달하며, 단일 세션이 H100 전체를 점유하고 두 번째 세션을 추가하면 오디오 비트의 **8–15%**가 지연됩니다.
해결책: 영구 GPU 프로그램
Dotwave의 추론 엔진은 모델을 GPU에 단일 프로그램으로 상주시켜 모든 비트마다 발생하는 CPU-GPU 조정 오버헤드를 제거합니다. 주요 최적화 내용은 다음과 같습니다.
- 배치 세션 진행: 같은 틱에 실행되는 모든 라이브 세션을 하나의 배치로 처리하여, 세션별이 아닌 그룹 단위로 모델 가중치를 한 번만 읽습니다.
- 사전 컴파일된 스케줄링: 컴파일러가 실행 전에 스케줄과 메모리 레이아웃을 고정하여 런타임 스케줄러 및 할당자 지연을 제거합니다.
- 연속 상태 관리: 콜 중간에 리소스를 해제하지 않고 연속 입력과 상태 보존을 처리합니다.
성능 결과
단일 NVIDIA H100 SXM 80 GB에서 엔진은 다음 성과를 달성했습니다.
- 참조 스택의 1개와 비교해 56개의 동시 세션 지원.
- 160 ms 비트당 147.4–147.5 ms의 p99 지연 시간.
- 측정된 84,000개의 세션-비트에서 마감 시간 미준수 0건.
- 대화당 GPU 비용 약 98% 절감.
이 측정값은 네트워크 및 오디오 재생 지연을 제외했으며, 약 2분 분량의 컨텍스트를 가진 녹음된 입력으로 수행되었습니다. 엔진은 Nemotron VoiceChat 11B 및 Nemotron 3.5 ASR Streaming 0.6B와 함께 테스트 가능하며, 가입 시 무료 사용 크레딧을 제공합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.