AI Briefing

NVIDIA, LLM 추론 벤치마크 도구 AIPerf 공개

AIPerf: 서버 성능 측정 시, 부하 생성기가 병목이 되지 않도록 NVIDIA가 개발 및 공개한 LLM 추론 벤치마크 도구

·2026.09.22 18:00

핵심 내용

NVIDIA가 클라이언트 병목을 제거한 LLM 추론 벤치마크 도구 AIPerf를 공개했다.

1 / 8

자세히 보기

NVIDIA가 기존 GenAI-Perf의 지정된 후속 도구로 LLM 추론 벤치마크 도구 AIPerf를 공개했다. 이 도구는 Apache 2.0 라이선스로 배포되며, PyPI를 통해 설치할 수 있다.

클라이언트 병목 문제 해결

기존 도구(curl, asyncio 등)는 Python GIL 및 단일 프로세스 한계로 인해 클라이언트가 병목이 되어 서버 성능 대신 클라이언트 성능을 측정하는 오류를 범했다. AIPerf는 ZeroMQ 메시지 버스를 사용하는 다중 프로세스 아키텍처를 채택하여 제어, 데이터, 분석 평면을 분리함으로써 이러한 문제를 해결했다. Worker는 요청 발송만 수행하고, Record Processor가 별도 프로세스에서 TTFT(첫 토큰 시간)와 ITL(토큰 간 지연)을 병렬로 계산한다.

주요 기능 및 지표

  • 추론 모델 지원: GenAI-Perf와 달리 추론 토큰을 구분하여 TTFT(모든 첫 토큰), TTFO(첫 출력 토큰), OSL(추론+출력)을 분리 측정한다.
  • 부하 시뮬레이션: Poisson, Gamma 등 다양한 도착 패턴과 동시성 버스트를 지원하여 실제 트래픽 변동성을 재현한다.
  • Goodput 측정: SLO(예: TTFT < 100ms)를 만족하는 요청만 집계하여 용량 산정의 정확도를 높인다.
  • 트레이스 재생: Mooncake, Bailian, BurstGPT 등 실제 프로덕션 트레이스를 재생하여 KV 캐시 재사용률 등을 분석할 수 있다.

생태계 확장

NVIDIA 단독 프로젝트가 아닌 AWS, CoreWeave, Baseten, Pinterest 등이 참여하는 협업 프로젝트다. Kubernetes 오퍼레이터, W&B/MLflow 연동 등 엔터프라이즈 환경에 필요한 기능을 포함하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.