AI Briefing

Hugging Face, LLM 리더보드 도입

Bringing the Artificial Analysis LLM Performance Leaderboard to Hugging Face

·2024.05.03 09:00

Artificial Analysis가 가격, 속도, 품질을 종합 평가하는 LLM 성능 리더보드를 Hugging Face에 도입했다.

LLM 애플리케이션 구축 시 품질뿐만 아니라 **속도(Latency/Throughput)**와 **비용(Price)**은 매우 중요한 결정 요소입니다. Artificial Analysis는 100개 이상의 서버리스 LLM API 엔드포인트를 대상으로 품질, 가격, 속도를 종합적으로 평가하는 리더보드를 Hugging Face에 도입했습니다.

이 리더보드는 AI 엔지니어가 적절한 모델과 API 제공업체를 선택할 수 있도록 다음과 같은 핵심 지표를 제공합니다:

  • Quality: MMLU, MT-Bench, HumanEval 및 Chatbot Arena 순위를 결합한 품질 지수
  • Context Window: 모델이 한 번에 처리 가능한 최대 토큰 수
  • Pricing: 입력/출력 토큰당 가격 및 혼합(Blended) 가격
  • Throughput: 초당 토큰 수(TPS)의 중앙값 및 백분위수(P5, P25, P75, P95)
  • Latency: 첫 번째 토큰 생성 시간(TTFT)의 중앙값 및 백분위수

테스트는 프롬프트 길이(100, 1k, 10k 토큰)와 병렬 쿼리 수(1개, 10개) 등 다양한 워크로드 환경에서 수행됩니다. 모든 API 엔드포인트는 매일 8회 테스트를 거치며, 리더보드는 최근 14일간의 측정값 중앙값을 기준으로 업데이트됩니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.