Hugging Face, 207개 WebGPU 커널 공개…브라우저 AI 추론 속도 2.57배 향상
핵심 내용
Hugging Face가 207개의 최적화된 WebGPU 커널과 로더 라이브러리를 공개해 브라우저 기반 AI 추론 성능을 평균 2.57배 개선했다.
자세히 보기
Hugging Face WebAI 팀이 브라우저 내 AI 추론 성능을 극대화하기 위해 207개의 WebGPU 커널 컬렉션과 JavaScript 로더 **@huggingface/kernels**를 공개했다. 이 라이브러리는 Hugging Face Hub에서 최적화된 커널을 직접 로드하고 실행할 수 있게 하며, 각 커널은 인터페이스, WGSL 셰이더 템플릿, 정확성 및 벤치마크 케이스를 포함한 완전한 패키지로 제공된다.
성능 벤치마크 및 최적화
Apple M4 GPU 환경에서 ONNX Runtime Web과 비교한 결과, 전체 연산 기준 기하 평균 2.57배, 중위값 기준 1.90배 빠른 성능을 기록했다. 특히 ai.onnx.Add 연산은 3.52배, Softmax는 2.11배 빨랐으며, 특정 Bilinear Einsum 케이스에서는 10,000배 이상의 속도 향상을 보였다. 이러한 개선은 워크그룹 크기, 메모리 접근 패턴, 벡터화 등 하드웨어 특성에 맞춘 세밀한 최적화를 통해 달성되었다.
Fleet을 통한 크라우드소싱 검증
단일 디바이스 결과의 한계를 극복하기 위해 브라우저 기반 벤치마킹 도구 Fleet도 함께 출시했다. Fleet은 사용자의 실제 하드웨어에서 커널을 실행해 정확성과 성능 데이터를 수집하며, 이를 통해 다양한 GPU와 브라우저 환경에서의 최적화 의사결정을 지원한다. Hugging Face는 이 데이터를 바탕으로 커널 변형을 개선하고 ONNX Runtime Web 생태계 전반에 업스트림할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.