분산형 AI 추론 속도 15배 향상
Someone just ran a 744B parameter model at 30 tok/s across 6 consumer GPUs in 6 different US states over the open internet
·2026.06.20 19:45
Shard 프로젝트가 WAN 환경에서 Speculative Decoding 등을 활용해 대규모 모델의 분산 추론 속도를 획기적으로 개선했다.
연구자 leyten이 공개한 Shard 프로젝트는 WAN(광역 네트워크) 환경에서 GLM-5.2(744B) 모델을 6개의 RTX Pro 6000 GPU에 분산 배치하여 초당 약 **30토큰(tok/s)**의 속도를 구현하는 데 성공했다.
기존 Petals(2022) 방식이 소규모 모델에서 1-2 tok/s를 기록했던 것과 비교하면 약 15-20배 향상된 수치다. 주요 기술적 성과는 다음과 같다:
- Speculative decoding over WAN: 작은 드래프트 모델이 여러 토큰을 제안하면, 분산된 대형 모델이 한 번의 네트워크 왕복으로 이를 검증하여 지연 시간을 최소화함.
- Ring pipelining with direct return: 최종 노드가 모든 단계를 거치지 않고 코디네이터에게 직접 결과를 전송하여 효율성을 높임.
- CUDA-graphed draft model: 드래프트 모델을 CUDA 그래프로 사전 컴파일하여 3.8~5.3배의 속도 향상을 달성함.
Shard는 누구나 GPU를 기여하고 USDC로 보상을 받을 수 있는 c0mpute.ai 네트워크의 기반 인프라로 활용될 예정이다. 모든 실행 결과는 GPU UUID, IP 주소, 지연 시간 등을 포함한 공개 영수증으로 검증 가능하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.