집에서 BitTorrent 방식으로 대형 언어 모델 실행하기
·2026.07.23 10:33
Petals 프로젝트가 BitTorrent 방식으로 소비자 GPU에서 Llama 3.1 405B 등 초대형 LLM을 분산 실행할 수 있게 한다.
Petals는 여러 사용자가 각자 모델의 일부 레이어를 로드해 P2P 네트워크를 구성, 소비자 GPU나 Google Colab만으로 Llama 3.1(최대 405B), Mixtral(8x22B), Falcon(40B+), BLOOM(176B) 같은 초대형 LLM을 실행할 수 있는 오픈소스 프레임워크다.
추론 속도는 단일 배치 기준 Llama 2(70B) 최대 6 tokens/sec, Falcon(180B) 최대 4 tokens/sec로 챗봇·인터랙티브 앱에 충분한 수준이다.
일반 LLM API와 달리 PyTorch 및 Hugging Face Transformers 기반으로 파인튜닝, 커스텀 샘플링, 히든 스테이트 접근 등 유연한 활용이 가능하다. GitHub에서 문서와 소스코드를 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.