집에서 BitTorrent 방식으로 대형 언어 모델 실행하기
·2026.07.23 10:33
핵심 내용
Petals 프로젝트가 BitTorrent 방식으로 소비자 GPU에서 Llama 3.1 405B 등 초대형 LLM을 분산 실행할 수 있게 한다.
자세히 보기
Petals는 여러 사용자가 각자 모델의 일부 레이어를 로드해 P2P 네트워크를 구성, 소비자 GPU나 Google Colab만으로 Llama 3.1(최대 405B), Mixtral(8x22B), Falcon(40B+), BLOOM(176B) 같은 초대형 LLM을 실행할 수 있는 오픈소스 프레임워크다.
추론 속도는 단일 배치 기준 Llama 2(70B) 최대 6 tokens/sec, Falcon(180B) 최대 4 tokens/sec로 챗봇·인터랙티브 앱에 충분한 수준이다.
일반 LLM API와 달리 PyTorch 및 Hugging Face Transformers 기반으로 파인튜닝, 커스텀 샘플링, 히든 스테이트 접근 등 유연한 활용이 가능하다. GitHub에서 문서와 소스코드를 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.