AI Briefing

FreeToken: 대역폭 적응형 실행을 통한 효율적인 엣지 네이티브 MoE 서빙

·2026.08.19 09:00

핵심 내용

FreeToken은 개인 기기의 이질적 자원을 활용해 대규모 MoE 모델을 효율적으로 실행하는 엣지 네이티브 서빙 시스템을 제공한다.

자세히 보기

최첨단 오픈 웨이트 모델은 점점 더 많이 공개되고 있지만, 이를 서빙하는 방식은 여전히 데이터센터 인프라를 전제로 하고 있다. FreeToken은 개인 기기를 단순한 소형 GPU가 아닌, 유연하고 통합된 추론 플랫폼으로 재정의하는 엣지 네이티브 MoE 서빙 시스템이다.

이 시스템은 로컬 AI의 두 가지 현실, 즉 에이전트 워크로드의 실행 패턴이 지속적으로 변하고 하드웨어 자원의 균형이 기기마다 다르다는 점에 맞춰 설계되었다. 고정된 오프로딩 전략을 고집하지 않고, 실제로 사용 가능한 자원에 맞춰 계산과 모델 상태를 지속적으로 매핑하는 대역폭 적응형 실행 방식을 채택했다.

FreeToken은 모델 레이아웃 및 로딩, 전문가 레지던시, CPU-GPU 실행, 에이전트 상태 재사용, 런타임 메모리 관리 등 전체 서빙 스택을 공동 설계했다. 이를 통해 8GB 랩톱 GPU부터 단일 워크스테이션 GPU에 이르는 다양한 하드웨어에서 20개 이상의 MoE 모델과 실제 코딩 및 도구 사용 에이전트를 지원한다.

주요 성과는 다음과 같다.

  • 35B 모델을 랩톱에서, 284B 모델을 게이밍 데스크톱에서, 753B GLM-5.2를 단일 워크스테이션 GPU에서 실행 가능하게 했다.
  • 사용자가 이미 소유한 기기를 프런티어 스케일 지능을 위한 실용적인 플랫폼으로 전환한다.

해당 시스템은 flashml.ai에서 공개되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.