AI Briefing

FreeToken, 로컬 PC에서 290B MoE 고속 실행

FreeToken: Frontier models at interactive speed using official checkpoints without extreme quantizations.

·2026.08.22 12:55

핵심 내용

FreeToken이 소비자 하드웨어에서 프런티어 MoE 모델을 인터랙티브 속도로 실행할 수 있는 엣지 네이티브 서빙 엔진을 공개했다.

자세히 보기

FreeToken은 게이밍 PC 등 개인 하드웨어에서 290B+ 규모의 프런티어 MoE(Mixture-of-Experts) 모델을 로컬에서 실행하기 위한 엣지 네이티브 서빙 엔진이다. 이 도구는 GPU, CPU, 호스트 메모리 등 이질적인 엣지 리소스를 통합된 탄력적 추론 플랫폼으로 처리한다.

주요 기능은 다음과 같다.

  • 고속 엣지 네이티브 런타임: 대역폭 적응형 CPU-GPU 공동 실행, 이중 버퍼링 프리필 스트리밍, 글로벌 LRU 전문가 캐싱 등을 지원한다.
  • 시맨틱 인지 캐싱: 에이전틱 컨텍스트 편집 시 불필요한 재계산을 방지하는 시맨틱 앵커 체크포인트를 제공한다.
  • 탄력적 메모리 관리: 엔진 재시작 없이 VRAM을 동적으로 재할당할 수 있다.
  • 광범위한 모델 지원: DeepSeek-V4-Flash, Qwen3.6-35B-A3B 등 오픈 웨이트 MoE 모델과 다양한 양자화 형식(MXFP4, NVFP4 등)을 지원하며, Anthropic/OpenAI 호환 API를 제공한다.

NVIDIA RTX 30, 40, 50 시리즈 GPU를 포함한 다양한 소비자 하드웨어에서 동작하도록 설계되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.