AI Briefing
추천

FreeToken, RTX 5090으로 284B MoE 서빙

FreeToken: 프론티어급 MoE 모델을 게이밍 데스크톱 수준에서 서빙하기 위한 Edge-Serving에 대한 연구

·2026.08.25 12:30

핵심 내용

FreeToken이 게이밍 PC 수준 하드웨어에서 프론티어급 MoE 모델을 효율적으로 서빙하는 시스템을 제안했다.

자세히 보기

Berkeley, UT Austin, UC Berkeley 등 11명의 연구자가 저자로 참여한 FreeToken 논문이 공개되었다. 이 연구는 오픈 웨이트 모델의 가중치는 공개되었지만, 이를 돌릴 수 있는 하드웨어 장벽이 여전히 높다는 문제를 해결하기 위해 고안된 엣지 서빙 시스템이다.

기존 llama.cpp, Ollama, KTransformers 등 엣지 인퍼런스 엔진은 MoE(Mixture-of-Experts) 모델의 희소성(Sparsity)을 충분히 활용하지 못해 prefill 단계의 전문가 전송 병목과 decode 단계의 캐시 미스 문제를 해결하지 못했다. FreeToken은 이를 위해 대역폭 적응 실행(Bandwidth-Adaptive Execution), 의미 인식 캐싱(Semantic-Aware Caching), 탄력적 엣지 자원 관리라는 3가지 핵심 원칙을 적용한다.

주요 성과는 다음과 같다.

  • **RTX 5090(32GB)**에서 DeepSeek-V4-Flash(284B) 모델을 21.5 tok/s로 서빙했다. 이는 같은 하드웨어에서 llama.cpp(14.7 tok/s)나 KTransformers(10.2 tok/s)보다 높은 성능이며, Ollama는 해당 모델을 서빙하지 못했다.
  • 8GB RTX 4060 노트북에서도 Qwen3.6-35B 모델을 39.3 tok/s로 서빙하여, 프로덕션 환경의 Codex 중앙 decode 속도(33 tok/s)를 상회했다.

이 시스템은 GPU, CPU, 호스트 메모리, 인터커넥트를 하나의 통합 추론 플랫폼으로 다루어, 데이터센터급 GPU 클러스터가 아닌 소비자용 하드웨어에서도 프론티어급 AI 모델을 로컬에서 실행할 수 있는 기반을 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.