AI Briefing

Project Maya, GLM-5.3-Flash 로컬 실행 지원

"Strata" for GLM5.3 Flash is here for some! Project Maya

·2026.10.12 03:42

핵심 내용

오픈소스 Project Maya가 GLM-5.3-Flash를 단일 RTX 5090 등에서 로컬 실행한다.

자세히 보기

zai-org가 MIT 라이선스로 공개한 GLM-5.3-Flash(매개변수 3210억 개)를 소비자용 하드웨어에서 로컬 실행할 수 있게 해주는 오픈소스 도구 'Project Maya'가 공개됐다. 단일 NVIDIA GPU부터 최대 16개 GPU까지 지원하며, AMD와 Windows 환경은 실험적으로 지원한다.

성능 및 하드웨어 요구 사항

엔진은 자주 사용하는 전문가(Expert)는 GPU에, 덜 사용하는 것은 RAM에, 나머지는 NVMe SSD에 배치하고 대화 중 동적으로 이동시켜 메모리를 최적화한다. 보고된 벤치마크 성능은 다음과 같다:

  • RTX 4090 4개 구성에서 초당 최대 118개 토큰 처리.
  • 단일 RTX 5090에서 초당 30개 이상 토큰 처리.
  • 토큰당 활성 매개변수는 약 180억 개이며, 최대 100만 토큰의 컨텍스트 창을 지원한다.

정확도 및 통합

Maya는 FP8 모델의 제로샷 정확도를 97.7-99.2% 유지하는 자체 양자화 기법을 사용한다. OpenAI 및 Anthropic 호환 API를 제공해 기존 코딩 에이전트 및 도구와 연동할 수 있다. 브라우저 기반 채팅 인터페이스, 이미지 지원, 사고 수준 제어 기능을 포함하며, 사용자의 GPU, CPU, RAM, SSD 구성에 맞춰 자동으로 조정되는 셀프 튜닝 메커니즘을 탑재했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.