AI Briefing

Kaggle 무료 TPU로 320B GLM-5.3-Flash 서빙 레시피 공개

Kaggle TPU Lab: 무료 Kaggle TPU에서 320B 크기의 GLM-5.3-Flash을 서빙하는 코딩 에이전트용 API 레시피 저장소

·2026.09.18 07:30

핵심 내용

Kaggle 무료 TPU v5e-8에서 320B MoE 모델 GLM-5.3-Flash를 서빙하는 오픈소스 저장소 공개

1 / 3

자세히 보기

개발자 Abdur Rahim이 Kaggle의 무료 TPU v5e-8 환경에서 GLM-5.3-Flash(320B MoE) 및 Qwen3.8-27B 모델을 서빙하고 OpenAI/Anthropic 호환 API를 생성하는 오픈소스 저장소 kaggle-tpu-lab을 공개했다.

GLM-5.3-Flash 서빙 기술

기존 vLLM TPU 백엔드는 Linear Attention 커널 부재 등으로 GLM-5.3-Flash 실행이 불가능해, 저자는 약 5,400줄의 JAX/Pallas 기반 커스텀 추론 엔진을 개발했다.

  • 양자화 전략: 전문가 가중치는 3비트, 나머지는 int8로 양자화하여 16GB급 TPU 칩 8개에서 실행 가능하도록 최적화했다.
  • 성능: 단일 스트림 기준 약 64 tok/s, 다중(3개) 스트림 시 약 90 tok/s를 기록하며, 컨텍스트 길이는 262,144 토큰을 지원한다.
  • 한계: 3비트 양자화로 인해 원본 bf16 모델 대비 출력 품질 차이가 존재하며, 정식 벤치마크 비교는 수행되지 않았다.

Qwen3.8-27B 및 vLLM 패치

Qwen3.8-27B는 vllm-tpu에 패치를 적용해 bf16 가중치 그대로 실행한다.

  • MTP 버그 수정: vllm-tpu v0.28.0의 MTP 드래프트 토큰 거부 시 순환 상태 롤백 실패 문제를 해결하는 패치(PR #3178 이식)를 적용했다.
  • 성능 향상: 그리디 디코딩 일치율 100% 확보 및 디코딩 속도 34% 향상(A/B 테스트 기준 78 tok/s에서 104 tok/s로 증가, 배포 설정에서는 약 130 tok/s)을 달성했다.

사용 조건 및 주의사항

  • 할당량: 전화 인증된 Kaggle 계정으로 주당 약 20시간의 무료 TPU 할당량을 사용한다.
  • 세션 제한: Kaggle 세션은 9시간으로 제한되며, 재실행 시 엔드포인트 주소가 변경된다.
  • 네트워크: cloudflared 터널을 사용하며, Cloudflare의 100초 타임아웃을 우회하기 위해 15초 간격 keep-alive 및 스트리밍 응답이 필수적이다.
  • 라이선스: 저장소는 MIT 라이선스이며, 모델 가중치 라이선스는 각각 Apache-2.0(Qwen)과 MIT(GLM)를 따른다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.