AI Briefing

Prime, 프런티어 오픈 모델 서빙 플랫폼 Prime Inference 출시

·2026.10.02 09:00

핵심 내용

Prime이 프런티어 오픈 모델 서빙을 위한 Prime Inference를 출시했다.

1 / 14

자세히 보기

Prime이 프런티어 오픈 모델을 실제 사용자에게 배포해 지속 학습 루프를 완성하기 위한 신규 서빙 플랫폼 Prime Inference를 출시했다. 이 서비스는 가변 수요에 대응하는 서버리스 엔드포인트와 지속적 워크로드를 위한 예약 용량을 모두 지원하며, NVIDIA Blackwell 인프라에서 운영되고 Vera Rubin이 곧 도입될 예정이다. 공개 출시 전 내부적으로는 대규모 RL 롤아웃과 합성 데이터 생성을 위해 일일 약 1조 토큰을 처리했다.

아키텍처 및 성능

플랫폼은 공개 API와 모델 플릿을 분리해 용량 전환과 페일오버를 원활하게 수행한다. 오케스트레이션에는 NVIDIA Dynamo, 실행에는 vLLM을 사용하며, 에이전트 워크로드 최적화를 위해 prefill/decode 분리를 구현했다. 이 아키텍처는 공유 GPU 환경 대비 p90 토큰 간 지연 시간을 약 40% 단축한다. 또한 Mooncake을 활용해 호스트 DRAM 캐싱으로 대화 이력을 보존하고 재계산을 줄인다.

GLM-5.3 배포

첫 공개 모델인 GLM-5.3은 9월 22일부터 OpenRouter에서 서비스 중이다. 현재 플랫폼 내 가장 빠른 GLM-5.3 엔드포인트 중 하나로, 출시 이후 100% 가동률과 거의 0에 가까운 도구 호출 오류율을 기록하고 있다. 목표 성능은 사용자당 초당 100 토큰이며, 최적화를 통해 사용자당 101 tok/s, GPU당 출력 100 tok/s(prefill-to-decode 비율 1:4)를 달성했다.

기술 최적화

  • NVFP4 KV 압축: MLA 캐시 행 크기를 576바이트에서 352바이트로 줄여 정확도 손실 없이 총 캐시 용량을 약 50% 증가시킨다.
  • BLHNC 레이아웃: 블록 우선(block-major) KV 레이아웃으로 이전 레이어 우선(layer-major) 레이아웃 대비 전송 디스크립터를 10배, 평균 전송 시간을 47% 줄인다.
  • 신뢰성 있는 도구 호출: vLLM에 xgrammar을 통합해 디코딩 중 도구 호출 문법을 강제하며, 조용한 실패를 제거하고 에이전트 작업의 스키마 준수를 보장한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.