Prime, 프런티어 오픈 모델 서빙 플랫폼 Prime Inference 출시
핵심 내용
Prime이 프런티어 오픈 모델 서빙을 위한 Prime Inference를 출시했다.
자세히 보기
Prime이 프런티어 오픈 모델을 실제 사용자에게 배포해 지속 학습 루프를 완성하기 위한 신규 서빙 플랫폼 Prime Inference를 출시했다. 이 서비스는 가변 수요에 대응하는 서버리스 엔드포인트와 지속적 워크로드를 위한 예약 용량을 모두 지원하며, NVIDIA Blackwell 인프라에서 운영되고 Vera Rubin이 곧 도입될 예정이다. 공개 출시 전 내부적으로는 대규모 RL 롤아웃과 합성 데이터 생성을 위해 일일 약 1조 토큰을 처리했다.
아키텍처 및 성능
플랫폼은 공개 API와 모델 플릿을 분리해 용량 전환과 페일오버를 원활하게 수행한다. 오케스트레이션에는 NVIDIA Dynamo, 실행에는 vLLM을 사용하며, 에이전트 워크로드 최적화를 위해 prefill/decode 분리를 구현했다. 이 아키텍처는 공유 GPU 환경 대비 p90 토큰 간 지연 시간을 약 40% 단축한다. 또한 Mooncake을 활용해 호스트 DRAM 캐싱으로 대화 이력을 보존하고 재계산을 줄인다.
GLM-5.3 배포
첫 공개 모델인 GLM-5.3은 9월 22일부터 OpenRouter에서 서비스 중이다. 현재 플랫폼 내 가장 빠른 GLM-5.3 엔드포인트 중 하나로, 출시 이후 100% 가동률과 거의 0에 가까운 도구 호출 오류율을 기록하고 있다. 목표 성능은 사용자당 초당 100 토큰이며, 최적화를 통해 사용자당 101 tok/s, GPU당 출력 100 tok/s(prefill-to-decode 비율 1:4)를 달성했다.
기술 최적화
- NVFP4 KV 압축: MLA 캐시 행 크기를 576바이트에서 352바이트로 줄여 정확도 손실 없이 총 캐시 용량을 약 50% 증가시킨다.
- BLHNC 레이아웃: 블록 우선(block-major) KV 레이아웃으로 이전 레이어 우선(layer-major) 레이아웃 대비 전송 디스크립터를 10배, 평균 전송 시간을 47% 줄인다.
- 신뢰성 있는 도구 호출: vLLM에 xgrammar을 통합해 디코딩 중 도구 호출 문법을 강제하며, 조용한 실패를 제거하고 에이전트 작업의 스키마 준수를 보장한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.