AI Briefing

Skymizer, 700B LLM 추론 카드 공개

Skymizer Taiwan Inc. Unveils Breakthrough Architecture Enabling Ultra-Large LLM Inference on a Single Card

·2026.04.27 21:56

핵심 내용

HTX301 기반 PCIe 카드로 700B LLM 추론을 약 240W에서 지원한다.

자세히 보기

Skymizer가 COMPUTEX 2026을 앞두고 HTX301 inference chip과 HyperThought 아키텍처를 공개했다. 단일 PCIe card에 HTX301 6개와 384GB memory를 넣어 700B-parameter 모델 inference를 로컬에서 약 240W로 돌릴 수 있다고 밝혔다.

  • HyperThought는 LLM inference의 prefill과 decode를 분리한다.
  • GPU는 compute-dense prefill을 맡고, HTX301은 memory-bandwidth-heavy decode를 담당한다.
  • 소프트웨어는 KV-cache manager, phase-aware scheduler, dynamic placement engine으로 prefill/decode 풀을 조율한다.

플랫폼은 1 chip~6 chips, 32GB~384GB로 확장되며, 4B~700B 파라미터 모델을 대상으로 한다. Skymizer는 이를 통해 GPU cluster와 고전력 냉각 인프라 의존도를 낮추고, 온프레미스에서 데이터 주권과 낮은 지연시간을 확보할 수 있다고 설명했다.

세부 플랫폼 로드맵은 COMPUTEX 2026 현장 발표에서 추가 공개될 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.