AI Briefing

TurboQuant 적용한 Valkyr

TurboQuant enabled Runtime Valkyr

·2026.04.30 04:43

Runtime Valkyr에 TurboQuant 추론 경로가 추가돼 RTX 3090에서 Gemma 120 tok/s를 냈다.

TRiP 소스코드를 바탕으로 한 Runtime ValkyrZig와 headless Vulkan Compute Shader로 포팅됐고, 선택적 추론 경로로 TurboQuant를 붙였다. Gemma 기준 RTX 3090에서 120 tok/s를 기록했다.

TurboQuant는 현재 Algorithm 1만 사용한다. 구성은 RHT pre-conditioner + Lloyd-Max scalar quantization + 글로벌 4-bit codebook + norm-correction γ이며, **QJL(Algorithm 2)**은 5개 독립 재현 결과를 바탕으로 제외했다.

  • sign-bit residual은 bias를 줄이지만 attention-score variance를 키워 채택하지 않았다.
  • 여기서 RHT는 random orthogonal이 아니라 Randomized Hadamard Transform다.
  • 4-bit 기준 plain random rotation의 PPL은 604였고, RHT는 10.12였다.
  • γ는 원본 L2 / reconstruction norm을 저장해 디퀀타이즈 블록의 L2 norm을 정확히 맞춘다.

기본 설정은 K=fp / V=TQ4의 비대칭 구성이다. TQ4 pack kernel은 deterministic input ramp에서 256/256 인덱스를 CPU oracle과 Python reference와 비트 단위로 일치시켰다.

Gemma 2B, max_pos 2048 기준으로 V cache는 36 MiB → 4.6 MiB로 줄었고, 여기에 2 MiB 공유 dequant scratchpad가 더해진다. 지원 하드웨어는 Vulkan 1.3 GPU 전반이며, vendor별로 SPIR-V 바이너리 하나씩을 사용한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.