NVENC로 PCIe 대역폭 6배 증폭
torch-nvenc-compress: GPU NVENC silicon as a PCIe bandwidth multiplier — PCA + pure-ctypes Video Codec SDK wrapper. Parallel-path overlap measured at 67% of theoretical max on a real GEMM + encode workload. [P]
·2026.05.04 07:43
NVENC를 활용해 PCIe 병목을 줄이는 압축 PoC의 실측 결과를 공개했다.
RTX 5090에서 NVENC를 활용해 활성값을 압축한 뒤 PCIe로 넘기는 PoC가 실제 워크로드 기준으로 측정됐다. README는 이 방식으로 NVLink가 없는 4090/5090의 GPU 간 전송을 압축 비율만큼 사실상 증폭할 수 있다고 주장한다.
- diffusion activations 1,735개 캡처에서 6.1× lossless compression, cosine 0.991 LOO를 기록했다.
MultiEngineDirectBackend는 real FLUX activations 668프레임 기준 0.180 ms/frame encode, 0.262 ms/frame decode를 보였다.poc/17의 30×4096² fp16 GEMM과 64-frame encode 동시 실행은 parallel wall-clock 26.0 ms, serialized 40.1 ms로 1.34× 빨랐고, 이론상 최대의 67% overlap을 달성했다.
README는 이 조합이 ~180 GB/s의 effective bandwidth에 도달할 수 있다고 제시하지만, cross-GPU peer-to-peer wiring은 아직 다음 통합 단계로 남아 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.