AI Briefing

NVENC로 PCIe 대역폭 6배 증폭

torch-nvenc-compress: GPU NVENC silicon as a PCIe bandwidth multiplier — PCA + pure-ctypes Video Codec SDK wrapper. Parallel-path overlap measured at 67% of theoretical max on a real GEMM + encode workload. [P]

·2026.05.04 07:43

핵심 내용

NVENC를 활용해 PCIe 병목을 줄이는 압축 PoC의 실측 결과를 공개했다.

1 / 2

자세히 보기

RTX 5090에서 NVENC를 활용해 활성값을 압축한 뒤 PCIe로 넘기는 PoC가 실제 워크로드 기준으로 측정됐다. README는 이 방식으로 NVLink가 없는 4090/5090의 GPU 간 전송을 압축 비율만큼 사실상 증폭할 수 있다고 주장한다.

  • diffusion activations 1,735개 캡처에서 6.1× lossless compression, cosine 0.991 LOO를 기록했다.
  • MultiEngineDirectBackend는 real FLUX activations 668프레임 기준 0.180 ms/frame encode, 0.262 ms/frame decode를 보였다.
  • poc/17의 30×4096² fp16 GEMM과 64-frame encode 동시 실행은 parallel wall-clock 26.0 ms, serialized 40.1 ms로 1.34× 빨랐고, 이론상 최대의 67% overlap을 달성했다.

README는 이 조합이 ~180 GB/s의 effective bandwidth에 도달할 수 있다고 제시하지만, cross-GPU peer-to-peer wiring은 아직 다음 통합 단계로 남아 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.