2.12.02개월 전
PyTorch 2.12.0 Release
PyTorch 2.12.0은 CUDA 성능을 크게 끌어올리고, 그래프 캡처/재생과 양자화 내보내기, fused 옵티마이저 지원을 확장했으며 SVE 빌드 검사는 더 엄격해졌다.
Breaking changes
- FindARM.cmake의 SVE compile checks가 강화되어, 이전에는 통과하던 잘못된 SVE 설정의 source build가 이제 CMake configuration 단계에서 실패할 수 있음.
주요 기능
- torch.accelerator.Graph API 추가: CUDA, XPU, out-of-tree backend 간 graph capture/replay를 통합.
- torch.export.save가 Microscaling (MX) quantization formats를 지원하여, 더 강하게 압축된 모델도 export 가능.
- Adagrad가 fused=True를 지원해, Adam, AdamW, SGD와 함께 단일 커널 optimizer 구현을 사용할 수 있음.
- torch.cond control flow를 CUDA Graphs 안에서 capture/replay 가능.
- ROCm에서 expandable memory segments, rocSHMEM symmetric memory collectives, FlexAttention pipelining 지원.
성능 개선
- CUDA에서 batched linalg.eigh가 업데이트된 cuSolver backend selection 덕분에 최대 100배 빨라짐.