2.13.03주 전
PyTorch 2.13.0 Release
Apple Silicon 지원 확대, 메모리 효율적인 손실 함수 도입 및 분산 학습 성능이 향상된 PyTorch 2.13.0 출시
주요 신규 기능 및 성능 향상
- FlexAttention: Apple Silicon(MPS) 지원이 추가되었으며, 희소 패턴(sparse patterns) 적용 시 SDPA 대비 최대 약 12배의 속도 향상을 제공합니다. 또한 CUDA 환경에서 재현 가능한 그래디언트 계산을 위한 결정론적(deterministic) 역전파 경로를 지원합니다.
- CuTeDSL "Native DSL" backend: Inductor에 Triton과 병렬로 작동하는 두 번째 고성능 코드 경로를 제공하여 주요 GPU 연산의 컴파일 속도를 높였습니다.
- nn.LinearCrossEntropyLoss: 예측과 손실 계산을 결합하여, 대규모 어휘집(large-vocabulary)을 가진 언어 모델 학습 시 피크 GPU 메모리 사용량을 최대 4배까지 절감합니다.
- torchcomms: PyTorch Distributed를 위한 새로운 통신 백엔드로, 대규모 클러스터 학습 시 결함 허용(fault tolerance), 확장성 및 디버깅 능력을 개선합니다.
- FSDP2: 전용 프로세스 그룹을 통해 reduce-scatter와 all-gather 통신을 중첩(overlap)시켜 분산 학습 처리량(throughput)을 높였습니다.
- 플랫폼 지원 확대:
- ROCm: AOTriton 0.12b 및 네이티브 HIP CMake 지원.
- Arm: Armv9-A 대상 torch.compile 지원.
- Intel XPU: 새로운 장치 텔레메트리(telemetry) API 노출.
- Python 3.15 지원: Linux 환경에서 free-threaded 3.15t를 포함한 Python 3.15 휠(wheel) 지원.
알려진 이슈 (Regressions)
- ROCm 휠 사용 시 CPU 환경에서 torch.compile이 작동하지 않는 문제가 보고되었습니다.