트랜스포머 학습 병렬화
·2026.08.21 09:00
핵심 내용
트랜스포머 모델의 데이터 및 텐서 병렬화 시 통신 비용이 계산 성능을 제한하는 임계점을 분석했다.
자세히 보기
모델 스케일링의 핵심 목표는 칩 수를 늘리면서 처리량이 선형적으로 증가하는 **강한 스케일링(strong scaling)**을 달성하는 것입니다. 단일 칩 성능은 메모리 대역폭과 FLOPs의 균형에 좌우되지만, 클러스터 수준에서는 칩 간 통신을 유용한 연산과 겹쳐서 숨기는 것이 중요합니다.
칩 수를 늘리면 통신 부하가 증가하는 반면 이를 가릴 수 있는 디바이스당 계산량은 줄어들어 비자명한 문제가 발생합니다. 특히 샤딩된 행렬 곱셈은 AllGather나 ReduceScatter와 같은 고비용 통신을 유발하여 TPU의 유효 작업을 차단할 수 있습니다.
본 섹션에서는 데이터 병렬, FSDP, 텐서 병렬, 전문가 병렬, 파이프라인 병렬 등 5가지 병렬화 방식을 다루며, 각 방식이 계산 비용을 병목 현상으로 만들게 되는 통신 비용의 한계를 분석합니다. 메모리 용량 제약은 리마테리얼라이제이션 사용 시 주로 무시되므로, 칩 간 통신 비용에 초점을 맞춥니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.