SLAI T-Rex, Ascend NPU로 DeepSeek-V4 학습 최적화
[Paper] SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
·2026.07.23 17:13
Ascend NPU 기반 SLAI T-Rex 프레임워크가 DeepSeek-V4 조 단위 MoE 모델 포스트트레이닝에서 MFU 34.22%를 달성했다.
SLAI T-Rex는 Ascend NPU SuperPOD에서 조 단위 파라미터 규모 MoE 모델의 전체 파라미터 포스트트레이닝을 위한 엔드투엔드 최적화 프레임워크다.
핵심 성과:
- MFU 34.22% 달성 — 오픈소스 베이스라인 대비 2.93배 향상
- 계층적 최적화: 모델 병렬성, 컴퓨트-통신 오케스트레이션, 저수준 커널 실행 전 영역 커버
Operations Research(OR) 특화 모델도 함께 공개했다. DeepSeek-V4-Flash 기반으로 CPT·SFT 파이프라인을 구축하고, 솔버 검증 합성 데이터를 포함한 1만 건 고품질 SFT 샘플로 학습했다.
- Zero-shot Pass@1 71.81% 달성
- GPT-5.4-Mini 대비 +3.98%p, 베이스 DeepSeek-V4-Flash 대비 +11.27%p 우위
코드는 GitHub, 모델은 ModelScope에 공개됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.