LongCat-2, 중국산 칩으로 1.6조 파라미터 훈련
What do we know about the "AI Accelerators" used to train LongCat-2?
·2026.07.23 10:45
핵심 내용
LongCat-2는 50,000개 이상의 중국산 AI ASIC만으로 1.6조 파라미터 모델을 훈련했다고 밝혔다.
자세히 보기
LongCat-2(3.55TB, BF16)는 공식 블로그에서 칩 벤더명을 명시하지 않았으나, 페이지 메타 설명(중국어)에 "훈련 전 과정이 국산 칩으로 완료됐다"고 적시돼 있다. Nvidia GPU 없이 프론티어급 모델 훈련이 가능함을 실증한 사례다.
인프라 구성 주요 수치:
- 50,000개 이상 ASIC으로 사전학습 수행
- 35조 토큰 이상 훈련, 롤백·손실 스파이크 없음
- Superpod = 최대 48칩을 올투올(all-to-all) 고대역폭 인터커넥트로 연결 (NVLink 도메인과 유사)
- Superpod 간 연결은 RoCE(RDMA over Converged Ethernet) 패브릭 사용
- 2계층 설계로 학습 처리량 약 30% 향상
메모리 제약 대응: H800(80GB HBM) 대비 칩당 HBM 용량이 적어 ZeRO-1 샤딩, 선택적 재계산(recomputation), 미사용 활성화 오프로딩 등 메모리 최적화 기법을 적극 활용했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.