LongCat-2, 중국산 칩으로 1.6조 파라미터 훈련
What do we know about the "AI Accelerators" used to train LongCat-2?
·2026.07.23 10:45
LongCat-2는 50,000개 이상의 중국산 AI ASIC만으로 1.6조 파라미터 모델을 훈련했다고 밝혔다.
LongCat-2(3.55TB, BF16)는 공식 블로그에서 칩 벤더명을 명시하지 않았으나, 페이지 메타 설명(중국어)에 "훈련 전 과정이 국산 칩으로 완료됐다"고 적시돼 있다. Nvidia GPU 없이 프론티어급 모델 훈련이 가능함을 실증한 사례다.
인프라 구성 주요 수치:
- 50,000개 이상 ASIC으로 사전학습 수행
- 35조 토큰 이상 훈련, 롤백·손실 스파이크 없음
- Superpod = 최대 48칩을 올투올(all-to-all) 고대역폭 인터커넥트로 연결 (NVLink 도메인과 유사)
- Superpod 간 연결은 RoCE(RDMA over Converged Ethernet) 패브릭 사용
- 2계층 설계로 학습 처리량 약 30% 향상
메모리 제약 대응: H800(80GB HBM) 대비 칩당 HBM 용량이 적어 ZeRO-1 샤딩, 선택적 재계산(recomputation), 미사용 활성화 오프로딩 등 메모리 최적화 기법을 적극 활용했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.