Rebellions, 외부 스위치 없는 256 소켓 지원 Rebel100s 가속기 공개
핵심 내용
Rebellions가 외부 스위치 없이 256 소켓을 지원하는 Rebel100s 가속기 아키텍처를 공개했다.
자세히 보기
Rebellions가 AI 추론을 위한 Rebel100s 가속기의 아키텍처를 공개하며, 컴퓨팅과 메모리만큼 인터커넥트 계층이 중요하다고 강조했다. AI 학습 시장은 Nvidia와 AMD가 주도하지만, 추론 시장은 지연 시간과 토큰 생성 비용에 민감해 여전히 경쟁이 치열하다. Rebel100s는 온다이, 패키지 내, 랙스케일 인터커넥트를 새로 설계해 이 문제를 해결한다.
Rebel100 아키텍처
초기 제품인 Rebel100 가속기는 이전 이름인 Rebel Quad로, UCIe-Advanced 인터커넥트로 연결된 4개의 NPU 칩렛으로 구성된다. 칩렛은 Samsung의 SF4X 공정(4nm)으로 제조된다. 각 Rebel-Single 칩렛에는 텐서 및 벡터 연산 유닛을 갖춘 16개의 뉴럴 코어, 4 MB L1 SRAM, 그리고 16 TB/sec 대역폭의 메시 네트워크로 연결된 32개의 L2 메모리 슬라이스가 포함된다.
Rebel100 패키지에는 칩렛당 통합 실리콘 커패시터(ISC) 1개와 12단 HBM3E 메모리 스택이 탑재되어 총 144 GB 용량과 4.8 TB/sec 대역폭을 제공한다. 커스텀 UCIe 구현에는 PHY 장애를 처리하기 위한 스트리밍 프로토콜 레이어와 멀티패스가 포함된다. 4칩렛 복합체는 FP16 정밀도에서 1 페타플롭스, FP8 정밀도에서 2 페타플롭스 성능을 낸다.
Rebel100s와 통합 스위칭
후속 제품인 Rebel100s는 복합체에 한 쌍의 Rebel IO 칩렛을 추가한다. 이 I/O 다이들은 네이티브 이더넷 라우팅을 제공하며 AXI 메모리 프로토콜을 캡슐화해, 1세대 시스템에서 최대 256 소켓까지 확장할 수 있게 한다. 이 설계는 스위치 기능을 소켓 내부로 흡수해 스케일업 도메인에 외부 스위치가 필요 없게 만든다.
Rebel100s의 주요 사양은 다음과 같다:
- 대역폭: Rebel IO 칩렛 한 쌍은 1,600 GB/sec의 스케일업 대역폭을 제공하며, 이는 Nvidia Blackwell B200/B300 GPU의 1,800 GB/sec에 근접한 수치다.
- 연결성: 각 Rebel IO 칩렛은 두 개의 PCIe 6.0/CXL 3.0 컨트롤러와 800 Gb/sec 스케일업 연결을 지원하는 네 개의 이더넷 포트를 갖추고 있다.
- 지연 시간: 서로 다른 소켓 간 NPU-to-NPU 홉은 약 1 마이크로초가 소요되며, 목표는 500 나노초다.
- 동기화: 커스텀 하드웨어 동기화 장치는 동기화 신호를 포스트 엔벨로프로 전송해 핸드셰이크 지연을 제거하고 추론 성능을 개선한다.
현재 Rebellions는 구리 이더넷 케이블을 사용해 64개 Rebel100s 소켓이 포함된 단일 랙을 지원한다. 이를 넘어 4개 랙으로 확장하려면 광케이블이 필요하다. 시스템은 유연한 토폴로지를 지원해, 작은 클러스터에서는 외부 스위칭 하드웨어 없이 메모리 서버 노드를 구성할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.