대규모 AI 추론을 위한 16Gbps UCIe-Advanced 칩 간 인터페이스와 풀칩 확장형 Mesh를 갖춘 4칩렛 AI SoC
·2026.01.02 12:38
4칩렛 AI SoC가 16Gbps UCIe-Advanced로 풀칩 mesh를 구현한다.
Rebellions가 ISSCC 2026에서 4개 chiplet로 구성된 AI SoC를 공개했다. 핵심은 UCIe-Advanced 기반 16Gbps die-to-die 인터페이스와, 칩 경계를 넘어 하나처럼 동작하는 full-chip scalable mesh다.
이 구조는 대규모 AI inferencing, 특히 LLM serving처럼 compute와 memory 병목이 번갈아 나타나는 워크로드를 겨냥한다. 칩렛을 단순히 묶는 수준이 아니라, 패키지 전체를 하나의 확장형 시스템으로 다루도록 설계해 latency와 coherence를 유지하면서도 확장성을 확보했다.
논문/화이트페이퍼에서 강조하는 기능은 다음과 같다.
- Unified mixed-precision compute: 한 코어에서 FP8/FP16/FP32를 함께 처리해 compute density를 높임
- Predictive DMA + on-chip mesh: 소프트웨어가 조정하는 DMA와 mesh를 결합해 메모리 접근 병목을 줄임
- Hierarchical synchronization: 중앙 sync manager와 peer-to-peer 통신으로 분산 실행을 조율
수치상으로는 2.8배 높은 compute density, 2.7TB/s effective bandwidth, 2 PFLOPS(FP8), 그리고 3.3배 더 빠른 mesh fabric이 제시된다. 칩 간 연결은 채널당 1TB/s, inter-chiplet latency는 11ns로 설명되며, 각 chiplet은 3개의 UCIe 채널을 사용해 수평 mesh 연속성을 유지한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.