Extropic, Z1+FPGA 기반 Z1T 연구 공개… 일부 연산의 에너지 효율 추정 제시
핵심 내용
Extropic은 Z1과 FPGA를 결합한 Z1T 설계를 공개하고, 최종 logits 연산 등을 제외한 조건에서 에너지 효율과 디코딩 처리량을 추정했다.
자세히 보기
Extropic 연구진은 Z1 칩을 활용해 Transformer 계열 모델의 추론 에너지 효율을 높이는 Z1T 아키텍처를 공개했다. 이번 초기 연구는 Z1의 희소 연산과 FPGA의 나머지 연산을 결합한 디코딩 구성을 다룬다. GPU 등을 보조 연산기로 사용하는 방안은 향후 탐색 대상이며, prefill은 현재 GPU가 더 적합하다고 설명한다. Z1T는 Softmax Attention 대신 Gated Convolutional Attention(GCA), RMSNorm 대신 DyT를 적용하고, MLP의 희소 가중치를 Z1의 tanh-linear units로 컴파일한다. 데이터 처리에는 4비트 정밀도에 근사하는 Dy4P 표현을 사용한다.
연구진의 외삽에 따르면 Z1T가 GPT-2와 같은 손실에 도달하려면 약 10배의 FLOPs가 필요하지만, Z1 연산의 낮은 에너지 비용이 이를 상쇄할 가능성이 있다. 제시된 에너지 수치는 Z1의 이론적 소비량에 기반한 추정이며, 최종 dense logit readout과 Z1·FPGA 간 데이터 이동을 제외한다. 이 범위에서 토큰당 294.52 nJ로 추정되며, H100의 MFU 10% 가정(40.9 µJ)과 비교한 비율은 약 139배다. 최종 logit readout을 FPGA에서 수행하는 비용까지 포함하면 약 136.4 µJ/token으로 달라진다. 포함된 연산만의 추정에서도 FPGA가 에너지의 95% 이상을 차지한다.
처리량 역시 전체 시스템의 실측 결과가 아니다. 단일 직렬 스트림을 가정한 Z1T 추정치는 약 17,000 tok/s이며, H100의 batch-1 torch.compile 측정치는 약 9,764 tok/s다. 이 비교에서도 양쪽 모두 최종 vocabulary logits 연산을 제외했다. 연구진은 작은 모델과 batch-1 조건이 H100의 효율에 불리하며, GPU 배치 처리에서는 효율이 크게 개선될 수 있다고 설명한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.