Hummingbird+ FPGA 추론
[Paper on Hummingbird+: low-cost FPGAs for LLM inference] Qwen3-30B-A3B Q4 at 18 t/s token-gen, 24GB, expected $150 mass production cost
·2026.05.03 21:55
핵심 내용
Hummingbird+가 24GB, 양산가 약 $150인 보드에서 Qwen3-30B-A3B Q4를 18 t/s로 구동했다.
자세히 보기
Hummingbird+는 Zynq UltraScale XCZU2CG/3EG 기반 커스텀 FPGA 보드에서 LLM 추론을 엣지 제품 단계로 끌어올리는 연구다.
보드는 24GB 메모리를 탑재하고, 양산 기준 BOM $150 이하를 목표로 한다.
핵심 결과는 GPTQ 4-bit Qwen3-30B-A3B를 추가 압축 없이 올려 decode 18+ tok/s, prefill 50+ tok/s를 기록한 점이다.
구현은 다음 최적화로 이뤄졌다.
- GEMV engine과 scalar engine을 소형화해 자원 사용량을 줄였다.
- dual-precision operand packing과 chain-tree mixing으로 연산 효율을 높였다.
- 24GB 메모리와 저가형 FPGA 조합으로 대형 MoE LLM 배포 가능성을 보여줬다.
요지는 tokens-per-dollar 기준으로 FPGA가 엣지 LLM의 실용적 선택지가 될 수 있다는 점이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.