Hummingbird+ FPGA 추론
[Paper on Hummingbird+: low-cost FPGAs for LLM inference] Qwen3-30B-A3B Q4 at 18 t/s token-gen, 24GB, expected $150 mass production cost
·2026.05.03 21:55
Hummingbird+가 24GB, 양산가 약 $150인 보드에서 Qwen3-30B-A3B Q4를 18 t/s로 구동했다.
Hummingbird+는 Zynq UltraScale XCZU2CG/3EG 기반 커스텀 FPGA 보드에서 LLM 추론을 엣지 제품 단계로 끌어올리는 연구다.
보드는 24GB 메모리를 탑재하고, 양산 기준 BOM $150 이하를 목표로 한다.
핵심 결과는 GPTQ 4-bit Qwen3-30B-A3B를 추가 압축 없이 올려 decode 18+ tok/s, prefill 50+ tok/s를 기록한 점이다.
구현은 다음 최적화로 이뤄졌다.
- GEMV engine과 scalar engine을 소형화해 자원 사용량을 줄였다.
- dual-precision operand packing과 chain-tree mixing으로 연산 효율을 높였다.
- 24GB 메모리와 저가형 FPGA 조합으로 대형 MoE LLM 배포 가능성을 보여줬다.
요지는 tokens-per-dollar 기준으로 FPGA가 엣지 LLM의 실용적 선택지가 될 수 있다는 점이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.