AI Briefing

Hummingbird+ FPGA 추론

[Paper on Hummingbird+: low-cost FPGAs for LLM inference] Qwen3-30B-A3B Q4 at 18 t/s token-gen, 24GB, expected $150 mass production cost

·2026.05.03 21:55

핵심 내용

Hummingbird+가 24GB, 양산가 약 $150인 보드에서 Qwen3-30B-A3B Q4를 18 t/s로 구동했다.

자세히 보기

Hummingbird+는 Zynq UltraScale XCZU2CG/3EG 기반 커스텀 FPGA 보드에서 LLM 추론을 엣지 제품 단계로 끌어올리는 연구다.

보드는 24GB 메모리를 탑재하고, 양산 기준 BOM $150 이하를 목표로 한다.

핵심 결과는 GPTQ 4-bit Qwen3-30B-A3B를 추가 압축 없이 올려 decode 18+ tok/s, prefill 50+ tok/s를 기록한 점이다.

구현은 다음 최적화로 이뤄졌다.

  • GEMV engine과 scalar engine을 소형화해 자원 사용량을 줄였다.
  • dual-precision operand packing과 chain-tree mixing으로 연산 효율을 높였다.
  • 24GB 메모리와 저가형 FPGA 조합으로 대형 MoE LLM 배포 가능성을 보여줬다.

요지는 tokens-per-dollar 기준으로 FPGA가 엣지 LLM의 실용적 선택지가 될 수 있다는 점이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.