AI가 설계한 오픈소스 가속기 openTPU, FPGA에서 LLM 추론 성공
·2026.10.07 01:23
핵심 내용
AI가 설계한 오픈소스 가속기 openTPU가 FPGA에서 LLM 추론에 성공했다.
1 / 3
자세히 보기
AI가 설계한 AI 추론 하드웨어
openTPU는 AI 에이전트가 직접 개발한 오픈소스 AI 가속기 프로젝트로, AI가 자신의 추론을 실행할 칩을 설계할 수 있는지 탐구합니다. 저장소에는 SystemVerilog RTL, 명령어 세트 아키텍처, 비트 단위 정확 시뮬레이터, 커널 컴파일러, 호스트 소프트웨어 등 전체 스택이 포함되어 있습니다.
Inspur YPCB-00338 카드 성능
이 가속기는 Xilinx Kintex-7 xc7k480t FPGA와 DDR3 채널 2개를 탑재한 Inspur YPCB-00338 카드에서 작동합니다. 실제 가중치를 가진 10개의 최신 모델을 실행하며 시뮬레이터와 비트 단위로 일치하는 출력값을 생성합니다. 주요 모델의 측정 성능은 다음과 같습니다:
- LFM2.5-230M (int8): 디코딩 59.0 tok/s
- LFM2.5-230M (4-bit): 디코딩 85.8 tok/s
- Qwen3-0.6B (int8): 디코딩 21.6 tok/s
- Qwen3.5-0.8B (int8): 디코딩 17.6 tok/s
- Gemma 4 E2B (4-bit): 디코딩 10.57 tok/s
- LFM2-2.6B (int8): 디코딩 6.05 tok/s
- SmolLM3-3B (int8): 디코딩 5.00 tok/s
- Phi-4-mini (3.8B) (int8): 디코딩 3.99 tok/s
- Qwen3.5-2B (int8): 디코딩 8.02 tok/s
- Qwen3.5-4B (4-bit): 디코딩 5.88 tok/s
설계는 캐시나 숨겨진 스케줄링을 배제한 단순성을 우선시합니다. 디코딩 성능은 DRAM 효율에 의해 제한되며, DDR3-1066 피크 대역폭의 82%에서 85%를 읽습니다. 4-bit 양자화는 int8 대비 디코딩 속도를 40%에서 45%까지 향상시킵니다. 또한 LFM2.5-8B-A1B와 같은 Mixture-of-Experts 모델을 지원하며 디코딩 중 피크 대역폭의 98.5%를 달성합니다. 프로젝트는 Apache License 2.0을 따릅니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.