AI Briefing

AI가 설계한 오픈소스 가속기 openTPU, FPGA에서 LLM 추론 성공

·2026.10.07 01:23

핵심 내용

AI가 설계한 오픈소스 가속기 openTPU가 FPGA에서 LLM 추론에 성공했다.

1 / 3

자세히 보기

AI가 설계한 AI 추론 하드웨어

openTPU는 AI 에이전트가 직접 개발한 오픈소스 AI 가속기 프로젝트로, AI가 자신의 추론을 실행할 칩을 설계할 수 있는지 탐구합니다. 저장소에는 SystemVerilog RTL, 명령어 세트 아키텍처, 비트 단위 정확 시뮬레이터, 커널 컴파일러, 호스트 소프트웨어 등 전체 스택이 포함되어 있습니다.

Inspur YPCB-00338 카드 성능

이 가속기는 Xilinx Kintex-7 xc7k480t FPGA와 DDR3 채널 2개를 탑재한 Inspur YPCB-00338 카드에서 작동합니다. 실제 가중치를 가진 10개의 최신 모델을 실행하며 시뮬레이터와 비트 단위로 일치하는 출력값을 생성합니다. 주요 모델의 측정 성능은 다음과 같습니다:

  • LFM2.5-230M (int8): 디코딩 59.0 tok/s
  • LFM2.5-230M (4-bit): 디코딩 85.8 tok/s
  • Qwen3-0.6B (int8): 디코딩 21.6 tok/s
  • Qwen3.5-0.8B (int8): 디코딩 17.6 tok/s
  • Gemma 4 E2B (4-bit): 디코딩 10.57 tok/s
  • LFM2-2.6B (int8): 디코딩 6.05 tok/s
  • SmolLM3-3B (int8): 디코딩 5.00 tok/s
  • Phi-4-mini (3.8B) (int8): 디코딩 3.99 tok/s
  • Qwen3.5-2B (int8): 디코딩 8.02 tok/s
  • Qwen3.5-4B (4-bit): 디코딩 5.88 tok/s

설계는 캐시나 숨겨진 스케줄링을 배제한 단순성을 우선시합니다. 디코딩 성능은 DRAM 효율에 의해 제한되며, DDR3-1066 피크 대역폭의 82%에서 85%를 읽습니다. 4-bit 양자화는 int8 대비 디코딩 속도를 40%에서 45%까지 향상시킵니다. 또한 LFM2.5-8B-A1B와 같은 Mixture-of-Experts 모델을 지원하며 디코딩 중 피크 대역폭의 98.5%를 달성합니다. 프로젝트는 Apache License 2.0을 따릅니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.