AI Briefing

Intel B70 백엔드 비교

Intel B70: LLama.ccp SYCL vs LLama.cpp OpenVino vs LLM-Scaler

·2026.04.27 06:25

Intel B70에서 llama.cpp OpenVINO가 SYCL보다 빨라졌지만 LLM-Scaler에는 뒤졌다.

Intel B70에서 llama.cpp의 OpenVINO backend가 기존 SYCL보다 크게 개선됐지만, LLM-Scaler보다는 느렸다.

  • 테스트 모델: bartowski/DeepSeek-R1-Distill-Llama-8B-GGUF:Q4_K_M
  • 벤치마크 도구: llama-benchy http://localhost:8000/v1

OpenVINO 결과

  • pp2048: 3845.61 ± 524.73 t/s
  • tg512: 40.89 ± 0.55 t/s
  • peak t/s: 44.33 ± 1.25 t/s
  • ttfr: 659.99 ± 56.95 ms
  • e2e_ttft: 739.42 ± 56.84 ms

작성자는 tg512에서는 SYCL이 가장 빨랐지만, 실제 체감은 프롬프트 처리 속도가 더 중요했고 그 지표에서 OpenVINO의 개선 폭이 컸다고 봤다.

다만 Intel GPU용으로 검증된 모델 풀이 좁아, OpenVINO에서 정상 동작하는 모델과 LLM-Scaler에서 대응 가능한 모델을 맞추는 데 시간이 걸렸다고 덧붙였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.