AI Briefing

Arc B70 난관

Anybody got Qwen3.5-27B working with Intel Arc B70 (or similar) and proper optimization?

·2026.04.15 07:29

핵심 내용

Arc B70에서 Qwen3.5-27B를 돌린 실전 벤치와 문제점을 공유했다.

자세히 보기

Intel Arc B70에서 Qwen3.5-27B를 돌려보며 백엔드별 체감 성능과 오류를 정리했다.

  • llama-server + Vulkan: 정상 동작하지만 매우 느림. 대략 300/10 tokens/sec 수준.
  • llama-server + OpenVINO: 아예 동작하지 않음. pre-allocated tensor 관련 CPY 오류가 발생.
  • llama-server + SYCL: 성능은 눈에 띄게 개선돼 800/20 tokens/sec 정도지만, 큰 요청에서는 출력이 망가지는 문제가 있음.
  • vLLM INT4: 로컬 빌드는 실패했지만 intel/llm-scaler-vllm 도커 이미지는 실행 가능. ingestion은 최대 2200 tokens/sec로 빠르지만 generation은 약 10 tokens/sec에 그침.

전체적으로는 Intel Arc B70에서 다양한 스택을 시험한 실제 경험담이며, 성능은 백엔드별 편차가 크고 안정성도 아직 부족하다는 점이 핵심이다. 작성자는 특히 vLLM에서 툴 호출이 제대로 동작하지 않는 문제를 남겼고, 다른 사용자의 성공 사례나 실패 사례를 요청했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.