Arc B70 난관
Anybody got Qwen3.5-27B working with Intel Arc B70 (or similar) and proper optimization?
·2026.04.15 07:29
핵심 내용
Arc B70에서 Qwen3.5-27B를 돌린 실전 벤치와 문제점을 공유했다.
자세히 보기
Intel Arc B70에서 Qwen3.5-27B를 돌려보며 백엔드별 체감 성능과 오류를 정리했다.
- llama-server + Vulkan: 정상 동작하지만 매우 느림. 대략 300/10 tokens/sec 수준.
- llama-server + OpenVINO: 아예 동작하지 않음. pre-allocated tensor 관련
CPY오류가 발생. - llama-server + SYCL: 성능은 눈에 띄게 개선돼 800/20 tokens/sec 정도지만, 큰 요청에서는 출력이 망가지는 문제가 있음.
- vLLM INT4: 로컬 빌드는 실패했지만
intel/llm-scaler-vllm도커 이미지는 실행 가능. ingestion은 최대 2200 tokens/sec로 빠르지만 generation은 약 10 tokens/sec에 그침.
전체적으로는 Intel Arc B70에서 다양한 스택을 시험한 실제 경험담이며, 성능은 백엔드별 편차가 크고 안정성도 아직 부족하다는 점이 핵심이다. 작성자는 특히 vLLM에서 툴 호출이 제대로 동작하지 않는 문제를 남겼고, 다른 사용자의 성공 사례나 실패 사례를 요청했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.