AI Briefing

llama.cpp -sm tensor 개선

Don't forget about dem free gains!

·2026.04.30 02:50

핵심 내용

RTX 3090 Ti 2장 구성에서 `-sm tensor` 적용 시 llama-bench 처리량이 상승했다.

자세히 보기

Qwen3.6-27B-UD-Q4_K_XL.gguf를 대상으로 한 llama-bench 결과가 공유됐다.

  • 1장 RTX 3090 Ti 환경에서는 -fa 1 기준 pp512 1580.12 t/s, tg128 44.43 t/s를 기록했다.
  • 2장 RTX 3090 Ti 환경에서는 CUDA_VISIBLE_DEVICES=0,1과 -fa 1 -sm tensor 조합으로 pp512 2047.28 t/s, tg128 58.83 t/s까지 올라갔다.
  • 두 결과 모두 같은 빌드 665abc609 (8951) 를 사용했다.

게시글은 몇 주 전만 해도 -sm tensor 경로에서 llama-bench가 동작하지 않았다고 적고 있어, 해당 멀티 GPU 경로가 최근 개선됐음을 시사한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.