AI Briefing

ATSInfer: 소비자용 기기 LLM 추론 최적화

[Paper] Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices

·2026.07.20 01:54

텐서 단위 스케줄링을 통해 소비자용 기기에서 LLM 추론 성능을 대폭 향상시킨 ATSInfer 연구 발표

기존의 레이어 또는 전문가(Expert) 단위 오프로딩 방식은 텐서 간의 이질성을 반영하지 못하고 하드웨어 부하 변화에 취약하다는 한계가 있습니다.

새롭게 제안된 ATSInfer는 다음과 같은 핵심 기술을 통해 이를 해결합니다:

  • 텐서 단위 오프로딩(Tensor-level Offloading): 레이어 내부의 텐서 세부 사항까지 고려한 정밀한 배치 수행
  • 하이브리드 스케줄링: 정적 텐서 배치와 부하 인식형(Load-aware) 동적 전송의 결합
  • 비동기 CPU-GPU 협업: 하드웨어 저장소, 데이터 이동, 연산을 효율적으로 조정

실험 결과, 기존 시스템 대비 Prefill 처리량은 최대 1.94배, Decode 처리량은 최대 3.29배 향상되었으며, GPU 활용도와 PCIe 대역폭 효율성도 크게 개선되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.