AI Briefing

Intel Gaudi, Assisted Generation 지원으로 추론 속도 향상

Faster assisted generation support for Intel Gaudi

·2024.06.04 09:00

Intel Gaudi에서 Speculative Sampling 기반의 Assisted Generation을 지원하여 LLM 추론 속도를 최대 2배 높인다.

LLM의 크기가 커짐에 따라 추론 비용과 전력 소비를 줄이기 위한 최적화가 필수적이다. Hugging Face는 Intel Gaudi 프로세서에서 Assisted Generation(Speculative Sampling)을 최적화하여 지원하기 시작했다.

이 기능은 Optimum Habana 라이브러리에 통합되었으며, Transformers 및 Diffusers와 같은 Hugging Face 라이브러리를 통해 Intel Gaudi에 최적화된 AI 워크플로우를 제공한다.

Speculative Sampling은 작은 크기의 드래프트(draft) 모델이 먼저 토큰을 생성하고, 이를 타겟 모델이 검증하는 기술이다. 이 방식을 통해 대규모 트랜스포머 모델에서 약 2배의 속도 향상을 기대할 수 있다. 사용자는 generate() 호출 시 assistant_model 파라미터를 통해 드래프트 모델을 간단히 지정하여 사용할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.