인텔, OpenVINO 2026.4 공개
Intel releases OpenVINO 2026.4
·2026.09.17 18:51
핵심 내용
인텔이 OpenVINO 2026.4를 공개하며 Gemma 4, Qwen 3.5/3.6 등 최신 모델 지원과 Multi-Token Prediction 추론 가속 기능을 추가했다.
자세히 보기
인텔이 OpenVINO 2026.4 버전을 공식 출시하며 생성형 AI 모델 지원 범위와 추론 성능을 대폭 확장했다. 이번 업데이트는 코드 변경을 최소화하면서 최신 Gen AI 프레임워크와의 통합을 강화하는 데 초점을 맞췄다.
주요 모델 지원 및 추론 최적화
- 신규 모델 지원: CPU에서 Gemma-3n, CPU/GPU에서 Kokoro-82M, Qwen3-VL-4B (EAGLE3 적용), Muse Glimmer 30B, Qwen 3.8 27B, Gemma4 12B 등을 지원한다. NPU에서는 FLUX.2-Klein 4B와 Kokoro 82M이 추가되었다.
- Multi-Token Prediction (MTP): OpenVINO GenAI가 CPU와 GPU에서 Gemma 4, Qwen 3.5, Qwen 3.6에 대해 MTP 추측 디코딩을 지원하여 정확도 손실 없이 처리량을 높이고 지연 시간을 줄인다.
- Tree Drafting 지원: EAGLE3의 Tree Drafting (Top-K)을 지원하여 Chain Drafting (Top-1) 대비 VLM 파이프라인의 처리량을 향상시킨다.
- Xe3 그래픽 최적화: Intel Core Ultra Series 3 프로세서에서 Gemma 4 모델의 긴 컨텍스트 입력 처리 성능을 개선한다.
개발자 도구 및 엣지 배포 기능 강화
- NPU 프로파일링 지원: Instrumentation and Tracing Technology (ITT) 프로파일링을 NPU로 확장하여 Intel VTune Profiler로 CPU, GPU, NPU 실행을 일관된 툴체인으로 분석할 수 있게 되었다.
- Node.js ASR 파이프라인: OpenVINO GenAI가 Node.js에서 ASRPipeline을 지원하여 JavaScript 개발자도 Whisper나 Qwen3-ASR 같은 음성 인식 모델을 C++/Python과 유사한 API로 스트리밍 및 성능 지표와 함께 실행할 수 있다.
- 모델 서버 개선: OpenVINO Model Server가 Muse Glimmer 30B 및 Qwen3.8 27B 같은 에이전틱 모델을 지원하며, 미사용 시 모델을 언로드하여 메모리를 절약하는 유휴 모델 관리 기능을 프리뷰로 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.