NVIDIA, IFA 2026서 로컬 AI 가속화 및 RTX Spark PC 공개
핵심 내용
NVIDIA가 IFA 2026에서 로컬 추론 최적화 도구와 RTX Spark PC를 공개하며 로컬 AI 생태계를 확장했다.
자세히 보기
NVIDIA는 IFA 2026에서 Microsoft 및 파트너사와 협력하여 로컬 AI 추론 속도를 높이고 에이전트 설정을 간소화하는 새로운 도구와 하드웨어를 발표했다. 이번 발표의 핵심은 llama.cpp와 vLLM 최적화를 통해 로컬 추론 속도를 최대 1.9배까지 향상시킨 점이다. 이러한 최적화는 LM Studio와 Ollama를 통해 즉시 적용 가능하며, NVIDIA는 개인용 AI 라우터 도구인 NVIDIA PAIR를 공개해 로컬 네트워크 내 PC들 사이에서 추론 작업을 지능적으로 분배할 수 있게 했다.
로컬 에이전트 실행 환경 간소화
로컬 모델 기반 에이전트 실행의 진입 장벽을 낮추기 위해 Hermes Agent, OpenClaw, Perplexity Portable Computer 등 주요 에이전트 앱이 NVIDIA GPU에 대한 지원과 설정 간소화를 도입한다. 특히 Perplexity Portable Computer는 Linux 시스템에서 단일 앱으로 모델과 도구를 패키징하여 제공하며, Windows 지원도 곧 추가될 예정이다. 이 도구는 민감한 정보를 로컬에 유지하면서 필요 시에만 클라우드의 프런티어 모델로 작업을 에스컬레이션하는 하이브리드 방식을 채택했다.
RTX Spark 및 신규 모델 생태계 확장
10월에는 Lenovo와 Acer의 새로운 Windows PC인 NVIDIA RTX Spark가 출시된다. EA, Ubisoft 등 주요 게임사들이 RTX Spark용 타이틀을 준비 중이며, 개발자와 크리에이터들이 로컬에서 강력한 AI 에이전트를 실행할 수 있는 환경을 제공한다. 또한 8월에는 다양한 로컬 AI 모델들이 릴리스되어 생태계를 더욱 풍성하게 했다.
- Nemotron 3.5 Lightning: 300억 파라미터 모델로 RTX PC 및 DGX Spark 등에서 실행 가능
- GLM-5.3-Flash: Z.ai의 멀티모달 MoE 모델로 DGX Station에서 에이전틱 AI 지원
- Qwen3.8 시리즈: 오픈 웨이트 멀티모달 MoE 모델 및 270억 파라미터 모델로 로컬 코딩 및 에이전트 워크로드 최적화
- LTX 2.5: NVIDIA GPU 및 DGX 시스템에 최적화된 오픈 월드 비디오 생성 모델
- MiniMax-H3: ComfyUI를 통해 로컬 실행 가능한 오디오 동기화 비디오 생성 모델로, FastH3를 통해 성능이 7배 향상됨
- Meta Muse Glimmer: 300억 파라미터 오픈 웨이트 모델로 코딩 및 에이전트 워크로드 지원
- DeepSeek v4 Flash: 2840억 파라미터 MoE 모델로 2x DGX Spark 클러스터에서 실행 가능
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.