AI Briefing

NVIDIA, 로컬 AI를 위한 Google DeepMind의 DiffusionGemma 가속화

·2026.06.11 01:15

NVIDIA가 Google DeepMind의 새로운 확산 기반 모델 DiffusionGemma를 RTX 및 DGX 시스템에서 최대 4배 빠르게 실행하도록 최적화했다.

Google DeepMind가 텍스트 생성 속도를 획기적으로 높인 실험적 오픈 모델인 DiffusionGemma를 공개했습니다. NVIDIA는 이 모델을 GeForce RTX GPU, RTX PRO, DGX Spark 시스템에서 더욱 빠르게 실행할 수 있도록 최적화했습니다.

DiffusionGemma는 기존 LLM의 순차적(Autoregressive) 방식과 달리, 이미지 생성 모델처럼 노이즈에서 시작해 텍스트 블록 전체를 한 번에 정제하는 방식을 사용합니다. 이를 통해 한 번의 단계에서 최대 256개의 토큰을 병렬로 생성할 수 있어, 단일 사용자 워크로드에서 지연 시간을 크게 줄였습니다.

주요 특징은 다음과 같습니다:

  • Gemma 4 기반: 260억 개의 파라미터를 가진 Mixture-of-Experts(MoE) 구조를 사용하며, 단계당 38억 개의 파라미터만 활성화합니다.
  • 성능 향상: 동일한 단일 사용자 환경에서 기존 모델 대비 최대 4배 빠른 생성 속도를 제공합니다.
  • 로컬 실행 최적화: Apache 2.0 라이선스로 공개된 오픈 웨이트 모델로, 클라우드 비용 없이 RTX 및 DGX Spark에서 완전히 로컬로 구동됩니다.

NVIDIA GPU 환경에서 DiffusionGemma는 압도적인 성능을 보여줍니다. NVIDIA H100 단일 GPU에서 초당 1,000 토큰을 생성하며, DGX Station에서는 최대 초당 800 토큰의 고속 추론을 지원합니다. 현재 Hugging Face Transformers, vLLM, Unsloth를 통해 즉시 테스트 및 프로토타이핑이 가능합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.