추천DiffusionGemma: 4배 빠른 텍스트 생성
·2026.06.11 01:00
Google이 기존 LLM의 순차적 생성 방식에서 벗어나 텍스트 블록을 동시에 생성하는 실험적 모델 DiffusionGemma를 공개했다.
Google은 텍스트 확산(Diffusion) 기술을 활용해 생성 속도를 극대화한 실험적 오픈 모델 DiffusionGemma를 발표했습니다. Apache 2.0 라이선스로 공개된 이 모델은 26B Mixture of Experts (MoE) 구조를 채택하여, 기존 Autoregressive 방식의 토큰 단위 순차 처리 한계를 극복했습니다.
DiffusionGemma는 텍스트 블록 전체를 동시에 생성함으로써 GPU에서 최대 4배 빠른 속도를 구현합니다. 주요 특징은 다음과 같습니다:
- 초고속 추론: NVIDIA H100에서 초당 1,000개 이상의 토큰을 생성하며, RTX 5090에서도 700개 이상의 토큰을 출력합니다.
- 효율적인 하드웨어 활용: 전체 26B 파라미터 중 추론 시에는 3.8B 파라미터만 활성화되어, 양자화 시 18GB VRAM을 가진 소비자용 GPU에서도 원활히 작동합니다.
- 양방향 어텐션(Bi-directional Attention): 한 번의 포워드 패스로 256개의 토큰을 병렬 생성하여 코드 인필링(Infilling)이나 수학적 그래프 생성에 유리합니다.
- 지능형 자기 수정: 텍스트 블록 전체를 한 번에 평가하여 오류를 실시간으로 수정하는 반복적 정제 과정을 거칩니다.
다만, 속도와 병렬 생성에 최적화된 실험적 모델이므로, 최고 수준의 출력 품질이 필요한 경우에는 표준 Gemma 4 모델 사용을 권장합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.