DiffusionGemma 기술 보고서
·2026.08.20 22:24
핵심 내용
디스크리션 디퓨전 기반 오픈웨이트 LLM 'DiffusionGemma'가 초고속 추론 성능을 입증했다.
자세히 보기
구글 연구진이 공개한 DiffusionGemma는 디스크리션 디퓨전(discrete diffusion) 방식을 적용하여 텍스트 생성 속도를 극대화한 실험적 오픈웨이트 언어 모델이다.
기존 오토레그레시브(AR) 모델이 토큰을 하나씩 순차적으로 생성하는 병목 현상을 해결하기 위해, 이 모델은 256개 토큰 블록을 병렬로 반복 정제하는 방식을 채택했다. 이는 Gemma 4 MoE 모델(활성화 3.8B, 총 25.2B 파라미터)을 파인튜닝하여 구축되었으며, 초기 AR 모델의 총 학습 토큰 예산의 10% 미만만 사용하여 효율적인 2단계 학습 파이프라인을 구현했다.
성능 및 효율성
- 단일 NVIDIA H100 GPU에서 초당 약 1,500개 출력 토큰을 생성한다.
- 포워드 패스당 평균 20개 토큰을 생성하여, 최신 스펙ulative 디코딩을 적용한 AR 모델보다도 현저히 빠른 속도를 보인다.
- 생성 속도와 모델 성능 간의 트레이드오프에서 새로운 파레토 프런티어를 설정했다.
기타 특징
- '사고 모드(thinking mode)', 멀티모달 입력, 긴 컨텍스트 지원 등 원본 모델의 핵심 기능을 유지한다.
- 디퓨전 파인튜닝에도 불구하고 AR 생성이 가능하며, 성능 저하가 미미하여 하이브리드 디퓨전-AR 디코딩으로의 전환 가능성을 시사한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.