AI Briefing

DiffusionGemma, 1,500토큰/s

DiffusionGemma 기술 문서 리뷰: 자기회귀 Gemma 4를 이산 확산 모델로 변환한 초고속 텍스트 생성에 대한 연구

·2026.08.06 15:30

핵심 내용

DiffusionGemma가 Gemma 4를 이산 확산 모델로 개조해 H100에서 1,500TPS를 달성했다.

1 / 2

자세히 보기

Google DeepMind는 자기회귀 방식으로 학습된 Gemma 4 26B A4B MoE 체크포인트를 사전학습 없이 이산 확산(discrete diffusion) 모델로 개조했다.

DiffusionGemma는 토큰을 한 개씩 생성하는 대신, 최대 256토큰 블록을 양방향 어텐션으로 병렬 디노이징하며 반복 정제한다. 이를 통해 자기회귀 모델의 메모리 대역폭 병목을 줄이고 추론을 compute-bound 영역으로 이동시키는 것을 목표로 한다.

학습은 두 단계로 구성된다.

  • SFT: 깨끗한 컨텍스트를 참고하면서 256토큰 노이즈 블록을 디노이징하도록 모델을 적응시킨다.
  • 샘플러 증류·강화학습(SD·RL): 생성 품질을 유지하면서 순전파 횟수와 지연시간을 줄인다.

동일한 트랜스포머 백본을 활용해 기존 Gemma 4의 멀티모달 이해, 긴 컨텍스트, thinking mode를 재사용할 수 있도록 설계됐다. 보고된 평가에서 순전파 1회당 평균 약 20토큰을 생성했으며, H100·FP8·배치 1 기준 약 1,500TPS를 기록했다.

이는 같은 환경의 Gemma 4 AR 모델 204TPS보다 7.1배, MTP를 적용한 AR 모델 303TPS보다 4.8배 빠른 수치다. 텍스트 확산 모델이 기존 AR 체크포인트의 지식과 능력을 활용하면서도 낮은 동시성 환경의 생성 지연을 줄일 수 있는지를 보여주는 사례다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.