DiffusionGemma, 1,500토큰/s
DiffusionGemma 기술 문서 리뷰: 자기회귀 Gemma 4를 이산 확산 모델로 변환한 초고속 텍스트 생성에 대한 연구
핵심 내용
DiffusionGemma가 Gemma 4를 이산 확산 모델로 개조해 H100에서 1,500TPS를 달성했다.
자세히 보기
Google DeepMind는 자기회귀 방식으로 학습된 Gemma 4 26B A4B MoE 체크포인트를 사전학습 없이 이산 확산(discrete diffusion) 모델로 개조했다.
DiffusionGemma는 토큰을 한 개씩 생성하는 대신, 최대 256토큰 블록을 양방향 어텐션으로 병렬 디노이징하며 반복 정제한다. 이를 통해 자기회귀 모델의 메모리 대역폭 병목을 줄이고 추론을 compute-bound 영역으로 이동시키는 것을 목표로 한다.
학습은 두 단계로 구성된다.
- SFT: 깨끗한 컨텍스트를 참고하면서 256토큰 노이즈 블록을 디노이징하도록 모델을 적응시킨다.
- 샘플러 증류·강화학습(SD·RL): 생성 품질을 유지하면서 순전파 횟수와 지연시간을 줄인다.
동일한 트랜스포머 백본을 활용해 기존 Gemma 4의 멀티모달 이해, 긴 컨텍스트, thinking mode를 재사용할 수 있도록 설계됐다. 보고된 평가에서 순전파 1회당 평균 약 20토큰을 생성했으며, H100·FP8·배치 1 기준 약 1,500TPS를 기록했다.
이는 같은 환경의 Gemma 4 AR 모델 204TPS보다 7.1배, MTP를 적용한 AR 모델 303TPS보다 4.8배 빠른 수치다. 텍스트 확산 모델이 기존 AR 체크포인트의 지식과 능력을 활용하면서도 낮은 동시성 환경의 생성 지연을 줄일 수 있는지를 보여주는 사례다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.