MBD-LM: 확산 기반 언어 모델의 병렬 생성 최적화
[Paper] Multi-Block Diffusion Language Models
·2026.07.04 22:21
확산 기반 언어 모델(BD-LM)의 병렬 디코딩 성능을 높이기 위한 Multi-Block 방식의 MBD-LM을 제안한다.
기존의 **Block Diffusion Language Models (BD-LMs)**는 단일 블록 기반의 생성 방식으로 인해 병렬 처리 및 가변 길이 생성에 한계가 있었습니다. 이를 해결하기 위해 연구진은 **Multi-Block Diffusion Language Models (MBD-LMs)**를 제안합니다.
MBD-LMs의 핵심 특징은 다음과 같습니다:
- Multi-block Teacher Forcing (MultiTF): 기존의 Teacher Forcing와 Diffusion Forcing의 장점을 결합하여, 추론 시 발생하는 불균일한 노이즈 패턴을 학습 과정에 반영했습니다.
- Block Buffer 메커니즘: Prefix-cache 재사용을 유지하면서 입력 형태를 고정하여, 디코딩 병렬성을 실제 연산 속도(Wall-clock acceleration) 향상으로 연결했습니다.
실험 결과, MBD-LLaDA2-Mini 모델은 평균 **Tokens Per Forward pass (TPF)**를 3.47에서 6.19로 크게 향상시켰으며, 정확도 또한 79.95%에서 **81.03%**로 개선되었습니다. 특히 DMax와 결합할 경우 TPF가 9.34에 달하는 높은 효율을 보여주었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.