확산 언어 모델(dLLM) 연구: 병렬 생성으로 AR 모델 속도 한계 극복 및 Mercury 2 등 상용화 동향
·2026.09.22 09:55
핵심 내용
Kuleshov 연구팀이 병렬 생성으로 AR 모델의 속도 한계를 극복하는 확산 언어 모델(dLLM) 기술과 Mercury 2 등 상용화 현황을 정리했다.
1 / 8
자세히 보기
Volodymyr Kuleshov 등이 이끄는 연구는 기존 자기회귀(AR) LLM의 순차 생성 한계를 극복하기 위한 **확산 언어 모델(Diffusion LLM, dLLM)**의 기술적 진화와 상용화 현황을 다룬다. dLLM은 전체 시퀀스를 병렬로 반복 정제(refinement)하여 오류 수정과 속도 향상을 가능하게 한다.
핵심 기술 및 메커니즘
- Masked Diffusion: 이산 토큰에 Gaussian noise를 적용할 수 없어 BERT와 유사한 bidirectional transformer로 random masking된 토큰을 복원하는 방식을 사용한다.
- 구조 확장: 표준 MDLM의 고정 길이 및 속도 한계를 극복하기 위해 Block Diffusion(Gemma Diffusion, 256토큰 블록 생성), Set Diffusion, Encoder-decoder 구조 등이 도입되었다.
- 오류 수정: Remasking(재마스킹) 기법을 통해 샘플링 단계 증가 시 MAUVE 점수가 0.40에서 0.66으로 상승하며 AR 모델(0.76)에 근접했다.
- Uniform State Diffusion(UDLM): 마스킹 대신 랜덤 토큰 대체를 사용하여 모든 토큰 수정이 가능하며, Gemma Diffusion이 이를 채택했다.
성능 및 상용화 사례
- Mercury 2 (Inception): 전용 칩 없이 알고리즘 최적화만으로 1,200 tok/sec를 달성하여 Claude Haiku, Gemini Flash-Lite 등과 품질이 동등하면서 5~10배 빠른 속도를 구현했다.
- Nemotron Diffusion (NVIDIA): 35B 파라미터의 AR-diffusion 결합 모델로 AR 대비 2~8배 처리량을 기록하며 품질의 99%를 유지한다.
- Gemma Diffusion (Google): UDLM 백본과 block diffusion을 채택해 메모리 대역폭 병목을 연산 병목으로 전환했다.
- LLaDA: 8B 파라미터 오픈 웨이트 모델로 LLaMA2/3 대비 일반, 수학, 코드 벤치마크에서 경쟁력을 입증했다.
응용 분야 및 전망
- 생물학: ESM3(100B 파라미터)는 단백질 생성 SOTA를 기록했으며, NT-v3는 Wet-lab 검증에서 native보다 우수한 enhancer 발현 조절 능력을 보였다.
- 추론 가속: 병렬 처리로 AR 모델 대비 최대 10배 속도 향상을 입증했으며, 트랜스포머가 RNN의 한계를 극복했던 것과 유사한 역할을 할 것으로 평가된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.