Diffusion Language Model을 위한 Unmasking 정책 학습
·2026.07.02 09:00
강화 학습을 통해 Diffusion LLM의 토큰 선택(Unmasking) 효율성을 극대화하는 새로운 정책 학습 방법을 제안한다.
Diffusion Large Language Models(dLLMs)는 여러 토큰을 병렬로 디코딩할 수 있어 추론 효율성 측면에서 Autoregressive 모델의 유망한 대안으로 꼽힙니다. 하지만 각 단계에서 어떤 토큰을 먼저 복원(Unmask)할지 결정하는 샘플링 과정이 성능의 핵심적인 설계 요소로 작용합니다.
기존에는 신뢰도 임계값(Confidence Thresholding)과 같은 휴리스틱 전략을 사용해 왔으나, 이는 수동 튜닝이 필요하고 블록 크기가 커질수록 성능이 저하되는 한계가 있었습니다. 본 연구에서는 이러한 샘플링 과정을 **마르코프 결정 과정(MDP)**으로 정식화하고, 강화 학습을 통해 최적의 샘플링 정책을 학습하는 방법을 제안합니다.
제안된 방식의 특징은 다음과 같습니다:
- Lightweight Policy: 단일 레이어 Transformer를 기반으로 하여 dLLM의 토큰 신뢰도를 Unmasking 결정으로 매핑합니다.
- 성능 입증: 실험 결과, 제안된 정책은 Semi-autoregressive(Block) 생성 방식에서 기존 SOTA 휴리스틱과 대등한 성능을 보였으며, Full-diffusion 설정에서는 이를 능가하는 성능을 기록했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.