MDLM, 에이전트 RL 세계모델
Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL [R]
·2026.05.21 13:36
핵심 내용
MDLM이 AR보다 더 강한 텍스트 세계모델로 에이전트 RL 성능을 올렸다.
자세히 보기
**Masked Diffusion Language Models(MDLMs)**가 자기회귀(AR) LLM보다 텍스트 기반 세계모델에 더 적합하다는 결과가 나왔다.
- AR 방식은 다음 상태를 왼쪽에서 오른쪽으로만 생성해, 도구 스키마나 뒤쪽 상태 필드처럼 전역적으로 맞물린 정보를 동시에 맞추기 어렵다.
- MDLM은 any-order denoising objective로 여러 조건 방향을 함께 학습해 글로벌 일관성을 더 잘 유지한다.
- 파인튜닝된 SDAR-8B, WeDLM-8B는 4배 큰 AR 베이스라인까지도 BLEU-1, ROUGE-L, MAUVE에서 앞섰고, Self-BLEU는 낮고 Distinct-N은 높아 prefix mode collapse가 줄어든 것으로 나타났다.
- GRPO로 MDLM 생성 롤아웃을 학습에 쓰자, ScienceWorld, ALFWorld, AppWorld 홀드아웃에서 AR 생성 데이터보다 최대 +15% 절대 task-success 향상이 관측됐다.
- 결과는 1.2B~7B 백본(LFM2.5, Qwen3, Mistral) 전반에서 보였고, zero-shot transfer 상황에서도 유지됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.