MDLM, 에이전트 RL 세계모델
Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL [R]
·2026.05.21 13:36
MDLM이 AR보다 더 강한 텍스트 세계모델로 에이전트 RL 성능을 올렸다.
**Masked Diffusion Language Models(MDLMs)**가 자기회귀(AR) LLM보다 텍스트 기반 세계모델에 더 적합하다는 결과가 나왔다.
- AR 방식은 다음 상태를 왼쪽에서 오른쪽으로만 생성해, 도구 스키마나 뒤쪽 상태 필드처럼 전역적으로 맞물린 정보를 동시에 맞추기 어렵다.
- MDLM은 any-order denoising objective로 여러 조건 방향을 함께 학습해 글로벌 일관성을 더 잘 유지한다.
- 파인튜닝된 SDAR-8B, WeDLM-8B는 4배 큰 AR 베이스라인까지도 BLEU-1, ROUGE-L, MAUVE에서 앞섰고, Self-BLEU는 낮고 Distinct-N은 높아 prefix mode collapse가 줄어든 것으로 나타났다.
- GRPO로 MDLM 생성 롤아웃을 학습에 쓰자, ScienceWorld, ALFWorld, AppWorld 홀드아웃에서 AR 생성 데이터보다 최대 +15% 절대 task-success 향상이 관측됐다.
- 결과는 1.2B~7B 백본(LFM2.5, Qwen3, Mistral) 전반에서 보였고, zero-shot transfer 상황에서도 유지됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.