1
SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing
不切片、不重建轨迹,用风险预算随机掩码驯服扩散大模型RL,直击TraceRL计算冗余。
arXiv:2607.00208v1 Announce Type: cross Abstract: Reinforcement learning for diffusion large language models (dLLMs) has largely moved to trajectory-a…