1
Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL
拆解RL策略梯度权重,FADE方法防止性能衰减,揭秘增益消失的根源。
arXiv:2607.01490v1 Announce Type: cross Abstract: Reinforcement learning post-training dramatically improves LLM reasoning, but suffers from training …