Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning
离线强化学习遇上LLM推理,未来策略近似方法带来新突破,AI研究者不容错过。
arXiv:2509.19893v3 Announce Type: replace Abstract: Reinforcement learning (RL) has emerged as a key driver of post-training for complex reasoning in …