1
Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning
提出Hista和Numca两种状态值估计新方法,显著提升LLM强化学习效果,已被ICML 2026收录。
arXiv:2605.29782v1 Announce Type: cross Abstract: Reinforcement learning (RL) refines large language models (LLMs) by directly optimizing model behavi…