1
ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents
传统奖励只看成败,这套方法用自适应评分标准给多步智能体每一步“打分讲理”,可解释强化学习的新思路。
arXiv:2606.21262v1 Announce Type: new Abstract: Reinforcement learning for multi-step LLM agents often relies on scalar rewards that indicate success …