CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning
一种自我纯净轨迹方法,大幅提升4B-7B小模型的Agentic强化学习效果,专治执行失败噪声!
arXiv:2601.15141v2 Announce Type: replace Abstract: Agentic Reinforcement Learning (RL) has empowered Large Language Models (LLMs) to utilize tools li…