1
CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward
小模型多步工具调用准确率达92%,逼近GPT-5且算力需求骤降100倍,极限效率训练新范式。
arXiv:2606.14179v1 Announce Type: new Abstract: We present CacheRL, a system for training small agent foundation models that achieves 92 percent proce…