1
ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy
用细粒度替代熵突破轨迹奖励瓶颈,为可验证推理任务打造更精准的信用分配新方案。
arXiv:2607.03126v1 Announce Type: cross Abstract: Reinforcement Learning (RL) has substantially improved the reasoning ability of large language model…