1
Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning
从token级分布偏差入手,超越传统熵方法,为LLM推理能力提升提供新视角。
arXiv:2606.19771v1 Announce Type: new Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) has significantly advanced Large Language Model …