1
Start Classifying: Categorical Critics for LLM Reinforcement Learning
用分类器替代传统标量奖励,为LLM强化学习开辟全新范式,COLM 2026亮点论文不可错过。
arXiv:2608.02181v1 Announce Type: new Abstract: Proximal Policy Optimization (PPO) for large language models typically trains its critic by mean-squar…