Le Critique: Privileged Value Functions for LLM Reinforcement Learning
给大模型强化学习装上“特权价值函数”,让模型更懂自己表现,训练效率有望大幅提升。
arXiv:2608.16739v1 Announce Type: new Abstract: Reinforcement learning algorithms for Large Language Models (LLMs) are largely distinguished by their …