1
LEPO: Latent Reasoning Policy Optimization for Large Language Models
提出LEPO方法,通过潜在推理策略优化显著提升大语言模型推理能力,为强化学习对齐开辟新路径。
arXiv:2604.17892v4 Announce Type: replace-cross Abstract: Recently, latent reasoning has been introduced into large language models (LLMs) to leverage…