1
Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment
提出将离策略Token转为在策略的插件方法,无需重训即可提升大模型对齐效率与效果。
arXiv:2607.04728v1 Announce Type: cross Abstract: Reinforcement learning (RL) post-training for large language models (LLMs) follows a efficient parad…