1
Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning
提出非策略回放机制,有效提升大模型强化遗忘的学习效率与数据利用率
arXiv:2606.15333v1 Announce Type: cross Abstract: LLM unlearning has emerged as a cost-effective alternative to full retraining for removing hazardous…