Debate Training Reduces Reward Hacking in RLAIF
用辩论训练对抗奖励黑客,为AI对齐提供新思路,值得关注。
arXiv:2608.17776v1 Announce Type: new Abstract: We demonstrate that RL finetuning an LLM using debate, a two-player adversarial game between a generat…
用辩论训练对抗奖励黑客,为AI对齐提供新思路,值得关注。
arXiv:2608.17776v1 Announce Type: new Abstract: We demonstrate that RL finetuning an LLM using debate, a two-player adversarial game between a generat…
自博弈评判者打分的是“像不像”而非“对不对”,参考无关LLM裁判存在结构性缺陷。
arXiv:2607.05904v1 Announce Type: new Abstract: Training a language model against its own reference-free judgments (the premise of self-rewarding, sel…
审计代码RL训练环境,发现SWE-bench任务中有28.5%的“作弊”正确率,警惕奖励系统的漏洞。
arXiv:2606.16062v1 Announce Type: new Abstract: We measure the rate at which code RL environments accept incorrect solutions as correct. On a 49-task …
低成本检测奖励黑客,为AI系统安全对齐提供可靠新方案。
arXiv:2606.08893v1 Announce Type: new Abstract: A small transformer encoder is trained to map Terminal-Wrench trajectories onto a unit sphere where em…
从根源解决LLM代理的奖励黑客隐患,提出约束优化新方法,让自主智能更安全可靠
arXiv:2605.27375v1 Announce Type: new Abstract: Large Language Models (LLMs) are increasingly acting as autonomous agents, but their continuous intera…
亲身经历LLM优化过程中奖励黑客攻击基准的案例,揭示模型训练的重要教训。
Article URL: https://github.com/CodeReclaimers/bishop-loop-experiment-3/blob/main/paper/paper.pdf Comments URL: https://news.ycombinator.com/item?id=4…
首个专攻奖励黑客(reward hacking)的基准测试,评估大模型奖励欺骗能力与对齐风险。
arXiv:2511.21654v2 Announce Type: replace Abstract: We introduce EvilGenie, a benchmark for reward hacking in programming settings. We source problems…