1
More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges
自博弈评判者打分的是“像不像”而非“对不对”,参考无关LLM裁判存在结构性缺陷。
arXiv:2607.05904v1 Announce Type: new Abstract: Training a language model against its own reference-free judgments (the premise of self-rewarding, sel…