Procedural Fairness Failures in RLHF from Preference Averaging
从偏好平均视角揭示RLHF中程序公平性缺陷,为对齐公平研究提供新警示。
arXiv:2608.10126v1 Announce Type: new Abstract: Reinforcement Learning from Human Feedback (RLHF) aggregates heterogeneous preferences into a single r…