1
Data-dependent Exploration for Online Reinforcement Learning from Human Feedback
提出数据依赖探索新策略,提升在线RLHF样本效率,值得算法研究者细读。
arXiv:2605.04477v2 Announce Type: replace Abstract: Online reinforcement learning from human feedback (RLHF) has emerged as a promising paradigm for a…