1
Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data
利用大量非精选、无奖励的离线数据引导世界模型,显著提升在线强化学习的样本效率
arXiv:2502.19544v3 Announce Type: replace Abstract: Leveraging offline data is a promising way to improve the sample efficiency of online reinforcemen…