1
Q-Flow: Stable and Expressive Reinforcement Learning with Flow-Based Policy
Q-Flow用流模型做策略,兼顾稳定性与表达力,为强化学习带来新思路。
arXiv:2605.13435v2 Announce Type: replace-cross Abstract: There is growing interest in utilizing flow-based models as decision-making policies in rein…