1
GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control
大模型异步强化学习训练不稳?GAC用梯度对齐控制实现稳定收敛,值得搞LLM训练的细读
arXiv:2603.01501v2 Announce Type: replace-cross Abstract: Asynchronous execution is essential for scaling reinforcement learning (RL) to modern large …