RL Post-Training Builds Compositional Reasoning Strategies
强化学习后训练如何催生组合推理策略,来自ICML workshop的前沿实证。
arXiv:2607.07646v1 Announce Type: new Abstract: Does RL post-training merely amplify primitive skills already latent in a base model, or can it compos…