1
LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents
用LLM智能体自动挖掘强化学习后训练的最优策略,无需人工调参。
arXiv:2606.18388v1 Announce Type: new Abstract: RL post-training strategies are dataset-dependent and reveal a recurring empirical pattern: capacity p…