MoE Proxy Models for Low-Cost Failure Reproduction and Diagnosis in LLM RL Post-Training
用MoE代理模型低成本复现LLM强化学习后训练故障,大幅降低排查成本,直击调试痛点。
arXiv:2608.10823v1 Announce Type: new Abstract: Reinforcement learning (RL) post-training of large language models (LLMs) is computationally intensive…