HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks
打破LLM后训练算力瓶颈,异构感知奖励引导优化让HPC任务上的强化学习更高效精准。
arXiv:2607.28301v1 Announce Type: new Abstract: Supervised fine-tuning (SFT) can equip large language models (LLMs) with domain knowledge for high-per…