1
State2State: Environment-Derived Mid-Training for LLM Agents
提出环境派生中期训练新范式,为LLM智能体在复杂环境中强化状态表征提供新思路。
arXiv:2608.04934v1 Announce Type: cross Abstract: Training LLM agents commonly relies on supervised fine-tuning from expert trajectories or online rei…