1
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
突破多轮智能体规划瓶颈,PlanPO用分组规划感知优化策略,让大模型协作决策更高效。
arXiv:2608.17289v1 Announce Type: new Abstract: Group-relative policy optimization has emerged as a key paradigm for training agentic large language m…