别只奖励「做对」:PlanPO 把「会不会规划」写进智能体训练目标
近日,预印本平台上线论文 PlanPO(Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs)。核心主张用一句话就能讲完:多轮智能体训练不该只看结果,规划质量本身应当成为优化目标。
近日,预印本平台上线论文 PlanPO(Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs)。核心主张用一句话就能讲完:多轮智能体训练不该只看结果,规划质量本身应当成为优化目标。
多轮智能体(Multi-Turn Agentic LLM)的真实工作方式是连续决策:读数据、调工具、看反馈、再行动。这类任务里,模型最难的往往不是「知道什么」,而是能不能把一个长任务有规划地做完。
但结果奖励,在长任务里经常迟到。
智能体可能执行几十步才拿到一个最终结果;一旦结果错了,你很难说清是哪一步的规划出了问题。这是多轮强化学习里经典的信用分配(credit assignment)难题——训练信号太稀疏,模型不知道该优化哪一步。
注:以上对比基于方法名称与摘要的技术语义整理,具体目标函数与实验设置以原文为准。
PlanPO 是 Group Planning-Aware Policy Optimization 的缩写。三个词对应三个设计决策:
把「是否会规划」作为显式考核维度,写进奖励信号,而不是等它自己涌现。
在采样出的多条轨迹之间做相对比较,而非对单条轨迹做绝对打分。
用强化学习更新策略,让模型学会「先规划、后执行」的动作模式。
从技术血缘看,PlanPO 与 GRPO(Group Relative Policy Optimization)处于同一条脉络:都强调组级相对比较,而不是训练一个绝对的价值模型。差异点在于,PlanPO 把组内排名的依据,从「只看结果」扩展成「结果 + 规划」的二维评价。
注:组级相对优化的优势在于无需额外价值模型,训练更稳定——这是该类方法被广泛采用的原因,PlanPO 继承了这一点。
如果训练信号只有结果,多轮智能体会养成三种坏习惯。PlanPO 的设计,恰好一一对应。
过去两年,Agent 类模型的竞争焦点是「会不会用工具」;接下来的焦点,正在转向「能不能把一件复杂事拆好、排好、做完」。
规划,是从「能用」到「可靠」的那道坎。
问题在于,当大家普遍只用结果奖励做强化学习时,规划能力只能作为涌现属性被动出现——模型偶尔会规划,但策略无法稳定地奖励「规划得好」这种动作。PlanPO 这类尝试的意义,就是把规划从涌现变成可训练。
注:四个阶段为编辑梳理的能力演进框架,用于定位该方法在行业所处的位置,非论文原文表述。
当然,也需要保持耐心。从公开信息看,原文未披露可核验的基准数字与复现设置;规划维度如何自动打分(LLM 评审还是规则信号)、在多大任务规模上有效,都要等更多细节与第三方复现。它的价值,目前主要体现在思路层面。
结果奖励正在逼近天花板,决定多轮 Agent 能力上限的,将是训练信号的颗粒度。PlanPO 的价值不在算法本身,而在于把「规划」从涌现属性变成可显式优化的目标——但预印本阶段没有可核验的硬数据,它更像一张值得复现的设计图纸,而不是一份成绩单。
原文为预印本,检索论文完整标题即可阅读全文与技术细节。