Skip to content

智能体 Plan 评估

Plan 评估衡量生成的执行计划是否真的可用。Plan 通常是动态 JSON 结构,不能像固定标签那样靠字符串比对,需要同时观察离线结构质量和线上执行结果。

离线评审

可以让独立模型按照 G4C 结构审查抽样 Plan:

  • 是否违反硬约束。
  • Goal 中的形容词是否都有明确成功标准。
  • 路径选择理由是否有证据。
  • 关键步骤是否具备足够检查点。
  • 常见失败是否都有对应纠偏动作。

完整评审每个 Plan 成本较高,生产系统可以按风险和流量抽样。评审器不必与 Plan 生成模型相同。

线上指标

指标说明
Plan 完成率任务是否按照 Plan 走完
步骤成功率哪些步骤经常执行失败
Replan 触发率初始 Plan 是否经常需要重写
用户纠正率用户是否频繁表示“不是这个意思”
最终任务成功率用户真实目标是否达成

Plan 完成不等于任务成功,任务成功也不一定等于用户目标达成。“完成率高但最终成功率低”通常说明 Plan 结构完整,却解决了错误的问题。

反馈闭环

离线缺陷应回写到生成提示和评审清单;线上高 Replan、高用户纠正则可能暴露上下文采集、意图识别或系统设计问题。评估与纠偏策略高级生成模式共同形成“测量—诊断—改进—重新测量”的闭环。

持续记录 AI、产品、工程与个人实践之间的连接。