主题颜色
智能体 Plan 评估
Plan 评估衡量生成的执行计划是否真的可用。Plan 通常是动态 JSON 结构,不能像固定标签那样靠字符串比对,需要同时观察离线结构质量和线上执行结果。
离线评审
可以让独立模型按照 G4C 结构审查抽样 Plan:
- 是否违反硬约束。
- Goal 中的形容词是否都有明确成功标准。
- 路径选择理由是否有证据。
- 关键步骤是否具备足够检查点。
- 常见失败是否都有对应纠偏动作。
完整评审每个 Plan 成本较高,生产系统可以按风险和流量抽样。评审器不必与 Plan 生成模型相同。
线上指标
| 指标 | 说明 |
|---|---|
| Plan 完成率 | 任务是否按照 Plan 走完 |
| 步骤成功率 | 哪些步骤经常执行失败 |
| Replan 触发率 | 初始 Plan 是否经常需要重写 |
| 用户纠正率 | 用户是否频繁表示“不是这个意思” |
| 最终任务成功率 | 用户真实目标是否达成 |
Plan 完成不等于任务成功,任务成功也不一定等于用户目标达成。“完成率高但最终成功率低”通常说明 Plan 结构完整,却解决了错误的问题。
反馈闭环
离线缺陷应回写到生成提示和评审清单;线上高 Replan、高用户纠正则可能暴露上下文采集、意图识别或系统设计问题。评估与纠偏策略和高级生成模式共同形成“测量—诊断—改进—重新测量”的闭环。