主题颜色
智能体成本控制
智能体成本控制,是把 token 经济学放进智能体系统设计里,而不是等账单失控后再补救。核心判断是:不是所有步骤都值得交给昂贵模型,越稳定、越可重复、越结构化的部分,越应该交给普通代码、API、缓存和流水线完成。
核心问题
智能体系统最容易积累三类成本债务:
- 把采集、解析、去重、格式转换这类确定性任务交给模型。
- 对同一批稳定资料反复让模型重读、重判、重写。
- 没有记录每次调用的输入、输出、模型档位和预算消耗,导致后期无法定位成本来源。
成本控制不是简单少用模型,而是提高每一次模型调用的杠杆率:让模型只处理需要语义判断、规划、审计、综合和取舍的部分。
三层执行模型
一个可持续的智能体系统通常可以拆成三层:
- 零成本层:脚本、HTTP API、RSS、数据库查询、哈希去重、文件写入、结构化校验。
- 低成本模型层:初筛、粗摘要、标签建议、简单分类、低风险批处理。
- 高能力模型层:复杂推理、方案取舍、交叉审计、重要发布前检查、需要上下文综合的判断。
这和确定性数据流水线的分工一致:流水线负责稳定搬运和规整,模型负责不可机械化的判断。
预算与度量
成本控制需要变成运行时契约,而不是事后估算。至少应记录:
- 每次调用的模型、输入 token、输出 token、估算费用。
- 当前任务、当天任务、单个工作流的预算上限。
- 触发降级、停止、缓存复用或人工确认的条件。
- 每次运行后的总成本报告。
当预算检查进入 hooks、CI 或调度流水线后,系统就能在执行中自动做出控制:继续、降级、跳过、等待人工确认。
常见节省手段
- 对稳定输入做哈希,结果可复用时直接读缓存。
- 用增量处理代替全量重读,只分析新增或变化片段。
- 先用廉价模型或规则做过滤,再把少量高价值样本交给强模型。
- 用短提示词和结构化输出减少冗余 token。
- 把多个小请求合并成批处理,但保留足够清晰的边界,避免一次失败影响全部结果。
与智能体工程的关系
成本控制连接了智能体循环工程、智能体反馈循环和智能体 Harness 工程。一个成熟的 Harness 不只要能调用工具,还要知道什么时候该调用、该用什么模型、该花多少钱、失败后该如何停下来。