主题颜色
确定性数据流水线
确定性数据流水线,是把可重复、可验证、结构明确的数据处理交给普通程序,而不是交给 LLM。它的目标是降低成本、减少随机性,并让模型只处理真正需要语义判断的环节。
核心分工
一个典型流水线可以拆成四段:
- 采集:通过 API、RSS、网页、文件系统或数据库获取数据。
- 规整:解析字段、统一格式、去重、补齐元数据、生成稳定 ID。
- 判断:在必要时调用模型做摘要、分类、聚合、风险识别或复杂推理。
- 存储与发布:写入文件、数据库、索引、报告或网站。
前三步中,只有“判断”天然适合模型。采集、规整和发布越稳定,越应该代码化。
常见控制参数
流水线需要显式暴露这些控制点:
- 数据源、时间窗口、数量上限和过滤条件。
- dry-run 模式,用于确认将要处理什么。
- 是否启用模型分析,以及使用哪个模型档位。
- 输出目录、去重键、缓存位置和失败重试策略。
- 每次运行的摘要报告和可审计日志。
这些控制点让流水线既可以人工运行,也可以被 CI、定时任务或智能体调用。
与 MCP 的边界
模型上下文协议适合为智能体暴露工具、资源和上下文,让模型在运行时按需查询。确定性数据流水线适合处理已知流程:固定来源、固定结构、固定输出。
二者可以组合:流水线负责采集和规整,MCP 把规整后的知识库暴露给智能体,LLM 只在需要判断和综合时介入。
与成本控制的关系
确定性流水线是智能体成本控制的基础。它用代码完成零 token 的稳定工作,用缓存避免重复分析,用增量处理减少上下文体积,最后把少量高价值输入交给模型。