AI想要落地其实很难!马克·库班:Agent会逐渐失效,也会慢慢偏离原来的运行状态

核心结论(一句话)

Agent 从 Demo 走向生产,真正要交付的不是一次生成结果,而是一条能抵御模型漂移、留下运行证据、接受人工接管并可回滚的长期工作流。

分类提炼

知识节点(8 个独立概念)

从首次跑通到长期可用

公众号用“12 分钟生成创业项目第一版材料”说明原型生成已大幅加速;但企业知识库或业务 Agent 要上线,还需回答数据可见范围、离职权限回收、引用版本、敏感日志、超时重试与错误兜底等问题。原型解决了“能不能做”,生产系统还要回答“谁能用、发生了什么、失败后怎么办”。

文章将运行失败归因为一串会变化的条件:模型版本、系统提示词、工具描述、上下文窗口、第三方接口和返回格式。对此,应把模型升级视为受控变更:维护固定任务集,覆盖已知 Bug、查询、依赖升级和异常输入;每次变更后记录结果、耗时、Token 与人工接管次数。验收目标必须是可检查的结果,“回答看起来不错”不能替代验证器。

生产风险 最小工程控制
模型或工具漂移 固定任务回归集与版本记录
权限和数据边界不明 模型外的身份、授权与审批
失败不可复现 步骤日志、输入输出、失败原因
供应商或工具迁移 稳定网关、业务 API 与审计格式
长任务失控 预算、超时、停止条件、人工接管与回滚

对本库主线的补充

[[phodal-Better-Harness-任务级证据评估]]回答“如何证明一次任务可信完成”;本文补充“为什么生产任务会在后续变化中失效,以及需要保存哪些运行控制”。[[腾讯-AI-Agent-Skill-测评方案落地]]提供评测实践;本文把评测触发点明确为模型、Prompt、工具与接口的变更。[[若飞-Agent如何理解业务-把对象-状态和权限接进执行流程]]则补足了部署工程中的对象、状态和权限事实源。

关联图谱与证据边界

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

证据边界

相关链接