AI想要落地其实很难!马克·库班:Agent会逐渐失效,也会慢慢偏离原来的运行状态
- 原文链接:https://mp.weixin.qq.com/s/P1tt77545YjGMzeL84Eh4A
- 编辑:姜篇;发布时间:2026-07-29 12:00
- 一手访谈参考:https://www.youtube.com/watch?v=1P1hJ36rxM0&t=226s
- 获取时间:2026-07-30
核心结论(一句话)
Agent 从 Demo 走向生产,真正要交付的不是一次生成结果,而是一条能抵御模型漂移、留下运行证据、接受人工接管并可回滚的长期工作流。
分类提炼
- 场景:企业 Agent 上线、运行维护、模型与工具升级治理
- 标签:#主题/AI-Agent #主题/Harness #主题/Agent运维 #主题/回归测试 #主题/AI工程化
- 类型:访谈整理 / 生产可靠性提醒 / 工程职责重组
- 分类理由:文章关注的不是单次提示词效果,而是 Agent 接入企业数据后如何持续运行、验证和恢复,属于 Agent 运行时与 Harness 工程。
知识节点(8 个独立概念)
- 上线鸿沟:可演示的结果没有覆盖认证、权限、审计、故障恢复与责任归属。
- Agent漂移:模型、Prompt、工具描述或接口返回变化,会改变相同任务的实际执行路径。
- 部署工程:企业 Agent 需要先接通数据源、身份映射、业务规则和人工审批,模型只是其中一层。
- 任务回归:模型或工具变更后,应以固定成功和失败任务重跑,而不是凭一次回答好坏判断。
- 模型隔离:模型提供商与前端工具可替换,身份、权限、业务 API、审计和预算应保持稳定。
- 运行证据:步骤日志、输入输出、模型版本、工具版本和失败原因共同构成可诊断记录。
- 人工接管:长任务需要预算、超时、停止条件和审批点,不能把异常处理留给提示词猜测。
- 维护责任:Agent 进入生产后,后端、测试、平台工程和 SRE 的职责会围绕同一自动化链路重新组合。
从首次跑通到长期可用
公众号用“12 分钟生成创业项目第一版材料”说明原型生成已大幅加速;但企业知识库或业务 Agent 要上线,还需回答数据可见范围、离职权限回收、引用版本、敏感日志、超时重试与错误兜底等问题。原型解决了“能不能做”,生产系统还要回答“谁能用、发生了什么、失败后怎么办”。
文章将运行失败归因为一串会变化的条件:模型版本、系统提示词、工具描述、上下文窗口、第三方接口和返回格式。对此,应把模型升级视为受控变更:维护固定任务集,覆盖已知 Bug、查询、依赖升级和异常输入;每次变更后记录结果、耗时、Token 与人工接管次数。验收目标必须是可检查的结果,“回答看起来不错”不能替代验证器。
| 生产风险 |
最小工程控制 |
| 模型或工具漂移 |
固定任务回归集与版本记录 |
| 权限和数据边界不明 |
模型外的身份、授权与审批 |
| 失败不可复现 |
步骤日志、输入输出、失败原因 |
| 供应商或工具迁移 |
稳定网关、业务 API 与审计格式 |
| 长任务失控 |
预算、超时、停止条件、人工接管与回滚 |
对本库主线的补充
[[phodal-Better-Harness-任务级证据评估]]回答“如何证明一次任务可信完成”;本文补充“为什么生产任务会在后续变化中失效,以及需要保存哪些运行控制”。[[腾讯-AI-Agent-Skill-测评方案落地]]提供评测实践;本文把评测触发点明确为模型、Prompt、工具与接口的变更。[[若飞-Agent如何理解业务-把对象-状态和权限接进执行流程]]则补足了部署工程中的对象、状态和权限事实源。
关联图谱与证据边界
上游(基于 / 来自)
- [[WorkBuddy-Harness工程复盘-从模型到可用Agent]]:把模型外的 Context、Memory、权限、反馈与 Loop 解释为可用 Agent 的基础。
- [[phodal-Better-Harness-任务级证据评估]]:为“运行证据”和“任务回归”提供真实任务、证据边界与 Finding 的判断方式。
- [[lencx-Agent开发指南-技术太多-该怎么学]]:其可信完成、动作回执和 Harness 边界,给本文的长期维护职责提供跨层坐标。
下游(应用于 / 验证于)
- [[腾讯-AI-Agent-Skill-测评方案落地]]:可将本文的固定任务集落实为确定性评分、Rubric 与人工复核组合的评测基线。
- [[若飞-Agent如何理解业务-把对象-状态和权限接进执行流程]]:可把“部署工程”中的数据映射和审批,落实到对象、状态、规则与权限契约。
同级(横向 / 并列)
- [[Loop-Engineering-验证才是瓶颈]]:两者都反对把生成能力误当交付能力;该文强调验证器上限,本文强调版本漂移与运维控制。
证据边界
- 本文是 51CTO 对 Mark Cuban 与 Jason Calacanis 访谈的中文整理;引语、数字和上下文应回到视频核对。
- “12 分钟”“两三个人完成过去每年 200 万至 300 万美元的软件”等为访谈口述,不能外推为通用工程投入或收益基准。
- “Agent 会漂移”是对模型和依赖变化下工作流失效的工程概括,本文没有提供跨模型、跨版本的量化实验。
相关链接