# 原文摘要 - 马克·库班谈 Agent 漂移与长期维护

- 原文：https://mp.weixin.qq.com/s/P1tt77545YjGMzeL84Eh4A
- 来源：微信公众号「51CTO技术栈」；编辑：姜篇；2026-07-29
- 一手访谈：https://www.youtube.com/watch?v=1P1hJ36rxM0&t=226s

## 一句话总结

Agent 的生产难题不在首次生成，而在模型、工具、权限和业务数据持续变化后，仍能以可观测、可回归、可接管、可回滚的方式完成任务。

## 核心观点

1. **上线鸿沟**：12 分钟 Demo 不等于企业可用；认证、权限、审计、错误恢复和责任归属才是上线成本。
2. **Agent漂移**：模型、系统提示词、工具描述、上下文和第三方接口任一变化，都可能让原链路失效。
3. **部署工程**：企业现场的难点是把分散数据源、身份映射、业务规则和人工审批接成可调用的接口。
4. **任务回归**：模型或工具变更后，应重跑固定任务集并记录成功率、耗时、Token 和人工接管次数。
5. **模型隔离**：身份、权限、业务 API、日志和预算应保持稳定；模型供应商与前端工具应处于可替换层。

## 七个分析角度与开头钩子

1. **Demo 与上线**：12 分钟做出 Demo，谁为半年后的失效负责？／原型跑通后，工程工作才刚开始。／“能演示”为什么不等于“敢交付”？
2. **Agent漂移**：模型升级没改接口，工作流为何断了？／稳定 JSON 为什么会突然多出解释？／漂移不是偶发 Bug，而是运行常态。
3. **企业集成**：AI 真懂业务，为什么还需要驻场工程师？／三套系统里的同一客户，Agent 该信谁？／数据和权限没接好，模型再强也无从行动。
4. **回归测试**：模型更新为什么也要跑回归？／“回答不错”为什么不是验收？／一组固定任务怎样暴露模型升级回归？
5. **工具迁移**：换一个 Agent 工具，为什么历史和审计也断了？／如何让 Claude、GPT、Gemini 可替换？／别让业务流程绑死在单一模型上。
6. **运行证据**：Agent 失败后为什么只能重跑再猜？／没有中间状态，怎么定位第几步出错？／日志、版本与输入输出才是维修手册。
7. **开发者角色**：AI 写得更快，开发者为何更忙？／会维修 Agent 会成为新岗位吗？／后端、测试、平台和 SRE 如何汇到一条 Agent 链路？

## 可执行最小闭环

1. 为每条关键 Agent 工作流保留固定成功、失败和异常输入任务。
2. 每次改模型、Prompt 或工具 Schema 后，自动记录结果、成本和人工接管。
3. 把身份、权限、预算、日志和业务 API 放到模型之外，并预设人工审批与回滚。

## 证据边界

- “12 分钟”“两三个人替代每年 200 万至 300 万美元外包”等为访谈嘉宾或主持人口述，未在本文独立核验。
- 本条目保存的是 51CTO 对视频访谈的中文整理；涉及原话与上下文时，应以视频为准。

标签：#主题/AI-Agent #主题/Harness #主题/Agent运维 #主题/回归测试 #主题/AI工程化 #节点/Agent漂移 #节点/模型隔离 #节点/运行证据 #场景/公众号长文
