# 得物技术：Delivery Harness 与可控 AI 交付 - 拆解

- 原文：https://mp.weixin.qq.com/s/Jcx_3OABcYwzzxWKFgivOA
- 来源：微信公众号「得物技术」；作者正飞
- 获取时间：2026-09-03

## 核心观点

1. Agent 同时进入 H5、后台、网关和服务后，最大风险不是代码写得慢，而是一次业务语义猜测会高速扩散为跨运行时的共同错误；Harness 应让错误在最早、最便宜的位置暴露。
2. Delivery Harness 用 Version Contract、Execution Boundary、Evidence Gate 和 Repair Loop 分别锁定事实、限制改动范围、控制状态跃迁、把真实反馈升级为下一次默认行为。
3. 可客观回答的路径、分支、仓库范围、发布记录和权限，应交给脚本/门禁；产品口径、架构取舍和真实体验仍需人类在受约束的上下文中作判断。
4. 代码完成、研发验证、产品验收、真实环境验收、生产发布和稳定分支合入是不同状态；每个状态只能由匹配的证据推进。
5. 多 SKU 订单案例说明，跨运行时交付要把业务不变量从口头口径写进接口合同、服务校验、反例测试、验收报告和版本证据，避免“局部正确、整体错误”。

## 七个分析角度与开头钩子

### 1. 语义分叉比生成错误更危险

- “一个数字选错，为什么能让接口、页面、海报和测试一起自洽地错下去？”
- “AI 的危险不只是会猜错，而是会把一次猜测扩散成整条交付链的事实。”
- “越早把业务分叉写清楚，越少需要在发布后花钱纠正。”

### 2. Version Contract 锁定事实

- “任务一开始该读哪份事实，不能由每个 Agent 临场决定。”
- “临时推断为什么不能直接写进下一次任务的默认上下文？”
- “产品口径、技术影响、版本、验收和缺陷要留在最接近它们的事实源。”

### 3. Execution Boundary 限制工程半径

- “一个人能调更多 Agent，不等于一条需求可以无限扩大改动范围。”
- “Worktree 不只是 Git 技巧，它把需求边界变成物理隔离。”
- “一需求一仓库一工作树，跨仓协作才不会共享未提交状态和猜测。”

### 4. Evidence Gate 管理状态跃迁

- “代码写完为什么还不能叫交付完成？”
- “编译、单测、真机验收和生产发布，为什么不能用同一句‘通过’概括？”
- “证据不够就停在原地，才是比事后补报告更便宜的质量控制。”

### 5. 跨运行时不变量

- “前端显示正确、接口返回成功，为什么订单仍可能在下游被拆坏？”
- “跨系统协作的核心不是接口都通，而是同一个业务不变量没有被拆散。”
- “将订单级原子性写进合同、校验和反例，才能阻止局部正确伪装成整体正确。”

### 6. Repair Loop 让反馈改变默认行为

- “缺陷修完不算系统学会，下一次同类错误更早失败才算。”
- “没有失败基线和回归证据的修复，为什么不能轻易宣布解决？”
- “能变成测试的进入测试，能变成权限边界的进入门禁。”

### 7. 人与 Agent 的最终分工

- “Agent 可以并行执行四个运行时，但谁来决定业务口径和产品体验？”
- “独立评估 Agent 可以看证据，但不能替代责任人签字。”
- “模型放大速度，系统保存判断、证据和追责路径。”

## 最小落地检查清单

- 为每个任务建立事实源、版本、仓库、分支、范围、验收项和待确认项组成的 Version Contract。
- 在第一次写入前创建并记录专属工作区；跨仓改动逐仓声明并用同一合同关联。
- 按代码、测试、环境、真机、发布、稳定分支分别记录状态，禁止将任何前置状态等同于最终交付。
- 对跨运行时业务写出不可拆分的不变量，并在接口、服务校验、反例测试和验收报告中重复验证。
- 为可复发问题保留原始反馈、失败基线、候选修复和回归结果；只有改变后续默认行为才关闭 Repair Case。

## 相关链接

- [[02-ai-coding/大淘宝技术-AI驱动研发体系-Price360-KB项目Harness]]
- [[02-ai-coding/AICoding之后-如何让Agent进入企业研发全链路-得物推荐的Harness实践]]
- [[02-ai-coding/大淘宝技术-永霸-AI-Coding-环境与验证驱动]]
- [[01-ai-agents/Loop-Engineering-验证才是瓶颈]]

## 证据边界

文章是得物小摊从 0 到 1 业务的实践复盘。Version Contract、Execution Boundary、Evidence Gate、Repair Loop、多 SKU 订单及其能力效果均为作者团队经验，未提供完整实现、样本规模、对照数据或独立审计；不能将其直接视为通用研发效能、安全性或发布授权证明。

标签： #主题/AI-Coding #主题/Harness工程 #主题/验证驱动 #主题/跨运行时 #主题/持续改进 #场景/企业研发
