AI Coding 之后,如何让 Agent 进入企业研发全链路?得物推荐的 Harness 实践
- 原文链接:https://mp.weixin.qq.com/s/mh8XQH5oDk5gq4EZq6oMlQ
- 获取时间:2026-08-26
- 证据边界:本文为演讲整理;文中的效果数据是得物推荐团队阶段性实践口径。
核心结论
企业级 Agent 的可靠性主要由研发环境决定:先把需求转成可执行边界,再让 Agent 在可运行、可观测、可验证的环境中完成交付,并把已验证经验固化为确定性路径。
分类提炼
- 场景:历史复杂系统中的 AI 辅助研发、推荐业务验收与线上问题排查。
- 类型:企业 Harness 实践;覆盖规格、执行、业务评测、知识供给和经验复用。
- 关键数字:补齐注释后的测试问答准确率约从 52% 提升至 90%+;AI 链路渗透率约 30%;问题排查时长约下降 80%。
知识节点
- 全链路 PDCA:Plan 明确目标和验收,Do 实现与验证,Check 校验业务效果,Act 将复盘送入下一轮迭代。
- TPRD-Contract:在自然语言 PRD 后补齐功能点、影响模块、技术约束、实验方式和验收标准,防止 AI 在错误方向上高效执行。
- 环境护栏:本地沙箱、代理或预发环境将代码、依赖、日志和验证连接起来,降低 Agent 与工程师的等待成本。
- UTD闭环:不仅生成单测,还依据原有与新增用例的执行数据检查改动影响,形成可度量的自我校验。
- AI评测员:以用户画像和预定义质量标准对上线前后结果分级,让业务质量评测从一次性人工劳动变为可追溯资产。
- 三层知识:L1 是全程生效的团队硬规则,L2 是模块设计与依赖,L3 是随代码维护的注释;按任务需要组合读取。
- Highway:已知问题的排查与处置被写成经过验证的代码,意图匹配后直接执行,获得稳定结果。
- ATV进化:未知长尾问题容许 Agent 探索;解决后经人工 Checklist 校验并代码化为 Story,反哺 Highway。
研发闭环
- Plan:TPRD/Contract 规定要改哪里、不能破什么约束、怎样证明成功;人工在技术方案阶段做关键 Review。
- Do:沙箱隔离、外部依赖 Mock 和 UTD 使 Agent 能修改、运行、读取日志并根据结果修正。
- Check:除稳定性外,用画像化 AI 评审员检验推荐的新颖性、质量与用户兴趣,专家对过程抽样复核。
- Act:线上 Bad Case 的排查路径不只留下说明,而是转成可执行 Story;已知问题走 Highway,未知问题走 ATV 后再沉淀。
关联图谱与落地边界
上游(基于 / 来自)
- [[02-ai-coding/从Prompt-Context到Harness-工程的三次进化与终局之战]]:将 Harness 定义为规则、工具、权限、验证和反馈组成的流程级可靠性。
- [[02-ai-coding/大淘宝技术-永霸-AI-Coding-环境与验证驱动]]:同样将研发瓶颈定位在 Agent 可用的环境与验证反馈,而非单次生成能力。
同级与下游(应用 / 互补)
- [[01-ai-agents/叶小钗-Agent评测-维度方法与落地实践]]:补足 Agent 评测的数据集、评分器、生产快照与持续回归视角。
- [[01-ai-agents/Harness工程AgentLoop]]:把本文的 PDCA、知识供给和确定性执行放到 Agent Loop 工程化框架中理解。
Seetong 最小迁移
- 对跨端高风险需求,先补 Contract:影响模块、不可突破约束、验收证据;没有这三项不进入长时 Agent 执行。
- 优先把构建、测试、日志和稳定 Mock 暴露给 Agent;验证环境也同时降低人工联调成本。
- 将反复出现的设备/服务问题沉淀成可执行诊断脚本;不要只存为需要模型再次解释的经验文档。
限制:Highway/ATV 的 80/20 划分与效果数据是团队实践经验,不应直接当作其他项目的容量或收益承诺。
标签: #主题/AI-Coding #主题/Harness工程 #主题/研发效能 #主题/Agent评测 #主题/知识工程 #场景/企业研发 #场景/公众号长文 #节点/全链路PDCA #节点/TPRD-Contract #节点/环境护栏 #节点/UTD闭环 #节点/AI评测员 #节点/三层知识 #节点/Highway #节点/ATV进化