Better Harness:用任务证据评估并持续改进 AI Coding 工作流

核心结论(一句话)

Better Harness 把 Harness Engineering 从“仓库配置体检”推进到“任务级证据评估”:只有将真实任务的证据、最小修复和后续可比较结果连成闭环,才能证明 Coding Agent 工作流在改善。

分类提炼

知识节点(8 个独立概念)

运行模型

Better Harness 公开的对象不是单条 Prompt,而是相互连接的三层:

层级 作用 对应问题
工程实践 分领域的判断依据 什么值得检查,什么不能只凭配置推出
Agent Work Loop 任务中心的评估模型 证据、评分、结论与 Finding 如何约束
可运行实现 采集、分析、报告与修复入口 如何在项目中持续执行和复验

其中最重要的约束是“资产存在”与“任务使用”不可混为一谈。AGENTS.md、Rules、Skills、MCP、Hooks、Memory、测试和 CI 能证明一个机制存在;但只有可关联到本任务的证据,才能支持“Agent 使用了它”或“它改善了交付”的结论。

工具先冻结任务范围,再并行采集三类信息:Session Evidence 还原实际行为;Project Harness 检查项目是否可启动、诊断、验证和恢复;Agent Customize 检查规则、Skill、MCP、Memory、Hook 的配置、路由与使用线索。它们在采集阶段不互相代偿,最终才结合 references 和 Agent Work Loop 给出综合判断。

五维评估与修复闭环

Agent Work Loop 维度 要回答的问题 典型证据
任务理解 Agent 是否知道目标和完成标准 规格、AGENTS.md、验收条件
可控执行 是否沿可支持、可复现的路径行动 Skill、命令、MCP、沙箱边界
改动验证 是否有证据证明改动真的有效 测试、lint、Hook、诊断信号
可靠交付 是否绕过质量门禁或验收 人工评审、审批、CI/CD、恢复路径
经验沉淀 下一次任务能否受益 Loop Discovery、可复用 Skill、Memory

报告的交付单位不是一个总分,而是一条 Finding。它应当写清:

  1. 哪些可见证据支撑这个判断,以及哪些证据尚不可见。
  2. 对用户或交付造成什么具体影响。
  3. 最小、可评审的修复范围是什么。
  4. 修复后应以什么验证方式确认。

修复顺序也应保持保守:先挑一条证据清楚、影响具体、验收便宜的问题;修完重跑检查;再观察后续相似任务。评分只能帮助定位,不能替代改进因果的证明。

评估模型的价值与边界

公众号称,首轮内部评测选取 30 个 GitHub 真实项目,使用四类模型生成 120 份标准化报告,经跨模型对比和人工校准后复跑;并在 200 多份 Spec 的积累中,把关注点从静态资产转向任务实际行为。这个过程的价值是把“什么算好 Harness”变成可讨论、可修订的准则,而不是模型的主观偏好。

但这不是通用成熟度认证:

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

相关链接