Agent 评测落地实践 - Digest

一句话结论

评测不是上线前的一次打分,而是从 PRD 定义门禁、将任务和评分器版本化、复用生产 Run 记录,再由问题中心和持续回归把失败接回优化的闭环。

七个分析角度

1. 评测前置到 PRD

2. 不只验最终答案

3. 评分器按风险分层

4. 数据集是版本化产品

5. Run 必须可复现

6. 报告应指导决策

7. 失败要进入问题中心

可执行最小闭环

  1. 选一个高频任务,写出结果、过程、成本和安全四类门禁。
  2. 建立开发集、回归集和保留集;每条样本绑定断言或 Rubric。
  3. 记录完整 Run 快照,先禁用或 Mock 真实副作用。
  4. 用固定基线比较通过率、方差、Token、成本和延迟。
  5. 把失败送进问题中心,修复后重新评测,并将确认的线上问题纳入回归。

证据边界

这是公众号作者的实践性框架,未给出可独立复现的平台代码、数据规模或基准结果。文中的平台组成和流程可作为设计清单,不应被视为已验证的通用效果承诺。