《Agent 评测白皮书》系列01:Agent 评测全览

核心结论(一句话)

Agent 评测是一套以观测为地基、以 Case 挖掘与归因为枢纽、由离线门禁和在线反馈共同驱动的持续校准系统;它的长期资产是可回归的评测标准与样本,而不是某一次分数。

分类提炼

知识节点

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点

  1. 先统一全景,再按阶段落地。 完备体系是四模块、三种能力、两条 Loop、一套评测资产,但不应在冷启动阶段一次性建完。
  2. 固定变量才能让回测可信。 评测集、标准和执行环境应尽可能固定;大模型随机性用多 Trial 的 Pass Rate 表达,安全与准确性可设一票否决。
  3. 离线与在线各司其职。 离线回测负责已知问题的版本门禁,影子模式、AB 和巡检负责真实流量、业务价值与未知问题,监控则观察运行健康。
  4. 端到端与过程必须配套。 端到端集判断最终交付,过程集定位链路故障;过早细分会制造负担,应由真实问题驱动拆解。
  5. 归因决定双环流向。 同一个 Bad Case 可能推动 Agent 修复、评测集扩充或 Rubric 校准,不能默认“评测判错就等于 Agent 错”。
  6. Trace 是最小闭环的底线。 没有完整执行轨迹,就难以稳定复现和解释问题,也无法把线上信号转化为可回归资产。

相关链接