《Agent 评测白皮书》系列01:Agent 评测全览
- 原文链接:https://mp.weixin.qq.com/s/hBSIPQnsBeWwX9UZLjWYFA
- 来源:微信公众号「美团技术团队」
- 发布时间:2026年9月10日 10:24
核心结论(一句话)
Agent 评测是一套以观测为地基、以 Case 挖掘与归因为枢纽、由离线门禁和在线反馈共同驱动的持续校准系统;它的长期资产是可回归的评测标准与样本,而不是某一次分数。
分类提炼
- 场景:AI Agent 生产化、冷启动、灰度扩量与自进化
- 标签: #主题/AI-Agent #主题/Agent评测 #主题/评测工程 #主题/质量保障 #场景/公众号长文
- 类型:行业团队实践 / 评测体系总览
知识节点
- 评测精密量具:评测既要稳定判断 Agent 好不好,也要指出哪里好、哪里不好,并随业务变化定期校准。
- 四模块评测体系:离线评测守住已知,在线评测与监控观察真实世界,Case 挖掘与归因定位分派,观测基建提供全链路证据。
- Agent 迭代 Loop:线上 Case 经归因定位到 Prompt、Skill、上下文或模型问题后,进入修复、回测、发布和 AB 验证。
- 评测体系迭代 Loop:线上 Case 若暴露评测集漏覆盖或 Rubric 判错,就扩充样本或校准标准,让量具贴近真实用户。
- 端到端评测集:从用户视角判断任务最终是否交付,回答“事情办成了吗”,是业务质量的直接门槛。
- 过程评测集:按 Skill、知识库、工具调用等中间环节拆解执行质量,回答“哪一步出了问题”,用于责任定位。
- Case 挖掘与归因:从反馈、采样、规则和监控汇总 Good/Bad Case,再沿 Trace 找到根因并决定进入哪条演进路径。
- 最小可归因观测:冷启动至少记录完整模型输入输出、Skill/Tool 调用和关键环境信息,使 Bad Case 能复现、能解释。
- 评测成熟度分阶段:冷启动先跑通观测、核心评测集和回测门禁,扩量补在线反馈,全量运营再建设自动化与规模化。
关联图谱
上游(基于 / 来自)
- [[01-ai-agents/Agent评测漫谈-由浅入深讲解Agent评测]]:继承“评测是精密量具”、人人一致/人机一致与评测校准的基本方法论。
下游(应用于 / 验证于)
- [[01-ai-agents/叶小钗-Agent评测-维度方法与落地实践]]:将全景框架落成 PRD 前置、版本化数据集、评分器和问题中心。
- [[01-ai-agents/腾讯-AI-Agent-Skill-测评方案落地]]:在 Skill 与工具型 Agent 中实践评分器、用例基线、Trace 和稳定性评估。
- [[02-ai-coding/用Agent评测思路管理AI-Coding-31万行代码重构实践]]:把离线回测、在线验证和 Verification First 迁移到 AI Coding 工程。
同级(横向 / 并列)
- [[01-ai-agents/一篇讲透Agent自进化飞轮怎么搭-评测→记忆→落地→控制]]:从自进化飞轮视角补充评测、记忆和控制的持续演进关系。
- [[01-ai-agents/InfoQ-TiDB-薄Agent-Loop厚Control-Plane-Harness]]:从 Control Plane、状态和证据治理角度补充生产 Agent 的可靠性边界。
正文要点
- 先统一全景,再按阶段落地。 完备体系是四模块、三种能力、两条 Loop、一套评测资产,但不应在冷启动阶段一次性建完。
- 固定变量才能让回测可信。 评测集、标准和执行环境应尽可能固定;大模型随机性用多 Trial 的 Pass Rate 表达,安全与准确性可设一票否决。
- 离线与在线各司其职。 离线回测负责已知问题的版本门禁,影子模式、AB 和巡检负责真实流量、业务价值与未知问题,监控则观察运行健康。
- 端到端与过程必须配套。 端到端集判断最终交付,过程集定位链路故障;过早细分会制造负担,应由真实问题驱动拆解。
- 归因决定双环流向。 同一个 Bad Case 可能推动 Agent 修复、评测集扩充或 Rubric 校准,不能默认“评测判错就等于 Agent 错”。
- Trace 是最小闭环的底线。 没有完整执行轨迹,就难以稳定复现和解释问题,也无法把线上信号转化为可回归资产。
相关链接