Agent评测漫谈 —— 由浅入深讲解Agent评测

核心结论(一句话)

Agent 评测的对象已经从“最终答案”升级为“模型 + 系统 + 工具 + 流程”的任务系统;只有把 Trace、可解释标准、Case、回归和流程门禁连成基础设施,才能把随机性转化为可持续迭代的可靠性。

分类提炼

知识节点(8 个独立概念)

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点(6 条)

  1. 评测服务迭代而非榜单:核心问题是 Agent 哪里好、哪里不好,结果要能指向下一轮 Prompt、Skill、策略或模型调整。
  2. 结果正确不代表工程可靠:两个 Agent 都完成任务时,还要比较路径稳定性、耗时、Token、工具调用次数、可复现性和安全风险。
  3. Trace 是观测地基:只记录用户输入和最终回复无法定位根因;要记录影响结果的隐藏动作、工具调用和中间状态。
  4. 评测体系要搭桥:业务指标、系统指标和 Agent 指标之间需要任务层桥梁,否则模型分数提升无法解释业务收益。
  5. 从实践中长出指标:先从高频场景开始,收集 Bad Case 和 Good Case,转成标准样本,再用结果反哺优化,避免一开始设计复杂体系。
  6. 长程评测走向平台化:未来评测应支持全链路回放、Case 管理、分层沙箱、Rubric 评分、报告归因、版本回归和准入准出。

对 Agent 工程的借鉴

相关链接

透明玻璃自检:8 个节点;wiki / digest 均带 frontmatter;原文为 HTML 纯文本抽取,图片文字未 OCR;文中案例与数字按作者团队经验处理,未扩展为通用基准。