测评是 Agent 从 Demo 可用走向生产可靠必须跨过的门槛。 腾讯 TEG 网关测试团队给出”3 类评分器 + 5 大维度 + 5 步闭环”完整框架,核心反直觉:”过度触发比不触发更难发现,所以负向触发用例比正向触发更重要”。
核心命题:Agent/Skill 设计阶段就要把 Trace 输出作为标准能力,而非事后补救 核心金句 4 条:① 能用代码判断的绝不用模型 ② 过度触发比不触发难发现 ③ 用例基线=1 次人工确认的预期快照 ④ N 次中 1 次不通过即标记稳定性风险 关键数字:3 类评分器 / 5 大维度 / 5 步闭环 / 落地项目 TPerf 性能平台
主条目:[[01-ai-agents/腾讯-AI-Agent-Skill-测评方案落地]] 上游:[[01-ai-agents/Skill-Self-Evolution]] / [[01-ai-agents/陈进-读完Agent-Loop工程手册-我有8个还没想明白的问题]] / [[01-ai-agents/阿里妹-端到端业务需求专家Agent-4层架构8步流程]] 下游:[[02-ai-coding/用Agent评测思路管理AI-Coding-31万行代码重构实践]] / [[07-rag-systems/如何构建一个更好的知识库]] / [[seetong-batch-issue-rootcause-analysis]] / [[seetong-daily-briefing]] 同级:[[01-ai-agents/清华沈阳-自进化AI新物种]] / [[01-ai-agents/Multica-AI-Native-组织-人是最慢的节点]]