一篇讲透Agent自进化飞轮怎么搭:评测→记忆→落地→控制
- 原文链接:https://mp.weixin.qq.com/s/5VDN-T9K8Wr-DaQ15-I6CA
- 作者:yannisyang、ethanytzhou
- 获取时间:2026-08-27
核心结论(一句话)
可持续的 Agent 自进化是“评测发现问题 → 记忆保留经验证据 → 候选变更修复 → 人控制边界和发布”的闭环;其中评测可信度和记忆治理优先于自动化复杂度。
分类提炼
- 场景:Agent/Skill 长期运行、Harness 自改进、企业级治理
- 类型:工程方法论与落地路线
- 标签: #主题/AI-Agent #主题/自进化 #主题/评测 #主题/记忆系统 #主题/Harness #场景/公众号长文
知识节点
- 四齿飞轮:评测、记忆、落地和控制必须由数据通路闭合,孤立建设不会产生累积收益。
- 评测信号源:评测既负责质量门控,也负责指引优化方向和筛选哪些经验可以沉淀。
- 三集隔离:train 用于诊断,val 用于选择候选,test 用于上线验证,防止修改方案对验证集过拟合。
- 记忆策展:长期记忆只接纳有证据的正例和明确反例,并管理来源、冲突、时效与不读取能力。
- 候选变更:系统性失败才触发 Skill、Prompt 或工作流候选;单次成功不能越级成为默认规则。
- 渐进发布:候选先回归、再灰度、后默认化;出现回归应回到上一个版本并冻结该方向。
- 人类控制面:评测器、安全边界、预算上限、生产权限和高风险变更的批准权必须在 Agent 可编辑表面之外。
- 失败归因:要区分系统性模式、偶发反例、能力缺失和回归,才能避免用“改大 Prompt”掩盖根因。
关联图谱
上游(基于 / 来自)
- [[01-ai-agents/Lilian-Weng-Harness-Engineering-自我改进]]:给出 Prompt、上下文、工作流到 Harness 代码的优化层级,以及 reward hacking 的理论边界。
- [[01-ai-agents/Skill-Self-Evolution]]:提供 Trace2Skill、EvoSkill、SkillOpt 等把轨迹转为候选 Skill 的研究路径。
下游(应用于 / 验证于)
- [[01-ai-agents/腾讯-AI-Agent-Skill-测评方案落地]]:将评测信号具体化为评分器、基线、Trace 与稳定性检查。
- [[01-ai-agents/若飞-Agent-记忆与可验证自我改进怎么设计]]:将“记住经验”细化为候选准入、读取/写入链和五道门。
- [[01-ai-agents/Loop-Engineering-验证才是瓶颈]]:为候选变更提供外部验证优先于生成的工程原则。
同级(横向 / 并列)
- [[01-ai-agents/清华沈阳-自进化AI新物种]]:从自进化概念与产品化视角讨论“可验证”路线;本文补足日常工程控制环。
正文要点
- 自进化应区分产物迭代、Harness 自改进和模型权重更新。现阶段优先改可持久化、可回滚的 Harness 资产,而非直接改模型。
- 可信评测采用分层方法:确定性规则处理格式、产物和工具调用;独立模型处理语义判断;人工抽样校准评估器。结果、过程、成本、鲁棒性与体验应分别评估。
- 评测后的归因决定下一步:系统性问题生成候选改动,偶发问题写为反例,能力缺失进入工具/知识需求,回归立即回滚并人工排查。
- 记忆不是对话仓库。写入应经过筛选,存储应有版本、来源、过期和冲突策略,读取应按需渐进披露并受 Token 预算限制。
- 自动化的上限由控制面决定。人应像教练和裁判,负责冷启动样本、不可变安全线、评测争议、回归决策和高影响变更,而不是重复执行日常操作。
- 从零落地先手工跑通一圈:选一个输入稳定、验证便宜、副作用小的任务,建立少量评测样本和候选版本链,再逐步自动化;不要在第一阶段建设大而全的平台。
备注
- 文中列举的模型、框架和“迭代/Token 节省”收益均为二手材料,不应视为本团队可直接复现的承诺。
- 文章对训练/验证/测试比例、记忆评分与预算给出的是方法建议;具体阈值应以任务风险、成本和线上基线校准。
相关链接
- [[01-ai-agents/腾讯-AI-Agent-Skill-测评方案落地]]
- [[01-ai-agents/若飞-Agent-记忆与可验证自我改进怎么设计]]
- [[01-ai-agents/Skill-Self-Evolution]]
- [[01-ai-agents/Lilian-Weng-Harness-Engineering-自我改进]]