一篇讲透Agent自进化飞轮怎么搭:评测→记忆→落地→控制

核心结论(一句话)

可持续的 Agent 自进化是“评测发现问题 → 记忆保留经验证据 → 候选变更修复 → 人控制边界和发布”的闭环;其中评测可信度和记忆治理优先于自动化复杂度。

分类提炼

知识节点

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点

  1. 自进化应区分产物迭代、Harness 自改进和模型权重更新。现阶段优先改可持久化、可回滚的 Harness 资产,而非直接改模型。
  2. 可信评测采用分层方法:确定性规则处理格式、产物和工具调用;独立模型处理语义判断;人工抽样校准评估器。结果、过程、成本、鲁棒性与体验应分别评估。
  3. 评测后的归因决定下一步:系统性问题生成候选改动,偶发问题写为反例,能力缺失进入工具/知识需求,回归立即回滚并人工排查。
  4. 记忆不是对话仓库。写入应经过筛选,存储应有版本、来源、过期和冲突策略,读取应按需渐进披露并受 Token 预算限制。
  5. 自动化的上限由控制面决定。人应像教练和裁判,负责冷启动样本、不可变安全线、评测争议、回归决策和高影响变更,而不是重复执行日常操作。
  6. 从零落地先手工跑通一圈:选一个输入稳定、验证便宜、副作用小的任务,建立少量评测样本和候选版本链,再逐步自动化;不要在第一阶段建设大而全的平台。

备注

相关链接