Lilian Weng:那个把 Agent 讲清楚的人,又开始定义 Harness

核心结论(一句话)

从 Agent 到 Harness,优化目标从“让模型给出更好回答”转向“让系统在真实环境中可恢复、可评测地完成和改进任务”;安全边界与评测必须留在自我修改循环之外。

分类提炼

知识节点

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点

  1. 2023 年的 Agent 框架回答“模型如何规划、记忆、使用工具”;Harness 继续回答“系统怎样跨步骤保存状态、从失败中恢复并验证结果”。
  2. Coding Agent 的有效循环不是一次生成代码,而是观察仓库、修改、运行测试、读取失败并重新行动;该循环的可靠性主要来自 Harness 设计。
  3. RSI 的近期工程形态是让系统优化运行机制,而非直接训练或改写模型权重。前提是每次变更都能由外部、稳定的评测保留或淘汰。
  4. 允许 Agent 修改工作流不等于允许它修改所有东西。测试、权限和安全规则若可被同一优化器改写,分数提升不再代表能力提升。
  5. 本文提醒不要把“AI 参与 AI 研发”外推为完全自治:弱评测、模糊目标和研究品味仍是当前闭环的主要限制。

备注

相关链接