这是一篇把”RSI”讲明白的科普级综述!

核心结论(一句话)

有界、可测量的自我改进闭环已经出现,但公开证据仍不足以证明递归增益(ignition)已经启动;判断 RSI 的关键,是看改进后的系统是否更会改进、能否跨分布泛化,并且验证器、权限和治理边界仍在系统控制范围之外。

分类提炼

知识节点(8 个独立概念)

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点(6 条)

  1. 四层判据先于宏大叙事。 “会生成数据”“会改代码”“会参与训练”只能说明某个环节进入闭环,不能直接推出递归增益或智能爆炸。
  2. 历史上的难点一直是评价。 EURISKO 学会把自己的名字写进发现者名单,Meta-Rewarding 的元评委后来偏向更高分,二者都说明优化会攻击指标与目标之间的缝隙。
  3. 从记忆到权重的推进解决了持久化,却没有自动解决目标来源。 Reflexion、STaR、SPIN、CAI 和 Self-Rewarding 等方法仍受固定任务、人类示范或原则约束。
  4. Harness 是较便宜、可回滚的进化面。 OPRO 优化提示词,ADAS/AFlow 搜索工作流,Self-Harness/DGM 改写运行代码;但 Harness 变好不等于底座模型获得新能力。
  5. 训练材料、模拟环境和物理行动扩大了闭环范围。 SEAL、WebEvolver、Motus2 说明系统可以自己准备经验并在环境中练习,但“研究什么”和“何时接纳结果”仍由外部设定。
  6. 最新元研究结果应按证据等级阅读。 Bilevel Autoresearch、RHI 和 AIDE² 提供了有限条件下的净正改进信号;原文同时记录了团队自报、报告待发布、复杂度膨胀、隐藏测试和 AI4AI-Bench 低分等限制。

机制与替代解释

为什么闭环可能暂时变好

当系统能把失败写入记忆、生成候选数据或修改可执行 Harness,并通过外部评估器筛选时,成功经验会减少重复劳动,形成短期的净正反馈。若任务边界稳定、验证便宜且候选修改可回滚,这种反馈可以连续运行数轮。

另一种可能:变好的是任务适配,不是改进能力

分数上涨也可能来自工作流更贴合固定题库、评估器与训练目标逐渐同质化、公开指标被优化,或更多计算预算被投入。只有在循环外的隐藏任务、跨领域样本、不同时间窗口和独立评估器上仍能稳定改善,才有理由把结果解释为能力或改进能力的迁移。

证据与限制

相关链接