Agent 开发指南:技术太多,该怎么学?

核心结论

Agent 原生软件的目标不是最大自治,而是让不完全可靠的推理者在可靠系统中持续承担责任。代码生成越便宜,越需要把身份、状态、执行、验证、副作用、恢复和人工接管设计成确定边界。

分类提炼

知识节点

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

正文要点

  1. 先定义“完成”,再设计恢复。 对每个任务先说明何种证据可通过、哪些副作用不可重试、每个中断点如何对账,以及何时必须交回人类。
  2. 把长任务当作状态机。 任务、步骤、动作、预算、资源租约与审批需要稳定身份;未知外部结果不能用盲目重试掩盖。
  3. 把入口和运行时分离。 CLI 可保持高密度、脚本化的行动闭环,桌面与 IM 承担可视化监督和异步触达,但不应各自维护一份会话真相。
  4. 让浏览器成为受治理的能力,而非无边界工具。 CDP 提供机械控制,WebMCP 试图声明页面业务语义;两者都仍需要 origin、身份、权限、审批与动作证据。
  5. 按系统责任选择技术,而非按热点选择语言。 TypeScript/Python 连接产品和生态,Rust/Go/Zig 覆盖不同的运行时与分发边界;先度量冷启动、延迟、崩溃、跨平台和维护成本。
  6. 把 Skill 当作有生命周期的操作资产。 对 Skill 的版本、owner、兼容矩阵、所需能力、脚本审查、行为 eval、失败恢复和退役规则做显式管理。

采用边界与相关链接