一句话总结

Andrew Ng 用「AI Engineering Skills Map」系统化梳理 AI 工程师能力——「构建与部署 AI 应用」作为第一项,要求掌握 6 大能力(LLM 基础、数据 Grounding、Agentic 系统、评估驱动、生产运营、ML 基础),其中评估驱动开发是区分普通与优秀的分水岭

核心命题(更完整的口径)

核心观点(6 条独立能力 + 4 条元判断)

6 大能力(Ng 原文展开)

  1. LLM foundations:理解 tokenization / 生成过程 / 多模态选择 / 上下文窗口 / 推理缓存 / 知识截止 / reasoning effort / 采样参数 / 工具调用 / 何时微调或自托管
  2. Grounding with data:RAG 不止向量搜索——含 prompt 直放 vs 工具按需检索 / 多种表示(向量索引 / 知识图谱 / 结构化语义层)/ 文档转输入(文本/PDF/HTML/图像)/ 数据管道干净新鲜
  3. Building agentic systems:从预设 workflow 到 agent harness 自主系统;含架构选择(串并行、代码 vs LLM)/ workflow & harness 设计(含 fallback)/ 工具决定(MCP/CLI/沙箱)/ 记忆架构 / 长会话上下文 / 多 Agent 编排 / guardrails & 对抗输入 & 数据外泄治理 / 前沿(voice / computer-use / generative UI)
  4. Evaluation-driven development(核心):evals + 错误分析循环;看 traces / 探索性数据分析 / 产品业务洞察决定测什么;确定性 / LLM-as-judge / 人工介入三种评估方式的选择;还要评估自己的评估方式
  5. Operating in production:可观测性 / 性能追踪 / 漂移检测 / 安全事件响应(prompt injection 等)/ 回归测试 + CI/CD 统计化 / 按风险校准测试力度 / 模型选择优化 / 蒸馏 / 微调 / 简化 workflow 降本
  6. ML foundations:LLM 本身基于监督学习 + 强化学习;bias/variance / 错误分析 / 数据工程等经典心智模型对处理不确定输出仍然关键

4 条元判断

  1. 不可预测性是根本特征:AI 应用输出事先不可知,决定了构建过程比传统软件更具迭代性
  2. 迭代节奏公式:「构建 → 检查 → 决定下一步」——基于中间结果灵活调整,用不可靠组件构建可靠系统
  3. 招聘启事 / 专家访谈 / 调研反馈:技能地图来源,强调非个人臆断而是实证提炼
  4. 后续连载:本文是第 1 项,后续会有第 2 项软件工程基础等——是持续更新的系列而非一次性总结

关键参数 / 事实清单

维度 数据 / 事实
作者 Andrew Ng(@AndrewYNg)
平台 X(Twitter)长文帖
发布时间 2026-08-21
互动数据 点赞 5.5k+,浏览 33 万+
技能地图项数 4 项(本文展开第 1 项)
第 1 项含能力数 6 大能力
技能地图来源 招聘启事分析 + 专家访谈 + 调研反馈
评估驱动地位 Ng 明确定为「区分普通与优秀」的最重要特质
框架范围 Agentic systems 只是 6 项之一,与营销视角形成对比

速查表(写给 AI 工程师 / 团队 Leader)

维度 关键判断
6 大能力定位 LLM 基础 + 数据 + Agentic + 评估 + 生产 + ML 基础(缺一不可)
能力地图来源 招聘启事 + 专家访谈 + 调研反馈(非个人臆断)
AI 应用根本特征 输出不可预测 → 构建过程迭代 → 「构建→检查→下一步」节奏
评估驱动 分水岭特质;evals + 错误分析循环是核心方法
Grounding 不止 RAG RAG(向量搜索)只是早期;现在菜单大幅扩展
Agentic 系统形态 从预设 workflow 到 agent harness 自主系统
生产运营核心 可观测性 + 漂移检测 + prompt injection 防护 + 统计化回归测试
ML 基础心智 bias/variance + 错误分析 + 数据工程——处理不确定输出的关键
与营销帖对比 Ng 强调全面务实结构化,agentic 是 1/6 而非全部
后续连载 第 2 项「软件工程基础」等会陆续发布

5 关键金句

  1. 「AI 应用的输出不可预测——你事先不知道 LLM 会输出什么」
  2. 「优秀的 AI 工程师会反复『构建 → 检查 → 决定下一步』,基于中间结果灵活调整」
  3. 「评估驱动开发(evaluation-driven development)是区分『普通』与『优秀』AI 系统构建者的最重要特质」
  4. 「RAG(向量搜索)只是早期手段,现在技术菜单已大幅扩展」
  5. 「用不可靠的 AI 组件构建出可靠的系统」

3 反直觉点

  1. 「Agentic systems」不是全部:Ng 把 agentic 只列为 6 大能力之一(重要的 1/6),而非「Agent 时代一切」的营销口径;评估驱动 / 生产运营 / 数据 grounding / ML 基础同等重要
  2. RAG 已不是主流答案:向量搜索只是早期手段;现在菜单大幅扩展(多种表示 + 工具按需检索 + prompt 直放 + 数据管道治理)
  3. ML 基础对纯 LLM 应用构建者仍然关键:LLM 本身基于监督学习 + 强化学习;bias/variance / 错误分析 / 数据工程等经典心智模型对处理不确定输出仍然关键(容易被新派忽视)

关联图谱

7 分析角度 × 2-3 开头钩子

角度 1:AI 应用的根本性差异(不可预测性)

角度 2:评估驱动 = 分水岭

角度 3:RAG 已不是终点

角度 4:Agentic 系统只是 1/6

角度 5:生产运营被严重低估

角度 6:ML 基础对 LLM 应用构建者仍然关键

角度 7:技能地图的方法论价值

适合关联的主题(指向已有文章 / 待新建节点)

适合 Seetong 借鉴的动作(4-6 个)

Seetong 是监控类 APP,AI 能力落地的 6 大能力对团队能力建设有直接借鉴价值。

  1. 盘点团队 6 大能力短板:按 Ng 的 6 大能力逐一评估 Seetong 团队的强弱——大概率「数据 grounding」和「生产运营」是两块洼地
  2. 建立 Eval 闭环作为研发流程:当前可能还在「调通就上线」阶段,借鉴 Ng 的评估驱动开发建立 Eval-Driven 研发节奏(构建 → 评估 → 决定下一步)
  3. 重新审视 Agentic 设计:Seetong 的智能告警 / 录像分析 / 设备诊断等场景是否过度套用 Agentic?按 Ng 视角要回到「用不可靠组件构建可靠系统」的总体方法论
  4. 提升 Grounding 多样性:Seetong 设备文档 / 历史告警 / 用户手册等 grounding 来源,应该从单一向量搜索扩展到多种表示 + 工具按需检索
  5. 建立 ML 基础培训:团队补 bias/variance / 错误分析 / 数据工程等经典心智模型,避免只会 prompt 不会调优
  6. 生产运营标准化:建立可观测性 + 漂移检测 + prompt injection 防护 + 统计化回归测试的运维体系(国内监控类 APP 普遍薄弱)

标签

备注与限制