Anthropic 产品负责人:评测就是新的 PRD
- 原文链接:https://mp.weixin.qq.com/s/1aT2ueDwoH8SoekxTZ_V2A
- 来源:微信公众号「Z Finance」;作者:ZF 编辑部
-
| 一手节目:Lenny’s Podcast,《Why AI is going vertical (again) |
Dianne Penn (Anthropic)》 |
- 获取时间:2026-08-25
核心结论(一句话)
AI 产品的需求不能停在“用户说不好用”:产品经理应把真实失败交互归因为可复现、可衡量、可回归的 eval,让它成为用户、产品和研究训练之间的共同规格;PRD 则继续承担机会探索和多团队对齐。
分类提炼
- 场景:模型产品、Agent 体验、研究产品管理、AI 产品团队协作
- 类型:产品管理访谈 / 评测驱动开发
- 分类理由:本文讨论的是 PM 如何定义价值、组织反馈与研究迭代,不是单纯的 Agent 评测基础设施或模型能力评测。
知识节点(8 个独立概念)
- 产品-模型双向承载:前沿模型需借助合适产品表面被用户使用,产品复杂任务的上限又受模型能力制约。
- 能力涌现:模型能力可能非线性出现,持续评测用于识别已经成熟但尚未被产品化的能力与风险。
- 评测即 PRD:当用户任务与成功标准明确时,eval 可直接定义应该改进什么以及如何证明改进。
- 反馈归因:抽象抱怨必须下钻到具体输入、交互轨迹、失败输出与预期行为,才能形成行动目标。
- 评测集:由真实失败案例、预期答案或 Rubric 及必要对照情境组成,用于稳定复现一个用户痛点。
- PRD 分工:PRD 在机会模糊或需要产品、工程、安全、法务对齐时,仍负责愿景、范围和事实来源。
- 亲手构建:AI PM 和管理者需要自己构建、使用模型并读用户反馈,才能建立对体验和能力边界的判断。
- 责任签收:AI 输出的可靠性不能只看“像不像人写的”,还要明确谁验证、谁批准、谁承担最终责任。
从抱怨到 Eval 的产品循环
文章给出了一条非常具体的工作流。用户说“模型不遵循指令”时,不把这句话直接翻译成需求,而是追问具体任务、prompt、模型输出、期望输出和出现频率。Penn 的例子发现,早期大量“指令遵循”问题实为 JSON 格式不正确。
接着将 30 至 40 个失败交互固化为 eval:输入、模型输出、golden answer 或判分标准,以及必要的正负对照。这个评测集只有能稳定重现痛点时才有用。它被加入版本回归后,研究团队可据此训练或调优,产品团队也能验证新模型是否真的改善了用户体验。
这使产品文档从“描述想要什么”前移为“证明模型在真实任务上该怎样表现”。重点不是套用某个指标,而是让用户反馈到研究行动的距离足够短、可追溯、可验证。
Eval 与 PRD 的边界
两者不是替代关系。若问题明确,例如模型能否按 schema 输出,eval 可以是最直接的需求语言。若技术仍在探索、用户群和体验尚未确定,PRD 更适合提出产品假设、限定首批用户和协调产品、工程、安全、法务等决策。
合适的顺序是:先用 PRD 收敛模糊机会和边界,再用实际交互长出 eval;已被验证的用户任务,则用 eval 驱动后续模型与体验迭代。
对 Seetong 的借鉴
- 把“AI 分诊不准”改成 Case。 每次人工改写 AI 结论时,保存原始输入、AI 输出、人工判定、理由和预期动作,累积成设备与反馈分诊的 eval 集。
- 每个 Skill 建立最小回归集。 先收集 20 至 40 个高频失败或高风险 case,版本更新前后都运行,避免“看起来更聪明”但关键任务退化。
- 将 PRD 与 eval 分层。 模糊的新能力先写目标用户、风险和成功标准;流程稳定后再把关键行为压成可重复验证的任务。
- 负责人保留一线样本。 PM、技术负责人和运营负责人每周各抽读一批真实输出,不将能力判断完全外包给仪表盘或团队汇报。
关联图谱
上游(基于 / 来自)
- [[01-ai-agents/Agent评测漫谈-由浅入深讲解Agent评测]]:解释 Trace、Rubric、Case、回归和评测基础设施;本文补充 PM 如何从用户反馈供给这些 Case。
- [[02-ai-coding/用Agent评测思路管理AI-Coding-31万行代码重构实践]]:说明评测思想在 AI Coding 质量治理中的工程应用。
下游(应用于 / 验证于)
- Seetong 设备告警与用户反馈分诊的案例库、回归集与人工签收流程。
同级(横向 / 并列)
- [[02-ai-coding/Capihom-OpenAI-Codex-Andrew-Ambrosino-产品工作新形态]]:同为 Lenny’s Podcast 产品负责人访谈;Andrew 讨论构建成本下降后的品味与媒介选择,Penn 讨论如何将模型表现转化为可验证产品目标。
- [[06-ai-tech/经纬创投-李飞飞-当答案变得廉价]]:共同强调 AI 不能替人设定问题与判断标准;本文给出产品团队把标准写进 eval 的具体机制。
证据边界
- 原文为二手整理,未核验节目逐字稿、Anthropic 内部流程或所有引语。
- 团队规模、案例比例、样本数、模型能力和发布节奏均不应视为通用基准。
- Eval 的代表性、评分可靠性、数据安全与人工签收边界需要结合具体业务单独设计。
相关链接