Anthropic 产品负责人:评测就是新的 PRD

核心结论(一句话)

AI 产品的需求不能停在“用户说不好用”:产品经理应把真实失败交互归因为可复现、可衡量、可回归的 eval,让它成为用户、产品和研究训练之间的共同规格;PRD 则继续承担机会探索和多团队对齐。

分类提炼

知识节点(8 个独立概念)

从抱怨到 Eval 的产品循环

文章给出了一条非常具体的工作流。用户说“模型不遵循指令”时,不把这句话直接翻译成需求,而是追问具体任务、prompt、模型输出、期望输出和出现频率。Penn 的例子发现,早期大量“指令遵循”问题实为 JSON 格式不正确。

接着将 30 至 40 个失败交互固化为 eval:输入、模型输出、golden answer 或判分标准,以及必要的正负对照。这个评测集只有能稳定重现痛点时才有用。它被加入版本回归后,研究团队可据此训练或调优,产品团队也能验证新模型是否真的改善了用户体验。

这使产品文档从“描述想要什么”前移为“证明模型在真实任务上该怎样表现”。重点不是套用某个指标,而是让用户反馈到研究行动的距离足够短、可追溯、可验证。

Eval 与 PRD 的边界

两者不是替代关系。若问题明确,例如模型能否按 schema 输出,eval 可以是最直接的需求语言。若技术仍在探索、用户群和体验尚未确定,PRD 更适合提出产品假设、限定首批用户和协调产品、工程、安全、法务等决策。

合适的顺序是:先用 PRD 收敛模糊机会和边界,再用实际交互长出 eval;已被验证的用户任务,则用 eval 驱动后续模型与体验迭代。

对 Seetong 的借鉴

关联图谱

上游(基于 / 来自)

下游(应用于 / 验证于)

同级(横向 / 并列)

证据边界

相关链接