# Anthropic Dianne Penn：评测就是新的 PRD - Digest

- 原文：[[Z-Finance-Anthropic-Dianne-Penn-评测就是新的PRD]]

## 核心观点

1. 前沿模型必须借助前沿产品体验才能转化为用户可感知价值，模型与产品是双向依赖。
2. Eval 不是发布前质检，而是发现能力涌现、定位用户痛点和定义研究改进目标的产品接口。
3. 模糊反馈必须下钻成 prompt、失败输出和 expected behavior，才能形成稳定、可回归的评测任务。
4. PRD 没有消失：目标清楚时 eval 可直接定义工作，机会模糊或多团队协同时 PRD 仍负责统一方向。
5. AI PM 与管理者必须亲自构建、理解 token 级表现和用户反馈；构建便宜后，判断与领域经验更稀缺。

## 七个分析角度与开头钩子

### Eval 即 PRD
- “AI 产品经理还在写 PRD，Anthropic 已经把它写成评测。”
- “为什么一个 eval 比十页需求文档更接近用户价值？”
- “当模型不稳定时，产品目标该怎样被定义？”

### 反馈归因
- “用户说‘不好用’，真正的问题可能根本不是他说的那个。”
- “80% 的指令遵循抱怨，为什么最后落到 JSON？”
- “从一句抱怨到可训练任务，中间究竟要追问几层？”

### 能力涌现
- “模型能力已经出现，团队为什么可能还没发现？”
- “损失曲线平滑下降，产品机会为什么会突然出现？”
- “没有 eval，能力跃迁和安全风险会怎样被漏掉？”

### PRD 的存续
- “PRD 没死，但它不再是唯一的产品语言。”
- “什么时候应该先写 eval，什么时候仍要先写愿景？”
- “模糊机会如何从产品愿景长成可验证任务？”

### 亲手构建
- “AI 产品负责人不写代码，为什么也必须亲自 build？”
- “不理解每个 token 的失败，怎么判断 AI 体验好坏？”
- “管理者怎样避免把 AI 理解外包给团队？”

### 安全与反对
- “最有用的 AI，为什么不应该总是赞同用户？”
- “对齐会让模型变笨，还是让它更会帮人做判断？”
- “谁验证、谁签字，为什么比谁写的更重要？”

### 组织协作
- “高速发布的隐藏变量，为什么不是更拼而是更信任？”
- “模型进步太快时，组织怎样避免死守旧计划？”
- “低自我文化如何让研究、产品和工程真正协作？”

## 证据边界

- 原文是播客的二手中文整理，非逐字稿或 Anthropic 官方方法论。
- JSON 案例的 80%、样本数量、团队规模、发布节奏及模型能力均未独立核验。
- Eval 驱动流程需根据任务风险、数据代表性和业务指标调整，不能仅复制格式。

标签： #主题/AI产品管理 #主题/AI评测 #主题/评测驱动开发 #场景/公众号长文
