返回播客目录

深度总结 · 基于完整逐字稿

Anthropic 第一位技术 PM:在能力跃迁之前构建产品

Dianne Penn 谈 Claude Code、Labs、evals、token maxing 与 AI 时代的产品判断:坚定押注方向,灵活迭代原型,并让用户证据进入模型训练闭环

01:33:50 AnthropicClaude CodeAI product managementevalsLabstoken maxingAI safetyhuman judgment
核心洞见 · 本文综合判断,不是嘉宾原句
前沿 AI 产品的核心资产不是 roadmap,而是更短的“用户证据 → eval → 训练改进”回路

本文综合:Dianne 对 Anthropic 早期、Labs 与 research product management 的复盘共同指向一个结论——模型能力会以不连续方式跃迁,固定 roadmap 很容易落后;但单纯追逐 token 或 prototype 数量也不会自动创造价值。更稳健的方法,是对长期问题和用户方向保持强观点,对具体 prototype 保持弱执着,再用 consented transcripts、失败 trajectory 与 evals 把模糊反馈变成 researchers 可以行动和衡量的对象(00:15:40–00:19:33;00:25:36–00:30:41;00:31:41–00:47:18)。因此,AI 时代的 PM 不会因构建成本降低而消失,反而要更深入用户、模型行为和验证细节。

TL;DR

两分钟读完

这期节目把 Anthropic 的产品史、研究协作与个人工作方法放在同一套能力跃迁框架中。

一句话

Anthropic 的产品方法,是让小团队公开实验、尽早发现模型的非连续能力,再用 evals 和 hands-on judgment 把这些能力转化为可验证、可扩展的用户价值。

  1. Golden Gate Claude 只触达约 2,000 人,却帮助 Anthropic 找到用独特产品体验公开展示 research 的身份与速度(00:04:50–00:07:26)。
  2. Opus 3 的 coding 优化与 Opus 4.5 + Claude Code 的共同跃迁说明:frontier model 需要 frontier product 才能让用户感到能力(00:09:10–00:13:59)。
  3. 模型能力并非平滑出现;evals、red teaming 和快速适应能帮助团队发现跃迁并调整计划(00:14:49–00:20:14)。
  4. “token maxing”的真正结果指标应是 experimentation 和 learning,而不是 token spend;公开、共同探索能更快组合出新 use case(00:20:14–00:25:36)。
  5. AI product manager 必须亲自 shipping、阅读失败 transcript,并把模糊反馈拆成可复现 eval;PRD 仍用于大规模对齐和探索模糊机会(00:31:41–00:55:10)。
  6. 人类长期稀缺的不是产出动作,而是 judgment、persistence、独立 POV、用户 empathy 与低 ego 的团队协作(01:12:20–01:25:38)。

THE ARGUMENT

整期内容的一条主线

节目中的关键论证可以整理为四步:

STEP 01

规模提升会带来不可精确预测的能力跃迁

loss 可能平滑下降,但具体能力会突然从不可用跨到可靠可用;没有 eval 和测试系统,团队甚至不知道跃迁已经发生(00:18:16–00:20:14)。

STEP 02

产品负责把能力变成可感知的用户体验

Opus 4.5 与 Claude Code 彼此放大:模型提供 intelligence,product 提供可端到端执行、可被用户采用的 vehicle(00:12:39–00:13:59)。

STEP 03

用户反馈必须被翻译成研究可行动的 eval

“Claude hallucinated”过于模糊;PM 要定位 tool use、search synthesis 或 alignment 等具体 failure,再用覆盖正反例的 eval 持续衡量(00:31:41–00:47:18)。

STEP 04

更快的实验要求更强的人类判断与协作

构建选择无限增加后,稀缺项转为决定应该构建什么、何时反驳、谁验证输出,以及团队能否在高压下互相补位(01:05:54–01:25:38)。

DEEP DIVE

内容提炼

以下主题按节目时间整理;“预测”均保留为嘉宾或主持人的未来判断。

0100:02:40–00:09:10

早期 Anthropic:通过古怪实验找到产品身份

观察本文综合

Anthropic 早期只有五位产品工程师、整个 API 业务一位工程师,却以强使命文化和 bottoms-up 协作快速试验。Golden Gate Claude 成为一个隐藏转折点。

  • interpretability research 中被放大的 Golden Gate Bridge feature,让 Claude 在每次回答中都联想到大桥。
  • research、product、engineering 和 design 在 24 小时内把体验上线 Claude.ai。
  • 项目规模很小,却证明 Anthropic 能以符合自身气质的方式把 research 变成公众体验。

早期实验的价值不只看覆盖人数,也看它是否帮助组织形成独特的产品语言和协作肌肉。

0200:09:10–00:14:49

Frontier model 与 frontier product 必须共同出现

观察主张

Opus 3 让 Anthropic 建立发布 frontier model 的信心;coding 训练上的小改动形成早期差异。Opus 4.5 则与 Claude Code 一起让 agentic 能力真正跨入大众采用。

  • 用户开始从 autocomplete 转向 long-form code,促使团队把 coding 纳入 Opus 3 训练目标。
  • 跨 pre-training、fine-tuning、inference、research 与 product 的一线协作建立了长期信任。
  • 模型没有 product vehicle 难以被感知,产品没有足够强的模型也难以快速采用。

模型发布不是产品策略的终点;用户能否在完整 workflow 中感受到智能,决定能力是否真正落地。

0300:14:49–00:20:14

生活在 exponential:适应计划,提前发现能力

观察预测主张

模型能力可能突然跃升,团队很难预测确切版本和时点;因此需要安全与能力 evals、first-principles thinking,以及根据新信息提前调整产品计划。

  • 不同团队感受 exponential 的速度不同,组织需要建立信任并把成员共同带上。
  • product overhang 指现有模型已具备但产品尚未充分呈现的能力;user overhang 指用户尚未发现的用法。
  • safety 困难也源自同一特性:没有测试,危险或有用能力都可能已出现而无人察觉。

稳定的不是 roadmap,而是持续测试、解释差异、并在证据变化时重排优先级的能力。

0400:20:14–00:25:36

Token maxing 应服务于共同实验,而非消费竞赛

主张观察

高 token spend 只是 input;真正 outcome 是更密集地 experimentation、学习和产生更好的 idea。Anthropic 内部公开试用模型,让一个人的发现被其他人快速变体与组合。

  • 最有创造力的 thinkers 与 prototypers 会深入使用每一版 research model。
  • 技术快速变化时,不触碰模型就很难制定可靠 strategy。
  • 大约十次公开 request 的相互启发,就可能形成一个新 use case;experimentation 不是个人运动。

应衡量从 token 投入中获得了多少可复用学习,而不是把高消费本身当作领先。

0500:25:36–00:31:41

Labs:对主题强信念,对 prototype 弱执着

主张观察

Labs 寻找 core roadmap 之外可能带来 10x、100x、1,000x 的 discontinuous bets。它通过小 pod、自驱 engineer 与允许失败的 zero-to-one culture 运作。

  • Claude Code、skills、Claude Design、MCP 等都来自这类孵化。
  • prototype 暂时失败时,团队可能等一两代模型后再重新审视。
  • 即使没有立即 shipping,只要 prototype 帮助组织学习,也具有价值。

前沿 Labs 的组合管理重点不是提高单次命中率,而是保留高质量学习和未来重启的选择权。

0600:31:41–00:49:14

Evals are the new PRDs:把模糊抱怨变成可训练问题

主张观察

research PM 的核心是进入 user trajectory 细节,将模糊 feedback 归因到具体 failure class,并用可重复 eval 连接用户价值与模型训练。

  • “hallucination”可能实际来自未调用 tool、找到错误 facts、search synthesis 或 alignment。
  • 早期“不会遵循 instructions”的约 80% 案例实际是无法输出正确 JSON;30–40 个实例构成初始 eval set。
  • 随着模型达到 99.9% 或 100%,旧 eval 可证明 pain point 已基本消失。

AI PM 的 TDD 不是套用工程术语,而是先定义可复现失败,再让训练和产品共同对结果负责。

0700:49:14–00:55:10

PRD 没死,但 PM 必须重新 hands-on

主张

PRD 仍适合跨 engineering、legal、safety 等大群体建立 source of truth,也适合探索尚无成熟用户证据的模糊机会;但管理者不能只停留在文档和协调。

  • 经验丰富的 PM 与 early-career PM 使用同样 onboarding:理解 users、读 consented feedback、谈 customers。
  • manager 要亲自负责一两个 workstream,保持对模型变化速度与 quality bar 的直接感知。
  • 只有实际 shipping,才能理解 computer use、模型 limitation 与新 UX 的真实边界。

职位层级不会替代一手判断;越负责战略,越需要定期回到模型和用户细节。

0800:57:49–01:11:54

从个人 POV 到 verifier:如何避免 AI 接管思考

主张观察

Dianne 用 Claude skill 准备关键谈话和管理 coaching,但会在需要 personal judgment 时先形成自己的 POV。对标准化 writing,则更愿意委派并转为 reviewer/verifier。

  • 有用的 thinking partner 必须知道何时 push back,而不是永远顺从。
  • alignment 与 constitution 可以提升 personality 和判断,因为它们支持有原则的反驳。
  • AI writing 的治理重点可能不是谁执笔,而是谁验证、谁签字确认。
  • 模型能力呈 jagged edge:agentic behavior 改进后,writing、tone 与 character 成为新的 rough edge。

委派程度应与 judgment 风险匹配;把生成交给 AI,不等于把观点与责任一起交出去。

0901:11:54–01:25:38

人类优势与组织韧性:judgment、inner voice、低 ego 协作

主张预测观察

Dianne 认为,人类来之不易的 judgment、persistence、proactivity 与 subject-matter expertise 仍然关键;儿童和成年人都应先发展自己的 inner voice。高压 AI 团队则要靠彼此补位维持可持续性。

  • AI 能构建很多东西,但该构建哪一个仍需要人类综合 nuance 与 experience。
  • Anthropic 团队在发布前跨 DRI 边界互助,形成所谓 hive mind,使 PTO 真正可恢复。
  • 招聘更看重 low-ego、team-oriented,并能理解共同 first principles 的同事。
  • 模型降低 building 成本后,深入 users、判断什么值得构建的 product work 反而需求更大。

AI 扩大个人规模,却也提高决策责任;真正可持续的杠杆来自独立判断与可信任的人类团队共同存在。

1001:25:38–01:33:50

从 culture metrics 到 trading floor:把 conviction 变成可执行反馈

观察主张

Lightning round 最后回到组织与个人实践。Dianne 从 Eric Ries 关于长期维持优秀公司的讨论,谈到 culture 也需要可观察指标;她又回顾早年在 JPMorgan high-yield trading desk 的经历,认为 authentic self、对好 idea 的 conviction 和完成琐碎 follow-through,能够跨越 seniority 与身份差异。

  • 如果组织只测 revenue,行为就会围绕 revenue 优化;她正在思考怎样为 team norms 和希望保留的 values 建立更好的反馈指标(约 01:25:38–01:26:50)。
  • 祖父留下的 motto 是“无论走多远,永远还有下一层”,她用它面对 AI 团队不断出现的 unprecedented challenge(约 01:28:00–01:29:20)。
  • 作为 trading desk 上最 junior、也是唯一女性与不同背景成员,她学会让 best idea 而非职位决定方向,并把 vulnerability、conviction 与执行带入后来的团队管理(约 01:29:20–01:31:40)。
  • Anthropic 通过产品 thumbs-up/down、sales feedback 和 research-model favorability 追踪失败点;她也把 deep curiosity、first-principles thinking 与 tinkering spirit 列为团队招聘信号(约 01:31:40–01:33:20)。

Culture、product quality 与职业成长都需要同一种闭环:明确希望保留的判断,收集真实反馈,并让任何层级的人都能把好 idea 推到落地。

OPEN QUESTIONS

尚未解决的张力

以下问题在节目中被正面提及,但尚无完整答案。

高 token 投入与可验证学习

更大量使用模型可以提前体验未来并扩大 idea spaceVStoken spend 可能只制造昂贵活动,未形成可靠用户价值

Dianne 建议以 experimentation outcome 重构指标,但节目没有给出跨团队比较学习质量、控制成本或识别无效探索的统一标准(00:20:14–00:25:36)。

能力开放与前沿安全限制

Anthropic 希望 general-purpose model 尽可能 inclusive 和可访问VS更强模型需要更严格 red teaming、safeguards、fallback 与可能的访问限制

fallback UX 可以保障部分体验,但 policy、export control 与风险阈值被明确留给其他团队;能力何时可以安全开放仍未展开(00:35:35–00:40:24)。

Evals 的可量化性与真实世界的非确定性

标准化 eval 能缩短反馈到研究改进的距离VS用户需求含糊、模型输出 non-deterministic,许多质量仍依赖 tactile judgment

节目展示了 JSON schema 这一较明确案例,但对更开放的 writing、judgment 与 agent trajectory 应怎样设计稳健 eval,没有给出同等具体的方法(00:43:28–00:49:14)。

AI 协作与人的认知自主

Claude 可作为 coach、sparring partner 与写作执行者增强 IQ/EQVS过度依赖可能稀释个人 voice、thinking 与责任归属

“先形成 POV,再与 Claude 推演”是实用原则,但如何识别观点已被模型塑形、怎样审计 verifier 是否真正验证,仍需要额外机制(01:02:55–01:10:36)。

SO WHAT

可执行启示

这些动作分别对应用户证据、团队学习与个人判断三个层级。

AP

AI 产品团队

  • 从最近 20 条经过许可的失败 trajectory 中归纳一个具体 failure class,不使用“效果差”“hallucination”等笼统标签。
  • 为该 failure 建立包含失败案例与本应成功案例的最小 eval set,并记录当前模型基线。
  • 在 roadmap 中区分长期 theme 与当前 prototype;prototype 失败时保留证据和下一代模型重试条件。
PM

Product managers 与管理者

  • 每个周期亲自负责至少一个端到端 AI workstream:构建、shipping、获取 user feedback、验证结果。
  • 对清晰问题优先使用 eval;涉及多人对齐、风险或未知用户空间时,继续用 PRD 建立 source of truth。
  • 把标准化汇报写作委派给 AI 前,明确 verifier、签字人和不可委派的 judgment。
IP

个人实践者

  • 选择一两个能立即创造价值的问题深入使用 AI,而不是同时浅尝大量 products。
  • 与一个真正享受探索的人结对,公开分享 prompt、失败和变体,把 experiment 变成共同发现。
  • 涉及职业、人际或价值判断时先写自己的 POV,再要求 Claude 反驳、补证据和指出假设。

CHAPTERS

节目时间轴

时间线覆盖 Anthropic 早期故事、产品方法和后半段的人与组织议题。

预告:coding 转折、evals 与 token maxing

Anthropic 早期文化与 Golden Gate Claude

Opus 3、coding 与 product-research 信任

Opus 4.5 与 Claude Code 互相放大

Exponential、能力跃迁与适应性

Token maxing 与公开共同实验

Labs 的 discontinuous bets

Research PM 如何把反馈转成 actionability

Evals are the new PRDs

PRD 的新位置与 hands-on 管理

通过共同探索找回使用 AI 的 joy

Claude 作为 manager coach 与 thinking partner

AI writing、verifiability 与 jagged edge

人类 judgment、孩子的 inner voice

高压发布、hive mind 与可持续团队

为什么 AI 时代需要更多深度用户导向的 PM

Lightning round 与职业早期经验

一句话带走

在能力随时可能跃迁的时代,最可靠的产品能力,是保持好奇、亲手验证,并把每次惊讶转化成团队可重复学习的证据。

方法与限制:本页基于 Lenny's Podcast 官方 YouTube 视频提供的英文 automatic captions,覆盖 01:33:50 的完整节目,并以官方节目页核对节目身份;未对小宇宙中文 AI 译制音频做二次 ASR。automatic captions 存在人名、产品名、断句和重叠时间轴误识别,例如 Claude/Claude Code 可能被写作 cloud/claw,部分未来 model/product 名称也可能识别有误;中英逐字稿保留英文 caption 原文不变,中文由 Codex 按 216 个 segment 一一对齐翻译,并仅在语境明确时规范 Anthropic、Claude、Claude Code 等术语,未调用外部翻译服务,也未经过独立人工审校。摘要的时间证据来自 caption 时间轴;“本文综合”属于编辑推断,不是嘉宾原话。涉及收入、用户规模、模型能力、安全判断与精确引语,公开引用前应回看官方节目页、原视频和音频复核。

查看逐字稿