执行正在从人转到 agent
模型已经能独立完成越来越多的战术工作。人的工作上移到掌舵:给出方向、在新数据出现后决定下一步,并作出带意见的选择(00:10:50–00:13:21)。
OpenAI Codex 与 ChatGPT Work 产品负责人 Tara Seshan:工作从划桨变成掌舵,产品要为两到三个月后的模型而建,知识工作也不能套用编码的输出验收
持久同事要成立,必须把执行交给模型,同时把过程交给人看见
本文综合:节目前半把工作拆成划桨与掌舵,后半又指出编码可以用测试验收输出,知识工作却必须跟着推理、引用和中间态走完一程。把这两条连起来,第三纪元就不是“更会干活的对话框”,而是一套新的协作界面:agent 能在云端持续执行、拿到同事级数据权限,人则负责方向、野心和最终责任。如果产品只交出漂亮成品、不暴露过程,知识工作者无法把 agent 当同事,只能当不可信的外包。
TL;DR
这不是一份功能清单,而是一套关于 AI 产品纪元、产品经理工作和知识工作验证方式如何一起改写的判断。
Tara Seshan 认为 AI 产品正从对话、智能体进入持久同事:人负责掌舵与抬高野心,模型负责执行;ChatGPT Work 与 Codex 共享能力,但知识工作还需要看见过程,而不能只验收输出。
THE ARGUMENT
Tara 的论证可以整理为一条从执行下沉到过程可见的因果链:
模型已经能独立完成越来越多的战术工作。人的工作上移到掌舵:给出方向、在新数据出现后决定下一步,并作出带意见的选择(00:10:50–00:13:21)。
以前只有少数全栈“独角兽”能把想法直接做成东西;现在更多人能设计、原型和建模。真正拉开差距的,是愿不愿意把天花板抬高,以及产品有没有人的意见与作者性(00:20:31–00:25:29)。
内部已经在按同事节奏同步、查看进行中的工作;下一步是多人一起指挥一组 agent,而不是在 Slack 里互发 Codex 截图。这既需要更强智力,也需要本地数据、云基础设施和第三方系统权限(00:15:58–00:20:34)。
Work 与 Codex 能力接近,差别主要在界面。北极星是用户输入任务后由系统选择 harness 与模型;当前分模式,是为了先接到用户已有习惯(00:29:29–00:36:34)。
代码可以用测试判断对错;知识工作必须看见输入、引用、推理和中间态,人才能相信结果。协作界面因此要从线程里的成品,转向可一起走完的过程(01:05:18–01:07:36)。
DEEP DIVE
以下主题按节目推进顺序整理,时间均指向英文原始节目;广告段未计入主题范围。
高强度、高人才密度对 Tara 并不陌生。真正意外的是:OpenAI 不是创始人自上而下指挥,而是许多人都在自己的产品区里像创始人一样做事;她也没有找到一份可背诵的内部战略圣经。
在这里做产品,核心能力不是解读内部圣经,而是自己贴近用户、把判断迅速做成可触摸的东西。
支付这类更可预测的市场,奖赏严密的第一性原理和长篇战略。AI 市场变化很快、结果高度涌现,还必须贴着研究走。因此多产、经验主义比学院式推理更重要。
PM 角色没有消失,而是被剥到内核:问对问题,尽快验证,再根据结果改假设。
她认为未来工作会越来越像掌舵而不是划桨:agent 承担执行,人负责把船指向正确方向。掌舵的抽象层级会上升,但方向、直觉和“希望世界长成什么样”的判断,目前仍要由人给出。
Agent 循环越大,人越不能把意见外包;差异会越来越集中在方向、品味和作者性上。
她看到的近三个月变化有两层:一层是让 agent 在更高抽象层级独立干活,并按同事节奏对进度;另一层是从“我与我的 agent”变成“我们与我们的 agent 一起做事”。
第三纪元不只是更聪明的模型,也是权限、可靠性和多人同步这些看起来很土的工程问题。
容易的事已经很容易,难的事也在变容易。她认为有效使用者不是只用 AI 自动化琐事,而是扩大自己能做成的事情集合。对 PM 来说,一项关键工作变成提醒别人:可能性的天花板其实更高。
当执行成本下降,组织差距会越来越表现为:有没有人持续把目标和速度往上抬。
按现在的模型能力建,会过时;按一年后的想象建,会太早。她认为两边同样错。唯一可执行的窗口是两到三个月,并且要把模型能力当作产品中心,少用会在模型变强后变成阻碍的产品结构。
产品结构应给模型让路;绑定当前能力上限的交互,会在几个月后变成摩擦。
当前界面有 Codex、Chat 和 Work。北极星是:用户只需输入任务,系统选择合适的 harness 与模型。Work 在罩子下就是 Codex,去掉了工作树等编码界面;差别主要在思维链里暴露多少技术细节。
分模式是过渡,不是终点;能力应共享,界面按用户已有习惯显露,最终不应要求用户理解 harness。
Lenny 认为 Codex 的氛围转变来自团队对人的执着,而不是某次模型突破。Tara 同意:桌面团队几乎人人像创始人,独立修补自己和用户碰到的问题。角色因此更像创业公司:边界很少,但必须有人对结果负责。
能力追上“人人都能上手”之后,组织要先保住结果责任;手艺转到哪一层,节目没有给出答案。
她认为能力和实际用法之间仍有 overhang。自己最常用的出口是 Sites:用一句提示做成可分享、可更新、带数据库的小工具,接近 Alan Kay 所说的个人软件。另一条是 Codex 里的 /visualize。
缩小能力和用法之间的缺口,最快的方法往往不是再写一份说明,而是先做成一个可点击的站点或图表。
她把写作分成两类:写作即思考,和写作即汇报。前者用来把想法写直,绝不交给模型代劳;后者可以尽量自动化。与此同时,知识工作与编码的验收方式不同:代码看输出和测试,知识工作必须看见过程。
模型可以代写汇报、代做执行;不能代你完成思考,也不能在看不见过程时要求知识工作者相信结果。
OPEN QUESTIONS
节目给出了明确方向,但以下几处仍未被现有论证收口。
她强调要贴着研究路线图,知道近期会强化哪些能力;但没有说明当研究日程本身滑动、或外部模型跳跃时,产品如何避免仍然建早或建晚(00:26:45–00:29:02)。
她承认这是为了先接到人在哪里;但没有说明合并的验收标准、错误路由的代价,以及十亿用户在过渡期持续混淆时,团队准备承受多久(00:29:29–00:36:34)。
她同时说发布前也应尽量收集信号,但没有给出哪些问题必须在发布前关闭、哪些可以留给发布后。对非生产力向的消费任务,她也承认还有大量可用性工作要做(00:34:21–00:38:20)。
她明确说自己还没有答案:一部分手艺会被模型抽走,手艺可能转移到产品或学科的其他层,但节目没有给出组织应如何保护判断力、如何重新定义资深标准(00:42:43–00:46:15)。
这是她自己标出的产品核心难题,但节目停在问题陈述:没有展示知识工作专用的协作界面,也没有说明多人一起指挥 agent 时,过程证据如何共享、如何避免“看起来完整但推理不可信”(01:05:18–01:07:36)。
SO WHAT
把节目观点转成可执行动作时,应优先写清要验证的问题、把过程留在可检查的工件里,并规定哪些思考不能外包。
CHAPTERS
时间轴按官方章节整理,标题按实际讨论校正;广告段未单列。
开场:第三纪元是持久同事
OpenAI 文化:founders-led,以及没有秘密战略圣经
AI 产品战略为什么必须快实验
PM 角色在变什么、不变什么
从划桨到掌舵
当 agent 变成同事:多人协作与基础设施
野心成为新瓶颈;mainlining 与最大加速
为两到三个月后的模型建产品
Chat、Work、Codex 有何不同,北极星是不再让用户选
在十亿用户产品上如何仍然先交出再迭代
Codex 的氛围转变:方法没变,外部感知赶上了
传统角色边界开始模糊
人脑仍将提供的价值:责任、作者性与彼此打气
Tara 自己怎么用 AI:Sites
/visualize 命令
写作即思考 vs 写作即汇报
如何用 AI 而不丢掉思考能力
Sutter Hill 一课:product marketing fit 可以先于产品
节目现场用 Sites 生成介绍页
知识工作与编码的验证逻辑为何不同
闪电轮:书、电影、cozy software,以及去试 Work 和云端任务
一句话带走
模型可以替你划桨,甚至替你写汇报;不能替你决定船往哪开,也不能在你看不见过程时要求别人相信结果。
方法与限制:本页基于 YouTube 自动字幕(en-orig)组装的英文逐字稿全文整理,逐段覆盖 01:21:44 的完整内容;中文译制可能仍在进行,主张与时间证据均以英文源为准,未对小宇宙中文音频做二次转写。英文稿未经词级人工校对,专有名词在自动字幕中常被误写,例如 Tara Seshan、Andrew Ambrosino、Codex、ChatGPT、Thiel、Sutter Hill、eigenquestion 等,摘要已按公开资料校正。摘要中的“本文综合”是编辑性推断,不是嘉宾原句;涉及产品能力、用户规模和未来判断均按节目语境陈述,公开精确引用前应回到对应时间点的英文原文与原始音频复核。
查看逐字稿