返回播客目录

AI 的第三纪元:持久同事,而不是更长的对话

OpenAI Codex 与 ChatGPT Work 产品负责人 Tara Seshan:工作从划桨变成掌舵,产品要为两到三个月后的模型而建,知识工作也不能套用编码的输出验收

01:21:44 persistent AI coworkerChatGPT WorkCodexsteering vs rowingambitionwriting as thinkingknowledge work verification
持久同事要成立,必须把执行交给模型,同时把过程交给人看见

本文综合:节目前半把工作拆成划桨与掌舵,后半又指出编码可以用测试验收输出,知识工作却必须跟着推理、引用和中间态走完一程。把这两条连起来,第三纪元就不是“更会干活的对话框”,而是一套新的协作界面:agent 能在云端持续执行、拿到同事级数据权限,人则负责方向、野心和最终责任。如果产品只交出漂亮成品、不暴露过程,知识工作者无法把 agent 当同事,只能当不可信的外包。

TL;DR

两分钟读完

这不是一份功能清单,而是一套关于 AI 产品纪元、产品经理工作和知识工作验证方式如何一起改写的判断。

一句话

Tara Seshan 认为 AI 产品正从对话、智能体进入持久同事:人负责掌舵与抬高野心,模型负责执行;ChatGPT Work 与 Codex 共享能力,但知识工作还需要看见过程,而不能只验收输出。

  1. OpenAI 是 founders-led:自上而下指令很少,产品负责人必须像创始人一样贴近市场;所谓秘密战略很快会变成公开产品(00:02:43–00:05:45)。
  2. 静态市场需要长篇推理,AI 市场必须经验主义:先写清 eigenquestion,尽快拿原型和用户结果迭代(00:07:04–00:10:41)。
  3. 工作会从划桨变成掌舵;工具普及后,差异来自意见、作者性,以及把他人野心往上抬的能力(00:10:50–00:25:29)。
  4. 第一纪元是 chat,第二纪元是 agent,第三纪元是持久同事;近期要把 agent 带给节目所称的十亿 ChatGPT 用户,并做到用户不必选择 harness(00:29:29–00:36:34)。
  5. 编码可用测试验证输出,知识工作必须看到输入、引用与推理过程;Sites 与 /visualize 是把能力变成可检查工件的入口(00:48:23–00:52:52;01:05:18–01:07:36)。
  6. 写作即思考不可外包,写作即汇报可以自动化;她在 OpenAI 改用原型和实验结果沟通,长文只留给自己(00:52:49–01:00:23)。

THE ARGUMENT

整期内容的一条主线

Tara 的论证可以整理为一条从执行下沉到过程可见的因果链:

STEP 01

执行正在从人转到 agent

模型已经能独立完成越来越多的战术工作。人的工作上移到掌舵:给出方向、在新数据出现后决定下一步,并作出带意见的选择(00:10:50–00:13:21)。

STEP 02

工具普及后,稀缺的是野心与作者性

以前只有少数全栈“独角兽”能把想法直接做成东西;现在更多人能设计、原型和建模。真正拉开差距的,是愿不愿意把天花板抬高,以及产品有没有人的意见与作者性(00:20:31–00:25:29)。

STEP 03

产品形态要从一对一聊天变成持久同事

内部已经在按同事节奏同步、查看进行中的工作;下一步是多人一起指挥一组 agent,而不是在 Slack 里互发 Codex 截图。这既需要更强智力,也需要本地数据、云基础设施和第三方系统权限(00:15:58–00:20:34)。

STEP 04

要把这套能力带给十亿用户,必须去掉选择题

Work 与 Codex 能力接近,差别主要在界面。北极星是用户输入任务后由系统选择 harness 与模型;当前分模式,是为了先接到用户已有习惯(00:29:29–00:36:34)。

STEP 05

知识工作不能复制编码的输出验收

代码可以用测试判断对错;知识工作必须看见输入、引用、推理和中间态,人才能相信结果。协作界面因此要从线程里的成品,转向可一起走完的过程(01:05:18–01:07:36)。

DEEP DIVE

内容提炼

以下主题按节目推进顺序整理,时间均指向英文原始节目;广告段未计入主题范围。

0100:02:43–00:05:45

OpenAI 的意外:人人都是创始人,没有秘密战略圣经

观察

高强度、高人才密度对 Tara 并不陌生。真正意外的是:OpenAI 不是创始人自上而下指挥,而是许多人都在自己的产品区里像创始人一样做事;她也没有找到一份可背诵的内部战略圣经。

  • 自上而下指令相对很少,产品负责人与市场的距离很薄,必须自己为产品找到 product-market fit。
  • 她进公司时期待有一间藏着 AGI 总计划的房间;实际感受是:关于产品、模型和世界应如何运转的想法,很快就会变成公开产品或公开叙事。
  • 她把这件事说成“OpenAI is open”:周期快到想法来不及先在内部沉淀成教条。

在这里做产品,核心能力不是解读内部圣经,而是自己贴近用户、把判断迅速做成可触摸的东西。

0200:07:04–00:10:41

PM 留下的核心:eigenquestion 与实验循环

观察主张

支付这类更可预测的市场,奖赏严密的第一性原理和长篇战略。AI 市场变化很快、结果高度涌现,还必须贴着研究走。因此多产、经验主义比学院式推理更重要。

  • 她一度怀疑自己是不是不够严谨,因为不再写接近博士论文的长计划;后来判断:真正要写清的是核心假设。
  • 她借用 Shishir Mehrotra 的 eigenquestion:先找出决定产品成败的那一个问题,再尽快做可检验的测试。
  • 按时交付、写演示文稿等外围工作在减弱;工程师、设计师、数据科学家也在转向同一套“问题定义—测试—回馈”循环。

PM 角色没有消失,而是被剥到内核:问对问题,尽快验证,再根据结果改假设。

0300:10:50–00:16:01

从划桨到掌舵:软件更像拍电影,而不是盖房子

主张预测

她认为未来工作会越来越像掌舵而不是划桨:agent 承担执行,人负责把船指向正确方向。掌舵的抽象层级会上升,但方向、直觉和“希望世界长成什么样”的判断,目前仍要由人给出。

  • 循环可以越做越大,agent 可以划更多桨;但在新数据出现后决定下一步,仍然是人的工作。
  • 她用时装类比:功能服装人人能穿,真正有力的是对比中的个性表达。工具普及后,若所有人都问“我们怎样赢”,分开彼此的是人的判断。
  • 她转述 Collison 兄弟的说法:软件不像房地产,投钱就能得到价值;它更像拍电影,预算不能保证作品成立,还需要作者声明与艺术性。

Agent 循环越大,人越不能把意见外包;差异会越来越集中在方向、品味和作者性上。

0400:15:58–00:20:34

持久同事需要同步节奏,也需要土味基础设施

观察预测主张

她看到的近三个月变化有两层:一层是让 agent 在更高抽象层级独立干活,并按同事节奏对进度;另一层是从“我与我的 agent”变成“我们与我们的 agent 一起做事”。

  • 持久同事的界面更像团队协作:对方做完一批工作,你给意见,再分头继续,并查看进行中的工作。
  • OpenAI 内部曾靠 Slack 互发 Codex 线程截图来解释一个数字是怎么来的;这不是多人协作的自然方式。
  • 模型智力、长时任务能力很重要,但同样关键的是本地数据、云基础设施、可靠性和第三方系统权限。把云端 agent 隔离开,就像把新同事锁进一间没有 Docs、Slack 和数据库的房间。

第三纪元不只是更聪明的模型,也是权限、可靠性和多人同步这些看起来很土的工程问题。

0500:20:31–00:26:21

野心成为新瓶颈,PM 负责把天花板抬高

主张观察

容易的事已经很容易,难的事也在变容易。她认为有效使用者不是只用 AI 自动化琐事,而是扩大自己能做成的事情集合。对 PM 来说,一项关键工作变成提醒别人:可能性的天花板其实更高。

  • 以前能把产品感觉、工程和设计压进同一个人的“独角兽”很少;现在她可以自己出设计、做原型、建定价模型。
  • 限制不再是自己会不会做、能不能讲清楚,而是思考有没有跟上能力扩张。她举 Patrick Collison 的 fast projects 清单:那些项目完成于这些工具出现之前,按理说现在应看到更多以不合理速度做成的事。
  • 内部口令包括 Nick Turley 的 “Is this maximally accelerated?”,以及她与 Andrew Ambrosino 常问的 “Are you mainlining it yet?”:是不是整天用自己的产品,并把品味压进反馈循环。

当执行成本下降,组织差距会越来越表现为:有没有人持续把目标和速度往上抬。

0600:26:45–00:29:29

为两到三个月后的模型建产品,并且让开模型的路

主张预测

按现在的模型能力建,会过时;按一年后的想象建,会太早。她认为两边同样错。唯一可执行的窗口是两到三个月,并且要把模型能力当作产品中心,少用会在模型变强后变成阻碍的产品结构。

  • 窗口不是完全黑箱:产品要和研究紧密沟通,知道近期会强化哪些编码或写作能力,并把研发日程与产品开发绑在一起。
  • 公司里另一句反复出现的话是 feeling the AGI:既推动 AGI 实现,也确保它对人类有益。
  • Lenny 转述 Kevin Weil 的话:这是模型有史以来最差的一次。Tara 同意这个判断听起来荒唐,但必须按这个方向建。

产品结构应给模型让路;绑定当前能力上限的交互,会在几个月后变成摩擦。

0700:29:29–00:38:20

Chat、Work、Codex:同一能力,用户不该做选择题

观察主张

当前界面有 Codex、Chat 和 Work。北极星是:用户只需输入任务,系统选择合适的 harness 与模型。Work 在罩子下就是 Codex,去掉了工作树等编码界面;差别主要在思维链里暴露多少技术细节。

  • Codex 用户继续留在 Codex 不会少掉能力;ChatGPT 用户若要使用新的 agent 能力,应进入 ChatGPT,再在需要对话或搜索时用 Chat,需要把事情做完时用 Work。
  • 公司财务等团队已经用 Work 做复杂财务模型:以前依赖少数人手工或专长的事,现在可以变成全队都能推进的工作。
  • 第一纪元是 chat,第二纪元是与 agent 共事,第三纪元是持久同事。近期产品挑战是把 agent 以自然、低概念负担的方式带给节目所称的十亿 ChatGPT 用户。
  • 她对比过去“打磨为王”的经验:在这一轮,有把握的变革性能力应尽早交到用户手里。完成优于完美,但发布前仍应尽可能收集信号。

分模式是过渡,不是终点;能力应共享,界面按用户已有习惯显露,最终不应要求用户理解 harness。

0800:39:14–00:48:25

角色边界可以溶解,责任和手艺却仍未安放好

观察主张预测

Lenny 认为 Codex 的氛围转变来自团队对人的执着,而不是某次模型突破。Tara 同意:桌面团队几乎人人像创始人,独立修补自己和用户碰到的问题。角色因此更像创业公司:边界很少,但必须有人对结果负责。

  • 她用“开悟前后都是砍柴挑水”形容 Codex:内部循环一直是抬高使命、最大加速、全日使用;外部感知赶上了,方法并没有换成另一套。
  • 她在意的是 DRI:有人必须对“有没有人用、好不好用、质量够不够”负责。谁来做具体工作,可以按能力与意愿认领。
  • 她明确说,还没有解决手艺问题:工程师怀念手写代码的心流,模型会抽走一部分专业技艺。人脑在她看来仍最有价值的位置是结果责任、表达与作者性,以及团队里互相打气、一起学习、抬高彼此野心。这些判断被她限定为“至少目前”。

能力追上“人人都能上手”之后,组织要先保住结果责任;手艺转到哪一层,节目没有给出答案。

0900:48:23–00:52:52

Sites 与 /visualize:把能力变成可触摸的个人软件

观察主张

她认为能力和实际用法之间仍有 overhang。自己最常用的出口是 Sites:用一句提示做成可分享、可更新、带数据库的小工具,接近 Alan Kay 所说的个人软件。另一条是 Codex 里的 /visualize。

  • 她为团队做过带数据库的游戏站点,也为徒步旅行做过路线、海拔和食物登记;也用内部数据做成指标看板,替代费力的幻灯片。
  • Sites 可在 Work、Codex、网页和移动端创建,并可选择公开、团队内或仅自己可见。
  • /visualize 能把 ChatGPT 使用记录等数据拉成可讲故事的可视化;她认为许多人还不知道这些能力已经可用。

缩小能力和用法之间的缺口,最快的方法往往不是再写一份说明,而是先做成一个可点击的站点或图表。

1000:52:49–01:07:36

写作即思考不能外包;知识工作必须看见过程

主张观察

她把写作分成两类:写作即思考,和写作即汇报。前者用来把想法写直,绝不交给模型代劳;后者可以尽量自动化。与此同时,知识工作与编码的验收方式不同:代码看输出和测试,知识工作必须看见过程。

  • 在 Stripe,brief 可以在内部传开,写作即思考受到重视。在 OpenAI,长文不再能证明你想过,因为长文已经很容易生成;她改用 mock、原型和实验结果沟通,文档仍写,但主要写给自己。
  • 她沿用“写到七成再找需要认同的人一起打磨”:太完整的方案会把别人的新想法弹开。为避免思考萎缩,她坚持自己起稿、自己收尾,中间才用模型做研究、取数或反驳;若要别人读,自己先投入不少于对方合计阅读时间的时间。
  • Sutter Hill 让她重新评估 product marketing fit:叙事和定位可以先于产品经验去验证,先把“为什么这件事能改变局面”讲给足够多人听,再锁定产品形态。
  • 编码任务可用测试验证;知识工作不能只看最终幻灯片里的数字。产品需要让人看到进行中的工作、引用和推理,并判断线程是否仍是合适的表面。

模型可以代写汇报、代做执行;不能代你完成思考,也不能在看不见过程时要求知识工作者相信结果。

OPEN QUESTIONS

尚未解决的张力

节目给出了明确方向,但以下几处仍未被现有论证收口。

两到三个月的窗口如何判断

不为现在的模型建,也不为一年后的想象建,只对准两到三个月VS指数变化里,这个窗口仍依赖研究沟通和判断,并不是可复核的预测方法

她强调要贴着研究路线图,知道近期会强化哪些能力;但没有说明当研究日程本身滑动、或外部模型跳跃时,产品如何避免仍然建早或建晚(00:26:45–00:29:02)。

统一入口与分模式过渡

北极星是用户不必选择 Chat、Work 或 Codex,系统自动挑选 harness 与模型VS当前仍靠切换和不同界面来迁就开发者与 ChatGPT 用户的既有习惯

她承认这是为了先接到人在哪里;但没有说明合并的验收标准、错误路由的代价,以及十亿用户在过渡期持续混淆时,团队准备承受多久(00:29:29–00:36:34)。

尽快交给用户与十亿用户产品的可用性

有变革性把握时,完成优于完美,先让用户用起来再迭代VSChatGPT 是超大规模消费产品,Work 上线后已经出现过界面混淆

她同时说发布前也应尽量收集信号,但没有给出哪些问题必须在发布前关闭、哪些可以留给发布后。对非生产力向的消费任务,她也承认还有大量可用性工作要做(00:34:21–00:38:20)。

角色无边界与专业手艺

团队不在意工程师、设计师、PM 的边界,只要求有人对结果负责VS许多人正失去手写代码、打磨文档等构成身份的手艺,并为此哀悼

她明确说自己还没有答案:一部分手艺会被模型抽走,手艺可能转移到产品或学科的其他层,但节目没有给出组织应如何保护判断力、如何重新定义资深标准(00:42:43–00:46:15)。

编码式验收与知识工作的过程信任

把 Codex 的执行力带进知识工作,用同一套 agent 能力完成财务模型等工作VS知识工作不能只看最终输出,必须暴露引用、推理和中间态,线程也未必是对的表面

这是她自己标出的产品核心难题,但节目停在问题陈述:没有展示知识工作专用的协作界面,也没有说明多人一起指挥 agent 时,过程证据如何共享、如何避免“看起来完整但推理不可信”(01:05:18–01:07:36)。

SO WHAT

可执行启示

把节目观点转成可执行动作时,应优先写清要验证的问题、把过程留在可检查的工件里,并规定哪些思考不能外包。

PM

产品经理

  • 本周只写一个 eigenquestion:用一句话写出“什么成立则产品成立,什么失败则方向作废”,并设计一个能在数天内跑完的用户或内部试验。
  • 把下一份长战略改成可点击原型、mock 或一次 A/B 结果;长文可以继续写,但默认只给自己对齐思路。
  • 在评审里增加一句:这件事能不能以十倍范围或明显更短周期尝试。要求对方给出新的验收标准,而不是只把原计划说得更满。
KW

知识工作者

  • 选一件过去要专家或数天才能完成的分析,在 ChatGPT Work 或 Codex 里做一次;要求输出带上来源、中间步骤和你能复核的假设。
  • 用 Sites 把正在进行的项目做成可分享页面,或在 Codex 里对一组真实数据跑 /visualize,用它替代第一版幻灯片。
  • 把写作分成两类:思考类文稿自己起稿、自己收尾;汇报类状态、纪要和格式转换才交给模型。
PE

工程与产品团队

  • 为当前项目标出两到三个月后模型很可能变强的那一层,检查现有界面是在给模型让路,还是把今天的能力上限写进了交互。
  • 给云端 agent 列出必须具备的同事级权限:文档、聊天、内部数据和第三方系统;缺哪一项就不要期望它表现得像同事。
  • 若任务是知识工作而不是代码,不要只验收最终文档。把进行中工作、引用和推理轨迹做成默认可见,并指定一名人对最终质量负责。

CHAPTERS

节目时间轴

时间轴按官方章节整理,标题按实际讨论校正;广告段未单列。

开场:第三纪元是持久同事

OpenAI 文化:founders-led,以及没有秘密战略圣经

AI 产品战略为什么必须快实验

PM 角色在变什么、不变什么

从划桨到掌舵

当 agent 变成同事:多人协作与基础设施

野心成为新瓶颈;mainlining 与最大加速

为两到三个月后的模型建产品

Chat、Work、Codex 有何不同,北极星是不再让用户选

在十亿用户产品上如何仍然先交出再迭代

Codex 的氛围转变:方法没变,外部感知赶上了

传统角色边界开始模糊

人脑仍将提供的价值:责任、作者性与彼此打气

Tara 自己怎么用 AI:Sites

/visualize 命令

写作即思考 vs 写作即汇报

如何用 AI 而不丢掉思考能力

Sutter Hill 一课:product marketing fit 可以先于产品

节目现场用 Sites 生成介绍页

知识工作与编码的验证逻辑为何不同

闪电轮:书、电影、cozy software,以及去试 Work 和云端任务

一句话带走

模型可以替你划桨,甚至替你写汇报;不能替你决定船往哪开,也不能在你看不见过程时要求别人相信结果。

方法与限制:本页基于 YouTube 自动字幕(en-orig)组装的英文逐字稿全文整理,逐段覆盖 01:21:44 的完整内容;中文译制可能仍在进行,主张与时间证据均以英文源为准,未对小宇宙中文音频做二次转写。英文稿未经词级人工校对,专有名词在自动字幕中常被误写,例如 Tara Seshan、Andrew Ambrosino、Codex、ChatGPT、Thiel、Sutter Hill、eigenquestion 等,摘要已按公开资料校正。摘要中的“本文综合”是编辑性推断,不是嘉宾原句;涉及产品能力、用户规模和未来判断均按节目语境陈述,公开精确引用前应回到对应时间点的英文原文与原始音频复核。

查看逐字稿