返回播客目录

深度总结 · 基于完整逐字稿

从 Codex 到 ChatGPT Work:agent 如何重写知识工作

Akshay Nathan 复盘 ChatGPT Work 的产品逻辑:统一 harness、保留场景化 UX,并把生产力从“做了多少”重新定义为“是否更快验证并实现目标”

01:09:28 ChatGPT WorkCodexagent harnessknowledge worksub-agentsmemoryproductivity measurement
核心洞见 · 本文综合判断,不是嘉宾原句
真正的“super app”不是堆功能,而是让能力共享、让界面按情境显露

本文综合:OpenAI 的核心选择不是把 Codex 简单改名为 Work,而是让 Codex 与 ChatGPT Work 共享同一套 harness,再分别对 Git diff、sandbox、artifact viewer 等界面和安全默认值做场景化取舍(00:14:24–00:16:24)。这使产品既能保留专业工作流的可验证性,又不要求普通用户先理解 repo、模型档位或 agent 编排。后半段关于 Sites、sub-agents、memory 的讨论进一步说明:界面会逐渐退到“表达意图、确认来源、检查结果”的位置,而真正的竞争力转向上下文、工具连接、持久环境与任务闭环。

TL;DR

两分钟读完

这不是一次功能清单式发布复盘,而是一套关于 agent 产品如何从开发者工具扩张为通用工作环境的设计判断。

一句话

ChatGPT Work 的产品命题,是把从 Codex 验证过的 agent 能力扩展到所有知识工作者,并用共享 harness、持久上下文和可验证 artifact,把生产力衡量从活动量转回目标进展。

  1. 非开发者在 OpenAI 内部主动采用 Codex,促使团队相信 agent 能力可以比预期更早扩展到通用知识工作(00:04:39–00:06:44)。
  2. Codex 与 ChatGPT Work 共享底层 harness 和能力,区别主要来自 UX、Git 状态暴露程度以及 sandbox 默认值(00:14:24–00:16:24)。
  3. Sites 与 spreadsheet 等 artifacts 让输出从长篇 Markdown 变成可迭代、可协作、可直接使用的工作对象(00:21:01–00:29:47)。
  4. 高质量 agent 使用依赖足够的 context、tool access、memory 与人工监督;能力越强,隐私和权限边界越需要明确(00:23:52–00:24:37;00:50:23–00:58:30)。
  5. AI 让制造 motion 变得极容易,但团队仍需用明确目标、反馈回路与高质量 at-bats 衡量 progress(01:05:51–01:08:57)。

THE ARGUMENT

整期内容的一条主线

Akshay 的论证可以整理为一条从模型能力到组织衡量的因果链:

STEP 01

模型与 computer environment 形成新的能力底座

Codex 证明,只要 agent 能进入灵活的计算环境、访问工具并持续执行,模型就不再只是回答问题,而能完成复杂任务(00:15:10–00:16:24)。

STEP 02

非开发者采用验证需求并不局限于写代码

战略财务、市场等内部团队主动用 Codex 处理工作,并把它视为一种“超能力”;这推动团队把相同底层能力带给 ChatGPT 用户(00:04:39–00:06:44)。

STEP 03

共享 harness,按场景调整界面与安全默认值

统一能力避免用户被产品边界限制;Codex 可以突出 diff 与 repo,Work 则隐藏不必要的实现细节,同时都保留 artifacts、plugins 和 computer use(00:10:21–00:14:24)。

STEP 04

能力提升迫使生产力指标回到目标本身

当 token、commit、pull request 等活动量不再稳定对应成果,团队必须直接定义目标、验证假设,并区分 motion 与 progress(01:05:51–01:08:57)。

DEEP DIVE

内容提炼

以下主题按节目推进顺序整理,时间均指向英文原始节目。

0100:03:06–00:08:34

Enterprise 的难点不是缺模型,而是缺具体入口

观察主张

企业对 AI 兴趣强烈,但具体需求高度分散。一个能输入任何内容的对话框既是优势,也会造成“不知道拿它做什么”的空白。

  • 客户会先谈数据和上下文,追问具体 use case 后,需求才呈现出巨大差异。
  • 产品侧仍必须在用户实际工作场景中提供引导,不能只依赖 forward-deployed engineering。
  • 每次 agents 等新能力出现,真正理解其边界的 early adopters 与大众市场之间都会重新出现认知差距。

通用能力不会自动转化为采用;产品必须把开放能力映射成用户当下可理解的任务。

0200:04:39–00:14:24

Merge 的依据:工作角色会被 AI 模糊

观察预测主张

OpenAI 内部非开发者采用 Codex,成为 ChatGPT Work 的重要触发点。团队据此判断,代码、策略、市场和内容生产的角色边界会持续模糊。

  • 用户不是因为被要求才用 Codex,而是为获得更大杠杆而主动采用。
  • 产品允许用户选择 experience,但不应依据身份把能力锁在不同 app 中。
  • plugins 等 primitives 因而需要跨 ChatGPT、Work 与 cloud 保持一致。

分层应围绕任务和验证方式,而不是沿用“开发者/非开发者”的固定身份边界。

0300:14:24–00:20:24

共享 harness,不等于共享同一套 UX

观察主张

Codex 与 ChatGPT Work 共享底层 harness,并同时获得为 knowledge work 改进的 plugins、computer use 与 artifacts;差异主要落在显示内容和默认安全策略。

  • Codex mode 可突出 Git diff、文件编辑和 agent 执行过程。
  • Work 隐藏普通用户不需要理解的计算机细节,但保留相同能力。
  • 模型与 mode 的默认值应覆盖多数用例,复杂配置留给明确需要的 power users。

好的抽象不是减少能力,而是把能力放在需要时才显露的层级。

0400:20:24–00:30:08

Artifacts 与 Sites 把回答变成可工作的对象

观察主张

spreadsheet viewer、Sites 等 artifacts 让用户能看见、迭代并分享接近最终形态的结果;团队内部甚至开始用 site 取代 deck 和 spreadsheet 作为 canonical artifact。

  • 高保真预览让用户在发送给同事前就能验证结果,提升迭代信任。
  • Site 既可用于原型设计,也能承载财务报告、研究面板等知识工作。
  • 无限灵活也会造成页面冗长、信息膨胀和协作困难,仍需进一步结构化。

agent 的价值不仅是生成文字,而是生成可检查、可修改、可继续协作的工作状态。

0500:32:47–00:41:43

Power user 的核心习惯:重新测试边界,持续积累上下文

观察主张

模型能力迭代很快,几个月前失败的任务可能已经可行;同时,持续保存 artifacts、notes 和领域信息,会让 agent 在未来以意外方式复用上下文。

  • 绩效 review 场景中,AI 更适合收集 code、review、Slack 等证据,而不是替 manager 写最终评价。
  • agentic search 的有效性是相对的:它会漏信息,人也会;新增价值来自找回人不会想到的关联。
  • 团队用 scheduled task 从内部讨论中生成 meme,说明检索与关联能力也能服务文化与共同记忆。

上下文的长期复利很重要,但高风险的人事判断仍必须由责任主体完成。

0600:44:25–00:50:23

从 OpenClaw 到个人生产力:持久环境比单次聊天更关键

观察预测

ChatGPT Work 借鉴 personal agent 的用法,通过 scheduled tasks、持久 file system、plugins 和长期引用,让 workout、meal planning、finance 等任务跨 session 延续。

  • 目标不是宣称替代每个 best-in-class app,而是把尽可能多的能力汇入一个会话入口。
  • 金融与健康数据集中后,用户可以用自然语言替代大量 filter 与 search bar。
  • 第三方 MCP/API 调用的延迟仍存在,但较长任务可通过 programmatic calls 与 sub-agents 并行执行。

个人 OS 的关键不是聊天界面,而是持久状态、权限明确的数据连接与可恢复的任务执行。

0700:50:23–00:56:36

Sub-agents 的设计取舍:证明并行能力,但避免暴露全部复杂度

主张观察

产品选择展示 sub-agents 的存在,让用户知道复杂或可并行任务能够被分解,但默认隐藏细节,避免 transcript 和控制项造成信息过载。

  • 部分 power users 希望控制并行度、模型成本与重复工作流中的 agent 配置。
  • 这些控制可以通过 prompt 表达,不一定都需要做成 toggle。
  • Ultra 的高资源消耗意味着它更适合主动开启、理解成本与行为的高级用户。

可观察性要围绕用户的干预需求设计,而不是把每个内部步骤都当作产品价值。

0800:56:36–01:00:44

Memory V3 与 Chronicle:长期工作需要检索,也需要适时想起

观察主张

对 ChatGPT Work 而言,memory 不只是保存用户信息,还要跨长期 project 与多个 session 重建 context,并在正确时机主动提出相关内容。团队希望复用 ChatGPT 已有 memory primitives,同时探索 Chronicle 这类从 computer activity 增加输入的实验性能力。

  • 嘉宾把难题拆成两面:系统既要知道关于用户和工作的事实,也要有足够的 EQ,在有帮助而非冒犯的时刻主动调用(约 00:56:36–00:57:20)。
  • 短 chat 看似一次性,但长期累积后也能形成 durable user representation;work product 则需要把同一能力扩展到 project、thread 与协作 context(约 00:57:20–00:58:45)。
  • Chronicle 从 computer usage 建立更深 memory,仍处于 experimental 状态,也不可能捕捉全部 intent;潜在价值是找到用户自己没想到的关联,并在任务中适时呈现(约 00:58:45–01:00:44)。

持久 memory 的质量不能只用保存量衡量,还要同时评估 retrieval completeness、context boundary、proactive timing 与用户控制。

0901:00:44–01:09:28

团队瓶颈转向 ideas、taste 与反馈闭环

观察主张本文综合

AI 扩大了个人和小团队能完成的范围,也模糊了 EM、PM、engineer、designer 的边界;但新想法仍需来自用户、摩擦和反馈,而不是在真空中生成。

  • 未来更像“generalist + specialty”的 T 型结构,而不是所有角色完全同质化。
  • token、commit、代码行数、story point 等 proxy 会进一步失真。
  • 更可靠的实践指标是高质量 at-bats:提出假设、构建、获得反馈、验证或推翻,再快速进入下一轮。

AI 降低了产出成本,却没有替团队定义正确目标;管理工作的价值因此更集中在方向、taste 和学习速度上。

OPEN QUESTIONS

尚未解决的张力

节目给出了明确方向,但以下边界仍未被充分解决。

统一能力与安全隔离

共享 harness 让所有用户获得相同的 agent 能力VS个人文件、plugins、memory 与企业数据需要精细权限边界

对话提到用户本人有时充当 permissions layer,也承认 agent 可访问高度私人的上下文;但没有展开多人协作中的授权继承、审计与最小权限机制(00:23:52–00:24:37)。

持久上下文与隐私可控性

更多历史、Chronicle 和长期文件会提升主动帮助能力VS错误记忆、过度检索或意外呈现可能造成负面体验

Akshay 把问题概括为“知道什么”与“何时以合适 EQ 提起”两面,但并未给出纠错、遗忘、数据保留或用户检查 memory 的完整方法(00:56:36–01:00:44)。

Sub-agents 的抽象与专业控制

默认隐藏细节可以降低新用户的认知负担VS成本敏感或重复工作流需要模型、并行度与执行轨迹控制

当前折中更多依赖 advanced settings 与 prompt;节目未解决如何稳定复现编排、如何核算每个 sub-agent 的成本与贡献(00:50:23–00:56:36)。

产出速度与真正进展

AI 让原型、代码、设计和文档的产量快速上升VS如果目标含糊,更多 artifact 只会制造 motion

节目提出 at-bats 与 goal attainment,却也承认跨用户衡量目标实现仍未解决;其有效性需要团队自行定义验收标准并持续复盘(01:05:51–01:08:57)。

SO WHAT

可执行启示

把节目观点转成可执行动作时,应优先建立目标、证据和权限边界。

PE

产品与工程团队

  • 选一个可在两周内验证的知识工作任务,记录 idea → prototype → user feedback → hypothesis decision 的完整 at-bat。
  • 让 agent 默认使用推荐配置,只为高成本、长时或高度并行任务开放高级模型与 sub-agent 控制。
  • 对每个持久 context source 列出读取、写入、共享和删除权限,并在协作前做最小权限检查。
MG

团队管理者

  • 停止把 token、commit、PR 数量当作成果;为本周期写出可以被验证或推翻的目标状态。
  • 在 review 中用 agent 收集证据与遗漏项,但由 manager 独立判断、写作并承担最终评价责任。
  • 每周复盘 motion 与 progress:哪些活动改变了用户结果或验证了假设,哪些只是增加产出量。
PU

个人 power users

  • 重新测试三个月前失败过的一个任务,并用明确验收标准比较能力是否真正提升。
  • 为长期项目保留结构化 notes 与 artifacts,让 agent 能跨 session 检索;敏感信息则单独隔离。
  • 先用默认 model/mode 完成基线,再仅在成本、质量或并行需求明确时调整配置。

CHAPTERS

节目时间轴

节目从产品起源逐步推进到组织设计与生产力衡量。

Akshay 的 no-code 经历与 OpenAI 使命

Enterprise 采用与具体 use case 的缺口

非开发者使用 Codex 触发 ChatGPT Work

Codex、Work 与 productivity 的产品边界

共享 harness 与不同 UX 默认值

模型选择、slider 与 artifacts

Sites 成为知识工作的 canonical artifact

从知识工作扩展到 personal productivity

OpenClaw、持久环境与 plugins

Sub-agents 的能力展示与信息负担

Memory V3、Chronicle 与检索边界

AI 前后的团队角色、ideas 与 taste

从 proxy 指标回到目标、at-bats 与 progress

一句话带走

当 AI 让“忙起来”几乎没有门槛,真正稀缺的就变成:知道要到哪里,并能证明自己正在接近那里。

方法与限制:本页基于 Latent Space 官方节目页公开的 creator transcript 全文整理,并逐段覆盖 01:09:28 的完整内容;未对小宇宙中文 AI 译制音频做二次 ASR。英文逐字稿保留 creator transcript 的措辞与说话人标记,可能包含口语断句或原始编辑误差;中文由 Codex 按 308 个 segment 一一对齐翻译,未调用外部翻译服务,也未经过独立人工审校。时间证据来自 creator transcript 的时间结构映射。摘要中的“本文综合”是编辑性推断,不是受访者原话;涉及产品能力、用户数字和未来判断均按节目语境陈述,公开精确引用前应回到英文原文与原始音频复核。

查看逐字稿