返回播客目录

Tibo:下一波 AI 到来之前,先看懂产品、harness 与效率回路

从 DeepMind 发不出 LM Chat,到 Codex 与 ChatGPT 合并、ultra fast、reset 按钮和用前沿模型改基础设施

00:44:28 OpenAICodexChatGPTpersonal AGIharnessultra fastrecursive self-improvementDeepMind
下一波能力不会先出现在排行榜上,而会出现在「人机illusion不断裂」和「把效率增益立刻还给用户」这两条产品回路里

本文综合:Tibo 把 DeepMind 发不出 LM Chat 的教训,直接接到 OpenAI 的 bottoms-up shipping 文化(00:00:54–00:05:20)。同一条逻辑贯穿后半场:模型变强以后,笔记本、skill files、subagent 和 tool-call 开销都会打破「完美搭档」的illusion;ChatGPT 与 Codex 合并,是为了做同一个高度 multimodal、voice first 的 personal agent,而不是再维护两套界面(00:07:35–00:16:57)。与此同时,Soul 优化 Luna、Luna 降价约 80%、堆栈提速约 60%,以及 ultra fast 优先留给外部用户,都是把前沿模型指回基础设施和分发,而不是把增益留在内部(00:27:07–00:39:07)。连接这两条线以后可以看到:他所谓的 next wave,不是再发一个更强的 coding 模型,而是让技术去迁就人的注意力、语音和日常任务,并用效率换取更广的 access。

TL;DR

两分钟读完

这期访谈把组织文化、产品合并、注意力设计和推理效率放在同一条「下一波」叙事里。

一句话

Tibo 认为下一波 AI 取决于能否做出懂你的 personal agent、把 ChatGPT 与 Codex 收成同一套 harness,以及持续把模型能力变成更便宜、更快、更广的使用体验。

  1. DeepMind 在 ChatGPT 大约一年前已有内部 LM Chat,但研究机构不适合发产品;他带到 OpenAI 的是 bottoms-up、少 stop energy,再用简洁和质量去对冲混乱(00:00:54–00:04:26)。
  2. 成熟公司的难点是自我颠覆:benchmark 不能揭示全部能力,必须实际使用模型;新语音和口述已经改变他早晨的工作流(00:05:18–00:07:37)。
  3. harness 仍粗糙:skill files 难维护、memory 不稳、subagent 会打破illusion;未来模型也不应再受笔记本这种为人类设计的资源上限约束(00:07:35–00:10:16)。
  4. 他把问题分成两类:与人同频的 personal AGI,以及日志优化、回归修补、漏洞自动修复这类尽量少人介入的自动化(00:12:53–00:14:42)。
  5. ChatGPT 与 Codex 合并,是因为未来模型需要同一套 harness;界面应按个人适配,而不是按「工程师 / 妈妈」这种职业标签分产品(00:14:41–00:17:24)。
  6. Soul 优化 Luna 后价格大约下降 80%,堆栈约比三个月前快 60%;他把基础设施上的自我改进视为 recursive self-improvement 的一部分,并预测一到两年内这类速度可能接近默认(00:27:07–00:41:43)。

THE ARGUMENT

整期内容的一条主线

节目中的关键论证可以整理为五步:

STEP 01

发得出产品,能力才会进入世界

LM Chat 已经显得 special,但 DeepMind 不是为 shipping 设计的;OpenAI 用 bottoms-up 和自我颠覆把研究变成可用产品。

STEP 02

模型变强以后,约束改到人与设备

笔记本、skill files、并行 agent 和 tool-call 延迟会打断心流;产品必须围绕注意力、语音和并发来重新设计。

STEP 03

个人助手与全自动系统是两类问题

一类要懂你、主动、不打破illusion;另一类要接管复杂流程,人只审批高风险动作。

STEP 04

同一套 agent 应适配所有人

合并 ChatGPT 与 Codex,是为了让同一技术按任务和个性变形,而不是按职业标签拆成多个产品。

STEP 05

把前沿能力指回堆栈和分发

用更强模型优化推理、内核和容量,再把成本与速度增益交给用户,才能扩大 access。

DEEP DIVE

内容提炼

下面按时间顺序提炼本期实际出现的产品、文化和效率主题。

0100:00–00:06

DeepMind 发不出 LM Chat,OpenAI 靠 shipping 文化对冲混乱

观察主张

Tibo 在 DeepMind 做加速研究的基础设施与产品。大约在 ChatGPT 一年前,内部已有 LM Chat,起初好笑,后来逐渐有用,但机构不适合把研究变成公开产品。

  • 他强调 OpenAI 研究与产品紧密共创,有强烈的 shipping 和让更多人用上的倾向(00:02:13–00:02:41)。
  • bottoms-up 与少 stop energy 必须配上简洁、质量和 iOS 应用那种 delight,否则会变成没有方向的功能堆砌(00:03:33–00:04:26)。
  • 给创始人的可操作建议是:有 conviction、尽快接触用户、用反馈迭代;大公司还要能把资源从主业调去新研究(00:04:24–00:05:20)。

下一波产品能力,首先取决于组织能不能发、敢不敢自我颠覆。

0200:06–00:08

能力是玩出来的:语音和口述已经改写工作流

观察主张

AI 的未来不会等待现有产品形态。OpenAI 训练出模型后,仍要大量实际使用,才能发现 benchmark 看不到的产品偏移。

  • 新语音更自然,并能 tool use;他因此花更多时间直接说话,而不是打字(00:06:40–00:07:09)。
  • 早晨用手机口述任务,模型调用他的工具去执行;这在语音质量不够时做不到(00:07:07–00:07:37)。
  • 他发推说 Codex 两三个月后会显得 primitive,下一波模型需要的资源会超过笔记本(00:07:35–00:08:05)。

先让新能力进入日常,再决定产品应该长成什么形状。

0300:08–00:12

harness 的illusion,以及笔记本不再够用

观察主张预测

老练用户已经习惯 coding agent 的笨拙:要维护 skill files,memory 不稳定,subagent 会把「完美搭档」的幻觉拆开。

  • 他想要的是真正理解你、你的目标、日常和团队,并能主动反应的伙伴(00:08:28–00:08:56)。
  • 笔记本按人类打字和思考速度设计;模型可以同时处理大量应用,因此需要云端和其他超出本机的资源(00:09:22–00:09:50)。
  • token 速度提高一个数量级后,tool call、网络和栈开销会变成新瓶颈,但也可以用并发探索、写测试、编译来挪动瓶颈(00:09:48–00:11:11)。

模型越快,产品越要消灭让人出戏的维护成本和设备上限。

0400:11–00:13

注意力友好:少并行几个 agent,换回心流

观察主张

主持人现在常并行踢出 10 到 15 个 agent,每个任务要等 30 到 45 分钟。ultra fast 会把工作流改成同时只盯三四个任务。

  • Tibo 说他们在为人类的注意力设计:现在打断,还是 30 分钟后再呈现,本身就是产品决策(00:11:35–00:12:05)。
  • 速度加上语音后,人可以留在 ideate、看原型、生成报告的心流里,而不想回到十路并行(00:12:02–00:12:31)。
  • loops、graphs 这类 agentic 技法,被他放进「对注意力友好」的同一问题里,而不是当成独立潮流(00:12:29–00:12:56)。

并行 agent 的上限不是 GPU,而是人愿意管理多少上下文切换。

0500:12–00:15

Personal AGI 对全自动系统

主张

他把工作分成两类:一类是高度个人化、能主动提出想法的 personal agent;另一类是接管复杂流程的智能系统。

  • 个人 agent 应覆盖技术、研究和建议,并深深根植于你这个独特的人(00:12:53–00:13:48)。
  • 自动化例子包括看生产日志做性能优化、自动修回归,以及安全扫描发现漏洞后把暴露窗口压到接近零(00:13:46–00:14:15)。
  • 后一类可以没有人在回路里,或只在高风险动作上需要批准(00:14:13–00:14:42)。

不要用同一套交互,去同时满足「陪你」和「替你把流程跑完」。

0600:14–00:20

ChatGPT 与 Codex 合并:同一套 personal AGI

观察主张预测

最初用户会问为什么要合并。Tibo 的回答是:未来模型要求他们合并,底层将是同一技术、同一 harness。

  • 软件工程师、设计师这些标签是人类为了处理复杂性发明的抽象;真实的人落在光谱上,界面应按个体适配(00:15:33–00:16:29)。
  • 他明确说你和你妈妈会用同一套东西,只是任务、工具和效用不同;这就是 personal AGI(00:16:27–00:17:24)。
  • 成功的illusion建立在自然语言这种人类沟通方式上;技术应成为既有行为的自然延伸,而不是让人去迁就模型(00:17:19–00:19:08)。
  • 他预期未来会更 ambient:白板、语音、表情和手势都可能被感知;新语音上线后,只用语音使用 ChatGPT 的用户正在快速增长(00:19:29–00:20:25)。

合并不是减产品线,而是承认职业界面会阻碍真正的个人化。

0700:20–00:27

不盯对手,盯社区:Codex 两千万用户与 reset 按钮

观察主张

Tibo 称 Codex 达到 2000 万用户,增长曲线后段接近垂直。被问到与 Anthropic 的竞争时,他反复把焦点拉回能力和把技术交到尽可能多的人手中。

  • 合并也是为了让产品经理、设计师、销售和市场都能用上同一套能力,并顺着 ChatGPT 已有用户分发(00:21:18–00:22:12)。
  • 他说自己不太看竞争,而看 OpenAI 能独特做好什么、价值观是什么,以及如何加速(00:22:08–00:22:38)。
  • reset 最初是因为产品还早、会 break 或配置错误,用额外用量补偿用户;现在有实体按钮,他可以在觉得对的时候按下,并不与营销或财务联合决策(00:23:54–00:25:45)。

把「我们弄坏了就补给你」做成可执行原则,比口头关心社区更有说服力。

0800:27–00:34

用前沿模型改堆栈:效率、降价与 recursive self-improvement

观察主张

Soul 优化 Luna 效率后,Luna 价格大约下降 80%,Terra 也降过价。Tibo 把这件事同时归因于两年前被质疑的大规模算力投入,以及用最强模型重构服务栈。

  • 很大一部分算力用于研究;把最强模型的能力边界推出去以后,就能很快发现如何重做 serving 和工程以换取效率和性能(00:27:34–00:28:30)。
  • 他说除 ultra fast 之外,速度大约比三个月前快 60%,并且由很小的团队完成(00:28:29–00:29:23)。
  • 他区分两类 recursive self-improvement:模型做下一个模型的研究,以及模型改进自己所依赖的推理栈、CUDA kernel 和更高效的交互方式;他认为不这样做会很傻(00:31:10–00:32:05)。
  • 被问及暂停绝对前沿 RL 时,他说随着能力上升,alignment 和 safety 更重要,暂停是为了让团队理解和硬化系统后再重启训练(00:32:04–00:33:50)。

效率增益如果立刻变成用户价格和速度,就会反过来扩大下一轮研究和分发。

0900:34–00:41

Ultra fast:高利害场景、生成密集任务,以及留给客户的容量

观察主张预测

内部在事故响应等每一秒都重要的场景使用 ultra fast;觉得自己在做关键工作的团队也会来要。员工并不能无限制占用该容量。

  • 生成大量代码来做网站或游戏原型时,体感可接近 10 倍;如果轨迹里有很多 tool call,网络和其他开销会把体感降到大约 3 到 4 倍,而不是宣传的 14 倍(00:36:51–00:37:46)。
  • OpenAI 员工没有全员 ultra fast;他们限制内部用量,把绝大部分容量留给外部用户,同时仍让员工足够使用以便理解产品和参与自我改进(00:37:44–00:39:07)。
  • 他看好共享画布、实时选图、语音或文本转向的创作流程;并预测一到两年内这类速度可能接近默认,但仍会保留更贵的上一档(00:39:04–00:41:43)。

速度档位首先是产品体验和容量分配问题,其次才是定价故事。

1000:41–00:44

对焦虑用户:效率会把前沿变成日常工具

主张预测

面对就业、环境和陌生感,Tibo 的回答不是抽象保证,而是指向持续降本和已经存在的个人效用。

  • Luna 更小、极便宜,但倒回六个月会坐在前沿;免费模式也在提供这种能力(00:42:07–00:43:02)。
  • 他的概括是:技术会随时间变得非常高效,他们优化的是直接效用和 broad access(00:43:00–00:43:28)。
  • 对第一次尝试的人,他指向写作帮助、个人建议、医疗咨询,以及已上线的 health 和 finance;他自己会用它们,以便更有准备地去见医生(00:43:26–00:44:19)。

说服犹豫的人,靠的是六个月就把前沿变成低成本日用,而不是更大的未来叙事。

OPEN QUESTIONS

尚未解决的张力

节目把文化、产品和安全说得很顺,但仍留下几处没有被证据收束的张力。

少看竞争与市场仍在用 Anthropic 做对照

Tibo 说自己不太看竞争,只加速自身独特能力和价值观VS主持人和付费用户仍在 OpenAI 与 Anthropic 之间做品牌、语气和 20 美元级订阅选择

节目没有给出 Codex 2000 万用户相对于对手的份额、留存或付费转化,也没有说明「社区透明」如何被独立验证。reset 按钮可以建立善意,但不能单独解释增长曲线。

Personal AGI 的illusion 与全自动少人回路

个人助手必须懂你、主动、不让人出戏VS生产日志、回归和安全补丁应尽量无人在回路,或只审批高风险动作

同一套合并后的 harness 要同时服务这两类问题。节目没有说明何时必须打断illusion、把控制权交还人,也没有给出自动化出错时的责任边界。

把效率增益交给用户,与内部仍限制 ultra fast

Luna 降价约 80%,并承诺不把显著效率增益装进口袋VSultra fast 不对全部员工开放,绝大部分容量留给外部客户

这在容量规划上说得通,但节目没有披露成本、margin 或内部配额规则。听众无法判断降价主要来自算法、预购算力,还是把高档速度另开溢价。

暂停前沿 RL 与「需要时总能高效做决定」

能力上升后必须加大 alignment 和 safety 投入,必要时暂停以硬化系统VS安全原则是在过程中辩论和发现的,节目只说团队后来形成了较清楚的原则

听众听不到具体触发条件、暂停时长、或重启前后的可检验安全指标。把「我们能做出这类决定」当成制度证据,仍然偏内部自述。

一到两年速度接近默认,与工具调用仍吃掉加速

推理硬件、token 效率和月度改进,可能让当前 ultra fast 接近默认VS只要轨迹里有大量 tool call,体感可能只有 3 到 4 倍,而不是 14 倍

这是预测,不是已发生的产品承诺。若 agent 工作越来越依赖外部工具,生成速度本身可能无法成为默认体验。

SO WHAT

可执行启示

把 Tibo 的组织原则和产品判断收成可以当场执行的检查项。

PD

做 agent 产品的团队

  • 把当前工作流拆成两类:必须保持人机illusion的个人助手,以及人只审批高风险动作的自动化;分别为它们设计中断和授权点。
  • 统计一次任务里 skill 维护、memory 失败、subagent 协调和 tool-call 等待各打断用户几次;优先消灭让人出戏的步骤,而不是先加新模型档位。
IN

工程与基础设施负责人

  • 把最强模型的一部分算力固定用于推理栈、kernel 和 serving 重构,并预先写明增益是降价、提速还是扩配额。
  • 为事故响应等每一秒都重要的场景单独准备高速档,同时写清内部占用上限,避免员工抽干生产 GPU。
DV

个人开发者

  • 在速度变快以后,把并行 agent 从十几个降到自己能保持心流的三四个,并改用语音或口述处理规划类任务。
  • 不要按「我是不是工程师」选择界面;把同一助手接到自己真正在用的工具上,看它能否按任务自适应。

CHAPTERS

节目时间轴

时间点来自 YouTube 自动字幕的分段边界,用于回听,不是官方章节。

开场:reset 按钮、不盯竞争、效率与 access

DeepMind 的 LM Chat 与发不出产品

OpenAI 的 bottoms-up 与质量原则

成熟以后如何维持自我颠覆

新语音、口述和工作流偏移

Codex 将显得 primitive:harness 与笔记本上限

并行 agent 与注意力管理

Personal AGI 对全自动系统

ChatGPT 与 Codex 合并

完美illusion、自然语言与 ambient 交互

Codex 2000 万用户与竞争问题

reset 按钮如何出现

Luna 降价、算力押注与堆栈提速

基础设施上的 recursive self-improvement

暂停前沿 RL 与 safety 投入

ultra fast 的内部用法与容量分配

低延迟创作,以及速度会不会变成默认

对焦虑用户:效率、Luna 与个人效用

一句话带走

先让技术迁就人的注意力和语音,再把省下来的成本和速度交给更多人。

方法与限制:本页基于 Matthew Berman 这期访谈的 YouTube 自动字幕(en-orig,json3)完整 101 段逐字稿整理,对应视频 00:44:28,而不是依据小宇宙 AI 中文配音二次转写。英文自动字幕未经逐词人工校对,存在专有名词和断句错误,例如把 ChatGPT 听成 Chhatra 或 LGBT,把人名和产品名切碎;Soul、Luna、Terra、ultra fast、reset 按钮和 Codex 用户数均按口述记录,公开引用前应回到原始音频核对。中文为编辑性翻译与主题重组,未调用外部翻译服务,也未做音频级复核。摘要中的「本文综合」是编辑推断,不是嘉宾原句;涉及用户量、降价幅度、提速比例、RL 暂停和一到两年速度预测,均未独立验证。

查看逐字稿