发得出产品,能力才会进入世界
LM Chat 已经显得 special,但 DeepMind 不是为 shipping 设计的;OpenAI 用 bottoms-up 和自我颠覆把研究变成可用产品。
从 DeepMind 发不出 LM Chat,到 Codex 与 ChatGPT 合并、ultra fast、reset 按钮和用前沿模型改基础设施
下一波能力不会先出现在排行榜上,而会出现在「人机illusion不断裂」和「把效率增益立刻还给用户」这两条产品回路里
本文综合:Tibo 把 DeepMind 发不出 LM Chat 的教训,直接接到 OpenAI 的 bottoms-up shipping 文化(00:00:54–00:05:20)。同一条逻辑贯穿后半场:模型变强以后,笔记本、skill files、subagent 和 tool-call 开销都会打破「完美搭档」的illusion;ChatGPT 与 Codex 合并,是为了做同一个高度 multimodal、voice first 的 personal agent,而不是再维护两套界面(00:07:35–00:16:57)。与此同时,Soul 优化 Luna、Luna 降价约 80%、堆栈提速约 60%,以及 ultra fast 优先留给外部用户,都是把前沿模型指回基础设施和分发,而不是把增益留在内部(00:27:07–00:39:07)。连接这两条线以后可以看到:他所谓的 next wave,不是再发一个更强的 coding 模型,而是让技术去迁就人的注意力、语音和日常任务,并用效率换取更广的 access。
TL;DR
这期访谈把组织文化、产品合并、注意力设计和推理效率放在同一条「下一波」叙事里。
Tibo 认为下一波 AI 取决于能否做出懂你的 personal agent、把 ChatGPT 与 Codex 收成同一套 harness,以及持续把模型能力变成更便宜、更快、更广的使用体验。
THE ARGUMENT
节目中的关键论证可以整理为五步:
LM Chat 已经显得 special,但 DeepMind 不是为 shipping 设计的;OpenAI 用 bottoms-up 和自我颠覆把研究变成可用产品。
笔记本、skill files、并行 agent 和 tool-call 延迟会打断心流;产品必须围绕注意力、语音和并发来重新设计。
一类要懂你、主动、不打破illusion;另一类要接管复杂流程,人只审批高风险动作。
合并 ChatGPT 与 Codex,是为了让同一技术按任务和个性变形,而不是按职业标签拆成多个产品。
用更强模型优化推理、内核和容量,再把成本与速度增益交给用户,才能扩大 access。
DEEP DIVE
下面按时间顺序提炼本期实际出现的产品、文化和效率主题。
Tibo 在 DeepMind 做加速研究的基础设施与产品。大约在 ChatGPT 一年前,内部已有 LM Chat,起初好笑,后来逐渐有用,但机构不适合把研究变成公开产品。
下一波产品能力,首先取决于组织能不能发、敢不敢自我颠覆。
AI 的未来不会等待现有产品形态。OpenAI 训练出模型后,仍要大量实际使用,才能发现 benchmark 看不到的产品偏移。
先让新能力进入日常,再决定产品应该长成什么形状。
老练用户已经习惯 coding agent 的笨拙:要维护 skill files,memory 不稳定,subagent 会把「完美搭档」的幻觉拆开。
模型越快,产品越要消灭让人出戏的维护成本和设备上限。
主持人现在常并行踢出 10 到 15 个 agent,每个任务要等 30 到 45 分钟。ultra fast 会把工作流改成同时只盯三四个任务。
并行 agent 的上限不是 GPU,而是人愿意管理多少上下文切换。
他把工作分成两类:一类是高度个人化、能主动提出想法的 personal agent;另一类是接管复杂流程的智能系统。
不要用同一套交互,去同时满足「陪你」和「替你把流程跑完」。
最初用户会问为什么要合并。Tibo 的回答是:未来模型要求他们合并,底层将是同一技术、同一 harness。
合并不是减产品线,而是承认职业界面会阻碍真正的个人化。
Tibo 称 Codex 达到 2000 万用户,增长曲线后段接近垂直。被问到与 Anthropic 的竞争时,他反复把焦点拉回能力和把技术交到尽可能多的人手中。
把「我们弄坏了就补给你」做成可执行原则,比口头关心社区更有说服力。
Soul 优化 Luna 效率后,Luna 价格大约下降 80%,Terra 也降过价。Tibo 把这件事同时归因于两年前被质疑的大规模算力投入,以及用最强模型重构服务栈。
效率增益如果立刻变成用户价格和速度,就会反过来扩大下一轮研究和分发。
内部在事故响应等每一秒都重要的场景使用 ultra fast;觉得自己在做关键工作的团队也会来要。员工并不能无限制占用该容量。
速度档位首先是产品体验和容量分配问题,其次才是定价故事。
面对就业、环境和陌生感,Tibo 的回答不是抽象保证,而是指向持续降本和已经存在的个人效用。
说服犹豫的人,靠的是六个月就把前沿变成低成本日用,而不是更大的未来叙事。
OPEN QUESTIONS
节目把文化、产品和安全说得很顺,但仍留下几处没有被证据收束的张力。
节目没有给出 Codex 2000 万用户相对于对手的份额、留存或付费转化,也没有说明「社区透明」如何被独立验证。reset 按钮可以建立善意,但不能单独解释增长曲线。
同一套合并后的 harness 要同时服务这两类问题。节目没有说明何时必须打断illusion、把控制权交还人,也没有给出自动化出错时的责任边界。
这在容量规划上说得通,但节目没有披露成本、margin 或内部配额规则。听众无法判断降价主要来自算法、预购算力,还是把高档速度另开溢价。
听众听不到具体触发条件、暂停时长、或重启前后的可检验安全指标。把「我们能做出这类决定」当成制度证据,仍然偏内部自述。
这是预测,不是已发生的产品承诺。若 agent 工作越来越依赖外部工具,生成速度本身可能无法成为默认体验。
SO WHAT
把 Tibo 的组织原则和产品判断收成可以当场执行的检查项。
CHAPTERS
时间点来自 YouTube 自动字幕的分段边界,用于回听,不是官方章节。
开场:reset 按钮、不盯竞争、效率与 access
DeepMind 的 LM Chat 与发不出产品
OpenAI 的 bottoms-up 与质量原则
成熟以后如何维持自我颠覆
新语音、口述和工作流偏移
Codex 将显得 primitive:harness 与笔记本上限
并行 agent 与注意力管理
Personal AGI 对全自动系统
ChatGPT 与 Codex 合并
完美illusion、自然语言与 ambient 交互
Codex 2000 万用户与竞争问题
reset 按钮如何出现
Luna 降价、算力押注与堆栈提速
基础设施上的 recursive self-improvement
暂停前沿 RL 与 safety 投入
ultra fast 的内部用法与容量分配
低延迟创作,以及速度会不会变成默认
对焦虑用户:效率、Luna 与个人效用
一句话带走
先让技术迁就人的注意力和语音,再把省下来的成本和速度交给更多人。
方法与限制:本页基于 Matthew Berman 这期访谈的 YouTube 自动字幕(en-orig,json3)完整 101 段逐字稿整理,对应视频 00:44:28,而不是依据小宇宙 AI 中文配音二次转写。英文自动字幕未经逐词人工校对,存在专有名词和断句错误,例如把 ChatGPT 听成 Chhatra 或 LGBT,把人名和产品名切碎;Soul、Luna、Terra、ultra fast、reset 按钮和 Codex 用户数均按口述记录,公开引用前应回到原始音频核对。中文为编辑性翻译与主题重组,未调用外部翻译服务,也未做音频级复核。摘要中的「本文综合」是编辑推断,不是嘉宾原句;涉及用户量、降价幅度、提速比例、RL 暂停和一到两年速度预测,均未独立验证。
查看逐字稿