返回播客目录

深度总结 · 基于完整逐字稿

从 1% 问题出发,构建真正有壁垒的 AI 系统

Jeff Dean 从 TPU、推理能耗和上下文工程,谈到长时 Agent、创业机会、品味与自动化科学方法

00:57:07 AI SystemsInference HardwareContext EngineeringLong-running AgentsAI StartupsScientific AutomationTaste 与问题选择
核心洞见 · 本文综合判断,不是嘉宾原句
Jeff Dean 的“1% 法则”不是一句创业口号,而是一套从物理约束、模型边界到人类判断的三层筛选器

整期对话把三个常被分开讨论的问题接到了一起:系统层先找能耗、数据移动与延迟的数量级瓶颈;产品层再找通用模型几乎完全失败、但数据或专业反馈可以改变结果的任务;组织层最后要求人清楚定义目标、验证器与成功标准。当代码和实验执行越来越自动化,真正稀缺的不是调用模型的能力,而是选择值得解决的问题、设计可信反馈回路,并知道哪些效率提升会转化为持久价值。这是本文基于整期内容的编辑性综合,并非嘉宾原话。

TL;DR

两分钟读完

这不是一套“多写 prompt”的技巧,而是从硬件约束一路推到产品与组织决策的方法。

一句话

AI 创业和工程的可持续优势,来自找到通用模型成功率仅 0%–1% 的高价值问题,再用清晰规格、专有数据、skills、工具与快速验证器把它变成可反复改进的完整系统。

  1. Jeff Dean 判断 Agent 已能承担更长、更复杂的编码任务,并预测到 2027 年,机器学习系统会更自动地拆分问题、运行实验和组合改进结果;这是预测,不是已完成的事实。
  2. TPU 的故事说明“餐巾纸估算”的价值:先量化规模、能耗和延迟,再问是否存在数量级更好的架构,而不是沿用当前解法做局部优化。
  3. AI 系统的关键数字越来越是带宽、内存层级、互联与能耗;搬运数据可能比一次计算贵约三个数量级,batching、精度和硬件专用化都受这一约束塑造。
  4. 模型只是系统的一部分。Context engineering 通过检索、工具、记忆、skills、任务分解和评估,把问题所需的信息直接放进上下文,并帮助长时 Agent 留在更可靠的路径上。
  5. 小团队应警惕通用模型已经能完成 20% 的任务,因为该能力可能很快扩张;更有机会的是模型接近完全失败、同时团队拥有独特数据、垂直验证方法或专门模型的领域。
  6. 当执行可以交给成百上千个 Agent,清晰规格、问题品味、快速且可信的 evaluator,以及与低 ego、互补型伙伴协作,反而成为更稀缺的人类能力。

THE ARGUMENT

整期内容的一条主线

访谈中的论证可以整理成一条从底层约束到创业选择的因果链。

STEP 01

先量化真正的约束

延迟、能耗、带宽与数据移动决定系统能否扩展;数量级估算能暴露被产品语言掩盖的物理瓶颈。

STEP 02

再选择合适的专用化

TPU 在低精度 dense linear algebra 上专用化,却保留了足够的算法适应性;专用化的目标是换取巨大效率,而不是把未来锁死。

STEP 03

把模型装进完整系统

检索、工具、历史、skills、任务分解和评估共同决定 Agent 的实际能力;仅比较基础模型无法解释系统可靠性。

STEP 04

用失败率筛选创业空间

通用模型已能做一部分的任务可能很快被覆盖;接近 0%–1% 成功率、又能获得独特数据或反馈的任务,更可能给小团队留下窗口。

STEP 05

把人的注意力移到目标与验证

执行成本下降后,规格是否清楚、evaluator 是否可信、问题是否值得做,决定自动化循环是在积累能力还是快速放大偏差。

DEEP DIVE

内容提炼

以下九个主题覆盖从硬件、Agent 系统到创业与科学自动化的完整讨论。

0100:00:07–00:05:58

Agent 的时间尺度正在变长,但“能运行很久”不等于“会持续正确”

观察预测

Jeff Dean 认为模型在长时编码任务上的能力增长快于他的预期,并提出 2027 年机器学习系统可能更自动地拆解问题、运行实验和形成改进。与此同时,他把“运行数天或数周”限定在部分问题域和高能力模型上。

  • 他认为“AI 达到初级工程师水平”的旧判断在某些 agent-based coding tasks 上已经相当接近,但定义和任务范围仍会改变结论(约 00:00:35–00:01:30)。
  • 2027 年预测指向自动问题分解、自动实验循环与结果组合,也可能扩展到目标可测量的科学和工程任务(约 00:01:51–00:02:47)。
  • 长时 Agent 的例子包括把软件重写到具有不同安全或性能属性的语言;访谈没有提供系统性成功率或成本数据(约 00:04:55–00:05:58)。

评估长时 Agent 时,除了运行时长,还要记录任务完成率、偏离点、恢复成本和最终可验证性。

0200:02:40–00:10:25

“餐巾纸估算”把模糊机会改写成数量级问题

历史解释行动框架

从 2001 年把 Google 搜索索引放进内存,到 2013 年估算语音识别会迫使服务器规模翻倍,关键动作都是先建立粗略但足以改变方向的规模模型,再寻找与现有方案完全不同的架构。

  • 内存化搜索把磁盘访问问题变成 RAM 容量问题,团队在意识到条件已变化后迅速重写并上线系统(约 00:02:40–00:03:37)。
  • 语音模型把错误率大幅降低,却可能因使用量增长造成不可承受的计算需求;TPU 由此选择低精度 dense linear algebra,换取约 30–80 倍能效和 20–30 倍延迟改善(约 00:05:58–00:08:53)。
  • Jeff Dean 建议创业者先找 bottleneck,再从 first principles 追问是否存在一个或两个数量级的替代方案(约 00:09:20–00:10:25)。

先写下单位请求的资源成本、规模上限和延迟预算,再讨论模型或产品方案。

0300:10:25–00:16:11

AI 的底层单位越来越接近能量与数据移动,而不只是 FLOPs

解释工程判断

访谈为传统 latency numbers 增加了 AI 版清单:内存带宽、片上存储、芯片互联、精度和能耗。搬运数据的成本远高于计算,解释了 batching、低精度和推理硬件专用化为何成为系统设计核心。

  • 需要掌握 HBM 到片上存储、乘法单元与多芯片互联的带宽,以及规模从数百芯片扩展到上万芯片时的网络退化(约 00:10:25–00:12:21)。
  • 访谈给出的量级是:把数据送进处理器的能耗可能比一次运算高约一千倍;batching 用更多样本或 token 分摊这一成本(约 00:12:18–00:14:34)。
  • 训练可以容忍吞吐优先,而交互式推理更需要低延迟,因此专门化精度和减少数据移动仍有巨大空间(约 00:14:33–00:16:11)。

把 p50/p99 延迟、每 token 能耗和每层数据移动纳入产品指标,避免把系统瓶颈误判为模型能力不足。

0400:16:11–00:25:21

Context engineering 的本质,是把隐性经验变成 Agent 可执行的路径

主张案例

模型、检索、工具、历史与评估共同组成完整系统。Jeff Dean 用 Google 内部性能优化 skill 说明:把人的测量—修改—复测流程写成机器可执行的指导,可以让 Agent 迭代改进;对长任务,则需要 skills、多分支搜索和 evaluator 控制偏离。

  • 直接进入 context 的信息比混在训练数据中的知识更清晰;Agent 还需要知道何时调用工具、如何分解任务并比较多个方案(约 00:16:11–00:18:40)。
  • 他和 Sanjay Ghemawat 把 microbenchmark、代码修改、缓存占用和性能复测写成 skill,让模型按人类工程师的流程循环优化(约 00:19:46–00:21:43)。
  • 长时任务会因分布外步骤和误差累积而退化;skills 可限制搜索区域,多 Agent 与 evaluator 可保留更有希望的分支(约 00:22:13–00:25:21)。

把一次成功操作沉淀为可重放的步骤、检查项和停止条件,而不是只保存一段效果不错的 prompt。

0500:25:21–00:31:19

小团队的机会位于通用模型的盲区,而不是它正在快速补齐的边缘

主张创业框架

Google 会继续扩展通用模型和基础设施,小团队则可在界面、数据、skills 或垂直模型上做到更准确、更愉悦。但这种机会必须考虑模型能力在未来 6–12 个月内追上的风险。

  • Jeff Dean 首先要求问题本身有用且让团队真正兴奋;缺少内在动机和用户价值,比技术竞争更早导致失败(约 00:27:26–00:28:23)。
  • 他的筛选标准是寻找通用模型成功率约 0% 或 1% 的任务,而不是已经能完成 20% 的任务(约 00:28:22–00:29:18)。
  • 个人数据、难以公开获得的领域数据,以及 AlphaFold 式的高精度专用模型,可能形成通用模型暂时无法复制的能力(约 00:29:15–00:31:19)。

用真实基准测出模型当前失败率,并写出优势为何能维持 6、12 和 24 个月;“模型今天不够好”本身不是壁垒。

0600:31:19–00:36:36

当 Agent 承担实现,规格与品味成为新的稀缺资源

主张行动框架

清楚表达目标的价值在 Agent 时代上升:模糊任务迫使系统猜测意图,明确规格则给出可执行约束。代码跨语言迁移之所以表现好,是因为原实现和测试构成了高密度规格。再往上,真正稀缺的是决定让 Agent 做什么。

  • 规格应说明目标、规则、边界和验收方式;Agent 虽能追问,但通常缺少人类同事已有的上下文(约 00:31:19–00:33:21)。
  • Python 到 Go 的迁移可复用实现、测试与行为差异作为 evaluator,因此比开放式需求更容易验证(约 00:32:53–00:34:15)。
  • Jeff Dean 把 taste 定义为选择值得投入的问题;他建议记录对未来 12 个月的判断并复盘,以增加问题选择的经验样本(约 00:34:11–00:36:36)。

在启动 Agent 前先写验收测试和“为什么这个问题值得做”;执行自动化不会替代目标选择。

0700:36:36–00:42:08

思想实验的价值,是暂时移除行业默认前提,再用系统设计检验后果

案例方法

访谈用“每天出错 20 次的晶体管”探索极端不可靠硬件,并回顾 TPU 与 MapReduce 如何源于重新审视既定假设。思想实验并不保证正确,但能暴露长期设计选择中被遗忘的约束。

  • 如果晶体管极不可靠,系统可能转向多路径传输和更高层冗余,类似分布式存储用不可靠部件构造可靠服务(约 00:36:36–00:39:33)。
  • Jeff Dean 明确说这不是立即执行的方案;许多旧设计有充分理由,但应定期重新验证这些理由(约 00:39:04–00:39:33)。
  • MapReduce 把并行化、checkpoint 和容错下沉到统一抽象,让业务逻辑摆脱重复的分布式系统代码(约 00:40:24–00:42:08)。

先把关键假设反转,再列出新架构必须满足的可靠性、成本和可制造性条件;思想实验要落到可证伪的约束。

0800:42:08–00:47:49

自动化科学方法的瓶颈,往往是 evaluator 的速度和可信度

预测科学方法

AlphaChip、AlphaEvolve 和自动实验循环展示了 AI 构建 AI 的路径:高层目标被拆成子问题,每个子问题运行大量实验,再组合成整体方案。要让循环真正加速,验证结果的装置也必须足够快。

  • 自动化把提出实验、实现、评估和整合的循环延迟降下来,可扩展到模型设计、芯片、工程与科学(约 00:42:08–00:44:22)。
  • 量子化学案例用昂贵模拟器的输入输出训练近似模型,把一次验证从一晚缩短约 30 万倍,同时声称保持接近的准确度(约 00:44:20–00:46:06)。
  • 模型自我改进仍需要人给出高层方向、选择实验尺度,并以单位计算量的发现效率衡量循环(约 00:46:30–00:47:49)。

优化实验生成器之前,先测 evaluator 的延迟、误差和失效边界;快速的错误评价只会更快地把搜索带偏。

0900:47:49–00:57:07

职业与团队选择最终回到影响、伙伴和持续学习

经验价值判断

从蒸馏论文被拒,到选择大组织或创业公司,Jeff Dean 的标准不是短期认可,而是问题成功后是否让世界显著变好、是否能与喜欢且互补的人一起工作,以及是否持续增加解决未来问题的工具。

  • 蒸馏工作因被认为影响有限而遭拒,但团队理解大模型服务的成本问题,随后通过 arXiv 传播并在 Gemini Flash 等系统中继续使用(约 00:47:49–00:50:01)。
  • 大组织提供平台、结构和大量专家,小团队提供更大自主性与风险;两者都应接受“最佳结果发生时,影响是否足够大”的检验(约 00:50:00–00:53:08)。
  • 理想伙伴低 ego、互补且愿意共同学习;未来问题包括高效推理硬件、数据高效学习、continual learning、多 Agent 协作和更好的公共讨论(约 00:53:06–00:57:07)。

用“成功后的世界是否明显不同”筛选项目,并选择能共同扩展技能工具箱的伙伴。

OPEN QUESTIONS

尚未解决的张力

访谈给出了方向性框架,但这些关键张力仍需要数据与治理设计来回答。

0%–1% 机会与快速移动的能力边界

通用模型完全失败的任务给小团队留下差异化空间VS新数据、规模和工具可能在数月内把盲区变成基础能力

“今天失败”只是筛选起点,不代表壁垒持久。访谈没有给出判断能力追赶速度的量化方法,团队仍需验证数据独占性、反馈回路和工作流嵌入是否可防御。

长时 Agent 与误差累积

更长运行时间让系统处理重写软件和复杂实验等任务VS分布外步骤、工具错误和错误目标会在几十次交互后累积

Skills、多 Agent 搜索和 evaluator 能提高可靠性,但也增加推理成本、延迟和系统复杂度。访谈没有展示数天任务的端到端成功率与人工监督量。

快速近似验证与科学可信度

学习得到的 surrogate evaluator 可把实验循环加速多个数量级VS近似模型可能在真正有价值的新区域分布外失效

科学加速需要持续用高保真模拟或真实实验校准近似器,并报告置信度和失效边界;速度不能替代可复现性。

硬件专用化与算法演进

更窄的精度和数据路径能显著改善能耗与延迟VS过度专用化会在模型结构变化时失去适用性

TPU 的经验恰好说明折中:专用到 dense linear algebra,却保留算法可编程性。未来推理芯片仍需判断哪些假设足够稳定。

自动自我改进与目标控制

自动问题分解和实验搜索可以提高单位计算量的发现速度VS系统只会优化被给定的 measurable objective,而目标可能不完整或带偏

访谈强调 taste 和高层 steering,却没有展开目标冲突、外部性与责任分配。越强的自动循环越需要明确停止条件和独立审查。

SO WHAT

可执行启示

把访谈转成下一周能执行的工作,而不是停在宏观判断。

FD

AI 创业者与产品负责人

  • 建立 30–50 个真实任务的基准,记录通用模型成功率;优先调查接近 0%–1% 且用户价值明确的失败簇。
  • 为候选机会分别写出数据优势、专用 evaluator、工作流嵌入和 6/12/24 个月能力追赶假设。
  • 在做模型微调前,先验证更好的界面、检索、tools 和 skills 是否已经能达到目标。
AG

Agent 与工程平台团队

  • 从失败日志提取高频偏离点,把专家处理流程写成含前置条件、步骤、检查和停止规则的 skill。
  • 分别测量 10、50、100 次工具交互后的任务成功率、人工介入次数和成本,而不是只展示最长运行时间。
  • 对高风险任务采用多分支尝试与独立 evaluator,并保留每个分支被淘汰的证据。
SY

系统、推理与硬件工程师

  • 为核心路径写一页 napkin model:请求量、内存带宽、每 token 数据移动、能耗、p50/p99 延迟和成本上限。
  • 区分训练吞吐与交互推理延迟,明确 batching 在能效和响应时间之间的代价。
  • 提出专用化方案时,同时列出算法改变后仍能工作的部分,避免把短期模型结构写死进硬件。
RS

研究者与科学计算团队

  • 找出实验循环中最慢的 evaluator,评估是否能用历史高保真数据训练近似验证模型。
  • 为 surrogate 设计分布外检测、置信区间和定期回到真实实验或高精度模拟器的校准机制。
  • 用单位计算量的有效发现数衡量自动实验系统,而不是只统计生成了多少候选。
LD

技术负责人和个人贡献者

  • 写下未来 12 个月最重要的 10 个技术判断,并在到期后复盘命中、遗漏和错误原因。
  • 启动项目之前回答:如果最佳结果实现,用户或世界会发生什么可观察变化?
  • 组建小团队时同时考察专业能力、低 ego、互补性和共同学习意愿。

CHAPTERS

节目时间轴

时间轴沿用 Y Combinator 官方章节,并以原始 57:07 视频为准。

AI 模型是否已达到初级工程师水平

能自动改进自身的 AI 系统

把搜索索引放进内存的 Google 突破

Agent 将运行数天甚至数周

催生 TPU 的餐巾纸估算

如何寻找数量级突破

AI 工程师的新 latency numbers

AI 系统为何首先是能耗问题

Context engineering 成为新前沿

让 Agent 学会性能优化的 skill

长时 Agent 为什么会跑偏

小团队仍能胜过 Google 的地方

如何成为 AI-native founder

质疑最大的默认假设

让 AI 构建更好的 AI

拒稿、蒸馏与继续推进

选择真正值得投入的问题与伙伴

一句话带走

当执行越来越便宜,决定做什么、用什么尺度验证,以及何时相信结果,才是稀缺能力。

方法与限制:本页基于 Y Combinator 官方 YouTube 的完整 en-orig 自动字幕整理,共 130 个带时间戳段落,并用 Root Access 发布的官方英文 transcript、官方章节和小宇宙节目说明交叉核对人物、主题与结构。原始视频时长 00:57:07,小宇宙 AI 中文译制版标注约 43 分钟,存在明显压缩,因此未对译制音频二次 ASR,也未把译制文本视为原始发言。ArkCLI ASR 未调用,prompt、completion 与 total Token 用量均为 0。逐字稿保留自动字幕文本,仍可能误识别人名、术语、说话人和断句;精确引用、技术数值或公开出版前必须回到官方 transcript 与视频对应时间复核。中文 Insight、TL;DR、themes、tensions、actions 和因果链是编辑性综合,不是嘉宾逐句翻译或原话;关于 2027、长时 Agent、自我改进模型和未来硬件的内容包含预测。

查看逐字稿