返回播客目录

深度总结 · 基于完整逐字稿

Russ Salakhutdinov:AI Agent、未来预测与模型商品化

从 deep learning 的早期突破,到 computer-use agent、forecasting system、中国开源模型与 robotics 的下一道瓶颈

01:44:14 AI AgentComputer UseForecastingOpen Source LLMSoftware EngineeringRobotics
核心洞见 · 本文综合判断,不是嘉宾原句
真正的护城河正在从“拥有模型”转向“把不完美模型接入可验证的决策闭环”

【本文综合】Russ 一方面认为 frontier lab 的核心架构高度相似,LLM 最终会商品化;另一方面反复强调 agent 仍卡在 grounding、planning、long-horizon reliability 和真实世界数据。把两点连起来看,模型能力只是起点:能否定义可验证任务、积累高质量私有数据、控制推理成本,并把 probability 转化为 decision point,才决定系统是否产生业务价值。换言之,未来优势不是某次 benchmark 领先,而是一个能持续收集证据、暴露不确定性、让人类承担判断责任的闭环。

TL;DR

两分钟读完

这期访谈不是在押注某一个新架构,而是在追问:当模型能力逐渐趋同时,真正稀缺的能力会转移到哪里?

一句话

Russ 判断 LLM 会逐步商品化,下一阶段的竞争将集中在 agent 可靠性、数据与工程、可校准的未来预测,以及进入物理世界所需的 robotics 数据和 manipulation 能力。

  1. 【观察】从 AlexNet 到今天,scale、数据质量、工程和 infrastructure 往往比“秘密新架构”更能解释能力跃迁(00:07:08–00:10:40;00:49:57–00:53:36)。
  2. 【观察】computer-use agent 已能完成网页研究与跨应用操作,但最佳系统在其长任务 benchmark 上仍只有约 60%–65%,离可委托所需的高可靠性很远(00:35:40–00:49:57)。
  3. 【主张】forecasting system 不应只给一个 outcome,还要给 calibrated probability、来源和可改变结果的 decision point(00:59:30–01:09:17)。
  4. 【主张】中国开源模型为学术界和创业公司提供低成本 post-training 基座,但跨国依赖也会引入知识偏差与供应风险(01:19:14–01:25:52)。
  5. 【预测】LLM 会趋向 commodity,差异转向产品整合、易用性与 intelligence per token;纯 coder 岗位承压,但兼具 judgment、ML 理解与 coding 能力的人仍稀缺(00:55:51–00:59:30;01:28:33–01:33:04)。
  6. 【预测】robotics 会成为重要投资方向,却会因缺少 universal hardware、internet-scale 操作数据和可靠 manipulation 而比 LLM 更慢兑现(01:33:04–01:37:34)。

THE ARGUMENT

整期内容的一条主线

Russ 的论证从 deep learning 历史出发,逐步落到 agent 的可靠性、预测的可验证性,以及产品与组织如何据此形成优势。

STEP 01

Scale 先把模型推到通用基座

AlexNet 与后来的 transformer 说明,数据、compute 和 engineering 能在架构大体公开的情况下制造巨大能力差异。

STEP 02

Agent 把能力暴露给真实任务

一旦模型必须点击正确控件、跨网页收集证据并完成长流程,grounding、planning 和可靠性成为主要瓶颈。

STEP 03

可验证反馈决定改进速度

coding 和 math 有 unit test 或确定答案,容易形成 RL 闭环;开放式网页任务、未来预测和机器人操作则缺少同等廉价的验证信号。

STEP 04

Decision point 才把预测变成价值

一个 probability 只有在来源透明、校准可靠,并能指出人或组织可采取的动作时,才会改变决策并产生竞争优势。

DEEP DIVE

内容提炼

以下主题依照节目推进顺序整理,时间均对应原始英文视频。

0100:01:23–00:11:36

Deep learning 的早期反共识与 scale 转折

观察

Russ 回顾 2005 年神经网络仍被视作不严谨的第三选择,随后 deep belief network、生成模型与 AlexNet 证明了多层表征和 GPU scale 的力量。

  • Geoffrey Hinton 对深层模型的数学论证和研究热情,促使 Russ 从金融业回到 University of Toronto 攻读博士。
  • AlexNet 在 ImageNet 上的大幅提升最初好到令人怀疑,几个月后才被社区接受,并推动 Google、学术界和主要实验室全面转向 deep learning。

早期技术转折并非来自口号,而是数学依据、工程实现、scale 与可重复结果的组合。

0200:11:36–00:19:37

从 image captioning 到生成:hallucination 也是 generalization 测试

观察主张

Russ 回顾早期 visual attention、image captioning 与 text-to-image 工作:小模型已经能让描述中的一个词改变整幅图像,并尝试生成训练分布中不常见的对象组合。研究重点不只是图像是否逼真,而是模型究竟在复用样本,还是学会了可组合的表征。

  • 把 rainy sky 改成 blue sky 会同时改变背景与整幅 pixel distribution,展示文字条件能够控制生成,而不仅是检索相似图片(约 00:12:30–00:13:30)。
  • “草地里的马桶”生成图后来被 Google Images 排到真实照片之前,说明点击驱动的 ranking 会放大新奇内容,却不能证明系统理解了内容(约 00:14:20–00:16:20)。
  • 团队依赖 MS COCO 等公开 labeled dataset,并用 cow-on-a-beach、不同视角和背景检验模型是否真正 generalize;这里的 hallucination 被当作创造新组合的能力,而非单纯错误(约 00:16:20–00:19:20)。

生成系统的早期难题已经包含今天仍在争论的核心:memorization、compositional generalization 与“理解”不能只靠一张好看的 output 判定。

0300:19:37–00:34:19

从感知系统到自动驾驶的最后 20%

观察主张

Perceptual Machines 与 Apple Project Titan 的经历说明,perception 可以在短期从 0 到 80%,但 corner case、planning、地图和安全门槛会让最后阶段耗时多年。

  • 塑料袋、植被、施工锥桶、天气和并线博弈,都可能让早期系统在看似简单的现实场景中失败。
  • Waymo 用 LiDAR 与高精地图换取更强感知,Tesla 依赖 camera 与规模化车队数据;两条路线分别承担成本、外观、泛化与安全的权衡。

“99% 可用”与“可无人监管”不是同一个产品状态,安全关键系统尤其如此。

0400:34:19–00:49:57

Computer-use agent:从演示到可靠委托

观察主张

VisualWebArena 等系统把网页导航变成可测试任务,但真实任务需要同时理解页面、准确 grounding、跨步骤 planning,并留下可复核证据。

  • 找最低价 iPhone、整理美国高校招聘信息或跨 app 核对订单,都要求 agent 真正执行,而不是只声称“已经完成”。
  • 优惠券搜索是适合早期落地的低风险任务;课程审核等长流程一旦要求稳定完成,现有模型仍不够可靠。

agent 的价值不在会不会操作界面,而在失败是否可见、结果是否可验证、用户是否能承担错误成本。

0500:49:57–00:55:51

模型创新的核心:架构相近,数据与工程拉开差距

观察主张

Russ 称各 frontier lab 的基础架构仍接近 transformer,真正的大量工作集中在 infrastructure、data quality、post-training 和 reinforcement learning。

  • coding 之所以进步快,是因为 unit test 能提供明确 reward,人工注入 bug 还能持续生成 verifiable training task。
  • synthetic data 和多模型过滤可以扩大训练材料,但是否已触及 scaling law 饱和点仍没有定论。

不要把模型发布的能力跃升自动解释为秘密架构;先检查数据、工程、反馈信号和推理预算。

0600:55:51–00:59:30

软件工程:人数压缩与 judgment 升值同时发生

观察预测

coding agent 可以处理依赖、debug 和夜间实验恢复,让更少工程师完成更多工作;但系统出错时,仍需要理解 software engineering、ML 与产品目标的人判断方案是否正确。

  • Russ 预计部分团队会从十名 programmer 缩减到三至五名,研究 iteration 也会明显加速。
  • 仅执行修复的人更容易被替代;能指出“需求或方案本身错了”的 engineer 仍会稀缺。

AI 降低 coding 的执行成本,却提高了问题定义、验证和技术判断在岗位价值中的占比。

0700:59:30–01:13:45

Forecasting system:从概率到可行动的决策点

主张预测

Soothe Labs 试图融合 structured 与 unstructured data,给未来事件提供 calibrated probability、理由和 trigger event,并用 forward testing 避免历史数据污染。

  • 学生能否按时毕业的例子中,系统发现 proposal 与 defense 必须相隔 12 个月,并指出申请 waiver 可把预测概率从 13% 提高到约 80%。
  • backtesting 容易因网页后来被修改而泄漏未来信息;真正的 forecasting 只能提前下注,再等待现实验证。

好的预测系统不是更自信地猜结果,而是校准不确定性、展示证据,并指出哪些动作能够改变结果。

0801:13:45–01:19:14

Prediction market、咨询业与 AI 的决策竞争

观察主张预测

crowd prediction 是强基线,因为真金白银会聚合分散信息;Russ 仍假设 AI 能凭更宽的信息处理能力胜过市场,并挑战 McKinsey、BCG 等咨询公司的研究角色。

  • prediction market 的限制是问题范围受交易热度驱动,且通常不给出概率背后的 reasoning。
  • 咨询公司的价值不只有准确预测,还包括为 CEO 的重大决策提供组织性背书;这部分“保险”功能不一定随分析自动化一起消失。

AI 若想取代咨询,不只要预测更准,还要承担证据解释、责任分配与组织协调。

0901:19:14–01:33:04

中国开源模型与 LLM 商品化

观察预测

Russ 肯定 Kimi、Qwen、DeepSeek、GLM 等模型的人才与成本优势,认为 open weight 加 post-training 已成为创业公司的现实路线,并将推动 LLM 走向 commodity。

  • 低成本 base model 让 startup 拥有、定制并隔离自己的模型;来源国并不意味着推理时数据自动外泄。
  • 但 general knowledge 与 creative task 可能带有文化或政治 bias;一个国家的产业完全依赖另一国模型,会形成战略风险。
  • 当 10% 成本可获得约 90% 能力时,业务选择会转向 intelligence per token、产品整合、易用性与迁移成本。

模型趋同时,竞争焦点从 benchmark 榜首转向成本、可控性、产品体验与供应链自主。

1001:33:04–01:44:14

Robotics 与人才:数据瓶颈下的长期适应

观察预测主张

robotics 缺乏统一 hardware 和 internet-scale manipulation data,因此会比 LLM 更慢;与此同时,教育与职业策略应围绕 analytical thinking、STEM 基础和使用 AI tool 的能力。

  • Roomba 与 self-driving car 是少数真正产生消费或现实价值的机器人;humanoid demo 尚未证明可可靠完成多任务操作。
  • 数学、data structure 和 computer science 的价值不只在具体知识,而在 reasoning;能把这种能力与 AI tool 结合的人会显著加快 iteration。

技术会淘汰一部分操作流程,但适应能力、分析思维与真实世界判断仍是跨周期资产。

OPEN QUESTIONS

尚未解决的张力

访谈提出了鲜明判断,但也保留了若干尚不能由现有证据解决的矛盾。

Scale 仍有效,还是回报已接近饱和?

历史上的主要能力跃迁与数据、compute 和 engineering scale 密切相关。VS高质量公开数据有限,synthetic data 可能放大模型自身偏差;Russ 也明确承认无法判断 scaling law 是否饱和。

访谈提供的是历史经验和研究方向,而不是能区分持续 scale 与新范式需求的实验结果。

99% 的 agent 成功率是否已经有商业价值?

优惠券搜索、资料整理等低风险任务即使偶尔失败,也能节省大量时间。VS自动驾驶、财务操作和长流程任务中,极少数失败就足以抵消收益,甚至造成不可接受的损失。

不能用单一准确率评价所有 agent;必须按错误成本、可恢复性和监督强度建立不同门槛。

开放模型的效率红利与主权风险

中国 open model 降低研究和创业成本,支持可控的 post-training,也扩大了学术访问。VS知识偏差、政策约束、模型许可和跨国供应依赖,可能在 general-purpose application 中累积为系统风险。

访谈区分了 weight 使用与数据泄漏,却没有量化 bias、license 或供应中断的实际概率。

AI 能否真正胜过 prediction market 与咨询组织?

AI 能同时处理更广的数据,并为大量长尾问题生成 reasoning 与 probability。VS市场包含真金白银与可能的 insider signal,咨询公司还提供责任背书和组织协调,不只是预测。

在长期 forward test、校准曲线和真实决策结果公开前,“胜过 crowd”仍是待验证 hypothesis。

SO WHAT

可执行启示

这些建议不是对未来的保证,而是从访谈论证中抽取的可执行检查项。

AG

Agent 产品团队

  • 按任务错误成本分层:先上线可恢复、可人工复核的低风险工作流,再逐步提高 autonomy。
  • 要求 agent 保留访问过的 source、tab、操作日志和失败状态;禁止把“自称完成”当作成功。
  • 用 long-horizon end-to-end completion rate,而不是单步点击率,作为上线门槛。
CT

技术负责人

  • 对每个模型记录 quality、latency 与 cost per successful task,而不只比较 token 单价。
  • 为 coding、math 等 verifiable domain 建立自动检查;对开放式任务明确 human review 与回滚路径。
  • 评估 open model 时同时检查 license、bias、安全隔离和替代供应商,避免把低推理成本误当作零依赖风险。
FP

战略与预测团队

  • 预测发布前冻结 source 与 cutoff time,防止后续网页修改污染 backtest。
  • 同时输出 calibrated probability、支持/反对证据、关键 decision point 和 resolution rule。
  • 维护 forward-testing ledger,用真实到期结果计算 calibration,而不是只展示挑选后的成功案例。
SE

工程师与学生

  • 继续训练 data structure、statistics、debugging 和系统设计等 analytical foundation。
  • 把 AI tool 纳入日常 workflow,但保留独立验证依赖、测试、性能和安全边界的能力。
  • 把职业差异化放在问题定义、技术 judgment 和跨领域理解,而不只追求手写代码速度。

CHAPTERS

节目时间轴

从 deep learning 历史到职业选择,节目形成了一条完整的技术—产品—组织链路。

开场:AGI、模型商品化与中国 AI 人才

Hinton、早期 deep learning 与生成模型

AlexNet 如何改变 computer vision

Visual attention、早期 image generation 与 generalization

Perceptual Machines、Apple 与 Project Titan

自动驾驶从 80% 到安全可用的漫长距离

CMU、Meta 与 computer-use agent

Frontier model 的架构、数据与工程

Claude Code 与软件工程岗位变化

Soothe Labs 的未来预测系统

Backtesting 污染与 forward testing

Prediction market 与咨询业

中国开源模型、post-training 与美国策略

RL environment、data business 与 SaaS

LLM 商品化与产品竞争

Self-improvement、forecasting 与 robotics

STEM 教育、analytical thinking 与适应能力

一句话带走

当模型越来越像 commodity,真正稀缺的不是生成更多答案,而是知道哪些答案可信、哪些行动能改变结果,以及失败时由谁负责。

方法与限制:本页基于原始英文节目公开的 YouTube 自动英文字幕整理,而非小宇宙中文 AI 音频的二次转写。英文字幕共有 233 个滚动合并段落,可能包含人名、公司名、断句和同音词识别错误;中文由 Codex 按 segment 一一对应翻译,未调用外部翻译服务,也未逐句回听音频。主题、因果链、tensions 与 actions 属于编辑性综合,不是嘉宾原话。时间点依据自动字幕轨道,可能有数秒偏差;任何公开引用、数字、专有名词或归因都应回到原始英文视频对应时间复核。

查看逐字稿