Scale 先把模型推到通用基座
AlexNet 与后来的 transformer 说明,数据、compute 和 engineering 能在架构大体公开的情况下制造巨大能力差异。
深度总结 · 基于完整逐字稿
从 deep learning 的早期突破,到 computer-use agent、forecasting system、中国开源模型与 robotics 的下一道瓶颈
真正的护城河正在从“拥有模型”转向“把不完美模型接入可验证的决策闭环”
【本文综合】Russ 一方面认为 frontier lab 的核心架构高度相似,LLM 最终会商品化;另一方面反复强调 agent 仍卡在 grounding、planning、long-horizon reliability 和真实世界数据。把两点连起来看,模型能力只是起点:能否定义可验证任务、积累高质量私有数据、控制推理成本,并把 probability 转化为 decision point,才决定系统是否产生业务价值。换言之,未来优势不是某次 benchmark 领先,而是一个能持续收集证据、暴露不确定性、让人类承担判断责任的闭环。
TL;DR
这期访谈不是在押注某一个新架构,而是在追问:当模型能力逐渐趋同时,真正稀缺的能力会转移到哪里?
Russ 判断 LLM 会逐步商品化,下一阶段的竞争将集中在 agent 可靠性、数据与工程、可校准的未来预测,以及进入物理世界所需的 robotics 数据和 manipulation 能力。
THE ARGUMENT
Russ 的论证从 deep learning 历史出发,逐步落到 agent 的可靠性、预测的可验证性,以及产品与组织如何据此形成优势。
AlexNet 与后来的 transformer 说明,数据、compute 和 engineering 能在架构大体公开的情况下制造巨大能力差异。
一旦模型必须点击正确控件、跨网页收集证据并完成长流程,grounding、planning 和可靠性成为主要瓶颈。
coding 和 math 有 unit test 或确定答案,容易形成 RL 闭环;开放式网页任务、未来预测和机器人操作则缺少同等廉价的验证信号。
一个 probability 只有在来源透明、校准可靠,并能指出人或组织可采取的动作时,才会改变决策并产生竞争优势。
DEEP DIVE
以下主题依照节目推进顺序整理,时间均对应原始英文视频。
Russ 回顾 2005 年神经网络仍被视作不严谨的第三选择,随后 deep belief network、生成模型与 AlexNet 证明了多层表征和 GPU scale 的力量。
早期技术转折并非来自口号,而是数学依据、工程实现、scale 与可重复结果的组合。
Russ 回顾早期 visual attention、image captioning 与 text-to-image 工作:小模型已经能让描述中的一个词改变整幅图像,并尝试生成训练分布中不常见的对象组合。研究重点不只是图像是否逼真,而是模型究竟在复用样本,还是学会了可组合的表征。
生成系统的早期难题已经包含今天仍在争论的核心:memorization、compositional generalization 与“理解”不能只靠一张好看的 output 判定。
Perceptual Machines 与 Apple Project Titan 的经历说明,perception 可以在短期从 0 到 80%,但 corner case、planning、地图和安全门槛会让最后阶段耗时多年。
“99% 可用”与“可无人监管”不是同一个产品状态,安全关键系统尤其如此。
VisualWebArena 等系统把网页导航变成可测试任务,但真实任务需要同时理解页面、准确 grounding、跨步骤 planning,并留下可复核证据。
agent 的价值不在会不会操作界面,而在失败是否可见、结果是否可验证、用户是否能承担错误成本。
Russ 称各 frontier lab 的基础架构仍接近 transformer,真正的大量工作集中在 infrastructure、data quality、post-training 和 reinforcement learning。
不要把模型发布的能力跃升自动解释为秘密架构;先检查数据、工程、反馈信号和推理预算。
coding agent 可以处理依赖、debug 和夜间实验恢复,让更少工程师完成更多工作;但系统出错时,仍需要理解 software engineering、ML 与产品目标的人判断方案是否正确。
AI 降低 coding 的执行成本,却提高了问题定义、验证和技术判断在岗位价值中的占比。
Soothe Labs 试图融合 structured 与 unstructured data,给未来事件提供 calibrated probability、理由和 trigger event,并用 forward testing 避免历史数据污染。
好的预测系统不是更自信地猜结果,而是校准不确定性、展示证据,并指出哪些动作能够改变结果。
crowd prediction 是强基线,因为真金白银会聚合分散信息;Russ 仍假设 AI 能凭更宽的信息处理能力胜过市场,并挑战 McKinsey、BCG 等咨询公司的研究角色。
AI 若想取代咨询,不只要预测更准,还要承担证据解释、责任分配与组织协调。
Russ 肯定 Kimi、Qwen、DeepSeek、GLM 等模型的人才与成本优势,认为 open weight 加 post-training 已成为创业公司的现实路线,并将推动 LLM 走向 commodity。
模型趋同时,竞争焦点从 benchmark 榜首转向成本、可控性、产品体验与供应链自主。
robotics 缺乏统一 hardware 和 internet-scale manipulation data,因此会比 LLM 更慢;与此同时,教育与职业策略应围绕 analytical thinking、STEM 基础和使用 AI tool 的能力。
技术会淘汰一部分操作流程,但适应能力、分析思维与真实世界判断仍是跨周期资产。
OPEN QUESTIONS
访谈提出了鲜明判断,但也保留了若干尚不能由现有证据解决的矛盾。
访谈提供的是历史经验和研究方向,而不是能区分持续 scale 与新范式需求的实验结果。
不能用单一准确率评价所有 agent;必须按错误成本、可恢复性和监督强度建立不同门槛。
访谈区分了 weight 使用与数据泄漏,却没有量化 bias、license 或供应中断的实际概率。
在长期 forward test、校准曲线和真实决策结果公开前,“胜过 crowd”仍是待验证 hypothesis。
SO WHAT
这些建议不是对未来的保证,而是从访谈论证中抽取的可执行检查项。
CHAPTERS
从 deep learning 历史到职业选择,节目形成了一条完整的技术—产品—组织链路。
开场:AGI、模型商品化与中国 AI 人才
Hinton、早期 deep learning 与生成模型
AlexNet 如何改变 computer vision
Visual attention、早期 image generation 与 generalization
Perceptual Machines、Apple 与 Project Titan
自动驾驶从 80% 到安全可用的漫长距离
CMU、Meta 与 computer-use agent
Frontier model 的架构、数据与工程
Claude Code 与软件工程岗位变化
Soothe Labs 的未来预测系统
Backtesting 污染与 forward testing
Prediction market 与咨询业
中国开源模型、post-training 与美国策略
RL environment、data business 与 SaaS
LLM 商品化与产品竞争
Self-improvement、forecasting 与 robotics
STEM 教育、analytical thinking 与适应能力
一句话带走
当模型越来越像 commodity,真正稀缺的不是生成更多答案,而是知道哪些答案可信、哪些行动能改变结果,以及失败时由谁负责。
方法与限制:本页基于原始英文节目公开的 YouTube 自动英文字幕整理,而非小宇宙中文 AI 音频的二次转写。英文字幕共有 233 个滚动合并段落,可能包含人名、公司名、断句和同音词识别错误;中文由 Codex 按 segment 一一对应翻译,未调用外部翻译服务,也未逐句回听音频。主题、因果链、tensions 与 actions 属于编辑性综合,不是嘉宾原话。时间点依据自动字幕轨道,可能有数秒偏差;任何公开引用、数字、专有名词或归因都应回到原始英文视频对应时间复核。
查看逐字稿