返回目录

Cosmos 3 与“造市场”:刘洺堉的世界模型、研究管理和英伟达方法论

从 GAN、Sora 触发的反思到 Physical AI:一场关于研究选择、统一多模态模型、组织协作与长期主义的 3 小时 36 分对谈

这一期在说什么

这不是一场只追求模型第一名的访谈,而是一套把研究变成基础设施、把基础设施变成新市场的完整逻辑

本文综合:刘洺堉把自己的二十年研究路径概括为三个扩展——从数学优雅转向真实问题,从完成工作转向让组织理解其价值,从个人成果转向让数百人围绕同一 mission 做出分布式决策。Cosmos 3 正是这种方法的集中体现:以 language、image/video、audio 与 action 描述同一个物理世界,用统一的世界基础模型为机器人、自动驾驶和工厂开发者提供 Better Data、Better Starting Point 与未来可能的 Better Environment。英伟达的商业回报并非把所有下游产品据为己有,而是扩大在其计算与软件生态上生长的 Physical AI 市场。这个逻辑有明确边界:模型统一不等于所有客户场景统一,开放也不等于没有平台利益;多项行业判断仍是受访者的预测,而不是已经发生的结果。

一句话

刘洺堉用 Cosmos 3 说明一种“研究即基础设施”的路线:统一理解、生成、仿真和 action,开源给 Physical AI 开发者,并用 mission、快速迭代与长期投入把数百人的研究组织聚合起来。

Cosmos 3 · Physical AI · 世界基础模型 · NVIDIA 研究与产品 · 大规模研究管理 · 开放模型生态

Insight

企业研究的正当性不只来自前沿论文,还来自它能否减少基础设施决策与未来应用之间的信息差。

  1. 节目中称其直接团队约 80–90 人,跨团队参与 Cosmos 的规模约 200–300 人;这是受访者给出的数量级,不是人员名册审计(约 00:04–00:06)。
  2. DALL·E 出现后,他向 Jensen Huang 争取约 1,000 张 A100,并与 Getty Images、Shutterstock 形成数据与模型合作(约 00:12–00:17)。
  3. Sora 让他再次反思判断与执行时机,并推动生成式研究团队共同向公司提出 world simulator 方向;对 OpenAI 后续资源分配的解释是他的外部推测(约 00:17–00:22)。
  4. 开源模型在他看来不是与客户抢 solution,而是替具身智能公司分担通用模型成本,让其资源集中在硬件、领域数据和商业落地(约 00:24–00:28)。

小俊 hello 大家好我是小俊。今天我在上海谈话对象是英伟达的研究副总裁刘明玉我们的谈话时间是黄仁勋刚刚访华之后的一个月明宇给我的印象一直是穿着很朴素背着一个有点旧的斜挎包态度很谦和。不过英伟达内部的人告诉我他不像是一个典型的研究者更像是一个工程上的领导者黄仁勋给他一个评价是 GSD getting shit done 不久前刘明宇带领团队刚刚发布了英伟达的世界模型 Cosmos 三。所以在这次访谈中我们聊了聊 cosmos 三世界模型。同时也聊到一名研究者长达二十年的求索而这名研究员的身份很特殊他身处在英伟达这样一个基础设施型的巨大的系统之中这改变了。他的很多研究思路。当然我们也很不自觉地聊了一些关于英伟达和黄仁勋的内部的故事明宇说做模型就要 low ego 模型竞争不应该是一场游于游戏。那接下来就是我对英伟达研究副总裁刘明宇的访谈。

嘉宾 Jensen 常常在讲就是他喜欢这种 zero billion dollar business 你可以是啊。不赚钱但当这个生意成功的时候必须是很influential 的是很巨大的。

小俊 嗯

嘉宾 经济的啊。茂盛程度是根据钱多快从一个人的口袋流到。另外口袋那研究的茂盛程度应该是啊。根据 idea 多快从一个人的脑袋流到。另外一个人的脑袋去我们做完 cosmos 一的时候问那个 Jensen 要不要?继续往下做。

小俊 嗯

嘉宾 然后 Jensen 跟我说你就做到 cosmo 九十七。因为他是一个很有纪律的人有些东西即使很重要他会叫 you pace pace your steps 就是让你不要急他擅长打马拉松战他每天都觉得公司只剩下三十天的现金流三十天后就要破产。

小俊 你刚好加入英伟达十年了。

嘉宾 是的

小俊 这十年你变化大吗?你在英伟达的这个股票涨了多少倍了一共。

嘉宾 hello 明宇要不跟观众朋友们先打个招呼。

小俊 线上的朋友大家好我是刘明。玉。

嘉宾 嗯。因为刚才我们也聊到你到美国了二十年。然后在英伟达了十年你现在讲中文还多吗?在公司里面。

小俊 就是有时候会讲中文但大部分时候还是讲英文。因为大部分的时候啊。团队里嗯。还是很多人不会讲中文。

嘉宾 嗯

小俊 然后。所以沟通上就是以英文为主但如果说在一个小组会议里面参与的都是讲中文的那很自然而然就会切换到中文模式。

嘉宾 嗯。这次你来中国的行程是什么样的你多久会来一次中国。

小俊 我现在大概是每一年会来二到三次中国对。因为我主要的啊。公司给我的任务我个人的兴趣在 physical AI在中国这里啊 physical AI 的发展是非常的茂盛啊。很多公司啊。很多研究员在做出啊。重大的突破我们在这里跟大家交流也理解下我们如何可以帮到他们。

嘉宾 这次来感觉到有什么不一样吗?跟之前。

小俊 这次来啊。我看到是啊。越来越多的啊。关于手啊。灵巧手在这个关键的科技上面做出突破。然后去啊。去追求下一个 physical AI 可以达到的一些重点能力就是跟上次来发觉就是速度非常的快进展非常的快。然后每次都学到很多东西。

嘉宾 这应该是你第一次做一个中文的 podcast 我想能帮助观众或者听众朋友们建立一个印象你现在在英伟达的 title 是研究副总裁能不能?介绍一下这个职位。然后以及你们团队的一些构造和人数。

小俊 我现在是研究副总裁。另外也是 Cosmos lab 的副总裁那我们的团队呢?就是研究员加工程师属于我这里的大约有八九十人啊。那。另外公司还有其他的团队也是在做 Cosmos英文叫 data line 虽然它不直接 report 给我。但是是我是整个 mission 的 overall pick 就是发号司令的人啊。然后决定方向的人。所以这些人是啊。就是遵循我的指示啊。就是跟这个团队一起合作把目标给推出去整个过做 Cosmos 的人应该有两到三百人之间呃这是一个呃在英伟达里面很重大的一个呃一个专案呃我们花很多资源这样的人员投入是我们觉得需要的。然后做出好的成果。

嘉宾 我看到你之前还管一个团队叫 Deep ImaginationA Research Group Cosmos 是它演化来的吗?它们是什么关系啊。

小俊 是的嗯。我大概是十年前的时候加入英伟达那呃我在加入英伟达的时候呃我的目标就是啊。我那时候给 job talk 啊。在跟英伟达推销我自己的时候我的 job talk 讲的是那是四年前我讲的是说有一天最主要生成视频的运算将会是 deep learning 而不会是传统的 computer graphics在那时期啊。就是电脑特效电影特效啊。用这种 graphics 传统的 graphic pipeline 去生成漂亮的 graphics 啊。是主流。然后我是在领。域里面早期认为就是 deep learning 是未来的趋势那我记得那时候呃我跟我的 chief scientist Bill Dally 呃在那时候的 presentation我的 presentation 里面就是讲 deep learning 因为它是 data driven 然后它可以做到很多传统 graphics 可以做不到的事情比如说我有一天可以把就是小说啊。当成是 input 放进这个 deep learning 就会产出啊。电影。然后呃你可以做很多啊。

现在传统 graphics 需要大量人力才能做出来的这些控制那时候我呃就公司对这个东西很有兴趣我就很荣幸地加入了 NVIDIA进去之后呢?我就一直朝着这方向努力但那时期最主要的这个模型呢?是有 generative adversarial network 啊。就是对抗生成网络。

嘉宾 嗯

小俊 那我是此领。域里早期去从事这个对抗生成网络研究的人那我就在里面一直做这方面的研究我做了几个呃我自己很感到骄傲的这个工作啊。其中一个就是嗯。我是最早。提出这个可以做这种我们叫做unsupervised 或是 unpaired 的 image translation 在 AI 里面学习很多时候就靠 supervision 你要对应的啊input 跟 output 你才可以学出这个 input output relationship那unsupervised 就是说你并没有对应的 input output 你不并不知道这个人笑的时候是怎么样你不知道这个啊。这个马变成斑马会是怎么样。

嘉宾 嗯

小俊 啊。我们那时候是早期呃利用一些呃 information bottleneck 可以去做出这个我们叫 unsupervised image to image translation那是我加入英伟达的时候呃英伟达并不是一个呃大家认同的 AI 公司啊。那时候deep learning 还没有像现在这么的火热那。因为打传统也都是做这种 computer architecture 去设计这个啊。这个 GPU 啊。没有人在做这种比较应用端的科研那我等于是早期在英伟达把这个方向做起来的那我在呃做了许多东西。然后其中一个 work 叫 Gaugan 好像中文把它翻成马良神笔像是小画家一样涂几个颜色每个颜色代表不同的语义那你涂一涂之后嗯。就可以变成漂亮的山水画哦。那个 work 让我在呃等于是帮 NVIDIA 把就是建立起一个形象不只是可以做出很好的 GPU 也可以做出很好的这个呃 AI 模型啊。啊。

那时候我还有些同事在一起做那个 stylegan 方向的研究那我们就是这群人把这个 NVIDIA 从第一批就是等于是第一个把这种生成式网络来做这种呃 media 生成把它带起来好那做了一段时间之后嗯。就那个公司就觉得我可以了。然后就可以开始成立自己的团队那我那时候成立的团队就叫 Deep Imagination Research 啊。就是跟我当初给 job talk 的目标是一致。

嘉宾 这是哪一年

小俊 应该一九到二零年之间啊。那时候我变成一个 research director啊。但就是那时候知道自己要成立团队就跟着几个啊。一起工作的伙伴。然后就开始建立这个 Deep Imagination research那接了 Deep Imagination Research 呃之后就一直啊。就是在解相关的问题就一步一步想从这个呃就是朝着把小说放进去产生电影这个目标前进。

嘉宾 嗯

小俊 就是呃一步一步往下走我们做了几个有趣的这种 demo 就是有一年 Jensen 我们的 CEO 他想要用一个数字人来取代他来给这个 keynote 啊。那时候我们就帮他做这个假的 Jensen 这个的 keynote 的 demo 然后还有陆陆续续啊。那时候是呃疫情期间嘛。然后在那段时间里面呃数字人的发展非常的呃快。然后我们也贡献了一些呃我们自己觉得很骄傲的 technology 我十年前在给 job talk 的时候我就想要解这个小说变成电影这个题目。

嘉宾 嗯

小俊 但呃那时候呃我觉得这个题目可能需要很久的时间才能解啊。应该是说我那时候并没有意识到我们。其实有已经有这个条件了当你的算力啊。当你的呃数据足够的时候就可以做出这样的一个大的突破那。但是那时候我就忙着做数字人忙着做各种有趣的应用到忽然某一天啊 OpenAI 出了。这个 Dali 这个 work 最早的一个 text to image model我才理解到我的野心不够大我不够勇敢没有决心去把这东西做出来。

嘉宾 在算力最多的地方。

小俊 在算力最多的地方那那时候呃 NVIDIA 是这样运作的啊。你要 Jensen 啊。投资你算力你要你要讲出来这为什么对公司重要我记得那时候 Dali 出来的时候我写了一封信给 Jensen 跟他讲说这个未来已经很明确了就是靠 deep learning 来做这个影像生成那 NVIDIA很多客户都是用 NVIDIA GPU 用传统的 graphics 来做这个影像生成那我们不能在这个用 deep learning 来做影像生成下落后我们必须投资 GPU 给给我们这个团队去帮助这个领域啊。成长那那段时间里面我跟 Getty Images 也有很多合作。因为我一直在做这方向那这些传统的啊content 公司他们也对这个 AI 很感兴趣但他们也就是啊。就是试试看但没有没有?足够多的决心啊。看了 Dali 之后我写一封信给 Jensen 要 GPU 写了一封信给 Getty Image 说我们应该合作你们这样未来才有比较保障。

嘉宾 嗯

小俊 然后呃我们就谈成了。这个合作方案就是他们提供数据。然后我们有算力。然后我们去 build 这个啊。大模型来做这个啊 test to image 这就是我踏入大模型的的时间点那那时候我们成立的一个呃专案叫 Picasso 啊。我们目标是做 AI 方俊就是呃有些公司有数据但它并没有这种AI 的人才没有这种 AI 的 infrastructure 但他们有数据他们有客户那我们就是等于帮他做一个呃 Gen AI 的模型。然后再把模型给他们让他们去服务他们客户。然后彼此就是这样一起获利那那时候就是跟 Getty Image 还有跟 shutterstock 去做这件事情那这是在这之后我还那时候还是在 Deep Imagination Research 这个团队的事情我们在做这件事情那从这里就是慢慢地我的 research 不只是产生一个模型不只是产生一个论文我们也产生了一个可以帮助客户成功的产品那就是这样啊。逐步的发展我当初以为我现在已经决心充足。然后呃就是愿意挑战最困难的问题啊。因为已经跟 Jensen 要了 GPU 跟。

嘉宾 要掉了多少 GPU 啊。

小俊 那时候我是要了 一千个呃 A100 的 GPU 对。

嘉宾 当时的一千张很多吗。

小俊 是非常地多那时候还在 mp 二的时代一千张已经很多那要把一千张的这个 GPU 串在一起做一个高效的训练也不容易。

嘉宾 嗯

小俊 啊。这是我们那时候尝试就是。当然遇到很多瓶颈。然后就逐一克服呃。因为我是最早。一批去做这个 Gen AI 的这个等于在 computer vision 里面做 Gen AI 的人我也很荣幸就是啊。就是跟很多很优秀的伙伴啊。一起合作啊。因为我比较资深。然后很多当时很有有为的年轻人还在学生的时代他们会来我这里做实习。然后包含现在在 Meta 的俞佳辉。然后做出这个 sora 的 tim brooks 都在我这里实习我还记得 tim brooks 刚加入我团队做实习的时候他就一直想做这个 video 生成想做他想做的 sora 的东西。

嘉宾 嗯

小俊 但那时候我们并没有这个 technology 我们是用 again 一起去做合作那时候就看到他的充满了决心嗯。充满了热情。然后。当然是人非常的聪明。然后手脚非常的快那我跟他一起合作里面学到很多东西我们也写了一个蛮不错的论文。然后。后来毕业之后呃想留住他但他去了 OpenAI 呃也很开心他在 OpenAI 那边就是获得啊。很好的发展。然后。后来就做出这个 sora 这个 work。

嘉宾 嗯

小俊 那 sora 这 work 出来之后对就我的我是感到。非常开心但我又觉得我的决心实在是不够。

嘉宾 还是不够

小俊 还是不够对我们那时候就几位啊。就是都在做这个领域的人我们就一起呃一起写了一封信给 Jensen 说我们必须要更多的投资这就是呃 Cosmos 发起的由来我们这群啊。学者啊。我啊。那时候还有Sanja Fidler 然后还有我们公司带这个 Nemo 团队的 Bryan Catanzaro啊。君范那时候也在这个 meeting 里面。

嘉宾 嗯

小俊 我们就一起讨论我们就决定要去做这个啊。这个 world model你觉得这对公司像是对人类像是一个重要的一个科技。然后那时候呃 Jensen 就叫我啊。还有 Sanja Fidler 两个一起来带这个 Cosmos 这个 effort那时候不叫 Cosmos 啊。那时候就是我们知道要做 world simulator。然后Jensen 呢?就叫我们每个人去想要叫什么这个 project 叫什么名字我们就每个人就回去去想就是要叫什么叫什么我已经忘记那时候有几个名字在里面选但最后 Jensen 就说叫 Cosmos。然后我们觉得 Cosmos 这个名字非常的好。然后呃。所以这个 Cosmos 这个 project 就这样产生了。那。然后我这还是在 Deep Imagination Lab 的时期那在那个时期就是我原本是在做 Picasso。然后就是这个 AI 方俊 for 这个 media generation 然后。但是。同时又负责 Cosmos 后来觉得啊。就是 Cosmos 这个 project 不管是对公司啊。对这个领域发展更加重要。

然后也没办法分身乏术啊。没办法。同时跑两个重大的 project 啊。然后慢慢就把这个皮卡这个 project 给收起来那帮这些客户找到了。其他可以继续支援他们的科技公司那我就全心全意开始做 Cosmos那 Cosmos 做一段时间从从一做到二做到三啊。这段时间里面啊。使用它的客户越来越多需要一定的规模才能去把这个 Cosmos 这个挖掘做好你可以想象我在 research 时期可能就是像一个萌芽阶段当现在这个这个 Cosmos 已经被这么多人给依赖不管是外面的客户或者是公司内部的团队到一个不能就是一定要成功的的一个阶段那所需要的资源更加的庞大那就是在今年年初的时候我就从 NVIDIA research 离开了。我现在是 report 给我们的 senior VP of software 啊。我们公司最大的一个 leader。

嘉宾 之前是汇报给 Bill Dally。

小俊 对带着 Deep Imagination 团队啊。我现在 report 给 Dwight这是他是我们公司的第一个 software engineer 啊。在 Jensen 的传记里都有他的故事啊。对那我现在 report 给他。然后我离开 research 之后啊。我们就换了一个名字后我就不叫自己的团队 Deep Imagination Research啊 team 我们就叫自己 Cosmos lab 嗯。啊。这是整个这样的一个变化。

嘉宾 我听说 sora 没有出自你的团队让你很遗憾是吗?

小俊 也不是遗憾就是我是感到。很开心就是啊。就是自己曾经一起共事过的人可以做出这么大的一个啊。贡献我感到非常的开心遗憾的是说每个研究员都想做做出贡献嗯。那看到这个 sora 这个产生的贡献这么大。当然自己会觉得很开心但一方面也觉得说到底是什么地方啊。在我的决策过程当中在我的判断的过程当中是哪些地方我没有看对而导致我没有在正确的时机做出正确的事情。

嘉宾 嗯

小俊 啊。一点就是呃我自己一个很喜欢自我反省的人那我就是往往都会去试图理解怎么样让自己更好。

嘉宾 因为说到 sora 还是会想多说一句你觉得为什么 OpenAI 后来把这条产品线基本上算是关掉了。

小俊 sora 它是一个重大的一个。

嘉宾 研究工作那它。当然本身也有许多应用。OpenAI 是一个啊。很有野心的公司。然后他们有大量的人才那Sam Altman 一直是啊。从他早期在 Y Combinator 他就是一个投资者那他。当然是希望啊。就是有这种投资者的心态。然后希望公司内部有各式各样的 Project有些 Project 非常的成功就是各式各样的呃 Portfolio。

小俊 那我觉得在过去呃一年当中他们受到这个 Anthropic 啊。巨大的呃竞争压力他们看到 Anthropic 在 Coding Agent 上面产生的巨大的经济效应啊。你在跟 ChatGPT 聊天的时候你产生了 Token 数就是可能最多一分钟就生成完了。那你做这个 Coding Agent 是可以工作二十四小时 四十八小时那个 Token 量非常的大那他们就是我觉得啊。就是觉得这是一个很好的方向那就集中公司的精力啊。往这个呃 Coding 的方向走。

嘉宾 孙子兵法讲的背多则力寡大家的资源啊。都是有限的那他们就是重新调整资源。然后去往 Coding 这面发展我不觉得他们认为 Sora 不是一个好的 Work 只是我觉得在这个时间点他们公司有更重要的事情必须要去做。然后就要做出一个不容易的决定。

小俊 我很好奇啊。因为像 Anthropic,OpenAI 这种前沿实验室他们做研究就天经地义。因为这就是他们的产品。但是对于英伟达这样的一个基础设施公司或者说是一个平台公司我卖 Token 给这些前沿实验室就好了。我为什么还要自己做自己的研究呢?就是研究这件事情本身对于英伟达的意义是什么呀?

嘉宾 你的基础设施要做得好做得好的定义就是适合这些啊。应用公司来用那如果你自己不做这些应用你更不能理解他们所需要的东西。所以就是要去走他们呃可能会走的路从中间去理解到。而且设计芯片啊。设计这个这个电脑的这个架构它的周期是很长的啊。你不能说我现在马上改需要很长的一段时间来做这个规划。所以你要做这方面的研究做方面投资去理解到什么是可能是重要的啊。问题要解才能设计出更好的这个啊。这芯片更好的 Infrastructure 来满足这些啊。就是 AI 大公司。

小俊 嗯。

嘉宾 我总觉得这世界上如果每个想啊。有抱负有理想的人都有这个工具啊。可以做出他们想做的事情这世界是为一个更好的世界一方面看到 OpenAI、Anthropic 还有中国几家大公司做出的突破我就非常开心但我们这个社会会有源源不绝的有抱负的年轻人我们也希望他们有他们的机会啊。就是啊。我们可以做出这些模型。然后分享给他们他们可以做出很好的应用很好的延伸模型或是从这里面获得灵感做出他们更好的模型。然后就是大家不同的想法都可以落地那我觉得啊。当这么多多元的啊。这些 Idea 都有机会被被实现。然后可以被呈现给这些啊。用户啊。我觉得大家选择更多那我觉得这社会进步会更好那这方面为什么英伟达做开源模型的原因。

小俊 嗯那你们的研究成果会跟客户去有一些竞争关系吗?

嘉宾 我们做这些呃。而且我们做这种开源的模型我们基本上就是无价放在呃网络上面让大家都可以去运用这世上真正要落地真正要满足客户的需求还很多东西要做尤其在巨深领域啊。好多硬体的问题啊。好多这个商业的问题都必须要解我觉得我们给 Community 一个讯号是说我们会帮助你在这方面那当你看到这个这个趋势啊。看到我们的 Commitment 我们从一代做到二代做到二点五代做到三代这样一代一代做下去你看到我们一步一步就是想把这个地方做得更好让你让大家都可以更加预期到说英伟达这上面会一直投资一直进步让让大家有这个认知有这个信心那他就可以把他的就是他资源投在更重要的刀口上面去做出重大的贡献。因为每家公司再有钱公司资源都是有限的。

小俊 嗯。

嘉宾 那你不找到痛点找到这个关键点去做投资做进步的话你是不容易脱颖而出的那聚生这么的难这么多东西要解啊。我觉得我们它做出这些模型啊。帮助他们分担部分的压力我不觉得是在竞争我觉得是在帮助大家成功。

小俊 对为什么你们当时要立一个非常重要的项目没有选择当时最火的大语言模型呃也没有选择像 Sora 这样的模型而是选择了具身的一个世界模型呢?

嘉宾 大语言模型它在当时就是发展得已经非常好了然后再就是我的背景不是大语言模型我是 Computer Vision 出身的。

小俊 CV 出身的。

嘉宾 对 CV 出身的那呃自然而然就是一直在这个 Media 这边徘徊啊。就是 Image Video 徘徊那这是大概是过去的背景啊。就是把自己走向这个道路。当然。因为我的背景关系。所以跟着我一起合作的伙伴也都是类似的背景。所以我们就是往这方向走这是为什么没有走大语言模型那。另外就是 NVIDIA 也有很强大的大语言模型团队在那里我觉得我没有太多的贡献啊。我觉得呃这 NeMo 创越做越好那我这边就是主要就是想去解一些啊。更适合我来解的问题那 Sora 当初出来的时候它是也是一个 World Simulator 啊。但啊。那时候主要的应用比较是像是这种啊。创作方面的应用创作非常有趣啊。每个人都希望可以用更好方式来讲故事去呈现自己想的东西就是具象化。然后帮助大家去理解你看到的世界这是一个很好的应用但那时候也看到了就是我们在这种低纬度 AI 发展极大的啊。非常的快。同时间社会很多问题啊。需要这些 Physical Tool 真正能那个改变这个物理世界状态的这些 Physical Tool 很难满足的比如说啊。就是当人年纪大的时候就没有办法开车啊。

但没办法开车整个人的啊。生活品质就降低很多啊。但如果有自动车年纪大的人还是可以有他的 Mobility 再就是呃有很多的工作非常啊。劳力密集的啊。也非常的危险啊。如果有这种 Physical AI 的啊。这种 Robot 可以帮忙做也可以就是改善人的生活。然后再就是家里面总是一堆琐事要收碗筷啊。要整理这些不见得是你在家里面最想做的事情啊。有机器人可以帮忙去做这件事情提升啊。人的生活品质我们就是看到这个呃就是 World Model 可以对 Physical AI 所产生的贡献。所以那时候就往这个 Physical AI 方向走而不是走这种 Content Creation 的路线。

小俊 Jensen 对于这个团队提过什么要求没有?

嘉宾 Jensen 对团队的要求非常的严格。然后呃目标高。当然第一目标就是可以帮助到客户嗯。那这不是一件容易的事情NVIDIA 是一个运算公司是一个AI Infrastructure 的公司呃那我们最厉害的就是整个 Computer Stack 从这个底层语法到 CUDA 到到一路往上。但是啊。我们并不是一个 Solution 的公司就是给一个啊。机器人的 Solution 啊。然后或者是啊。一些其他应用的 Solution 那但我们的目标是帮助这些建 Solution 的公司成功那有时候会觉得有点像隔靴搔痒。因为你不太了解啊。痛痛点在哪里啊。那你设计模型的时候你设计一个产品如果你不了解你的呃客户的话你就没办法最佳化那这就是为什么我会常来中国原因就是想理解一下啊。大家遇到的问题是什么怎么去啊。帮助他们这是一个难处一个 Jensen 的要求啊。你做东西是需要Make an impactJensen 常常在讲就是他喜欢这种 Zero billion dollar business你可以是啊。

不赚钱但当这个生意成功的时候必须是很Influential 的是很巨大的。

小俊 嗯。

嘉宾 你你不能说就是满足在就是每年赚个什么一百个 Million 哦。这种 Scale 这对很多公司而言都很大了。但对一个呃对英伟达这家公司而言这并不是一个 Distraction。

小俊 嗯。

嘉宾 对。

小俊 是个分心。

嘉宾 分心对是个分心啊。就是你要去解最重要的问题产生最大的贡献那我们觉得 Physical AI 是一个够大的问题可以产生那个最大的贡献。所以在在这个方向的时候要很小心就是要去解最重要问题而不是去解一些啊。短暂可以产生成果但它的 Impact 并不是很大那这这是其中一个问题那。当然就是要做那种最好嗯。那这也是很难的。

小俊 听起来过去十年的明玉在英伟达变得越来越具有野心了。

嘉宾 是。

小俊 那接下来我也想探索一下就是你个人的一个作为研究员的刘明玥嗯你是怎么一步一步呃探索你的研究之路的?

嘉宾 在回答你这个问题我先想想想回答之前的问题我觉得我是一直。很有野心的。因为我那时候就认为可以用小说直接生成电影。

Insight

研究生涯的连续性不在于永远坚持同一算法,而在于保留问题意识,并在条件变化时敢于替换实现范式。

  1. 他将重要转变归纳为:不再为漂亮数学远离现实;重视解释与“销售”研究价值;学会让大团队围绕同一目标协作(约 00:42–00:49)。
  2. GauGAN 的经历让他看到,易懂的命名、实时 demo 和用户反馈能让研究影响远超阅读论文的同行(约 00:49–00:54)。
  3. 从 Coupled GAN、image translation、vid2vid 到 diffusion,他反复强调 scalable approach、数据和基础设施;对 GAN 的稳定性与规模上限判断促成团队转向(约 00:54–01:01)。
  4. 他把实习生合作比作 idea 在不同头脑间快速流动,并提到 Tim Brooks、Tero Karras 等同事或后辈对自身研究的反向影响。

小俊 嗯。

嘉宾 只是我觉得我的执行力啊。不够我的啊。看时间点不够。然后我不太会去理解啊。在那时候还是刚进业界不久还不太理解怎么样做才是可以在公司中获取支持。然后获得巨大的资源去从事方向。然后我觉得过去十年的历练里面让我更加理解怎么样啊。看清楚在对的时机。然后怎样怎样就是帮助公司理解这是对公司重要的决定啊。然后去印象公司怎么去投资啊。那这是我觉得一个变化是一直很有野心只是不知道怎么实行我最早呃。因为那时候成长背景嘛。我在台北长大呃。然后在我读高中的时期啊。最热门的科技是无线通讯那时候那个手机刚出来那是巨大的手机。然后还是 Nokia 的时代啊。那时候对这个科技感到非常的啊。就是好奇在台北长大啊。那呃总想离开台北。然后我高三就去了呃台湾的交通大学在新竹啊。那边去学习这个无线通讯那无线通讯那边学了一段时间之后就比较理解它是怎么做的在我的同学啊。那时候一起在那个新竹交通大学求学啊。学无线通信的这些同学很多人就留在台湾啊。去比如说在联发科或者是有些人去台积电啊。去做这些就是啊。台湾本身就很擅长的工作那我在那时候就有点怀疑啊。是不是?这就是我要选择的道路啊。

因为呃那我从小到大。其实没有想过说会去呃美国留学我。

小俊 没有想过。

嘉宾 没有想过啊。所以我。其实一直不是很重视我的英文。然后就是觉得啊。数学物理学得好就够那那个时期我就开始有点怀疑到底啊。什么路是是对的在大三那一年我就好奇去看看美国的研究所啊。博士班在做什么东西。然后我看看我自己现在那时候在台湾的交通大学做什么东西。然后那时候我就发觉就是啊。做东西很不一样。然后我觉得啊。我那时候在算怎么样啊。设计一个呃 Protocol 可以让传输更加啊。快那我觉得这是一种提升但不是一个零到一的变化啊。那我看到在美国这些呃高等学府做东西我就觉得嗯。这个看起来每个成功都是一个零到一的变化。

小俊 嗯。

嘉宾 所以那时候我就啊。觉得我应该出去闯一闯。然后我跟我我还记得我跟我爸妈说我要去美国留学的时候他们都吓了一跳。因为啊。他们认识我二十几年没有听过我讲说我要去美国留学这件事情。

小俊 这是大几啊?

嘉宾 大三的时候。

小俊 嗯。

嘉宾 然后。所以他们听到就是还蛮震惊的啊。那那时候我想去美国学习的是啊。量子通讯。因为我觉得这东西很神奇就靠着量子可以直接那个把讯息传从 A 传到 B 去但。后来我到那个去美国之前我在在台湾的 Intel 啊。在那边待了一年。然后认识了一个朋友我们都在那里实习他在那里做这个影像辨识。然后我就这是我第一次接触到 AI 因为之前都是学通信。然后我看到他在做影像辨识我觉得这很神奇它就是可以从这些 Pixels 里面去判断啊。里面是什么东西是谁啊。是什么物件。然后我就对这个呃这个 AI Computer Vision 有些啊。开始有些印象那我那时候申请到了美国马里兰大学啊。啊。在那边开始我的博士那最早期的 Computer Vision 都不是 Book 那最主要的那个经费研究都是国防。

小俊 嗯。

嘉宾 那马里兰离那个华盛顿特区很近啊。所以那时候聚集了一些非常厉害的啊。就是早期的啊。做 Computer Vision AI 方向的大佬在那里那我到那个学校之后原本是要研究量子通讯的。然后。后来发现那里有做这种Computer Vision 跟我那时候在 Intel 实习看到的东西很接近的这个题目我就觉得说嗯。这看起来更有趣那我就找了。我的指导教授 Ramachandra。

小俊 嗯。

嘉宾 他是这个领域里面啊。是等于是先锋啊。然后我就开始跟他学习 AI Computer Vision那时候最早做第一个题目呢?是从 Video 里面去看这个人走路的姿态去判断是谁哇。然后那时候也是蛮有趣的问题那啊。我就是在这样逐渐逐渐就是啊。转换跑道。然后去做这个 AI 然后最早期啊。去做这些啊。影像辨识 Video 辨识。然后。后来在博士期间还学习怎么用啊。叫 Shape 啊 Matching 然后 Segmentation 这些啊。常见的这个 Understanding 方向的这个AI Computer Vision 的的研究。然后这样逐渐踏进这个这个 AI 了啊。那那时期并没有 Deep Learning 啊。是啊。

小俊 是一个传统计算机视觉的时期。

嘉宾 传统计算机视觉那时候什么都不 work。所以什么都要学我们那时候啊。就 Support Vector Machine那是一个很传统的一种 Machine Learning 的方式Support Vector Machine 跟优化有很大的关系。然后这是一个不管是连续啊。离散的优化都必须要学。然后也要去学习一些 Graphical Model 然后 Energy Minimization 还有各式各样的啊。就是这种 3D Calibration 这些啊。东西就学的蛮多我觉得算是很扎实但就是在毕业的那一年呃 ImageNet 这个 AlexNet 出来。然后改变了整个世界嗯PhD 的后期就到一家叫Mitsubishi Electric Research Laboratories 的一家公司三菱电机研究院。

小俊 这是你后来的一个工作对吧?

嘉宾 对这是我的第一份工作。

小俊 在美国的第一份工作。

嘉宾 对在美国第一份工作它是在呃Cambridge 在 Massachusetts 就是在 MIT 的旁边这家公司在九零年代是非常强大的一个研究单位啊。那时候跟微软研究院是一争雌雄在 Graphy 上面都是呃非常领先的一个研究机构那MIT 里面有许多教授以前都是在那个三菱电机研究院里面当研究员包含 Bill FreemanRamesh Raskar 他们都在那边做那我加入的时候已经过那个时期。但是还是很多优秀的研究员留下来那我进入那个公司之后啊。几件事情嘛。那一年AlexNet 出来。所以我过去学的东西就是跟未来的世界开始有些呃就 Divergence。

小俊 那一刻会失落吗?

嘉宾 不会我其实在我是对这些新的科技是很感兴趣的因为 Computer Vision啊因为什么都不 work 所以我已经养成这个习惯什么都学。

小俊 什么都不 work。

嘉宾 那时候什么都不 work。然后。后来 Deep Learning 出来之后就觉得很有趣我还记得我那时候是博士班的最后一年了嘛。等于是实验室里的大师兄。然后我就组织学弟妹们啊。师弟妹们一起去要研究 Deep Learning这是去研究那我还记得那时候有一位呃师弟跟我讲说这东西只有几个人会没有必要去研究。然后呃我还是没有理他就是继续办这个这个研讨会。然后。后来我的第一份工作是在这个三菱电机研究院嘛。那研究院啊。通常就是啊。研究风气就是工作比较自由那我有很多时间啊。去学习。所以我在那里就学这个呃 Deep LearningGenerative Model 是呃我的指导教授 Rama Chellappa 他很相信 Generative Model他相信 Bayesian 啊。就是相信你要把那个生成放在这个啊。这是Understanding 的一部分哈那。所以我在那时候学 Deep Learning 的时候就就是也在留意这个生成这一块那。后来有一年去 NeurIPS 看到 Ian Goodfellow 的这个那个生成对抗网络的工作啊。

就对这个东西感到非常有兴趣回来后就开始在这方向里面就开始做大量的投资。然后越学越多这样。

小俊 对你很早就开始做生成了。

嘉宾 对我是最早。做生成的一批研究员啊。那时候还在只要能生成三十二乘三十二 Pixels 的脸。然后看起来不像鬼。然后就觉得自己很成功了。

小俊 为什么生成是理解的一部分?

嘉宾 Richard Feynman 他讲的If I cannot create I cannot understand就是当你可以生成它的时候你真的彻底的理解它。

小俊 哦这跟人的学习有点像。

嘉宾 对是是啊。

小俊 当你可以讲的时候意味着你已经理解了。

嘉宾 还有早期就是 Computer Vision 也分这种呃 Discriminative Model 跟 Generative Model 嘛。

小俊 嗯。

所以 discriminative model 是它。其实没有生成能力但它可以判断这是 a 还是 b。

嘉宾 判别式

小俊 判别式 嗯

嘉宾 那生成模型就是一样可以被用来做判别 但是它还是包含可以去重建这个讯号 啊。就可以去描述它 然后当你可以描述清楚的时候 大家是可能认为你更加理解这个东西的 对 那就是 discriminative 跟啊 generative 嗯 嗯 所以像最早期的 AlexNet 可以做 ImageNet Classification 我们就把它看成是一个啊。判别式网络。

小俊 其实你最早做了一年的工程师 你觉得这个经历对你。后来做 research 有影响吗。

嘉宾 我觉得我在在那个 Intel 做工程师吧。

小俊 对以及你觉得做 engineering 和做 researcher 的本质的差异是什么呀 哪个更适合你自己。

嘉宾 这是一个好问题 嗯 做 research 啊 最重要一部分就是问对问题。

小俊 嗯

嘉宾 问对问题 当你问到对的问题 你你就你总大概就是找对一个方向 那 engineering 等于是帮助你去去跟大家讲对这是对的问题就是要把东西做出来 研究的这个一个实现能力 让你去做点事情 那 engineering 当做大 scale 的时候还有很多东西是很重要的哈 在去美国之前的那一年做 engineering 对我影响 我可能最大影响就是认知了。这个有这个领域叫 AI 哦 computer vision 然后从中间 啊。我记得那时候在啊。巨大的这个 software stack 里面帮公司去找问题 那这是很磨练耐心的一个啊。一个过程 那我觉得都是很好的训练。

小俊 所以 AI 对你来说也是一场意外它本来不在既定的轨迹之中。

嘉宾 不算 不是 我不是那种从小就是说我要去理解为什么人类为什么可以有这个智能的啊。发生 我等于是啊。就是一步一步看到这东西觉得非常有趣 想去理解。然后就一步一个往那个方向前进。

小俊 它最初打动你的是什么呢。

嘉宾 为什么打动我吗。

小俊 嗯。最初。后来。当然很可以有很多原因了。

嘉宾 因为不懂

小俊 因为不懂嗯

嘉宾 对不懂那又比较容易去理解它的重要性噢 就是有些科技领域像量子通讯你可能要很懂 你才知道它到底是为什么重要啊。这个 AI 就是很容易可以理解 就是你可以重造这个智力 好那它有些表现会跟人非常的像啊。就就很好奇因还有就是善和难 每个人都对自己的就是存在会产生这个困惑 整个群体就是到底什么是人 我们跟其他生物有什么不同 那这就是一个很自然你会问的问题 啊。我觉得也也是。因为这原因 这个领域会吸引这么多人在上面做出投入。

小俊 嗯。如果要找到一个早期对你研究生涯都非常重要的一个时刻 你会怎么描述它它是哪个时刻 它是你在做工程师的阶段 还是你到美国之后。

嘉宾 太多了对那哪个是最重要的 嗯。

小俊 或者最重要的三个呢。

嘉宾 我觉得第一个时刻就是在早期啊。我喜欢漂亮的数学 在 computer vision 早期阶段什么东西都不 work 那computer vision 运用大量的优化的算法那优化呢?就是要去找最佳解 如果是连续性的呢 常常会遇到这种 non-convex 的问题 就是你没办法找到最佳解那如果是离散呢 就这种 NP-hard 的问题 就是你也没有足够多的算力去找最佳解 你还是研究出算法去找啊。一个答案但你不知道答案离最佳解多远那为了去确保你的答案离最佳解啊。不是太远 就有一定的就是保证。然后就会去证明这叫 bound 就也许这个最佳解啊。是虽然找到答案不加解但它离最佳解可能就是差十 percent 啊。或是差那个二十 percent这比随便一个答案好 为了去证明这个 bound 的很多时候在早期的研究啊。就会开始做些假设那假设让你的数学变得比较干净可以找到答案但假设也让你离现实比较远。然后那时候早期会有点偏向于去找这个追求数学的美而去忽略跟真实世界的距离 然后。

后来一段时间之后 我理解到这不是一个正确 因为AI 本身就是一个应用 就是智力就是拿来被应用的 然后啊。我是越来。越喜欢接近这个问题的本质 而不会被这些花俏的数学给迷惑。然后。后来还有一个阶段就是 呃可能就是从小成长的背景有关 就是我总是专注在把事情做出来而不专注在让别人懂你做出什么东西。然后我开始做 Image 之后就是我觉得我做的 research 不错 呃蛮不错的 然后在那个别人看到这些这种 Image Transition 之前 我就把这东西做出来 但我不太理解怎么去不太会去表现我做出来东西让一般人可以懂。然后我常常讲说我自己做了一百分 但是我的解释只有十分 所以别人看到只有十分。然后那时候我就更加重视如何让我做的东西让别人理解它的重要性 然后让他去理解这个过程 那这是我觉得啊。可能一个很重要的一个 lesson 那当时我早期做 Gan 的时候。然后第三个是啊。我。后来理解到 尤其是啊。开始做大模型的时候我开始理解到团结合作是非常重要一件事情。

小俊 嗯

嘉宾 人跟人的沟通呢?啊 其实是一个高复杂度的问题 好比如说你呃我不知道这是叫 N-square 假设你有 N 个人你跟这些。另外 N 个人沟通是 N-square 啊。那 N-square 在在那个复杂度来讲是一个不好的复杂度 就是不容易 scale 懂啊。就是当你很多人的时候啊。就是每个都要点对点沟通就不容易 比较好的就是这种 N 啊。或者 linear 或者 sublinear 啊 我开始知道说要做出一些巨大贡献 需要大家一起团结合作的时候啊。必须要把事情讲得非常明确 让大家都能懂。然后大家目标能一致 就是自己能把东西做出来噢。然后也希望就是大家都能真懂 自己做在做什么东西 然后可以朝同一个方向前进 那这地方就还需要很多就是帮助大家去理解为什么这个重要 这这是。后来我做科研啊。尤其是做到大的 scale 的科研里面觉得很重要一件事情。

小俊 你要做应用。然后你要销售你的工作。然后你要团队协作。

嘉宾 对唉是

小俊 这。其实是也是你的成长的路线 对吧?

嘉宾 是啊。对是当我做出的第一个啊。那时候我一个很 popular 我叫 GaoGan那时候大家都在用它 就是我刚讲的马良神笔我看到用户的反馈让我充满着就是成就感让我觉得说我能影响的不只是读过 paper 的研究员嗯。而而是一些就是啊。更大的一个族群 然后可能就觉得自己的生命更有价值 然后嗯。就朝那方向前进。

小俊 高光是取自高更吗。

嘉宾 对这个名字是这样 那时候啊。我是跟一。个啊。我们当时实习生啊。叫那个 Taesung Park 啊。他呃我们一起在研究这个方向 啊。当然还有创还有一起合作 还有朱俊彦 然后还有那个王鼎钧 我们这四个就是一起在研究这个题目那那时候我们开发出一个算法 叫我们叫 SPADE 就是 Adaptive ModulationDemodulation 啊。这是一个算法那那时候做出来之后很开心 我在那公司内部做个 demo。然后 Jensen 看到非常的兴奋。然后他问我叫什么名字 我就叫 SPADE 他就不喜欢就是这这东西就是不容易懂。

小俊 它不是一个用户语言。

嘉宾 啊。不是用户语言那时候就是 paper 已经写完了 然后投了 CVPR啊。但还没有放在 arXiv 上面。然后公司看到之后就叫我不要放在 arXiv 上面让公司让 Jensen 在 GTC 那是二零一九年的 GTC 的时候可以在他的大会里面跟大家宣布。然后我觉得很兴奋啊。呃很好的机会。

小俊 嗯

嘉宾 那那他们就在想这个叫什么啊。我们公司有一个呃 marketing 的 genius就想说这叫啊。因为那时候算法都是什么 Gan 什么 Gan 什么 Gan 对。

小俊 那是 Gan 的时代

嘉宾 对 Gan 的时代 嗯 然后那个 market 它叫做那个… 然后他他就提出叫 GauganGaugan 啊。他是法国人啊。就啊。就把这个名字取出来 然后大家一听他的名字 很合理画家著名画家。然后那时候做应用 也是这个啊。画画这件事情。然后就啊。就出来了 好那呃那时候本来是在 GTC 啊。它的就是宣传大会上面要去宣布的结果那一年它太多产品要介绍了它最后一刻就啊。我记得我在礼拜天晚上还跟他这边排练 就是要在台上给个 demo。然后当天晚上就接收到通知 说太多产品要要讲了 他决定把这个 GauGan 就不放在他的 keynote 上面就一样是做了新闻稿一样就做做 demo 给这个媒体啊。朋友去看但就没有放在这个 它的大会上面很多媒体朋友看了之后反而是 GTC 里面最受瞩目的一个啊。一个 work 然后呃就那一年就这样子啊。就做了很多种事 然后我们做一个online APP 让大家都去测试 然后从里面就是大家使用里面获得很多呃就是很很好的反馈 然后就就是越做越往应用方向前进。

小俊 其实高干是不是?跟你之前的研究轨迹是一步一步呃 递进的 它不是第一天就做到那里 因为你从博士毕业以后加入了三菱电机研究所computer vision 就进入了 Gan 的时代 然后你。其实围绕 Gan 做了一系列的工作 包括 CoGAN 最开始 再是到了英伟达之后的呃比如说 GauGan 这一系列的工作对吗?它它是怎么延展的。

嘉宾 我最早的一一个 Gan 的工作叫那个 Coupled GAN。

小俊 Coupled GAN

嘉宾 Coupled GAN 就是啊。把呃两个 Gan 的生成网络把它 couple 在一起 然后 couple 在一起产生了一个 information bottleneck 然后所有的 deep learning 就是在学怎么压缩资讯。然后 bottleneck 是帮助你啊。帮就是给这个 network 一个机会 可以去找到本质那就是你一个 Gan 是在 model 一个 distribution。然后你有两个 Gan 是 model 两个 distribution 啊。一个是马 一个是斑马 嗯 当你 couple 在一起以后 它就有个限制就会找一些共同性 然后就可以让你做这个转换 从马变斑马 啊。就是从这个方向走的整个生成式网络就是在做这个 distribution modeling 那 distribution modeling 就是你可以 sample 就产生一个 image 一个山 一个海 或一个 video。但是人不只是只想要去生成他要去能控制自己去生成的东西那控制呢?

就是要有讯号嗯 那讯号有很多种那一种常见的讯号就是拿 image 当讯号 就是我这有一匹马怎么变斑马对这是一个讯号 嗯 另外一种方法是弄 age 就是你素描好。然后还有一个就是 segmentation 就是这个像小画家一样 什么颜色代表是山 什么颜色代表是水 这是一个讯号。然后再来呢?就是啊。比如说 class label 就说这是山 这是车 这是机车 那就生成。然后最最 sophisticated 的最接近人的 natural language 就是 text就是 text to image 啊 text to video 啊。这是最就是最自然的一种形式 嗯 但它text 跟跟这种 segmentation 最不同一样 最不同地方就是 segmentation 是给你很具体这个 pixel 是什么 它帮你对位对好了。那 text 呢?它是一个比较不一样 它的 structure 跟 image structure 很不一样 跟 video structure 很不一样。因为 structure很不一样 所以它是啊。

比较难学的需要更多的数据 啊 所以我。后来过程当中我是理解。到这个问题 所以我是从比。较容易啊。的的方向一步一步往上走。然后。

小俊 容易的最最早是。

嘉宾 这种 segmentation 啊。这种 age 或者 image那这也是为什么我之前讲说呃 DPR 让我觉得我自己的那种决心不够啊。因为我那时候总觉得 text to image 是很困难一件问题好。然后觉得这个领域还没有足够多的咨询的 data 跟算力来做这件事情 啊 啊 那。其实是有的。然后就就是。因为没有去做 所以做不出来。

小俊 哦。嗯。所以你是沿着 image 然后到 text 这个路径一点点的延伸的。

嘉宾 对就。其实在早期啊。我几个朋友 我们每年一起参加 NeurIPS 我们就在讨论啊。我们在讨论说那时候还没有 GPT 那时候都是早期我们就在讨论说如果真的有 AI 就是真的会产生突破 第一个会产生突破的领域是哪一个当时我就跟大家讲说是 text 是 language。

小俊 这是哪一年

嘉宾 应该是一六一七吧 我虽然自己不做 text 但我知道就是影像的讯号太多杂讯你很多东西都是那个啊。就是它离那个知识的本质是比较远的 它是比较一个就是这个世界的就是这个 observationtext 已经已经是很纯净的 比较接近 symbol 就要产生一些类似智力的表现 最早就是 language我虽然知道那个啊。最早的 AI 会是在 language 发生 然后。后来也是真的是这样 但那时候我就是比较喜欢这种视觉讯号 所以就一直留在这个视觉讯号的生成这边。

小俊 嗯。后面这几个 Gan 的工作你也来讲一下。

嘉宾 那时候就是 image translation 嘛 从 A 就是那种马变斑马 那个风景画变变真实的这个风景。然后。后来又开始做 video 啊。然后嗯 我们那时候做一个叫呃叫 vid2vid 啊。那时候是把一个车子 simulator 啊。产生的这种很简单的这种卡通的图片 然后把它变成一个真实的开车场景 就是很接近现在的 war model 这些东西。

小俊 对这已经到 NVIDIA 了。

嘉宾 对都到 NVIDIA 了 嗯 我只有 Coupled GAN 不是在 NVIDIA 做的 剩下的 Gan 都在 NVIDIA 做的嗯 那时候啊。早期做这些工作 然后呃也。因为这样子跟 Ian Goodfellow 就 Gan 的那个发明的人成为好朋友 然后我们就那个就很多讨论 然后也很幸运就是在英伟达啊。就是很多优秀的研究员嗯 于佳慧Tim Brooks 还有很多啊。来来我这里实习 然后跟他们学习 然后做了很多一系列 work 都是围绕着就是 image translation 啊video to video translation 啊。嗯 啊。这方向走 对 然后。后来有一年我在读 PHD 的时期学的都是传统的这个 computer vision 的东西那 PHD 毕业之后 deep learning 时代来了 啊。

那时候就是想说你不应该做 handcraft 的algorithm design 你不应该做 handcraft 的future engineering 就是应该 data driven 然后那时候也理解到就是这种更加 scalable 的 approach 哦。简单 scalable approach 是是更容易成功的 所以就常常跟自己讲 就是说你在做选择的时候要找这种啊。更加 scalable 这点是就是。后来就大家讲 bitter lesson那我在做 Gan 的时候很开心 但我一直在思考Gan 到底是不是?scalable 嗯 因为 Gan 大家都知道说它很难去训练呃。所以我我担心这东西就是可能最后不 scalable那一年 于佳慧来我这边实习的时候 我跟她研究的题目就是要去 skill Gan 啊。那时候还很早 那时候我就看到于佳慧 她的才华洋溢 然后就是做出很多就是虽然我们那时候没有写出一个 paper 但那时候做的实验量非常惊人 她的想法我看到哇 还可以这样想 好。然后就是啊。

比如说那时候Gan 是一个 generator 跟 discriminator 嘛。那那时候我有幸的是有很大量的 GPU 可以一个 cost 来 train Gan他就想到说每一个 GPU 都放一个 discriminator 但是它的 weight 都不一样。所以好像很多人。同时跟这个生成式网络做啊。对抗 在那个时代能去实现的东西是很不容易的一件事情。然后那时候还有。另外一个啊。实习生 他叫 Jermy Burstan他就是。后来发明那个 Momentum Optimize 现在大家都在用的 Momentum Optimize 的人。然后他那时候来我这边实习 那我跟他研究的方向是如何在在这种 algorithm 上面更好的算法来去把这个 Gan 给给做的稳定 嗯 然后这两个最后就是方向 最后都没有成功 但他们各自都开发出了啊。非常惊人的呃很有成就的工作Jermy 就是从那时候开始 我们写了一系列的 paper 就是如何用呃 moment 早期的算法来去稳定啊。来去就是让这个训练更稳定 他就是一路一路往下走 在开发着 moment 的算法。

小俊 嗯

嘉宾 就是很开心那段时光 学会很多东西 嗯 到某一年很努力啊 然后跟这么多聪明人在研究这个怎么让 Gan 更加 scalable 但每个结果都走向都是得到一个结论 就是 Gan 不 scalable。然后呃我建立这个团队 就是那时候就是大家加入原因就是想做 Gan。然后那一年我就跟大家讲 不能做 Gan 了要往就是这个方向不 scalable 我们那时候看到 diffusion 啊 觉得哇。这个这个方法极其稳定 然后。

小俊 这应该是一七年。

嘉宾 不是 不是一七年 应该是二零二一吧 就那那时期间。

小俊 二零二一七年是 Transformer 发明出来了。

嘉宾 对一七年 TransformerTransformer 发明出来之后呃我必须讲呃我不是早期去接触 Transformer 的。

小俊 当时。因为还是 LLM。

嘉宾 对这是 LLM 那一块 嗯 我我一直在专注在 Gan 然后早期的 Gan 呢 比较好训练的都是用那个 convolution network啊。到 salient 它把这个 diffusion Transformer 带进来之后 才做 diffusion 那边的人才慢慢的往这个Transformer 这边走 所以那时候就是从算法层面来看 噢 就是觉得这个 Gan 不 scalable 然后就跟团队讲说这是不 scalable 的东西 最后做不远。然后走 diffusion。然后就是开始做 diffusion 然后往下走嗯 对嗯 这是一个一个重大的转变时期 那做啊 diffusion 一开始是做 image 嘛。然后。后来做 multi view image。然后 multi view image 呢?啊。就最后变成 three D generation。

然后我们就做了一系列这方面的 work 就是 eighty five 系列的啊 eighty five image generator eighty five啊 three D eighty five 啊 video 然后做各自各样。

小俊 用 diffusion 来做的生成。

嘉宾 嗯。

小俊 嗯。

嘉宾 我听这个我会想到两个点就是嗯你在 CV 这这这么漫长探索过程中其实计算范式发生好几次变化。

小俊 对。

嘉宾 从传统的然后到了 again 然后又到了 diffusion 现在每次转变的时候作为一个研究员在其中应该是一个什么样的心态啊。

小俊 我发觉它越变越简单呢。

嘉宾 会不会觉得哎呀我之前的工作都白做了。

小俊 孙中山讲就是 suffering little greatness 然后在这么多嗯。就是经历当中我觉得我现在越来越能掌握这个事情的本质。然后我觉得有点像是啊。就像传统的科研一样就是把事情越就找到真正找到本质找到最简单的方式去描述啊。这个有这物世界怎么运作的。然后我觉得现在的方法就是把事情越变越简单。

Insight

资源争取不是包装,而是迫使研究负责人说明:若项目成功,组织、客户与平台分别获得什么。

  1. 他从三菱电机研究院的兴衰中观察到,完全自由的 blue-sky research 在公司方向变化时会承压;研究与业务兴趣并非天然冲突,但需要主动建立连接(约 01:09–01:15)。
  2. 研究结果只有模型还不够,必须与产品、数据、软件栈和客户分发形成正循环;他以 Google 的应用生态说明纯模型优势可能收敛(约 01:15–01:19)。
  3. 创业公司不宜在资本与客户都不占优时复制前沿实验室,而应寻找大公司因经济尺度或组织约束无法解决的痛点(约 01:19–01:21)。

嘉宾 嗯。

小俊 然后在 Kosmo 这边我们也是从数个模型最后变成了现在这个 Kosmo 三的一个模型。

嘉宾 也统一了。

小俊 对就是就是渐渐理解到 ok 原来这就是事情的本质。然后每一个方向我都是花了五到十年在在投入嘛。我觉得未来的决定啊。我所深受这些过去的那个经历影响哈。然后我也不能说那是错误的那时候不能说它是错误就是啊。那时候的条件那时候的算力那时候的数据啊。在那时候做那些事情是合理的。

嘉宾 嗯。

小俊 对那那时候那时候学的东西对我啊现在做很多事情理解很有帮助。

嘉宾 还有我发现你好几次提到你的实习生在 AI 的 lab 里是不是就是通过实习生来涌现一些 idea 是一件很常见的事情怎么看待年轻人。

小俊 比如说经济的啊。茂盛程度是根据钱多快从一个人的口袋流到。另外一个口袋那研究的茂盛程度应该是啊。根据 idea 多快从一个人的脑袋流到。另外一个人的脑袋去你听了。我的 idea 你有些想法把它变更好我听了。你的新的 idea 我觉得诶不错但这个地方还可以更好你就一直流动流动流动。然后就 idea 越来越好那。所以啊。因为我走向业界这条路就不是去学校做教授。那啊。如果你只是在业界整天交流的只有你自己的同事啊。那 idea 的的 diversity 就低一点那英伟达这边我们找很多实习生啊。就是跟这些很有想法不同背景的人。然后一起合作啊。研究。然后互相学习。然后。所以我觉得这东西是啊。是帮助我成长啊。就是。然后也帮助他们成长一个很重要的一个发展。

嘉宾 你一二年加入了三菱就博士毕业加入了三菱研究所。然后一六年加入英伟达你后面这个职业的变化是怎么发生的你怎么加入英伟达的。

小俊 是从开始做 deep learning 之后我很相信算力在三菱电机呢?不是一个重视算力的公司是一个啊。它是重视算法。然后那时候我为了能做出研究做出好的研究我就常常跟我那时候的 manager 要求要买 GPU。

嘉宾 哦。

小俊 对。然后开会就是说我们需要 GPU要做这件事情在那个三菱电机有一个 long time mentor 啊。他叫 angelo 制造他是也是一个很有名的研究员。然后他那时候就决定离职加入苹果做自动车。然后。然后我突然间觉得说就是当初把我留在三菱电器的主要原因走了。然后我就开始思考说我是不是?也要换工作那很自然而然的换工作就是到硅谷跟这些大公司聊一圈那时候大家都看到就是 google 啊 apple 啊。亚马逊啊。这些meta 这些大公司。

嘉宾 嗯。

小俊 然后后来他们的 recruiter 找到我然后我看到哎 NVIDIA 对每次我都想要买他们的 GPU。

嘉宾 嗯。

小俊 啊。那我这么缺 GPU 这么想要 GPU 啊。为什么我不加入一个啊。就是生产 GPU 的公司啊。所以那时候我之后就决定就是加入这个啊。英伟达那我那时候父母亲不太能理解。因为 no 英伟达是他们没听过的公司那时候没听过的公司那说您苹果不错啊。谷歌不错啊。你为什么要加入这个英伟达。然后我当时很宠。因为我觉得 GPU 是最重要的啊。其实那时候我我我开始做 couple game 的时候呢?这种 unsupervised approach 啊。所以 unsupervised approach 代表数据取得比较容易一点你不需要标注那我就觉得那最重要的就是算力跟数据嘛。那啊。我既然数据不需要标注那我就去有算力的地方。然后一件事情很有趣的是我。后来发觉就是我那时候在三菱电机的 manager我每次跟他 argue GPU 只要我吵赢了。他给我一些那个经费去买 GPU 同时之间他会买 NVIDIA 的股票。然后。后来他就退休了。

嘉宾 他没有告诉你是吗当时。

小俊 他后来也跟我说了。

嘉宾 当时没有告诉你不然你也可以买了。

小俊 是的嗯。

嘉宾 嗯我看到你在三菱电机的工作的时候就已经和 NVDIA 的人有一些合作了是吗在一些论文上面。

小俊 嗯。不是我豆瓣是那时期就是写的那个paper 啊。因为那个学术的那个论文啊。就是审核啊。有时候你不是第一次投就会上。然后可能是多投了几次后才上那呃在三菱做的研究啊。可能。后来到了。那个啊。英伟达之后又继续在上面做些提升哈。然后。所以这个才会有些paper 的作者。同时有三菱的作者跟跟英伟达的作者。

嘉宾 哦。

小俊 对并不是在那时候有合作就公司跟公司之间合作没那么容易。

嘉宾 哦我以为是之前有一些合作的基础所以你加入了英伟达其实不是的还是正常的一个求职的过程。

小俊 对就是啊我那时候并不知道那个啊英伟达有一个研究机构。

嘉宾 哦。

小俊 对我那时候觉得主要是卖 GPU。

嘉宾 嗯。

小俊 嗯。然后啊。那时候面试我的几位啊。同仁我。后来跟他聊之后才知道哎他们真的是在做研究才过去的那时候英伟达的研究机构没有什么名气。

嘉宾 多少人啊。

小俊 他时候去的时候不到一百个人吧嗯。那。而且不是纯粹做 AI 研究大部分人都是做 graphics那时候做 style game 那帮人啊。那时候也不是在做那个也不在做 gan 他们在做别的东西。

嘉宾 嗯。

小俊 啊。那我都印象很深刻就是在 NVIDIA research 每一年都会有一个叫啊 offsite就是把世界各地的 NVIDIA research 的同学飞到啊。是加州啊。在硅谷南边有一个小镇 Monterey 下面那个小镇。然后那边就有一个地区我们在那边做个两三天的就是研讨那是我第一次见到 Tero Karras 就是发明 StyleGAN 的人还有一个 Timo Aila Samuli 这几个重要的那个GAN 的研究员那时候他们都没有做 gan。然后我已经做一段时间了。那我遇到他们的时候他就跟我讲说他要把 gan 的问题给解了。那我会想说 ok你可能不知道多难呃我。当然希望他们成功。但是觉得他们有点低估它的难度。然后。后来他们就是真的一直投入在做这个 style game从一啊。二啊。三啊。然后就不断的突破。然后我跟他们合作当中学到很多东西对他们一直在做这种 unconditional 的不是这种我做的那种控制性的但。但是他们就是对这个细节的追求啊。对这个结果的那个追求就是影响我这个这个研究的发展很多。

嘉宾 嗯进入英伟达做研究有像你预期那样可以有很多的 GPU 吗。

小俊 对这世界上没有任何一个地方 GPU 是够的。

嘉宾 哦。

小俊 对。然后呃你总是看到啊。不够的地方哼对那我是很幸。运就是我是最早。在英伟达里面做大模型的那个就是用大量 GPU 来做这个生成式网络的的一个研究员那。因为我早期帮公司做了一些就是啊 visibility 很高的 work 啊。所以公司很多人都认识我。然后那个老黄也对我蛮有信任的。所以我就很有有幸有很多 GPU 资源可以去做这些研究但每次都是看到别人的 GPU 更多啊。那觉得自己总是不够啊。

嘉宾 怎么在一个像英伟达这样的公司获得更多的 GPU 啊你需要学会什么。

小俊 你要懂公司要解的问题是什么你要你要想办法就是跟公司解释为什么你做的东西会都对公司产生影响每个研究员都自己有自己的想法啊。都想解解事情。然后研究员某方面来讲都是 very high ego 嗯。就文人相轻自古皆然每个人都觉得自己想法比别人好。

嘉宾 嗯。

小俊 嗯。但公司的本质跟啊。还是不太一样啊。就是公司是为了。为啊。就是股东获利好那。当然对 Jensen 来讲他是希望可以 take care of family 就是整个整个公司这么多人一起打拼嘛。英伟达坚持出来他希望可以帮大家照顾好 family 就是公司要赚钱。所以我学到一件事情就是就是我深信我做东西是对世界很重要那这东西会产生改变好产生感改变会帮助公司那我要怎么去把这事情讲清楚让这个 leadership 让这些不懂得 AI 的这些 leader 啊。就是理解到这东西对公司重要啊。我觉得这是一个重大的的变化。

嘉宾 嗯这是你刚才分享的三个时刻里的第二个时刻这具体是在哪个项目里发生的转变。

小俊 啊。我那时候讲第二个时刻是如何让其他的研究员更加理解自己做的东西啊。就是重要性嘛。我觉得这个一是不断变化的过程我很难讲是具体在什么时候发生但我想讲三菱电机的那个案例对我印象很大。因为三菱电机在九零年代非常的重要。因为它是早期这种啊。就是没有任何限制的这个啊。地方来做 research 包含领域里面很多著名的人呐像啊。你知道有 Bill Freeman 那时候在那个三菱电机研究院嘛。然后 Bill Freeman 吸引了一堆现在比如说阿卢沙 Frawley 这是一些著名的教授都在那边实习过。然后那边就是做出很多重大的 research 所以那时候可以跟微软研究院啊。可以一起竞争嘛。但某一时期啊。公司的方向改变了。他们开始怀疑这些这种 blue sky research 对公司的影响是什么就越来越难去去 justify 为什么要去配这些 researcher嗯。好。然后就产生了一个很著名的事件这都是现在年轻人大家都没有接触到的事情那时候就开始啊。就是一堆重要的学者在三菱电机学者就陆陆续续被 fire 了离开公司啊。有些就加入微软有些加入学校当教授嗯。

然后那个 mit 是 stan 那个那个 rice 啊 harper。然后有些人去那那个 um disney 哦。就是人就陆陆续续的走那留下来的一些人就是他们还是做的啊。类似的 research 但是比较难跟公司的发展方向啊。相关比如说啊。三菱电机对做相机啊。做这种工业用的相机很感兴趣做机器手臂很感兴趣。所以你帮忙研究就是啊。就是就可以获得公的公司的支持继续往下走。

嘉宾 嗯。

小俊 那那我加入的时候已经是这东西都结束了。那。但是我那时候得到的训练就是说 Blue Sky Research 跟公司的兴趣也是可以 align 的。然后我又常常看到。因为在这业界很久常看到这种周期啊。就是啊。很多公司都会一开始的时候就是给很多自由度。然后很多很有趣的 idea 都出来了。但某段时间后开始紧缩。然后就是留下那一批跟公司这个啊。兴趣比较相关的人那就是你可以看到不管是 Google 啊。不管是 Meta 都是有这样一个过程那我可能是很有幸的在我的职场的早期我就看到这个过程的发生。所以我在英伟达的时候我就知道我那时候就就是一直认为就是首先我知道我做东西跟这个用 deep learning 来生成影像对公司绝对是正相关的更加花心思去理解怎么跟公司的决策层解解释为什么我做的东西重要。

嘉宾 哦。这个特别重要。因为可能是公司在上升期或者是膨胀期的时候它允许你做很多 Blue Sky 的探索。但是它只要是下沉的阶段它就会收缩。

小俊 对。

嘉宾 他一定要你回答为什么你你做这个事情重要你跟我有什么关系。

小俊 是而而且而去做 deep learning 非常花钱。

嘉宾 嗯。

小俊 对啊所以你更加要做注重解释为什么这是这这对公司是一个重要的投资。

嘉宾 因为大家也会注意到你的研究。其实很多时候的理念就是研究即产品这个跟那段经历有很大的关系是不是?这后面影响你在英英伟达的很多的呃做的研究和产品。因为比如说你的 GauGAN 你刚刚提的那个项目就是 spa 的那个算法。其实也是做成了一个实时绘图的一个产品。然后包括后面的也做了视频会议增强 AI 增强的一个产品就是所有你的研究都会变成一个产品去发布。

小俊 是我是算很。运气的人我是一个。呃我是一个。随着我年纪越来越大我越重视效率的人。所以我很精准的把自己的 research 变成了一个产品哈我不能说 GauGAN 是个产品我还有件事情是一个学习啊。一个重要的学习就是 AI 单独存在并没办法改变一切。

嘉宾 怎么说。

小俊 在做 AI 的时候大家都是追求越来越好的模型。

嘉宾 嗯。

小俊 当你慢慢会发觉就是模型的的那个就是慢慢收敛大家都差不多啊。当然我有些人会说我不断的进步但你看到就是那个这个月那个 Anthropic 比较好下个月那个 GPT 比较好。然后可能下下个月那个啊 no Gemini 就追上来了。然后中国这些强大的公司啊 g o a n t i m e啊 系的呃阿里混元。然后呃 deepseek 哦。然后 minimax 啊。这些公司都不断的在在在做突破那慢慢的就是大家的模型的能力都会差不多当你能嗯。模型能力都差不多的时候你就会理解到说你纯粹靠模型是不够的啊。那我我可能是比较运气比较好的就是早期就就认为这个模型会收敛。然后我一直重视就是不能只靠模型要跟公司的其他的 ecosystem 结合在一起你看 Gemini 做那么好就是 GeminiGoogle 有一整套的这种 Google Doc 啊 Google 嗯 search 啊。嗯 mail 一整套的平台合在一起那就是当越多人使用你的模型的时候你的要反馈越多啊。然后啊。越方便嗯。你就更容易就是对公司产生贡献对公司产生贡献公司愿意给你更多的投资你就可以做出更好的模型。

然后就一路可以把这个啊。长期的这个就是发展嘛。一路一路做下去。所以啊。那我在早期做 AI 的时候就是跟其他的研究员差不多就是 no 研究员啊 PhD 学生毕业的方式就是写出啊。高质量的论文什么叫高质量的论文呢?往往就是你在 benchmark 结果比别人好嗯。就是你就是要一个 killer 把别人的方法给击败。然后大家就是文人相轻嘛。总觉得自己比较行。然后就是一路往下做。所以很多时候早期做研究的时候就想要比别人好。然后到晚期的时候我会渐渐理解就是那种比别人好只是其中一个就是证明你的东西有价值的方式那。另外一方面就是你可以帮助到别人让大家都变更好嗯。然后你会发觉就是我我我现在的想法越来越接近就是我做出什么东西可以帮助整个领域变好而不是追求的就是我比别人好。

嘉宾 这是一种 high ego 还是一种 low ego。

小俊 嗯。我不知道是 high ego 还是 low ego 我嗯。我是有幸。的在过去二十年当中遇到好多聪明人我总觉得就是这世界上能人非常的多。然后我很多实习生都比我优秀。然后我也觉得这是非常开心的一件事情那我觉得我自己能做出东西来可以服务这个社会但我也不会觉得说我一定是比大家都还要优秀。然后啊。所以我不是说 high ego 也不是说 low ego 我就觉得我是有办。法产生贡献。

嘉宾 嗯。你刚才。其实说到一个你做模型的思路就是你觉得模型最终会收敛它的能力可能会同质化。但是我理解那些 frontier lab 他们的认知是说智能现在还没有到顶智能还要继续高速的提升你你不认可他们这个观点吗?就他 bet 智能的 scale。

小俊 我我。当然一方面很好奇嘛。啊。然后呃我自己也在用这些模型我也看到它不断的都在提升嘛。然后。但是有些人总是会讲说接下来会有 exponential growth 如果你不赶快投资这间公司不加入这个公司的话你就 miss out the opportunity 对。然后我觉得历史上看过去历史从来没有这样发生过就是一家公司就是掌握所有的科技其他其他的公司都没有办法去追上这从来没有在世界上发生过。

嘉宾 嗯。

小俊 然后我不觉得 AI 会是一个例外对我觉得就大家都很聪明对就是人员会流动总是在 a 公司做一段时间总觉得我自己的才华没有受到肯定我可能就跳到 b 公司去对那呃这些 know how 这些东西就自然会在这个领域里面扩散对。然后我总觉得不会有一个公司会比其他公司都做一个巨大的超前我觉得这本身就不是一个稳定的社会状态。

嘉宾 如果推演一下如果模型嗯的智能大家达到了一个差不多的水平接下来大家竞争的是什么呀。

小俊 就是呃整合跟跟自己的这个生态跟自己的产品的整合。

嘉宾 嗯。

小俊 对就是。

嘉宾 这是大公司创业公司呢。

小俊 创业公司啊。创业公司的优势是可以可以走那个大公司不能走的问题比如说对 NVIDIA 来讲任何生意只要是小于一个 billion 就没有兴趣去做但那些本身就是有一些很值得做的东西。然后有一本著名的书叫那个啊。叫什么innovator's dilemma 这。

嘉宾 这是一个创新者的窘境。

小俊 对嗯。就是往往这些小公司在走向那些当初不是很被看好的这个领域看到了一些东西可以慢慢逐渐起来很多公司都是这样起来的。

嘉宾 嗯英伟达也是这样的。

小俊 对英伟达是这样起来的。所以我觉得还是充满机会嗯。对我不觉得一定要做你你如果现在开一间公司要跟No Open AI Anthropic 做一样的事情很危险对你的资金绝对没有他们雄厚。然后你没有客户。

嘉宾 你要怎么去累积。然后他们这么大的资源可以把东西做便宜。然后你不容易追上。所以你要去解一些痛点是他们没办法去解的不是他们不想解是他们没办法去解他们不能justify为什么要去解这件事情。

小俊 所以哪怕是你要做大模型这件事情本身最后你也要找到你自己独特生态位不管是OpenAI还是Anthropic。

嘉宾 我们可以看到Anthropic它早期是被认为是落后OpenAI的对但它是最早相信coding的当OpenAI在做分散式投资把鸡蛋不放在同一个篮子里的时候那个Anthropic是做集中式投资。然后最早去做出这个coding这个东西的。所以它那时候就看到了一些那个就是机会。然后他就坚信就决心把它做出来。所以我觉得对创业者而言应该就是要决心要去看到一个机会。然后去看到一个就是你独特的机会利用你的资源把事情做成。

小俊 但是今天不管是硅谷还是中国大家又开始全部同质化的都在做Coding Agentic Coding 你怎么看这个现象你觉得这是对的吗。

Insight

技术管理者的杠杆来自优先级和组织判断,但判断质量仍依赖持续接触代码、实验和使用者。

  1. 他称自己可能是英伟达首位由研究员一路晋升为 VP 的案例,并把原因归于早期 AI 建设、研究落地与持续获得公司信任(约 01:24–01:27)。
  2. 从导师 Rama Chellappa、实习 mentor 到 Tero Karras,他强调沟通、专注和把一个 idea 做到极致的影响(约 01:28–01:31)。
  3. 对 Jensen Huang 的观察集中于 first principles、长期投资、快速 prioritization 和持续学习;这些是受访者的个人观察(约 01:31–01:35)。
  4. 武术、站桩与冰浴被他用作体力和心智训练,但它们属于个人习惯,不应被解读成普遍有效的工作法。

嘉宾 每个公司做这件事情背后都有不同的目的好那我我不是站在他们的立场我无法去讲但从我角度来看就是呃这。其实是很辛苦的一件事情对那。

小俊 你说的是同质化竞争。

嘉宾 同质化竞争是很辛苦的一件事情啊。我觉得他们做这件事情可能是被迫的。因为这是本身是一个重要的一个technology 任何人都不希望自己核心科技是被掌握在别人的手里对吧?那但我不觉得这个是他们计划的全部他们一定有其他的计划去做出一些差异化你没有差异化就没办法做出有差差别性的产品。

小俊 最终还是要差异化。

嘉宾 我觉得是

小俊 嗯。刚才我们。其实回溯了。你的很长的一段经历那你觉得你作为就刚到美国时候的那个第一份工作的研究员呃刘明宇。然后到。后来变成一个在英伟达变成一个Tech Lead 然后再到现在是一个VP 研究的VP你觉得你在不。同时期解的题是一样的吗。

嘉宾 嗯skill 是越来越大。

小俊 嗯。然后那个这个skill 指的不只是管理的skill 对吧?

嘉宾 对不只是管理的skill 不管是运算人员的skill 然后嗯。这跟整个AI发展也有关系嘛AI从探索到可以落地嗯。那这是一个变化。然后这些不同的时期都有不同的经历有时候还是会怀念以前那些各种方式都各东西都不work 整天就想什么东西会work 的时光。

小俊 为什么有多种可能性的时候也也蛮蛮开心的吧就多个选择多个选择会给你一种开心的方式现在的状态就是也有很多选择只是就是我觉得越来越趋近我自己蛮喜欢就是呃回到事情的最最核心了。然后现在发现就是很像是现在的解法都是呃无重剑无风大巧不工就是啊。很扎实的一步一步把这个Beta 硬件做好。然后就把东西写出来在这个执行过程当中我也觉得是一个很不错的历练从里面学到很多东西怎么让这个帮助团队看到最核心的本质。然后去去提升这个执行力但。同时间又在可以创新的地方让团队做出重大的创新来去跟上这个时代的前沿就是各种时期有不同的挑战都很有趣。

嘉宾 嗯。从一个研究员到英英伟达的VP 这个多见吗。

小俊 我可能是第一个吧。

嘉宾 你是第一个对我觉得为什么呢?这是我想问你的。

小俊 我在英伟达前几年是每一年跳一级。然后就一直跳跳跳跳就到VP 了对。然后我觉得是。因为我呃早期在英伟达还没有AI人才的时候我就在那里嗯。就是帮助公司嗯。然后提升不管是AI 在社区的知名度或者是解释AI怎么影响公司。然后我自己又很喜欢落地就是一步一步就是获得公司的信任呃公司就愿意把这个越来越大规模的的专案给我做嗯。像现在想想就是整个团队这么多人运用这么多运算资源每天都是几百万美金就是的运算成本啊。储存成本我觉得就是积年累月啊。就是公司有一定的信任才有这个机会去带这么大的这个project。

嘉宾 嗯。所以你跟公司align 非常重要对吧?

小俊 对一个纯粹的研究员的天性和一个管理者可能是有某种程度上是相背的。

嘉宾 对研究员要创新研究员很ego 研究员需要recognition 然后recognition 呃有时候recognition 跟公司要的recognition 可能不太一样。

小俊 嗯。那你在成为管理者的道路上有没有?可能就是抑制一部分研究员的天性呢?有没有?可能是在戴着镣铐跳舞。

嘉宾 我觉得我还是一个研究员我还是常常读论文。然后我有时候会做一些实现。然后去去理解我我最担心在成为这个一路成为管理者的历程当中我最担心一件事情就是我我跟底层脱钩我不理解啊。就是问题的核心所在。然后我会强迫自己就是啊review 大家的code 然后啊。去读paper 然后去challenge 每个人的idea 然后跟大家做一些就是等于就是debate 来确保这个方向是对的我很呃跟我公司人大家都知道就是呃我可能是少数还继续在看code 的VP 然后还是继续会去就理解但我我觉得我如果不这样做我我。当然我我知道我的任务不是一个不是成为一个很能很能去实现的人但我是觉得。我如果不做这些东西的话呃我自己会不理解痛点在哪里我这样就更不能去理解大家每个每个人对这个专案的贡献在哪里就是我只希望自己一直stay grounded 啊。看清楚一切。然后这样可以帮助团队成长。然后也可以看清楚谁对谁谁的贡献在哪里。

小俊 嗯。如果说过去二十年就是你到了美国之后的这二十年对你影响很大的几个人你会说谁啊。

嘉宾 啊。那第一个就是我的指导教授啊。他把我带进这个深度学习这一行他非常厉害就是啊。然后他也是非常善于沟通。然后他可以让任何场面都是充满着欢笑啊。即使是啊。这种很严肃的这个review meeting 然后他对人都非常的尊重。然后就是在他那边学到很多东西。然后再来就是我在我暑期生啊。我做实习的第一个mentor 啊。他就是手把手教会我很多这个machine learning 的东西呃他对我影响非常非常大到英伟达之后就是多半跟这个同才学习是那个StyleGAN的艺术我也受他影响非常大。

小俊 对是哪方面影响。

嘉宾 他对东西追求到极致你如果读过他的论文你看他做的实验分析去把这个本质套出来这个过程这个这个坚持啊。我跟很多不同的研究员呃合作嘛。在那个时期。然后那时期很多研究员就是一个想法写一篇paper 同时间一个人大概可以写二十篇paper 或是四十一年可以写个四十篇paper Tero 就是每年只想写一篇paper 他就是把他所有的他他他也工作非常努力。然后就是把他所有的就是人生的精力啊。就投注在同一个idea 越钻越细找到问题的本质。然后产生重大的贡献。

小俊 这样压强更大就是这个stay focus 这件事情是我可能是从这里面啊。从他从这些人共事当中学到很多东西。

嘉宾 嗯。那老黄呢?他对你有影响吗。

小俊 非常大的影响他是个工作非常认真的人啊。我在早期加入英伟达的时候他常常会传论文叫我看。

嘉宾 传论文对叫我看。然后。然后我就要写一些summary 给他跟他帮他讲是什么事情他是一个非常热爱学习一直去学习一直去理解他当初也不懂computer graphics 他敢踏入做GPU 他去把computer graphics 学起来他也不懂Deep learning 也踏进AI 去懂Deep learning 对。然后嗯。这是他强大的学习能力强大的兴趣一直往下走。

小俊 嗯。他不懂他为什么敢投入呢。

嘉宾 他有一套自己的那个决策法则他就是叫first principle 啊。就是他会把事情的本质把它理清清楚不会受到外界的讯号的干扰他就是看的很清楚就是说这方向最make sense 然后就往那边走他在早期就敢all in Deep Learning 对让公司获得巨大的领先在早期就敢all in CUDA 让公司产生这个很好的foundation 我在认识Jensen 之前我觉得我的决策就是都是偏比较短期的。然后我看到他怎么去做这种长期的决策。然后坚持。然后我觉得是印象非常的惊人的那他还有一些很惊人的地方就是他的他的每天的信都非常的多。

小俊 邮件是吗

嘉宾 对邮件邮件都非常多但他都是很仔细的去读。然后去找一些别人看不到的讯号。然后做出一些那个啊。重大的决定。而且他嗯。是一个很理性的人当你事情很多的时候啊。你如果没办法去做prioritization 啊。就是把重要事情去做的话就知道你把时间放在不重要事情上面你就你就不会变得做出重要的事情嘛。所以你你决定哪些事情很重要是很重要的一件事情叫prioritization 然后我我自己是这样推想的他强迫自己每天读大量的Email 强迫自己快速的就决定什么是重要的什么是不重要的在每天不断练习之下看事情看得非常清楚嗯。好当你看清楚事情什么是重要什么是不重要的时候接下来都是执行那很多人执行的时候会把自己的个人情感放在里面就说这虽然不重要。但是我跟那个人不错。然后我是不是?应该让他去做他不会这样做他就是就是他就是觉得说我最终目标就是take care 整个公司我只要一直对我做对公司最重要决定你只要留在公司里面我就会take care of you 对。然后。

然后我就从里面去学习他怎么去做prioritization 然后我觉得这件事情让我印象非常的大就是我我现在一当research 的一年的时候可能。同时处理两三个project 就觉得好累啊。每天要换两三个topic 啊。那我现在几乎就是每半个小时换一个topic 然后呃我觉得以前是没办法想象自己做件事情。但是在这种不断的一直做context switch 的状态里面也帮助我去更加理解什么东西是比较重要的对。然后这是很重要一件事情。然后还有一件事情就是如果你学过Computer Science Computer Science 最重要的一件事情就是懒惰就是不用算的东西不要算。

小俊 嗯。可以晚点算的东西晚点算嗯。可以直接就是一个no 就全部一个no 嗯。那你人生就是这么多时间你的经历就这么多如果你能知道什么东西不要算就把它移出的话你的人生运用就更有效率。所以我觉得还是很值得去学习Computer Science 不要。因为AI 就不去做Computer Science。

嘉宾 老黄又把什么排入了。他的计算范围之外。

小俊 每个时期不一样每个时间点不一样对这不是永远固定的。

嘉宾 嗯。比如说现在呢。

小俊 他要处理的事情实在是太多也很难说现在什么东西不是重要我我自己看到的东西跟他看到东西完全不同的等级嘛。他看到是他等于是全球AI 重要的一个推手对吧?那他看到东西远超过我看到的东西那我不好评论他觉得现在什么东西绝对不重要。

嘉宾 嗯。你是怎么保持自己的精力的你有什么一些技巧吗。

小俊 我是很喜。欢运动的人我以前喜欢做这种团体运动打篮球啊。打网球那我。后来就是我还有一个很大的兴趣就是我是一个。啊。投入中国功夫很多年好几个十年就是从十八岁开始就一直在练习中国功夫的人。

嘉宾 啊。对我听说你练功夫是吧?有功夫老师。

小俊 有功夫老师。我的我的武术老师是徐纪他是一个很有名的武术老师。他的老师是刘云桥刘云桥老师是李书文当初是那个大家讲神枪李书文是沧州的武术啊。家的代表。然后他的八极拳劈挂掌对整个那个就是整个武术啊。是一个重大的贡献他所整理出来的八极拳劈挂掌那我觉得很有幸就是在台湾啊。那时候。因为啊。蒋介石的关系有一群这个武术家到了台湾那我的老师徐纪在那边跟刘云樵学。然后我跟徐纪学才去学会这些中国武术那武术这是一个很好的身体的锻炼不管是心智啊。然后磨练啊。啊。对体力啊。对心智磨练都很好呃还有武术。另外一个好处就是它是只要一个人就可以做的运动。然后。所以我早上起来就是啊。就是做这个啊。武术的锻炼自己在那边做训练啊。蹲蹲桩啊。打打拳啊。然后我最近还有一个新的嗜好就是叫Ice Pong 就是你用一个冰桶。然后把像运动员一样做完激烈运动之后跳进一个冰冷的水池里面。然后呃就是帮助身体的修复。然后我觉得这东西也帮助我保持个静力可以面对每天高强度的挑战。

嘉宾 这都是你上班之前要做的事情对和我我对你的印象还蛮不一样的。因为我每次看你都是一个非常谦和的人。但是你还是呃做一些相对有一点点激烈的运动对吧?

小俊 啊

嘉宾 冰水啊。武术呀。

小俊 是但呃我学武术的目标不是为了打架是一开始是啊。受到金庸小说的影响。然后那样就是对这些啊。这个中国武术充满了兴趣学了之后发觉是对自身的一种磨练中国武术最重要就是控制全身控制自己。因为你要啊。发挥要打出一拳的时候最大的力量会来自于全身协调可以把力量从脚一路灌到了手这么长的路径你要控制到全身协调这个力量传递到身上循序啊。就是一步一步到位是很难的。因为都一瞬间发生。所以你要经由不断的练习不断的自我修改啊。我觉得这个跟我喜欢一直自我检讨一直追求啊。都有很深的影影响。然后我并不是就是为了展现我就是强大的破坏能力啊。我是啊。就。我觉得。后来变成一种对自己的追求。

嘉宾 嗯。你的性格这种比较温和呃你能算温和吗?你在公司应该不这样吧。

小俊 哦。当然不是这样坐久之后都有点恨铁不成钢。然后看到呃年轻的研究员就是差那么一点火候就可以把事情做更好就会忍不住就会啊。提出来。

嘉宾 啊。所以还是会凶的对吧?在公司里面。

小俊 我是我觉。得是一种呃是一种直接指出这些问题所在嗯。取决于听的人听的人如果是觉得我是正面。的他就会很开心。因为这世界上不是每个人都愿意跟你讲出什么地方可以做进一步的提升对。然后他们可能会感激我跟他讲说这个地方你可以做的更好但如果你听者是觉得说我就在挑剔的话那你就会觉得我很凶。

Insight

不要先争论世界模型的唯一词义;先说明它为哪个物理任务提供数据、表示、预测或交互环境。

  1. 他认为 Physical AI 的共同核心是泛化:机器人能否把有限示范迁移到从未见过的环境、物体和任务(约 01:37–01:40)。
  2. “Matrix”是对第三层愿景的具象比喻:让系统在大量安全、可控的虚拟环境里通过交互加速学习;节目也承认这一层尚未真正实现(约 01:38–01:40;03:24–03:27)。
  3. 世界模型可以服务预测、理解或三维重建,定义会随用途变化;Cosmos 自称 Foundation Model,是因为它试图成为不同下游世界模型的共同基座(约 01:44–01:49)。
  4. 英伟达投资其他 world-model 公司与自建 Cosmos 在其平台逻辑下并不矛盾,但这种“共同成功”仍与扩大 GPU 生态的商业利益一致。

嘉宾 嗯。你这个希望能够一击制胜的课题是不是?Cosmos。

小俊 就是我们整个组就有一个project 就是Cosmos 对。然后我是非常。专注在做Cosmos 我也呃就是就是我们就是希望透过Cosmos 来对这个世界产生巨大的贡献。

嘉宾 嗯。这也是你接下来也许长达十年最重要的一个课题吗。

小俊 是的呃我们做完Cosmos 我们做完Cosmos 一的时候问那个Jensen 要不要?继续往下做。然后Jensen 跟我说你就做到Cosmos 九十七对我现在做到三而已。所以还有还有还有还有这个九十四代可以往下走。

嘉宾 为什么不是一百而是九十七。

小俊 那他他他是随口说说的就是啊。他他数字是随口说说但他的决心是展现在他这个数字上面他是认为这是一个重要的方向。然后希望我们可以继续专注啊。去做这个物理AI 的foundation 来帮助整个领域往下走。

嘉宾 嗯。我们接下来重点来聊聊Cosmos 和世界模型吧也是你当下最重要的一个议题我看你在你的个人主页上说你一直被这样的一个愿景所驱动就是为机器人构建一个黑客帝国对能不能?阐释一下这个愿景。

小俊 我认为世界模型可以帮助这些啊。具身智能啊。有来做到这个泛化效果嗯。那我觉得任何AI 的问题要解的问题就是这个泛化的问题你能不能?在你看过的训练数据之外也能表现的非常的好泛化对不对?就是在这个coding 啊。在这个chat 里面都是去解去训练模型让它可以去解在他训练没看到的东西的问题很很就是变得像人一样对吧?那物理世界的AI 也不例外就是要解泛化的问题那解泛化的问题在Cosmos 这边我们是想这样帮忙三个点第一个提供更好的数据第二个是提供更好的起始点。然后第三个是提供更好的环境数据是你可以用生成数据啊。数据是帮助AI 模型更加泛化的关键就是你可以想象这个世界上你看到的数据是这么多个点你可不可以去生成一些你需要看到。但是你真实世界真实世界里没有采集到的数据我把它叫Better Data 然后再就是如果你可以训练出一个好的世界模型这个世界模型理解世界怎么运作可以去预测未来发会发生什么事情这样的一个模型它本身的这个representation 是不错的。

其实可以提供一个物理世界AI 就不管是policy model 还是什么model 一个更好的一个backbone 从里面可以去就是衍生出你想要做的policy 啊。这是更好的起始点更好的数据更好的起始点那第三个人是怎么学习啊。在这个物理世界学习呢?就经由实验啊。经由啊。跟这个环境做交互跟真实环境做交互往往是比较昂贵的。然后你能获得经验累计。

嘉宾 一定是短暂的就是一个极限。

小俊 嗯

嘉宾 如果说你可以用这种像黑客帝国这种矩阵的方式给。同时产生多个环境真实无比的环境你可以跟他交互。然后给你讯号你是可以学习的非常快的那就是更好的环境更好的数据更好的起始点更好的环境那里面最具有挑战性的就是更好的环境我们不想在我的网页里面把它写得非常的长像一个 essay 一样只是提出了像黑客帝国这样是一个啊。比较好的一个就是帮大家理解我们想这么做怎么帮助这个 Physical AI 的 community。

小俊 嗯Cosmos 这个在内部具体是怎么立项的这是二四年还是二五年。

嘉宾 嗯

小俊 二四年吧应该。

嘉宾 二四年开始做的在二四年三月份左右我们决定要做。然后。

小俊 就是在 Sora 之后

嘉宾 对在 Sora 之后

小俊 就是完全是那个时间点啊。

嘉宾 对很对。然后大家都在想说啊。这个啊。是充满了决心嗯。一定要做。然后很荣幸的 Jensen 就是信任我啊。让我去带这个 project。

小俊 说服他的过程难吗?在这这件事情上。

嘉宾 那时候已经不难之前要说服比较难但看到 Sora 之后就不难了。他就很他他是很聪明的人他一看就知道这个东西对对那个这东西对公司的影响他是一个很有纪律的人有些东西即使很重要他会叫你 pacepace your steps 就是让你不要挤他擅长打马拉松战。

小俊 嗯

嘉宾 嗯。对好。所以他是很有纪律就是就是慢慢地一步一步往目标前进。

小俊 为什么之前这个时机还没到在 Sora 之前。

嘉宾 这 Sora 之前就是嗯First mover 有 first mover 的 Advantage 对不对?好。然后每家公司有不同的定位对吧?

小俊 嗯

嘉宾 取决于你想要解什么样问题你要怎么样活力我没有足够多的资讯来判断啊。但我不觉得你看像现在很多家公司都做得很好啊。现在做Video 生成最赚钱的应该是字节吧对 C 店对吧?所以啊。这个轨迹是很难说的。

小俊 嗯。好到 Sora 的时候觉得时机到了。

嘉宾 对嗯

小俊 是你又跟他写了封邮件吗。

嘉宾 是我们这一群在做这个生成式模型的做这种 Media Generation 的这群人一起决定跟 Jensen 写邮件我猜每个人都有写吧对我们。

小俊 每个人都会写不是一起写一封。

嘉宾 呃我们会讨论。然后一起写一封。然后让大家都会加意见。然后就是就变成一个公司的共识就是我们必须要把这东西做出来。

小俊 哦Jensen 回复这封邮件了吗。

嘉宾 对就是把我们聚集在一起开会嘛。

小俊 哦。然后在那个会议上打成了共识。

嘉宾 对。其实会议之前大家都达成共识了。

小俊 嗯

嘉宾 然后那个会议只是是更具象化到底要怎么做。然后谁负责这样子。

小俊 你对那个会有什么记忆深刻的事情吗?有什么场景。

嘉宾 就是他叫我们去想名字嘛。然后我那时候。其实已经知道最后他会提出更好的名字有点拒绝不想浪费我的力气想个名字之后他想出更好的名字但我还他还我就跟他讲说你就直接跟我们讲吧你觉得什么名字好他说不行你要去思考去想我觉得有道理啊。因为这个名字跟产品的定位会非常的相关。

小俊 嗯

嘉宾 你看我们叫 Cosmos 是一个就是那种宇宙啊。

小俊 我们目标就不是产生这个 content 不是为了要做创作就是为了要解物理世界的问题啊。

嘉宾 嗯

小俊 才慢慢往物理 AI 这边前进。

嘉宾 因为 Sora 其实是一个服务创作者的一个事儿。

小俊 它早期的 demo 是这样讲。

嘉宾 嗯。为什么你们当时选择的就是 Physical AI 呢?就是面向的这个市场。

小俊 那时候已经陆陆续续可以看出来就是那个 Physical AI 它会是下一个 revolution 因为这个是个刚需嘛。

嘉宾 嗯

小俊 就每个人都会老化每个地方都缺乏劳动力每个人都想提升更好的生活品质还一方面来讲就是嗯 NVIDIA 是走这个 developer market。

嘉宾 嗯

小俊 啊。就是帮助这些开发者啊。就是做出更好的产品我们自己不会经营一个社群网站也不会去经营一个创作工具。

嘉宾 啊。这有点太 To C 了对于英伟达来说。所以你们定了。我要做一个世界模型。然后这个世界模型是为了 Physical AI 的。

小俊 为服务 Physical AI 这个 community

嘉宾 嗯对

小俊 今天大家对于世界模型的定义还是非常的不清晰你跟我们讲讲你的世界模型的定义吧。

嘉宾 我我是个很。讲究实用性的人嘛。那人为什么会去设计一个模型呢。

小俊 嗯

嘉宾 就是它可以用那用法有很多种对不对?比如说啊。你设计一个模型设设计一个模型来描述这个世界仅由这模型你可以去预测接下来发生什么事情。所以它的目的呢?是为了预测这边好这是一种世界模型的为什么去设计世界模型的原因。

小俊 嗯

嘉宾 用处嘛。预测那。另外一种是你想去理解为什么这事情发生了今你某方面来讲整个物理学就是去建世界模型去了解这世界是怎么运作啊。从这个牛顿力学一路到这个啊。量子力学啊。就是去去去了解这世界怎么运作就建一个模型嘛。然后去帮助我们理解怎么运作那。当然从 different learning 里面啊。我们把这个这个 understanding 啊。就是经由一些标注的数据去去教这个模型啊。这个东西会这样是。因为发生这件事情。然后。然后经由大量的数据泛化。然后帮助未来新的事件发生的时候你经由这个看到的视讯讯号。然后去解释帮助人去理解发生什么事情比如说这工厂在工厂里面为什么这个地方突然间产线卡住了。然后可能是之前某个工人忘记把什么东西打开也是一个这个世界模型建的也是一个目的性就是为了去理解发生什么事情找到问题对还有。另外一种世界模型就是为了要重建这三维的世界从重建这三维世界有很大的用处你可以去规划你东西路线要怎么走啊。然后你可以就是让人去体验一下你人虽然身不在这个真实世界但你可以在虚拟的状态下而去在这世界里面做游历这是模型for the world 来。然后。

因为你的用处不同。所以它的模型的形态长得不一样。

小俊 嗯

嘉宾 终究我们是在同一个世界里面这些模型就是不同的就是经由不同的观察来去描述同一件事情那种重建是 重建是一个很重要的学问那我自己本身就是以前做过重建但我现在已经不再在做重建了。我现在就是主要是做物理世界的理解跟物理世界的生成对吧?就是 prediction 这些事情就是大家都会对世界模型有不同的解释啊。现在定义什么叫 War Model。

小俊 嗯

嘉宾 在几年前呢?同一件事情发生就是大家定义什么叫 AGI 对。然后经过这么多年还是没有一个共同的定义。

小俊 对

嘉宾 对。然后我认为去定义 War Model 很可能会走向同样的道路我觉得没有可能不是很重要的一件事情。

小俊 这是。因为这个词太大了吗?过于笼统。

嘉宾 对是过于笼统那就是定义出来后对对这人类有什么影响。

小俊 诶那为什么 LLM 就是一个相对精确的词。

嘉宾 LM 就是 large language model 它模型很大。然后做 language 对。

小俊 就这个词为什么大家都是一个有共识的一个精确的定义。但是世界模型大家一直在争论不休。

嘉宾 对LLM 就是我 LMLarge language modellanguage model 就是可以 predict 接下来会发生什么词汇。

小俊 嗯

嘉宾 对吧? large 代表说它的模型很大这很很明确。

小俊 对

嘉宾 嗯

小俊 对吧?就是世界模型就是一个可以帮助你去 model 这个世界的一一一个工具。

嘉宾 嗯

Insight

“统一”真正有价值的部分不是概念漂亮,而是它能否同时提高效果、减少维护面并保留客户可适配性。

  1. 刘洺堉用“减少陈列反而提高选择效率”的比喻复盘 22 个候选模型造成的用户困惑与维护负担(约 01:57–02:01)。
  2. Cosmos 3 采用双塔 Mixture-of-Transformers:离散 reasoner 支持理解,连续 generator 支持生成;这种分离也降低客户只做一侧 post-training 时的能力干扰(约 02:11–02:18)。
  3. 将 audio、video 与 action 合并的依据是它们提供互补监督,例如接触声帮助定位事件发生时刻,预测 future state 可以辅助 action 学习(约 02:06–02:11)。
  4. 他否认存在单一 secret sauce,把大模型研发描述为假设、控制实验、记录、调整数据比例与反复验证;技术报告的贡献也包含把细节做全、开放和规模化(约 02:03–02:05;02:18–02:21)。

小俊 啊。那你 model 这个世界一个工具你要做什么用途呢?啊。因为用途不同。所以你 model 世界方式不一样。

嘉宾 啊

小俊 所以当只要你对这个世界这个模型有不同的用途之后就有不同的定义。

嘉宾 所以你觉得世界模型能够描述 Cosmos 吗?还是应该用。另外一个词来描述你在做的事情。

小俊 啊。是我我们一开始的时候我们是把 Cosmos 叫做那个 World Foundation Model。

嘉宾 嗯

小俊 我们目标是建立一个 foundation 让大家都可以建出适合他们要用的世界模型。所以我们把自己叫 Foundation Model 是。因为我们希望我们是一个。

嘉宾 更底层

小俊 更底层的东西来满足大家。所以我我。所以我是这样。我是这样。我们是这样定义的。

嘉宾 嗯

小俊 就哪怕他是一个要做世界模型的人他也可以基于你的 Foundation Model 来做。

嘉宾 是的

小俊 你是希望提供那个基座。

嘉宾 是的我们要提供这个基座对就是。因为我们认为世界模型将是在 Physical AI 里面重要的一个环节但不是每一个想从事 Physical AI 的公司都有足够多的资源去做自己要的世界模型从零开始做。

小俊 嗯

嘉宾 但他们又需要为了帮助他们我们就做这个 Cosmos 这个 World Foundation Model。

小俊 因为你们也。同时投资了 LeCun 的 AMI Labs 和呃菲菲老师的 World Labs 嗯。你们做的世界模型的差有差异吗?是嗯。

嘉宾 NVIDIA 是站在一个 enable 的角度我们希望就是啊。凡在我们的这个 GPU 的 ecosystem 上建立的公司我们都希望帮助他们成功我们希望大家可以一起走向成功 win win 然后嗯。每个公司看到的点都不太一样想解的问题也不一样。所以会有各式各样的啊。就Fei Fei 的 World Labs 啊 Yann LeCun 的这个 MI 都是不一样走不一样的路线那我们都帮助他们。然后也希望他们成功我们投资他们我们跟他们也有合作那如果说他们对我们的 Cosmos 东西有兴趣他们可以利用那呃其他家公司他们需要 world model 但他们可能没办法不像 fei fei 或是 Yann LeCun 资金雄厚对他们可能更需要帮助他们可以 leverage 我们的 Cosmos我们就是目标是帮助整个领域成功那这几家重要公司我们。当然希望成功但我们还很多需要需要去帮助的人。

小俊 所以你们没有竞争对手吗。

嘉宾 我觉得呃 NVIDIA 竞争对手就是跟 NVIDIA 做同样的事情的公司嘛。就是去做这个这个整套 AI 的这个 ecosystem 啊。那呃你说没有竞争对手那有些公司也在做算力嘛。我在做 Cosmos 的时候我是不想。竞争对手的我想的就是怎么去帮助这个 ecosystem。

小俊 嗯

嘉宾 对在我这 ecosystem 里面在 NVIDIA 的 ecosystem 里面的这些用我们 GPU 用我们运算平台用我们软体的公司他们如果都成功的话那 NVIDIA 就会成功对吧?因为它。然后会帮一些还没在我们 ecosystem 的人会产生信心那我觉得这是帮助方式我不太想竞争了。我已经过那个时期就是为了要毕业把论文发出去是我的算法要比别人好是我现在目标就是要帮助这个领域可以一起往下走。

小俊 嗯。嗯。因为从第一代到第三代的 Cosmos 其实也经历了很多的变化是嗯。你们在第一代到第二代的过程中有没有?什么积累什么浓厚。

嘉宾 是的就是

小俊 这就是去年的工作。

嘉宾 对这个步调很快那那时候开始做那个 Cosmos 的时候我强调一个点就是我们要迭代快速那时候深受 DeepSeek 的影响。因为DeepSeek 是很惊人的公司它可以一年一年内迭代三次产生 DeepSeek V 三对。然后。所以我一直强调就是我们要迭代速度快啊。迭代速度快的话可以一直不断的进步嘛。一代比一代好那。但是我们那时候挑战的题目是这个物理世界模型。然后在那时候。其实二四年不是很清楚就大家都还在摸索。

小俊 嗯

嘉宾 什么样的世界模型对大家有帮助那刚刚讲就是不外就是用世界模型是怎么用它啊prediction 或是 understanding 啊。那就是做这个这种 video model 来帮助 predict future 然后我是做这。种 reasoning model 来解释发生什么事情。

小俊 嗯

嘉宾 然后。所以就是一个一开始的时候就跟一些伙伴合作去理解他们的需求。然后啊。然后自己本身有一些想法。然后就做出这些模型。然后跟这些伙伴迭代之后才慢慢收敛就是在过程当中就是慢慢的收敛从。然后我们那时候做了 predict 之后啊。可以预测未来。然后想说呃仿真环境是大家常用的环境但它的生成的这个 video 啊。就是跟这个真实世界的讯号还有一定的差距可不可以就是用这个模型来帮助它更啊。逼真那就做 transfer 啊。为了解释发生什么事情就做了 reason。

小俊 当时是三个

嘉宾 对。然后。后来理解到说我如果可以去描述这个这个 pixel space 这个 pixel 是怎么变化的那我这个 pixel 变化跟我这个 action 的变化。其实很接近的。所以我们要做一个叫 Cosmos Parsing给一个 Parsing Model 然后。后来陆陆续续的发觉就是就像刚刚讲的一样这是同一个世界不管你从哪个角度来看你 model 都是同一个世界你模型就是在学一个 internal representation of the world 就是这个世界你在做压缩过程当中学到怎么样的一个表示方式那既然是同一个东西那还有一个东西就是 Foundation Model 它的核心概念就是一个可以纳百川就是可以从各式各样的数据里面去学会那个就是这个模式的一个模型。所以如果你可以把你 train reason 用的 data train predict 用的 data train transfer 用的 data train pass 用的 data 全部合在一起的话你这模型的上限更高一个你是描述同一个世界。

然后第二个 Foundation Model 就是就是纳百川把东西合在一起好那。所以就慢慢的往这个单一模型走它中间还有一个是一种执行上的问题我记得我当初去建的这个第一版的 Cosmos 的时候我自己算一算就是。因为我我是希望。真的模型可以帮助到其他人。然后跟这些 partner 合作一下我可能需要这个模型 A B C D E F G我自己算一算那时候可能需要二十二个模型。然后那时候我就呃有个会议啊。跟 Jensen 一起开会我就跟 Jensen 说我预计需要二十二个模型。然后 Jensen 听到就觉得我工作非常认真他就是讲说very good you know work very hard。然后他想说。但是你知道吗?Louis Vuitton LV 这家店呢?当他减少他的货品陈贵陈列的这个货品数之后反而 sales 是提提升的你不希望太多的东西困惑你的那个消费者让他没办法做出决定那个对我影响很大就是我理解到说嗯。对我也自己也遇到问题连我自己都分不清楚要用 A 还是用 B 了。那其他人更加不清楚。

然后再就是执行上的困难一个每个模型你出来我们不是发 paper 就结束走下一个 paper 我们要去帮助使用者去用那只要每个模型出来我们就要维护要解决问题。然后当你有数个模型的时候就是啊。很辛苦。

小俊 嗯

嘉宾 贝多则利寡嗯。然后影响到你迭代的速度。所以啊。在做一的时候是在地铁的过程当中。然后还快速做二。然后在做二的。同时就理解到不行啊。就是这样做不长久。所以就决定要做这个 only 啊 model 的 world model 就是 Cosmos 三那就四个方向第一个是描述同一个世界。

小俊 嗯

嘉宾 所以。其实是可以合在一起的。然后第二个 Foundation Model 就是吸收各式各样的 data 合在一起。然后在开发上也简单很多。所以就是走向了 Cosmos 三这条道路。

小俊 所以二到三。其实是一个大的变化。

嘉宾 是的一到二的变化是啊。等于是数据的提升还有一些那时候在二的时候把 passing 带进来是有些变化但我觉得二到三是一个很大的一个 gap。

小俊 嗯

嘉宾 对三做了多久。

小俊 三从去年十月开始做。

嘉宾 也就是刚好发了二之后二月发呃十月份发的二。

小俊 对。其实。其实那时候在啊。大概是更早时期就知道说必须要做三。然后但那时候已经开始二点五。然后把二点五收尾。

嘉宾 嗯

小俊 然后把二点五收尾之后再开始做三。所以可能三可能就是大概是九月的时候开始知道说要做三。然后真正执行可能就是十月十一月。然后做了将近半年对超过半年。

嘉宾 一个中国做世界模型的创业者他说他看 Cosmos 三论文看了一周。而且是每天看里面有很多的细节嗯。我觉得他们的观点是说就是觉得 Cosmos 三它在技术的大的创新上不多。但是他把很多的细节工程验证出来了。你觉得他们的这个评价中肯吗。

小俊 Michel Transformers 之前也有人提出。

嘉宾 嗯

小俊 然后 Parsing Model 之前有人提出我们是第一个把这个 Michel Transformer scale 到这么大的模型把 Audio Video Action 都合在一起。然后这些东西呃从概念上来讲就是东西合在一起但你真正要把它做出来不是那么容易。

嘉宾 嗯

小俊 那真正做出来就是这些细节所有的啊。这些大语言模型都是Transformer 架构啊。你可以讲大家都没有创新。但是它的那些细节会让这个某些模型比。另外一些模型好很多我认为就是这么多年之后我就更加重视那个啊。这东西能产生的效果我就往往越来越不重视这些东西是不是?革命性的一个。

嘉宾 原创

小俊 原创对

嘉宾 嗯

小俊 对我来讲它有用产生 impact 解掉大家能想解掉问题是它的重点对那这个 paper 我们是希望帮助整个开源社区啊。就是做开源模型帮助到整个 Physical AI那我们这几年看到的现象就是这些 Frontier Lab 很多都走向闭源。然后即使写 paper 也不愿意讲出那些关键的环节。

嘉宾 嗯

小俊 那我们决定走不一样的道路我们把能讲的东西都讲得起能就是把就是尽量把东西讲讲得非常的清楚。然后能就是我们开源这个模型也开源我们怎么去训练这个这个模型的框架。然后部分的这个 synthetic data 我们也都开源了。我们就是希望保持透明让大家看到怎么做也希望别人可以利用我们开源东西做出跟 Cosmos 类似的东西如果他们有这个兴趣的话我们目标就是 enable 这整个 community 对我。

嘉宾 担心别人可以做出一模一样的东西。

小俊 嗯。

嘉宾 我想到你刚刚提到DeepSeek 你选择开源跟它有关系吗?

小俊 嗯也不算是有关系,就是呃 DeepSeek ,它的工作对整个 AI 的影响非常的深远,第一个把 MIT 和ASPER 啊这个开源的一个公司。然后你看它最近的模型,它的用心把这个把这个闭环机制直接对这个领域都产生了深远的影响。

嘉宾 嗯。

小俊 我觉得这很重要,从这影响的角度来看,我觉得是相通的,我们是想产生影响,把这些细节都讲出来。NVIDIA 有很多这个建在 NVIDIA 上面的 Physical AI 的公司,那我们希望帮助他们成功,我们的目标可能跟 DeepSeek 是不一样,对,我们是希望帮助我们的使用者成功。

嘉宾 你们天然就是这个生态了。

小俊 对,我们就是希望就是那个啊希望可以帮助这个这个这个 Physical AI 降临世界快一点。

嘉宾 嗯,你们在这次为什么选择首先在输入层同时能够输入语言 Video Audio 和 Action ?这是一个重要的决策吗?

小俊 是,是,我觉得就是这个世界不是只有视觉,对吧?然后也有听觉,当我也想加入触觉。但是触觉的讯号还不好,这个 Touch Sensor 这些东西还,我觉得还在快速迭代当中。

嘉宾 这个需要灵巧手。

小俊 对,需要灵巧手,需要数据,那我觉得大模型呢基本上思路有两个,一个是让 Language 当成 first class citizen 就像 Coding 啊像 Chat 另外一种是让那种视觉讯号 Video 当成是 First-class citizen 像 Siddhance 啊像 VLM 。我们认为物理世界的模型跟这个数字世界的模型最不一样的地方就是物理世界的 Agent 会 take action 会改变这个世界的状态。

嘉宾 嗯。

小俊 我们认为一个好的物理世界的 Foundation Model 也要把 Action 当成 First-class citizen ,这是为什么我们把 Language 哦 Video 跟 Action 合在一起建这个 Cosmos 3 。

嘉宾 嗯,我记得以前杨植麟跟我说,他们做语言模型,他就是把语言当作最重要的智能提升的工具。

小俊 对。

嘉宾 他们会很担心 Vision 加入进来,就是影响它的智商,变成一个傻的多模态。但是谢赛宁今年又跟我说,他说他担心语言对于视觉的污染。他觉得语言才是人类的脚手架,并不本质,这是他的观点。所以你怎么看待他们这两种观念?以及你把他们这些信号都训到一起的时候,会出现问题吗?就互相的污染。

小俊 这些讯号他们带进来都有他们的目的,就是 Language 可以把这些人类的 Knowledge 带进来,然后也帮助人类跟这个这物理 AI 做沟通,对吧?然后 Video 是大量的视觉资讯,Audio 大量的听觉资讯去描述这个世界怎么运作。那这个更紧用用这个 Video 更精准的去 Capture 这个世界的物理运作用 Language 反而很难,对吧?但是人跟这个模型,这个模型最后建出来是要服务人的嘛,那你他不懂 Language ,你是没办法跟他沟通的。然后这个这个模型最后是要帮助这些 Machine 去 Take action 的,所以他不懂 Action ,他是没办法去改变这个世界的。应该这样讲吧就是呃我们的目的不同,对我我的我的目的是希望这成为一个好的 Foundation Model 来 for Physical AI ,他需要懂 Language ,需要知道这个东西怎么变动,然后 Action 。然后经由这个 Control 把它合在一起去做,那我的目标不是去追求 AGI 对,然后那 AGI 本身也很难去定义嘛。

当你定义的 AGI 就是纯粹要去解这个了解这个人类的本质的时候,或者什么啊。去做 Coding 的时候,可能这些视觉讯号会影响到你啊,那是必然的,对吧?遥远的古代是没有任何语言的。然后这一切人类的文明的发展就是经由这个看这个世界怎么变动而产生的,那你可以觉得。因为啊。毕竟这个这个语言是发展适合人类的,但你不知道机器是不是?接受这一套,也许你就从这个视觉讯号里面直接去学这个世界的怎么运作,得到一个 Intelligent ,然后发展出。另外一个文明,那你从角度看也许语言讯号是一种干扰对,那我觉得是看你要的是什么,我很明确的知道我要的是什么,所以我觉得我需要 Language 让人可以跟这个物理 AI 沟通,我需要 Video Audio 去去描述,去去从这个物理世界的变化啊,就是去学会这个物理啊。本质。需要 Action ,因为我希望它最后是可以 for Physical AI 去改变这个世界。

嘉宾 嗯。

小俊 多模态融合到一起,这些模态是相互 Benefits 的还是相互制约的?

嘉宾 在过去呃一年甚至超过一年之间,我们都一直在研究把这些模态的融合那我们从各个不同的研究里面得到一些线索,在 Cosmos 三的时候把它结合在一起。比如说在 Cosmos Pass 那篇 Work 里面,我们就发觉把 Video 跟 Action 合在一起是帮助 Action 的。对,就是当你在呃直接 Predict Action 的时候啊,就是当我们在做 War Action Model 的时候,我们发觉就是除了 Predict 你要做什么 Action ,你也 Predict 接下来Take the action 之后会产生的 States 就是 Observation 是帮助你做新训练的,收敛。所以我们知道就是 Predict 那个 Video 是帮助 Action 的啊,就是 War Action Model 的的这个这套系列声音也可以帮助 Audio ,啊。声音也可以帮助 Video Generation ,当你这样咔一声碰到的点,你就知道接触的时间是那个点。所以知道这个是有互互相这个互辅的。

然后一般做 Video 的人都知道就是从文字到 Video 这是一个啊。循序链变大的过程,啊。循序链变大代表说有很多种可能性很多种可能性的方方选是比较难去学习的,就是你一种东西可能十种可能,啊。这东西就没有固定它比较不好学。所以在做 Video 或 Image 大家都会发觉,就是当你的那个文字描述非常详尽的时候,这是比较容易产生好的一个 Video 哦。所以你可以知道就是文字啊。的详细描述也可以帮这个这个 Video ,那我们做这个 Cosmos 三啊。就是像把之前呃这些 Cosmos Reason Cosmos Predict Cosmos Transfer Cosmos Pass 这些东西合在一起,合在一起本身就有它的好处了,整个东西都简化了。那这些讯号怎么合在一起,让它产生互补的作用,而不是互相啊。抗拒的作用,这是可以经由实验的设计,经由这个 Data 的比例的调整来来达到的。

所以我们那时候是坚信着这些讯号都是描述同一个世界,这些讯号都含有这个世界怎么运作的资讯,是应该有一种方式让它们合在一起会互相帮助更多讯息帮助你了解这个背后的运作的原理是什么。所以啊。有这样的 Belief ,然后从这方向出发。

小俊 在这里面有什么 Secret Sauce 吗?在互相 Benefits 上。

嘉宾 其实做大模型没有什么 Secret Sauce ,就严格的实验假设实验看到结果累积姿势,再做下个实验,就一步一步一步往下走走扎实的做就对。没有什么,我不觉得有什么就是不可告人的秘密,就是你要追求的东西,耐心做实验验证,对了下一步,就这样走。

小俊 嗯,因为你们这次采取的是一个双塔的呃设计,呃一一个塔在呃处理散信息,一个塔在处理连续信息。呃,为什么采取这个设计?

嘉宾 嗯,有很多个原因,啊。一开始的时候 Cosmos Reason 就是离散的,啊。从那个 Vision Language Model 出发,那 Predict Transfer Pass 是连续的,所以啊。就是我们知道离散的 Work for Understanding ,我们知道连续的 Work for Generation ,那把它放在一起啊,就是一个啊。现阶段很合理的一个选择。然后再就是呃有很多种用 Cosmos 的方法,但常用的是做 Post-training ,就是也许用你的 Video Action 的 Pair 来去 Train Generator ,然后或者是你只想用 Reasoner ,啊。只是用你当知自己 DOMAIN 的这些 Understanding Data 来 Train 。当你有两个,这样可以合在一起,可以把轨迹的影响切开的,是帮助客户去使用的。

如果我们全部连在一起,好那这是 Generation 跟 Understanding 在一起了,好我现在要换这个 Generation 的 Distribution 在换的过程中,因为全部都连在一起,你的 Data 也会改变你 Understanding 那边的表现,如果你没有两个 Tower 你是一个的话。那 Understanding 那边既然要改变,那你的 Data 又没有 Understanding Data ,它很容易这个 Understanding 部分就流失好,那就不方便客户使用,所以分成两个,是对使用上是有一定的帮助的啊,虽然它相对起来还是不够 Elegant ,啊。因为你还要事先决定它的架构。在整个 Deep Learning 就是让 Data 来决定啊,这是怎么说,而不是你人为去去做区分。但是在这个阶段,我觉得这个东西是比较合理,比较适合它使用。那讲到这个东西也可以大家可以猜出来,就是我们下一步目标是更加简单一点啊,为什么要两个 Tower 一个 Tower 就够了,啊。

但是我们在往一个 Tower 东的目标前进的时候,我们要考虑到这些使用者是不是?容易用上它,因为我们不是,我们的目标是帮助大家赢,而不是自己就是产生一个就是可以做很多事情的模型。我们相信机器人每个都不太一样,有个啊。相机的数量相机的位置啊,然后自动车每个都不太一样,我们需要我们觉得需要克制,那我们要。其实合在一起去追求这个工程的这个简约完美,我们要考虑到使用者是不是?有办法去利用它,那这是我们必须要研究的课题。

小俊 嗯,但是相对来说呃离散的信号更好处理,把融合进了连呃连续的变量之后它的处理难度会变高,你们怎么合在一起并且能够把它 Skill 上去呢?

嘉宾 对,现在呃有一系列的 Work 像 Transfusion ,啊。它是可以。同时处理这个离散跟连续的。在做 Next Token Prediction 的时候,它是做离散的,然后在做 Diffusion 的时候,它是连续的,可能是通用同一个 Tower ,然后这段时间也有很多种不同的啊。就是变异,大家在研究这个大家都关切的问题,这些讯号可以用离散表示也可以用连续表示。然后我是希望。也许是不是?开发出一种架构,就是全部离散或者全部连续,啊。让事情相对变得更简单一点啊,那但这是一个理想,也不确定能不能?成功,也要做一步一步的实验验证啊。往下走。

小俊 直觉来看离散更容易还是连续更容易啊?

嘉宾 嗯,各有各的好处啊,离散比较好做训练啊,然后连续它有它的啊。漂亮的地方啊,就是在做 Inference 的时候,他们两个是很不一样的一个呃 Shape ,然后最后最关键的就是呃做客户还是要部署,啊。部署的时候一些成本的考量都很重要,所以我觉得最后就是会根据部署是最适合啊。什么样的什么样的模型最适合部署,就我觉得是最容易获得成功,所以有很多的方向要要记聚集在这里讨论。

小俊 有一个研究员问你,因为你现在是把所有的模态都训到一个模型里去,那理论上就是它也可以 Coding 得很好,也可以呃让机器人能够运作,然后也能够生成我们现在这种创作者的内容,那它有可能在这单一维度比如说 Coding 上比 Claude 还要强吗?

嘉宾 我还是喜欢讲这个孙子兵法讲的备多者力寡,对就是如果你什么都要好的话呃你但就是在训练过程当中你要博学多闻,你要触碰很多不同的的类别,让你提升你知识水平。但当你确定你只需要用这个单一的 Application 的时候,是不是?有些调整是。因为你你不 Care 其他东西的,有没有?东西是你愿意放弃啊,然后就是做比较好,因为如果你什么都不愿意放弃的话,你就会打得很辛苦。我觉得策略往往就是关乎着你决定你可以放弃什么东西。

小俊 这双塔之间会互相的提升吗?

嘉宾 我们知道就是嗯。我们在这个 Paper 里面有个实验,就是说当你用更接近 Physical AI 的 Reasoner 的话,可以帮助你更啊。做更好的 Physical AI 的 Generation ,然后我们也知道就是说如果你可以把 Generator 的轨迹传回这个 Reasoner 的话啊。理论上是可以帮助你的 Reasoner 做更好的那个就是强化学习的学习。在这 Paper 里面受限时间啊,我们并没有做成完整我们想所做的实验,已经很多实验了。但是就是啊。这件事情啊。这个 Foundation Model 开发本身就是一个很耗时,然后一个决定就是都是两三个月前就做了,然后很难快速的去做一些啊。就是调整,然后我们是我们不把这个三看成是一个中期啊,就是我们会继续做三点一三点二啊。一步一步往下提升,把一些我们想做进去的能力想做的一些研究,这是没有机会把它给呈现的继续补下去。

小俊 嗯,除了可能会更简单双塔有可能会变成一个塔,还会有什么在未来模型中可能大家会看到的一些变化?

嘉宾 我们很关注的就是这个模型怎么去帮助那个 Physical AI 的 Builder ,啊。然后这个模型推出去之后,啊。据我所知就是大家都在讨论,然后有些啊No Partner 一些同学都给了蛮不错的 Feedback ,泛化是一个核心的问题。任何 AI 的核心的问题,那在物理世界的 AI 里面,我觉得一种啊。我们需要达到泛化,就是假设我今天呃教机器人说我的衣服我喜欢这样折,然后喜欢这样放我就给这个机器人看一两次我怎么做,他是不是?就可以快速学会,在在现实生活中啊。就快速学会这个东西。然后是不是?给这个这个 Physical AI 读了说明书,他就知道怎么去操作这个仪器,怎么在这个工厂里面做那个检测。那我觉得这些东西是很重要的能力,是 Physical AI 能达到的。那。当然这些在落地的时候有很多考量,我是想说。在这个 Foundation Model 部分是有什么东西我们能做的,然后可以来帮助这些 Physical AI 的 Developer ,所以我们中间的提升可能都是会朝着这些啊。提升这些泛化能力啊。的角度来去啊。

把这些东西加进 Cosmos 模型里面。

小俊 比如说你们为这个有哪些具体的优化呀?

嘉宾 优化是像加速那些是一定会发生的啊,我们我们。当然是希望这个这个模型可以啊。就是越跑越快啊,然后呃。然后。另外一些优化就是能力的优化,泛化的优化对,那这个东西就是啊。可能会改一些架构上哇,或是一些 Training 的 Objective 的改变,或是用一些啊。特殊的就是 Curate 的 Data 来做这个训练,不是很清楚主要测试啊。

小俊 它是一个实验科学。

嘉宾 对,是实验科学哈,就是我常常觉得那个 Deep Learning 就很像中医一样,就是试出来的。

小俊 试出来的。

嘉宾 对,然后那个在试的过程当中,你做详细的实验记录,从里面去理解那个中间的法则。然后我觉得这是啊。是很有趣,这两个东西我觉得很像,然后我觉得做严格的实验,然后控制变数。然后得到一些关键的结果是是模型迭代的重要的那个一步。

小俊 嗯,也有研究员提出这个模型的语言渲染是不是?可以把它的比重加的更大一些,因为他们还是认为 LLM 是提升智能的关键,你认可吗?

嘉宾 我觉得嗯。在早期的这个 Image Generation 的研究包含 Imagen ,啊 Google 的 Imagen 里面就提出了当你的 Language 的 Understanding 越强,你用更大的 T5 Model 你的 Image Generation 能力更强,我是相信。的你用更大的 Simantic Representation 应该有帮助啊,我是同意。的。毕竟 Physical AI 的应用跟这个啊。大家常讲的 Coding 啊。或者 Chat 还是不太一样啊,所以还是需要做一些实验的验证。我想做的事情是了解真正的痛点,然后从这痛点里面去去找到合适的方式,来把这个模型能力补强。有些大家得到的讯号能更好的这个模型,那当你没有资源限制的时候,你。当然是会放进去啊,但呃比较有挑战的就是当你资源有限的时候你怎么做取舍。

小俊 嗯,所以也许对于场景来说智能可能不是那个最关键的变量,你需要你的机器人会学奥数问题吗?你需要你的机器人会解这个 Coding 的问题吗?我觉得你可能更关注它能不能把你的这个工厂要组装的东西做好,或家庭的卫生啊就是把它这些操作把它做好,对吧?所以我觉得啊这个你要解的问题似乎是跟这些大语言啊模型公司这种 Agent 公司要解的东西是有点不太一样啊,然后所以啊既然是不一样的题目,然后最后这个解这个题目的这个成本啊都是一个重要的,因为如果要商业化,最后成本都是一个重要的考量。那在这些条件之下,它的架构真的会跟现有的这些 for Agent 的模型是一样的吗?啊,这是我一直在思考的问题。

嘉宾 你现在有初步的答案没有?有没有一些直觉?

小俊 过去的啊就是纵观人类的历史。

嘉宾 答案就是应该是不一样对吧?啊。然后你你你你要做耕田的工具跟你要做纺织的工具是不一样的,所以实际上也是不一样最后就是哎贝多则利寡是吧。

小俊 嗯。

嘉宾 老祖宗的智慧还是蛮管用的。

小俊 嗯。

嘉宾 嗯。

小俊 Cosmos 你们未来会投入多少卡和资源啊?

嘉宾 这个我们一直在提在卡一直在提升当中我不知道我这边方不方方便讲这个这个卡的数量但就是啊。我们希望啊。我们已经在万级了。然后希望可以在更多更多。

小俊 嗯这会是英伟达最重要的一个模型的项目吗?

嘉宾 英伟达有数个模型项目然后呃我们主要是把它分成两类一个叫 Agentic AI 就是要做这个 coding chat 然后去 Agentic 这种 Digital 啊 Intelligent 的这这套这些客户的需求。

小俊 嗯。

嘉宾 在这里面我们有这个 Nemo 创的 model 就是他们啊。这个团队最近 release 的这个 Nemo 创 Nemo 创区 Ultra 得到蛮不错的效果那在 Physical AI 这边主要就是 Cosmos 这个模型 Cosmos 是一个 Base model 是一个 Belle model那 NVIDIA 也很关注自动车也很关注机器人也关注工厂对我们而言这些都是 Physical AI 的应用那在自动车上面我们就叫做 Open Mavo 的 effort它呢?是在 Cosmos 上面做的啊 Specialization 就是专门做自动车所需要做的这些呃优化哦。那 Groot 呢?是在 Cosmos 上面对机器人啊。相关的优化。然后还包含这些 Whole body 啊control 的这些东西我是把这。些啊。做自动车内部做自动车做机器人这边看成是也是我的客户。然后也希望帮助他们成功嗯。然后在 Physical AI 这边就是 Cosmos 为核心来去辅助这些主要的档案啊。的这个呃开发者可以获得成功。

小俊 嗯。

嘉宾 所以主要是两个你说是不是最重要呢这两个都很重要啊Digital AI 好这个怎么用 Agent 怎么做 coding 很重要那 Physical AI 也很重要很难讲谁比较重要。

小俊 嗯。

嘉宾 对但现在打的最火热的就是这些 Agentic AI 的东西那 Physical AI 是下一步。

小俊 Physical AI 在你们看来会是一个多大的市场?

嘉宾 这个应该是一个巨大的市场啊。我我不确定这个估这个市值不是我的专业。然后我也不方便代表公司讲多大啊。但是啊。这个啊。随着人口的老化啊。随着对制造业的啊。自主的需求。然后还有各式各样的啊。应用我们觉得这将是一个巨大的市场。

小俊 嗯嗯因为世界模型现在缺乏有效的评估方法你们有一些呃好的探索吗?

嘉宾 呃世界模型呃大语言模型大家都在追求更好的啊评估检测的方法。

小俊 嗯。

嘉宾 然后呃就是一般来讲啊。模型的评测有三步第一步呢?就是 Benchmark 啊。就是有一些啊。固定的 data set 你去量上面两侧它的 Quality。然后第二种是 Arena style 就是 A 跟 B 比看谁比较好那第三种呢?就是啊。跟着 Expert 啊。去真正有这个痛点的人。然后去去解这个问题那我觉得这三个都很重要在 Physical AI 里面第三个特别重要。因为每个嗯。就Coding Agent 大家都在解 Coding 的问题对吧? Digital use 的问题但 Physical AI 每个要解的问题都不太一样。

小俊 对。

嘉宾 对。然后。所以啊。我在更加强调就是跟这个客户啊。跟这些啊。愿意一起合作的伙伴一起去了解怎么样去评估一个模型真正有用还是没有用那这不是件容易的事情这个是给模型发展指引方向的重要一步我觉得在未来的发展当中这一步会越来越重要。

小俊 数据也是一个难点你们这次是怎么怎么做的?

嘉宾 数据是一个难点尤其是在 Physical AI 更是困难。因为 Physical AI 每个形体都不太一样。然后收集数据你没有那个没有那个 Physical 的 set up 就没有去收集这个数据。

小俊 嗯。

嘉宾 然后在。因为大家都更加的困难。因为我们是要服务各个 Physical AI 的的这个开发者每个机器人都不一样。所以我们能做就找最容易共同的觉得就是 Physical AI Data 主要有两种一种是 Navigation 的 Data 从 A 到 B。另外一种是 Manipulation 的 data 怎么用那个手或是 tool 去操作完成啊。既定目标那 Navigation data 比较容易做就是你键盘怎么动车怎么动机械怎么动这些都可以收集那机器人 A 跟 B即使他们不一样但他动起来就是在空间中位移有时候可能加一些旋转。所以是比较相同的那操作这边就比较复杂我们发现一个趋势就是呃大家越来越追求接近人手啊。的这种这种机器手臂。然后论点就是说呃这世界人类的世界是建出来给人类用的。所以大部分的工具都是适合人手去操作的那整个 AI 呢?需要大量的数据。然后如果你的数据越好取得你就容易更更快得到突破。所以大部分的收集数据者是人人就是手。所以两个环境两个条件啊。就是人手适合收集数据。然后第二个这世界是大部分建给人手的。所以就今天看到大家往人手的方向啊。

前进。

小俊 嗯。

嘉宾 那。所以我们在这个 Cosmos 三代的时候啊。也就是啊。特地把这个 Ego Centric 的 data 给加进去那包含了。这个人眼怎么看这个东西从第一人称。然后还有人手怎么去操作这个物件。所以因。因为我们的目标不是不是?去做出一个机器人啊。我们目标是帮助大家可以做出很好的机器人。所以我们要找最容易可以互通的东西那我觉得 Ego Centric 的 data 是非常重要的。

小俊 在刚才说的那些现在的限制和局限之下英伟达有显著的一些优势吗?

嘉宾 在英伟达获得 GPU 运算的成本比较比较便宜毕竟我们生产 GPU 嘛。然后再就是我们在 Physical AI 这边已经深耕多年了。我们有这个 Thor 这个 Chip。然后也有这个 Isaac Simulator 然后就是啊。所以我觉得这些东西合在一起我们提供更多的啊。工具来满足各式各样 Physical AI 开发者所需要的需求那呃还有一点是我们是真心想帮助其他家公司成功的。因为我们啊。就是我们很清楚自己能提供的服务在哪里啊。然后呃比较不会有这种呃一直就是比较我我觉得客户往往比较愿意跟我们一起合作。因为我们是我们不会说就是跟你做一模一模一样的东西。然后把你啊。就是。

小俊 灭了。

嘉宾 对不是这不是我们的目标对。

小俊 哦。

嘉宾 嗯。

小俊 这个模型让你非常满意的一点是什么然后让你有点遗憾的可能是什么?

嘉宾 满意的一点就是呃我当初跟大家讲说可以把过去的所有模型合在一起还会做比全部之前的模型都还要好这件事情发生了。

小俊 嗯。

嘉宾 我们现在的模型比过去单独独立的模型效果都比较好啊。那时候很多人不相信那我觉得很开心。然后第二个就是这个是我们第一次就是啊。把整个团队原本是建造数个模型现在合在一起建一个模型将把这么大的一个组织大家凝聚在一起去建这模型我本身也很骄傲这这件事情可以顺利的发生。

小俊 嗯。

嘉宾 遗憾的是什么啊。我觉得我们的模型就是。因为时间的限制啊。其实啊。我觉得模型还可以继续提升。但是。因为时间限制我们没有让它完全收敛就必须要那个退出了。然后还有很多想要改的地方在之前都没有时间改啊。那啊。所以就是觉得这几项是毕竟就是想要追求啊。更好的结果啊。那时间有限但好处就是我们继续会做三点一三点二会把之前没做好的东西再把它补进去。

小俊 嗯你有想过像老黄说的做到九十七代会是什么样子吗?

嘉宾 那时候听到九十七代我的理解就是我们有决心就是一路把它做下去把它做好。

小俊 嗯。

嘉宾 嗯。然后这是一个很大的 Commitment 因为这个做这个模型是很耗费资源的嗯。然后呃他展现出他的决心就是往下走我得到的信心就是这个东西会一直往下走那世界模型最后就是接近这个世界对。

小俊 接近这个世界。

嘉宾 接近这个世界从透过那模型你可以去啊。学习你想在真实世界里面学习啊。的东西啊。那我觉得就是是往那方向走那就最接近的就是你有能力随时可以做出一个黑科技帝国的矩阵我觉得就是最终的样子那我我不确定是不是?需要到九十七代你看我们如果啊。就是每半年一代的话那还要四十几年对吧。

小俊 四十几年。

嘉宾 对然后我觉得现在 AI 的发展速度极快。

小俊 啊。

嘉宾 也许不需要到四十几年。

小俊 因为你们团队又有做呃数数字世界的模型也有做 Physical AI 的模型你觉得像这两种模型的差别是什么差别大吗?

嘉宾 这个目前的状态是这样就是在 Nemo 创那边他们用一个叫做那个呃 Hyb-Hybrid 的 Architecture呃就是某些层是这个传统的 Transformer 但某些层是这个 Mamba style 的这个接近 RNN 的这种架构那这样的架构有它的好处。因为那这种 RNN 的运算比在 Inference 的运算是比这个这种 Transformer 是便宜的。然后 Agent 有一堆 Token 要产生有时候你要 Token 要要 Agent 做很久的事情。所以这个是运算成本的需求那 Physical AI 这边我们的架构就不太从这个路线我们是还是走比较传统的 Transformer 但是我们走到这个Miso Transformer 然后把这个 Action 加进去。所以这两边的模型的发展是就是渐渐有点不太一样但我们两个团队之间啊。紧密合作你可以在 Cosmos 三的这个 Paper 里面发觉很多作者是从 Nemo 创来的好。然后我们就是啊。跟他们合作吸取他们的经验。然后一起去建一些模型对。

小俊 在未来这两个模型有可能统一成一个更大的模型吗?

嘉宾 这都是有可能就是啊我们的决策很简单怎么样可以帮助客户最好我们就这么做对我们是很 No ego 的。

小俊 刚才你也提到就是呃 Cosmos 是一个非常大的团队。

嘉宾 对。

小俊 嗯你觉得驱动这么大的一个团队一起工作呃难点是什么我印象中论文好像有两百九十多人不到三百人对吧?

嘉宾 对就是啊。这个团队非常的大。然后呃我是这样。看的啊。这是一个组织架构的难难题你希望所有人目标一致但你又希望所有人可以自主做决定当全部人的目标一致但每个人都不能做决定的时候进展会很缓慢。因为只有少部分的决策者可以做决定。

小俊 嗯。

嘉宾 那这些决策者假设只有我能做决定只有我能决定这个这个 Data 的比例怎么调只有我能决定这架构怎么做那我们这个模型就不会成功。因为我的知识有限。然后我的时间有限。然后我们需要的就是每个人都可以做出对这个组织对这个模型发展重要的决定那第二个事情就是如果大家都可以做决定但大家目标不一致我就是想把 Action 做好我完全不管 video 怎么样。然后我就是想 Understanding 做好完全不管其他的这样就会发散。然后可能就会产生不同的架构。然后可能就进一步有赛马的行为啊。那我觉得跑这么大的一个 project 最重要就是让大家的目标一致但每个人又可以做出决定。然后这在组织架构上面啊。花了很多心思去设计一些团队运作的这个合作的方式让资讯透明化让每个人都有足够多的资讯去做出对组正确的决定那。当然我们也提供了容错的空间。因为当一个人害怕他决定错误的时候他是不会做决定的。

小俊 嗯。

嘉宾 所以你要让他们可以做决定但也要接受有些决定会错误。但是错误的时候要能快速修正这些都是需要一些时间啊。跟一些啊。训练才能让整个团队可以朝这方向前进。

小俊 怎么让两百多个人都同时做决定啊这个好难啊。

嘉宾 大家都清楚整个关键这个整个 Project 之后要达到目标是什么。

小俊 嗯。

嘉宾 你要一直去把未来给划清楚跟每个人讲在 Cosmos 三 Paper 出来之前或做完之前我就跟啊。主要的几个 Leader 还有各大部分的团队都已经讲过说我们做出来模型会是这样子那是不是?完全这样子呢?可能百分之九十相似百分之十不相似。但是当大家都看到同一个愿景的时候就比较容易集中就像你在啊。在一个篮球选手你在罚球之前你都会想象这个球空心落网就先把那个目标给定出来。然后大家再朝那方向前进那。当然每个人扮演扮演的角色不一样。然后当大家看到同一个画面的时候就比较容易在他的岗位上做出对这个团队啊。正确的决定。

小俊 嗯你设计了什么样的管理方法让大家的信息能更透明能更好的协作有什么样的管理的技巧?

嘉宾 都用点心思了解这个怎么样讲大家会动注重沟通。

小俊 注重沟通会开例会这样的会议吗?

嘉宾 我是一个呃就是我很讲究团结合作。

小俊 嗯。

嘉宾 啊所以我们的会很多但是啊不是每周一次我们每周可能十次有吧啊。

小俊 每周。

嘉宾 应该超过十次。

小俊 超过十次所有人还是多少人跟主要的的 Leader?

嘉宾 每个比如说我们做 video 的就是定期开会的一周两三次吧。

小俊 嗯。

嘉宾 然后做 Understanding 也是定期就一周两三次。然后还有各个环节的就是两三次就是嗯。就是会蛮多的。然后会议上可以做一些沟通啊。那。当然会议大家会觉得就是开会啊。有时候很没有效率尽量做一件事情就是让每个会议都更加 Engaging 然后让每个人都能参与啊。这都是需要一些一些训练啊。让让这个团队这样那你永远不会最高效你可以你可以大家都不开会各做各的那不见得会成功。

Insight

Physical AI 的里程碑应由真实任务上的泛化和经济效用定义,而不是只看视频 demo 或模型榜单。

  1. 数据被分为 navigation 与 manipulation;后者受不同机器人本体限制,因此 Cosmos 3 特别吸收第一人称视角与人手操作数据作为较通用的桥梁(约 02:22–02:27)。
  2. 模型按期发布时尚未完全收敛,部分实验被留到 3.1、3.2;这是快速迭代带来的显式取舍(约 02:28–02:30)。
  3. 他把 Physical AI 的 ChatGPT Moment 定义为社会清楚看到一个以 AI 为核心、具有明显实用价值的物理应用,而不是某个模型单独达到指标(约 02:33–02:35)。
  4. “今年或明年可能发生”是乐观愿望而非可靠时间预测;人形、轮式或混合形态最终仍受运营与硬件经济性约束。

小俊 啊。

嘉宾 你可以一直开会什么都不做只是讲也不会成功你就要选一个均衡在不同的时间点会有不同的一种调配方式那这个东西都是呃因任务因时而定而没有说一定的公式哪一个一定会成是最好。

小俊 你看硅谷现在大家说 Open AI 的企业文化是自下而上 Anthropic 是自上而下你们属于哪一种?

嘉宾 我们是都有一个都会走向极端吧天下分久必合合久必分就是东西就是啊。物极必反就是我觉得都是要掌握这个就是在那个时间点了解什么是对这团队最正确的事情而不是就是一味一味的循着一个方向一个模式而操作。

小俊 嗯。我理解 Cosmos 的爆发的时间点和 Physical AI 和机器人的爆发可能会有是是正相关的对吗?你觉得这个市场会在什么时候迎来一个所谓的 ChatGPT Moments?

嘉宾 大家都在追求这个 Physical AI 的 ChatGPT MomentChatGPT Moment 什么叫 ChatGPT Moment 呢ChatGPT Moment 跟 GPT Moment 有什么不一样GPT Moment 是跟我们讲说东西可以 scale。

小俊 嗯。

嘉宾 Scale 之后模型能力会更强ChatGPT Moment 是让大家清楚看到这样的一个 Scaling 这样一个好的模型对人的生活会产生什么样的变化大家发觉这是一个有智能体可以跟他沟通可以跟可以问一个知识广播的朋友那什么叫 ChatGPT Moment for Physical AI 呢?应该是指说大家看到一个就是以 AI 为主的啊。这 Enable 的 Physical AI 的应用让大家清楚看到说这东西是真的有用那这东西什么时候会发生这是很难去预测。然后但我看到是整个领域对这个 Physical AI 的兴趣越来越大流入资金越来越多越来越多的有志者创立公司想去解决这个问题呃Physical AI 可以利用在 Digital AI 上面的成功。所以我觉得各项条件都逐渐在收敛当中啊。我是希望。尽快看到 ChatGPT Moment也许今年也许明年我不知道。但是我觉得它必然会发生。

小俊 你觉得人形机器人会在这个赛道里面成为主流吗?

嘉宾 我觉得人形机器人它的优势就是可以利用大量的这个人的啊。数据来获得啊。就是啊。就是学习啊。的素材。然。后来提升这些效果啊。但人形机器人它本身啊。就是越像人有腿啊。有手啊。然后这些东西就是啊。相对的啊。复杂度也比较高一点。然后很多人都在做轮形的啊。只有上半身是人但下半身是一种这种移动平台那这样的平台也可以解掉很多问题那你说这样的是人形机器人吗?我觉得也是吧?就是半身像人对吧?也不是全人形啊。然后像全人形的某些人形也更接近人形那有些人形比较不接近人形那我觉得人形机器人终终究会是一个重要的这个就是关键哈。但是多向人行这件事情大家都在都在那个尝试当中我觉得最终最终可能就是全人形是最啊。最最适合各式各样的操作。因为这个人类这个环境就是设计给全人形的啊。但最后还是要关键还是这个营运成本到底怎样是最最这个最经济效益最高啊。那这就超乎我的专长我。其实不知道那我的目标是满足帮助这些各式各样的 Physical AI Builder 我也不需要做选选择好我就是聆听他们的声音看我们的模型怎么做可以更加帮助他们。

小俊 嗯呃 DeepMind 谭杰老师他有一个预测他是觉得二零三五年到二零三六年可能是人形机器人成为主流的一个拐点。

嘉宾 好是吧。

小俊 嗯。

嘉宾 嗯。

小俊 OK。

嘉宾 嗯。

小俊 对我我希望早一点但我不确定。

嘉宾 嗯你觉得世界模型可能会有一个所谓的拐点吗?

小俊 我觉得世界模型并不是新的啊早就有世界模型了。

嘉宾 嗯。

小俊 那我觉得世界模型会一直在做啊。就是性能的提升那我们在大元模型上面看到模型越来越好对不对?那我觉得在世界模型上也会看到越来越好,我们这次在 Cosmos 三也做出这个一个呃比较不一样的世界模型,这种 all model 的 war model 对,所以我觉得还是有一些变化。然后我会需需要一点时间去让大家去吸收消化一下啊。因。因为啊。

嘉宾 毕竟这东西不是这个模型出来后直接可以使用是必须要看怎么调配可以在这个啊。就是机器人场景落地,那我觉得这需要点时间那我觉得这这会也还会继续变化啊,对会一直进步,会一直变化。

小俊 因为你说你要为机器人构建一个黑客帝国嘛。那黑客帝国讲的本身就是一个人类沦为了机器的活体电池,然后活在一个虚拟世界 Matrix 中。然后一个觉醒的人试图挣脱这个呃 system 的宿命。然。后来终结这个循环那你现在为机器人打造这个 Matrix ,如果有一天机器人要觉醒了想要挣脱这个虚拟世界怎么办?

嘉宾 我用黑客帝国的比方是帮大家具象就是有一个世界模型这么快去加速学习很多人担心啊。就是 AI 当它能力太强的时候会啊 take over the world ,对就会把我们给 eliminate。

小俊 嗯

嘉宾 那我觉得这个社会是人去建立的,这些科技是人在背后操作,我觉得只要大家是有共识,我觉得就是这件事情是呃不会发生。然后再就是我啊。这里就比较哲学一点了。我觉得Pain 跟 Suffering 是一种驱动人啊。去进步的一个重要的关键不是很确定这些硅粒康做成的 Intelligence 是不是?有同样的Pain 跟 Suffering 然后我心里是产生存疑的状态啊。那我们。当然知道就是呃我们希望这个科技可以大幅度的改善人类的生活,那我们也需要做出这些啊。相对应的啊。就是 garrail 来确保它就是啊。不会去影响这个正常世界的发展。

小俊 嗯。说到世界模型其他做世界模型的团队会把你当当做竞争对手,因为大家觉觉得你也是做世界模型的。但是你一直在说我我不是你的竞争对手对吧?,你有什么想对他们说的吗?

嘉宾 世界模型是个工具对。然后工具是解决问题有好多种不同问题要解最终要解的问题只有世界模型是不够的对吧?然后取决于你要解的问题如果如果说呃。因为我们要满我们要去服务这个整个 physicalize Eco system 我们要建这世界模型让大家模型可以用。然后Physical AI 的问题本身又特别的难,有好多其他问题要解那如果你可以跟我们一起合作啊。利用我们做的东西那你可以走得更快更远。

小俊 嗯

嘉宾 这不是很好的一件事情嘛。对不对?啊。那呃那我们都是才开源的状态那如果说呃你用我们就是做出比我们更好的模型那这模型也是开源的让大家可以用那我们也是帮助整个 Physicalize system ,所以你做得比我们好我们也觉得这是一件好事,对吧?我觉得大家一起团结合作去解掉困难的问题是一件啊。很值得去做的事情那。当然彼此间啊。就是啊。就是互相抵触就是晒得 HIPAA 然后越来越往上爬,那也是很重要的一环对。

小俊 他们肯定会说哦。英伟达又想来卖我卡了。

嘉宾 对那你需要做运算嘛。那我们这个呃现在这个英伟达的生态在这里有很多东西可以帮你去啊。利用的啊Why not 对吧?你要做一个生意都是要做投资的最重要的是你的获利是多少而不是啊。像这些Cloud company 他们买了大量的 GPU但他赚了更多的钱。

小俊 对吧

嘉宾 你们内部会讨论什么是下一个 CUDA 吗?有可能是 Cosmos 吗。

小俊 过去的软体是建议逻辑。然后 CUDA 是帮助把这些 application 所需要逻辑转换成 GPU 的运算未来的软体是 AI为啊。就核心的那 AI 是 Big Five model of the AI。然后。所以我们觉得啊。做的 Nemo 创跟这个 Cosmos 都可能是未来的 CUDA。

嘉宾 因为外外部会对 CUDA 有非常多的复盘但作为呃你的视角你觉得 CUDA 是怎么做成功的它需要具备哪些要素像比如说现在 Cosmos 它具备了哪些不具备的是哪些它是一个可复制的路径吗。

小俊 我不确定这是不是?一个可啊。我觉得 CUDA 当初提出的时候是很前瞻性的想法是一个很很冒险的想法对在这个啊。当都不确定这个 Accelerated Computing 会不会?是a based thing 的时候我们公司就做出了。这样呃勇敢的投资那呃我们做的大模型都得益于 CUDA。然后可以往下走我不会把这个Cosmos 或 Nemo 闯跟 CUDA 做同等的连接。因为我觉得现在的整个发展已经相对复杂很多,有很多个不同的这个产业是很多个stack 的合在一起的。

嘉宾 嗯

小俊 我觉得合在一起可能是新的 CUDA 而不会说这个模型单一就是一个 CUDA。

嘉宾 嗯

小俊 对你还需要做 serving 啊。你还是要去做这些 infrastructure 有很多东西要合在一起。

嘉宾 那扩大你们觉得是哪些要素共同促成了它的成功。

小俊 CUDA 一开始的时候就是在寻找 application。

Insight

平台护城河通常是模型、工具链、硬件与开发者生态的组合,不能由一个“下一个 CUDA”的标签替代。

  1. CUDA 的成功既来自早期通用加速计算下注,也来自不断寻找 scientific computing、deep learning 等关键 application。
  2. 复制历史表面路径并不能复制成功;更重要的是根据当下环境用 first principles 判断最需要补齐的层。

嘉宾 嗯

小俊 一开始是 scientific computing

嘉宾 嗯

小俊 然后。后来在 Deep Learning 出来之后找到 CUDA 最重要的 application啊。往下走那 CUDA 还是一直在提供不同各式各样的 application我觉得复制 CUDA 是一个很好的想法,但我不觉得你按照原来的路线就会走一样的啊。的路,我觉得这个环境是不一样的。

嘉宾 嗯

小俊 对我我觉得是要 Adaptive要看清楚哪哪个时间可以做出哪些重要的贡献。

嘉宾 嗯。所以你们不会拿着这个锤子去找钉子对吧?拿着我要做出下一个 CUDA ,就是当年是一个非常成功的决定。然后我来做今天的决定。

小俊 就像老黄常讲的他的第一原则,base on first principle他是觉得什么合理。然后再往那个方向走啊。不是找着拿着锤子去找钉子。

嘉宾 嗯。因为你刚好加入英伟达十年了。

小俊 是

嘉宾 呃这十年你变化大吗?你在英伟达的这个股票涨了多少倍了一共。

小俊 对那个呃这些一切都是没有预期到的嗯。啊。这段时间里面啊。我们见证到一个没有人把AI 跟英伟达联结在一起变到一个全世界都把英伟达跟 AI 联结在一起到一个我父母亲不知道什么叫英伟达到全全世界都不知道什么叫英伟达的这个事件啊。这是很巨大的变化。

嘉宾 嗯

小俊 啊。那中间的历程嗯。也不是那么容易公司你从股价来看就有起起伏伏我记得那一年啊。就是TPU 刚出来的时候公司股价掉了很大一截对。然后有些同学们在那时就对公司的啊。的未来产生了呃就是不同的想法也就离职了啊。但。后来嗯Nvidia 每年在MLPerf 里面都击败 TPU ,然后产生出更好的那个性价比那。后来就是只有我们参赛了。这东西都都很难去预测这些变化实在是很大啊。那我觉得就是在这场期间我更加理解到什么叫就是慢慢经营慢慢去经营。然后就是找到一个你相信的目标 first principle 啊。一步一步往下走你就看着老黄带着整个公司这么大一个团队。然后就是一步一步走向今天这个啊。这个呃成绩。然后余有荣焉啊。就是大概是这样。

嘉宾 你当时加入的时候没有想到这一切对吧?你当时还有其他的 offer 但没去。

小俊 对嗯。对但不可预期的我我当初加入原因就是。因为我想要有 GPU 可以为这个支持我的学术研究是很简单一个原因我某方面来讲我也是非常 first principle我觉得 GPU 是啊。这个做科研很重要的工具我要去一个 GPU 众多的地方那不如去一个生产 GPU 的地方。

嘉宾 嗯。另外一个 offer 是谁啊。当时。

Insight

分布式决策不是取消管理,而是把目标、信息和错误修正机制做到足够清晰,让更多人能做出一致方向的局部判断。

  1. 他称英伟达在自己任职期间没有经历公司级裁员,并以疫情期削减差旅和工具为例;这是个人经历陈述,不等同于对全球所有用工变化的独立核验(约 02:53–02:57)。
  2. 不以内部赛马为默认机制,有助于互信和协作,但代价是旧技能向新方向转型可能更慢(约 02:56–02:59)。
  3. Cosmos 让跨组织成员围绕 mission 聚合;Top-5 Email 则让微弱信号更容易跨层传播(约 03:00–03:03)。
  4. 大团队的管理难点不是让所有人服从,而是让成员理解约 90% 的共同目标、在容错范围内快速决定并修正错误(约 02:30–02:33)。

小俊 对啊。我有数个 offer 啊。对其中有一个投资公司啊。他跟我讲说不管我去哪里不管对方给我多少钱我都给你四倍。然后希望你可以加入他们的啊。这个我们的公司可以一起去研究怎么去啊。用 Deep Learning 来做投资。

嘉宾 嗯

小俊 啊。我本身对这个东西并不是很感兴趣我还是想做科研。然后去还是选择了 NVIDIA。

嘉宾 你当时 NVIDIA 是可能是更不知名的那一个是吗?

小俊 是啊对

嘉宾 嗯。你觉得你看一六年的老黄和现在老黄变化大不大。

小俊 头发都白了。我觉得他承担的压力大了很多但他还是就是关心员工。然后啊。很仔细地去阅读公司的学员工学的 TIE email 啊。然后去找到一些讯号。然。后来帮助啊。整个公司往前啊。进步有很大的变化公司的规模很大的变化我们都加入的时候公司可能不到两万人吧。然后现在已经两倍以上可能更多那那个呃就是那时候 GPU 都还是座机啊。那现在都是 Data Center对。然后那时候没有 Physical AI 现在 Physical AI 都成为了一个重点对变化是很大的。

嘉宾 你在过程中有见证英伟达哪些 Pain and Suffering 没有。

小俊 先生常常在嘴边讲他说啊。当然不是真的他每次都讲说他每天都觉得公司只剩下三十天的现金流。

嘉宾 嗯

小俊 三十天后就要破产。然后。

嘉宾 现在还这么说。

小俊 他每天都这样讲。

嘉宾 每天都这样讲。

小俊 每次开会都都是这样提醒自己。

嘉宾 吓唬高管吗

小俊 就是要求自己做出对公司最正确的决定。然后有一年 Pandemic 的时候那个整个整个就是经济状况不好。然后那个时间点就是很多公司就开始裁员那我记得那次公司大会的时候我们就决定要裁什么我们要裁的就是啊Travel啊。就是员工就不用去 travel 了全部都是 online 这样就省下一笔钱。然后我们在研究哪些工具可以不要比如说在硅谷啊。很多公司都用 Slack 来做这个通联我们来考虑是不是?就不要 Slack 了反正我们有 email。然后我们有两个两三个 call 比如说我们有时候用用 Microsoft 有时候用 Google 是不是?可以就取消一个可以省钱你可以看到公司就是在一些困难的时期做出一些相对不平凡的决定啊。有些公司会把裁员来降低这个这是呃人事开销NVIDIA 想的是什么可以节省掉一些不必要的开销照顾员工一起度过困难的事情。

嘉宾 为什么 Nvidia 一直坚持不裁员啊。它真的没有裁过员工吗。

小俊 我在英伟达的时间里面啊。就是我没有听到任何裁员的消息。

嘉宾 嗯。也没有末位淘汰对吧?

小俊 我们没有所谓的末位淘汰,啊。那就是我们就给 performance review 那。当然就是有些人会。因为对 performance 的不满而离开那有些人是就是啊。这里有其他因素就就离开但我们不会。因为我们改变了产品的方向。然后或者是。因为就是这段时间内你就是啊。不笨是不好而就让你走啊。我们觉得人跟人之间的信任很重要啊。当一个员工对这个公司啊。有认同感有安全感他愿意讲出一些啊。就是啊。可能在一般担心被淘汰的地方不愿意讲的事情。

嘉宾 嗯

小俊 当没有所谓的末位淘汰的时候大家也不会就是真的这么的啊。就是这么担心被淘汰而强出头那在一个全部都强出头的地方反而不容易促成团结合作我觉得这样的一个啊。管理模式啊。会促成一种公司文化是跟啊。那些会做末位淘汰的公司文化是蛮不一样的。

嘉宾 嗯。它的优点和缺点是什么呢。

小俊 我觉得就是公司员工讲敢讲真话愿意团结合作缺点就是啊。当一项科技就是逐渐变得啊。成熟的时候啊。这些员工需要一点时间学习新的东西做转型。

嘉宾 嗯

小俊 那重新学习新的东西是需要多点时间的那如果你直接 layout 在 hire 新的一批人那你可能可以直接 hire 到一些已经会这些东西的人。所以这些啊。经由转型啊。做起来是会比较慢一点。但是你得到就是员工的信任。然后也可以寻可以团结合作的员工。

嘉宾 嗯。组织效率怎么提升呢?这对你们来说是个问题吗。

小俊 就是大家只要充满热情。然后觉得自己做的东西啊。是很有意义的。然后整个整个效率就会提升嗯。每个人都有选择。

嘉宾 嗯

小俊 对那呃都会想做自己啊。有成就的事情那如果公司可以提供这个环境让大家可以去发挥的话那那这样效率就会提升就让每个人可以做出他们最喜欢最擅长的事情但。同时这些事情对公司又是有极大的利益的只要能做到这点我觉得就是一个很好的状态。

嘉宾 嗯。听上去不裁员有很多好处。但是大部分公司都不是这么做的对吧?

小俊 是

嘉宾 这是为什么。然后以及老黄黄为什么从一开始就觉得不应该裁员。

小俊 我觉得 NVIDIA 是一个想啊。长久经营经营下去的公司。然后我觉得就是这么多年他在老黄在这个硅谷待了。这么多年也看到这么多风风雨雨他选择这个东西一定有他的道理也就是啊。我觉得不是一个随机的选择是一个深思熟虑后觉得这东西是啊。是是他想要的企业文化他想要啊。的公司的运作模式。

嘉宾 嗯。那是不是?意味着当新技术来的时候英伟达不会是最快的那个。但是它是依赖于你早十年或者早五年的提前布局这样它对快就要求不高。

小俊 NVIDIA 就是跑马拉松嘛。然后看得远啊。在你看 CUDA 就是这样一个案例布局了十年。

嘉宾 嗯

小俊 对吧?啊。所以就是你要有很强的眼光。然后长期投资对嗯。嗯。

嘉宾 你们也不赛马对吗?

小俊 我们不喜欢赛马。因为我们通常都是这样做啊。就是你去 take 这个 mission 我们就相信你让我们一一起给你很高的啊。的 bar 希望你完成就是啊。用老黄话讲就是一直让你那个接受 Pain and SufferingTorture you to greatness 相信你。然后给你考验。然后不断地磨练你让你一路一步一步往下成长啊。这是我们喜欢的模式。

嘉宾 你在英伟达受过最惨烈的 suffering 是哪个阶段啊。

小俊 做这些大模型甚至这几年都是这么呃辛苦的在往下走我刚刚跟你讲那些东西很多都是啊。从错误中学习。

嘉宾 嗯

小俊 好呃很多东西啊。就是一开始也没有理理解到这些东西最重要的东西那为了把东西做好。然后当你做不对的时候要怎么慢慢把东西给改进我我觉得这一段就是自从呃 GPT 起来之后整个这个 AI 的从业人员大家都感受到莫名的压力对。然后这段时间里面啊。就是这个迭代的速度啊。然后大家都饱受的压力的那我觉得都是 Pain and Suffering尤其是当你每天啊。挥洒这些 GPU 资源挥洒这些年轻人的时间。然后做出成果没有达到你最喜欢的啊。结果我我觉得东西都是无形上都是一个呃。

嘉宾 压力

小俊 压力对

嘉宾 嗯。你的生活状态发生变化了吗?在这过去几年。

小俊 高效

嘉宾 高效哦。早几晚几。

小俊 我大概是四点到五点起来。

嘉宾 我这么早

小俊 对

嘉宾 哦

小俊 早上起来时候啊。呃运动啊。那些就是时间比较连续一到公司后就一直开会嘛。

嘉宾 然后所以

小俊 十点到公司大概。

嘉宾 大概是九点到十点左右。

小俊 嗯

嘉宾 对。因为整个整个产业的迭代速度。所以生活步调都变快啊。还是要学东西还是很多但处理的事情又变更多。然后找到让自己更加高效。

小俊 嗯。你几点睡啊。

嘉宾 我大概大概十点左右吧。

小俊 十点左右睡四点五点起。

嘉宾 十点到十一点左右。

小俊 对

嘉宾 哦

小俊 对不是每天都固定但。但是基本上是我的常态对。

嘉宾 嗯。英伟达的嗯。书也好或者老黄的传记也好都讲了很多他的管理方式。

小俊 是

嘉宾 能不能?从更一线的视角来讲一讲就是呃英伟达的一些不一样的管理方式我们刚刚可能涉及到一个是不裁员。

小俊 呃第二就是 Tough I 就员工就是要跟很多人啊。就是讲这个他做的事情最重要的五件事情这件事情让你看清楚就是各种公司的大小讯号可以看到很多两个团队在做一模一样的东西啊。那个 Tough I email 就会自然显现出来NVIDIA 是一个相对很透明的一个组织架构啊。苹果可能是返利就是啊。就是我们就是追求的资讯透明。然后让那个呃这这也是一个很不一样的考学那呃那那那些老黄传记有些是比较戏剧性的啊。但很多都是你可以在英伟达工作的时候就可以感受到他认识很多员工我们常常讲 mission the both。

嘉宾 嗯

小俊 啊。然后。因为这英伟。

嘉宾 有时候像是一个啊。有机体没有那么强的框架当我们公司今天要走向这个方向的时候在各种不同组织的团队但有相对的技能就会自动 align就往那个方向前进就是像一个活的组织不是一个固定框架就说你在这个里面你就不能做错东西。

小俊 嗯

嘉宾 没有关系你在这公司哪里都没关系。但是你要往这个方向前进的时候你的你的这个团队的啊。的是可以产生贡献的就全部人就 align 就变成一个新的方向往这边走Cosmo 就这样子一个案例。

小俊 嗯。就是很多人他可能不属于这个团队。但是他都可以来支持这个团队的工作。

嘉宾 对 mission is the boss

小俊 嗯

嘉宾 而不是你的 boss 是你的 boss。

小俊 Mission is the boss

嘉宾 Yeah 这几个是最具有特色的啊。就是这几个让整个公司的就是很很活啊。你看我刚刚讲了。这个 mission is the boss 就不是一个很硬的框架是个有机体那这个 tough fight 让公司各个地方的微小讯号都可以传到扩散出去。

小俊 嗯

嘉宾 对吧?那啊。不愿意让就是不轻易 lay off 员工啊。就是讲究转型讲究 tochur让员工对这个公司加强信任。然后可以彼此互相合作我觉得这几个都是啊。英伟达很独特的地方。

小俊 嗯。一群 S 级的人一起工作和一群 A plus 或者 A A 级的人一起工作哪个可能取得的成功更大呀。你觉得。

嘉宾 大家在追求就是一加一大于二。

小俊 嗯

嘉宾 对。然后是不是?大家可以团结合作产生更大的效应啊。是啊。是很重要一件事情。然后当人人多的时候就有一个沟通的成本啊。然后沟通成本就是负面的你等于就是要人跟人合作可以产生正相关。但是要降低这个沟通的成本那一群很聪明的人一起合作啊。当然大家都很聪明很快就理解。然后手脚又快啊。但是如果人跟人之间无法互信的话也很难达到一加一大于二大家都防备着对方不愿意把最好的一面啊。展现出来或者是就是要展现出哦。我就是比你聪明那这样子也不见得是一个好的状态那我觉得反正就是啊。就像打游戏一样你不要整个团队全部都是弓箭手可能有些人是负责防御有些人是会啊。是是做补血的啊。各项不同的啊。属性合在一起啊。

小俊 嗯

嘉宾 我觉得这样多元是一个比较好的状态。

小俊 嗯。你看你今天说了很多你没有竞争对手。然后你不和任何人竞争都是你客户。然后大家都是合合作伙伴这种 low ego 的状态是在英伟达发生的变化吗。

嘉宾 呃是就是

小俊 是真的 low ego 还是这是一种隐藏。

嘉宾 我觉得是一种 confidence 是一种自信。

小俊 嗯

嘉宾 啊。是觉得啊。我们做出来的东西是可以帮助到大家那我的目标是帮助大家做好但我对我自己做东西我要求很高我希望它变好但我的目标并不是击败对手我的目标是那个做出好成绩提出更好的 foundation 让大家可以动得更快。

小俊 嗯。啊。这这是跟老黄学的吗。

嘉宾 呃对我受他影响非常的深。

小俊 嗯。这是什么时候学的。

嘉宾 如果你是一个研究员你就是毕业的方法就是让你的论文在顶级的会议上被接受。然后 reviewer 都会 question 你的东西是不是? stale the art那你要 stale the art 代表说你要击败所有的人。所以研究员都有这种心态就是我的东西要比你强。然后。所以循着这个轨迹我也就是一开始就是一个 highly competitive individual 就是我东西要做的比你好。

小俊 嗯

嘉宾 那这这这是我要求。当然好就希望东西越来越越来越好但久之后就是你知道就是你总是 stale the art一段时间就下一个啊。出去了对就是这东西是一直不断进步我今天站的位置也不一样了就是啊。成为这个管理者之后啊。希望就是培养新一代的人才帮他们成长。然后站在这个 NVIDIA 这个 ecosystem 的角色又希望这个公司逐渐感受到这个好处有时候看到我这些伙伴们跟我讲说用你的模型之后我觉这个效率提升了很多。然后我就很开心我觉得啊。我的我的付出啊。整个团队的辛苦付出啊。获得的一些回想那不是这种肯定也是很好的一件事情啊。不见得是要击败啊。其他才是一定能产生贡献。

小俊 对你不需要击败你的对手。

嘉宾 我不喜欢把他们当成是对手喜欢把他当成是伙伴。

小俊 嗯。你看英伟达包括你。然后包括 Jason 他出来经常会说 take care of others 就不管是员工还是外外部的合作伙伴这种 take care 是一种真实的吗?他真实这这么想的吗。

嘉宾 对

小俊 英伟达一开始的时候我们就是啊。我们就是生产这个啊。就是这 design house。然后之后我们也没有什么 consumer product 都是靠着其他家公司帮我们做 GPU 卡我们就是一直有这个习惯就是要跟着整个 ecosystem 一起成长大家一起赚钱总不能说钱只有我们赚嘛。这些帮忙做这个显卡服务器这些啊。都都要一起能那个往下走那。因为啥早期的这个显卡都是拿来做游戏我们也不做个游戏对我们就是就是一直开发这些好的 library 帮助这游戏公司做游戏我们刚开始走向 deep learning 的时候那时候好几个框架比如说 PyTorch 啊 TensorFlow 啊。还有一些 MMC 那些东西我们全部都支持对。然后。后来我本来有这个 Trident compile 我们是支持那个 Trident那 VON 出来之后我们也支持 VON对就是我觉得是真心的就是啊。

就是想帮助这些建在我们这 GPU 平台上面的客户能更加成功他们更加成功代表他们可以服务更多的客户那他们就有大量的机会会使用我们的 GPU是一种真的是共利一起走向成功一条路线那我觉得这让也是他经营了。这么多年才把这个公司放在这么一个好的位置让帮助别人也可以获得获利啊。这我觉得自己不容易。

嘉宾 嗯。你近距离观察过呃老黄很多年如果只用几个词来形容他你会怎么形容啊。

小俊 我们叫他六边形战士嗯。就是不管是你我们有时候开会他可以走到很深去研究这个 register这个 Computer Architecture 的 register 这个非常细的细节。同时间又可以长到想到可以就可以教大家怎么做 marketing 怎么做这些非常 high level 的东西。然后在处理这个啊。不管是产品定价。然后跟客户的关系他面面俱到。然后是他是极大的热情 he gives everything he hasto help the company be successful 这是一件很很令人佩服的一个呃的操作这样各个方面都可以产生贡献。然后各方都尽力做到最好他是一个很厉害的一个人。

嘉宾 他对你鼓励比较多还是呃批评比较多一般来说。

小俊 鼓励批评都有当我还没有完全理解他怎么要怎么去跑这个公司的时候批评是比较多的啊。但批评中中只带着总是带着鼓励希望你可以变好他的目标就是 coach everybody to greatness 啊。经由这些磨练让你更加理解就是怎么样做才能做出不平凡的事情这很耗精力的你愿意花时间去偷求别人这是件不容易的事情在偷学别人你自己心里要产生很大的负担对吧?

嘉宾 嗯

小俊 而且你人生就这么多时间你可以不管啊。你可以也许还能还是能达到你要的东西。但是他愿意花时间去偷球别人让大家不断的进步这是件不容易的一件事情。

嘉宾 他对你让你印象很深的一句话是什么呢。

小俊 我记得有一次啊。我们在一个会上啊。我们在比较两个 solutions 两个东西。然后我是做其。中一个东西的人啊。另外一个是啊。其他人做的东西。然后我记得那时候我讲了一句话说我觉得他们用的 setting是一个不 fair 的 setting 所以导致这个那个啊。所以我们在这方面表现就没有达到我们的预期呃落后这个呃竞品。

嘉宾 嗯

小俊 那呃他那时候给我句话说 are you a cry baby这世上没有什么是公平的你在写论文的时候常常讲说哎我的 setting 就是跟你的 setting 不一样。所以不能。同时比较。

嘉宾 嗯

小俊 但你的目标如果是要解决一个问题那你。当然是是做这个要解决这个问题所需要的条件啊。没有这条件你就想办法拿到那时候我呃那那句话让我印象很深刻就是我更加严格要求自己就是找理由是没有用的就是这个啊。就应该 give everything you have。然后我以前也听过这句话西点军校有一些著名的的那个书也是讲的就是没有理由 no excuse 对吧?但但他跟我讲让我的印象就更加深刻了。因为毕竟他是一个著名的人物那啊。我觉得这句话对我的影响也蛮大我。后来就不再找理由了对。

嘉宾 如果当你作为一个研究员想成为 number one 和英伟达的本身的业务。因为它不想成为强劲的竞争对手嘛。如果发生冲突的话你会选择哪个。

小俊 我觉得那个就是科学的发展本身就是 incremental 的就是一直在进步一直在进步一直在进步你随时随地都可以提出 improvement 就是要往上再再走一步。

嘉宾 嗯

小俊 然后我觉得就是the absolute number one 呃什么叫那我这很难去定义什么叫 number one。然后我我比较喜欢看。

嘉宾 是一个 frontier 的模型吧。

小俊 好嗯。对但 frontier 的模型啊。做出来那时间是 number one 很有成就感但之后就会有其他的模型可以追上去我我是希望。就是你具备的啊。就是做 number one 模型的能力啊。但是啊。就是啊。做出就是对这个社会影响最大最最有贡献的事情。

嘉宾 嗯

小俊 对。因为你可以做出 number one 的模型但你就是只给少部分人用啊。或者是呃就等于让权力过度集中在少部分人的手里。然后产生一些不平衡的状态我觉得不见得是一件对的事情对那我我是希望。就是啊。具备 number one 的能力。但是做出对这世界贡献最大的事情。

嘉宾 具备 number one 的能力。但是做出对这个世界贡献最大的事情。

小俊 是的

嘉宾 所以最重要的是后面后面那个贡献对吗?不是那个能力。

小俊 对

嘉宾 对人人们就走一遭嘛。对吧?然后你留下来就是影响。

小俊 所以要活得久。

嘉宾 呃我的九机会大一些嘛。呃就是希望能产生一些啊。做些啊。贡献。然后啊。就证明自己啊。就是没有白来走一遭嗯。他就这样子。

小俊 嗯。你还有什么在研究生涯上觉得遗憾的吗?你还有什么特别想得到的。

嘉宾 嗯。我觉得 Physical AI 还没有成功嘛。对还还没有还没有到那个时间点是啊。就是就是谈论这些我觉得呃我很开心那时候十年前我在我在讲这个啊 deep learning 会取代 computer graphics 成为一个最重要的这种这种影像生成的模式这件事情发生了。我我觉得还蛮开心的这事情真的发生了。那我觉得这种世界模型会是推动 Physical AI成功的重要推手。然后这是我下一个呃重大目标我希望这个东西也能成功你要比就是你有一个 best people 喔你就会想说我要拿两个。然后我就知道有些人拿了十几个你总是拿不完嘛。对不对?比论文数总是有更多的论文那你比 satisfying 人数总是有更多的 satisfying你比钱总是有人更没有钱对不对?那重点是我觉得你对自己的东西啊。啊。是不是?啊。很骄傲我觉得过去很多东西我觉得我做的不够好但目前有些东西我觉得我做的不错啊。我接受。然后我觉得就是呃在我的能力范围内我觉得我做出了。我自己满意的东西这个。

小俊 嗯。就外部的很多衡量指标现在慢慢都变得没有那么重要了对吧?

嘉宾 对年轻的时候都觉得它们很重要。

Insight

真正可持续的差异化不是把所有人拖进同一场模型淘汰赛,而是找到独特问题、形成产品闭环,并创造新的价值池。

  1. 他肯定 DeepSeek、千问、豆包、Kimi、MiniMax 等中国模型团队,并认为广泛招收实习生有利于 know-how 扩散;这是一项行业观察(约 03:18–03:21)。
  2. “模型能力会收敛”是他基于人才流动、数据和算力扩散作出的预测;领先实验室仍可能通过时间、资本、产品和生态保持差异(约 03:22–03:24)。
  3. 他认为 Physical AI 在中国具备硬件制造和软硬一体快速迭代优势,在美国则较少公司自建本体;最终商业结果仍取决于资本与运营模式(约 03:25–03:28)。
  4. 给年轻研究者的建议是不要被“明年 AI 就结束”式叙事催促,冷静寻找值得长期投入的真实问题(约 03:29–03:31)。

小俊 嗯

嘉宾 为什么这个人的 base paper 比我多对。然后奖比我多啊。现在觉觉得就是渐渐渐的这个不在意啊。就是我我重心渐渐转移帮助别人也许我现在 care 的帮助人够不够多。

小俊 嗯。你最近最近一年帮助了谁。

嘉宾 啊。这些使用 Physical AI 的使用 Cosmo 的 user 我觉得我都呃默默之中替他们提出了帮助。然后。当然还有自己的团队还有一些就是啊。就是跟我交焊过的人我觉得或多或少我都对他们生命都产生了一些影响。

小俊 嗯

嘉宾 嗯

小俊 你也经常来中国嘛。

嘉宾 是

小俊 你怎么看中国的这一批模型的发展呀。

嘉宾 非常的 impressive very impressive这这些啊。从 Deepsea 开始啊。千问啊。豆包啊。这我都把它全部讲一次啊 MiniMax 就有。然后 Kimi 啊。啊。然后这些。

小俊 Mimo

嘉宾 Mimo 对然后呃

小俊 文远

嘉宾 文远就是这么。

小俊 智谱

嘉宾 智谱对都做得很好那还有一件事情就是啊。在美国啊。尤其是这些 frontier lab现在的状态就是他们很少去招收实习生很多那个 know how 啊。很多这些研科研的结果都只有在他们自己本身内部的实验室有那在中国这边我看到就是啊。他们像嗯。这些公司都招收很多实习生。然后帮助把这些就是 know how传递出去那我觉得对人类整个就是知识扩增啊。就是就是 diffusion 啊。是对我觉得是一件好事看到这些快速发展我觉得我觉得很 impressive 然后还还。同时注重到这些啊 diffusion大家对 AI 都充满了热情就是愿意去尝试我觉得这都是我看到的一些现象。

小俊 嗯。谢赛宁跟我说硅谷已经被 L L M 催眠了。你怎么看他这句话。

嘉宾 我不觉得是纯粹被 L M 催眠不能否认的就是现在在 AI 里面最顶尖的公司啊。就是模型上最顶尖的公司不管是 open a i Anthropic 都是从大语言模型出发的嘛。

小俊 嗯

嘉宾 那这些模型也确切我现在已经不知道没有 coding agent 我要怎么过下去我也不知道就是这些实在太方便了。我就反正很巨大的变化我觉得也不是一件坏事嘛。就是啊 LM 真的产生了很大的用处。然后帮助提升我们的生活我觉得很自然而然的就是大家会会想就是这东西既然都都已经在这里了。然后下一步是什么我觉得人自然会想要做哪件事情我知道领域里面有些人是把啊。学术变成信仰但我觉得大部分人都还是啊。求从求知求真的角度出发当一个东西啊。的啊。被充分理解之后大家会找到新的东西来进行做突破你很难很难想象一个人就这么聪明的人一辈子就只做 L M 嘛。对吧?我觉得自然而然会发生不并不觉得有这种催眠的事情只是对那些人而言对现在时间而言也许做 L M 是一件很正确的事情。

小俊 昨天 Spacex 上市。然后马上 OpenAI 和 Anthropic 也要上市今年这些公司大模型公司的上市会对这个行业发生什么样的影响吗?二零二六年会是巨变的一年吗。

嘉宾 这上这边上市大家都看到新闻了嘛。就是会产生很多富翁对吧?然后我知道旧金山的房价在快速飙涨早期相信 deep learning 啊。早期相信这个这个 space mission 这些人啊。就是啊。这些等于是对他们的远见对他们的勇气对他们的决心啊。这一个认同我觉得都很合理。

小俊 嗯

嘉宾 对这些公司真的对公对世界产生巨大的贡献我觉得完全值得但这个我觉得科技不会停在这里。

小俊 嗯

嘉宾 然后陆陆续续都会有新的事情发生一百年前强盛的公司跟现在强盛的公司是完全不一样五十年前不一样二十年前不一样对我觉得啊。这个社会啊。只要组织架构还是一个有好的良性的状态就会不断有创新发生对。

小俊 嗯

嘉宾 这模型这场竞赛的终局可能是什么样短短几年已经发生这么大的变化再往远看呢。

小俊 呃我想这就很 controversial我觉得模型的能力慢慢就会统一对靠模型自己不会是啊。区分一定要靠一些其他的东西组织在一起那领先的模型有更充裕的时间去找到这个区分啊。的方式。然后强大的这个公司也可以加大自己强大的 ecosystem 去做出一些啊。变化对。然后我不会觉得像 software 刚刚出来的时候会写 software 公司很少那现在大家都会写 software。然后每家 software 都有一个自己的区分方式那些能够活下来的 software 公司都有自己的区分方式嘛。然后我觉得没有理由模型会是嗯。不一样我觉得会是一样。

嘉宾 所以没有必要神话模型或者模型公司是吗?

小俊 我把它当成综艺了就是一个 black box 那这么多人不同尝试最后就是一个一套学问嘛。然后很多人都会综艺嘛。对吧?

嘉宾 关键是你要拿它干什么。

小俊 对关键要看干什么那有些人解读比较深一点啊。那有些人就是需要多点时间这都是我的预测啊。

嘉宾 啊

小俊 我我是我是。觉得这些东西慢慢就会 diffuse。

嘉宾 现在假设一个新公司说我要训练一个模型它还有很大概率赶上来吗?就他可能比前面的公司落后两三年的时间。

小俊 像呃 Kimi

嘉宾 嗯

小俊 或是 Mimo 这些 effort 都是算比较晚期出来的吧。

嘉宾 Kimi 还行Mimo 比较晚

小俊 对

嘉宾 嗯

小俊 对还是有机会。

嘉宾 我是觉得。就是啊。过一段时间大家会觉得算力不够。然后我觉得算力慢慢就会起来,都都有办法去参加竞争我觉得这这世界上有抱负有决心有办法去呃去挪动资源去建一个大模型团队的人很多啊,然后。

小俊 还会有更多是吗?

嘉宾 我觉得如果说大模型是一个绝对的区分那。当然就会更多,但如果不是绝对的区分,应该会很多人就是想到呃对他们的比是你更有利的方式对,我就这一种自然的平衡状态。

小俊 自然的平衡状态嗯端侧模型你觉得会多久之后爆发吗?

嘉宾 这东西跟那个Physical AI会很相近嘛。

小俊 嗯。

嘉宾 刚刚也讲了嘛,就是我觉得资金渐渐投入然后科技迭代很快也也许这段时间我说不准,但我觉得希望它快速爆发。

小俊 嗯对于今年和明年的模型竞赛你有哪些预测?

嘉宾 在Physical AI上是很难的啊。那创作还是很快,那我还是坚信这个对World Model能力啊。是帮助这些啊。物理世界模型强化泛化的一个重要关键对那啊。怎么落地啊。用什么样的modality这些事情大家都还在探索当中ChatGPT moment for physical AI is coming,这是我可能可以做的预测对那大语言coding模型这些东西我自己本身在在follow,但我自己不做啊。我也很难去讲我是用得。很开心啊。但是啊。我也很难讲接下来会怎么样。

小俊 嗯刚才你说了就是中国的这些模型公司,那中国的机器人公司呢?你应该也见了很多你觉得跟美国有什么不一样吗两边。

嘉宾 美国在做本体的公司很少就Tesla跟Figure AI啊在中国好多家公司在做这个本体。

小俊 嗯。

嘉宾 做本体它可以控制的东西更多了啊。可以控制啊。这个这个模型跟软体的整合的控操作空间更大啊。然后我觉得。因为中国强大的制造业啊。让产生一个很优势的条件可以让这些公司做一些在啊。美国不容易做到的事情啊。我觉得这些都是啊。啊。很值得去关注这样的垂直整合会产生什么样的一个突破对我觉得还蛮蛮蛮有趣的。

小俊 你觉得美国现在会不会有一点嗯就是不不那么重视硬件可能是错的。

嘉宾 也很难说。但是就是在这个如果说这种呃软一体整合是一个机器人的一个趋势那那没有硬件。当然是处于啊。被动状态是吧?,有点难讲嗯。有好多东西要考虑啊。包含这个呃金融模式啊。中国明显就是有这个条件可以可以让大家做快速的硬件迭代那个软硬体整合。

小俊 嗯ChatGPT moment在Physical AI你觉得有可能在哪里爆发?

嘉宾 啊看到一个应用。

小俊 嗯。

嘉宾 啊是大家很明显知道就是啊就会产生巨大的经济价值。

小俊 嗯。

嘉宾 啊。然后也许在那个时间点那个应用并没有产生经济价值,当ChatGPT刚出来的时候是赔钱的对吧?但是这大家看到这个趋势。然后觉得就会发生那我个人觉得这种啊。就是简单的人示范一下怎么要的操作这个机械就可以就地学会的东西我觉得这是一个如果这东西出现我看到这样的一个这样的一个产品我就觉得说呀,that's a ChatGPT moment for physical AI。

小俊 所以它核心是泛化。

嘉宾 我觉得是泛化嗯就是AI的核心问题就是解泛化的问题。

小俊 嗯对于泛化来说现在最重要的一个问题是什么呀,如果只说一个。

嘉宾 泛化的问题在Physical AI里面就是怎样从这个有限的讯号里面学到需要的操作。

小俊 嗯。

嘉宾 然后应用在一个没有看过的一个啊这场景里面嗯这个是呃Physical AI里面要解的一个主要的泛化问题Observation对action这个这个pair的泛化。

小俊 嗯。

嘉宾 让你看到一些你看到这个action跟observation是完成事情的怎么样快速泛化到一个啊新的observation那类似的action。

小俊 嗯诶我在想就是如果他在Cosmos这套系统里学习了但他走向现实世界之后他还是会有sim to real gap对不对怎么解决这个问题呢?

嘉宾 啊这也是一个泛化的问题对就是啊sim to real gap通常是嗯就我我们Cosmos想帮助呃这个呃Physical AI builder是通过三个方式嘛之前有讲的就是better data。

小俊 嗯。

嘉宾 better starting point。

小俊 嗯。

嘉宾 跟这个better environment那我觉得better environment这些东西是还没发生是大家都希望能做出这个矩阵哦。但还没发生就有陆陆续续有些突破我们看到一些work都很不错那现在比较管用的可能就是better data跟better starting points你拿一个懂这个比较懂这世界face怎么去去预测physics啊。就是懂physics可以去也不能说真的懂physics但抓到那个模式可以去predict接下来发生什么事情这个东西也许可以帮你产生更好的pair做出更好的policy那这东西。因为它本身的pair是比较适合泛化的那它也许就可以帮你啊。建出一个更更容易泛化的一个policy model对我觉得这个是我看到可能短期内Cosmos model可以对这个Physical AI builder的一个贡献。

小俊 嗯如果五年后我再来采访你你希望Cosmos发展到什么阶段?

嘉宾 哦。我希望五年后如果我们再有这个啊。这样的一个采访我们可以清楚的讲出来ChatGPT moment是什么时候发生的啊。对。然后是在哪里发生我希望可以可以这个事情是可以明确的讲出来。

小俊 几年几月几日那时就有一个具体的时间了。

嘉宾 对对对hopefully啊。

小俊 嗯在人工智能的历史上你希望别人怎么来记录你啊?

嘉宾 所以不要讲我吧我觉得就是呃讲Cosmos吧啊。然后希望Cosmos可能是一个重要的推手。然后帮助啊。这些几个重要的Physical AI builder啊。达到这个ChatGPT的moment,我觉得这个可能是我会很开心的一件事情。

小俊 嗯我还有一些快问快答。

嘉宾 嗯。

小俊 全球范围内一个你最喜欢的食物。

嘉宾 牛肉面。

小俊 全球范围内一个你最喜欢的地点。

嘉宾 啊我喜欢湾区天气实在太舒服了。

小俊 你有什么喜欢的音乐书电影或者游戏吗?

嘉宾 书蛮多的嗯然后呃音乐我不怎么听然后游戏我已经不怎么打我上次打游戏可能都是二十几年前的事情了。

小俊 你能分享一本真正改变你或者影响过你的书。

嘉宾 学生推荐的书它是是讲positioning的一件事情。

小俊 嗯。

嘉宾 啊。然后我忘记那个书名叫什么很有趣的一个心理学的书。然后让让你更加理解问题的本质是什么当年轻的时候读了很多不同的书对我特别喜欢金庸小说那那那是其中一环。

小俊 金庸小说有帮助到你后面的科研或者是学管理吗?

嘉宾 嗯。倒是没有啊。就是啊。里面的这些啊。可以体会这个金庸的各式各样的幻想。然后很美的一些意境哈那。当然是呃我把我推向了学中国武术的道路。然后啊。从中国武术里面得到一些力量啊。我觉得那都是蛮不错的一些过程。

小俊 嗯对于年轻的研究员你会有什么建议啊?

嘉宾 就是不要紧张。

小俊 为什么不要紧张?

嘉宾 因为现在年轻人研究员都往往觉得就是啊会不会明年这个AI就就结束了。

小俊 就AI自训练了。

嘉宾 嗯。不要紧张对自己有信心。然后冷静下来那个看清楚什么地方是值得你投入精力不要不要?被这些啊。大家的这个宣传而觉得好像自己路越走越窄。

小俊 现在研究员进入Physical AI是一个好时机是一个蓝海吗?

嘉宾 好时机对。

小俊 就是一个好时机嘛。就是各种机会。然后还有很多地方我我。当然做Physical AI我比较懂但这些啊AI的进步让我们可以做出更好的这些material啊。更更好的药啊。这些生物方面的这个突破我觉得在各行各业里面都可以渐渐看到这个这个AI的影响我觉得很多地方都可以去投入。

嘉宾 嗯我们工作室叫语言即世界工作室当你第一次听到这个名字的时候你在想什么?

小俊 用语言来啊描述这世界上发生有趣的事。

嘉宾 嗯。你觉得是大模型竞争不是鱿鱼游戏,还是世界模型竞争不是鱿鱼游戏啊。还是说对于你来说不是鱿鱼游戏对别人可能是。

小俊 我不清楚你你你如果你如果大家想解的东西一模一样。

嘉宾 嗯。

小俊 那就是鱿鱼游戏。

嘉宾 嗯。

小俊 对吧啊。

嘉宾 所以模型竞争不应该是鱿鱼游戏。

小俊 对因为这世界上要被解决问题这么多。

嘉宾 啊。

小俊 对。

嘉宾 嗯。

小俊 然后可以提供价值的东西这么多。

嘉宾 嗯。

小俊 每个人喜欢东西又不太一样对啊我觉得不应该是啊看成是鱿鱼游戏。

嘉宾 你有过那个特别嗨ego的时候吗?

小俊 年轻的时候。

嘉宾 社会的是吧?

小俊 对就是我总觉得我的呃算法最好。然后对我写的paper最漂亮总是会这么觉得算法重要你需要很好的数据很好的infrastructure让你可以做快速的算法迭代啊。因为你即使你有两种可能嘛。一种是你一开始算法很好OK那很好。但是即使你一开始算法不好你有很好的data,有很好的infrastructure,你可以迭代。然后迭代只要你遵循着这个就是很很严格啊。纪律。然后这种控制实验法则你算法就越变越好。所以我反而觉得迭代速度是重要的那迭代速度就是要靠强大的那种infrastructure来支持data很重要。因为啊。如果一个问题可以用data解,你就用data解就好不用开发算法。

嘉宾 嗯。

小俊 因为data简单多了。

嘉宾 嗯。

小俊 对然后所以不喜欢浪费力气这个问题只要是data能解就就收集data就造data啊然后真正不能解的再用算法来解。

嘉宾 是每一个公司都需要训一个自己的大模型吗你觉得没有必要是吗?

小俊 如果是commodity,你你需要建自己的电厂吗你每家公司要建自己的电厂吗?

嘉宾 OK。

小俊 就是看合不合合乎经济效用效应对吧?

嘉宾 哦嗯。

小俊 在早期你要做汽车工厂的时候当电厂不充裕的时候你盖个电厂你可能可以确保你公司是二十四小时运行的。但是现在这时代你可能不需要了对吧。

嘉宾 嗯。

小俊 对你可能跟太多这个AI的那个呃就是开发者聊他们每个人都是觉得我的AI模型是最好我觉得这东西在历史上从来没发生过。然后我不觉得这因人跟人相处没那么容易的你看当初Am那个Dario Amodei跟跟那个Sam Altman就是合不来。

嘉宾 啊。

小俊 对吧啊。

嘉宾 啊。

小俊 啊他就走了。

嘉宾 啊。

小俊 对。然后你确定在在那个Anthropic里面每个人都是一模一样啊。我不觉得都是就是坚信的就是莫被哪天就是你生了A不生了B,然后B就觉得说。

嘉宾 哦。

小俊 嗯对吧然后然后他会不会带一群人走去做个类似的东西。

嘉宾 啊。

小俊 对然后哎呀但数据大家都有。

嘉宾 啊数据有算力找你们买。

小俊 算力你只要有钱还是买得到。

嘉宾 嗯。

小俊 对吧啊。

嘉宾 嗯所以大家都能做。

小俊 你有决心然后你你你有资源你是可以做的。

嘉宾 嗯。

小俊 嗯其实没有那个必要诶。

嘉宾 Cosmos对你们来说是一场不能输的战争吗?

小俊 这如果说有其他公司也做开源模型的话那就不是。

嘉宾 那就不是。

小俊 对什么叫战争呢就是我没有打算把别人杀死。

嘉宾 那我必须要on这个赛道。

小俊 噢不是。

嘉宾 就是你们都得长在我的生态上面。

小俊 Nvidia要继续成长Physical AI是一个重大的一个市场现在家家户户都没有机器人但如果有机器人的话我家可能会买两三个那每个机器人都需要算力那等于整个世界对需要对算力的需求会大幅的增长这个事情如果发生的话对Nvidia是巨大好处我们的心态不是说想把别人给杀死我们的心心态是我们要怎么去造市场你懂我意思吗?cuda就是造市场造出了今天的AI的市场我们想的是怎么造出下一个大的市场那你说呃是不能输的战场吗?我觉得。

嘉宾 也不是。

小俊 也不是因为是全新的东西对。

嘉宾 我没有跟任何人竞争是吧?

小俊 Yeah就是共力嘛。带着大家一起把这个市场建出来。然后你卖这个机器人赚钱你做这个custom agent赚钱那这个东西会需要一些算力你赚钱那。当然会有公司研发自己的芯片它也会赚钱但整个市场就起来原本是nothing。

嘉宾 老黄会分享类似观点嘛,经常说什么。

小俊 经常说造市场嗯。

嘉宾 造市场啊而不是在存量竞争。

小俊 对你读他的书就会发现他讲说我们就叫做这种zero billion dollar business什么叫zero billion dollar business就是现在不是个business,但以后成功后会变billion。

嘉宾 嗯。

小俊 嗯如果现在已经有人在做很就不值得做。

嘉宾 这是一种拥抱风险还是一种抵抗风险它是一个de-risk吗?

小俊 这是一个de-risk吗?我们做事方法是很risky的对吧全部就是cuda那时候是很risky的一件事情等于是赔本在卖对我们因为创了cuda我们整个GPU的价格都比别人高同样的flops我们就是比别人高因为我们要资源那个programmability。

嘉宾 嗯。

小俊 对吧你不这么做你做这件事情很risky,你不做这件事情更加risky。

嘉宾 你不做那件事情别人做了的话对于你们来说就很有风险。

小俊 对就是呃不不做这件事情的话就是你的东西就渐渐变Commodity。

嘉宾 嗯你还要从老黄身上学到什么没有?

小俊 我都尽量很用心在学习他怎么去呃跑其他东西然后从里面去应用在跑Cosmos。

嘉宾 为什么其他公司都说CEO不应该是最努力的人但是你们公司CEO是最努力的人。

小俊 对是哦这我也不懂it works你看对吧啊世界没有绝对。

嘉宾 他现在驱动力是什么呀?

小俊 驱动就是take care of families。

嘉宾 啊。

小俊 对做AI整件事是很有趣的一件事情你尤其是站在他角度里面看到他的贡献改变世界我觉得是很有成就感的一件事情。

嘉宾 不愧是教主。

小俊 是的。

嘉宾 嗯。

回到顶部