教 AI 理解物理世界——对话 World Labs 李飞飞(No Priors 第 117 期)
Teaching AI to Understand the Physical World, with Dr. Fei-Fei Li of World Labs (No Priors Ep. 117)

嗨,听众朋友们,欢迎回到 No Priors。今天的嘉宾是 Fay Lee 博士,她是计算机视觉和深度学习领域的先驱。她创建了 ImageNet,这个具有里程碑意义的数据集推动了深度学习革命。Fay 是斯坦福大学教授,也是 Stanford Institute for Human-Centered AI 的联合主任。她还曾在 Google Cloud 负责人工智能业务,为国际政策制定者提供顾问服务,最近联合创立了 World Labs,一家致力于开发空间智能 AI 的公司。Fay,感谢你今天的到来。
嗯,谢谢邀请。这会是一次有趣的对话。
过去二十年来,你在科学和政策领域都做出了非凡贡献。我先从最大的问题开始:为什么现在选择创业?
因为我内心想要创造。我认为现在是一个关键、有趣且令人兴奋的时刻,可以构建一些每个人都能使用的非凡技术。我非常看好空间智能,以及能够赋能众多人群和大量应用场景的 3D 世界模型。我认为这将非常令人兴奋,而且我能与一群极其杰出的年轻技术专家一起实现它。
我想回头聊聊你现在的团队成员,因为我认识几位你的联合创始人,之前还曾极力说服他们去创业,然后他们说,哦不,我们现在和 Fay 一起有更大的使命。什么是空间智能?你能向更广泛的受众定义一下吗?
对我来说,空间智能是理解、推理、交互并生成 3D 世界的能力,因为我们的世界从根本上说——无论我们如何投射它——本质上都是 3D。物理上它是 3D 的,而在数字层面,如果存在真正的 3D 表征,我们就能更轻松地实现很多事情,无论是设计更多创意作品、导航、模拟,还是体验 AR/VR,所有这些对我来说都属于空间智能的范畴。真正让我兴奋的是,人类拥有空间智能,它是我们核心智能能力的一部分;动物也具备空间智能。整个进化历程也与空间智能的演化深度交织在一起。它是如此根本——没有空间智能,AI 将是不完整的。
这如何转化为你公司正在做的事?关于你们正在构建的技术,你能分享些什么吗?
是的。我们正在攻克人工智能中最难的难题之一:构建本质上是 3D 的世界模型。因为一旦你能破解这个难题,就能解锁大量的空间智能问题。因此,据我们所知,我们是第一家解决 3D 生成基础模型问题的公司。
我有很多问题,但既然你首先描述了 3D 对于理解世界的关键性,这是否意味着你认为 World Labs 或学术界、其他公司未来将创造出的世界模型,会在某一天达到现实般的精确度,能够表征物理规律和对世界的理解,从而让我们能做更多事情?
是的,它应该达到现实般的精确,或者说是合理的。所以你可以创造一个奇幻世界,但它必须是合理的,因为其几何结构和物理规律需要是合理的,而这正是空间智能的根本。
这是否意味着你从神经科学的角度有特定的观点——比如视觉智能有多根本?我的意思是,你一直是计算机视觉领域的领导者,但视觉智能相比大语言模型和文本智能,究竟有多重要?
我确实有这样的观点。从神经科学和认知科学的角度看,空间智能是进化必须为动物解决的一个非常棘手的问题。真正有趣的是,我认为动物在一定程度上解决了这个问题,但并未完全解决。这是最难的问题之一,因为动物必须解决什么问题呢?动物必须进化出一种能力,用某种器官——主要是我们称之为眼睛的器官——收集光线。然后,借助眼睛收集到的信息,它们必须在脑海中以某种方式重建一个 3D 世界,这样才能导航、行动,当然还有交互。对人类而言,我们是操作能力最强的动物。我们能做很多事情,而所有这些都属于空间智能。对我来说,这根植于我们的智能之中。
有趣的是,即便在动物身上,这也不是一个已完全解决的问题。比如我们人类,对吧?如果我让你现在就闭上眼睛,画出或构建出周围环境的 3D 模型,这并不容易。在未经训练的情况下,我们并不具备生成极其复杂的 3D 模型的能力。你知道,我们中的一些人,无论是建筑师、设计师,还是经过大量训练、极具天赋的人,要做到这一点也是很难的。想象一下,如果你能轻松地在指尖完成这件事,并实现更加流畅的交互和可编辑性,那将为人们开启一个完全不同的世界——无意双关。
除了空间智能之外,你觉得还有哪些重大领域从模型角度来看尚未得到充分发展?或者你认为,在构建人工智能未来的过程中,还有哪些缺失的环节是人们应该逐步关注或建设的?我只是好奇,除了 3D 和世界生成之外,是否还有其他类似的大问题?因为感觉随着时间的推移,我们已经解决了一些大事,还有一些正在攻克。
语言问题我们算是正在解决。
我认为语言在很大程度上已经被解决了,而 3D 对我来说和语言一样关键、一样困难。那么还有什么没被解决?我的意思是,情感智能这一整个领域是我甚至都不知道从何入手去解决的。我认识很多人也没能解决它。也许等 AGI 实现的时候吧。
我可以告诉你,这方面的训练数据不会来自硅谷人。
别低估了硅谷。
是的。我也把自己算在这一类里,但我认为我们可能需要更广泛的人群。
是的,不,这点我同意。
但说实话,这就是三大块。我不知道。Elon 和 Sarah,你们怎么看?
我认为这在很大程度上取决于你在每个模型中封装什么。所以我同意你关于这三大块的框架,然后某些方面——比如空间智能,我猜也会涉及不同类型的物理模拟和世界模拟——你知道,这些是很多人认为有趣或重要但鲜有人涉足的大领域。
而且这其中有宏观和微观两个尺度。
微观尺度最终会变成材料科学,以及与你所说的更偏分子层面建模截然不同的领域。
没错,而且这在某种程度上也超出了当前 AI 的定义范围,不过我认为它们当然会从中受益。当然还有机器人技术,但机器人技术在很大程度上是一个系统集成问题,而且你知道,即便观察动物,也不仅仅是大脑本身的计算,对吧?
是的,相对于动物拥有的特定系统,空间智能涉及的很多东西似乎分布得更广,而且在某些情况下,正如你所说,并不像人们想象的那样集中。
因此,从这种模型来思考生物体内部更分布式的智能,相对于 CNS 而言,是非常有趣的。是的,我认为这是非常有趣的研究。
您在机器人学以及物理智能领域也做过研究。关于机器人基础模型和驱动的数据层级,人们当然想使用视频,因为这是我们最容易获取的数据。但关于仿真以及我们今天能从中获得多少价值,存在很大的疑问——也许人们未能看到未来仿真质量和物理引擎的潜力。此外还有接近具身的数据,比如不同形式的遥操作,以及具身数据采集。这是您心目中的数据层级吗?还是说您认为人们低估了仿真和世界模型在未来能发挥的作用?
是的,问得好。首先,正如您所说,我确实从事机器人学研究,尤其是在斯坦福的实验室里。我毫不怀疑人类将进入一个与机器人共存的时代,而且“机器人”这个词并不专指人形机器人。机器人会呈现各种各样的形态。实际上,几年前我的实验室发表了一篇非常有趣的论文,讨论形态智能——即智能体的形态可以通过优化其要完成的任务而发生改变。所以我们应该比仅仅想象人形机器人更有想象力。话虽如此,关于如何训练机器人,您提到了数据——有人称之为数据金字塔或数据蛋糕之类的。
我同意,我认为这将是多种不同数据形式的混合体。我也认为仿真被低估了。实际上,很多业内专家和从业者并没有低估它。如果你看看许多机器人公司,它们都在研究仿真和合成数据。但我还认为我们必须意识到,与语言模型甚至空间智能基础模型不同,机器人是一个高度多模态的系统。在我看来,真正被低估的是触觉——触觉数据太多了,尤其是如果我们想做操控而不仅仅是导航的话。我认为触觉数据以及将触觉真正整合到视觉、感知和空间数据中的能力,绝对是至关重要的。
您提到有一点我觉得非常有趣,那就是机器人可能会适应或采用多少种不同的形态。关于未来,人们大致提出了两种相反的论点。一种认为,从供应链以及生产管理和制造规模的角度来看,最终只会剩下很少的机型。另一种则认为专业化的经济价值非常高,因此随着我们进入一个机器人驱动的未来,将会有成千上万种不同的机型。您对这两种观点之间我们最终可能落在哪里有什么看法?
我认为我们会像梯度下降一样,朝着生产力和效率的最优化演进。我的假设是,不同任务的需求差异如此之大,以至于拥有很少机型或坚持单一机型在能量上是低效的,很多任务可以而且应该由能效高得多的机型来完成。举一个极端且显而易见的例子:如果我们把机器人放到水下,它们不应该长成人的形状,最好像鱼一样,对吧?想想能量效率。飞行也是如此。我不认为人类的形态适合飞行,我们的飞机正变得越来越像机器人。所以我确实认为未来会呈现多样性。
机器人学是未来的一个潜在应用。您首先是科学家,但我也知道您曾任职于 Twitter 董事会,并参与过初创企业。对于生成 3D 世界,您能想象到哪些近期的商业应用?
我相信创造力是一个极其令人兴奋的领域,人类可以通过 AI 和空间智能获得极大的增强。这里我想拿软件工程做个类比。如果你看看今天 LLM 在软件工程中的成功,包括 Cursor、Windsurf 等应用,你会发现 AI 与人类之间存在大量协作,这种协作体现在不同技能层面等等。我认为创造力领域也会类似——无论是设计师、3D 艺术家、VFX 艺术家,甚至是营销人才和游戏开发者。在设计和创造 3D 空间方面存在巨大的协作需求,而这从根本上来说即使对训练有素的专业人员也是一个极难的问题,因此如果做得好,拥有一位协作者将会非常有趣。
所以我认为创造力是一个真正令人兴奋的领域。我也认为,我们对于元宇宙或 XR、ARVR 的诸多期待其实在于内容创作。我理解硬件本身需要继续演进,但我也认为在软件层面,我们寻求的是内容创作,而这与 3D 建模、3D 或生成式空间模型天然契合,这是另一个值得关注的有趣领域。
对于世界模型是否能成为可扩展 RL 的一种有趣解决方案,从而让智能体具备更强的泛化能力,您有强烈的观点吗?
我确实这么认为。就像我说的,没有空间智能,AI 就是不完整的,因为人类在 3D 世界中互动,在数字世界中我们也需要各种各样的交互。以设计为例,当你在思考设计时,你在脑海中优化着太多东西——无论是美感、效率、优化还是别的什么——而这天然地非常适合 RL 的框架。
在设计和训练世界模型的这条道路上,您认为最大的挑战是什么?我想象之一是,您研究过图像,也研究过视频,我们有图像和视频数据,但如您正在构建的那种 3D 世界数据,我们并没有很多。
是的,数据绝对是一个挑战。您说得完全正确。要知道,为了创建世界模型、3D 基础模型,我们需要越来越复杂的数据工程、数据采集、数据处理和数据合成。所以我很羡慕我那些从事 NLP 和 LLM 的同事,互联网上的数据如此丰富,而我们未必有这样的奢侈。这肯定是一个挑战。另一个挑战是,3D 有点讽刺,对吧?我们每个人每天都在使用 3D,在那么多场景中——基本上你睁开眼睛,你体验的整个生活就是 3D 的,即使我们一直在电脑前打字或盯着屏幕看。然而,与语言相比,它仍然不是一种那么容易交付到人们手中的形式。语言太简单了,而且它是一种非常主动的形式,不是被动的观看消费。没人会醒来就说“我就坐这儿看 3D 吧”,您知道吧。所以这给产品化以及如何用正确的方式去做带来了挑战。
您曾经是《第二人生》之类的玩家吗?或者玩过什么类似的东西?
我不是游戏玩家,但我的孩子们很喜欢《我的世界》。
我正想问您,有没有一个您想要体验或想象的世界。
Sarah,这是个好问题。您知道,我很想看到各种世界。我喜欢看到那些我未曾见过的世界。
比如,不断放大、再放大,进入微观世界,或者进入引擎内部,了解真实的引擎究竟是怎么回事。当然,我从理论上知道它是如何运作的,但亲眼看到它、亲身体验它,或者——你可能会笑我——我想钻进洗碗机里,亲身体验那是什么样的。如果我们能为任何事物建立 role models,所有这一切都可以通过虚拟方式实现。
我很想聊聊你过去的职业生涯,也许再分享一些对任何从事研究或试图在AI领域产生影响的人的见解。
就在这次访谈之前,我问了 Andre Karpathy 我应该问你什么,他说,你知道,Fei-Fei 在雄心和对数据的思考方面真的很了不起。你应该问问她的博士经历,以及她和 Petro 一起创建的那个101数据集,因为那很有启发性。
所以我必须问你这个问题。
你知道,首先我想说,当你有一位学生比你更有名、成就比你更高时,那总是最美好的事情。这让我非常骄傲。为 Andre 感到非常骄傲。
我很惊讶他竟然记得我的博士工作。
是的,没错。哎呀,那得追溯到2003年左右,当时世界刚刚触及互联网的表面,数据还远未成为什么大不了的东西。
但在计算机视觉领域,我的博士工作真正试图让物体识别奏效。就是当你看到一张图片时,识别出猫、狗、微波炉、椅子等等的问题,而且我们开始假设数据很重要。但我们毫无概念,没有什么 scaling law。我们完全不知道数据能发挥多大作用。
我们想要的只是,如果我们有一个机器学习算法——无论是神经网络,还是当时非常流行的 baset,亦或是支持向量机——我们需要一些数据来训练,但根本没有训练数据。作为一名博士生,你肯定想毕业。然后 Petro 就说,好吧,Fei-Fei,你去整理一个数据集。我当时想,是啊,我确实需要整理一个数据集,因为现有的每个数据集都太小了,我无法信服。
Petro 和我就在讨论,你知道,是15种不同的东西,还是30种?然后,我的天,博士导师说出了一个三位数:100。
我当时就想,这工作量可太大了。但我内心深处知道,从数学角度看,他是对的——要推动模型泛化,我们至少需要足够的数据。
所以,你知道,我在我的书《The Worlds I See》中写过这个过程。不知怎么的,我偶然发现了一本词典,其实那是我自己学英语用的。我想那是 Webster 词典,如果我没记错的话。
它里面似乎随机附有一些单词的视觉插图。说实话,我甚至不知道他们是按照什么规则挑选这些词的。有些是花,有些是自行车,有些是狗。我当时想,好吧,这其实——你可以说我作弊,也可以说这是个工具——我从中抓取了101个词。
这真的让我的博士导师哑然失笑,因为他说:“啊,是啊,你就是想比我要求的再多做一个,来挑战我。”于是我就这么做了。
我得说,我还记得我当时从 Google 下载,或者说尝试从 Google 找图片。那时候 Google 还很新,Google 图片搜索跟今天比起来太糟糕了,我不得不做大量的清理工作。有一次我绝望到直接让我妈妈来做图像清理,因为我在电脑上写了一个小界面。她不懂电脑,但至少知道点点鼠标。所以她帮我做了其中一部分。
我的意思是,你拥有AI领域最传奇的职业生涯之一,而且正如你所说,你的许多学生同样在这个领域、在产业界、在全世界取得了非常了不起的成就。
当你今天回顾自己的职业生涯时,会想到哪两三个时刻?显然你的职业生涯还远未结束,我只是有点好奇。
当然,你在图像和视觉识别相关系统等方面做了很多工作,但我只是好奇,当你回想过去这20年,考虑到你所做的一切,什么最突出?
哦,谢谢你问这个问题。当然是 ImageNet,它由许多个时刻组成——从早期的挣扎,被告知我拿不到终身教职,到意识到 Amazon Mechanical Turk 可以救场,再到 AlexNet 获胜的时刻。
还有几年前,我在多伦多参加一个活动,和 Jeff Hinton 在一起,他公开谈到那(ImageNet)是多么具有决定性意义。他几乎有点抱歉地表示,ImageNet 没有像神经网络那样得到广泛认可。
所以那段旅程非常令人欣慰。对科学家来说,这种欣慰不在于认可或奖项,而在于你产生了影响——就像那个没人相信的猜想,那个没人相信的假设,我们最终能够把它实现。
这是一个脉络。顺便确认一下,对于任何来自商界、可能不熟悉它的人来说,ImageNet 是一个大规模数据集,拥有数百万张标注图像,涵盖数千个类别,不仅仅是10个或1个。对吧,1500万张标注图像。
1500万张标注图像。谢谢你,Fay。你知道,它催生了深度学习领域的惊人突破,特别是 AlexNet,并在机器视觉领域推动了巨大进步。实际上我记得在2016或2017年,我常用一张幻灯片展示AI的历史。那时候是 CNN 和 RNN 的天下,GANs 也正崭露头角。我把 ImageNet 和 AlexNet 列为真正定义AI进步的极少数 seminal moments 之一。显然现在 transformers 也是其中一部分,也许还有 diffusion models 之类的。但那真是一个巨大的突破。
是的,谢谢你。另一个我非常自豪的时刻,其实是 Andre,还有 Justin Johnson,以及他们的博士论文。
在我看来,那是语言和图像首次通过为视觉世界生成描述和写故事而融合的时刻。
这对我来说意义重大,有两个原因。一是,我博士毕业时真的以为——不骗你——我以为即使我能活到100岁,那可能是我们刚好能够解决的问题,也就是为图片讲故事。
所以我进入职业生涯,当助理教授的第一年,就想着:好吧,我要做 ImageNet 来解决物体识别问题,然后我要用我整个职业生涯的剩余时间来解决这个讲故事的问题。
然后等到 Andre,稍晚一点还有 Justin Johnson 加入我的实验室时,那大约是2013、2014年,深度学习的初期。突然之间,序列模型——当时是 LSTM,还不是 transformer 模型——和 CNN 的结合,彻底打开了 image captioning 这项工作的大门。
我的工作是和 Google 一起最早发表的,那对我来说——我真的无比自豪。我几乎有了一种危机感:那我接下来的70年,或者65年,要做什么呢?这实在太令人兴奋了,这个领域进化得如此之快。
Sarah关于这点,我能再问一个问题吗?因为你已经取得了非常惊人的进展,而且效率很高。我们之前私下聊过,你提到在资金雄厚的大型企业实验室之外,AI 研究中仍然需要有 moonshots 和创造力,你还指出有几个关键时刻正是源于学术界的研究和创造力。对于那些想进入这个领域的人,你有什么建议?是否还存在这样的机会?还是说从现在起一切都只是百亿美元级别的训练 run 了?
Fei-Fei Li我唯一的建议,而且我在自己的公司和实验室里也一直这么说,就是要 fearless。我认为科学家、技术专家和企业家都必须 fearless。要知道,你最终必须弄清楚,你是需要百亿美元级别的训练 run,还是得来找 Sarah 要资金?可能两者都需要。是的。或者你还必须弄清楚,我不知道,数据的问题。有时候,fearless 是一种非常有趣的状态:你有点妄想、有点疯狂,但又有点理性的果敢,它介于两者之间。
因为如果你太过理性,那就不够有勇气,你识别不出足够大的问题。但如果你完全疯狂,那我不知道,可能会出很多乱子。所以,要 fearless,要勇敢。对我来说,即使到了我这个年纪,我创办初创公司 World Labs 时也是这么想的——我要 fearless 地解决 spatial intelligence 这个问题,作为解决问题的一部分。
Sarah你曾与世界上一些最顶尖的 AI 研究人员和工程师合作过。在你的公司里,你如何看待这件事?你想招聘什么样的人?目前有开放的职位吗?毫无疑问,你们团队非常棒,我只是好奇你想加入什么样的人才,以及你对此的长远考虑。
Fei-Fei Li是的,我们有开放的职位,非常希望招聘最顶尖的工程师以及产品思想家,这对我们公司现阶段来说很重要。所以,如果你是工程师、AI 研究员或产品人才,热衷于加入最出色的团队来解决这个问题,请加入我们。那么我们招聘什么样的人?首先,我们确实非常看重思维多样性。说到这里,你称我们为 AI 公司,但如果你深入了解一下,我们有计算机图形学专家、计算机视觉专家、数据专家、generative AI 专家、machine learning infra 专家、优化专家等等。
因此,招聘一群背景各异、真正优秀的人其实非常重要,因为像 spatial intelligence 这样困难的问题并不是单一维度的,它需要各种背景的人才才能解决。另外,你知道吗,我还看重 fearless 的品质。
Sarah你怎么判断呢?你怎么识别一个人在他的背景或思维过程中是否具有 fearless 的特质?
Fei-Fei Li这体现在他们的背景中。你和他们交谈,就能感觉到一个人是否 fearless。你能感觉到是什么在驱动他们。你能感觉到他们问的问题。如果他们开始问你很多类似“我不知道怎么完成这件事”的问题。当然,你必须问这些问题,因为你想把事情做成。但如果你感觉到这出于一种害怕解决这个问题的视角,那就不是 fearless。但那些 fearless 的人,他们富有创造力,有雄心壮志,他们不害怕不确定性或未知。我真的很欣赏这一点。
Sarah嗯,我深有同感,你知道吗,我们努力与 fearless 的人合作,希望他们在技术上也有创造力。呃,最后一个更宏观的问题:我认为你工作中很重要的一部分,也是思考如何让更多人进入 AI 领域,比如你联合执导的斯坦福大学 human-centered AI 研究中心。如果展望未来几年——不是故意用你书名的双关——从你上一组预测来看,你对 human-centered AI 最乐观的愿景是什么样的?
Fei-Fei Li是的,谢谢你的提问。事实上,这是我职业生涯中另一个让我感到非常自豪的成就,那就是创办了 human-centered AI institute(HAI),以及推动这种思维方式不断发展。我想构建一个 AI 与人协作、并 superpower 人类的世界。我始终相信,我们的世界,我们人类的世界,需要以人为本,爱、人际关系,以及所有社区的共同繁荣,这些都非常重要。公正,以及所有这些价值观都非常重要。
我认为任何机器,无论是 AI、飞机还是生物技术,都不应剥夺这些价值。但在牢记这些核心价值观的前提下,让 AI 来 superpower 我们真的非常重要,因为还有太多未解的难题。我曾从事的一个应用领域是医疗保健,比如在斯坦福的工作。如果你看看医疗保健,从药物研发、疾病治疗,到能惠及全球所有人的诊断、所有人都能获得的治疗,再到整个医疗交付体系,如何让老龄化更体面、如何照顾慢性病、如何应对心理健康,所有这些。
我们面临的问题不是人类太多之类的问题。我们缺乏帮助。我们缺乏科学发现,缺乏诊断,缺乏精准医疗,缺乏更安全、更有效的医疗交付方式和养老帮助等等。这就是我坚信的。我认为 AI 是帮助人的工具。
Sarah是的。我想,我和许多人共同投资了一系列公司,希望它们能在这方面发挥作用,从 a bridge 到 open evidence 再到 LA,但正如你所说,问题涉及的范围非常广泛。说实话,过去十五年我对技术在医疗领域的普及一直不太乐观,但这次感觉真的不一样了,实际上这具有巨大的 net good。
Fei-Fei Li是的,实际上在此之前我创办过一家数字健康公司,我希望人们谈论了几十年的很多事情最终能够实现,而 AI 似乎是实现这一切的一个很好的 delivery mechanism。
Sarah完全同意。呃,非常感谢你,Fay。这次对话太棒了。令人鼓舞,也很高兴能更多了解 World Labs。谢谢。
Fei-Fei Li谢谢。非常感谢。谢谢 Sarah。
Sarah在 Twitter 上关注我们的账号 no prior pod。如果你想看到我们的面孔,请订阅我们的 YouTube 频道。在 Apple Podcasts、Spotify 或任何你收听播客的平台关注本节目,这样你每周都能收到新节目。你还可以注册邮件,或在 no-briers.com 找到每一集的文字记录。