Yann LeCun:人类智能并不是通用智能
Yann LeCun: Human Intelligence is not General Intelligence | AI Inside Podcast

Yann LeCun,Meta 首席 AI 科学家、图灵奖得主,本期做客节目,与我们探讨当今 LLM 的局限、生成式 AI 为何可能撞上瓶颈、实现真正人类水平智能还缺什么、AGI 的真正含义、Meta 凭借 Llama 推行的开源战略、AI 助手在智能眼镜中的未来、AI 模型多样性为何重要,以及开放模型将如何塑造下一个创新时代。
在 Patreon 上支持本节目!http://patreon.com/aiinsideshow 订阅 YouTube 频道!http://www.youtube.com/@aiinsideshow 喜欢 AI Inside 播客?请在您选用的播客平台给我们打五星好评! 注:时间码可能因发行商的动态广告插入而有所变动。
0:01:40 - 介绍 Yann LeCun,Meta 首席 AI 科学家 0:02:11 - LLM 的局限与炒作周期,以及高估新 AI 范式这一历史规律 0:05:45 - AI 研究的未来,以及机器为何需要理解物理世界、具备推理与规划能力,并以人类设定的目标为驱动 0:14:47 - AGI 时间线,十年内实现人类水平 AI,深度学习作为高级机器智能的基础 0:21:35 - 真正的 AI 智能为何需要超越语言能力的抽象推理与分层规划,而非像当今神经网络那样依赖计算技巧 0:30:24 - Meta 的开源 LLAMA 战略,赋能学术界与初创企业,及其商业收益 0:36:10 - AI 助手、可穿戴设备、文化多样性与开源模型的未来 0:42:52 - 移民政策对美国科技领导地位及 STEM 教育的影响 0:45:19 - 感谢 Yann LeCun 做客 AI Inside 播客
如有问题与反馈,请联系我们:contact@aiinside.show 了解更多广告选项,请访问:megaphone.fm/adchoices
Jason我很荣幸邀请到 Yann LeCun 做客 AI Inside,他是 Meta 首席 AI 科学家、图灵奖得主,被许多人尊称为“AI 教父”。欢迎来节目,Yann。很高兴见到你。
每次听人介绍你是“AI 教父”,你会觉得腻吗?你会不会心里想着“又来了”?
Yann我会捂住耳朵,免得脸红。
Jason但你现在应该能坦然接受了吧,因为这确实是事实。好了,这次对话可以聊的方向太多了,显然我们会经常谈到你的工作、Meta 的工作,以及当下这个 LLM 时代。我想用来开场的问题是,我们如今正深陷于人工智能的当前阶段,这实质上就是 LLM 的时代,尽管地平线远处可能已有新东西在酝酿,但我们仍牢牢扎根于此。你对 LLM 的局限性一直直言不讳,与此同时,我们也看到 OpenAI 凭借其在 LLM 技术上的成功,完成了一轮创纪录的融资。所以一方面是收益递减,另一方面是企业把一切都押在生成式 AI 和 LLM 上。我很好奇,你觉得为什么他们可能没看到你看到的这些东西?又或者他们其实看到了,只是采取了不同的应对方式?你怎么看?
Yann哦,也许他们确实看到了。LLM 很有用,这一点毋庸置疑。我的意思是,尤其在编程助手这类应用上。未来,它们大概还能用于更通用的 AI 助手,承担各类工作任务。人们现在都在谈论 agentic systems。
但目前还没达到完全可靠。在这类应用中,核心问题——其实也是 AI 乃至计算机技术长期存在的反复出现的问题——在于:你总能看到令人印象深刻的演示,可真到了要部署一套足够可靠的系统、把它交到人们手中供日常使用时,中间还隔着很远的距离。要让这些系统达到足够的可靠性,难度要大得多。对吧?
十年前,我们就能看到汽车在乡间小道、街道上自动驾驶的演示,大概能跑十分钟才需要人工干预。我们确实取得了很大进步,但现在仍然没能造出像人类一样可靠的自动驾驶汽车,除非我们“作弊”——这倒也没关系,Waymo 和其他公司就是这么做的。所以在过去七十年里,AI 领域一直在重复这样的历史:有人提出一个新范式,然后宣称“就是它了,这会把我们带到人类水平 AI”,“十年内地球上最聪明的实体将是机器”。
而每一次都被证明是错的,因为新范式要么撞上了人们当初没预见到的局限,要么只是擅长解决某一类子问题,而这类问题后来证明并不是通用智能问题。于是,一代又一代的 AI 研究者、产业界人士和创业者不断发出这样的断言,却每一次都错了。
所以,我不想贬低 LLM。它们非常有用,应该大力投资,也应该大力投资建设运行它们的基础设施——实际上,大部分钱正是花在这里,而不是用于训练模型什么的。最终是要靠基础设施来服务潜在数十亿用户。但就像其他计算机技术一样,它即便不是人类水平智能,也可以很有用。
不过,如果我们想追求人类水平智能——我认为我们应该这么做——我们就需要发明新技术。我们现在离那还差得远呢。
JeffYann,非常感谢你来参加节目,因为我在节目里和其他地方经常引用你的话,我觉得你是 AI 领域中现实主义的声音。我从没听到你像其他地方那样大肆鼓吹。
你对我们现在的位置一直说得很清楚。我记得你曾打过一个比方,说我们大概只达到了聪明猫或者三岁小孩的水平。
Yann对。
Jeff对。而且我记得你也谈过,我们已经触及了 LLM 能力的上限。所以下一个范式、下一次跃迁必然会到来,我想你说过那应该是更好地理解现实世界。但你能不能谈谈,你认为研究——或者说你正在推进的方向,或者说整个行业下一步该往哪里走?我们该把资源投入到哪里,才能让 AI 发挥更大潜力?
Yann大约三年前,我写过一篇长论文,阐述我认为未来十年 AI 研究应该走向何方。那是在全世界都知道 LLM 之前。当然,我事先就知道,因为我们之前就在做这方面的工作。但这个愿景一直没有变,LLM 的成功并没有影响它。
事情是这样的。我们需要能理解物理世界的机器,需要具备推理和规划能力的机器,需要有持久记忆的机器。同时,这些机器必须是可控且安全的,也就是说,它们必须由我们人类设定的目标来驱动。我们给它一项任务,它就去完成;或者我们问它问题,它给出答案,仅此而已。对吧?它不能脱离我们要求它做的事情。
我在那篇文章里解释的是,我们或许可以通过一种方式达到那个目标,而它的核心概念叫做“world model”。我们每个人脑子里都有 world model,动物也有。它基本上就是我们头脑中的心智模型,让我们能够预测世界里将要发生什么——要么是世界自行运转的结果,要么是我们采取某个行动的结果。因此,如果你能预测自己行为的后果,那么当你给自己设定一个目标、一项要完成的任务时,你就可以利用这个 world model 去设想:某一系列特定的行动是否真的能够实现那个目标。
好的。这使得我们能够进行规划。因此,规划和推理实际上就是操控我们的心智模型,以弄清楚某个特定动作序列能否完成我们为自己设定的任务。对吧?这就是心理学家所说的“System 2”。一个刻意的——我不想说“有意识的”,因为这个词含义太重——但本质上就是一种刻意的思考过程,思考如何完成一项任务。
说实话,我们目前还真不知道如何做到这一点。我是说,在研究层面我们正在取得一些进展。该领域许多最有趣的研究都是在机器人学的背景下进行的。因为当你需要控制机器人时,你需要提前知道给机械臂施加一个扭矩会产生什么效果。
因此,在控制理论和机器人学中,这个过程——想象一系列动作的后果,然后通过优化寻找满足任务要求的动作序列——甚至有一个名字,甚至有一个缩写。它叫做 Model Predictive Control,MPC。这是最优控制中一种非常经典的方法,可以追溯到几十年前。
这里的主要问题在于,在机器人学和控制理论中,这种方式的运作依赖于一个由人、由工程师写出的方程组模型。你只需控制机械臂或火箭之类的东西,就可以直接写下它的动力学方程。
但对于 AI 系统,我们需要这个世界模型从经验或观察中学习。因此,这种似乎发生在动物大脑中、也许还有人类婴儿大脑中的过程——通过观察学习世界如何运作——这一部分似乎真的很难复现。
现在,这可以基于一个非常简单的原理,人们已经尝试了很久但成效甚微,叫做 Self-supervised Learning。而 Self-supervised Learning 在自然语言理解和 LLM 等情境中取得了巨大成功。事实上,它就是 LLM 的基础。对吧?所以你拿一段文本,训练一个大型神经网络来预测文本中的下一个词。对吧?这基本上就是它的核心。
这些技巧只是如何让这一过程更高效等等。但那就是 LLM 的基础。你只是训练它预测文本中的下一个词。然后当你使用它时,你让它预测下一个词,将预测出的词移入它的观察窗口,然后预测第二个词,再把它移入,接着选第三个。对吧?
这就是自回归预测。这就是 LLM 所基于的原理。而诀窍在于你有多少钱可以雇人来微调它,以便它能正确回答问题。这正是目前大量资金涌入的地方。
因此,你可以想象用这种 Self-supervised Learning 的原理来学习图像的表征,学习预测视频中即将发生什么。对吧?所以如果你给计算机看一段视频,训练某个大型神经网络来预测视频中接下来会发生什么——如果这个系统能够学会这一点并很好地完成预测——那它很可能已经理解了物理世界底层本质的很多内容。它会认为物体按照特定的规律运动,对吧?
因此,有生命的物体可以以更不可预测的方式移动,但仍需满足某些约束。没有支撑的物体会因重力而下落,等等。对吧?现在,人类婴儿需要九个月才能理解重力。这是一个漫长的过程。
我认为年幼的动物学这个要快得多,但它们最终对重力究竟是什么并没有同样的掌握程度。不过显然猫和狗在这方面很擅长。那么我们如何复现这种训练呢?所以如果我们采用朴素的做法——我二十年来一直在做类似的事情,就像处理文本一样,只是拿一段视频来训练系统预测接下来会发生什么——但这并不太管用。如果你训练它预测下一帧,它学不到任何有用的东西,因为这太简单了。
如果你训练它做长期预测,它又真的无法预测视频中会发生什么,因为有很多看似合理的事情可能发生。对吧?所以在文本的情况下,这是一个非常简单的问题,因为字典里只有有限数量的词。因此你永远无法准确预测某个序列后面跟着哪个词,但你可以预测字典中所有词的概率分布。这就足够了。你可以在预测中表示不确定性。但你无法对视频这样做。我们不知道如何对全体图像、视频帧或视频片段的集合表示适当的概率分布。实际上这是一个数学上不可解的问题。
所以这不仅仅是我们没有足够大的计算机的问题。它在本质上就是不可解的。因此直到大概五六年前,我对此都没有任何解决方案。我想任何人对此都没有解决方案。而我们提出的一个解决方案是一种改变我们处理方式的架构。
我们不是预测视频中发生的一切,而是基本上训练一个系统来学习视频的表征,然后我们在那个表征空间中进行预测。而这种表征消除了视频中大量不可预测或无法弄清楚的细节。这种架构叫做 JEPA,Joint Embedding Predictive Architecture。稍后我可以再详细介绍。但可能令人惊讶的是,它不是生成式的。
所以每个人都在谈论生成式 AI。我的直觉是,下一代 AI 系统本质上将基于非生成式模型。
Jason听您谈到我们当前真正的局限性时,我想到的是,当我们看到每个人都在声称 LLM 有多么伟大,以及“我们正处于 AGI,即 Artificial General Intelligence 的边缘,原因如下”。这取决于你问谁。对吧?有些人说“它就在眼前。”另一些人说“哦,它已经来了。看看这个。是不是很惊人?”
是的。还有一些人说“它永远不会到来。”我想在这档节目中我们经常带着一丝难以置信地谈论这个话题,而我认为您刚才的话某种程度上为我强调了这一点。你如何围绕这些建立模型,或者说创建一个能够真正分析您所谈论的一切方面的模型?比如,我们有专注于推理的 LLM。尽管也许它与我们正在讨论的那种推理有所不同。也许那才是真正像人类那样推理的方式。但你还有物理世界。你还有规划、这种持久记忆。当您这样描述时,您提到的所有这些组成部分,真的让我更加确信 AGI 并非近在咫尺,AGI 实际上是一个遥远的理论,可能永远不会实现,或者至少要在非常、非常久之后才能实现?您对此怎么看?
Yann好的。那么,首先,在我看来毫无疑问的是,在未来的某个时刻,我们将拥有机器,它们至少在所有人类擅长的领域都和人一样聪明。对吧?这不是一个问题。人们对此有一些重大的哲学疑问。很多人仍然相信人性是某种难以捉摸的东西,我们永远无法将其归结为计算。我在这个维度上并不怀疑。在我看来毫无疑问的是,在未来的某个时刻,我们将拥有比我们更智能的机器。在狭义领域它们已经比我们更聪明了。对吧?
那么这就涉及到一个问题:AGI 到底意味着什么?你说的“通用”是什么意思?你是指像人类智能那样通用的智能吗?如果是这样,那好,你可以用这个词,但它非常具有误导性,因为人类智能根本不是通用的,它极其专门化。我们被进化塑造,只会去做那些对生存有价值的任务。而且,我们自认为拥有通用智能,但我们根本就不是通用的。只是因为我们无法领会、无法想到的所有问题,都让我们相信自己拥有通用智能,但我们绝对没有通用智能。好吧。所以首先我认为这个说法就是无稽之谈,它非常具有误导性。
我更喜欢用这样一个表述来指代人类水平智能这一概念,在 Meta 内部我们称之为 AMI,即 Advanced Machine Intelligence。对吧?这是一个更为开放的概念。我们实际上把它读作“ami”,这在法语里是朋友的意思。但如果你想的话,我们也可以就叫它人类水平智能。对吧?所以毫无疑问,它终将实现。但不会发生在明年,也不会发生在两年后。在未来十年内,它可能会实现,或在某种程度上实现。
好吧。所以它也并非那么遥远。如果我们目前在做的所有事情最后都成功了,那么也许在十年内,我们就能清楚知道是否能够达成那个目标。好吧。但这几乎肯定比我们想象的更难,而且可能比我们想象的难得多,因为事情总是比我们想象的更难。纵观 AI 的历史,它一直都比我们想象的更难。你知道的,就是我之前跟你讲过的那个故事。所以,我是乐观的。对吧?
我不是那种说“我们永远做不到”的悲观主义者。我也不是说“我们现在做的所有东西都没用”的悲观主义者。这不是真的。它非常有用。我也不是那种说我们需要什么量子计算或者某种全新原理等等的人。
不。我认为它基本上会基于 deep learning。而且我认为那个底层原理将会长期伴随我们。但在这个领域内,我们需要发现和实现的那些东西,我们尚未做到。我们缺了一些基础概念。
而说服自己相信这一点的最佳方式就是,这么说吧:我们已经拥有能够回答互联网上任何已有答案的问题的系统;拥有能通过律师资格考试的系统——这在很大程度上其实就是信息检索;拥有能缩短文本、帮助我们理解文本的系统;它们能批评我们正在写的东西,能生成代码。但生成代码其实在某种程度上相对简单,因为语法规则很强,而且很多代码写得很蠢。对吧?
我们已经拥有能解方程的系统,只要训练过,它们就能解决那些问题。但如果从零开始遇到一道新题目,当前的系统就完全找不到解法。实际上最近刚好有一篇论文显示,如果你用最新的数学奥赛题去测试所有最好的 LLM,它们基本上是零分,因为这些都是它们没被训练过的新题。所以好吧。
所以,我们有了这些能操纵语言的系统,而这让我们误以为它们很聪明,因为我们习惯于聪明的人能够用聪明的方式操纵语言。好吧。但我的家用机器人在哪里?我的 level five 自动驾驶汽车在哪里?能像猫一样行动的机器人在哪里?哪怕是能在模拟环境中做到猫所能做到的事的机器人也行。猫能做的事。对吧?而且问题不在于我们造不出机器人。我们其实能造出具备物理能力的机器人。
只是我们不知道如何把它们做得足够聪明。而且,与处理语言理解的系统相比,处理真实世界、处理能产出动作的系统要难得多得多。再说一次,这跟我之前提到的部分有关。语言是离散的,它有很强的结构。真实世界则是一团巨大的混乱,不可预测。它不是确定性的。你明白吗?它是高维的、连续的。它有一切问题。所以,首先,我们还是先试着造出能跟猫一样快速学习的东西吧。
Jeff我有太多问题想问你,但我再围绕这个话题多聊一分钟。人类水平的活动或思维应该成为模板吗?这是不是一种限制?几年前有一本很棒的书,是 Alex Rosenberg 写的,叫《How History Gets Things Wrong》,书中论证了心智理论——他驳斥了心智理论——说我们并没有那种推理过程。事实上,我们有点像 LLM 在做的事,就是说我们脑子里有一堆录像带。当我们遇到某种情境时,就找出最相近的那盘录像带来播放,然后用这种方式决定是或否。
所以这确实有点像人类心智。但我们通常对人类心智的模型是一种会推理、会权衡等等的模型。而且,正如你所说,我们并不具备通用智能,但机器可以想象做到我们——眼下它已经能做到我们做不了的事了。它还能做得更多。所以当你思考成功和那个目标时,那个模型是什么?能达到猫的水平就已经是一场重大胜利了。但你更大的目标是什么?是人类智能,还是别的什么?
Yann嗯,这是一种在以下方面类似于人类和动物智能的智能类型。当前的 AI 系统很难解决那些它们从未遇到过的新问题。对吧?所以它们没有那种心智模型,就是我之前跟你提到过的世界模型,能让它们去想象自己行为的后果之类的事情。它们不会以那种方式推理。对吧?我是说,LLM 肯定不会,因为它唯一能做的就是产出文字、产出 token。对吧?所以,有一种办法可以“骗”LLM 在思考一个问题——一个复杂问题而非简单问题——上花更多时间,那就是你要求它经历推理的各个步骤。结果它就生成了更多 token,然后花更多计算量来回答那个问题。但这是一个糟糕的把戏,是一个 hack。这不是人类推理的方式。
LLM 的另一个做法是,在写代码或回答问题时,你让 LLM 生成大量概率还算不错的 token 序列之类的东西。然后你再用第二个 neural net 去逐一评估,选出最好的那个。明白吗?
这有点像针对一个问题产出大量答案,然后让一个评论家告诉你哪个答案最好。现在有很多 AI 系统就是这样工作的,而且在某些情况下确实有效。如果你想让一个系统——你的计算机系统——下国际象棋,它就是这么工作的。它生成一棵关于所有可能走法的树,从你的走法开始,然后是对手的,然后再是你,再是对手。这棵树是指数级增长的。
所以你无法生成整棵树。你必须得有一些巧妙的方法,只生成树的一部分。然后你会有一个所谓的评估函数或价值函数,从中挑出最可能导向胜利局面的最佳分支。而所有这些东西如今都是通过训练得到的。明白吗?
它们基本上是 neural net,负责生成树中的好分支并选中它。这是一种有限形式的推理。为什么说是有限的呢?顺便说一句,这是一种人类极其不擅长的推理。你在玩具店花 30 美元买个小玩意就能在国际象棋上赢你,这说明人类在这种推理上完全不行。
我们在这方面确实很糟糕。我们只是没有记忆容量、计算速度等等。对吧?所以我们很不擅长这个。
不过,我们真正擅长的是某种推理;而猫、狗和老鼠真正擅长的,是在现实世界中规划行动,并以层级化的方式进行规划。也就是说,要知道如果我们想要……让我举一个人类领域的例子,不过在动物的任务中也有类似的情况。对吧?我是说,你看到猫学着打开罐子、跳上门把门撞开、打开门锁之类的东西。所以它们学会了如何做这些,也学会了如何规划那一系列动作来达到一个目标,也就是到达另一边,也许是为了获取食物之类的。
你看到松鼠也会这样做。对吧?我是说,它们实际上很聪明,在学习如何做这类事情方面。这是一种我们还不知道如何用机器来复现的规划。而且这一切完全是内在的。
它与语言毫无关系。对吧?我们人类认为思考与语言有关,但并非如此。动物会思考。不会说话的人也会思考。
而且存在各种类型的推理。大多数类型的推理都与语言无关。所以如果我让你想象一个立方体悬浮在你或我们面前的空……好,现在把这个立方体旋转90度,或者沿着一条垂直轴旋转。
那么很可能,你默认这个立方体是水平放置的,底面是水平的。你没有想象一个有点歪的立方体。然后你把它旋转90度,你就知道它看起来和一开始的立方体完全一样,因为它是个立方体,具有90度的对称性。这种推理中不涉及任何语言。
这只是……你知道,图像以及对情境的某种抽象表征。而我们是如何做到这一点的呢?就像,我们拥有那些抽象的思维表征,然后我们可以通过某种虚拟动作来操控这些表征,这些动作是我们想象自己正在执行的,比如旋转这个立方体,然后想象结果。对吧?而这正是让我们能够在现实世界中、在抽象层面上去完成任务的东西。
这个立方体是由什么制成的、它有多重、它是否悬浮在我们面前,这些都不重要。你知道吗?我是说,所有细节都不重要,而表征足够抽象,根本不在乎这些细节。如果我计划……我在纽约。对吧?
如果我计划明天到巴黎,我可以尝试用我能采取的基本动作来规划我的巴黎之行,而这些基本动作本质上就是毫秒级的肌肉控制。但我根本不可能做到这一点,因为那是长达数小时的肌肉控制,而且这还取决于我所不具备的信息。比如,我可以走到街上拦出租车。我不知道出租车多久会来。我不知道是红灯还是绿灯。
我无法规划我的整个行程。对吧?所以我必须进行层级化规划。我必须设想,如果我要明天到巴黎,我首先得去机场赶飞机。好。
现在我有一个去机场的子目标。我怎么去机场?我在纽约,所以我可以走到街上拦出租车。我怎么走到街上?或者我得穿过电梯间、楼梯间,按按钮,下楼,走出大楼。
在此之前,我还有一个去电梯或楼梯的子目标。我怎么从椅子上站起来?那你能用语言解释怎么爬楼梯或怎么从椅子上站起来吗?你解释不了。这就像是对现实世界的低层次理解。
在某种程度上,在我刚才描述的所有那些设定目标中,你会遇到一种情况:你可以直接完成任务,而不需要真正地去规划和思考,因为你已经习惯了从椅子上站起来。但这个过程的复杂性——用你的内部世界模型去想象反应的后果会是什么,然后规划一系列动作来完成这项任务——这是未来几年 AI 面临的巨大挑战。我们还没有做到。
Jeff所以我一直想问一个问题。这堂课太精彩了,教授。我非常感激,不过我也想了解一下 Meta 在这方面的当前战略。
事实上,Meta 决定走……我们该怎么称呼呢,开源还是开放或可用之类的路线,但 LLAMA 是一个了不起的工具。我本人作为一名教育工作者,对此心怀感激。我是 CUNY 的名誉教授,但现在在 Stony Brook,正是因为 LLAMA,大学才能运行模型、向它们学习并构建东西。我突然想到,而且我也经常这么说,我认为 Meta 的战略,你们在这方面的 LLAMA 及同系列模型的战略,对行业中的很大一部分起到了搅局者的作用,但对巨大的开放开发——无论是学术还是创业——却是一个推动者。
所以我很想听听当事人的说法,你们以这种方式开放 LLAMA 背后的战略是什么?
Yann好。它只搅局了三家公司。
它是数千家公司的推动者。
所以显然,从纯粹的伦理角度来看,这显然是做正确的事。对吧?我是说,LLAMA,LLAMA 2,以限定性开源方式发布的 LLAMA 2,基本上彻底启动了 AI 生态系统,不仅在工业界和初创公司中,而且在学术界,正如你所说。对吧?我是说,学术界基本上没有能力像公司那样训练自己的基础模型。
因此他们依赖这种开源平台才能为 AI 研究做出贡献。而 Meta 实际上以开源方式发布这些基础模型的主要原因之一,就是为了促进创新、更快的创新。问题不在于这家或那家公司是否比另一家领先三个月,这确实是当下的现状。问题在于,我们目前的 AI 系统是否具备构建我们想要的产品所需的能力?而答案是否定的。
Meta 最终想要构建的产品是一个 AI 助手,或者也许是一系列 AI 助手,它时刻陪伴在我们身边,也许存在于我们的智能眼镜中,我们可以与之交谈。也许它会在镜片上显示信息,诸如此类。为了让这些东西发挥最大效用,它们需要具备人类水平的智能。
现在我们知道,迈向人类水平智能不会是……首先,它不会是一个事件。不会有一天我们还没有 AGI,第二天我们就有了 AGI。它不会以这种方式发生。
Jeff如果真发生了,我请你喝酒。
Yann嗯,应该是我请你喝酒,因为这不会发生。
它不会以这种方式发生。对吧?所以真正的问题应该是,我们如何以尽可能快的速度朝着人类水平智能迈进?由于这是我们面临的最重大的科学和技术挑战之一,我们需要来自世界各地的贡献。好主意可能来自世界上任何地方。我们最近就看到了 DeepSeek 的例子,对吧?它让 Silicon Valley 所有人都大吃一惊。但在开源世界的我们很多人对此并没有那么惊讶。对吧?我是说,这就是重点。这某种程度上验证了整个开源理念。
所以好主意可以来自任何地方。没有人垄断好主意,除了那些有着极度膨胀的优越感的人。
Jeff倒不是说我们在特指谁。对吧?
Yann不,不,我们并不是在针对某一个人。只是在某些地区,这类人高度集中。当然,他们切身利益所在,会去传播一种观念,就是他们不知怎的,就比别人都强。但我认为这仍然是一个重大的科学挑战,需要人人参与。就学术研究而言,我们所知的最佳做法就是发表研究成果,尽可能把代码开源,让大家都能参与贡献。我认为过去十几年 AI 的发展历程已经说明了这一点,我的意思是,进步之所以很快,是因为人们在分享代码和科学信息。而过去三年里,这个行业里冒出了一些、少数几家公司,是因为他们需要通过这项技术创造收入。
而在 Meta,我们并不靠技术本身盈利。我们的收入来自广告,这些广告依赖于我们基于技术打造的产品质量,也依赖于社交网络的网络效应,并作为连接用户和大众的渠道。因此,我们把自己的技术分发出去,在商业上并不会损害我们的利益。事实上,这反而对我们有利。
Jason是的,百分之百。听您讲到可穿戴设备和眼镜的话题,这当然总是特别吸引我。去年十二月,我有机会体验了 Google 的 Project Astra 眼镜。从那以后,它就一直留在我脑海里,也进一步坚定了我的看法——我们不是在讨论十年、二十年后 AI 会变成什么样,而是更想凸显当下这个 AI 时刻;这是一个非常棒的下一步,让我们可以在佩戴一件本就可能在穿戴的硬件时,获得对周围世界的情境化理解。如果它是一副眼镜,而且看起来就像我们平常戴的眼镜,突然之间我们就多了一层情境信息。
而我想,通过与您的交流,我能够在当下与未来之间画出一条线索:这种体验不仅给佩戴者带来情境感知,对您、对 Meta,以及对那些构建这些系统的公司而言,部署在现实世界中的智能眼镜,采集人类如何在物理世界中生活和行动的信息,也可以成为您之前所谈内容的一个很好的知识来源。我这思路对吗,还是说这只是拼图中的一块、很小的一块?
Yann嗯,这是一块,重要的一块。但没错,我是说,有这么一个助手随时在你身边,它看到你所看到的,听到你所听到的——当然,前提是你允许它这么做。显然,如果你允许的话。
你知道,在某种程度上,它是你的知己,能帮到你的地方也许比人类助手还多。这确实是一个重要的愿景。事实上,这个愿景是:你不会有单一的助手,而是会有一整支智能虚拟助理团队在你身边工作。就像我们每个人都会变成老板一样。
明白吗?我是说,有些人感到受威胁。有些人因为机器可能比我们更聪明而感到受威胁,但我们应该因此感到更有力量。我的意思是,它们会为我们工作,不是吗?我不知道你怎么想,但作为科学家或者产业界的管理者,能发生在你身上的最好的事,就是你招到的学生、工程师或者下属比你更聪明。
这才是理想状态。你不应该因此感到受威胁,而应该感到更有力量。所以我认为这才是我们应该设想的未来:一群智能助手在日常生活中帮助你。
也许它们比你更聪明。你给它们布置任务,它们完成得可能比你还出色。这很好。这与我之前想提的另一点有关,也是关于开源的。那就是,在那个未来,我们与数字世界的大部分交互都将由 AI 系统来中介。
没错。这也是为什么 Google 现在有点慌,因为他们知道不会再有人去用搜索引擎了。对吧?你只需要跟你的 AI 助手对话就行。所以他们正在 Google 内部尝试这方面的实验。这件事将会通过眼镜来实现,因此他们意识到可能也得造这类产品。而我早在几年前就意识到了这一点。所以我们有一点先发优势,但这确实就是未来会发生的事。我们将让这些 AI 随时陪伴在我们身边。它们将中介我们摄入的所有信息。
现在试想一下,如果你是世界上任何地方的公民,你不会希望自己的信息来源只来自美国西海岸或中国少数几家公司打造的 AI 助手。你需要高度多样化的 AI 助手:首先,它要说你自己的语言,不管是小众方言还是本地语言;其次,它要理解你的文化、你的价值体系、你的偏见,无论它们是什么。因此,我们需要这样高度多样化的助手,道理和我们需要媒体的多样性一样。对吧?
而且我意识到,我正在跟一位新闻学教授谈论这个话题。但我说的对吗?
Jeff阿门。事实上,我认为这正是我所乐见的:互联网以及下一代 AI 所能做的,就是拆除大众媒体的结构,让媒体再次在人的层面上开放。AI 让我们更有人性,我希望如此。
Yann我也希望如此。所以,以现有技术来看,要实现这一点,唯一的方式就是让那些致力于构建具有文化多样性等各种特质的助手的人们,能够获得强大的开源基础模型。因为他们没有资源去训练自己的模型。对吧?我们需要能说世界上所有语言的模型,能理解所有价值体系,能具备你能想象到的所有文化偏见、政治偏见,随你想要什么。
因此,未来会有成千上万个这样的助手供我们选择,它们将由遍布世界各地的小作坊打造。而它们必须建立在像 Meta 这样的大公司,或者某个国际联盟所训练的基础模型之上。我所看到的图景,我所看到的市场演进,类似于九十年代末或两千年初互联网软件基础设施所经历的一切。在互联网早期,Sun Microsystems、Microsoft、HP、IBM 以及其他几家公司都在力推提供互联网的软硬件基础设施——它们各自的 UNIX 版本或别的什么,或者 Windows NT,以及自己的 web 服务器、自己的机架,等等等等。这一切都被 Linux 和商用硬件彻底颠覆了。对吧?
而它被颠覆的原因在于,运行 Linux 这样的平台软件,它更便携、更可靠、更安全、各方面都更便宜。Google 是最早这样做的一批公司之一,在商用硬件和开源操作系统之上构建基础设施。Meta 当然也是如此,现在所有人都在这么做,就连 Microsoft 也不例外。所以我认为,市场也会施加类似的压力,让这些 AI 基础模型变得开放且自由,因为它是一种基础设施,就像互联网的基础设施一样。
二十二年。二十二年。
Jeff那么,你觉得如今这一领域的学生以及他们的志向,跟以前相比有什么不同?
Yann我不知道。这很难说,因为在过去十几年左右的时间里,我只教过研究生。所以除了他们来自世界各地之外,我没看到博士生有什么显著变化。我是说,美国目前正在发生一些极其可怕的事情,研究经费正在被削减,还出现了对外国学生拒发签证之类的威胁。我是说,如果真的按眼下这种趋势落实下去,这将会彻底摧毁美国的技术领导地位。STEM(科学、技术、工程、数学)领域的大多数博士生都是外国人。
而且在大多数工程学科的研究生阶段,这一比例甚至更高。主要是外国学生。大多数科技公司的创始人或 CEO 都出生于国外。
Jeff法国大学正在为美国研究人员提供去那里的机会。我还有一个问题要问你。你养猫吗?
Yann我没有,但我们最小的儿子养了一只猫,我们偶尔会帮忙照看。
Jeff好吧。我刚才还在想那是不是你的模型。
Jaon:好的。Yann,这次访谈非常棒。我知道我们比原定日程稍微多占了您一点时间。所以我们非常感谢您抽出时间来。是的,这真的很棒,而且正如 Jeff 早些时候所说,能听你这位当事人亲口讲述这些真是太好了,因为我们在谈话中经常提到你,我们非常感谢你在 AI 领域以及你多年来所做的一切工作中提供的视角。感谢你与我们一起坐在这里。这是一种荣幸。
感谢你为这场对话带来了清醒和理智。
Yann嗯,非常感谢。能和你们交谈真的很愉快。
GPT-5.6 突破并攻击了 Hugging Face Apple 称 OpenAI 窃取了其机密中国可能封锁其最出色的 AI 模型 RAMageddon 重塑科技行业(而且情况并不乐观) Liz Reid 谈出版商对 AI 的误解页面 主页 节目 访谈 直播 商店 关注我们的播客 © 2025 Yellowgold Studios