Noam Shazeer 与 Jack Rae:扩展测试时计算、回应 Ilya 与 AGI
Ep 58: Google Researchers Noam Shazeer and Jack Rae on Scaling Test-time Compute, Reactions to Ilya & AGI

有没有那么一组里程碑,对你来说真正有意义?要我说,当 Gemini 3.0 能写出 Gemini 4.0 的时候。大概几天前,我还给我妈展示了这件事。妈妈们是检验某件事是否真正突破了推特圈层、走进现实世界的终极标准。妈妈的「氛围检验」可是件大事。你觉得如今 AI 领域什么被过度炒作了,什么又被低估了?我有几个想法,但觉得都太劲爆了。在我的播客里,没有「太劲爆」这一说。这永远会像打地鼠一样,去分辨什么实际上只是在插值已知想法,什么又是在创造完全新颖的想法。
关于这一点,我要请出 Noam Shazeer 和 Jack Rae,他们真的无需介绍。两人都处于 Google Gemini 大语言模型工作的最前沿,而且在过去十年里参与了一些 AI 领域最重要的发现。Noam 是 Transformer 和 mixture of experts 的共同发明人之一;Jack 则是许多 DeepMind 重大突破的核心人物。能坐下来和这两位聊聊,问他们如今 AI 领域几乎所有最热门的问题,真的是这份工作的莫大荣幸。
我们讨论了 test time compute 能带我们走多远,在哪些领域管用、哪些领域不管用;我们讨论了 test time compute 与大规模预训练范式在基础设施需求上有何不同;我们还谈到了开源模型追赶闭源同行的惊人速度,以及他们对 DeepSeek 的反应;我们讨论了他们对 Ilya 说法的接受与反应——Ilya 认为这种 test time compute 范式无法一路带我们通往 AGI——以及 Yann LeCun 的说法,即这一代模型实际上完全无法产生新颖的想法;我们讨论了当今最前沿的 AI 研究到底是什么样的,他们的日常工作如何,以及未来哪些模型里程碑对他们才真正重要;然后我们还听到了 Noam 对「性格」的思考,以及两人对 AGI 对人类角色意味着什么这一问题的回应。
我觉得大家会喜欢这期内容。能同时和 Noam 与 Jack 交谈,真的是一种享受。话不多说,下面请听他们的分享。
嗯,Noam、Jack,非常感谢你们来做客播客。
哦,谢谢。
我们现在坐的地方,就是 Transformer 被发明出来的那个办公室吗?
不,这是新大楼。我们之前在查尔斯街196号,我想。
不,大概半英里远。半英里,对吧?直线距离的话相当近了。
相当近,是啊。
好,今天我们有很多话题要聊。显然,我想先从最新的 Gemini 2.0 模型开始,还有你们在 test time compute 和 Gemini 2.0 Flash Thinking 方面做的所有工作。我想对我们的听众来说,最高层面上,你们如何刻画这些模型如今管用的领域、不太管用的领域,以及在实验过程中,什么结果最让你们惊讶?
有一个令人惊讶的地方是,当我们开始集中努力,将大量关于 test time compute 的研究融入 Gemini,并考虑将其发布时,我们一开始真的专注于推理任务,所以数学和代码是重点领域。当时并不清楚,虽然我们在那个领域冲刺,显然也希望随着时间自然扩展,但尚不清楚这会如何奏效,是否会产生某种泛化感——如果我们作为研究者只专注于这些,「思考」是否在推理任务之外也有用。我认为非常有趣的一点是,我们看到早期的一个模型,它经过训练试图匹配 Gemini Flash 的风格,也就是它经过了带「思考」的训练,然后又经过了一些训练,让它总体上成为一个风格很好、交谈起来很舒服的模型。
实际上,看到「思考」互动并改进创意任务是非常有趣的。你可以让模型就某个主题写一篇散文,它的思考内容读起来非常有趣,会经历各种不同的想法,然后会对想法进行修订,或者考虑该删减什么,这挺有意思的。而且最终的输出感觉也非常好。所以这是让我感到惊讶的一点。
你呢,有什么惊讶的发现吗?
嗯,是的。总的来说,我完全支持通用性,就是说让我们训练一个在各方面都很出色的模型。这确实很重要。你知道,我一开始对如此密集地关注数学这类事情是有些怀疑的。但拥有好的基准测试非常重要,这些测试能激励你去推理困难的任务。因为很多东西只会降低 perplexity,比如给模型增加更多参数,让它记忆更多东西。所以,拥有能更好地区分更困难问题的 eval,这是很好的。
我是说,现在哪些 eval 对你们来说还有意义?显然,我觉得你们似乎在同样的 eval 集合上 hill climb,而这些 eval 感觉与日常工作的相关性越来越低。你们测试这些模型时具体会做什么?你们怎么进行「氛围检验」?
感觉我们总是撞上一个 eval,然后想:「哦,其实我们忽略了这个 eval。」哪怕在数学领域也一样。比如我们做了不少数学 eval,但可能比如普特南竞赛,只要求答案的形式,当时仍被认为有挑战性,然后突然之间:「搞定了,完全饱和了,我们真的一点也不在乎了,而且这些题目体量很小。」我们甚至会想,当初为什么要研究它们。而且很容易忘记,就在六个月前或者几个月前,我们还觉得那些问题非常难,可能对模型来说太难了,然后它突然就轻而易举了。
所以现在,我确实觉得 DeepMind 内部以及整个 Google 一直以来都在集中努力开发有用的 eval。但也很高兴看到,这是许多不同 AI 实验室的共同责任,甚至像 Scale AI 也在真正加大力度开发 eval,比如「Humanity's Last Exam」。叫它「人类最后的考试」这个标题很危险——如果我们每六个月就觉得「其实也没那么难」,那这个标题就很危险。真的真的是最后的考试。没错,第73个最后的考试。
总的来说这非常非常有挑战性,因为 eval 会泄露。一旦人们开始讨论某个 eval,外面就会有大量关于它的文本,然后它就没用了,因为所有人都知道题目了,所有模型也都会知道这些题目,除非你非常谨慎。所以我认为,在拥有私密的 eval 方面,仍然有很多工作要做。
有没有一组对你们来说有意义的里程碑?比如,当 Gemini 3.0 能做到 X 的时候,那会是一个非常令人兴奋的里程碑,无论是一个 eval,还是你们用这些模型尝试过、但它们目前还做不到的某件事。
要我说,就是当 Gemini 3.0 能写出 Gemini 4.0 的时候。
哦,或者我应该说 Gemini X 编写 Gemini X+1。是的,我认为这些强化循环可能是最值得关注的事情。你知道,目前存在多个强化循环。我刚才提到的那个可能是最重要的——我们可以将正在构建的 AI 用作工具,来提高我们构建 AI 的效率。但除此之外,还有其他强化循环,比如数据飞轮。你知道,当人们使用这些模型并提供反馈时,它们就能在人们关心的方面变得更好。我认为这将带来巨大的加速。还有就是全球范围内的关注热潮和资金飞轮,我觉得这在过去几年似乎也明显在加速。
是的,当然。那么,回到你所说的身边仿佛有一千名 AI 工程师在协助你、让你效率更高的那个点,我们现在进展到哪一步了?你知道,你是否已经达到了相当于一个……的节点?
如今有多少全职员工在日常工作中使用这些 Gemini 模型来辅助你们的研究?我觉得 Google 的一个优势在于,我们的工作环境是一个非常结构化的 monorepo,而且我们已经有很多非常出色的工具来支持代码库的贡献,所以 AI 已经在很多角度上被引入作为我们自身开发的工具。我想 Jeff 引用过一个数据,虽然我不太确定,就是所谓的 pull request 数量——对,那种有用的、纯粹由 AI 完成的 bug 修复,或者附带代码审查的内容——这些东西每天都在被自动合并进去。
有一天我注意到这个,心想“这挺酷的”,我现在可以一键应用它已经识别出的修复方案。但这只是我们正在将 AI 引入自身编码开发的一个方面。我们对 agentic coding 感到非常兴奋,这绝对非常重要;努力让模型能够处理更开放、更困难的任务,也绝对是我们非常期待的方向。而且我觉得,在某种程度上,当我们有一种非常明确的方式来定义库、构建规则之类的东西时,整个代码库就能非常协调地融合在一起,所以 orchestrate 起来会容易得多。
我可以想象,随着技术不断进步,会有一个非常明确的时刻,突然间大量库都能在我们的代码库中非常快速地迭代。
是的,而且你们已经让 AI 工程师向你们提出实验建议了——哪些方向值得尝试。这些模型在那些容易验证的领域似乎表现得特别好,比如编程和数学,你们显然也在这些领域做了很多工作。那么,对于一些不那么容易验证的领域,你们如何看待这些模型的规模化发展和实用性?我的意思是,它们在这些方面也在进步,但确实更难。我猜在那些领域,我们需要要么找到更好的验证方法,要么建立更多的人类反馈循环。不过好的地方在于,我们看到即使是 Gemini 系列模型,也已经能够遵循更抽象的指令了。
因此,我们可以尝试对一项定性的工作提供奖励信号——如果换作人类来给出反馈,可能会涉及一整套评分标准或评分细则,甚至只是某种关于什么是好风格、什么是有趣的简单直觉。所以我认为,问题的一部分在于训练模型去接受这些非常广泛的标准,学会接收一大套标准,然后据此施加奖励信号。一旦有了奖励信号,我们就可以用 reinforcement learning 来训练。而且我觉得我们已经看到这种做法开始变得可行了,不再像一两年前那样感觉非常抽象。
我很好奇,一两年前,你们是否预料到这种方法会奏效?还是说你认为这条研究路径更多是朝向那些更容易验证的领域?我感觉你是觉得它总有一天会成功,但感觉我们需要解决一大堆复杂的问题才能到达那一步,而通常实际情况是,“哦,原来还有一条简单得多的路”。至少我是这么觉得的。是的,通常好的惊喜比坏的惊喜多。
你们已经把这些模型发布到外界了,你最喜欢看到人们用它们做什么?又希望看到更多人尝试和构建什么东西?其实就在今天,Gemini app 有一个更新,我们接入了一个更强的模型,并且它基本上整合了 Gemini app 的全套工具——所有 Gemini app 支持的应用,比如 Maps,还有搜索整合,现在也支持非常长的上下文等等。这基本上是一次功能完整的 Gemini thinking 版本在 app 里的发布。
实际上,这是一个非常令人愉悦的体验。到目前为止,我觉得即使是日常琐事,人们……其实我之前并不确定,用户是否愿意为了模型思考后再回答而多等一点延迟。但实际情况似乎是,如果人们从口袋里掏出手机输入问题,那么我们认为很长的等待时间——也许几秒钟——对于他们认为质量更高的答案来说,代价非常小。而且有时候他们还能查看并审视模型的思考过程。前几天我还给我妈妈展示了,她就像是检验某个东西是否从 Twitter 圈层破圈进入现实世界的终极测试。
对,妈妈的 vibe check 可是大事。是啊,我猜她问了很多我觉得非常典型的问题,比如“生命的意义是什么”。对对,她直接问了生命的意义,然后她真的坐下来读了很长时间,还读了思考过程,接着她沉思了一番,我觉得她似乎非常欣赏这些思考的存在,欣赏模型是如何围绕这样一个开放式问题进行思考的。所以,希望更多人用这些模型来构建哲学对话。
嗯,我觉得它们的多模态能力非常令人印象深刻,但从应用角度来看,这些能力似乎仍被严重低估,我也不太清楚为什么会这样。不过我觉得,目前某种程度上我们对 Gemini 的多模态能力还是相当低调的。我感觉这个模型在图像输入方面一直非常强大,图像输入加上 thinking,实际上可以说是非常出色。我看到很多人在做 red teaming,比如在 onx 之类的东西上,尝试用困难或有挑战性的图像、视觉推理问题来测试模型,我觉得这运行得相当好。
虽然其中有些有点像 toy examples,但将多模态与 agentic 任务结合起来也超级有趣。比如我们去年 12 月发布的 Mariner,它是一个能使用浏览器之类的 agent,内置了很多多模态功能。非常关键的是,他们让模型不仅能扫描屏幕,还能真正理解屏幕内容,并知道如何在各种不同类型的网站上操作。所以,将这种能力与 agentic、相当开放的任务配对——也许你真的需要对可能很混乱的场景有视觉理解,再结合 thinking——这是我感到非常兴奋的方向。
是的,这很有趣。我是说,从文本开始是有道理的,你知道,一图胜千言,但一张图有一百万像素,所以文本的信息密度仍然要高一千倍左右——这只是拿陈词滥调做算术而已。而且,文本的主要训练数据也要多得多,我们有大量文本样本,它们实际上代表了人类通过语言接收和产生信息的方式。但像图像生成这类任务,我们没有那么多人类生成图像的例子,所以事情会更具挑战性。不过,正如 Jack 所说,正在发生很多很棒的事情。
是的,你提到了 Mariner 这个产品。我很好奇,我记得你们两位之前都谈过,要让 agent 真正被广泛使用,需要同时解决推理的复杂性和可靠性问题。你会如何描述我们今天应用 Gemini 模型解决这些问题的进展?以及真正提升这些能力的实际路径是什么?有很多答案,其中之一就是让模型更聪明,这总是有帮助的。而且很可能,你需要非常通用的解决方案来应对这些控制问题,就像你需要通用的解决方案来应对智能问题一样,因为人们会以无数无法预见的方式使用这些东西,你无法预料。
用户在发掘用例方面比开发者更聪明。就像人们发明互联网时,没人能预见互联网会用来做什么;发明计算机时,也没人能预见计算机会用来做什么。如今 AI 正变得越来越通用,这一点更加成立。我们正在构建一个拥有数十亿种无法预料用例的产品,因此我们需要为所有情况构建通用的解决方案。
要达到那种更高水平的复杂性和可靠性,感觉还有多远?我不想给出精确的时间,比如 6 个月、18 个月还是 24 个月。但我认为,很多时候实际上并不取决于核心算法层面的 AI 开发。部分原因甚至在于工程挑战——要真正改变整个训练方式,让它在更复杂的 agentic 环境中运行,这几乎需要固定的转换时间,而且切换研究方式的成本也不低。所以我觉得 agentic 研究的前期挑战在于,它不再是非常简单的 prompt 和 response,我们现在要在环境中行动。
因此,如何定义这些环境——这个角度至少从 2014 年我加入 DeepMind 以来就一直是团队的共识。构建 AGI 的一部分在于打造一个非常出色的 agent,另一部分在于打造一个非常出色的通用环境。我觉得还没有任何人解决了完美环境的问题。有一些显而易见的选择,比如使用网页界面来自动化各种网页任务,或者拥有代码库并在其中完成很多有用的事情。但我认为,如果你能选出一个非常好的环境,我们就能在这个环境中大幅加速 agentic 研究,并构建出非常优秀的算法。
我觉得这一挑战的重要性,不亚于 attention、长上下文或 reinforcement learning 等任何单一突破。
你们觉得继续沿着 test time compute 这个方向走,天花板有多高?显然,Ilya 已经公开表态,认为需要一条全新的路径才能真正将 AI 推向下一阶段,你们同意吗?是的,我非常同意,因为 LLM 的推理实在是太便宜了。你知道,如今运算成本低至 10 的负 18 次方美元左右,所以即使在一个非常大的模型上,只要推理效率相对较高,每美元就能获得超过一百万 token。我想你可以查一下 Gemini 或其他任何人的定价,是的,每美元能获得数百万 token。
这比你所能想到的大多数其他事情都要便宜好几个数量级。比如,如果你想想一种非常便宜的消遣,比如买本平装书来读,每美元大概只能买到一万 token 左右,所以我们比读书还要便宜几个数量级,可能比雇人做任何事便宜四个数量级,比雇软件工程师便宜六到八个数量级。因此,那里有巨大的差距可以用来投入更多算力,让系统更智能。而且如果价值存在的话——我认为确实存在——比如,你愿意花每小时 5 美分雇一个差劲的工程师,还是花每小时 10 美分雇一个好工程师?
所以,如果我们能找到使用它们的方法,那里有大量尚未被利用的 FLOPs。一种直接的使用方式就是训练一个更大更好的模型,我们已经在做了,但模型训练成本往往会随着模型规模呈二次方增长。而如果你做得对,最终仍然会得到相对便宜的 inference。所以当然,现在所有人都在做的就是在 inference 时投入更多算力,通过 Chain of Thought thinking 或任何我们能想出的聪明算法。
因此,我认为我们将开始看到那里也出现一条 scaling curve,就像我们在很多地方已经看到的那样。
但这能一路把我们带到人们设想的 AGI 未来吗?还是说需要某种完全相邻的东西?它会在哪里 asymptote?我想这就是我们将会看到的地方——看究竟是人类发明了下一次突破,还是 AI 做到的。不过我已经放弃整理车库之类的事了,因为我就在等机器人。你觉得它们快来了?我猜你们昨天刚发布了一个很重磅的机器人成果。太厉害了。那它能打扫你的车库了吗?据我所知还不能。但我认为,关于 test time compute 这个范式还有多少潜力可挖、它是否能一路通向 AGI 这个问题——我不认为它能直接通向 AGI。
我们已经确立过,还有其他组件,比如在复杂环境中行动的能力,行动非常重要,对 acting agent 的研究绝对是一项需要投入的方向,还有很多其他方面。不过,我们是否看到 test time compute 在 asymptote?我脑子里一直有一个类似 Ramanujan 的例子:我不希望 test time compute 只是在任何给定问题上想得更久、最终得出答案,我们还希望它能非常深入地思考,真正创造出可能有用的知识,并将其融入自身,从而在思考过程中解决更多任务,因此大幅提升数据效率。
如果你只有一本数学教科书,却能把大部分时间花在真正思考、琢磨这些概念上,然后成为世界级数学家——这就是我觉得我们应该努力用深度思考模型去实现的事情。我们到了吗?还没有。我们有通往那里的路径吗?我觉得有很多梯度方向可以导向这样的模型。我们已经看到了,而且关于 test time compute 有一点人们不太常提起:我们已经看到,通过在解决问题时用 reinforcement learning 训练模型深入思考,数据效率有了惊人的提升。
所以即使我们只有一批 RL 数据,不再增加,仅仅是走 test time compute 这个范式,也让我们能从这些数据中学到更多,而且我觉得我们还能把这一点推得更远。因此,有很多具体的研究角度我们都很感兴趣,比如模型如何思考——不只是为了解某道题而吐出几千个 token,而是像研究人员思考一个困难且开放式的问题那样,进行更深入的思考。
我觉得你们谈到的很多内容都是这些模型越来越像研究人员在行动。你会关注哪些早期迹象?我想举一个例子,就是数学。我觉得现在数学被当作基准测试来对待,这有点奇怪,数学常常被用来当考试,甚至像数学竞赛。未来会有一个非常重要的转变,从数学基准测试转向真正生成有用的数学,开始解决我们真正关心的重要问题。我觉得有一些方式,比如我觉得 Frontier Math 那个 eval 很酷,它试图提供一种梯度,也许更难的那类题目基本上接近未发表的数学发现,较容易的类别则是比较难或比较 tricky 的题目。
我不知道那个特定的 eval 是不是最完美的方式,但拥有一套从我们现在所处的位置通向真正有用的科学贡献的 eval ramp,这是我特别兴奋的。比如引进教授和研究人员,告诉他们:认真地使用这个工具,真正加速你们领域的研究,你会怎么做?缺什么?我们需要什么才能推进?我觉得这种逐步加难的基准测试概念,听起来可能像是 AI 研究人员的老生常谈,但这基本上会成为我衡量进展的标准。
数学在这里是个很好的例子,因为这是一个你实际上不需要更多数据的领域。人们在没有外部输入的情况下发明了所有这些数学,很多时候只是在一个房间里思考。当然也有一些例子,比如 Isaac Newton 拿了一堆天文观测数据,然后居家隔离,待在自己家里,然后搞出了物理学之类的东西。所以那是有一个数据的例子,但一开始其实根本没人懂物理学,然后你创造出了物理学。而数学就更疯狂了,因为你基本上是从几乎没有数据开始,然后发明出有用的东西。
所以这可以作为一个反证,反驳那种“这只是在模仿人类”、“AI 最多能做到的就是重新学习所有人都知道的东西”的说法。这种“学习人类”的批评我感觉已经存在一段时间了,Yann LeCun 也说过很多这方面的话。你们觉得这一点现在已经被完全推翻了吗?基本上就是说,在这些 transformer 架构上,新颖的发现和思考是不可能的。嗯,确实有一类科学发现我觉得几乎没人能反驳,那就是实际上很多科学领域——如果你知道两个互不相关的信息片段,然后思考它们的交集一段时间,你就会意识到一个新属性。
比如在材料科学中,可能你会发现,如果把事物更好地关联起来,实际上就能更多了解某种新材料可能具有光伏特性,或者还可能怎样怎样。所以仅仅是这种插值就已经能完全加速科学了。我猜接下来总会是这种打地鼠式的争论:什么算是真正的插值已知想法,什么又算是创造一个完全新颖的想法。对于后者,我要说我不知道。我猜我会把这个问题抛回给 Yann LeCun,让他证明他产生过一个完全新颖的想法。我们拭目以待。我其实不太在乎争论这些东西。
我们就去构建 AI 吧,大幅提升世界的技术水平,帮助人们,这对我来说已经够好了。
即使回到数学的例子,我很想看到的是,也许数学目前的状况有点像 15 世纪的地理勘探。就是有一些已知的东西,有一些模糊的区域,我们不太清楚边界之外有什么,我们有一点猜测,然后你派一小部分人坐船出发,去推动已知和未知的边界是非常昂贵的。他们回来时会带着一些看起来很滑稽的地图。对,他们会带回一小块新探索的领土,然后告诉人们。这有点像数学界现在正在发生的事:极少数精英数学教授能够提出正确的问题,然后真正证明有用的性质,学科就这样一点一点地增长,一直以来都是这样,对吧?
如果我们能训练一个模型,让它能够实质性地提出——可以说是对“所有有用数学的空间”提出正确的问题,这个空间某种程度上是无限的,你不希望它像分形一样偏离到无趣的问题上。但如果有某种关于“所有有趣数学问题集合”的概念,如果它能不断提出新的问题,而且它非常强大,能够解决这些问题,那么在某个时刻——也许现在我们已经有相当强的数学模型了——也许有一天它会达到教授水平,也许有一天会达到 Terry Tao 的水平,然后你拥有一百万个这样的模型,那时候我想你就可以有望完成这幅地图了。
完成地图会是什么样子?这可能是对科学最伟大的贡献之一。到那时,物理学、化学,你都能对任何有用的数学有非常深刻的理解。我觉得那会是非常令人兴奋的事情。是否可能?我不确定。但我同意,关键也许在于它能否提出真正新颖的问题。在我看来,提出问题似乎是最难的部分;解决问题我非常有信心我们能做到。但数学也许是无限的。是的,它绝对是无限的,所以我们还能做得多得多。
我想我们稍微聊聊 AI 研究的文化吧。你知道,你显然是 original Transformer 论文的核心作者之一,你们两位都参与了这么多突破。人们喜欢写一些思考文章,探讨驱动这些创新的文化是什么。我很想知道,在你们做了这么多研究之后,经历了巨大的成功,也可能有比较沮丧的时期,你们认为从文化和团队结构的角度来看,真正推动事情向前发展的主要心得是什么?也许 AI 研究有点像 15 世纪的化学,更像是炼金术。
我们不知道为什么它有效,但它高度实验性。你会有些想法,但真正的证明总是要去尝试。然后你会有各种观察,提出假设来解释为什么这东西有效,关键是什么。有时候你对了,有时候你错了,通常需要更多实验才能发现。或者你也可以直接宣称它有效是因为你的魔法 XYZ,然后让你的助手去吞青蛙之类的,或者 equivalent。我发现研究人员天生就喜欢分享,对自己的工作充满热情。而且总是要尽量大方地归功于他人,因为搞清楚哪个想法引出了哪个想法、关键洞察是什么,往往非常复杂。
我觉得在某个时刻,我们可能不得不暂时放弃 credit assignment,采取一种“等 super intelligence 来理清一切”的态度——一旦我们有了 super intelligence,它会写出一篇篇精彩的文章,探讨驱动这些 transformer 变革的文化。但在 Google 和这群才华横溢的人一起工作、与每个人合作,真的超级有趣。
Transformer 的故事有一点让我印象深刻,我觉得它涉及到——听你讲故事的时候感觉你只是偶然听说有些人在做某件事,听起来就像“哇,这差点就没能发生”。我不知道,如果你那天没有走过那里,会不会感觉六个月之后 inevitably 也会有人发现它?还是说有多少随机偶然的事件,让我们走上了与“只是楼里的人们以各种方式碰撞”不同的路径?哦,有趣。是啊,否则我们可能现在还在用 LSTM 什么的。我是说,我想这有点像你问的那个问题:如果没人发明内燃机,我们现在还会在用蒸汽机吗?
我觉得总会有人想出类似 transformer 的东西。从我的视角看,在伦敦那边,感觉你们确实在围绕那个方向探索。有 Neural GPU,它也是说:关键是我们要摆脱 RNN,我们要 parallelize,但这不会只是一个 convnet,我们要有一种概念,比如深度会是序列长度的某种函数。这是 Neural GPU 里的一个想法,它没有完全成功,但摆脱 RNN 的那种关键 vibe 已经在那里了。
对对。因为那时候所有人都在做 convnets,大家都想干掉 LSTM。而且 attention 已经从翻译模型里浮现出来了。所以是的,这些东西需要汇聚到一起。
哦,我喜欢这个说法。另外在文化层面,我觉得 Google 运作方式中有一点很有趣,就是基本上有一种自下而上的算力分配,对吧?就是大家去做不同的项目,说服其他人加入并分配 compute。显然这是一种模式,还有其他地方会说“我们要 all in 在一件事上”,它们在竞争方面更加自上而下。你们如何看待这两种模式之间的权衡?是的,我是说,我们两种都经历过,或者说我个人都经历过。我猜我之前在 Google 的时候,Google Brain 主要是自下而上的,就像你说的那样;而 DeepMind 则主要是自上而下的。
对,它更自上而下一点。不同的理念,各有优缺点。我觉得自上而下有利于促进人们协作,促成更大规模的训练 run。但自下而上也很棒,也有利于协作,因为当你带新人加入项目时,并不意味着人均资源变少了,而是总资源变多了。所以那也很好。而且有很多打破抽象的想法,根本没有办法很好地归类它们。所以如果你说“这是预训练的 compute,这是后训练的 compute”,好吧,你会有一些完全不同的东西,没法 neatly 归入这些类别,然后它就会从裂缝中掉下去。
所以我们正在重新引入大量的自下而上机制,因为我觉得这超级重要。要保持 balance,是的。
我想我在 OpenAI 短暂工作过,我很喜欢他们做集中押注的方式,这显然在某些领域给他们带来了很好的回报,那很不错。我也很喜欢 DeepMind 做集中押注的方式,尤其是……对,我觉得有时候确实需要一些愿景,比如说,AlphaGo 团队刚成立时他们邀请我加入,因为他们需要一名工程师,而我是一名研究工程师,但我当时完全没 get 到,我心想为什么会有人在乎一个棋盘游戏,我不明白。所以你真的需要有远见的好研究领导者来驱动这些事情,你不能指望每个没有最佳 vantage point 的人都知道影响会来自哪里。
比如现在,thinking 作为我们研究的领域,极其重要。我们在纯粹的 bottom-up 研究上投入了相当可观且不容小觑的资源,我们什么都不规定,然后这就是一个有趣的过程,一种有趣的元研究过程:我们如何让这些人效率最大化?如何让基线轻量?如何让 signal 有意义?如何让人们尽可能快地推进?这非常重要。但同样重要的是,不能全是这样,还需要有自上而下的押注,这是我们必须交付的任务。不过这总是很让人谦卑,我觉得我们对正在发生的一切有很好的全局视野,我们能感觉到哪些领域会非常重要,但通常 bottom-up 研究会给你当头一棒——某个你根本没想过的东西最终比你想的影响大得多。
所以始终保持 bottom-up 的运行是超级有影响力的。
回顾过去十年,有没有一些拐点或决策点,那些可能是艰难的 51/49 抉择,最终却产生了巨大影响?我觉得对我们俩来说,投入大语言模型是一件好事。对,我想说那大概是一个正确的决定。现在看起来似乎显而易见,但至少在当时,我觉得它处于大多数人不觉得明显,但一小部分合作者觉得明显一定会成大事的状态,而且有一段时间必须逆流而行。没错,确实有一段时间人们对语言模型并不兴奋,现在感觉都快记不起来了。对我来说,它一直像是地球上最棒的问题,但你知道,那时候搞深度学习的人可能觉得机器翻译更酷一点,或者计算机视觉。
对,视觉曾经兴奋过一段时间。我不知道为什么所有人都搞视觉。我猜是因为 ImageNet 那件事,有一张猫的照片什么的。哦,那确实很棒。那只猫。你做过那个猫的项目吗?没有没有,我其实从来没怎么做过视觉。然后现在你又绕回来了,现在你们在做 Gemini 2。