Noam Brown 解读 o1 正式版与通往 AGI 之路
Ep 49: OpenAI Researcher Noam Brown Unpacks the Full Release of o1 and the Path to AGI

回到2021年,我和 Ilya 喝了杯咖啡,他当时问我对 AGI 时间线的看法。我告诉他,说实话,我觉得这还需要很长时间。我跟他说,你看,在我们找到一种非常通用的方式来扩展推理计算之前,我们不可能实现超级智能,而我认为这是一个极其困难的研究问题。所以我当时觉得至少得花十年。结果只花了两三年。我毫不怀疑还有其他未解决的研究问题,事实上我知道确实存在其他未解问题,但我不认为其中任何一个会比我们已经解决的问题更难。
Noam Brown 是 OpenAI 的研究科学家,在 o1 项目中发挥了关键作用,处于 LLM 推理的最前沿。他此前在 FAIR 的履历非常有趣,曾从事 Diplomacy 和扑克方面的研究。在本期《Unsupervised Learning》节目中,我们探讨了当今 LLM 领域最重要的问题:我们讨论了这些模型是否遇到了瓶颈、test time compute 能扩展到什么程度、Noam 如何定义 AGI,以及过去几年他在 AI 研究中改变了哪些看法。在 o1 正式发布后不久做这期节目真的很有趣,我觉得大家会非常喜欢。废话少说,有请 Noam。Noam,非常感谢你来参加播客。
当然,很高兴来到这里。我一直很期待这次对话,而且时机确实很好,正好赶上一些激动人心的 Shipmas 发布活动正在进行。
嗯,我也很期待。
我们明天会发布 o1,我猜到这期播客上线时,它应该已经对外发布了。我对此相当兴奋,我觉得社区会很喜欢它,但嗯,拭目以待吧。
我要是不先从过去一个月我觉得最核心的问题开始,那就是我的失职了。就是关于模型能力是否遇到了瓶颈。这个问题显然有不同的层面,所以也许可以先从你如何看待 pre-training scaling 还有多少潜力可挖开始。
我的看法是,而且我也公开表达过,我认为整体上还有推进空间,这也包括 pre-training。我觉得正确的思考方式是,每当你想进一步扩展这些模型时,都是有成本的。你看 GPT-2,成本大概在 5 万到 5 万美元之间,取决于你怎么衡量。再看 GPT-4,显然有很大提升,但最根本的、最重要的变化是投入的资源量。所以对于前沿模型,你的花费从几千到几万美元,再到几十万、几百万、几千万,直到今天对某些实验室来说可能已经达到几亿美元。
模型一直在变好,我认为这种情况会持续下去——如果你投入更多资金、更多资源、更多数据等等,你会得到更好的模型。问题在于,好吧,如果你想每次都 10 倍地扩大规模,那到了某个点,成本就会变得难以承受。所以下一次,如果你想让它更好,再来一个 10 倍,现在就是在谈几十亿美元了;再来一个 10 倍,就是几百亿美元。到了某个点,从经济上讲就不再值得继续推进了。所以你 presumably 不会花万亿美元去训练一个模型。
因此,这不是一堵硬墙,更像是一堵软墙——最终经济学上就是算不过账来,对吧?
而且显然,在很多方面,你们能够通过 test time compute 来推进这件事,从成本角度来看,那里还有更容易摘到的低垂果实可以推动它向前。
没错。这也是我对 test time compute 如此兴奋的原因。我想很多人对此感到兴奋,是因为我们某种程度上回到了 GPT-2 的时代。当 GPT-2 和 scaling law 被弄明白时,很明显,你只要把这个东西扩展 1000 倍,就能得到更好的模型。你现在要在 pre-training 上再扩展 1000 倍有点难了,而在 test time compute 方面,我们还处于相当早期的阶段,所以有很大的空间、很长的跑道去进一步扩展。算法改进方面也有很多低垂的果实。所以我觉得这个方向有很多令人兴奋的事情可以做。这不是说 pre-training 已经结束了,只是说 test time compute 范式还有太多空间可以推进。
而且我还想说,即使回到 pre-training,也不是说还能再推两个数量级然后就结束了。成本还会持续下降,你会想到摩尔定律。问题只是你能以多快的速度扩展。之前存在一个巨大的储备,很容易快速扩展,但现在这一点变得没那么明显了。
我意识到这可能是一个过于宽泛的问题,但 test time compute 的天花板有多高?你怎么看待它的上限?
我还是从美元价值的角度来思考。所以今天一次 ChatGPT 查询的成本大概是一美分,粗略估计。对于一次你非常关心的查询,你能承受多少成本?你愿意付多少钱?我认为有些问题是社会非常关心的,人们愿意为此花大价钱。我不是说一两美元或五美元,我说的是一百万美元,对于某些最重要的问题。那是多少个数量级?大概八个数量级吧。所以我觉得还有很大的推进空间。而且我认为算法改进的空间也很大。所以不是说我们只是往查询里砸更多钱,然后得到更好的输出。不,我们实际上可以进一步改进这个范式,让这种扩展效果好得多。
有一件事我觉得很有意思。大概一个月前吧,Sam Altman 发推说,我们基本上已经知道该怎么构建 AGI 了。我想你当时发推说,他的看法和今天 OpenAI 研究员的中位数看法一致。你能多说说这个吗?因为显然现在有那么多人在说,哦我们遇到墙了。你觉得他们错过了什么?
我觉得我们对此一直挺公开的,我们看到事情在相当快速地进展。这是我的观点,Sam 表达了他的观点。我听到有人说,哦 Sam 只是在炒作什么的,我其实有点惊讶,因为我们说的是同一件事。是的,我认为这在公司内部是一个普遍看法,即事情会快速进展。
你觉得光靠 pre-training 和 test time compute 就能让你走完全程吗?还是说显然还有算法这一桶东西需要解决?
我绝不是在说我们已经完成了,不是说我们现在已经破解了超级智能的密码,然后只需要……要是你今天上播客宣布这个就很酷了。但我认为,我在2021年底、大概是2021年末的时候,和 Ilya Sutskever 喝了杯咖啡,他当时问我对 AGI 时间线的看法。我告诉他,说实话,我觉得这会需要很长时间。我对十年内能否实现相当怀疑。我给他的主要理由是,我们没有一种通用的方式来扩展推理计算、扩展 test time compute。
我在游戏中见识过这能带来多大的差异,而它在语言模型中还没有以非常通用的方式出现,这在我看来,光靠扩展 pre-training 就想得到超级智能,是有点荒谬的。因为你看这些模型,它们确实在做一些相当聪明的事情,但在那时候,它们甚至连井字棋棋盘都画不出来。是的,到了 GPT-4,它们突然能画棋盘了,而且大多数时候能走合法的步,但有时还是会走非法的步,在井字棋中会做出次优决策。我毫不怀疑,如果我们再把 pre-training 扩展一两个数量级,它会把井字棋玩得很好。
但如果情况是我们花了数百亿美元训练一个模型,而它连井字棋都勉强能玩,那离超级智能还差得远呢。
所以我告诉他,你看,在我们找到一种非常通用的方式来扩展推理计算之前,我们不可能实现超级智能,而我认为这是一个极其困难的研究问题,大概需要至少十年才能解决。令我惊讶的是,他当时同意我的看法,他也认为仅靠扩展 pre-training 无法达到超级智能。我想我当时没意识到,但他也在非常仔细地思考这个扩展 test time compute 的方向。所以我以为至少需要十年,结果只花了两三年。我当时认为这是最难的未解研究问题。我毫不怀疑还有其他未解问题,事实上我知道确实存在其他未解的研究问题,但我不认为其中任何一个会比我们已经解决的问题更难。
是的,也因为这个原因,我认为事情会继续快速进展。
显然你对这项 test time compute 工作产生了巨大的影响。你的研究生涯一直集中在搜索、规划,以及扑克和 Diplomacy 这样的游戏上。从其他人的描述来看,你加入 OpenAI 时似乎非常明确这就是要推进的方向,而且看起来收获颇丰。我好奇的是,你加入时这种共识程度如何?也许可以聊聊如何让研究机构在这个方向上达成共识。
这挺有意思的。当我进入求职市场,在好几个地方面试时,人们总体上对这个想法相当接受。实际上,在前沿研究实验室中,几乎所有人都相信仅靠 pre-training、当前范式无法带我们实现超级智能,还需要别的东西。所以对于“也许我们需要找到如何扩展 test time compute”这个想法,很多实验室都接受。有些实验室比其他的更信服。我其实很惊讶 OpenAI 对此非常认同,因为他们正是开创大规模 pre-training 并把其扩展到前所未有规模的机构。但他们非常认同这一点,而我当时并不知道,其实在我加入之前,他们也已经思考这个问题有一段时间了。
所以我加入后,有趣的是,我觉得动机有所不同。他们心目中的动机更多是关于如何突破数据墙,不完全是“我们需要找到如何扩展 test time compute”,而是“我们如何越过数据墙”。但最终的技术路线、研究议程其实是相当兼容的。所以实际上,要让人们接受这个方向并不难。你看,当我开始推进时,它仍然是一个探索性的研究方向。有一些人在做,但绝不是公司一半的人都投入在这个大规模项目上。但我加入几个月后,我和其他人尝试了各种方法,很多都不管用,但有一个人尝试的东西出现了一些生机,然后人们觉得,哦,这挺有意思,也许我们应该再试试别的东西,然后得到越来越多的积极信号。
最终,我觉得领导层认识到,这里确实有不一样且有价值的东西,我们应该真正把它做大。我对此很支持,但其他人也是。我觉得这实际上证明了 OpenAI 及其组织能力的优秀——它能够识别出这里的巨大潜力,并愿意投入大量资源去扩展它。
我觉得人们真的低估了这一点,某种程度上 o1 出自 OpenAI 是非常令人惊讶的。它颠覆了整个范式,颠覆了 OpenAI 自己开创的范式。我认为这是一个非常好的信号,说明 OpenAI 没有陷入创新者的窘境,愿意投资一个冒险的方向,而且我觉得这次会有回报。
是啊,这真的很有意思,因为显然如果剧本只是继续扩展 pre-training、不断融资去做这件事,OpenAI 处于非常有利的位置。所以任何正交的方法都是不同的,而它能出自同一个地方真的很酷。
显然你最初的时间线是,嘿这需要十年,结果你两年就做出来了。你第一次看到什么东西让你意识到,好吧,实际上这可能比我想象的快得多?
首先,这不只是我,是我和很多人一起,在比我预测的更短时间内做到了。我第一次看到的是什么?我想当我加入时,我们有很多讨论,关于我们希望模型展现出什么样的行为。这包括:我们希望能看到它尝试不同的策略来解决问题;如果某个策略行不通,我们希望看到它放弃;我们希望看到它把一个涉及很多步骤的难题分解成更小的、可以逐个解决的部分;我们希望看到它认识到自己的错误并纠正,或者一开始就避免犯错。我们有很多关于如何实现这些单独能力的讨论。这让我有点困扰,因为我们会试图逐个解决它们,而这似乎不太对。理想情况下,我们应该得到一个能自己搞清楚所有这些的东西。然后我们得到了最初的积极信号,之后我们尝试了一些方法,其中有一个我非常支持、我主张的:我们为什么不就让它想得更久一点呢?
当我们让它想得更久时,这些行为就涌现出来了。不是说突然我们有了 o1,而是说这里有迹象表明,它正在做我们希望它做的事——我们之前还在策略性地讨论如何让它做到这些事——而它自己就想明白了。而且它自己就想明白了应该这么做。而且很明显我们可以把它扩展得更远。所以对我来说,那个大时刻就是我们让它想得更久,突然你就看到了质的变化。你看到了这种定性行为,我们原以为必须想办法加到模型里,而它自己就想出来了。当然性能也更好了,但性能提升还不算大,真正让我确信的是看到这种定性变化,看到这些行为。这让我确信,好吧,这事会很大。我觉得那大概是2023年10月。
哇,然后它很快就发布了。本来还可以更快吧。
你会怎么向今天的听众解释,在什么情况下 o1 类型模型中的规划是有帮助的,在什么情况下你应该继续使用 GPT-4o,或者说它没那么有帮助?你怎么预期这一点会变化,显然你们一直在努力改进这个?
我觉得最终会有一个单一的模型。我觉得现在处于这样一个阶段:GPT-4o 在很多方面更好,o1 在很多方面也更优。o1 肯定更聪明,所以如果你有一个非常难的问题,o1 极其适合。我和大学的研究人员聊过,我有个朋友是教授,他非常喜欢 o1,是个真正的重度用户,因为它能处理那些通常需要博士学位才能应对的困难研究问题。我觉得对于某些任务,比如创意写作,4o 可能比 o1 preview 更好,虽然我不确定 o1 和 4o 在这方面的对比如何。
但显然 4o 的一大好处是响应更快。所以如果你只是想要一个立即的回复,而且不是什么很难的推理任务,我觉得 4o 是一个合理的选择。但我得说,最终我们想达到的是一个单一的模型,你什么都能问它。如果需要深度思考,它就能做到;如果不需要,它也能立即给出相当好的回答。
多模态模型和这些模型的交集未来会是什么样子?
o1 已经可以接受图像输入了。我觉得这会非常令人兴奋,想看看人们会用它做什么。我不觉得这有什么阻碍,可以让它们像 4o 和其他模型一样多模态。
o1 的一个迷人之处在于,我感觉你之前做的很多推理工作都是建立在针对特定问题的推理之上的。据我理解,围棋用的是蒙特卡洛树搜索,可能对扑克没那么适用,而你们最了不起的成就之一是实现了推理计算的通用扩展。你能谈谈做到这一点需要什么,以及这与过去针对特定类型问题所做的工作有什么不同吗?
我觉得这需要……我不能透露具体的技术细节,但我觉得重要的是,这可能需要一种思维上的转变。当我读博以及之后,一旦我看到扩展 test time compute 在扑克中产生了多大的差异,我当时想,这很棒,但可惜它只在扑克里管用。那我们怎么把这个算法扩展到更多领域呢?所以问题就变成了,你怎么让这个技术同时适用于扑克和围棋,或者扑克和 Diplomacy?于是我们开发了在 Hanabi 中有效的技术,也开发了在 Diplomacy 中有效的技术。
我当时考虑过的一个方向是,试着让这个算法能玩尽可能多的游戏,想出一个能像扑克那样工作、但适用范围更广的算法。而我觉得 Diplomacy 工作其实让我相信,这种思维方式是错误的。你真的需要从终点出发,我们有一个极其通用的领域,语言就是一个很好的例子,它的广度如此之大。与其试图把在一个领域有效的技术扩展到越来越多的领域,最终做到所有事,我们应该反过来,从所有事出发,找到某种扩展 test time compute 的方式。
我猜一开始它的效果当然不会很好,不会像是一个非常优秀的技术,但你能让它扩展得越来越好。我觉得这种思维转变——Diplomacy 工作正是说服我进行这种思维转变的原因——因为试图把我们在扑克和围棋中开发的技术应用到 Diplomacy 上,要应用到完整、通用的 Diplomacy 游戏上,我们只做到了在一些约束条件下应用,而且存在一个天花板。实际上我们只达到了人类水平,也就是强人类水平的 Diplomacy 表现,而且很清楚,如果我们继续推那个范式,我们不可能达到超人类表现。
所以要真正攻克完整的 Diplomacy 游戏并达到超人类表现,很明显我们需要一种几乎对所有事都管用的方法。所以我想,好吧,你得直接跳到终点,尝试 tackling 所有事。
这太有意思了。你提到你期待所有东西最终收敛到一个单一模型。我猜在什么时间范围内?在中期内,你觉得会有一个模型统治一切吗?还是显然有很多公司在为不同用例构建专用模型。你觉得构建自己的模型有意义吗?有些人在构建法律模型、医疗模型之类的东西。
这是个好问题,我经常被问到。我没有一个很好的答案,但我一直在想一件事。你可以让 o1 把两个大数相乘,它确实能做,它会一步步做算术,进位什么的,然后告诉你答案。但它这样做毫无意义。最优的做法其实是调用一个计算器工具,或者写个 Python 脚本把两个数相乘,运行脚本,然后告诉你输出。所以我觉得那个计算器工具就像光谱的一个极端:非常专用、非常简单,但非常快和便宜。另一个极端是像 o1 这样的东西:非常通用、非常强大,但也相当昂贵。我觉得很可能会出现很多介于这两个极端之间的工具,而 o1 或类似 o1 的模型可以使用它们,从而为自己和用户节省大量成本。
真的很有意思,这些工具最终并不是为了增强能力,而更多是为了避免在可以更容易解决的问题上花费巨量计算成本。
也完全有可能某些工具在某些事情上比 o1 做得更好。所以我思考这个问题的方式,和我想象人类如何行动差不多。你可以让一个人做某事,但也许他用计算器会更好,或者使用某种专用机器或别的什么。
好吧,说到 o1 这边,你提到了你那位教授朋友在使用它。你在实际应用中还看到过什么其他意想不到的用例,或者个人特别喜欢的?
我是 Jacob,希望你正在享受与 Noom 的这期节目。只是想快速插播一下,在《Unsupervised Learning》中,我们每周都会与创始人和 AI 研究人员进行这样的对话。如果你喜欢这期节目,请考虑分享给朋友并订阅。废话少说,回到 Noom。
你在实际应用中还看到过什么其他意想不到的用例,或者个人特别喜欢的?
有一件事我真的很期待,就是看看 o1 如何被用于编程。我觉得 o1 preview 的编程能力给人们留下了相当深刻的印象,但它在某些方面擅长编程,在其他方面就没那么出色。所以它当时在模型中并不是严格意义上对编程最强的。我觉得 o1 会好很多,我很期待看看这会如何改变这个领域。如果这能改变这个领域的话。我只是真的很好奇,想看看我们内部使用 o1,其他人也用过,有些人玩过并给了反馈,但我觉得直到真正部署到实际环境中,我们才知道它是如何被使用的。
你怎么用它?
我用它做很多编程任务,或者如果我有……通常我的做法是,如果某件事相当简单,我就交给 4o,但如果我知道某件事真的很难,或者我需要写很多代码,我就直接交给 o1,让它自己全部搞定。而且经常地,如果我有一个难题,4o 因为某种原因搞不定,我就交给 o1,它通常能给我一个答案。
o1 还不能做核心 AI 研究。
o1 还不能做核心 AI 研究。
你提到了在通往 o1 的路上,你们看到了一些东西,一些非常有意义的里程碑,围绕推理能力。考虑到你们显然还在继续研究这类模型,展望未来,哪些里程碑对你有意义?如果你们继续扩展,看到哪些事情会是重要的?
是说具体的 benchmark,还是……
可以是具体的 benchmark,或者也可以是你如何看待下一组重要的能力,你希望某种“o2”具备什么。
我真的很期待看到这些模型变得更具 agentic。我觉得很多人也是。我认为要实现 agent,其中一个主要挑战、主要障碍是,人们谈论 agent 已经很久了,自从 ChatGPT 出来后就一直在谈。人们会来找我,问为什么你在做 agent,我的感觉是模型太脆弱了。如果你有一个长程任务,中间有很多步骤,你需要可靠性,需要连贯性,才能让模型明白它需要完成这些单独的步骤,并且实际执行它们。是的,人们尝试通过 prompt 让模型做到这一点,你某种程度上可以做到,但总是有点脆弱,而且不够通用。
o1 很酷的一点是,我认为它是一个真正的概念验证:你可以给它一个非常难的问题,它能自己想出中间步骤,它能自己想出如何处理这些中间步骤。所以它能做一些完全超出 4o 能力范围的事,而且不需要那种非常复杂的 prompt。我觉得这是一个很好的概念验证,证明它可以开始做具有 agentic 特征的事情。所以我对那个方向很兴奋。
今天显然有很多人在做 agent,我觉得他们基本上是在绕过当前模型的局限性。无论他们是把六个模型调用链在一起检查输出,还是找某个微调过的小模型来检查某事是否完全回溯到原始数据源,感觉所有这些编排和脚手架都是为了让它能工作而搭建的。你觉得这些东西会一直存在,还是最终会全部变成底层模型的一部分?
你知道,有一篇很棒的 essay 叫 The Bitter Lesson。我就知道我们这期播客绕不过 The Bitter Lesson。因为每次我在各种 AI 活动上演讲,我都会 poll 大家,问有多少人读过 The Bitter Lesson,surprisingly 很少人读过。我觉得听你播客或在 Twitter 上关注你的人,应该已经被 expose 过 The Bitter Lesson 很多次了。
好吧,对于那些没读过的人,我觉得这是一篇很棒的 essay,强烈推荐大家去读。它是 RL 领域的创始人 Richard Sutton 写的。他谈到这一点,他说基本上每次你看国际象棋的历史,例如,人们试图攻克国际象棋的方式,是把知识编码进模型,试图让它们做像人类一样的事。而最终非常有效的技术,是那些能随更多计算和数据规模化扩展的技术。我觉得现在语言模型也是如此。我们已经达到了一定的能力水平,然后你很想推动它——有些东西它们就是做不到,你希望它们能做到,于是就有很大的动力去添加一堆脚手架、各种 prompt 技巧来稍微推动一下,让它们能做到那些事。
你在这过程中编码了大量的人类知识。从长远来看,真正有效的是能随更多数据和计算规模化扩展的技术。问题在于,那些脚手架技术是否也能随更多数据和计算规模化扩展?我觉得答案是否定的。像 o1 这样的东西,是能随更多数据和计算规模化扩展的。所以我认为长远来看,我们会看到很多那些把前沿稍微往前推一点的脚手架技术,我觉得它们会消失。对于今天的构建者来说,一个有趣的问题是,你可以用脚手架解决一个眼前的问题,然后随时间演进到需要的东西。
是的,这对初创公司来说尤其棘手,因为我知道他们可能面对某项任务有很大需求,而模型刚好做不到,他们就会想,好吧,如果我大量投入脚手架和定制化,让它能做到这些事,那我就会拥有一家能做到别人做不到的事的公司。但我觉得有一点很重要,这也是我们告诉人们这些模型会进步、而且会快速进步的原因之一:那就是,你不希望自己处于这样一种境地——模型能力提升了,突然模型开箱就能做那件事了,而你浪费了六个月去搭建脚手架或某种专门的 agentic 工作流。
谈谈更广泛的 LLM 领域正在发生什么吧。除了 test time compute 之外,你还在关注哪些其他研究领域?
我对 Sora 非常兴奋,很多人也是。我觉得它非常酷。我之前其实没太紧跟视频模型的进展,所以当我看到它时,我对它的能力相当惊讶。
你显然是在学术界成长起来的。现在很多人在想,鉴于显然需要完全不同的算力水平,学术界在今天的 AI 研究中扮演什么角色。你怎么看当今学术界的角色?
这是个很难的问题。我和很多博士生聊过,他们的处境很艰难。他们想帮助推动前沿,但在一个如此依赖数据和计算的世界里,如果你没有这些资源,就很难推动前沿。我觉得一些博士生有一种诱惑,就是去做我刚才说不该做的事:添加他们的人类领域知识,加各种小技巧来稍微把前沿往前推一点。所以你拿一个前沿模型,加一些聪明的 prompt 什么的,稍微推进一步,得到一些……
在某些 eval 上比别人高 1%,问题在于,这其实并不是——我不太责怪学生,我觉得学术界在激励这种行为。能在顶会上发表论文是很有声望的事,而如果你能证明自己在某个 eval 上至少比其他人稍微好一点,论文就更容易被会议接收。所以激励机制就是这样设置的,至少在短期内鼓励了这种行为;但从长远来看,这最终不会成为最有影响力的研究。因此我的建议是:不要试图在前沿能力上与工业界的前沿研究实验室竞争。我觉得还有很多其他研究可以做,我也见过非常有影响力的研究。
比如,研究新颖的架构,或者新颖的、扩展性好的方法。如果你只要能展示 scaling trends,表明随着投入更多数据和算力,它展现出一条有前景的路径,那就是好的研究,即使它在某个 eval 上没有取得 SOTA 表现。人们会关注这一点。可能那些 casually 关注这个领域的人不会注意到,也可能不会进入新闻周期,但如果它展现出有前景的趋势,就会产生影响。我向你保证,工业界的研究实验室会看这类论文,如果他们看到某个东西展现出有前景的趋势线,他们愿意投入资源,看看它在大规模上是否真的能有回报。
哪些 eval 对你来说仍然有意义?或者当你测试一个新模型时,你会关注什么?
我觉得我会问很多 vibe 类的问题,我相信大家都有自己的 vibe 测试题。我的首选其实是井字棋。
总是游戏类的,这说得通。
是的,看到这些模型玩井字棋有多困难,还是挺让人震惊的。
我开玩笑说,这大概是因为互联网上没有足够的五岁小孩在 Reddit 上讨论井字棋策略。
我们还没有用大量的井字棋数据填满世界。
是的,我就是想看看这些模型如何处理我日常遇到的各种问题。看到从 4o 到 o1 preview 再到 o1 的进步,还是挺酷的。
是啊,你显然提到过,听起来从 2021 年开始你改变了想法,然后通过 test time compute 展示了可能性。在过去一年里,AI 研究领域还有什么你改变了想法的吗?
嗯,我不应该说我在 2021 年才改变想法。我其实早在 2017 年初得到扑克结果的时候,就已经非常认同这一点了。
啊不,抱歉,我更多是指你在 2021 年时认为扩展这些东西需要 10 年,而现在我觉得是两年。在过去一年里,有什么你彻底转变观点的事情吗?
嗯,我觉得主要改变我观点的是事情进展的速度。就像我说的,我在 AI 领域已经待了相当长的时间——以今天的标准来看。我 2012 年开始读研究生,见证了深度学习革命,也看到人们在 2015、2016、2017 年左右非常认真地讨论 AGI 和超级智能。当时我观点是,仅仅因为 AlphaGo 在围棋上超人类,并不意味着我们很快就能达到超级智能。我认为这个判断其实是对的。我觉得人们当时没有足够看到 AlphaGo 的局限性:它能下围棋,甚至能下国际象棋和将棋,但它不能玩扑克,而且实际上没人知道如何让它比这更通用。
双人 zero-sum 博弈是非常理想的情况,你可以进行无限的 self-play,不断在某个方向上 hill climbing,从而达到超人类表现,但这在现实世界中不成立。所以我当时处于比较怀疑的一端。我可能实际上比一般的 AI 研究员更乐观一些,认为我们可以朝着能改变世界的非常智能的模型前进,但相比 OpenAI 或其他一些地方的人,我算是更怀疑的。而我认为这个观点已经改变了不少。看到能够以非常通用的方式扩展 test time compute,这改变了我的想法。
我实际上变得越来越乐观。我觉得 2021 年我和 Ilya 的那次对话就是开端,他某种程度上说服了我:是的,我们还没有把整个范式搞清楚,但也许不需要 10 年那么久,也许我们能更快达到。
是的,我觉得看到它实际发生改变了我的观点,而且我认为事情会比我原先想的更快发生。
显然有很多人试图与 Nvidia 竞争。你知道,我觉得 Amazon 最近在大力投资 Trainium,还让 Anthropic 使用它。你怎么看这些其他的硬件努力?
我对看到硬件投资感到很兴奋。我觉得 o1 很酷的一点是,它确实改变了人们应该思考硬件的方式。之前人们的心态是:好吧,会有大规模的 pre-training run,但实际上 inference 成本会很便宜,而且非常具有可扩展性。我不认为情况会如此。我觉得我们会看到向 inference compute 的重大转变。如果有办法优化 inference compute,那将是一个巨大的胜利。所以我认为现在硬件方面有很多发挥创造力的机会,来适应这种新范式。
稍微聊一些 LLM 之外的问题。你知道,我觉得你在 Diplomacy 游戏上的工作非常有趣,这显然是一个涉及谈判、预测他人行为等的游戏。很难不想到这对模拟社会以测试政策,或者甚至以某种方式让 AI 成为政府一部分的影响。你对此有过怎样的思考?随着这些模型变得越来越好,你对它们在整个社会这些部分中扮演的角色有什么直觉?
嗯,我觉得这大概有两个问题,但我先回答其中一个。我对这些模型非常感兴趣的一个方向是用它们来做很多社会科学实验,还有 Neuroscience 这类东西。我觉得通过观察这些在海量人类数据上训练、能够很好模仿人类的模型,你可以学到很多关于人类的知识。当然,它们的好处是比起雇一堆人来做实验,它们更具可扩展性,也更便宜。所以我很期待看到社会科学如何利用这些模型在他们的领域做出酷炫的研究。
是啊,你能想象这会以什么方式发生吗?
嗯,通常如果你想做——我不是社会科学家,所以我没有很深入地想过这个问题。但我认为比如经济学,就有很多——你之前在 FED 工作过对吧?
我确实在 FED 工作过。我想社会科学里博弈论其实是个好例子。我本科的时候做过一些实验,他们会带几个本科生进来,付一点钱,让他们做这些小的博弈论实验,看看他们有多理性、如何对激励做出反应、他们有多在意赚钱 versus 报复那些冤枉他们的人。这些现在都可以用 AI 模型来做。虽然它是否能对应人类表现还不好说,但这是可以量化的。你可以实际看看:总的来说,这些模型是否会做人类会做的事?然后如果你有一个昂贵得多的实验,你就可以推断说:好吧,用人类被试做这不划算,但我们可以用这个 AI 模型。还有伦理问题,你知道,也许有些实验对人类做是不道德的,但可以用 AI 模型来做。所以我想一个例子是最后通牒博弈。你熟悉这个吗?
不熟悉。
好的,最后通牒博弈是这样的:有两个参与者,叫他们 A 和 B。A 有大概 1000 美元,他必须分一部分给 B,然后 B 可以决定是否接受这个分配,或者让双方都得不到任何东西。所以如果 A 有 1000 美元,分给 B 200 美元,如果 B 接受,B 得 200,A 得 800;如果 B 拒绝,两人都得零。有实验表明,如果人们得到的分成低于大概 30%,他们就会拒绝。当然这就引出了一个问题:如果金额很小,那很能理解——如果是 10 美元,只给你 3 美元,你可能会很烦那个人,为了赌气而拒绝。
但如果是 1 万美元,给你 3000 美元,那就是另一个问题了。所以当然,实际运行那个实验非常昂贵。历史上他们做法是去一个很贫困的社区,在另一个国家,给他们一笔对他们来说很大的钱,看看他们的行为会不会不同。但即便如此,你也只能做到这一步。所以有了 AI 模型,也许你现在可以真正获得一些洞见,了解人们会如何反应,而这些情况本来是因为成本过高而无法测试的。
这对 Neuroscience 和其他领域也是。我总是想,社会科学的一个抱怨是,所有这些实验都是在那些需要心理学导论课学分的大学生身上做的。所以,接触更广泛的群体——至少互联网可能是比大多数实验更广泛的群体,那些实验基本上都是在顶尖学府的 19 岁年轻人身上做的。
是啊,这点说得很好。而且我还想说,如果你在做这些实验,比如用 GPT-3……
5,就像 GPT-3 一样。