🎙️AI 访谈库
Noam Brown 等谈 o1:如何教大模型更好地推理
Noam Brown · OpenAI 推理研究员(o1 核心成员)

Noam Brown 等谈 o1:如何教大模型更好地推理

OpenAI's Noam Brown, Ilge Akkaya and Hunter Lightman on o1 and Teaching LLMs to Reason Better

2024-10-02 · Training Data (Sequoia Capital, Sonya Huang & Pat Grady) · 45m · 约 33 分钟读完 · 原文
o1 发布三周后研究团队首次集体复盘:思维链与回溯如何工作、test-time compute scaling law 的发现过程与 aha 时刻。核心概念是 Noam 提出的 generator-verifier gap——验证比生成容易的问题(STEM 类)才最受益于推理计算,这解释了 o1 为何在数理上提升最大,还透露 o1 在 IOI 拿到银牌。

思考推理的一种方式是这样的:有些问题若能花更长时间去思考,就会受益匪浅。你知道,人类思维中有一个经典的概念,即 System 1 与 System 2 的区别。System 1 是更自动化、更本能的反应,而 System 2 则是更缓慢、更具流程驱动的反应。对于某些任务,增加思考时间并不会带来额外的好处。比如,如果我问你不丹的首都是哪里,哪怕你想上两年,也不会提高你答对的概率。首都是什么?我其实也不知道。

但也有一些问题,显然受益于更长时间的思考。我常举的一个经典例子是数独 puzzle。理论上,你可以遍历大量可能的组合,去试探这个数独 puzzle 的解法到底是什么,而当你得到正确答案时,验证它是非常容易的。因此,理论上,只要你有足够长的时间去解一道 puzzle,你最终一定能解出来。

我们很高兴今天邀请到 Noam、Hunter 和 Ila 三位研究员,他们是 OpenAI 内部 Project Strawberry(即 o1)项目的研究人员。o1 是 OpenAI 首次在通用 inference time compute 领域的重大尝试。我们非常期待与团队探讨推理、Chain of Thought、inference time scaling law 等话题。Ila、Hunter、Noam,非常感谢你们加入我们,也祝贺你们将 o1 发布到外界。

我想先问一个问题:你们从一开始就坚信这会成功吗?

我认为,我们当时坚信这个方向上的某些东西是有前景的,但实际通往这里的路径从来都不清晰。你看 o1,它可不是一夜之间诞生的,实际上这背后是多年的研究积累。而且其中很多研究实际上并没有成功。但我认为,OpenAI 内部以及许多领导层都坚信,这个方向上的某些东西一定会奏效,他们愿意在最初的挫折之后继续投入。我认为这最终得到了回报。

我要说的是,我从一开始就没有像 Noam 那样坚定的信念。我盯着语言模型,试图教它们做数学和其他类型的推理已经有一段时间了。我认为研究本身有很多起伏,有时候管用,有时候不管用。当我们看到这里采用的方法开始奏效时,我觉得对很多人——包括我自己——来说,那是一个顿悟时刻。我开始读到模型的一些输出,它们正以不同的方式处理问题。我想对我来说,那一刻我的信念才真正确立。我认为 OpenAI 总体上对这些事情采取非常 empirical、data-driven 的方法。当数据开始向你说话,当数据开始变得合理,当趋势开始吻合,我们看到了值得追求的东西,我们就去追。对我来说,那就是信念真正确立的时刻。

Ila,你在 OpenAI 待了很长时间了,五年半,五年半。你怎么看?你从一开始就相信这个方向会奏效吗?

不,加入以来,我在通往 AI 的路径上误判过好几次。我最初认为机器人技术才是出路,所以一开始加入了机器人团队。具身智能、AGI,那是我们当时认为的发展方向。但后来遇到了瓶颈。我想说,在我任职期间,ChatGPT——现在回头看这很显然——是一个范式转变。我们得以向世界广泛展示了一种通用界面。我很高兴,现在我们可能有了一条新的路径去推进这种推理范式。但确实,在很长一段时间里,这对我来说都不是显而易见的。

我明白,出于非常充分的理由,你们能公开分享的技术细节有限。但你们能否从宏观角度介绍一下它的工作原理?

o1 模型系列通过 RL 训练,从而具备思考能力——你也可以称之为推理。这从根本上不同于我们过去熟悉的 LLM。正如我们最近分享的,我们看到它真正泛化到了许多不同的推理领域。因此,我们对这个新模型家族带来的范式转变感到非常兴奋。

对于那些可能不太熟悉当今语言模型领域最前沿进展的人来说,什么是推理?你会如何定义推理?以及,为什么它很重要?好问题。

我的意思是,思考推理的一种方式是:有些问题若能花更长时间去思考,就会受益匪浅。你知道,人类思维中有一个经典概念,即 System 1 与 System 2 的区别。System 1 是更自动化、更本能的反应,而 System 2 则是更缓慢、更具流程驱动的反应。对于某些任务,增加思考时间并不会带来好处。比如,如果我问你不丹的首都是哪里,哪怕你想上两年,也不会提高你答对的准确率。首都是什么?我其实也不知道。

但也有一些问题,显然受益于更长时间的思考。我常举的一个经典例子是数独 puzzle。理论上,你可以遍历大量可能的组合,去试探数独 puzzle 的解法到底是什么,而当你得到正确答案时,验证它是非常容易的。因此,理论上,只要你有足够的时间去解一道 puzzle,你最终一定能解出来。这就是我理解的推理。当然,AI 社区里很多人对推理有不同定义,我并不是说这就是权威定义,每个人都有自己的看法。但我把它看作这样一类问题:能够考虑更多选项、花更长时间去思考是有好处的。

你可以称之为“生成器-验证器鸿沟”——生成正确答案很难,但识别正确答案却容易得多。我认为所有问题都分布在从“验证相对生成非常容易”(比如数独 puzzle)到“验证和生成一样难”(比如不丹首都的名字)的光谱上。

我想问问 AlphaGo,也考虑到你在扑克和其他博弈领域做过很多出色的工作。游戏中的经验教训在多大程度上与你们在 o1 上所做的工作类似,又有哪些不同?

我认为 o1 非常酷的一点在于,它显然受益于更长时间的思考。回顾 AI 领域的许多突破,AlphaGo 是一个经典例子。不过,当时我认为有一点被低估了:这个机器人在行动前会思考很长时间。它下一步棋要花大概 30 秒。如果你让它立即行动,它其实并不会比人类顶尖棋手更强,反而会明显更弱。因此,额外的思考时间显然给它带来了巨大收益。问题在于,AlphaGo 所用的额外思考时间是靠运行 MCTS 实现的,这是一种对围棋很有效的特定推理形式,但比如在扑克这类我早期研究的领域就行不通。

所以,当时已有的许多推理方法、延长思考时间的方法,仍然局限于特定领域,尽管其背后的神经网络、AI 的 System 1 部分已经非常通用。我认为 o1 非常酷的一点是,它的通用性很强——它延长思考时间的方式实际上相当通用,可以应用于许多不同领域。我们正是通过把它交给用户,观察他们能用它做什么,才看到这一点的。

是的,语言模型一直以来让我非常着迷的一点是——这并不新鲜——正因为它们的界面是文本界面,所以可以被适配去解决各种各样不同的问题。我认为,对我们来说,现在这个时刻令人兴奋的地方在于,我们觉得有办法在这个通用界面上做某种强化学习,我们很期待看到这会走向何方。

关于这一点我有一个问题。你刚才提到——我觉得说得很好——生成和验证之间的差距,以及验证难易程度存在一个光谱。在这个光谱的不同位置上,推理方法是否同样适用,还是说不同位置需要不同的方法?

这次发布让我兴奋的一点是,o1 能交到这么多新人手中,让他们去试玩,观察它的表现,看它擅长什么问题、不擅长什么问题。我认为这非常符合 OpenAI 迭代部署策略的核心。我们将自己开发的技术、研究成果发布到世界中,这样我们就能观察——我们安全地去做,同时观察世界如何与它互动,以及有哪些我们自己也未必完全理解的东西。因此,在思考我们方法的边界时,看到 Twitter 上展示它能做什么、不能做什么,真的很有启发性。我希望这对全世界也有启发,帮助大家弄清楚这些新工具的用途。我也希望我们能够把这些信息拿回来,有效利用,以更好地理解我们的流程、研究和产品。

说到这个,你们在 Twitter 上有没有看到什么特别让你们惊讶的东西?人们发现的使用 o1 的方式中,有没有你们未曾预料到的?

有一件事让我非常兴奋。我看到很多医学博士和研究人员把模型当作头脑风暴的伙伴。他们谈到,自己在癌症研究领域已经耕耘多年,一直在把各种想法抛给模型,询问在基因发现、基因疗法等应用上可以做什么,而模型能够给出非常新颖的研究方向。显然,模型本身无法开展研究,但它可以成为人类非常好的合作者。从这个意义上说,我非常高兴看到模型能推动科学路径向前发展。这虽然不是我们团队正在做的,但我想这就是我们希望在世界其他领域看到的——那些超出我们自身领域的、能真正从这款模型中受益的方向。

对了,我记得你发推说 deep RL 已经走出了“幻灭的低谷”。你能多解释一下这是什么意思吗?

我的意思是,确实有过一段时期,我认为是从 DeepMind 的 Atari 结果开始的,那时候 deep RL 是最热门的东西。我当时在读博,记得 2015 到 2018、2019 年左右的样子,deep RL 正当红。在某种程度上,我认为——确实有很多研究产出——但有些东西被忽视了。我觉得其中一个被忽视的,就是单纯用海量数据训练的力量,比如 GPT 那种方法。这某种程度上挺令人惊讶的,因为你看 AlphaGo,它在很多方面可以说是 deep RL 的巅峰成就。

是的,其中有 RL 的步骤,但也有——首先,它还有推理的步骤;而在此之前,还有一个大量从人类数据中学习的过程,那才是真正让 AlphaGo 起飞的东西。后来出现了一种越来越强的倾向,某种观点认为这是一种“不纯”——于是很多 deep RL 研究非常专注于无人类数据、完全从零开始学习。AlphaZero 是一个伟大的、惊人的结果,最终表现也比 AlphaGo 好很多。但我认为,正是因为这种对从零学习的专注,GPT 范式一度被忽视了。

除了 OpenAI——他们看到了一些初步结果,并且有信念加倍投入。是的,确实有过一段时期 deep RL 很火,然后当 GPT-3 和其他一些大型语言模型问世,在没有 deep RL 的情况下也取得了巨大成功,于是出现了一段“幻灭期”,很多人转向别处,或者对它失去了信心。而现在我们从 o1 身上看到,deep RL 其实仍有其位置,当与其他元素结合时,它可以非常强大。

而且很多 deep RL 的成果都出现在定义明确的环境中,比如游戏。o1 是不是你们第一次看到 deep RL 被用于更通用、更开放的环境?这么理解对吗?

是的,我认为你说得很对。很多 deep RL 的亮点成果确实很酷,但适用范围非常窄。我的意思是,其实也有很多相当有用的 deep RL 成果,以及一些相当通用的 RL 成果,但没有任何一个能产生像 GPT-4 那样的影响力。所以我认为,在这个新范式下,我们未来将看到 deep RL 达到那种量级的影响力。

顺着这个思路再问一个问题。我记得 AlphaGo 在对李世石的某场比赛中走出了第 37 手,那一步让所有人都震惊了。你们有没有见过 o1 做出类似的事情——它告诉你某件事,让你大吃一惊,但你细想之后发现它其实是对的,甚至比任何顶尖人类想得都好?你们和模型相处时有过这种时刻吗?还是说你觉得要等到 o2、o3?

我想到的一个例子是,我们花了大量时间为 IOI 竞赛做准备,我们把模型送进去参赛,观察它在编程竞赛题上的反应。有一道题,它非常执着地要用一种很奇怪的方式、某种奇怪的方法去解。我不太清楚具体细节。我们那些更懂竞技编程的同事试图弄清楚它为什么要这么做。我不认为那是“神来之笔”的时刻,我觉得更像是模型不知道标准解法,所以就一头撞到底,直到找到别的路子。它最后解出来了吗?对,解出来了。它只是用了某种方法——如果你从别的角度看,那其实很容易。我希望我当时记下了具体是哪一题,但我记得那挺有意思的。

编程竞赛的结果里有很多这样的例子。我想我们把 IOI 竞赛的程序发布在某个地方了,你可以从中看到,模型的思维方式不太像人类,或者说它处理这些问题的方式与人类不同,它有稍微不同的解题方法。在正式的 IOI 竞赛中,有一道题人类表现很差,模型却拿到了一半的分数;而另一道题人类做得很好,模型却几乎无法入手。这说明它处理这些问题的方式可能与人类不太一样。

我见过模型解一些几何题,它的思维方式让我非常惊讶。比如,你让模型想象一个球体,球体上有一些点,然后问某个事件的概率。模型会说:“让我们可视化一下,把这些点放上去,如果这样想的话……” 我就想,哦,你只是在用语言描述并可视化某些东西,而这确实能帮助你建立上下文。作为人类我也会这么做,但看到 o1 也这么做,真的让我很惊讶。

真有意思,太迷人了。所以这些思维方式实际上是人类可以理解的,而且能够拓展人类思考问题的边界,而不是某种无法破译的机器语言。这真的很迷人。

是的,我认为 o1 的结果中很酷的一点是,模型产生的这些 chains of thought 是人类可解读的。因此我们可以观察它们,可以仔细探究模型是如何思考的。

那在这一过程中,有没有出现过顿悟时刻?或者有没有某个时刻,你的看法发生了改变——Hunter,你提到自己起初并不那么确信这是正确的方向——那一刻你说了“天哪,这真的会奏效”吗?

是的。我在 OpenAI 待了大概两年半,大部分时间都在努力让模型更好地解决数学问题。我们朝这个方向做了很多工作,搭建了各种定制系统。在 o1 的研发轨迹中,有一个时刻,我们用这种方法训练了模型,加上一堆修复和调整,它在数学 evals 上的得分超过了我们其他任何尝试、任何定制系统。然后我们去读它的 chains of thought,发现它们呈现出一种不同的特质。尤其可以看到,当它卡住时,它会停下来想:“等等,这不对,让我退后一步,找出正确的路径。

” 我们称之为 backtracking。很长一段时间以来,我一直期待看到模型出现回溯的实例,但我一度觉得不可能看到自回归语言模型回溯,因为它们本质上只是在不断预测下一个 token。所以,当我们看到数学测试上的这个分数,又看到包含回溯的思维轨迹时,那一刻我心想:哇,一些我原以为不可能凑在一起的东西,居然凑在一起了。我必须更新我的认知。我想就是在那一刻,我的信念大大增强了。

我的故事也差不多,而且应该差不多发生在同一时期。我加入时就带着这样的想法:ChatGPT 在回答前并不会真正思考,它非常快。而 AI 在游戏领域有一个强大的范式,即能够通过更长时间的思考获得好得多的结果。于是有一个问题一直让我很感兴趣:如何把这一点引入语言模型?说起来容易,但说要让模型思考更长时间,和真正做到这一点之间是有差距的。所以我们尝试了一些方法,其他人也尝试了不同的东西。特别是,我们很想实现这样一种能力:回溯,或者识别自己犯了错误,或者尝试不同的方法。

我们围绕如何启用这种行为讨论了很多。后来我们觉得,好吧,至少作为基线,我们应该试试让 AI 思考更长时间。然后我们看到,是的,一旦它能思考更长时间,它就几乎像涌现一样发展出了这些非常强大的能力,包含回溯、自我纠正,所有这些我们曾苦思冥想如何在模型中实现的东西。而看到它们来自如此简洁、可扩展的方法,那一刻对我来说意义重大,我当时就觉得:好吧,很显然我们可以把这推得更远,未来的方向已经看得很清楚了。

不不,我认为你们低估了他对 test time compute 的信念有多强、多有效。我记得他刚加入时,我们早期的一对一谈话总是在聊 test time compute 及其威力。而且在项目过程中有很多次,Noam 都会说:为什么不让模型思考更长时间呢?然后我们照做了,它确实变好了。他就会用那种有点好笑的眼神看着我们,好像在说:你们居然到现在才这么做。

我们在你们的 evals 中注意到,o1 在 STEM 领域明显很强,比之前的模型在这方面强得多。对于这一点,你们有没有大致的直觉,为什么会这样?

我之前提到过,有些推理任务验证答案比生成答案容易,而有些任务不属于这一类。我认为 STEM 问题往往属于我们所说的“硬推理问题”。所以我认为这是我们在 STEM 类科目上看到显著提升的一个重要原因。

说得通。另外,我们在你们发布的研究论文中看到,o1 通过了你们研究工程师的面试,通过率相当高。你们怎么看这件事?这是否意味着未来某个时候 OpenAI 会雇佣 o1 而不是人类工程师?

呃,我觉得我们还没到那个水平。虽然很难做到 100% 准确,不过也可能是面试本身需要改进,我不确定。我认为 o1 至少对我来说——我想团队里其他人也有同感——感觉上是一个比其他模型更好的编程搭档。我想它已经在我们仓库里提交了几个 PR。所以在某种程度上,它确实表现得像一名软件工程师。因为软件工程是另一个受益于更长推理时间的 STEM 领域。我不知道,我觉得目前我们看到模型输出的是一次思考几分钟的结果。而我写代码时做的那种软件工程工作,每次思考时间都超过几分钟。所以也许随着我们进一步扩展,沿着这条趋势线走下去,让 o1 思考得越来越久,它就能完成越来越多这类任务。到时候再看吧。

当你们看到我们撤下所有招聘信息的时候,就能知道我们内部已经实现了 AGI——到时候要么公司运转得极好,要么极差。

你们认为 o1 要擅长人文学科还需要什么?你们觉得,随着 inference time 的扩展,擅长推理、逻辑和 STEM 是否会自然延伸到擅长人文学科?你们认为这会如何发展?

你知道,就像我们说的,我们发布了模型,然后很好奇地想看看它擅长什么、不擅长什么,以及人们最终用它做什么。我认为,模型的原始智能与它实际在各种任务上的有用性之间显然存在差距。在某些方面它很有用,但我觉得它在很多方面还可以更有用。要实现那种更通用的实用性,我们还需要做一些迭代。

那我可以就此问问你们。我很好奇,OpenAI 内部是否有一种理念,或者你们个人观点:模型能力与实际世界工作需求之间的差距,你们希望多大程度上由模型自身填补,多大程度上由建立在你们 API 之上的生态系统去补足?你们内部有没有一套思考逻辑,来判断哪些任务应该由模型来完成,哪些应该划清边界,从而形成一个围绕我们的生态系统?

我以前一直听说 OpenAI 非常专注于 AGI,说实话,加入之前我对此还有点怀疑。但基本上在我入职第一天,公司召开全员大会,Sam 站在全公司面前,阐述了短期和长期的优先事项,那时就非常清楚了:AGI 才是真正的优先目标。所以我认为最清楚的答案是,AGI 就是目标。除了带我们走向 AGI 之外,没有哪个单一应用是优先事项。

你们对 AGI 有定义吗?每个人对 AGI 都有自己的定义。对,我就是好奇这个。我不知道我有没有一个具体的定义。我只是觉得,它关乎我们的模型和 AI 系统能够完成的经济上有价值的工作所占的比例。我认为在未来若干年里,这个比例会大幅上升。我不知道,这属于那种“你感觉到了就会知道”的事。我们会不断移动球门柱,心想“这还不算 AGI”,持续很长一段时间,直到有一天,我们就和这些 AI 同事一起工作,它们承担了我们现在做的很大一部分工作,而我们去做不同的工作,整个“工作”的生态体系都发生了改变。

你们有一位同事很好地阐述了推理在通往 AGI 之路上的重要性,大意是:任何要完成的工作都会遇到障碍,而帮你绕过这些障碍的,正是你推理穿越它们的能力。我觉得这很好地关联了推理的重要性与 AGI 的目标,以及完成经济上有价值任务的能力。这是思考推理本质及其重要性的最佳方式吗?还是说你们有其他常用的框架?

我认为这还是一个待定的问题。因为在 AI 系统和模型开发的许多阶段,我们都看到了它们不同的缺陷、不同的失败之处。我觉得我们在开发系统、评估系统、试图理解它们的能力边界的过程中,正在不断学习这些。另外我想到的一些事情,我不确定它们算不算推理,比如战略规划、头脑风暴等等。要做出一个能像优秀产品经理一样出色的模型,你需要围绕用户需求做大量头脑风暴和创意发想,这是推理吗?还是说这是一种不同的创造力,不完全是推理,需要用不同方式解决?之后,当你要把这些计划落实为行动时,你必须谋划如何推动组织把事情做成,这是推理吗?其中某些部分可能是推理,某些部分可能是别的什么。也许最终在我们看来,这些都会像是推理;也许我们会发明一个新词,还需要采取新的步骤才能到达那里。

我不知道我们还能把这推多远,但每当思考这个通用推理问题时,数学领域会给我很大帮助。我们花了很多时间去读模型在想什么——当你给它一道数学题时,它显然在做这样的事情:遇到障碍,然后回溯,发现有问题,“哦等等,也许我该试试另一种方法”。当你看到这种思考过程时,你可以想象它也许能泛化到数学之外的事物。这正是我的希望所在。

我不知道答案,但让我犹豫的是,o1 的数学已经比我强了,但它在软件工程方面还不如我。所以这里存在某种不匹配,还有工作要做。好吧,还有工作要做。如果我全部工作就是做 IMO 题和高中竞赛数学,那我早就失业了。至少目前,我还有一些事情可做。

既然你提到了 Chain of Thought,以及能够观察背后的推理过程,我有一个问题——这可能是你们不能回答的那种,但就当随便问问。首先,我要给你们点赞,你们在发布 o1 时发布的博客中解释了为什么 Chain of Thought 实际上是隐藏的,而且直言不讳地说,部分原因是出于竞争考量。我很好奇,这个决定是否有争议?或者说,这个决定有多受争议?因为我能理解两方面的做法,隐藏它是一个合乎逻辑的决定,但我也能想象另一种世界:你们决定公开它。所以我只是好奇,这个决定是否有争议。

我不认为这有争议。我的意思是,同样的道理,你并不希望 necessarily 分享一个前沿模型的模型权重,我认为分享模型背后的思考过程也存在很多风险。实际上,我觉得这是一个类似的决定。

你们能不能用大白话解释一下,什么是 chain of thought?能不能举个例子?

比如说,如果你被要求解一道积分题,我们大多数人需要一张纸和一支笔,把从复杂方程到最终答案的步骤一步步列出来:先简化,再推导,最终得到答案。答案可能是 1,但我是怎么得到它的?在数学领域,这就是 Chain of Thought。

我们来聊聊未来的道路——inference time scaling law。对我来说,这是你们发表的研究中最重要的图表,在我看来是一个里程碑式的结果,类似于预训练阶段的 scaling law。抱歉说得有点夸张,但你们同意吗?这里的 implications 相当深远,这对整个领域意味着什么?

我认为这相当深远。其实在准备发布 o1 时,我就在想,人们会意识到它的重要性吗?我们把它放进去了,但这其实是个比较 subtle 的点。实际上,我非常惊讶和钦佩,这么多人意识到了这意味着什么。很多人担心 AI 可能撞墙或陷入平台期,因为预训练成本太高,而且越来越高,还有围绕是否有足够数据训练的种种问题。我认为关于 o1——尤其是 o1 preview——的主要收获之一,不在于它今天能做什么,而在于它对未来的意义。事实上,我们拥有了另一个迄今几乎未被发掘的 scaling 维度,我认为这是件大事,也意味着天花板比很多人认识到的要高得多。

如果你让模型思考几个小时、几个月、甚至几年,会发生什么?你们觉得会怎样?

我们拥有 o1 还没几年,所以还没法让它想那么久。有没有一个后台任务正在运行,它还在思考如何解决世界和平?好吧,我在思考、思考、思考。对,阿西莫夫有一个这样的故事,叫《最后的问题》,他们问这台巨型计算机尺寸的人工智能——大概是关于如何逆转熵——它说:我需要更长时间来思考。然后故事发展下去,10 年后他们查看,它还在思考;100 年后;1000 年后;10000 年后。对,“目前信息不足,无法给出有意义的答案”之类的,它还在思考。

你们凭经验猜测一下会发生什么?或者,我觉得现在有人说这个模型大概有 120 的 IQ,非常聪明。随着 inference time compute 的扩展,这会有天花板吗?你们觉得最终能达到无限 IQ 吗?

很重要的一点是,某个测试给出 120 的 IQ,并不意味着在我们关心的所有不同领域它都具备 120 IQ 水平的推理能力。我想我们甚至提到过,在创意写作等某些方面它可能还不到 40。所以,思考如何外推这个模型是令人困惑的。我认为有一点很重要:我们谈到这些基准测试,其中一个我们在结果中重点展示的是 GPQA,这是给博士生的题目,通常博士生能答出来,而 AI 在这个基准上超过了好多博士生。但这并不意味着它在方方面面都比博士生聪明。有很多事是博士生能做的,有很多事是人类能做的,而 AI 还做不到。所以你在看这些 evals 时,必须明白它测量的是特定的东西,对人类来说通常是智力的代理指标,但 AI 参加这个测试时,含义就不同了。

也许可以这样框定这个问题的答案:我希望我们能看到,在模型已经表现出优势的领域,让它思考更长时间会继续提升它的表现。所以我印象很深的一个 Twitter 时刻是,我看到我以前学校的一位数学教授发推说,他对 o1 印象深刻,因为他给了它一道人类已经解决过但 AI 从未解出过的证明题,而 o1 接过来就跑通了。这让我觉得,我们正处于某种非常有趣的事物的边缘——它快要成为开展新颖数学研究的有用工具了。如果它能完成一些小引理、一些真正的数学研究证明,那真的会是一个突破。

所以我希望,通过让它思考更长时间,我们能在“成为优秀数学研究助手”这个特定任务上变得更好。更难外推的是,它在目前不擅长的事情上会变好吗?前进路径会是什么样?如果让它在擅长的问题上永远思考下去,“无限 IQ”会是什么样?相反,我认为你可以把自己锚定在这样一个事实上:这些是它能做好的问题,如果我们让它思考更久,它会在数学研究上很有用,在软件工程上很有用……你可以开始玩这个游戏,开始看到我希望未来会如何演变。

扩展 inference time compute 的瓶颈是什么?对于预训练来说,很明显你需要海量算力、海量数据,这需要巨额资金,很容易想象预训练扩展的瓶颈。那么,什么制约了 inference time compute 的扩展?

GPT-2 和 GPT-3 问世时,就很清楚了:只要投入更多数据和更多 GPU,它就会变得更好很多。但从 GPT-2 到 GPT-3 再到 GPT-4 仍然花了好几年。把一个听起来很简单的想法真正扩展到非常大型的系统,其中有很多工作要做。我认为这里也面临类似的挑战:好吧,这是个简单的想法,但实际把它扩展上去,有大量工作要做。所以我认为这就是挑战所在。

是的,我认为有一件事——现在可能不再让人惊讶,但过去可能会让那些更偏学术的研究人员感到惊讶——就是我们解决的问题中有多少是工程问题,而非研究问题。构建大规模系统、训练大规模系统、在全新的系统上运行从未有人发明过的算法,这种规模是前所未有的,真的非常非常困难。所以总是有大量艰苦的工程工作要做,才能让这些系统扩展。另外,你还需要知道该用什么来测试模型。我们有标准的 evals 作为基准,但也许还有一些我们目前没有在测的东西。所以我们肯定在寻找那些只要在测试时投入更多算力就能获得更好结果的场景。

我一直很难想明白的一点是,如果你给模型近乎无限的算力会发生什么。因为作为人类,即使我再怎么训练,我的大脑在某些程度上也是有极限的。而你可以在 inference time 不断叠加算力。那是否意味着,比如所有数学定理最终都能通过这种方法解决?或者说,极限在哪里?你认为无限算力——大量算力,近乎无限——会怎样?

这就回到阿西莫夫那个故事了——如果你等上 10000 年,但也许……我这么说只是为了锚定一个事实:我们目前还不完全清楚这种扩展与解决真正困难的数学定理之间的关系。也许你真的需要让它思考一千年,才能解决一些未解决的核心数学问题。是的,我认为确实如此:如果你让它思考足够长的时间,理论上你可以遍历一切——比如你把所有东西都在 Lean 里形式化,然后遍历每一个可能的 Lean 证明,最终你会偶然发现那个定理。我们已经有理论上能解决任何数学问题的算法了,你是不是想说这个?对,没错。给定无限时间,你能做很多事情。但显然,思考时间越长,收益递减也越明显。不过你说得很对。

你们觉得关于 o1 最大的误解是什么?

我觉得很大的一个误解是,当 Strawberry 这个名字泄露时,人们以为是因为网上那个流行问题——模型回答不出 strawberry 里有多少个 r。但完全不是这样。实际上,当我们看到那个问题时,非常担心是不是有人内部泄露了模型信息。据我们所知并没有。我们的项目叫 Strawberry 和网上那个关于 strawberry 的流行推理题,纯属巧合。据我所知,它之所以叫 Strawberry,唯一的原因是某时某地有人需要起一个代号,而房间里有人在吃一盒草莓。我觉得就是这么简单。这比叫 Cou 什么的更接地气吧,我觉得。

实际上,我很惊讶大家居然理解得这么好。是的。我们在发布时其实不太确定大家会怎么接受。内部曾有过激烈争论:人们会不会失望,觉得它并没有在所有事情上都更好?还是会被它疯狂的数学表现所震撼?我们真正想传达的是,重要的不是我们现在发布的这个模型,而是它指向的方向。我当时不确定大家能否理解这一点,但看起来大家确实理解了。所以我其实非常高兴看到这一点。

关于 o1,有没有什么批评是你们认为合理的?

它确实不是在所有事情上都更厉害。它是一个玩起来有点 quirky 的模型。我觉得网友们正在发现新的提示方式,让它表现更好。所以它还有很多奇怪的边角需要打磨。我不知道,我非常期待看到——有人前面暗示过,让生态系统在我们的平台上创造更智能的产品、更智能的东西。我很期待看到 o1 在这方面会怎样。我觉得我们处于非常早期的阶段。就像,不知道一年前什么时候开始,人们真正搞清楚了这些语言模型程序,配合 GPT-4 什么的,催生出了更聪明的软件工程师工具之类的东西。也许我们会看到类似的发展,人们在 o1 之上构建应用。

我们还没聊到的一件事是 o1 mini。我听到很多人对 o1 mini 感到兴奋,因为大家普遍对小模型很兴奋。如果你能在保留推理能力的同时,抽取出一些世界知识——毕竟深度神经网络在存储世界知识方面并不是最高效的机制——那最终得到的会是一个非常不错的东西。所以我很好奇,你们对 o1 mini 有什么喜爱或兴奋之处?以及它所代表的整体方向?

这对我们研究人员来说也是一个超级令人兴奋的模型。如果一个模型很快,那它就是 universally useful。所以是的,我们也喜欢它。它们服务于不同的目的。同时,我们也很高兴能有一个更便宜、更快的版本,以及一个更重型、更慢的版本。它们各有各的用途。所以是的,我们很高兴最终在那里达成了一个很好的权衡。

我很喜欢这个框架。它凸显了进步的本质:你能前进多少乘以你能迭代多少。至少对我们的研究来说,o1 mini 让我们迭代得更快。希望对于更广泛地摆弄这些模型的人来说,o1 mini 也能让他们迭代得更快。因此,它应该是一个非常有用且令人兴奋的产物,至少出于这个原因。

对于在 AI 领域创业的创始人,他们应该如何思考什么时候该用 GPT-4、什么时候该用 o1?他们是不是必须在做 STEM、编程或数学相关的事情时才用 o1?他们应该怎么看待这件事?

我也希望他们帮我们搞清楚。我们发布 o1 preview 的动机之一,就是想看看人们最终会用它做什么、怎么用。其实内部确实有过争论,说发布 o1 preview 到底值不值得。但我认为我们想发布的原因之一,就是尽早把它交到人们手中,观察哪些用例真的有用、哪些没用、人们喜欢用它做什么,以及如何改进它——针对人们觉得有用的那些方向。

关于 o1,你们觉得目前人们最低估的是什么?

这多少证明我们在命名上进步了一点——我们没有叫它 GPT-4 什么的。

o1 的 thinking mode,whatever。嗯,我之前以为它叫 Strawberry,以为它叫 QAR,所以我也不太确定。thinking mode 这名字听着有点……有点不太对劲。呃,你们对 o2、o3,或者接下来可能出现的 o3,最期待的是什么?