Brad Lightcap · OpenAI 首席运营官

OpenAI COO Brad Lightcap:GPT-5 的能力、意义与 AI 的下一步

2025-08-07 · Big Technology Podcast (Alex Kantrowitz) · 30m · 原文链接

→ 在 AI 访谈库中阅读(可切换中英、记录进度)
GPT-5 发布当天的高管解读:动态推理如何工作、scaling 与后训练的关系、幻觉改善、企业采用与定价。最值得听的是他对'GPT-5 算不算 AGI'的正面回答,以及从商业侧透露的企业落地与盈利前景判断——这是研究员访谈里听不到的视角。

GPT-5 已经发布,OpenAI 首席运营官 Brad Litecap 做客本期节目,为我们拆解这款新模型的能力、它对 AI 商业的意义,以及这项前景广阔的技术接下来将走向何方。Brad,很高兴见到你。感谢你参加《Big Technology Podcast》这期紧急加更的节目。我的荣幸。感谢邀请。好的。那么,先请你简要介绍一下 GPT-5。能否在大约 60 秒内,说说它是什么,以及相比 OpenAI 此前的模型有哪些改进?是的。GPT-5 是我们下一代旗舰模型。它做了一件非常有趣的事:将动态选择是否深入思考一个问题并进行推理、再给出答案的能力,整合到了同一个模型中。想必你还记得,以前你在 ChatGPT 里必须面对那个模型选择器——大家“最爱”的功能。你必须针对特定任务手动选择要用的模型,然后走提问、获得回答的流程。有时你选思考模型,有时不选。我认为这对用户来说是一种令人困惑的体验。GPT-5 把这一切都抽象掉了,它替你来做这个决定。而且这实际上是一个更智能的模型,所以无论你是否启用了思考模式,在所有情况下你都会得到更好的回答。此外,它在写作、编程、健康等领域都有巨大提升,准确性更高,速度也更快。总之,我们认为这是一次全方位的更好体验。对于那些一直在关注热度的人来说,我猜我们可能原以为你会首先强调这是一次智能的爆炸式增长,而不是说模型里有个开关,会在最合适的时候切换推理或非推理模式。你能解释一下这种反差吗?以及为什么你们选择先强调易用性,而非智能的提升?是的,因为智能实际上取决于模型要思考多长时间。所以,取决于你愿意为一个问题分配多少思考时间,你就会得到更好的答案。通常来说,它思考得越久,给出的答案就越好。因此,当我们在某些 benchmark 和 eval 上测试这个模型时,它的表现会远远优于我们现有的任何模型。即便你不给它任何思考时间,你得到的答案通常仍然会比使用 GPT-4.1 这样的非思考模型更好。因此,这确实是智能上的巨大提升。我认为它在几乎所有维度上都是一个更高质量的模型。但推理时间,以及能够动态地利用推理时间来思考,我们认为实际上是更重要的部分。这让用户体验好得多。接下来我要仔细分析一下你的措辞。你说它比之前的模型有巨大改进。Sam 在一场媒体电话会上说,GPT-5 相比 GPT-4o 是一个相当重大的进步。Simon Wilson 使用你们的模型有一段时间了,他说感觉上并不像比其他 LLM 有跨越式的飞跃,但它散发出一种自信,很少出错,而且经常让我感到惊艳。我这么铺垫是因为我好奇,我们是否可以这样说,或者你是否会说,这个模型是能力上的指数级提升,还是渐进式提升?要知道,很难用这种方式来衡量。我认为我们现在进入了一个必须从多个不同维度来衡量智能的阶段。这么说并不是为了回避问题,而是为了解释为什么 GPT-5 如此特别。显然,它在那些你期望它擅长的核心任务上表现更好。它在 Swebench 等测试上得分更高,在我们所有的学术 eval 中得分也更高。特别是这一次,我们确实着重让它在某些健康基准测试上取得更好成绩,因此它在医学推理和其他健康相关领域表现更佳。但现在决定一个模型好坏的因素有很多,因为根据模型的训练方式以及它如何思考问题,你有很多维度可以调整。例如,如果它更快,我们认为这实际上表明它更好了。如果它能在单位思考时间内给出更好的答案,我们认为这是一种重要的、值得衡量的改进。此外,如果它能进行结构化思考、解决问题、使用工具,所有这些都是我们实际在衡量的指标,而对用户来说有些是不可见的。你知道,如果你只是在使用 ChatGPT,你不一定能体会到后台发生的每一件事。但所有这些方面,GPT-5 都比我们之前的模型做得更好。对吗?我这么问是因为,我想很多人都曾指出从初代 GPT 到 GPT-2、GPT-2 到 GPT-3、GPT-3 到 GPT-4 的跨越。人们注意到的一点是,当时的能力是全面提升的,没有什么附加条件。也许这些附加条件事出有因,但那时候没有说“在这个地方和那个地方智能提升了”——当时的说法就是:我们训练了一个更大的模型,我非常确定就是这么回事,然后它在各方面都更好了。所以,情况变了吗?变了。是的,从技术角度来看,我认为从 GPT-2 到 GPT-3、再到 GPT-4,这些实际上只是对 scaling paradigm 的利用——也就是预训练越来越大的模型。这基本是一条单一的训练路径。结果就是你得到了一个更好的模型。这一点至今仍然成立,但我们现在有了另一种训练类别,也就是 post-training。以及能够以比过去更有趣的方式使用 test time compute,这几乎就像是训练的第二阶段。我们认为这实际上给了我们一点提升,一种 force multiplier,让我们有能力将模型推向新的智能水平,同时也能够把许多你希望一个智能模型具备的能力训练进去。例如,使用工具就是我们认为对整体智能非常重要的一点。GPT-2 和 GPT-3 在这方面做得不太好,GPT-4 能以一种更自然的方式做到。而现在 GPT-5 把这些能力内置了进来,还受益于这种多步骤、长程推理的过程。所以,是的,我们希望把这一切从用户端抽象掉。显然,我们不认为作为 ChatGPT 用户的你应该停下来去思考这些。从某种程度上说,我认为模型选择器之所以成为人们的一个痛点,正说明了人们并不一定希望每次和 AI 模型对话时都要做这些决定。他们更希望模型替他们做决定。这就是为什么我们认为 GPT-5 是一大进步。回到预训练这个话题——扩大预训练规模,带来模型性能的可预测提升。是的,现在 post-training 也登场了,而且正以非常令人印象深刻的方式让模型变得更好。但你是否认为,或者 OpenAI 是否认为,预训练现在已经出现边际收益递减了?鉴于我们现在讨论的是用不同形式来训练这些模型,完全没有。我们的 scaling laws 依然成立。从经验上看,没有任何理由认为预训练或 post-training 存在任何形式的边际收益递减。我们对这个新范式其实才刚刚开始触及皮毛。你知道,O 系列模型,也就是此前的那些推理模型,其实只是我们刚开始探索后训练阶段可能性的起点。我认为这在接下来的一两年里会是一个主导主题,也就是继续在那个维度上进行 scaling,并继续观察你能获得的收益,仅仅因为这些收益非常显著。所以现在我们在两个轴向上推动模型改进,我们认为这将加快并压缩创新的节奏。这是一个开端,我认为从此绝大多数的进步将来自 scaling 或算法。我认为会是两者的结合。两者结合总是必然的,对吧?始终是算法、scale、算力和数据。所以我们在三个方向上都发力,它们在我们如何看待未来方面都扮演着非常重要的角色。显然,难点在于让它们协同起来。要训练更大的模型,通常意味着你需要在更多数据上进行训练,显然也需要更多算力。因此这些因素之间需要微妙的平衡,因为仅仅扩大规模并不一定意味着在所有情况下都能获得同等对应的改进速度。你还必须能把其他要素也带上。所以这并不是说我们要么按这个按钮,要么按那个按钮。实际上我们会非常用心地努力把这些全部整合在一起。好的。你们并没有把它称为 AGI。而且我得说,我在这档节目上输了一个赌注,因为我听了 Sam 在 Theo Von 节目上的话。他说 GPT-5 在几乎所有方面都比我们聪明。我当时想,好吧,这听起来就像你想象中的 AGI 该有的样子。然后,GPT-5 昨天发布了,或者说就在发布的时候,Sam 说,“我有点讨厌 AGI 这个词,因为目前每个人用它指代的含义都略有不同,但这显然是一个具备通用智能的模型。” 帮我理解一下这是怎么回事。因为看起来也许他想把它称为 AGI,但你们还没有。那么为什么这不是 AGI?嗯,这确实很难定义。你知道,这里有个笑话说,你问五个人什么是 AGI,会得到七个答案。我认为我们看待它的方式是,这是一个累积的过程,对吧?它是一个系统。而且我认为你必须定义这个系统是什么,以及你期望它能做什么。至少对我来说,那是一个能够可靠地学会新事物的系统,这些新事物某种程度上是 out of distribution,凭借其推理、思考、解决问题、使用工具以及提出新想法的能力。所以,我认为我们到了一个我可以称之为 AGI 的系统了吗?没有。但我认为我们看到,我们开始看到那些痕迹,以及那个用于通用学习的整体系统的各个碎片,开始在 GPT-5 这样的模型中聚合起来,我怀疑在它的后继模型中也会如此。我不知道是否会有一个时刻,我们会说,好了,我们从非 AGI 世界跨入了 AGI 世界。即使真有这样一个时刻,我也不确定我们是否一定能在当时就意识到,因为我们在与现有模型共事中学到的一件事是,capability overhang 非常显著。我认为当 Sam 谈到这些模型的智能,以及口袋里装着一位博士时,我们还没有真正把这种潜力完全挖掘出来。你知道,从某种意义上看,我认为你可以让 AI 进展在此刻暂停 10 年,人们仍然会有大约十年的新产品要开发,仍然会有人们想出如何使用这些模型的新方式,即使是 GPT-5 级别的模型,用在有趣的产品和有趣的流程中。所以,其中一件有趣的事情是,我认为随着模型变得更聪明,它们从产品构建的角度几乎提出了更高的要求,关乎你如何将它们接入系统。我大致会把它类比为,你可以有一个非常非常聪明的实习生,说到底,他们只能为你做几件事。他们可以在会议上记笔记,可以写摘要,可以做一些基础分析,但如果你带一个博士来工作,那个人拥有巨大的能力集,可能第一天上班未必完全有效,但你的工作真的是要弄清楚如何让他们接触足够的上下文、足够的信息,给他们正确的工具,让他们之后真正发挥效用。而这个过程实际上让他们达到完全效能所需的时间,比实习生更长。我认为 AI 模型也会类似。所以,你知道,这是一个连续的过程,而且我认为它不会是线性的。但是,就我们今天所处的位置而言,我会说,我们可能还没有达到一个我会称之为 AGI 级别系统的程度。是的。这引出了一个非常有趣的问题:从这里开始,努力让模型变得更聪明真的有意义吗,还是说关键在于构建那些辅助能力?你知道,我认为 Sam 在媒体电话会上提到过这点,他说 GPT-3 是高中水平的智能,GPT-4 可能是大学生水平,GPT-5 则是专家水平。所以我想知道,对 OpenAI 来说,追求的是往其中加入更多智能,还是专注于智能以外的能力,比如你提到的一些东西,像记忆和 continual learning?我认为会是所有这些方面。当然,有一些尚未解决的问题,你这里提到了几个,我同意那些。你知道,你会期望一个真正聪明的人默认就具备的能力,我们的模型仍然难以应对。所以那里还有开放性的研究要做,我认为这样才能在我所称的智能全谱系上形成闭环。但是,你知道,正如我们早先在播客中谈到的,智能以很多不同的方式呈现。部分在于你的纯粹智商,在于你对事物运作方式的了解以及回忆信息的能力,但也在于你推理如何使用其他工具解决问题的能力。在于你反思的能力,回顾自己的 chain of thought、自己的思路,并在你觉得其实走错了路、也许没有想出正确策略来解决问题时进行纠正。所以我们看到的一个很酷的事情是,GPT-5 在这些 vectors 上,我们可以可靠地测量出它比我们之前的系统更好。对我们来说,我认为我们真正想了解的一件现实世界中的事情是,它们在实际世界中表现如何。开发者如何使用这些模型?企业如何使用这些模型来将它们应用于现有问题、现实世界的问题,并看看下一代模型是否比上一代做得更好。所以对我们来说,我认为现实世界基准相对于学术基准,正越来越成为智能的一个重要标志。那么,continual learning 在 OpenAI 内部有多大的优先级?我们有很多优先级。我认为,当然,那也是其中之一。但我们对自己的研究感觉非常好。中等偏低的优先级?很难说。OpenAI 酷的地方在于,我们某种程度上已经系统化了做研究的能力,我认为从公司早期就是如此。我在 2018 年加入 OpenAI。我们对研究采取的是一种高度探索性的方法,因此在研究方式上,我们绝非自上而下——不是只有一个想法,然后所有人都蜂拥而上,一次只做一件事。我们真正做的是让小型团队进行大量开放式探索。我们探索不同的路径,看它们是否能产生新的想法,如果可行,再把这些想法循环反馈到核心思路、主流思路中去。如果不可行,我们就会把这些团队重新组合到其他看起来有成效的想法上,然后让其他新想法从中衍生出来。所以这确实有点像在黑暗中摸索。当你发现一块草地,让你觉得“好吧,我们可能走对路了”,你就会把所有人都带到那个点,然后让大家再稍微摸索一下。我认为这必须是这样运作的。我认为事先、提前就知道这些事情是非常困难的。你可以有直觉,我们的研究人员往往比普通人有更好的直觉,但这本质上仍然是科学探索。现在我想谈谈,你们的 Plus 订阅者,或者说使用这些聊天机器人的人,在使用 ChatGPT 时是否会感受到改进。沃顿商学院教授 Ethan Malik 也在测试 GPT-5,他有一个有趣的评论。他说:“我认为这是一个巨大的进步,但并不意外。如果你一直关注着这条曲线,”他说,“这些模型这周在数学奥林匹克上拿了金牌。我已经搞不清楚什么才算重大进步了。现在所有模型都在非常快速地进步。”他的问题是,如果你有一个已经达到大学水平生物学的模型,然后它提升到了研究生水平,普通聊天机器人用户可能感受不到这种变化,尽管它变得聪明多了。所以我很好奇,你认为这种智能的提升会在普通用户的 ChatGPT 体验中如何体现?对于那些已经使用 reasoning models 有一段时间的 Plus 用户来说,又会如何?对他们来说,感觉会有所不同吗?是的。我在 X 上看到一条内容,跟你描述的类似,有人基本上说,对于那些处于 ChatGPT 用户顶层的人来说——他们可能是付费用户,每天非常活跃,使用这些系统的水平几乎达到专家级别——这感觉上会是一种改进,但可能是比较细微的改进。但对于普通用户,对于免费用户,而且我们正把 GPT-5 带给免费层,这感觉上会是巨大的提升。如果你看看免费用户使用 ChatGPT 的方式,大多数人其实没有体验过 reasoning models 的威力。他们大多在使用 GPT-4o,而且大多是以一种回合制的、非常快速的、你来我往的、几乎像搜索一样的方式在使用,而我认为这种方式并没有真正展现出模型的全部能力。所以对很多人来说,这将是他们第一次使用具有推理能力的模型。而且这不仅将是他们第一次使用具备推理能力的模型,也将是他们第一次体验到一个模型会根据问题的难度,自主决定思考多长时间以及给出多好的答案。所以我们预计,对于普通用户来说,感觉会截然不同。对于那些顶级的重度用户来说,感觉可能没有那么不同。所以我同意这一点。我认为这是自然的事情,实际上也是好事。如果你一直关注着 AI 进步的速度,并且你一直在每个节点上挖掘前沿能力,那么是的,这可能令人眼花缭乱,但这开始感觉起来更像是一个连续的过程,而不像你使用的是一两年前的最佳模型,对吧?我认为你说得太对了,普通用户把它当作一种搜索版的搜索工具,他们会说:“那我该用它来做什么呢?”他们问我的时候会说:“我该用 AI 做什么?”我就说,上传点东西,然后跟它聊你上传的内容。我有一个朋友上传了他儿子足球训练的照片,问它教练方面的建议,结果他对这东西能给出关于站位的一些真正分析感到相当震惊。我是说,我不会把它当作足球教练来用,但我认为随着普通用户开始接触这些能力,这将会相当令人震撼。是的,每个人的切入点都略有不同,而这正是它的酷之处——对每个人来说都非常个性化。你知道,我们在这次发布中非常关注健康,因为我们从人们那里听到的一个最常见的事情就是,他们使用强大 AI 的出发点之一,是在应对健康历程的时候。所以我们真的很想努力确保,如果人们要将 AI 系统用于健康相关的事情,我们能为他们提供最好的模型,这也是训练 GPT-5 的一大推动力。你提到了好几次健康。你们希望这取代全科医生吗?我的意思是,很多人在医疗方面严重服务不足,但我有点担心把一个有幻觉问题的模型交给他们,然后说这就是替代品。我不认为它会取代全科医生,但我认为它能帮助人们在就医过程中拥有更多自主权,对管理护理的过程有更多掌控。它也能让人们了解自己的病情。我们经常听到这样的故事:人们在管理一些他们并不真正理解的疾病,因为实际上没有人花时间向他们解释。这并不是因为有人做错了什么,而是因为医疗系统现有的设计就不允许有让人们理解自己所管理疾病的时间。所以,仅仅是给人们这种基础教育——比如,这就是你正在管理的疾病。这常见吗?它会以这些方式表现。你会有这些症状。这对人们管理疾病时的心理状态来说是一个巨大的释放。而且,我认为你仍然需要与全科医生合作来治疗,你知道,与专科医生合作。但有一个东西能在这个过程中引导你,我认为对很多人来说非常安慰,而且在很多情况下已经被证明是有帮助的。显然,我们希望确保模型尽可能准确。所以能够在那个特定领域推动模型能力一直是我们的一个重点。但我们认为,现在有了 GPT-5,而且显然随着未来的模型,我们看到准确率一直在上升,而幻觉率一直在下降。GPT-5 我认为取决于你如何衡量,但它比前代模型准确大约四到五倍。而且这在健康领域可能更加显著。嗯,我一时想不起来,但总之,我觉得我们拥有很大的掌控权,而且正在朝着正确的方向努力,让它们变得可靠且准确。这非常有趣。我们现在讨论的东西已经远远超出了聊天机器人的范畴。当然,它有聊天功能,但还有编程、医疗,当然还有企业应用,也就是企业如何使用这些模型。而企业在实施这项技术方面向来以缓慢著称,肯定需要层层审批和审核,很难把产品推出去。但我确实认为,当你拥有更好的模型时——这是我的信念——你就能更快、更有效地推动这一切。那么,请谈谈更好的模型 GPT5 将在企业或商业领域带来哪些可能性。是的,我同意你的判断。我认为,在很多方面,我总是说,我们还没看到 AI 在商业领域的“聊天机器人时刻”。我觉得 AI 对消费者来说是一个神奇的工具,因为所谓的“搜索空间”更窄,问题更受约束,处理的上下文显然也窄得多。你可以一步一步来,几乎没有什么外部依赖,真的只是让模型纯粹的智能充分展现。但企业是另一种难度的类别。你有复杂的业务流程,有很多多用户依赖,有大量上下文需要处理,有很多工具必须调用。这些工具必须按特定顺序、在特定护栏下使用。而且,当它们出问题时,容错空间并没有那么大。所以这回到了我们之前讨论的内容。我认为,像 GPT5 这样的模型及其在商业中的影响,体现在能力基线的提升。它们能够使用工具,以结构化方式思考来解决问题,能够递归地纠正自身错误,能够进行长上下文检索。这些细节实际上在边缘场景确实很重要,作为个人用户,你在 ChatGPT 上未必每天都能感受到,但作为开发者或企业,你会开始感受到。所以我们也有轶事层面的观察,我们与大型企业、小型初创公司以及各类公司合作,在发布前测试这些模型,特别是 GPT5。我们从 Uber、Amgen、Harvey、Cursor、Lovable、JetBrains 等公司获得了很多反馈。所有这些公司的用例都对模型可靠调用工具、处理长上下文、有效解决问题和推理的能力高度敏感。所以我认为这对整个企业界都是水涨船高,而关键真的在于与我们合作的开发者能够理解这种差异和改进,并将其落实到他们构建的应用中。有趣的是,你们已经在与许多公司合作,并且让他们提前使用 GPT5 了。那么,是否存在某种统一的感觉——以前用之前的模型做不到,但现在用 GPT5 可以了?还是说,它现在解锁的能力是分散在各处的?我想说,这基本上是全面水涨船高。所有在做基准测试的人,以及我们通常合作的所有公司,现在都已经非常习惯评估和对比他们使用的所有模型的性能,但每家公司都反馈说,在这些 eval 上性能普遍高得多,而且 consistently 更高。不过有几个领域我们看到了特别明显的跃升。首先是编程,毫无疑问。我提到了 Cursor、JetBrains、Windsurf、Cognition 等我们合作的公司,从轶事来看,他们都说 GPT5 现在感觉是最强的编程模型,无论是在交互式编程环境还是更 agent 式的编程环境中。另外,我们现在持续看到的一点是,它在非常技术性的领域中进行推理和解决问题的能力显著提升了。Harvey 就是一个很好的例子,Harvey AI 与律所合作,非常依赖其可靠、准确、一致地呈现所审视的案例、进行法律分析的能力,要提供你在做法律分析时想要的那种结构化思维水平。所以我预计这会延续下去。金融服务是一个非常有趣的领域,重度依赖数据分析、研究和规划,这些都是我们看到有改进的地方。所以随着 GPT5 不断渗透市场,我们会获得越来越多的反馈,并能在这些用例上继续改进。那定价方面呢?因为输入 token 的成本只有 GPT-4o 的一半,输出 token 成本相同。这些更低的成本会有助于解锁更多用例吗?另外,既然你们今年已经筹集了或者说宣布了 480 亿美元的资金,降低成本如何与这一事实协调?真的有可能在降低成本的同时,满足投资者在这方面的预期吗?是的。你知道,在 OpenAI 的历史上,每当我们削减成本,通常会看到相应的消费增长,而且这一增长通常会超过成本的削减。所以只要这一趋势持续,我们就会继续降低模型成本。我们知道开发者必须在延迟、模型质量与智能以及价格之间进行复杂的权衡。我认为,我们在这里基本上尝试做的是,听取市场对这三方面的反馈,然后将这些模型——这些 GPT5 模型,不只是标准版,还有 mini 模型和 nano 模型——放置在质量、成本和延迟的前沿上,优化到我们认为市场成功所需要的状态。所以我们试图找到一个非常有吸引力的价格目标,同时延迟也非常有吸引力,再加上 GPT5 自带的模型质量和智能。所以我们会继续推动这一前沿。我认为我们越推动这一前沿,通常就越能看到人们想把它用于更多场景。所以只要这个等式成立,我们就非常幸运。这也激励我们努力让它们变得更好。你们会盈利吗?我希望会。好吧,我们接受这个回答。好了,Brad,在结束之前,让我第一个问你,GPT6 什么时候发布?嗯,你不是第一个问的。我我可以告诉你,但我已经——

是的。不。Twitter 上的人对这个问题反应很快,但怎么说呢,就像我说的,我们认为 GPT5 能力非凡。我们认为未来会有更好的模型。我们知道未来会有更好的模型。目前,我们只专注于如何把它送到人们手中?如何支持那些用这款模型与我们共建的公司?而且我认为我们仍处于对它的科学探索阶段。令人兴奋的是,我们才刚刚起步,自己也正在理解所处的范式,因此我认为这是重要的第一步。你必须先了解自己身在何处,才能明白将去往何方,希望从中获得的经验能让 GP6 大幅改进。

Brad,很高兴今天能邀请到你,尤其是在 GPT-5 发布的这一天。等 GPT-6 问世时,我们还得再聊一次。非常感谢你的参与,我们期待届时再会。好了各位,GPT-5 已经发布。你可以在 chat.com 上体验,它将逐步向所有人推出。所以去试试吧,明天我们会回来深入探讨,届时 Ron Johnroy 和我将梳理本周新闻,特别是有关 GPT-5 的最新动态。感谢各位的收听,我们下期 Big Technology Podcast 再见。