Josh:在这个领域,我看到人们反复学到的一个教训是,我们总觉得自己写代码能比模型做得更聪明,但随着领域的发展,模型往往会想出比人类更好的解决方案。
Josh:机器学习大概最重要的一课就是,你会得到你所优化的东西。所以,如果你能把系统搭建好,让你可以直接针对你想要的结果进行优化,那么效果会比试图把没有经过端到端优化的模型拼凑起来要好得多——那种拼凑出来的模型并不是为你想让它完成的任务而优化的。
Josh:所以我长期的判断是,我认为在模型之上进行 reinforcement learning 调优,很可能会成为构建最强大 agent 的关键环节。
Host:很高兴欢迎 Isa Fulford 和 Josh Tobin,他们负责 OpenAI 的 Deep Research 产品。Deep Research 三周前发布,迅速成为热门产品,许多科技名人和 the cisin 都在使用它,用途涵盖行业分析、医学研究到生日派对策划。Deep Research 是使用端到端 reinforcement learning 在困难的浏览和推理任务上训练出来的,是 OpenAI 发布的一系列 agent 产品中的第二款,第一款是 Operator。我们与 Isa 和 Josh 聊了聊 Deep Research 的用例、技术底层原理,以及未来 OpenAI agent 产品发布的预期。Isa 和 Josh,欢迎来我们的节目。
Isa:谢谢。
Josh:非常感谢邀请我们。
Isa:很高兴来这里。
Josh:谢谢邀请我们。
Host:那么也许我们先从 Deep Research 是什么开始吧。跟我们讲讲它的起源故事,以及这个产品在做的事情。
Isa:Deep Research 是一个能够搜索许多在线网站的 agent,它可以生成非常全面的报告。它能完成那些人类需要花费数小时才能做完的任务,而且它集成在 ChatGPT 里,只需要 5 到 30 分钟就能回答你。因此,它能进行更深入的研究,比普通 ChatGPT 的回答提供更详细的答案和具体的来源。这是我们最早发布的几个 agent 之一,我们最近也发布了 Operator,所以 Deep Research 是第二个 agent,未来我们还会发布更多。
Host:Deep Research 背后的起源故事是什么?你们是什么时候决定做这件事的,灵感来自哪里,有多少人参与,把它实现出来需要付出什么?
Josh:好问题,这在我加入之前就开始了。我认为大概一年前,我们在内部看到这种新的推理范式取得了很大成功,训练模型在回答前先思考,当时我们主要关注数学和科学领域。但我觉得这种新的推理模型范式解锁的另一种能力,是完成更长程的任务,这需要类似 agentic 的能力。我们想到,很多人做的任务需要大量的在线研究或外部背景信息,这涉及大量推理、辨别信息来源,而且做这些事情需要相当的创造力。我认为我们终于有了模型,或者说有了训练模型的方法,让我们能够应对其中一些任务。所以我们决定尝试开始训练模型去做浏览任务,使用我们训练推理模型时相同的方法,但应用在更真实的任务上。
Host:这是你的想法吗,Josh?你一开始是怎么参与进来的?
Isa:是我和 Yos Ptil,他在 OpenAI 也在做一个类似的项目,会在某个时间点发布,我们对此非常兴奋。我们搭建了一个早期版本,还有 Thomas Dimson,他是那种非常出色的工程师,会一头扎进任何事情里,把很多东西都推进起来,所以非常有趣。
Josh:是的,我加入得比较晚。我大约六个月前重新加入 OpenAI,之前我在做自己的创业公司。我很早就在 OpenAI 工作过,重新加入后我在看各个项目,对我们的一些 HMT 工作非常感兴趣,包括这个项目,就是通过这个参与进来的。
Host:太棒了。跟我们讲讲你们为谁构建了这个产品。
Josh:它其实是为了所有把知识工作作为日常工作一部分,或者作为生活一部分的人而建的。我们看到很多使用量来自人们把它用于工作,比如工作中的研究、了解市场、公司、房地产,还有很多科学研究、医学研究,我们也看到很多医学方面的例子。另外,我们非常兴奋的一点是,这种“我需要花很多小时去做某件事,要做一堆网页搜索、收集一堆信息”的工作风格,不只是工作场景需要,对购物和旅行也很有用。所以我们很期待 Plus 版本的发布,这样更多人就能尝试 Deep Research,也许我们还会看到一些新的用例。
Host:这绝对是我过去几周使用最多的产品之一。用于工作真的很棒,当然 also for fun。你们都用它来做什么?
Isa:对我来说,天哪,我当时考虑买一辆新车,想弄清楚这款车的下一代型号什么时候发布。网上有很多猜测性的博客文章,还有一些厂商的规律可循。于是我就问 Deep Research,你能不能把所有关于这款车的八卦,以及他们之前做过什么的所有事实都整理一下。它生成了一份很棒的报告,告诉我不如等几个月,今年,也就是未来几个月内应该就会发布。
Josh:是的,它一个很酷的地方在于,它不只是泛泛地收集某个主题的所有信息,还很擅长在网上找到非常冷门、奇怪的事实。如果你有非常具体想知道的事情,可能不会在搜索结果第一页出现,它也很擅长做这类事情,所以很棒。
Host:你们看到过哪些令人意外的用例?
Isa:我觉得最让我惊讶的是,很多人用它来编程。这真不是我考虑过的用例,但我在 Twitter 和我们收到反馈的各种地方看到,很多人用它来编程、搜索代码,还有查找某个包的最新文档,帮助他们写脚本之类的。所以,说实话,我很不好意思我们没把这个当成一个用例,因为对 ChatGPT 用户来说这似乎太明显了。不过它做得好到令人印象深刻。
Host:你认为商业用例和个人用例之间的平衡会如何随时间演变?你提到了正在进行的 Plus 发布,你觉得一年后或两年后,这主要会是一个商业工具还是消费者工具?
Josh:我希望两者都是。我认为这是一种相当通用的能力,而且我们在工作和个人生活中都会用到,所以我对两者都很兴奋。我认为它的魔力在于能为人们节省大量时间。如果有些事情原本可能需要花你几个小时,甚至我们听说有些情况下要花几天,人们现在只需要把它输进去,就能得到他们自己去做的话大约 90% 的成果。所以我倾向于认为,这类任务在商务场景中比在个人场景中更多,但它肯定会成为人们生活中的一部分,两者皆是。
Host:是的,它已经成为我使用 ChatGPT 的主要方式了,我总是选 Deep Research 而不是普通模式。那么从消费者用例的角度来说,你们觉得怎么样,对什么感到兴奋?
Isa:我觉得有很多购物、旅行推荐的场景。我个人就大量使用这个模型,几个月来一直用它做这些事。Deep Research 发布的时候我们正在日本,它在找有特定要求的餐厅方面非常有帮助,还能找到一些我不一定能发现的东西。
Josh:是的,我发现当你要买比较贵的东西,或者策划一次特别的旅行,那种你愿意花很多时间去思考的事情,对我来说,我可能会花好几个小时去读网上关于这个产品的所有信息,翻遍所有评论和论坛之类的。而 Deep Research 能很快把类似的东西整合出来,所以在这类事情上真的很有用。
Isa:这个模型也非常擅长遵循指令。如果你的查询有很多不同部分或不同问题,比如你不只想要某个产品的信息,还想和其他所有产品做对比,还想了解 Reddit 上的评论之类的,你可以提很多不同的要求,它都会帮你完成。
Josh:对了,还有一个技巧,就是让它用表格的形式输出。它通常本来就会这么做,但如果你主动要求,会很有帮助,可以有一个带很多引用和信息的表格,涵盖你想研究的各个类别。
Isa:还有一些功能,希望未来能加入产品。底层模型能够嵌入图片,所以它可以找到产品的图片。还有,虽然不是消费者用例,但它还能生成图表并嵌入到回答里。希望这些功能很快也能在 ChatGPT 上线。
Josh:很极客的消费者用例。
Isa:是的。
Josh:说到极客消费者用例,个性化的教育也是一个非常有趣的用例。如果有个话题你一直想学,比如需要复习生物,或者想了解某个国际事件,它很擅长——你输入所有你觉得不懂的信息,你想深入研究的方面,它就会为你整理出一份不错的报告。
Isa:我有个朋友在考虑创办一家 CPG 公司,他一直用 Deep Research 来找类似产品,看看某个名字对应的域名是不是已经被占了,还有市场规模测算等等各种事情。这挺有意思的,他会把报告分享给我看。另一个有趣的用例是,它很擅长在网上找到某个单一的冷门事实。比如有个冷门的电视节目,你想找到某一集,它会深入搜索,在网上找到唯一的那条引用。
Josh:对了,我兄弟朋友的爸爸有一个非常具体的问题,是关于某位奥地利将军在某场战役中某人去世时是否在任,非常小众的问题。据说 ChatGPT 之前答错了,他很确定是错的,于是去公共图书馆查了记录,发现确实是错的。然后 Deep Research 答对了,我们发给他,他很兴奋。
Host:能否给一个粗略的心智模型,说说 Deep Research 今天最擅长什么?人们应该在什么时候用 O 系列模型,什么时候用 Deep Research?
Isa:Deep Research 真正擅长的是,如果你有一个相当详细的需求描述,而要得到最好的答案需要阅读大量互联网内容。如果你有一个比较模糊的问题,它也会帮你厘清你想要什么,但它最出色的时候,是你有明确的一整套信息要找。我认为它非常擅长整合它遇到的信息,非常擅长找到具体的、难以发现的信息。它也许能从遇到的内容中做出一些新洞察,但还不至于做出新的科学发现。然后我觉得,如果用 O 系列模型,通常是在问编程相关的事情,因为编程通常不需要超出模型预训练知识之外的信息,所以你会用 o1 Pro 或 o1 来编程,或者 o3 mini high。而 Deep Research……
Host:……是 OpenAI 新产品方向的一个很好的例子。我很好奇,在能分享的范围内,它的工作原理是什么?
Isa:驱动 Deep Research 的模型是 o3 的微调版本,o3 是我们最先进的推理模型。我们专门在一些困难的浏览任务上训练它,这些任务是我们自己收集的,还有其他推理任务。它还能使用浏览工具和 Python 工具。通过在那些任务上进行端到端训练,它学会了解决这些任务的策略。最终得到的模型擅长在线搜索和分析。
Josh:是的,直观上你可以这样理解:你提出请求,最好是详细的请求,说明你想要什么;模型会深入思考,搜索信息,提取并阅读这些信息,理解它们与你的请求之间的关联,然后决定下一步搜索什么,以更接近你想要的最终答案。它经过训练,能够把所有这些信息整合成一份整洁漂亮的报告,并附上引用,指向它找到的原始信息。
Isa:我认为 Deep Research 作为 agent 能力的新颖之处在于,因为我们有能力进行端到端训练,在做研究的过程中有很多事情是你事先无法预测的。所以我觉得,不太可能写出某种语言模型程序或脚本,能像模型通过训练学到的那么灵活——模型实际上是在对实时网络信息做出反应,根据看到的内容改变策略之类的。所以我们确实能看到它进行相当有创意的搜索。你可以去读 Chain of Thought 的总结,我相信你有时能看到它想出的下一步搜索方向非常聪明。
Host:John Carlson 发了一条有点火的推文,问 Deep Research 的魔力有多少来自实时访问网页内容,有多少来自 Chain of Thought。你们能解释一下吗?
Josh:我认为这肯定是两者结合。你能看出来这一点,因为还有其他搜索产品不一定经过了端到端训练,所以在响应信息和遇到的情况时不会那么灵活,在如何解决具体问题上也不会那么有创意,因为它们没有专门为这个目的训练过。所以这肯定是结合。它是 o3 的微调版本,o3 是一个非常聪明且强大的模型,很多分析能力也来自底层 o3 的训练。但所以我认为肯定是结合。
Isa:在 OpenAI 之前,我在一家创业公司工作,我们当时在尝试构建 agent,就是那种我在互联网上看到大多数人描述的构建 agent 的方式——本质上,你构建一个操作图,其中一些节点是语言模型。语言模型可以决定下一步做什么,但整个步骤序列的顶层逻辑是由人定义的。我们发现,这是一种快速搭建原型的强大方式,但在现实世界中很快就失效了,因为你很难预料模型可能面临的所有场景,也很难考虑你可能想走的所有不同分支路径。此外,模型通常不是图中节点上最好的决策者,因为它们没有被训练来做这些决策,它们只是被训练做看起来类似的事情。所以我认为这个模型真正强大的地方在于,它是直接经过端到端训练来解决用户用它解决的那类任务的。所以你不需要搭建一个图,也不需要在后端架构上做那些节点级别的决策,一切都由模型自己驱动。
Host:能多讲讲这个吗?因为这似乎是你们做出的一个非常鲜明的决策,而且显然奏效了。有很多公司在你们的 API 上构建应用,通过 prompting 来为特定用户解决特定任务。你们觉得那些应用是否更适合通过端到端训练模型来服务他们的特定工作流?
Josh:如果你有一个非常具体且相当可预测的工作流,那么做刚才描述的那种事情是非常合理的。但如果你要处理的东西有很多边界情况,或者需要非常灵活,那么我认为类似 Deep Research 的方法可能是更好的选择。
Isa:我给人们的建议是,有一件事你不希望硬编码进模型,那就是那种死板的规则。比如,如果你有一个不想让模型碰的数据库之类的,最好把它写进人类编写的逻辑里。但我认为,这是人们在这个领域反复学到的一个教训——我们总觉得自己写代码能比模型做得更聪明,但实际上,随着领域发展,模型往往能想出比人类更好的解决方案。而且,机器学习大概最重要的一课就是,你会得到你所优化的东西。所以,如果你能把系统搭建好,让你可以直接针对你想要的结果进行优化,效果会比试图把没有经过端到端优化的模型拼凑起来要好得多——那些模型并不是为你想让它完成的任务而优化的。所以我长期的判断是,在模型之上进行 reinforcement learning 调优,很可能会成为构建最强大 agent 的关键环节。
Host:在让它落地的过程中,最大的技术挑战是什么?
Josh:嗯,也许我可以以一个旁观者的身份来说,而不是从一开始就参与的人。但似乎 Isa 和团队其他成员非常努力做的一件事,也是成功的隐藏关键之一,就是制作真正高质量的数据集。这又是机器学习中人们反复重学的古老教训之一,但你输入模型的数据质量,很可能是决定你得到的模型质量的最大因素。还有就是像 Edward Sun 这样的人,他是项目的另一位成员,任何数据集他都会去优化。所以这就是成功的秘诀:找到你的 Edward。
Host:是的,太棒了,机器学习模型训练。
Host:你们如何确保它是正确的?
Isa:这显然是这款模型和产品的核心部分——我们希望用户能够信任输出。一方面,我们有引用,用户可以看到模型引用的信息来自哪里。我们在训练过程中也确实会努力确保引用是正确的。但模型仍然有可能犯错、产生幻觉,或者信任一个可能不是最值得信赖的信息来源。所以这绝对是我们想要持续改进模型的活跃领域。
Host:我们应该如何看待它与 o3、Operator 和其他不同版本的关系?Deep Research 用了 Operator 吗?这些是彼此叠加构建的,还是都是 o3 的不同应用系列?
Josh:目前这些是相当独立的。但你可以想象我们要往哪里走——未来某个时刻,人们能使用的终极 agent 应该不仅能做网页搜索、使用电脑,或者任何你希望你的人类助理能做的其他类型动作,还应该能以更自然的方式融合所有这些能力。
Host:还有其他什么设计决策是一开始不太明显的吗?
Isa:我认为其中之一是澄清流程。如果你用过 Deep Research,模型会在开始研究前问你一些问题。通常 ChatGPT 可能会在回答末尾问你一个问题,但一般不会有这种前置行为。这是有意为之的,因为如果提示词非常明确和详细,你会从研究模型得到最好的回答。而我们认为,用户在第一次提问时就给出所有信息并不是自然的用户行为。所以我们想确保,如果你要等 5 分钟、30 分钟,得到的回答是尽可能详细和令人满意的。因此我们增加了这个额外步骤,确保用户提供我们需要的一切细节。实际上我看到 Twitter 上有很多人说他们会先走这个流程,或者先跟 o1 或 o1 Pro 聊聊,让提示词更详细,满意后再发给 Deep Research。这很有意思,人们正在找到他们自己的使用流程。
Host:过去几个月有三款不同的 Deep Research 产品发布,跟我们讲讲你们有什么特别之处,我们应该如何看待。而且它们都叫 Deep Research 对吧?
Josh:对,都叫 Deep Research。
Isa:这个领域在命名上确实没什么创意。
Isa:我认为人们应该亲自去试用它们,自己感受。我觉得质量上的差异——它们各有优缺点,但差异会很明显。归根结底,这在于这个模型的构建方式,在于构建数据集所投入的努力,还有我们 O 系列模型的引擎,这让我们能够优化模型,做出真正聪明、真正高质量的东西。
Host:去年 o1 团队来我们播客时,我们开玩笑说过 OpenAI 不太擅长起名字。我得说,这是你们命名最好的产品,Deep Research 至少描述了它是做什么的。
Josh:是吧。
Host:所以我很想听听你们接下来想往哪里走。你们现在有 Deep Research,你觉得一年后会是什么样子,以及一路上你们还想构建哪些互补的东西?
Isa:我们很期待扩展模型能访问的数据源。我们训练了一个非常擅长浏览公共信息的模型,但它也应该能够搜索私有数据。然后我觉得要继续推进能力,让它更擅长浏览、更擅长分析。再然后,思考这如何更广泛地融入我们的 agent 路线图。我认为这里的配方会扩展到相当广泛的用例,有些东西会好到让人惊讶。但核心思路是,你拿一个最先进的推理模型,给它使用人类用来工作或日常生活的相同工具的权限,然后直接针对你希望 agent 能够实现的结果类型进行优化。这个配方,真的没有什么能阻止它扩展到越来越复杂的任务。所以我觉得,AGI 现在更像是一个工程实现问题了。我认为按照这个通用公式,还会有很多东西出现。
Host:Sam 有一个很引人注目的说法:Deep Research 将接管全球所有经济上有价值的任务中个位数的百分比。我们应该怎么理解这句话?
Josh:我的理解是,Deep Research 还不能做你所有的工作,但它能够一次为你节省几个小时,有时甚至是几天。所以我认为,我们有望 relatively close to 的是,Deep Research 以及我们接下来构建的 agent、在它之上构建的 agent,能为你节省 1%、5%、10%、25% 的时间,具体取决于你的工作类型。我觉得你已经自动化了我 80% 的工作,所以对我来说肯定属于高端。我猜我们只需要开始开支票了。
Host:有没有哪类工作整体来说——说“风险”不太对——但更像是 Deep Research 特别擅长的目标领域?比如我在想咨询业,但有没有哪些具体类别你们觉得更在目标范围内?
Josh:我以前做过咨询。我不觉得有什么工作处于风险中,我完全不把这看作是劳动力替代之类的事情。但对于这类知识工作,也就是你花大量时间翻阅信息并得出结论的工作,我认为它会赋予人们超能力。
Isa:我对很多医学用例非常兴奋。仅仅是为某种疾病找到所有文献或最新案例的能力,我就已经看到很多医生在发帖子讲这个,或者他们联系我们说,我们用这个做了某件事,我们用它帮某个病人找到了临床试验之类的。对于那些已经非常忙碌的人来说,节省一些时间,或者做那些他们本来没时间做的事情,现在他们能够拥有这些信息了。
Josh:而且我认为这种影响可能比表面上听起来要深远一些。这不仅仅是节省 5% 的时间,而是那种可能花你四小时或八小时的事情,现在你只需要一个 ChatGPT 订阅和 5 分钟就能完成。所以,如果你有无限时间,你会去做哪些类型的事?现在也许你可以做很多副本了。比如,你是不是应该去研究每一个你可能投资的初创公司,而不是只去见那些你有时间见面的?或者在消费者端,我想到的是那种太忙而没时间为孩子策划生日派对的职场妈妈,现在这变得可行了。所以我同意你说的,这比节省 5% 的时间重要得多,它关乎所有你以前做不到的事情。
Host:这会如何改变教育,以及我们应该如何学习?既然我们已经身处一个充满 agent 和 Deep Research 的世界,你会教你的孩子什么?
Isa:教育一直是人们用它最多的前几大场景之一。我认为,这对 AI 来说普遍成立——通过与一个能根据你告诉它的内容、甚至未来可能根据它对你的了解来个性化提供信息的 AI 系统对话来学习,感觉上比读课本要高效得多,也吸引人得多。
Host:我们来几个快问快答问题。
Josh:好的。
Host:你最喜欢的 Deep Research 用例是什么?
Josh:我会说个性化教育,就是学任何我想学的东西。
Isa:我已经提过了,但我认为人们分享的很多个人故事都很棒,关于他们为自己或家人收到的诊断寻找信息的故事。
Host:去年我们看到几个应用类别爆发了,比如编程就是一个明显的例子。你觉得今年哪些应用类别会爆发?
Josh:显然是 agent。
Isa:我也正想说这个。
Josh:好吧,2025 是 agent 之年,我觉得是的。
Host:你会推荐人们读什么内容来更多地了解 agent 或 AI 的发展方向?可以是某位作者。
Josh:训练数据就是这个播客。不,我觉得要跟上 AI 最前沿太难了。我给人们的一般建议是,选一两个你真正感兴趣的子话题,然后去创建一份你认为在说有趣内容的人的清单。如何找到那一两个你感兴趣的东西,也许这其实是一个很好的 Deep Research 用例——去用它深入挖掘你想了解更多的事情。
Isa:这个现在有点老了,但我想几年前我看过一个课程,我想叫《Foundations of RL》之类的,来自 pel,已经有几年了,但我觉得它是 reinforcement learning 很好的入门。所以我绝对会推荐任何 Peter Abbeel 的内容,他是我研究生导师。
Josh:是的。
Host:Reinforcement learning 经历了一个高峰,然后感觉又有点沉寂,现在又重新火起来了。这么理解 RL 的现状对吗?
Josh:它完全回来了。
Isa:完全回来了。
Josh:为什么是现在?因为其他一切都奏效了。我想如果你关注这个领域一段时间,可能会记得 Yann LeCun 的蛋糕比喻。如果你在做一个蛋糕,蛋糕的大部分就是蛋糕本身,然后有一点糖霜,再上面有几颗樱桃。这个比喻是说,无监督学习是蛋糕,监督学习是糖霜,reinforcement learning 是樱桃。2015、2016 年我们在这个领域做 reinforcement learning 的时候,我觉得 Yann LeCun 的比喻——现在回头看可能是对的——就是我们试图在还没有蛋糕的时候就加樱桃。但现在我们有了在大规模数据上预训练过的语言模型,能力极强;我们知道如何对这些语言模型做监督微调,让它们擅长遵循指令,一般性地做人们想让它们做的事。既然这部分已经跑通了,那么针对任何你能定义奖励函数的用例去调优这些模型,时机就非常成熟了。
Host:太棒了。从快问快答中,我们得到:2025 年爆发的类别会是 agent,reinforcement learning 完全回来了。我很喜欢。非常感谢你们加入我们,我们很喜欢这次对话,祝贺你们做出了了不起的产品,我们迫不及待想看到接下来的发展。
Josh:谢谢。
Isa:谢谢。
Josh:谢谢。