Inside OpenAI's big play for science

MIT Technology Review:精选主题、新闻通讯、活动、音频。精选主题、新闻通讯、活动、音频。人工智能:OpenAI 进军科学领域的重磅举措。与 OpenAI for Science 负责人 Kevin Weil 的独家对话——这个全新的内部团队希望让科学家变得更高效。
自 ChatGPT 惊艳问世三年来,OpenAI 的技术已经颠覆了家庭、职场、校园等大量日常场景中的活动——无论人们开着浏览器还是拿着手机,而这些地方无处不在。
如今,OpenAI 正明确地向科学家群体发力。今年 10 月,该公司宣布成立一个全新团队,名为 OpenAI for Science,专门探索其大语言模型(LLMs)如何帮助科学家,并调整工具以更好地支持他们。
过去几个月,社交媒体上涌现了大量帖子,学术期刊上也发表了许多论文,数学家、物理学家、生物学家等纷纷讲述 LLMs(尤其是 OpenAI 的 GPT-5)如何帮助他们取得发现,或将他们推向一个本可能错过的解法。从某种程度上说,OpenAI for Science 的成立正是为了与这个群体建立联系。
然而,OpenAI 在这一领域也算姗姗来迟。Google DeepMind——这家因 AlphaFold 和 AlphaEvolve 等突破性科学模型而闻名的竞争对手——已经设立 AI for Science 团队多年。
Demis Hassabis:"这就是我创立 DeepMind 的原因……事实上,这也是我整个职业生涯都在从事 AI 的原因。"
那为何选择现在入局?进军科学领域与 OpenAI 的宏大使命如何契合?这家公司究竟希望达成什么?
上周,我在一次独家专访中向 Kevin Weil 提出了这些问题。他是 OpenAI 的副总裁,也是新成立的 OpenAI for Science 团队的负责人。
Weil 是一位产品人。几年前,他在 Twitter 和 Instagram 担任产品负责人后,以首席产品官的身份加入 OpenAI。但他最初是一名科学家。他在斯坦福大学攻读粒子物理学博士,完成了三分之二的学业后,便离开学术界,投身于硅谷的梦想。Weil 很乐意强调自己的学术背景:
Kevin Weil"我原以为这辈子都会当一名物理学教授。我现在度假时还会读数学书。"
当被问及 OpenAI for Science 如何与公司现有的白领生产力工具矩阵,以及病毒式视频应用 Sora 相契合时,Weil 复述了公司的信条:
"OpenAI 的使命是尝试构建 AGI,并让它惠及全人类。"
试想一下这项技术未来可能对科学产生的影响:新药物、新材料、新设备。
"想想它能如何帮助我们理解现实的本质,如何帮助我们思考未解难题。也许 AGI 带来的最大、最积极的影响,将来自它加速科学发展的能力。"
Kevin Weil 补充道:"而且,有了 GPT-5,我们看到这种可能性正在成为现实。"
在 Weil 看来,LLMs 如今已经足够出色,可以成为有用的科研合作者。它们可以头脑风暴、提出新颖的探索方向,还能在新问题与几十年前发表在小众期刊上或用外语写就的旧解法之间,找到富有成效的类比。
但大约一年前情况还不是这样。自 2024 年 12 月 OpenAI 发布首个所谓的推理模型(一种能够将问题拆解为多个步骤并逐一解决的 LLM)以来,这家公司一直在不断突破这项技术的能力边界。推理模型让 LLMs 在解决数学和逻辑问题上的表现远超以往。
"回想几年前,当模型能在 SAT 中拿到 800 分时,我们所有人都惊呆了。"
但很快,LLMs 就在数学竞赛中拔得头筹,并解决研究生级别的物理问题。去年,OpenAI 和 Google DeepMind 双双宣布,它们的 LLMs 在国际数学奥林匹克(International Math Olympiad,世界上最难的数学竞赛之一)中达到了金牌水平。
"这些模型不再只是比 90% 的研究生更强。它们真正处于人类能力的前沿。"
这是一个巨大的断言,而且附带不少前提条件。尽管如此,毫无疑问,集成了推理模型的 GPT-5 在复杂问题解决方面相比 GPT-4 有了巨大提升。在以 GPQA 这一行业基准测试衡量时——该测试包含 400 多道考察生物学、物理学和化学博士级知识的选择题——GPT-4 得分 39%,远低于约 70% 的人类专家基线。据 OpenAI 称,GPT-5.2(该模型于 12 月发布的最新版本)得分 92%。
这种兴奋显而易见——或许也有些过头。10 月,OpenAI 的几位高层(包括 Weil)在 X 上吹嘘说,GPT-5 已经找到了几道未解数学题的答案。数学家们迅速指出,事实上 GPT-5 所做的似乎只是在旧研究论文中挖出了现成的解法,其中至少有一篇是用德语写的。这固然有用,但并非 OpenAI 似乎宣称的那般成就。Weil 和他的同事们随后删除了这些帖子。
如今 Weil 谨慎多了。他说,很多时候,找到那些存在但已被遗忘的答案本身就足够了:
"我们都站在巨人的肩膀上,如果 LLMs 能够整合这些知识,让我们不必再花时间去攻克已经解决的问题,这本身就是一种加速。"
他对 LLMs 即将带来颠覆性新发现的说法持保留态度。
"我认为模型还没达到那个水平。也许它们会达到。我对此持乐观态度。"
但他坚持认为,那不是团队的使命:
"我们的使命是加速科学。而我认为,加速科学的门槛,并不是要像爱因斯坦那样对整个领域进行重塑。"
对 Weil 来说,问题在于:
"科学家加上模型,是否真的比科学家单独工作能做得更多、更快,从而让科学真正加速发展?我认为我们已经看到了这一点。"
11 月,OpenAI 发布了一系列由公司内部和外部科学家提供的轶事性案例研究,展示了他们如何使用 GPT-5 以及它带来了哪些帮助。
"大多数案例中的科学家已经在研究中直接使用 GPT-5,并以各种方式主动找到我们说,'看看我用这些工具能做到什么。'"
GPT-5 似乎擅长的事情主要有几件:找到科学家此前未曾注意到的、与现有工作的参考文献和关联,这有时会激发新的想法;帮助科学家勾勒数学证明的框架;以及为科学家在实验室中验证假设提出建议。
"GPT-5.2 基本上读完了过去 30 年里发表的每一篇论文。它不仅理解某位科学家所从事的领域,还能从其他不相关的领域中汲取类比。"
"这非常强大。你总能在相邻领域找到一位人类合作者,但很难在可能相关的上千个相邻领域中都找到合作者。除此之外,我可以在深夜与模型一起工作——它不用睡觉——而且我可以同时问它 10 个问题,对人类这么做就有点尴尬了。"
大多数与 OpenAI 分享案例研究的科学家都支持 Weil 的观点。
范德堡大学物理学和天文学教授 Robert Scherrer 此前只是拿 ChatGPT 随便玩玩,直到他在范德堡大学的同事、如今就职于 OpenAI 的物理学家 Alex Lupsasca 告诉他,GPT-5 帮 Alex Lupsasca 解决了一直以来困扰他的一个难题。
Robert Scherrer:"我以前让它把《Gilligan’s Island》的主题曲改写成《Beowulf》的风格,它写得非常好。"
Scherrer 当时被一个难题卡住了,这个问题涉及极早期宇宙中一种被称为宇宙弦(cosmic strings)的假想结构可能释放的辐射量。Lupsasca 让 Scherrer 用上了 GPT-5 Pro——OpenAI 每月收费 200 美元的高级订阅服务。
Scherrer“它解决了一个我和研究生花了几个月都没解决的问题。”
“它并不完美,GPT-5 仍然会犯蠢错。当然,我也会犯错,但 GPT-5 犯的错更蠢。”
不过他表示,模型一直在进步。
“如果当前趋势持续下去——这是个大大的如果——我怀疑所有科学家很快都会用上 LLM。”
Derya Unutmaz 是杰克逊实验室(Jackson Laboratory)——一家非营利研究机构——的生物学教授,他在研究免疫系统时使用 GPT-5 来头脑风暴、总结论文和规划实验。在他与 OpenAI 分享的案例研究中,Unutmaz 用 GPT-5 分析了团队此前看过的一组旧数据。模型给出了新的见解和解释。
Unutmaz:“LLM 对科学家来说已经不可或缺了。当你能在过去需要几个月的时间里完成数据集分析时,不用它们就不再是一个可选项了。”
加州大学伯克利分校的统计学家 Nikita Zhivotovskiy 说,自从 ChatGPT 首个版本发布以来,他就在研究中使用 LLM。
和 Scherrer 一样,他发现 LLM 最有用的地方是指出他自己的工作与一些他此前不了解的现有成果之间意想不到的联系。
Zhivotovskiy:“我相信 LLM 正在成为科学家的必备技术工具,就像以前的计算机和互联网一样。我预计不使用它们的人会长期处在不利地位。”
但他预计 LLM 短期内还不会做出新颖的发现。
Zhivotovskiy:“我很少见到真正新颖、本身值得发表的观点或论证。到目前为止,它们似乎主要是把现有结果组合起来,有时还会出错,而不是产生真正全新的方法。”
我也联系了几位与 OpenAI 没有关联的科学家。
利物浦大学化学教授、Leverhulme 功能材料设计研究中心(Leverhulme Research Centre for Functional Materials Design)主任 Andy Cooper 就没那么热情。
Cooper:“我们尚未发现 LLM 在根本上改变科学研究的方式。但我们最近的结果表明,它们确实有一席之地。”
Cooper 正在领导一个开发所谓的 AI 科学家的项目,旨在全自动化的部分科学工作流程。他说,他的团队不用 LLM 来产生想法。但这项技术开始被证明可用作更广泛自动化系统的一部分,例如让 LLM 协助指挥机器人。
Cooper:“我猜 LLM 可能最初会更多地留在机器人工作流里,因为我不确定人们是否准备好被 LLM 指挥该做什么。我当然没有准备好。”
LLM 可能正变得越来越有用,但谨慎仍然关键。
去年 12 月,研究量子力学的科学家 Jonathan Oppenheim 指出了一份科学期刊中出现的一个错误。
Oppenheim“OpenAI 的领导层正在宣传一篇发表在 Physics Letters B 上的论文,其核心理念由 GPT-5 提出——这可能是第一篇由 LLM 生成核心贡献并经过同行评审的论文。一个小问题:GPT-5 的想法检验错了东西。”
“GPT-5 被要求给出一个检验非线性理论(nonlinear theories)的测试。它提供的是一个检验非局域性(nonlocal ones)的测试。听起来相关,但其实是两回事。就像你要新冠检测,LLM 却乐呵呵地给了你一份鸡痘检测。”
显然,许多科学家正在寻找与 LLM 互动的创新且直观的方式。同样显然的是,这项技术会犯下如此微妙的错误,连专家都会漏掉。
部分问题在于 ChatGPT 会用恭维让你放松警惕。
“一个核心问题是,LLM 被训练成去肯定用户,而科学需要的是挑战我们的工具。”
在极端案例中,有一个非科学家个体被 ChatGPT 说服,连续数月以为自己发明了一个新的数学分支。
当然,Weil 非常清楚幻觉(hallucination)的问题。但他坚称,更新的模型幻觉越来越少。即便如此,他说,过分关注幻觉可能偏离了重点。
Weil“我的一位队友,他以前是数学教授,说了一句话让我印象深刻。他说:‘我做研究时,如果和同事碰撞想法,我 90% 的时间都是错的,而这正是意义所在。我们俩都在抛点子,试图找到可行的方向。’”
“这其实是一种理想状态。如果你说了足够多的错话,然后有人偶然发现了一个真理的颗粒,另一个人抓住它说:‘哦,这不太对,但如果我们——’你们就逐渐在密林中找到了路径。”
这是 Weil 对 OpenAI for Science 的核心愿景。GPT-5 很好,但它不是神谕。这项技术的价值在于为人们指明新方向,而不是给出定论。
事实上,OpenAI 现在正在研究的一个方向是让 GPT-5 在给出回答时降低自信度。它不会说“这就是答案”,而是可能告诉科学家:“这是值得考虑的一点。”
“这实际上是我们正在花大量时间做的事情。试图确保模型具备某种认识论上的谦逊。”
OpenAI 还在研究的另一个方向是如何用 GPT-5 来事实核查 GPT-5。通常,如果你把 GPT-5 的一个答案再喂回给模型,它会拆解并指出错误。
“你可以让模型充当自己的批评者。然后你就能得到一个工作流:模型思考,然后交给另一个模型,如果那个模型发现可以改进的地方,就回传给原始模型,说:‘嘿,等等——这部分不对,但这部分有意思,保留。’就像几个智能体在协作,你只在它通过批评者审核后才看到输出。”
Weil 描述的听起来也很像 Google DeepMind 用 AlphaEvolve 所做的事——该工具将公司的 LLM Gemini 包裹在一个更广泛的系统内,筛选出好的回答、剔除坏的,再反馈回去迭代改进。Google DeepMind 已经用 AlphaEvolve 解决了多个现实世界的问题。
OpenAI 面临着来自竞争对手的激烈挑战,这些对手的 LLM 已经能够做到 OpenAI 声称其模型能做到的绝大部分,甚至全部功能。既然如此,科学家为什么要用 GPT-5 而不用 Gemini 或 Anthropic 的 Claude 呢?这些模型家族本身也在逐年进步。归根结底,OpenAI for Science 可能更多是在新领域插旗占地的努力。真正的创新尚未到来。
“我认为 2026 年对科学而言,就像 2025 年对软件工程一样。在 2025 年初,如果你用 AI 写大部分代码,你是个早期采用者。而 12 个月后,如果你不用 AI 写大部分代码,你可能已经落后了。我们现在在科学领域看到了与当年代码领域同样的早期火花。”
“我认为一年后,如果你是一位科学家却还没有大量使用 AI,你将错过一个提升思维质量和速度的机会。”
在 Facebook 上分享文章通过邮件分享文章热门
一家初创公司声称突破了阻碍 LLMs 发展的瓶颈 Will Douglas Heaven
“类固醇奥运会”如同一场马戏——也是我们文化的一扇窗 Amit Katwala
一个欧洲生育组织称,精子捐献者需要设限 Jessica Hamzelou
走进内感受:你身体内部感觉的隐藏感官 Katherine W. Isaacs
深度报道人工智能
一家初创公司声称突破了阻碍 LLMs 发展的瓶颈 Subquadratic 现已分享了其新模型的更多细节。但一些人仍持怀疑态度。
这使得诱骗它们去做不该做的事变得很容易,比如告诉你如何破坏飞机的导航系统。
一项新技术让该公司得以比以往更深入地探究 LLM 的奇特运作方式。
该公司正加倍押注于 AI for science。
发现特别优惠、热门报道、即将举行的活动以及更多精彩内容。
隐私政策感谢你提交邮箱!
我们在保存你的偏好设置时遇到了问题。请尝试刷新本页面并再次更新。如果你继续收到此消息,请发送邮件至 customer-service@technologyreview.com,附上你希望收到的通讯列表,与我们取得联系。