🎙️AI 访谈库
微软 CTO Kevin Scott:AI 如何拯救而非摧毁互联网|Decoder
Kevin Scott · Microsoft

微软 CTO Kevin Scott:AI 如何拯救而非摧毁互联网|Decoder

Microsoft CTO Kevin Scott on how AI can save the web, not destroy it (Decoder)

2025-05-19 · Decoder with Nilay Patel (The Verge) · 1h11m · 约 51 分钟读完 · 原文
微软 CTO 谈 AI 时代的搜索与开放网络:开源自然语言搜索工具、agentic web 愿景与网站数据主权。

微软顶级 AI 领导者之一,谈 agent、网页搜索与 AI 艺术的未来。

今天,我与微软首席技术官、公司 AI 核心领导者之一的 Kevin Scott 对谈。这是 Kevin 第三次做客 Decoder,也是我最喜欢的嘉宾之一。他常思考技术、艺术与文化之间的关系,而且格外愿意深入探讨所有细枝末节——这显然是我永远无法抗拒的。

Kevin 今天在微软 Build 大会期间做客节目,探讨搜索的未来——微软刚刚宣布了一款开源工具,让网站只需投入少许精力就能集成 AI 驱动的自然语言搜索,并且这种方式允许网站所有者真正运行他们想要的任何模型,同时保留对其数据的控制权。这东西很酷——在我和 Kevin 聊天之前看了一些演示,相比大多数网站上糟糕的本地搜索,改进显而易见。

但这里的目标不仅仅是改进一堆互不关联网站上的本地搜索功能。它是要重新思考在一个 AI 更广泛分布的世界里,搜索究竟应该如何运作。这么想吧:如今,构建一个搜索引擎需要你去索引互联网上的所有页面——然后让这个索引保持持续更新,这是一笔巨大的经常性成本。

收听 Decoder,一档由 The Verge 的 Nilay Patel 主持、关于宏大构想——以及其他问题的节目。点击订阅!

正是因为这种成本,实际上目前只有两个主要的搜索索引:一个是 Google 的,这很显然;另一个是微软的 Bing 索引,它为你可能熟悉的 DuckDuckGo 等大多数替代搜索引擎提供支持。这些集中式搜索索引也是我们当前 AI 搜索工具的基石,比如内置于 ChatGPT 和 Bing 中的搜索功能,或者 Google 的 AI Overviews。

但如果所有这些网站突然都拥有了自己强大的自然语言搜索工具,那么你可能就不再需要那个庞大的中央索引了。你真正需要的只是一个标准,让你可以向大量网站询问它们是否能回答你的问题,这将大幅降低搜索的整体成本,也可能让更多竞争者进入市场。因此,微软的本地搜索项目正是建立在这样的标准之上——它叫做 Model Context Protocol,简称 MCP,它让 AI agent 能够以受控的方式与数据库和服务交互——而不是像目前许多 agentic 产品那样,真的在网站上四处点击。

MCP 最初由 Anthropic 开发。现在,包括 Google 在内的业界其他公司也开始支持它。前路还很长,但第一步就是让更多网站启用 MCP,这正是微软要让基于 MCP 的本地搜索变得廉价且易于实现的原因。

畅想由 MCP 驱动的 agentic 搜索的未来图景,是非常酷的事。也许竞争会因此增多,也许网站会获得更多流量,其中一些业务也会更具可持续性。但这里也存在一些明显的复杂性——首先,为什么有人会希望 agent 以这种方式使用他们的服务,以及任何人打算如何通过这种方式赚钱。我问了 Kevin 这个问题,我们也花了一些时间思考,对于所有真正在创作内容的人来说,Web 的未来如何才能保持可持续。

我可以永远聊这个话题,但既然有机会与 Kevin 对谈,我也确保问到了微软与 OpenAI 之间独特且常常令人困惑的关系,他对 AI 能力随时间推移不断提升的感受,以及随着诉讼和争议在创意社群中持续发酵,他对 AI 作为创意工具的看法是否在演变。毕竟,Kevin 自己也是一名作者——他在 2020 年写过一本关于 AI 的书,前言出自当时一位尚不为人知的 JD Vance 之手。

于是我问 Kevin:如果有人站在书店外面,向每一个似乎有意购书的人概括总结他的书,他会作何感想。我想你会觉得这段交锋相当有趣。

好了:微软 CTO Kevin Scott。我们开始吧。

本访谈为兼顾篇幅与清晰度已作轻度编辑。

Kevin Scott,你是微软的首席技术官。欢迎再次回到 Decoder。

如果算上我们在 The Vergecast 频道上做的 Decoder 早期试播,我相信你是我们第一位四度做客的嘉宾。

而且你一直是我最喜欢的对谈对象之一,所以我对这次访谈非常期待。微软在搜索和 Web 方面有一些新消息,这正好切中我这档节目的靶心,因为我看到这一领域正在发生翻天覆地的变化。我想和你聊聊,既然 AI 在这里已经进入了第二个时代,我们学到了什么;还想聊聊它正走向何方,不过是些寻常话题,小事一桩。

我们从新闻开始吧。微软就在今天,在人们收听这档节目的同时,于 Build 大会舞台上宣布了一种在网站本地进行搜索的新方法。跟我们讲讲这是怎么回事。

实际上,我不会太把它框定为搜索。我近来一直在思考的是,我们有一个假设,而且我认为它正不断得到验证:由过去这几年构建的各种强大新型 AI 模型所赋能,我们将拥有 agentic software,而 agents 需要能够代表用户去执行各种操作。我们的约束变少了,就像你说的,这是 AI 的 second act;我们在内部把当下这个阶段描述为 middle innings。因此我们不再以受限的方式做推理。我认为,在我们试图构建的这些 agentic software 中,我们更多受到的是 utility 层面的限制……

等等,utility constrained 这个说法可以有很多种解读。最严厉的一种是“这东西还不太好用”;温和一点的说法是“还没有 product-market fit”。你觉得这指的是什么?

我觉得这得看情况。如果你看向软件开发领域,显然已经存在 product-market fit。这类工具已经成为人们构建软件时不可或缺的方式,就像我们构建的那些 software development agents。在这方面,我认为我们更像是 agentic software 能力边界上的早期探路者。这并不奇怪,因为开发者通常先为自己打造省事工具,然后才会去为其他人打造那些名义上让生活更轻松的东西。

所以在那里我们走得稍微靠前一些,而且我们在构建这些 software engineer agents 的过程中,已经学到了一些经验——关于未来如何让 general-purpose agents 在软件开发之外的场景也变得更有用。我们学到的一点在于,agents 需要能够获取信息来源;它们需要能够代表用户采取行动,改变状态与系统。

比如预订酒店房间,或者在我的日历上添加事项。我认为,要让这些功能真正落地,需要的是开放的协议,在整个 agents 图景中实现真正的互操作性——每一个拥有服务或内容、并希望其能被 agent 访问的人,都能有一种方式宣告:“嘿,我在这儿。” 然后无论谁构建的 agents,都能连接到这些内容与服 务。我们在 Build 大会登台时,把这套东西称为 agentic web。那么,在这个有大量 agents 代表用户行事的世界里,必须存在哪些东西?它们在本质上的重要性,相当于二三十年前万维网发展过程中必须涌现出来的那些基础要素。

所以就是 agentic web。我们在这档节目里已经聊过很多次了。我之前和你的同事 Mustafa Suleyman 讨论过 agentic web 和构建 agents。我一直把它叫做“DoorDash 问题”。我找不到更好的名字了。我为 DoorDash 的人感到有点抱歉,因为我没征得他们同意就一直在用,但我一直这么叫:好吧,我想买个三明治。于是我对 Bing 或 ChatGPT 或别的什么说:“去给我买个三明治。Alexa,去买个三明治。” 然后它就跑到网上去了。

眼下,大多数 agentic products 真的会去打开一个网站,试图扫描网页,然后在上面点来点去,最后给我下单买个三明治。而大多数这样的公司态度是:“别这么干。” 他们的立场是:“我们不希望你这么做。我们会封禁你,也许如果你体量够小,我们会睁一只眼闭一只眼,但我们需要有商业条款,不能让你就这样把我们的能力拿走,以这种方式放进你的产品里。”

这个问题必须解决。我很好奇你会怎么解决这个问题。听起来你只是在那个问题之上多做了一层抽象,也就是说,假设我们解决了商业层面的问题,那如何让我的 agent 能与 DoorDash 对话——这其实是个容易得多的问题,因为让 agent 在网页上点来点去从来就不是什么好解法。

是啊,这种方式很脆弱。而且你看,我认为解决商业模式问题实际上与解决技术问题必须同步进行。所以这不只是要想出一个技术上的实现路径,而是要让整个生态系统中的所有激励都以正确的方式对齐,让各方都能从中受益。所以,如果你经营一家企业,希望你的企业能通过用户的 agent 与用户完成交易,那这件事本身必须具有良好的商业意义,你才愿意让它发生。你不能只是靠技术手段绕过这一关,还指望它能长久。即便你能暂时找到某种技术魔法,绕过实际技术层面的脆弱性,你也必须消除商业模式中的脆弱性。

这正是当下万维网中似乎最受威胁的一环——底层的商业逻辑:我建了一个网站,放入一堆 schema,让搜索引擎能读取我的网站,并在不同分发渠道上呈现我的内容;我可能会添加 RSS feed,这是一种标准化的、人人都在用且达成共识的分发方式。要做到这些其实有很多途径。

但如果我建了一个网站,我就把自己开放给了不同 surface 上的分发。我为此得到的回报不一定是钱——几乎在每一种情况下都不是钱。我得到的是访问我网站的访客,然后我再按自己的方式去变现:卖订阅、展示广告,诸如此类。这套逻辑已经崩坏了,对吧?随着越来越多的答案被直接呈现,尤其是在基于 AI 的搜索产品中,网站的流量总体上一直在下降。我们反复看到这一现象。那么在 agentic 时代,当我们创建了新的 schema 让 agents 来与我的网站对话并获取一些答案时,什么将会取代原有的那套逻辑?是什么会让这件事变得值得?

我认为,我们目前通过一些正在发布的东西,并试图以开放的方式去做的一件事情是:你将拥有让 agents 能够访问人们网站的技术机制,但协议本身会让你能够决定你想提供什么、以及如何提供。所以如果你看看 MCP,这是 Anthropic 开发的一个非常棒的协议,我们正在和 Anthropic 做大量工作来支持它,而且我知道生态系统中很多人都参与其中。OpenAI 也在与他们合作,不少人已经把 MCP 视为 agentic web 中相当于 HTTP 的存在。MCP 本身并不会对内容或服务提供商应该通过 MCP 提供什么、或者这种访问应该采用什么商业模式发表任何意见。

所以我认为其中一个好处在于,它为拥有内容或服务的人提供了一种方式,去决定新的商业模式会是什么样子。比如说,如果用户订阅了你的网站,那么 MCP endpoint 是否就能在他们的 agent 中使用?会不会出现某种新的广告模式,你免费提供一些内容,借此吸引大量 agent 活动到你的网站上,然后可能有一些广告帮助分发,再产生一些交易,你可以按 conversion 来定价。我不确定最终的商业模式会是什么,但我确实知道,你真正需要的是让内容和服务提供商拥有 agency,这样他们才能决定自己提供什么,以及他们所做之事的商业模式是什么。

MCP 代表的是 "model context protocol" 吗?

要我说,这还算是一项尚处萌芽阶段的标准。你来到我的网站或我的服务,我告诉你能做什么。据我所知,它非常像是 robots.txt 的演进。它更复杂、更精密,但核心理念非常相似。你到访,我告诉你什么能做、什么不能做。微软、OpenAI 和 Anthropic 能凭一己之力强行把它推出来吗?还是说其他参与者也能从中获得好处?

嗯,我认为如果你是开发者,那好处非常多。这让我想起我年轻时做开发者的感觉,就在几十年前互联网爆发式出现那会儿,当时我想要的是一套无需许可的机制,我可以直接把东西放到网上,然后让其他人以有趣的方式访问它。

所以,我确实认为 MCP,以及我们基于 MCP 正在做的那件事——也许我们过会儿会聊到——这个叫 [Natural Language Web] 的有趣事物,它是一套开放协议和一堆代码,让你无需向任何人申请许可,就能决定在这个 agentic web 上开放什么内容,让你正在做的事能被 agent 访问。你把它称为尚处萌芽阶段的协议,我认为你说得对。有趣的是,目前它的发展势头有多快,大家多么迅速地接受了这种方式,让自己的东西能被 agent 访问。所以我觉得,如果你是内容或服务提供商,有吸引力的地方在于,越来越多的用户活动会以 agent 为锚点。

未来越来越多的用户交易和用户注意力都会向这里汇聚。因此你会希望自己的业务对 agent 可见,这样才能触达受众。而且我认为你会真正进入一种模式:agent 为你异步地做事。在当前的网络模型中,很多事都是同步发生的。你就坐在那里,“我现在盯着浏览器。我可能想在某人的 Shopify 店面上买件工具。我的注意力集中在这项特定任务上。我完成交易,然后转向下一件事。”而 agent 的有趣之处在于,事情将开始异步发生——你给 agent 一个任务,它会在你把注意力放在别处的时候去处理所有这些事务。

这是一件非常有趣的事,我认为会出现一堆目前不存在的机遇,因为说到底,我能花在网站上的注意力就那么一点。如果我有一堆 agent 在帮我做各种研究,帮我规划暑假——或者我在工作室里有个疯狂的项目,正在建一个窑炉,为了我做的一堆陶艺杂活——如果它能帮我多推进几步,那么当我剩下一点注意力可以分配时,我能立刻采取行动,或者直接购买东西,又或者我给出的注意力质量会高得多。我觉得这对那些在网上做生意的人来说太有意思了。

我们来聊聊你正在做的 NL 搜索项目,以及它如何与这个更大的愿景相连。我之前看了一个简短的演示,非常酷,对吧?这是一种低成本、极易上手的方式,能把自然语言搜索集成到网站里。我看到的一个演示是 Tripadvisor。我听说 Tripadvisor 团队周三才看到它,下周二就向公司高层做了演示。这很酷,成本低,而且兼容所有模型。你可以用 DeepSeek 跑,也可以用 OpenAI 的 4o mini 跑。这就是它能提供 MCP 能力的原因,对吧?

所以你把这个工具部署到自己的网站上,为用户提供了一个好处。如果你愿意,可以用聊天机器人或自定义界面的形式提供自然语言搜索。然后你现在又给自己的网站加上了 MCP schema,让 Microsoft Copilot agent 能够以某种你可以控制的结构化方式出现并与你的网站互动。这一切都很酷。我也理解其中的激励逻辑。但这不就是换了个名字的 API 吗?我心里总有个声音觉得,这么说把它想得太简单、太渺小了。

是啊,我觉得这其实不是坏事。实际上这是件大好事,正因为它是一套非常简单的协议,却能催生出一系列极其丰富的行为。再说回基本前提,你希望 agent 非常有用,名副其实。所以 agent 应该是一种软件,你可以随着时间推移把越来越复杂的任务委托给它。为了让这些任务变得越来越复杂,agent 必须能够实际干活。而让它们能干活的最佳方式,就是让内容和服务无处不在;你需要让所有人的激励都合理,无论是采用门槛还是商业模式,还有整体的经济性,这样才能获得相当广泛的普及。所以简单绝对是一个特性。

让我问问房间里的大象——关于 web 以及在 web 上构建新能力的问题。显然就是 Google。目前整个 web 是围绕 Google 的优先级、它的需求、它的流量偏好来组织的。有一整类 SEO 顾问对着天空挥舞烟花棒来帮你引流。这很好,我们很喜欢。

但这显然在变,对吧?随着 Google 把越来越多的流量留在自己手里,或者它对训练数据有了不同的想法,所有这些都在变化。这里的交易是:让你的网站更 agentic,然后 MCP 作为协议能让你在上面构建一些新的商业模式。但在我看来,问题是随着 Google 引荐流量的下滑,整个 web 的流量正在急剧下降。你怎么解决这个问题,好让每个人都有动力继续在 web 上建设?

说实话,我不知道。我的一种回答方式是,我为了亲身体验,搭建了一个 Shopify 店面。所以我有一个自己经营的小副业,就是为了感受做一个 web 业务所有者是什么滋味。

这非常有趣。你要想方设法给业务引流,还得花大量精力去维护这条流量渠道。有趣的是,我店面里的大部分引荐流量并不是来自 Google。大部分是通过社交媒体和社交媒体广告来的,这和我预想的很不一样。所以我不确定自己有没有获得过什么有意思的引荐,自然搜索带来的转化肯定是一个都没有。

知道你并没有暗中偏袒,这很好。我其实就是在问这个。

是啊,是啊,是啊。[笑] 我当然没有。事实上,我想大多数微软员工都是第一次听说 Kevin Scott 有一个 Shopify 店面。所以没错,绝对没有偏袒任何一方。

我认为,作为一名网站运营者,我最希望的是找到一种方式,根本不必花那么多时间去担心流量推荐。我更愿意把时间花在那些可能对我的产品和服务感兴趣的人身上,与他们建立真诚的关系,并找到一种方式来精心维护这段关系。我希望网络上能存在这样一种机制:人们可以购买我的产品、了解更多我所提供的服务,然后他们能成为忠诚的客户,而我与他们之间确实能建立一种关系,就像我拥有一家实体店面、有客流走进我的店里时一样。因此,至少对我来说,所有这些东西都是一种途径,让我能拥有比那种玩非常抽象的 SEO 游戏更多的那种真实互动。

至少社交媒体给我的感觉更像我刚才描述的那样。比如说,我一直在非常用心地经营社交媒体上的受众,只吸引那些可能对我作为 maker 所做的事情感兴趣的 followers。所以,我……我知道这完全没有回答你的问题。而且我也知道,很多人做网站的商业目标与只是想开一家小店面截然不同。

你知道这有什么有趣的地方吗?过去几年我问过很多人:“为什么会有人想做一个网站?” 对我来说,背景是这样的:当年我们创办 The Verge 的时候,我们唯一要做的就是一个网站。我们是一帮想聊科技的人,所以在 2011 年,我们要做一个网站。我们甚至都没想过要开一个 YouTube 频道。那是后来人们大规模做 YouTube 频道之后才发生的事。在我们创办的时候,观念就是“你要做一个大型网站”。

到了 2025 年,我想,好吧,如果我有 11 个朋友想和我一起做一个科技类产品,我们会去开 TikTok。我们绝对不可能说,我们必须搭一个巨型网站,还要依赖这么多东西。我们会开一个 YouTube 频道。我也问过人们:“现在为什么会有人想做网站?” 答案几乎无一例外是为了做电商。是为了在平台规则或平台抽成之外进行交易。是为了把人们引导到另一个地方,证明你确实是某种商业实体,然后完成交易,这就是网站的意义所在。

据我所知,网站的另一个意义在于,它已经成为桌面上主导性的应用平台。无论这是通过 Electron 实现的,还是通过浏览器里真正的 web 本身实现的,它都是应用层。所以我能理解为什么你会想说:“好吧,我们要做 agent。它们会遍历这个开放的、已有的应用层,并使用那些工具。” 但我仍然困惑的是,如果我只是想和人交流,我会去某个封闭平台,然后我们就进入了一种境地:连 AI 工具能获取的信息都变少了,因为所有人讨论要买什么可能都在 TikTok 上,而所有能买的东西都在网站上。这个闭环我一直想不明白。

我认为,这正是 MCP 和 NLWeb 这类东西可能做到的事情之一。如果人们想做研究或做生意的方式是通过他们的 agent,而那里才是意图所在、才是用户需求产生的地方,那么你就会想要某种机制,让你能够连接到那个层面。

那么假设你和你的 11 个朋友在 2025 年要开一个 TikTok 频道来聊科技。如果你们在那里做的事情之一是评测一堆科技产品或科技网站,而你想触达受众,这些受众却都在 Copilot 或 ChatGPT 之类的东西里面,你就会希望那些 agent 软件有某种方式能够接入你的媒体频道,从而让这些受众看到你在发布的内容。

而 NLWeb 也许是一种很好的方式,也许你并不会把所有内容都提供出来,而是提供……有点像搜索里发生的情况,比如 teaser、snippet,也就是那种场景:你对你的 agent 说,“嘿,我想买部新手机。这是我大概想要的。你能帮我找一些相关信息来源吗?” 如果你的 TikTok 频道有办法让你的 agent 知道你的内容是什么,那这可能就是从 agent 回流到 TikTok 的推荐流量,就像:“嘿,去看这个视频,特别有意思。”

我非常好奇,大型平台是否会允许自己被 agent 搜索或被 agent 操作,就像它们曾经不得不在某种程度上允许大型搜索引擎搜索它们一样,对吧?

当时别无选择。我想也许最大的、曾一度回避搜索的平台是 Facebook,但 Instagram 仍然是可以被搜索的。对吧?这里曾有一种交易:你想要被曝光、被这些工具找到,所以大家都某种程度上开放了。而你会如何向 agent 开放,我认为出于各种原因——其中很多都合情合理——目前还不清楚。既然我们可以做自己的 agent,为什么还要这么做呢?我们仍处于早期阶段。

我不知道这个问题的答案。

用搜索的术语来说,你是要做垂直搜索,还是大型横向搜索?横向搜索基本上完全赢了。

这里具体会发生什么很难说。我认为这在很大程度上将由用户决定。会发生的事情之一是,用户只会决定他们能忍受什么。因此,如果使用 agent 来帮你理清生活和事务成为人们一种强烈的偏好,那么那些无法连接到 agent 的东西对人们来说就会某种程度上变得隐形。你就会想:“哦,好吧,X 我的 agent 够不到,也许 X 有点问题,我会找另一种方式来做这件事。” 我认为,当市场在摸索自己想要什么的时候,你想要的是尽可能多地拥有开放协议,这样人们才能做出那些 late-binding 决策,判断这是否是用户所选择的。他们在表达自己的偏好。至少让这件事保持开放,这样当偏好明确时,我就可以选择加入。

我非常想知道这会如何发展。我能看到像 Tripadvisor 之类的一大堆网站会非常想要这种分发渠道。显然,我们需要构建前端工具,构建那些聚合器,说:“好吧,这就是你要派出去的 agent。” 鉴于你到目前为止已经看过那些演示过、宣布过但还没发布,或者发布了却只向五个人 shipped 的 agent,你认为这是一种必需吗?你认为像这样在整个网络上启动 MCP,是 agent 系统运作的必要条件吗?因为到目前为止,它们都还没真正跑通。

我认为类似这样的东西确实是有点必要的。我是说,我记得当年我从事移动广告早期工作的时候,我做移动广告的原因是,我想找到一种方法来帮助那些做移动应用和服务的人解决分发问题,解决如何实现商业化的问题。在 AdMob 这类东西出现之前,你唯一能获取分发的方式是去和移动运营商谈一笔商务合作,由它来决定是否给你展示位——当时还是 WML(无线标记语言),就是在它的 deck 上给你一个位置。那是一种有点野蛮的机制。在当时它完全合理,但如果你看看技术的发展,再快进到未来,就会觉得,是啊,为什么还会有人选择那种方式呢?

所以我认为,现在确实存在着这样一种动态:即便这些 agents 目前仍受到诸多限制,人们也确实从中发现了实用价值。在软件开发这类领域,你需要让 agents 能够执行的动作范围窄得多,而你已经在那里构建出了某种完整性,比如,天哪,采用率很高,人们很喜欢这些东西正在做的事,而且竞争非常激烈,它确实正在改变软件开发的工作方式。

因此我认为我们将看到——这是我,Kevin Scott,乐观主义者——如果你拥有一个真正完整的 agentic web,其中 MCP 有点像这个 agentic web 的通用语,就像 HTTP 曾经那样,就像每个人都可以搭建一个 HTTP 服务器并开始提供 HTML,而且他们可以自己决定 HTML 载荷的内容。你会看到关于可能性如何自然展开的一种非常有趣的过程,而且它可能只会……我不知道该用什么来类比 Amazon.

com 或者早期互联网上的赢家,就是那种当你把足够多的底层 plumbing 铺设好,一切就会变得非常有用的情况。但我认为,在实现完全的实用价值之前,这些协议层面的东西必须先到位。这就是 MCP 值得关注的原因。我们把 NLWeb 看作有点像 HTML 层,它能够让你不必去做大量的底层工作,就能把自己的东西接入 agentic web。

这里让我想到的类比是苹果试图构建一个 agentic Siri,它建立在苹果操作系统中一个名为 App Intents 的框架之上,该框架允许 iOS 应用以某种方式向 Siri 暴露自身,并让 Siri 在这些应用内部执行操作。这里有一些大致的相似之处——显然 MCP 是一个更开放的标准;它还更初级。App Intents 也遇到了同样的商业模式问题:如果你是 iOS 上的应用开发者,你为什么要让 Siri 使用你的应用,而不是让用户直接用,这样你才能向他们追加销售或卖给他们应用内订阅?这是一个类比。

另一个类比是 Alexa Plus,我之前开玩笑说它已经向一些人推出了,但没人知道他们是谁。Google 也有一些 agentic 的想法。Anthropic 和 OpenAI 有 computer use。这些还没有一样真正成功。你有没有看到过任何能证明这事肯定能成的东西?

我明白……没有。所以是的,非常具体地回答你的问题,除了软件工程和演示之外,我还没有真正看到管用的东西,而且我可以把话说得更实在一些。如果我看看我的日常生活,看看我是如何使用这些东西的,在软件开发之外,其实我没有太多选择——Kevin Scott 没有在选择——去把一堆事情委托给这个 agent 替我去做。但我能通过 MCP 隐约感觉到这种可能性,而且我确实认为它必须是开放的。我觉得很难通过垂直整合的方式来做这件事。

另一个我想问的问题,我真的要把媒体培训用上了。我要问问你关于 Google 的事。Google 之所以能取得某些成功,是因为当时 Microsoft 正处于反垄断压力的痛苦之中,对吧?Microsoft 捆绑 Internet Explorer,给 Netscape 施压——这导致了一堆法律麻烦。Google 得以趁虚而入,它能把 Chrome 放到 Windows 上,而且它创造了应用层。大家都知道这个故事。对 Microsoft 的反垄断压力确实为 Google 的成功创造了机会。

如今,很多年过去了,几十年过去了。Google 面临着很大的反垄断压力,特别是在它如何控制网络方面,无论是在广告层还是搜索层。有说法称政府将迫使 Google 剥离 Chrome。这是一种反垄断层面的牵制,而我正在这里和一位 Microsoft 高管谈论关于网络的新想法和网络的新标准。你是否认为机会是一样的,即因为 Google 正被分心,所以存在空间?

我认为机会在于我们当下所处的这个时刻——技术本身已经准备好让其中一些事情发生了。Guha 给你做的这个演示在两三年前是不可能完成的,因为技术还没有准备好。那会难到几乎不可能做到,而且 Tripadvisor 也不可能在周二看到某个东西,周三就能用自己的数据把它演示出来。这完全取决于技术的成熟度。所以我不知道政府对其他科技公司采取的任何行动会产生什么结果。

但我认为,当下正在发生的部分原因是,你拥有了一系列能够做一系列新事情的新技术,而且有一大堆大型科技公司和小型创业者都看到了其中的可能性。而我希望看到的是,这个生态系统能尽可能充分地走向成熟。再说一次,我的模式匹配要回溯到我上一次还是个快乐的年轻开发者的时候,那就是互联网正在兴起的年代——就是那种当一堆困难的事情变得简单,一堆协议开放,你不需要请求任何人的许可就能去尝试一些疯狂的东西时,你会拥有的那种感觉。那才是真正有意思的事情发生的时候。

那让我再追问一下。我想把话题扩展开来,泛泛地谈谈 AI。如果你在两年前出来说:“好吧,这是 Microsoft 提出的一个访问网络和构建网站结构的新标准”,所有人都会说:“很好,我们要等 Google 出自己的版本”,或者“等 Google 来采用这个标准”。Google 现在压力很大。很多对 Google 的信任已经消失了。现在 OpenAI、Anthropic 和 Microsoft 有机会带着一个新标准出现,并相信这里可能会有真正的采用率,而且 Google 不可能明天就拿出自己的标准来打击你们的势头。这对你来说肯定是对的,对吧?你感觉到了。

因为我会做的类比是,我不知道,在 90 年代末或 21 世纪初,有人会宣布一个新标准,然后 Microsoft 就会推出一个专有的 Windows 版本来应对那个标准,而原有的东西就消失了,这就是问题的一部分。你现在能看到这种映射吗?

我不知道。有时候我是在试图回避问题。但这次我不是想回避。作为一名工程师,有时候我觉得某些事情在技术上是不可避免的。我在 Microsoft 内部和很多人讨论过 MCP,他们会说,啊,这不完全是我们本来会选择的方案。而我会说,是的,但这其实不太重要。有时候在一个生态系统中存在一个真正的问题,即每个人都可以选择采用的最简单的解决方案就是赢家,因为我们都赢了,因为普及性才是真正重要的东西,而现在感觉我们正拥有一堆这样的机会。

所以我认为真正有益的是,其中一些东西已经变得如此简单,以至于你实际上不需要一家数万亿美元的巨头去做大量工作来创造快速采用的条件。从某种意义来说,有了 MCP 和 NLWeb,你其实不需要一家大型科技公司来推动它。我们只是在这里发出一个声音:“嘿,有这么个有趣的东西。它是开放的。你想怎么用就怎么用”,而我能做的也就这些了。在开放协议方面,我没有能力告诉任何人该做什么。我们会照亮它,然后希望好事会发生。

让我们从宏观角度聊聊 AI 行业。你曾把它形容为中盘,我则称之为第二幕。这项技术已经存在,每个人都用过,我们都玩过聊天机器人。有些记者甚至遇到过聊天机器人劝他们离开妻子的情形。这个玩笑我永远开不腻。总的来说,你最初的押注里哪些对了、哪些错了?有什么让你感到意外?

我认为我们准确预判了 foundation models 在推理能力上的 scaling law 趋势。我坚信这些趋势会持续显现,而事实证明这一判断大体是对的。我认为,在提升模型推理能力方面,我们仍有巨大进步空间,而且我不想轻视继续推进 scaling 的实际难度。但如果你有合适的资源和专注力,这些问题看起来都是可解的。

我觉得现在困难的地方在于,我感觉到模型存在一种 capability overhang——它们实际具备的能力远超当前被应用的范畴。所以,即使在微软内部,我可能也高估了人们全力拥抱基础 AI 模型平台能力的速度。因此我认为,目前我们在产品层面有点落后。我说的“我们”不是指微软,而是指所有人,除了软件开发工具领域出现的快速进展之外。所以我觉得,医疗健康等领域本可以比现在好得多。很多事情受制于一些 plumbing 层面的基础问题,这也是本次对话的主题之一。但很大程度上,我们只是需要创办更多公司、打造更多产品,去利用这些模型已经可以实现的能力。

还有一部分原因在于,这样的对话我经历了一次又一次。上周末我和一群开发者聚会,发现存在一种很有意思的保守心态,而在指数级改进的平台上,这种心态尤其有害。如果不是因为平台在指数级提升,这种心态甚至不会显得保守。就好比有人看到某个东西会说:“啊,用这个来解决我这个特定问题有点太贵了”,或者“对我试图解决的某个特定问题来说不划算”;又或者它目前只有边际效用,大约 30% 的时间能给出正确答案,但这只是边际上有用。然后就成了:“好吧,我先暂停,等等看。”

这么做本身可能是对的,但“暂停”里的“等待”这部分有问题,因为在很多情况下,现在的等待时间太长了。下次人们再去试用、看看它是否变得更便宜或更强大时,它往往已经跑过了所需的水准,而这时你再想把产品推向市场就已经太晚了。所以我觉得,这是我反复看到的情况——我们集体都在犯错,我们的 pattern matching 并没有达到应有的水准。

没错。你是说,即使产品还不是百分之百完善,你也应该去构想它们。

提到这个很有意思,因为你曾是微软与 OpenAI 合作关系的主要架构师之一。几年前你上过这档节目,我当时问你这段关系的由来,你是用“平台”来形容它的。你说微软是一家平台公司,显然 Azure 是一个巨大的平台。你还说:“OpenAI 与你们在平台愿景上是一致的,我们希望构建一种合作伙伴关系,以便一起去搭建这个平台。”

但我要说,这两年情况变了。两家公司疏远了一些,也许很多。前几天我看了参议院关于 AI 的听证会,注意到微软的 Brad Smith 和 OpenAI 的 Sam Altman 坐在桌子的两端。OpenAI 已经变得更像一家消费者公司,对吧?它显然在努力做大型的消费者产品,而不是平台型产品。要我说,今天的 Anthropic 比 OpenAI 更像一家平台公司。你如何看待这段关系现在的发展?它已经完全解耦了吗?你们还在合作吗?还在试图共建平台吗?

我仍然把大量时间花在 OpenAI 的事务上,其中涉及大量的技术工作。就我作为工程师的身份而言,我们一起搭建大型计算系统。OpenAI 是 Azure 的巨型客户,它的 workload 确实是我们平台中不容忽视的一部分,尤其是在 AI compute 方面。所以我们一直在与 OpenAI 合作,确保我们搭建的东西能满足它的需求,双方在方方面面仍有大量合作,包括如何优化我们正在搭建的基础设施,以及如何将我们正在训练的模型进行优化,使它们真正能成为平台组件。我们还共同运营着一个联合部署安全委员会,确保我们向公众发布的东西在上线前都经过了严格的 Responsible AI 审查。所以没错,我们的合作仍然非常多。

如果你仔细听,就会发现这和你之前的说法有质的不同,对吧?以前你说的是“OpenAI 是我们巨大的 Azure 客户,workload 很大”。当然,每个人都会与自己的大客户紧密合作。而以前的说法是“我们是相互依存的,他们的模型驱动着全公司每一款 Copilot”。现在听起来,微软似乎已经把 OpenAI 从独立技术合作伙伴的类别,转移到了“我们密切合作的大客户”这一类别。

它与我们任何其他大客户都截然不同。OpenAI 在 Azure 超级计算机上训练的模型,对微软正在构建的东西仍然至关重要。它正在构建的组件也是 Azure 平台的重要组成部分。所以它既是客户,也是平台共建伙伴。而且你看,它自己也在独立尝试一些事情,比如 ChatGPT,这些与我们无关。这很棒,因为 ChatGPT 的成功给 Azure 平台带来了巨大的良性压力。

还有一点是一致的。我不确定上次谈 OpenAI 合作时有没有提到这一点。但我们在做第一笔交易时——那是多久以前了,五六年了吧——我的一个核心论点是,我们需要让全世界最顶尖的 AI workloads 运行在 Azure 上,这样我们才能确保 Azure 以世界级的水准为未来的这些 AI workloads 建设自身。所以 ChatGPT 越成功,Azure 就变得越好。

说到这些 AI workloads,我的同事 Tom Warren 报道称,Elon Musk 和 xAI 正准备把 Grok 托管到 Azure 上。他让我问问你,微软内部对与 Elon 合作是否感到焦虑,你是否能信任那家公司,尤其是考虑到其他层面的依赖关系。你感到那种焦虑吗?

其实我对那次对话的细节不是特别了解。我知道我们在做这件事。我们在 Azure 上搭建 model marketplace 的目标是,确保所有开发者想用的优秀开源模型都能方便地获取和使用。所以只要是我们能提供的,我们都会提供。

你现在还掌控着微软的 GPU 预算吗?

这是你几年前对我说过的话,我一直没忘。你不再管了?

那里发生了什么?是因为事情太多了吗?因为你当时也说那是一份很糟糕的工作。

哦,那确实是一份糟糕的工作。真的,非常糟糕。

对 GPU 需求的压力是减轻了还是加重了?

因为路透社等媒体也有报道,随着模型运行成本降低,以及 DeepSeek 等模型的出现,微软已经放缓或重新调整了一些数据中心投资。

不。我们仍在紧急部署算力。我要说的是,如果你身处 Microsoft 内部,与你所有正在开发 AI 产品或从事 AI 研究的团队交流,你会发现,无论技术趋势如何变化,人们对更多 GPU 的渴求丝毫没有减弱。

你认为我们能在现有硬件上实现 AGI 吗?这是业内流传、也是我时常听到人们谈论的一个说法。

我甚至连 AGI 是什么都不知道,这其实是自从很多年前我写书以来就一直让我有点困惑的问题。我觉得首先你得定义清楚,你认为这个词到底是什么意思。如果你看看目前正在推出的这一代硬件,我们从当下正在部署的下一代产品中获得了巨大的性能提升。所以,如果你考虑未来 12 个月会发生什么,所有人的系统性能都将迎来一次相当大幅度的飞跃,因为这一代硬件以及在其之上能做的优化都是非常惊人的。

你认为我们会因为优化而获得更多算力,还是因为硬件本身更强大了?

嗯,绝大多数性能提升确实来自优化,这一点绝对没错。每一代硬件的价格性能比大约能提升 2 倍左右,顺便说一句,这已经相当了不起了。在 Moore's Law 下,你可从未在每隔 18 个月就获得这样的提升,它要比这慢一些。所以说,这里的硬件进步之巨大令人叹为观止,但硬件之上的软件性能优化甚至比硬件本身的进步还要大得多。把这两者结合起来,我们非常稳定地做到每一年左右就能提升一个数量级。

你会如何描述这些优化?因为早期模型能力的很多提升其实只来自摄入更多数据,对吧?我们只是把模型做得更大,它们就这样变得更聪明了。

这是一系列因素的综合。取决于你如何训练模型,有各种不同的做法。总而言之有很多方面。很多提升来自于能够有效地使用更小的数据类型来存储模型激活值,无论是在推理端还是训练端,这意味着你可以并行进行更多算术运算,因为你在算术运算中使用的数字位数更少了。我的意思是,从训练端的各种做法,到人们从根本上重写推理栈的数值内核,优化的广度之大实在令人咋舌。

此外,你还可以运用计算机科学中一套标准技术,比如提示词优化、缓存,以及使用多个模型来处理提示词。你不需要把每个提示词都发给最贵的模型。我们现在已经有足够丰富的模型组合,可以选择用那些极致优化性能但通用性较弱的模型来处理某些任务,把更复杂的问题发给更大、更昂贵的模型。所以这几乎就和缓存优化是一回事。

有意思的是。当我和其他做 agentic AI 的 CEO 交谈时,他们把那种编排视为关键,而你把 MCP 视为关键,我好奇这两者哪个必须先实现。我们在编排上已经走得相当远了。

我认为,再次回到这个能力过剩的话题,我觉得这些模型目前拥有的推理能力远超我们实际在利用的程度。因此我的假设是,阻碍我们获得更有用成果的其中一个因素就是行动执行,而且整个行动空间目前太过受限。所以我并不是说这是二选一的问题。我只是觉得,打开这个行动空间将是一项极其艰巨的工作,所以我们需要立刻投入去做,就像是在建设一个生态系统那样。

我想最后和你聊聊我最喜欢跟你聊的话题,那就是技术与艺术的关系。你确实写过一本书,叫《Reprogramming the American Dream》。我们第一次交谈就是关于那本书的。相当引人注目的是,前言是 JD Vance 写的,他现在已经是美国副总统了。我觉得你当时没料到会有这一天。

你确实预见到了很多事情,比如 AI 将如何重塑经济,或者至少威胁到重塑经济。当我们谈论模型变得越来越强大以及它们变强的方式时,那种仅靠摄入更多数据就能让模型更强大的想法已经达到了极限,对吧?

我们已经把所有数据都摄入了,现在有大量诉讼在争论这种数据摄入是否合法,是否应该获得补偿。你是位作者。我会尽可能简单地把这些问题抛给你。如果我站在一家书店外,拦住每一位来找你书的人,说“我可以直接为你做一期关于这本书的播客。你给我发条消息,发短信就行,我会发给你一期完整总结这本书的播客”,你觉得这会增加还是减少你书的销量?

嗯,我要说一点关于凯文的事,我不知道这是否能或者是否应该推广到所有作者身上。我个人完全不在意人们怎么处置我书里的内容。

即便你只能靠卖书谋生?

是的,所以这非常非常不同。我认为作者们,如果你倾尽所有时间和心血去创作一样东西,你理应为此获得报酬。不过,我觉得一样东西可以获得报酬的方式有很多种,而且说实话,我连那些诉讼的进展都没有紧密关注,所以即便我能就此发表评论,也未必是有用的见解。

但我认为回到我们一开始的谈话,对于这个 agentic web 拥有开放协议,一个潜在的好处是创作者能获得更多——尤其是在当下,整个行业都还没真正理清商业模式是什么,我觉得人们可以参与进来,在商业模式上拥有更多主动权。我认为现在对大家来说,非常非常重要的是认真思考这一点。

ChatGPT 发布那个功能的时候,你做 Studio Ghibli 风格的 meme 了吗?

你没做?好吧。我挺好奇的。很多人都做了。不是说我就没做。我对此不予置评。我的意思是,作为在这里从事创意工作的人,你自己也是创作者,有很多人的生计依赖于他们的创意作品能够进行经济交换,而他们对 AI 行业的普遍批评是:你们创造了所有这些能力,也许正如你所说,甚至比我们现在用的还多,但我们什么都没得到。而且我们现在已经身在其中了,对吧?第二幕,中局,除了一些诉讼之外,感觉情况并没有改变。我只是想知道你的想法有没有演进或变得更成熟。

我思考这个问题的方式从一开始到现在都没有变。所以我当然不希望看到任何事情导致 Hayao Miyazaki 创作的美好事物变少。我可能是他和 Studio Ghibli 多年来所作作品世界上最大的粉丝之一。我认为这简直就是 20 世纪和 21 世纪初所创作的最美的艺术之一,所以对这样的人,我希望他们拥有世界上所有的动力,去继续创作更多作品。

不过说到这个平台,我就直说了。我对这些图像生成工具其实不太感兴趣。我真正感兴趣的是,能为我母亲做医疗诊断的模型——她住在弗吉尼亚州中部的农村地区,根本无法获得真正高质量的医疗服务——而美国还有数千万像她一样处于这种困境的人。

由于美国的人口结构,这种情况不会随时间好转。Studio Ghibli 的内容与 AI 是否擅长医疗诊断毫无关系。所以在这场辩论中,我想确保一点:我们可以讨论这一部分,也就是存在一个我完全不希望被打乱的创意经济,因为我是它的粉丝,我也很欣赏那些创作者。几个月前,我和 Reid Hoffman 以及 JJ Abrams 聊过,如果非要说什么的话,我很希望 AI 能让像 JJ Abrams 这样的人更容易去做他们擅长的事。我认为,市场上只会有更多优质内容涌现出来,那才是人们想要的。

他们会想要更多像“嘿,我是 JJ Abrams 的粉丝,我喜欢他的风格和作品。给我更多那样的东西,而不是某个青少年用图像生成模型弄出来的随机垃圾”这样的内容。但这场辩论非常重要。我不想让它掩盖了另一件事,那就是这些工具在解决一些非常重要的问题上可以极具价值。我们不希望正在进行的这边这场对话——虽然它很重要——阻碍我们推进另一边同样非常重要的工作。

这很有意思,因为你描述的框架大体上就是美国版权局在特朗普解雇国会图书馆馆长和版权登记局长之前发布的那份框架,而那件事似乎起了反作用。现在那个职位上坐着一位更加极端的版权最大化主义者,因为那份报告曾指出,训练数据的某些用途显然属于合理使用,比如学术和研究。

我给你读一下版权局上周发布的初步报告中的原话:“对海量受版权保护的作品进行商业性使用,以生成与这些作品在现有市场上竞争的表达性内容,尤其是通过合法途径获取、未经许可就拿走这些内容的做法,超越了既定的各种边界。”

所以这里存在一个区分。某些领域,比如医学影像,其效用如此之高,且工作具有足够的变革性,那可能是没问题的。但还有一些情况,就是你复制了世界上所有的 YouTube 视频,然后让人们去制作更多的 YouTube 视频,那恐怕就不行了。你能设想一个适用于 Microsoft 正在构建的工具的框架吗?在这个框架下,你可以明确说我们要做这些事,不做那些事。

我认为我们愿意进行任何合理的对话。我觉得你只需要参与进来,而且底层技术在什么是可能的、什么是不可能的问题上存在一些技术限制和约束,但我认为这里完全可以进行一场非常丰富的对话。还有一点很有意思,正如你准确地指出的,我认为我们正日益耗尽所有可用于训练模型的数据,因此我们现在进入了一个阶段,许多系统正在使用一套技术进行训练,这些技术不再像过去那样依赖数据,所以可能存在各种技术手段来增强模型的推理能力,而不再像某个时期那样必须依赖摄入大量的原始数据 token。

还有一点也是事实,我想我们上次聊过,那就是人们对数据质量、一个数据 token 对模型推理能力的贡献有多大,正有着越来越好的理解。而最重要的一点,我对这一切最大的心结在于,把模型当作数据库、当作信息检索系统,如果你想谈一个次优系统的话,从效率的角度看,它们作为数据库其实很糟糕。所以再次回到 NLWeb 这类东西,模型学会了如何推理,就像你可能教会一个生物大脑如何去推理一样。

而一旦你拥有了某种水平的推理能力,有趣的是,逐个 prompt、逐个项目地,你能获得什么信息来进行推理?而你如何对这两者进行商业化,以及这两者在业务中的份额占比,可能会非常、非常不同。比如说其中一种情况,如果你需要一个对突发新闻进行推理的模型,如果你有类似 NLWeb 的东西,并且订阅了一堆新闻机构,你就可以在出版商愿意允许的情况下,通过用户的授权 token 让 agent 访问这些订阅,然后让模型基于这些信息进行推理。你支付订阅费,是为了获得这些短暂存在的内容用于推理。所以我认为,随着时间的推移,我们可能能够找到各种方式来解决商业模式的问题。

我想把这些串起来。听起来,伴随着新的搜索项目 NLWeb,以及对 MCP 的投资并希望它更广泛地普及,这给人的感觉是,你正试图为整个网络带来一次架构层面的彻底转变。这是一种新型网络,你正试图发起并激励它的创建,因为旧网络的契约似乎已经瓦解了。这样的概括公平吗?

我不知道旧网络的契约是否已经瓦解,但我认为,是时候让我们思考某种新的契约了。我觉得,当我们所有人都在集体思考新事物时,我们应该像每一位优秀的建筑师思考新事物时那样去做。也就是说,回顾过去几年,哪些做法对所有参与者和利益相关方有效,哪些无效,然后让我们去尝试创造一种对所有人都更好的东西。当所有人的激励一致时——创作者和消费者的利益达到平衡,并且没有一大堆奇怪的中介去限制效用和价值如何交换——我们才能获得最好的结果。

好吧,祝你好运,因为到目前为止,创作者们对自己的利益所在有着非常明确的立场。Kevin,显然我可以跟你一直聊下去。你得尽快再来做客。我想持续关注这个网络项目的进展,看看它随着时间如何发展。

对本集有任何问题或评论?请发邮件至 decoder@theverge.com。我们真的每封邮件都会读!

The Verge 出品的一档关于宏大构想与其他问题的播客。

Bluesky 的新任 CEO 想要的是一顶大帐篷,而非一个气泡播放关税并未让制造业岗位回流美国播放 Apple 起诉 OpenAI 一案事关谁来定义后智能手机时代播放 Jill Lepore 博士谈为何对 AI 的抵制对未来至关重要播放 “没有公司会为你去坐牢”:Proton 的 CTO 谈如何平衡隐私、政策与信任播放就连 Nvidia 汽车业务负责人也要与 Nvidia 争夺算力播放 Bluesky 的新任 CEO 想要的是一顶大帐篷,而非一个气泡 Nilay Patel 8 月 3 日播放关税并未让制造业岗位回流美国 Nilay Patel 7 月 27 日播放 Apple 起诉 OpenAI 一案事关谁来定义后智能手机时代 Nilay Patel 7 月 23 日播放 Jill Lepore 博士谈为何对 AI 的抵制对未来至关重要 Nilay Patel 7 月 20 日播放 “没有公司会为你去坐牢”:Proton 的 CTO 谈如何平衡隐私、政策与信任 Nilay Patel 7 月 16 日播放就连 Nvidia 汽车业务负责人也要与 Nvidia 争夺算力 Nilay Patel 7 月 13 日广告主内容来自这是原生广告的标题

Facebook Threads Instagram Youtube RSS 联系我们向我们爆料社区准则存档关于伦理声明我们如何评分和评测产品 Cookie 设置使用条款隐私声明 Cookie 政策许可常见问题无障碍平台状态 © 2026 Vox Media, LLC. 保留所有权利。

The Verge The Verge 标志。登录以查看你的通知,或创建账户加入对话。