大家好,我是 Google DeepMind 团队的 Logan。欢迎回到本期特别版 release notes。今天和我一起的是 Josh Woodward 和 Tulsi Doshi。我们现在就在 I/O 现场,第二天,很兴奋能聊聊我们刚刚发布和交付的所有内容。一切都很棒。你们两位在舞台上表现太出色了,看得很过瘾。观众在欢呼,网上的评价也非常好。谢谢你们坐下来聊这些。很高兴来到这里。对我来说,第一天的整体感受非常积极,大家都很兴奋。我觉得我们发布了一系列很棒的产品。昨晚我给一个人发消息说,今年的 I/O 感觉像是 Google 最好状态的表现。真的。我觉得这是第一场让我感到真正 AI 原生的 I/O,而不是我们好像刚刚迈入 AI 时代的第一步。所以,我想听听你们两位对昨天一切的反应。昨天太精彩了。后来我在现场走动时,有人把它比作“Google 嘉年华”。我真的觉得现场氛围就是那种感觉,我们传递出大量兴奋和能量,而这些兴奋和能量又源源不断地反馈回来,这真的很棒。对我来说,这届 I/O 不仅仅是发布新产品——这本身就很棒——更是一个关于势头的故事。我们真的感觉已经进入了状态。从 Gemini 的角度来说,我们不仅是在讲述 Gemini 作为模型本身有多出色——确实如此——我们还在讲述 Gemini 如何融入我们的产品,如何以真正有意义的方式触达真实用户,无论是从开发者和 API 与 jewels 的角度,还是从 AI mode 的角度,或者是从眼镜的角度。我们讲述的是 Gemini 如今正处于这样一个时刻:我们可以真正按照用户希望使用它的方式将其带给他们,我觉得这非常棒。是的,我觉得这大概就是主题。如果给昨天贴一个标语,对我来说应该是“从研究到现实”。真的是把大量研究成果落地了。对啊,做个好标语。给我一件 T 恤,上面写着“从研究到现实”,再加一个 Gemini 的 logo。不过我觉得,纵观开发者产品、消费级产品,我们甚至还没提到正在推进的企业级业务,那一个月前的 Cloud Next 已经讲过了。我觉得这是全公司各方面凝聚在一起的成果,而 I/O 总是一个疯狂的时刻。有时候你得在最后一刻才把东西拼凑好,多半甚至是今天早上之类的。但这真的很棒。所以从我们这边来说,Google Labs 和 Gemini app 都带来了很多东西,很高兴能分享其中一部分,也期待大家的反馈。好。其实我先想从另一个问题开始,这个问题不是我的原创,是昨晚有人提出的。我当时和 Yunhan、Bibo 一起参加了一个 panel,他们都在你们团队,panel 主持人问我们想象中的 I/O 2030 会是什么样子。这个问题非常有趣,他们俩都给出了很棒的回答。所以你们两位的压力不小,但我很好奇你们怎么看,I/O 2030 会是什么样子?2030 年?也许我先说说我当时的回答。好啊,你先开始。我的说法其实和 Tulsi 你说的方向一致。我觉得历史上 Google 是一家拥有非常多不同产品的公司,但此前一直缺少一条能够将它们全部串联起来的主线。我想某种程度上唯一把它们联系在一起的就是你的 Google 账户,或者 Google 的基础设施。而现在越来越明显的是,Gemini 就是这样一条产品线,把 Google 所做的一切整合在一起,这真的很酷。我当时还想到开发者生态系统。历史上不同的开发者社区彼此非常割裂,但现在 Gemini 和 Android Studio、Gemini 和 Chrome、面向 Web 开发者的 Gemini 等等,正在把所有人凝聚在一起。我觉得我们会在 I/O 上看到越来越多这样的叙事,即 Gemini 成为把 Google 自身以及我们的客户凝聚在一起的机制。不过我很好奇你们对 I/O 2030 还有什么别的看法。好啊,你想先回答吗?好。我觉得这很有意思,因为当你提到 I/O 2030 时,我想到三件事。第一,到 2030 年技术会变得非常疯狂,对吧?仅从 2024 年到 2025 年,Gemini 的能力就已经令人惊叹了。所以我们将会看到这样一个世界:Demis 昨天展示的关于通用虚拟助手的愿景,以及 Gemini 成为你生活中主动参与的一部分这一理念,将会真正实质性落地。因此我认为,Gemini 的形态、我们谈论 Google 产品的方式,以及人们与技术乃至与世界交互的方式,都将变得不同。这将是 I/O 的重要组成部分。第二,正如你所说,我认为我们会真正把各个部分整合成更加统一的体验。不再是我在这里用这个、那里用那个,得到三种不同的东西,而是 Gemini 真正跨我的各种界面、跨我的各种设备为我工作。然后第三,我觉得 I/O 本身在 2030 年也会看起来不一样。2030 年的互联网会不一样,我们消费和参与内容的方式也会不一样。你只需要派你的 agent 去 I/O,它就会消化所有内容,搞定搞定搞定。不过说真的,我觉得一切都会变得不同。我觉得有趣的是,2030 年感觉太遥远了。所以你刚说 2030 的时候,我第一反应其实是:也许说的是 2027 年吧?我不知道。对啊,也许我们先撑到周四再说。在 Google Labs,我们有时会做一个有趣的练习:想象你跳进一艘神奇的飞碟,被发射到未来,你有几分钟四处看看,写下关于未来的一切,然后回来。目前我们只做过去到 2028 年的这个练习,所以额外多出来的那两年,2030 年,谁知道呢?不过确实,甚至在 I/O 上我们昨天发布的一些产品中,我们已经看到很多界限正在模糊,关于什么正在成为可能的界限。而且门槛正在降低,无论是所需的时间、所需的技能,还是成本。以及谁能使用它。这些全都与人有关。所以当你思考软件开发、创造力、知识或其他任何领域的未来时,是的,四五年后会非常有趣。但我确实认为,整体趋势是朝着民主化这一切的方向发展。看看我们昨天发布的 Flow 这类产品或其他产品,感觉这将会是一条核心原则。至于展会形式之类的东西,那就谁知道呢。我是说,正因如此,看到 VEO 在昨天的发布会上如此引人注目,真的很酷。对吧?它真正参与了叙事,甚至参与了 IO 的创作。而且这可以说是我们做这件事的第一年,对吧?甚至是第一个月、第一周。我觉得,如果你仅以这一点为例,也能看出 IO 这场发布会本身将会如何演变。实际上,我们在制作昨天那场发布会时,在很多环节都用到了 Gemini 和 VEO。我觉得这将会非常非常疯狂。是的,是的。你团队里的 Yunhan,她是后训练(post-training)负责人之一,对这一点有个很棒的评论。她说她对 2030 年的期待是,希望我们届时能宣布一些由 Gemini 促成的重大科学突破。我觉得这个回答特别有意思,你可以顺着“普及访问权”这条线索去想象。我觉得最妙的是,世界上某个地方的一群大学生,开箱即用 Gemini,然后发现了某种全新的科学原理,或者治愈了某种疾病之类。我觉得那会是一个特别疯狂、特别精彩的故事。对。嗯,我觉得昨天发布会最后是我最喜欢的环节之一,Sundar 当时退后一步,谈到如今的人工智能研究将如何成为 2028、2029、2030 年及以后的现实。我觉得想想那些科学突破,无论是医学领域,还是 FireSat 的救灾工作,或是 Wing 运送医疗物资或水,Waymo、Isomorphic Labs 等等。我觉得有一大堆这样的事情,看看它们如何层层叠加,将会非常有趣。我觉得还有一点很酷,那就是我们谈论 AI 时,往往聊的是更面向消费者、更触手可及的层面,比如它如何开辟你与 AI 日常互动的新方式。但我认为,你提到的科学突破以及你举的例子,也说明了我们在当今世界以及当下人们所关切的问题中能扮演什么角色,对吧?无论是气候变化,还是普及访问或医疗保健,我们如何把其中一些原理拆解开来?我觉得这真的非常了不起。对,我觉得昨天另一个贯穿始终的线索就是 Google 业务的广度。科学这块特别棒,我们既能做 VEO、拥有各种酷炫有趣的技术,同时也能说到做到,真正去做硬核科学,并通过这个视角帮助世界。不过我们来聊聊昨天发布的一些产品吧。你们俩都参与了,而且昨天宣布了一大堆东西,你们谁想先来?Josh,你先来吧。好的,大家想要更多 Gems,想要更多 Flow,想要更多 VEO,更多 Gemini 应用。所以我觉得需求大得惊人。嗯,要说的很多。首先,这简直是一次难以置信的跨团队努力。所以任何看到台上那些人的人,都知道背后有海量的人一起为此付出。我是说,也许先从 VEO 3 开始吧。宣布这个特别有意思。最大的 headline 是,你现在可以直接让画面动起来,让图片动起来。它们能说话,还有音效和背景音。我还记得当我们拿到那个 checkpoint 时,我第一次看到那些视频,完全被震撼了。是的。过去 24 小时里大家的反应就是这样:很难想象你只需要用自然语言描述一下,它就能活灵活现地呈现出来。所以这是模型层面的突破。它是最先进的,建立在去年 12 月最先进的 VEO 2 模型之上。这背后是巨大的创造力。太厉害了。不可思议。从核心研究层面来说就真的不可思议。然后,基本上在不到 100 天前,我们说要打造一款配得上这个模型的产品。于是就有了 Flow。这是一款面向 AI 电影人的工具。我们有意和行业里的人共同创作。所以这里面有你可能在好莱坞认识的超级大腕,也有新兴的 AI 电影人,他们正在用原生 AI 制作自己的第一部电影。所以我们努力听取了方方面面的意见,并且以 Google Labs 和 Google DeepMind 创意实验室一种不太寻常的方式进行了共创。所以产品功能、来回打磨的过程,都是和这群优秀的创作者一起测试的。所以当你看到“哦,你可以剪辑片段”时,任何视频编辑产品当然都能做到。但当你去延伸画面时,背后其实有大量工作,尽管屏幕上看起来那么简单;还有电影制作人的大量反馈,比如“如果你能这样做,那就太棒了”。于是我们就试着把这些做进了工具里。呃,所以是的,它昨天就在舞台上发布了。TPU 立刻变得非常烫。我们呃,我觉得我们甚至 hopefully 已经增加了更多容量来满足需求。呃,不过是的,我们真的很兴奋想看看它接下来会走向何方。我们对它的愿景是,它真正是一款赋能创意叙事者的工具。它不是用来取代的,而是用来赋能的。昨天在 Google 看到的很多东西,都是这个主题。呃,而这,我想,是一种视觉化的实现方式吧。我很喜欢这个。而且对于那些——我今天早上看了一大堆视频,完全被震撼了。是的,真的太厉害了。那现在要怎么才能用上呢?好的好的。目前它基本上可以在两款产品里用到。你可以在 Gemini 应用里使用。酷。或者在这个叫 Flow 的新产品里。因为现在刚开始推出,我们把它放进了这个新的 Google AI Ultra 计划里。这个 Ultra 计划,你直接 Google 一下就能找到。呃,前三个月五折。就像我们今天上场前我说的那样。呃,它能让你用到 Google 所有最顶尖的 AI 功能。所以我们设计这个 Ultra 计划,就是为了让它是你通享一切的 VIP 通行证。所以它能使用 VEO 3,有所有功能里最高的速率限制。呃,里面还有 YouTube Premium,30 TB 存储空间。我们基本上就是想打造这样一个计划:如果你想要最好的,那就选它。对。这就是你今天能获取它的方式。随着时间推移,我们会把它引入到其他层级里,让更多人都能用上。我很喜欢。呃,这是使用 Flow 的唯一方式吗?就是 Flow 是 Ultra 套餐的一部分,它不是那种你可以按视频付费的独立产品之类的?没错。是的,按量付费其实是最常被提起的诉求之一。是的,是的。大家已经在问:“能不能直接买积分,按使用量付费?”所以我看到一堆推文说:“Josh,请提高速率限制。”我就说:“这事我可没法提高速率限制。”所以你得——我会直接艾特你,找到源头。直接找 Josh。直接找 Josh。我们听得清清楚楚,正在努力。是的。Josh 其实就在后台——不,好吧,我们没料到需求来得这么快。所以需求量很大。大家已经开始撞到一些速率限制了。是的。所以我们正在处理,正在处理。是的。说到音频加视频的创新,这和 Veo 有关吗?我们也在讲 Gemini 原生音频的故事?应该聊聊这个。这些技术在创新层面上是如何联系的,还是只是类似的想法,又或者两者之间有什么共通之处?我认为有相似之处,不过我也觉得实际的技术突破确实是不同的。明白了。那么在 Veo 的语境下,我们真正想做的是将音频和视频结合在一起,对吧?并且能够以某种方式生成它们,让这两者真正相互融合、形成统一体。在原生音频的语境下,我们给 Gemini 带来的就是让它能够说话的能力。当我们说“原生”的时候,真正的意思是:Gemini 不是先生成文本,再将文本转换成语音,而是直接自然地以语音形式生成它创造的内容。这让你能够真正专注于让对话感觉更自然。所以它不会像你预期的那样,模型说话比较单调,而是更有情感,语调变化更丰富,你可以改变风格。你可以让它说话声音更大或更小,或者更戏剧化,甚至像海盗一样。你可以改变模型说话的风格。所以当你得到结果时,会感觉它更像是在对话,对吧?我们实际上把原生音频放到了 NotebookLM 里,看到它的效果很棒,看到它在很大程度上甚至支持了 ITN,对吧?因为原生音频让你能够无缝切换语言,所以 NotebookLM 能够支持多种语言。你不必明确设置“现在说英语”或者“现在说印地语”。你可以拥有这种灵活性,对吧?有人在这方面提到我。我说我和 NotebookLM 没关系。我说我找了人来帮忙。很有意思。另外,当你获得 Tulsi 描述的这些新能力,以及团队发明的新技术时,这真的会改变你对产品构建的思考方式。是的。像 NotebookLM 和音频概述这样的功能,甚至现在在 Gemini 应用里,开箱即用就支持 45、55、70 多种语言。这不仅开放了访问权限,还降低了延迟,让交互性大大增强。所以我最喜欢做的事情之一就是,你打开其中一个播客,点击加入,直接拨进去。然后你就和主持人聊起来了。你在 Gemini Live 里也能看到类似的东西,对吧?我认为这些是基于这些新能力构建的新型交互方式,但我觉得我们才刚刚开始探索它解锁了哪些产品可能性。而且它的用途非常广泛。原生音频中一个很酷的点是我们仍在实验的,你可以在 AI Studio 和 API 中尝试并测试,就是“主动音频”这个概念,对吧?也就是说,模型能够分辨出我们是在彼此交谈,还是在跟模型说话。所以它知道什么时候该回应,什么时候该打断,什么时候该保持沉默。这太棒了,对吧?然后回到你说的产品新可能性,如果你做不到这一点,你就得围绕所有这些边界情况来设计产品,对吧?因为你会想,我怎么确保设置了正确的限制?但如果模型能够有意识地决定如何回应,你现在就可以开始创造更有吸引力的体验,真正融入你的日常生活,我觉得这也变得非常酷。是的,完全同意。Josh,关于 Gemini 应用的一个问题和所有这些音频功能有关。现在 Gemini 应用里的 Live API 或者说 Gemini Live 模式,感觉像是一个截然不同的 Gemini 应用体验。你点进去之后,视觉效果和应用的其余部分完全不同。你觉得这在多大程度上是因为技术本身与现有功能相对独立而带来的产物?但随着它逐渐融入主 Gemini 模型,你认为我们会看到这些能力更多地融入到所有功能中吗?我觉得还有其他一些公告。现在所有人都可以免费在 Gemini 应用里试用了。是的,没错。这也是我们整体战略的一部分。我们想让所有这些很棒很酷的功能都变得可用。是啊。我很喜欢你是个这么硬核的 Gemini Live 用户。是的,是的。我很喜欢。没有,我昨天其实还在用它处理一些事情。我觉得你说得对。现在,你确实会进入一种不同的模式。有那种水滴动画。整个界面都变了。感觉像是进入了一个不同的地方。这挺酷的,因为它确实像是一种神奇的差异化体验。我不知道这是否就是这样。这就是最初的设计理念。我觉得我们在思考如何把这些元素带出来,因为有趣的是,当人们进入那个模式后,对话的平均时长比文字对话长五倍左右,因为这是一种更加自由流畅的交互体验。所以,我们很有兴趣看看能否把其中一些原则带到应用的其他部分。因为想到 Gemini,我们正努力让它成为最个性化、最主动、最强大的助手。而主动性这一点,我觉得到目前为止在很多 AI 产品中都缺失了,甚至我们在 Google Labs 里做的那些产品也是如此,对吧?所以我认为有一个很大的机会,就是把很多这样的原则拿过来,比如:嘿,实际上这个 AI 助手当然会在你说话时回应你,但它也会主动给你带来东西。带来那些对你真正重要或非常及时的东西。所以我觉得 Gemini Live 的体验中可能有一些种子可以以这种方式传播开来。不过这挺有意思的,因为我确实觉得,我很好奇,感觉你们构建 Gemini Live 时背后有一个不同的心理模型,这可能不一定是坏事。围绕着对话这个概念,对吧?比如我可以开车时进行一次对话,让对话本身就是……但我想按照你说的,也许问题在于如何把那些“我实际上可以为你采取行动”的元素带进来,那会是什么样子,以及如何把这两件事更紧密地结合起来。我们已经看到很多人这样做,他们甚至就这样称呼它——“Go Live”。他们想把 Gemini 带进他们正在做的任何事情中。这就是为什么昨天相机和屏幕共享的发布如此重要,因为当你和 Gemini “Go Live” 时,就像是:“好了,这是我的摄像头。现在,帮帮我,Gemini。修修这辆自行车或者别的什么。”你懂我的意思吗?所以我觉得这很有趣。它正在变成一个动词,而我们甚至都没计划过。所以我们会顺应用户的这种行为,因为这里头有点意思:“哦,好吧。它就像在此时此刻帮我。”
嗯,这个主动性的功能在 iOS 和 Android 上都可用。我觉得它在桌面上也会非常强大。所以这是我每天都要被问到的那个避不开的问题。没错,大家想要桌面应用。Gemini 桌面应用,他们想要这个。他们都在求我们推出。我们能……我们能拿到一款 Gemini 吗?你能就在镜头前承诺一下吗?我喜欢……我喜欢……我喜欢这种方式。我都不知道这是个陷阱。好吧,那么这就是我们桌面应用的方向。另外,我们昨天还宣布了一件事:Gemini 将接入 Chrome。太好了。这会是……这会是一个开始。它会在你的桌面上运行。当你点击那个闪光图标时,屏幕上会出现一个可以浮动的 Gemini,你可以把它拖到任意位置。太棒了。这样一来,如果你是 Chrome 用户,希望你以后会很喜欢这个功能。未来我们还会不断增加更多能力。现在这个功能有什么限制?我还没怎么试过。总体来说……我在 Gemini 应用里能做的所有事情,在那里都能做吗?是的,目前的起点其实已经内置了很多功能。你基本上可以把 Gemini 唤出来。最酷的是,我们会抓取你当前浏览页面的上下文,并自动放进 context window 里。太神了。这很有帮助。是的。各种问答、长文本侧边栏之类的东西都能直接用。我们还内置了 Gemini Live,你可以像平时一样跟它对话。而且当然,你可以随意拖动它。我们不想把它固定死在屏幕某个角落,因为……像你这样有多个屏幕的人,肯定需要来回拖动。我其实只有一个屏幕,配置没那么好。我想……我想这就是目前的起点。未来我们希望能加入更多功能。比如我们昨天演示的 agent mode,还有 Project Mariner 的一些能力,如果你只需点一下图标——还有键盘快捷键——就能唤出它,派发一个任务,然后它自动帮你完成,岂不是很酷?是的。这就是我们的方向。关于独立桌面应用,尤其是 Mac 版的呼声,我们已经听得非常清楚。所以确实有一支团队对此非常兴奋。等时机成熟,也就是准备好了的时候,我们会分享更多信息。昨天另一个主线就是全新的 Gemini 模型。DeepMind 带来了 Gemini 2.5 Pro。Mariner 也让大家非常兴奋,它是 Gemini 主模型的一部分。我们还发布了 Gemini diffusion。Tulsi,你宣布了一大堆东西。我当时的反应是叹为观止。如果大家还没试过 Gemini diffusion,它真的疯狂。跟我们说说——对,如果你还没试过,一定要去 waitlist 上报名,因为……我不知道你有没有机会试过。它太惊艳了。太惊艳了。所以,我觉得我们昨天发布的 Gemini 模型系列真正酷的地方在于,它覆盖了整个光谱:一端是我们努力让模型性能更强,对吧?从质量角度来说。Deep Think 本质上是从推理角度推动研究前沿,对吧?我们试图回答:如果我们让这些模型进行更深入的推理,允许它们审视多种假设再确定答案,能否真正大幅提升编程、数学、推理以及多模态表现?答案是肯定的,我们在 2.5 Pro Deep Think 上确实看到了这一点。它在基准测试上达到了 state-of-the-art,而且用起来也非常酷。所以在 Deep Think 这边,我们现在的感受是:哇,这是一个真正具备这些能力的前沿模型。我们需要认真思考安全策略是什么,如何确保人们在使用这款模型时我们是审慎而有意的,然后再逐步推出。所以我们正处于这个阶段。这算是一种极端:如何推动推理方面的研究。
Diffusion 则是另一端,即如何推动速度、效率以及与模型交互新方式的研究。diffusion 的酷之处在于,到目前为止 Gemini 采用的是从左到右生成的方式,也就是按顺序生成。而 diffusion 没有这种限制,它会通过一步步细化来完成生成。如果你在 I/O 上看了我们展示的视频,你能实时看到它在修改答案。但因为切换太快,你几乎看不清。I/O 上的金句就是“眨眼间就错过了”。不过如果你看了慢放版本,就能看到它实际经历的过程。速度实在太快了。这某种程度上展示了我们希望 Gemini 前进的方向:一方面大幅降低延迟、提升效率,并带来编辑和交互的新方式;另一方面则在 2.5 Pro 及其推理能力和性能上持续突破。当然还有我们的主力产品 2.5 Pro 和 2.5 Flash。昨天很酷的一点是 2.5 Flash 也迎来了更新。是的,太棒了。它的性能在过去一个月里提升了很多,很大程度上是来自开发者的反馈,我们试图弄清楚开发者正在哪些场景使用这些模型,以及我们希望在哪些方面继续推进。比如它的编程能力强了很多,多模态表现也在提升。它真的是一款很棒的模型。而 2.5 Pro 我们实际上在两周前就提前发布了。对,I/O 版本,两周前。就是为了让大家能尽早开始基于它做开发。这非常令人兴奋,因为大家用它生成 web app 的能力太疯狂了,我们看到人们做出来的东西。这也非常酷。而且很快也会 GA,这非常重要。人们的反馈大多是:给我们一款能用一年的模型。对,就是“好用,但我们想长期用”的意思。我想说,这个反馈我们肯定听到了。我们非常想确保给开发者提供一款稳定的模型,一款能持续一年、可以用来构建稳定生产系统的模型。所以对于 2.5 Flash 和 Pro,Flash 我们在 I/O 上预先宣布了,将在六月初推出;Pro 也会在随后非常快的时间里推出。我们真的希望确保开发者既有稳定的生产级模型可以持续构建,也有渠道让我们不断发布模型、获取开发者反馈。是的。所以我们也在与 Gemini 应用团队合作,确保我们有方式持续测试这些模型、收集反馈,并兼顾到所有方面。两周前提前发布 Pro 模型的另一个好处是,我们收到了大量反馈,关于大家喜欢初代模型的哪些地方、喜欢新模型的哪些地方,以及他们在哪些地方感受到了差异。这也非常有帮助,因为基准测试只能捕捉部分变化,而人们真正产生共鸣的地方其实是非常宝贵的反馈,我们可以将其融入模型的训练和迭代中,这很棒。Pro 上的 thinking budgets 也是另一项头号需求,大家希望能控制推理量,尤其因为它比 Flash 贵一点,所以用户本质上想控制成本、时间等等。thinking budgets 基本上允许你从关闭它开始,也就是零推理,一路扩展到比如 16K budget。你可以决定让模型进行多少推理,而这本质上是我们希望用来代表成本和延迟的指标。还有 summaries 功能,这也是另一项更新。对了,谢谢你提醒我。现在我在想,我刚才要说什么来着?天哪。是啊,我今天早上还在想这个。我当时觉得,事情太多了,实在太多了,我完全理不过来,因为同时发生了太多别的事。不过,我觉得从中让我印象最深的一点是,你总结得非常到位。现在各种进步都在发生。如果你是开发者,如果你在经营一家公司,如果你是 CEO,我认为现在就是全力投入 Gemini 的时机。没错。你能看到进步的速度,简直不可思议。我认为它是全球最好的。不管是已经 GA 的模型,比如 2.5 Pro,还是未来几周将要推出的 2.5 Flash,还是像 diffusion 这样的技术,或者 deep think 模式,你想到那个 Pareto frontier 的广度,我们正在把它向外推进。眼下只有一家公司在推动这个边界。所以,我记得之前有很多疑问。Gemini 是新东西,这个 Gemini API 到底是什么?作为开发者,我能信任它吗?它能满足我的需求吗?而且我想你也看到 Sundar 甚至宣布了 Cursor 上的增长。没错。Cursor 上有一群最顶尖的开发者,他们在把所有这些模型推到极限。他们选的是什么模型?选的是 Gemini。所以,我觉得已经有了所有这些证明,我想很多人,我是说你每天在 X 上跟大家交流,我觉得他们也看到了,而且我认为时机就在现在,因为我们不会放慢脚步。对。无论是在进步还是变化方面。所以我希望这次能把这些整合在一起。这也非常棒,因为说到 Cursor 和开发者真正在他们想构建的地方使用 Gemini,我认为从中我们其实得到了非常、非常真实的反馈。比如说,我们在 2.5 Pro 第一个版本和第二个版本之间做的一项改动就是 tool calling。对。因为我们从 Cursor 和 Cursor 用户那里收到了很多反馈,说 tool calls 有问题。而且我们在这方面仍有改进空间,也仍在继续与各个 IDE 迭代协作,但正是这种真实的反馈让我们能够做出更易用、更丰富、功能更完整的产品。我觉得这很了不起,因为背后有一整支团队在这些环节上努力。他们非常投入,而我觉得很棒的是,这是全方位的努力,从模型层面的改动开始,也就是真正去训练模型,确保模型本身能力超强。也包括 serving 层面的改动,确保整个技术栈都能以丰富的方式支撑这些模型。还有 TPU 在满负荷运转,所以要确保容量按我们想要的方式运作。这是一整套团队协力,而且看到我们所有的研究人员也都真正接纳这些反馈,说“等等,这是我们从开发者那里看到的,这意味着什么?我们怎么把它融入进来”,这真的非常棒。是的,另外我想补充一点,这也是一个很美好的故事,我们在开发者所在的地方与他们相遇。要知道,完全存在这样一种可能:Google 做出了最好的编程模型,却只放在我们自己的产品里。我认为那是错误的做法,而我们现在采取的做法是,我们知道大家在用 Cursor,我们知道大家在用 Klein,我们知道大家在用 Bolt、Lovable 以及所有其他那些开发者产品,那我们就把模型带到这些开发者身边,让他们能在自己想构建的地方使用它。你应该在自己想构建的地方使用 Gemini。对。然后我们应该让 Gemini 适配那些环境。我觉得这太棒了。作为一名 PM,我觉得产品开发过程中最棒的时刻就是当你真正开始收到真实用户反馈的时候。这让事情变得简单。当人们告诉你什么不能用、他们希望添加什么功能时,事情就简单了。我喜欢开发者作为用户的一点就是他们非常敢言。没错。他们会告诉我们他们想要什么,不管是 Gemini 真正出色的地方、他们喜欢的地方,还是不好用的地方,这都很棒,因为我们确实可以据此采取行动。外部开发者的看法方面,我们对已经落地的所有功能都非常兴奋,不过我觉得这个故事的另一部分是为开发者推出的新产品。我认为 Jules 就是其中之一,Stitches 也是其中之一。我们还推出了代码生成 AI studio,也就是你演示的那个。你的演示太棒了,说实话简直不可思议。我总是很惊讶当一切真正整合在一起,变成一个真正亮眼、制作精良的演示时。所以你表现得很出色。Josh,你能不能给我们介绍一下 Jules?我记得我们去年 12 月低调地发布了一个研究预览版,但现在终于向所有人开放了。没错。是的,Jules 很有意思,它一开始就像 Google DeepMind 和 Google Labs 里很多项目那样。我们一小群人当时在聊,如果能做一个异步编程代理是不是很酷?那大概是万圣节前后,也就是十月、十一月,很久以前的事了。所以我们在 12 月做了第一个版本。Jules 背后的理念是我们真的想给你一种方式,让你可以把不想做的任务指派给这个编程代理,这样你就能腾出时间去做真正想做的事。所以我们昨天宣布的是迄今最大的一次更新。它的核心是 2.5 Pro Gemini,最好的编程模型,然后它就开始为你工作。它可以修 bug、做测试、处理一些文档工作。另一个有趣的点是我们创造了其他方式,我们更多把它看作一个开发者可以去的 hub。大家知道,做法各不相同,有些人想在命令行或其他地方构建东西。我们的想法是,如果你有一个地方,有点像你的指挥中心,可以在那里观察所有这些事情的发生,应该会很有趣。没错。而且这让你能从不同的角度去思考。所以我们在团队里的使用方式是,你关联自己的 GitHub 仓库,Jules 就可以开始介入,你可以给它分配不同的任务,它会给你返回 PR,你可以批准、拒绝、编辑,随你怎么处理。但它还有一些功能,比如一个叫 Codecast 的功能,昨天非常受欢迎。我们甚至得去调配计算资源。它基本上能让你获得一个摘要,就像播客摘要一样,介绍你的代码库在发生哪些变化。我们团队的使用方式是在开车上班的路上听。一夜之间,CL 不断合入,你就能对自己的代码库在发生什么有个大致感觉。我们原以为这有点实验性质,但大家非常喜欢。因为它能让你心中有数,了解代码的变化,这样当你到了公司,就不用花大量时间去搞清楚状况。你已经有个大致概念,然后就可以直接去做你想做的事。我们就是这样用的。我们在实验室团队会跑 bug bash。你可能攒了 38 个 issue 的 backlog,然后 Jules 就开始猛攻其中一些。它实际上现在开始创建功能了,不只是修 bug。所以我觉得这个领域非常令人兴奋。现在我们有了 Gemini 2.5 模型,它在编程和推理方面表现出色,还能进行规划并执行多步骤操作。我的意思是,我们才刚刚开始。目前它处于公开测试阶段,如果你访问 jules.google 就可以试用。现在你每天可以执行五个任务,之后我们会提高上限,目前只是在尽量控制需求。但这是一款全新的产品,我们认为它代表着软件开发的未来。作为一名专业开发者,希望它不仅能大幅提升你的工作效率,还能让你的工作变得更加愉快,因为你可以把时间花在真正想做的事情上。希望其他一些事情你可以交给它处理。我觉得有一点很酷,就是我们如何看待代码相关产品,以及如何在 Gemini 中改进代码能力,这又回到了我提到的“范围”问题。Jules 我认为是真正为专业软件工程师打造的,为那些想要摆脱一系列任务,或者想要实现协作式开发环境的开发者而设。然后是 canvas 和 Gemini app,它们主要是为 vibe coding 打造的,对吧?还有 code gen 和 AI Studio,这可能比前者更进一步,因为它的目标是帮你轻松将东西部署到生产环境。所以,我们可以聊聊 Stitch,我觉得既然现在我们有了一款出色的编程模型,就存在这样一个范围:一方面,我们想让这个模型在哪些不同类型的开发者使用场景中变得更好;另一方面,需要有哪些不同类型的产品界面来支撑这些工作流程。所以我认为这是关键所在,因为像 Stitch 这样的项目,没有这种 first principles 的思考是不会存在的。Stitch 背后的理念是,我们不要只是把 AI 硬塞进某个工作流程,而是如果重新构想整个工作流程呢?所以 Stitch 实际上不是从代码开始,而是从设计开始。嗯,它的思路是,如果你能描述想要的界面,它就直接帮你做出来。而且不只是生成一张截图,而是真正生成带有标记的设计文件。当你有了这些,你就从一个完全不同的起点开始了。我们认为这将为那些可能从未把自己当成开发者的人创造各种全新的可能性。但他们大致知道自己想要什么样的界面,知道点击那个按钮应该发生什么,或者想要深色模式。你明白我的意思吗?所以这真的开始走向民主化,降低了门槛。所以你提到的那个频谱,Jules 在一边,Stitch 在另一边,这是有意为之的。我们正在努力探索各种可能性边界。这真的很像我常跟团队说的,产品管理的历史就是围绕 PRD 展开的——什么是 PRD,或者你如何描述自己的想法——现在这一切都在发生根本性的改变,对吧?构建产品的方式。这就是酷的地方。没错,没错。你实际上可以探索它、制作原型,构建你能真实感受到的东西,其他人也能感受到,并且能以这种方式进行更深入的协作。我认为这完全改变了你设计产品的方式,无论你是不是工程师。这就是当下这个时刻。我过去的工作流程通常是,我会截取 AI Studio 的截图,然后拿到另一个产品去做代码生成之类的事情。而 AI Studio 中原生代码编辑和代码生成功能让我恍然大悟的那一刻是,我截了一张 AI Studio 的截图,然后进入 AI Studio 说“复刻这个”,接着我就开始 vibe coding,迭代一堆潜在的新功能,效果出奇地好,我当时就觉得这真的太棒了。这改变了你表达想法、迭代想法的方式。因为我觉得 PRD,或者任何文档,都是把你脑中的想法翻译成别人动手做出东西,这在很多方面都非常容易造成信息损耗。而能够不断尝试表达你脑中的想法,并亲自掌控整个过程,这是很美好的。所以我认为这又回到了提升人们在所有这些领域——设计、代码等等——进行创造的能力标准这一主线上。是的。嗯,这太棒了。我觉得这是我最喜欢的对话之一。在 IO 大会上面对面做这档节目真的很棒,我还能感受到现场的能量。面对面那期节目你跟我说过……我知道,我知道,抱歉,好吧,我得四处出差,我们以后必须都在面对面做。对于听这期节目的朋友们,我们讨论的所有内容都在简介里,去看看吧。你可以链接到所有产品,链接到团队所有精彩的发布。所以这真的很棒。我们有一份特别的惊喜送给你们两位。酷。作为对你们辛勤工作和整个团队辛勤工作的感谢。哦。这也某种程度上反映了当下的现实,就是大家对这些东西的需求非常大,而支撑所有这些需求的背后,正如你们马上会看到的……太棒了。等等,这太有趣了。TPU V4 版本。V4。我们不得不让团队在幕后超级努力地在全球搜罗 TPU,把它们带到这里。还挺可爱的。昨天我们把这些送给了一些受邀前来参加的开发者,现在送给你们两位作为特别的礼物,感谢你们的辛勤工作,所以……谢谢。谢谢大家。是的。好的,大家继续构建吧。是的,看到你们在做的事情真的很受鼓舞。也请继续给我们反馈。我其实不知道正确的摄像头是哪个,但不管它在哪,请继续给我们反馈。得把这些 TPU 收回去重新投入使用了。谢谢。