🎙️AI 访谈库
Josh Woodward:Google Labs 如何从 0 到 1 快速打造 AI 产品
Josh Woodward · Google 副总裁(Gemini App 与 Google Labs 负责人)

Josh Woodward:Google Labs 如何从 0 到 1 快速打造 AI 产品

Josh Woodward: Google Labs is Rapidly Building AI Products from 0-to-1

2025-03-18 · Training Data (Sequoia Capital) · 51m · 约 55 分钟读完 · 原文
接手 Gemini App 前夕的访谈,讲 Google Labs 的快速迭代方法论和 NotebookLM、Veo 2、Project Mariner 等产品,团队把这些工具称为交给用户的'AI 操纵杆'。最劲爆的数字:Google 已有 25% 的代码由 AI 编写,他并预言编程将在当年迎来大跃进。
只看

我们的创始人 我们的公司 我们的团队 故事 播客 Arc 开放搜索 Google Labs 如何推动 AI 应用前沿:对话 Josh Woodward 第 34 期 | 访问 Training Data 系列页面 跳转到 写提示词已经过时了 什么是 Google Labs? 接下来要做什么项目? Veo 2:AI 视频中已解决与未解决的问题 构建还不太灵光的东西 进展速度在加快吗? 视频消费的未来 像素流 vs 3D 模型?

Agent 与 Google Mariner 无限上下文的诱惑 计算机使用何时才能足够好用? 还招其他作者吗? 2025 年该在哪里构建? 现在 AI 领域什么被过度炒作了? 什么被低估了?

作为 Google Labs 的副总裁,Josh Woodward 领导着探索 AI 应用前沿的团队。他分享了关于快速开发流程的见解,解释了为何如今的书面提示词将变得过时,以及 AI 如何改变从视频生成到计算机控制的一切。他透露,Google 现在有 25% 的代码由 AI 编写,并解释了为何编程在今年可能会实现重大飞跃。他强调,在构建将塑造未来几代人工作与创作方式的 AI 工具时,品味、设计和人类价值观至关重要。

Google Labs 副总裁 Josh Woodward 分享了实验室内部创新工作与文化的见解,强调快速原型制作、市场匹配探索以及 AI 驱动产品不断演变的格局。他的经验凸显了创造力、技术与战略思维的交汇点,这正是 AI 创始人和创新者要在快节奏行业中取得成功所必需的。以下是本次对话的核心要点:

同时迭代产品与市场至关重要。尽管许多人专注于产品开发,但找到合适的市场匹配同样重要,以确保产品满足目标受众的需求与兴趣。这种双重迭代过程能够带来更成功、更可持续的 AI 产品。

AI 交互的未来正逐渐远离传统的文本提示词。Woodward 认为,提供给 AI 模型的上下文将演变为包含更自然的输入方式,如图像、视频和语音,从而使终端用户的交互更加直观,并为 AI 应用开辟新途径。

培育快速实验与容忍失败的文化。通过从想法迅速推进到用户测试,Google Labs 在大型企业内部保持了类似初创公司的环境,鼓励创造力与创新。这种方法使小团队能够开发和测试具有显著规模化潜力的产品。

AI 的应用层才是真正的价值创造所在。虽然 AI 模型和工具正在大力发展,但将这些技术整合到增强用户工作流程与创造力的应用中,才是产生重大影响与机遇的地方。

聚焦放大人类创造力,而非取而代之:AI 持续进步,尤其在视频与 Agent 技术领域。通过让 AI 产品顺应模型变得更智能、更快速、更便宜这一自然趋势,创始人能够确保其解决方案在长期保持相关性并持续创造益处。

Josh Woodward这些年做产品下来,我发现有一点很常见——大家都在谈 product-market fit,说什么你看到了就会知道,诸如此类,这确实没错。但至少对我来说,我一直觉得在做产品的初期,你会在产品上迭代很多次,却有时会忘记在市场侧也做迭代。找到合适的市场与做出合适的产品同样重要。你必须把这两者连接起来。

所以在 Mariner 这些早期项目中,我们就处于这个阶段。比如,AI 模型能否——就像——操控你的计算机?可以,这是一项重大的新能力。它准吗?有时候准。它快吗?目前完全不快。这就是我们在实际应用场景或能力层面所处的位置。然后接下来就是找到合适的市场。

Sonya HuangJosh,非常感谢你今天来和我和 Ravi 一起录制。我们很期待听听你在 Google Labs 做的一切。或许先从一个话题开始,你来的时候跟我提到一个颇具挑衅性的观点:写提示词已经过时了。你这话是什么意思?

Josh Woodward好的,感谢邀请。我确实认为这已经过时了。未来从终端用户体验回望这个时期,我们会说:“真不敢相信我们当初竟然试图往这些小框里写段落级别的提示词。”所以我觉得现在它正在分化。一方面,作为开发者、AI 工程师,你应该看看我们目前在 Labs 写的一些提示词,它们精美得像多页文档一样。但我认为对终端用户来说,他们没那个时间。而且你得像是某种“耳语者”才能解锁模型的能力。所以我们现在看到了更强的需求和吸引力。

我在行业里的其他产品中也观察到了这一点。你能否把自己的素材带进来,也许作为提示词,拖入一份 PDF 或一张图片,以类似的方式重新组合,从而绕过这种大段文字写作?所以我觉得它会分化。我认为作为工程师、AI 工程师,你们会继续写长提示词,但我认为对世上大多数人来说,我们目前所处的这个阶段可能很快就会消退。

Ravi Gupta所以上下文的形式会改变,对吗?

你仍然得给模型提供一些东西。

但也许你可以通过一张图片来传达,或者通过“看看这组文档”来传达。

一段语音、一个视频,任何形式都可以。这些模型非常热爱上下文。

Josh Woodward所以上下文不会消失,但我们现在押注的很多方向是,上下文的类型以及你传递上下文的方式,正在非常迅速地发生变化。

Sonya Huang我喜欢这个观点。好的,我们会在本期节目中更深入地探讨提示词和多模态模型的未来。但在那之前,先介绍一下 Google Labs 是什么?它的使命是什么?再多说说你在 Google 内部的定位。

Josh Woodward是的。Google Labs,如果有人听说过的话,我们很久以前有一个,后来休眠了一段时间,大概三年前又重新启动了。它本质上是一群构建者的集合。我们试图打造人们喜爱的新 AI 产品。这些产品可以是面向消费者的、B2B 的,也可以是面向开发者的。一切都是从零到一。这里往往能吸引到一个有趣的混合人群,很多是在 Google 待了很久的老员工,也有一大帮初创公司创始人和前创始人。

所以我们把这些人混合在一起,基本上会说:“某个领域的未来会是什么样子?”比如创造力的未来、软件开发的未来,或者娱乐的未来。然后他们就组成小团队,开始构建和发布产品。这就是它的运作方式。它在某种程度上处于 Google 传统大产品体系之外,但我们也大量协作。不过那里存在一种有趣的互动——我觉得这也是其中的乐趣之一——你可以稍微介入,也许与 Search、Chrome 或 Google 的其他部门合作,但你同时也拥有探索、实验甚至尝试颠覆的空间。这就是我们正在做的事。

Ravi Gupta你如何在实验室内部创造出你想要的文化?想想看——想必这里的失败要比其他部门多得多。在 Google 这种体量下,衡量成功的标准肯定也有所不同。

那么你试图营造的是一种什么样的文化,你又是如何营造的?

Josh Woodward因此,我们非常自豪的是,团队文化上始终追求极快的节奏。从一个想法到最终交到用户手中,只需要 50 到 100 天。为了实现这一点,我们会做各种各样的努力。所以速度至关重要,尤其是在当下这种 AI 平台转型的时刻。

另一件我们经常思考的事是,大事往往从小处开始。如果你在 Google 这样的地方工作,身边全是拥有数十亿用户的产品,人们很容易忘记,这些产品最初通常都是从解决一个用户的一个痛点开始的。所以对我们来说,如果能获得大约一万名周活跃用户,我们就会非常兴奋。[笑] 我们会为此庆祝。这对我们启动一个新项目来说,是一个重要的里程碑。而在 Google 内部很多其他团队看来,他们的仪表盘根本不会统计这么小的数字,对吧?所以在这个意义上,我们尝试做的事情规模非常小。说实话,从这个角度来看,我们大概和你们所合作的公司看起来很像。

我认为我们还在努力做的另一件事是,由于我们处于 Google 各大核心团队之外,我们一只脚踏在外部世界。我们会与创业公司及其他伙伴进行大量的共建和协作;同时另一只脚也在 Google DeepMind 内部。因此我们既能看到研究前沿目前在哪里,更重要的是,它正向何处发展。所以我们经常尝试将这些能力引入进来。我们非常自豪于找到那些极具创造力的人,那些几乎把自己视为弱势挑战者、充满拼搏劲头的人。

我们有一份完整的文档,叫做“Labs in a Nutshell”。其中我最喜欢的一节叫做“Who Thrives in Labs?”,里面列出了大概 16 或 17 条特质。这就是我们试图打造团队文化的方式。但你也必须让失败这类事情变得正常化;在晋升、薪酬等所有你在公司通常会做的这些事情上,你都必须换一种思路来思考。

Sonya Huang你提到了和 DeepMind 的联动,我觉得这非常酷。

你觉得在 Labs 里,理想的产品构建者画像是什么样的?是有研究背景的人?还是来自成功消费级产品背景的人?是否存在那种既能做研究又懂产品的神奇独角兽?

Josh Woodward没错,能找到多少独角兽,我们就招多少。[笑] 而且我们确实找到了一些,这很棒。你确实需要寻找那种既具备深厚的模型专业知识,又具备消费者敏感度的人……

这样的人是存在的。如果你能找到他们,他们也非常出色。而且我们也找到了一些培养或发展人才的方法。所以另一件我们经常思考的是,如何引进那些可能并非你常规寻找的人才类型。我们总处在这样一个有趣的区间里:谁被低估了,谁其实很有意思,但可能简历上并不亮眼,而当你和他们交流,或者去看他们的 GitHub 历史,等等,你可以从各种不同的信号中去判断。对,这就是我们大致的思考方式。

Sonya Huang非常酷。你们怎么决定接下来要做哪些项目?是自下而上?还是自上而下?具体是怎么运作的?

Josh Woodward嗯,好问题。实际上我们采取的是一种混合模式。从自上而下的角度,我们会看哪些领域对 Google 的使命来说是核心方向,对 Google 具有战略意义。因为我们身处 Google 内部,所以会在更广阔的语境中思考自己的定位。

比如,软件开发的未来会是什么样子?Google 有数万名软件开发者,显然 AI 必将在这个领域带来巨大变革。于是我们会思考,我们能不能为其他 Googler 打造一些东西?对外部而言,我们又该如何构建这类产品?所以我们会有这种自上而下的视角。你几乎可以把它想象成——我来自俄克拉荷马,夏天我们经常钓鱼。你要搞清楚该去哪个池塘钓鱼。所以我们会花很多心思去思考该去哪些“池塘”。

但接下来,我们会让很多这样的团队——通常是四五人的小团队——自己去发掘值得解决的用户问题。这就是我们上下结合的地方。我想对于很多其他团队来说,他们看我们可能会觉得有点混乱。你知道,我们并没有那种跨多个季度的路线图。我们更像是努力活到下一个,比如说,一万用户的里程碑,然后再想办法增长。但我想说,这大致就是这种混合模式。

Ravi Gupta你们现在做出的产品中,有哪一个是让你们特别兴奋的?

Josh Woodward哦,当然。我猜如果你用过 Gemini API、AI Studio、Notebook LM 或者 Veo 系列产品中的任何一个,这些都是我们从 Labs 开始参与打磨的产品。也许我可以聊一个已经比较知名的,再聊一个即将推出的。我对 Notebook LM 的发展方向感到非常兴奋。我觉得我们找到了一个关键点:你可以把自己的资料带进去,AI 会真正深入理解这些内容,然后你就能基于它进行创作。很多人可能听说过去年推出的那个播客功能。接下来还有很多遵循这一模式的新东西要推出,所以请持续关注。

这种模式可以做非常多的事情。我觉得特别有趣的是,它给了用户很大的控制权。他们会觉得自己在驾驶 AI。我们团队里有一个说法,其实是某位营销同事想出来的,叫做“AI joystick”,意思是你就像在操控摇杆一样来控制它。这挺有意思的。

我想说现在有很多东西正在到来。我们对 Veo 感到非常兴奋,这是 Google 的图像模型以及视频模型,还有这两者融合的方向。所以在这个领域,我们有一些非常有趣的产品正在酝酿。我想也许我们可以在某个时候再聊聊这个。但我认为,生成式视频已经从“几乎可能”的阶段,进入到了“真正可能”的阶段。而且我觉得……

Ravi Gupta那我们现在就聊聊吧。跟我们说说。

Josh Woodward好的好的。我觉得这很有意思,因为这些模型仍然非常庞大。要运行比如 Veo 2,需要数百台计算机,对吧?所以成本非常高。但正如我们在 Gemini 等文本模型,甚至 OpenAI 和 Anthropic 的模型上所看到的那样,仅在过去一年里,成本就下降了大约 97 倍。所以如果你假设成本曲线也会类似地发展,那么对于这些 Veo 模型,尤其是像 Veo 2 这样全新的模型,真正突破之处在于它实现了极高的质量和物理效果。

无论是动作还是场景。如果你和很多 AI 电影制作人聊,他们会提到一个概念叫 cherry pick rate,意思是你得跑多少次,才能从中挑出真正好的片段。而我们在 Veo 这样的模型上看到,cherry pick rate 正在下降到几乎一次就能出片,一次就能得到我想要的结果。因此,模型的指令遵循能力,也就是模型按照你的要求去执行的能力,真的非常酷。所以我认为,当你把这些能力放到工具里,你就能够用完全不同的方式来表达想法。

Sonya Huang你认为在 AI 视频生成领域,哪些问题已经解决了,哪些还没有解决?因为我记得去年,甚至就在去年,还有很多人在讨论生成式视频可以作为物理模拟器,比如……

它可以模拟物理。当时大家都觉得这很神奇。你觉得物理方面的问题解决了吗?还有哪些是——你知道,已经搞定了的,以及还有待解决的?

Josh Woodward是的。我觉得物理规律是个很难永久攻克的课题,但已经很接近了。我认为足够接近了。不过六个月前、一年前、几年前,你还看到过威尔·史密斯吃意面的视频,那简直是一场灾难。甚至去年还有那种刀切手指、结果切出六根手指的视频。你知道,那就是我们当时的水平。

所以我认为物理规律?进步巨大。实现照片级真实感(photorealistic quality)的能力进步非常大。做跳切(jump cuts)和不同 camera controls 的能力,差不多快要解决了。所有这些都有解决路径。不过我觉得,效率和 serving cost 仍然有待攻克,而且可能还需要在应用层(application layer)上再多想清楚一些。因为我认为这是另一个巨大的机会,正如我们在 AI 的很多其他模态(modalities)中所见。

你有模型层(model layer),有工具层(tool layer),而我们认为真正的价值在于应用层(application layer)。因此,围绕视频重新思考工作流程是非常有意思的。而且我觉得这一块目前还很空白。

Sonya Huang你认为模型是否具备在应用层可塑的视频生成能力?比如,如果我想要场景之间的 character consistency,模型现在做得到吗?还是说你需要模型具备 steerability,这样才能在应用层与之协作。所谓的 model readiness 是什么?要在应用层实现神奇的效果,还需要哪些条件?

Josh Woodward是的。我这周和几位 AI 电影制作人聊过,他们最感兴趣的正是你所说的:character consistency、scene consistency、camera control。这几乎就像我们得造一台 AI camera。想想现在正在拍摄我们的那些相机,那可以说是几十年的技术积累,为了某种特定的输入/输出(input/output)而臻于完善。我认为我们现在正处于需要打造全新 AI camera 的边缘。一旦做到这一点,你就能生成无限数量的场景。你可以生成,比如,哦,你穿了件红色毛衣;现在把它变成蓝色。而且不仅是在那个场景里,而是在整整一部两小时的电影中。

所以,我们开始看到各种各样的可能性,我们内部也在研发这些原型,这一切已经在这里了。就是说,它正在到来。那些曾经要么太贵、要么太耗时间、要么需要一定技能门槛的事情——我们团队内部常说,如何降低门槛、提高天花板?我们在做产品时的思考是,如何让一样东西更易获取,或者如何让专业人士拿起来就能大幅突破质量上限,做出不可思议的作品。我们在视频领域看到的就是这样。它正处于两者同时发生的临界点。

Ravi Gupta最近 Paul Graham 发了一条很有意思的推文,或者说帖子,大意是,基于进步的速度,你大概应该去造那些还不太好用(don’t quite work)的东西。

因为它们迟早会好用起来,成本也会大幅下降。所以我想这对你们也适用,尤其是对 Nvidia。

Josh Woodward我们就是这么做的。是的。我的意思是,现在具体数字我一时想不起来,但每生成一段八秒的视频片段都贵得离谱。但我们基本上是在为一个这样的世界做准备:到时候你会一次性生成五段,根本不用多想。过去几年做 AI 相关工作,我学到的一个实际原则是:确保你的产品与模型变得更聪明、更便宜、更快这一趋势对齐。如果你的核心产品价值主张(value prop)能从这些 tailwinds 中获益,那你就处在一个好位置。如果有哪一点对不上,那就该质疑自己的存在了。这是我对这件事的总结。

Sonya Huang你认为我们还要多久才能让视频生成的经济账算得过来——也就是生成成本低于它带来的经济价值?

Josh Woodward是啊。哇,这很难。这种预测你永远无法真正确定。我不知道,但我想说,随着我们开始把 Veo 放进即将推出的一些自有工具里,我们也在做大量成本建模,目前我们看到的一点是:除了产品和应用层(application layer)之外,我们可能还需要在商业模式层面有所创新。我的意思是,你可以——我们最初的想法是,要不就搞个订阅制,然后在上面按用量收费。这可能是条路。另一种方式是,当你和一些创意工作者聊天时,不管他们是好莱坞的,还是那些新兴的 AI 电影制作人,他们会说:“好吧,我想要这个输出,我愿意付这么多钱。

”这有点像按输出付费(pay-per-output),你在其他案例中也见过——AI 公司也开始在做一些类似的事情,但对于影视和视频来说,这有点像制片人做项目时的思维方式。

但现在你想象的是在个人创作者层面,这就挺有意思了。所以那更像是一种,几乎是拍卖类型的模式(auction-type model),potentially。我觉得有很多可以探索的。不过我认为,事情发展的速度大概在几个季度(quarters)的时间尺度上就会开始变得有趣,而不是很多很多年。所以——是的,我觉得有路可走。

Ravi Gupta你几次提到了进步的速度。

你觉得它在加速吗?你在 DeepMind 有独特的视角,我们就把它当作其他公司的一个风向标(proxy)吧。

Josh Woodward是的,是的,作为一个 proxy。是的,是的。

Ravi Gupta我们现在处于什么阶段?是在加速吗?还是说我们在一条疯狂的轨迹上并保持同样的速度?我很感兴趣。

Josh Woodward是的。我一直以为它会慢下来,但在过去三年里它从未慢下来。所以,你觉得,哦,pre-training 可能要到瓶颈期了。Inference time compute 又打开了一整片新天地。而且我觉得还有很多——我们团队里有一位作者,其实我们招了他进来。他叫 Steven Johnson。我们最初把他招进来时,他联合创立了 Notebook LM。他提到一个概念,叫做 adjacent possibles。

他写过一本关于创新史的非常有趣的书。而我觉得现在就像是,你走进一个房间,里面有好多扇门正在打开,通向那些 adjacent possibles。而且不止是一个房间一扇门。就像是一个房间里有——感觉像是 30 扇门等着你去探索。所以我想这就是内部的感受。

Ravi Gupta我喜欢房间和 adjacent possibles 那个画面。

我要偷走这个,然后拿来当成我自己的说法。

Sonya Huang你认为对于我们消费者来说,视频消费的未来会是什么样子?比如,我是否仍然在看好莱坞工作室制作的好莱坞式故事片,只是成本大大降低?还是说我将看到一段根据你对我的了解而动态生成、只给我一个人看的内容?你认为作为消费者,消费的未来是什么样的?

Josh Woodward我想说,这个话题可能会向很多不同方向发散。我们感到兴奋并看到的一些方向——我认为娱乐的未来将具备更强的可操控性。现在想象一下,你坐在沙发上,划着手机浏览内容,然后投屏到电视上播放。未来它会变得更加可控,你可以随时介入,并按自己的意愿引导内容走向。这是我们看好的一个方向。

我们认为另一个方向是个性化,就像你说的。想想现在的 YouTube、TikTok,或者其他任何能通过算法摸清你兴趣的平台,再想象一下,这种能力会变得更加极致,可以根据你愿意与模型分享的信息进行精细调整。我认为还有一点是,很多内容将会实时生成。所以我们有一个看法:就像大约10到15年前创作者阶层崛起,推动了 YouTube 和其他平台的发展一样,未来会出现一种转变,或者说会出现另一群人,我们称之为“策展人”,他们负责筛选内容,并与模型协作进行创作。

我认为其中另一个循环在于你如何重新混合这些内容。这也是我们对娱乐未来设想的重要组成部分:未来会出现这样的场景——“嗯,我挺喜欢这个的,但能不能把它改成这样。”某种程度上,做这件事所需的花费、时间和技能,可能只不过是点一下按钮,或者描述一下你的需求,就能得到不同的版本。我们认为这就是部分发展方向。

这些比例是否会保持不变,将会非常有趣。我们知道,如今很多时候,比如90%、95%的人只是在平台上消费内容,而创作者阶层非常小。这种平衡会改变吗?但我能看到完全不同的思路来重新构想内容平台,让它们具备一些原生控制功能。比如,未来的 UI 会不会有一个“加入”按钮?现在的 UI 可能有播放、暂停、保存、书签、星标、点爱心之类的功能。未来会不会出现新的交互方式,让你“加入”进去,然后系统会说:“嘿,Sonya、Ravi,你们想聊点什么?”你明白我的意思吗?我认为这完全有可能。我们今天正在 Notebook LM 里构建这样的功能。因此你可以想象,如果向前推演,会有虚拟形象或类人的角色,配合唇部动画、声音克隆等技术,所有这些都能以全新的方式结合起来。

Sonya Huang你认为电影和游戏会开始融合吗?

Josh Woodward是的,我认为这很有可能。现在电影或视频内容、游戏、世界观构建和 3D 之间,正发生一个非常有趣的交叉融合。我们目前也不太清楚这会走向何方,但现在有很多领域都在相互借鉴。甚至在一些训练技术上,我们也发现了类似的情况。

Sonya Huang实际上这正是我想问的。你看现在所有公司在做生成式视频模型,有些人可以说是直接从像素流入手,而有些人则从 3D 角度出发,认为要真正做好视频,需要先掌握 3D。

你对此有什么看法?

Josh Woodward是的,实际上我们两边都在押注。[笑] 我不知道,我不知道。[交叉对话] 在 3D 这边,我们启动了一个项目,基本上就是:拍六张运动鞋的照片,然后生成一个可旋转的 3D 模型。我们把它放到了搜索里。效果非常棒,模型填充细节的能力令人惊叹。但有意思的是,我们沿着这条路走下去的时候,Veo 2 这样的技术出现了。现在你不需要六张照片了,两三张就够了。你基本上可以搞定整个产品目录,就像 Google 索引过的每一个商品,几乎一夜之间就能全部生成。

所以现在,基本上任何物体——书架、椅子,不管什么——你都能得到一个 3D 模型,可以从任意角度平移、倾斜、缩放、重新打光。这个物体可以被放到任何场景里。这是 3D 角度的情况。从视频角度来看,有趣的是它在世界观构建方面的应用。我们之前做了一个小原型,当时我们想:“如果能帮每个教室重现登月场景,给老师一个工具,让孩子们仿佛坐在登月舱里降落,那岂不是很酷?”于是我们就做了这么个东西。其实还挺吓人的,因为我们还做了一个侧边面板,可以让你插入突发状况,比如:“糟糕!后面着火了!”

它们会模拟各种情况。我们玩得挺开心的。但这很有趣,因为模型可以接收指令,比如你说“往右看”,它真的会补全相应的细节。于是你开始感受到——这就是电影和游戏开始模糊边界的地方,我想这也是为什么我们目前在两边都押注。是的,我们也不确定。

Ravi Gupta2025 年,所有人都在谈论 agent。

Josh Woodward是啊,你刚才已经连说三遍了。[笑]

Ravi Gupta没错。我今天已经两次被人叫成 VC 了,这是很大的侮辱。能跟我们聊聊 Google Mariner 吗?

Josh Woodward好的。Mariner 是我们去年 12 月发布的一个项目。这个其实挺有意思的,因为我们开始看到模型中发展出了这种能力。我们想弄明白,如果让这些模型控制你的电脑或浏览器,会发生什么——好的方面和坏的方面。所以这个项目是一个很好的例子:我们从“嘿,这种能力开始显现了”起步,然后决定把它做成一个——目前是一个 Chrome 扩展程序,只是因为这样搭起来快——交到用户手里,总共用了 84 天。非常快,非常有趣。那阵子留下了很多回忆。

但我认为有趣的是,Anthropic、OpenAI,当然还有 Google,以及这个领域的一大批创业公司,大家似乎都在指向同一个理念:模型不再只是关乎知识、信息、综合和写作,它们还能做事。

它们可以滚动、打字、点击。而且它们不仅可以在一个浏览器、一个会话里做这些,还能在后台同时开无数个会话。所以我觉得,Mariner 真正想探索的是:短期来看,它当然是要能在浏览器里完成任务;但更大的问题是,当你手上拥有的不是一个,而是基本上无限多个这样的东西时,人机交互的未来会是什么样。这就是我们在那个项目里追求的东西。

Sonya Huang你认为 Mariner 的理想使用场景是什么,哪怕是近期的?因为我看到的所有演示视频——不一定来自 Mariner,而是更广泛的 computer use——基本都是在说:来,让这个 agent 帮我订个机票,或者去 DoorDash 上给我点个披萨。

这挺好的,但我喜欢做这些事。

Josh Woodward是啊,是啊。你用手机已经很熟练了。

Sonya Huang订机票是我人生的一大乐趣。所以你觉得哪些才是杀手级的消费者使用场景?

Josh Woodward是的,有意思的是,它可能不是面向消费者的,而可能是面向企业的。我们现在针对 Mariner 做的所有用户研究中,因为我们有一些受信任的测试人员,他们正在试用并给出大量反馈,我们发现真正高频出现的其实是这些高度耗费劳力的活动。"Toil" 是个有点老派、不太常用的词。但人们谈到它时会说:"这就是让我恼火的东西,而这款产品帮我解决了这个问题。"

但有趣的是,这类需求在企业端出现得更多。举个昨天听到的例子,有一个团队基本上有一个 co-browser 的用例。想象一下,你在某个呼叫中心,有客户打电话进来。目前,呼叫中心座席要远程接管客户出问题的电脑、浏览并为客户操作,这个过程非常复杂。他们说:"我们很希望让 Mariner 来做这件事。"这是一种。另一个我们听到的比较有趣的例子是,有些人大概是销售团队的,他们接完客户电话后,有一大堆后续步骤要做。

他们只想把这些任务分散出去。通常是要更新各种不同的系统,可能全是他们到处在付费的 SaaS 订阅。他们就说:"界面太笨重了,要花很长时间,我就想看着 Mariner 把这些都做完。"所以这些就是自然而然浮现出来的、比较有趣的需求。在消费者端,我也不确定。你心里有没有想到什么自己喜欢的用例?因为我们想到了几个,但我挺好奇的。

Sonya Huang我在想我日常生活中有什么苦差事。

开玩笑的,开玩笑的。和 Ravi 聊天是我一天中最棒的部分。

Ravi Gupta谢谢。不过我喜欢这个框架。即使我们还没有找到确切的用途,这个框架就是:一天中哪些重活是你不喜欢、又占用时间的。而且我觉得,DoorDash 或 Instacart 这类产品实际上也是基于同样的逻辑诞生的。

你看,我还得把 Instacart 塞进去对吧?我确保提到了它。回到企业端,你们是怎么测试的?是用现有客户测试吗?是用 Google Cloud 的客户测试吗?你们到底会和哪些企业合作测试?

Josh Woodward是的。在这方面,我们大小企业都会接触。会有一些云客户。我们有很多云客户总是想要最新、最酷的东西。

就直接给他们。他们公司内部也有类似 Lab 的部门,对吧?所以这些都是很棒的试验场。我们也和很多初创公司合作。

而且,如果还有其他听众感兴趣,私信我,告诉我。因为我们总是想从市场的不同侧面学习。多年来我做产品还发现一个很常见的现象——人人都在谈 product-market fit,说遇到了你就知道了,等等,这没错。但至少对我而言,我一直觉得在做产品的初期,你会大量迭代产品,却有时候会忘记迭代市场。找到合适的市场方向和找到合适的产品同样重要。你必须把两者结合起来。

所以我觉得在 Mariner 这些早期阶段,我们正处于这个位置。比如,AI 模型能否操控你的电脑?可以。这是一项巨大的新能力。它准确吗?有时候。

它快吗?完全还不快。这就是我们在实际用例或能力方面所处的位置。然后就是找到合适的市场。不过简短回答就是,在早期阶段,我们做事很快。我给我们产品经理和团队其他人,包括工程师和 UX 设计师的建议是,别盯着 dashboards。

现在样本量太小了。

看着他们的眼睛。看着客户的眼睛。当你给他们展示东西时,他们的眼睛亮了吗?明白我意思吗?这就是你要跟随的信号。在这个阶段,这远比科学更像艺术。

Ravi Gupta我们能稍微回到上下文那个话题吗?因为我在想你既然在 Google 工作,对吧?你提到过自带数据。会不会有一种可能,就是有人可以直接 opt in,比如 Google 已经知道很多关于我的信息,对吧?我的搜索、Gmail、日历。会不会有一个世界,你可以直接选择加入,然后说:"我现在不想把所有东西都带过来,我就想让你用你已有的数据来变魔法。"对吧?这种事可能发生吗?因为 Google 特别适合做这种事——可能比任何人都适合。

这是你们可以在 Labs 里尝试的,或者有可能实现的吗?还是说这不可能?

Josh Woodward我们在内部会做一些这方面的尝试,用一些我们自己团队的数据,我选择加入了很多东西,意思就是,全用上吧,咱们做出点好东西。不过我觉得你在 Gemini app 里也会看到一些这方面的功能,你可以关联不同的数据源。但我觉得这其实也是一个正在积极探索的领域,哪些类型的数据最有趣、最有用。当然,还有恰当的管控机制,让人们不会觉得只是在把数据交出去。

是的。所以我认为这确实是我们会做一些实验的领域,但我得说现在大部分实验还是基于我们自己的数据,因为我们还在摸索。

Ravi Gupta那你之后得单独告诉我们,既然他们现在对你了如指掌,有哪些事情是可以为你做到的?就是说,能为你创造什么样的魔法?

Josh Woodward是的,我立刻想到的一些相当强大的功能是,你能看到一些东西。比如在我自己的数据中,我感觉自己有了第二个大脑。

这是真的——就像一直以来都有"第二大脑"和"思维工具"之类的愿景。

而且我觉得你已经能非常接近这个愿景了。我觉得 Gemini 模型特别擅长 long context,拥有这种令人印象深刻的短期记忆能力。所以在 Gemini 2.0 中,这正是我们努力挖掘的方向,就是如何利用这一点。

Sonya Huang关于 Mariner,我想问的和刚才问 Veo 的类似。

你觉得什么时候我们会有足够准确、足够快速的 computer use,来实现你刚才说的那些用例?

Josh Woodward是的,这又是一个很难回答的问题。按现在的迭代速度,很难说。我是说,不仅在 Google 内部,你看看其他一些 lab 也在做。它们大概每一两个月就推一个版本。[笑] 所以你可以想象,光是今年,我们就会看到这些东西迭代四、五、六个版本,对吧?这还是我们已经知道正在发生的。我觉得目前比较棘手或困难的领域在于,计算机如何精细或精确地导航 XY coordinates,几乎是这样。你几乎想要屏幕上的 lat-long,而这一点目前仍然有一些非常有趣的粗糙边缘,我是这么认为的。

另一个重要领域是这样的——它更多是关于人的问题。比如,你什么时候希望人类参与进来,什么时候不希望?他们自己又想在什么时候参与?这几乎是要构建一种合适的机制。就像“嘿,我要买东西了。哦不,我想了解一下这个。”或者“我可以接受5美元,但不能更多。”你明白我的意思吗?所以这几乎涉及一大堆硬核的 HCI 研究,以及深入共情地去思考如何设置这些控制。

这一块我觉得目前所有人都还没做到,包括现在的 Google Mariner 在内,我们没有——我是说,我们现在只能做一些很生硬的事情,比如“不要买任何东西。不要同意任何 toss。”你知道,目前你能做的都是些比较粗糙的限制,但我认为人们会想要更精细的方式。所以这些是我认为尚未解决的一些问题。再说回那个原则,就是押注模型会变得更聪明、更快、更便宜,而且今年你可能会有四、五、六甚至七个 rev。

Sonya Huang好的,我有一个元问题。

为什么所有研究实验室都在——据我所知——完全相同的时间点集中攻关 computer use?这是偶然吗?还是技术恰好都在同一时间 converge?当时到底发生了什么?

Josh Woodward这是个好问题。我是说,这——我不了解其他每个实验室的具体情况,但我想说,你知道,当你阅读创新史的时候,这方面有很多论述,发现同时发生其实并不罕见。我认为现在有了这些模型,某种程度上出现了一种新范式,很多人都以特定的方式看到了其中的潜力。而且我确信还有人员在不同实验室之间流动,以及其他促成这些想法交叉传播的因素。但我的理解是,这确实像是那种情况之一,就像编程一样,对吧?甚至现在就连 agent 领域也有很多东西在酝酿,这让一切变得非常有趣,但也让你时刻保持警觉,对吧?因为这有点像是弱者心态。

Ravi Gupta你们会聘请其他作家吗?我这么问是因为我在想——我觉得 Matt Ridley 写过一些关于相邻创新的内容。而你们已经请了 Steven Johnson。能说说当初为什么聘请他吗?是怎么发生的?

你们会考虑引进其他背景不那么显而易见的人才进入实验室吗?

Josh Woodward会的,会的。关于 Steven 的简短故事是,那个某种程度上重启了 Google Labs 的人叫 Clay Bavor。

共同的朋友,没错。他和我都是 Steven 的铁杆粉丝。我们基本上读完了 Steven 写过的所有东西。Steven 是个非常有趣的人,因为几十年来他一直在寻找完美的思想工具。所以 Clay 给他发了 cold email。我们都是他 Substack 的订阅者。我们给他发了消息,说“我们太喜欢你了。你愿意来和我们一起工作吗?我们可以把你一直想做的工具做出来。”事情就是这么开始的,真的。

那是在2022年夏天。所以是在 ChatGPT 时刻或其他任何事情发生之前。Stephen 接了电话,他说“好啊,干吧。”于是他进来了,作为访问学者。当时根本没有对应的职级体系。我不得不去和我们的 HR 人员一起想办法创造一个他能担任的角色。从这方面来说,这是非常规的操作。然后剩下的显然就是历史了。

我读过 Matt 的很多书。我不认识 Matt。他会很棒的,所以如果他正在听,请……

我得说我们在这方面已经做了不少。所以我们其实已经引进了音乐家。实际上我们现在真的在想办法引进一位访问电影制作人。

所以这几乎成了一种模式。Steven 某种程度上开创了先河。他是第一个——在实验室里,如何引进人才有很大的价值。我们如何共同创造?

我们不希望只是做出东西然后扔出去。我们实际上想和行业里的人共同创造。当我们这么做的时候,我们发现实际上能远远超越那种“哦,那是个很酷的 AI 玩具功能”的阶段,而是进入工作流。如果你和 Steven Johnson 这样的人合作,你知道,他写了十几本书以上,他思考事情有一种特定的方式,而且几乎带着一种对来源的尊重。

还有引用。所有这些东西都在 Notebook LM 里体现出来了。

我们在音乐和视频方面也在做类似的事情,还有……

Sonya Huang目标是创造 net new 产品,让你们能独立地把它从1做到100再做到10亿?还是说目标是先让 NotebookLM 这类东西找到产品市场契合度,然后真的把它们并入 Google 这艘母舰?

Josh Woodward是的,这很有意思。所以我们刚开始的时候,我要说当时的理念完全是做出东西,然后让它毕业。所以有点像传统的孵化器模式。随着时间推移,这变得很有意思。在某些情况下我们确实这样做了,比如 AI Studio 和 Gemini API,我们让它们毕业了,现在归 DeepMind 管,他们在继续推进。但像 NotebookLM 这样的产品,我们在可预见的未来会把它留在 Labs 里。

因为它有点像是一种不同的生物。它只有借助 AI 才可能存在,而且我们现在做的很多东西——我是说,我们得看看能把其中多少东西组合起来,真正获得逃逸速度。但我们真的很感兴趣的是把它们变成生意,让它们可持续,这其实是我们很多焦点的所在,就是下大赌注。这又回到了你的观点:这些东西很多不会成功。

因为如果它们都成功了,说明你下得还不够大。所以要努力找到那个平衡。但这肯定是——我们一开始就会考虑,这东西能不能做成一门生意?从那倒推。如果我们最终让它毕业了,对我们来说仍然是好结果。另一个好结果是,我们叫停它,及时止损,我们完成了百天冲刺之类的。然后转向下一件事。是的。

Sonya Huang你在节目开头提到,你们会尝试做一些自上而下的思考,比如对我们来说最值得去建设的领域是什么?

你对2025年最值得建设的领域有什么预测?比如,你们在哪里招聘人才?在关注哪些方向?在哪些地方和 DeepMind 的人共同创造?

Josh Woodward是的,是的。agent 方面有很多事情在发生,视频方面也有很多。还有我们谈到的一些 computer use 相关的东西。

但我对这些“池塘”的思考角度有点不同。我看待它们的方式是——我们有一份文档叫“Labs is a Collection of Futures”。它包含82条关于未来的预测,而对未来做一条预测就已经够危险了,更别说82条。但我们团队得出这个结论的思考实验是:想象你身在这样的一个房间里。天花板突然打开,一个小胶囊降下来。我们都跳进去,它把我们弹射到未来。那是2028年。你可以出来,你有五分钟时间,四处看看,写下所有东西,然后你被带回现在。然后写下你看到了什么。这份文档就是这么来的。那么知识的未来是什么样?未来是什么样?

Ravi Gupta尽管 prompt 已经老派了,但你给团队的这个 prompt 相当不错。我正想跟你说这个。

Josh Woodward是的。我们会在那个层面思考,在比较高的层面上思考。比如说,知识的未来会是什么样子?我们认为,在我们 82 项预测中,其中一项就是知识将无限可 remix,任何输入的内容都可以被转换,并以任何形式输出。如果你相信这一点,你就会据此下注,并在构建产品时考虑到那样的未来。这可能就是其中之一。不过我想回到很多人可能在关注或正在构建的一些领域,我认为我们现在正处于视频的一个关键时刻,也正处于由思考和推理模型带来的非常有趣的 agent 应用的关键时刻。另外,我觉得现在还有一些稍微低调一点的领域。我仍然认为编程今年会有重大飞跃。这些就是我们最关注的一些领域。

Ravi Gupta你们实验室也在做编程方面的工作吗?

Josh Woodward是的。现在在 Google,25% 的代码都是由 AI 编写的。

没错,没错。而且这个数字增长很快,进步速度非常快。不过在这个领域,我觉得可以有两种思路。怎么——还是那句话,降低门槛,抬高天花板,对吧?如何让以前完全不会写代码的人也能编程?这里存在巨大的机会。

Ravi Gupta比如 Sonya。你知道,我写了一辈子代码。我是说,Sonya……

Josh Woodward其实挺有意思的,因为这里发生的一些最有趣的事情——不知道你们有没有人玩过 Replit 的 agent 功能。

非常有趣,对吧?

几个周末前,我和我四年级的儿子在一起。我们家里现在正为落实家务事发愁。我们做了一个家务追踪应用。28 分钟,45 美分。

完成了。我们现在是日活用户。所以这是一种进入软件世界、一个软件丰裕世界的有趣方式。我们在这个领域也有一些布局。同时我们也在关注,如何让一名受过专业训练的 SWE 程序员效率提升 10 倍甚至 100 倍?

我认为在这两个方面都有值得关注的有趣赌注。

Sonya Huang你认为现在 AI 领域有什么是被过度炒作的?

Josh Woodward哦,这是个有趣的问题。我希望我们能稍微超越 chatbot 界面一点。[笑] 感觉我们在很多地方都在复用这种界面——Google 也不例外。而且我不太确定——我觉得现在仍然有很多人在把 AI 硬塞进各种东西里。AI 本身就有点被过度炒作了。我希望我们在判断它的颠覆性程度以及应用场景时能更精确一些。

所以我认为,我们再次强调,要更多思考工作流程,而不是拿一个现有产品把 AI 硬加上去。所以我觉得这有点——现在有一种竞赛。你看到第一代 AI 产品,就是把 AI 塞进去。这让我想起很多——其实,我刚加入 Google 的时候,正好赶上 iPhone 时代刚刚发生并站稳脚跟。2007 年 Steve 走上台说「这就是 iPhone」,如果你看三年后的 App Store,大概就是我们目前在 AI 革命中所处的阶段,2009 年左右的 App Store——我回去查过——就是把网站缩小适配手机,手电筒应用和放屁应用。

[笑] 这些是当时下载量最高的东西。所以我觉得我们现在正处于这样一个阶段,真正的东西会在今年、明年、后年开始出现。到那时你会看到 Uber、Airbnb、Instacart 这些真正改变你做事方式的东西。这就是我的看法。

Ravi Gupta那好,Sonya 问了你什么是过度炒作的。我来问你什么是低调、被低估的。AI 内部有哪些领域值得更多关注?

Josh Woodward是的。我们刚才聊了一点编程。关于这个也许再补充一点:我认为如果你能做出可以写代码、自我纠正、自我修复、迁移代码并做所有这些事的代码模型,那会让——你觉得现在节奏已经很快了吗?这会彻底改变曲线。所以我认为这是一个巨大的——我仍然觉得它被低估了。

顺便说一句,它已经被炒得很热了,但我认为即使炒得这么热,还可以再热一点。这是其一。我觉得我们还没有完全内化 long context,或者说 infinite context,这个概念意味着什么?它可能涉及到你提到的个性化问题,但也涉及到我们刚才聊的一些东西,比如怎么让像 Mariner 这样的东西真正持续运行下去?

所以整个 long context 的概念,我的意思是,你看到 Google 在这方面做了很多,但我们也在大力投资,因为我们认为这是一个重要的战略杠杆,尤其是当你有了更 agentic、串联在一起的工作流时。也许还有一点,我觉得关于「品味」的讨论不够多。

比如,如果你相信价值会出现在应用层,如果你相信会有一定比例的 AI 垃圾内容,你就能看到这些趋势。

我认为良好的品味和设计会有价值。这并不意味着它必须由人类创作,尽管我也认为人类精心制作的内容会变得更加像手工艺品,从而具有很高的价值。但我想说这是另一点。我觉得可能与此相关的是真实性和真相。

以及什么是真实的。我认为这些东西会变得比今天重要得多。

Ravi Gupta我认为其中关于上下文这一点我非常认同,就是如果你——你的 infinite context 这一点。因为如果你想想生活中哪种关系拥有最多的上下文、共享的上下文,那可能是和你的配偶。

对吧?如果你想想这一点,最终会发生的是,你可以和配偶交流时 literally 只需一个眼神,对吧?然后他们突然就完全明白你的意思。他们知道该离开派对了,不管是什么情况。

你会想到,这就是 infinite shared context 所能达到的愿景。

Josh Woodward我们知道那就是天花板。

Ravi Gupta没错。想想,你的——就像,想想现在离那还有多远。

现在你还在打字输入。

描述那是什么。还有你说的,等等。有很多种不同的沟通方式,如果它有记忆,就能更了解你。

所以我觉得这里面有很多宝藏,仅仅因为它能够持续运转。

但要给它正确的上下文。并且在任何需要的时候。

Josh Woodward我们想到你们投资的任何公司——甚至 Google。最痛苦的事情之一就是当一位老员工离职时,因为所有的上下文都跟着走出了门。所以我觉得完全正确。无论是个人关系还是工作关系。是的。

Sonya Huang好的,我们以一轮快问快答来收尾。

Josh Woodward好的。没问题。

哦,我之前提过。我玩 Replit 玩得很开心。

他们新的 agent 功能,而且在手机上。我觉得他们在那里做了一些非常有趣的东西。

Sonya Huang你知道,我们的一位合伙人 Andrew Reed 以制作这些很棒的 meme 并到处发送而闻名。

现在开发一个应用太容易了。他一直在做这些应用,然后发给我。都做得挺好的。

Josh Woodward是的。我们有“一次性软件”(disposable software)这个概念。

用一次,用完了就扔掉。对。

Sonya Huang好的。你认为今年哪个应用或应用类别会真正爆发?

好的。给 AI 从业者推荐一段内容或读物。

Josh Woodward哦,这问题有意思。这个不是传统的 AI 读物推荐,因为我觉得可能……

Sonya Huang好啊,因为那种推荐我们已经太多了。[笑]

Josh Woodward我是想说,假期期间——我读了很多书。其中一本我读的是 Lego 的故事,就是乐高的历史。

这本书讲的是 Lego 家族经营已经传到了第三代。我推荐这本,真的很有意思。是的。原因如下。在公司历史上有一个关键时刻,当时他们有 260 款产品。也许在听的很多创始人都能想象,自己的公司可能走向各种不同的方向,而你正在努力理清头绪。当时身为 CEO 的祖辈基本上认准了那些小积木块。就是这个。他以此押上了整个公司。他还购置了那些极其昂贵的机器。所以我觉得这非常——我很喜欢读传记,而这本真的让我印象深刻。

Ravi GuptaJosh 的选书品味极佳,他还分享了一份很棒的阅读清单给我。

这份清单策划甄选得非常好。它的格式设计得很清楚,能区分哪些是你真正必须读的,哪些则不是。所以——各位听众,你们应该认真对待 Josh 的推荐。

Sonya Huang其实我真的很想要一款很棒的 AI 阅读应用。这简直就是我愿望清单上的应用。

部分原因是我记忆力很差,但基于我曾经读过或听过的一切内容——我觉得这不同于世界上所有的书籍。

就是有很多东西仿佛就在嘴边,还有各种相互关联的想法。

但,你知道,它们都像是沉入了深渊,我很难触及。所以如果有某种工具能把我那些思考和想法、我读过的东西都浮现出来,你能理解,就是我从读过的两本不同书籍中反思得出的下一层思考。

Josh Woodward以及它们之间的关联。

Ravi Gupta我觉得即便是在这个愿景之内,就像你说的,最基础的层面,纸质版、Kindle 版和有声书版也能无缝地交织在一起。

你知道,这样你就能持续专注于你喜欢的内容。然后我们可以再做到你说的那个版本。

Sonya Huang创业需求。好的。Pre-training 撞墙了。同意还是不同意?

Josh Woodward可能偏向同意。我觉得还有榨取的空间,但我看重心已经转移了。

我不给股票建议。[笑] 指数基金。

Ravi Gupta你有没有跟 Demis 坐在一起时说,“听着,作为——我们俩加起来,可是拿过诺贝尔奖的。” 你有没有这样开场过?你知道,因为这感觉像是事实。你知道,你们两个人之间,有一个诺贝尔奖。

Josh Woodward那都是单向的。Demis 和 John Jumper。是那些人拿了诺贝尔奖,不是 Joshua Woodward。

Sonya Huang好的。还有没有其他关于 AI 的反共识观点?

Josh Woodward还有别的反共识观点吗?我想就用这个来收尾吧。我觉得某种程度上——第一点是,能活在当下、投身建设是多么美好的时代。因为我感觉目前正处于一个窗口期,大量 adjacent possibles 正在涌现。第二点就是,我想鼓励听众们认真思考,当然现在大家都在关注模型、谁赢了、来回博弈,但是,你们正在为公司注入怎样的价值观?因为我觉得当下正是一个时刻,即将诞生一些能够塑造后续世代的工具。我认为人们认真思考这一点非常重要。以及,你是想取代和淘汰人类,还是想放大人类的创造力?

我是说,比如我想到视频领域时,就有一个问题会立刻浮现出来。我站在想要放大人类创造力这一边。但我觉得,在我们这个山谷里,正发生着一些时刻,事物在改变,而且这种改变往往会影响几代人。它们可能变好,也可能变坏。所以我只是想鼓励那些正在建设的人,你们掌握着这项不可思议的技术,它正变得越来越智能、越来越快、越来越便宜,请好好利用它,并思考下游的后果。

Sonya Huang非常感谢你今天加入我们,Josh。我们很喜欢这次对谈。

浏览本网站即表示您同意我们的 cookie 政策。