🎙️AI 访谈库
OpenAI CPO Kevin Weil 与 Anthropic CPO Mike Krieger 对谈(Sarah Guo 主持)
Kevin Weil · OpenAI 首席产品官

OpenAI CPO Kevin Weil 与 Anthropic CPO Mike Krieger 对谈(Sarah Guo 主持)

A conversation with OpenAI's CPO Kevin Weil, Anthropic's CPO Mike Krieger, and Sarah Guo

2024-11-06 · Lenny & Friends Summit (Sarah Guo 主持) · 41m · 约 19 分钟读完 · 原文
OpenAI 与 Anthropic 两家 CPO 罕见同台,聊在前沿实验室做产品的独特之处:非确定性输出如何颠覆传统 PM 方法、产品策略随模型能力频繁重校。最出圈的观点来自 Krieger'把产品经理放进模型团队与研究员一起工作'——Krieger 事后称这是全场被回看最多的片段。

大家好。好了好了,Sarah,你是AI投资界的女王——这句话以后绝对不许再用了——不过很高兴能和你们两位一起在这里。关于我们最后的这场讨论,我本来有两个不同的想法。第一个是来个产品发布比拼,因为这两位男士手里都握着合并到生产环境的按钮,我当时就想,拜托,把你们已知未来六到十二个月要发布的东西全放出来吧,别管什么内部准则了。第二个想法是我们一起重新设计Instagram,毕竟他们俩之前都执掌过Instagram。结果这两个想法都被彻底否决了。所以我想,我们就还是像朋友一样交换下心得吧,我知道这挺没劲的,但无论如何,还是很期待听到你们两位的分享。

其实,这对你们两位来说都是相当新的角色。Kevin,先从你开始吧。你之前做过很多非常不同且有趣的事情,当你接受这份工作时,朋友和同事们的反应是怎样的?

总体上是兴奋的。我觉得这是最有意思、也最具影响力的角色之一,有太多东西要摸索。我这辈子从未经历过如此有挑战性、如此有趣、让人睡不着的产岗位。它有普通产品岗的所有挑战,比如要弄清楚你在为谁做产品、能解决什么问题等等。但通常,当你做产品时,你依托的是一个相对固定的技术基础,对吧?你知道自己手头有什么,然后尽力做出最好的产品。而在这里,每过两个月,计算机就能做到一些以前在人类历史上从未做到过的事情,你要去思考这会如何改变你的产品,而答案很可能改变巨大。所以,在AI发展的内部观察这一切,真的非常有趣、令人着迷。我这段时间干得很开心。

Mike,你呢?我记得听到这个消息时,我心想,原来你能说服Instagram的创始人去为一个已经存在的东西工作啊。

我最喜欢的三种反应是这样的:了解我的人会觉得,这很合理,你在那儿会玩得很开心。中间那拨人则问,为什么啊?你又不是必须工作,为什么要这么做?但如果你了解我,你就知道,我停不下来,我觉得我无法控制自己。第三种反应是,哇,你居然能 hire 到Instagram的创始人,这也挺有意思的。其实没多少人能做到,但可能也就三家左右的公司能引起我的兴趣。所以,反应各异,取决于你有多了解我,以及你有没有见过我所谓的“半退休”状态——那大概持续了六周,然后我就想,好了,接下来我们该干点啥?

最近我们和一圈子朋友一起吃饭,你当时谈到自己正在学习企业级业务时那种孩子般的兴奋让我印象很深。是因为服务对象不再是Instagram上那样的普通用户,还是因为你身处一个由研究驱动的组织?到目前为止,最大的惊喜是什么?

我觉得这两者都是这个角色中非常值得探索的部分,对我来说也很新鲜。我18岁时发过一个非常18岁的誓:我希望生命中的每一年都不一样,不要重复同样的一年。这也是为什么,有时候我觉得,又是一个社交产品?又要做一遍?首先,你的标准会被严重扭曲,其次,这感觉太重复了。所以,企业级市场对我来说很新鲜。我也很想听听你在这方面的经历。你知道,反馈周期其实更像投资,要长得多。你一开始聊,觉得他们挺喜欢我的,然后发现进入采购流程了,可能要六个月才能部署,到那时你才知道到底对不对。

所以要适应这种节奏。我们会问,为什么这个还没上线?他们会说,Mike,你才来两个月,这东西正在VP们那里走流程呢,总会到那一步的。所以肯定要适应不同的时间线。但有趣的是,你真的能得到那种互动反馈。一旦部署了,有人可以打电话给你,你也可以打给他们,问,用得怎么样?好不好?而面对普通用户,你做的是数据科学和聚合分析,虽然也能找来一两个人聊聊,但他们没有足够强的经济动机来告诉你哪里做得烂、哪里做得好。这方面很不一样,但也很有成就感。

Kevin,你之前做过这么多种不同的产品,你的直觉有多少是适用的?

对,我也正想补充企业级市场的观点。关于企业级市场,另一个有趣的地方是,关键不一定在于产品本身,对吧?有采购决策者,他们有自己的目标。你可能做出了全世界最好的产品,公司内部所有人都乐意用,但这并不一定管用。我之前和一个大型企业客户开会,他们说,这太棒了,我们非常满意,不过有一件事我们需要你们做到:在发布任何新东西之前提前60天通知我们。我当时心想,我也希望能提前60天知道啊。所以真的非常不一样。有意思的是,OpenAI 同时在做消费级产品、企业级产品和开发者产品,我们基本上是一起推进的。

至于直觉,我觉得在一半的工作中是适用的。当你对要做的产品有感知时,比如我们正在收尾 Advanced speech mode,或者准备发布 canvas,你在做最后的润色,试图理解你在为谁而做、到底要解决什么问题,那时候直觉是管用的,因为那个阶段有点像普通产品的收尾阶段。但这些东西的起步阶段完全不是那样。

会有一些我们尚不清楚的能力。你在训练某个新模型时,隐约感觉它可能具备能力X,但你并不真的知道,研究团队也不知道,任何人都不知道。你会想,我觉得这有可能实现,有点像透过迷雾去看,但它是模型的一种涌现属性。所以你不知道它到底能不能用,也不知道它会达到60%的好用程度,还是90%,或是99%。而针对60%成功率设计的产品,与针对90%或99%的,是完全不一样的,对吧?所以你只能等着。至少,我不知道你有没有这种感觉,就是时不时去研究团队那边问问,嘿,怎么样了?模型训练得如何?有什么进展吗?他们会说,这是研究,我们正在做,我们也不知道,我们也在同步摸索。我觉得这超级有趣,因为你像是在一起探索发现,但也非常随机。

这让我想起 Instagram 时期,比如苹果在 WWDC 上发布新功能,你会想,这对我们来说要么太棒了,要么会彻底搞乱我们的节奏。现在的情况类似,但区别在于,是你自己的公司从内部颠覆了你。这很酷,但也会让你想,天啊,这可能会完全打乱我的产品路线图。

这种周期对你们俩来说是什么样的?你刚才形容它像是透过迷雾窥视下一批能力。如果你们不知道具体会来什么,还能做规划吗?而发现哪些新东西应该被纳入产品的迭代周期又是什么样的?

我觉得在智能层面,你可以眯起眼睛看,好吧,它是往这个方向发展的,所以你大致知道可以用模型做什么,并开始围绕这些构建产品。我觉得有三条路。第一,智能的发展虽不可预测,但至少你能观察到它的趋势曲线。第二,你从产品端决定投入的能力,然后和研究团队一起做 fine-tuning。比如 artifacts,我们在研究上花了很多时间,canvas 应该也是一样,对吧?你进行的是共同设计、共同研究、共同 fine-tuning。

我觉得能在这家公司做这些、能这样去做设计,是一种真正的特权。第三,还有能力的前沿阵地。对 OpenAI 来说可能是 speech mode,对我们来说就是我们这周发布的 computer use。你会想,好吧,60%?行,够好了吗?是的,够了。所以我们尽量让设计师尽早参与流程,但心里要清楚,你下的不是确定的赌注。就像刚才关于实验的讨论说的,实验的产出应该是学习,而不一定是每次都要 ship 的完美产品。

我觉得和研究团队合作时也一样,你的产出 hopefully 是 demo 或能提供信息的东西,能激发产品灵感,而不是一个可预测的产品流程,比如说到现在已经 de-risk 了,所以它最后一定会是那个样子。

还有一点我很享受。研究至少有一部分是非常产品导向的,尤其在 post-training 方面,就像我刚才说的;但另一部分在某种程度上真的很像学术研究。所以有时候你会偶然听说某种能力,大家在开会时你会说,唉,我真希望我们能做这件事,然后团队里的研究员会说,哦,不,我们可以做到啊,这个我们已经有了三个月了。我们会问,真的吗?那是什么样的?好吧,我从哪儿能了解更多?他们说,哦,因为我们不知道这很重要,所以我现在在忙别的。但有时候就是会有这种神奇的时刻。

我们在投资时经常思考的一点是,如果模型在完成某项任务上只有60%的成功率,而不是99%,你还能用它做什么?不像很多任务已经做到接近99%了,但这项任务本身非常重要、非常有价值。你们内部是如何评估这种任务进展的?哪些事情应该由产品来承担,比如设计优雅的失败体验,或者帮用户走完最后一公里,还是说你们就觉得,我们需要等模型变得更好?

我认为当某件事做到60%正确时,其实仍然可以做很多事,只是你真的要为此设计。你得预期人在其中的参与会比其他情况多得多。比如 GitHub Copilot,它算是第一款真正让人们眼前一亮的产品,让大家意识到这东西不仅能做问答,还能做真正具有经济价值的工作。我不知道它底层具体用的是哪个模型,但那是很多代之前的了,所以我敢肯定那个模型在写代码方面并不完美。我想是 GPT-2,还挺小的。但即便如此,它对你仍然有价值,因为它帮你完成了相当一部分代码,那些部分你就不用自己敲了,而且你可以编辑。

所以我觉得这类体验是完全可行的。我认为在向 agents 和长程任务转变的过程中,我们也会看到同样的情况。它可能不完美,但如果能帮你节省五到十分钟,那仍然有价值。更进一步,如果模型能意识到自己在哪里没有信心,然后回来问你,这件事我不太确定,你能帮我一下吗?那么人和模型加在一起,成功率就能远高于60%。

而且我发现这个60%,这个神奇的60%数字——其实是我五分钟前随口编的,算是一个 takeaway——60%就是AI的“门多萨线”。我觉得它往往是很不均匀的,有些任务做得很好,有些则不行。这也很有趣,当我们和客户做试点项目时,同一天收到两家不同公司的反馈,一家说,它解决了我们的全部问题,我们三个月都没搞定,谢谢;另一家却说,差太远了,比上一个模型还糟。所以这也让人保持谦逊。你自己有内部 evals,但真当模型投入实际使用,就像是你做了所有设计,然后放到一个用户面前,发现,哇,我错了。模型也有这种感觉。我们尽全力去预判,但用户有自己的定制数据集,有自己的内部使用方式,他们会用特定的方式去 prompt。所以当你真正把它放到世界上时,它有一种几乎是双模态的特性。

我想知道你有没有这种感觉。我认为现在的模型在很多方面其实并非受限于智能,而是受限于 eval。它们实际上可以做更多事,在更广泛的问题上做到更准确。关键其实是去教它们,它们已经具备了智能,你需要教它们某些特定主题,这些主题可能不在原始训练集中,但如果你方法得当,它们是可以做到的。

是的,我们经常遇到这种情况。大概三年前有很多很火的AI部署,现在人们觉得新模型更好了,但当初根本没做 evals,因为那时候我们只是在 ship 一些酷炫的AI功能。最难的坎儿是让人们退一步想:成功对你来说到底是什么样子?你在解决什么问题?通常PM已经换人了,是别人接手的。然后就说,好吧,那这应该是什么样的?好吧,我们来写一些 evaluations。我们发现 Claude 其实很擅长写 evaluations,也擅长打分,所以我们可以帮你自动化很多这部分工作。

但前提是,你得告诉我们成功是什么样子的,然后我们才能一起迭代改进。而这往往就是任务完成60%和85%之间的差别。如果你来 Anthropic 面试——也许你应该来,也许你在现在的岗位很开心,也许不是——你会看到我们面试流程里有一环,就是让你把一个烂 eval 改到好,我们想看看你的思路。但这种人才在外面还不够多,所以我们想培养。如果说有什么是我们能教给大家的,那可能就是写 evals 这件事,它大概是最重要的一件事。

我觉得这正在成为PM的核心技能。也许这有点像内部黑话,但我觉得很有意思。我们内部原本有研究型PM,主要做模型能力和模型开发;还有更偏产品界面的PM,或者API PM。最后我们意识到,在2024、2025年做AI驱动功能的PM,工作内容越来越像前者,而不是后者。比如我们发布了代码分析功能,Claude 现在可以分析CSV并帮你写代码。负责这个的PM把它推进到80%,然后必须交给另一个能写 evals 的PM,再去做 fine-tune 和 prompt。我当时想,这其实应该是同一个角色。你功能的质量现在取决于你的 evals 和 prompt 做得好不好。所以PM的定义肯定已经变了。

是的,完全同意。我们办了一个训练营,让每个PM都学习写 evals,了解好的 evals 和坏的 evals 有什么区别。我们肯定还没做到位,需要继续迭代和改进。但这对于用AI做出好产品来说,是至关重要的一部分。

既然这算是招聘号召,对于那些未来想做好AI产品或研究产品的人来说,我们没法参加你们的训练营,Kevin。那我们该如何培养直觉,去做好 eval 和迭代?

其实我认为你可以利用模型本身。就像你刚才说的,你可以直接问模型,什么是好的 eval?我想做这个,你能给我写个 sample eval 吗?它写得会相当不错。

是的,我觉得这很有帮助。还有一点,如果你听 Andrej Karpathy 或其他在这个领域深耕很久的人讲,没有什么能替代亲自去看数据。人们常常陷入一种状态:我们已经有这些 evaluations 了,新模型从78%涨到了80%,我们不能 ship,或者甚至更糟了。我就会问,我们看过它失败的案例吗?然后发现,哦,其实这次更好,只是我们的打分器不够好。又或者,再说点内部细节,每次模型发布都有 model card,其中一些 golden answer,我会想,我不确定人类会这么回答;或者我觉得这道数学题其实有点错。

要做到100%会很难,因为连打分本身都极具挑战性。所以我鼓励大家,培养直觉的方法就是去看真实的答案,哪怕只是抽样看看。也许我们应该改进 evals,也许虽然 eval 分数持平,但 vibe 对了。所以要真正深入数据,我认为这很重要。

我也很好奇,当我们走向更长程、更 agentic 的任务时,这会如何演变。因为如果你的 eval 是我给你一道数学题,你能把四位数加起来得到正确答案,那很容易知道什么是好的。但当模型开始做更长程、更模糊的事情,比如“去纽约给我订个酒店”,那什么是对的呢?很大程度上会涉及个性化。你问两个完全称职的人,他们也会做两件不同的事。所以打分就会变得更柔和。这将会很有趣,我认为我们必须再次进化。

说到要不断重塑,我觉得两家实验室大概都有某种概念,就是能力演进是什么样子的,有点像职业阶梯:你在承担哪些更大、更长周期的任务?也许 eval 会开始变得更像绩效评估——我正处在绩效考核季,所以脑子里是这个比喻,抱歉——比如,模型是否达到了你对一个称职人类的期望?它是否超越了期望,因为它做得快了两倍,或者发现了一家你本来不会知道的餐厅?是大幅超越、达到预期、还是基本满足?它会变得比单纯的对错更微妙。更不用说,是人类在写这些 evals,而模型已经在某些任务上开始超越人类了,人们更喜欢模型的答案而不是人类的答案。所以如果人类在写 evals……是吧,这意味着什么呢?

好吧,evals 显然是关键。我们会花很多时间和这些模型相处,自学写 evals。那产品人现在还应该学哪些技能?你们两位都在这条学习路上。

我觉得,用这些模型做原型设计是被低估的。我们最优秀的PM会这么做:我们会就UI应该是这样还是那样进行漫长讨论,然后设计师还没打开 Figma,我们的PM或者有时候工程师就会说,太好了,我刚 prompt 了 Claude,做了这两个UI长什么样的AB对比,我们来试试。我会说,这太酷了,展开讲讲。这样我们就能以快得多的速度,对更广泛的可能性进行原型设计和评估。所以,利用这些工具进入原型设计模式的技能,我认为非常有用。

这个建议很好。我还想补充,我认为这也会推动PM更深入技术栈。也许这一点会随着时间改变,比如2005年做数据库技术,可能需要以不同于现在的方式深入底层。抽象层不断被构建,也许你现在不需要知道所有基础原理。不是说每个PM都要成为研究员,但我觉得要对它有理解,花时间去学习语言,培养对这些东西如何运作的直觉,哪怕只是一点点,也会大有帮助。

我觉得另一方面是,你面对的是一个随机的、非确定性的系统,evals 是我们目前最好的应对方式,但产品设计的世界里,你无法控制模型会说什么,你只能尝试。所以你需要什么样的反馈机制来闭环?你怎么判断模型跑偏了?如何快速收集反馈?你想设置什么样的护栏?你怎么知道它在全局上到底在做什么?这更像是你要理解这种智能每天在众多输出、众多用户中的整体表现。这和以前完全不同,以前bug报告是“用户点了按钮但页面没跳转”,那是一种很可知的问题。

也许五年后人们习惯了会改变,但我觉得我们自己还在适应这种非确定性的用户界面。当然,那些不是技术出身、但正在使用AI的人肯定更不习惯。这违背了过去25年使用计算机积累的所有直觉。以前,如果你输入完全相同的东西,计算机通常会给你完全相同的输出,现在不再是了。我们不仅要自己适应这一点来做产品,还必须站在用户的角度去想,这对他们意味着什么。这里面有缺点,但也有很多很酷的优点。所以思考如何在不同场景下利用这一点,是很有趣的。

我记得我们在 Instagram 做过很多滚动式用户研究。我们的研究员每周会带不同的人来,只要有原型就绪就会拿去测试。我们在 Anthropic 也做同样的事。但有意思的是,在那些测试环节中,以前经常让我惊讶的是用户如何使用 Instagram,他们的用例或者对新功能的反应总有有趣的地方。而现在,一半是这个,另一半是模型在那种情境下做了什么。你会想,哦,它做对了,这太棒了。这几乎有一种自豪感,当在用户研究环境中它反应良好时。然后也有沮丧的时候,比如,哦不,你误解了意图,现在已经翻到十页开外了。所以这也需要一点禅意,学会放手,不再执着于控制那些环境中会发生什么。

你们俩都曾打造过教会数亿人新行为的消费级产品,而且速度很快。这些AI产品的普及速度实际上比那还快。如果连PM和技术人员都没有太多直觉去使用它们,你们如何在你们这样的规模上教育最终用户去接受如此反直觉的东西?

我的意思是,人类适应的速度真的惊人。前几天我和一个人聊天,他跟我讲他第一次坐 Waymo 的经历。在座有谁坐过 Waymo 吗?或者在这里坐过?如果你还没坐过 Waymo,而你又在旧金山,那离开这里后打一辆 Waymo 去你要去的地方吧,那体验很神奇。他说,最开始的30秒,我心想,天哪,小心那个骑车的人!五分钟后,变成,天哪,我活在未来了。十分钟后,就开始无聊地刷手机了。你看,我们对这种绝对神奇的东西,适应得多快。

我觉得,ChatGPT 到现在还不到两岁。它刚问世的时候绝对是令人震惊的。现在我觉得,如果要我们回头去用最初的那个,不管是 GPT-3 还是什么……