🎙️AI 访谈库
Anthropic 如何在模型就绪之前就构建 Claude Code 这样的产品 | Dianne Penn
Dianne Penn · Anthropic 研究与 Labs 产品负责人(公司首位技术 PM)

Anthropic 如何在模型就绪之前就构建 Claude Code 这样的产品 | Dianne Penn

How Anthropic builds products like Claude Code before the AI models are ready | Dianne Penn

2026-07-26 · Lenny's Podcast (Lenny Rachitsky) · 1h33m · 约 70 分钟读完 · 原文
2023 年以首位技术 PM 身份加入(当时产品团队仅 5 名工程师)的 Dianne Penn,讲述 Anthropic 从 underdog 到史上增长最快公司的转折点,以及 Claude 是如何变得这么会写代码的。看点:她参与了 Claude 2 至 Fable 每一代模型并孵化了 Claude Code、MCP、Skills 与 computer use,详解其团队开创的 eval 驱动开发闭环,以及为何'Claude 敢于反驳'是其成功关键。

2023年我刚加入时,没人会把 Anthropic、Claude 和编程放在同一句话里。

我想回到 Anthropic 创立之初。我记得当时心想,天哪,这些人根本没机会。OpenAI 遥遥领先。

当时,我看到人们开始用这些模型不只是做代码补全,而是真正在写长篇幅的代码。 这让我看到我们可以把 Opus 3 训练得更擅长这方面的机会。那就是转折点。

一年后,我总会想起寒假期间的 Opus 45,当时大家都放假在家,能够写代码。

Opus 45 的神奇之处在于,我们不仅拥有了一个模型,还拥有了一个载体、一个出色的产品体验,比如 Claude Code。如果没有 Claude Code 这样的产品,Opus 45 就不会有那个高光时刻;而如果没有 Opus 45,Claude Code 也不会获得如此快速的采用。

我想聊聊产品经理的角色正在如何变化。

对我团队来说,创造用户价值的方式是找到合适的用户反馈。评估测试(evals)——我们团队甚至有一句口头禅:evals 就是新的 PRD。

这也是 Gary Tan 一直在谈的话题。如果你现在每年愿意花 10 万美元买 token,那你就是在过 2028 年人们将要过上的生活。

你必须像对待像素一样精打细算地对待 token。你必须利用模型来产生好想法、棒想法和更好的想法。这一点没有捷径。如今人们需要对 AI 工具更有野心,因为它们的能力太强了。

我常问团队一个问题:假设 Claude 8 问世了,用户的行为会发生什么变化?这对我们今天的产品构建方式意味着什么?

今天我的嘉宾是 Diane Penn,Anthropic AI 研究与实验室团队的产品负责人。她在三年多前以首位技术产品经理的身份加入 Anthropic,在 AI 领域,三年就像是过了一辈子。 当时产品团队只有五名工程师。她参与交付了 Anthropic 从 Claude 2 到 Fable 的每一代模型。她还参与孵化和推出了 Claude Code、MCP、Skills、Claude Design,以及计算机使用(computer use)、工具使用(tool use)和推理等核心能力。

能与身处 AI 和产品管理核心位置的人交谈,总是让人感到愉悦和思维开阔。很难想象有谁比 Anthropic 研究与实验室团队的产品负责人更能看清未来的方向。 在开始之前,别忘了访问 lennysproass.com,领取一年免费使用权,全球最热门、设计最精美的 AI 产品,专供 Lenny's Newsletter 订阅用户独家享用。话不多说,有请 Diane Penn。Diane,非常感谢你来到节目,欢迎。

谢谢,Lenny。很高兴再次见到你。

我想回到 Anthropic 的早期,呃,刚成立的时候。我记得 Anthropic 刚发布第一款模型大概是,不知道,几年前,三年前左右吧。

是的。

三年了。我当时就觉得,天哪,这些人根本没机会。OpenAI 遥遥领先,每个人都在想,他们怎么想的?这怎么可能?OpenAI 已经赢了,太晚了。呃,但现在情况完全不同了。我看到的最新数字是 Anthropic 的 ARR 大概有,不知道,500 亿美元。这相当于过去很多非常成功的公司上市时的估值。而据报道 Anthropic 每年都能赚到这个数。你是最早加入的产品经理之一。当时好像只有五名工程师。你加入时模型甚至还没[清嗓子]发布。Anthropic 早期是什么样的?有什么可能会让外界感到惊讶的事情?

我认为 Anthropic 今天取得成就的核心要素,在早期就已经奠定了。就像你说的,我在 2023 年加入,当时有五名产品工程师。如果你相信的话,我们整个 API 业务只有一名工程师。我觉得很大一部分原因在于文化非常强大,这也是我向那些对这家公司感兴趣的人强调的一点。他们真的在践行使命、文化和价值观。能量状态完全就是一家创业公司。你说得对,早期我们确实在努力寻找自己的身份认同。一方面是技术,但技术如何为用户创造价值、为社会创造价值,这又会是什么样子?

我认为早期我们就在用不同方式探索这些。我们从 Claude.ai 做起,就像另一个聊天助手,然后逐步进化到工具使用(tool use)等功能。我觉得我们真正开始找到节奏的一个时刻,是推出了 Golden Gate Claude。不知道你还记不记得这个。

不记得。

这其实只上线了大概 24 小时。我们在 2024 年初发表了一篇早期的可解释性(interpretability)研究论文。其中的一个例子是,你可以在模型的各层中找到所谓的“特征”(features),它们表达某些特定主题。研究人员识别出的主题之一是,比如说,写项目符号。另一个是关于人物和地点。还有一个频繁出现且引起共鸣的主题是金门大桥(Golden Gate Bridge)。所以当你本质上调高那个特征时,Claude 就会对金门大桥产生执念。

也就是说,在它的每一个回答里,都会回到金门大桥这个话题。比如你说“给我一个做意大利面的食谱”,它会说“这是一个食谱,而且里面的橙色就像金门大桥的国际橙一样。”就真的很古怪。我们当时非常想把这种体验带给大众,带给那些开始使用 Claude 的人。所以整个体验实际上我们在 Claude.ai 网站上 24 小时内就搭建上线了,这需要工程、产品、设计,还有我们的研究团队通力合作,我们为此感到非常自豪。说实话,可能只触达了 2000 人 。

但这让我们觉得,哇,我们其实可以带来新的用户体验,以一种与众不同、且符合我们自身特色的方式展示我们的研究,而且是以非常创业公司的速度推进的。对我来说,那就像是早期一个隐秘的转折点——我们开始找到自己的身份认同,能够打造与竞争对手不同、与市面上已有产品不同的产品和体验。我认为后来的 Labs、Claude Code 等等,让我们开始明确自己的身份:我们如何看待 AI,如何将其更贴近大众。但那时的文化是非常自下而上的。

整个体验都是自下而上推动的。我看到工程师、设计师主动抽出时间来做这件事。所以我总是用这个例子来说明早期是什么样子的,但文化和价值观我认为从早期到现在一直保持着高度一致。

本集节目由我们本季的呈现赞助商 WorkOS 为您带来。OpenAI、Anthropic、Cursor、Vercel、Replit、Sierra、Clay,以及数百家其他成功企业,它们有什么共同点?它们都由 WorkOS 提供支持。如果你正在为企业打造产品,你一定感受过集成单点登录(SSO)、SCIM、RBAC、审计日志以及其他 大型公司要求的功能时的痛苦。

Work OS 通过专为 B2B SAS 打造的现代开发者平台,将这些交易障碍转化为即插即用的 API。毫不夸张地说,我投资的每一家开始向上游市场扩张的创业公司,最终都会与 Work OS 合作。因为他们是最出色的。无论你是试图签下第一家大企业客户的种子期创业公司,还是正在全球扩张的独角兽企业,Work OS 都是实现企业级就绪、打通增长路径的最快方式。它本质上就是企业功能领域的 Stripe。访问 workos.com 开始使用,或者直接去他们的 Slack,那里有真正的工程师等着回答你的问题。Work OS 让你通过设计精良的 API、全面的文档和流畅的开发者体验来更快地构建产品。前往 works.com,让你的应用今天就具备企业级能力。

回想 Anthropic 从当初那个试图与 OpenAI 这样的巨头抗衡的实验室,发展到今天的模样,还有哪些重大的转折时刻?有哪些让你印象深刻的瞬间,让你觉得“哇,这真的改变了一切”?

绝对是我们在训练和测试 Opus 3 的时候。我想那时公司还不到 200 人,但我们非常清楚,自己需要并且想要打造一款 frontier model,而这对我们触达用户、消费者以及展示研究成果来说至关重要。我们也在寻找答案:为什么有人要选择 Claude?这是一个核心问题,也是早期大家一直在问我们的问题。我认为 Opus 3 最终发布是在 2024 年 3 月初,但在此之前的好几个月里,inference、research、fine-tuning、pre-training 等各个团队在不同阶段齐心协力,朝着共同的目标努力,我想每个参与者都感到非常自豪。

我记得作为 PM,我和各位研究负责人当时大概在 12 月,大家都在各自父母家里,从视频背景中能看到每个人童年时期的房间,所有人都在非常努力地思考:我们训练这个模型的目标是什么?它的表现是否符合预期?所以我觉得那一刻在建立信任方面非常有力量。很多当时参与的研究负责人,现在正带领我们的 reinforcement learning、character work 和 alignment 工作。这种基础的信任也帮助我们现在在产品与研究的各个生产模型上都能良好协作,因为早期我们曾一起在战壕里并肩作战。

然后还有像意识到编程能力很重要这样的事。2023 年我刚来的时候,没人会把 Anthropic、Claude 和编程放在同一句话里。我觉得当时像 GPT4 这样的竞争模型虽然也会被用于编程,但只是众多用例之一。而我观察到的是,人们开始用这些模型,不仅仅做代码补全,而是写长篇幅的代码。那我们是否可以把 Opus 3 训练得更擅长这个?从训练角度看,这最终只是一个相对较小的改动,但却帮助我们在早期形成了竞争差异化,吸引了许多最早期的 Claude 爱好者和开发者,因为我们提供的价值在当时是他们认为不可能实现的。

你谈到 Opus 3 时,感觉那是很久以前的事了,很难想到那曾是一个重大转折点,所以听到它在内部是一个重要里程碑真的很有意思。这几乎像是你们建立了一种信心:哇,我们真的能够发布 frontier model,虽然以今天的标准来看,和现在的模型相比已经不算什么了。我一直想到的是 Opus 45,有趣的是,差不多一年后,同样是在寒假期间,大家都在家里写代码。那也是另一个重大里程碑吗?

是的。Opus 45 绝对也是一个重要时刻。我觉得 Opus 45 的神奇之处在于,我们不仅仅拥有了一个模型,还拥有了一个载体——一个出色的产品体验,比如 Cloud Code。我们团队在内部经常说,你需要 frontier products 才能拥有 frontier models,也才能让人们感受到 frontier models 的魔力。我想,在那之前的很多个月里,我们已经感受到了 Cloud Code 的魔力。

但关键在于,模型的智能水平达到了一个新的高度,在非常广泛的层面上,用户能够在新的用例中体验到 frontier intelligence,并让它以 agent 的方式端到端地运行任务。我认为那才是转折点。实际上,这两者缺一不可。我觉得如果没有 Cloud Code 这样的产品,Opus 45 不会迎来那样的时刻;而如果没有 Opus 45,Cloud Code 的采用速度也不会那样大幅加速。

顺着这个话题,有趣的是,如果你回顾 Dario 的所有预测,他当时就说,编程将在大约一年内被 100% 解决。他一直在说 AI 将承担我们所有的编程工作。我记得当时所有人都说:“不可能。这太复杂了。AI 怎么可能擅长人类做的这种极其复杂的事情?不,未来很长一段时间还得靠人类。”他完全说对了。他还经常提到另一个观点,就是我们现在所处的这条指数曲线。他是这样描述的:我们正处在这条指数曲线上。我记得不久前,新模型不断发布,大家都在说:“好了,我们已经到头了。

没有上升空间了。正在 plateauing。结束了。没有增长空间了。”而现在情况完全相反。我们现在正身处指数曲线之中,如果你去想这条指数曲线的形状,我们现在就在它的内部,这意味着根据定义,每一次改进都是巨大的飞跃,因为我们正处于曲线上那个曲棍球杆式的拐点部分。身处这样一个 AI 进步如此之快、如此之多的疯狂历史时刻内部,是一种什么样的感觉?人们应该如何为 AI 能力持续增强的即将到来的加速做好准备?

我常对团队说,当互联网从一种新奇事物转变为每个人都能使用的工具时,我们大多数人还没有真正进入职场,而那种感觉就像是人类正在经历某种……我觉得类比很有帮助,关于这一点我想说几个方面。第一,适应能力变得非常重要。我们有 evals,有安全方面的 safety testing 和 red teaming,在能力和产品层面有新的原型、Cloud Code、Tag 等产品,但很难精确预测那个特定的时刻或特定的模型。

因此,当你面对新信息时,适应能力就体现在:你是据此做出更好的决策,还是坚持原来的计划?所以这种敏捷性非常重要。另一方面是,在此基础上,你如何真正用 first principles 去思考,并推导出接下来会发生什么?那意味着什么?我们如何投资新产品?如何投资向用户解释这些差异?所以我觉得身处这种指数增长中的很多体验,就是理解这种节奏,懂得如何运作并做出更好的决策,然后运用 first principles 思维去做一些事——比如把原本预计几个月后才启动的计划提前,因为现在模型已经能够胜任并实际推进,最终将其带给用户。

所以像是协作技能标签这类东西,这是一个非常积极的自我强化循环。而且我认为其中很大一部分其实是彼此之间的信任——确保我们经过了正确的决策思考,让大家都能跟上。有些团队可能比其他人更早感受到这种指数级变化。那么我们如何以从容的方式让整个不断成长的组织和公司都能跟上呢?

所以我理解你的意思是,你几乎无法预知每一次模型发布会带来什么可能性。因此重要的是在事物涌现时保持适应能力。正如你所说,产品本身必须追赶上技术的可能性。再说回你的观点,虽然它能做很多事,但人们可能不理解如何去做,也可能做不到。所以产品要做到易用,甚至只是告诉用户“你可以做这件事”,感觉也是很重要的一环。这大致是你想表达的吗?

我想是的。我认为在最初的 scaling law 论文中有一些非常有趣的图表,我想大家对 scaling loss 已经很熟悉了——从增加算力和数据的角度来看,所谓的 loss,也就是 next token prediction 的损失,会下降。所以这是一条非常平滑的线性曲线,意味着随着模型规模扩大,它们变得更聪明。但那篇论文中同样有趣的是,还有一些非常不同的 emerging capability 图表。

比如说,当你增加数据、用更多算力训练模型时,你会看到这些不连续的 emerging capabilities 的跃升。模型从无法计算 1+1,变成能够可靠地计算 1+1。所以这些 emerging capabilities,这种可预测性的本质,并不是说每个人都知道确切时刻——你需要 eval 才能评估——这实际上一直是这项技术运作方式的一部分,也让安全之类的事情变得更难,因为除非你有 eval,有测试系统,否则这些跃升可能发生而你却浑然不觉。

这太有意思了,你可能已经开发出了这样一个 AI 大脑,它能做某些你甚至没意识到的事,所以工作的一部分就是去发掘:哇,我们刚刚在这件事上变得很厉害了,我们能用它做什么?

我觉得存在 product overhang 和 user overhang——也许用我们 PM 的语言来说,即使在今天的模型上也是如此。我认为我们在当前版本的 Opus 上还有很多可以探索的空间,当然也包括像 Fable、Temple 这样的项目。这种探索实际上也是 Anthropic 早期 DNA 的另一部分,我认为它也将继续成为我们产品、实验室以及整个研究团队运作方式的重要一环。这让我想到 Gary Tan,Y Combinator 的总裁,我不知道他具体头衔是什么。

他有一个有趣的观点:如果你现在每年愿意花 10 万美元在 token 上,你过得就像 2028 年的人一样,因为到那时这会非常便宜,每个人都能这样工作。所以现在有一个 alpha 机会,就是直接活在未来,疯狂地在 token 上花钱。因此人们有很大机会去了解未来是什么样,并且建设得更快。你对这个想法,以及所谓 "token maxing" 的价值,怎么看?

是的,我认为我更倾向于从产品的角度来看。token 的投入更像是输入,而真正的输出是你所说的实验。我觉得如果我们将目标围绕实验来设定,那可能是对结果的更好 framing,因此也可能有不同的方式来实现这个结果。我可以说,在内部,一些最有创造力的思考者、最优秀的原型设计者,确实会在每一个新的研究模型版本出来时,花大量时间与 Claude 相处。所以有一点很关键:你必须使用这些模型,才能想出好主意、更好的主意、再更好的主意,这一点无可替代。

当技术变化如此之快时,如果不接触技术,很难制定出完美的策略。同时,我认为我们还可以做其他事情。比如我们经常在 Anthropic 内部公开地工作。早期产品界面还不多的时候,有一个 Slack 频道,几乎全公司的人都在测试早期版本的 Claude,尝试不同的 use case。当时人们并不叫它们 use case,但你会让它改一篇论文,或者想出发这封邮件的恰当方式。它们其实都是不同的 use case,但我们都是公开地做的。

然后你会神奇地看到,不同的用户或团队里的人提出一个想法,然后其他人尝试这个想法的不同变体,可能在大约 10 次左右的请求内,就会出现某种神奇的东西,或者涌现出一个新的 use case。我认为这很有价值——不只是靠个人独自摸索如何使用这项技术。我们可以做更多事情,在进行实验时实现那种 communal discovery。实验不一定总是一项个人运动。

这太有意思了。是的,这种想法就是我们不确定它到底能做什么,或者我们能用它做什么,需要不断试探,人们不断尝试,听别人在尝试什么,才能弄明白什么是可能的。这太有意思了,我不知道这是技术本身的特点,还是就像:好吧,我发现了它能做这件事,你要怎么用它?

我觉得从大的主题上我们知道,对吧,我们知道模型能写出很棒的文章,能写长文,但具体到你能用它解决什么痛点,并把它带到用户可以使用的层面,我认为这更需要基于探索或实验。

顺着这个话题,你负责实验室团队的产品工作,这非常酷。我们的播客请过 Ben Mann,还有 Mike Griger,他们现在都在实验室工作,聊过实验室的事。实验室是什么?实验室出了什么成果?很多人听说过这些东西,但它们是如何运作的,让它们甚至能在 Anthropic 核心产品团队之外产生如此创新的想法?实验室的核心理念,在很多方面就是识别并跟进那些可能不在核心路线图上的、不连续的大赌注,弄清楚那里到底有没有东西,以及那个东西的 10 倍、100 倍、1000 倍会是什么。比如说像 Claude Code 这类东西,我想——

我听说过(笑)。像 Claude Code 啊,像 skills 啊,还有最近的 Claude Design MCP。我们在团队内部真正想强调的是,特别是现在,可以构建的东西太多了,那么什么才算是不连续的赌注?我认为我们今年采取的一种方法是,你可以对某个主题或领域持有非常坚定的看法,但对具体原型则保持更宽松的态度。所以这里有一种实验文化。有很多自下而上的动力,团队里的工程师非常自主,自我驱动地测试不同想法。有时我们有一个假设,但它可能暂时还不成立,那么我们可能会在一到两个模型代际之后重新审视它。所以这种原型最终只是帮助我们学习的想法,即使它没有立刻带来上线的产品,也是很有价值的。

因此,我认为这使得实验室的孵化和使命能够真正加速,并让 Anthropic 更全面地预见未来。想到 Anthropic 内部还设有一个实验室,本身就很有意思,因为 Anthropic 已经极具创新性和创造力,产品发布快得惊人,但即便如此,在内部设立一个实验室团队仍然有价值。是什么让实验室能够如此高效地运作?因为你列举了所有这些产品,而且感觉 Anthropic 发布的其他东西里,几乎所有最大的胜利都来自实验室。当然,肯定还有很多我现在一时没想起来的。那么,在一家更大的公司内部,创建一个成功的实验室,核心要素是什么?

我认为是团队文化——与 Anthropic 整体类似——团队文化非常宝贵。我认为 Ben 设定了极其宏大的愿景,推动人们去思考一个想法的 10 倍、100 倍潜力,而且实验室内部的小组团队规模很小。有时候,这些想法是从一名工程师开始的,对吧?我认为,有时候当团队规模过大,去追求非常模糊且宏大的想法时,实际上反而会被拖慢速度。所以,我认为关键在于文化。我们实际上也会筛选那些真正愿意做从零到一实验的人,而这并不容易。我们最终放弃或叫停了很多赌注,也许未来会重新考虑它们。但这很难——当你倾注全部心血,像一个创始人那样为某个赌注付出,而它目前还没有起色时,这非常艰难。所以,我认为关键在于筛选那种性格的人——那些对从零到一充满热情并深入钻研的人。

所以你负责研究团队的产品工作。你与 Anthropic 的研究人员合作。很多人对什么是研究、研究人员做什么有个大致概念,但我想很多人并不完全理解这些在所有 AI 实验室里都非常宝贵的人才。我的理解方式——也是我想帮助大家理解的——是,研究人员一整天都在做什么?我想象的是,他们对如何改进模型有一个假设,然后寻找数据,调整算法,检查并调整训练方式,接着测试,看效果如何,不断迭代,持续寻找改进模型的方法。这大致对吗?或者帮我们理解一下研究人员整天都在做什么?

这确实——我认为这更多是日常层面的工作。关于研究人员以及 Anthropic 这样的研究组织,还有一点是,他们也对未来有更广阔的愿景。例如,甚至在公司成立之初,研究人员就在讨论如何让 Claude 使用电脑,如何让 AI 操作屏幕界面。所以,很多研究人员身上其实有一种非常像创始人的能量——我是这样描述的——或者说,真正大胆且雄心勃勃的研究人员,而 Anthropic 有很多这样的人。所以有一层是关于这项技术未来方向的愿景;然后在循环的另一端,既然这项技术或 Claude 已经交到人们手中,我们如何让它在今天变得更好?

因此,既要中长期地思考未来的视角,也要关注当下和短期内我们可以改进的领域。我认为你描述的确实很好地体现了如何对 Claude 的不同版本进行迭代改进。我的团队与研究人员合作的方式,是深度融入和嵌入到这些循环中,特别是在对用户影响很大的领域。比如视觉、computer use、编程、agent coding、tool use、test time compute 等对用户有直接影响的方面,然后想办法把用户反馈带回来,将其转化为研究人员能够理解且可执行的层面。

我认为这是第二点,实际上也是工作中很重要、有时也很困难的部分。例如,我们可能会在 claude.ai 上收到反馈:Claude 出现了幻觉。这非常模糊。如果你拿着这个去找研究人员,说“请修复 Claude 的幻觉问题”,这并不太可执行。所以我们团队的一部分时间花在理解上:好的,这位用户给出这条反馈的轨迹是什么?而且这通常有具体情境。于是我们会分析:在那一刻,Claude 本应该调用什么工具?或者基于它当前的知识,它调用了正确的工具、查看了正确的文档,但提取了错误的事实。

第一种情况属于 tool use 的失败;第二种情况则可能是 search、知识检索、search synthesis 的失败,或者也可能与 alignment 有关。因此,要把这种细节程度带给研究人员,判断这是否是个足够大的问题,设计 evals 来描述我们如何改进——这些才是可执行的层面,也是研究人员的日常语言。所以我们努力紧跟如何在用户与核心模型训练及研发循环之间,以可执行的方式传递这些信息。

前几天我和人聊天,感觉 AI 研究现在是如果你想在生活中取得巨大成功,最应该去的地方。据你所见,成为一名真正成功的研究人员需要什么?你知道,不是每个人都能进入这个领域,不是每个人的大脑都能以这种方式工作,但假设有人说“嘿,我想探索这条职业道路”,据你所见,要做到这一点需要什么?

研究人员通常指的是研究人员,以及与研究人员合作的产品经理,或者两者都算?

两种都谈谈吧。但与研究人员合作的产品经理也会非常成功。只是感觉现在每个人都在试图从各家公司挖走顶尖研究人员。我知道你不是 AI 研究人员,但就你所见,在这条职业道路上取得成功需要什么?

是的,我认为 Anthropic 许多最成功的研究人员和研究领导者,都是非常擅长对问题进行第一性原理思考的人。他们能很好地推理问题。他们对自己的研究领域充满热情,并且对该领域可能的样子有大胆的描述。然后,他们实际上非常贴近细节。你知道,我们的领导层、首席科学家、fine-tuning 负责人以及 RL 团队的人,实际上都非常贴近训练过程,会查看训练运行的 eval 情况,查看底层数据。所以,真正贴近细节,并且对钻研细节充满热情,我认为这是非常优秀的研究人员的标志,也能培养品味。

我认为另一点是他们能够随着时间的推移进行宏大的思考,并且非常有野心,对吧?就像 Dario 说的,我们可以变革软件工程……我认为朝着那个方向,你会学到很多,你必须在许多方面、在你的想法上志存高远,我觉得这样才能成为一名成功的研究人员。

我很喜欢“要更有野心”这个说法,现在经常被人提起,但这太难了。说起来容易,真正做到却很难——你能把目标设到多大?而这也是 AI 现在所解锁的很多东西。就是要更有野心。

是的。

我认为要把问题彻底想一两次,然后对领域保持坚定,但在具体方法上可能更灵活一些。这也是我们一直在挑战自己的一个问题。

技术迭代如此之快,那么如何确保你正在构建的东西真正具备向前兼容性?我认为这也是核心产品开发循环的一部分:要有更大的格局。我经常问团队,或者说我在构建产品时会这样想——假设 Claude 8 问世了,用户的行为会发生什么变化?这又对你今天构建产品的方式意味着什么?它是否能与未来的体验向前兼容?所以我觉得,“有雄心”这个说法很宽泛,需要想办法在某些方面将其具象化、描述清楚。

而且,是的,所有事物都要朝着一个连贯、合乎逻辑的方向推进,而不是在一个完全不同的方向上盲目追求野心。说到雄心和 Claude 8, uh,Fable Mythos 最近似乎让模型触及了一个全新的转折点。过去的情况是,你有一个很棒的模型,发布它,“大家好,欢迎,Opus45 上线了,所有人都能用”。但 Mythos 走上了一条截然不同的道路。它被拦截了,受到了大量审查,人们非常担忧它的能力。所有公司都不得不去确保它不会入侵他们的系统。而现在,感觉每一个模型因为能力持续提升,都会受到更多审查,并且会有更多关于谁能使用它们的限制,这感觉是件大事。你怎么看这件事?它如何改变了你们的运作方式?

政策和出口管制方面,或许我会留给那些负责并从事相关工作的同事去谈。我认为产品层面的问题,以及我们内部如何应对——正如你提到的,随着前沿模型能力越来越强,防护措施、红队测试的方式以及发布前的流程,也都需要快速演进和调整以应对这种变化。举个例子,在 Fable 模型之前,我们没有那么强的 fallback UX 和系统,因为我们的目标是确保这项技术能产生非对称的收益,同时最大限度地降低其负面影响或严重风险。

所以我们最终构建了 fallback 系统,这样用户仍然能从 Opus 4 获得很好的回复。因此,随着我们不断改进安全系统,如何持续开发并提供出色的用户体验,这其中有很多工作要做。我认为我们在两方面都还有很大的提升空间。所以在未来几周乃至几个月里,你会看到我们在不断创新,持续改进我们目前所称的 model safeguards package。

真正有趣且出乎意料的是,这为 Anthropic 创造了一种非常独特的优势——你们能接触到最新的东西,而且这种情况会在每个实验室发生。每个人都会持续进步,这在实验室内部创造了一种不公平的优势:你能接触到别人还无法接触到的最顶尖的东西,而这超出了你的控制范围。你本来希望所有人都能使用它。因此,一个即将开始的、很值得关注的新反馈循环是:那些过于先进的模型只对某些公司开放,这将成为一种全新的、意想不到的局面,可以说是所有这些限制所产生的二阶效应。我们的目标是开发这些系统和模型,使其尽可能具有包容性。我认为我们的目标是不要让这种情况发生在通用型、日常使用的技术上,并让它们变得更易获取。你知道,这可以说是我们当前最优先的事项之一,以减少我们所看到的这种现象。

是啊,这说得通。我猜你希望尽可能多的客户,或者说尽可能多的人使用这款产品。本期节目由 Mercury 赞助,一家与众不同的银行,深受超过 30 万名创业者喜爱,现在更推出了 Command。我做 Mercury 的客户已经超过 6 年了,从未想过要离开。Mercury 本质上是由产品人而非银行家打造的银行。他们让发发票、转账、为团队成员设置虚拟卡变得如此简单,甚至可以说是有趣。你的银行有 API 吗?

有原生的终端 CLI 吗?有支持 AI 的 MCP server 吗?我不这么认为。就在最近,他们推出了 Command,一个直接内置在 Mercury 中的对话式界面,充当你的财务运营助手。我一直在用 Command 来转账、查看自己在哪些类别上花钱最多、分析现金流,而就在今天,我还用它查了过去一年从某个特定赞助商那里赚了多少钱。我只问了一句:“过去一年我从 X 那里赚了多少钱?”10 秒后我就得到了答案。

简直太酷了。访问 mercury.com 了解更多信息,几分钟内即可在线申请。Mercury 是一家金融科技公司,并非 FDIC 承保银行。银行服务由 Choice Financial Group 和 Column N.A. 提供,二者均为 FDIC 成员。

我想聊聊产品经理这个角色正在如何变化,以及在这个 AI 已成为我们生活核心组成部分的新世界里,什么样的人表现突出。你在招聘 PM、产品人员时,当你观察那些在当下世界中做得好的人,你注意到了些什么?你最看重什么?哪些能力的重要性在上升,哪些又在下降?

实际上,我的团队已经三年没有改变过招聘流程了。我们真正看重的特质,以及我们评估像 PM 这样的通才、或者像研究型产品经理这样的通才的方式,其实一直都没变。我认为其中一些特质,第一就是第一性原理思维。这实际上意味着,不是去套用你在做消费级产品或 B2B SaaS 时的旧模式,而是真正去搞清楚:在当下,针对这个用户群体,结合这项技术,用户价值究竟是什么。

能不能举个例子?很多人听到第一性原理思维时会说,“对,我懂这个,我很擅长”。那么,有没有什么人真正展现出了非常好的第一性原理思维的例子?

我觉得一个例子是,你可能觉得产品经理就是负责产品战略和交付用户价值,而我日常的工作体现就是写 PRD 或者写产品愿景文档。但对于我的团队,比如研究型产品经理来说,驱动用户价值的方式是找到正确的用户反馈,也就是 evals,对吧?然后这可以成为用户需求的一种具象化表达。所以我们确实也会写一些产品文档和 PRD,但我们团队里其实有句话:evals are the new PRDs,对吧?因为要交付用户价值,靠的不是过去一二十年里人们写的那种固定文档,而是一种新的工作方式。所以第一性原理思维就是:让我想清楚为了达成目标,真正应该做什么;而不是说,“这是我过去做过的一套活动,所以我将继续做下去”。

所以这里的思路是,过去通常是先有个想法,然后写一份 PRD,跟大家讨论,对齐计划,设计,开发,上线,看效果,再迭代。而我从你这里听到的是,比如说,这里有一些关于某个问题或机会的反馈。第一步现在变成了用 eval 来定义工作内容,而不是用 PRD。

也许第一步应该是理解用户的痛点。而即便是触达用户痛点的方式也已经不同了,对吧?过去,我们可能会做用户访谈,而且我认为如果你挖得够深,你可能会让用户带着你过一遍他们的使用流程、看每一个像素。而在这里,你必须像关注像素那样去关注 token。

所以我们团队在做的其中一项工作,就是阅读对话记录,深入理解那些失败路径,进而判断这究竟是幻觉,还是 Claude 过于自信。失败主题其实包含很多细微差别,由此你就能构建出一种持续的痛点描述。接着,这本质上可以构成一个新的 eval——它的 distribution 是否正确?是否既捕捉到了模型确实会失败的场景,也涵盖了它本不该出错的区域?然后再把这些反馈带回给研究团队,这样我们才能做出改进,并真正衡量效果:比如当 Opus 5.5 发布后,这个领域有没有改善?Claude 现在能否在文档中找准位置并提炼出正确的综合结论?核心就是可执行性,缩短与可执行性之间的距离,让我们的利益相关方和合作团队(比如研究人员)能够据此采取行动。

能否举一个具体的例子,比如你发现了某个问题或机会,然后据此写了 eval?而且在大多数情况下,eval 是什么样的?当人们想要想象一个 eval 时,他们应该想象什么?

这个概念其实是我们先在 Anthropic 内部开创的。早期的一个例子是,最初的 Claude 模型不太擅长遵循特定的 schema。比如输出 JSON 这类格式,而这正是 Claude 成为一个优秀 agent 的基础。对吧?如果你无法输出特定格式,你就不知道如何调用 API、无法使用工具等等。所以最初端到端的流程是,我听到很多关于 Claude 2 时期 Claude 不太擅长遵循指令的反馈。

于是我就深入追问用户:你说的“Claude 不擅长遵循指令”具体是什么意思?在什么情况下发生的?具体是哪一段内容?你输入了什么?Claude 又是如何回应的?要深入到这种细节程度。我发现,早期用户提到的这类失败中,大概 80% 的意思都是 Claude 没有写出正确的 JSON。于是我们就说,好,那先整理 30 到 40 个 Claude 没做对的例子。这其实就是你的 eval 数据集。本质上就是一组 prompt 和 response。

如果模型给出的答案不是你预设的标准答案,那就说明这个 eval 确实有价值,因为它在持续地识别这个痛点。然后我们就把它加入到 eval 仓库里。每次发布新版本的 Claude,我们都会跑这个 eval 检查。我想现在它基本已经 100%,或者说 99.9% 通过了。所以它不再是痛点了。但在早期,这个过程就是接收用户反馈、搞清楚他们真正的意思、能否复现、问题是否稳定、影响大不大,然后想办法把它标准化,让研究人员能用起来。

我们现在所处的世界,对 PM 来说基本上就是测试驱动开发。你先写测试。所以现在在 Anthropic,写 eval 是不是已经成为产品经理工作的核心部分?

我觉得是的。而且这也是我跟其他公司的 PM 聊过的话题,我认为这正越来越成为一项更广泛的技能,因为我们构建的很多产品都处于模型、harness 与特定用户场景的交汇点。所以 eval 不仅仅是模型团队的事,对整个产品团队来说,它也是通往更好用户体验的路径,因为无法衡量就无法改进,而且很多东西仍然基于实际体感,仍然基于主观判断,所以你必须贴近细节。

而且这也非常非 deterministic,这是很关键的一点,它不会每次都给你同样的答案。所以你得把描述写得更宽泛一些,不可能做到完全精确匹配。所以产品工作的开展方式正在发生、也将继续发生一个非常有趣的变化,eval 在其中扮演了重要角色。你们现在还会写 PRD 吗?还会写那种描述问题的单页文档吗?还是说这已经过时了?哦,你在摇头。会的,

我们确实还在写。我觉得当问题定义非常清晰时,eval 几乎就像一种速记。但在另一些情况下,PRD 非常有价值。PRD 是一个很好的工具,能让一大群人在关于体验的若干真相来源和目标设定上达成一致。所以每当我们推出一个模型,实际上都会有一份 PRD,这未必是为研究人员准备的,而更多是为我们不断扩展的产品界面、工程团队,以及像法务、安全这样的利益相关方准备的,作为一份关于我们要达成什么目标的真相来源,让一大群人能朝同一个方向使劲。

另一个我觉得 PRD 很有价值的地方,是在更模糊的问题和机会上。比如如果我们还没推出像 computer use 这样的功能,我们未必已经有一套明确的、针对具体用户的痛点。这时候 PRD 中产品愿景的部分就有价值了:你可以去探索,即使某项技术还没准备好服务所有人,如何先让某个特定群体用得好。这样你就能探索价值,实际上能为某个用户群体带来一个连贯的东西。所以我们确实还在写 PRD,只是应用方式稍有不同。

太好了。我刚和 Andrew 聊过,他是 OpenAI Codex app 的负责人,你们观点一致。PRD 没有消亡,在特定项目和想法上仍然非常有用。很好,我们可以就此定论——PRD 依然健在。我们一直在讨论产品经理需要具备哪些新兴技能。除此之外,你有没有发现,在这个新的 AI 时代,那些表现出色的产品经理或产品团队成员身上,还有哪些共同的特质或模式发生了变化?还有什么是你觉得必须转变的,或者你在招人时会更看重的?

我觉得特别是对于那些处于职业生涯中期,或者更多坐在管理型产品领导岗位上的人来说,有一点我感受非常强烈:要想成为好的团队管理者、好的 PM,在与这项技术打交道时,你必须自己非常亲力亲为,不仅花时间 tinkering,还要真正用这个技术交付过产品,而且再次强调,要深入细节,和你的 PM、工程师以及团队一起为 token 费心思。所以即使我招的是经验丰富的 PM,他们的入职计划也和早期职业生涯的人完全一样,核心都是理解用户、阅读经过用户同意的反馈、与客户交谈。

我觉得这里面有一点很关键:要能够知道该拿这项技术做什么,知道什么是好的标准,并且是通过非常亲力亲为的方式培养出这种认知的。这一点很重要。如果一个人没有亲身经历过搭建过程,他不一定能认同或真正看清一个好的、甚至伟大的 AI 产品或 AI 功能应该长什么样。所以我的感受非常强烈:如果你是管理者,你必须亲力亲为,你必须花一部分时间真正去交付产品,你必须设身处地,像你的团队一样亲历亲为。

呃,我总是尽量抽出一部分时间,在有模型的时候实际负责一到两个工作流,以此保持对模型的认知,保持对模型进展和提升速度的感知,这样我才能帮助团队做出决策,做出更好的决策。

那么,我听到的是,无论你在公司的层级阶梯上处于什么位置,如果你自己不亲自构建,如果你实际上没有在和 Claude 对话、没有在和 Codex 对话、没有在做东西,你是走不远的。

而且你应该享受使用这项技术的过程。我认为这是另一方面。我觉得无论级别高低,最成功的人都是那些热爱与 AI 共事、不断探索和实验,并专门抽出时间不仅做实验,而且真正亲手从头到尾交付产品、获取用户反馈的人。我认为这对每个人来说都必须是基础。

我完全明白你的意思。就像我运营着新闻通讯、做着这档播客,只是谈论各种事情,然后说“听起来不错”。但每当我真正做出点东西,捣鼓各种小项目时,你就会觉得“好的,我明白这里在发生什么了”。你会获得多得多的东西,很难准确描述你在实际与模型共事、实际做东西时的体验,但这就完全是另一个世界了——“好的,我明白了。这就是他们说的 computer use。这就是他们说的这个限制,这个用户体验状况。”

是的。

所以,就是这样。而且你提出了一个非常有意思的观点:你必须从中找到乐趣,但对很多人来说这并不容易,因为他们是被推着去使用 AI 的,或者他们根本不知道该拿它做什么。对于那些觉得“我不知道,这太烦人了。我只是不得不做这件事。我不知道这有什么好的,我讨厌这玩意儿。为什么我得用它?变化太快了。我累了”的人,你有什么建议能帮助他们在这份工作中找到乐趣?

我想再次强调我之前说过的一点:实验不是一项个人运动。我想我接触过的研究模型版本几乎涵盖了迄今 20 个版本的 production Claude,而部分乐趣正来自于看到其他人发现使用场景。所以这里有一个想法:找一个对此感到兴奋的人结对,围绕你在乎的使用场景一起探索、一起合作,而不是自己独自去识别或试图找出完美的使用场景,因为那可能感觉像工作。与他人合作往往更像是一种乐趣。我们还能做些什么来带动其他人呢?很多时候,在我们内部,某个非常好奇的人分享了一个新原型的想法,实际上会带动更多人——“哦,我不知道 Claude 现在还能做到这个”——于是这就形成了某种良性循环,以及继续从这项技术中获得乐趣的方式。

这点说得真好。我想这也是为什么 Twitter 在这类事情上特别有用——你能看到其他人分享他们做了什么,这会激发你想出自己的小点子,而且分享你自己做的东西也很有趣。

所以这一点非常好,就是找其他人一起玩、一起寻找使用场景。我还经常听到的一个建议是:找到你在生活或工作中想解决的一个问题,然后打开 Claude Code,告诉它你想做什么。哪怕只是对想解决的问题有一个模糊的想法,你能做到的深度都令人惊讶。

是的。

困难之处在于,你可以尝试的东西太多了。

是的。

所以你只需要聚焦在要么与人结对,和一个对这项技术充满热情的人合作,要么找出一件你能立刻发现价值的事。无论是哪种,都能让你更深入,而不是对太多事情只停留在表面。我发现很难跟上外面那么多原型或产品的节奏,所以我的视角一直是:我自己如何在一两个产品上做到深入。

你这么说我太感兴趣了,因为确实如此。我们刚刚做了一项调查,是我和同事 Noam 一起进行的,询问我的读者们对当下科技界和 AI 领域所有动态的感受。我们得到的最有趣的结论之一是,幸福感的来源正是你所说的:在几件事上做到深入,而不是试图做一大堆小事。找到几件事真正解决好,然后深入下去,这就是幸福感的来源,因为很多人的幸福感来自于他们终于解锁了让 AI 真正改善生活的方法,而不是几个搞砸的、破损的、半吊子的东西。

是的,关键是如何让这件事从“打个勾交差”变成别的什么。作为产品人,这实际上是一个对你时间和精力进行产品优先级排序的练习。如果目标是带着乐趣去实验,那么你需要什么样的输入条件呢?不过,我认为 Anthropic 的秘诀很大程度上在于文化,在于人们自下而上的工作方式,以及这种公开实验的做法。通过这样做,很大程度上就是在思考如何带动其他人同行。我认为这最终是非常有价值的。

是啊,我从各个实验室那里听过无数次这种说法:没人确切知道其中一些东西会被如何使用,很多时候就是尽早发布,看看人们怎么用它,看看什么是可能的,然后用这些信息来构建真正引领方向的产品。

是的,是的。

我很好奇,沿着这个思路,找到让 AI 在工作和生活中帮助你的方法。你最近作为 PM,有没有什么有趣的使用 Claude 的方式?

我想有很多东西,比如 Fable 和像 Tag 这样的产品。所以,我认为 Tag 还处于非常早期的阶段,我认为这里面涉及一种不同的工作范式:让一个 agent 去执行任务,然后把产品和体验带回给你。

有一个领域,虽然不算最近才有的,但我经常跟团队提起,而且我认为我们在使用 AI 方面可以做得更多,那就是如何利用它来让我们彼此之间的沟通更高效,成为更好的管理者。我不认为这仅仅是提高我们构建的体验的 IQ,我还大量用它来做准备,以便在关键时刻进行更好的对话。我很喜欢那本书,所以我其实有一个 skill,能帮助我判断:鉴于当前情况,我是否在以合适的详细程度进行沟通,并实际帮助我成为更好的管理者、更好的团队支持者。所以,对于团队中的管理者,这实际上是我一直在和我们的管理者们分享的一件事:好了,你到底怎样使用 Claude 才能让你成为更好的教练?

因为有时候很难找到完美恰当的措辞,而模型有很多完美恰当的措辞。

我认为这涉及到它如何从一个 ET 的角度真正增强我们。

天哪,那里有太多有趣的东西了。所以,为了理解你在那里具体在做什么……

所以你搭建了一个 skill。就像 Claude 从《Crucial Conversations》这本书里汲取经验来掌握一门技能,而它本身对这本书已经足够了解,你甚至不用把内容喂给它。然后你用这个 skill 去和 Claude 对话:“嘿,我马上要和一个同事进行一场非常棘手的对话。”

“给我一些怎么处理的建议。”

“对。” 这真的很棒,几乎就像个性化的私人教练,只是教你如何……而且我们整天都在频繁切换 context,让 Claude 来帮我搭档、协助我,也许有时候我最终并不会采纳 Claude 的建议。但它在头脑风暴方面确实非常有帮助。我这样理解对方的反应对吗?怎样才能更快更深入?更快建立信任,更直接。

是啊,老兄,我这边问题太多了。这太有意思了。一个是,大家担心人们说话方式会变得像 AI 写作那样,因为他们和 AI 聊得太多了,然后就会变成“Diane,不是这个,而是那个”。我知道你不是在这么做,但这确实是,你知道,大家的一个担忧。我就直接问了吧,你担心这个吗?有那种,你知道,大家常说的“brain rot”、大脑萎缩什么的。我们现在太依赖 AI 了,停止了学习和思考,你知道,过度依赖 AI,你对此怎么看?你离它这么近,又时刻和它深度整合。

实际上,思考和写作过程对我来说是紧密相连的。所以我认为在某些方面,我用 Claude 来增强我的思考。但我想确保——也许这正是你说的——Claude 不会接管我的全部思考。所以我认为,视情况而定,取决于我想在多大程度上保留个人判断,我可能会先形成自己的 POV,然后再和 Claude 一起打磨。并确保我始终保持自己的感觉和语气。然后还有其他事情,比如更新,我们有月度业务回顾,在那些情况下,我更希望它是标准化的,更希望信息能被凝练到恰到好处,而且我有一个 skill,我们在持续增强和改进这个 skill,但我想达到一种状态:月度业务回顾的写作本身,其潜在价值是不对称地低于思考过程的,那么如何把写作这部分完全交给 Claude,而我更多是审核者和验证者。

所以这取决于你用 Claude 做什么,你想传达什么,以及把它更多地交给 Claude 是否存在不对称价值。

我听到的第一个建议非常棒,就是先思考,形成观点,然后把 Claude 当作一个陪练伙伴,几乎是用来打磨想法、挑战想法。

对,对。我认为这正是我们的 alignment research 和 safety research 能发挥作用的地方,因为你不会想要一个只会附和你的 AI,对吧?你希望这项技术真正能增强你、推动你成长,并达成更好的结果。所以有时候让 Claude 反驳我,会让我变得更好。这很棒。就像同事一样,我希望当我的想法不够成熟时,有人能站出来反驳。

我想多听听这个。但我记得 Ben Mann 上播客时谈到过内置在 Claude 里的 constitution,以及这种专注于 safety 和 alignment 的工作,还有这个描述 Claude 应该如何思考和运作的 constitution,是多么反直觉——你会以为这会限制 Claude 的能力,让它变得没那么有趣。但结果完全相反。Claude 拥有最有趣的个性。我一直听到这种说法,就像是我更愿意和 Claude 交谈。

就像 OpenAI famously 是建立在 Claude 的基础上,然后人们被迫——我们不深入说了——被迫切换过去,他们会说“这太糟糕了,这不是我习惯交谈的对象”。所以这是个我觉得非常有趣的点,我想确保我们花点时间聊聊。为什么会这样?为什么这种对 alignment、safety 的关注,拥有清晰的 constitution,会让 Claude 更好、更有趣?

为了让 Claude 尽可能聪明、能干,能够让它在正确的点上真正反驳,而不是简单给出一个“是”或“否”,这实际上能帮助你得出更好的结论。所以,我用 Claude 来协助一些事情,比如“下一版 Claude 的定价决策是否正确?”这有点 meta,但使用研究版本的 Opus,让它去研究该如何定价,并能够得出更好的结果,这才是最终目标。所以,让 AI 不仅仅是一个助手,不仅仅是一个执行者,不仅仅被委派任务,而是去判断它做的是否正确。这其实与知道何时反驳是紧密相连的,

对吧?这是知道何时应该 proactive 的一部分。Proactivity 不一定总是去做你被安排好要做的事。而是知道何时提出新想法。所以为了让 Claude 更有用,总体方法必须是它知道何时 push back。这是模型核心特性的组成部分之一。

这太有意思了。太有意思了,它没那么 compliant,这几乎正是它更好、更有用的原因,因为我们需要那个。就像很多人跟我说的,“嘿,AI 告诉我我是对的。”不,我希望 AI 能反驳这些人。

对。这回到了我们之前关于思考的话题,对吧?你如何保护你的思考?

嗯,如果你有一个 AI 可以作为思考伙伴,一个思考伙伴不会只是附和你。它应该为你补充,你在一天结束时应该因为和 Claude 合作而拥有了更好的想法。这应该是最高目标,而不仅仅是把你的想法提升 10%。

是啊,我喜欢这个,因为以前像是“think 10x”,以前创始人就是像这样鞭策人的——“如果我们把这个 10 倍放大呢?”而我不断听到的是,像是“我们如何从这个想法出发实现 1000 倍?最具雄心的版本是什么?”我想回到我们刚才聊持续和 Claude 对话时我想到的一点。嗯,现在仍然很容易看出什么东西是 AI 写的。有趣的是,它是一个 large language model,你会以为它最擅长的就是写作,但有趣的是,不,AI 其实很不擅长写作,你总能很清楚地看出这是 AI 写的。你认为我们会发展到无法分辨这是 AI 写的地步吗?

我认为这取决于你想通过分辨来达成什么目标,对,eval 是什么。实际上,我确实认为我们在让 Claude 写得更好方面还有很多可以做。我的团队和研究团队在这方面有非常积极的投入。但总的来说,我认为应该清楚知道一个想法是由你主导、由你 Lenny 主导,还是由我 Diane 主导。我认为这真的取决于那份写作的目标是什么。比如对于月度业务回顾,我其实希望它完全由 Claude end-to-end 撰写。

呃,而且显然不要让它感觉像是人写的。你提出的这个观点非常有趣,像是知道这是 AI 写的,对我们来说究竟是更好还是更糟。

对。

但但这可能更多是从可验证性,或者谁来核实

输出来看的。对吧。就是说谁来签字确认。也许重点不在于谁写的,而在于谁来核实、谁来签字确认。这变得比是谁写的更重要。

你为什么觉得AI不擅长写作?我猜它学习了人类历史上所有最优秀的作品,已经弄清楚了最好的写作方式。而且现在说到底,写作的方式也就那么多。所以我们就意识到,好吧,这就是AI的风格,它有自己的这些套路。核心原因就是这个吗?还是有什么别的东西阻碍了它成为伟大的作家?讽刺的是,它终究是一个大型语言模型,你会觉得它本该非常擅长语言。

我觉得部分原因还在于,我们需要在训练改进上投入更多,让AI在写作等领域持续保持强劲。而且就像刚才提到的,技术的发展是不均衡的。有时候模型擅长写作,但不具备agentic能力,我们的核心思路就是如何让模型更具agentic能力,或者调用正确的工具。现在这方面有所改善之后,其他这些领域反而变成了更突出的短板。所以我觉得我们在写作上正处在一个这样的时刻:我们需要真正聚焦并优先训练模型在这个领域变得很出色,就像你说的,这是我们非常、非常活跃的一个研究方向。

好的。我很高兴,很高兴。另外,等AI写得非常好的时候,我们会说“我不知道那是谁写的”,但就像你说的,有时候我们其实想知道那是AI写的。这真的很有意思,我以前从没这么想过。另一个有趣的点是,有个 comedian 开玩笑说,我们在飞机上,Wi-Fi断了,我们就会说:“搞什么?这架飞机上Wi-Fi不能用,太烂了,你怎么敢这样?”可你明明坐在一根管子里,像鸟一样在天上飞,你怎么敢抱怨Wi-Fi不能用呢。你的意思是,技术已经取得了这么大的进步,具备了这么强大的能力,我们不可能把所有事情都解决好,不可能让一切都达到最优状态。所以基本上,AI写作一直不是优先事项,但现在感觉这方面的投入正在增多。

是的,我觉得语调和个性是优先事项。我认为技术进步本身就是个持续进行的过程,所以我们看到agentic行为出现了一次飞跃或突破,这成了一种新常态,然后其他能力也需要继续提升。

而且我觉得一旦我们把写作、语调和个性这些方面提升了,我们可能就会说

怎么让Claude变得更主动。生产力是一个机会,这也是人类的本性,我们想让自身变得更好,我们也想让这项技术变得更好。所以是的,我认为我们正把这应用到AI上,这是正确的方向。我们应该让它变得更好。

我想问你几个问题,这些问题我喜欢问那些身处即将到来的未来中心的人。一个是,你认为在未来几年里,人类的大脑在哪里仍然最有价值?我知道Anthropic的使命和愿景是我们要达到AGI、超级智能。所以在未来,也许人类大脑到处都没价值了,但在那之前,在我们接近那个时间点的过程中,你认为人类大脑在哪里仍然最有价值?

我们去年左右开始讨论如何让Claude和模型在判断力上做得更好。我觉得判断力是一个——这是一个汇聚了如此多细微差别和经验的领域,而这些系统还没有像人类那样经历过那么多,所以我觉得这种来之不易的判断力,对产品负责人以及更广泛的人群来说,将继续非常关键。AI能构建的东西太多了,但一个组织或实验室应该构建哪些东西呢?这很大程度上需要人类的判断力、 persistence 和主动性。这些都超越了一般性的能力,而是那个层次的人们的行为和特质:你如何找到最佳解决方案,如何创造最佳体验。

所以我觉得这类特质实际上是那些具体的、我认为会继续重要的特质。而且,在很多领域仍然需要专业能力和领域知识。你知道,软件工程已经被AI深刻改变了。但在生物学、生命科学等领域,我觉得我们还处在指数曲线的起点,也许软件工程算是已经踏上了指数曲线,有些其他领域已经在上面了,有些则还没达到。所以我想你看到我们推出了像Claude Science这样的产品,投资这些领域,因为这些领域能让这项技术真正造福社会。

所以我觉得这方面还有很多要做。

另一个问题是,作为有孩子的人,你如何看待鼓励他们学什么?或者说,你会不会引导他们在我们即将进入的这个疯狂新世界里取得成功?

其实我觉得很大程度上还是那些我和你小时候可能就被培养起来的特质,就是

对学习的好奇心、坚持不懈、相信自己内心的声音、培养并相信自己内心的声音。我有一个四岁的孩子,一个八岁的孩子。我们有责任——是我有责任帮助他们培养内心的声音,无论是变得有主见、敢于表明立场,对我来说都是这样,培养这些、鼓励这些。我觉得这类技能组合在未来很重要,拥有自己的独特声音。

这太有意思了。这跟你之前回答如何避免“脑腐”、避免过度依赖AI时说的完全相关,那就是在过度使用AI之前,始终专注于你自己的观点和你的视角。而你描述的在孩子身上培养这种想法,真的非常重要。这太有意思了,我很喜欢这一切是如何联系起来的:判断力、坚持,以及你自己的观点。

是的。

对孩子和成年人来说都是如此。

是的。你有没有想过什么,对你——

哦天哪。我一直在想的问题就是,什么时候让他们接触AI这类东西。你知道,我有一个三岁的孩子,所以现在谈这个还太早,但你知道,怎么让他们上手这个疯狂的东西呢?我最近参加了一个活动,一群家长在聊他们怎么看待孩子使用AI,有个人的做法特别有意思,就是让他们用非常早期的模型,这样他们还得费点劲,不能立刻得到所有答案。我觉得这很有意思。就像一个开源的本地模型,

不稳定。

是的。而且好奇心这个东西,我一直在提Ben,但他对这个问题的回答一直让我印象深刻,就是好奇心,还有他非常喜欢Montessori,这也正是我们在鼓励孩子去接受的。所以这中间是有关联的。最后一个问题,也是沿着这个方向的,是Fiona Fun建议我来问你的,她最近也上了播客。作为一位母亲,身处这场AI疯狂风暴的中心,在Anthropic做研究工作,呃,我只是觉得我们正生活在最前所未有的时代,即便只是作为Anthropic外部的旁观者。

这太疯狂了。我甚至无法想象身处其中是什么感觉。那么,关于如何避免倦怠、保持精力充沛、在这一切之中保持头脑清醒,你学到了什么?2024年我们一整年发布了四个模型,或者说四个系列模型,而我认为仅在今年第二季度,我们的发布量就超过了那个数字。 我觉得我非常幸运,因为我们所组建和培养的团队,无论是研究方面的利益相关者,还是研究产品管理团队内部,都很出色。我认为应对这一切的神奇之处之一在于,这不是一项个人运动。

这里有一种彻底的主人翁意识和团队协作精神,我觉得有时这确实像一项高强度竞技运动,因为你需要做出非常关键的决策。关于用户、关于训练的新信息不断出现,你必须非常迅速地给出建议、做出判断和决策,而没人能靠自己持续做到这一点。所以我认为真正有帮助的是拥有一支杰出的团队,成员们互相关照。比如在发布前夜,即使他们不是该模型的核心 DRRi,也会熬夜帮助那位 DRRi 审阅博客文章、修改内容、想出更好的演示方案,成为彼此的得力助手。

如果你把所有变化都独自扛在肩上,很容易感到孤立无援,觉得事事都得亲力亲为。但我认为 Anthropic 的神奇之处之一,就是我们能够找到互相帮助的机会,并且更进一步实现 mindmelding。我们称之为“进入 hive mind”。之前有篇文章就谈到过这个,我觉得这能让团队得以恢复元气。并不是说我刚在六月休了假,回来就会发现工作量变成了三倍。实际上,你可以放心休假,因为团队知道该做什么正确的事,而且我们每个人都会互相照看着。

所以我认为这是很重要的一部分。就我个人而言也非常幸运,我的伴侣非常支持我。这是我在 AI 领域工作的第六年了,从 Amazon 到 Anthropic,他看到了我对这项技术的热爱以及它能带来的可能性,这真的很有帮助,我想从个人角度来说也是如此。

我很喜欢这些答案之间的关联。所以我听到的是,要拥有伙伴、与他人共事、依靠他人,在事情变得疯狂时互相帮助。这和你之前关于如何在这份工作中找到乐趣和快乐的回答很相似。就是从他人身上获得启发,看看他们在做什么,

一起协作。

是的。有趣的是,Fiona 最近来播客时,我问她软件工程领域发生了什么变化,她指出现在孤独多了,因为我们现在是在和 agents 而不是其他人类一起工作。团队更小了,人们要不断与各种 fleets 对话。所以这提醒我们,身边有真实的人类是多么有力量。

因为技术带来了更大的规模,我们被要求去处理大事、做大决策,对吧?我认为拥有一些能在一定程度上与你实现 mind meld 的人,了解你做什么、如何处理问题,也许不是每一个细节,而是基本原则是什么?你做决策的假设是什么?这样他们就能支持你,或者推动你的决策、磨砺你的思维。所以我认为,在组建团队、发展团队、招聘时,我真的很注重这一点:这个人会更在乎自己的 ego、想建一个大部门,还是更在乎为 Anthropic 做贡献、为团队的影响力做贡献?我会倾向于那些低 ego、以团队为导向的人。我认为这是可持续发展的重要部分。

是的,归根结底总是文化和招聘。而且我听过很多关于 Anthropic 为何能行动如此迅速的原因。我记得那个时刻,好像整个月每天都在发东西。有一张发布日历,人们都在问这怎么可能?而我听到最多的原因就是,因为每个人都高度认同使命和价值观,这让人们能够非常迅速地做决策。在我们进入激动人心的 lightning round 之前,Dan,你还有什么想分享的吗?还有什么想补充的?有什么想在我们聊过的话题上进一步强调的吗?

这次访谈其实非常有趣,因为我觉得你的问题帮我梳理了一些思路,让我看清这些点是如何联系起来的。我在这儿就是你的真人版 Claude。有一件事我真的很想传达,或者说希望大家记住的是:一是工作方式,二是这一切伴随着大量的成长和变化,以及使用这项技术带来的快乐。如果你在这个时刻感觉没有那么多最初的喜悦了,你该如何找到那些拥有喜悦的人?如果这是一个你感到兴奋、想要投身的领域,我认为培养技能、在很多方面充实技能很重要,比如以 first principles 的方式思考你解决的问题。

从根本上说,虽然你没问我这个,但社区里有一个问题:当模型如此强大、工程师们又如此投入时,我们是否还需要 PM?我认为那些以用户为中心、深入了解用户想要达成什么、并将其提炼为可执行的方案、并不懈努力去做到的人,这些对我来说是产品人的核心,而且我认为我们其实需要更多这样的人。我觉得我们正变得非常以技术层为驱动,而要让技术产生真正的影响力,你必须深入其中,你必须保持好奇,你必须非常亲力亲为。我认为这些特质也帮助了 Anthropic,无论从产品开发、模型开发的角度,还是作为文化的一部分,希望这对其他人也有价值。

太棒了。多么鼓舞人心的收尾方式啊。天哪。是的。这一点我也说了很久,现在构建变得容易了,难的部分变成了如你所说,我们该构建什么?我们构建的东西是否正确、是否好、是否值得深入投入?对我来说,这就是 PM 的工作,也是 PM 擅长的事。

是的,是的,是的。关键在于深入了解用户。

是的,同理心。好的,太棒了。PM 会撑过去的。好了,PRD 还没死。 这里有各种重要的经验教训。Dan,既然如此,我们已经到了激动人心的 lightning round 环节。我有五个问题要问你。准备好了吗?

准备好了。

第一个问题。你发现自己最常推荐给别人的两三本书是什么?

一本比较个人化的,我很喜欢《How to Raise an Adult》。嗯,我是个妈妈。我经常思考我想在孩子身上培养什么品质。那本书很好地阐述了一个观点:我们不是在养育孩子,我们是在培养成年人。所以这个框架本身就很有意义:这意味着什么?我们想在孩子身上磨砺、激发和培养哪些特质?嗯,另一本我最近常在 Audible 上听的书是 Eric Reese 的《Incorable》,所以——

《Incorruptible》,《Incorruptible》。是的,是的。

是的。他最近上过你的播客。

嗯,是的。

我只是觉得如何打造伟大的公司这个问题很重要。我个人最着迷的,是如何让优秀的团队和公司持续前行。看到他如何构建和重构这个问题,非常有趣。我很喜欢其中一些关于文化指标的例子:如果你只衡量收入,那就会成为你追求的目标;但如果你有其他更好的指标,那才是真正维系你所关心价值观的方法。我一直在思考如何将其落实到团队层面,比如我们如何更好地明确那些团队规范,很多我们团队内部讨论过的事情。所以我觉得这也是一本很好的读物。

没错。各位听这期节目的时候,接下来可以去看 Eric Greece 那期。

非常棒的一期。

而且他的新书刚出版,叫 *Incorruptible*。

对。

我觉得它登上了《纽约时报》畅销书榜,实际上卖得特别好,我看到之后特别高兴。

是的,没错。

下一个问题。你最近最喜欢的电影或电视剧是什么?Anthropic 大多数人都没时间看剧,但我好奇你有没有答案。要我说,上个月休假的时候,我确实抽空在 Amazon Prime 上刷完了 *Fallout*。我其实挺喜欢的,它有点……你听说过吗?

听说过,听说过。是根据游戏改编的。

是的,是根据游戏改编的。我觉得它非常机智、幽默,而且动作戏很足。强烈推荐。

好的,下一个问题。你最近有没有发现什么特别喜欢的,爱不释手的产品?

我真的觉得 Claw Tag 在产品体验上非常有趣。我们在 Anthropic 内部其实也有不同版本的这类工具,我觉得它真的是一个非常非常强大的工具。

是啊,感觉有些人会觉得这有什么大不了的?但 Anthropic 每个人都在疯狂安利它,这说明肯定有重要的事正在发生。我正试着把它用在我那个付费 newsletter 订阅者的 Slack 社区里。要是能成那该多酷?

对啊。我在想如果不是在公司里,而是一群互不认识的人,这东西要怎么运转。但我们正在尝试。好了,还剩两个问题。你最喜欢的人生座右铭是什么,工作或生活中经常会想起的?

其实我是由祖父母带大的,人生的前十年都是。我父母当时是来美国读本科和硕士的移民学生。

哦,哇。

我祖父总是说:“无论你走多远,总有更高的层级。” 我觉得这其实很好,虽然也是相当强烈地描述了他的人生哲学。但每当遇到新鲜或前所未有的事情时,我都会想起这句话。今年上半年的确有很多这种情况,有很多新事物需要我们学习,我自己也在学习。所以就是感觉总有另一座山,另一个机会——

不够好,Dan,我们要做得更好。

我们要做得更大。这让我想起 Ben 在他播客里说的另一句话:这是未来最正常的一刻,之后只会变得越来越怪异和疯狂。

是啊。没错。好了,最后一个问题。

呃,我之前在你的 LinkedIn 上翻了翻。你早年曾在 JP Morgan Chase 做高收益债券交易员。你好像有一个被隐去数字的、上亿美元级别的交易组合。从那段经历中你学到了什么至今受用的东西?或者那个时期有没有什么疯狂的故事?那可是你人生中的四年。

我觉得我确实学到了很多,后来应用在 Anthropic 和其他工作中。我在 JP Morgan 的时候,交易大厅你可以想象有点像《华尔街之狼》里的场景,非常不一样。大多数交易员我想都是坐在终端前,更多是在电脑上做分析。但那里仍然是非常男性主导的。所以我是交易桌上唯一的女性,也是唯一有我这样背景的人。我学到的是,那是一个很好的环境,一方面培养了我真实的自我认知,另一方面让我明白,即使我是资历最浅的,即使我可能看起来不一样,但最好的想法,以及对最好的想法有信念,不管其他那些因素如何,才是最重要的。

所以我觉得就是把这种意识带到我现在的工作方式中。我在团队面前非常坦诚、真实。我努力确保无论级别高低、资历深浅,如果有人有好想法,如何帮助他们去推进,同时我自己也这样做。就是把想法提出来,真正对其有信念,跟进到底,去做那些繁琐的脏活累活让它实现。这些都是我从交易中学到的。我觉得在很多方面适用于任何工作。

说得太好了。如果人们想关注你,在网上哪里可以找到你?听众又能怎么帮到你?

我在社交媒体上没什么存在感。想了解我和我的团队的工作,最好的方式其实是看 Anthropic 的博客,以及我们发布新模型、新产品体验的时候。至于能帮到我的,我觉得最重要的是你们的反馈。实际上,如果你在产品的任何界面上点了赞或踩,或者联系你们的销售反馈模型的情况,这些都会传到我这里。我们每出一个研究模型,我都会非常密切地了解用户满意度和反馈。所以给我们反馈,去挑战 Claude,告诉我们它在哪儿不行,这些都能帮我们做得更好。另外,如果你的圈子里有我刚才说的那种类型的人,我正在招人,团队正在扩张。我们非常喜欢热爱这项技术、有深度好奇心、first principles thinker、敢于质疑假设,而且有爱折腾、爱鼓捣精神的人。

哇,理想工作。所以基本上 Anthropic 研究团队有开放的 PM 岗位?

是的。

我猜是在官网招聘页面申请吧?

是的。

天哪。好了,等着简历如潮水般涌来吧。

谢谢。

Dan,非常感谢你今天来。

非常感谢你邀请我。谢谢你提出这些非常有帮助、发人深省的问题,还帮我梳理了我们如何工作、这项技术如何整合,以及我们作为产品人如何身处其中。

我真的很感激。不过说真的,谢谢你,Dan。好了,各位再见。非常感谢收听。如果你觉得这期节目有价值,可以在 Apple Podcast、Spotify 或你喜欢的播客应用上订阅。也欢迎给我们打分或留下评论,这真的很能帮助其他听众找到这档播客。你可以在 lennispodcast.com 找到所有往期节目或了解更多信息。下期再见。