🎙️AI 访谈库
走进模型工厂——Poolside AI 联创 Eiso Kant
Eiso Kant · Poolside

走进模型工厂——Poolside AI 联创 Eiso Kant

Inside the Model Factory — Eiso Kant, Poolside AI

2026-07-23 · Latent Space · 1h55m · 约 120 分钟读完 · 原文
只看

订阅 登录

Latent Space:AI 工程师播客走进模型工厂——Eiso Kant,Poolside AI 421 1× 0:00

当前时间:0:00 / 总时长:-1:54:33 -1:54:33 你的浏览器不支持音频播放。请升级。走进模型工厂——Eiso Kant,Poolside AI Poolside 的联席 CEO 讲述他如何带领一支顶尖研究员组成的小团队,打造出一个能够训练 Laguna S 的模型工厂——这是一个拥有 118B 参数的 MOE 模型,性能超过了 Thinky 约 1T 参数的开源权重模型……而这仅仅是个开始。

2026年7月23日 421 分享 文字实录

近几个月来,关于模型所有权以及主权/本地 AI 的开源与闭源之争、美国与中国之争,已经升温到了白热化的程度。因此,Poolside AI 终于带着 Laguna S 2.1 等新模型浮出水面,且其性能击败了 Thinking Machines 近期发布的、规模几乎是其十倍的模型,这无疑是一个非常好的消息。

Poolside 近期发布的技术报告因其详尽的细节而备受赞誉,Vibhu 首先在我们的论文俱乐部上介绍了 Laguna 的技术报告:

Eiso Kant@eisokant 喜欢 @latentspacepod 对我们 Laguna M.1/XS.2 技术报告的拆解!Latent Space 的论文俱乐部刚刚做了一次深入探讨,他们的要点总结完美地捕捉到了我们打造模型工厂的初衷。以下是视频中的一些引用 🧵👇 (1/6) youtu.be/QLfZamyMls0 2026年5月28日晚8:34 · 1.13万次浏览 1 条回复 · 8 次转发 · 47 次点赞

从在世界尚未关注之前花费 1200 万美元构建代码语言模型,到打造出能在八周内将模型从预训练推进至发布的模型工厂,Eiso Kant 十多年来一直押注代码是通往 AGI 的路径。在本期节目中,这位 Poolside 联合创始人与 swyx 和 Vibhu 一起,解释了为什么 ChatGPT 让他感觉像是得到了验证,为什么 Poolside 拥抱开源权重和开放研究,以及为什么他宁愿生活在一个拥有 100 家基础模型公司的世界里,也不愿生活在一个只有五家的世界里——即使 Poolside 是那五家之一。

我们深入探讨了 Poolside 的模型工厂:支撑每月 1 万到 2 万次实验的工程技术体系、数据直接流式输入训练、可复现实验、低精度计算,以及越来越多地编写代码、启动作业、评估结果并修改用于训练未来模型的流水线的 agent。Eiso 还详细解析了他们最新发布的 Laguna S,为什么坚持、验证和回溯可能比原始智能更重要,更小的模型内还蕴藏着多少能力,为什么强化学习将在预训练中提前介入,以及为什么 next-token prediction 仍未能充分从网络中提取知识。

Poolside@poolsideai 今天我们发布了 Laguna S 2.1,这是我们迄今为止能力最强的模型。这是一个总参数量 118B 的 Mixture-of-Experts 模型,每 token 激活 8B 参数,上下文窗口最高可达 1M token,并具备思考模式与非思考模式。其能力足以与许多更大规模的模型抗衡。 2026年7月21日下午5:05 · 65.6万次浏览 160 条回复 · 320 次转发 · 2180 次点赞

我们还讨论了模型与 harness 的协同设计、Poolside 从编程 agent 到 AGI 的路径、为什么 Eiso 认为 MCP 和传统 tool call 是“愚蠢的”、前沿模型训练背后的真实经济学、Poolside 的 5 亿美元融资、开源 AI、监管、NVIDIA 和 TSMC 的影响力、agent 时代的工程生产力、高主动性团队,以及 Poolside 的人才招聘。

Andrej Karpathy 的 RNN 研究如何启发 Eiso 在 2015 年开始为代码构建语言模型

为什么 Eiso 在市场尚未关注之前,花了四年时间和 1200 万美元坚持一个想法

为什么 ChatGPT 让人感觉像是得到了验证,并让 Poolside 回归开源

为什么 Eiso 宁愿选择 100 家基础模型公司,而非由五家公司构成的寡头垄断

发布开源权重与发表真正开放的研究之间的区别

为什么 Poolside 有意在湾区人才战之外构建一个全球化研究组织

为什么模型构建归根结底是 90% 的工程工作

模型工厂:Poolside 用于快速训练和改进模型的端到端系统

不到 70 名研究员如何每月运行约 1 万到 2 万次实验

Poolside 如何将模型迭代周期从六个月缩短到五至八周发布

为什么将数据直接流式输入训练能够解锁更快的实验速度

不可变数据、版本化代码和可复现性如何实现严谨的模型研究

为什么 Eiso 希望有能力的研究员离开他们的实验室,成为 Poolside 的竞争对手

为什么 95% 的模型构建工作可以归结为更好的数据或计算效率

Laguna S,以及为什么坚持、验证和回溯能够胜过原始智能

为什么更小的模型或许能处理远超此前预期的知识工作

为什么强化学习将在更早阶段进入预训练

为什么 next-token prediction 仍未能从网络中提取足够的知识

为什么 distillation 和 environments 已成为 AI 行业最钟爱的“毒品”

为什么 mid-training 实际上是一种早期的课程设计形式

低精度训练、网络瓶颈,以及计算效率的下一个提升点

Laguna S:1180 亿总参数,80 亿激活参数,从训练到发布仅需八周

为什么模型构建者通常能在新的 checkpoint 诞生后的前 30 分钟内完成评估

模型与 harness 之争:agent 的能力究竟来自何处

为什么 Poolside 将编程和长周期的软件任务视为通往 AGI 的路径

为什么 Eiso 认为 MCP 和传统 tool call 是“愚蠢的”

为什么未来的 agent 将编写脚本,而非从数十个预定义工具中进行选择

极简 harness、容器与模型自由度的理由

为什么 Poolside 优先投入视觉,但不预计短期内会涉足音频

为什么语言可能是编码知识和推理的最具计算效率的模态

模型开发的真实成本,以及为什么最终的训练运行反而虎头蛇尾

Poolside 这个名字背后的故事,以及它为何代表着拒绝降低雄心

在投资者仍质疑 AGI 是否真实存在时,Poolside 如何筹集到 5 亿美元

为什么智能可能成为世界上需求最大、也最商品化的资源

开源模型何时可能变得能力过强,以至于无法不加限制地发布

为什么在全球竞争环境中,单边的 AI 安全行不通

监管如何可能意外地将市场锁定在两到三家 AI 公司的寡头格局中

NVIDIA、TSMC,以及支撑基础模型进步的硬件系统

为什么强化学习的挂钟时间(wall-clock time)是 Poolside 最大的瓶颈之一

为什么 Poolside 选择从头训练模型,而非简单地 distillation 更大的模型

AI 如何改变公司衡量工程生产力的方式

为什么 agency 可能成为 AI 时代员工最重要的品质

领导者如何通过共同目标和清晰的约束来对齐高 agency 的人才

Poolside 在研究、post-training、pre-training、架构、evals 和工程领域的人才招聘

LinkedIn: https://www.linkedin.com/in/eisokant

00:00:54 Karpathy、RNN,以及在 Transformer 出现之前构建代码模型

00:02:26 1200 万美元的失败与 ChatGPT 带来的验证

00:03:39 开源与 100 家基础模型公司的理由

00:09:22 开源权重、开放研究与 Poolside 的全球化团队

00:16:04 模型工厂:为什么模型构建是 90% 的工程工作

00:20:19 Agent、自动化实验与 RSI 的早期迹象

00:24:04 流式数据、可复现性与科学严谨性

00:30:35 创建更多基础模型公司

00:36:07 Laguna S:坚持与原始智能之争

00:43:01 重塑预训练、RL 与课程设计

00:52:33 低精度训练与从更小模型中榨取更多性能

00:58:37 模型 Harness、编程 Agent 与通往 AGI 的路径

01:09:26 为什么 MCP 和传统 Tool Call 是“愚蠢的”

01:13:04 视觉、多模态,以及为什么语言仍然重要

01:18:15 模型 Scaling 与训练的真实经济学

01:20:40 Poolside 名称的由来与 5 亿美元融资

01:27:37 开源模型、AI 安全与寡头垄断的风险

01:33:53 NVIDIA、TSMC 与强化学习瓶颈

01:41:52 更小的模型、Distillation、工程效率与招聘

引言:Eiso Kant、Poolside 与开放模型

Swyx [00:00:00]:好了,我们现在在演播室,和来自 Poolside 的 Eiso Kant 一起,还有 Vibhu。欢迎。

Eiso Kant [00:00:08]:谢谢。谢谢你们邀请我,各位。很高兴来到这里。

Swyx [00:00:10]:是啊,刚下飞机。你给我发短信说:"嘿,我正在去旧金山的路上。" 我就说:"你现在在飞机上,对吧?" 就是,嘿。

Eiso Kant [00:00:16]:我知道。给你发完短信后,我意识到带着严重的时差过来,今天可能会有一些有趣的体验,但我们开始吧。

Swyx [00:00:23]:我是说,我想告诉嘉宾的是,他们不必准备太多,因为如果你真的每天都在做这件事,那么即使你依稀记得的东西,对很多不生活在你们这个世界的听众来说也是新鲜的,对吧?所以十年前,你在 Google Slush 做了一场演讲,谈论 AI 的民主化。而现在你在这里,要开源一个我们要聊的了不起的新模型。但我猜,是什么让你开始关注 AI 民主化的?从你的 LinkedIn 上看不太出来。

Eiso Kant [00:00:57]:不,完全看不出来。我觉得我是怎么进入这个领域的,这一点并不明显。我能进入这个领域要归功于 Andrej Karpathy。

Eiso Kant [00:01:05]:2015 年,他写了一篇文章,叫《循环神经网络的不合理有效性》。

Eiso Kant [00:01:11]:那篇文章,我读了之后,一夜之间就把当时的创业公司转向去做 RNN,后来是 LSTM 和 Transformer 模型,用来写代码。如果你去看这篇文章,往下滚动,你会发现,这就是后来成为语言模型的前身。所以,至少当时他做的是字符级语言模型,开始预测字母,他里面有一个例子。有一个小小的 Paul Graham 生成器,你可以读它,文本看起来有道理,但其实没有。然后还有一点——再往下一点有一个代码的例子。对,还有莎士比亚。

Eiso Kant [00:01:49]:出于某种原因,我读了这篇文章,然后一头扎进了兔子洞,尽我所能去学习关于 RNN 和 LSTM 的一切,对吧?这是 Transformer 论文之前的事。我形成了一种完全不合常理的信念,即神经网络应该能够泛化到任何事物,而语言应该能够泛化到很多智能的事物,以及写代码的能力。所以我开始创建 Sourced,这是一家完全开源的公司,试图构建我们过去所说的"代码上的机器学习",也就是代码上的语言模型。我们在这上面花了大概四五年时间,直到 2019 年底。这在今天听起来很酷,但在那时候,没人在意。

Eiso Kant [00:02:29]:对吧?没人在意。我们像是在黑暗中摸索。一路上我们做了不少事情。我们尝试把卷积神经网络应用到代码结构上。当 attention 机制出现时,我们把它应用到 LSTM 上,然后 Transformer 论文发表了。而这一点——并不明显,我们在整个过程中错过的是,我们其实走在正确的轨道上,但我们当时应该继续扩大规模。今天,对我们所有人来说,scaling law 和扩大规模看起来是最显而易见的事。

但当我花了四五年生命在代码语言模型上时,这并不明显。所以我很敬佩 Google、OpenAI 和其他地方的人,他们带着那种信心坚持了下来。我们当时最终失败了,那可以说是我职业生涯中最大的失败,对吧?你烧掉了 1200 万美元投资人的钱,在当时那可是一大笔钱。

Eiso Kant [00:03:19]:你花了——仍然很多,而且你花了好几年时间,和大约 40 人的团队一起,就只是痴迷于这个问题。然后生活转向了另一个方向,家庭成了重心,我埋头低调行事,在接下来的两年里确实没有再关注语言模型。考虑到接下来的几年会非常有意思,这是个巨大的错误。然后 ChatGPT 出来了,就像是一种平反。人们开始给我发短信。我找到了我旧的演示文稿和这些旧的演讲。而在整个那段旅程中,我们——

Eiso Kant [00:03:56]:当时我们确实有一个非常鲜明的观点,就是说,当你构建更强大的智能时,它应该是开放的、开源的。

Eiso Kant [00:04:04]:当我们创办 Poolside 时,情况完全不是这样,我想对此非常坦诚。我们创办 Poolside 时,有两个前提。第一,这项技术的能力不会停止复合增长。我觉得今天对大多数人来说这很明显,但三年多前我们刚开始时,大多数人还在争论这些是不是 stochastic parrots。第二,强化学习将成为大语言模型能力最大的驱动力。今天这很明显。三年前,OpenAI、Google 或 Anthropic 等都不持这种观点,也没有朝这个方向走。

所以人们有点看不起我们。他们就像,"这真的有用吗?" 于是我们就开始解决这个问题,再也没有真正想过开源的事。我们只是埋头苦干,从零开始构建我们的知识和理解,对吧?我们不是从某个现有实验室出来的。所以我们拿起论文,开始写代码,一点点弄明白。

Eiso Kant [00:04:59]:直到今年年初,我和我的联合创始人 Jason 才重新提起开源这个话题。

Eiso Kant [00:05:07]:如果你回过头去看我们网站上早期的一些内容,那非常直接。就是我们想实现 AGI,我们想支持一个富足的世界,我们想成为第一家到达那里的公司。

Eiso Kant [00:05:20]:但我们在年初开始讨论这个话题,因为很明显世界正在朝一个方向走去,开始让我们感到有点不安。这——这不是一夜之间发生的。就是我们一点点看到,然后说:"好吧,世界正在走一条路。" 而在整个这段旅程中,我用过一个类比或东西。我说,好吧,如果我回到那时候,2015 或 2016 年,我们正在做这个,我从书架上拿起一本科幻小说,读一本关于 2035 年的书。AGI 实现了,故事会在接下来的几十年里展开。它会有第一章,每个人都在试图搞明白。你会读到 ChatGPT 问世的那一章。然后你会读到世界站在岔路口的那一章,而它选择的那条路是,三四家或少数几家公司将创造未来所有的智能。

Eiso Kant [00:06:21]:而当我想到那个故事时,它感觉像一本反乌托邦科幻小说,而不是乌托邦科幻小说。而现实是,我是一个乌托邦科幻小说迷。所以我们就退后一步说:"嘿,我们能在这里发挥作用吗?" 现在对我们来说这么做很容易,因为我们并不在最前沿。

Eiso Kant如果我们当时已经处于前沿,我觉得我们不太可能改变主意。我这么说并不是指当资本投入过大、期望过高、已经积累了很多东西的时候,对吧?我们是一支小团队,只是在不断改进。所以我们知道,现在可以做出这个决定,但随着我们越来越接近前沿、越来越追上其他公司,这个决定就会难做得多。我们进行了大量的自省和讨论,然后说:“不,这样做是合理的。”即便有很多重大问题尚未解答,比如如何用开源的基础模型构建商业模式?

这到底该怎么做?这是个很大的开放性问题,我们目前还没有完全答案,对吧?到了什么节点,你就不再想发布开源模型了,因为模型的滥用确实存在潜在风险?政府会如何应对开源?但我认为这一切最终都归结于一点——我就不再长篇大论了——那就是:我宁愿生活在一个拥有一百家基础模型公司的世界,而不是只有五家的世界,即便我是那五家之一。为了让一百家公司能够存在,我们能做的最小也最有意义的贡献,就是现在公开我们的研究和权重,并在过程中摸索如何能做更多。

Swyx是的。如果要说有什么变化,过去三年里这一点变得更加真实了。你们是如今人们所称的“Neo labs”群体中的一员。

我们录制这期节目的当天,正好是 Thinky 发布他们新模型的日子,而你们在一些他们发布的基准测试上表现优于他们,对吧?他们还没有做到。所以这说明,我认为,这就是那种可以容纳多个参与者的事情之一,而你们正在更多地看到未来。也许更像是二十家,而不是一百家,但你们就是那二十家之一。

Eiso Kant我真的希望如此,对吧?我对他们的发布感到兴奋,也对所有人的发布感到兴奋,因为最终,选择和竞争都会推动进步朝着正确的方向发展。但事实是,我们构建模型,虽然实际上都是从同一口数据之井中取水,但我们确实在模型中引入了非常不同的行为和偏见。有些是刻意的偏见,有些则完全是意外的偏见。

如果我们正在形成一个开放模型将成为 token 经济一部分的世界生态,我认为这一点已经毋庸置疑了。那么我们就应该能够生活在一个企业、国家、个人都可以选择并说“嘿,在这些方面,我最认同也最信任这家提供商”的世界里。

Vibhu我认为你们不仅仅只是二十家 Neo labs 之一。直到最近,大部分开源创新都来自中国实验室,对吧?所以西方有 DeepSeek。是今天吗?好吧,也许是 thinking machines reflection,但这样的人并不多,对吧?所以,你们最初在法国、欧洲起步,这一点是很突出的,但现在你们非常明确地采取了美国的立场,而且更重要的是,我们看到的那些中国模型,它们的开放研究程度并没有那么高。而你们发表的成果,我认为是最好的之一。所以每隔几个月,你们不仅推出前沿模型,还会发布详细的拆解博客、论文、技术报告,介绍构建前沿智能所需的一切,你们也在填补这个空白,对吧?所以不仅仅是开放权重,不仅仅是西方公司,而且研究也相当开放。

Eiso Kant不,我很感激。听着,我认为这是最有意义的贡献,对吧?权重本质上就是一个二进制文件。我们就实话实说吧。是的,我们可以修改它们,可以改变它们,但把权重给别人,并不能让他们最终复现你正在做的事情,对吧?所以现在发布数据集存在挑战,发布某些东西也存在挑战,但能够分享你们的研究,比如,我们是怎么做的?我们在数万次计算实验中得到的经验教训是什么?我非常认同这一点。不过要纠正一点,Vibhu,我之所以这么说,是因为这件事困扰我们好几年了。我们从第一天起就是一家美国公司。

所以这个故事要一劳永逸地讲清楚。我们一开始就是美国公司,而且一直都是美国公司。早期我们做了一个非常自觉的决定。我们说:“我们不会在海湾地区招聘任何研究人员。我们要在全世界其他地方寻找人才。”这包括从美洲中部、西雅图到塞尔维亚,再到台湾、新加坡和其他地方。这是因为我们当时就认为,这将会是一场人才争夺战,我认为这几年确实如此。三年前,这一点还没有完全显现。但今天非常明显了。而且我们也意识到,世界上一些最有能力、拥有最有趣、最创新想法的人不会只待在这里。

于是我们创建了一家完全远程的公司。我们最终在巴黎、伦敦和其他地方开设了办公室,团队中有很多人在美国,也有很多人在国外。但我们一直秉持这样的观点:我们是美国公司,但如果我们想让最顶尖的人才和我们一起工作,我们就需要采取全球视角。现在我们硅谷这里也有人,公司发展壮大了,等等。但我认为有一件事,一开始拖慢了我们的速度,但现在却加速了我们,这也是为什么你们看到了我们模型上的进步以及发布的节奏,是因为我们不是从现有实验室孵化出来的。

对吧?我们当时没有很多在这里自由流动的信息。我们只是抱着这样的观点:“好吧,我们就直接解决问题。去读一读外面为数不多的论文,然后把这些东西搞清楚。”因此,这些年来我们在模型训练中犯了一些很滑稽的错误。

尤其是在最初十二个月里。有几件事我觉得至今仍然困扰我,想起来还后怕。我们可以稍后再聊这些。但这在团队中创造了一种韧性和坚持,对吧?多年来极少有人离开我们,这告诉我们:“好吧,我们能行。”当我们第一次完全从头开始编写训练代码库时,它不是任何开源项目的分支。就只是:“好吧,让我们从零开始构建。”我记得有一个时刻,我们花了三周时间解决一个优化器的 bug。训练就是无法稳定。我们对此非常执着,心想也许我们错了。

也许我们应该直接 fork 那个代码库,或者我们应该这样做。但当我们解决它的时候,我还记得当时公司里大概只有五个人。解决之后,我们意识到:“哦,我们能做到一些事情”,只要我们愿意努力工作。我认为这种带有强烈工程偏见的文化帮助我们走到了今天的位置。所以关于开源、人才这些东西,我想我们只是从不同的起点做出了不同的决定。而且我认为我们是幸运的。我确实想称之为幸运。团队付出了大量的努力,而现在,这些开始体现在结果上了。

Swyx只是因为我们可能不会再回到这个话题了,而且如果有人知道答案,这会是一个有趣的招聘挑战。那个 bug 是什么?然后我们不会说出解决方案,但我们——

Eiso Kant所以这个——这——你要考我的记忆力了,

我想我能回忆起来。如果你看看,如果你把 Adam 当作优化器,你有一个 epsilon。

它是在分母里的,对吧。

SwyxMomentum 和 weights。对。

Eiso Kant没错,就在分母里。当时,如果我没记错的话,你看早期的 Llama 论文之类的东西,人们在相当程度上把 epsilon 调得很高。他们好像加了,我不知道是 E-4 还是什么,反正是一个很高的 epsilon 值。

如果你在训练过程中想想这件事,就会觉得有点奇怪和反直觉——我们实际上只是在分母里加了一个数,就像在小数点后面动了点手脚,结果就给优化器加了噪声,对吧?我不记得具体的 bug 是什么了,但我记得的是,一旦我们解决了它,就不再需要像 Llama 论文和其他地方那样大幅调高 epsilon 了。那是一个很关键的时刻,我们之前一直相信那篇已发表的论文,觉得“哦,不,它就必须是这样,epsilon 必须有这么高的值。”但凭直觉,这对我们来说完全说不通。如果你只是为了避免除以零,为什么这个值不能极小呢?那一刻让你意识到,好吧,自己从零开始摸索才能真正建立更好的直觉。因为在模型构建中,你很快就会学到一件事:你一开始的直觉会被狠狠地打脸。

对吧?这是一门实验性极强的科学,那些看起来显而易见的东西,你很快就会发现自己是错的,而且希望你还能弄明白为什么,有时候甚至根本搞不清原因。

Swyx对。所以,你们发布新模型的时候,Vibhu 特别兴奋。我是说,每个人都很兴奋。但 Vibhu 牵头在我们的 paper club 里讨论了它,然后你们看到

显然如此。也许可以谈谈你们从中学到了什么,任何你能透露的。我们可以聚焦在 model factory 上,或者你觉得从哪开始讲比较好。

Eiso Kant我想说,从公司非常早期开始,我们的观点就是,模型构建归根结底有 90% 是工程。

而且我觉得行业里的人都心知肚明,因为如果你看看每个研究者把时间花在哪里,他们都花在写代码上,对吧?看数据、写代码。所以我们说,好吧,三年前的状况是,训练用的是 bash scripts、Slurm,以及像 spaghetti code 一样的代码库,数据管道也是东拼西凑补起来的。我们看着这一切说:“归根结底,模型构建是一个流程。”你从原始数据开始,对吧?就像训练的原材料,网页之类的东西。

你要做大量的过滤、清理、转换、分析。如今这些比三年前复杂多了。然后你训练模型,这本质上是一个大规模分布式系统问题,对吧?横跨的硬件虽然——现在可靠多了,那时候极其不稳定。而且每一代新硬件,我们都会遇到新的挑战。然后你进入下一个阶段,对吧?那时候还没有 post-training,但你看,你有 post-training,然后是强化学习。所以我们看着这一切说:“这看起来是一个工业化的流程。这看起来是一个端到端的流程,每个环节都有自己的机械。

”对吧?不管是你的大数据管道,还是你对网页的爬取和摄入,还是你的大规模分布式训练,然后还有可靠性。我们说:“那我们为什么不把世界上一些最聪明的分布式系统工程师从第一天起就纳入研究流程,而不是之后再打补丁?”从一开始就真正融入进去。这就成了我们的 model factory。

我们的 model factory 一开始只有少数几个组件。今天,它已经有数千个组件了。我试着打个比方:如果你想想那些在 Foxconn 非常早期就在场的人,如果他们在接下来的十年里一直待在那里,他们就能重建 Foxconn,因为他们见证了构建那个系统的每一个决策以及所有的复杂性。但如果你我今天走进 Foxconn,没戏。

对吧?因为我们没有导致那个结果的决策谱系和历史。所以我们从一开始就带着一个真正理解这一点的团队来构建,我们优化的指标是:一个想法从研究者产生,到得出我们可以信赖、并能纳入下一轮模型训练的实验结果,这中间的速度。

而且因为这是一门实验性极强的科学,最初它还没那么复杂的时候,你可以用补丁凑合过去,对吧?但现在,在任何一家基础模型公司,你都在跑——我是说,我们是个小团队,对吧?研究员不到 70 人,另外 35 名工程师。而且我们每个月要跑——我没看最新数字,但远不止 1 万次,可能是 1 万到 2 万次实验。所以如果你看看这个规模,每一次模型运行,归根结底它是一个基础设施层面的信任问题。所以我们这些年一直在做的,就是把这件事做到极好,通过不断地实践、改进,并痴迷于那些端到端的决策。

所以现在这意味着,你看我们发布的 Laguna XS 2,从训练开始到发布只用了五周。我们今天要聊的模型从训练开始到发布是八周。我们 literally 昨天才启动了下一个模型,因为我们刚刚完成了下周要发布的模型——或者等这期节目播出时就是今天发布——所需的 post-training,然后我们把算力转移到了我们现在正在训练的、大得多的 Laguna M 模型上。所以模型应该是某个人流程的产物,它本身不应该是一个独立的东西。

我们把它看作 SpaceX 的工厂:没错,第一枚火箭确实很难造,但更大的挑战是建造工厂。现在火箭源源不断地下线,已经没人再去想下一次发射有什么大不了的了。不过就是又一次发射,又一次发射,又一枚火箭出来了。这就是我们想在模型构建中做到的事。

而从第一天起并没有计划、只是隐约觉得总有一天会发生的事情是,当你搭建了一个真正优秀的端到端 model factory,配上非常好的 API 和工程系统,那么它最适合用来做什么?最适合做 agents。

因为 agents 现在开始在我们 model factory 里接管越来越多的工作。

所以当我们每月集中办公、我走过大家身后时,我看着屏幕,停下来和我们的研究员聊天。默认景象就是各种 agents 在他们的屏幕上运行,写着代码,启动任务,评估模型运行返回的结果,做出修改。我们仍然掌控全局,仍然提出想法,仍然帮忙 debug。但越来越多地,而且这在我们的 pre 和 post 以及合成数据管道的数据侧已经体现得非常明显,在架构侧也开始出现了。你开始能看到 RSI 未来会是什么样子的微光了。

就是这样。所以当我们谈到——回到你关于我们模型的问题,每次谈到模型工厂时,我最酷的例子总是:当我们启动一次新的训练时,无论是一次大规模的训练运行,还是我们现在为了发布而做的多个后训练实验之一(比如我们做了10个后训练版本),或者很多其他实验中的某一次,在任何给定时刻,某个人前一天做出的改动、他们得到的实验结果,都能进入那次运行。

所以并不存在像“提前90天截止”这样的规矩。不,literally 从那一刻起就能纳入,因为我们现在足够信任这套机器。然后你也得在可靠性上投入。所以我关于 Laguna S 最喜欢的一个指标就是,没有任何需要把人叫醒的 on-call 事件,对吧?完全为零。据我回忆,整整这一年我们都没有出现过需要叫人起床处理的有意义的 on-call 事件。不过这里有一个星号标注的例外:通常在启动一次新模型运行的前六个小时里,总会出点问题,因为你配置设错了、犯了个小错误之类的。

所以通常还需要一点人工干预,但那种情况总是在值班时段内就能解决,对吧?不需要半夜被叫起来。而且我觉得这种效应现在开始复合放大了。所以我们现在发布的这个模型,我很喜欢,它很棒,但我们已经在搞下一个了。我觉得这才应该是常态。

Vibhu对了,我还想说一下,背景是这样的,这大概是一个月前的事了。我们在技术报告里发现了它,所以我们当时进来就想:“哦,新模型发布了,之前完全没听说过。” 我们当时——

Eiso Kant是啊,我们每隔几个月就会这么干一次,已经很习惯了。

Vibhu我们当时的反应基本上是:“好吧,看看,它跟 Kimi、DeepSeek 之类的小模型、Gemma 级别差不多。哦,这是一篇很酷的论文,讲构建过程。” 然后我们就翻到了这一页,对吧?技术报告 literally 第二页写着:“这一流程让我们能够在五周内将小型模型从零构建到交付,并应用了学到的经验。” 然后我就想,哦,这篇论文不是那种“这是基准测试的技术报告,这是训练用了多少 token”之类的。对于那些想深入了解、但我们不会在播客里讨论的内容,全都在这里写明了,对吧?从——

agents 可以用来与训练代码、训练数据交互的定制软件。

Eiso Kant对。记得把论文链接放对,所以是的。

Vibhu对,所有这些东西。在这里读论文,但是——

Eiso Kant但我想展开说说。我喜欢原则,而且我觉得这可能是讲故事的一个很好的起点。也许我们可以一条一条地过这些原则。我顺便提一下,Dagster 刚被 Prefect 收购了。

是不是很有意思?不过是的,我对 Dagster 非常熟悉。任何能引出故事的东西都行。

Vibhu那么,我会说,实验即代码是显而易见的,但我最喜欢的一点是——我不知道这部分在报告的哪里——但在早期,而且我觉得现在很多基础模型公司仍然是这样:人们准备好训练数据集,把它们打包,然后复制到训练集群上,分布到所有节点,之后训练才开始。

我们大概三年前看到这种做法,就觉得这完全说不通。

Eiso Kant你会浪费大量时间,因为一旦你不得不重新物化数据集、做修改、修复问题等等,你就得花大量时间重新打包,对吧?重新 tokenize,重新打包,移到集群上,再分布到各个节点。集群越大,你就越要开始用一些花哨的类似 torrent 的算法来分发数据。那为什么不把数据流式输入到训练里呢?对吧?这是非常常见、非常基础的——

Just-in-time,就像好的计算机科学原则一样。而我觉得这是最早解锁“模型工厂”的事情之一。因为当你开始意识到,一个训练任务——不管是一次大规模的“英雄式”运行,还是一次小规模的后训练实验——它每秒只消耗一定数量的 token,对吧?而从数据传输的角度来看,这并不算多,对吧?所以我们说,好吧,我们有训练集群,然后我们有类似 AWS 的架构,可以在上面构建这些很棒的大数据管道。我们可以搭建各种东西。我们在底层用 Spark,诸如此类。

Vibhu但你说的 AWS,不是真的 AWS,而是你们内部的 AWS。

Eiso Kant是我们内部的——不,是我们内部运行的基础设施,

没错。我们的东西运行在 AWS 账户上,或者任何硬件上,对吧?

所以一旦我们做出了这个转变,能够把数据流式输入到训练里,你突然就会意识到很多东西被解锁了。因为现在你不需要等待整个数据集物化完成。

现在当你做关于数据混合的数据实验时,它突然就变成了一份配置。因为你有这些数据源在流入,然后你只需——我们有一个叫 Blender 的服务,报告里也写了——然后我们可以说:“好,这次运行我要20%的这个来源,10%的那个来源。我要这么多轮重复。我要以某种方式 shuffle 数据,”而你的训练任务可以在其余数据甚至还在物化的时候就开始。另外,这样做还带来一个好处,因为在这一切底层——对我们来说,我们把底层的数据层当作不可变数据层(immutable data layer)来处理,这非常重要。

实验即代码(experiments as code),不可变数据层意味着你总能回溯并理解,literally 精确到单个 token,在某个代码版本上,是在哪个 cursor 位置输入的。

这花了我们——我得承认,在 Poolside 的第一年,我们明白工程必须做好,但我们当时还没意识到,这归根结底是为了支持良好而严谨的科学进展。我们当时——人数非常少,所以很多都是 YOLO 式的想法和 YOLO 式的运行。

我们为这些 YOLO 式运行搭建了很棒的基础设施。但一旦我们意识到要把数据视为不可变的,代码始终要版本化,你总能从头到尾完美地追踪和追溯每一次实验,你能完美地复现所有东西,对吧?你有完美的可复现性。如果我想的话,我现在仍能复现两年前的运行,对吧?它推动了科学进展,就像科学流程一样,而我觉得这是公司成立大概一年半之后我们才领悟到的。我们也有一些很棒的招聘,比如我们的应用研究负责人 Nikolai,他从 Yandex 加入我们,大概从2020年代初就开始研究语言模型,我想是他把这种理念带进了公司:“嘿,我们要更严谨。

” 然后一旦我们有了这种结合——能力越来越强的平台让人们能做更多事,但又具备这种不可变性——我们就能够开始说:“好,每一次实验都是一次真正的 ablation。我们必须真正理解它。” 我觉得在过去几年里我们变得科学严谨多了,而底层基础设施让这成为可能。

Vibhu是啊,很多内容都很有趣,比如光是你们分享了所有的消融实验,还有数据集的选择,对吧?文中有个不起眼的小段落,大概意思是:“哦对了,训练数据,我们有一些,我们还有个自动混合器。”它会训练八个小模型,对它们进行缩放,然后挑选数据集。我们甚至不用去看它。我当时就想:“哇,这背后的工程严谨性真高。”而且这里面的内容确实非常多。

Eiso Kant是啊,而且你看,我们还想发布更多内容。长期以来,我们把写论文看作是一件我们还没资格做的事。只有当你处于前沿时,你才有资格花时间去发表研究,因为在那之前,你一直在追赶,而这个行业的每一分钟、每一小时都至关重要。我对这点非常执着,不只是从想法到结果的 wall clock time,也包括我们每天浪费的每一分钟、每一小时——这些浪费的时间让我们无法完成追赶。但这一次我们说:“好吧,我们给自己一点时间。

”我想我们给了团队大概三四天时间,同时他们还在做日常工作,就是把所有内容都写进去。正如你刚才所说,如果你的东西本身过硬,发布出来就很容易。所以我们还有很多很多东西想慢慢聊,而且我们肯定会开始这样做。随着我们越来越有“资格”,同时现在我们的使命中也增加了希望有更多基础模型公司存在这一点,你会看到我们会更加主动,持续分享我们一路上学到的东西,帮助其他人加速。

Vibhu这也是这件事另一个很酷的方面,对吧?回到你说的,这不只是“这是我们的训练基准”。如果你想要复现,这里有关于优化器、数据集、post-training 的实验。你们在这里展示了很多内容,同时还有一套系统来说明该怎么做?所以这实际上是在推动

其他人也能做同样的事。

Eiso Kant另外,我还想澄清一点,我们从其他人发表的开放研究中获益良多,对吧?你提到了中国的实验室,我觉得重要的是,来自每个国家、每种文化、每种背景,包括像我们这样的西方公司,都有不同的模型出现,人们可以选择去信任。但我觉得我们必须把功劳归于该归的地方,对吧?中国的实验室非常了不起,在分享研究方面做了很棒的工作,而我们肯定也是受益者。所以当你是受益者的时候,我觉得你也有义务回馈。

Swyx你有没有特别喜欢或者被低估的中国实验室想点名表扬的?所有人都在夸 DeepSeek。

Eiso Kant好问题。

SwyxMoaan 显然是因为 Therapsi。对。

Eiso Kant是啊,我觉得,显然最近所有人都在聊 Zhipu 的 5.2。我觉得大多数人没意识到的是他们是什么时候开始的。

Swyx他们只是重新品牌化了。对。

Eiso Kant所以,我记得在全世界其他人还没对这些事感到兴奋之前,做这些东西有多难。因此我对那些致力于改进模型的人怀有极大的敬意,那时候做这事并不时髦,相信 LLM 会让你被嘲笑。我记得早在 2016 年,我们在用这类模型做所谓的代码机器学习时,人们只会嘲笑我们,他们会说:“这毫无意义。你们为什么要浪费数百万美元去研究这个?”所以我想说,智谱可能是那个值得 shout-out 的,不只是因为他们最新的模型非常好,而是因为他们是拼到这里来的。

而且我觉得,每一家基础模型公司都需要时间才能走到这一步,对吧?我们花了三年时间才达到现在要发布的这个模型。而现在模型之间的间隔已经以周来计算了,不再是以月或年。但这东西很难。如果我们能让下一个人稍微轻松一点,我们都应该这样做。因为如果不这样做,在模型真正影响到 recursive self-improvement、达到让追赶变得不可行的程度之前,我们还有一个很小的窗口期。我们应该努力在这个窗口期内,鼓励尽可能多的实验室,或者不管我们怎么称呼它们,开始行动。

使命,但也可以说是顾虑,就是我想鼓励现在任何觉得自己能攻克这个问题的研究者,走出去,离开,成为我的竞争对手。

去创办另一家基础模型公司,因为我觉得我们需要这样。我觉得否则我们就不会身处这样一个世界:我不想只是成为第五或第六家获胜的公司。我想看到一个有很多选择的世界。

Vibhu创办一家基础模型公司还有什么东西是人们看不到的?需要大量的算力,需要大量的资本,大量的算力。你们展示了模型工厂以及如何进行训练,但背后的东西还有很多,对吧?那就是,

Eiso Kant嗯,你看,这其实是——这是一种过度简化,我总是要打个星号说明这一点,因为在人们脑子里可能会产生一些误解。但我觉得你可以把模型构建的 95% 归结为只做两件事:你要么在改进数据,要么在提升 compute efficiency。我知道对于那些才华横溢、技艺精湛的人来说,这听起来像是一种过度简化。但如果你认真想想,我们在做什么?我们在观察数据,我们在生成新数据,我们在改进数据。而做到这一点的唯一方法就是去观察数据,对吧?

这是基础模型构建的一大部分。另一方面,我们提出了在 inference、architecture 和新的 attention mechanisms 上的惊人突破。但它们真正在做什么?它们在带来 compute efficiency。当然,这些年来我们确实有一些突破,让模型具备了更强的能力。但从极限来说,如果你能训练一个足够大的模型,对吧,而且你有无限的算力,我们可能——如果你有无限的算力,你可能明天就已经达到 AGI 了。

Eiso Kant [00:34:12]:对吧?其实并非如此。所以,我想说,无限算力加上无限快的网络能力,因为网络最终比算力更容易成为瓶颈。不过,我认为这些就是主要因素。而且要意识到,这是工程。我觉得这一点现在已经越来越明显了,但过去几年里,人们一直把基础模型公司、研究人员和其他从业者捧得很高,觉得你们在做不可思议的魔法或火箭科学,好像只有诺贝尔物理学奖得主才能做到。别误会,确实有一些非常难的问题需要解决,但我们很多人日常做的大部分工作,并不是坐下来试图证明某个数学定理。

我们做的很多事情,其实就是把基础工作做好:写好代码、查看数据、改进数据、做实验、看图表,试着培养直觉。其实很多人都有潜力成为非常优秀的研究人员。我觉得对大多数人来说,这看似遥不可及。但我在我们公司亲眼看到,工程师变成了研究员,因为模型工厂让他们做实验和尝试新东西的门槛大大降低了。我们团队里有个同事,一开始是工程师,负责搭建我们的 agent,现在已经成为一名真正的 reinforcement learning 研究员,并且取得了实质性的进展。

而这只用了大约六个月的时间。要是在几年前,我想大多数人不会觉得这有可能。

Swyx [00:35:46]:对。我觉得有一个有趣的里程碑是当你能自托管的时候,就像某种编程语言里,如果你能用这种语言本身来编译这门语言,那对应的等价问题就是:你能用你自己的工具吗?你们有 pool CLI,有自己的模型。但想必你们不会只用自己的模型,这不可能。不过,这个比例随着时间推移大概是多少?

Eiso Kant [00:36:10]:这是我们发布的第一个真正开始对我们自己的工作产生实质性贡献的模型。它目前还算不上最顶尖的模型。Fable 和其他模型都很强,但 Laguna S 非常有趣。我要引用一段话。我们应用研究的负责人之一 Peng Ming 在上周,也就是大约十天前模型发布时,说了一些话,模型比我们希望或预期的要好得多。他说,他觉得 Laguna S 的很多提升并非来自更高的智能,而是来自不同的行为:更多的验证、更少地把事情视为理所当然、不会过早宣告胜利,而且更加执着。

说实话,这些特质在某种程度上对人类的成功而言,比原始智能更具预测性。那是7月5日,一个周日,他写给我的,从那以后这段话就一直刻在我脑子里。因为 Laguna S 这个模型,你会发现它在基准测试中表现那么好、在日常使用中表现那么好,就是因为它极其执着。它会进行大量推理。这一点我必须指出。我们还需要让它更高效,还需要提供不同的推理模式。但这个模型做到了一些我从未想过它能做到的事。1180亿参数,80亿激活参数,并不算大。

它能跑在 DGX Spark 上,而且在 Spark 上仍然能以每秒三四十个 token 的速度运行。它能独立解决 Erdős 397 问题。它能完成复杂的编程任务。它还能……今天早上我让它给我做一个 Fi scanner,在我的 Mac 上,不使用任何外部库,它就像……通过非常执着地尝试去理解核心 WLAN API 来搞定,而且全程没有联网。另外,我很喜欢 vibe checking。过去十天里,我每天大概花八到十个小时和这个模型待在一起。

Eiso Kant [00:38:05]:我没有夸张。昨天我坐了十一个小时的飞机,花了十个小时阅读这个模型的轨迹和跟踪记录。

Eiso Kant [00:38:12]:我从中学到的正好就是 Peng Ming 说的那些。我们将能够从更小的模型中榨取出比业界此前想象的要多得多的能力,因为没错,智能是存在的,更大的模型确实更聪明。这一点毫无疑问。我们应该继续 scale up。但那种非常执着的行为、犯错时能够回溯的能力、以及如何与环境互动的理解,这些让我们看到还能挖掘出更多潜力。而这让我在过去几天里产生了一个疑问。如果你想想我们今天在哪些地方使用模型,对吧?比如,我们把模型用于知识工作。这占全球经济的25%,是25万亿美元的工作。

Eiso Kant [00:39:00]:随着我们 scale up 模型、模型变得越来越智能,我们很期待能越来越多地用它们来推动科学前沿。

Eiso Kant [00:39:08]:而如果你看科学前沿,比如真正的科学突破,它们在很多地方都与更高的智能相关联。爱因斯坦想出广义相对论,就是能够把别人无法联系起来的概念联系到一起。我认为智能的诸多维度之一就是这种能力,而且我们清楚地看到,随着模型变得更大、能力更强,它们能把更多想法和线索串联起来,这是小模型做不到的。

Eiso Kant [00:39:36]:我们在医学、生物和其他领域已经开始看到这类例子。但如果你想想我们日常做的绝大部分知识工作,包括构建软件。我骨子里首先是个软件开发者,虽然可能不能再这么说了,因为我已经好几年没写生产代码了。让我们优秀的其实是我们的执着。是我们遇到问题时能回溯,会说“我得去搞清楚这个 bug,我得去研究这个,我得去看文档,我得尝试五种不同的方法来看看能不能解决”。但这并不一定意味着要把来自完全不同领域的三个想法拼在一起。

所以,如果我们现在看到——我认为 Laguna S 就是一个例子——我们能够让一个相对较小的模型变得比我当初确实预测的、或者任何以往基准测试所显示的同等规模甚至更大规模的模型都要强得多,至少在编程任务上,那是因为行为模式的改变。所以现在我的问题是,而且我也没有答案:我知道在极限情况下,也就是无限大的模型规模,对吧,极其庞大的模型,运行它的成本会非常昂贵。我们知道这一点。所以更大模型的投资回报率。

Eiso Kant [00:40:52]:所以我知道,在极限情况下,总有一天我不会用世界上最大的模型——千万亿参数,不管我们 scale up 到多么疯狂的规模——去做一个基础的编程任务。就在今天,我已经开始针对某些任务换用更小的模型了。

Eiso Kant [00:41:07]:这意味着存在一个最优解。意味着在知识工作领域,随着模型规模增大,会有一条曲线,在某个点我们到达顶峰,在那之后,使用更大模型的投资回报率就毫无意义了。

Eiso Kant [00:41:22]:现在,我认为问题在于,以前我会觉得那个顶峰还非常遥远。

对我来说,这个模型是第一个信号,表明那个峰值可能在一万亿、五万亿、十万亿(参数)。也许我们能从这些模型中榨出更多的能力。我不再认为我们需要最大模型的规模再提升两到三个数量级,才能解决知识工作——无论是会计、法律,还是我们编写的代码。如果这确实成立,那它就是模型商品化的一个论据。它也是一个开源可以在这个世界上获胜并取得成功的论据。当然这当然是一个自利的论点,也是一个充满希望的论点,但从理论上讲,在极限情况下它是成立的。

我们只需要在未来几年里去发现还能榨出多少能力。不过,我要打一个大大的星号。这并不意味着我反对扩展模型规模。我认为我们最终只有在模型规模扩展到与竞争对手一样大时才能成功。我不喜欢这样。我认为我们不应该把头埋进沙子里,说我们要成为开源小模型的王者。我觉得那是一种出局。那是在试图成为你那个小王国里的国王,却没有意识到世界其他部分在做什么。我们所有人都宁愿使用一个更聪明、更快、更强大的模型。这是一个希望的信号。

所以我不想过度吹嘘这是一个好模型。要达到最先进水平我们还有很长的路要走。但我希望人们在使用这个模型时能体会到,推动它能力大幅提升的是其内部的行为,而不一定是参数数量。

Vibhu这主要是 post-training 的效果吗?就像是——

Eiso Kant完全是 post-training。

Vibhu我们在训练方面已经没有什么可改进的了吗?训练是不是已经到头了?

我只是想先聊完训练,然后再聊 post-training——

Eiso Kant训练还没有结束。我是说,你看,训练有一部分就是在处理技能,对吧?模型技能的每一个新数量级,都会带来新的你必须解决的问题。但这归根结底是工程挑战。

我有一个,可以说是,不太常见的观点,那就是 reinforcement learning 会越来越早地进入训练阶段。

甚至不只是训练。就像今天的训练,对吧,如果你看看——我们已经在这方面研究了很多年了。我认为最好——我认为我们第一次在公开场合看到它是 DeepSeek Zero 的论文。我想那是一年半以前的事了,如果我没记错的话。在那里,你可以在模型非常早期,当它刚开始能够使用语言等等的时候,就诱导出推理能力。所以我提出的问题是,我们有这个——我们有一个数据集,就是互联网。互联网,我认为我们 arguably 可以说,大概在不同地方编码了人类知识的全部总和。它的质量方差极大,从垃圾数据——一旦你真正去看训练数据,你就会对互联网到底是什么感到汗颜——到最伟大的科学论文、最棒的博客文章、最好的文字记录等等。

所以现在,我们正试图弄清楚,并且已经在这方面做了大量工作,这是一个我们可能不像在其他事情上那么开放的地方,但随着时间推移我们会变得更加开放。我们花了几年时间真正在研究,如何将互联网转化为不仅仅是 next token prediction,而是一种在训练早期就教会模型思考的方式。我认为那里有大量的金矿有待发掘。我认为我们现在这个行业里有一些“毒品”。其中一种毒品是 distillation。另一种毒品是更多的 environments。它们很棒,让我们感觉良好,让模型变得更好,我们都对它们上瘾了,而且我们会使用它们,对吧?以各种不同的方式。但归根结底,我认为我们仍然几乎没有从互联网中榨取出我们应该得到的东西。

我认为仅仅在训练期间做 next token prediction 是不够的。

我认为我们还会看到一些非常有趣的事情发生。而在 post-training 中用 RL 来诱导行为、改进模型,我认为——现在全世界都知道怎么做了。我们正在将其规模化。所有人都是。但我怀疑我们是否需要像今天这样在 environments 上走得那么远。我还不确定。

Vibhu你是说我们走得太远了?

Eiso Kant我,我不确定通往 AGI 的道路是否只是——

Vibhu这看起来像是永无止境的,“好吧,我想要这张桌子的说明书,对吧?我是不是要造一个 environment 来拼装家具?还是说我们最终只是需要一个通用的解决方案?”

Eiso Kant我认为,我认为有一种能力可以从互联网中泛化出更多东西。但我也很受鼓舞,比如当我看到 Laguna S 时,它的 post-training 才是产生巨大影响的地方。然后我就想,哦,等等,仅仅通过把这些行为中的一部分做得更好,我们就能从中获得多得多的能力。这确实稍微改变了你思考智能的方式。

Vibhu是的。人们经常打的比方是,RL 阶段并不是你学习很多新知识的地方。你转移——

是的。所以,你转移了分布,然后你可以让它朝着你想要的方向推理。关于你提到的训练,很多训练仍然只是在某个领域继续训练,比如说医学,然后你再做 RL。所以仍然只是——

Eiso Kant只是更好的数据,对吧?我是说,训练——哦,我喜欢我们发明了这个词。它实际上就像——

这是训练的第二阶段,用一种非常愚蠢的方式来做 curriculum。但归根结底,你想要的是一个从第零个 token 到第 30 万亿或 40 万亿 token 的 curriculum,一个真正对模型学习来说最优的 curriculum。但训练本质上是一个基于互联网数据的分阶段 curriculum,因为我们没有算力,而且实际上也没有能力去 ablate 出一个完美的 curriculum,对吧?

所以我很确定,你很快会开始听到人们谈论另一些术语,有两到三个——因为我们现在就是这么做的,对吧?我们说什么 stage two、stage three、stage four 训练之类的。但归根结底,我们所做的一切,就是试图给我们拥有的互联网数据分配一个 curriculum,让模型学得更好。我认为在某个时刻,随着算力变得充足,随着模型运行成本降低,随着下一代计算资源的出现,这会变成一个更连续的光谱。

顺便说一句,我认为之所以有训练以及 stage two、stage three 这样的划分,是组织层面的原因,对吧?这是——我认为这正是我们在 model factory 中真正试图避免的事情:训练之所以存在,是因为现在有一个训练团队,对吧?有专门的人,或者说训练团队的人决定专注于一项训练工作。但你真正想要的是工程和规模化实验能力,从而实现一个更加连续的光谱,让你拥有无限多个阶段。现在,我们还没做到那一步。

算力还没到。组织设计也还没到。但我想我们会到达那一步的。再过几年回头看,我们会说:“天哪,我们以前用这么天真的方式处理训练数据,真是太可爱了。我们几乎没做什么排序。

Vibhu构建那个 curriculum 会让你在业内达到那种境界。

Eiso Kant我可以证实这一点,当我与一些研究人员交谈时,现在的很多焦点就在于训练如何变化,以及除了 next token prediction 之外下一个目标函数是什么。我猜你们还没有答案,但你们有一些想法。

Vibhu我们有一些想法。我们还没准备好谈论这个。

我们已经在这方面工作了很多年,我认为这也是你之前问到的那一点——关于创办一家基础模型公司,有一点并不那么显而易见:你必须不断在门槛性的常规工作、成熟的方法论,与你那些疯狂的纯粹研究之间寻找平衡,并根据你在竞争中所处的位置来调整两者的比例,这一点至关重要。

Eiso Kant我是说,这话说得挺好。我本来也打算找个机会聊聊自动研究(auto research),这是 Andrej 的另一个发明,或者说提法。说真的,目标函数能有多少种呢,对吧?干脆试上一千种,让它们跑起来,随便怎样。就像你在寻找的东西,你找的是那种损失曲线,就是……

Vibhu这也是人们在押注的东西,对吧?当你说更多的 Neo labs 时,你们是在做一种“我们要做基础模型、把它们做大、做下一个 token 预测”的版本。但我们看到的很多其他 Neo labs 想要采取完全不同的方法,对吧?从某个层面来说,你说得对,最终都是计算效率,那是总体目标。但有些会选择不同的架构,计算开销也截然不同。所以有些是不一样的,它们99%不是在平衡什么“标准方法放大就好”,而是99%都押在“这是能改变一切的新颖研究”上。

Eiso Kant而且我认为,Luke,你也……这也取决于你是什么时候创办的,对吧?我们刚开始时,我们做的创新之处是代码上的强化学习。不,那早就不是什么新鲜事了,但在当时没人相信强化学习的时候,我们就在那上面死磕。所以当你创办公司时,你必须有自己的想法,必须有一些能让你加速跑起来的不同之处,对吧?对我们来说,就是将对 RL 的研究应用于 LLM,这后来变得很普遍,就像常识一样。但一开始并不是这样。

Vibhu挺酷的。这就像你们2023年最初的那篇博客,你们在里面把什么都讲清楚了。那篇博客被大大低估了,对吧?整个“代码上的强化学习”在当时非常超前。

Eiso Kant非常超前。而且我们甚至不得不跟人争论。就像这里说的,要突破当前的能力边界,你得训练自己的基础模型。我们当时必须跟人争辩,拥有自己的基础模型是很重要的,你不能光靠微调就走向成功,对吧?主要的能力来自于基础模型的训练,微调只是让它变得准确和有用。

Vibhu要知道,放在当时的背景下,我们都知道闭源模型里 OpenAI、Anthropic 已经很厉害了。而我们能接触到的开源模型大概只有 Mistral 7B、30B、70B 这些。

Eiso Kant这个日期是错的。我们发表这篇博客的时候是2023年4月。我想这大概是迁移过程中出的问题,可能是在 archive.org 上找到的。Mistral 也是那时候刚起步的,我们是同一个月开始的,对吧?所以那时候甚至……我觉得当时只有 Llama 出来了,就这些,对吧?所以……但我同意。我认为我们需要尽可能多的多样化思路,而且我觉得如果你今天才开始创办公司,你需要一些能让你获得优势的东西,对吧?而且我认为我们有时过于……

我认为每一种架构——说到底,每一种架构都管用。RNN 也管用,只是计算效率不高,对吧?比如说,如果你有无限的算力,你大概直接拿一个当年那种最基础的 RNN,也能做出很不错的成绩。当然现在已经出现了一些有意义的突破,比如 attention,还有其他一些东西。但我认为我们仍然处于非常早期的阶段。我最感兴趣的是人们在做的极低精度训练,对吧?比如我们看到的 ternary 相关研究,还有……

非常酷。昨天看到的 Bonsai 相关成果就特别酷。我想如果你能翻到我2023年的推文,我当时就在说,这其实是一种显而易见的权衡:更大的模型、更低的精度,就等于更小的模型、更高的精度,从定义上就是这样,对吧?关键只是这种权衡到底会怎么发展,对吧?实际的大小极限在哪里?所以现在有些公司在试图搞清楚这个问题,而如果这些方向做对了,是能改变我们整个行业的。

因为归根结底,我们在计算上的瓶颈是 MatMul 的瓶颈,还有网络通信的瓶颈,而当你开始做那些事情的时候……所以我对这个方向很兴奋。我们倒不是……我是说,我们也在做常规的事情,比如 Laguna S 是用 FP8 训练的。这一轮训练中,我不得不承认唯一没有使用 FP8 的,是我们昨天才启动的新一轮训练里的 all-to-all。FP8 的 all-to-all(没做成)纯粹是因为截止日期到了,我们还没完全做好准备去做。

Nemotron 在 NVFP4 训练上做了非常出色的工作,我觉得他们做的那些被低估了。我很期待能用上 NVFP4 训练。但目前来看还不太合理,因为我们还在用 Hopper 训练,对吧?我们规模还相对较小。目前我们是一家拥有 1 万块 H200 集群的公司。我们很快会扩展到更大的规模,而且如果有人在考虑申请加入的话,真的会扩展得非常大。但总之……是的,我认为这里面还有很多潜力可以挖掘,希望 Laguna S 能让大家看到,这个规模的模型还能做到更多。

我们这次只用了八周。我们认为在任何模型规模上都还有很多潜力可以挖掘。我们现在之所以向上扩展,是因为作为一家公司这是最优化的事。但如果我有无限的时间,我很乐意去进一步推动其他模型规模上的能力。

Vibhu我想我们还没正式宣布新模型的尺寸。我们之前有 XS,大概是 300 亿参数左右。旧的 Medium 是 2000 亿参数,这个大概要淘汰了。看起来是这样。那么新的 Laguna Small……

Eiso KantLaguna S,也就是 Laguna Small,总参数量 1180 亿,激活参数 80 亿,非常稀疏。这是 XS 架构的放大版。它采用了经典的——或者说如今堪称经典的——滑动窗口注意力与全局注意力 3:1 的比例。这个尺寸很好,有几个原因。第一,它的成本效率非常高。对我们来说,这是一个很好的方式——我们想快速把进展发布出来。我们看到的一点是,在基础模型公司内部,专注于发布和交付与做新颖研究之间需要平衡。

但有了 model factory,我们能够把模型发布视为对团队时间投入要求更低的事情,因为无非就是:到这个时间点,跑训练,完成,应用最新的 post-training。所以我认为这是一个很合适的量级。而且它还能塞进 DGX Spark,我对这个小东西有点偏爱。我喜欢让这个小设备跑一个不错的模型。

Swyx对,我们去年在 GTC 那期播客里聊过。我觉得开源的 120B 模型是第一批(能做到单卡运行的),因为它是一张大型单 GPU,也就是 H100,对吧?租一块 H100,现在你有 128GB 内存的 Mac、Mac Mini、Spark。这就是家庭用户最理想的甜点区间。

Eiso Kant但我最兴奋的是,这个模型有望向大家展示这个尺寸能做到什么,因为当你看基准测试、开始用它的时候,你会发现我们的表现超过了那些规模是它两三倍的模型。

Swyx对,而且他们认为——比如说,今天发布的 Thinky 模型大概是万亿参数级别。

Eiso Kant没错。顺便说一下,我很兴奋——它刚发布,我在手机上刚看到,对于那些正在听这期节目的人来说。

Swyx如果你在听的话。

Eiso Kant就两秒钟前,所以我甚至还没来得及看那篇帖子。

Swyx但不知怎的,你们不仅在 Thinky 这类基准测试上表现更好,而且在某些基准测试上,比如 τ-bench,你们达到了最先进水平。

Eiso Kant我们——听着,我不确定我们在 3 banking 上是不是最先进水平,我还没查过我们在排行榜上的位置。但我想说,在同等参数规模内,我可以非常自信地说,甚至在某些参数规模两倍于我们的类别中,我们可能也是最先进的。不过我也要声明,目前世界上最好的模型绝对是 Fable,绝对是 5.6。正如你之前所说,我们也会使用其他模型。

Swyx我觉得,你之前提到的一个有趣之处在于,你们开始将很多实际使用转向它了,对吧?基准测试就像是——

它们适合用来比较,但不太现实。

Eiso Kant必须得这样,对吧?这就是他们 dogfooding 基准测试的方式。

不,你必须这么做。你必须使用自己的模型,必须有自己的内部 eval 和基准测试。有趣的是,当一个新 checkpoint 发布时,也就是训练后的第一次 post-train,你在最开始的 30 分钟内就能感觉到这个模型大概会达到什么水平。你不太确定具体会怎样,但当这个模型出来时,我们会说:“哦,这次不一样。”我觉得这是最好的例子。但这有点像你的孩子。我没有孩子,但父母看自己的孩子时,觉得孩子是完美的,他们爱孩子,然后看不到所有的瑕疵。你自己构建模型时总是这样。最有趣的部分是你会有点爱上自己做的每一个模型。我们总是说:“这是我们训练过的最差的模型。”所以我知道团队现在已经开始着手——

下一个模型了,本来就该如此,因为这是一场竞赛。而这个模型是某个时间节点的产物,希望能让人们看到我们认真对待这场竞赛,我们想要非常努力地投入其中,我们想要反馈,对吧?它哪里好?哪里不好?将模型以 open weight 的形式放到世界上,好处之一就是你能获得大量反馈。

Swyx你们是怎么考虑构建它的,比如与 harness 配合工作,对吧?OpenCode、Codex,你们有自己的 pool CLI 工具。让人们使用它、模型 harness 的设计、在其中训练。

Eiso Kant所以你需要做一些 multi-harness 训练。如果你在,尤其是在这些更小的尺寸下,你想做一点 multi-harness 训练,让这些模型获得正确的表现。而且只需要很少一点。你不需要很多,但只是为了让你在自己 harness 中看到的行为能转移到其他人可能会使用的 harness 中。我们内部一直把这叫做 polishing,就是你有了模型之后做一些打磨,让它在其他 harness 中也能像在你们自己的 harness 中一样工作良好。

毫无疑问,它在你自己的 harness 里会表现得更好,这只是因为你把强化学习的算力投在哪里,对吧?你把 RL 和合成数据都投入到自己的 harness 里,因为这是你最理解的,也是最能推动的。因为这种端到端的控制才能让你把它做得更好。然后,转移这些能力更多是关于确保模型能诱导出适量的推理,并且理解一些可能在其他地方存在的更复杂、更奇怪的工具调用格式。所以我们做了一些 multi-harness polishing,我们是这么叫的。

它其实不是真正驱动能力的因素,但确实能带来更好的体验。我觉得现在大家大概都会这么做,但完全可以理解为什么你自己的 harness 仍然会比其他的更好。我认为我们在所有基础模型公司身上都能看到这一点。而当你在推进能力时,你真的不想通过在 RL 运行中放入 10 个 harness 来做权衡,因为这会带来复杂性。工程上的复杂性,因为——当你想做好的科学研究时,对吧,当你真的想理解是什么让我的模型提升时,你希望在你理解的东西上只改变一个变量。

而别人的 harness,你不会像理解自己的 harness 那样了解或理解它,对吧?他们可能有不同的 agent 或不同的 prompt。

在不同的位置。

Swyx如果是开源的,你可以看源代码。

Eiso Kant是啊,但这是时间的问题,对吧?我真的没法再强调了,我知道我在这方面是个怪人,因为我有朋友问我:“我们能见面吗?”或者“我们能做这个吗?”或者“我们能出去吗?”我说:“不行。”因为归根结底,这是一场竞赛,时间是唯一重要的东西。如果我看向我们的团队,然后说:“好吧,在我们构建更强大模型、同时又能快速泛化到其他 harness 的总体路径上,引入复杂性是否值得?”顺便说一句,我们的模型在其他 harness 上运行得很好。我真的鼓励大家去试。它运行得很好。我一直在 OpenCode、Kilo Code 还有其他平台上测试它,还有 Claude Code。

SwyxClaude Code 今天刚被收购了。

所有东西都在被收购。

Eiso Kant没错。我觉得部分原因是,而且有一些很棒的。我很兴奋,我觉得 Hermes 是一个非常酷的 harness,而且——

Swyx而且,问题的一部分在于,这到底是模型的功劳,还是模型加 harness 的功劳,对吧?所以像 Agents Last Exam 这样的新基准测试,它不想仅仅衡量模型本身。同样,随着模型越来越 agentic,它们需要一个 harness 来运行,对吧?

Eiso Kant我觉得当你向一家模型公司提出这个问题时,可以把它分成两部分,也就是 harness。我们的 harness 非常精简。你看它大概只有六个工具。像是 shell、shell kill、shell wait、write、fetch web,还有,我不知道,bash。我觉得我漏了一个,但基本上就是所有这些工具。它非常简单,非常轻量。所以它不是为了在基准测试上表现好,或者为了在某类特定任务上表现好而设计的 harness,对吧?它不是一个 deep research harness。所以我认为,那些围绕模型构建大量 prompt、额外数据源和其他工具的复杂 harness,确实有不可思议的能力来真正推动模型能力向前发展。

但我们的模型在编码类任务中仍然比那些这样做的其他 harness 表现更好,因为它是用这些工具做过 RL 的。

我确实鼓励大家去尝试。顺便说一句,我认为我们的模型本身完全没问题,表现也很好。差异可能小到任何人都察觉不到,但最终我们在 benchmark 上仍然能看到一点点差距。所以我认为两种情况都成立。基础模型公司会大力推动他们自研的 harness,因为从运营角度说,这是提升模型时保证科学严谨性的最佳方式。但与此同时,如果有人拿了我们的模型,并在改进 harness 上投入大量精力,他们就会与我们竞争,这是理所当然的。

而这正是因为 harness 是模型能力与它所需额外指令之间的过渡手段,而它所需的是数据和工具的访问权限,对吧?我认为这就是 harness 的本质。随着模型能力越来越强,你也在提升模型的指令遵循能力。因此,额外的 harness 只是在说:“嘿,如果你遇到 X、Y 或 Z,就这么做。” 所以,即使你说两个使用不同 harness 的模型最终能达到你关注的同等能力,一个真正针对某项能力量身定制的 harness 会让它实现得更高效。

这就好比一个人拿到了一本操作手册,知道如何用合适的工具和正确的数据源最高效地完成任务;而另一个非常聪明的人只听到“自己去琢磨”。他们都能解决问题,但前者会高效得多。所以我是全球所有 harness 开发工作的坚定支持者,我们也希望与更多 harness 创作者合作,确保如果需要额外的训练或发布,我们都会去做。

Swyx我是说,我觉得当你说这是一场竞赛时,问题在于你到底在竞速什么?你是想成为最好的编程模型公司,还是最好的“编程模型 + harness”公司?这是两码事。

Eiso Kant我们——我是在向 AGI 冲刺。从我们官网上线第一天起,编程对我们而言就一直是——我们一再强调过——我们认为聚焦编程和长程软件任务是通往 AGI 的一条路径,因为它迫使我们解决难题。它迫使我们解决如何完成极长程复杂工作的能力,这类工作需要大量推理、外部工具、数据等等。而且我可以给你展示一点,我们会把这个模型放到网页聊天端,我非常喜欢用它来做深度研究,只是放在我的编程 harness 里用而已。

它从未针对这个场景训练过,从未专门看过这类数据,但在我看来它做得很好。因为说到底,技能是可以迁移和泛化的。至于我们今天没有重点投入的方向,是确保把全球最顶尖的医学知识或法律知识编码进这个模型。但它确实——我们不会发布这个 benchmark,因为我们没有足够时间做严谨的测试——但它在 LegalBench 上表现很好。至少在我们首批测试中是这样,而且我们非常严谨。当我们发布 eval 时,我们会检查每一个细节,会跑很多次。

我们会逐一排查,会反复核查,我们尽量做到极度诚实,所以如果某个我们内部在用的公开 benchmark 我们没花足够时间,我们就直接说不会发布它。

Swyx其实另一种方法就是把它交给 Artificial Analysis,让他们去跑。

就像第三方标准那样。

Eiso Kant哦,完全同意,而且我们也会这么做。但这仍然需要时间和精力,对吧?因为你得和对方沟通,了解基础设施故障、他们使用的工具、配置是否正确等等。但我同意,你肯定希望这样做。我是 Vals、Artificial Analysis 以及其他做这类工作的公司的忠实粉丝。

Swyx我觉得这很好。你是第一个提到这点的。

Eiso Kant是的,我觉得他们很棒。他们做了大量工作并公开发布,我很喜欢。我认为还会有更多这样的公司,所以请大家创办更多的 eval 公司,创造更多的 eval。我认为这对行业非常有价值。

Swyx我感觉这实际上是一种垄断。哦,也许算是双头垄断。

Eiso Kant我觉得这很容易被打破。

因为我确实认为这很容易打破,因为对很多人来说,做一个 eval 并不是那种炫酷的工作,但只要有人做了,大家都会很高兴拿到一个好的 eval。如果一个 eval 构建得好,所有人都会为之欢呼,都愿意付费,都愿意——就像基础模型公司——

Swyx哦,对,做 eval 本身当然是。但如果说要成为那种“我们是行业标准,我们会——”

运行 T-bench,并确保你没有作弊——

而且我会用你运行的方式、而不是你竞争对手运行的方式来跑它。

Eiso Kant是的,确实如此,而且我们需要这样的机构。有几个标准化的平台,我们都必须遵守,这很好。这让我们保持诚实,我觉得这非常重要。但没错,我认为我们的目标是打造世界上能力最强的模型。目前我们专注于编程 agent 能力和长程任务。但你会发现,这么做能带来很多附赠的好处。我一直说,当我们在编程领域达到 SOTA 和 frontier 水平后,再回过头来说“好,现在我们要疯狂利用 model factory,在那些我们还不够强的领域补充更多数据”,比如医学、法律或其他任何领域,这对我们来说会容易得多。

同样,我们也观察到一个现象,尤其在 reasoning models 上非常明显:如果你给模型提供正确的知识来源,并且它们具备强大的推理能力,它们就能很好地进入那些对它们来说不那么熟悉、甚至在训练数据中很少出现的领域。所以,但没错。我们是那种“模型 + harness”的 agent 公司吗?不,我们是一家模型公司。但我认为今天的模型没有 harness 是无法训练的,这不可能。所以就像以前容器里只有 weights,而现在上面附加了一个 agent harness。

但我认为,作为一家模型公司去做 agent harness,和真正去做一家 agent 公司,这两者之间有巨大区别。我觉得后者能做到的事情远比我们多。

Swyx明白。我想这就是我小小的不同意见。如果你们真的把自己定位为一家模型公司,那就应该为 OpenCode 打造最好的模型,对吧?而不是为 pool 或其他什么。当然,如果目标是 AGI,那与为 Hermes 打造最好的模型相比,这就不算什么了。

对吧?因为那就是编程之后的下一个阶段。

Eiso Kant听着,我们正在和他们非常紧密地合作——

因为我确实认为这很重要,你必须在乎,必须投入。所以我们才花时间去打磨它。而且我认为随着时间推移,没错,你说得对,你会想要平衡这一点。但最终你想要的只是通用能力,让模型在每个 harness 里都能同样出色地工作。

Swyx顺便问一句,你们跟 Hermes、OpenAI Codex、NanoCodex 之类的合作多吗?还有 Pi?

Eiso Kant不过我必须要说,我是 Pi 的忠实粉丝。我觉得它真的非常性感——

SwyxPi,你听起来最接近 Pi——从 pool 和 Pi 那种最小化表面的角度来说——

Eiso Kant最小化,对。

这是因为我不——我还有个看法。请允许我再发表一个强烈的观点。

这话我已经说了两年了。

我认为 MCP 和 tools 都很蠢。

我支持 MCP,我们也支持 tools 等所有东西。但对我来说,它们完全说不通。

我来稍微解释一下为什么,我觉得应该能让大家认同这一点。

如果你要处理复杂任务,时间跨度越来越长、任务越来越复杂,不管是编程还是别的什么,你都需要与数据源交互,对吧?而且你还要与安装在某种虚拟机上的东西交互。

而我们现在做的,是在这些东西之间加一层。我们在中间加 MCP,在中间加 tool calls,而且这一点针对 tool calls 更甚于 MCP,模型本可以直接写代码与系统交互。我们已经看到这种趋势了。Laguna S 就经常这么做。你在 frontier models 中也会看到。它们越来越不再是“我们要把 50 个 tools 塞进 system prompt”这种模式,而是“不,这里有一台虚拟机,装了这些二进制文件,有这个你可以操作的代码库。

这里还有个文件夹,你想用的话可以作为记忆。”模型在用代码来完成复杂请求。当它使用代码时,就不再是一个、两个 tool calls 或者三个串在一起的东西了。它开始用 if 语句、for 循环,让事情变成条件化的。

没错。就像直接写在文件里的代码。我不知道你们怎么叫

对,没错。你在模型中已经看到这种情况越来越多了,因为当你开始用 RL 训练它们时,模型想要自由。它们想以最高效的方式做自己想做的事,而不是调用 system prompt 里那 50 个 tools 中的某一个。所以我非常主张给模型一个最小的束缚,越小越好,给它一个容器,里面有自己的代码库,对吧?让模型的代码库能访问 API keys、数据源、需要的小库和文档,然后让它在任务中自由发挥。我认为这就是我们要走的方向。我觉得 12 个月后,我们不会看到任何一个 system prompt 里塞满 20、30 或 40 个 tools 了。

Swyx无可奉告。对此我没有异议。我觉得它还会存在很长时间,因为已经有很多人习惯了这种方式,不过也许你们之后不必在自己的模型里支持它了。但没错,我是说,如果可以的话。我确实觉得写代码更通用,而且这是一种达到目的的手段

Eiso Kant而且我们确实支持 tools。

我们支持。而且这是我们第一个支持 parallel tool calling 的模型,这方面我们之前需要追赶。所以这个功能是有的,而且

所以它是有的,但我

这只是我个人的一点小执念。我希望模型拥有尽可能多的自由度,能够自由地做有能力的事。

Swyx对。那么接下来,刚才说的是关于怎么用 Poolsides 的模型和 Laguna 的模型来跑我的 Hermes 或者我的 OpenAI Codex

在所有这些事上。通常我看重的是 computer use 或者 vision。这是非常重要的一点。你们在这方面发过一篇博客文章。但另外 persistence 我觉得也是很强的价值,还有长上下文,你们有一百万 token 的上下文。还有别的吗?

Eiso Kant对我们来说,你看,对我们来说,vision understanding 是接下来的重点,对吧?

我们目前还没有 vision understanding。

Swyx我正想说这一点

Eiso Kant这些模型目前还没有 vision understanding。

所以这方面我们已经开始投入努力了。我们认为拥有 visual understanding 非常重要。

所以没错,我们在这方面还有工作要做。这也是我喜欢 Thinky 模型的一个原因,就像我花了两分钟快速浏览他们博客文章时看到的

Swyx他们非常致力于 multimodal,包括 audio。对。

Vibhu他们的 audio 是 state of the art 的,虽然是万亿参数的 state of the art audio,而且全是从头训练的,对吧?

没有 encoder,也就是说

Swyx对我来说,这是你必须从头训练的最有力的理由之一,因为你会有不同的 tokenizer,会有不同的

Eiso Kant我完全认同,这里没有任何分歧。就是直接加上这个模态,别搞复杂,保持简单。我觉得我们很长时间都不会碰 audio。

Vibhu名字里也有体现,InkLink Inc.

Swyx我是说,audio 有什么难的?

Eiso Kant不是关于难不难的。再说一遍,归根结底是专注。

对吧?对事情说不意味着有研究或算力可以投入到取得通用进展上,而我们的观点是,通用进展将来自于把这些模型推向更强推理能力、更长时程任务的能力。我不认为 audio 能为此添砖加瓦。我不觉得它让我们离 AGI 更近。我认为当你接近 AGI 时,它是一种必要的模态。我认为 visual understanding 处于这些事情中间。我认为 visual understanding 绝对可以做到这一点,而且它还能解锁当下就有价值的能力。所以但这就是关键,对吧?你希望有更多多样性,希望有更多不同的基础模型公司专注于不同的事情。我们就像一匹戴着眼罩的马,就像

Swyx对,你们有自己的路线

Eiso Kant我们有自己的路线,我们想赶上前沿,不想被其他任何事情分散注意力。

Swyx我要提一下,有一个研究方向是 DeepSeek OCR,就是你能不能扔掉 text tokenizer,只保留 vision?

Eiso Kant我觉得这个——你看,我内心的极客看到这种东西就会想,哇,看看这个,看看编码所需的 bit 数

我觉得这超酷的,对吧?但我想我们最终还是会回到这个问题上。它可能能跑通,只是它的计算效率够高吗?是不是——我觉得这些东西最终很多都能 work。只是问题在于,text 的好处是什么?而且我之前提到过,Peng Ming 和 Nikolai 是我的两位应用研究负责人,他们太出色了,没有他们和整个团队,我们不可能走到今天。

我和 Nikolai 多年来一直在争论,推理应该在 latent space 中进行,还是应该在 token 层面进行?但有一件事,我认为他和我,以及我们三人,都真正认同,那就是语言之所以不可思议,是因为它是一种密度极高的方式,用来编码知识、信息和智能,对吧?想想看,一篇最终成稿二三十页的物理学论文,要生成它所倾注的智能、思考等等,都凝聚在这 20 页的文档里,就那么一点点比特,却编码了如此大量的内容。

而其他模态,比如视频和图像,虽然也很棒,但在知识密度或推理密度上——或者说在我们努力推动的那些方面——并不及语言模态所编码的内容。它们确实存在。很多时候,你可以在 YouTube 上看一场精彩的 50 分钟讲座,但但如果你把视频当作数据来处理,与文本数据相比,它的比特信噪比、该模态的计算效率都要低得多。所以我们持这样一种观点:凭借语言你可以走得很远,而且在计算资源有限、人才有限的情况下——这两者本身也高度关联——我认为我们可以全力推动语言。

这是更划算、更好的投资。但我想要所有的模态。我觉得它们超级酷,也很喜欢 DeepSeek 等公司在尝试的方向。我可以一直转发他们的动态,但内部我们只是在说:“保持专注。

Vibhu我得说,看看 Anthropic 就会发现,这种策略某种程度上是有效的。OpenAI 在视觉和多模态方面投入很多。Anthropic 则没有,对吧?Fable 在图像处理上迈出了一大步,但他们并不以多模态公司著称,对吧?他们是一家语言模型编程公司,具备多模态能力,但从不刻意炫耀,却也走得很远。

Eiso Kant在这方面,我认为 Anthropic,我的意思是,他们做对了很多事,但我认为这种近乎偏执地专注于推动能力、扩大模型规模的策略,我再同意不过了。我认为这是第一道难关,一旦我们跨过这一步,就能改进很多其他事情。但与此同时,在光谱的另一端,看到人们在构建这些空间模型,对吧?还有正在构建的 world models,用于非常不同的应用场景,这也非常令人兴奋。但我认为,这一切最终会在某个时刻汇聚到一起。

Vibhu好的。那么扩大模型规模,这就是 Laguna S,代表 small。

你们的命名不错,extra small、medium、large。

Eiso Kant所以新的 medium 已经开始训练了,比上一个 medium 大得多,昨天开始的。这是一次为期 39 天的训练。

Vibhu这些天数和具体事项是怎么安排的?就只是计算和模型的事吗?

Eiso Kant对吧?而且到了这个阶段,有了模型工厂,就——

Vibhu我觉得这很有意思。你们在 Laguna medium 和 extra small 里,甚至直接给出了 GPU 小时数,用了多少天等等,针对不同尺寸。我当时就想:“哦,你还可以倒推出这要花多少钱,对吧?用什么 GPU,多少小时——”

Eiso Kant然后你就会发现,这并不多。

这花不了多少钱。你们一开始说要做“西方的 DeepSeek”,我认为那就是 DeepSeek 时刻,对吧?那一刻人们意识到,你可以在一次训练中以不高的成本训练出能力极强的模型。但我认为那是一种误解,对吧?训练并不是最昂贵的部分。训练本身是一个非常平淡无奇的事件,对吧?就像我们昨天刚收到一条 Slack 消息说:“新模型开始训练了,这是链接,你们可以跟着看 evals”,然后就没了。为了那一刻所做的全部工作,就像——我对体育一窍不通,但就像运动员说的那样——重要的是准备,是平时去健身房训练,而比赛就只是比赛。我觉得模型训练也有点像这样。

Swyx是的。人们过度关注 DeepSeek 只花了 500 万美元还是多少来训练,对吧?但实际上那之前还有大量的研发投入,基础设施也是一点点建起来的。

Eiso Kant没错,所有这些东西,还有数据。不过先不说这个,Laguna M 正在训练中,而且是的,以后会有 L,也会有 XL,而你们将——

你们将在 M 上看到,对吧,M 比上一个 M 大得多,对吧?所以这些代号有点像是我们对不同——

Swyx是啊,他之前还在嘲笑别人说 small 是 24B 什么的。

不,其实,不是。Mistral 的 small 现在都超过 100B 了。

Eiso Kant我是说,我们的 small,对吧,是 118,所以我不想再多说什么了。就像,这——

Swyx我是说,我觉得这也……好吧,你们的 small 是——

Eiso Kant我们都知道,对任何一家 foundation model 公司来说,最困难的事就是起名。

我也不想声称我们擅长这个。我是说,这是 Laguna S 2.1。它,它——

Swyx但至少大家能看懂,medium 比 small 大。在你们把这个搞砸之前,还是——

既然我们说到命名,这本来打算放到最后问的,但不如现在就问吧。

为什么叫 Poolside?为什么叫 Laguna?

Eiso Kant所以我们创办公司的时候,本来打算叫 Snowball Apps。这个名字来自滚雪球效应,因为我们预期这家公司会产生滚雪球效应,而对我们来说,它确实也产生了滚雪球效应。结果发现这是 Amazon 的商标。

毫不夸张地说,我联合创始人的下一个命名建议是:“那我们叫 Bedrock 吧。”所以当时我就说:“好吧,不行,如果你在 Amazon 工作过,那你确实太会起名了。”所以,在公司正式成立之前,很早的时候,我们去参加了一家非常大型的科技公司的年度会议,当时我们一直在和他们洽谈。你要知道,那时候公司就我、我的联合创始人,还有我们的 CEO Margarita。我们甚至已经知道第一个要加入我们的人是谁,但还没正式注册成立。当时我们在和这家大型科技公司谈一个 OpenAI-Microsoft 式的合作协议。他们会给我们提供大量算力,我们会给他们永久使用权,以及很多其他条件。

Eiso Kant [01:21:49]:我们当时发现 Snowball Labs 这个名字已经被注册了商标,而那时我们正在那场会议上进行着一场本不该由我们参与的讨论,对吧?我们当时只是几个还一无所有的小伙子,但这家大公司却愿意考虑与我们合作的可能性。我们正在讨论这件事,那是在他们年度会议的公开场合,那家公司的首席科学家说:"这里有人能听见我们说话。我们得换个地方。去 Poolside 餐厅吧。"

不知怎的,我和 Jason 在那一刻对视了一眼,说:"哦。"然后那天晚上晚些时候,这个名字就留在了我们脑海里。这个词留在了我们脑海里,我们说:"公司就叫 Poolside 吧。"从那以后,我们最终没有做成那笔交易,而我们也用它来提醒自己永远不要削弱自己的野心,因为那样做才是轻松的路。而我们选择的艰难道路是,作为几个甚至不在硅谷创业、也没有什么知名背景的小伙子,却要起步并尝试筹集巨额资金。所以每个人都觉得 Poolside 这个名字跟 AGI 有关——每个人都能坐在 Poolside(池边),这是个 playful 的名字,我们很喜欢,而且有点与众不同。

但这个名字对我们来说是一种提醒,永远不要削弱自己的野心,每当你面临那些抉择时,就选更难的那条路。

Swyx [01:23:09]:是啊。这是个很棒的故事。我知道你以前讲过。

Swyx [01:23:14]:而且是有记录的。但我第一次见你的时候你就跟我讲了。你当时让我坐下,我们当时在酒店的某个地方。

Swyx [01:23:21]:

然后你说:"我们要融 5 亿美元。"我当时就愣住了。然后你把整个愿景讲了一遍,后来你也真的做到了。我就想,我也没多少机会能问你,你到底是怎么向那些 VC 融到那么多钱的?他们在找什么?对,大致上是因为 AGI,但具体来说,他们想要什么——

Eiso Kant [01:23:42]:你看,世界肯定变了,对吧?我们在融那 5 亿美元的时候,大多数与投资者的对话还在努力解释这些模型不仅仅是 stochastic parrots,而且它们会继续进步。我亲眼见证了世界从"OpenAI 会通吃一切,其他人根本做不成公司"这种观点转变过来。我是说,Anthropic 当初为他们的 5 亿美元融资也挣扎过。这是有广泛报道的。他们很高兴地完成了。所以我认为当我们在一年半前左右融那笔钱的时候,世界跟今天非常不一样。我觉得今天,相信 AGI 是真实存在的人数,可能已经呈现出超线性,或者绝对是某种指数级的增长。

Eiso Kant [01:24:31]:而我认为这很重要,因为如果你持有我们三年半前和一年半前的那种信念,并且我们去寻找那些持相同信念的人,也就是认为这项技术将从根本上支撑未来所有具有经济价值和科学意义的事物,那么之后的价值函数就很容易理解:嘿,如果你做到了,你就是能构建这种 commodity 的参与者之一。而多年来,构建这种 commodity 已经不仅仅关乎做模型,还关乎构建基础设施和其他东西。

Eiso Kant [01:25:03]:所以我认为今天,因为相信的人更多了,而且结果已经被证明了,对吧?我觉得 Anthropic 现在令人难以置信的财务成功,以及 OpenAI 和其他公司、还有 Google 的增长,已经不再让 product-market fit 成为一个问题,而这在几年前还是问题的一部分。比如,这些东西能做多大?如果你告诉别人,在我们这个行业你现在能达到这样的收入数字,人们当时还会把你笑出房间。

Eiso Kant [01:25:33]:现在我认为,问题在于世界上哪些人相信智能会形成寡头垄断,哪些人相信这种寡头垄断可以被其他公司打破。我认为这才是投资者之间最大的分歧。对于那些相信 AGI 的人来说,然后你还有一整层人在自我淘汰,退出 foundation model 公司,因为他们觉得:"你看,我把钱投在这里,跟投给应用公司相比,回报会很不一样。"我觉得有很多了不起的应用公司,而且应该有很多被建立起来。

但我确实认为我们现在仍然处在一个早期阶段——这仍然可能是决定谁能成为赢家的早期阶段。智能,在我看来,将成为世界上需求最大的 commodity。它在利润和价格上会更加商品化。而世界需要选择,需要选项。所以我认为,投资者如果把世界看作"哦,只会剩下两个玩家",那是非常短视的。

Eiso Kant [01:26:41]:我认为持那种观点的人群在年初的时候比现在多得多。

Eiso Kant [01:26:46]:我觉得过去几个月让很多人警醒过来,心想"天哪",这个世界既能用上多得多的智能,同时世界本身也复杂得多。我们应该有多个选择、更多选项,有些东西可以被关闭,有些则不能。人们现在对模型施加的限制,我认为也是这个问题的另一个层面,对吧?

Eiso Kant [01:27:08]:比如,我们正在进入一个这样的世界:模型公司说,"你不准把我用于 foundation model 公司的开发。"他们应该被允许这样做。这就是资本主义。这是他们的生意。这是他们的劳动成果。

Eiso Kant [01:27:25]:而我们居然对此表示接受,这太疯狂了。

Swyx [01:27:30]:你更反感 Anthropic 这么说,还是白宫这么说?这是两种——

Swyx [01:27:37]: ——不同的限制和约束。

我是这么看的。随着这项技术变得越来越强大,无论好坏,我们都越来越应该诉诸民主来决定这些问题。我认为任何单一公司做出单边决定都是危险的。这是权力集中在少数人手中,却几乎没有制衡。这在历史上从来不会有好结果,任何形式下都是如此。我这不是在批评现有的 foundation model 公司。这更多只是在表达我希望世界成为什么样子。在一个技术越来越强大的世界里,政府需要在判断哪里存在真正的滥用风险方面发挥积极作用。

我确实认为我们需要把安全分成两部分来看:滥用,以及那些没人知道会不会发生的 doomsday 场景。而从非常实际的角度来说,我很高兴看到政府层面现在又开始有大量讨论,试图弄清楚这些问题。至于最终的决定是什么,也许我会满意,也许不会,也许我同意,也许不同意。但说到底,这就是民主,对吧?在任何一个特定时刻,我可能不会对某一项决定完全满意,但人们投票选出了代表来做这些决定。所以我认为从长远来看,在 20 年的时间跨度里,世界大方向是正确的,民主是有效的。

至少,不是有句名言吗,说它是所有最糟糕的体制中最好的一个,类似这样的话。

Swyx它是所有我们尝试过的组织形式中最糟糕的一种,除此之外。

Eiso Kant没错,就是这句。

Swyx引用丘吉尔的话你尽管找我,因为我研究过很多丘吉尔的东西。

Eiso Kant我喜欢这句。这就是我期望的。现在,我认为我们正处于一个关键时刻,所以对任何人来说,发声都很重要。我觉得那些考虑创办自己的 foundation model 公司的研究人员,应该去做。想分享观点、想公开发声的人,无论是向自己的民意代表表达,还是在 X 上发声,都应该去做。

但具体回应你的观点,我认为我们目前的能力水平还没有达到应该以任何形式限制 open model 的地步。如果我们这么做,会损害创新。

Swyx那有没有某个时刻你会改变这个观点?

Eiso Kant会。我是说,看吧——而且必须要有这样一个时刻。

对吧?你不能板着脸说“这东西在任何形式上都可以永远 open”,我觉得这和说“相反,现在就必须全部封闭起来”一样过分。我认为任何光谱的极端都是我们会犯错的地方。

对吧?社会在任何形式下都是如此。所以答案总是更加微妙的,从来不是非黑即白的。因此我认为,当我们遇到现实世界中的场景,不得不说出“嘿,我们必须更谨慎”的时候,我们就需要重新评估。如果这意味着要以不同的方式训练 model 并开源,推出不同版本,对某些东西加以限制——我觉得这完全没问题,因为我认为任何人都不应该不负责任。但我想指出的是,从 GPT-2 开始,人们就一直在呼吁担心这些 model 被滥用,对吧?我还记得当时有人说“我们不能发布 GPT-2,因为全世界都会……”

所以,这不是针对 Dario 的评论,只是对整个领域的一般性评论。到目前为止,我们在这件事上做得并不好,我们需要改进。我确实认为 safety institute 以及更好的 eval 等方面正在开展的工作,可能是正确的方向。

Swyx是的。我是说,我想为此辩护几句。宁可先偏向安全一侧,然后再回调,反过来也不行,因为反过来是一个单向决定。我认为这是对的。

Vibhu但这里的前提还包括竞争,对吧?你不可能在全球范围都偏向安全,对吧?你说的是……

Swyx你不可能单方面推行安全,因为别人只会比你更不安全。

Vibhu你可以在这里暂停创新,但这并不意味着其他地方也在暂停。

Swyx他们就会接管世界。就这么简单。

Eiso Kant这些都是很复杂的因素。

对吧?我认为,我们最好能去讨论某些我们可以达成共识、甚至在国际上达成共识的能力,讨论我们想要限制哪些能力,或者不希望哪些能力被随意获取,而不是用非黑即白的方式来讨论 model 是否开放。一旦你开始做出这种大而化之的笼统声明,你就开始面临风险。我总会回想起我们禁止香烟广告的时候。这是件好事。我不是说我反对这个。但这实际上奠定了烟草公司的寡头垄断,因为其他公司根本无法竞争。而且那可能是烟草行业有史以来最好的时刻。

我们现在不想重蹈覆辙。如果你在创新面前筑起高墙——这话出于私利,因为我自己还不处于前沿,但这不仅与我有关。我认为这与这个领域的每个人有关。如果你在 2026 年就基于 model 当前的能力,决定这件事只有两三家公司能做,那对我来说,就像是我读过的最反乌托邦的科幻小说的第十四章,因为从那里开始,你就可以推演出世界上发生的各种场景,而那些场景都不会让我对未来感到兴奋。我认为这是我们都应该思考的。我们想要一个什么样的未来,让我们为之兴奋?

我们想要拥有什么?我认为那是一个智能成为商品的未来。每个人都能获取它。它变得越来越便宜,对吧?我认为这很重要。它能影响世界上更多的人,而不是由某一家公司来决定它输出什么,或者随时开启或关闭它。

Swyx我认为在这个问题上,比美国政府更有权力的实体是 Nvidia。

因为,谁能拿到分配份额,谁就能获得算力。

Vibhu你可以进一步追溯到 TSMC,或者……

SwyxTSMC 还在它下面。但我只是想抛出一些 provocative 的陈述,看看你有什么回应。

Eiso Kant这个我得想想。

Vibhu我觉得它们是受到监管的吧?你看政府……

它们能往中国发货吗?

Swyx好吧,但它们不是中国。

Eiso Kant听着,我认为这个行业之所以存在,是因为 Nvidia 所做的一切。

对吧?我知道人们很容易批评他们,但我也想说,我记得我们创办 Source 的时候,对吧?2015 年,在那篇 capacity 文章之后。我们能够取得这些进展,是因为我们能把 consumer GPU 放进服务器里,而他们允许我们这样做,然后你就不断往前推进。所以就是这样,foundation model 与它们的硬件和系统联系得如此紧密。

我们为什么会看到这些阶梯式的进步发生?我们看到它们发生是因为下一代网络和系统的出现,对吧?你可以在 Hoppers 上训练的模型与在 GB300s 上训练的模型之间的差距,就是万亿参数模型与五六万亿参数模型之间的差距。因此我认为这些东西彼此之间紧密共存,而我认为未来更有趣的问题将是,当我们开始更多地设计这些系统时,我们能在模型能力方面解锁什么?我们正在下一代系统中看到这一点。而我认为,世界憎恶垄断。

资本主义在推动那些允许更多竞争的事物方面做得很好,对吧?而 Nvidia 允许竞争。它并非垄断。但如果政府通过监管说其他人不能有效构建基础模型,那就完全不同了。现在,去构建一家 Nvidia 难吗?绝对难。构建一个基础模型难吗?我认为构建基础模型非常难。但我们应该让竞技场成为一个如果有人明天醒来想这样做,他可以这样做,并且他被允许使用工具去做的地方。而且我认为,我们在围绕模型公司的讨论中所看到的,与我们在芯片公司方面所看到的,仍然存在很大差异。

Vibhu差距似乎也在于谁来监管它的专业知识,对吧?政府中谁来决定什么太安全、太聪明、太危险?不过既然我们都在抛出尖锐问题,你有没有想到什么可以改变的?那么,OpenAI、Anthropic 应该开源模型吗?是开放权重吗?是我们在 RL 中做的事决定了你的安全屏障吗?那里应该做些什么,还是只是在随便聊聊?

Eiso Kant这是个好问题。是的。有一件事让我兴奋,我认为我们越来越多地在谈论它,但还没有人在做,那就是在 RL 训练期间混合搭配硬件,对吧?就像——你想想这个概念,我们在推理中已经看到这一点了,对吧?Prefill 和 decode

在通用 GPU 和更专用的芯片上工作得更好,对吧?就像,如果是 Groq 芯片和 Nvidia,LPU 和 GPU 结合,而且行业中有不同的版本。而 RL 受 batch size 限制,对吧?所以,你最终受 batch size 限制是因为你没有无限的任务,对吧?当你拥有整个网络时,你可以更灵活地扩大 batch size,因为你拥有整个网络。但对于 RL,你有 X 百万个任务要训练,所以你不能大幅扩大 batch size,这意味着你无法在某种程度上像训练那样用 RL 扩展计算。

所以我对任何能改善这一点的事情都很兴奋。我认为开始改善这一点的最好方式之一,就是我们已经在推理中开始看到的东西,也就是把 prefill 和 decode 分离到不同的芯片上,并将其应用到强化学习中,对吧?而且我认为我们很快就会达到那里。我认为应该有更多人从事这项工作,因为那样我们就能在 wall clock time 上更高效地训练 RL。再说回来,这是一场竞赛,对吧?竞赛不是用 GPU 数量来衡量的,而是用日历来衡量的,而这可能是我们现在能对加速行业产生的最大影响之一。

所以这是一个我在技术上很喜欢钻研和与人讨论的话题。是的。

Swyx是的,我会和 Etched 聊聊。我参观了他们的数据中心,从物理上你可以看到 PD disaggregation 是如何在数据中心中布局的,而且你必须拥有自己的硬件才能做到这一点。

Eiso Kant是的。不,听着,我认为这个领域更多的创新简直是最酷的事情。

所以我很兴奋,因为就像我们所有人一样。

比如说,为什么我们不能在发布前两周完成这个模型的 post-training?或者不对,抱歉,在训练完成到训练 SFT,再到发布所需的时间。我现在最大的 wall clock 瓶颈就是 RL 时间。

对吧?而这只是因为我无法进一步扩展它,因为我由于那个 batch size 限制无法添加更多 GPU。有一篇非常酷的博客文章刚出来,展示了用比我们任何人都在做的更低精度完成的 RL。我觉得这非常酷。那么今天是什么日期?我们是 7 月 15 日,所以这是五天前发布的。我觉得这非常酷。我认为,在保持稳定的低精度 RL 方面,我们仍在用 FP8 做这件事,所以我很兴奋看到他们分享这项工作并将其公开。这绝对是我们一旦转向 Blackwell GPU 后我很兴奋去做的事情。

Swyx但是的,很酷。开放研究的一部分就是,你索取也给予。

我只是快速提一下,有一篇论文对量化级别做了消融实验,他们大致得出的结论是 four bit 是甜点。但我不记得了

Eiso Kant这就是几年前的事,对吧?我想我记得这个。

Swyx但就像,我在想,好吧,也许 NVFP4 就是它了。你真的不能——就像,你能做到的最低是 ternary。

就是这样。就像,没有那么多选择。

Eiso Kant嗯,我是说,NVFP4 和 four bit 之间还是有很大区别的,对吧,就可能性而言。但我认为 NVFP4 就其本身而言被低估了。我很兴奋——当它发布时,只是获得那个额外的,就像,range 之间的权衡,

Swyx几个快速的收尾问题。

Vibhu好的,快速回到技术层面。那么从 XS 2.1 medium 到训练新的 small 模型,在训练模型方面有什么重大收获吗?你在之前的讨论中提到很多,在训练中还有很多可以榨取的,对吧?你可以从网络中学到更多。同时,你把 30B 扩展到了 120B,对吧?模型小到多少算太小,有没有什么门槛?所以我先随便说几句。最后我会提个问题。但 Karpathy 的论点的一部分是认知核心,对吧?我们看到了 Vipe Thinker、Nanbase,3B、4B 的模型能进行大量推理,然后想法是你把工作卸载给不同的模型。这些是小推理模型。那么你在模型尺寸方面有没有发现什么有趣的,比如设备上 20B、30B,单 GPU 上 100B?你在那里还能榨取更多吗?

Eiso Kant还有很多可以榨取的。比如,我不想做太多前瞻性承诺,但我认为我们也可以从 XS 尺寸中榨取更多。而且我认为我们在 S 模型的训练中学到了很多,这将使我们能够进一步改进 XS 的尺寸。而且我认为自那以后我们已经学到了一些本可以让 S 变得更好的东西。我认为我们的领域还有很多可以从更小的模型中榨取的。我不认为这是反对 scaling 的论据。这只是——而且顺便说一句,我认为这是一件好事——拥有一个小模型的 post-training 配方并试图将其应用到一个更大的模型上,这真的没什么帮助。

在所有情况下,你都得重新思考大部分配方。不过,把大模型的后训练方案应用到小模型上,几乎总能带来非常好的性能提升和基线改进。你当然还可以进一步微调,但这一点未必那么显而易见。所以——一旦你把大模型做得更好了,你通常就有一个快速手段来再次提升小模型。但我们还能从小模型身上榨出更多潜力吗?Laguna S 让我非常有信心,我觉得我们可以。而且我认为这跟我们之前讨论过的那一点有关:关键在于模型行为,而不一定是原始智能水平,这才是你改进模型的方向。

Vibhu而且这是在所有维度上的。有一个维度是模型能推理多久,也就是它能保持 agentic 状态多长时间;还有一个维度是效率,对吧?你理想中希望两头都推进。另外有一点需要澄清,你们现在没有做、但我们在 Frontier Labs 看到的情况是蒸馏,对吧?你有一个大模型,并不真正发布给用户,而对外提供推理的通常是由此蒸馏出来的,这能带来不少收益,对吧?

Eiso Kant要知道,我觉得我们现在不做这件事,跟我们为什么要训练这些模型有关,对吧?这些模型对我们来说是我们研究路径的一部分。我们之前训练的 Laguna Medium 比我们最近发布的这两款模型——这一款和上一款——要大得多,而且我们过去还训练过更大的模型。所以大模型本身有工程上的考量,每提升一个数量级,你都会在训练稳定性方面学到新东西。但在较小的模型尺寸上,你在内部研究中的迭代速度会快得多,对吧?

所以对我们来说,蒸馏成小模型并不能达到目的。这些模型——这么说不太准确,但对我们来说它们是双重用途的模型。它们既是我们衡量模型工厂是否取得进步的标尺,也是对外发布的产品。所以我们才不做蒸馏。我们做过蒸馏实验,确实能做出一些很酷的东西,而且我觉得如果你拥有大量用户数据,还能在这方面走得更远,对吧?但我认为,以较快的节奏从头训练完整模型这件事是有其价值的,这样你作为一家研究机构才能学到经验,而不用干等。

模型训练之间的间隔更长,比如六个月,我们会训练一个大模型,等六个月,再训练一个更大的模型。你会把太多的改进变化堆叠在一起,等到训练下一个模型时,就成了一锅大杂烩,你根本不清楚到底是哪些因素带来了结果。所以当你更频繁地训练模型时——这对后训练和从头训练都适用——你就更能理解是什么带来了提升。我认为这很重要。说到底,我们现在仍然没有一门关于大语言模型深度学习的真正科学。但我认为我们都在努力从实验中获得洞察,正是这些洞察带来了 scaling law,带来了改进,让我们能够再次提高计算效率,并获得更强的能力。

Swyx是的,太棒了。我最后还想再聊一点历史。你曾花过一段时间研究工程团队生产力的衡量指标。你今天怎么看工程团队的生产力?

Eiso Kant怎么说呢,太疯狂了,对吧?这就像是黄金时代。你现在只需要有一个想法,然后等着 agent 通宵干活,就能把东西做出来。

Swyx就是说,你怎么衡量呢?

因为你实际上在理论上

就是在做这件事,对吧?

Eiso Kant嗯,我觉得这是个好问题。我已经很久没考虑过这个了。

Swyx但你非常——你非常有资格谈这个。

Eiso Kant不,我——不,你说得有道理。让我花点时间想想。说到底,代码是什么、软件是什么、工程是什么,就是要把对终端用户或某类终端用户有价值的东西——比如一个想法、一个额外功能、一个 bug 修复、一个特性——交付出去,实现那份价值。我觉得随着这些模型能力越来越强,我们正在大规模地既削减中间环节,又压缩交付价值所需的时间。最终,对任何初创公司或任何企业来说,这个迭代周期才是制胜关键,对吧?

如果你能在两小时内解决一个 bug,而不是让它在 backlog 里躺三周;如果你能在跟客户的通话中了解到,"嘿,如果有这个功能,他们愿意付更多钱,这对他们更有价值",然后你在一周内而不是一个月内把它上线。所以我觉得,也许我们多年前关注的那些东西今天仍然适用,核心就是周期时间的概念。但在这里,它指的是从你有了一件想为用户做的有价值的事情,到把它交付给他们的前置时间。其他所有指标最终都只是这个滞后指标的领先指标,对吧?

无论你是看代码量、PR、review,还是别的什么。所以我觉得,在这种情况下,我们在一些事情上开始推进得如此之快,以至于我们可以直接退后一步,去看过去那个滞后指标。我们过去通常把它叫做从 ticket 到最终结果的前置时间。

对吧?你看那些 AI native 公司,它们的设计不像 LLM 时代的工程组织架构。它们往往只需要构建者本身,对吧?而且要尽可能贴近客户、贴近交付能力。中间未必有一个庞大的团队杵在那里。我觉得这很令人兴奋,就是说在这种组织里,单个 IC 就能更直接地触达这些。所以我会看从价值被识别出来到最终交付之间,有多少人参与其中。你希望参与的人更少,端到端的时间更短。

Swyx好。那你在面试一个人的时候,有什么办法能评估这一点吗?

最压缩的版本。

Eiso Kant我觉得这个问题最常见的答案是 agency。

一个人有多大的 agency?我觉得在 AI 能力越来越强的时代,agency 可能成为一个人最重要的品质之一。而且我认为 agency 是可以通过一个人过去做过什么来考察的,因为如果你有 agency,你就会表现出来,对吧?没有人仅仅拥有 agency 却坐在那儿不去运用它。它的全部定义就在于被践行。所以要去了解,这个人在生活中、在职业项目里、在个人项目里,做过哪些体现 agency 的事——而且你的个人经历就展现了极其惊人的 agency。

我觉得说到底就是这样。过去一年半左右,硅谷所谓的那句话就是:你可以直接去做事,对吧?

这——我觉得这就是你要找的东西。

Swyx我觉得要让高能动性的人步调一致非常困难,因为他们都想按自己的方式做事。这本来就是高能动性的核心,对吧?

Eiso Kant对——是的,但我认为,一个好的领导者,在一个组织里,应该能够把大家凝聚到一个共同的成果周围。我觉得对于任何高能动性的人,你想要做的是——我很幸运,我的团队里全是自主性极强的人。我是说,模型不是我一个人搭出来的,这一点我再怎么强调都不为过。是团队完成了这件事,而这个团队的能动性非常强。所以如果你要问,把这样的人凝聚起来需要什么,归根结底是一个共同目标和一套共同的边界。因为如果你放任自流,说“你什么都能做”,你就变成了一种探索算法。

这就是我们在大型科技公司里看到的情况,对吧?在那些公司的研究部门里,一切都是探索算法。只要……谁都可以做任何事,然后事情就变成了搞政治、抢资源。所以当你说,“这是我们的共同目标,这些是我们设定的边界”,对吧?“我们不做 multimodal,我们聚焦 RL。”类似这样的事,而且在别人加入公司之前就摊牌,你就能获得很强的能动性。你可以在自己想跑的地方跑,但这些是我们……

这并非……——这就是跑道

这就说得通了。我觉得这能最大程度地激发人的潜力,因为创新源于约束。

与外面其他一些公司相比,我们用的 compute 和资金都相对较少。最近我回头想了很多,觉得这反而是件好事。因为这些约束迫使我们在某些其他维度上变得比其他人更强,对吧?我们购买的外部数据也相对很少。

Swyx我正想问这个。对。

Eiso Kant没错,就是这样。那是一个约束,但正是这个约束推动我们在其他领域去改进。而且类似的情况还有很多。所以我觉得,对于高能动性的人,你要去赋能,要让他们对自己做的事充满激情,但也要说清楚:“嘿,如果你加入这个使命,这是我要你达成的结果。但这些方向我们不碰,如果你在意那些方向,也许你应该去别的地方。”

Swyx好的。最后发个号召,你们在招什么样的人?

Eiso Kant我们公司应用研究和工程方面的所有岗位都在招人。从……

Training 到 evals,再到 post-training 架构,全都在招。就是说,我们现在仍然处在一个个人可以产生巨大影响的时代。我觉得我们吸引大家加入的理由——我们聊了很多关于使命、关于我们怎么思考问题,但我认为我们的个人影响力比例是最高的地方之一,对吧?搭建这个模型的人不到 70 个。工程师和研究人员加在一起,不到 115 人完成了这项工作,而且这个定义已经非常宽泛了,因为我把自己也算进了这 115 人里。

所以,能够在一个你认同的使命下做这样的工作,而且每个人都能产生巨大的影响。我觉得……

Swyx而且还能发表论文,还能开放……

Eiso Kant是的,这些都是其中的一部分。但我觉得归根结底,今天如果你可以选择加入一家非常大的基础模型公司,但你只是众多人中的一个。

这当然不是他们的错,只是从定义上讲,分母变得太大了。而我们的分母相当小,所以你能发挥的影响力水平就非常高。我觉得归根结底,我认识的最了不起的高能动性的人,他们在优化什么?他们在优化影响力。他们在优化影响力,以及我是否认同这个使命。如果今天你在听完之后认同这个使命,同时你也在追求影响力,那我觉得我们真的是一个非常适合加入的地方。

Swyx那我们就到此为止吧。这段话太精彩了。你只睡了四个小时,表现还这么棒。

所以,这期播客评估,绝对通过。

Eiso Kant谢谢。我简直要把这句话记下来了。我的眼睛已经快要睁不开了,就像这样。我心想,“唉。”

Swyx我们放你去休息。你快回去吧。

Eiso Kant很高兴见到你们。

Swyx谢谢你安排这次访谈。我们很想做成这期内容,因为我们觉得这是一个很棒的模型。

也是一个很棒的故事。谢谢。