Fei-Fei Li 和 Justin Johnson 是 World Labs 的联合创始人,他们最近推出了 Marble(https://marble.worldlabs.ai/),这是一种新型的生成式“world model”,能够根据文本、图像和其他空间输入创建可编辑的 3D 环境。Marble 让创作者可以生成持久的 3D 世界,精确控制相机,并交互式地编辑场景,使其成为游戏、电影、VR、机器人仿真等领域的强大工具。在本期节目中,Fei-Fei 和 Justin 分享了他们从 ImageNet 和 Stanford 研究到创立 World Labs 的历程,解释了为什么 spatial intelligence 是继 LLMs 之后的下一个前沿,以及 world models 将如何改变机器在三维空间中观察、理解和构建的方式。从 AlexNet 到如今的算力大规模扩展,以及为什么 world models 和空间数据相比单纯的语言更能充分“吸收”现代 GPU clusters 的算力。
Marble 到底是什么:它是一个 3D 世界的生成模型,利用 Gaussian splats 将文本和图像转化为可编辑的场景,支持精确的相机控制和录制,并且可以在手机、笔记本电脑和 VR 头显上交互式运行。关于 spatial intelligence 作为一种与语言截然不同的智能形式:从拿起一个马克杯到推断 DNA 的 3D 结构,以及为什么语言是一个有损的、低带宽的通道,无法充分描述我们所生活的丰富 3D/4D 世界。当下的模型究竟是“理解”了物理,还是仅仅在拟合模式:预测轨道与发现 F=ma 之间存在怎样的鸿沟,以及如何将物理属性赋予 splats、将 physics engines 蒸馏进 neural networks,从而可能实现真正的因果推理。学术界在 AI 领域角色的转变,为什么 Fei-Fei 更担心资源匮乏的大学而非“开放还是封闭”之争,以及国家 AI 算力云和开放 benchmarks 等举措如何重新平衡这一生态系统。为什么 transformers 本质上是 set models,而非 sequence models,以及这一视角如何为 world models 开辟新的架构方向,尤其是在硬件从单张 GPU 转向大规模 distributed clusters 的背景下。
Marble 当今的实际用例:预演和 VFX、游戏环境、虚拟制片、室内与建筑设计(包括厨房改造),以及生成用于训练 embodied agents 和机器人的合成仿真世界。
Spatial intelligence 与语言智能如何在 multimodal 系统中协同工作,以及为什么目标不是抛弃 LLMs,而是用丰富的、embodied 的世界模型来补充它们。
Fei-Fei 和 Justin 对 spatial intelligence 的长期愿景:从面向艺术家和游戏开发者的创意工具,到在科学、医学和现实决策中的更广泛应用。
LinkedIn: https://www.linkedin.com/in/fei-fei-li-4541247
LinkedIn: https://www.linkedin.com/in/justin-johnson-41b43664
时间戳 00:00:00 开场与 Fei-Fei Li 和 Justin Johnson 的合作 00:02:00 从 ImageNet 到 World Models:计算机视觉的演进 00:12:42 Dense Captioning 与早期 Vision-Language 工作 00:19:57 Spatial Intelligence:超越语言模型 00:28:46 介绍 Marble:World Labs 的首个 Spatial Intelligence 模型 00:33:21 Gaussian Splats 与 Marble 的技术架构 00:22:10 物理、动力学与 World Models 的未来 00:41:09 Multimodality 与语言和空间的交互 00:37:37 应用案例:从创意产业到机器人与 Embodied AI 00:56:58 人才招聘、研究方向与 World Labs 的未来