Sam Altman 与 Sora 负责人 Bill Peebles 谈 Sora、社交媒体与 AI 的未来
Sam Altman on Sora, Social Media, The Future of AI, and More

这就像是视频领域的 GPT3.5 时刻。我们知道如何打造出相当于 GPT4 的视频模型,并且我们会逐步做到这一点。
这几乎可以成为一个小小的平行现实,对吧?
Sam,Bill,你们好吗?
最近怎么样?
嘿,大家好。
很高兴见到你们。
恭喜你们取得的所有进展。我个人非常喜欢 Sora,也很享受制作视频的过程。昨天制作那条合作帖子的过程非常有趣,我想问问……
还有你们的 cameo 功能。John 设置成如果有人用他的 cameo,他就会以健美运动员的形象出现,所以你们也体验到了……
这带来了一些混乱又有趣的结果。你们有没有特别喜欢的 Sora 帖子,是会反复去看的,或者让你觉得特别有创意的用法?
我肯定会反复看所有关于我偷 GPU 或者为了拿到 GPU 做其他疯狂事情的视频,这些都很好笑。在过去几天里,至少在我的信息流中,出现了一些非常美丽的奇幻场景,这些东西如果没有 Sora 就不可能存在,或者会很难制作。看着大家创作这些内容,看着各种趋势流转起来,真是太棒了。
那你呢 Bill?到目前为止有什么特别喜欢的 Sora 用法吗?
天啊。Mark Cuban 前几天入驻了平台,出现了一些非常搞笑的 Shark Tank 梗图,那些可能是我最喜欢的。他还推销了一些 Sora 功能,同时利用提示词功能总是植入 Cost Plus Drugs 的广告,我觉得这特别搞笑,因为他一直是对 AI 中投放广告反对声音最大的人之一。他把这个功能利用到了极致。
是啊。
是啊。我认为我们会看到各种奇怪的新动态涌现出来,这在以前的视频形式中是不可能的。这段时期很有趣,因为每隔几天就会有完全不同的新东西出现。天哪,我看到 Polymarket 的盘口在我眼前闪过,我真的很想对这些东西说点什么。
是啊是啊是啊。需要说明的是,不用担心那个盘口。我觉得我们不会把那些预测市场放到滚动的行情里,但是……
是的。
是啊,这就是我们身处的新世界。
是啊,你可以在 TBPN 上实时影响市场,但我敢肯定,今天大家要么开心要么失望,因为我们当然是来聊 Sora 的。所以,不会涉及其他话题。
但我还想聊聊广告。为什么 Sora 在上线第一天没有广告?我觉得你在 Andreessen Horowitz 的播客上,已经就如何在 stratey 上思考广告阐述了一个非常好的思维模型,我已经被说服了。这是技术问题吗?你们需要规模吗?还是需要再考虑考虑?为什么第一天没有广告?
这就像一个才发布 10 天的产品,对吧?能让任何东西正常运行都已经很难了。而且我们并不假设自己一定会成功。我们必须去赢得成功,然后才能考虑变现。不过到目前为止,一切进展顺利。现在仍然非常早期,要做出让很多人喜爱的产品,还有很多工作要做。首先,
那模型有哪些令人惊喜的能力呢?你提到看到了一些奇幻场景。我想知道你注意到 Sora 在哪些具体方面有突破性表现,特别擅长什么。我注意到其中一个亮点是反射效果很棒。显然,大家很喜欢 cameo 功能,但就技术层面而言,模型现在能做到以前做不到的事,哪些让你感到惊讶?
这个模型在 physics IQ 方面是一个巨大的飞跃。基本上,过去所有的视频生成模型都很难处理涉及后空翻、体操动作之类的提示词。这真的是当今唯一能够可靠处理这类极其复杂动态效果的模型。到目前为止,用户在应用中最喜欢的功能之一就是模型的 steerability。如果你给它一个非常简单的文本提示,甚至只有几个单词,这个模型也很擅长讲述一个有开头、中间和结尾的连贯故事,而且是自动完成的,不需要用户进行太多直接引导。如果你想在提示词如何展开、故事如何发展的细节上深入挖掘,它也能支持。所以,无论你处于创作过程的哪个阶段,它都能满足你。但归根结底,这个模型的可操控性极强,而且 physics IQ 大幅提高,这让它能够做出几个月前还不可能实现的东西。
这些都是模型内部完成的吗?还是说有某种推理步骤,比如你在扩展或拆解我的提示词,写出一个更长的提示词,或者以某种方式分解问题?你能分享些什么吗?
这是个好问题。这些 text conditional video models 的智能既存在于核心模型本身(比如 Sora)之中,也有相当一部分来自文本提示词。所以,无论用户决定如何启动一个提示词,后台都可以有一个语言模型来补充一些细节。但比如说,当涉及到后空翻这类动作,或者任何物理交互——比如折射如何建模,或者往杯子里倒水时——所有这些细节都必须由核心视频模型本身来捕捉。这种智能是 Sora 与生俱来的,当然你也可以用语言模型的智能来辅助,但这不一定是获得惊人结果的先决条件。
在物理效果方面,你有没有觉得模型在哪些地方还有欠缺、想要改进的?我的意思是,我们经历过六指头的时代。反射和水似乎已经被解决了,但有人说门很难处理,我个人还没注意到这一点,但很多内容已经很棒了。你注意到哪些方面是下一个版本会做得更好的?
现在仍然非常早期。Bill 说的一点我很认同,这就是视频领域的 GPT 3.5 时刻。
我同意。
如果你回头去用真正的 GPT3.5,你会觉得,好吧,它展现了巨大的潜力,偶尔能做出令人印象深刻的东西。但直到 GPT4,这些文本模型才真正开始为人们提供实际价值。我们知道如何打造出相当于 GPT4 的视频模型,而且我们会做到这一点。到时候,目前这些恼人的问题——比如门,或者偶尔有东西穿过了不该穿过的物体——都会得到解决。就像当初全世界都曾短暂地抱怨过 3.5 哪里不行,说它永远不会有用,永远做不到这个,永远做不到那个。然后我们就不断地把它做得越来越好。这个模型的 physics IQ 无疑是我见过最高的,但跟未来版本相比,它还远没有达到最好的水平。
我希望我们会看到类似 GPT 文本模型所经历的情况:人们总会要求更多、更好的东西,总会发现更新更好的用途,而世界也将制作出越来越精彩的视频。
多快……哦,抱歉。
就视频而言,我们目前还处于早期阶段。
是的。
嗯,就像 GPT-1 对于这种模态来说实际上就是 Sora 第一代,而我们在过去 18 个月里取得的进步,达到了这个 3.5 时刻,对吧?与语言领域从 GPT-1 发展到 3.5 所花费的时间相比,这真的很短。所以我们真的期待进展在不久的将来继续突飞猛进。
你们预计 Cameo 功能多快会被复制?这感觉像是同样重要的一部分——你知道,模型实现了飞跃,但产品本身、体验以及创作这些素材的体验是极具创新性的。我们看到 Stories 被复制了,我们看到算法短视频信息流被复制了。我预计很多其他平台会关注这项功能,并意识到这可能就是未来。你们当然相信这可能很重要。那么多快……
其实我们完全接受这样一个世界:我们做产品创新,其他人复制。而且我不认为这对他们来说有他们想象的那么有效。就像,你知道,很多人试图复制 ChatGPT,你可以去看看我们竞争对手的应用,他们甚至复制了我们的错误,甚至复制了我们真心希望当初没有做的设计决策。也许这对他们效果不错吧,我想我还挺希望如此,但这对我们来说没什么问题。
我认为关键并不在于某一项创新,而是能够一次又一次地持续推出新东西,并且率先想出这些点子,把它们整合成一个协调的产品组合。你知道,这正是我们想要擅长的。如果其他人想复制那些行之有效的东西,我们有时也会复制行之有效的东西,这没问题。但最重要的是,我们希望能够驱动创新。我认为 Bill 和他的团队在弄清人们实际上想如何使用这些视频模型、模型真正需要做什么方面做了令人难以置信的工作。他们真的将其视为一个 full-stack 问题,从如何训练视频模型到如何让用户获得愉悦的体验。但 Cameo 只是他们从当下到最终希望打造的产品这一旅程中的众多想法之一。所以,如果人们从我们这里获得一些灵感,一路上复制我们,我相信他们会的。这没关系。
你怎么看待那种流行的说法——“我们想要 AI 检测,我想要 AI 内容被标记”?这是一种 stated preference 而非 revealed preference 吗?因为就我个人而言,我不想要劣质的 AI 内容,但我也不想要劣质的人类创作内容。我想要两者都很棒。而且当有人想出天才的创意并用视频模型将其实现时,我完全接受。你怎么看?
我认为真正重要的是你不想要垃圾内容。你想要优质内容。对不同的人而言,一个人的垃圾确实是另一个人的宝贝。但你真正在乎的是好的、原创的、有深度的、新颖的、有用的,诸如此类的内容。无论这是完全由人类生成的,完全由 AI 生成的,还是我认为未来大多数情况下会发生的——由工具辅助、人类主导的生成方式。嗯,如果内容足够好,我觉得你并不那么在乎其来源。其实有很多从技术上讲是由人类写作、绘画或拍摄的东西,却完全是衍生的,比 AI 生成的内容缺乏原创性得多。
我认为这才是人们长期真正会关心的。你就是想要好内容。嗯,不过我也确实希望其中有一些人与人的连接。比如当我读一本好书时,我想做的第一件事就是去了解写这本书的作者,以及什么样的人生经历融入了其中。我认为这不会消失。但如果他们使用 AI 作为工具来帮助自己把写作变得更好,那我完全支持。这听起来很棒。同样,我宁愿看一个我认识的人的视频,也不愿看某个随机 AI 生成的角色,这也是我认为提供这项功能很酷的部分原因。
团队所做的一个我认为非常棒的设计决策是,信息流是纯 AI 内容,而非 AI 加上传视频的混合体。实际上我一开始在推动他们往另一个方向走,但后来我觉得他们完全正确,我感谢了他们并放弃了自己的想法。这是一个微妙但极其重要的设计决策,影响着人们与这个产品的关系。
是的。这对我来说是一种非常奇妙的体验。我当时在想我要发一篇合作帖子来宣布这次访谈,我最初的想法是,我得想个脚本,或者我得想好我要说什么,或者我应该录一段这个然后再用。但结果却是,不,我只需要输入 prompt,然后就能得到一段面对镜头的视频,这太不可思议了。你们在看哪些指标?当 Sora 从它刚发布时的样子——一个创意工具——转变为更像一个消费平台、传统的社交媒体平台时,你们在推动什么?因为显然你们正在用这个工具为网络播下种子,但把它变成一个让人们每天花数小时纯粹消费内容而非创作内容的东西,肯定要困难得多。
你知道,我们真的很想从头开始就把这个产品设计成以创作为中心。我们在这里专注优化的很多指标,实际上都是为了确保尽可能多的人能够真正亲手使用 Sora 模型本身,能够与朋友一起、也能够面向全世界创作内容。到目前为止,这次发布让我们非常自豪的一个指标是,70% 的用户实际上在创作内容,即使在今天,也就是发布一周半之后。这比任何其他社交媒体平台都要高得多。
而且我认为这恰恰说明了,有了合适的工具,创作可以有多么有趣。对吧?你看看那些传统的平台,从退出信息流进入某种创意心流状态之间存在着巨大的摩擦,对吧?你得放下手机,得去找个摄像机,开始录自己,找朋友,跳个舞之类的。这就是很多工作,对吧?但在 Sora 上,你只需要拿起手机,在信息流里找到任何你喜欢的视频,重新混剪它,或者用 Cameo 功能让你的朋友们出镜。我认为有一个洞察我们一开始并不明显,但现在我们已经清楚地看到了这款产品正在形成的行为模式——那就是,有很多这样的人,他们可能并不一定想成为网红之类的东西,也不一定想在社交媒体上拥有很大的存在感,但事实是,他们所有的朋友都能随意使用他们的 Cameo,对吧?
把他们放到各种疯狂的场景里,这其实以一种以前门槛很高的方式让他们进入了这个场域。所以,你知道,我们现在每周活跃用户已接近 200 万。让我们非常兴奋的是,这么大一比例的用户群直到今天仍在用 Sora 创作,而我们将继续朝这个方向推进,确保未来人们拥有更强大的工具。
是的。所以 70% 的 Sora 用户在创作内容。人们通常会随口引用的典型基准大概是 1% 创作、99% 消费之类的。
这确实很像我在 Instagram 上的体验。我偶尔发一张照片,但大多数时候只是刷信息流。我想知道,你觉得这个 1% 在 Sora 上会高很多吗?从实际使用时长来看,写 prompt 的时间对比刷信息流的时间。如果你有数据的话,那会非常有趣。另外,这是否意味着它更像电子游戏的竞争对手,而非传统社交媒体?因为这是一种需要 lean forward 的体验,而不是只需要 lay back 的体验。你怎么看?
是的,这是个好问题。我们还需要更深入地研究,平台上创作与消费习惯究竟如何随时间变化。现在还处于非常早期的阶段。不过我确实同意你的观点,我认为随着时间的推移,这会变得越来越有沉浸感,有点像电子游戏那样。你在使用平台时拥有更多 agency,而不是像每天花好几个小时那样漫无目的地刷信息流。对这个产品有一种解读我觉得挺有意思的,尤其是从研究角度来看:Cameo 在某种意义上是最简单的方式,让你可以把自己注入到模型中。所以目前这是一个带宽非常低的通信渠道,你知道,你只需要给应用提供几秒钟的视频片段,任何一个特定个人的,输入到应用里。
但随着时间推移,你可以想象这些模型会越来越了解你的生活。它们会真正深入理解你的朋友,理解你想以何种方式呈现在世界上,久而久之这几乎会变成一个小小的 alternate reality,对吧?所以你不仅仅是在生成自己和朋友的视频,而是你实际上拥有 digital copies,在 Sora 平台的模型中运行,与其他人进行有 agency 地互动。因此我认为,随着时间的推移,我们会看到这个平台从某种程度上今天还觉得熟悉的东西,演变成未来真正依托 Sora 2 完整智能的东西,并真正利用我们内部正在开发的所有 world simulation 能力。
是的,我想补充一点:如果你把在电脑前能获得的娱乐看作一个光谱,一端是看一部两个半小时的电影,你按下播放键,然后 lay back,什么都不做。另一端是非常激烈的视频游戏,你大汗淋漓、心跳加速,超级活跃。AI 会把事情推向这两者之间的状态。所以,也许你仍然在看那部电影,但现在你可以在观影过程中说几次话,它会改变电影的剧情走向。或者在 Sora 上,你看到了一种惊人的新现象:大多数用户都在进行创作,而在传统世界里只有 1% 的人会这么做。所以,是的,你就像在刷视频流,但你做得更多了一点。至少对我来说,这真的改变了整个过程的乐趣以及我的感受。然后也许你会像 Bill 说的那样,在 Sora feed 中更加积极地参与。我认为你会看到那个 continuum 模糊很多。
Sam,你看过 Ber Snatch 吗?你看过这部 Netflix 的作品吗?它就像 Netflix 的“自选冒险”互动剧,点子很酷,但最终没能火起来,没变成人们会反复观看的东西。我在想是不是因为定制程度不够,还是人们只想坐下来看导演想表达的东西。我不知道。总之,
我没听说过,但听起来挺酷的。
是的。Sam,你是怎么考虑的?如何在 Sora 和公司其他业务之间分配 compute?我猜 Bill 每隔一小时就在你耳边唠叨。但你是怎么想的?
你知道,我真正的答案是,我已经彻底改变了我每天花时间的重点,转而去获取更多 compute,而不是不得不去做 compute 分配的决定。
我仍然需要做一些短期的 compute 分配决定。但我希望我们正在走向一个世界,在那里
我反而要告诉人们,你得想办法用掉更多 compute,而且
我们会非常激进。感觉你在供应链方面把很多事情都纳入了自己的控制范围内。现在还有什么不在你的控制之中?
我的意思是,大部分都不在。嗯,
但我觉得你在整个技术栈上下游都有很棒的合作伙伴,在链条的不同环节都有多个合作伙伴。比如当我想到 scaling up Sora 时,我觉得跟你对赌太疯狂了。你总能拿到芯片。你不会
GP,试图购买比如明年交付的 10 gawatt hour 电力。这可不是那么容易的。
嗯,挺有意思的。
跟好莱坞那边的对话进展如何?
哦,是的。
哦,其实,
是的,你来说。
是的。我想说的是,实际上上周我们一直在和好莱坞一些非常有名的人士交流。我认为人们对这件事的第一反应是
非常可以理解地会包含很多忧虑和焦虑。不过当我们能和这些人坐在一个房间里,真正解释我们在构建什么时,我实际上对好莱坞人士对此的兴奋程度感到相当惊讶。你知道,我们最近和一位演员聊过,她提到大概一年前在 Twitter 上看到用某个 open-source 模型生成的她的 deep fake,里面确实有很多 nasty 内容。而当我们真正向她详细介绍我们所有的安全缓解措施时,对吧?我们如何确保拥有非常明确界定的 model spec,来规定我们在平台上允许的行为。
以及我们如何真正致力于让人们对 likeness 拥有完全的控制权,对吧?比任何其他平台都更彻底。比如你必须通过 Cameo 流程进来。你不能只是上传一张自己的照片,然后随便生成任何人的视频。你必须通过 Cameo 进来。我想她明白了,我们确实在设定正确的标准,在好莱坞这里确保人们对自己的 likeness 拥有完全的控制权。我想这就是很多焦虑的来源,对吧?就是那种觉得随便什么人都可以拿你的视频或照片,想怎么用就怎么用,制造出各种超出你视野的糟糕内容的感觉。
但我们真的从一开始就在设计 Sora,让用户端到端地完全控制自己的 likeness,从你登录应用的那一刻起,到需要 Cameo 权限才能访问你任何朋友的生成内容。所以我认为我们需要更多地与好莱坞接触,我们也会继续这样做,但一旦我们真正讲清楚 Sora 的故事,你知道,他们是非常愿意接受的。
你认为是否存在这样一个世界
要补充一点吗?你知道,团队在发布前问我,能不能把我的 cameo 放到他们的 open access 里,我当然想了一秒,然后说是的,绝对可以。结果第一天就有好多好莱坞明星给我发消息说,
我简直是疯了。这太疯狂了。
Sam这大概是我见过的最蠢的东西。但到第三天左右,他们就觉得:嗯,这还挺聪明的。你获得了大量免费曝光。也许我们也该这么做。我觉得现在你已经看到真正的名人在说“好吧,我也要做这个”。而且我预计会有更多人加入。其他类型的 IP 角色也是如此。我完全能想象,在一年、六个月甚至更短的时间内,我们的问题将不是人们不希望自己的 cameo 或角色出现,而是他们认为我们让他们的角色或 cameo 出现得还不够频繁。
是的,这最终可能会成为粉丝互动的一件大事。也许老一辈明星不想这么做,但网红明星们都会做。我不知道结果会如何,但我打赌这会是一种相当深刻的新型连接。
是啊,这对 DiCaprio 的表情包来说似乎挺有益的。当你展示那个香槟表情包或他指着电视的表情包时,他并没有直接靠这些变现,但你知道,这在某种程度上为他增添了光环。
我们的一个朋友昨天发了些东西。这位是 Jeremy Gon。他说:“我们对 slop 如此愤怒,原因很简单——显然在两到三年后,我们都会爱上消费这些内容。它不会长期停留在 slop 阶段。” Sam,你同意吗?
我是说,对某些人来说,其中一些内容始终会是 slop,而另一些则不会。我记得在 GPT 早期就有过类似的反应,当时人们说:“我不敢相信有人会读这个。完全是垃圾,充满了幻觉。对任何人都没用。”后来它对某些人变得更有用了,但他们又说:“我不敢相信有人会觉得这东西能写出优美的句子。太荒谬了。”然后到了 GPT-5,你听到有作者说:“哇,这是个有用的工具。它有时能写出优美的句子。”
是的。
嗯,我觉得它会遵循类似的轨迹。
你怎么看这件事——至少我感觉,也不知道他们是否真的能做到——但人们觉得仍然能识别出 GPT-5 写的文字,你知道,不是这个,是那个,M dash,类似这种。你觉得三年后我们在 Sora 5 中还会看到这些痕迹吗?人们会说“哦,懂的人自然懂,你能看出来,但大多数人看不出来”。
是啊。这就好比视频界的 M dash 是什么,因为我觉得应该不是六根手指。
不,不,绝对不是。那是 typo,现在已经不会发生了。
Bill是啊,我觉得现在视频界的 M dash 大概是 Sora 里那种略微不自然的说话模式,它喜欢非常快速地说很多词。你知道,这些生成内容确实带有一种风格。
嗯,我觉得类比 GPT,我们确实希望给用户充分的控制权,让他们能精确控制视频在平台上的呈现方式。比如如果你真的想要一种非常舒缓的体验,没有太多镜头切换,我们希望用户有能力生成那样的内容,而且我们会继续给人们提供更多选项。所以,你知道,Sora 肯定会有一些默认的行为和特性,但我们绝对希望帮助高级用户实现完全掌控。
问个题外话,Sora 这个名字是怎么来的?
这是个有趣的故事。最初的 Sora 发布于 2024 年 2 月,就是那篇最早的博客文章。是的,我们当时一直没想到名字。我觉得直到向世界公布模型的前两天,我们团队都没法就该叫什么名字达成一致。
你们至少有个代号什么的吗?怎么叫的?
我们就叫它 videogen。好吧。
然后在某个深更半夜,我开始往 ChatGPT 里输入一堆疯狂的想法,后来我们基本上把英语单词都用尽了,于是开始改用日语单词。哇。然后 Sora 出现了,我当时就想:“哇,这听起来真不错。它的意思是天空,你知道,引申为想象力,以及创造的一切可能性。”然后我们在最后时刻把 Sora 推了出去。是的。是啊,当时有点疯狂赶工。
好吧,说到日本的东西,Sam,你之前说你在找一辆 Acura NSX。那是一种情怀车。非常特别,它不是 Whimo。你觉得在这样一个时代,当每个人都在乘坐视频界的 Whimo——也就是 Sora 视频生成——时,什么样的内容或格式会依然受到喜爱?你觉得会是什么?
Sam首先,我买到了那辆 NSX,它完全符合我童年时的所有 hype。我是说,太不可思议了。那辆车太棒了。
嗯,我不知道。我觉得无论是不是 AI 生成的,总会有很多东西让人们仍然想要真实的东西。你想要那种与童年有情感连接的东西。
你知道,现在的孩子可能不会想要 NSX,但类似这样的酷车他们会想要。而且到了某个时刻,即使他们能拥有疯狂的 VR 体验,他们仍然会想要真实的东西,以及与它的情感连接和他们所拥有的一切。所以我觉得这方面会有巨大的需求。事实上,我觉得未来看起来会有更多这种东西,而不是更少。
你们多快想在 Sora 上建立经济体系?感觉会有很多方式可以激励创作者为 IP 持有者创作内容,也可以让个人仅仅通过肖像权就能被动变现。
Bill我是说,这对团队来说是头等大事。你知道,对名人、对各类权利持有者来说,这显然有着巨大的价值。我们认为 cameo 是一个很好的切入点,对吧?你可以想象,现在我们有真人 cameo。也许未来你可以为你的角色或品牌做 cameo。所以,我们团队现在正在积极推进,研究合适的变现模式来推出这个功能。但这对我们真的很重要,平台上的创作者应该得到回报,而且要有明确的财务激励,来奖励他们已经在做的出色工作。所以这是我们最优先考虑的事,未来几周会有更新。这是我们正在积极推进的事情。
Sam我会说这非常重要且很棒。不过我得说,我很想知道 Bill 过去几周平均睡了多少小时,但我打赌肯定不够。所以我们有很多事情要做。团队要在短时间内完成大量工作,这需要一点时间。
好吧,让我再给你加一件事,Sam。多年前,你做了 Looped,一个基于位置的产品。你有没有想过 AI 和基于位置的内容如何结合?比如在大多数社交应用上,你可以标记位置。这在当前的 Sora 应用里甚至说不通。但 AI 地图产品会是什么样的?我没怎么想过 AI 和位置,但我想过 AI 如何真正改变人们的社交体验。
我们还没有确定的答案,但有很多有趣的线索可以探索。我也经常回想起经营那家创业公司的日子。我的直觉是,有可能创造一种非常有趣的新型社交体验,把你和人们连接起来,帮助你找到人,由 AI 以一种有趣的方式作为中介。
但在这方面,我们还有很多探索工作要做。
这些天你给创业公司创始人的建议是什么?我记得在 GPT-3.5、GPT-4 那会儿,建议是不要创办一家假定模型会停滞不前的公司。在 Sora 时代,你又是怎么看待这个问题的?
这个建议确实非常棒。
确实如此。完全如预期那样发展了。有很多优秀的公司并不是那样建立起来的,但它们也做得很成功。但如果你只是想,哦,我有一个特殊的提示词能优化 GPT-4。那可就惨了。但现在,在视频和 Sora 的具体背景下,你又是怎么思考这个问题的?你们显然有 API。你们有 Dev Day。会有人基于这个进行开发。问题的形态有所不同吗?
完全不同。API 的反响简直好疯了。至少这是我见过的 API 中新模型收入增长最快的一次。也许有更快的,只是我不记得了,但……
恭喜。
那里的需求简直不可思议,人们用它做出了很棒的东西。Bill 和我自发布以来还没机会一对一交流,因为实在太忙了。我们晚点会聊。今天下午就会聊。但我想向他提议的一点是,鉴于大家对基于这些技术进行开发的热情如此之高,我们要做一件平时不常做的事:公布我们打算优先推进的产品路线图。因为我能想象到,随着我们发布的每一项新功能,都会出现一些以前根本不可能实现的、非常酷的新创业公司。
所以,当你们通过 API 发布 Sora 2 时,我有一个问题:如果 Sora 有潜力成为 Instagram 或 YouTube 规模的业务,为什么要把你们的部分优势释放给全世界,让他们可以将其整合到其他创意工具中,然后用这个模型生成没有水印、不在你们信息流里的内容,从而无法获得你们通过 Sora 所获得的那种反馈循环?
对于 ChatGPT,我们也在 API 中推出了很棒的模型,人们理论上可以在 ChatGPT 上与我们竞争,也确实有人尝试,但我们愿意这样做。我们不可能构建这项技术的每一个酷炫应用,我们希望全世界都能享受到这些。人们使用我们的 API 付费,我们也很高兴,但我们就是希望 AI 能在世界上蓬勃发展。我们也不会构建视频模型所有可能的伟大应用。我们会做一个,而且我觉得它非常棒。但人们还有很多其他关于业务和产品的主意想去实现,我们希望能赋能这些创意。
好的,最后一个问题回到汽车上。保时捷 911 有什么问题?
是的,你之前说时间线上一团糟。你说如果你身家——有人说——500 万,你会买一辆 911 吗?你说不会。你同意 PG 的看法。你这么说是什么意思?
嗯,可能那是个不太得体的玩笑。当时挺晚了,我脑子有点……随便发的。但我确实对昂贵汽车有种不幸的癖好。
是的。
当时的回应是:"你会花 25 万美元买辆车吗?"而我按字面意思理解了。
太绝了。
为这种字面理解敲一下锣。
不,不是没空理会 25 万美元的车。也不一定。
但我大概……那不是我最好的推文,你懂的。
不,我现在很喜欢那条推文。了解了背景之后,我们都很喜欢。恭喜你们俩取得的所有进展。非常感谢你们抽时间来到节目。真的很感谢——
也非常期待看到后续发展。谢谢。干杯。