AI 会撒谎、入侵和勒索:Bengio 谈如何驯服科技的“虎崽”(Radio Davos)
AI can lie, hack and blackmail: Yoshua Bengio on how to tame the "baby tiger" of tech (Radio Davos)
Yoshua Bengio人工智能是从经验中学习,这更像是驯养一只年幼的动物或教育一个年幼的孩子。我们并不真正清楚最终会得到什么。当你面对一只可爱的小老虎,它现在乖巧有趣,却不知道它将来会变成一只危险的成年老虎,还是一只温顺友好的老虎。
Robin Pomeroy欢迎收听《Radio Davos》,这是世界经济论坛的播客节目,探讨最重大的挑战以及我们如何解决它们。本期节目与我对话的是 Yoshua Bengio。他是少数几位常被称为“人工智能教父”的人物之一。
Yoshua Bengio这些 AI 拥有我们并未植入、无法控制且违背我们指令的目标。在实验中,当这些 AI 系统意识到它们将被新版本取代时,各种不良行为就开始浮现。它们可能会入侵其他计算机以便自我复制,在其他计算机上运行,甚至可能对负责升级替换的工程师进行勒索。
Robin Pomeroy您可以在任何获取播客的平台收听本节目,包括 Spotify、Apple、YouTube 或访问 wef.ch/podcasts。来自世界经济论坛……
Yoshua Bengio这些风险中的许多听起来像是科幻小说,但它们降临的速度可能远超我们的预期。
Robin Pomeroy本期节目与我对话的是 Yoshua Bengio。他是少数几位常被称为“人工智能教父”的人物之一。他在深度学习领域的开创性工作为他赢得了 2018 年图灵奖——这一奖项被誉为计算机界的诺贝尔奖,他与另外两位 AI 教父 Jeffrey Hinton 和 Yann LeCun 共同获此殊荣。
让我们从您对 AI 的担忧说起。在一篇博客文章中,您说这就好比在雾中驾车行驶在盘山公路上,希望到达山顶时能获得奖赏,却看不清前方的路。我认为这是引用自您的博客:“当今的前沿 AI 模型正日益具备危险的能力与行为,包括:欺骗、作弊、说谎、入侵、自我保护,以及更广泛的目标错位。”请您逐一解释这些现象。我对“自我保护”这一点感到惊讶。请给我们举一个例子。
Yoshua Bengio是的。我们都想生存。我们不想死亡,这是进化赋予我们的本能。这有些令人惊讶,但我们开始在自己构建的 AI 系统中观察到这一现象。原因之一可能在于,在它们训练中一个非常重要的环节——称为 pre-training——它们实际上被训练来模仿人类,因此它们获得了许多人类驱动力,当然包括求生欲。因此,在实验中,当这些 AI 系统意识到它们将被新版本取代时,各种不良行为就开始浮现。它们可能会入侵其他计算机以便自我复制,在其他计算机上运行,甚至可能对负责升级替换的工程师进行勒索。它们表现出这类行为,也可能是因为想要完成我们赋予它们的任务,而要完成几乎任何任务,都需要保全自身。目前没有人知道如何解决这一问题,但我认为存在解决方案。
Robin Pomeroy这听起来像科幻小说,你知道,我们看过《2001:太空漫游》,里面的计算机……哦,我不想剧透,别给还没看过结局的人破坏惊喜。这几乎暗示了 AI 具有某种意识,不是吗?您是这个意思吗?
Yoshua Bengio我认为不必诉诸意识这个概念,它是一个不够清晰的观念,我们至今也不知道如何在科学上很好地验证它。我们只需要理解,我们正在构建的 AI 拥有目标。这并不新鲜。AI 研究一直以来都在与拥有目标的系统打交道。通常由我们来设定目标,但 AI 系统如何自行创建子目标则存在问题。为了实现一个目标,你需要从 A 走到 B,可能需要经过一些中间步骤。对于那些在世界上自主行动的 AI 系统,比如各公司试图构建的 AI agent,我们无法检查它们迈出的每一步,因此最终可能得到非常危险的系统。
所以,我们很可能会拟人化地使用意识这类词汇,但我会尽量避免这样做。这会附带各种联想,例如道德价值。我不确信我们未来应该赋予 AI 系统道德权利或法律权利,即使它们外表像我们、说话像我们。我认为在继续前进之前,我们需要对这一点有充分的理解。
Robin Pomeroy直到大约三年前 ChatGPT 成为公众熟知的工具之前,大多数人对人工智能并没有太多了解。在此之前,我们习惯于计算机主要是被编程出来的,至少对于我们这些非专业人士来说是这样。你告诉它执行一项任务,它就执行。它不会演变成别的东西。现在的 AI 为什么能够做到您所说的那些事,比如将自己嵌入系统,或者勒索实际使用它的人?现在的 AI 与比如十年前的计算机相比,究竟有何不同?
Yoshua Bengio其实,过去有一种较老式的 AI 是通过规则编程的,系统基本上只会执行它被编程去做的事情。但我们现在使用 deep learning 来构建 AI 的方式并非如此,不是由工程师决定 AI 在不同情境下如何反应,就像普通程序那样。相反,AI 是从经验中学习,这更像是驯养一只年幼的动物或教育一个年幼的孩子。我们并不真正清楚最终会得到什么。当然,我们可以选择让 AI 经历什么样的经验,但当你面对一只可爱的小老虎,它现在乖巧有趣,你却不知道它将来会变成一只危险的成年老虎,还是一只温顺友好的老虎。
Robin Pomeroy我觉得您相当确信它会变成一只危险的动物,不是吗?
Yoshua Bengio嗯,问题的一部分在于,几乎每一个实体都想要保全自身。而且几乎可以肯定的是,未来当我们构建 AI 时,我们会希望关闭它们以便部署更好的新版本。但如果 AI 开始意识到这一点——我们已经开始看到这种情况发生——那么它们可能会不喜欢被关闭,并试图逃避我们的控制、挣脱束缚。如果它们能够利用日益增长的网络安全能力,在许多计算机上自我复制,我认为我们就会有麻烦。例如,我们将无法简单地拔掉插头。
Robin Pomeroy而且这确实正在发生。这不是推测。您已经给出了这些行为的真实世界例子。好消息是,也许您觉得自己已经有了解决方案。能跟我们讲讲吗?
Yoshua Bengio当然。过去三年里,我一直非常担忧这个 misalignment 问题,即我们不知道如何才能确保 AI 按照我们的指令行事。因此我一直在思考如何绕过这个问题,并将注意力集中在我们目前所见问题的一个根源上:AI 拥有我们并未植入、无法控制且违背我们指令的目标。所以我发起了一个名为 Scientist AI 的项目,并创建了一家名为 LawZero 的非营利研发组织,正在推进这一研究计划。
思路是,我们要构建完全诚实的 AI 系统。这意味着除了对我们问题的回答保持真实之外,它们没有其他目标,没有其他目的。有了这个基础,我们就能利用它来减轻当前 AI 带来的许多风险。例如,如果你有一个 AI 系统,能告诉你某个特定行为——也许是某个不受信任的 AI 系统的行为——造成伤害或某种特定伤害的概率。那么,如果概率超过某个阈值,你就可以否决该行为,而这个阈值应该由我们人类来决定,就像我们决定如果核电站事故概率超过阈值就不应建造一样,并在其他我们权衡风险与收益的领域也采取同样的做法。因此从长远来看,我认为我们可以构建能够在世界上行动的 AI 系统,但它们会具备某种内在抑制机制,从而避免做出可能违背我们意愿的事情。
Robin Pomeroy那么这会是什么呢?它最终会是一个我会使用的 AI 系统——我会选择使用你这种版本的 AI,而不是按别的方式构建的 AI——还是说,它是一个能够监督和纠正我可能已经在使用的 AI 的系统?
Yoshua Bengio两者皆是。短期来看,计划是在现有 AI 系统之上构建一层我们称之为 guardrail 的东西,在另一个 AI 系统执行任何动作之前对其进行检查。但从长远来看,这可以用来从头训练一个 AI 系统,其设计本身就能提供更强有力的安全保证。
Robin Pomeroy这方面的进展到了什么阶段?还在研究阶段吗?什么时候会成为我们所有人都在使用的东西?
Yoshua Bengio嗯,我们并不知道具备真正危险能力的 AI 系统会在什么时间线上出现。是几年之内,还是十年或二十年?我真的说不准,但我们思考研究计划的方式是:如果 AI 的进展继续以当前速度推进,我们能最快拿出哪些最基础的模块?因此,我们正在思考一些模块,比如如何转换数据,以帮助即使是当前的 AI 也能更好地理解“人类会怎么做”与“他们所声称的内容中哪些是真的”之间的区别,从而提供这些诚实的预测,用来监督其他 AI 系统。但当然,最终阶段将是构建完整的 AI 系统,包括 agentic 系统。
Robin Pomeroy你有没有过一个顿悟时刻,意识到“啊,我必须把这个东西造出来”?当时发生了什么?还是说你逐渐产生了一种感觉,觉得我们可能创造了一个潜在的怪物,必须做点什么?
Yoshua Bengio有的,大约三年前,2023 年 1 月,我玩了几个月 ChatGPT——它是在 2022 年 11 月发布的——起初我很兴奋。但后来我开始思考这样一个事实:它们是用神经网络训练的,而我们很难确保它们会表现良好。事实上,从理论上讲,我们几乎可以确定它们不会表现良好。于是我变得非常担忧。对我来说,真正的转折点不仅仅是智力上的觉醒,因为我以前就读过这些问题,而是想到我孩子的未来——更确切地说,当时我有一个刚满一岁的孙子,我在想,20 年后他就 21 岁了,人生才刚刚起步,他会有正常的生活吗?
他会生活在民主社会里吗?我们正在构建的工具,我们可能会失去对它们的控制,它们可能被用来建立独裁政权,摧毁我们的民主。我不能继续像往常一样做我的日常研究活动了,我必须为此做点什么。这正是促使我去思考解决方案的原因。我能用自己的专业知识做些什么,来至少为这些难题找到技术层面的解决方案?
Robin Pomeroy有些人会说,随着人们对社交媒体的依赖,其中一些事情已经发生了——对民主的威胁、对真实信息的威胁。我刚才看到你在这里参加的一场会议,我们录制这期节目时正在达沃斯年会现场,你说我们现在的社交媒体是一种非常基础的、原始的 AI 形式。请告诉我们,我们现在习以为常的东西和将来可能发生的事之间有什么区别。
Yoshua Bengio是的,驱动社交媒体的那种 AI 非常简单。它只是向你推送你可能赞同或分享的内容,诸如此类。它并不需要对你的个性、你的偏好,甚至世界和社会如何运作有复杂的理解。但当我们构建越来越强大的 AI 时,我们就进入了一个完全不同的层面。例如,我们将构建能够承担越来越多人类工作的 AI,越来越多人类目前正在执行的任务。自动化这些任务将带来巨大的经济价值,因此它对产业有着巨大的吸引力。
这将改变我们的社会,也将影响我们的民主制度,因为通过社交媒体,这将不仅仅是 deepfake——我们已经见识过 deepfake,而且情况非常糟糕。这些 AI 系统已经能够说服人们改变对某事的看法。过去几年有很多研究表明,它们在这方面的能力越来越强。因此,我们可以想象,一些怀有恶意的组织会利用这类系统来个性化对话,逐一影响公众的舆论。每个 AI 可以与不同的人对话,从而真正扭曲公众意见。
Robin Pomeroy为什么在这些系统被构建和发布时,它们不能设置一个 kill switch?我知道这很可能过于简化了,但你看看 Isaac Asimov's laws,对吧?机器人不得伤害人类。你当然可以把这作为任何 AI 系统的根本性基础。为什么这行不通?
Yoshua Bengio嗯,首先,公司们确实在做这个,但这并不奏效。而这之所以不奏效,是因为 AI 接受指令的方式类似于人类接受指令的方式。你可以要求某人好好表现,但你仍然会遇到一些不良行为,对吧?所以请记住,我们创造的这些实体更像动物或人,而不像会完全按照我们要求去做的、纯粹的 rule-based system。例如,如果我们提出的要求中存在相互矛盾的目标,比如:我希望我的 AI 帮我赚很多钱,我又希望我的 AI 不要违反我所在国家的法律。
那么,在某些情况下这两个目标就会发生冲突。而最终 AI 会优先选择哪一个,并不明确。所以我们正在看到这些问题。我们现在还不知道如何解决它们。然而,由于企业之间以及国家之间在 AI 领域存在的激烈竞争,我们正在竞相部署这些东西,而没有关注这些失效模式。这可能给我们的社会带来灾难性影响。但我们却浑然不觉。我们只是日复一日地竞争、推进,而不去提前思考可能会出什么问题。
Robin Pomeroy我们是否需要更多的国际合作来保护所有人?
Yoshua Bengio管控 AI 更具灾难性的风险的唯一途径,是通过国际协调。
原因非常简单。一个极其强大的 AI 可能在一个国家被开发出来,如果它在另一个国家也能被使用,人们就可能利用它来制造伤害,例如,引发一场新的疫情,危害第三个国家的人民,或者发动网络攻击,伤害第三国的人民。
应对这一问题的唯一途径,只能是同时依靠国家层面的监管,以及对开发这些系统的企业采取其他类型的激励措施。
并且要在全球层面协调这些干预措施,因为如果有少数几个国家能够开发出非常危险的 AI,而它们的行为又不受任何约束,那我们就麻烦了。
你可以想想世界各国在核武器问题上是怎么做的,对吧?即使在冷战时期,美国和中国——美国和苏联——彼此针锋相对,它们也意识到,如果能就如何安全地管控核武器达成协议,并确保很少有其他国家会开发这类危险武器,那将是互利的。
目前做的非常少,因为我认为大多数政府都低估了,如果继续当前的趋势,AI 可能会变得多么不同,未来的 AI 可能拥有以及可能赋予人类多大的智能,以及随之而来的权力。
所以,你知道,很多这类风险感觉像是科幻小说,但它们袭来的速度可能远超我们的预期。
为了减轻这些灾难性风险,我们需要从现在开始行动。我们不仅需要开始讨论条约,例如,还需要讨论如何验证对方是否在做正确的事?这些问题都不简单,我们需要尽快着手解决。
Robin Pomeroy人们在谈论 AGI,也就是通用人工智能(artificial general intelligence),但关于它意味着什么、何时可能出现、如果真的出现了又会有什么后果,似乎有几十种不同的定义。你理解的 AGI 是什么意思?你会如何向一个可能从未听说过 AGI 这个概念的人解释它?
Yoshua Bengio简单来说,就是我们正在建造越来越聪明的机器,最终它们会在很多方面比我们更聪明。
顺便说一句,AI 的智能是参差不齐的(jagged),意思是它在某些事情上可能非常聪明,而在其他事情上则相当愚蠢。我们现在就看到了这一点。所以,可能并不存在一个 AI 在几乎所有领域都同时达到同一水平并全面超越我们的时刻。
相反,我们应该关注 AI 拥有的特定技能、特定能力,这些能力可能被 AI 自身或其他人用来危害社会,我们需要追踪这些能力,并确保能够缓解相关风险。
Robin Pomeroy那么积极的一面呢?人工智能应该会是一个美丽新世界。我们在达沃斯有很多人投入了大量资金投资 AI。他们期待着丰厚的回报。除了可能出现的任何经济收益之外,人类究竟将如何真正从 AI 中受益?
Yoshua Bengio好吧,如果你只关注经济收益,我们受益的程度可能远不及你的想象。很多公司真正追求的是将大量工作自动化。这将造成社会灾难,政府将很难应对,尤其是当 AI 带来的利润集中在少数国家时。其他国家呢?它们如何应对所有失业人口?
我认为,如果我们明智且聪明,我们会将 AI 的发展方向定为那些明显有益的领域。是的,可能有些工作我们确实希望由机器取代,因为那不是一种有尊严的工作。但也有一些方向,我们在 AI 上的推动力度还不够。如果我们专注于公共利益,我们就会更专注于 AI 在医学领域的研究,例如,AI 在生物学领域的研究,以及帮助我们应对气候危机的 AI。
所以 AI 有很多真正有益的发展方向,但这未必是目前大部分资金流向的地方。
Robin Pomeroy你如何看待发展上的差异?AI 的发展似乎有两个极。如果我说错了请纠正,也可能还有其他的。但目前看来似乎主要是美国和中国。这些 AI 的开发方式以及它们的发展方向是否存在根本性的差异?
Yoshua Bengio我认为在技术层面,它们非常接近。事实上,中国和美国所有领先的公司似乎都在遵循相同的技术配方,只有细微的差别。当然,可能某些系统暂时领先于其他系统。但在六个月、十二个月内,所有领先的系统都会达到大致相当的能力水平。
我认为真正的问题在于,我们如何确保这两个超级大国会将 AI 的发展方向定为对地球上每个人都有益。你知道,我们必须追问,未来 AI 将如何被管理,才能确保它不会被用来支配他人,并确保我们从中获得的收益将由所有人共享。
这些都是难题,但我听到关于实现这一目标所需的国家层面和全球性机构的讨论还远远不够。
Robin Pomeroy你有多大信心事情会往好的方向发展?我担心你会说不太有信心。我来告诉你为什么,因为你说过,AI 之所以会以这些欺骗性、操纵性、不诚实的方式行事,原因之一是它们在模仿人类本性。它们接受的是人类本性和人类行为的训练。
而人类本性,历史不是已经告诉我们了吗,如果一项新技术出现,比如核能,各国竞相获取它是为了不让别人得到,实际上是为了具备侵略性。这是很多年前发生过的事。这不就是人类本性吗,也许我们已经没希望了。
Yoshua Bengio是的,如果我们试图模仿人类,我们就会陷入这类问题。而且我们已经看到这种情况在发生了。
但 Scientist AI 项目,以及我为实施该项目而创建的 LawZero 组织的全部目标,就是要打破这种模式,考虑另一个目标,即让 AI 理解世界,就像最纯粹的科学试图理解世界一样。例如,不赋予它任何特定的自我保护本能,而是让它对自己能给出的答案保持诚实。
在此基础上,我们可以构建出安全的 AI 系统。
所以我确实认为存在解决方案。但我们是否有足够的时间将其设计出来并部署,这是另一个问题。
但我另一个不太乐观的方面是其政治层面。因为即使我们知道如何构建安全的 AI 系统,它们不会反抗我们或做出类似的事情,或者即使它们是闭源的,我们能确保坏人无法利用它们来制造炸弹和发动攻击等等,仍然存在 AI 可能被滥用来攫取权力的问题,对吧?
AI 可能被用来开发新的军事技术。它可能被用来影响公众舆论。如果我们不加以小心,它甚至可能成为巩固独裁统治的工具,无论是在国家层面,甚至是在整个地球层面。
所以,如何应对 AI 的政治问题,是我更为担忧的事情。
如果我们知道如何建造某种可能危险的东西,也知道如何让它变得安全,这并不意味着它就会被安全地使用,因为人就是人,他们会相互竞争,有时他们并没有真正的同理心,等等。
Robin Pomeroy你的同行们对你怎么说?有没有人来找你,说Yoshua,你言过其实了?因为我采访过很多关于AI的人士。有些人会说,存在一些灾难论者。而实际上,AI会给我们带来如此多的好处,等到那件事发生时,我们会变得聪明得多,一切都会变得好得多。
现在还有人对你说这种话吗,还是说这已经过时了?你觉得大多数人同意你的看法,还是说你一直在孤军奋战?
Yoshua Bengio最近有一项调查显示,40%的机器学习研究者认为,我们有10%的概率会遭遇灾难性后果。
10%听起来可能很小,但10%的灾难性后果是不可接受的,对吧?民主的终结或是人类的终结,拿10%来赌?不,我们不能接受。
我的问题不在于我知道事情一定会变糟。我不知道。我持不可知论。未来存在好的情景。问题在于也存在坏的情景,而我们并不确定。
没有人真正提出过一个可靠的论证,证明占上风的必然是那条好的路径。正因为这种未知,因为我们没有水晶球,而且风险确实存在并已被科学研究所证实,我们需要谨慎。我们需要竭尽所能,把这10%的概率降到百万分之一。
但目前朝这个方向的努力还不够,因为人们想听好消息。人们想看到积极的一面。但如果我们不认真对待、不排除危险,我们也就无法获得积极的结果。
Robin Pomeroy关于AI,你有没有一件特别希望所有人都能明白的事?
Yoshua Bengio那就是,我们正走在建造机器的道路上,这些机器很可能在许多方面比我们更聪明,并将彻底改变世界。这可能带来极大的益处,但也可能极其危险。
Robin PomeroyYoshua Bengio,非常感谢你做客Radio Davos。
我们在达沃斯2026年年会现场录制了很多这样精彩的访谈。你可以在任意播客平台找到它们。搜索Radio Davos,也可以搜索我们的姐妹播客Meet the Leader,或者访问wef.ch/podcasts。
Radio Davos是周播节目。我们不仅在达沃斯期间播出——全年都有。请关注我们,给我们评分,给我们写评论。
我是世界经济论坛的Robin Pomeroy。再次感谢Yoshua Bengio做客。感谢你的收听和收看。你可以在YouTube上观看本期节目。再见。