Chris Olah:没有本科学历如何进入顶级 AI 实验室工作
Chris Olah on working at top AI labs without an undergrad degree

由 Robert Wiblin 和 Keiran Harris 撰写 · 发表于 2021 年 8 月 11 日
本页面内容:简介1 精彩片段2 节目中讨论的文章、书籍及其他媒体3 文字实录3.1 Rob 的开场 [00:00:00]3.2 访谈开始 [00:00:57]3.3 为被诬告的朋友辩护 [00:04:24]3.4 Chris 为什么没有重返大学 [00:13:21]3.5 转向机器学习 [00:19:33]3.6 Chris 如何敲开机器学习的大门 [00:27:34]3.7 DeepDream [00:30:52]3.
8 组建专注于 circuits 的团队 [00:35:58]3.9 从 Chris 非传统职业道路中汲取的教训 [00:38:13]3.10 去读研或在最好的实验室工作是否重要?[00:46:01]3.11 作为研究者的成长策略 [00:50:17]3.12 Cold emails [00:55:25]3.13 研究即市场 [00:59:02]3.14 把复杂的事情解释得非常好 [01:02:26]3.
15 Distill [01:13:12]3.16 Micromarriages [01:19:28]3.
……当你获得第三方认可时,去做一些不寻常的事情其实要容易得多。……在我拿到 10 万美元去做我想做的事情后,我生活中的成年人们态度完全转变了,而这在此前他们是完全不支持的。
Chris Olah 拥有一段引人入胜且非同寻常的职业经历。大多数想要从事研究工作的人都觉得需要一张学位才能被认真对待。但 Chris 不仅没有博士学位,甚至连本科学位都没有。他从大学辍学,去帮一位面临虚假刑事指控的熟人辩护,之后便开始独立从事机器学习研究,最终在一家领先的 AI 研究团队 Google Brain 获得了实习机会。
在本期访谈中——作为我们此前关于他技术工作那一期节目的后续——我们探讨从他这段不同寻常的职业道路中,究竟能学到什么,还是说根本学不到什么。更多人是否应该跳过大学,直接投身去解决自己关心的问题?还是说,试图复制 Chris 这样一个独特的案例,对其他人而言会是鲁莽之举?
我们还谈到了 Chris 多年来的一些个人热情,包括他试图通过创办一本名为 Distill 的新学术期刊来减少他所谓的 "research debt";该期刊专注于以异常清晰的方式解释现有成果。
正如 Chris 所解释的,随着一个领域的发展,它会积累起庞大的知识体系,研究人员在开始作出自己的贡献之前,理应熟悉这些内容。但既有知识的沉重负担——以及跟上其他人进展的必要性——可能会变得令人难以承受。一个人可能要等到 30 多岁甚至更晚才能获得认可,而有时一个领域甚至会分裂为二,只为了让任何人都有可能掌握其全貌。
如果这是不可避免的,那倒也罢了,但 Chris 认为,我们在传播现有知识方面,远远没有达到本可以达到的水平。对某个技术概念的阐释进行渐进式改进,也许只花费一位作者数周时间,但如果它成为了最佳的可得资源,就可能为数千、数万乃至数十万名学生每人节省一天的时间。
尽管如此,学者们却很少有动力去产出关于复杂思想的出色阐释,而这些阐释本可以加快该领域每一位后辈的学习速度。有些人甚至将破解糟糕阐释的过程视为一种值得经历的成人礼,认为所有人都该像他们当年一样经历一遍。
因此 Chris 试着着手解决这个问题——但他后来得出的结论是,这个问题的本质与他最初所想的不太一样。在本次对话中,我们讨论了这一点,以及:
订阅我们的播客即可收听本期节目,我们聚焦世界上最紧迫的问题以及如何解决它们:在你的播客应用中搜索 "80,000 Hours"。或者阅读下方的文字实录。
制作人:Keiran Harris 音频母带处理:Ben Cordell 文字转录:Sofia Davis-Fogel
Chris Olah我申请了 Thiel Fellowship,这是一个为 20 岁以下的人提供经济支持、让他们去从事雄心勃勃的项目或做不寻常事情的项目,我拿到了。我当时想:"好吧,我有两个选择。一个是回到大学,另一个是在两年里做任何我想做的事。" 事实证明,这个决定并不难做。
从之前的经历中,我已经积累了很多逆势而为的经验。但我想在当时,我是这样看待这件事的——尤其是向别人解释时——嗯,我可以先做两年,之后仍然可以回到大学。这似乎是个绝佳的机会。另外还有一点很重要,那就是当你获得第三方认可时,去做不寻常的事情其实会容易得多。我觉得人们在听到 Thiel Fellowship 时会想,"啊,最有价值的地方在于他们提供了资金。" 这当然是其中一部分,但我认为实际上更有价值的是,我生活中的成年人们在我拿到 10 万美元去做我想做的事之后,态度就完全转变了,而这在此前他们是完全不支持的。我认为这在为一条非传统道路赋予合法性并使之变得更易走方面,也有着非常大的作用。
另请参见 Chris 关于人们是否应该上大学的那篇文章。
我收到很多邮件,人们问我他们是否应该去上大学。我想这可能是我被问到最多的问题。我认为几乎所有给我发邮件的人,都应该去上大学。我这么认为的原因是,如果你想从去做别的事情中获益,你必须具备很强的自律性、愿意努力去工作的意愿,以及在没有外部强制机制的情况下自我激励去努力工作的能力。我认为很多人往往并不具备这些,那么这种方式对他们来说就不太奏效。
另一方面,我觉得对于那些——也许再多给一些背景——我所看到的在 Thiel Fellowship 中真正表现出色的人,有些在 20 岁之前就已经完成了本科学位。所以有那样一些人。但我认为很多人是做过涉及软件或科学之类意义重大的个人项目。我觉得这其实是一个很好的检验标准。如果你能够出于自我激励,去完成你自己的大型个人项目——而且显然你处于有足够特权、能够养活自己的位置——那么你很可能能在 Thiel Fellowship 这样的项目中表现出色,或者休学一年、休学几年也不错。但如果你做不到,那就会困难得多。
我想我提炼出的最有用的东西,可能是关于技能的 Pareto frontier 的思考。例如,我早期对机器学习领域的很多贡献,基本上就是能够创作出对复杂概念非常有帮助的图示。要做到这一点我需要什么技能呢?嗯,我既需要理解机器学习,又需要会画画。我并不是特别出色的艺术家或科学插画师,我在机器学习方面的知识也不算特别渊博。但很有可能,在一段时间内,我是世界上在"机器学习"与"绘画"交叉领域最出色的人。如果你把这些不同技能想象成二维或三维的坐标图,再考虑到 Pareto frontier,社会往往很擅长培养那些被优化到极致的人,他们针对的是某一特定技能组合或一系列技能,也就是社会真正认可其价值的技能。
我们会搭建整套培养人才的机制。但我认为,如果你能发现某些非标准技能之间有用的交叉点,往往能产生巨大价值。这样更容易产生重大影响,而且在反事实层面也常常影响深远。当我与人谈论他们的职业发展时,我常会尝试这样来框定:他们正在培养哪些技能?我们认为这些技能对应的 Pareto frontier 是什么样的?是否存在这样的领域——与其把一项技能做到世界顶尖,不如掌握其他人所不具备的交叉技能,从而创造巨大价值?
Rob Wiblin是的,这很有意思。从理论上思考,我想部分原因就在于,你能把两种完全不同的东西组合起来的方式实在太多了。因此,可能的组合空间要大得多,你也有更多选择。这也意味着,如果你选的两样东西相距足够远,你可能是唯一一个同时对 X 和 Y 感兴趣的人。这样一来,你就拥有了一套真正独特的技能组合,而且你可能会偶然发现一些其他人甚至从未尝试去寻找的东西。
Chris Olah没错,而问题在于这个空间是指数级庞大的,你不仅得找到一个交叉点,而且这个交叉点必须有用。因此,在选择培养哪些技能时,你得具备一定的品味。但我认为这类机会有很多,而且这么做通常比去精通某个社会已经高度重视、人人都在优化的技能要远远没那么卷。
我觉得把成为一名优秀研究者拆解成两部分会很有助益。一是品味,即你挑选好问题、选择好的路径去攻克这些问题的能力,等等。第二部分你可以称之为技术,或执行力。想象一下化学家摆弄试管、移液管和各种古怪仪器,很明显,操作这些实验设备本身就有一套完整的技术。
我认为在其他领域这更隐晦一些,但确实存在某种东西——当然在机器学习领域,无论是训练模型的技术,还是仅仅做一名优秀的程序员,又或是在代码编辑器里进行非常精细的操作,抑或操控分布式系统,等等——我觉得问题在于如何同时培养这两类技能。而在品味方面,我认为这可能是最难培养的。我曾尝试列出一组可以做的练习。其中一个例子,我觉得可能也是最有用的,就是写下一份你认为可能很重要的问题清单,然后让另一个人,最好是你的导师,去给它们逐一打一到十分。
因为培养品味最难的一点在于,你学习经验教训的反馈循环非常慢,因为你必须完成整个项目。你要做的是把导师或其他人当作获取反馈的廉价代理,如果你不同意他们的反馈,你可以和他们讨论,或者你甚至可以去亲自做那个实验。我觉得这会很有效。我觉得还有很多其他方法。阅读科学史是有帮助的;尝试去写一写你为什么认为某些事情很重要,也是有帮助的。总之,我觉得那里有一系列练习可以做。然后,在技术层面,我认为最有价值的事情其实是与那些技术过硬的人紧密合作。
实际上,我认为至少在机器学习领域,乃至其他计算机科学学科中,与人结对编程都极具价值。我认为有很多东西很难通过其他形式传递,但在结对编程时却能自然传承。我觉得对于培养技术而言,结对编程往往杠杆率最高。
另请参见 Chris 关于培养研究品味的笔记。
我收到很多 cold email,其中 99% 都很糟糕。要么是“你能帮我做作业吗?”,要么是“你能回答这个基础问题吗?我自己 Google 一分钟就能找到答案。”我认为人们之所以觉得 cold emailing 没用,是因为如果你发的是这种邮件,对方会应接不暇,自然不会回复。或者,即便你写得比较泛泛……如果你发了一封措辞得体的邮件,说“我想进入机器学习领域,能和你通半小时电话聊聊怎么入门吗?”即便这样,你也不太可能收到回复。但我认为人们忽略的一点是,如果你认真写一封高质量的 cold email,要做到成为我那周收到的最好的一封,其实并不难。
而且我认为,如果你愿意花精力去了解某位研究者或某个团队正在做什么,你在邮件中具体提到他们的论文,并提出经过深思熟虑的问题,那么人们就会很重视。而且这样做……往往效果很好。我觉得人们在说 cold email 的时候,所指的东西其实天差地别;如果你愿意下功夫,如果你真的非常关心对方正在做的事情,并且确实花功夫去理解了,还能非常聪明地谈论它……这些是会传达出来的。这比别的理由更能说服对方与你交谈。
有很多人试图寻找如何进入机器学习领域,他们的做法是给很多人发邮件,或者给名人发邮件。我认为你真正应该做的是,弄清楚你最想和谁合作,并真正理解他们的工作。理想情况下,选一位可能没那么出名的人,然后给对方发一封你下了很大功夫的邮件,让对方清楚你读过他们的研究,并把对方的兴趣和你的联系起来,等等。有几封邮件对我来说非常重要,我花了一周时间去写它们。我认为这是完全值得的投资。我觉得这并不是人们通常看待 cold email 的方式。
大致的思路是,你把研究者看作是在对不同研究想法进行投资,如果某个研究想法成功了,而且别人没在他们之前抢占,那么他们或许就能获得某种回报。可能是更多的资源,或者只是在某种形式上获得收益。你可以看到,这里存在一场去抢占有前景的研究想法的竞争。我认为在这个市场上大致有两种策略。一种是去做那些大家都认同其重要性、也非常热门的事情。
当你这样做的时候,你其实是在让研究市场的这一小块区域变得稍微更高效一点。你在推动那些真正需要完成的重要想法,让它们更快地被完成。我认为这本身确实是一件有价值的事。如果你做的事确实很重要,而且你让它的预期完成时间提前了一周或一个月,那真的很棒。但另一种策略是,你可以尝试击败市场。你可以去做那些你明显看出被大多数人低估了的事情。这是我大部分时间都在尝试做的事。而你能击败市场的原因有很多。
可能只是因为你关心别人不在乎的东西。如果你关心安全,或者在别的领域关心动物福利,又或者你有更奇怪的目标、与多数人不同的目标,你或许就能以这种方式超越市场。不过我认为另一种方式是,如果你对某个问题有一些你坚信为真、但又不是普遍共识的洞见,那这可能会非常有帮助。这可以说是……我觉得我个人做的很多事就是这样。我认为,如果你愿意投入足够的精力去弄清楚到底在发生什么,你是能够真正理解神经网络的。这是一个很大的赌注,而大多数人并没有下这个赌注。
我认为在许多领域,要达到研究级别的理解就像登山一样。你必须先理解并积累所有这些概念,然后才能开展研究。
数学就是一个非常鲜明的例子,你可能要花很多年时间去攀登那些概念,才能达到可以做研究的水平,因为已有太多东西层层堆叠在上面。而当你到达山顶后,你又会往上堆更多的成果,让这座山变得更高。
我觉得很多人对此引以为豪,因为他们会觉得,啊,要经过这么漫长的朝圣之路才能达到做研究的水平,这说明它特别深刻,也体现了迄今为止所有已做的工作。但我认为,实际上这往往反映出我们在解释事物、构建良好的领域学习基础设施方面投入得还不够。我觉得这体现在很多方面。可能是讲解质量差,就是没有好的解释;有时候只是未经消化的概念——某个想法很重要,但它还没有被提炼成成熟的最终形态。我认为糟糕的符号系统或者糟糕的定义非常常见,它们让事情变得更复杂,而所有这些都让人更难理解这个主题。
我喜欢的一个类比是,在软件工程中,人们有时会提到技术债务:你为了快速推进到能发布某个功能的地步,过程中写了很多糟糕的代码,代码又乱又脏,变量名起得不好,也没有文档,然后其他人就很难在此基础上继续开发。我认为存在某种类似的东西——一种研究债务——在科学界是普遍存在的。
Rob Wiblin听众朋友们好,这里是 80,000 Hours 播客。在这里,我们会就世界上最紧迫的问题进行异常深入的对话,探讨你能做些什么来解决这些问题,以及让一个没有医学博士学位的人免费给你做手术是不是一笔划算的交易。我是 Rob Wiblin,80,000 Hours 的研究主管。
上星期的节目是 Chris Olah 有史以来第一次上播客,而今天我们放出的是他有史以来的第二期播客——因为我们要聊的内容实在太多,所以分两次录制、拆成两期节目更合理。
上星期那期聚焦 Chris 的技术工作,但这一期是关于他到目前为止的生活和经历。我们会聊到诸如此类的话题:
话不多说,有请 Chris Olah。
今天与我对话的是 Chris Olah。Chris 是一位机器学习研究者,目前专注于神经网络可解释性。直到去年十二月,他一直领导 OpenAI 的可解释性团队,但最近他和一些同事离开 OpenAI,去协助创办一家新的 AI 实验室,该实验室专注于大模型和安全。在加入 OpenAI 之前,他在 Google Brain 待了四年,开发用于可视化神经网络内部活动的工具。他在 Google Brain 影响力巨大,是 2015 年 DeepDream 文章发布时的第二作者。我觉得 DeepDream 生成的图像到了今天基本上人人都看过。
他还协助开创了 feature visualization、activation atlases、可解释性的 building blocks of interpretability、TensorFlow,甚至与人合著了那篇著名的论文 Concrete Problems in AI Safety。除此之外,2018 年他参与创办了学术期刊 Distill,该期刊致力于发表对技术概念清晰明了的阐释。
Chris 本人也是一位深受本节目许多听众喜爱的作者,他的博客试图以高度通俗易懂的方式解释最前沿的机器学习,吸引了数百万读者。他做成了这一切,却连学位都没有——因为他 2009 年就从大学辍学了,为的是替一位朋友辩护,对抗捏造的恐怖主义指控。2012 年,Chris 获得了 10 万美元的 Thiel Fellowship,这是一项旨在鼓励有天赋的年轻人直接进入研究或创业领域、而非上大学的奖学金。
这介绍太厉害了。感谢你来上播客,Chris。
Chris Olah谢谢你邀请我,Rob。这个介绍太抬举我了。我得说,我在 TensorFlow 中的贡献其实非常小。
Rob Wiblin好吧,但剩下的部分都属实。
Chris Olah这可是我有生以来第一次上播客。要是我被这种媒介吓到了,再也不做播客了,大家都知道该怪谁。
Rob Wiblin或者换个角度,如果一切顺利,我们就会拿到一条很棒的新闻,我还会得到一大堆新订阅者。这就是梦想。
好了,希望我们能聊聊你对 AI 可解释性的研究,以及你刚才提到的那些不寻常的人生经历。但首先,你目前在做什么工作,又为什么认为它很重要?
Chris Olah我觉得机器学习最疯狂的事情之一是,我们拥有所有这些能做出惊人行为的系统——它们能分类图像、翻译文本、写文章、识别你的声音、生成视频……然而我们却无法直接构建出这些系统。没有任何人知道如何直接写出一个能做这些事情的计算机程序。相反,我们造出了能做这些事的系统,却完全不知道这些系统内部在做什么。所以我一直觉得,那个让我痴迷的问题,也是在我看来机器学习中最为紧迫的问题,就是:这些系统到底是如何做到所有这些我们根本不知道该怎么做的疯狂事情的?我出于安全原因关心这个问题,而且说实话,我也仅仅是因为觉得这是世界上一件极其疯狂的事,而我就是想弄懂它。
Rob Wiblin是啊,这非常说得通。从你的履历来看,你研究这个问题似乎已经有大约八年的历程了。你一直在一点点地啃它,试图把神经网络从黑箱变成我们能够真正理解并在此基础上继续发展的东西。
Chris Olah是啊,过去八年里这不是我唯一做的事,但肯定是最重要的一件,而且我尝试过很多方向。早期尝试的很多东西效果都不太好,但随着时间推移,我觉得我们确实取得了很大进展。不只是我,还有很多其他人和我合作过的许多同事,都已经真正达到了一个阶段:我们可以非常深入地理解神经网络,甚至可以仅仅通过观察它们的权重,就从中读出整套算法——而这些算法对应的事情,我们以前其实并不真正知道该怎么做。看到这一切非常酷。
Rob Wiblin好吧,我们稍后再回到那些技术话题。现在来聊聊你最终走过的这条非常不寻常且曲折的职业道路。看看人们能否从中吸取什么教训,或者也许这条路太过怪异,根本不具备普遍性。显然,你现在从事机器学习研究非常专业,但不同寻常的是,你既没有博士学位,甚至连本科学位都没有。这到底是怎么发生的?
Chris Olah天哪,是这样的,我高中时深深投入了一个名为 HackLab 的社区技术空间。当时 G20 峰会在多伦多召开,我们的一位成员正在做安全研究,他会记录临时摄像头被安装的位置。警方觉得这非常可疑,于是突袭了他家,发现了他业余爱好性质的化学和电子实验室,便认定他在制造炸弹。参与突袭的一名警察曾在阿富汗服役,自以为能识别爆炸物,结果把化学药品误认成了爆炸物。
对他来说,这显然是非常糟糕的处境。我跟他不算太熟,只是通过 HackLab 略有了解,但我们很多人都团结起来支持他。我比其他人的余地更大,因为我是大学一年级学生。我觉得尽力支持他非常重要,所以每次他有保释听证会之类的事情,我就去法庭,试着做一些法庭支持类的事务,帮他和他的家人一点忙,记笔记之类。后来他被软禁了一年,第二年我休学了一年,以便能全程出席他的庭审。最终他被判所有罪名不成立,但这导致我最初从大学辍学了。
Rob Wiblin是的,我读过一些关于此事的内容,你个人网站上有 2008 年的记录。这是一个令人震惊且相当悲惨的故事。你一定——我想我也会是——感到无比愤怒和厌恶,以至于基本上从大学辍学了。听起来你花了大量时间跟进这个案子,尽你所能帮助他,确保这个人没有因为他绝对没做过的事而背上长期的恐怖主义监禁。
Chris Olah是啊,我不确定自己实际上帮了多大的忙。我想充其量我帮他省了一点钱,因为我去做了一些事,替他律师节省了些零星时间。我觉得我做过的最有影响力的事,是我把一场审讯做了文字记录并传到了 YouTube 上,这样他的律师就可以……有一个很好的功能,你可以点击文字记录中的某一行,视频就会跳转到对应的时间点。我想那可能是我做的影响力最大的一件事。但实际上,起初主要并不是愤怒。当然有很多愤怒,但我觉得首先涌上来的是恐惧。我为这个人感到害怕,为我自己害怕,也为我所有的朋友害怕,担心他们接下来会把我们都当成什么同谋之类的人来追究。
那真的是一段非常可怕的时期,我想也许最关键的是,当某些人系统性地疏远或抛弃一个人时,其他人团结起来尽力支持他,这似乎非常重要。或者说,这是我内心一种强烈的情感直觉。我想那可能就是我的主要动机。
Rob Wiblin是啊,我没怎么从这个角度想过。我想这在某种程度上其实需要勇气。勇气,或者说愚蠢。因为你如此积极地介入此事,作为一名被指控的恐怖分子的关联人,你很可能是在给自己画了一个靶子,让警察来找你麻烦,调查你,或者如果他们对你们的所作所为感到挫败,还可能试图报复。我猜你父母……也许他们支持你,也许他们只是对你冒的风险感到惊恐?
Chris Olah我生活中所有的成年人都对此非常、非常担忧,极力劝我不要这么做。但我觉得我面临的任何危险,仅凭既有的关联就已经存在了。只是那时候我对法律一无所知,也不知道该如何思考这类事情。总之就是觉得非常可怕。
Rob Wiblin是啊,听起来……你这么做完全是可以理解的,但听起来你觉得自己并没有起到那么大的作用。回想起来,你是否希望自己没有从大学辍学,或者没有做过这些事?还是说这是一个不可能假设的情境?因为那样你就会成为一个不同的人?
Chris Olah是啊,这很难想。我确实觉得这在某种意义上是利他的,但并不是特别有效。另一方面,也很难为此感到太难过。我想这个人可能感到更受支持了,他的父母可能也感到更受支持了,这确实让人感觉很好。而且我不确定在职业生涯的那个阶段,我的时间具有超高的杠杆效应。但是,是啊,我不知道,这很难想。这件事也让我走上了一条轨迹,让我做了很多不同的事情,而且或许在某些方面,正因为变得更为不同寻常,让我后来变得更有效率了。所以很难去评判。
Rob Wiblin是啊,当一个人被指控那样的罪行时,即使大家都知道那是诬告,人们还是会倾向于避而远之。这就意味着,必须有人甘愿承担代价,站出来与他产生关联,才能防止那个人彻底被毁掉,或者陷入完全没有社会支持、感到被完全抛弃的境地。这是一种艰难的处境。我想很难用有效利他主义的视角去审视这件事。但我非常钦佩,也理解你最终为什么会这么做。
也许我只是对警察不当行为的故事变得麻木了——我想我们不想在这里深入所有细节,因为这终究不是一期关于刑事司法的节目——但这一定对你的国家安全机构观留下了某种负面印象。你当时是怎么想的?从 18 岁到现在,你的看法又有了怎样的变化?
Chris Olah是的,这确实败坏了我对国家安全机构的印象。有很多非常糟糕的事情。他们一度威胁他的妻子,试图逼他认罪。庭审中有很多让我觉得检方极度不诚实的地方。我应该说明,作为试图提供支持的一方,我不认为自己始终是知识诚实的典范。但我觉得,如果你是一名试图把人送进监狱的检察官,却去提出不诚实的论点……我记得有一个例子,他们辩称他之所以拥有能燃烧出鲜艳颜色的化学品,是因为他计划制造一枚“彩虹炸弹”。在发现他并没有爆炸物之后,说法就变成了他拥有可用于制造爆炸物的化学品。
他们发现他拥有能燃烧出鲜艳颜色的化学品,于是就有了这种说法,称其可能是“彩虹炸弹”。我认为任何以诚实态度对待此事的人都不会提出这样的论点。我认为他们确实给这个人的生活造成了严重伤害,因此这极大地恶化了我对这些机构的看法。然而另一方面,随着时间推移,尤其是当我更多地去思考x-risk、生物问题甚至AI时,我逐渐也对国家安全类的担忧有了更多的理解。我不知道该怎么说,我最终的感受大概是,非常失望。因为我真的很希望能够信任这些机构,但它们显然在系统性地表现不佳。不过它们也确实在做一些重要的事情。
而且这也很可悲,哪怕从他们的角度来看也是如此。他们做这些事,简直是在到处消耗善意。我站在一个立场上时,会对其极其恶劣的伦理感到愤慨;而站在另一个立场上时,我又为这种无谓的浪费和善意的消耗感到难过。
Rob Wiblin是啊,在这个案子上耗费了这么多时间,而事情很快就明朗了——实际上根本没有什么可调查的。我知道国家安全部门里有很多了不起的人,其中一些人有着极高的正直品格和令人敬佩的职业道德。只不过国家安全和执法这个行业和其他行业一样,有人非常优秀,也有人一直在行为不端。这恰恰是一个如此重要、权力如此巨大的领域,因此当人们确实出现不当行为时,后果可能极其不公、极具伤害性。
Chris Olah而且这个领域太大了,我觉得想要设定很高的门槛、真正做到严格筛选可能也更难。我不知道,我不是专家,所以我不想过多发表意见。
Rob Wiblin嗯,警察是最大的就业群体之一,所以我想人数确实很多。要把门槛设得极高,以至于只有那些一生中展现出最高正直品格的人才能当警察,这可能确实很难,因为人数实在太多了。
那我们也许可以回到你当时的职业道路上来。你当时在上大学,但为了做这件事离开了。我想你的人生中那条自然的、平淡的轨道已经有点脱轨了。但之后你本来大概还是可以回去上大学的,只是你决定不回去了。为什么呢?
Chris Olah是的,在我做这类法庭支持工作的时候,有很多月份都很清闲,根本没什么事可做,所以我有很多空闲时间。有一段时间我对3D打印机很感兴趣,于是就很投入地研究3D打印机。一开始我在设计3D打印机,后来我和一个朋友一起做了一个初创项目,开发开源软件来设计用于3D打印的物体。那些所谓的CAD软件就是用来设计三维物体的,而我们试图创造开源工具,因为我觉得这非常重要。
我申请了Thiel Fellowship,这是一个为20岁以下的人提供资金支持、让他们去做有野心的项目或做不寻常事情的项目,然后我拿到了。我当时想,“好吧,我有两个选择。一个是回去上大学,另一个是在两年里做任何我想做的事。”结果证明,这个决定并不难做。
Rob Wiblin是啊,但很多考虑不上大学、去创业或做别的事情的人,他们会感到来自他人、社会乃至自身的巨大压力,这也可以理解。“你必须得上大学。”即便你更倾向于不上大学这条路,这在某种程度上是否也是一个艰难的决定?
Chris Olah嗯,从之前那些事里,我已经有很多顶着压力做事的经验了。
但我觉得在当时,我是这样看待这件事的——尤其是向其他人解释时——我可以先干两年,然后仍然可以回去上大学。这看起来是个绝佳的机会。另外还有一点也很重要:当你得到第三方认可时,去做不寻常的事情其实会容易得多。我想人们在听说Thiel Fellowship时会觉得,“啊,最有价值的是他们提供资金。”这确实是一部分,但我认为实际上更有价值的是,我生活中的成年人们在我拿到10万美元去做这些事情之后,完全转变了态度,而在此之前他们其实是不太支持的。我认为,让一条非传统道路变得正当化、从而走得更顺畅,这本身也有非常大的作用。
Rob Wiblin是啊,这说明上大学有信号传递的成分,你需要一些资历凭证来证明你是个正经人,不是疯子,也不是不负责任的人。我想Thiel Fellowship是在作为一种替代来提供这个。
Chris Olah我觉得有一部分是这个原因。还有一部分是,当你做一件非传统的事情时,关心你的人会感到担忧。而拥有某种信号,表明你其实在做的是合理的事情……我觉得这会有很大帮助。
Rob Wiblin你在自己的网站上写过一篇文章,详细阐述了你对不上大学、转去做别的事情这条路的一般看法。如果人们想充分了解你在这方面的观点,那可能是最好的资源。你能不能简要总结一下,这是更多人都应该考虑的事情吗?
Chris Olah我收到过很多邮件,问我他们是否应该上大学。我想这可能是我被问到的最常见的问题。我认为几乎每一个给我发邮件的人都应该去上大学。我这么认为的原因是,如果你想从去做别的事情中获益,你必须具备很强的自律、愿意努力做事的意愿,以及在没有外部强制机制的情况下自我驱动、努力做事的动力。我觉得很多人往往不具备这些,那么这条路对他们来说就不太管用。
另一方面,我觉得对于那些人——也许再多给点背景,我看到很多在Thiel Fellowship里真正取得成功的人,其中一些在20岁之前就已经完成了本科学位。有这样的例子。但我觉得很多人是做过非常重大的个人项目,涉及软件、科学或类似领域。我认为这其实是个很好的检验标准。如果你能够出于自我驱动去完成自己的大型个人项目——而且显然你处于一个足够有特权的地位,能够养活自己——那么你很可能在Thiel Fellowship这样的项目中,或者休一年假、休几年假,也能做得很好。但如果你做不到,那就会困难得多。
Rob Wiblin是啊,这条路在多大程度上只是为真正有天赋的人准备的呢?我想公平地说,20岁时的Chris Olah就已经拥有极大的潜力了。我见过的其他一些不上大学也发展得很好的人,他们看起来一开始就仿佛坐在火箭上。这让我不禁想,如果你本身就很有才华,是否还需要那些资历凭证才能敲开你想要的职业大门?
Chris Olah我猜自我驱动力这件事比其他任何因素都更重要。但我也觉得自己不太有资格去评判大学对那些与我很不相同的人有多大用处。比如,我能想象这样一个世界:对许多不会从事极具智力挑战性职业的人来说,实际上去读职业学校可能更有效,或者类似的选择。我能想象,对那些与我很不相同的人来说,不上大学可能有各种不同的合理理由。但这方面我很难多说些什么。
Rob Wiblin没上过大学有没有让你在之后的人生中遇到不被认真对待的问题,或者移民方面也可能是个顾虑?
Chris Olah是的,我觉得移民是一个被低估的顾虑。几乎所有美国的签证都要求你有本科学位。我现在持有一种非常奇怪的“杰出能力外国人”(Alien of extraordinary ability)签证,它刚好没有列出这个要求。但如果你没本科学位,我认为这基本上是你唯一的主要选择。
我觉得还有一些社交层面的挑战。实际上,我没上大学时低估了一点:在大学里,年轻人建立友谊和恋爱关系会容易得多。我错失了很多这样的机会,现在回头看,那其实是一笔相当巨大的代价,只是当时我不明白。
Rob Wiblin没错。那再多讲讲 Thiel Fellowship 吧,那里的社交圈子在多大程度上可能替代了大学?
Chris Olah嗯,如果我当时能住在湾区,说不定替代作用会更明显。那时我会定期去拜访,但我一直住在加拿大,因为我没有签证,没法在美国定居。如果我能待在那里,或许作用会更大。我确实交到了一些朋友,我觉得这很有价值。更广泛地说,那是一段非常不可思议的时光,让我能够去追寻自己真正感兴趣的事情。我一开始研究的是 3D 打印机,同时也做了很多随性的业余项目。大概过了一年左右,我从 3D 打印转向了机器学习,这是一个相当大的转变。
Rob Wiblin是什么促使你做出这个转变的?
Chris Olah有几个原因。一是因为我有这样的机会:我在多伦多认识的 Michael Nielsen 当时正在写一本关于神经网络的教材。他为了练习写作,办了一个研讨班系列。就在这个领域即将爆发的前夜——2012 年 Krizhevsky 的成果出来之后不久——我因此接触到了大量的观点和学习内容。所以我有这个机会,也意识到这是一件非常令人兴奋的事,于是我自己也变得非常热衷于此。另外,我在 3D 打印项目上的主要合作者退出了。还有一个稍微起了点作用的因素是,我碰巧遇到了 GiveWell 和 Open Philanthropy 的 Holden Karnofsky。
Rob Wiblin那应该是很早的时候了。
Chris Olah是的,那是在 2012 或 2013 年。我能见到他,是因为我和 Dario Amodei 是朋友,当时他还在读研究生。Dario 不知怎的,尽管拿着研究生的津贴,却把其中很大一部分捐给了 GiveWell——从财务角度来说这可能不太明智——正因如此他见到了 Holden。后来我就和 Holden、Dario 一起吃晚餐。席间我向 Holden 推介我正在做的 3D 打印机项目,我说如果我们能拥有 3D 打印机的开源工具,就能让 3D 打印机普及到每个人,也许我们还能终结稀缺之类的事情。结果 Holden 直接把这个想法毙掉了。当时我很恼火。
实际上,Holden 的原话是:“我不觉得这有多大价值,但看起来这对你锻炼技能倒是个很好的方式。”当时我很不爽。但回头看,他这么说其实非常有用。我觉得跟 Holden 聊天经常就是这样。我有时会因为他而恼火,但事后又常常很感激他说的那些话。
Rob Wiblin他当时反对你做开源……这该怎么称呼,本地制造?这个词怎么说来着?
Chris Olah我当时在开发开源 CAD 工具。我不记得他具体是怎么论证的了。我觉得他对很多事情都持怀疑态度,而也确实有很多地方值得怀疑。比如,3D 打印机是否真的能够按照我想象的那样,以低成本真正普及开来?还有,这些开源工具到底是不是一个关键的瓶颈?回头来看,我觉得它们并不是。
Rob Wiblin是啊,人们谈论 3D 打印机已经很久了,而我一直在想,我真不知道自己有多少东西是想用这种方式做出来的。有多少东西是可以 3D 打印出来、并且我真的有兴趣为自己制作的?也许有一天我会被证明是错的。
Chris Olah嗯,我觉得真正吸引人的设想是:如果你能造出一台可以打印自身的 3D 打印机,同时还能打印各种各样的物品,你就能形成一个正反馈循环,让推广它们变得非常容易。然后任何你能打印的东西,都可以免费提供给所有人。你可以把一台打印机的大约 80% 打印出来,类似这样。但剩下那些无法打印的“维生素”(vitamins)零部件——而这些“维生素”恰恰都是最难的部分,所以我觉得在某种程度上,你以为自己在取得进展,其实只是一种幻觉。
我也不清楚,我已经很久没涉足这个领域了。但曾经有一段时间,我对此有很多幻想,我设计过一台可 3D 打印的吸尘器,还研究过如何用 3D 打印机制造显微镜。回头来看,这些都没什么用。
Rob Wiblin是啊。你怎么看待扮演那种“毙掉别人计划”的角色?这很难,因为你可能会显得有点像个混蛋。
怎么说呢,也许你自己也未必有资格斩钉截铁地告诉别人这个想法很糟。我觉得旁观者不喜欢你这样做,当事人本人可能也会反对,而且你还有说错的风险。然而有时候确实非常需要有人站出来说:“不,这是个蠢主意。”这是一种平衡的艺术。
Chris Olah我觉得这真的很重要。这是我希望自己能更擅长的能力。我个人很难给别人负面反馈。当我处于管理岗位时,我会强迫自己这样做,但这很难。我真的很佩服那些能直接说:“对,这完全是胡说八道”的人,能非常坦率地讲出来。我觉得最理想的做法是把它和支持结合在一起。Holden 当时说的并不只是“这是个蠢主意”,而是“这似乎不是个好主意,但你在培养很多优秀的技能,而且你将来很可能会做出有用的东西。”
Rob Wiblin是啊,我也尝试过几次扮演这种角色。听到别人的计划时,我会直接说:“不,这太糟糕了。你真的得改,因为我觉得这不会产生任何影响力。”公平地说,我得到的反应褒贬不一。所以现在我更谨慎了。我不知道,也许听完你这个故事之后,我应该重新回到——
Chris Olah我觉得我可能花了好几年时间,才彻底不再觉得 Holden 当时只是有点烦人。
Rob Wiblin是啊。他有劝你进入机器学习领域吗?他当时有没有说“机器学习才是未来”之类的话?
Chris Olah完全没有。我当时完全是因为其他原因,独立地对机器学习产生了热情。
Rob Wiblin好的,那么 Holden 以及其他一些因素让你相信,3D 打印可能并不是最值得去做的事情。然后,你又独立地对 machine learning 产生了兴趣,当时它正在开始兴起?
Chris Olah是的,或者说当时 deep learning 正在开始兴起。
是的,让我一直无法释怀、并且非常痴迷的一点是,我们拥有这些系统,它们能完成一些人类根本不知道如何编写计算机程序来完成的事情。而且没人知道它们内部在发生什么!这个问题深深吸引了我,让我挥之不去。它也成为了我的一大动力。
Rob Wiblin有意思。我想我一直理所当然地认为,neural nets 就是由节点和权重组合而成的东西,也就是一堆数字,它做了些事情,而我们不理解它是怎么工作的。但从某个角度来看,这确实很疯狂。
Chris Olah这很疯狂。我们拥有这些系统,这完全是不可思议的。就像在任何一个其他领域,你会说,创建一个能自动为你构建系统的系统,要比直接得到一个能做困难事情的系统更难。但在这种情况下,我们根本不知道如何去构建这个系统,而且人们确实尝试过。对于我们谈论的几乎所有 machine learning 任务,人们都尝试过去手工构建系统来完成它们。我们无法构建出能做 neural networks 所做的事情的系统,即使我们非常努力地手工去做。然而不知怎的,它们却自动形成了。这确实是世界上一个极其疯狂的事实。
Rob Wiblin是的,所以我们是在间接地制造它们,通过给计算机编程,告诉它“试着做这件事”,然后当它失败时,我们又说:“如果这些数字以某种方式稍微不同一点,你可能会做得更好一点。”于是我们再试一次,再调整数字,一直重复直到成功。但到最后,我们得到一大堆数字,然后只能无奈地说,我们并不真正知道该如何理解这些数字。我们甚至不知道任何……或者至少在过去,正如我们待会儿会讲到的,我们不知道各个不同的部分都在做什么。
Chris Olah是的,不知怎的,这些数字对应着一个计算机程序。它内部到底在发生什么?我真的很想知道。
Rob Wiblin好的,所以你特别——
Chris Olah……而且 19 岁的 Christopher 也非常想知道。
……这一点其实没怎么变。
Rob Wiblin接下来你做了什么才能进入这个领域?我想,现在有人仅凭高中学历就能在这些 AI 实验室找到工作,这种想法……我不知道当时是更容易,还是说你特别出类拔萃,但你是怎么设法入门的?因为人们通常会觉得,如果你走了这条非传统的路,这些事可能会非常难。
Chris Olah我得说,我并不是唯一一个没有学历却身处这些实验室的人。据我所知 Alec Radford 没有博士学位,我不确定他是否有本科学位。还有其他一些研究人员也是这种情况,所以我并不是个例。对我来说,我非常幸运能和 Michael Nielsen 一起工作,他基本上把我当成他的研究生对待了半年或一年。那是一段非常有帮助的经历,我认为让我作为研究者成熟了很多。然后我开始给不同的实验室发 cold email,询问我是否可以去访问。Yoshua Bengio 发布了一个招收博士生的公告,我给他写了信。我花了大约一周时间给他写邮件,问他是否愿意考虑我。
他最终考虑了我,而且我实际上被录取了,但我最终没有去。我开始访问不同的研究小组,并就我做过的研究做讲座。我得到了一些还算有点意思的结果,而且……我认为这个领域在当时小得多,而且它正在增长——我觉得相对于它现在的规模,当时的增长速度非常快。所以这也确实让进入这个领域变得更容易。
Rob Wiblin是啊,有意思。我猜你第一份正式的工作是在 Google Brain 实习,对吗?
Chris Olah是的,我当时在 Google 做了一次讲座,Jeff Dean 非常友好地提出让我做实习生。我最终在 Google 实习,而且实习期一拖再拖,结果我一共实习了整整两年。
显然我不是 Google 历史上实习时间最长的人,但我想我很有竞争力争夺这个头衔。
Rob Wiblin你做这段长时间的实习,是为了代替其他正式培训吗?这是你学习所有必要知识、以便最终被正式录用的地方吗?
Chris Olah是的,我认为通过这段经历我学到了很多。我也从 Michael 那里以及自学等方式学到了很多。但是,是的,我认为其中很大程度上确实有那个因素。我非常幸运能被这么多非常棒的人包围,他们非常慷慨地付出时间,尤其是在做各种不同事情方面。Google Brain 当时大约有 30 人。与其去构建 neural networks 来完成各种任务——我确实做了一些这方面的工作,然后也参与了很多项目,做了一些 generative models 方面的工作,并为 TensorFlow 等项目做过一点贡献——但我主要做的事情只是试图弄清楚这些 neural networks 内部到底在发生什么。
而且当时真的很少有人去思考这个问题。Matthew Zeiler 做过一点工作,不过他后来基本停下了。Alex Mordvintsev 后来成为了我的密切合作者,他当时也在这个领域做一些工作。我花了很多时间写关于 machine learning 的博客文章,试图将它们可视化,试图理解内部发生了什么,还尝试了很多效果不太好的方法。
Rob Wiblin是啊,那么你在 Google Brain 待了六年左右?有哪些亮点,或者你做过最有趣的事情是什么?
Chris Olah是的,大概五年,五年多,也许六年。
Rob Wiblin是啊,有哪些亮点?
Chris Olah最疯狂的事情可能是 DeepDream。最早期的 DeepDream 结果是 Alex Mordvintsev 发现的。他做了一次讲座,我当时特别兴奋。我把手头所有项目都搁置了,投身进去。那令人极度兴奋。其思路是,你通过优化输入图像,试图让 neural network 某一层的 neurons 激活。如果你还没见过,你可以得到这些充满狗蛞蝓、迷幻色彩之类东西的幻觉图像。Neural networks 看起来像魔法,但这看起来像是真正疯狂的魔法,我花了无数小时尝试各种不同的做法。我试图可视化不同的层,试图以各种方式调整我们正在做的事情。
我发现可以把这种方法应用于可视化单个类别,我们还发现了一些东西,比如它识别杠铃的部分方式,是寻找连接到杠铃上的手臂。但那只是一个充满强烈神秘感的、非常激动人心的时刻,真的很酷。
Rob Wiblin是啊,我觉得大家都见过 DeepDream 的图像。我猜技术论文的读者比图像的受众小得多,但它引起了轰动。你能描述一下这些图像是如何生成的吗?看起来你是在逆转 neural network,让它生成一张图像,而不是对某物进行分类。
Chris Olah是的,这个想法是,你去调整输入图像,以得到一张能让某一层中的神经元大量激活的图像。随着神经元开始激活,你试图让这些神经元激活得越来越强。后来我们提出了这个……关于 DeepDream,有一点我一直感到有些遗憾,那就是我们一开始获得了那么多关注,但我觉得我们在某些重要方面并没有真正理解这些结果。我们并没有真正理解自己发现了什么。
我有时会把它比作,在显微镜发明的某个阶段,一定有人发现了一块扭曲的玻璃,意识到他们可以把它举到物体前面,看到这些变形的图像,而这些变形的图像中有一些被放大的部分,让他们能看到以前看不到的东西。我觉得 DeepDream 就是那个阶段,后来我们把它发展成了 feature visualization,并进一步开发……当然,这不只是我们自己的工作,我们也建立在其他人所做的工作之上……这让我们拥有了这些“镜片”,能够非常清晰地观察,并真正掌握一个强大的工具,以理解神经网络的不同部分。但这都是在 DeepDream 带来的关注之后才发生的事。
Rob Wiblin这波关注对你被认真对待、或者获得更多资源有什么帮助吗?我不知道机器学习界在多大程度上会尊重“创造出一个能做出惊艳图像、供人们发到社交媒体上的工具”这件事。
Chris Olah我觉得人们确实兴奋了一两个月。我印象最深刻的是收到了很多来自心理学界人士的邮件,他们想和我们一起研究这个现象。我记得收到过一封来自某位看起来相当严肃的教授的邮件,说他想研究这些图像为何看起来类似于迷幻图像,比如我们能否合作来弄清楚。我从未跟进过这件事。但我觉得很多关注并没有那么有帮助。也许只是因为,至少从我的角度来看,我们当时还没有真正深入理解这些结果,所以也没能真正将这些关注引导到对推进“真正理解神经网络”这一议程有帮助的方向上,我是这么想的。
Rob Wiblin和那么多比你年长、资历也比你深得多的人一起工作,是什么样的感觉?
Chris Olah那是一段有趣的经历。是的,有一段时间我是那里最年轻的人,因为连实习生都是年龄比我大不少的博士生。实际上,当时……你知道,那里只有30个人,我有几位同事的孩子都和我差不多大。这也挺有意思的。但其实每个人都非常好,和他们一起工作真的很愉快。我觉得稍微有些挑战的是——而且在我成为全职员工之后这个挑战变得更大了——那就是如何与同龄人互动。比如我有过这样的经历:我试着和博士生们相处,然后他们会说,“Olah 博士”——因为所有人都假定我有博士学位——“我能做你的实习生吗?”类似这样的事情。
如果你进入某个环境时,真心希望能有同龄人式的互动,并和别人成为朋友,那么当这种事发生时,其实真的挺令人失望的,也是一种相当奇怪的经历。
Rob Wiblin有意思。我想,如果你作为一个20岁的人,所有时间都和三四十岁的人待在一起,你会不会最后就总是在聊,我不知道,男性脱发,或者怎么买房?就像“我们来聊聊厨房装修吧”之类的。我觉得人们聊的话题可能相当不一样。
Chris Olah我大多是在和别人聊研究。我试着聊过几次 effective altruism,但我觉得人们只是被我搞糊涂了。
Rob Wiblin这么说,你在 Google Brain 待了五年,在那里写了很多阅读量极高的文章。你还创办了学术期刊 Distill。你想不想详细说说在 Google Brain 的其余经历,以及后来发生了什么?
Chris Olah嗯,我觉得我的职业轨迹大概从那个时候起变得没那么不寻常了,因此也没那么有趣了。但是,是的,在 Google 待了几年之后,我开始对如何推进 interpretability 研究有了更清晰的愿景,而且是一个非常独特的愿景。我真的很想试着建立一个研究团队,从事那种 interpretability 研究。同时我也对 open-notebook science 这个想法非常感兴趣。我觉得将 interpretability 研究完全公开化没有任何坏处。我只是觉得,要是我们能在研究过程中就直接分享出来,并试着让更多人参与进来,那就太好了。
我和我的经理以及 Jeff 聊了很多,他们其实都非常非常支持我。我们一致觉得 Google 可能并不是我追求这个方向的最佳场所。于是我最终去了 OpenAI,组建了一个团队,叫 Clarity 团队,在那里开展这类 interpretability 研究。那对我来说是一段非常积极、也非常不可思议的经历。
Rob Wiblin是啊,看起来你一路见证了这个……我想这个 clarity 或者说 interpretability 领域在你加入时还不存在。你几乎可以说是创立了这个领域,或者至少是在它创立之初就在场,而现在你已经看到它成为了机器学习研究中相当有意义的一部分。它被广泛接受,也有很多人对此感兴趣。
Chris Olah嗯,我觉得现在有很多人在做各种各样被称为 interpretability 研究的工作,也有很多人为创造这个领域内的不同分支和方向做出了贡献。但我对这类工作中最让我兴奋的部分一直有一个非常具体的愿景。我非常幸运能够帮助构建这一方向,而且觉得自己真的很幸运能在早期就参与进来。我在 OpenAI 与一群非常出色的合作者一起工作,我们推进了我们称之为“circuits agenda”的研究议程,也就是试图去完全理解神经网络。
Rob Wiblin好吧,我们来整体看看你在2008年到2015年间走过的这条非传统职业道路。你认为我们能从这段经历中学到什么?听众能否从中吸取一些适用于自身经历的教训?也许他们应该去为某个面临恐怖主义指控的朋友辩护?有没有什么可供借鉴的,还是说这段经历实在太离奇了?
Chris Olah嗯,我觉得我从中提炼出的最有用的东西,可能是关于技能的 Pareto frontier 的思考。例如,我早期对机器学习的很多贡献,基本上就是能够为复杂的概念创作出非常有帮助的图示。要做到这一点我需要什么技能呢?我既需要理解机器学习,又需要会画画。我并不是特别出色的艺术家或科学插画师,我在机器学习方面的知识也不是特别渊博。但很有可能的是,曾有一段时间,我是世界上在“机器学习”和“绘画”的交叉领域做得最好的人。如果你把不同技能画成二维图,或者三维图,然后考虑 Pareto frontier,你会发现社会往往很擅长培养这样一类人:他们在某一特定的技能组合——也就是社会已经认可为有用的技能组合——上被优化到了极致。
我们会搭建完整的人才培养流程。但我觉得,很多时候,如果你能找到一些非标准技能之间有用的交叉点,那可能会带来巨大价值。而且这样更容易产生重大影响,往往还能带来巨大的反事实影响。当我和别人聊他们的职业发展时,我通常会试着从这个角度去分析:他们正在培养哪些技能?我们认为这些技能的帕累托前沿是什么样的?是否存在这样一种可能:与其把某一项技能练到世界第一,不如处在一个其他人都不具备的技能交叉点上,从而创造大量价值?
Rob Wiblin是的,这很有意思。从理论上想,我想部分原因就在于,两种不同的事物可以组合出太多可能性了。因此可能的组合空间要大得多,你也有更多选择。这也意味着,如果你选择的两个领域距离足够远,你可能是唯一一个同时对 X 和 Y 感兴趣的人。这样一来,你就拥有了一套真正独特的技能组合,而且你可能会偶然发现一些其他人根本没想过要去寻找的东西。
Chris Olah没错,而问题在于这个空间是指数级增长的。你不仅要找到一个交叉点,而且这个交叉点必须是有用的。所以在选择培养哪些技能时,你得有一些品味和判断力。但我认为这类机会有很多,而且这条路往往比去精通某个社会已经非常看重、大家都竞相优化的技能要竞争小得多。
Rob Wiblin是的。我猜你也可能选错组合,比如那两者之间并没有太多互补性。又或者,你可能会掉进修有学科之间的裂缝里。人们做跨学科工作时常抱怨的一点是:如果你研究的是经济学哲学,经济学系不喜欢你,哲学系也不喜欢你,没人真的觉得你属于他们那边。
Chris Olah我想把这和跨学科工作稍微区分一下,我觉得那是有点不同的。当我做机器学习的科学可视化时,它其实是对机器学习领域的一项纯粹贡献。那是对机器学习社区有价值、并且面向机器学习社区的东西。我认为这两者之间是有区别的,介于——
Rob Wiblin……技能和知识体系之间?
Chris Olah对。你可以去做更具跨学科性质的事情,比如把机器学习用于科学绘图之类的,但我认为我当初做的并不是那种东西。
Rob Wiblin嗯,好的。所以我觉得 80,000 Hours Podcast 可能就是这种例子。我们处于这样一个交叉点:一方面熟悉有效利他主义的理念和研究,另一方面又做采访、做媒体、做传播。这大概是这档播客的独到卖点。我想问问,你有没有那种经典技能的例子,就是把它叠加到某件事上,然后可能做出别人还没发现的有趣成果?
Chris Olah关于这个现象,我有一个最喜欢的例子,不过我很可能会记错一些细节,而且这个例子其实来自 Michael Nielsen。据我所知,理查德·费曼……我对物理了解不多,但他当时要做大量工作……物理学家们都在忙着解复杂的积分。通常的做法是用复分析、解析延拓之类的技巧去求解。而费曼对这些复分析工具并不是特别精通,但他掌握了很多奇奇怪怪的工具,比如分数阶微积分之类的东西,他就用那些方法来解题。
也许这还……这其实算不上多么奇怪的技能组合,但正因为他的技能组合和同事们不同,他才能产生更大的反事实影响,去解出别人解不出的问题。并不是说他的工具更好,而是其他人已经在用那套常规工具尝试了。他把一套不同的工具带到了桌面上。
Rob Wiblin是的。我猜一些可能的组合是:对某个技术领域很了解,再加上比如懂组织运营、懂经商、懂财务,或者懂人员管理。也许这些就是可以组合的东西……
Chris Olah对。我认为人员管理加技术能力是一种超强的组合。这也是我正在努力提升的方向。我见过那些真正擅长这一点的人,我觉得他们……是的,这真的很了不起。
Rob Wiblin是的。他们最终会变得非常抢手。
Chris Olah是的。我认为任何沟通能力加技术能力都很有价值。网页开发加科学其实被严重低估了。很多时候,如果你能搭建交互式界面,你就能……我想基本逻辑是这样的:很多科学家倾向于高度还原论的思维方式……也许这在机器学习领域比其他领域更明显,我不太确定。但他们往往倾向于寻找汇总统计量,因为汇总统计量容易处理,可以画折线图之类的东西。而我认为,如果你能转而创建交互式工具去探索事物,你和数据的交互方式就会完全不同。这里面其实大有可为……至少在机器学习领域,我觉得有很多价值被白白浪费了。我猜在其他领域也是如此。
Rob Wiblin嗯。你觉得这会不会多少有点湾区的特色?就是那种人们特别欣赏拥有奇特组合技能的人,而如果你身处一个更保守的社会环境中,这么做可能风险更大?还是说这种看法不对?
Chris Olah有这个可能。不过我认为在很多情况下,关键是如果你能证明你的技能交叉点能够创造价值,这才是真正重要的。一旦一个组织从你的技能组合中获得了价值,那它奇不奇怪可能就不是决定性因素了。
Rob Wiblin是的。这不会成为成败攸关的问题。我猜还有另一个启示:如果你能直接向别人展示你能做成事情,那你往往就能绕过学历门槛。我觉得这话在很多时候是对的。但问题在于,如果没有经过训练,要弄明白如何创造价值、如何做好工作,其实可能是相当困难的。这需要一个人要么有极强的天赋,要么有极强的专注力,要么有极强的自律性,才能在非结构化的环境里做成事情。
Chris Olah完全同意。我觉得这也很大程度上取决于学科。没有资质就去执业法律是行不通的。我想,这取决于你所在的学科,也许这跟我之前的回答方向有点相反,但我指的是学科的灵活程度……其实这和技能交叉点的问题略有不同。你完全可以拿了博士学位,同时拥有一套奇特的技能交叉组合。
Rob Wiblin是的。我觉得人们大概不会只靠学徒制就能学会医学。出于可以理解的原因,这是一个相当看重资质的领域。
Chris Olah如果一位医生没有医学博士学位,我肯定会感到不安。
Rob Wiblin这让我想到,如果你愿意充当某位理发师手下的第一位顾客,就能免费理发。也许在手术环境里,这事就没那么容易了。
我们已经聊了很多关于人们是否该去读本科的问题,但你对读研怎么看?情况很不一样吗?
Chris Olah还是那句话,我不确定我的建议在多大程度上能推广到不同领域,但至少对于 machine learning,我通常鼓励人们只问自己一个问题:去哪里才能做出最好的研究?作为背景,我通常听到人们在考虑读博时问的是:“那我是不是应该直接去工业界的实验室做研究?还是去读个 PhD,在那里继续发展我的 machine learning?” 我认为关键并不在于这是否是 PhD。关键在于,你觉得能从身边的人身上学到多少,以及那里的研究环境究竟有多好。
对有些人来说,去读 PhD 往往能让他们获得更多的指导,并进入比工业界机会更契合其品味的研究环境。但对另一些人则恰恰相反。我觉得最好还是去比较具体的问题。我猜,关于读博,人们常给的一条经典建议就是:认真思考你将要加入的研究组,并努力去理解他们。我认为,正如你在考虑读博时应该比较具体的研究团队一样,如果你也在考虑工业界,那么你应该去考量你将要加入的具体工业界团队,以及在那里工作你能获得什么。
Rob Wiblin嗯。Machine learning 这个圈子有多势利?会在意你是否毕业于名校,或者是否曾在最好的实验室工作吗?
Chris Olah我觉得不怎么在意。当然,这可能因机构而异,但我认为大多数机构如果你做出了令人印象深刻的成果,那才是它们最关心的。实际上,曾经有一所大学鼓励我去申请教职。这让我非常惊讶,因为我既没有本科学位,也没有 PhD。我一直觉得大学是非常非常传统的机构,所以如果大学在人们做出好的研究时愿意考虑这种情况,那这就是一个相当强烈的信号,表明很多机构更愿意关注人们的研究本身,而非其工作经历或在哪里读的 PhD。
Rob Wiblin是的。在我看来,machine learning 作为一个学科可能相当不寻常。它似乎在绕过一大堆常规惯例。现在大多数研究人员只去会议上做报告,对吧,然后大家——
Chris Olah这不只是 machine learning,整个计算机科学都是这样。
Rob Wiblin啊,整个计算机科学都这样。我明白了,好的。
Chris Olah是的。计算机科学总体上不怎么使用期刊,而是非常依赖会议。
Rob Wiblin有意思。你知道这是怎么形成的吗?
Chris Olah不确定。但我知道这会在学术界造成一些奇怪的情况,比如有人看到一位计算机科学家的履历时可能会想:“哦,他只在会议上发表论文,那他的工作不怎么样。” 但事实上,这只是惯例而已。
而且我觉得物理学的一些领域也是如此。Machine learning 里有相当一部分人只在 arXiv 上发表文章,完全不在任何正式场合发表,但我认为物理学的一些领域已经把这做得更彻底了。
我的印象是,物理学的一些领域里,人们并不真正使用……总体而言,他们既不使用会议也不使用期刊,或者任何 peer-reviewed 的场合,而是直接把东西放到 arXiv 上。
Rob Wiblin哇。他们活出了理想状态。
我说过,我真的不确定学术出版物到底提供了什么价值,因为 peer review 似乎在筛掉劣质论文方面做得并不太好。我是说,它 presumably 还是有一定作用的,但据我了解,peer review 的重测信度并不算强。所以,即使你把同一篇论文投给一家期刊两次,也很可能一次被拒、一次被接受,这有点像个危险信号。
Chris Olah是的。NeurIPS 做过一个测试,他们对一部分论文进行了两次 peer review,结果发现如果一组审稿流程接受了某篇论文,另一组审稿流程接受它的概率是 50%。考虑到它们的接受率还不到一半……这听起来没那么糟,但仍然是一个非常非常 noisy 的过程。
Rob Wiblin是啊。如果这些学科已经摒弃了传统的期刊体系,那我们或许可以通过观察这是否造成了灾难,来了解期刊一开始究竟提供了多少价值。也许这值得我去研究一下。
我知道你写过一篇文章,讲人们如何培养对“研究什么”以及“如何进行研究”的良好 taste。实际上为了准备这次访谈我没时间读那篇。你能给大家总结一下你的观点吗?
Chris Olah当然。首先,我完全不认为自己是这方面的专家。这只是对我自己有效的方法,也是我在指导别人时发现有帮助的东西。但我认为,把成为一名优秀研究者分成两部分来看通常是有益的。一是 taste,也就是你选择好问题的能力,以及选择有效途径去攻克这些问题的能力等等。第二部分你可以称之为 technique,或者 execution。想象一下化学家操作试管、滴管和各种奇怪仪器,很明显,操作实验设备是有一套完整技术的。
我觉得在其他领域中这更微妙一些,但我认为确实存在某种东西——至少在 machine learning 中,训练模型是有 technique 的,甚至只是成为一名优秀的程序员,在代码编辑器里做非常细致的操作,或者去操作分布式系统等等——我认为问题在于如何培养这两种技能。而对于 taste,我认为这可能是最难培养的。我试着列出了一组可以做的练习。举个例子,可能也是最有用的一个:写下一份你认为可能值得研究的重要问题清单,然后让另一个人,最好是你的导师,去给它们逐一打分,从 1 分到 10 分。
因为培养 taste 真正困难的一点在于,你学习经验教训的反馈周期非常长,因为你必须做完整个项目。你要做的是利用导师或其他人作为一个低成本的反馈代理,如果你不同意他们的反馈,你可以和他们讨论,或者也许你甚至想去做那个实验来验证。我觉得这可能会有帮助。我认为还有很多其他方法。我觉得阅读科学史是有帮助的。我觉得去试着写下你为什么认为某些事情很重要也是有帮助的。无论如何,我认为那里有一系列练习可以做。然后,在 technique 方面,我认为最有价值的事情其实是与那些技术过硬的人密切合作。
其实我觉得,至少在机器学习领域,可能也包括其他计算机科学学科,与人结对编程是极其宝贵的。有很多东西很难通过其他形式传达,但在结对编程时却能传递出来。我认为对于培养技术能力来说,结对编程往往是收效最大的做法。
Rob Wiblin这很有意思。我注意到……我想在那些有实体形态的工作领域,在物理世界中实际搬动物品的任务里,人们可以相互观察,通过观看别人在做什么来学习,并琢磨如何做得更好。而在电脑上的工作中,这种情况就少得多了。
似乎普遍存在着一种文化,就是你不会……当你进入一家公司,比如想接受经理的培训时,你不会真的整天坐在他们身后观察他们的一举一动。那也许……那样或许挺合理的,但你不能就这么坐在他们身后盯着屏幕,看他们怎么移动窗口、怎么回复别人。这种事不会发生。我想这就意味着,人们很可能会遗漏一些非常基础的东西。听起来在编程领域,结对编程的存在在某种程度上就是为了填补这个空缺,因为这个问题在那里可能尤为严重。
Chris Olah是的。我觉得很多组织中结对编程的文化正在兴起。我感觉听到人们谈论它的次数明显变多了。而且是的,我发现它在传递这些东西方面非常有帮助。我自己在与他人共事时就不断学习别人的长处,也希望他们能从我这儿学到东西。你提到的关于没有实体形态时技术就会被隐藏起来的观点,说得非常好。
Rob Wiblin是的。我认为这种文化的存在,部分是因为人们担心……嗯,我想有两个原因。一是可能有点羞怯,怕别人不认同自己的工作方式。把屏幕藏起来、不让别人看,这很容易。另一个原因可能是担心保密问题。你不想让别人探过头来看你的邮件。总体而言,不看别人的屏幕是一种真正的规范,但似乎也许我们应该想办法绕过这个问题。比如,你可以约定一个特定时间,让别人就看着你工作,而你尽量不做那些太敏感、不适合被看到的事。我觉得如果能看到同事们是怎么度过一天的,我会非常着迷。他们切换窗口的频率和我一样高吗?我不知道。有时候这些基础技能对生产力至关重要,为此付出努力可能是值得的。
Chris Olah嗯,我觉得这也不仅仅是教学。很多时候,如果身边有另一个人,你们往往能更快地推进事情。Jeff 和 Sanjay 在 Google 以影响力巨大著称,他们就一直结对编程。
Rob Wiblin所以他们是坐在一起,电脑挨着电脑,然后一起解决同一个问题?
这真的很有意思。是啊。你有没有想过为什么这种做法没有更普及?它看起来似乎是一种非常合理的做事方式。
Chris Olah我认为它在编程和软件工程领域已经有一定普及度了。我想在这里强调的是,它非常有用……我觉得人们有时觉得这只是一种不错的工作方式,或者一种有效的工作方式。但我认为……特别是如果你想培养技术能力,它是我所知道的最好的传承方式。
Rob Wiblin是啊。我在你的文章中看到,你通常也非常提倡给别人写陌生邮件。你发现这对你很管用。你觉得这也能推广到其他人身上吗?
Chris Olah我收到过很多陌生邮件,其中 99% 都很糟糕。它们就像:“你能帮我做作业吗?”或者“你能回答这个基础问题吗?我自己 Google 一分钟就能找到答案。”我觉得人们之所以觉得发陌生邮件没用,是因为如果你发的是那种邮件,对方会被淹没,自然不会回复。或者,就算你只是非常泛泛地……如果你发一封措辞得体的邮件,说“我想进入机器学习领域,您能和我通半小时电话聊聊该怎么做吗?”即便是这种,你也不太可能得到回复。但我觉得人们忽略了一点:如果你写的陌生邮件质量真的很高,要做到成为我那周收到的最好的邮件,其实并不难。
而且我认为,如果你愿意投入精力去了解一位研究者或一个团队正在做什么,你具体提到了他们的论文,并且对相关内容有经过思考的问题,是的,我认为人们会非常关注这些。然后我觉得这……往往会很管用。我觉得人们在谈论陌生邮件时,所指的东西往往大相径庭。我认为如果你愿意下功夫,如果你真的非常关心某人在做什么,并且花了功夫去理解,还能非常聪明地谈论它……这些是会体现出来的。这比其他任何理由都更能说服对方与你交谈。
Rob Wiblin明白了。听起来你的意思是,人们不应该给各种各样的人大量发送陌生邮件,但如果有一个你非常感兴趣、而且非常理解其工作的人,你就不应该羞于给他们发邮件。因为即使他们也在收别的邮件,如果你能证明自己确实读过他们的论文,你的那封邮件就很有可能会脱颖而出。
Chris Olah嗯,还有另一点。我觉得有很多人在琢磨怎么进入机器学习领域,他们的做法是群发邮件,或者给名人发邮件。我认为你真正应该做的是,弄清楚自己特别想和谁共事,并且真正理解他们的工作。理想情况下,也许选一位名气稍小的人,然后给那个人发一封你下了很多功夫的邮件,清楚地表明你读过他们的工作,把你的兴趣与他们的兴趣联系起来,诸如此类。有几封对我来说非常重要的邮件,我花了一周时间去写。我认为这是完全值得的投资。我觉得这不是人们通常看待陌生邮件的方式。
Rob Wiblin这太有意思了。你对长度怎么看?也许我们有点钻到邮件技巧的细节里了,不过请继续。
Chris Olah我觉得我写过很多最有影响力的邮件都只有几段长,不到一页。但我事先读了那个人五篇论文,我认为这些会以微妙的方式体现出来。而且我并不是非常生硬地引用它们,而是因为我真心投入并关心他们的工作,与他们有共同的兴趣,所以才写信给他们。我觉得这是非常、非常不同的。
Rob Wiblin是的。我想我学到的主要教训是……好吧,我觉得这是另一类 cold email……这种邮件是向别人请求帮个小忙、征求反馈,或者提供建议。当然,邮件越短,对方回复的可能性就越大。也许还有一点,如果你能真正把想传达的信息浓缩成几句话,人们就更有可能吸收它。因为人们浏览收件箱的速度很快,而且往往还有别的事情在忙,如果他们打开一封邮件发现是一整面墙的文字,那你确实要承担风险——他们可能会直接关掉,然后再也不会回头去看,因为内容实在太多了。他们还不知道是否真的值得投入时间去读。
Chris Olah是的。我觉得你确实应该……如果你要写长文,出于这个原因,你真的要优化好开头。
Rob Wiblin对于如何成为一名成功的研究者,你有什么想法吗?
Chris Olah我想还有最后一点我觉得挺有帮助的,就是把研究看作一个市场。我不觉得这有多新颖,但我确实觉得这是一个非常有力的框架。大体思路是,你把研究者看作是在不同的研究想法上投资,如果某个研究想法有了成果,而且别人没在他们之前抢到,那他们也许就能获得某种回报。可能是更多的资源,或者以某种方式获得收益。你可以看到这里存在一种竞争,大家都在去抢占那些有前景的研究想法。我觉得在这个市场里大致可以有两种策略。一种是,你可以去做那些所有人都认为很重要、也非常热门的事情。
当你这样做的时候,你其实是在让研究市场的这个小领域变得更高效一点点。你在让某些重要的想法能够更快地被完成。我认为这确实是一件有价值的事。如果你做的事真的很重要,而且你能让它预期提前一周或一个月实现,那真的很棒。但另一种策略是,你可以尝试跑赢市场。你可以去做那些你明显能看出相对于大多数人来说被低估的东西。这是我经常尝试去做的。而你能跑赢市场的原因有很多。
可能只是你关心别人不在乎的东西。如果你关心安全,或者在其他领域,如果你关心动物福利,或者你有一些更奇怪、与多数人不同的目标,你也许能以这种方式跑赢市场。不过我觉得另一种方式是,如果你对于某个问题有一些你深信不疑的洞见,而这种洞见并不普遍,那可能会非常有帮助。这可以是……我觉得这就是我本人在做的很多事情。我认为,如果你愿意投入足够的精力去弄清楚发生了什么,你是可以真正理解神经网络的。这是我在下的一个重注,而大多数其他人并没有这样做。
Rob Wiblin是的。我想如果用 80,000 Hours 的话来说,一种选择是去做所有人都认为最重要的事,或者如果你能在上面取得进展,它就会产生特别大的影响。但问题在于,它可能不会被忽视,因为所有人已经在做了。另一种选择是去押注那些目前真正被忽视、其他人没在做的领域,但当然,那些选择不做的人可能是对的——也许太难取得进展,或者即使成功了,它也并没有那么重要。
我想,是的,理想情况是你拥有某种别人忽略的底层洞见。也许他们只是没时间认真去钻研,因为外面的想法实在太多了。很多东西都被忽略了。然后你可以基于那个洞见找到一件既重要、又被忽视、而且容易取得进展的事,如果你足够幸运地成功了——
是的,那你就大功告成了。对吧。完全正确。你觉得你在 interpretability 上的工作是以这种方式挖到了金子吗?看起来那是一个亟待发展的领域。
Chris Olah我觉得是的。我觉得这也非常符合我的比较优势。但是的,我觉得是的。其他人可能仍然不同意。我认为关于它有多大价值,还没有最终定论。但我觉得是的。
Rob Wiblin我们继续推进,来聊聊如何把复杂的事情解释得非常好,我知道这是你多年来一直热衷的事。首先,为什么一个领域必须投入精力去做好解释工作?
Chris Olah我觉得在很多领域,要达到研究水平的理解就像登山一样。在你能够从事研究之前,你必须理解所有这些想法,并逐步积累。
我认为数学就是一个非常突出的例子,你可能要花上好多年的时间去攀登,才能达到可以做研究的地步,因为上面已经堆积了太多的东西。然后当你到达山顶后,你又会往上堆更多的成果,让这座山变得更高。
我觉得很多人对此感到自豪,因为他们觉得,啊,要达到能做研究的地步需要这么漫长的朝圣之旅,这意味着它特别深奥,也反映了迄今为止所做的全部工作。但实际上,我认为这往往反映了我们没有花足够的功夫去解释事物,没有为学习这个领域建立起真正良好的基础设施。我觉得这会以多种形式表现出来。可能是糟糕的阐述,只是对事物的解释不够好。有时候是未经消化的想法。某个想法很重要,但它还没有被真正提炼成那个想法的完善版本。我认为糟糕的符号或糟糕的定义非常常见,它们让事情变得更加复杂,而所有这些都让人更难去理解这个主题。
我喜欢的一个类比是,在软件工程中,人们有时会谈到技术债,就是你为了快速到达可以发布某个功能或类似东西的地步,在这个过程中写了很多糟糕的代码,代码非常混乱、难看,变量名起得不好,也没有文档,然后其他人就很难在此基础上继续构建。我觉得类似地,一种研究债务在科学界是普遍存在的。
Rob Wiblin是的。我猜这个问题可能随着历史发展正变得越来越严重。
Chris Olah是的,它随着历史发展正变得越来越糟,因为我们只是在不断堆积成果。有时人们确实会写出漂亮的教程和教科书,让情况稍微好一点,但我认为总体上来说还是在恶化,而且往往一个领域越古老,这个问题就越严重。
Rob Wiblin是的。所以我想,到了现在,在很多学术领域,如果你真的想触及前沿,你必须等到 30 岁,读完了博士,再做一大堆额外的东西。在某些领域,可能要到 35 或 40 岁你才能真正开始做出贡献。这反映了一个事实:首先,存在庞大的知识基础。在某些情况下,在某些领域,我觉得我们正在逼近人类大脑所能做到的极限。所以你必须真正达到自己的巅峰能力,才能做出任何新的贡献。
而且看起来基础概念最终会被提炼得很好,因为它们在小学、高中就被教授。人们摸索出了如何传达这些内容,但越是接近前沿顶峰,情况就越混乱,因为没人真正弄明白……没有关于最新成果的教科书。要攀登到顶峰可能变得越来越慢,因为一切都变得晦涩难懂。
Chris Olah我觉得人们往往也缺乏动力去钻研阐述工作。这是我的印象。Thurston 去世前写过一篇很好的文章,他谈到——至少按我的理解——如何扼杀一个领域:去摘光所有低垂的果实,然后抛弃这个领域,留下一大堆自己未曾解释的成果,让后来者完全无法触及。我想这是个极端的例子,但我觉得这种事确实可能严重阻碍学科发展。
Rob Wiblin等等,所以你是说有人可以丢出一堆……好吧,丢出下一步的研究,但解释得如此糟糕,以至于人们连理解它的欲望都被浇灭了?
Chris Olah你得连续推进好几步,但你可以堆砌大量进展却完全不加以阐释,于是这就成了一条死胡同:你进去重做那个领域的工作也得不到认可,因为果实都已被摘光了。而且你无法在其基础上继续建造,因为它太难理解了。是啊,这不是什么好景象。
Rob Wiblin这是一种很吸引人的可能性。
Chris Olah回到你之前的问题,我想还有一点可以说明为什么投入精力写好解释很重要。或者说,好的解释之所以有价值,在于它的影响往往是非线性的。当你写出更好的解释时,它不仅为读者提供了更多价值,而且你也会拥有更多的受众。
在很多事情上,如果你把东西做得更好,边际回报会急剧递减。当然,让事物好上加好的难度越来越大,这本身就意味着递减回报。但我认为在解释这件事上,还存在一种非线性的效应:当你把解释做得越来越好——好到超越现有所有解释时——它的价值实际上会以这种非常非线性的方式大幅增长。
Rob Wiblin因为这会成为默认的参考文献,每个人都会去读,而它更好,所以大家都节省了大量时间?而且也许还会有更多人——
——更多人会觉得,"哦,这东西我大概能懂,因为现在它被讲清楚了。"最终你会总体上扩大人们对这个话题的兴趣。
Chris Olah有时我对此感到有点难过,但我写过的阅读量最高的东西是一篇关于 LSTM 的教程,阅读量有几百万次。如果我写得再好一点点,让每个读者节省一秒钟的阅读时间……那实际上累积起来,我为很多人节省的时间就相当可观了。当你在某件事上拥有百万倍的乘数时,那确实会产生巨大影响。而拥有百万倍乘数与只有百倍或千倍乘数之间的差别,实际上可能是一个非常急剧的跃迁:你从一篇与现有解释相当的好解释,变成了一篇超越现有替代方案的解释。
Rob Wiblin作为一名经济学家,我认为这里的关键概念是固定成本与可变成本。把解释做得更好是一种固定成本,而这只是写文章的人要承担的成本。他们得花更多时间修改,但收益却是可变的,取决于有多少人阅读。随着读者数量增加,花时间去改进解释所能合理证明的投入就会急剧膨胀。如果一本教科书会有百万读者,那你真的希望确保它非常非常好,这样才能为人们节省时间。
Chris Olah既然我们是用一种偏经济学的方式思考这个问题,我觉得还有一件事值得琢磨:如果你设想一个领域里有 n 个人在互动,随着……当你改变这个领域的规模时,你可以问:如果你想让每个人都理解其他所有人的工作,那么有多少精力花在解释上,又有多少精力花在理解上?解释的努力是线性增长的,因为每个人都要解释自己的工作。但理解的努力是二次增长的,因为每个人都需要理解其他每个人的工作。
所以如果你有机会改变这两者的系数——让人们产出更好的解释,然后受众少做一点功课——我认为你就能改变一个领域在分裂前所能达到的规模。也就是说,一个领域存在一个最大规模,在此规模下每个人仍能真正理解该领域内发生的一切,而这个规模取决于人们如何阐释事物,正是因为这种线性/二次成本的关系。
Rob Wiblin嗯。有意思。好吧,所以这里的意思是,如果人们不擅长解释自己在做什么,那就意味着一个领域会发生裂变,因为人们会觉得必须更加专业化,因为要理解领域另一端那些人在做什么实在太费劲了。是啊。对他们来说那就像天书一样。
Chris Olah是的。我觉得这是很自然的反应。
Rob Wiblin那么,你认为什么才是好的解释,以及我猜大多数典型解释缺了什么,让你觉得它们本可以更好?
Chris Olah我认为好的解释包含两个部分。一是对话题有一种非常清晰的思考方式,二是把解释执行好。至于如何形成清晰优美的思考方式,这很难给出什么建议。对我管用的办法是,我会一直对自己的理解感到恼火,直到它变得顺手为止。这是适合我的方法。但我觉得关于如何把解释执行好,还是有更多可说的。好吧,有一件事让我觉得很奇怪。经常出现这种情况:有人对某个话题极其了解,他们花了很多力气去写解释,结果写出来的东西别人却很难跟上。
然后情况还会更糟。人们告诉他们这很难懂,他们试图改进,结果实际上是解释变得越来越差、越来越难听明白。当他们审视自己的解释时,却觉得"哦,这很容易懂啊。这是篇很好的解释。"这非常神秘。为什么会这样?我想我的假设是,他们拥有两种读者不具备的资源。首先,他们在读自己的解释时,不需要把东西存进工作记忆里。他们已经记住了所有术语和所有概念。他们可以就这样写下去。通常,如果他们试图把解释做得更好,就会加入越来越多的细节,试图做到极其全面等等。最终结果是,他们把读者的工作记忆塞得满满的。
我不是心理学家,但据我了解,读者只有大约七个工作记忆槽位,而且会被全部占满。这样一来,读者在消化解释内容的同时,就很难继续纳入新的信息片段并将它们联系起来。同样地,作者已经具备了全部的动机,他们明白为什么你应该在意这些观点,为什么你应该咬牙攻克难点,但读者并不具备这些。当然,对作者来说这很容易,因为他们已经完成了困难的部分,而读者没有。我认为,这两方面的缺失——没有作者那样的工作记忆优势,也没有作者那样的动机——往往是人们自以为写出了一篇好的解释,实际上却并不出色的原因。这就是我对解释为何失败的理论。
Rob Wiblin所以我想第一种情况是,当人们说“我跟不上”时,他们可能会增加更多细节。他们在解释中加入更多内容,但这实际上可能让内容更难跟上,或许是因为他们应该做的是简化,而不是追求完全精确。这是事情可能出错的其中一种方式吗?
Chris Olah是的。不过,我认为这并不完全是简化。你不该做的是把一个想法降格处理,却没有真正解释清楚关键内容。但你确实应该认真思考如何减轻读者工作记忆的负担。我觉得有很多技巧可以做到这一点。图表通常很有帮助,因为你可以进行空间排布。给方程添加注释也有帮助,还有思考如何组织解释结构以减少远距离的相互依赖,这确实很有帮助。在页面边缘添加小注释来提醒读者重要内容。我认为有很多类似的做法。问问自己是否真的需要引入某个术语,或者是否可以不用某个人们需要去记住的额外术语。我觉得,是的,所有这些都有帮助。
Rob Wiblin好吧,所以你不仅仅对此感到恼火。你决定真正做点什么来帮助解决这个问题。跟我们讲讲 Distill 吧。
Chris Olah是的。让我尤其沮丧的是,有很多非常出色的解释性文章,人们只是把它们写成博客帖子,而这并不被视为真正的学术贡献。通常这对他们升职、受聘之类的事情没有帮助,至少在学术岗位上是这样。在我看来,创作这些真正有价值的工作——解释性文章,以及我也很重视的交互式可视化内容——根本得不到回报。如果我们能创造一种方式来奖励和支持这类工作,我们就会得到更多这样的成果。
那么我们该如何创造更多激励呢?Distill 背后的理念是,如果我们能创办一本学术期刊,充当那些非正常科学论文的奇特成果与传统学术体系之间的适配器,或许就能让人们获得职业回报和支持,就像他们去做更传统的学术贡献所能获得的那样。是的,我们创办了一本期刊,这就是我们认为它会有帮助的核心论点。
Rob Wiblin是的。那进展如何?你认为你的核心论点大致正确吗?还是说,就像人们常遇到的那样,在真正尝试解决问题的过程中学到了一些新的东西?
Chris Olah是的,我认为这个论点有很多部分是错误的。我不再相信的有两点:第一,缺乏回报是这类工作无人做的主要障碍。我更倾向于认为,人们不做这项工作是因为它很难,而那些确实在做的人,是出于一种热情——他们内心深处觉得自己必须去做,或者就是非常兴奋地想做。很难想象存在一个世界,职业激励足以让人们因为这个原因而去做这项工作。即便你把这类工作当作正常的学术贡献来对待,你的教程被视同普通论文,但产出它却要付出五倍的努力。这不是人们会去做的。
Rob Wiblin好的,所以如果我没理解错的话,你认为你有一点说对了:确实没有足够的学术或声望层面的动机去把观点提炼工作做到非常好。这在一定程度上打击了人们的积极性,但真正打击人们积极性的是他们做起来很费劲,而且要花很长时间。如果这项工作更容易完成,他们也许愿意纯粹出于热爱去做,仅仅因为他们想从知识的源泉中取水来分享给其他人。
Chris Olah嗯,我想说的是,现在在做这件事的人之所以做,是因为他们有着非常强烈的内在动机。在当前的边际上,很难创造出足够大的外部激励来真正改变局面。
我认为这不奏效的还有一个原因。以前我以为,如果这类工作没有发表在同行评审的场合,没有发表在正规学术期刊或会议上,机构就不会认可它。现在我觉得,情况更像是:有些机构非常灵活,会奖励非传统的工作,它们不在乎有没有发表在期刊上,只会根据作品本身的价值来评判。还有一些更传统的机构,看到 Distill 就会想:“这对我们来说太奇怪了,我们不认。”实际上,处于中间地带、会因为这一点而产生很大改变的群体相当小。我认为这两点都让像 Distill 这样的机构存在的必要性比我最初认为的要弱得多。
Rob Wiblin明白了,那你们打算关停它、尝试别的方法吗?还是你认为 Distill 仍然有一席之地,我们应该保留它,即便它无法彻底解决这个问题?
Chris Olah是的。我确实认为 Distill 还在其他方面提供了价值。我认为它仅仅是作为展示解释性文章、交互式可视化和 interpretability 方面可以做成什么样的一个范例,就已经非常有价值了。在这个领域全力以赴能做到什么,仅仅是展示这种可能性就很有用。我认为它也作为元科学的一个实验室发挥了作用,让我们获得了一些公信力去组织一些事情。我们做过一种奇怪的讨论文章形式:当时有一篇颇具争议的论文,我们没有采用同行评审,而是找来一群人直接撰写讨论这篇论文的文章,然后我们把它们汇总起来并加以总结。
人们花了几个月时间去写这些,实际上就是评论文章。我认为那是一次非常酷的实验。还有我们正在做的所谓“spreads”的东西,也就是收集一系列文章,围绕一个主题层层递进的短文。我觉得这些似乎也相当成功,而且非常有趣。所以这些都是我对 Distill 感到欣慰的地方,我认为是积极的。但它的运营成本也非常高。我觉得我在创办之初没有充分认识到的一点是,它会变得多么有政治性——有一部分人对我们很不满,因为他们觉得我们在自己的期刊上发表文章是一种腐败行为。
因为这个圈子非常小且小众,很多做这项工作的人……那些投入大量精力创作交互式科学论文的人,往往形成了一个关系紧密的小圈子,他们不是直接参与运营 Distill,就是认识运营 Distill 的人。从外部看,这显得近亲繁殖、腐败不堪,而且人们对此很不满。唉,我也不知道。应对这种事确实不太愉快。
Rob Wiblin是的,听起来确实棘手。好吧,这其实非常有趣,而且我想也并不罕见——你在尝试解决问题的过程中,对问题的实质本质有了更深刻的理解,也许基于你现在掌握的一切,你会尝试不同的方法。但 Distill 在我看来真的很酷。我在为这次访谈做准备时浏览了网站,就视觉质量和解释质量而言,它比我通常不得不读的那些论文好太多了。所以它肯定实现了那个目标。
Chris Olah谢谢。是的,能参与其中真的很棒。我想除了我自己参与撰写的论文之外,还能支持很多人去创作这类论文,这让我感到非常自豪,也是一件很酷、很特别的事。
Rob Wiblin好了,我们这次访谈快没时间了。不过我想还是回到一些个人话题上。为了更了解你,如果你必须彻底转行,而且在某种程度上变得完全不在乎让世界变得更美好,那么最放纵自我或最令你愉快的职业会是什么?你有没有想过这个问题?
Chris Olah天哪。嗯,有一件事我真的很想做,就是教小孩子数学。我常希望能更多地与小孩子互动。我觉得教书非常令人愉快。我有时会做白日梦,琢磨“我要怎么教这个?”你能把 group theory 做成给小孩子玩的桌游吗?比如有 Cayley diagrams 这类东西,你可以利用它们。或者有时我会帮朋友照看孩子,我会做实验,比如打出一些绳结,然后让他们猜这是不是 unknot 之类的。所以我想我会从中获得很多乐趣。
Rob Wiblin教孩子可是份正经工作,Chris。这就是你能想到的最放纵自我的事?这活儿很累人的!
Chris Olah嗯,我不知道。我想以某种方式去做……我想我只是在最大化个人乐趣。可能是一份非常兼职的工作,或者类似这样。
Rob Wiblin是啊。有一幅 xkcd 漫画是怎么说的来着,“当别人让我描述理想工作时,我总不确定该说得多字面意义上的真实。”而那个人真正的理想工作,我想是从烘干机里清理 lint,然后用光剑劈一扇门,之后退休去过奢华生活。
如果我要自私且放纵地设想你可能选择的另一种职业,我会非常乐意读到 Chris Olah 做博主或写 Substack,或者别的什么,也许是 Twitter,虽然你已经在用 Twitter 了。是的,你的网站上有很多非常有趣、令人愉悦的文章,我很幸运地在为这次访谈做准备时带薪读到了它们。其中有一篇特别突出……大家可能熟悉 micromort 这个概念,即百万分之一的死亡概率。
而且我想,我最近注意到,人们正把这个概念应用到越来越多的领域。大家可能知道,有效利他主义社区中的一些人做了一个很棒的网站叫 microCOVID.org,你可以在上面详细描述你做过的一件事:在哪个国家、有多少人、持续了多久、拥挤程度如何、在室内还是室外,从而算出你承担了多少百万分之一的新冠感染概率。所以,如果你在室内接触了一位新冠感染者,你就会累积 100,000 microCOVID,也就是 10% 的感染概率。但在日常生活中,你累积的是一、二、三、四、五、六这样的 microCOVID,人们可以用它来判断自己愿意承担多大风险,并以一种更连贯的方式做出那些通常很难做的风险收益判断。
而你把这个百万分之一概率的概念巧妙地应用到了“micromarriage”上。你在文章里谈到,当你进行社交活动或日常生活时,你可以想象,每多认识一个人,你就在累积百万分之一遇到此生挚爱的概率,遇到一个能与之建立真正美满关系的人。你能给我们展开讲讲吗?
Chris Olah是的,我想这种发明单位来思考问题的技巧是我非常喜欢的一个方法。在我们深入之前,我想先提供一些背景。我写那篇文章带点幽默性质,但背景是,我其实经常很难说服自己去参加社交活动。当我在一个活动上不认识太多人,又不能只靠聊研究来撑场面时,我常常觉得那种场合很有压力,经常就不想去。
但我也真的很想有一天能成家、找到伴侣,而这需要你进行社交。我想,去参加朋友办的晚宴派对,或者去别的社交活动,甚至去约会或和某人谈恋爱,这些事中有很多——派对并没有让你认识任何人,或者这些其他事也没有朝着你希望的方向发展——这真的很令人沮丧,也很艰难。
所以我有时会觉得,试着这样想会很有用:“嗯,虽然这次没成,但其实它本来是有可能带来某种结果的。”是的,你可以用这个来激励自己,也可以在一定程度上抚平情绪,或者让自己看到其实正在取得进展,即使这些事有时挺让人沮丧的。
Rob Wiblin是的,这很有道理。我想,那些认真约会、想要找个人共建生活的人,往往会感到非常挫败,这已经成了老生常谈,因为那个门槛天然就很高。如果你真的要和某人共度几十年、一起抚养孩子,那你肯定想做好功课,认真确认这个人是否真的适合和你共建生活。但这就意味着,也许最好的办法就是大量约会,甚至开始多段关系的萌芽,而这会占用大量时间。而且从最优策略来看,其中大多数最终都会失败。但当你从狭义上看似乎总是碰壁时,你很难提醒自己其实一切进展顺利——
Chris Olah这里存在一种脱节:你理智上知道“这完全正常,是预料之中的,事情大概本该就是这个样子”,但日常体验却是你不断在尝试那些困难的事。分手非常痛苦,感觉自己毫无进展也很难受。所以我想,这就是为什么我发现这种思考方式很有用。
Rob Wiblin是的,退一步说,从整体上思考这种 microX 概念,我想它真正有用的情况似乎是在概率较低时。嗯,我猜是对于那些低概率事件,但又没到那种低到可以忽略不计的程度。
Chris Olah我想我会更明确地说,我认为它们适用于低概率、高影响的事情。
所以,在这些情况下,你可能会让自己有点困惑,因为涉及的概率非常小,如果你仅从概率的角度来思考,这种视角本身就会让你感到困惑。但影响却非常大,只有将两者相乘来考虑,你才能得到一个便于思考的、逻辑自洽的单位。
Rob Wiblin是的。而且我想对于其他事情,你可以用千分之一来衡量。
Chris Olah是的,有时候我也会用 milliunits 来衡量一些事情,当概率看起来稍大一些,而事情的整体重要性又稍小一些的时候。有时那才是一个自然的尺度。
Rob Wiblin是的,那么这为什么能帮助我思考这些事情呢?我想,一方面,当你从概率的角度思考,或者仅凭直觉时,100 micromorts 和 1,000 micromorts 之间的差别感觉并不太大,100 micromarriages 和 1,000 micromarriages 也是如此。它们都模糊地混成了一种感觉:"这不太可能。"但实际上,将其具体化为百万分之一的机会,会让它感觉更可衡量、更真实,就像你在累积这些死亡风险,或者某些非常好的事情发生的风险。你能看到渐进式的进展,也能像对待更频繁的事件,以及日常生活中那些我们更熟悉成败的正常事情一样,去权衡机会与风险。
Chris Olah嗯,我认为这没错,但我觉得还有一件非常有趣的事会发生,那就是,当你花更多时间用这些单位来思考……你花了那么多时间思考距离,以至于英尺、米和公里……我猜对很多人来说也许是英里……都成了直觉性的单位。同样地,我认为如果你思考这类事情,100 micromarriages 或 1,000 micromarriages 会在某种意义上开始让人觉得是有意义的东西。
现在对我来说,我会想:"天哪,1,000 micromarriages?那可太多了。10,000 micromarriages?简直不可思议。"而这些东西开始让人觉得有意义。然后,如果你去了某个活动,遇到了一群人,并且如你所说,累积了这么多 micromarriages,这就有了一个你通常能获得的基准尺度之类的,你会感觉:"哦,是的。那次进展真的很顺利",即使在某种意义上并没有什么具体的结果。
Rob Wiblin是的,就拿 micromarriage 这个度量来说,我想这也让我更新了对于在某个特定社交活动中可能获得多大收益的认知。因为我想,大多数人最终都会结婚,通常是和一个他们相当喜欢的人,而且他们会在一起相当长的时间。那么通常需要参加多少次社交活动才会发生这种事呢?我是说,大多数人在年轻时并没有时间参加超过 1,000 次可能遇到某个人的社交活动。对很多人来说,这个数字可能更接近 100。所以实际上,在任何一次特定的社交活动中遇到某个可能最终与之建立严肃关系的人,概率可能大约在百分之一到千分之一之间。因此在直觉层面,这在任何具体实例中都不太可能。但实际上,如果你参加了一堆活动,那累积起来真的很快,这就是为什么很多人最终都成双成对了。
Chris Olah是的,我是说,我认为这假设了参加社交活动是人们遇到伴侣的主要机制,而这可能并非如此。也可能是通过朋友介绍,或者在线约会之类的方式。
不过是的,我认为这些事情可能真的非常重要。而且我觉得这是如此改变人生的事情,是如此可能有巨大积极意义的事情。是啊,我不知道。我有时候,也许……甚至不是也许……我肯定是个相当奇怪的人,所以这对别人可能没什么用。但我经常惊讶于自己花了那么多时间,比如,思考线性代数,试图真正深入地思考线性代数或其他这类智力话题,相比我在认真思考那些将极大地塑造我未来的事情上所花的时间却那么少。是啊,我不知道,对我来说,努力去仔细思考这些事情似乎是很自然的。
Rob Wiblin好的,那么我们想把这个概念应用到低概率、高影响的事情上。我们已经有 micromort 了。死亡,那似乎是件大事。我想我们还有 microCOVID。COVID 不如死亡那么严重,但也不好受。我们还有 micro-important relationship。还有什么其他的呢?其他重大人生事件是什么?我想可能还有找到一份非常好的工作或职业?
Chris Olah是的,我认为这完全是有可能的事。是的,我觉得这完全说得通。我有时发现这有助于思考痛苦。我会想我所经历过的最痛苦的事情,然后是它的千分之一。接着我就可以用这个来思考某件事会涉及多少痛苦,所以我有时觉得这很有用。
Rob Wiblin是的,这有点阴暗。但 microfriendships 呢?我认为 micromarriage 的一个令人欣喜之处在于,它将这个到目前为止我只见过被应用于负面事物的东西,也应用到了积极的事物上。
Chris Olah是的。嗯,我想相关的一点是认真思考极端的上行收益,而不仅仅是极端的下行风险。我认为我们常常专注于避免极端的负面结果,但这些同样重要甚至更重要的极端正面结果,我想我们常常不太去想。所以是的,找到一份出色的工作,找到一个伴侣。
而且我觉得有一点有点棘手——尤其是关于朋友这件事——那就是我认为我们缺乏足够的词汇来描述……一个人将成为你余生的挚友,或者一个非常亲密的朋友,并将某种程度上改变你的人生,这与那种只是泛泛之交、你很喜欢和他们见面,但并不能以同样方式改变人生的人,是有区别的。
而且我认为婚姻,希望如此,能够相当明确地将你归入"那个会改变你人生的人"这一类别,并希望能真正极大地改善你的生活。是的,我觉得工作也一样,在某种程度上你需要明确那是真正出色的工作。我不知道,microbestfriend 之类的其实是个非常有趣的单位。说起来有点拗口,但我认为我最亲近的朋友确实极大地改善了我的生活,对我来说极其珍贵,而为了获得千分之一的机会去结交另一个那样的朋友,我愿意付出很多。
Rob Wiblin是的。我认为作为一个社会,我们可能低估了友谊的价值。人们的生活结构中有许多因素会导致他们的友谊在三四十岁、五十多岁时逐渐萎缩,如果人们不主动努力维系,最终他们的朋友圈会变得相当小。但我想这可能是改天再聊的话题了。
我今天的嘉宾是 Chris Olah。非常感谢你再次来到 80,000 Hours Podcast,Chris。
Chris Olah非常感谢你,Rob。很高兴能来这里。
Rob Wiblin如果你喜欢这期节目,而且还没有听上周的第 107 期 Chris 参与的节目,我强烈建议你回去听一听。
如果你有兴趣利用自己的职业生涯,像 Chris 一样致力于安全地引导 AI 的发展——或者致力于解决我们在节目中讨论的任何问题——那么你可以免费申请与我们的团队进行一对一交流。我们新招了一些员工,并取消了申请职业咨询的等候名单,因此我们的团队很期待与更多忠实的播客听众交流。
他们可以讨论你该聚焦哪个问题、审阅你的规划、为你引荐导师,并推荐适合你技能的岗位。只需访问 80000hours.org/speak 了解更多信息并申请。
The 80,000 Hours podcast 由 Keiran Harris 制作。
完整文字稿可在我们的网站上获取,由 Sofia Davis-Fogel 整理制作。
感谢收听,下次再会。
The 80,000 Hours Podcast 围绕世界上最紧迫的问题,以及你如何利用职业生涯去解决这些问题,提供异常深入的对话。我们邀请来自广泛职业道路的嘉宾——从学者、活动家到企业家和政策制定者——分析支持或反对致力于不同问题的理由,以及解决这些问题的最佳路径。
如需提供反馈或推荐嘉宾,请发送邮件至 [email protected]。
我们精心挑选了 10 期核心节目,帮助听众理解强大的变革性 AI 的潜在利与弊。欢迎查看“The 80,000 Hours Podcast on AI”。
可在此收听,或在任何你获取播客的平台收听:
如果你是新听众,请访问播客主页获取收听建议,或浏览我们的完整节目存档。
订阅每周的研究更新,以及工作和其他参与机会。
想用自己的职业生涯去解决紧迫的全球性问题吗?
80,000 Hours Limited 是一家在英格兰和威尔士注册的非营利担保有限公司(注册公司编号:15746854)。
请联系我们,提出建议、改进意见或勘误。
我们尽力提供有用的信息,但如何使用这些信息由你自行决定。我们对因使用本网站信息而导致的任何损失不承担责任。请参阅我们的完整法律免责声明、网站隐私声明和使用条款。另请参阅我们的 cookie 声明并调整你的 cookie 偏好设置。
© 2012-2026 – 保留所有权利。如果你希望重新发布、翻译或改编本作品,请联系我们。