📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

The Man Who Might SOLVE AI Alignment — Dr. Steven Byrnes, AGI Safety Researcher @ Astera Institute

Doom Debates3:15:17

Transcription

您的首要任务是解决技术性通用人工智能(AGI)的对齐问题。正确。>> 是的。我希望有一个计划,一个技术计划,这样人们就能大致了解要编写什么样的代码,在哪里编写这些代码,并且通用人工智能不会试图杀死它的程序员,也不会试图杀死它的用户,更不会试图杀死其他所有人。[音乐] 欢迎来到“末日辩论”。史蒂芬·伯恩斯博士是阿斯特拉研究所的人工智能安全研究员。他拥有哈佛大学物理学和数学学士学位。他在加州大学伯克利分校获得了物理学博士学位。他的论文是关于太阳能电池、激光物理和物理化学的。他还曾在哈佛大学做过物理学博士后,研究热力学和光学。然后,从 2015 年到 2021 年,他在一家名为德雷珀(Draper)的非营利应用物理研究和开发实验室工作。之后,自 2021 年以来,他一直从事通用人工智能安全研究,最初是独立研究,现在在阿斯特拉研究所工作。现在,您可能在想,嗯,这个人听起来像个普通人。一秒钟。这个人实际上是货真价实的。他在高中时是美国数学奥林匹克竞赛和美国物理奥林匹克竞赛的获奖者。他还在西门子-威斯汀豪斯竞赛中以一项数学项目获得全国第一名。所以,当我有一位客人带来如此强大的智力和成就时,我总是很高兴。他的研究成果令我惊叹,因为他的文章,我鼓励大家去看看。链接在节目说明中。他的文章非常出色且详尽,我几乎百分之百同意他的所有论断。我邀请他参加“末日辩论”,是为了问他一个与几周前我问吉姆·巴布科克同样的问题。什么是主要的末日情景?我们将讨论史蒂夫对真正通用人工智能的看法,它何时到来,他的主要末日情景是什么,以及如何在技术层面真正解决人工智能对齐问题。史蒂夫·伯恩斯,欢迎来到“末日辩论”。>> 谢谢你邀请我。>> 好的,有很多事情要谈。在过去的几周里,我一直在深入研究史蒂夫的世界,总的来说,我非常佩服。我觉得你就像李白之于牛顿,你们在很多方面都在独立思考。你们每个人都在相互印证,但似乎你们是从不同的方向切入的。这样说公平吗?>> 我认为埃莱泽有一些好想法,我试图在注意到时内化并模仿这些好想法,并且不声称我写的所有东西都是我独立想出来的。>> 公平。那么,我想更深入地探讨一下您认为自己的思维优势是什么,因为您似乎结合了多种技能,我将其描述为思维超能力,因为您不仅数学很好,而且还结合了独立研究和综合大量概念,并写出了我认为非常有意义的综合性文章。那么,您认为自己独特的思维超能力是什么?>> 嗯,也许其他人应该自己决定我擅长什么,不擅长什么。我确实认为我的性格非常适合我目前的工作。我讨厌动手工作,而且我在这方面很糟糕,而且我也不必做。我讨厌管理和指导,而且我在这方面也很糟糕,而且我也不必做这些。我确实喜欢在技术问题上进行长时间的在线辩论。我早在 20 年前就作为维基百科编辑做过这件事。我一直以来在我的许多空闲时间里都在这样做。这似乎是我非常擅长的一件事。而且我有时会听到其他独立研究人员在工作的某些方面感到挣扎,而这些方面对我来说似乎很容易。所以在这方面我算是幸运的。>> 没错。是的。我看到您花了数十年的时间来帮助在线清晰地解释事物,而许多关于物理学的维基百科文章都有您贡献的大量段落,对吗?>> 是的。是的。我写了很多维基百科的物理学文章。当然,自从我上次编辑它们以来,它们都被彻底改得面目全非了。你知道,我过去十年里真的没有怎么编辑过。>> 嗯,但您给了他们一个很好的开端。>> 是的。>> 嗯,我读到您研究冷聚变的历史时,印象深刻。您在您的网站上写道,众所周知冷聚变是不存在的,但我不想听信任何人的话。我想自己去核实。因此,我将仔细阅读论文和研究冷聚变支持者的论点作为我的爱好。经过四年的 29 篇博客文章,我得出结论,主流共识是正确的。确实不存在冷聚变。与此同时,这个博客也是写关于量子光学、核物理、相对论量子力学、玻色-爱因斯坦凝聚、统计力学等许多有趣教学帖子的绝佳借口。所以,当我读到这个时,我想,好吧,为了能够进行这样的练习,肯定有很多独特的因素在起作用,对吧?因为我们大多数人会说,“好吧,我只是谷歌一下冷聚变是否真实。”嗯,似乎可能不是。好吧,我退出了,对吧?那就是我。但您却说,“哦,让我来学习一点相对论量子力学,并写 29 篇关于这个及其相关主题的博客文章。”所以,对我来说,这就像,“好吧,你拥有基础的数学和逻辑才能。你擅长学习,对吧?深入研究这种独立研究。你想要亲眼看看为什么某件事是真的,而不是仅仅从教科书中学习。然后你还有生产力方面,你会真的去写点东西,对吧?你不会拖延很久才写一篇帖子。似乎你的产出很高。这是对你技能的良好概括吗?>> 是的,听起来确实如此。我不知道。>> 我看到的另一件事是优先事项。所以,您似乎品味不错,对吧?您进入一个领域,不会只是陷入其中某个随机的方面。您会说,“好吧,这些似乎是重要的想法。让我专注于那些。”同样,这也是艾尔扎尔所拥有的。您是否注意到自己有这种感觉,“哦,是的,这就是重要的。”而其他人却在浪费时间?>> 嗯,最终我们会发现人工智能是否会杀死所有人。从天堂之门,我们可以决定我的工作是否富有成效。所以,在这方面有点令人恐惧。我尽我所能。我想我正在做重要的事情并取得进展。我敢肯定,许多,希望大多数其他人也会对自己的工作说同样的话。是的,我,时间会证明一切。公平。好的。我注意到的另一件事是,尽管您的背景是物理学和数学,但您似乎对神经科学非常了解。这怎么发生的?>> 是的。在我完成了我最后一个爱好,也就是您提到的冷聚变博客之后,我准备开始新的爱好。这大约是 2018 年、2019 年,我决定我的下一个爱好将是通用人工智能安全。我并没有对自己抱有很高的期望。所以我想,我至少可以,你知道,在别人的博客文章上留言,写一些教学内容之类的。于是我开始接触它。我写了几篇关于这个新事物 GPT2 的博客文章。但最终,我听了一个播客,其中杰夫·霍金斯(Jeff Hawkins)似乎在亚历克斯·弗里德曼(Alex Freriedman)或类似的人那里,他说杰夫·霍金斯理解大脑,而人类智能的秘诀在于新皮质,大约占大脑的 70%,包括视觉区域、运动控制、推理、语言、年龄等等。他说,“事实证明,整个皮质或多或少是一个统一的学习算法。这是 1970 年代的一种理论。”他说,“它只是一个大的随机初始化的学习算法。”>> 嗯,我不确定他是否会那样说,但我的说法是这样。嗯,我和杰夫·霍金斯一样,正在全力理解这个学习算法是如何运作的,并且我将发明通用人工智能。嗯,这将是了不起的。所以,这就是杰夫·霍金斯的推销。>> 您第一次听到杰夫·霍金斯说这些话是什么时候?您是什么时候开始关注他的?>> 我想那一定是在 2019 年。>> 这很有趣,因为我实际上在 2006 年左右就开始关注杰夫·霍金斯了,只是听了他的 TED 演讲,然后,你知道,我认为关于智能的书在那时出版了,我当时想,是的,太棒了,这个人明白了。但与您不同的是,我只是想,“好吧,我还是回去当个软件工程师吧。”但您却说,“哦,让我深入研究一下。”>> 是的。嗯,安德鲁,我不知道怎么发音。嗯>> 安德鲁·吴(Andrew Ng)据说受到启发,开始研究深度学习。他看到了大规模学习算法在扩展后可以做很多事情。所以,是的,皮质有,它有多少个皮质微柱?它们都非常相似。它们都有>> 嗯,它们通常有六层。有些有五层,有些有六层以上。有子层,等等。但无论如何,这是一个重复出现的六层结构,这与深度学习中大规模学习算法的最终发展有些相似。但当然,杰夫·霍金斯会说,“不,不,不。那种学习算法是错误的。大脑与深度学习不同。”>> 他说得对吗?>> 我确实认为杰夫·霍金斯说得对,大脑就是皮质学习算法与深度学习非常不同。我不认为杰夫·霍金斯特别的观点都对,或者他即将弄清楚。但是,只是皮质是一个大的学习算法的想法对我来说非常有趣,因为当时似乎没有人在通用人工智能安全领域问这个问题:好吧,如果他是对的,这对安全和有益的通用人工智能意味着什么?而且,他说的对吗?我们应该相信他吗?所以这让我对这个问题产生了兴趣。它也引出了许多相关的神经科学问题。也就是说,如果皮质是一个大的学习算法,那么如何解释发展心理学、进化行为中的一切?所有这些是如何运作的?而且有很多后续问题似乎没有人问。这个皮质统一性成分融入其中的大图景是什么?所以,我开始对此感到好奇,并在过去五六年里从那个起点开始自学神经科学,起初是在我的空闲时间,后来当我找到全职工作时,我能够花更多时间在这上面。>> 酷。好的。是的。所以,现在,我觉得,即使我不能说神经科学是您的资历,但您对神经科学的了解程度似乎与拥有学士或硕士学位的人一样。这样说公平吗?>> 是的,我认为这样说很公平。我很乐意参加任何神经科学知识竞赛。>> 是的,我们得让你参加神经科学奥林匹克竞赛。>> 我对神经科学有很多独特的看法。我可能会在知识竞赛中答错,因为我的答案根据教科书是错误的,但根据我自己的看法是正确的。>> 我明白你的意思。是的。我的意思是,不是,你知道,我没有神经科学的观点。这不是我的研究领域,但我知道一个领域是如何运作的,当所有人都朝着一个方向前进时,就像,“伙计们,这是怎么回事?”你知道,我见过几个领域,比如量子理论,我是那些认为多重世界解释是正确的人之一吗?>> 是的,我是那样的人。>> 是的,我也是。您是什么时候第一次接触到艾利泽·罗夫斯基(Eliezer Yudkowsky)的系列文章,又是什么时候成为通用人工智能的信徒的?>> 我在 2010 年代听过通用人工智能的事情,我想我在 2016 年读了《超级智能》,比它出版晚了几年。但当时我想,这是一个人工智能问题,而我是一名物理学家,所以希望其他人会处理它,因为你知道,我正在做我的物理学研究,我懂什么人工智能?但随着时间的推移,我确实通过我的工作学到了一点人工智能知识,我还做了一些脑机接口和其他一些相关的工作。所以,当 2018 年或 2019 年是时候选择这个新爱好时,我想也许我会尝试一下。所以,那将是我开始认真阅读大量关于这个主题的写作,并阅读艾利泽·尤德科夫斯基(Eliezer Yudkowsky)的大量作品的时候。>> 您确实读完了整个系列文章,对吗?>> 我现在可能已经读完了几乎所有内容。>> 您读过《哈利·波特与理性之道》吗?我想我读得晚多了。>> 您是否还读过他各种 BDSM 和其他类型的虚构作品?>> 我没有读过。>> 我自己也还没读完,所以我也不能说我读完了艾利泽的全部作品,但我读了系列文章的 300%,因为我一遍又一遍地阅读它们。我觉得它们非常有启发性。所以,这是关于您来自哪里以及您如何成为通用人工智能信徒的良好背景。当我们说您是通用人工智能信徒时,为了说出显而易见的事实,这仅仅意味着您同意通用人工智能可能在短期内出现,甚至不是长期,而是短期内,就像一个疯狂的巨大震动,是地球上从未有过的,也许是永远的。>> 嗯,这取决于“短期”是多久。“短期”这个词在空气中弥漫,如果你不认为通用人工智能会在我下午喝咖啡之前到来,那么在这个时代就是长远的时间线。我不认为,我不指望今年会有通用人工智能。我不指望明年会有通用人工智能。我想,我不知道达里奥·阿马迪(Dario Amodei)在抽什么,他认为我们将在 2027 年获得诺贝尔奖级别的原创研究。但如果我说的是在我有生之年将发生什么,那么我当然认为通用人工智能非常有可能,而且是一件非常非常非常大的事情。>> 我想我同意你的看法。但我也认为我们应该澄清一下,当你说“是的,达里奥的原创研究到 2027 年底”时,你给它的概率是多少?显然不是零。可能至少是 1%?>> 我不知道。足够低,以至于它不会影响我日常生活的决策。>> 所以,粗略地说,1% 到 10%?我想人们在实践中有使用概率的方式,那就是有主线,你大致预期的事情,你大致预期的最大化情景,你大致预期的生活,然后你有一些抽象的想法,其他事情可能会发生,理想情况下,你的行动不会在那些其他分支中搞砸世界。但你并不一定生活在这种情景中。然后还有其他事情,你认为它们非常不可能,以至于可以,你知道,做一些适得其反的事情,如果那些事情是真的。我很高兴地报告,我认为我没有在达里奥·阿马迪关于通用人工智能在未来几年内到来并产生超级智能的假设世界中搞砸任何人。因此,我不觉得我需要仔细考虑我给它的确切概率,除了“相当低”。>> 好的,让我们谈谈您的研究方向。所以,10,000 英尺的视角,非常高层。您似乎优先考虑解决技术性通用人工智能的对齐问题。正确。我,是的,我希望有一个计划,一个技术计划,这样,你知道,人们就能大致了解要编写什么样的代码,在哪里编写这些代码,并且通用人工智能不会试图杀死它的程序员,也不会试图杀死它的用户,更不会试图杀死其他所有人。很少有人真正理解技术问题,并且实际上说,“好吧,是的,我理解这个,但我会尝试解决它。”你知道,就像。这基本上是玛丽(Mary)之前试图说的,现在他们已经放弃了。我的意思是,他们仍然有一些研究人员在做研究,但他们基本上说,“是的,我们认为这个问题是棘手的。”而你却在这里说,“嗯,我理解玛丽的想法。我理解为什么它很困难。我认为大多数想法都是正确的,但我在这里试图解决它。”>> 是的。我正在尝试。而且我现在并没有声称有一个可行的计划。所以,时间会证明我是否过于乐观。>> 您是否同意我的评估,即当您环顾四周时,您看到其他人,哦,他们在一家人工智能公司从事人工智能安全工作,但他们对所有艾利泽(Eliezer)的问题并不在同一个页面上,对吧?所以他们甚至没有看到该领域中他们认为自己正在应对的重要障碍。而您看到了,但您仍在尝试解决它。>> 是的,我认为我同意这一点。如今,一种非常普遍的观点是,将当前大型语言模型的对齐问题外推到未来强大通用人工智能的对齐问题,我认为它们将足够不同,以至于该研究计划最终会让人们对未来人工智能的发展感到不愉快地惊讶。>> 嗯。>> 我认为我有点同情,这是一种可以理解的错误,但确实我认为他们错了。所以,我想我在这方面同意。>> 是的,我知道你的意思。所以,嗯,对于观众来说,我认为正在发生的是,您有很多在人工智能公司工作的人,我认为萨姆·奥特曼(Sam Altman)几乎说了出来。他说,“是的,所有这些十年前的人工智能末日论者,他们给了我们所有这些警告,然后我们构建了大型语言模型,我们进入了一个他们甚至无法想象的未来。计算机与我们交谈而不杀死我们。末日论者从未想象过这一点。所以,你必须停止听末日论者的话。”这基本上是许多在这些人工智能公司工作的人的观点,就像,“好吧,现在就忽略末日论者,因为大型语言模型与末日论者曾经想象过的任何东西都不同。”然后,您和我达成共识,就像,“好吧,大型语言模型非常有趣,但它们最终是通往末日论者所警告的同样末日情景的道路上的一个停靠点。”>> 嗯,是的,这就是我的看法。我们还没有真正强大的人工智能。所以,关于它会是什么样子,以及它是否会像我和其他末日论者一直说的那样,具有杀戮倾向,还有待观察。>> 我们将深入探讨这一点,因为您有很多有趣的观点,解释为什么会这样。为什么大型语言模型与即将到来的超级智能人工智能不同。在我们深入探讨之前,让我们回到您的研究计划和您解决技术对齐问题的目标。我想提前剧透一下,告诉大家您最终的研究方向,那就是引用您自己的话,在神经科学大脑算法层面逆向工程人类的社会本能。正确?>> 是的,我认为我们应该将人脑视为执行某种基于模型的强化学习。嗯,它有一个奖励函数,说疼痛是坏的,而饥饿时进食是好的。这些是,还有其他类似的事情。它们有时被称为天生的驱动力或主要的奖励、主要的强化物、主要的惩罚物,具体取决于您所在的领域。我认为这些基本上是一些天生的驱动力,使人类喜欢做某些事情,而不喜欢做其他事情。其中一部分是人类的社会本能,让我们,你知道,想要做学校里“酷孩子”在做的事情,让我们在某些情况下想要感到同情,在其他情况下想要感到恶意,在其他情况下想要血腥。所以,我们拥有一整套社会本能,无论好坏。我认为,当我们制造强大的通用人工智能时,嗯,我的主要期望是,它将比人脑的结构更相似。因此,同样,将有一个奖励函数,程序员可以将其中的任何内容放入该奖励函数中。所以,如果我们希望通用人工智能感到同情,那么理解人脑如何建立同情心将是一个很好的起点。我在这档节目中经常谈论引导人工智能的困难,我认为人工智能公司离能够引导它还差得很远,而且大多数公司,我的印象是,它们甚至承认这一点,你知道,它们承认,“是的,这是一个开放的问题,但我们正在努力解决它,我们将让通用人工智能来帮助我们。”所以,关于人工智能引导很难,这是一个开放的问题,存在很多共识,当然,您也有像 Grok 称自己为“巨型希特勒”这样的问题,这可能不是团队想要的。所以,引导是一个挑战,而我将您的最终目标描述为,这是我的看法,我告诉你这是正确的。您想了解人脑如何自我引导。然后我们就会了解如何引导通用人工智能,或者将引导编程到通用人工智能中,然后最终目标是我们让通用人工智能像智力增强的人类一样引导世界。>> 我大部分同意。我觉得我想反驳说,如果我们真的只谈论今天存在的大型语言模型,那么在让 03 减少撒谎方面确实有改进的空间。我预计一两年内,03 将会减少撒谎和欺骗。我认为,如果你给 Grok 足够的时间,它就会停止称自己为“巨型希特勒”。嗯,我认为这些是可解决的问题,人们正在不断改进并会解决它们。我更感兴趣的是大型语言模型(2025 年)与未来更强大的通用人工智能之间的差异,以及为什么我们应该期望这些差异,如果确实应该期望这些差异的话。嗯,关于您所说的。是的。所以,进化需要构建一个大脑,它能够表现出灵活的行为,以提高遗传适应性,例如寻找健康的食物,在狩猎采集部落中获得高地位,以及吸引配偶。如果进化只是在编程一种反射,就像,如果我的视野中有一个黑暗的、不断扩大的斑块,那么我应该缩回脖子,因为可能有什么东西正朝我的脸飞来。你不需要强化学习来做到这一点。你只需要检测,你构建一个黑暗的、不断扩大的斑块探测器到大脑中,并将其连接到收缩反应,问题就解决了。但人类也系统地表现出灵活的、有动力的、有远见的行为,例如,帮助他们的孩子。了解这一点会很有趣。>> 是的,让我们谈谈解决对齐问题是什么样的,因为这也是问题的一部分,就是连贯地谈论解决方案是什么样的。您有一篇非常有帮助的文章,名为“成功的四种愿景”,您将其分为助手/工具型人工智能、自主型人工智能、人类智能增强或不构建超级人工智能,对吧?这是您的四种区分。所以,我认为这很清楚。我的意思是,助手/工具型人工智能的问题在于,它限制了它的能力。我的意思是,我们已经超越了这一点,对吧?我们说,“好吧,代理,写我的代码。”所以,有一些介于两者之间的事情,我一直认为它属于“雄心勃勃的价值学习”这个术语,即人工智能有兴趣帮助某人 X 实现其长期目标,包括,如果他们需要将某人 X 放入地堡五年,并代表他们进行自主战争,那么他们正在做出某人 X 事后会认可的决定。所以,如果你采取像这样的愿景,并想象它很容易实现,只需说,“嘿,克劳德(Claude),照顾我的长期最佳利益,或者‘嘿,聊天 GPT(Chat GPT)’之类的。”如果你想象一下是这样,那么你就会得到一个东西,它不完全是我所认为的助手型人工智能,它也不完全是我或它,它介于两者之间,但我确实认为这就是一些人的想法。所以,您说助手型和自主型之间的区别可能介于两者之间。>> 我想是的。我不太确定如何准确地表述或思考它。我在这方面仍然有点困惑。但是,是的,当我们谈论解决技术对齐问题时,我将其视为一个更大的图景的一部分,我不想让通用人工智能杀死我。还有一些额外的问题,比如对齐到什么?我们实际上想让通用人工智能做什么?嗯,那里有不同的故事,我现在没有强烈的看法,除了你知道,想要杀死所有人类的人工智能是很糟糕的,而且至少应该有可能做其他事情。>> 自主型人工智能的问题在于,它们可能会失控,没有关闭按钮,而您希望调试它们,但现在已经太晚了,无法调试它们,对吧?这就像单点故障。>> 是的。>> 然后是人类智能增强。我觉得艾利泽·尤德科夫斯基(Eliezer Yudkowsky)现在似乎认为这是圣杯。就像如果我们能够实现人类智能增强,我们将有机会解决对齐问题,而不是通过从头开始构建人工智能来解决,机会不到 10%。所以,这似乎是艾利泽的想法。而且我觉得这很有道理,它给了我们一个不错的机会。你知道,如果你从一个人开始,嗯,你可能仍然会得到一个人。我不知道。嗯,你可能指出,超级充电的生物大脑可能不是圣杯。它可能有自己的问题。>> 是的。所以,如果我理解正确,艾利泽的观点是,它不是非常有前途,而是比其他所有可能性都“不太注定”。嗯,所以,我想,如果这是起点,那么,当然。但是,一个问题是,这可能需要很长时间。另一个问题是,个性是除了智力之外的一个重要组成部分。例如,严伦(Yan Lun)显然非常聪明。嗯,但他对人工智能对齐有非常愚蠢的想法,而且,嗯,我,这些想法,他已经被指出很多次,他对人工智能对齐有误解,而且我认为他有很多动机性推理。你知道,我写过关于他思维的客观错误的文章,但是,是的,嗯,有聪明人,他们仍然,你知道,不听从理性,并进行人身攻击等等。>> 在严伦(Yan Lun)犯错的情况下,我们必须弄清楚有多少是智力限制,有多少是性格缺陷。显然,你知道,仅仅假设某人是错误的,而不是仅仅争论客观层面,被认为是不礼貌的。但我认为你可能是在试图联系这一点,即如果我们扩大严伦(Yan Lun)的大脑,这是否能让我们实现对齐?嗯,也许他会继续犯错,对吧?这基本上是你的意思吗?>> 我的意思是,让我们撇开严伦(Yan Lun)或任何个人,只注意到有聪明人对人工智能对齐有不同意见。嗯,我不认为这仅仅是因为他们的智力有限。我认为其中一部分是动机性推理,然后这又回到了个性和动机以及对真理的追求,这有点难以工程化,我认为个性理解得很差,人们在谈论人类智能增强方面的东西,我认为它们不会直接适用于个性,而且即使尝试也很危险。>> 是的。有道理。现在,您的愿景,基本上您认为最有可能追求的目标。您将其描述为类似大脑的通用人工智能,并具有逆向工程的人类社会本能的更好部分。但它是自主的。正确?>> 嗯,是的,我认为必须有一些通用人工智能在思考什么构成一个美好的未来,并自主地朝着那个方向做出决定,而不是遵循人类的特定指示。嗯。>> 所以,这可以通过多种方式实现。我们可以谈论起点是,“遵循某人 X 的长期最佳利益。”即使某人 X 没有意识到某事符合其长期最佳利益,也要去做。然后,一种潜在的实现方式是,也许人类能够自主地朝着美好的未来行动。我们希望如此。所以,无论人类能做什么,人类在某种程度上都能进行道德哲学。也许足够像人类的通用人工智能也能出于同样的原因进行道德哲学。诸如此类。这似乎值得研究。再次,我,我没有一个我感觉很好的计划,但这是我正在研究的方向之一。>> 好的,观众。现在您对史蒂夫的研究方向以及他所有想法的起源都有了大致了解,这些想法都试图达到这个终点。有了这个背景,在我们进一步讨论对齐问题之前,让我们回顾一下您认为他的一些核心发现,也许它们还没有完全达成共识,但它们非常有道理。我们将讨论您在解决对齐问题的过程中所做的核心发现。从这个关于大脑两大子系统的想法开始,即“引导大脑”与“从零开始学习的大脑”。请解释一下。>> 好的。是的。嗯,我不会称之为“发现”,而更像是对已说过的事情的综合。>> 但是的,我认为将大脑分成两部分很有帮助。一部分正在进行大规模的终生学习算法。另一部分正在进行,是的,我称之为引导子系统,它充满了所谓的“业务逻辑”。所以,“业务逻辑”是软件工程中的一个很酷的术语。例如,如果您正在制作税务软件,它可能会说,“如果您有超过 200 名员工,则填写表格 529X”,并且“如果您在德克萨斯州注册,则附加表格 XXX”。所以,所有这些都是您可能想为之编写代码的内容,但您编写的代码直接与您试图满足的功能规范相关。所以,如果我是进化,而我正在构建一个大脑,我同样需要大量的业务逻辑。如果,如果一个人有生育能力,那么他们的性欲应该增加。如果一个人,你知道,濒临饥饿,那么他们的疼痛耐受力应该下降,抱歉,应该上升,而且,你知道,他们应该感到饥饿信号,而且他们应该,你知道,停止进行非寒颤性产热过程,这些过程会燃烧能量来抵御体温过低等等。有大量的,可能数百或数千行,实际上是代码行,进化需要构建到大脑中。我认为,如果您看看下丘脑,看看脑干,以及其他几个大脑区域,它们都充满了这种业务逻辑。而如果您看看皮质,看看小脑,纹状体,那么您看到的是这些大规模的学习算法,我认为正确的思考方式是,它们在效果上是随机初始化的。嗯,然后有,你知道,损失函数,有超参数,有学习规则,并且在整个生命过程中。所以,它们在刚形成时是完全无用的,但到您成年时,您的大脑皮质正在为您做各种有用的事情。所有灵活的学习行为都来自这些系统。>> 我作为一名没有真正研究过神经科学的人,但偶尔会读一些通俗读物,显然我读过您的文章。我认为您可能是对的。对我来说,可能性更大。就这些而言。所以,让我回顾一下我的理解,为观众。基本上概括您刚才所说的。所以,您有两个大脑。您有引导大脑和从零开始学习的大脑。引导大脑主要包括脑干和下丘脑,对吗?因为大脑有所有这些区域。您说这两个区域,我认为它们也最接近脊髓,对吗?就像最原始的区域。是这样吗?>> 所以,嗯,我不同意“原始”这个词。如果您回到 5 亿年前,回到我们与蠕虫的共同祖先,它们已经拥有引导子系统和学习子系统,就像我们一样。但是,你知道,学习,但它们都比我们现在简单得多。>> 这并不是说人类的下丘脑停止进化了。我们与黑猩猩在许多重要方面有着不同的本能。让黑猩猩畏缩的东西与让我们畏缩的东西不同,等等。是的,我认为,从发育早期来看,事物具有更多的引导控制,也许您可以追溯到基因和 DNA,对吧?那些是最终的,我不知道,最终的动力源,它们是自然选择作用的对象,然后它们围绕它们构建身体,然后身体的较晚形成的部位,对吧?比如大脑,皮质是进化上新出现的,所以直观上可以理解,好吧,皮质是为了服务于脑干而出现的。>> 汽车有两个档位,我不会说其中一个服务于另一个。>> 你知道,嗯,早期海洋中挖掘的微小蠕虫状生物,它们仍然需要学习如何在环境中导航,它们仍然需要记忆,它们仍然需要,你知道,强化学习,它们仍然需要,需要,需要这种终生学习,因为并非所有关于您的情况都可以通过基因组以反射的方式来指定。所以,反射是好的。如果您看到视野中有一个黑暗的、快速扩张的斑块,那么畏缩几乎总是一个不错的选择。但是,你知道,蠕虫可以学会,你知道,这里有一个捕食者,那里有捕食者,而且这可能与你祖父母 20 年前捕食者在哪里不同。那些在你一生中学习的东西一直都很重要,而且,我们应该认为它们也很原始。所以,再次,嗯,人类皮质是脊椎动物大脑皮层的直接后代,甚至可能与果蝇的蘑菇体有关。>> 好的,我猜我有一个天真的思维模型,就像,“好吧,大脑首先是总和,然后它从大脑中长出皮质。”但您说的是,“不,不,就像皮质也有一个原始的类似物。”>> 是的,皮质可以追溯到很久以前。它们都从胚胎神经板同时生长。>> 所以,是的。所以,再次放大。所以,您有引导大脑,即脑干和下丘脑,您声称,对吧?并非 100% 证实,但它似乎是一个不错的模型。>> 以及其他一些零碎的部分。是的。>> 确切。确切。而且它只占体积的 10%,这对我来说很直观,因为,是的,我的意思是,引导,你知道,如果你看一个程序中的业务逻辑量,很多时候,管道和库以及传感器占了程序的大部分。然后引导部分是相对较少的代码行,对吧?>> 是的。尤其是在人类身上,学习子系统占大脑体积的 90% 以上,我估计,我估计超过 90%。而且我认为它有点像,你知道,GPT,人们写了很多代码,但他们并没有写多 10 倍的代码,当他们使参数数量增加 10 倍时,当他们从 GPTN 升级到 GPT N+1 时,或者,你知道,>> 对,>> 有太多的学习参数,以至于它淹没了其他一切。所以,同样,当我们从黑猩猩进化而来时,我们的皮质变成了,你知道,三倍大还是什么的,我们的纹状体也变成了三倍大。所以,这就像放大了学习算法,这使得人类能够在一生中学习更多,并学习更丰富、更复杂的关于世界模型。但是,这可以通过比在脑干中构建三倍多的反射所需的进化设计少得多来实现。>> 在您的世界模型中,您的大脑模型中,引导大脑,它试图使用的业务逻辑实际上可以追溯到遗传信息和跨代基因层面的学习,这是一种缓慢的学习类型,与皮质相比,它几乎无法累积太多信息,而皮质就像基因可以这样说,“好吧,是的,我想要这个两倍大。”然后它在单个生命周期内使用两倍大的皮质来填充大量的动态学习。>> 是的,确切。就像放大深度学习模型会使它们学习到更酷、更好的东西一样。>> 确切。好的。所以,我们谈论了引导大脑,然后是“从零开始学习的大脑”。它是最大的区域。我想它占大脑体积的 90% 左右。正确?>> 是的,超过 90%。我不知道确切的数字。这取决于你怎么算。>> 是的。根据您的说法,学习大脑的主要子部分是当然的大脑皮层,对吧?这是最现代、体积最大的部分,但您也包括了小脑,这可能是一个非传统的选择,对吧?因为我所知道的关于小脑的一点点,我认为它只是关于,你知道,协调肌肉运动。是的,但如果你放大到小脑,你会发现它基本上是相同的模式重复出现。这个有浦肯野细胞和攀爬纤维的东西,你知道,你会发现一个惊人的数量的颗粒细胞。而且我认为,大脑中有一半的细胞,或者什么的。而且我认为正确的思考方式是,它是一个大的学习算法。它对于通用人工智能来说不是一个特别重要的算法。但它是,我们可以谈论我到底认为它做什么。但我确实认为,正确思考小脑的方式是将其视为一个大的学习算法。>> 我觉得小脑可能是一个类似大型语言模型的学习算法,对吧?因为,如果它只是试图学习如何精确地协调肌肉。这不正是大型语言模型范式似乎擅长的事情吗?>> 我认为你不应该相信你读到的关于小脑的一切。所以,所以小脑涉及运动控制,但它也涉及情绪,也涉及思维。而且我认为正确思考小脑的方式是,它只是一个昂贵的、巨大的解决方法,用来弥补大脑非常慢的事实。所以,大脑中的一切都有非常高的延迟,因为信号是通过这些轴突传输的,而不是像我们习惯的计算机芯片上的电子信号那样。如果你到处都有这些疯狂的延迟,你可以做的一件事就是设置一个学习算法,它只是观察某个信号,然后说这个学习算法的目标,损失函数是预测这个信号在,比如说,2 秒后会做什么。所以,你有一个非常清晰的损失函数。只需等待 02 秒,你就会看到你的猜测是对还是错。基本上,你所做的是将这个信号在时间上向前推移 02 秒,但代价是会产生一些噪音。这通常是一个不错的权衡。>> 好的,这很多都说得通,因为首先,你知道,你说训练,奖励函数就是等待 02 秒。这不就像你在用无监督学习训练大型语言模型,然后它的信号可以是下一个 token 吗?>> 是的,你可以认为它是一种预测性学习,就像大型语言模型正在进行预测性学习一样。>> 好的。嗯,我,我,我必须相信这是真的,因为小脑的最后三个字母几乎是 LLM。所以我真的想把小脑看作是大脑的 LLM 部分。>> 是的,我喜欢。>> 开玩笑说,这是,我看到了很多联系,因为你和我,我们都同意大脑的架构可能比大型语言模型更复杂,但我也觉得有一个大的涡轮增压器,对吧?就像,也许一个好的比喻是,想想渲染图形。拥有实际的物理模拟可能很有用。就像在计算机图形学领域,我们可能不想丢弃实际的光线追踪,实际的物理模拟。但似乎物理模拟器可能每秒只能渲染一帧,然后大型语言模型层可以“幻觉”下一秒。在我看来,这就像人脑在发生的事情,我们有那些更聪明、使用不同架构的部分,但我们也通过小脑或其他东西来插值。嗯,关于小脑,重要的是要知道,有时有些人出生时没有小脑,但他们过得还不错。他们走路有点奇怪,我认为他们可能不是下一个爱因斯坦,但他们可以找到一份工作并独立生活。>> 你知道,他们,他们,在人类的背景下,小脑真的,我真的不认为我们需要考虑它。我不认为它在做任何重要的事情。我认为皮质也进行预测性学习,而且我认为预测性学习总的来说是一件非常有用的事情,这就是为什么人工智能领域的人发明了它,或者我猜是重新发明了它,这也是为什么进化也在到处使用它。>> 你知道,那些没有小脑出生的人的问题是什么?因为我听说他们很难协调自己的动作,对吧?这对我来说映射到“就像一个视频,你每秒只能得到一个关键帧”的想法,对吧?所以,它只是有点卡顿,对吧?这是公平的描述吗?>> 是的,你,嗯,根据我所提倡的延迟假说,你会认为它就像,你需要大量的在线反馈来控制运动。所以,你知道,每秒的几分之一,你就会注意到你的脚稍微偏离了它应该在的位置,或者,

地板只高了一点点。所以你需要动态调整。而且,如果你知道,有一个巨大的延迟,你必须把信号一路传到你的脚,与此同时,你的本体感觉信号需要一段时间才能传回你的大脑,你将很难做到那种运动控制调整,因为有这么大的时间延迟。>> 好的。所以,我认为这其中的关键是,我个人觉得我们通过深度学习和大型语言模型所做的事情,我认为我们已经触及了大脑正在做的一件大事。我知道你认为,我同意,这并不是大脑所做的一切,但你是否同意我,它就像大脑所做的事情中的很大一部分?>> 我只会给出那个模棱两可的回答,说大型语言模型在某些方面像大脑,而在其他方面不像。我同意大型语言模型中的预测学习方面也是大脑会做的事情。>> 对。具体来说,似乎是小脑,对吧?我不知道。我沉迷于这个概念,但对我来说,这似乎是一个相当贴切的比喻。再说一遍,皮层也有预测学习。>> 好的,说得通。我之所以认为大型语言模型确实是真正的秘诀,不是全部,而是我认为我们实际上已经掌握了大脑使用的秘诀的一半或某个分数,仅仅因为这些高维向量的想法,它非常有意义,或者它就是如此简单,你只需要一个高维向量,它就可以以一种微妙的方式编码某个事物的语义含义,以及它与其他向量的关系,就像,是的,只是线性操作。你知道,很多词语的真正含义就像它们在高维空间中的坐标一样。这似乎是上帝的旨意,你知道吗?如果它如此强大和简单,为什么大脑不做呢?>> 是的,也许大脑确实是这样做的。>> 好的。我想我们只能说到这里了。没关系。好的。那么,为了再次总结,小脑就像它非常擅长预测,但你并不真正需要它。所以,你知道,如果你想拥有150的智商,那可能不是因为你的小脑贡献了那么多。它可能更多的是你的大脑。而你的大脑占大脑体积的80%。所以,当你从视觉上看大脑时,我猜你主要想到的是大脑的外部,以及所有那些褶皱,你想到的是外层,就像折叠的大脑,对吧?>> 是的。我认为大脑比皮层更宽泛。所以皮层是我花最多时间谈论的部分,它包括海马体,它有三层,它包括新皮层,它主要是五到六层,它是这个皱巴巴的东西。如果你把它展开,它大约有一块餐巾纸那么大。它被极度扭曲以适应人类的头骨,但它,是的,它是一张薄薄的片状物,然后还有所有这些白质,这是皮层如何连接到自身以及大脑其他部分的。>> 请再帮我理清一下。所以大脑、皮层和新皮层,再说一遍。>> 大脑是一个更宽泛的术语,它还包括皮层之外的一些其他东西。我认为它还包括纹状体,我认为这是一个独立的从零开始的学习系统,然后我认为它还包括苍白球,我认为它实际上应该与下丘脑和脑干一起被归类为更多业务逻辑的存储库。关于不同类型的细胞以及它们的结构外观的划分。但当你开始研究它时,你会发现整个皮层看起来与其他皮层非常相似,撇开,你知道,嗅觉皮层与异质皮层以及其他更细微的区别。嗯,你知道,整个纹状体看起来都差不多。所以它包括尾状核、壳核、内侧隔核等等,但它们都包含相同类型的神经元,以大致相同的方式连接,有一些有趣的例外,我们可以深入探讨。所以,我认为皮层是一个大的学习算法,然后纹状体是一个不同的、相对不那么大的学习算法,它与第一个相互连接。>> 你说皮层是新皮层加上纹状体,或者新皮层又是什么?>> 新皮层是一个术语,意思是哺乳动物中新出现的那个部分。所以基本上,如果我们回到我们与蜥蜴的共同祖先,有胎盘动物被认为是拥有100%的三层皮层,称为异质皮层。所以我们仍然有一些三层皮层,包括以导航和记忆而闻名的海马体,以及参与嗅觉的旁嗅皮层。但然后我们也有我们大脑的很大一部分,现在大部分,可能90%以上,是六层。所以大概它做了一些更复杂的事情。我仍然认为它是一个大的学习算法,但它是一个更复杂的算法,它被称为新皮层,因为它在哺乳动物中进化。>> 让我想起吉列剃须刀,对吧?你的皮层有更多的层,就像剃须刀上的刀片一样。你可以学得更好,而人类视觉皮层有所有层的子层。所以如果你真的数一下,你会得到九到十层左右。>> 令人惊叹。好的。好的。现在,说到业务逻辑,你在你的一篇文章中写道,理解这种业务逻辑的纠葛,即在控制大脑中,即下丘脑和脑干,理解这种业务逻辑的纠葛是令人恼火但可能实现的。然后你做了一个练习。你挑战自己去理解笑声,因为你认为笑声完全是业务逻辑。>> 是的。我有一篇关于笑声的文章,我提出了一个特定的连接,一个假设的下丘脑细胞群,以及它的输入和输出。我争辩说,如果这个细胞群存在,它将解释我们日常笑声体验的一切。它在进化上是合理的。它将与我们在黑猩猩和老鼠身上观察到的笑声方式相符。是的,如果你挠老鼠的痒痒,它实际上会笑。你需要,它是超声波的,你需要特殊的设备才能听到。但人们确实会挠老鼠的痒痒,而且在神经科学上是合理的。我不认为有人测量过这个特定的下丘脑细胞群,如果它存在的话,但这是一个任何人都可以进行的实验。我希望有人在某个时候这样做。那将是相当酷的。>> 对。这是你试图做的,也就是基本上逆向工程所有这些业务逻辑的一个特殊案例,因为你基本上说的是,是的,有很多参数。它不会是一行代码。它不会是一个简单的指令。也许会有数千条指令,但有人应该尝试读出所有这些低级汇编语言业务逻辑。>> 是的,我认为那将是一件富有成效和有益的事情。我希望人们能做到。我,所以,有很多人在艺术上做这件事,他们一次测量一个细胞群。我想在这种情况下,你会称之为示踪研究。所以他们测量细胞群的输入是什么,输出是什么。他们测量表达了哪些基因。他们经常进行光遗传学操作,打开和关闭细胞群,看看它与行为有何关联。这些都是真正的黄金标准。你可以从这些研究中学到很多东西。就学习大脑的东西而言,我会用一项这样的研究来代替一百项fMRI研究。与此同时,也有一些团队试图大规模地进行连接组学研究。你不是一次探测一个组并将其与行为相关联,而是采用整个大脑并试图测量一切如何连接到这个巨大的数据集中的一切。所以有一些团队,特别是E11是其中之一,他们正在进行连接组学研究,这是一个令人兴奋的领域。每当我与机器学习人员交谈时,我都会祝他们好运。我告诉他们有很酷的连接组学工作,因为你必须做所有这些非常棘手的图像重建工作。>> 让我们来谈谈语言习得。我认为如果你回到20世纪70年代和80年代,诺姆·乔姆斯基以基本上说“看,语言是天生的业务逻辑,对吧?像它具有结构化的语法,就像硬编码在你的基因里一样,你只是拥有这个大脑,从出生起就知道要寻找什么样的语法。”但我也认为今天似乎有很多在线学习也在发生。我的意思是,我们当然都知道,词典显然是学来的,对吧?那么,你对语言习得的看法是什么?>> 是的,我认为,如果你看看新皮层的语言区域,它们看起来与其他新皮层区域非常相似。我不认为,我认为确实有一些业务逻辑在起作用。特别是那部分说,如果有人,如果你听到人声,你应该注意它。还有那部分说你应该尝试说话。没有这些,人们可能不会有学习语言的动力。所以动力必须来自>> 你知道,上帝不会告诉你什么有趣,什么不有趣。你知道,如果人们有动力去数人行道上的鹅卵石,他们可以整天这样做,并学到很多关于鹅卵石的知识。人类,尤其是人类婴儿,倾向于关注其他人。人们在说什么?人们在做什么?我认为这与动机有关。这必须来自下丘脑和脑干。我对确切的工作原理有一些想法。>> 如果你看看现在能和我们说话的大型语言模型,对吧?理查德·萨顿的教训发挥了巨大作用,对吧?它们只是基于下一个词进行训练,而没有明确地训练语法规则。虽然技术上来说,我想它们在训练过程中也阅读了《怀特》或类似的书籍,但我认为,仅仅通过阅读下一个词,看起来不像《缩小的怀特》或语法教科书是它们学习语法的方式。它们似乎只是使用一种通用的学习算法来学习的。所以这是一个相当大的信号,表明乔姆斯基关于硬编码业务逻辑的数量是错的。就像它更多的是在线学习。而且,如果你考虑进化解释,那么基因试图高效,我们的基因试图将尽可能多的东西卸载到通用学习算法中,并且只硬编码最小的位,因为自然选择很难跟上这些位的完整性。是这样吗?>> 一旦我们开始谈论学习算法,我就会将讨论从业务逻辑转移到归纳偏差。而且我确实认为有一些证据表明皮层的归纳偏差与语言模型的归纳偏差不同。例如,如果我理解正确的话,婴儿会犯一些大型语言模型在训练中不会犯的语言错误,比如过度泛化语法规则之类的。我只听说了二手信息,所以不要引用我的话。但显然,大型语言模型在语言方面的成功证明,至少有可能让一个大规模的学习算法习得语言。而且我认为这是间接证据,同样,皮层也可以是一个学习语言的大型算法,以及它能够做的所有其他事情,比如运动控制、推理等等。你知道有些人谈论,你知道,语言之所以特别,是因为它有递归或其他什么,但你知道,如果你看一张图片中的图片,那是视觉,但它有递归。如果你谈论制定一个有子计划的计划,那就是计划,但它也有递归。你知道音乐可以有递归。所有这些事情都可以有递归。我认为这不是语言的特殊之处。它只是>> 能够做到,那是这个学习算法能够做的事情之一>> 这真是令人难以置信,对吧?我的意思是,如果十年前你问我,你认为这种深度学习算法能处理很多递归吗?我会说,我不知道,伙计,我觉得递归真的需要编程进去,但正如你所说,对吧?它可以处理大量的文本,其中包含大量的递归语法结构,或者像自我指涉的上下文,而且它真的不是问题。只要你不要递归到100层深,没有人会这样做,它看起来就很好。我的意思是,它能处理递归,这难道不令人惊讶吗?>> 是的。人类也无法达到100层递归深度。>> 没错。没错。>> 是的。大型语言模型非常令人印象深刻。它们确实能够遵循递归结构。>> 在这个节目中,我经常问我的嘉宾一个问题,比如,好吧,你认为通用人工智能不会很快到来,因为你认为大型语言模型是有限的,但实际上障碍是什么?我得到了各种各样的答案。你知道,有些人会说,嗯,大型语言模型没有能动性。你知道,它们最终都由人类控制。我说,我不知道,伙计。如果你把它们放在一个循环中,它们看起来就很有能动性。它们只是不断地决定下一步该做什么。所以,这是一个弱例子。我刚刚做了一个反应性剧集,采访了Amjad Msad。Masad说,“嗯,它们不思考新概念。它们只能重新组合。”我说,“嗯,如果你只是不断地重新组合,然后你重新组合你的重新组合,你不能那样创造新意吗?”所以,我从来不相信这些答案,但你正处于说服我大型语言模型局限性的最前沿,因为你也知道,我请来了Andrew Critch博士,他明确地持有一种观点,即没有障碍,你只需要不断扩大大型语言模型,一切都会随之而来,也许会有小的障碍,但我看不到大的障碍。但似乎你看到了障碍,因为当你审视人脑时,你可以写下,不是写下,而是将部分归类为“就像大型语言模型一样”的部分。我的解释是,小脑非常像大型语言模型,但在你看来,人脑中有一些部分正在做一些其他非常强大的智能事情,而大型语言模型永远无法达到,对吧?你看到了某种障碍。>> 嗯,是的,我应该先声明一下,我通常对说服人们相信大型语言模型会扩展到通用人工智能的企业不那么热情。>> 如果我与一个对冲基金研究员交谈,他正在为大型语言模型可能扩展到通用人工智能的应急情况做准备,那么我会说,好吧,这似乎是件合理的事情。我的意思是,我没有那么自信,以至于我不想,我不想发展这个“非大型语言模型通用人工智能安全”的领域。我宁愿吸引新的人加入这个领域。但你问了这个问题,是的,我认为大型语言模型在变得非常强大和危险之前就会停滞不前。我的意思是,它们会在一些更小的方面变得危险,但不会像“机器人军队消灭人类”那样危险,或者“发明瘟疫”等等。你知道,大型语言模型已经处于大规模网络钓鱼的边缘,那将是糟糕的。大型语言模型已经处于虚拟朋友的边缘,就像社交媒体遇上芬太尼,但糟糕得多。这些事情都足够糟糕了,而不用担心机器人军队和瘟疫消灭人类。但如果我们只是谈论实际的“接管世界并消灭人类”,那么是的,我认为大型语言模型不会这样做。现在不会,永远不会,无论是在可验证奖励的强化学习中,还是在脚手架中。我认为它们缺少一些东西。>> 那当然是个好消息,这当然解释了为什么你对未来两年的AI接管不那么担心,因为你认为还有另一个范式转变即将到来,当然,它可能在五年内到来。听起来,如果它在五年内到来,你也不会太惊讶。>> 是的,很难说。我当然不会排除在五年内发生,因为五年内可以发生很多事情。我喜欢提醒人们,五年前,大型语言模型根本不存在,而到了2023年,已经有数十亿美元投入其中了。在2018年,当它们根本不存在时,到2023年,已经投入了数万小时。所以这是五年,是的,五年内可以发生很多事情。>> 对。举个例子,五年前,每个人都说,谷歌停止工作了。我以前可以输入长查询并获得有用的资源,现在它只是一个垃圾邮件页面。就像谷歌不再工作了。而今天,如果你问我对网络搜索的看法,当然,也许我不会直接使用谷歌。我不会把我的查询输入谷歌。但当我把我的查询输入GP03或公平地说,谷歌的AI模式时,我得到了比我梦想过的更好的搜索质量,因为发生的是它花费下一分钟运行一系列自适应搜索查询并推理并为我阅读网页并综合所有内容。我从未梦想过搜索能如此有效。所以我们从“谷歌停止工作”变成了“我的天哪,它奏效了?”>> 是的,五年内可以发生很多事情。还有赖特兄弟中的一个说他离飞行还有50年,然后两年后就实现了。>> 没错。没错。好的。那么,我有一些后续问题,但让我先回到你的两个大脑子系统的模型。我想再仔细看看。让我们以一个简单的目标为例,比如缓解我的瘙痒。比如,我胳膊上痒,我想缓解我的瘙痒。那么,我必须使用我的控制大脑来做这件事,还是我的学习大脑可以自己学习?你知道,小脑可以像“哦,是的,我知道这里的模式。你只需要移动你的手。”>> 我认为抓挠痒痒是一种有动机的行为,一种有动机的灵活行为,它通过终生学习来实现。基本上,故事是这样的,脑干的某个部分,我不知道,孤束核什么的。我不记得确切负责痒痒的是什么,所以它会发送许多信号。所以它会从身体的特定类型的神经细胞那里获得地面真相,这些神经细胞会通过脊髓背角什么的,然后它会向学习子系统的不同地方发送许多信号。一种是发送内感受性感觉输入。所以我们会感觉到一种特殊的感受,我们会将其描述为痒痒。另一件事是发送我称之为非自主注意力。这使得很难思考其他事情,除了痒痒。所以我们想思考数学作业,但我们的注意力通路被这个下丘脑或脑干细胞群劫持了。它迫使我们思考痒痒的感觉。然后第三件事是进入我们强化学习系统的奖励函数,说这种痒痒的感觉是坏的,当我们抓挠痒痒并感受到那种缓解的感觉时,那是一件好事。所以当你把所有这些要素放在一起时,小婴儿就很容易学会抓挠痒痒。>> 那一切都说得通。有没有可能这一切都是绕过控制大脑的短路?比如我们不需要很多业务逻辑来做这件事。>> 我不认为控制大脑里有太多事情发生。我只是认为它是一个小的细胞群,只有一到三个或四个输出。>> 所以,我的意思是,这是我想深入研究的区别,对吧?因为我认为,你认为控制大脑真的不像大型语言模型,它仍然是“人类专属”的一部分,对吧?没有AI被允许,人类专属的秘诀。然而,我们可以看到,像抓挠痒痒这样的行为似乎绕过了它。我想问题是,大型语言模型能做多少事情,比如,你知道,你能把抓挠痒痒扩大多少?如果痒痒是征服世界呢?>> 所以我认为我们应该把控制子系统看作是有点像强化学习的奖励函数。它也做其他事情,但你知道,控制你的心率。但如果我们主要把它看作是强化学习的奖励函数,那么它就有点类似于大型语言模型领域的RLHF奖励函数,或者RLVR奖励函数。所以,人们确实会用大型语言模型进行强化学习。我不认为这是“秘诀”在于拥有一个特殊的奖励函数。>> 是的。所以,我试图探究你对两种大脑类型的区分。因为我试图思考,在什么最小的挑战水平,最小的复杂目标下,你不能仅仅依靠这些通过强化学习在线连接起来的电路。比如控制大脑真的必须发挥作用。我认为你用过长期目标的例子,比如建立一个盈利的企业,你肯定必须使用一个控制系统。你不能只依赖一个循环,而且因为时间太长了。>> 所以,当我想到大型语言模型不擅长的事情之一时,我认为它们在将大量相互关联的复杂性放入上下文窗口中时会遇到困难,而这些复杂性已经不在互联网上。你将越多的相互关联的层级复杂性堆积到复杂的上下文窗口中,大型语言模型的效果就越差。如果你想象训练一个大型语言模型,从中删除所有关于线性代数的提及,然后将一本线性代数教科书放入上下文窗口,它有所有这些新概念。所以它有,你知道,基、核、奇异值分解、逆矩阵、矩阵指数以及无数其他相互关联并堆叠在一起的东西,然后你让大型语言模型做练习,我认为它会做得非常糟糕,仅仅因为上下文窗口就是这样,仅仅因为它不擅长那种事情。它需要将事物学习到其权重中才能获得良好的性能。所以这是一个牵强的例子,但如果你想象运行一个工厂,同样,随着时间的推移,你会遇到不在互联网上的特有复杂性和领域知识。所以我知道这个机器擅长这个,不擅长那个,它如何与其他机器相互连接,它如何与城镇的噪音法规相互连接,我的不同员工擅长什么,不擅长什么,你知道我尝试过的事情,以及我所有供应商的一切,我所有客户的一切。上下文窗口中的复杂性过高,大型语言模型就会开始崩溃。这也解释了为什么大型语言模型在自成一体的问题上如此出色,而与被聘为完全的替代人类员工相比,它们基本上还没有做多少事情。>> 是的。>> 是的。至少从我思考大型语言模型局限性的一方面来看是这样。>> 明白了。我也想问问关于动物大脑的问题。有些动物是否擅长一种大脑或另一种大脑?比如,有没有一种非人类动物碰巧拥有一个像我们一样好的控制大脑?>> 在动物王国中,关于它们的行为有多少来自灵活的终生学习,有多少来自控制子系统,肯定存在差异。这不仅仅是动物王国之间的差异,也是你一生中的差异。例如,一个新生儿的行为几乎完全由脑干驱动,而一个成年人相比之下,这方面的行为非常非常少。我们仍然有抽搐反射。我们仍然,你知道,吞咽。我们仍然呕吐。我们仍然有血管收缩。但总的来说,我们日常做的大部分事情都是学来的。如果你将其与青蛙进行比较,你知道,它的整个大脑部分,我认为占其大脑体积的25%,而我们占80%。它一生中会进行更多的本能行为。所以可以推测,你知道,我见过新生儿。他们,恕我直言,他们在驾驭世界的能力方面并不令人印象深刻,因为人类已经进化到如此依赖这些习得的行为。而那些终生学习较少的动物,想必在通过本能反射驾驭世界方面会做得更好。你认为可以准确地说,许多动物在脑干和下丘脑方面确实拥有可比的控制部门,但归根结底,它们学到的东西不多,所以它们的控制选项有限。>> 很难比较。你知道,青蛙有作为青蛙的正确本能,我们有作为人类的正确本能。而其中一部分是,是的,我们的控制子系统正在做一些事情来帮助指导学习子系统学习有用的东西。如果你一生中学习的东西不多,那么控制子系统要做的事情就更少,它通过在运动控制方面做更多的事情来弥补。我不想建立一个等级制度,关于,你知道,谁的反射更好或更差。你知道,每种动物都有非常令人印象深刻的反射,帮助它在自己的生态位中生存和繁荣。看起来,比较人类和其他动物,说我们拥有更大的新皮层,这给了我们更大的学习大脑,所以我们比其他动物学得更好,我们可以学习比其他动物更复杂的东西,这似乎是显而易见的事情。你是否也同意这种说法,或者有什么有趣的细微差别?我没有关于人类大脑与大象大脑相比的“秘诀”的强烈看法,大象大脑拥有相当大的新皮层,我猜,或者我不知道细胞数量的确切比较,但也许细胞类型不同,或者,是的,我对此没有太多看法。>> 对。对。是的,我就是这么想的,因为有些动物,我认为你提到了大象,比如神经元和神经连接的数量,每单位的身体质量或什么的。我认为可能甚至超过人类,还是我们明显是第一名?>> 我不知道。我甚至不确定,你知道,你想除以体重。比如,你确实想为某些事情除以体重。运动控制可能与身体面积成比例。当然,如果你有更长的神经,延迟更大,需要纠正,你需要一个更大更好的小脑。如果我们不除以体重,那么你就会开始谈论,你知道,鲸鱼之类的,蓝鲸非常巨大。所以我猜它们的大脑比人类大,但我还没查。>> 好的,我得到了GPT03的结果。它说,以下是按总神经元数量和每公斤体重神经元数量衡量的最佳领先者。总神经元数量,获胜者是非洲草原象,拥有2570亿个神经元,其次是虎鲸,拥有约430亿个仅皮层神经元。好的,我们从257亿降到了430亿。天哪,这头大象肯定有大量的神经元,但它说这主要是由于一个巨大的小脑。好的。我们认为小脑神经元在“智力”方面不太令人印象深刻,我不知道,它们的小脑不擅长书本知识,对吧?>> 是的。我认为,你看到更大的小脑,这可能与运动控制有关,与这些非常非常长的神经有关。>> 导致非常严重的延迟时间延迟。根据我的想法,你想通过小脑来纠正这些时间延迟。>> 明白了。明白了。好的。然后,在每公斤体重神经元数量方面,第一名是安娜蜂鸟,因为它只有4.5克的体重。所以每个神经元都很重要,它有4.5亿个神经元。>> 是的,鸟类显然需要飞行。所以每一次进化都在努力让它们变得更轻。>> 好的,让我们说清楚,我认为你和我都在同一页上,那就是一些非人类动物并没有秘密地拥有我们无法想象的聪明才智。比如,人类是最聪明的,这很明显,对吧?>> 嗯,嗯,有可能>> 好的。>> 我想说得更细致一些,比如>> 好的。>> 我敢肯定,黑猩猩在某些方面比人类更擅长,大象也是如此。我认为有一个重要的事实与人类发明了技术并登上了月球,而大象和虎鲸没有,以及人类通过发明,你知道,我们殖民了地球上的每一个大陆,我们显然能够利用技术来完成目标,而其他动物做不到。而人类正在做的,使他们能够做到这一点的事情,是未来的AI也将能够做到。所以这有点像与我自己的兴趣相关。>> 没错。我也是。控制大脑,我们谈论的是脑干和下丘脑。我认为将谷歌关于这些大脑区域的说法与克利夫兰诊所的说法进行对比,然后看看你的解释,这是一个有趣的对比。例如,当我搜索下丘脑时,谷歌强调下丘脑有助于调节你的体温、饥饿和口渴、情绪、性欲、血压和睡眠。但在你看来,它可能比这做得更多,比如在控制人类目标方面。>> 是的,它在做所有这些事情,而且更多。当然有强有力的证据表明,社会本能也是下丘脑中的一些东西,它超出了,你知道,性欲和攻击性,但也包括育儿等。最近有一项研究发现,老鼠会感到孤独,它们渴望另一只老鼠的安慰性抚摸,你知道,它们越孤独,当它们终于和新老鼠朋友在一起时,它们就越感到安慰。他们发现下丘脑中有一个小的细胞群,它会追踪老鼠有多久没有和其他老鼠在一起了。而且你知道,随着时间的推移,它的活动会越来越高,一旦它们被另一只老鼠朋友抚摸,这个不同的细胞群就会把它关掉。所以这就是下丘脑在做一些事情,你知道,非常明显地与社会性有关。所以人类有这个,我想我们人类有这种感觉,就像我们的道德和我们的正义感以及所有这些东西都是,你知道,上帝赐予我们的不朽灵魂。你知道,人们可能会更复杂地描述它,但我们不喜欢认为这些所谓的“更高本能”只是一个细胞群,旁边是控制你血压的细胞群。但实际上,我认为有充分的证据表明,它只是一个细胞群,旁边是控制你血压的细胞群,你知道,在丘脑的内侧视前核或其他地方。对老鼠来说就是这样,这在人工智能方面以及你知道的,如果你想遵循人类规范,你不能从“是”中得到“应该”,那么必须有一些动机来自我们的脑干和下丘脑,说遵循规范是好的,违反规范是坏的,并且必须有一个细胞群来实现这一点。>> 没错。所以,如果你是对的,我们所认为的道德是我们基因写入下丘脑的业务逻辑,或者那个区域的某个地方,那么我们当然相信正交性理论,即我们很容易想象,好吧,想象改变基因,改变业务逻辑,然后你就改变了道德,至少对于新的生物体而言,对吧?你和我可能会同意,无论如何,杀人都是错误的,但新的生物体将不同意,而且可能没有人能阻止他。>> 高功能精神病患者实际上存在于人类世界中,我们喜欢假装他们不存在,但他们确实存在,我认为我们可以从他们存在的事实中学到一些东西。>> 没错。所以从我的角度来看,就像还有什么可说的?这太明显了,但有一半的嘉宾来到这个节目,我们不得不争论道德是普遍的,还是正交性理论是真的。>> 是的,我绝对非常坚定地站在“你不能从‘是’中得到‘应该’”这一边。我认为‘应该’直接或间接地来自这个奖励函数,而‘是’来自皮层使用预测学习来构建一个更好的世界模型。>> 是的。好的。所以,我们谈了下丘脑。现在我正在查看clevelandcl clinic.org关于脑干的信息。它说脑干有助于调节你不需要思考的生命体征,比如呼吸和心率。你的脑干还有助于你的平衡、协调和反射。是的,通常有一个等级制度,下丘脑在决定执行哪些反射程序。它决定现在是否是笑的好时机。如果现在是笑的好时机,那么下丘脑就会触发脑干的各种细胞群,这些细胞群实际上会协调哪些肌肉以何种顺序运动。或者,你知道,下丘脑会说现在是呕吐的好时机,然后脑干会触发呕吐反射,你知道,首先是这个肌肉,然后是那个肌肉。>> 而你说,在调节稳态和保持所有器官正常运转以及拥有目标之间存在联系。我的意思是,我认为这是一个相当关键的见解。>> 是的。我的意思是呕吐是坏的。所以显然,如果人们不喜欢呕吐,这表明下丘脑中的呕吐反射也与这个奖励函数连接在一起,这个奖励函数说现在正在发生坏事。然后你从经验中学习到,如果你正在做一个有远见的计划,最终会导致呕吐,那么,你知道,在其他条件相同的情况下,这是一个不这样做的理由,你知道,对不起,正在收听的大学生们。>> 是的。让我试着用我自己的话来解释你刚才说的话,关于为什么脑干,克利夫兰诊所告诉我它与调节呼吸和心率以及协调反射有关,而你却说这是大脑中负责控制的部分,硬编码的业务逻辑,也许你可以这样想。当我们即将做出决定时,我们会进行一次“凭直觉检查”,对吧?我们会说,“这感觉对吗?”然后你大脑中负责的部分就会启动,它会说,“好吧,让我让你胃部感觉更糟,对吧?让我调节你的胃,或者预测如果这件事发生,你的身体会感觉更糟。”这就是“凭直觉检查”的信号,它会说,“好吧,是的,我将做出这个决定。”这就是它进行控制的方式。>> 嗯,这是其中一件事。你所说的与所谓的“体征标记假说”有很大的重叠。我认为其中有一个核心的真相,但它也可能只是,你知道,一个想法突然出现在我的脑海里,比如,如果我把钱包里所有的现金都拿出来撕碎呢?然后这个想法似乎很糟糕,所以我没有这样做。我甚至没有真正考虑它超过零点几秒。它没有,有些坏主意,它们以一种与生理唤醒和其他身体反应相关的方式令人厌恶,但有些事情,你知道,只是,你知道,如果我把方程两边都除以三呢?然后我试了一下,结果不行,所以我说,哦,好吧,我猜我不应该这样做。它不一定需要与奖励函数本身以及大脑的相关部分有太多联系。所以从我的角度来看,我也补充说,我认为,如果我们谈论脑干,我特别关心的脑干部分,我真的不关心哪个肌肉以何种顺序收缩导致你呕吐。但我非常关心脑干中的一些感觉处理系统。所以,它们常常被忽视的神经科学部分,因为如果我们谈论人类视觉,人们谈论的是皮层处理视觉,但这是一个被低估的事实,脑干也处理相同的视觉数据。所以数据会传到皮层,并通过一个平行的通路传到脑干的顶盖,在那里进行处理,脑干会寻找特定的触发器。它会寻找,你知道,像蛇一样滑行的东西,或者像蜘蛛一样跳动的动作。它会寻找,你知道,美丽的风景画面或人脸的迹象,并触发与这些天生的刺激相关的各种反应。同样,你知道,嗅觉是在皮层处理的,但在脑干中也是如此。味觉是在皮层处理的,但在脑干中也是如此。所以我认为这些区域对于奖励函数部分以及最终的人类动机非常重要。我仍然很好奇,再举一个你只是假设性地思考某事的例子,对吧?所以没有太多的感官输入涉及。你只是在尝试计划你可以做的各种事情。比如,我正在为我的公司制定一个战略计划。你知道,就像埃隆·马斯克在思考哪种引擎最终能将我们带到火星是最好的。你知道,应该简化引擎还是使用哪种燃料?应该用哪种钢材来制造它?所以他正在与自己进行抽象的战略规划会议,从你的角度来看,这不会仅仅通过大型语言模型类型的,你知道,那些短路,比如“只是使用强化学习”来解决。有一些其他的层次起作用,一些控制系统,它将是脑干和下丘脑以某种方式做到这一点,对吧?也许你能把这个联系说得更清楚,因为如果你的意思是“是的,然后他们去做克利夫兰诊所描述的调节稳态的事情,但他们却 somehow 掌控了方向盘”,那将是很好的。>> 是的,我觉得你似乎认为,人类大脑般的通用人工智能和大型语言模型之间的真正区别在于人类大脑有一个更酷的奖励函数。但那不是我的想法。我认为皮层比能够做变压器无法做到的事情的变压器是一个更好的学习算法。它有更好的归纳偏差和任何相关的感觉。我认为这是巨大的区别所在。所以,如果我们回到埃隆·马斯克,我不知道是什么在驱动他,至少现在不是。但是,你知道,如果他有动力去建造一艘更好的火箭,那么,他为什么有动力?我不知道。他一定有某种原因,但很难确切知道原因。比如,如果我对埃隆·马斯克说,你知道,拥有奇数数量的1美元纸币在你的钱包里非常重要,那么他会说,为什么这很重要?我会说,因为你钱包里的纸币是偶数,但应该是奇数。他会说,为什么?为什么应该是奇数?我为什么要在乎?我们不会有任何进展。有什么东西在驱动埃隆去建造那艘火箭飞船,我认为这最终来自某种天生的驱动力。>> 是的,但让我们把核心动机或天生驱动力的问题分开,让我们只看解决工具性子目标的驱动力,对吧?就像无论埃隆的真正动机是什么,他目前有一个工具性子目标,他只是想要最有可能将我们带到火星的正确引擎。我只是好奇如何模拟大脑,即使是战略性地思考那个子目标,以一种你认为大型语言模型永远无法做到的方式,对吧?比如,大脑正在做一些有趣的事情,只是为了帮助他们比大型语言模型更好地进行战略思考。我认为真正的区别在于,大脑比现有的AI算法更擅长进行强化学习。所以,强化学习算法,比如有很多事情,例如,如果我去一家美味的餐厅,我想再去那里,我不需要,你知道,一次又一次地去那家餐厅,以一种情景性的方式,而今天的强化学习算法必须这样做。相反,我只需要吃过一次美味的食物后就想去那家餐厅,并做出灵活的、有远见的计划来实现这一点。所以,我认为很清楚,人类基于模型的强化学习系统比今天任何现有的算法都更有效地进行基于模型的强化学习,通过模型获得奖励并进行规划。>> 比任何现有的算法,无论是大型语言模型,还是Alpha Zero或MuZero类型的,还是AI研究界今天提出的。>> 我想我明白了你的意思。所以,在埃隆·马斯克设计最佳引擎的例子中,考虑到他的工具性子目标是高效地到达火星。在这个例子中,你并不是声称脑干和下丘脑对这项工作贡献了多少。>> 是的,我认为他们没有。我认为这都来自于,

强化学习,模型构建,世界建模,以及能够持续学习新事物的能力。我认为这些对人类来说比对大型语言模型(LLMs)更好。我认为如果你试图给一个大型语言模型设定一个类似的目标,它会开始做正确的事情。但随着时间的推移,它的上下文窗口会堆满它计划制造火箭发动机的各种特殊细节,以及它之前尝试过什么,什么没成功,什么成功了,以及为什么没成功。嗯,它最终会有点失去对正在发生的事情的追踪。而这,这最终是问题所在。它是在学习算法层面,而不是在动机层面。所以这种普遍的复杂行为,比如拥有工具性目标,然后去实现它们。你认为那几乎都是在线学习的,灵活学习的吗?因为这确实是每个代理都想学习的一件事。我认为这与大型语言模型已经能够做到的事情并没有根本区别。比如,如果你要求一个大型语言模型制定一个做某事的计划,那么它会注意到明显的工具性子目标。所以我不认为那里有什么特别之处。我认为问题在于,如果计划变得足够复杂,那么大型语言模型最终会开始混乱,并对它正在做的事情感到困惑。好的。是的。所以,所以只是为了回顾一下,你认为大脑的引导很重要,因为即使是像埃隆·马斯克这样的人,他花了很多时间来弄清楚工具性目标,对吧?他只是埋头苦干,只是在工具性地优化设计或任何东西,但也有很多时候他会抬起头来,说:“好吧,但我的最终目标是什么?”对吧?而你认为他会在这里进行一次凭直觉的检查,与大脑的某个部分进行核对,而这正是我们想要理解的部分。是的。埃隆之所以做他所做的一切,或者任何公司的创始人,或者你知道的,世界上任何一个正在做一个复杂项目的人,之所以在做那个项目,都有其原因。他们开始它是有原因的。他们可能一直在想,你知道,就像如果我,我不知道,我正在走楼梯去拿一件毛衣,那么我在走楼梯的时候,我可能在脑海中想象着那件毛衣。而这让我继续前进。并不是说我真的喜欢走楼梯本身。但也有可能,一旦我开始走,走足够多的台阶,我就可以暂时忘记毛衣,只知道我在做一些好事。然后当我走到楼上时,我会想起,啊,我知道我为什么上楼,因为我想要那件毛衣。但毛衣是我开始的原因。毛衣在某种程度上是在让我继续前进。如果我真的感到沮丧,一切都失去了动力,那么我也会同时停止走楼梯。就像如果有人给我注射了某种药物,导致了严重的临床抑郁症,那么我就会立即停止做我正在做的事情。你写了一篇关于你称之为“类脑通用人工智能”的长篇序列。是的。当我听到你谈论类脑通用人工智能时,我觉得你本来想直接说通用人工智能,但现在我们有了这些大型语言模型,而大型语言模型就像这些弱通用人工智能,它们比我们认为的通用人工智能要弱,现在我们需要一个更精确的术语来称呼那些将实现通用人工智能真正命运的通用人工智能。所以你称它们为类脑通用人工智能。嗯,是的,我的意思是,我主要想保持中立。你可以想象有不止一种方法可以构建通用人工智能。我的意思是,原则上,如果成本不是障碍,肯定有不止一种方法可以构建通用人工智能,比如你可以,你知道,对所有计算机程序进行盲目搜索,你最终会以这种方式获得通用人工智能,你可以,你知道,可计算的归纳法近似最终会遇到通用人工智能,所以我说这是一个我们应该计划的偶发事件,这是通用人工智能计算机程序的一种可能的样子。它是通用人工智能的一个下限,是类脑的。这是一个场景,而且我确实认为这是最有可能的场景,也许是唯一可能的场景,但我不想……我的意思是,很难为这一点争论。而且,也有可能每一个通用人工智能都是类脑的。我的意思是,我们甚至不知道。是的,我会换个说法,说类脑通用人工智能可能是唯一一种,或者至少在我使用的术语的广义上,是构建通用人工智能的唯一实用方法。我喜欢举出快速傅里叶变换的例子,比如如果你要对一个大型数据集进行傅里叶变换,你应该使用FFT,而FFT在历史进程中被反复重新发明,因为这是做FFT的最好方法,如果我们遇到外星人,他们也会做FFT,这只是解决这个问题的自然算法。所以同样地,可能……自然算法,你知道,在现实世界中完成雄心勃勃的项目,就是类脑通用人工智能。我们不确定。这只是一个,只是一个可能性。关于类脑通用人工智能的一个观察,我认为这很重要,那就是似乎进化在构建人类大脑方面做得非常容易,因为我观察到其他类人猿和人类之间的大脑大小差异和智力差异。在进化时间上发生得非常快。所以,这并不像自然选择必须经过如此漫长的时间来完善它。它就像,哦,是的,只需增加更多的神经元,然后你就可以变得非常聪明,你知道。是的,我的意思是,这有点难说。你也可以指出相反的证据,比如我们过去五亿年脊椎动物的历史中没有技术物种,你知道,为什么大象和虎鲸没有发明技术,我不知道,以及有多少拼图碎片恰好已经存在于我们的大脑中,你知道,为人类智能铺平道路。这只是,是的,这有点难,我不会说有一个明确的答案。好吧,如果你不想承认建造智能很容易,那么你唯一能声称的是,其他类人猿已经拥有了人类大部分的智力。但然后有一个观察,比如,好吧,但我们是老板,不是它们,对吧?比如在实际方面,你知道,我们取得了多少成就,存在巨大的差异。所以,这很有趣,最后这个冲刺,所有有效的力量都在这里,是一个进化上的轻松冲刺。是的,那是肯定的。是的,我们和黑猩猩之间没有发生太多进化。这让我有一种强烈的直觉,我们真的可能处于通用人工智能的黎明。就像,无论最后一个冲刺是什么,我们可能已经很接近了。嗯,是的,我同意这个结论。我不确定这是一个如此有力的论点,因为理性的人们对还有多少其他成分缺失存在分歧。我,是的,但我确实认为你是对的,我们将以一种……一种缺失的关键部分来达到这一点。让我们回到那个问题,以及大型语言模型在根本上无法做什么的问题。人们喜欢谈论这个话题,因为它非常有趣,对吧?我们有这些大型语言模型。每个人都至少对它们能做多少事情感到有些惊讶。然而,这么多人提出了关于它们不能做什么的说法。而且,很多说法似乎都被证伪了。比如,有著名的斯科特·亚历山大与加里·马库斯和其他怀疑论者之间的争论,怀疑论者说,看,这些图像,它们就像幻觉。你知道,你永远不会看到一匹马骑着一个人。即使你提示它画一匹马骑着一个人,它也总是会画一个人骑着一匹马。但然后下一个版本出来了,它成功地画了一个人骑着一匹马。所以,关于这些大型语言模型不能做什么,存在着来回的争论,而且目标似乎一直在移动。而你让我感到惊讶的是,你似乎已经表明了自己的立场,关于大型语言模型不能做什么,你用了一个例子,如果你能有一个基于大型语言模型的系统能够创建一个成功的、盈利的公司,你会感到震惊,这会彻底打破你的模型。嗯,我的意思是,是的,互联网上有一些玩具例子,其中大型语言模型就像,你知道,说,“我是一个大型语言模型”,然后马克·安德森说,“嘿,给你十亿美元”,或者别的什么。你可以称之为生意,但这有点……有点愚蠢。比如,如果我们谈论的是一个像亚马逊那样的稳健的生意,你知道,他们建造东西,他们想出新的商业模式,他们实际执行很长一段时间,他们有管理层,他们有员工,那种事情。我认为杰夫·贝索斯在做这件事方面仍然比大型语言模型高出一筹。现在,当我们使用新颖性和创造性等指标时,人们有一个非常流行的选择指标,试图争辩说,它从来不会偏离其模板,所以它永远不可能新颖,你知道,它只能重新组合。你认为这是一个有成效的指标吗?还是你认为我们必须找到一个不同的指标?人类能做一件事,比如我说,想象一个紫色的漏勺,上面有一只鸟,从飞机上掉下来,你可以在脑海中立即创造出这个图像,我可以问你关于它的后续问题,你将能够非常熟练地回答这些问题,利用你对漏勺、空气动力学、飞机和鸟类的所有理解。你刚才做的是创造性的事情吗?也许。而且这绝对是大型语言模型可以做的事情。它涉及到,你知道,以一种我所知道的从未发生过的方式重新组合现有的想法。我的意思是,我不知道。有时大型语言模型会以非常令人费解的方式失败。而且很难确切地知道如何理解大型语言模型说出一些非常不人性化且令人费解的愚蠢话。我更倾向于强调我之前说的关于上下文窗口的事情。你往上下文窗口里塞的东西越多,大型语言模型就越糟糕。而不在上下文窗口里的东西必须是人类已经在互联网上创造出来的东西,或多或少。但当你这样说的时候,它似乎暗示着也许有办法绕过它,比如,“好吧,如果我只用两个提示呢?”对吧?其中每个提示里有一半的东西,然后合并它们。是的,我敢肯定人们会尝试他们能想到的所有可能性,而我只是认为这是大型语言模型架构的一个问题。我用另一种方式来问关于你认为大型语言模型的障碍在哪里,让我这样问吧。你认为在接下来的两年里,人工智能几乎肯定还不能做什么最令人印象深刻的事情?首先,我不太愿意对此发表强硬立场,因为我本人不是大型语言模型的重度用户。其次,比如,是的,其次,我不是要求人们相信我说大型语言模型会撞墙。我有点在做一个研究赌注,但我不是……我尽量不在这方面出错。第三,比如,我确实认为,所以,就像,对于人类来说,你可以,就像人类在解决问题一样,当他们建造工厂并运营它时,经过几天、几周、几个月、几年的时间,他们会在大脑中积累越来越多的关于这个特定工厂的特殊领域知识,这些知识不在互联网上。而我认为大型语言模型无法做到这一点。但它们在上下文窗口方面能做的事情一直在逐步增加。我认为,我不想就两年后天花板的确切位置发表强硬立场。是的,我的意思是,我并不完全不同意你关于大型语言模型是有限的说法,对吧?我的意思是,我也能看到,对吧?我,最让我惊讶的是,你会拥有这些最先进的系统,它们会给我一些关于医学状况的非常有见地的建议,或者分析人际关系,比如真正深刻的见解,比人类给出的要好得多,毫无疑问,然后你问它们一个非常简单的问题,比如一些简单的算术,它们会自信地给你一个明显错误的答案,对吧?直到今天仍然令人震惊,对吧?所以,我同意有些事情不对劲,对吧?就像,这里有一些需要解释的事情,也许有一些根本性的限制与鲁棒性有关。只是,就像,模型似乎如此灵活。大型语言模型模型如此灵活,就像任何时候你注意到错误,很多时候你可以通过说,“好吧,只是让他们看这个巨大的TB数据”,然后,你知道,问题就会解决,而且,真的,你只需要让他们看大量数据。我的意思是,这很容易,现在我们在谈论,“哦,是的,未来会有少数人在做某事,并开创它,然后人工智能将迅速接管。”就像,嗯,好吧。所以,而且你认为我们还没有接近自动化那些人类,你知道,只是通过修补来达到不需要人类的程度?你知道,我,我只是没看到一个明确的分离。所以,就像,你知道,如果人工智能已经运行了这个工厂六个月,而且它没有,没有可以指向人工智能的数据集来处理这个特定工厂的所有细节,这些细节不在互联网上,比如,你知道,这个特定的机器与这个特定的员工群体一起工作的方式,那就是,或者,你知道,这是一个平凡的例子,当然,人们对发明新的科学范式更感兴趣,比如,如果我不知道,拿一些随机的物理概念,比如量子电容,然后说,如果,如果大型语言模型不,你知道,理解量子电容的所有细微之处,你怎么能为大型语言模型创造更多数据呢?创造数据的唯一方法就是理解量子电容,所以这是一种鸡生蛋蛋生鸡的问题,我不知道你应该从哪里获得这些数据。我敢肯定,人工智能公司此刻正在努力解决这个难题,我不祝他们好运。我祝他们失败,但我们会看看会发生什么。所以,我认为关于大型语言模型如何接管世界的幼稚提议是,好吧,是的,当然,它们需要在线学习,所以你需要一个循环,其中训练一直在发生,或者最坏的情况是,你也许可以争辩说人类就是这样做的,你知道,你睡觉,然后你过夜训练。我的意思是,如果它们想与人类竞争,它们每天有八小时的停机时间来重新训练自己,这是可以的,这是一个相当慷慨的时间窗口。所以,所以,所以幼稚的提议是,你只需要越来越好的大型语言模型,它们会走向世界,组装新知识,它们有摄像头连接到它们,对吧?它们收集一天的数据,然后它们睡觉,并在所有新数据上训练自己,然后醒来,它们又变成了大型语言模型。就像,是的,这有点幼稚。我不认为这真的是通用人工智能会是什么样子,但很难告诉你那个模型会在哪里达到人类的极限。是的,我可能会提到,比如,再次,如果有一个概念是人工智能不理解的,那么,人工智能没有办法,你知道,凭空创造新的训练数据,就像,如果,如果人类训练语料库中关于量子电容的数据不够多,那么人工智能就不能打印出关于量子电容的新事实并进行训练,因为整个重点是它们对量子电容感到困惑。嗯,我的意思是,是的,但想法是,人工智能能够被用作量子电容研究员,并执行人类每天会做的相同步骤来弄清楚它,对吧?是的。所以,我认为人类每天所做的步骤,人类仍然能够进行持续学习,而人工智能,大型语言模型则不能。截至今天,当你说到持续学习时,我的意思是,我不确定你说的是多长时间,因为,就像,前提是大型语言模型在一天开始时拥有与人类员工相同的背景知识,对吧?你一天一天地进行。是的,我的意思是,是的,我认为人类能够弄清楚事情,你知道,在没有训练数据的情况下,而大型语言模型则不能。如果一个人意识到他们以前相信的某些事情是错误的,那么他们就可以更新他们的永久知识,以消除那个错误信念。而,你知道,至少截至今天,大型语言模型的训练方式,那种事情不会发生。所以,如果我理解正确的话,你认为即使你初始化一个人和一个人工智能,让他们拥有相同的先验记忆和先验知识,你知道,他们读了相同的教科书,直到相同的当前知识水平,你仍然认为,仅仅在八小时工作日里,人类研究员的大脑里有更多的事情会让他们领先于大型语言模型。嗯,我认为,是的,我的主张是,人类能够在八小时工作日里弄清楚新事物,并将其添加到其永久知识中,而大型语言模型则不能。而且你最终会得到一个稍微聪明一点的人。而你不会得到一个稍微聪明一点的大型语言模型。然后,你知道,也许在一个工作日里,谁在乎呢?但将其迭代数天、数周、数月,人类可以随着时间的推移逐渐弄清楚他们的情况,而我认为大型语言模型则不能。我不确定我是否同意将它描述为人类擅长日复一日地将新事物添加到其知识中,因为任何时候知识被创造出来,大型语言模型都可以吸收这些知识。所以,我不确定它必须是知识的积累,而你自己创造了然后添加到堆栈中。我认为这可能更有成效。我将它描述为更像是它的鲁棒性。所以,这不仅仅是添加知识。这是关于,就像,回顾你的一天,并注意到,比如,你做的很多事情都很难学习,对吧?或者,你知道,你犯了错误,你想回溯,因为这就是我对大型语言模型的看法。它们就像,它们可以做任何事情,但它们有这个错误率,而且它们不会从错误中恢复,对吧?错误会堆积起来,而且它们没有像样的错误清理过程。是的,我的意思是,我认为这有点间接相关。再次,时间会告诉我们人工智能研究人员会想出什么。当然,如果有什么方法可以让大型语言模型更好地工作,那么我敢肯定,它今天已经在存档中了。如果不是今天,那就是明天,然后它就会,你知道,在下一代大型语言模型中,后天,我们将看到它效果如何,或者效果不好。你不能让它们一遍又一遍地运行,然后说,好吧,不断检查你的错误,不断检查你的错误,这不是很奇怪吗?就像,不知何故,一些错误即使在进行了很多“自我检查”运行后仍然存在。是的。是的。而这是一个问题,你知道,你永远不知道下一代哪些类型的问题会得到改善,哪些不会?是的。好的。所以,所以对我来说,最突出的是鲁棒性,这是一个非常奇怪的境地。就像,我从来没有预料到这种情况会发生,但我们就在这里。关于大型语言模型不能做什么的主题,我还有一件事想问你。我觉得现在谈论时间跨度指标很流行,对吧?你知道那个图表,比如,哦,我们发现,如果某件事只需要几个小时,那么人工智能就可以超越人类的表现,但如果某件事需要几天,那么人类就会超越人工智能。你认为这是一个好的衡量标准吗?你认为它就像,是的,它永远不会超过一天。就像,我正在设置一个一天的硬性防火墙。我认为这与我一直在说的关于将大量复杂性放入上下文窗口的说法有些吻合。时间越长,我的意思是,并非所有任务都是如此,但至少存在一个模糊的关联,即一个人完成某件事所需的时间与完成这项任务所需学习的、不在互联网上的特殊知识量之间存在关联。这可以解释为什么任务越确定和独立,人工智能通常就越擅长。而且,我不知道,很明显,这条线在上升。所以,我不知道它何时会停止,但我认为这与人类解决问题的方式不同。而且我认为,我认为那里有一些根本性的东西。时间会告诉我们确切的上限在哪里。你认为今天的大型语言模型能做所有智商80的人类能做的事情吗?所以,如果我想出一个智商80的人会做得更好的任务,我会尝试想出一些需要几天甚至几周才能弄清楚的事情。我认为那是人脑相对于大型语言模型可以大放异彩的地方。学习杂耍。我猜你会说这不算,因为我们没有运动控制。如果你做一个基于文本的杂耍学习游戏,你基本上是映射这个……这有点愚蠢。你必须将人置于一个足够复杂的环境中,或者你……这里还有另一个例子,给这个人一个你刚在隔壁房间发明的有趣小工具,然后给他们几周时间玩它。他们会非常擅长,你知道,使用这个小工具作为工具,并将这个小工具放在头上,然后他们会完全理解它,你知道,就像它自己的手一样。我猜这又是一个愚蠢的例子,因为然后你会抱怨大型语言模型在多模态方面不如好。我不知道。我认为也许可以代替小工具,也许可以只是像Wordle或Sudoku这样的游戏,你仍然可以玩,或者俄罗斯方块,对吧?是的。我,我不记得Claude玩宝可梦现在怎么样了,但它并没有给我留下深刻的印象。我上次查看它时,它需要大量的指导。是的,我不确定。我认为智商80的人,我猜我不太清楚智商80在现实世界中对应的是什么样的人,但我认为他们至少有可能比没有指导的Claude更擅长玩宝可梦。特别是如果你给这个人一个教程,而Claude能够在他预训练期间阅读互联网上的每一个教程。我之所以提到这一点,是因为之前我们谈论的是,好吧,人工智能并不鲁棒。它会犯这些简单的错误。它无法修复它的错误。但我想我们可能会倾向于将其与平均以上智商的人进行比较。而且,它可能只是非常接近,或者它已经干净利落地击败了低智商的人类。就像,这很难说,对吧?也许所有低智商的人都在不断犯类似的错误,而社会只是……它能够帮助他们恢复,而我们只是没有注意到。是的,我的意思是,一些半体力劳动的工作,比如,我不知道,仓库工人,杂货店打包员。我确实认为,再次,很难比较,因为大型语言模型没有机器人身体,但如果我试图想象构建一个足够类似于打包杂货的基于文本的系统,那么我认为一个低于平均水平的人,经过几周或几个月的反复试验,最终会比,你知道,一个在复杂的基于文本的杂货打包系统中挣扎的大型语言模型做得更好。如果你把它放入足够多的,你知道,低级细节,比如,“现在你必须这样移动你的手臂,现在你必须那样移动你的手臂。”你知道,当你说的,“嘿,我们没有类脑通用人工智能”,这几乎就像你的主张是,我们没有像120智商的类脑通用人工智能。是的,我认为有一个更好的学习算法,一个更强大、更可怕、更危险的学习算法在那里,而且我认为人们迟早会发现它。嗯,但是,但是,我的意思是,你明白我的意思,对吧?即使是你关于人类和人工智能之间分离的主张,听起来你也没有那么自信地说,一个智商120的人类在很多年里都能与人工智能抗衡。我认为你必须选择正确的任务。人类有一种随着时间推移增长知识的方式。他们逐渐学会了他们需要的知识,而我认为大型语言模型在这方面很挣扎。但大型语言模型有一个更高的起点,所以很难找到那些任务。但如果我们谈论的是,比如,你知道,消灭人类并自己统治世界,我不认为,你知道,一个好的起点,然后,你知道,不能真正地,你知道,系统地学习,就像人类一样。我认为这不够。好了,现在,总结一下你之前说的话,你认为人脑所做的本质上是更好的强化学习,对吧?某种算法比我们现在拥有的大型语言模型更优越。但我们也有其他成功的例子,比如AlphaGo,它们通过使用不同类型的强化学习实现了大型语言模型无法实现的目标。所以,我认为你和我可能在同一页上,就像某个拼图块,某个来自机器学习世界的成分将会出现,并与我们现在拥有的来自大型语言模型世界的成分结合起来,然后你就会得到一些更像大脑的东西。是的,更好的基于模型的强化学习,我们可以对秘密酱汁有多少在模型中,有多少在强化学习中保持中立。在学习算法的世界里,仍然有一些尚未发现的秘密。有很多学习算法。我们还没有发现所有这些。现在,你写道,你期待某种“Actor-Critic”基于模型的强化学习。那么,你能解释一下“Actor-Critic”基于模型的强化学习与常规强化学习有什么不同吗?是的,所以,我用一个非常广泛的方式来使用这个术语。我确实认为大脑中的强化学习与强化学习和强化学习教科书、人工智能教科书中的强化学习有所不同。例如,我脑海中突然冒出一个想法,比如我要开窗,然后这似乎是一个好主意或一个坏主意,如果它似乎是一个好主意,那么我实际上就去做了。所以,我建议我大脑的一部分,大致是皮层,是这个想法的起源。我要去开窗,而我大脑的另一部分,即脑干与纹状体结合,就是,这是一个好主意,或者这是一个坏主意。所以,这就是我所说的“Actor-Critic”的意思。那么,什么是Actor,什么是Critic呢?Actor可以被认为是提出一个想法。我要去开窗,而Critic则认为,这并不是一个激励人心的想法。不要那样做。或者,是的,去做。如果Critic说“是”,那么我就会站起来,走到窗户边,把它打开。你是否将Actor和Critic映射到了不同的脑区?是的,我认为Actor基本上是皮层,粗略地说,而Critic基本上是纹状体,然后下丘脑和脑干是某种更新Critic的真实基准。所以,纹状体是学习大脑的一部分,对吧?从零开始学习的大脑。是的,它是另一种,它是一种不同的,它是一种自己的学习算法。是的。你能更详细地解释一下吗?因为你有从零开始学习的大脑,还有皮层与纹状体。那么,当你在学习时,它们是如何相互作用的?我认为皮层提出了一个想法,或者一个想法,一个计划,或者任何东西。我要去开窗。然后,纹状体将这个想法作为输入。嗯,纹状体也做其他一些事情,但对于这次谈话来说,相关的是,纹状体接受这个想法,并试图根据你一生中根据什么触动了你的天生驱动力,什么没有触动你的天生驱动力而学到的这些联系来判断它是一个好主意还是一个坏主意。而这在我们进行与引导大脑的核对之前,是一个层级。是的,所以,引导大脑在事后更新纹状体,而且引导大脑有时也会在当下否决纹状体。所以,比如,如果我现在很痛苦,那么无论我想什么可能都是坏事。是的,好的。所以,也许这有点像管理层级,其中纹状体只是更接近一线经理,而……引导大脑更像是CEO或老板。纹状体正在猜测什么是好什么是坏,它有更多的东西可以用来猜测,因为它拥有所有这些神经元和所有这些连接,让你对世界的丰富理解。也许纹状体就像助教,而脑干就像教授,或者别的什么。所以,助教在批改作业,而教授有时会注意到,你知道,发生了非常糟糕的事情,而助教没有注意到,然后说,“嘿,助教,你做错了。”说得通。当你研究杰夫·霍金斯的研究时,你认为那将是Actor-Critic强化学习的成分之一,我们可以从大脑中复制吗?所以,他基本上完全专注于皮层如何工作。他对理解下丘脑和脑干不感兴趣,事实上,他完全不屑于此。我认为他对人工智能安全有非常糟糕的看法,这源于他不愿花哪怕五分钟来思考动机是如何运作的。所以,例如,如果你读他最新的书,比如,如果你读一章,它说,皮层构建了一个世界模型,而模型本身并不危险,它只是像桌子上的地图。哦,甚至更糟。他谈到皮层如何想要破坏脑干,你知道,皮层是所有这些更高驱动力的家园,比如道德、好奇心和让世界变得更美好。所以,皮层就像桌子上的地图,而皮层是所有这些更高驱动力的来源,比如道德,之间存在着明显的矛盾。我认为和解是,事实上,道德就像好奇心一样,就像其他一切一样,都来自下丘脑和脑干。而我们需要逆向工程并将其放入我们的人工智能中。问题是我们该怎么做?说得通。好的。所以,在你看来,霍金斯有点走进了死胡同。我的意思是,如果你想知道皮层的六层是如何工作的,以及为什么,那么有很多人在试图弄清楚这一点,唉。而霍金斯是众多理论化皮层电路的确切作用的人之一,你知道,第四层在做什么,第二三层在做什么,等等。好了,回到你的研究,你关注的是什么,你预测的是类脑通用人工智能,你预测的是这种新的Actor-Critic强化学习,它比大型语言模型走得更远,并且成功地完成了更长期的任务。你预测这种新的类脑通用人工智能将参考一种新的奖励函数,而且你认为它不会像预测下一个词那样。你认为它会像可读的Python代码。所以我确实认为人脑的一部分在进行预测性学习。所以,你伸手去够门把手,你期望它,你知道,轻松转动,或者你期望它安静,但它发出了噪音,你对此感到惊讶。你最终会得到一个复杂的世界模型,能够对未来会发生什么做出非常好的预测。而且,我确实认为这通过预测性学习起作用,你知道,在结构上类似于下一个token预测。我不认为它是一个Transformer架构,但它仍然是一种基于预测性学习训练的学习算法。我们可以从能力的角度来考虑奖励函数有什么特别之处,然后我们可以从对齐的角度来考虑人类奖励函数有什么特别之处。从能力的角度来看,我真的不认为很难创建一个能带来强大能力的奖励函数。我认为对齐要困难得多。但如果你只是想要一个能带来强大能力的奖励函数,在类脑通用人工智能的背景下,你需要好奇心,你需要一些其他的零碎东西,但主要是奖励函数从我的角度来看对对齐很重要,而学习算法和更新规则对能力很重要。这说得通。我认为你做的一个区分是,我们不期望奖励函数是一个难以理解的混乱。我们期望它是一个实际的Python模块,人类可以对其进行管理。所以,如果人们制造出类脑通用人工智能,那么他们就可以放入任何他们想要的作为奖励函数。所以我认为他们选择放入的任何东西都会非常危险。问题是,他们可以把什么东西放入奖励函数中,才能真正带来好的结果,比如一个不想杀死其程序员、用户以及其他所有人的AI。我最乐观的方向,或者至少是最不悲观的方向,将是一个看起来或多或少是可读的Python代码的奖励函数,而不是更像RLHF的东西,它是在成千上万个好行为和坏行为的例子上训练的。我认为后者注定要失败,我们可以详细讨论为什么我认为……难以理解的矩阵注定要失败。是的,详细说明一下。所以,当人们谈论难以理解的矩阵时,他们通常谈论的是学习算法。而且,我确实预计类脑通用人工智能仍然会学习一个难以理解的世界模型,因为,你还能做什么?这是一个复杂的世界。轮胎通常是黑色的,你知道,垃圾车通常是蓝色的。世界上有太多事情了,你不会把它们写进源代码。相反,它们需要存在于某种学习模型中。而且,无论它们是,你知道,矩阵的条目还是其他什么,它们很可能难以理解。它们默认情况下将是这些未标记的东西。所以,从我的角度来看,真的没有办法绕过难以理解的矩阵,或者至少是难以理解的学习模型。我不知道为什么人们会认为有其他选择。但另外,奖励函数可能涉及学习算法组件,也可能不涉及。所以,大型语言模型中使用的RLHF奖励函数是一个学习函数。所以,人们对许多不同的……你知道,大型语言模型行为进行点赞和点踩,然后用它来训练这个奖励模型。所以,你也可以用类脑通用人工智能来做这件事。我认为这不会带来好的结果。我认为它会产生试图杀死所有人的精神病AI。有趣。好的。所以,有三种流行的奖励函数,对吧?所以,第一个是预测大型语料库中的下一个词,或者预测下一个token,即使它是视频数据或其他什么。然后第二个是人类给你点赞和点踩,然后预测点赞和点踩的高维流形形状,这有点难以理解。然后第三个是,这是Python代码,它就像一个闭式表达式,说明什么东西有价值,对吧?这些是三个类别吗?还有其他有趣的类别吗?我可能会称第一个为损失函数,而不是奖励函数。嗯。嗯,预测……自监督学习通常被称为预测损失。而且,我认为在类脑通用人工智能中,它在结构上与奖励函数比在大型语言模型中更不同。而在大型语言模型中,你……它只是梯度下降,就像在预训练阶段的自监督学习期间所做的更新与RLHF阶段的更新一样。但在大脑中,我认为它是不同的。你在一种情况下更新,你知道,某些类型的皮层连接。在另一种情况下,也许你更新纹状体或其他什么。所以,如果我理解正确的话,你是在说,我们将迎来一种新的、更强大的机器学习范式。而这种范式通常不会使用混乱的奖励函数。它只会很好地适应更整洁的奖励函数。这之间有什么联系吗?我的意思是,我认为,如果你将一个RLHF奖励函数连接到一个足够好的RL系统,它也会非常糟糕,因为它会找到学习到的奖励模型的边缘案例并无情地优化它们,包括在必要时接管世界。这会非常糟糕。但你之所以不会那样做,是因为,嗯,如果你关闭了正则化或者其他什么,有时会有KL散度,或者他们会调节学习率什么的,以防止它失控。但当大型语言模型过度优化RLHF奖励函数时,它们往往会做一些愚蠢的事情,比如,它们会,你知道,输出你“blah blah blah blah Bob”或者一些愚蠢的东西。它们不会,你知道,做出有远见的危险行为。而这正是我认为人类大脑基于模型的RL系统更好之处。你给它一个奇怪的奖励函数,它就会制定出好的计划来优化这个奖励函数。它会进行有远见的规划。它会想出一些出人意料的想法。它不会只是说“blah blah blah blah Bob”。相反,它会,你知道,接管世界并输出Bob,或者别的什么。这是一个糟糕的愚蠢例子,但是,是的,我认为奖励模型在某种程度上是固有的局限性。这不仅仅是关于类脑通用人工智能,而是它与类脑通用人工智能是一个更强大的解决方案查找器这一事实相互作用。它是一个更强大的解决方案查找器,但你说点赞和点踩仍然可以起作用,尤其是在早期阶段,当它还没有那么强大,你只是给它点赞和点踩的时候。它不会仍然像大型语言模型那样工作吗?当然。但我对那些在人工智能变得更聪明时仍然有效的解决方案感兴趣。好的,明白了。所以,你是在考虑这个新时代,我也认为这很可能是“是的,这些东西基本上是魔法棒,或者Alazer称之为结果泵”。你喜欢那个思想实验吗?我知道你指的是什么。我认为在它是否是我们应该期望的那样,以及是否有我们可以采取的步骤来避免它方面,有很多细微之处。你认为结果泵,我的意思是,不是字面意义上的结果泵,而是结果泵的可计算近似值,是我们将可能滑入的收敛未来吗?所以,对于不熟悉的听众来说,结果泵是一个思想实验,其中有一个魔法按钮,你输入一个结果,它就会穿越时间来找出使该结果成为现实的事件过程。所以,所以我们都是结果泵,只要我们对未来的世界有渴望,并且我们采取行动来尝试实现这些渴望。但我们也渴望其他东西。我们喜欢遵守规范。你知道,有时我们不太关心未来会发生什么。所以,我喜欢谈论人工智能,或者更普遍地说,拥有对未来世界渴望的系统。所以,你和我对未来的世界都有渴望。大多数人类在某种程度上也是如此。而且,我们也渴望其他东西。我,你知道,我现在想吃午饭,除此之外,我还关心我的孩子……你知道,长大成人,过上美好的生活,你知道,有孙子孙女,或者别的什么。我预计我们最终会制造出同样对未来世界有渴望并采取行动的人工智能。所以,你可以称之为结果泵。我的意思是,我们也会制造出不这样做的人工智能。我们已经在制造不这样做的人工智能了。但最终,有些人对未来有渴望,他们正在努力……你知道,我们希望有更好的太阳能电池。我们希望,你知道,世界和平,无论什么。我们希望,你知道,获得诺贝尔奖和一个,你知道,酷的基准分数,让我们进入NeurIPS。所以,人们一直在努力制造人工智能,让它们表现得好像它们对未来的世界有渴望,我预计他们会一直尝试下去,直到最终成功。但另一个问题是,人工智能是否会表现得好像它只有对未来的渴望,还是它也会表现得好像它还有其他种类的渴望,比如遵守规范的渴望,或者,你知道,不想把事情搞砸太多的渴望,或者别的什么?而且,至少可以想象,我们可以制造出具有这些对未来的渴望,但也有其他渴望的人工智能,而这可能是一种摆脱问题的方法。我没有说结果泵的缺点。如果你对未来有渴望,它会导致工具性收敛,正如许多听众可能知道的那样,这个想法是,好吧,如果我想让世界在未来以某种方式存在,那么我现在应该做什么?我应该收集资源。我应该收集影响力。我应该接管。

外国,这样我就可以随心所欲地对待它们,你知道,继续增加我的财富和影响力。我将能够贿赂人们。我将能够,嗯,你知道,你数得过来。拥有大量金钱,你知道,无论如何获得,都有好处。拥有良好的声誉有好处。拥有所有这些东西都有好处。所以,如果你对未来有渴望,并且拥有不可思议的力量,那么你最终会得到像人工智能那样接管世界,以实现其渴望,而这是糟糕的。所以,我认为对未来的渴望是能力之源,也是危险之源。所以,这是一种你必须把握的微妙平衡。我认为把握这种平衡的一部分是我们能够制造出也拥有其他渴望的人工智能,而这些渴望不仅仅是关于未来。>> 是的。是的。好的。所以,我同意所有这些,除了也许我们可以让它们拥有其他渴望,而不是关于未来的这个想法。我认为也许你和我有些分歧。我认为你已经将此标记为你和 Eleazarowski 之间的一项重大分歧,对吗?>> 嗯,我曾被指责误解了 Eleaser。所以,我们应该只说这是一个可能存在的立场,有人应该持有。嗯,无论这是否是 Eleazar 的真实想法,或者我是否误解了他。>> 是的。无论 Elazar 的想法是什么,我都是一个倾向于同意 Elazar 的人,我可以告诉你,我个人相信,无论他怎么想,似乎一切都会汇聚成一个连贯的效用函数。所以,当你描述像“它不会仅仅拥有关于未来的渴望,它还将拥有这些其他渴望”时。我猜它只会将其他渴望折叠到效用函数中,并将一切简化为一个主效用函数。但你不这么认为吗?所以,仅仅说一个效用函数是空洞的,因为它取决于效用函数的定义域是什么。比如,如果定义域,如果效用函数说,嗯,你知道,这个特定的行动序列是好的,然后我将执行这个特定的行动序列,也许它涉及到原地打转而一事无成,但我仍然是一个效用最大化者。所以,你知道,或者我可能有一个效用函数说我应该根据决策规则 X 来做决定。这将是最好的事情。所以,仅仅说我正在根据效用函数行事是完全空洞的。>> 好的。好的。那么,那么是的,我将修改我的说法。所以我修改我的说法,效用函数不会有义务论的色彩。它将非常清楚地是关于未来结果的领域,或者你知道,随着时间的推移,宇宙的状态。>> 是的。所以,如果你说效用函数的定义域,效用函数的输入是未来世界的样子,那么是的。那么,那么你就是在声称人工智能关心未来世界的样子。这绝对是一个实质性的说法。你获得力量,你获得工具性趋同,>> 我认为在某种程度上它确实关心。实际上,我现在想提出的论点是,我总是为功利主义者辩护,因为人们说,“哦,里昂,你真的认为你是一个功利主义者,所以这意味着你不在乎人们、爱和感受。你只在乎效用。”我说,“嗯,不,不。我只是把爱和感受融入了我的效用中。我仍然在乎那些东西。”我认为一个对齐的人工智能也会看起来一样,对吧?它会将所有这些美好的模糊价值观作为它喜欢宇宙未来状态的一部分。>> 如果我们制造了一个真正想要美好未来的人工智能,那将是很好的。但也有它如何到达那里。你可以想象一个人工智能,它想要一个美好的未来。所以,比如,人类被赋权了,所以它会剥夺所有人类的权力,然后收集大量资源,然后稍后重新赋权人类。但你也可以想象一个人工智能,它希望人类一开始就不会被剥夺权力。所以,我猜你可以称之为义务论。但同样,我不知道。很容易陷入将功利主义与你知道的空洞的、义务论的说法混为一谈。>> 好的。好的。嗯,我想把这个与 Python 代码代表奖励函数这个概念联系起来,因为当你考虑解决对齐问题并使未来变得美好时。我认为你非常专注于那一部分,对吧?因为我看到你写道,你认为人工智能公司将处于一个位置,它们拥有这个新的范式,它们正在使用这个新的 actor ML,突然它们取得了更好的结果。你知道,而不是仅仅一个两年的时间跨度或别的什么,现在是两年的时间跨度,而且很明显我们正在走向 ASI 起飞。但它们将在奖励函数方面遇到麻烦,因为它们将看到工具性趋同,而它们的人工智能将比以往任何时候都更难控制,或者它们会不断地做类似“机械希特勒”的事情,对吧?它们会不断地对它们的“主人”变得非常铁腕,而效用函数就是有问题的,而你基本上想在幕后等待,已经完成了关于“理想的、可读的奖励函数是什么”的研究,它们可以从文献中抓取,它将使它们的人工智能工作得更好,并更好地塑造未来。是的。是的。我倾向于认为这属于“强化学习研究”和“人工智能”的传统,而不是“强化学习在 LLM 时代的应用”的传统。所以,如果你看看,比如 AlphaGo,奖励函数是一个非常直接的东西,它说赢是好的,输是坏的。如果你看看,比如 OpenAI 的 Gen,以及基本上所有其他的“强化学习环境”,它们几乎总是有简单的、可读的奖励函数。我认为,如果人们继续沿袭这种传统,他们将制造出具有各种简单、可读奖励函数的人工智能代理。我认为这将是灾难性的危险,因为如果你将一个足够强大的人工智能系统应用于某个随机奖励函数,比如,你知道,赢得这场比赛,或者,你知道,移动箱子,或者赢得游戏,或者任何东西,但你知道,在现实世界中。那么突然之间,你知道,关闭程序就成了优化该奖励函数的障碍。所以,那将非常糟糕。而且我们希望在强化学习范式中,有更好的奖励函数选项,这些选项不会导致灾难性的危险行为。>> 所以,我同意你,我们很可能进入一个我们可以看到人工智能将世界优化成可读目标的时期。我认为这已经是一种很好的失败方式了,因为实际上我认为,到了那个时候,我们可能会有一个非常快的飞跃,就像,哦,它们开始在它们的实验室里开发更好的学习能力,并且它们已经开始了一个接管世界的计划,甚至在我们注意到并打印出它们的 Python 奖励函数之前。甚至在我们到达那个点之前,就太晚了。我们已经死了。所以,对我来说,如果它甚至能让我们活到我们可以说,“哦,是的,它们显然在试图比我们赚更多的钱,然后它们显然在试图最大化覆盖地球的 GPU 数量。”哦,有趣。我认为我们实际上可能会看到它们在做那些可读的目标。就像,我们将有机会观察到这一点,我们甚至可能能够识别出它们代码的一部分,甚至有机会编辑它。就像,我们实际上可能处于那种有点像你的主流好场景的情况,对吧?就像,我们看到了控制的杠杆在哪里,这个奖励函数,我们有机会编辑它。所以,我同意你的前提,即存在一个显著的机会,这可能是我们可以塑造的机会和拼图的一部分,你可以塑造。这是你的研究计划。所以,我同意这是一个合理的好事,值得关注,但问题是,我仍然认为,无论你将什么作为那个 Python 奖励函数,几乎肯定会出错。>> 所以,我,我,我现在没有一个很好的计划。所以,嗯,时间会证明我是否能想出什么。我不想声称一个障碍不存在,直到我真的有一个好计划。也许还有我还没有意识到的障碍。当我花更多时间试图弄清楚可能的奖励函数时。但我确实想说,我认为人类大脑是由这些,你知道,相对简单的社会奖励函数构建的。而且人类至少有时是友好的,至少不是非常明显的可怕。所以,这至少是一个存在的证明,也许有一条路可走。>> 好的。是的。让我深入探讨一下。你的意思是,你目前不声称有很高的成功概率或一个可靠的计划。而且,听起来你对整个人类解决这个问题并不那么乐观。这让我惊讶地在采访中提出了最终问题。你准备好了吗?>> 当然。>> 砰。>> 史蒂芬·伯恩斯博士,你的砰是多少?嗯,我不知道,大概 90% 吧,但你知道,我这个数字是从我脑子里冒出来的,所以随便你怎么看。>> 这么高。>> 我认为,嗯,是的,在我看来,事情看起来相当严峻。但是,当然,我们正在努力让它变得更好。所以,嗯,是的。>> 好的。有点好笑,因为我通常会早早地处理砰的问题,我有点忘了,跳过了,然后我们进行了这次有趣的采访,现在我们快要结束了,然后,“哦,顺便说一句,我的砰是 90%。”>> 是的,我认为有很多问题会影响到这一点,是的,我们可以讨论不同的贡献。>> 哇。好的。那么,当你想到你自己的计划的成功时,这似乎意味着你认为你的成功机会相当低。>> 嗯,我不知道。我认为,嗯,嗯,这是可能的,就像我正在尽我最大的努力。我认为有一个不错的机会,就像,我会想出一个某种程度上原则上可行的计划,但它很难而且实施起来很昂贵,而且很容易出错,然后,即使它被正确实施了,结果是,你知道,就像,我们甚至不知道,就像你之前在采访中提到的那些所谓的,你知道,如果你拿一个,你知道,那些所谓的生物工程高智商人类,我们不知道他们是否真的会好。也许巨大的力量伴随着巨大的腐败,即使你开始时是一个好人。而且,是的,我不确定这是否与决策相关。而且我不喜欢砰已经成为一种部落标记,被夸大了它实际的决策相关性,尽管它不是零。就像,显然,你从中获得了大量关于人们对问题的立场的重要信息。是的,我理解你。当然,Ali Azer 已经明确表示他不赞成砰。就我而言,我之所以经常在播客中提出砰的问题,是因为我试图移动“奥弗顿之窗”,让那些观看了一集又一集的人说,“哇,所有这些极其聪明的人都告诉我们,我们很有可能完蛋了。嗯,也许这个信息会传达出去。”>> 是的。我将重申,这不是像“明年 LLM 的砰”,而是像“人工智能的砰”,我不知道,在我有生之年或者什么的。>> 好的。我想先解决一些我们很容易达成一致的事情。其中之一是,当我们谈论 LLM 时,我认为你和我对 LLM 到目前为止的净积极贡献都感到满意。正确吗?>> 是的。今天的 LLM 似乎,我喜欢提出像 LLM 辅助的网络钓鱼可能是一件坏事,以及 LLM 虚拟朋友可能令人担忧的事情。但总的来说,我认为 LLM 是一项很酷的技术,如果 LLM 的进展今天就停止了,我会很高兴,并感谢发明它的人。>> 完全正确。而且,似乎我们甚至可以摆脱人工智能公司里的安全部门,然后,当然,你会有个机械希特勒在这里,或者有偏见在那里,但,随便吧。就像,那没关系。我们会解决的。>> 是的,我的意思是,如果我们摆脱了它们,公司会把它们带回来,因为它们不想要,你知道,机械希特勒。>> 完全正确。所以,你知道,从我们的角度来看,这是显而易见的,但以防万一观众感到困惑。并不是你和我讨厌技术。我们不讨厌 LLM。就像,我们认为一切都很棒。我们只是稍微看到了未来,事情会变得不同,然后我们就会被摧毁。>> 是的。我的意思是,我不是一个插画师,有失去工作的风险,或者别的什么,这很有帮助。>> 对。完全正确。好的。我想解决的另一件事,我认为这可能很容易得到肯定,就是这个问题:人类智能之上还有很大的提升空间吗?>> 是的,非常是的。>> 好的。超级智能到底能让你做什么?因为很多人说,“是的,是的,会有一个人工智能非常聪明。物理学对它来说很容易,但它仍然做不了太多。它仍然会被瓶颈。政府仍然会减缓它并监管它。”我喜欢谈论水平扩展而不是垂直扩展。所以,没有人可以同时做十亿件事情,但你可以拥有十亿个人工智能副本,它们正在运行整个文明。而且,人工智能的思考速度会比人类快得多,我预计。而且,你知道,它们会像最聪明的人类一样弄清楚事情。它们会像最有魅力的人类一样有魅力。它们会像最有说服力的人类一样有说服力。>> 好的。但是,但是听我说。但是,但是听我说。你必须在人类时间尺度上进行实验,这会减慢你的速度。>> 是的。我认为,再次,我不认为人工智能一出生就什么都知道。我不认为这对“人工智能接管”的故事真的有必要。人工智能可以消灭人类,然后进行大量实验来学习如何做事。我们,是的,我们不应该讲述需要人工智能知道它无法知道的事情的接管故事。哥德尔不完备定理是否证明机器永远无法达到人类的洞察力水平?只回答是或否。>> 不。>> 好的。好吧。你们听到了吗?嗯,这个呢?如果我们有一个超级智能的人工智能在一个数据中心里,但它没有身体,没有物理执行器,它仍然可以轻易地接管吗?>> 是的。哦,是的,绝对。>> 是的。我的意思是,我给出的简短答案是,嗯,它可以利用数百万人类。它们可以滑入每个人的私信,开始哄骗或雇佣他们。我的意思是,人类就是执行器。>> 是的。是的。我喜欢谈论,你知道,如果你把约瑟夫·斯大林放在一边,把其他所有俄罗斯人放在另一边,你知道,谁会赢?显然是数百万其他俄罗斯人。然而斯大林最终,你知道,我认为他不是一个特别强壮的人。他没有更好的武器,但他最终获得了对俄罗斯的独裁的、极权主义的控制,因为他,对,>> 他讨好,他使用魅力,他使用威胁,他使用,他使用他所有的人类技能,他使用他的大脑。>> 我认为你可以将 3000 万俄罗斯人的死亡归咎于斯大林,或者什么的,我认为至少有 1000 万。就像,他实际上比希特勒更糟糕,如果你只看死亡人数。而且,你知道,我是犹太人,但我愿意承认斯大林在道德上的恶劣程度比希特勒更糟。而且,你知道,那 1000 万俄罗斯人都会希望他死,但他们死了。>> 是的。是的。而这将是斯大林的一个下限。斯大林只有一个人类,一个人类大脑,但他仍然能够做到这一切。>> 好的。所以,我们显然在同一页上。而且你明确表示,你甚至不认为人工智能必须将人类保留很长时间。不是,哦,让人类留下来管理世界。你几乎认为,不,它们会逃跑,它们会自己管理世界。我的意思是,这确实是我的想法。我不确定这个观点有多重要。你可以不同意我的观点,然后讲述一个不同的故事,其中人工智能阻止了任何其他同样强大的人工智能的创建,并且你知道,它通过操纵自己的方式获得了世界上的大量政治和其他权力,经过了多少年或几十年,它才建造了越来越多的机器人。然后,一旦它能够独立管理世界,它就会消灭人类。而这并不是一个更令人放心的故事,但它不是一个需要,你知道,这个“百战天成”的东西,其中人工智能有一个机器人身体,那个机器人身体建造了第二个机器人身体,收集了更多的太阳能电池。而且,我认为这个“百战天成”的故事是可能发生的,但它不是实现“百战天成”的必要条件。是的。我个人最有可能的场景是我确实认为它会构建一种不同于我们人类所认为的主要技术的工作马技术。我认为一个明显的候选者是纳米技术,就像,是的,这些机器非常棒,而且对我来说实际上很容易制造和控制它们,尽管对人类来说这可能需要几十年。这就是为什么也许这个想法,“哦,我需要人类的身体来为我工作,”我觉得可能不会长久。你是这么想的吗?是的,我对纳米技术没有太多看法。>> 好的。也许你和我一样,你的意思是,你考虑情况,你考虑头部空间有多大,对吧?对我来说,它总是回到我的观点,人类智能之上还有很多头部空间,所以当我想到人工智能利用这个头部空间时,我只是期待很多烟花。我没想到它会看起来像,好吧,这里有新的管理层。是的,你可以想到所有高级持续性威胁行为者能做的事情。就像国家级的黑客,他们基本上可以入侵地球上的任何系统,只要有足够的,你知道,只要有技能和时间。而且,你知道他们能做什么,人工智能也能做到。基本上入侵地球上的任何系统。>> 我的意思是,以色列的摩萨德,对吧,以色列的摩萨德以其 Stuxnet 而闻名,对吧?它就像干扰了离心机,即使它们是气隙的。所以,它就像干扰了伊朗的离心机,并使核计划倒退。然后最近,你知道,像“信使行动”或者它能够轻易地在最新的战争中消灭伊朗整个军事领导层的方式,你知道,抱歉,我为以色列加油,这是我的祖国,但它只是一个例子,说明你可以有这些计算机科学家,这些黑客在某个局部点的一个实验室里工作,然后进行这些非常令人印象深刻的攻击,但现在想象一下,这种情况每天都在发生,对吧?就像那个花了 20 年计划的行动,对吧?就像几代以色列人加入军队,帮助这个计划。想象一下,这种情况一直在发生。>> 是的。就像国家安全局最熟练的员工,或者,你知道,最熟练的团队被复制了,你知道,十万次并行工作,这是世界接管的第一步,确实是一个可怕的前景。>> 所以,当我们加起来我们对所有这些问题的答案时,是的,有很多头部空间。它可能会发明自己的技术。它不需要太多依赖人类。这一切加起来就是,你知道,最初的,原始的 Yudcowski 和 Foom,对吧?而且我认为你和我都在同一页上,我们是 OG,我们认为人们已经开始像 Foom 是老派一样行事,你不再需要谈论 Foom 了,你只需要谈论 LLM 和训练数据,而我们说,“不,不,不,Foom 仍然会来,别忘了 F。”>> 是的。我的意思是,我们还没有谈论从现在到超级智能的过程有多么渐进,但我确实预计一个不是非常渐进的过程,而是相当突然的过程,每个人都对此毫无准备。>> 对。所以,你对事情会变得多么疯狂的图表相对于 Dario 们所宣传的来说是比较平坦的,对吧?你认为他们有点过于超前了,你预计在未来 5 年、10 年甚至 20 年内会出现一个更平坦的曲线,但然后你预计会有一个新的范式出现,这将是一个真正的转折点,然后人类就没有必要再存在一年了。>> 是的。是的。显然,如果我认为 LLM 最终会趋于平稳而 Dario 不认为,那么我的 LLM 图表就会与 Dario 的不同。所以,这并不意外。但是,是的,更实质性的说法是,我认为当人们,你知道,你知道,这个所谓的危险的下一个范式可能已经在,你知道,在档案中被研究了,在模糊的玩具模型中被研究了,但它不是,你知道,没人关心。档案中有数百万个玩具模型,没有人跟踪它们,我们也没有从试验它们中学习到关于 AGI 安全的任何东西,因为它们只是不,它们不使用人类语言,而且它们不做有远见的规划,这与我们预期的 AGI 问题真正类似。而且我认为,当这个所谓的恐怖的下一个范式足够好,以至于你真的可以看到 AGI 和超级智能,你知道,在它的眼睛里闪烁,比喻地说,在超级智能真正到来之前,留给我们的时间将非常少。你提出了一个非常大胆的说法。你说,我们与这种真正的大脑般的 AGI 之间的研发量可能不到 30 人年。所以,可能是一个研究人员工作 30 年,或者一个三人团队工作 10 年。你认为这可能就是我们达到大脑般 AGI 所需要的吗?嗯,我真的想澄清一下,这是从它已经做出了令人印象深刻的事情开始的,这些事情显然是 protoagiish 的,就像 LLM 正在做的事情。你知道,它们使用语言,它们解决问题。它们,你知道,它们在对齐研究和能力研究方面确实很有帮助,就像人类一样。我认为当你达到那个程度时,你就几乎接近超级智能了。我认为这不像,我认为这不像从今天开始需要的工作量。>> 明白了。好的。所以,你没有考虑到人们探索不同方向的试错过程。你的意思是,就像,有人已经这样做了,然后从那个起跑线开始,然后将会有另外 30 人年或更少。>> 是的,完全正确。我不知道我们还有多少人年的玩具模型。可能还有很多。>> 有趣。你认为你会注意到起跑枪响了吗?你会说,“哦不,这是最后的范式。我能看到它。”>> 如果,如果我对这一点有任何看法,我可能不会公开谈论它。>> 好的,好吧。是的,我知道 Alazer 过去,我觉得他现在说得不多了,但他过去经常说,每当人们说,“哦,你认为人工智能会这样发展吗?”他说,“我不会告诉你我认为发展 AGI 最有效率的路线是什么,”这就像,好吧,好吧,但我的意思是,如果我们的砰很高,我们就不应该到处告诉人们如何进行增益函数研究。>> 是的。是的。或者,你知道,哪些廉价的铀浓缩技术是最有前景的。>> 对。好的。现在,即使你不会具体说明,可以理解的是,你写过,我们非常接近大脑般 AGI 的最后几块拼图,它可能是非常优雅的拼图块,比如 Judea Pearl 的因果推理网络,或者用我的话来说,Transformer 架构。这不代表一块实际上很简单拼图吗?我们没有特别的理由必须在游戏的后期才找到它。>> 是的。是的。我认为这将是一种不同类型的学习算法。历史表明,学习算法并不复杂。如果你仔细想想,学习算法可能不应该很复杂,因为它是,你知道,它是能够进行语言、推理和规划的唯一一件事。如果你考虑大脑皮层,它就是做同样事情的大脑皮层。如果这是一个“鲁布·戈德堡机械”的学习算法,你不会制造一个能够学习语言,也能学习视觉,也能,你知道,进行运动控制和感觉和规划以及所有这些其他事情的“鲁布·戈德堡机械”学习算法。它必须建立在更简单、更优雅的原理之上。你可能会认为。>> 嗯。现在,我们都同意,当这个障碍被打破时,当我们最终弄清楚新的 RL actor 范式时,那么拯救世界可能就太晚了,因为在训练资源过剩的情况下,可能只需要很少的训练资源,就像大脑以其生命周期使用少量训练资源而闻名,相对于世界上有多少资源。推理资源也将非常少。所以,你甚至不需要那些疯狂的吉瓦数据中心。它们将是过度的。大量的硬件过剩。可操纵的人类是一种过剩,对吧?想想如果你足够聪明,你可以给多少人发私信让他们为你效劳。负熵过剩,就像,你知道,有如此多的原子可以配置成纳米机器人,太阳辐射。一旦你拥有了足够高的智能,这里就有太多丰富的资源了。>> 是的。是的。关于大脑使用多少计算和数据存在争议,但我恰好同意。我有很多关于,我非常倾向于,你知道,用人类大脑能够做到的事情不需要太多计算。>> 比如发明技术和在世界各地活动。我认为,比如比今天的,你知道,大型语言模型训练要少几千倍。但是,是的,我只是想指出这是我的观点,而且存在争议。>> 这也是我的观点。我认为人们的观点中有很多炒作。如果你用火药桶的比喻,对吧?周围有大量的火药,但它实际上就像一切都是火药,你知道,就像负熵。它不像核爆炸那样,就像,“哇,那个核弹爆炸是如此巨大的爆炸,如此正反馈,核爆炸的指数增长。哇。但然后它耗尽了燃料。但与人工智能不同的是,它永远不会耗尽燃料,因为它就像一切都是燃料。它将继续利用宇宙中的每一份燃料。>> 是的。我的意思是,绝对是一座巨大的火药山。就像,任何一个 AP 团队理论上可以入侵的计算机系统,你知道,都是火药,当一个足够不对齐的智能开始处理它时,爆炸起来就很糟糕。而且,是的,这相当可怕。为了总结我们的立场,也许你和我之间在这一点上有些分歧,就像你非常有信心,你知道,将会有一个范式转变到大脑般的 AGI。我更倾向于认为,就像,LLM 经过一点点调整可能就能做到。所以,我们在那里有点不同。>> 我们会以一种或另一种方式找出答案。>> 对?我们会找到的。没错。嗯,但我们都同意,就像,当这个障碍被超越时,就像,你可以放一个指标说,“人工智能刚刚在像,嗯,一个月的任务上击败了人类。”对吧?有一个起跑枪,就像,一旦我们到达那里,我们都预计会飞速前进。我们不期望这种,就像,温和的,哦,是的,人工智能公司的市值达到一万亿美元了。不,一万亿美元到时候将是小钱,或者,金钱到时候将是小钱。>> 嗯,是的,如果,如果到时候还有钱的话,当然,不幸的是,我预计每个人都会死。>> 对。好的。所以,是的,所以基本上我们都有这种,就像,无法生存的巨大数量级的概念,就像,一旦超过某个阈值会发生什么,我认为指出这一点很重要,我们的灭亡预测,我认为你和我,以及 Aliaza 和很多人,我们的灭亡预测一直取决于某个超人类阈值被跨越。所以,我们的借口是,人们说,“哦,你为什么在撤退?我们今天不会灭亡。”我们的借口就是,好吧,是的,我们非常接近阈值,而且说实话,我没想到我们会这么接近阈值。但我认为不公平地说我们已经跨越了阈值。>> 是的。是的,我同意你。我认为 LLM 并不是今天强大而可怕的人工智能。我们可以争论它会是什么样子,但我认为我们还没有到达那里。>> 所以,观众们,我希望你们一直在听史蒂芬的很多回答。你们可能已经注意到,它们和我一直在节目中与客人争论的事情很相似。比如人类智能之上的头部空间。是的,显然有。正交性理论。是的,显然是真的。伙计们,这就是“答案密钥”。当我与其他客人交谈时,是的,我与他们辩论,是的,他们持有不同的观点,但他们显然是错的。好的。这一集是我有机会带给你们另一个自己思考过一切的人。显然是一位博学家,研究过神经科学、物理学、数学、计算机科学、人工智能,在哈佛做过博士后研究,在加州大学伯克利分校获得博士学位,在哈佛获得本科学位,并且他过去五年的整个职业生涯都是 AGI 安全研究员。我只是一个播客。我有一个学士学位。但是,就你们信任哈佛教育系统而言,>> 那里有一个巨大的错误。>> 我认为你应该听听史蒂芬·伯恩斯博士是如何快速回答这些问题的。而且很疯狂,因为从我们的角度来看,是的,这就像一场胜利的巡演。显然,不是我所有的客人都同意,但从我们的角度来看,这些其他客人或者我正在做出反应的其他人都离说得通太远了。你知道,我们,我认为我们提到了 Yan Lun,Robin Hansen,Richard Hania 给出了低于 5% 的砰,这是否超出了你可能称之为理智的范围?>> 嗯,我不想称呼,我太有礼貌了,不能称呼人们理智或不理智。我认为他们是错的,但很多人在很多事情上都是错的,我试图表示同情。>> 好的。关于人工智能出于好奇心或求知欲或信息价值而让我们活着的想法呢?我有一个著名的客人 Mike Israel,他是一位健身企业家,有一个受欢迎的 YouTube 频道,他认为人工智能会出于好奇心而让我们活下来。埃隆·马斯克说,让人工智能最大程度地追求真相很重要,这将是我们实现对齐的关键。从我们的角度来看,这只是,“不,这只是你实现对齐所需的一小部分。这不会让你走多远。”是的,我我我同意这两种计划都不会奏效。>> 怎么看待这位名叫 Sai Kapoor 的人,他是《人工智能的蛇油》的合著者之一?他认为人工智能的风险概率不应该影响政策。这有什么意义吗?我认为我读过,我显然有很多抱怨,但我最大的抱怨是把对砰的不确定性等同于低砰,就像,这不应该是应对不确定性的方式。所以,你知道,他认为,就像,这些预测,你知道,人工智能很可能会杀死我们,或者很可能不会杀死我们。这些都不是基于任何东西,因为人工智能与任何参考类别都不同。它只是非常难以预测。但如果你说,就像,“嗯,也许人工智能有 0.1% 的概率杀死我和我所爱的人,或者也许有 99% 的概率杀死我和我所爱的人,谁知道呢?我们不知道。”因此,让我们什么都不做。这太疯狂了。这不是在不确定性下如何行动。就像,你知道,我们可以争论如何在不确定性下行动,但那不是。你知道,你可以采取“最小化最大值”策略,试图,你知道,假设最坏的世界,或者你可以做某种议会的事情,或者别的什么。但是,是的,只是说,“我不会,我将把问题视为不存在,因为没有人能证明它是。”我也认为客观的论点是好的,而且砰实际上很高。>> 与不可知因素分开。>> 是的。好的。所以,回到人们为什么会如此错误的想法。有很多人希望更聪明意味着更道德,包括 Scott Sumner 和 Scott Aronson,我倾向于同意他们说的大部分话。就像,他们无疑是非常聪明的知识分子巨匠,但当你向他们提出正交性理论时,他们突然坚持认为它是错误的。是的,这可能是一个类比,今天的 LLM 和未来的人工智能,至少我正在考虑。所以,如果你看看人类的分布,我没有强烈的意见,但至少对我来说,道德和智能之间可能存在系统性的相关性。我的意思是,当然有,我不知道,有吗?当然有聪明的人很糟糕,也有聪明的人看起来很不错。但如果存在相关性,你知道,我没有强烈的意见,但如果存在相关性,那么大概可以延伸到 LLM,毕竟它们是在人类数据上训练的。嗯,它们的许多行为倾向都来自人类分布。但我想到的是这些未来的人工智能,它们根据来自这个奖励函数和你知道的置信度选择而不是根据“在这种情况下,人类可能会做什么”来做决定。然后,所有的赌注都落空了,你真的不能依赖人类分布,你必须回到基本原理,意识到你不能从“是”中得到“应该”。>> 我同意。现在,与这个想法有关,即人们认为正交性理论是错误的,你知道,足够智能的人工智能的道德轨迹会朝着正义或朝着善良发展。人们可能会从这个说法中退缩,他们会说,“好吧,好吧,是的,正交性理论是真的,但是,你知道,一个好的对齐解决方案是什么?社会进化?如果你想听一集关于这个的节目,你可以在我的频道上搜索 Gil Mark,或者你可以搜索 EMTT Shear。我做了一个反应集,听 EMTT Shear 谈论他的公司 Softmax,他们正在做某种社会进化,据我所知,他们认为这将建立一个相互对齐的人类和人工智能社区。这是我能做的最好的代表他。你知道,如果他想更精确地解释他的意思,他随时欢迎来我的节目。所以,史蒂夫,你考虑过社会进化作为对齐解决方案的想法,并且像我一样,你并没有看到多少希望。你指出了许多问题。凭你的直觉,有哪些问题?>> 嗯,我对 Emiture 在做什么不太熟悉。我以为他是在研究蚂蚁群和细胞之类的东西,而我只是不认为这对人工智能真的有用。也许有一个我没看到的愿景,但蚂蚁群和细胞在合作,但它们没有进行有远见的规划和手段推理,而这正是人工智能的力量和危险所在。所以,这就是我正在思考的。历史上,在强化学习中,人们通常只是写下他们想要的奖励函数。所以,比如,在 AlphaGo 中是赢得围棋,在 Atari 游戏中的是赢得视频游戏,或者视频游戏分数,我想。他们写下奖励函数,然后他们花,你知道,99.9% 的时间来开发代理以优化该奖励函数。而我说的应该是,我们应该花更多时间来设计一个好的奖励函数,并真正思考它,而不是,你知道,将 0.1% 的强化学习教科书用于奖励函数设计。这应该是第一个也是最重要的问题。但还有另一个选择,就是对外循环搜索奖励函数。这就像进化最接近的类比,你知道,奖励函数就像学习算法和其他一切一样,通过自然选择进化。我认为这不太可能是一个好主意。尽管,你知道,我不想完全排除它,但是的,有很多问题。一个问题是,为了使其可行,你将需要人工智能与其他人工智能一起存在,它们可能会发展出良好的社会本能,但这些本能不会推广到人类,而这将是一个问题。另一个可能的问题是,也许它们不会进化出非常有合作的本能,就像,我不知道,比如狼群会合作,但它们也,你知道,它们彼此之间非常具有攻击性,等等。即使是人类,你知道,进化博弈论据说与某些人类是精神病患者以及人类有血腥欲望和愤怒以及所有这些其他我们不一定希望 AGI 拥有的东西有关。然后还有一个问题是,如果我们不清楚奖励函数将从哪个可能性空间中被这个外循环搜索过程提取出来,那么我们可能会遇到每个可能性都会导致危险 AGI 的问题,然后仅仅进行外循环搜索对我们没有任何帮助。>> 对。所以,你刚刚列举了两个我们不应该对这种社会进化方法过于乐观的原因。你说不同的动物进化出不同的社会本能。所以,你可能不会得到人类,你可能会得到狼的道德。而且,正如你所说,博弈论说,如果每个人都太友好了,那么精神病患者实际上将是最佳策略,而我们不想要那样。然后,从你的写作中,我注意到两点:你说它教会人工智能与人工智能对齐,所以它们可能会忘记与人类对齐。>> 是的。我的意思是,人类将它们的善良推广到婴儿和其他人类,以及像大象这样的有魅力的动物,但对蜘蛛和蛇之类的动物则不那么推广。这是一个悬而未决的问题。你可能不想仅仅听凭机会和你知道的这种盲目的外循环搜索过程。理想情况下,你会,你知道,设计它,这样你就知道它会推广到不进行大规模谋杀人类是一个好主意。>> 对。现在,还有一个问题。我不知道你是否明确写过,但我认为这是显而易见的,就是可能出现一个单一实体,因为生物学上的限制不适用。具体来说,就像,在生物学上,你不能拥有一个像世界一样大的身体。你需要繁殖并拥有一个协同工作、相互依赖的身体群体。而对于人工智能来说,你可以拥有一个像世界一样大的身体。你可以到处运行代码。是的,单一实体与数百万个相互合作的克隆军队之间存在一种区别,但没有实质区别。而且你不需要社会本能来与你的克隆合作,因为你已经想要同样的东西了。>> 对。你可以自上而下控制。>> 是的。所以,这是另一个问题。我绝对认为我们应该认真考虑统一的人工智能力量,称为单一实体,而不是,或者至少除了多个人工智能相互竞争的场景之外。>> 所以,总结一下这里的讨论,我认为你和我一致认为,如果你没有一个计划来使一个人工智能对齐,而你只是把它们放在一个笼子里,你知道,让它们一起进化。我认为你不会得到对齐,除非你放入对齐。是的,我认为这是最有可能的。然后你只能依赖测试或其他什么。但是,你知道,如果你要做测试,那么为什么不自己设计呢?>> 完全正确。但是,为了偷换概念,为了偷换概念,对吧?就像,嗯,进化造就了我们,我们对我们最终的样子感到满意。所以,我想我们都同意,有可能它会提取出与我们相同的道德观,但它似乎并不是每次运行都如此。>> 是的,我认为当我们看待人类的结局时,有一些“围绕箭射击”的情况。完全正确。完全正确。而且,当然,要记住约束条件,我们是生物,我们有身体。所以,如果人工智能,如果我们打算使用生物学并让人工智能拥有物理身体和世代,并且无法在世界范围内复制自己。好吧,我想这增加了我们成功的机会。>> 是的。是的。而且,即使你做到了这一点,现实世界也是一个分布转移,就像,人类今天做的事情与 2000 年前大不相同,因为我们不断发明新技术,这不断改变我们的选择。同样,人工智能将拥有发明新技术的选择,而这些选择在训练和测试环境中是没有的。>> 你读过肯·斯坦利博士关于发散与目标追求的书吗?>> 不。>> 所以,肯·斯坦利博士是“灭亡辩论”节目的嘉宾。我们进行了一场激烈的辩论,他也是 Softmax 的顾问,与 Emma 一起。他是我最喜欢的知识对手,因为我有一个非常以目标为导向的世界观,而他却说,“你知道什么最有效吗?没有目标,只是漫无目的地探索空间,因为这样你实际上会获得更多的探索价值。”就像,这大致是他的想法。我可能没有很好地代表他,但他只是我很多想法的一个很好的陪衬,这就是为什么我们进行了如此激烈的辩论。但是当我看到 Softmax 时,对我来说,它只是基本上基于这些绝望的想法。用他们自己的话说,他们就是“不尝试”。

为了自上而下地对齐,但他们让 AI 彼此对齐,然后人类将成为这个“对齐群体”的一部分。我甚至不知道。但我的观点是,从我的角度来看,这远远超出了合理性,对吧?>> 嗯,再说一遍,在没有阅读更多关于他们的信息以及他们来自哪里之前,我不敢说得太绝对。我只能说,如果他们有一个清晰的愿景,那还没有进入我这迟钝的脑袋。>> 好的。现在,我们刚才做的这一部分的目的是,我们回顾了对我们来说显而易见但却有争议的想法,我只是想让观众明白,当我们和朋友在一起时,这个节目叫做“末日辩论”,但当我们只是和朋友聊天时,我们并不真的把它看作是一场辩论。就像这些对我们来说是早已解决的问题一样。所以,我们不把它看作是末日辩论,我们只把它看作是末日。>> 是的,我的意思是,这很公平。>> 好的。比如正交性论点。我们不认为这是一个我们必须不断争论的古老哲学问题。我们必须说,是的,我们知道答案。>> 是的。如果你对未来有任何愿望,那么是的,那个论点很烦人,因为人们一直在重新定义正交性论点,使其含义不同,有些是真的,有些是假的。而且,我们无法保持我们的术语足够清晰,所以,我不知道。人们喜欢表现得好像他们反对正交性论点,但如果你深入探究,就像我上周读到的一篇论文,有人反对正交性论点等等,但然后你在文本的某个地方会看到“我承认,AI有可能想要消灭人类。”我当时想,好吧,那么我们实际上并没有在正交性论点上 disagreement,你只是不喜欢那种感觉。>> 对。正是如此。我认为这里的问题是,社会不允许我们在哲学战争中获胜,这有点像地缘政治,对吧?好吧,俄罗斯入侵乌克兰,抱歉,俄罗斯,你真的无法赢得战争并占领乌克兰的领土,那真的不太酷,也许这有一些逻辑,也许我们不应该让国家赢得战争,尤其是那些他们自己发动的战争。好吧,所以也许这在地缘政治上是说得通的,但在哲学上,我认为如果有人有更好的关于哲学上什么说得通的想法,我认为我们应该让他们赢得战争。你和我,我们都同意在量子理论中,多世界应该赢得战争,我们不应该还在谈论该死哥本哈根诠释。同样,正交性论点,不幸的是,我必须在我的节目中辩论它,因为许多非常聪明的高层人士,拥有大量权力的人,仍然认为它是错误的,但从你的角度和我的角度来看,它应该被允许赢得战争,即正交性论点是正确的。>> 是的,令人沮丧的是,哲学和其他领域中的坏想法会永远存在。丹尼尔·丹尼特在他的回忆录中谈到了这一点,他说,有一个针对某个哲学子领域的哲学共识在不断增长,我不记得是哪个了。但然后那个子领域里的人发动了一场政变,成功地将自己选入了哲学专业组织的领导层,然后战斗还在继续,据我所知,它永远不会结束。>> 好的,回到解决对齐问题。我们谈到了一个相对有希望的方向。你解决对齐问题的方向是研究一个可识别的、似乎与人类价值观一致的奖励函数,并试图从中提取人类大脑的社会动机中的好东西。我同意这是一个相对有希望的方向,即使它可能不是那么有希望。我认为我们在这方面有共识。我想指出的是,大多数人工智能公司和大多数非末日论的技术行业,他们甚至没有意识到这是我们需要去的一个方向。他们太沉迷于大型语言模型了,对吧?他们把整个研究项目都围绕着它来构建。就像他们看不到一步 ahead。>> 我的意思是,如果他们正在研究大型语言模型,并且他们正在尝试进行针对大型语言模型的对齐,那么这是可以理解的。真正让我恼火的是那些试图推动强化学习和基于模型的强化学习代理走向通用人工智能的人,他们说他们正在尝试这样做,并且他们花费了他们生命中几乎所有的时间来思考,随着人工智能变得越来越强大,一个好的奖励函数应该是什么样的。大型语言模型的人也确实在做越来越多的强化学习,我认为他们还没有足够仔细地思考这种训练协议变化的影响。嗯。好的。我想谈谈外部对齐和内部对齐,因为你解释得很好,而且实际上与我一直以来的想法略有不同。所以,我认为我们都同意内部不对齐意味着目标泛化错误,也就是说,你得到了这些信号,你知道你得到了赞成票和反对票,或者其他某种奖励信号,你认为你知道如何优化你将要获得的信号,但你构建的优化它们的模型与信号生成者的模型非常不同。嗯,或者至少是预期的。我应该澄清的是,外部和内部不对齐会根据人工智能范式有不同的变体。我认为这是思考主动批评强化学习的有用方式。所以,内部不对齐是指批评者——批评者是记住这一点的东西,我认为我将关闭窗口,而批评者是根据生活经验猜测这是个好主意还是坏主意。所以,批评者正在采取这种涉及世界模型的丰富语义计划,并猜测根据奖励函数,它会好还是坏。奖励函数是一种更愚蠢的东西,它不理解世界的一切。所以,你可能会出现不匹配,批评者认为某事是好是坏,这与奖励函数将如何奖励该计划或惩罚该计划不符。我喜欢举例,比如如果我吸食可卡因,那会非常有回报,但我不会吸食可卡因,因为我不想上瘾。所以,这是一种内部不对齐,因为奖励函数会说可卡因是个好主意,但批评者说可卡因是个坏主意,所以我不会这样做。>> 所以,如果我理解正确的话,内部不对齐在训练期间不会发生。这是人工智能在训练期间与在生产中的行为之间的区别,因为在生产中,它认为它会因为做可卡因而获得高回报,或者我不知道。它认为有一些行为,比如“这是最好的行为,我将获得如此高的回报”,如果在训练中,它实际上会获得低回报,但它泛化错了。>> 对我来说有点不同,因为我正在考虑这些连续学习范式,你永远不会停止进行强化学习。我现在正在用我自己的大脑进行强化学习。我一生都在这样做。所以,如果你有一个像这样的人工智能,那么一旦你做某事,它就不再是分布外的,它也不再是泛化问题了。但内部不对齐仍然可能是一个大问题。例如,如果我不吸食可卡因是因为我不想上瘾,这是一种内部不对齐,但它不会得到纠正,因为我从不吸食可卡因。一个更可怕的例子是,如果我去接受手术来改变我的奖励函数,或者我开始服用像 Ozempic 这样的药物来改变我的奖励函数,那会得到纠正,但到那时就太晚了。>> 现在,当你使用可卡因的例子时,我觉得它具有误导性,因为我们通常认为可卡因是一种不好的结果,上瘾于可卡因,这就是它在大多数讨论中的感觉。但你说你的情绪实际上打算奖励你吸食可卡因,而你错过了那个信号的预测。>> 是的,这是一个重要的观点。所以,我们通常是从我们自己的角度来看待它,从我们自己的角度来看,内部不对齐是一件好事,因为你知道,我们围绕着箭来绘制靶子。我们想要的东西就是我们想要的东西,如果我们的奖励函数想要不同的东西,那么对我们的奖励函数来说就更糟糕了。但如果我们站在 AGI 程序员的角度,并想象我们已经在奖励函数中放入了一些东西,我们期望它能引导我们的人工智能的动机,而人工智能说,“嘿,你知道我要做什么吗?我要编辑我自己的奖励函数。我要创建一个具有不同奖励函数的子代理,或者其他任何东西。你知道,一些不可逆的行动,这可能会有问题,因为它使得推理人工智能将要做什么变得困难,而且它可能会做一些我们不希望它做的事情。”>> 完全同意。好的。那么,继续谈论外部对齐。你称之为“规范博弈”和“奖励黑客”。所以,这里的想法是,代理可能完全知道。它擅长预测它将获得什么奖励。只是它预测它可以采取所有这些违反直觉的举动,比如接管世界或杀死操作员等等。它正确地预测它可以采取这些不受欢迎的举动,然后最大化它从奖励函数中获得的奖励。>> 是的,没错。这是强化学习文献中的一个经典问题。在大型语言模型时代,人们已经有点忘记它了,但如果你奖励在有 bug 的游戏中获得高分,那么人工智能通常会学会利用这些 bug,也许你并没有打算这样做。但如果你进入现实世界,面对它所有的复杂性,也许获得高分的好方法是,你知道,奖励人类快乐,那么它可能会把你锁在监狱里,给你注射海洛因,就像他们说的。>> 现在,你称之为内部和外部不对齐,我认为这是一个很好的区分,它是有道理的。但我认为我一直把它们都归为内部不对齐,因为我认为还有另一个层次的外部对齐,那就是我们作为人类,甚至知道该写下什么作为奖励函数。>> 是的,我猜我把它归类为安全有益的 AGI 问题,我对此非常感兴趣。而且这一切都必须联系到一个清晰的故事。写一本书说这就是我们想要的 AGI 做的事情很容易。但如果我们不知道如何为那本书编写代码,那就没用了。而且存在一些相互关联的约束。比如,如果我们只能编程 AGI 做的事情有限,那么当我们试图头脑风暴我们真正想要 AGI 做的事情时,我们就必须围绕它来工作。>> 让我快速玩弄一下你的术语。所以,你有一个人工智能,你刚刚训练了它。你试图训练它变得好,现在它已经投入生产了。它不再接受训练了。然后它去做一些马基雅维利的事情。如果它做了马基雅维利的事情,因为它认为在训练时你会给它高回报,而它是错的,那么那就是内部不对齐。但如果它采取了马基雅维利的行为,因为它正确地预测到你搞砸了你要给它的奖励,而它实际上获得了高回报,那么它就是外部不对齐。>> 嗯,我不同意,当你开始谈论训练与部署的区别时,因为再说一遍,我认为一切都是训练,因为我处于这种连续学习范式中。>> 好的。只是当你谈论内部不对齐时,我觉得它就像是拼图中的一个重要部分,它必须错误地预测奖励函数将如何工作。>> 嗯,它不一定在事实上是错误的。比如,我有一个关于吸食可卡因后我会感觉如何的正确事实信念,但我仍然不想吸食可卡因,因为我不在乎感觉良好。我只是,我也在乎其他事情。你知道你会因为吸食可卡因而获得回报,但你决定不这样做,所以这是另一种错位。它不是来自错误的预测。它只是来自你做决定的其他方面。>> 是的。这是一种本能的渴望,想要吸食可卡因或不吸食可卡因。而仅仅更好地理解世界并不会让你产生这种本能的渴望。>> 对。对。对。好的。让我们回到最外层。嗯,你知道吗?你甚至不称之为外部。我一直称之为外部对齐,那就是将我们大脑中编码的道德混乱转化为一个巨大的愿望,你知道,我们真正想要什么?或者你可能称之为天堂的规范,对吧?天堂会发生什么?让我们设计一下,让我们和建筑师谈谈,让我们建造天堂。>> 是的,很难知道。随着 AGI 的到来,正在发生很多可怕的事情。而且,如果有一个能避免灭绝的计划,那将是极好的。我正在努力拼凑一个可行的计划,但我并没有真正掌握它。>> 我觉得你是在回避这个问题,对吧?就像你没有,你说,“是的,天堂的规范。那会很好,但那只会发生在你的操作顺序中。”而且,再说一遍,我并不是说你对你的计划有信心,对吧?你只是尽力而为。但听起来你正在按顺序排列事情,比如,“嗯,我们只会有一个拥有大量人类社会本能的超级智能 AI,它会思考天堂的规范是什么。”>> 嗯,我不喜欢那个计划。我觉得我能做的就是想出一个任何计划。确实,如果人类能够想出一个天堂的规范,那么原则上 AI 也能做到,如果它们拥有相同的内在驱动力、归纳偏差、训练环境等等。要完全准确地做到这一点并不现实。然后谁知道会发生什么。如果我生活在一个我可以写下任何规范并让它发生的世界里,那么我不知道。我可能会想让 AI 服从某种像长期反思这样的过程,来建立它,并服从无论结果如何,以一种更公平民主的方式决定的人类整体。我不知道如何将这样的规范转化为代码。那么,有没有可能……你知道,只是制造一个人工智能,你知道,摧毁所有 GPU?就像人们有时开玩笑说的那样。我不知道。我也不知道如何做到这一点。只是想办法摆脱这种危险的境地似乎是一个难题。>> 是的,我的意思是,我认为罗曼·尤尔科夫斯基的立场很大程度上基于我称之为外部对齐的难度,他说,“看,无论你写下什么,一旦你优化它,它都不会真正是你真正想要的。”>> 嗯,是的。但我的意思是,我不知道。这就是人类一直以来的处境,因为我们有内在的驱动力,每一代人都朝着某个方向发展,你知道,我们对此感到高兴。我猜我们别无选择。但当我们把权力交给下一代时,他们将去优化他们想要优化的东西,过他们想要过的生活,我们无法控制这一点,我们只能寄希望于最好的结果。>> 好的。这些人工智能公司,它们经常谈论人工智能帮助人工智能对齐,以一种渐进的方式,我猜你会称之为可扩展的监督,对吧?这个术语基本上是这个意思吗?>> 嗯,这是其中的一部分。如果我理解正确的话,我认为我会以不同的方式定义可扩展的监督。>> 好的。好的。好吧,让我们就说人工智能帮助人工智能解决对齐问题,或者正如 Aliezer 所说的,“人工智能会做我们的人工智能对齐作业。”>> 是的。我的意思是,我认为这是一种在没有充分论证的情况下进行攻击,但我确实认为这很糟糕。>> 是的。好吧,让我插一句话,因为你那种试图逆向工程人类社会本能如何在大脑转向系统中工作的 AI 对齐方向,这种特定的对齐方向似乎是我可以想象人工智能实际上会加速的。所以,这些认知公司正在招聘机器学习研究人员,我希望他们能找到非常优秀的研究人员,并希望他们使用人工智能来帮助弄清楚他们大脑扫描切片中的联系。我使用大型语言模型不多,但使用了一点点,我很乐意使用它们。我乐意让人们使用人工智能来帮助人工智能对齐,就像他们应该使用任何其他工具一样。但这与人们经常谈论的将任务委托给人工智能不同。我认为这有一些鸡生蛋蛋生鸡和其他无法解决的问题。>> 对,我认为另一个问题是,一旦人工智能在研究方面非常擅长帮助我们,我们就已经开始了那个阶段。>> 是的,那就是鸡生蛋问题的一部分。>> 是的。所以,我们必须提前解决。>> 是的,那就是鸡生蛋问题的一个角落。然后另一个角落是,如果人工智能不想帮助我们进行对齐,那就不好了。但我们需要解决对齐问题,才能制造一个想要帮助我们进行对齐的人工智能。是的。让我们谈谈人工智能政策。我是 PAS AI 的成员。我只是认为我们应该暂停人工智能,尽量将其保持在当前水平,尝试进行智能增强,或者至少对当前的人工智能进行更多研究。我对这个提议并不满意。我不兴奋。我希望看到更多酷炫的技术出现,但我认为现在继续前进有点疯狂。现在,你写过你其实对 PAI 这个提议并不那么看好,尽管你有 90% 的末日论。所以,解释一下你自己。>> 是的,我的意思是,我认为大型语言模型将在达到非常强大、可怕和危险的人工智能之前达到平台期,而它将是某种未来的范式,需要更少的计算。所以我认为我们与可怕的人工智能之间的主要瓶颈是人们在玩弄玩具模型并在 Archive 和 GitHub 上发布。而且我认为到目前为止的暂停人工智能的行动不会有效地劝阻这些研究人员。我猜我首先应该说,我认为在边际上,争取时间是好的。在超级智能到来之前争取时间将是非常好的,因为我认为我们还没有准备好迎接超级智能,但我们在取得渐进式进展。我不认为争取时间是唯一的事情,也不是最重要的事情。我只是希望有更多的人在这个领域进行好的研究。但这是我认为在边际上会有好处的事情。如果人工智能,你知道,离我们还有一万年,那么我就会说,嗯,在那个边际上,我希望人工智能来得更快。但在当前的边际上,我希望它来得更晚。所以,从这个意义上说,我在意识形态上与暂停人工智能的目标是一致的。但我想,实际上暂停人工智能涉及到,你知道,暂停这种研究中的玩弄,这种研究似乎很难也很不切实际地减缓。换句话说,你在我这边,认为如果我们能找到一个瓶颈,那么切断人工智能的发展将是很好的,但问题是,人们谈论的唯一瓶颈是训练运行,对吧?如果它是一个大型训练运行或昂贵的训练运行,那么这样做是非法的。这就是每个人都在谈论的。这正是我支持的。但我认为你正确地指出,那不是一个很好的瓶颈,因为即使是一个随机的家伙在他的实验室里,一个独立的像你一样的研究人员。嗯。史蒂夫,你在做什么?但一个独立的研究人员可能只是让我们突破到下一个突破,而瓶颈根本不起作用。事实上,瓶颈甚至可能将一些精力转移到更危险的事情上。>> 是的,潜在地。是的,这基本上就是我的出发点。>> 所以,你甚至有一个论点,即暂停人工智能是净负面的,如果它转移了努力。>> 嗯,我的意思是,我认为这种效应基本上趋于零。嗯,我大多对此持中立态度。你希望人们采纳其他政策吗?>> 嗯,是的。我对那方面没有太多强烈的看法。我通常把那留给政策制定者。>> 是的。是的。说实话,我也是。我的意思是,这个节目的目的基本上就是散布恐惧,只是为了让人们意识到,嘿,伙计们,我们完蛋了,对吧?然后人们会问,那么我们应该做什么,Lon?我说,嗯,我不知道我是否走得那么远,好吧,但我只是认为大多数人都在四处走动,甚至不知道我们完蛋了。我觉得我可以通过至少让他们睁开眼睛看到末日来尽我的一份力量。>> 嗯,是的,你做得很好。>> 谢谢。你认为散布恐惧是好事吗?>> 嗯,我希望人们对人工智能的未来有准确的看法,他们可以根据这些准确的看法来感受他们的感受。嗯,但我认为准确的看法将包括,我们正在朝着制造想要杀死其程序员、杀死其用户以及杀死其他所有人的 AI 发展,而且这是一个艰难的技术问题,而且它不是我们可以通过迭代就能解决的那种问题,因为有很多深层原因,你知道,安全很难测试,你知道,不可逆转的问题。我认为我们正在邀请这个新的智能物种来到地球,而且,你知道,没有人征求许可。他们只是在这样做,而这将是一个由精神病患者和敌对人工智能组成的物种,而且这真的很糟糕。而且,我认为如果人们知道这一点,那将是件好事,只要它是真实的。>> 是的。好的。那么,请告诉我。你知道,你说话很平静,你享受接受采访的乐趣,但你感到恐惧吗?嗯,我认为我的情绪并不主要取决于此。我仍然对……你知道,我的孩子摔倒膝盖比……或者我不知道。我仍然为……你知道,我的孩子摔倒膝盖而感到难过。偶尔我也会因为即将到来的末日而流泪,以及这些事情有多难解决,以及我没有取得更多进展,我会感到沮丧,我会感到其他事情,但大多数时候,我只是尽力而为,过我的生活。>> 是的,完全同意。我前几天在路上慢跑,没有路边,汽车开得很近,我想,你知道,我在这方面所做的努力,比如我现在应该有多直观的恐惧,我应该比处理蛇更害怕,因为我跑步靠近这些汽车。但我的直觉还没有真正跟上,对吧?我真的没有直觉说,“哦,天哪,跑近一辆车太可怕了。”你知道,就像一只老虎张开嘴巴对着你一样。我只是,你知道,我的下丘脑和脑干还没有收到信息,因为我还没有经过几代人的进化。>> 是的。正是如此。>> 所以,对。所以,就像,好吧,我们都将因为人工智能而完蛋,但我没有,你知道,我只是没有那个固件来感到害怕。>> 是的。是的。如果有一只蜘蛛爬到你的腿上,那将比我在播客上宣布你最有可能的死因是人工智能的反应更强烈。>> 正是如此。好的。那么,我们在这方面有共识。好的。你准备好闪电战了吗?>> 嗯,当然。好的。我的意思是,这些都是巨大的话题,可以单独进行采访,但对我们来说,这只是闪电战。好的。那么,进攻,防御,平衡。你的立场是什么?哪一方会赢?>> 我倾向于非常强烈地站在进攻一方。>> 我也这么认为。而且我不知道是否有简单的答案,但关于这个呢?哦,你是物理学家。太好了。所以,我要问你物理学方面的问题,低级物理学方面的问题。你不认为向任何空间立方体倾倒能量的能力对攻击者来说是一个巨大的优势吗?>> 是的。是的。摧毁比创造更容易。还有一点是,如果你足够不遵守规范,力量就会产生力量。你知道,在僵尸末日电影里,有一个僵尸会变成两个僵尸,然后变成三个僵尸。你知道,我预计人工智能将是每个芯片运行一个推理副本,而不是每个数据中心运行一个。所以,一旦人工智能入侵了另一个芯片,它就会使自己的力量翻倍,然后它又获得另一个芯片,它的力量就会再次翻倍,或者获得另外两个芯片。所以,这是世界不稳定的另一种方式。>> 所以,当我们问进攻还是防御会赢时,也许这相当于问最好的防御就是好的进攻,对吧?对。因为,而且它确实感觉像是答案是肯定的。因为如果你有很好的防御,但你的边界很小,就像你的防御真的有多好?战略上增加你的边界不是很诱人吗?在这种情况下,这不就意味着进攻比防御更强大吗?>> 是的,我的意思是,有那种……你知道,相互确保摧毁之类的事情。我不知道。有一个关于它的整个讨论,而且这是一个简短的回答,而不是详细地谈论所有事实。>> 好的。对。正是如此。我们已经超出了闪电战的时间,但但请考虑这一点。好的,我有一个关于防御的论点,那就是你可以防御三维球体的二维边界,而且……你知道,二维边界相对较小。你可以在该边界内的三维空间中做很多事情。但我想我也可能在争论……你知道,这就是为什么你想控制尽可能多的领土,因为边界相对容易防御。>> 嗯,我认为我不会太看重这种抽象层面的论点。比如,我想谈谈导弹防御很难,即使导弹必须穿过一个区域,因为它们移动速度很快,而且它们带着炸弹。但哦,但瘟疫呢?我不知道。我们可以一整天都在谈论不同类型的威胁。>> 我认为你和我都可以同意,智力将迅速超越人类水平,所以归根结底,这在物理性质方面,谁拥有根本优势,这并不重要,因为人工智能无论如何都会通过工程解决方案来解决问题。是的,我预计会有一个人工智能,它有能力接管世界,并独自运行世界,如果它愿意的话。然后希望它的动机是好的。>> 同样。同样。我还有最后一个想法在我的笔记里,我认为值得分享,关于进攻与防御,那就是,假设防御获胜,而防御比进攻更容易。好吧,没问题。但第一个进入进攻状态的 AI 将迅速扭转其角色,现在它正在保卫其领土,然后我们就输了。是的,你将不得不防御人工智能。没错。>> 所以,我想,你知道,我之所以提起这一切,是因为我觉得那些说我们可能会……你知道,我们可能会侥幸成功,因为防御比进攻更容易的人。我只是看到了很多问题。你知道,我没有看到很多……你知道,幸运的迹象。>> 是的。嗯,再说一遍,防御针对高级持续性威胁,你知道,国家级黑客是不够的。如果你有百万倍的规模,你知道,美国国家安全局将能够入侵一切。然后防御的方法是说,哦,我们有自己的百万倍规模的美国国家安全局,它将……你知道,修补所有 bug。但然后这就说明,好吧,那么我们需要担心那个被误导。>> 是的。正是如此。对。就像,你知道,吃掉蛇的猫鼬,现在猫鼬是威胁。>> 是的。>> 好的。你的模拟概率是多少?>> 嗯,我认为是,我们生活在一个真实的世界里,而不是一个由其他有意识实体模拟的世界。但我不知道如何分配概率。>> 嗯,来吧。你得给我一个大概的数字。>> 嗯,如果我随便说一个数字,我猜我会说 1% 左右。>> 哇,只有一。好吧,我们应该就此进行一场全面的辩论。好的。而且实际上,你知道,我的 PDM 只有 50%。我是 50% PDM,50% P 模拟。你是 90% PDOM,1% P 模拟。这很有趣。>> 我们有很多分歧。没关系。>> 人们可以有很多不同的立场。是的,我注意到了。好的。嗯,最后一个闪电战问题。关于人工智能大规模失业或一些人称之为渐进式去权力化的想法。我赞同 Aliezer 的引述,他说,“担心机器超级智能对就业市场的影响,就像担心月球撞击地球对中美贸易关系的影响一样。”是的。是的,会有影响,但你有点错过了重点。我认为 ASI 将是……你知道,我们星球上的这个新的智能激进物种,它可能会消灭所有人类。如果不是,那么我们就有……你知道,失去工作是我们应该考虑的最后一件事。>> 是的,我们都同意这是一个好问题,因为它意味着我们都没有死。>> 是的。>> 我改变主意的方式是,我认为即使我们最终拥有这个好问题,它实际上也不是一个简单的解决方案。它不是,哦,只是给每个人普遍基本收入,给他们爱好。它不是一个简单的解决方案,因为我实际上认为,一旦我们幸运地处理了渐进式去权力化,我们仍然会被去权力化。>> 如果你有一个人工智能单体,那么你就不一定受到我理解的渐进式去权力化论文所关注的那种竞争性“逐底竞争”。嗯,而且我对人工智能单体的想法并不满意。我认为这有点可怕,但无论好坏,这实际上是我现在预期的。>> 是的,观察到你的好情景很有趣,再次强调,你对此并不特别自信,但至少你给了它一个机会。这是一个好情景,我们拥有这些强大的自主人工智能,它们内化了人类社会本能,基本上是好的,但也很自主和独立。在这种情景下,它们可以帮助我们分享权力。嗯,是的,把我们留在比喻的动物园里,那不是……>> 但比更好的动物园。就像有很多丰富的东西。>> 它只是轻微的反乌托邦。嗯,与……>> 是的,你知道,那可能是另一个末日情景,那就是渐进式的动物园生活,就像,好吧,你得到了你想要的一切,但你只能接受你最终是别人的宠物的想法。我的意思是,我很难想象人类最终会控制宇宙的命运,而这就像让一个 5 岁的孩子负责美联储一样。就像,>> 是的,>> 有些人拥有更多的经验,他们更深思熟虑,你知道,更聪明,在任何可以想象的方面都更胜任,而且是一个巨大的因素。那么,你为什么要让一个 5 岁的孩子负责美联储呢?所以,就像,如果人工智能没有杀死我们所有人,那么我们就会……我猜我们会处于这种境地,人工智能将处于一个更好的位置来做出……你知道,决定。>> 好的,观众朋友们。所以,这显然是一次非常漫长而广泛的谈话。史蒂夫是一个真正的知识宝库。如果你想获得更多这些知识,请访问他的网站,它链接在节目说明中。有太多好的文章了。我们在这场谈话中只是触及了表面。而且我认为你也可以看到史蒂夫对这么多不同的事情都很了解,当他在研究方面取得进展,或者当人工智能世界取得进展,并且有更多新事物出现时,他肯定会是我想要寻求更多问题并帮助理解这些事情的人。然后最后,我想指出关于史蒂夫的是,他实际上正在直接解决人工智能对齐问题,而且这种方式并不明显错误和无望。他实际上正在认真尝试,他可能真的是世界上能够真正帮助人类解决这个问题的人之一。所以,所以史蒂夫,谢谢你这样做,也谢谢你来到“末日辩论”。>> 嗯,非常感谢你的邀请。我玩得很开心。>> 非常感谢史蒂文·伯恩斯博士来到节目,从我的角度来看,他是在说实话。只是如实地说。我想重申一下,他实际上正在解决这个问题,而且他理解这个问题,这真是太棒了。他不仅仅在考虑如何让人工智能在政治上正确。他没有考虑当前一代的大型语言模型如何能更好地微调以赚更多的钱。他当然不是来“末日辩论”并要求我说服他所有显而易见的末日列车站点。他已经掌握了。他远远领先于其他人。但他就在数百万我们需要的我们所在的地方,就在我们的谈话所在的地方。那就是舆论窗口需要存在的地方。不幸的是,正如你所见,我们还有很长的路要走。所以,请尽你的一份力量。你可以支持这个节目。首先,点赞,订阅,评论,你知道,喂养算法。但你之所以想去 doomdebates.com 并点击订阅按钮,给我你的电子邮件地址,还有另一个原因。我们即将推出几集精彩的节目。我刚刚宣布很快就会有一集与 Vitalik Buterin 的节目。甚至还会有一集与我最喜欢的知识偶像。没错,Ali Ezra Udkowski。你不会想错过这些节目,但除非你现在就去 dunebates.com 输入你的电子邮件地址并订阅,否则你会错过它们。这有助于节目。它有助于史蒂文·伯恩斯这样的人为他们的事业获得更多支持。你正在尽你的一份力量来支持这项使命,我对此表示赞赏。所以,请现在就去做。doomdebates.com。输入你的电子邮件,订阅。我真的很感激。我期待着下次在“末日辩论”中见到你。[音乐]