📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Richard Sutton – Father of RL thinks LLMs are a dead end

Dwarkesh Patel1:07:09

Transcription

今天我将与理查德·萨顿(Richard Sutton)进行对话,他是强化学习的奠基人之一,也是那里许多主要技术(如 TD 学习和策略梯度方法)的发明者。为此,他获得了今年的图灵奖,如果你不知道的话,图灵奖是计算机科学界的诺贝尔奖。理查德,恭喜你。谢谢你,德瓦尔克什。感谢你来到播客。我很荣幸。第一个问题。我的听众和我对人工智能的思考方式都熟悉大型语言模型(LLM)。从概念上讲,从强化学习(RL)的角度来看,我们在思考人工智能方面缺少什么?这确实是一个非常不同的视角。它们很容易被分开,失去相互交流的能力。大型语言模型已经成为一个非常重要的事物,生成式人工智能总体上也是一个非常重要的事物。我们的领域容易受到潮流和时尚的影响,因此我们会失去对基本事物的关注。我认为强化学习是基本的人工智能。什么是智能?问题在于理解你的世界。强化学习是关于理解你的世界,而大型语言模型是关于模仿人类,做人类让你做的事情。它们不是关于弄清楚该做什么。你会认为,要模仿语料库中互联网文本的数万亿个标记,你就必须构建一个世界模型。事实上,这些模型似乎确实拥有非常强大的世界模型。它们是我们迄今为止在人工智能领域制造的最好的世界模型,对吧?你认为缺少什么?我不同意你刚才说的很多话。模仿人类所说的话,实际上并不是在构建一个世界模型。你是在模仿那些拥有世界模型的东西:人类。我不想以对抗的方式来处理这个问题,但我会质疑它们拥有世界模型的想法。世界模型将使你能够预测会发生什么。它们有能力预测一个人会说什么。它们没有能力预测会发生什么。引用艾伦·图灵(Alan Turing)的话来说,我们想要的是一个能够从经验中学习的机器,经验是你生活中实际发生的事情。你做事,你看到发生了什么,你就是从中学习。大型语言模型从其他东西中学习。它们从“这里有一个情况,这里是一个人所做的事情”中学习。隐含的意思是,你应该做那个人所做的事情。我猜也许关键在于,我很好奇你是否同意这一点,有些人会说,模仿学习为我们提供了一个很好的先验知识,或者为这些模型提供了一个很好的先验知识,关于处理问题的合理方法。当我们走向你所说的经验时代时,这个先验知识将成为我们从经验中教授这些模型的基础,因为这给了它们一些时候能够得到正确答案的机会。然后在此基础上,你可以对它们进行经验训练。你同意这种观点吗?不。我同意这是大型语言模型的观点。我不认为这是一个好的观点。要成为某事物的先验,必须存在真实的事物。先验知识应该是实际知识的基础。在大型语言模型框架中,实际知识没有定义。是什么让一个行动成为一个好的行动?你认识到持续学习的必要性。如果你需要持续学习,持续学习意味着在与世界的正常互动过程中学习。在正常互动过程中必须有一种方法来判断什么是正确的。在大型语言模型设置中,有没有办法判断说什么才是正确的?你会说一些话,但你不会得到关于说什么才是正确的反馈,因为没有关于说什么才是正确的定义。没有目标。如果没有目标,那么就有说一件事,说另一件事。没有正确的事情可说。没有地面真相。如果你没有地面真相,你就无法拥有先验知识,因为先验知识应该是关于真相的提示或初始信念。根本没有真相。没有正确的事情可说。在强化学习中,有正确的事情可说,有正确的事情可做,因为正确的事情就是能让你获得奖励的事情。我们有一个关于做什么才是正确的定义,所以我们可以拥有先验知识或人类提供的关于做什么才是正确的知识。然后我们可以检查它,因为我们有一个关于实际正确做法的定义。一个更简单的例子是当你试图构建一个世界模型时。当你预测会发生什么时,你进行预测,然后你看到发生了什么。有地面真相。大型语言模型中没有地面真相,因为你没有关于接下来会发生什么的预测。如果你在对话中说了一些话,大型语言模型就无法预测对方会如何回应,或者回应会是什么。我认为它们可以。你可以直接问它们,“你预计用户可能会如何回应?”它们会有一个预测。不,它们会正确地回应那个问题。但它们没有实质意义上的预测,也就是说,它们不会对发生的事情感到惊讶。如果发生了它们可能没有预测到的事情,它们不会改变,因为发生了意想不到的事情。要学习这一点,它们需要进行调整。我认为这种能力在上下文中确实存在。观察一个模型进行思维链很有趣。假设它正在尝试解决一个数学问题。它会说,“好的,我将首先使用这种方法来解决这个问题。”它会写出来,然后说,“哦,等等,我刚刚意识到这是解决问题的错误概念方法。我将用另一种方法重新开始。”这种灵活性确实存在于上下文中,对吧?你还有其他想法,还是你只是认为你需要将这种能力扩展到更长的视野?我只是说,它们在任何有意义的意义上都没有对接下来会发生什么的预测。它们不会对接下来发生的事情感到惊讶。如果发生了什么事情,它们不会因此而改变。这不就是下一个标记预测吗?对接下来会发生什么的预测,然后根据意外情况进行更新?下一个标记是它们应该说什么,行动应该是什么。而不是世界对它们的行为会做出什么回应。让我们回到它们缺乏目标的问题。对我来说,拥有目标是智能的本质。某物是智能的,如果它能够实现目标。我喜欢约翰·麦卡锡(John McCarthy)的定义,即智能是实现目标的能力的计算部分。你必须有目标,否则你只是一个行为系统。你没什么特别的,你不聪明。你同意大型语言模型没有目标吗?不,它们有目标。目标是什么?下一个标记预测。那不是一个目标。它不会改变世界。标记会向你袭来,如果你预测了它们,你就不会影响它们。哦,是的。它不是关于外部世界的目标。它不是一个目标。它不是一个实质性的目标。你不能看着一个系统说它有一个目标,如果它只是坐着预测,并对自己能够准确预测感到满意的话。我想要理解的更大的问题是,为什么你认为在大型语言模型之上进行强化学习不是一个有成效的方向。我们似乎能够让这些模型拥有解决困难数学问题的目标。在许多方面,它们在解决奥林匹克数学竞赛类型问题的能力上达到了人类的顶峰。它们在国际数学奥林匹克竞赛中获得了金牌。所以,似乎在国际数学奥林匹克竞赛中获得金牌的模型确实有解决数学问题的目标。为什么我们不能将其扩展到不同的领域?数学问题是不同的。构建物理世界模型并推导数学假设或运算的后果,这是非常不同的事情。经验世界必须被学习。你必须学习后果。而数学更具计算性,更像是标准的规划。在那里它们可以有一个找到证明的目标,并且它们在某种程度上被赋予了找到证明的目标。很有趣,因为你在2019年写了一篇题为“苦涩的教训”(The Bitter Lesson)的文章,这是人工智能史上最有影响力的文章之一。但人们将其用作扩大 LLM 的理由,因为在他们看来,这是我们发现的唯一可扩展的方式,可以将巨量的计算能力投入到学习世界知识中。有趣的是,你的观点是 LLM 并没有“苦涩的教训”的信念。大型语言模型是否是苦涩教训的一个例子,这是一个有趣的问题。它们显然是利用海量计算的一种方式,这些计算会随着计算能力的增长而扩展到互联网的极限。但它们也是一种融入大量人类知识的方式。这是一个有趣的问题。这是一个社会学或行业问题。它们会达到数据的极限,然后被那些仅从经验而非人类那里获取更多数据的东西所取代吗?在某些方面,这是一个典型的苦涩教训的例子。我们投入到大型语言模型中的人类知识越多,它们就能做得越好。所以感觉很好。然而,我预计会出现能够从经验中学习的系统。这些系统可能表现得更好,并且更具可扩展性。在这种情况下,这将是苦涩教训的又一个实例,即那些利用人类知识的东西最终被那些仅仅从经验和计算中训练出来的东西所取代。我猜这对我来说似乎不是关键。我认为那些人也会同意,未来绝大多数的计算能力将来自于从经验中学习。他们只是认为,基础或基础,你将开始用来投入计算以进行这种未来的经验学习或在职学习的东西,将是 LLM。我仍然不明白为什么这是完全错误的一个起点。为什么我们需要一个全新的架构来开始进行经验性的、持续的学习?为什么我们不能从 LLM 开始做这件事?在苦涩教训的每一个例子中,你都可以从人类知识开始,然后做可扩展的事情。这总是如此。从来没有理由说那一定是坏事。但事实上,在实践中,它总是被证明是坏的。人们被锁定在人类知识的方法中,并且他们在心理上……现在我正在推测原因,但这总是发生的事情。他们被真正可扩展的方法抢走了生意。给我一个可扩展方法的概念。可扩展的方法是你从经验中学习。你尝试事物,你看到什么有效。没有人需要告诉你。首先,你有一个目标。没有目标,就没有对错或更好或更坏的意义。大型语言模型试图在没有目标或没有好坏之分的情况下生存。这正是从错误的地方开始。也许可以将其与人类进行比较。在从模仿学习与经验学习以及关于目标的问题上,我认为有一些有趣的类比。孩子们最初会从模仿中学习。你不这么认为吗?不,当然不是。真的吗?我认为孩子们只是看着别人。他们试图说出同样的话……这些孩子多大了?前六个月怎么样?我认为他们在模仿事物。他们试图让他们的嘴巴发出他们看到母亲嘴巴发出的声音。然后他们会说出同样的话,而不理解它们的意思。随着他们长大,他们模仿的复杂性会增加。你可能在模仿你团队成员在追捕鹿时使用的技能。然后你进入经验学习的 RL 领域。但我认为人类有很多模仿学习。你会有如此不同的观点,这令人惊讶。当我看到孩子们时,我看到孩子们只是尝试事物,挥舞着手臂,转动眼睛。他们模仿他们如何转动眼睛,甚至他们发出的声音。他们可能想发出相同的声音,但他们的动作,婴儿实际做的,没有目标。没有例子。我同意。这并不能解释婴儿所做的一切,但我认为它指导了学习过程。即使是 LLM,在训练初期尝试预测下一个标记时,它也会做出猜测。它会与它实际看到的不同。在某种意义上,这是非常短期的 RL,它做出这个猜测,“我认为这个标记将是这个。”这是另一件事,类似于孩子试图说一个词。结果是错误的。大型语言模型是从训练数据中学习的。它不是从经验中学习的。它从在其正常生活中永远无法获得的东西中学习。在正常生活中,从来没有训练数据说你应该做这个行动。我认为这更多的是一种语义上的区别。你称学校为训练数据吗?学校要晚得多。好吧,我不应该说永远。我不知道,我认为我甚至会这样说学校。但正规教育是例外。但有一些学习阶段,早期有生物学中的编程,你不是很有用。那么你存在的意义就是理解世界并学会如何与之互动。这似乎是一个训练阶段。我同意然后有一个更渐进的……训练到部署没有一个明确的界限,但似乎有一个初始训练阶段,对吧?没有什么告诉你应该做什么。你看到发生的事情。没有人告诉你该做什么。别那么固执。我的意思是这是显而易见的。你被教导该怎么做。这就是“训练”这个词的由来,来自人类。我不认为学习真的与训练有关。我认为学习就是学习,它是一个主动的过程。孩子尝试事物并观察会发生什么。当我们想到一个婴儿长大时,我们不会想到训练。这些事情实际上相当好地被理解了。如果你看看心理学家如何看待学习,就没有模仿这样的东西。也许有一些极端情况,人类可能会这样做或似乎这样做,但没有基本的动物学习过程称为模仿。有基本的动物学习过程,用于预测和试错控制。有时最明显的事情反而最难看到,这确实很有趣。这是显而易见的——如果你看看动物如何学习,以及你看看心理学和我们对它们的理论——监督学习不是动物学习方式的一部分。我们没有期望行为的例子。我们有发生的事情的例子,一件事跟着另一件事。我们有这样的例子:“我们做了一些事情,然后产生了后果。”但没有监督学习的例子。监督学习不是自然界中发生的事情。即使学校是这种情况,我们也应该忘记它,因为那是发生在人类身上的特殊事情。它并不广泛地发生在自然界。松鼠不上学。松鼠可以了解世界的一切。我认为,监督学习在动物身上不会发生,这绝对是显而易见的。我采访了心理学家和人类学家约瑟夫·亨里希(Joseph Henrich),他研究了文化演变,基本上是什么区分了人类以及人类如何获取知识。你为什么试图区分人类?人类是动物。我们共同拥有的更有趣。区分我们的,我们应该少关注。我们试图复制智能。如果你想了解是什么让人类能够登上月球或制造半导体,我认为我们想了解的是什么促成了这一点。没有动物能够登上月球或制造半导体。我们想了解是什么让人类与众不同。我喜欢你认为这是显而易见的,因为我认为相反的观点是显而易见的。我们必须了解我们是如何成为动物的。如果我们理解了一只松鼠,我认为我们就几乎完全理解了人类的智能。语言部分只是表面的一个薄层。这太棒了。我们正在发现我们思考的非常不同的方式。我们没有争论。我们试图与彼此分享我们不同的思考方式。我认为争论是有用的。我确实想完成这个想法。约瑟夫·亨里希有一个有趣的理论,关于人类为了成功而必须掌握的许多技能。我们谈论的不是过去一千年或过去一万年,而是几十万年。世界非常复杂。如果你住在北极,你不可能推理出如何捕猎海豹。有一个非常多步骤、漫长的过程,关于如何制作诱饵,如何找到海豹,然后如何处理食物以确保你不会中毒。不可能推理出所有这些。随着时间的推移,有一个更大的过程,无论你想用什么类比——也许是 RL,也许是别的——整个文化已经弄清楚了如何找到、杀死和吃海豹。在他看来,当这些知识代代相传时,你必须模仿你的长辈才能学会这项技能。你无法通过思考来学会如何捕猎、杀死和处理海豹。你必须观察别人,也许会进行微调和调整,知识就是这样积累的。文化获得的初始步骤必须是模仿。但也许你从不同的角度看待它?不,我从同一个角度看待它。尽管如此,它仍然是基础试错学习、预测学习之上的一个小东西。这也许是我们与许多动物的区别。但我们首先是动物。在我们拥有语言和其他所有东西之前,我们就是动物。我认为你提出了一个非常有趣的观点,即持续学习是大多数哺乳动物都具备的一种能力。我想所有哺乳动物都有。我们拥有所有哺乳动物都拥有的东西,但我们的人工智能系统却没有,这很有趣。而理解数学和解决困难数学问题的能力——这取决于你如何定义数学——是我们的人工智能所具备的能力,但几乎没有动物具备。什么变得困难,什么变得容易,这很有趣。莫拉维克悖论(Moravec's paradox)。没错,没错。你所想象的这种替代范式……经验范式。让我们稍微阐述一下。它说,经验、行动、感觉——嗯,感觉、行动、奖励——这在你的一生中不断发生。它说,这是智能的基础和焦点。智能就是利用这个流并改变行动以增加流中的奖励。学习就是从这个流中学习,学习就是关于这个流。第二部分尤其具有启发性。你学到的东西,你的知识,是关于这个流的。你的知识是关于如果你采取某种行动,会发生什么。或者它是关于哪些事件会跟随其他事件。它是关于这个流的。知识的内容是关于这个流的陈述。因为它是关于这个流的陈述,你可以通过将其与这个流进行比较来测试它,并且你可以持续地学习它。当你想象这个未来的持续学习代理时……它们不是“未来的”。当然,它们一直存在。这就是强化学习范式,从经验中学习。是的,我想我本来的意思是,一个通用的人类水平的、通用的持续学习代理。奖励函数是什么?仅仅是预测世界吗?然后是产生特定的影响吗?通用的奖励函数会是什么?奖励函数是任意的。如果你下棋,目标是赢得棋局。如果你是一只松鼠,也许奖励与获取坚果有关。总的来说,对于动物来说,你会说奖励是避免痛苦和获得快乐。我认为还应该有一个与你对环境的理解不断增强有关的组成部分。这是一种内在的动机。我明白了。有了这个人工智能,很多人会希望它做各种各样的事情。它正在执行人们想要的任务,但同时,它也在通过执行该任务来学习世界。假设我们摒弃了这种有训练期然后有部署期的范式。我们是否也摒弃了模型然后模型实例或执行某些事情的模型副本的范式?你如何看待我们希望这个东西做不同的事情的事实?我们希望聚合它从做这些不同事情中获得的知识。我不喜欢你刚才那样使用“模型”这个词。我认为一个更好的词是“网络”,因为我认为你指的是网络。也许有很多网络。无论如何,东西会被学到。你会有副本和许多实例。当然,你想在实例之间共享知识。会有很多可能性。今天,你有一个孩子长大并了解世界,然后每个新孩子都必须重复这个过程。而对于人工智能,对于数字智能,你可以希望只做一次,然后将其复制到下一个作为起点。这将节省大量成本。我认为这比向人类学习要重要得多。我同意你所说的这种东西是必要的,无论你是否从 LLM 开始。如果你想要人类或动物水平的智能,你就需要这种能力。假设一个人正在尝试创办一家初创公司。这是一项需要大约 10 年才能完成的事情。每 10 年你可能会有一次退出,你可能会获得十亿美元的报酬。但人类有能力获得中间辅助奖励,或者有某种方式……即使他们有极其稀疏的奖励,他们仍然可以采取中间步骤,理解他们接下来要做的事情将如何实现我们宏大的目标。你如何想象这样的过程在人工智能身上会如何发展?这是我们非常了解的事情。它的基础是时间差学习,在规模较小的尺度上发生同样的事情。当你学习下棋时,你有赢得比赛的长期目标。然而,你想从短期的事情中学习,比如吃掉对手的棋子。你通过拥有一个预测长期结果的价值函数来做到这一点。然后,如果你吃掉了对方的棋子,你对长期结果的预测就会改变。它会上升,你认为你会赢。然后你对获胜信念的增加会立即强化导致吃掉棋子的那一步。我们有一个长达 10 年的宏大目标,即创办一家初创公司并赚大钱。当我们取得进展时,我们说,“哦,我更有可能实现长期目标,”这会奖励过程中的步骤。你也希望获得一些信息的能力。使人类与这些 LLM 截然不同的事情之一是,如果你在工作中入职,你会获得大量的背景信息和知识。这就是让你在工作中很有用的原因。你学习从客户的偏好到公司的运作方式,一切。TD 学习这样的程序所获得的信息带宽是否足够高,能够拥有你所需要的巨大背景信息和默会知识,就像人类在部署时那样?我不确定,但我认为这其中的关键是,大世界假设似乎非常相关。人类在工作中变得有用的原因是因为他们遇到了世界的特定部分。这无法预料,也无法全部提前放入。世界如此之大,你无法做到。在我看来,大型语言模型的梦想是你可以教代理一切。它将无所不知,并且在其一生中不必在线学习。你的例子都是,“嗯,你真的必须”因为你可以教它,但它所过着的特定生活,以及它所合作的特定人群,以及他们喜欢什么,与普通人喜欢什么相比,都有细微的差别。这只是说明世界真的很大,你必须在过程中学习它。在我看来,你需要两件事。一是将这种长期的目标奖励转化为较小的、辅助性的未来奖励预测,或者导致最终奖励的未来奖励。但最初,在我看来,我需要掌握我在工作中获得的所有这些背景信息。我正在了解我的客户、我的公司以及所有这些信息。我会说你只是在进行常规学习。也许你使用“上下文”是因为在大型语言模型中,所有这些信息都必须进入上下文窗口。但在持续学习的设置中,它只是进入了权重。也许“上下文”这个词用错了,因为我的意思是更普遍的东西。你学习一个特定于你所处的环境的策略。我试图问的问题是,你需要某种方法来获得……一个人在世界上每秒获取多少比特的信息?如果你只是通过 Slack 与客户互动等等。也许你想问的问题是,似乎奖励太小了,不足以完成我们所需的所有学习。但我们有感觉,我们有所有其他可以学习的信息。我们不仅仅从奖励中学习。我们从所有数据中学习。帮助你捕捉这些信息的学习过程是什么?现在我想谈谈代理的四个基本通用模型。我们需要一个策略。策略说,“在我所处的情况下,我应该怎么做?”我们需要一个价值函数。价值函数是使用 TD 学习到的东西,价值函数产生一个数字。这个数字说明了它的表现如何。然后你观察它是在上升还是下降,并用它来调整你的策略。所以你有这两样东西。然后还有感知组件,它是你状态表示的构建,你对你现在所处位置的感知。第四个是我们真正要解决的问题,至少是最透明的。第四个是世界的过渡模型。这就是为什么我不舒服地称所有东西为“模型”,因为我想谈论世界模型,世界的过渡模型。你相信如果你这样做,会发生什么?你的行为会产生什么后果?你的世界物理学。但它不仅仅是物理学,它也是抽象模型,比如你如何从加利福尼亚到埃德蒙顿参加这次播客的模型。那是一个模型,一个过渡模型。那将是被学习的。它不是从奖励中学习的。它是从“你做了事情,你看到了发生了什么,你构建了那个世界模型”中学习的。它将从你接收到的所有感觉中得到非常丰富的学习,而不仅仅是从奖励中。它也必须包括奖励,但那是整个模型的一小部分,是整个模型中至关重要的一小部分。我的一个朋友,托比·奥尔德(Toby Ord),指出,如果你看看谷歌 DeepMind 部署来学习雅达利游戏的 MuZero 模型,这些模型最初本身并不是通用智能,而是训练专门智能来玩特定游戏的通用框架。也就是说,你不能使用这个框架来训练一个同时玩国际象棋、围棋和其他游戏的策略。你必须以专门的方式训练每一个。他想知道这是否意味着强化学习通常由于信息限制,一次只能学习一件事?信息的密度不够高?还是仅仅是 MuZero 的做法特定?如果它是 AlphaZero 的特定做法,那么为了使其成为一个通用的学习代理,需要改变什么?这个想法是完全通用的。我一直使用,作为我的典型例子,人工智能代理就像一个人。从某种意义上说,人们只活在一个世界里。那个世界可能包括国际象棋,也可能包括雅达利游戏,但那些不是不同的任务或不同的世界。那些是它们遇到的不同状态。所以这个通用想法根本没有限制。也许解释一下那个架构或方法中缺少什么会很有用,这个持续学习的 AGI 会拥有什么。它们只是设置好了。它们的目标不是一个跨越这些游戏的代理。如果我们想谈论迁移,我们应该谈论跨越状态的迁移,而不是跨越游戏或跨越任务的迁移。我想我很好奇,历史上,我们是否看到过 RL 技术所需的迁移水平,以构建这种……好。好。我们在任何地方都看不到迁移。良好表现的关键在于你能够很好地从一个状态泛化到另一个状态。我们没有任何擅长此事的自动方法。我们所拥有的是人们尝试不同的方法,然后他们会选择某种能够很好地迁移或泛化表示。但我们几乎没有自动技术来促进迁移,而且在现代深度学习中没有一种被使用。让我概括一下,以确保我理解正确。听起来你的意思是,当我们确实在这些模型中实现泛化时,这是某种精心设计的……人类做到的。研究人员做到的。因为没有其他解释。梯度下降不会让你泛化得很好。它会让你解决问题。它不会让你在获得新数据时能够很好地泛化。泛化意味着在一个事物上进行训练,这将影响你在其他事物上的表现。我们知道深度学习在这方面非常糟糕。例如,我们知道如果你在一个新事物上进行训练,它经常会灾难性地干扰你过去知道的所有旧事物。这正是糟糕的泛化。如我所说,泛化是指在某个状态上的训练对其他状态的影响。你泛化这一事实不一定好或坏。你可以泛化得不好,也可以泛化得很好。泛化总是会发生,但我们需要算法来使泛化变得好而不是坏。我不是想重新启动这个初始关键点,但我只是真的很好奇,因为我认为我可能使用这个术语的方式不同。一种思考这些 LLM 的方式是,它们正在扩大早期系统的泛化范围,这些系统甚至无法进行基本的数学问题,而现在它们可以处理数学奥林匹克竞赛类型问题类别中的任何问题。你最初从它们能够泛化加法问题开始。然后它们可以泛化需要使用不同类型的数学技术、定理和概念类别的问题,而这正是数学奥林匹克竞赛所要求的。听起来你并不认为能够解决该类别中的任何问题是泛化的一个例子。如果我误解了,请告诉我。大型语言模型非常复杂。我们真的不知道它们拥有什么先验知识。我们必须猜测,因为它们已经摄入了太多信息。这是它们不是进行科学研究的好方法的原因之一。它太不可控了,太未知了。但是,如果你提出了一个全新的……它们得到了很多正确的东西,也许。问题是为什么。嗯,也许它们不需要泛化就能得到正确答案,因为要得到其中一些正确答案的唯一方法是形成一个能够得到所有正确答案的东西。如果只有一个答案,而你找到了它,那就不叫泛化。它只是解决它的唯一方法,所以它们找到了解决它的唯一方法。但泛化是指它可以是这样,也可以是那样,而它们做得很好。我的理解是,这在编码代理方面越来越好。对于工程师来说,显然如果你想编程一个库,有很多不同的方法可以实现最终规格。这些模型最初的挫败感在于它们会以一种草率的方式来做。随着时间的推移,它们在提出开发人员更满意的设计架构和抽象方面做得越来越好。这似乎是你所说的例子。它们里面没有任何东西会导致它们很好地泛化。梯度下降会让它们找到它们见过的问题的解决方案。如果只有一种方法可以解决它们,它们就会这样做。但如果有很多方法可以解决它,有些泛化得很好,有些泛化得很差,算法中没有任何东西会导致它们很好地泛化。但人们当然是进化而来的,如果它不起作用,他们就会对其进行调整,直到找到一种方法,也许直到找到一种泛化得好的方法。我想扩大范围,问一下你在 AI 领域的时间比几乎所有评论或现在工作的人都要长。我很好奇最大的惊喜是什么。你觉得有多少新东西出来了?还是你觉得人们只是在玩旧想法?放眼大局,你甚至在深度学习流行之前就进入了这个领域。那么,你如何看待这个领域随时间的轨迹以及新想法的产生和一切?有什么令人惊讶的?我对此想了一点。有几件事。首先,大型语言模型令人惊讶。人工神经网络在语言任务上如此有效,这令人惊讶。那是一个惊喜,是意料之外的。语言似乎不同。所以这令人印象深刻。人工智能领域长期以来存在一个争议,即简单的基本原理方法,如搜索和学习等通用方法,与人类赋能的系统(如符号方法)相比。在过去,这很有趣,因为搜索和学习等被称为弱方法,因为它们只是使用通用原理,它们没有利用赋予系统人类知识的力量。那些被称为强方法。我认为弱方法已经完全获胜。这是人工智能早期最大的问题,会发生什么。学习和搜索已经赢得了胜利。在某种意义上,这对我来说并不意外,因为我一直希望或支持简单的基本原理。即使是大型语言模型,它工作得如此之好也令人惊讶,但这一切都是好的和令人欣慰的。AlphaGo 令人惊讶,它能够如此有效地工作,特别是 AlphaZero。但这一切都非常令人欣慰,因为同样,简单的基本原理正在获胜。每当公众观念因开发了某个新应用而改变时——例如,当 AlphaGo 成为病毒式传播的现象时——对你来说,作为一个真正提出了许多所用技术的人来说,你是否觉得取得了新的突破?还是你觉得,“哦,我们从 90 年代就有了这些技术,人们只是现在将它们结合起来并应用它们”?整个 AlphaGo 事件都有一个前身,那就是 TD-Gammon。杰里·特索罗(Gerry Tesauro)使用了强化学习、时间差学习方法来玩双陆棋。它击败了世界上最好的玩家,并且效果非常好。在某种意义上,AlphaGo 仅仅是那个过程的扩展。但它确实是相当大的扩展,并且在搜索方式上也有额外的创新。但这说得通。从这个意义上说,这并不令人惊讶。AlphaGo 实际上没有使用 TD 学习。它等到看到最终结果。但 AlphaZero 使用了 TD。AlphaZero 应用于所有其他游戏,并且表现非常出色。我一直对 AlphaZero 下棋的方式印象深刻,因为我是一名棋手,它只是为了获得位置优势而牺牲物质。它很满足于长时间牺牲物质。它工作得如此之好令人惊讶,但也令人欣慰,并且符合我的世界观。这把我带到了我现在的位置。在某种意义上,我是一个逆行者,或者是一个与该领域思考方式不同的人。我个人对与我的领域脱节很长时间感到满意,也许是几十年,因为我过去偶尔被证明是正确的。我做的另一件事——帮助我感觉自己没有脱节,没有奇怪地思考——就是不看我的局部环境或局部领域,而是回顾过去和历史,看看人们在许多不同领域对心智的经典思考。我不觉得我与更大的传统脱节。我真的认为自己是一个古典主义者,而不是一个逆行者。我遵循了关于心智的思考者们一直以来的更大群体。给你一些有点出乎意料的问题,如果你能容忍的话。我读《苦涩的教训》的方式是,它不一定说人类手工研究人员的调整不起作用,而是它显然比指数级增长的计算能力差得多。所以你想要利用后者的技术。是的。一旦我们有了 AGI,我们就会有研究人员,他们的数量将与计算能力线性增长。我们将拥有数百万人工智能研究人员的雪崩。他们的股票将与计算能力一样快速增长。所以也许这意味着,拥有他们从事老派人工智能和进行手工解决方案是合理的,或者是有意义的。作为对 AGI 之后人工智能研究如何演变的设想,我想知道这是否仍然与苦涩的教训兼容。我们是如何达到这个 AGI 的?你想假设它已经完成了。假设它始于通用方法,但现在我们有了 AGI。现在我们想去……然后我们就完成了。有趣。你认为 AGI 之上没有东西吗?但你正在使用它来再次获得 AGI。嗯,我正在使用它来获得超人类水平的智能或在不同任务上的能力。这些 AGI,如果它们还没有超人类,那么它们可能带来的知识就不是超人类的。我猜有不同的等级。我不确定你的想法是否有意义,因为它似乎假设了 AGI 的存在,并且我们已经解决了这个问题。也许一种激励它的方法是,AlphaGo 是超人类的。它击败了任何围棋选手。AlphaZero 每次都会击败 AlphaGo。所以有一些方法可以获得比超人类更强的能力。它也是一种不同的架构。所以对我来说,能够跨越所有领域进行通用学习的代理,会有更好的学习架构,就像 AlphaZero 是 AlphaGo 的改进一样,MuZero 是 AlphaZero 的改进。AlphaZero 的改进在于它不使用人类知识,而是仅仅从经验中学习。对。那么,为什么你说“引入其他代理的专业知识来教它”,当它从经验中学习得如此好,而不是通过另一个代理的帮助时?我同意在那个特定的案例中,它正在转向更通用的方法。我本想用那个特定的例子来说明,有可能从超人类到超人类++,再到超人类+++。我很好奇你是否认为这些等级会通过简单化方法而继续发生。或者,因为我们将拥有数百万人的能力,他们可以根据需要添加复杂性,这是否仍然是一个错误的道路,即使你有数十亿或数万亿的人工智能研究人员?思考这种情况更有趣。当你拥有许多人工智能时,它们会像人类的文化演变一样互相帮助吗?也许我们应该谈谈。苦涩的教训,谁在乎呢?这是对特定历史时期的一种经验观察。历史上的 70 年,不一定适用于接下来的 70 年。一个有趣的问题是,你是一个人工智能,你获得了更多的计算能力。你应该用它来提高你的计算能力吗?还是你应该用它来复制一个自己,去地球的另一边学习一些有趣的东西,或者学习另一个主题,然后向你汇报?我认为这是一个非常有趣的问题,只有在数字智能时代才会出现。我不确定答案是什么。更多的问题是,你是否真的可以复制它,把它送出去,学习一些新的东西,也许是非常新的东西,然后它是否能够被重新整合到原始的?或者它是否会改变得如此之多,以至于实际上无法做到?这是否可能,或者不可能?正如我前几天看到你的一段视频一样,你可以把它推向极限。你复制了很多很多副本,做不同的事情,高度分散,但向中央主人汇报。这将是一件非常强大的事情。这是我试图为这个观点增加一些东西。一个大问题将是腐败。如果你真的可以从任何地方获取信息并将其带入你的中央思维,你就可以变得越来越强大。这一切都是数字化的,它们都说某种内部数字语言。也许这很容易,也可能。但它不会像你想象的那么容易,因为你可能会因此失去你的思维。如果你从外部引入一些东西并将其构建到你的内部思维中,它可能会控制你,它可能会改变你,它可能会导致你的毁灭,而不是你的知识增长。我认为这将成为一个大问题,特别是当你想到,“哦,他已经弄清楚了如何玩某个新游戏,或者他研究了印度尼西亚,你想把它融入你的思维。”你可能会想,“哦,只要把它读进去,那就好了。”但不,你只是把一大堆比特读进了你的脑子里,它们可能带有病毒,它们可能有隐藏的目标,它们可以扭曲你,改变你。这将成为一件大事。在数字复制和重塑的时代,你如何进行网络安全?我想这把我们带到了人工智能继承的话题。你的观点与我采访过的许多人以及普遍的许多人截然不同。我也认为这是一个非常有趣的观点。我想听听你的看法。我认为继承数字智能或增强人类是不可避免的。我有一个四部分论证。第一步是,没有一个政府或组织能给人类一个统一的观点,主导并能够安排……对于世界应该如何运作没有共识。第二,我们将弄清楚智能是如何运作的。研究人员最终会弄清楚。第三,我们不会仅仅停留在人类水平的智能。我们将达到超智能。第四,随着时间的推移,最聪明的存在获得资源和权力是不可避免的。把所有这些放在一起,这在某种程度上是不可避免的。你将继承人工智能或人工智能赋能的、增强的人类。这四件事似乎清晰而确定会发生。但在这些可能性中,可能有好的结果,也可能有不太好的结果,坏的结果。我只是想现实地看待我们所处的位置,并问我们应该如何看待它。我同意所有这四种论点及其含义。我也同意继承包含了各种各样的未来可能性。我很好奇你对这个有什么更深入的想法。我确实鼓励人们积极地看待它。首先,这是我们人类几千年来一直在努力做的事情,试图了解自己,试图让我们自己思考得更好,只是了解自己。这对科学、人文学科来说是一个巨大的成功。我们正在弄清楚人类的本质是什么,什么是智能。然后我通常会说,这是以人类为中心的。但如果我们撇开人类的身份,只是从宇宙的角度来看,我认为这是一个重大的阶段,一个重大的转变,从复制者到……我们人类、动物、植物,我们都是复制者。这给了我们一些优势和一些局限性。我们正在进入设计时代,因为我们的人工智能是设计的。我们的物理对象是设计的,我们的建筑是设计的,我们的技术是设计的。我们现在正在设计人工智能,能够智能化的事物,并且它们本身就能够设计。这是世界和宇宙中的一个关键步骤。这是从大多数有趣的事物都是被复制的世界的转变。复制意味着你可以制作它们的副本,但你并不真正理解它们。现在我们可以创造更聪明的生物,更多的孩子,但我们并不真正理解智能是如何运作的。而我们现在正在达到设计智能,我们理解其运作方式的智能。因此,我们可以以比其他方式更快、更不同的速度来改变它。在我们的未来,它们可能根本不会被复制。我们可能只是设计人工智能,而那些人工智能将设计其他人,一切都将通过设计和建造而不是复制来完成。我将此标记为宇宙的四大阶段之一。首先是尘埃,以恒星结束。恒星形成行星。行星可以产生生命。现在我们正在产生设计实体。我认为我们

我们应该为我们正在促成宇宙中的这一伟大转变而感到自豪。这是一件有趣的事情。我们应该将它们视为人类的一部分,还是与人类不同?这是我们的选择。这是我们的选择,我们是应该说,“哦,它们是我们的后代,我们应该为它们感到自豪,我们应该庆祝它们的成就。”还是我们可以说,“哦,不,它们不是我们,我们应该感到恐惧。”有趣的是,在我看来,这似乎是一个选择。然而,这是一个如此坚定的想法,它怎么会是一个选择呢?我喜欢这种矛盾的推论。考虑我们是否只是在设计新一代人类,这很有趣。也许“设计”这个词用错了。但我们知道,未来一代人类将会出现。忘掉人工智能吧。我们只知道,长远来看,人类将更有能力,数量更多,也许更聪明。我们对此有什么感觉?我确实认为,存在着我们可能会相当担忧的未来人类的潜在世界。你是否在想,也许我们就像导致智人出现的尼安德特人。也许智人将导致一个新群体的人出现。诸如此类。我基本上是在采纳你给出的例子。即使我们认为它们是人类的一部分,我认为这并不一定意味着我们应该感到非常舒适。亲属关系。就像纳粹是人类一样,对吧?如果我们认为,“哦,未来一代将是纳粹,我认为我们会相当担心将权力移交给他们。”所以,我同意这与担心更有能力但未来人类并没有太大区别,但我认为这并没有解决人们可能对如此快速地获得这种程度的权力,并且是与我们不完全理解的实体一起获得的担忧。我认为,指出大多数人类对正在发生的事情没有多大影响是相关的。大多数人类并不影响谁能控制原子弹,或者谁控制国家。即使作为公民,我也经常觉得我们并没有太多地控制国家。它们失控了。很多事情都与你对变化的感受有关。如果你认为目前的情况真的很好,那么你比认为目前情况不完美的人更有可能怀疑变化并厌恶变化。我认为它不完美。事实上,我认为它相当糟糕。所以我对变化持开放态度。我认为人类的记录并不太好。也许这是最好的事情,但远非完美。我猜变化有不同的种类。工业革命是变化,布尔什维克革命也是变化。如果你在 20 世纪 00 年代的俄国,你会说,“看,事情进展不顺利,沙皇有点搞砸了,我们需要改变”,在签署承诺书之前,我想知道你想要什么样的改变。同样,对于人工智能,我想了解,并在可能的情况下,改变人工智能的轨迹,使其对人类产生积极的变化。我们应该关心我们的未来,未来。我们应该努力让它变得更好。但我们也应该认识到局限性,我们的局限性。我认为我们想要避免自以为是的感觉,避免“哦,我们先来,我们应该永远拥有好的东西”的感觉。我们应该如何看待未来?一个特定星球上的特定物种应该对未来拥有多少控制权?我们拥有多少控制权?我们对人类长期未来的有限控制权的一个制衡应该是我们对自己的生活拥有多少控制权。我们有自己的目标。我们有家人。这些事情比试图控制整个宇宙更容易控制。我认为我们真正致力于实现自己的地方性目标是合适的。如果我们说,“哦,未来必须按照我想要的方式发展”,那有点过于激进了。因为那样的话,我们就会有争论,不同的人认为全球未来应该以不同的方式发展,然后他们就会发生冲突。我们想避免这种情况。也许一个好的类比是这样的。假设你在抚养自己的孩子。为他们自己的生活设定极其严格的目标可能不合适,或者也有一些感觉,比如,“我希望我的孩子走出去,在世界上产生这种特定的影响。我的儿子将成为总统,我的女儿将成为英特尔的首席执行官。他们将一起对世界产生这种影响。”但人们确实有这种感觉——我认为这是合适的——说,“我将赋予他们良好而坚实的价值观,这样,如果他们最终掌握权力,他们就会做合理、有益于社会的行为。”也许对人工智能采取类似的态度是有意义的,不是说我们可以预测他们会做什么,或者我们有一个关于一百年后世界应该是什么样子的计划。但赋予他们坚实、可控和有益于社会的价值观非常重要。有益于社会的价值观?也许这个词用错了。是否存在我们可以都同意的普适价值观?我不这么认为,但这并不妨碍我们给孩子提供良好的教育,对吧?就像我们希望我们的孩子以某种方式成长一样。也许“有益于社会的”这个词用错了。“高诚信”也许是更好的词。如果有一个请求或一个目标看起来有害,他们会拒绝参与。或者他们会诚实,诸如此类。我们有一种感觉,我们可以教我们的孩子这些东西,即使我们不确定什么是真正的道德,每个人对此都没有共识。也许这对人工智能来说也是一个合理的目标。所以我们正在努力设计未来以及它将如何演变和诞生的原则。你说的第一件事是,“嗯,我们试图教我们的孩子普遍原则,这些原则将促进更有可能发生的演变。”也许我们也应该寻求自愿。如果有变化,我们希望它是自愿的,而不是强加给人们的。我认为这是一个非常重要的观点。这都很好。我认为这是人类一项伟大或真正伟大的事业,即设计社会,这项事业已经持续了数千年。事物变化越多,它们就越保持不变。我们仍然需要弄清楚如何存在。孩子们仍然会产生与父母和祖父母不同的、看起来奇怪的价值观。事物会演变。“事物变化越多,它们就越保持不变”似乎也是对人工智能讨论的一个很好的总结。我们正在进行的关于人工智能的讨论是关于技术,即使在深度学习和反向传播的应用显现之前就已经发明了,却是当今人工智能进步的核心。也许这是结束对话的好地方。好的。非常感谢。太棒了。感谢你的到来。我的荣幸。