📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Richard Sutton: The OaK Architecture – A Vision of Superintelligence from Experience | AGI-25

SingularityNET1:04:43

Transcription

很高兴能在这里,有机会与大家交流,并就心智问题分享我的想法。今天,我将为大家呈现一种愿景。它并非一个完整的、已实现算法,而且它也无法是,因为它有一些先决条件,而这些先决条件目前尚不可用。因此,先决条件基本上是一个可行的深度学习算法,一个能够持续学习并随着时间推移改进其学习方式的算法。我一直认为这是一个小小的要求,但奇怪的是,我们至今在我们的算法家族中还没有它。

好的。那么,在我开始之前,我想先提一下,在我众多工作中,我创立了一个名为“开放心智研究所”(Open Mind Research Institute)的机构,在那里我们对与心智相关的强化学习方法进行基础研究。如果你是一个对该领域感兴趣的年轻人,你可能想访问我们的网站 openmindresearch.org 了解更多。

好的,让我们开始吧。基本上,我想说的是我一直在探索一个简单通用的 AI 代理架构。我将花一些时间谈论目标,以及如何在一个非常庞大、复杂且未知的世界中从经验中学习。然后,我们将深入探讨 OAK 架构本身,我将通过几种方式来谈论它,解释它,用图示,一步一步地讲解,并谈论这个愿景。

所以,这就像是人工智能,或者更确切地说,是通用人工智能(AGI)的圣杯,即对心智的探索,这有点难以直视。让我先移除背景。一种通用的心智愿景。我所说的通用,是指它不包含任何特定于某个世界的知识。所以没有领域知识。

嗯,是的。其次,它是经验性的。我们从运行时经验中学习,而不是从特殊的训练阶段学习。所以运行时经验是红色的,因为在图表中,我不知道你是否能看到我的光标,图中的红色部分是观察、动作和奖励,那些就是经验。经验是未标记的信息,未解释的信息,因为我们正在寻求一个通用的设计。因此,没有什么是特定于世界的。观察只是比特、区分,你必须通过你的经验来理解它。

最后,也许最重要的是开放式抽象的概念。我们希望代理能够发展出概念、思维方式、行为中的常见模式,这些模式的复杂性是无限的,当然除了计算资源本身的限制。

所以,为了帮助你理解我的思路,抽象通常有两种类型。抽象就像是找到世界的特征,你对世界的理解的特征,这些特征对你有帮助。我所说的特征是指线索、方式、概念,是你试图理解世界时形成的一种信号组织方式,然后你用它来帮助你做决定。所以你可以寻找好的特征,这些特征有点像状态,而添加到特征上的好的形容词是“状态特征”。然后第二件事是我们想找到的是好的时间抽象,即你可以做的事情,这些事情比单个动作的尺度要大。比如像“步行上班”、“开门”或“捡起物体”这样的抽象。

好的。我们都会谈论这些。这就是我的探索。我谈论设计时和运行时这两个词很有用。设计时是指代理被设计出来,并在被派往世界获取奖励之前。在设计时,你将领域知识构建到代理中。所以,我当然会最小化这一点。我会弃用它。运行时是指代理从经验中学习,并制定特定于它所遇到的世界特定部分的计划。我将强调运行时从经验中学习。

在一个庞大、复杂且事物无法完全预料的世界里,仅仅在设计时构建东西是不够的。特别是如果你对开放式抽象感兴趣,那么你必须能够在运行时发现它们。它们不能仅仅是设计时构建的。我们真的必须在运行时发现事物。一切都必须在运行时完成。

所以,如果一切都必须在运行时完成,那么为什么我们不在设计时就不做任何事情呢?因为它只会使设计复杂化。所以,设计时,你可能想把它看作是一种理解智能的方式,而不是一种生产产品的方式。所以,对于生产产品,你可能想构建大量的、大量的背景知识,但对于理解心智,你希望它尽可能简单和纯粹。所以,为了理解它,你不想遗漏所有这些复杂性。

好的,我在这里会再多说一点。事实上,我说的这个代理架构,一个理想的架构,为了这个目标,理解智能,应该不为任何特定世界做出设计时的承诺,这是我从“苦涩的教训”(bitter lesson)博客文章中得出的。正如我在那里所说的,心智的实际内容是任意的、内在复杂的外部世界的一部分。任意复杂,它们的复杂性是无穷无尽的。它们不应该被构建进去。相反,我们应该只构建能够发现和捕捉这种复杂性的元方法。所以我们想要人工智能,我们想要能够发现的人工智能代理,而不是包含我们已经发现的东西。

好了,这就是基本思想,以及为什么我们为了通用性而弃用领域知识。

好了,让我问你一个问题。代理应该从特殊的训练数据中学习,还是我们应该只局限于从运行时经验中学习?对我来说,答案很清楚。我认为这就是智能的力量所在,特别是强化学习的力量所在,那就是我们可以从未经准备的运行时经验中学习。所以,让我明确我的承诺。我的承诺是,代理应该只从运行时经验中学习。这就是我所说的代理应该是完全经验性的。

好的?我提到了大世界视角。所以,这是我们的代理,就像一个人,它比世界小。事实上,它比世界小得多。世界中有所有其他代理。通常看起来是这样的。世界包含了物理世界的所有物体、地点和复杂性。它还包含无数其他代理,而它们心智中发生的事情对代理来说是完全重要的。代理正确的行为是与人互动,与它的老板、它的配偶和它的朋友互动。它们心智中发生的事情对它们很重要,就像你们心智中发生的事情现在对我来说很重要一样。

因此,世界比代理复杂得多,而且不可避免地如此,这意味着代理所学到的任何东西都无法是正确的,无法是最佳的。任何关于最优性或正确性的定理,你都必须知道它与真实情况无关。你所有的价值函数都必须是近似的。你的策略必须是近似的。你的状态转移模型,特别是你对世界的模型,必须比世界简单得多。所以它会是错误的。它会是近似的。即使是世界的单个状态,你也无法真正地记在心里,因为世界的状态包含了所有其他代理心智中发生的一切。当然,你心智中的东西不可能比所有其他心智复杂得多。

好的。另一个更高级、更微妙的含义是,世界将显得是非平稳的,因为你不知道其中到底发生了什么。它有时会显得是一种方式,有时会显得是另一种方式。就像你在街上开车,看到前面的车,你不知道那辆车是否会右转或左转。我的意思是,开车的那位代理心智中发生的事情并不是随机的,但它会显得是非平稳的。你知道,有时汽车会朝一个方向转,有时汽车会朝另一个方向转。它会显得是变化的。

因此,面对所有这些关于世界的有效不确定性,你必须在运行时学习。你必须在运行时规划。你必须能够在运行时找到任何需要的抽象。你将出生、成长,并遇到这个世界,你必须弄清楚它的物体、它的人,以及世界运作的方式,社会制度运作的方式。你必须在运行时弄清楚这一切。它不能被设计进去。所以我们弃用它。

好的。那么,让我们现在开始 OAK 架构,它正在解决所有这些问题。让我来处理一下。谈谈通用人工智能问题。它是设计一个在世界中有效行动的、有目的的代理。在强化学习中,问题是一样的,只是我们以一种特殊的方式来表述它。我们将目的表述为一个称为奖励的标量信号。我稍后会对此做更多说明。其次,也许在专门的强化学习中,我们假设世界是通用的且不完全了解的。因此,世界可以是任何东西,从网格世界到复杂的人类世界,随机的、复杂的、非线性的,其状态空间如我所说,是无限的,其动力学是实际上是非平稳的。我们必须在运行时工作。我们必须在没有教师或人类的特殊训练信号的情况下,在运行时应用。这个问题很宏大。我认为我们不需要改变它。我们只需要解决它,奖励信号就足够了。

我还想提一下,我将假设代理受计算能力限制,而不是数据限制。数据非常丰富,我们想要流式算法,因此我们将排除诸如回放缓冲区之类的东西。

现在,我说了目的由标量信号指定。我将再用一页幻灯片来介绍。这就是所谓的“奖励假设”。奖励假设是,我们所说的目标和目的,都可以很好地被视为最大化我们收到的称为奖励的标量信号的累积总和的期望值。我认为这根本不是限制,而事实上,这是一种清晰地指定目标的好方法,增加额外的东西并不会使其更好,也不会使其更好。这方面有一些理论工作,我鼓励你查看 Michael Bowling 等人关于“解决奖励假设”的论文。而且,我们也知道,即使是简单的奖励也能带来智能的所有属性,也许我应该说我们知道这一点,我以及其他人认为,在一个足够复杂的世界里,简单的奖励可以带来智能的所有属性。那就是“奖励足够”的论文。

好了,现在让我们开始。OAK 架构,我喜欢从一个先前的架构开始,这就是我称之为“智能代理的通用模型”,它在许多领域都很普遍。它在人工智能、心理学、控制论、经济学、神经科学、运筹学中都很普遍。每个人都使用这个标准,使用一个具有某些基本属性的代理模型。

第一点是红色部分,你知道的,经验界面,即你有奖励,你有动作,你有来自世界的某种信号,那是你的观察,以及观察通常不足以完全消除状态歧义的事实。那是外部视角,那三件事,红色的。

然后,其他的,但实际上通用模型的大部分是关于内部事物和四个组成部分。

好的,首先看看连接这些组成部分的。连接这些组成部分的是蓝色部分。它是状态特征向量。它是你如何表示世界的状态,它是一个特征向量。所以它有组成部分,每个组成部分都是一个特征,这个状态特征向量被创建,它基本上是你对你所处位置的理解。所以当你从你的输入和过去的动作中创建这种对你所处位置的感知时,一个很好的词是“感知”。这是你如何感知世界以及如何表示你现在在哪里。它是你例如选择动作的基础。我假设你能看到我的光标。这个状态表示会流过,它是你动作的输入。你的策略会做出反应,这意味着没有太多思考就会选择一个动作。所以这是前两个组成部分,感知和策略,它们共同构成了一个完整的代理。但为了学习这个代理,改进它,你想学习一个价值函数。价值函数说哦,我现在做得很好,或者我现在做得不好。事情变得更好了或更坏了。所以它必须知道奖励,因为价值函数本质上是对奖励的预测。然后它被用来学习策略,我们通过在策略结构上画一条对角线来建议。第四个组成部分是用于规划的转移模型。转移模型基本上是你所知道的,它接受状态并尝试预测下一个状态,如果你以某种方式行动。我无法展示它如何工作的全部内容,但以一种或另一种方式,通过规划过程,我们在策略上画一条对角线,我们再次改变策略,我们也改变价值函数,在这两种情况下都是如此。

好了,这就是通用模型,我们从那里开始,学习和规划包含这四个组成部分。我认为它很有趣,我们可以用这个单一的视角来涵盖所有这些不同的领域,比如控制论会使用不同的名称。它不会谈论动作,它会谈论控制。不会谈论奖励,它会谈论收益或成本。而在心理学中,例如,我们可能会说奖励,但我们会用刺激来代替观察。所以,总之,所有这些领域确实都有相同的想法,有时名称不同。

好的。那么,我们必须问一个问题,通用模型缺少什么?为什么我们还没有完成?我们缺少的是它有点低级。动作是瞬间的动作,奖励是瞬间的,义务是瞬间的。我们必须获得更高层次的抽象。我们必须发展概念。我们必须发展更高层次的思维方式。所以,基本上,我认为我们需要添加的是,OAK 架构试图添加的是开放式抽象到这个视图中。

好的。这是 OAK 架构,我试图用紫色显示所有新事物。这是 OAK 架构,它正在添加辅助子问题。所以,辅助于主要问题的子问题。主要问题是获取奖励,而子问题,我们将在几次中看到这个短语,它们是“尊重奖励的特征获取子问题”,这意味着它们是关于,你知道,每个子问题都采用一个特定的特征并试图获取它,但它尊重奖励。它说,获取这个特征,同时仍然,你知道,获得大量的奖励,并且在你的奖励方面不会遭受太多。

这张图看起来几乎一样。策略现在我们背后有很多东西叫做选项,它们就像进一步的策略,而在价值函数背后,我们有更多的价值函数。所以我们有一整套价值函数。当然,我们必须为每个子问题有一个价值函数,因为这是一个独立的问题,我们必须知道我们在这方面做得有多好。所以,我们需要更多的价值函数。所以现在我们有四种组成部分,因为,嗯,这两者是相同的,但这两者现在是多个。我们仍然有感知,与之前大致相同,它产生一个状态特征向量,该向量将由所有子问题使用,现在策略,我们也形成了所有选项,它们产生一种适合子问题的行为方式,以及许多价值函数,用于评估我们在每个子问题上做得有多好。我没有在这里显示子问题。有趣的是,你的架构中实际上不需要一个对象来表示子问题。你只需要有价值函数,并且对于它,这个从特征向量上拉下来的小触须代表了每个价值函数都有一个单独的特征,它正在试图优化。

现在,让我们稍微详细地谈谈转移模型。我将用“知识”这个词来指代转移模型。我们所有的知识都在我们的转移模型中。我们相信如果我们做不同的事情,世界会如何变化,特别是如果我们做这些叫做“选项”的更大事情。

让我现在谈谈。所以,OAK 这个名字,OAK 架构,来自“选项”(Options)和“知识”(Knowledge)。选项是一种更高层次的行为方式。但它只是一个策略和一个终止方式的组合。策略只是一个从状态到低级动作概率分布的映射。而终止条件只是一个从状态到终止概率的映射。

在 OAK 中,我们有很多这样的选项。嗯,就像每个特征一个,每个数值特征,然后它学习关于遵循该选项直到终止会发生什么的知识。所以,这就是知识的形式,你知道,比如“如果我捡起物体并把它放在手里,它会是什么感觉?”“如果我走下楼去厨房,我会看到谁?”“如果我去了冰岛,你知道,我可能会遇到什么样的人?”“如果我参加讲座,我会学到什么?”那就是你关于会发生什么事情的知识。它成为一个高层次的世界转移模型,使规划能够进行更大的跳跃,并有望“切中要害”地分割世界。

所以,OAK 架构涉及这八个步骤,我们将要讨论它们。它们都并行地在运行时完成。我将逐一讨论它们,但你也可以先看一眼。我将学习策略和价值函数来最大化奖励。我将生成新的状态特征。我将对特征进行排序。我将创建子问题,每个子问题针对一个高度排名的特征。然后我将学习子问题的解决方案。我将学习这些子问题解决方案的转移模型。然后我将进行规划,并且我必须维护关于一切效用的元数据。

所以,希望其中一些词对你来说有意义。让我们一步一步地进行,并评估我们现在是否能够做到。

第一步是学习最大化奖励的策略和价值函数。嗯,这是经典的强化学习,我们有多种算法可以做到这一点。但仍然,我不会给它打绿勾,因为我不认为它完全解决了。如果我们真的能够进行持续的深度学习,那它就解决了。嗯,正如我一开始所说,这是我们尚未拥有的主要先决条件。所以,让我们看看那个。

所以,我在这里只关注第一步,并注意到它需要可靠的持续深度学习。我们现在能做到吗?我的意思是,因为我们至少需要这样做 40 年了。我一直,或者说我相当失望,没有人想出如何进行可靠的持续非线性学习。我们可以为线性网络做到这一点。线性网络可以可靠地、持续地学习。但传统的深度学习,你知道,一旦我们要求它进行持续学习以维持其学习能力,就会灾难性地失败。最著名的是我们遇到了灾难性遗忘。这可以追溯到 90 年代,最近人们才意识到我们失去了持续学习的能力。这被称为“可塑性丧失”,这已被我实验室和其他人的研究人员证明。

所以,其中一个解决方案,你知道,也许我们有一些部分的近期解决方案,我们可以进行深度学习并能够一定程度上持续学习。另一个可能有助于的想法是持续发现新特征和步长。而且我相信,无论如何,我们将在未来几年内实现可靠的持续非线性学习。因此,我认为假设它将会实现并依赖于它的存在,就像我在 OAK 架构中所做的那样,是公平的。

好的,回到第二步。我们需要从现有的状态特征生成新特征。所以,这里我不是在谈论寻找最好的特征。我是在谈论生成一大堆候选特征。所以,我认为这一点并不真正清楚。有很多想法。让我们来谈谈这个。所以,OAK 将需要发现新的状态特征。这是一个古老的问题,可以追溯到 60 年代。如果你曾经接触过,你可能对此很熟悉。它有很多名字。所以,整个表征学习的概念,或者“新术语问题”,或者“元学习”,经常用于这个想法。而这就是反向传播本应解决的问题,但实际上并没有。你知道,学习表示的梯度下降之类的论文是最初的反向传播论文,而且有一些论文声称它做到了,但我想如今我们承认它并没有真正找到好的表示,除了在最终解决问题的绝望意义上,这可能需要一些表示,但它不能很好地泛化,特别是,它并没有真正找到表示。

其他方法基于“生成和测试”。同样,事情可以追溯到很久以前。比如尝试一大堆候选特征,然后选择一个,看看哪些泛化得更好,然后保留那些。而反向传播的持续反向传播再次是基于生成和测试的新算法之一。所以,我坚持认为这是一个未解决的问题。我们需要解决它。我们需要一种好的方法来从现有特征生成新的状态特征,我将依赖于它。我有一个个人最喜欢的解决这个问题的方法,那就是 IDBD 算法。我认为这将是解决方案的一部分。所以,我在这里给你论文的名称,如果你想了解更多。

好的,接下来,我们有了所有这些我们创建的特征,候选特征,我们想对它们进行排序。我认为这似乎很容易。我们可以根据它们对子问题和代理以及模型学习的有用性来对它们进行排序。你只需要看到特征的使用情况,并用它来对它们进行排序。所以你可以对它们进行排序,然后大问题,或者说重要的步骤是为每个高度排名的特征创建子问题。所以我想谈谈这一点,因为我实际上认为这很容易做到,而且我们已经做到了。

那么,如何创建子问题呢?首先,我必须承认,人们在辅助子问题方面有着悠久的历史。有一些问题已经基本解决,也有一些问题仍然悬而未决。所以,让我们谈谈悬而未决的问题。悬而未决的问题,比如子问题应该是什么?它们从哪里来?代理可以生成自己的子问题吗?子问题如何帮助解决获取奖励的主要问题?OAK 架构为所有这些问题提供了答案。

所以,子问题,我认为我们正在关注的是玩耍。如果你只是想想动物甚至人类的生活,我们的生活充满了子问题。但这里有一个年轻的红毛猩猩,我认为他专注于子问题,就是他挥舞时获得的感官体验,他试图享受并重现它。所以,你知道,他能否再次做到这一点?他需要做什么才能做到这一点?你可以认为他在这里进行的玩耍是为了获取那个特征,即挥舞的特征,他的前庭系统说出它的感觉,这对他来说通常不会发生。

同样,这里实际上是一只虎鲸,有时被称为杀人鲸,它在一个水族馆里,有人扔了这个浮标给它,它一直在玩它,它发现它可以把它放在背上。这只是它注意到的一件有趣的事情,然后它在没有任何训练的情况下,就学会了可靠地做到这一点。

所以,这就是我认为的玩耍,我们可以认为它专注于获取一个特征。这里有一个人类的例子。这是一个婴儿在玩耍。它的行为不是随机的。它的行为被加速了一点,我敢肯定你注意到了。但它与玩具互动,它学到了一些东西,然后它继续前进,你知道,当它无法学到更多的时候,它就会寻找下一个学习的机会。所以,这就是我们所说的好奇心,当然。但我们可以把它看作是具有特征获取的子问题,某些它可以拥有的体验,颜色、感觉或声音,并试图能够重现它们。这是思考探索和好奇心过程的一种方式,就子问题而言。它正在获得对其世界的控制。

所以,显然,代理必须创建自己的子问题。所有可能的子问题都不可能被内置进去。婴儿遇到它的世界,看到有什么可以做的,然后它学会如何获取那里存在的东西。所以,可能的子问题太多样化了,而且太依赖于世界。我们必须将形成子问题、提出问题的责任交给代理,而且我们拥有许多必要的算法。我们有选项。我们拥有价值函数的概念及其全部通用性。我们有离策略学习和规划方法。所以,我们必须以一种领域通用的方式创建子问题。

那么,你如何做到呢?我的意思是,它们可能是什么?一个子问题,我认为我将提供解决方案,那就是“尊重奖励的特征获取”。最合理的解释是,除了获取特征之外,几乎没有其他东西可以考虑。你知道,你不能谈论状态,因为代理没有状态。你不能谈论世界中的物体,因为我们没有先验的物体。我们所拥有的只是我们形成来理解世界的特征和概念。

所以,如果我们,我没有太多检查我的时间。我确实想知道我做得怎么样。如果我有时间详细介绍我们如何在 OAK 中创建子问题。基本上,我们从一个特征开始。

>> 请继续。

>> 所以这是一个索引,一个特征编号,比如特征 53,而 kappa 是你想要特征的强度。你指定了这两件事,我们就可以自动创建一个子问题。子问题是驱动世界达到特征高的状态,而不会损失太多奖励。所以解决方案是一个选项。它是一个策略和一个终止方式,它最大化终止时 I 特征的价值,同时尊重奖励和价值。

所以,你想最大化,你想选择选项,以最大化你将获得的预期总奖励的价值,从现在开始到终止的时间段内收到的奖励总和。这是所有条件,我从时间 t 开始,在指定的状态 s,然后我们开始遵循选项,我们将获得一些奖励,我们将在时间 T 结束,所以我们只是在这些时间段内收到的奖励。我们还对结果状态的价值感兴趣。我们不想处于一个糟糕的事情将会发生的状态。所以这是我们对处于那个终止状态的估计价值。

哦,这是特征的获取。当然,我们想要,当我们停止在时间 T 时,我们希望处于特征 fi 高的状态。所以那个价值很大,它乘以 kappa,也就是你想要的特征的强度。所以这些是尊重奖励的子任务,特征的获取。一年前,AI 期刊上有一篇关于这个的论文。

所以,这就是我认为的子问题,然后我们必须学习解决方案,并学习解决方案的模型。解决方案就是选项。所以这两件事我认为相对简单,但它们再次依赖于我们能够很好地进行持续深度学习。但如果你承认我这个先决条件,那么我们就可以做到。

所以,这就是我们真正进入 OAK 的核心的地方。所以,请注意论证的整体结构。基本上,我们将进行所有这些学习过程,它们将使用特征,并且它们还将驱动新候选特征的创建。所以,基本上,我们将拥有在这里传递的特征。一旦我们有了有趣的特征,我们就可以创建子问题来获取每个特征。所以,一旦我们有了这些子问题,我们就会解决它们。如果我们有一千个子问题,我们将解决它们以产生一千个选项。

好的。每个选项都将成为基础。你知道,我们问这个问题,如果我在这种情况下执行那个选项,会发生什么?这就是转移模型。我们正在预测以那种方式行事的后果。现在,这与解决问题不同,解决问题是找到一种好的行为方式,而那将是一种希望实现特征的方式,但会有许多其他后果。你可能会实现特征,你可能会,你知道,其他事情会发生。如果我下楼去厨房,我可能会到达厨房,但我可能也会看到我的配偶,或者我可能会绊倒摔下楼梯。很多事情都可能发生,我需要预测可能的后果。

所以,这就是转移模型,然后我有了转移模型,我想用它们来规划,这会改善我的行为,并有望让我获得高度适应性的行为。

好了,让我们用另一张图来看看。所以,我们谈论感知给我特征。所以,现在我有了状态特征。然后我解决了这些子问题。我玩弄世界,我得到了选项。选项,我预测选项的后果,这给了我一个转移模型。转移模型通过规划给了我改进的价值和策略,然后所有这些后续步骤都会反馈回来,并告知感知。我们告诉感知,为了形成这个模型,我不得不使用一些特征,而忽略其他特征。为了解决问题,我使用了一些特征而没有使用其他特征。所以,这些过程会影响特征的构建过程,它们可能会说,“哦,你提供的这些特征是无用的,你应该把它们扔掉,给我更多的特征,而这些其他特征非常有用。也许它们应该成为未来子问题的基础,这些子问题被提出并解决,从而递归地通过这个循环,以开放的方式改进代理的抽象。”

一切最终都与奖励挂钩。所以,请记住我的探索。我的探索是通用、经验性,并具有开放式抽象。我认为,也许我希望,你能看到这个愿景,它为你提供了一种可能希望实现所有这些目标的方式,即使它有一些缺失的先决条件。

所以,OAK 有一个关于如何从运行时经验中培养超级智能的愿景。它拥有所有最重要的能力。它可以行动、学习和规划。可以学习模型。它可以形成子问题。这些抽象与不同的事物协同工作。还有选项。它可以通过函数逼近、部分可观察性、非平稳世界、随机世界来做到这一点。它可以发现状态特征,从而发现子问题、选项和模型。所有这些都会反馈回来,以激励更抽象的特征。这个良性循环,良性的开放式发现循环。同时,该架构是完全通用的。它没有任何特定领域的组件,因此具有可扩展性和潜在的持久性。

影响。非常感谢您的关注。[掌声] 非常感谢您,Rich。很高兴您能来到这里。当然,恭喜您获得最近的巡演奖项,并感谢您为该领域做出的所有贡献。当然也包括对强化学习的贡献。希望您也能帮助我们解决这个鲁棒的持续深度学习问题。如果您有时间,我们还有几个来自观众的问题。这边有一个。>> 嗯,是的,我看了您为 Oak 列出的要求。在您提到的黑猩猩或猩猩的例子中。似乎为高度排名的特征创建子问题会消耗第二和第三个状态,因为您已经内置了一个奖励函数,让黑猩猩享受比如荡秋千。所以这是一种化学反应,然后说这是一个高度排名的特征,因为您的经验。因此,生成状态函数来自系统本身的形成,它通过从环境中获得奖励来体现。然后,该排名顺序就变成了奖励的好处,而不是您所说的有偏见的特征。所以我想我的问题是,有没有办法通过假设子问题来自玩耍,基于您所说的“乐趣”来跳过一到四步?用您的话来说,就是“得到奖励的东西是通过它的构建方式来调整以获得奖励的”。嗯,所以您,您,您很正确地关注我们如何选择特征作为子问题的基础。现在,其中一些可能来自我们的先验设计,你知道,比如我们的设计可能会说亮光可能很重要,或者响亮的声音。也许我们的设计可以告诉我们,激活我们前庭系统的东西很重要。但很多事情并非如此。所以,你知道,想想您在科学上的工作,您研究一个问题,然后您会意识到非常细微的区别,而您仍然可能想关注它们并朝着它们努力。或者也许,您下棋,然后您有一些表面上微妙的东西,比如,你知道,您的兵的结构,然后您可以设定一个目标。或者也许您国王的安全,您可以为之设定目标。所以我不认为您可以预测,您可以期望它们是可以预测的。但是,通过注意到这些微妙之处对于回答您的一些问题很重要,它们可能有助于回答您基本的奖励问题,或者有助于回答其他子问题。所以也许一个很好的例子是想想一个婴儿,婴儿变得非常意识到它的照顾者。比如它的母亲,我不知道,也许它母亲的气味是一件微妙的事情,但通过与良好结果的关联,它变得很重要。或者它母亲的声音,或者声音,是的,我也想到了玩拨浪鼓的例子,也许你动了,你发出了拨浪鼓的声音,拨浪鼓是某种特定的声音,但它是新颖的,仅仅因为它新颖,你可能想关注它并能够重现它,无论如何,这是一个很棒的有趣问题,关于子问题是如何被选择的。感谢您的问题。>> 谢谢。这边还有一个。>> 是的。嘿,我是 Ben。所以,我们在这个会议上已经有几次关于预测编码作为反向传播训练深度神经网络的替代方案的演讲了。我知道有一些研究正在尝试使用它来解决灾难性遗忘问题,并使神经网络能够持续学习。所以我想我的问题是,您的直觉是持续学习问题可以用反向传播来解决,还是您认为我们需要回到 DC 或其他更具生物学性或其他创新性的神经网络训练方式?>> 谢谢 Ben。我不认为这是神经网络结构的问题。我认为这是简单反向传播的弱点问题。解决方案,我认为解决方案仍然会涉及梯度下降,但仅靠梯度下降是不够的。这是持续反向传播算法的教训。这是 Dohare 提出的新算法,并在“损失可塑性”论文中进行了研究。它很简单。它与反向传播相同,只是在开始时不是用小的随机权重进行初始化,而是随着时间的推移,对那些使用不多的单位中的一小部分进行随机权重重新初始化。所以这是一个非常简单的想法,一个简单的修改。它实际上只是让反向传播更具持续性,你知道,让它做更多它已经做的事情。所以这是一个算法的小修改,它大大增强了持续学习的能力。所以我认为算法的空间很大,我们探索得很少,而且会有小的,或者也许更大的,但无论如何,有一系列可能的想法可以使其在持续学习方面更有效,并且它们仍然会涉及梯度。只是梯度>> 预测编码也涉及梯度下降。你只是用它来学习不同的东西。我的意思是,你在一个神经元上进行梯度下降来预测另一个神经元在局部做什么,所以你不是以与反向传播相同的方式传播,但你仍然在局部进行梯度下降,它更像是 Benio 的差异目标传播的方向,但更极端一些,对吧?所以,正如你所说,有很多方法可以组织它。关键是你需要一个随机成分,你需要一个搜索成分。梯度下降是确定性的,并且遵循梯度。这还不够。你需要一些能产生多样性的东西。而这正是通过随机权重初始化产生的多样性。>> 这是个很好的智慧。我同意随机成分将是关键要素之一。所以,是的,谢谢你,Ben。我们在房间后面还有另一个问题。>> 你好。我有一个关于连续观察世界如何转化为新的可能行动的问题,这个过程是如何发生的?比如,如果一个孩子在玩耍,他们发现了一个沉重的东西,这是一个锤子,他们可以用它来敲打东西,然后他们慢慢发现了钉子和木板,你知道,如何使用锤子将木板组装起来成为你的学习机制?>> 你说连续,连续有两种可能的含义。我想让你澄清一下你的意思。连续可能意味着它是一个取连续值的数字,或者你可能意味着它是持续进行的。是的,我指的是持续进行,只是根据观察来创造新的可能行动。你知道,是否存在一个具体化,然后转化为一个抽象,即“这是一个我可以使用的工具”?我想问的是,工具的使用是如何被发现的?>> 嗯,这是一个大问题。>> 是的。是的。>> 但即使是像简单的工具,我也会提供,它暗示了它是如何完成的。嗯,让我想想。如何?所以你可能会找到锤子,然后你意识到你可以用锤子发出声音。所以你可以熟练地用这个锤子发出声音,然后你可能会,我的意思是,我指出的是,用锤子敲钉子是一个相当高级的概念。是一项技能,一项高级技能,你不会期望它立即成功,但你可以用锤子发出声音。然后你可以用锤子打碎东西。而且,为了熟练地将钉子敲进去,你可能需要看别人做。如果你看到别人拿起钉子和锤子,做这个非常有趣的事情,钉子进入了木板,你知道,这是一种不寻常的观察,而这可能成为你“我能用锤子把钉子敲进木板吗?”的基础。好的。然后你可能会为此工作很长时间。然后一旦你有了这个,你就会,你知道,也许你会想到你可以通过工具组装东西。我不知道,这有点含糊其辞,但我认为有一个从检测有趣的、新颖的特征到想知道你是否能重现它们的进展。所以,你知道,关键是你只是想能够敲打它,即使它没有给你带来任何奖励。你想重现你看到别人做的事情,即使它没有立即给你带来任何奖励,但你学会了如何做,而且你也学会了如何在不伤害自己的情况下将钉子敲进木板,例如,不被锤子砸到拇指。这就是你想要尊重奖励的意义所在。>> 谢谢。>> 谢谢。>> 非常感谢。最后一个问题。>> 你好。你认为一个新的代理将如何发现和理解它自身与世界之间的界限?比如什么是自我,什么是环境?>> 嗯,我认为这很有趣,它是如何模糊的。嗯,因为当你,首先界限在哪里?你知道,我会在哪里画它?我会把它画在你的思想周围,你可能会认为它在你的大脑周围。所以,特别是,你的身体,比如你的手,是你无法完全控制的环境的一部分,而你又想控制它。你知道,我们可以想想一个孩子最初不知道如何控制自己的手或其他肢体,而你可能会看到一个年幼的婴儿,事实上,你知道,他们经常会看着自己的手,弄清楚如何控制它们。你知道,首先你能找到它们,就像,你知道,嘿,这是我的手,我可以看到它,现在我看不到了,我说,“嘿,我能拿到它吗?我能?”它没有说“这是我的手”。它说,“这是一个有趣的感觉。我能让它再次发生吗?我能把我的手举到我的视野里吗?我能把我的拇指放回嘴里吗?”嗯,这是一个有趣的对象。我想知道如果我把它放进嘴里会是什么味道。所以,没有,界限在哪里?让我再说一点,因为对于那些长期从事强化学习的人来说,这通常是不清楚的。关于奖励。奖励来自代理的外部,但它不来自我们的身体外部。对吧?奖励是在我们的大脑内部计算的,事实上是在我们的大脑内部,但它是大脑的一部分,我认为它不被认为是代理的一部分,因为代理不允许自己将奖励设定为高。我认为我们下丘脑的一部分计算奖励信号,而这在技术上是在代理之外,就像身体在代理之外一样。我当然要参考扩展假说。嗯,当我们越来越熟悉控制某物时,比如我们的身体,它就变得几乎,几乎有用,把它看作是代理的一部分。你知道,或者我们开汽车,我们开始把汽车看作是我们控制方向盘,方向盘就像我们的选择。这是抽象的变化。而且,这确实是一种有用的思考方式。但正式来说,我们想要在代理和环境之间划清界限,并在引入更高级的抽象之前,对可用的原始动作有一个清晰的定义。再次感谢。>> 这太棒了。非常感谢您,Rich。如此清晰的解释。很棒的讨论。我不知道您是否能听到掌声,但我们非常感谢您的到来并加入我们。非常感谢。>> 谢谢。