Transcription
以下是与马库斯·胡特尔的对话,他是谷歌DeepMind的资深研究科学家。在他的研究生涯中,包括与尤尔根·史密斯·胡贝尔和沙恩·莱格的合作,他提出了许多关于人工通用智能领域及其周边领域的有趣想法,包括开发了AIXI模型(拼写为a ixi),这是一种将柯尔莫哥洛夫复杂度、所罗门诺夫归纳法和强化学习思想融入AGI的数学方法。
2006年,马库斯设立了5万欧元的胡特尔奖,旨在奖励人类知识的无损压缩。这个奖项背后的理念是,良好的压缩能力与智能密切相关。对我来说,这是一个深刻的理念。具体来说,如果你能比你的前辈更好地压缩维基百科的前100兆字节或1千兆字节,你的压缩器可能也必须更智能。这个奖项的目的是鼓励开发智能压缩器,以此作为通往AGI的途径。
就在几天前,与本播客发布同时,马库斯宣布将该奖项的多个方面提高10倍,包括奖金增至50万欧元。你的压缩器相对于之前的获奖者表现越好,你获得的奖金比例就越高。如果你简单地谷歌搜索“胡特尔奖”,就可以了解更多信息。
我非常喜欢用于开发AI系统的基准测试,而胡特尔奖可能确实会激发一些好想法,推动通用智能系统开发之路的进展。这是人工智能播客。如果你喜欢它,请在YouTube上订阅,在Apple播客上给它五星好评,在Patreon上支持它,或者简单地在Twitter上与我联系,我的账号是@lex Friedman,拼写为Fri D M am。像往常一样,我现在会播放一两分钟的广告,对话中间绝不会有任何广告打断交流的流畅性。我希望这能对你有所帮助,并且不会损害收听体验。
本节目由Cash App呈现,它是App Store中排名第一的金融应用。当你下载它时,使用代码“Lex Podcast”,Cash App让你能够向朋友汇款、购买比特币,并以低至一美元的金额投资股票市场。经纪服务由Cash App Investing提供,它是Square的子公司,也是SIPC的成员。由于Cash App允许你进行数字化的点对点收发资金,并且所有数字交易都非常安全,这一点非常重要。让我提一下Cash App所遵循的PCI数据安全标准。我非常喜欢安全和保障方面的标准,PCI DSS就是一个很好的例子,它是一群竞争对手齐心协力,同意需要一个关于交易安全的全球标准。现在我们只需要对自动驾驶汽车和一般AI系统做同样的事情。
所以,如果你从App Store或Google Play下载Cash App并使用代码“Lex Podcast”,你将获得10美元,Cash App还将向我最喜欢的组织之一捐赠10美元,该组织正在帮助全球年轻人推进机器人技术和STEM教育。现在,这是我与马库斯·胡特尔的对话。
作为一个计算机,或者说一个信息处理系统,我们先从一个大问题开始,好吗?我先从一个大问题开始。是的,我认为这是一个非常有趣的假设或想法,我拥有物理学背景,所以我对物理理论,粒子物理学的标准模型和广义相对论有所了解。它们非常惊人,几乎描述了宇宙中的一切,而且它们在某种意义上都是可计算的理论。我的意思是,它们非常难以计算,但你知道,它们是非常优雅、简单的理论,描述了宇宙中的几乎一切。所以,有一个强烈的迹象表明,宇宙在某种程度上是可计算的,但这是一个合理的假设。
那么,你认为,就像你说的广义相对论、量子场论一样,你认为物理定律为什么如此美妙、美丽、简单和可压缩?你认为我们的宇宙是被设计的,还是自然而然就是这样?我们是否只是专注于那些特别可压缩的部分?我们人类的大脑是否只是喜欢那种简单性,而实际上还有其他不那么可压缩的东西?
不,我坚信并相当确信宇宙本质上是美丽、优雅和简单的,并由这些方程描述。我们并非只是在选择性地看待。我的意思是,如果存在无法描述的多样现象,科学家们会尝试去描述,对吧?而且,你知道,生物学更混乱,但我们明白它是一种涌现现象,而且,你知道,它是复杂的系统,但它们仍然遵循量子电动力学的相同规则,所有化学都遵循这些规则,我们知道这一点。我的意思是,我们无法计算所有事物,因为我们计算资源有限。现在我认为这不是人类的偏见,而是客观上的简单。我的意思是,当然,你永远不知道,也许在宇宙中非常遥远的某个角落,或者原子核之下极其微小的某个地方,或者平行宇宙中,存在不那么美好和简单的东西,但没有证据表明这一点,你应该应用奥卡姆剃刀原理,你知道,只是简单的故事与此一致,但也有点为了友谊。
那么,也许我们暂停一下,什么是奥卡姆剃刀原理?奥卡姆剃刀原理说,你不应该在没有必要的情况下增加实体,这在某种程度上,如果你把它翻译成恰当的英语,并且,你知道,在科学语境中,意味着如果你有两个理论、假设或模型,它们同样能很好地描述你所研究的现象或数据,那么你应该选择更简单的那一个。所以这只是一个原则,它不像一个可证明的定律。也许我们会讨论并思考它,但为什么更简单的答案更有可能成为我们所谈论的任何事物的更正确描述,其直觉是什么?
我相信奥卡姆剃刀原理可能是科学中最重要的一条原则。我的意思是,当然,我们逻辑上不应该做实验设计,但科学是关于发现和理解世界,寻找世界的模型。我们可以提出疯狂复杂的模型,它们解释一切但什么也预测不了,但简单的模型似乎具有预测能力,这是一个合理的问题,为什么?是的,对此有两个答案:你可以接受它就是科学的原则,我们使用这个原则,它似乎是成功的,我们不知道为什么,但它就是这样发生了;或者你可以尝试寻找另一个原则来解释奥卡姆剃刀原理。如果我们从世界由简单规则支配的假设开始,那么就会有一种偏向简单性的倾向,而应用奥卡姆剃刀原理就是找到这些规则的机制。实际上,从更定量的意义上讲,我们稍后会回到这一点,就某种罗马吸引力而言,你可以严格证明,通常假设世界是简单的,那么奥卡姆剃刀原理在某种意义上就是你能做的最好的事情。
那么,我为这个浪漫化的问题道歉,但你认为除了其有效性之外,为什么我们人类会觉得简单性如此吸引人?为什么E=mc²对我们人类来说如此美丽?我想,总的来说,许多事情都可以用进化论来解释。而且,你知道,人类身上有一些人工制品,你知道,它们只是人工制品,并非进化所必需,但这种美和简单性,我相信,至少其核心在于科学在世界中发现规律,理解世界,这对于生存是必要的,对吧?你知道,如果我看到一丛灌木,然后我只看到了诺里斯,然后那里有一只老虎,它把我吃了,那我就死了。但如果我试图找到一个模式,我们知道人类倾向于在数据中找到比实际更多的模式,你知道,就像火星脸和所有这些东西一样。但这种寻找模式的偏好,即使它们不存在,但我的意思是,当然,如果它们存在,那最好,是的,它有助于我们生存。是的,这很迷人,我真的没有想过这一点。我以为我只是热爱科学,但确实,就生存目的而言,有一个进化论的论点可以解释为什么我们觉得爱因斯坦的作品如此美丽。
也许我们稍微岔开一下,你能描述一下什么是所罗门诺夫归纳法吗?是的,这是一个我声称,而且里斯林也曾声称,很久以前就解决了归纳法这一重大哲学问题的理论,我相信这个说法本质上是真实的。它的作用如下:好的,对于挑剔的听众来说,归纳法可以被狭义和广义地解释。狭义是指从数据中推断模型,广义是指然后使用这些模型进行预测,或者说预测也是归纳法的一部分。所以我在术语上有点随意,也许这来自于雷·所罗门诺夫的随意,也许是说我们不能再抱怨了。那么,让我简单解释一下这个理论。假设我们有一个数据序列,把它变得非常简单,最简单的一个,比如1 1 1 1 1,你看到100个1,你认为接下来会是什么?自然的顺序,我重复一下,自然的答案当然是1。好的,问题是为什么?好的,我们看到了一个模式,是的,好的,有一个1,我们重复它,为什么在100个1之后它会突然不同呢?所以我们正在寻找的是我们所拥有的数据的简单解释或模型。现在问题是,模型必须以某种语言呈现,在科学中我们希望使用形式语言,我们可以使用数学,或者我们可以在计算机上使用程序,例如在图灵机上抽象地,或者可以是通用计算机。当然,有很多模型,你可以说也许是100个1,然后是100个0,再是100个1,这是一个模型,对吧?但有更简单的模型,有一个模型是“打印1循环”,它也解释了数据。如果你推到极致,你正在寻找最短的程序,如果你运行这个程序,它会重现你拥有的数据,它不会停止,它会自然地继续,你将此用于你的预测。在1的序列上,这非常合理,对吧?“打印1循环”是最短的程序。我们可以给出一些更复杂的例子,比如1 2 3 4 5,接下来是什么?简短的程序又是计数器。所以,粗略地说,这就是很多互动的工作方式。额外的亮点是它还可以处理有噪声的数据。所以,如果你有一个抛硬币的例子,比如一个有偏的硬币,以60%的概率出现正面,那么如果你学习并弄清楚这一点,过一段时间它就会预测下一次抛硬币有60%的概率是正面。所以它是这个的随机版本,但目标,梦想,始终是寻找最短的程序。是的,在所罗门诺夫归纳法中,你所做的正是如此:你结合了寻找最短程序,这就像应用奥卡姆剃刀原理,寻找最简单的理论。还有一个“帕科拉斯原则”,它说如果你有多个同样能很好地描述你的数据的假设,不要丢弃任何一个,把它们都保留下来,你永远不知道。你可以把它们结合起来,说“好的,我偏向于简单性,但我不会排除更大的模型”。从技术上讲,我们所做的是,我们给较短的模型更高的权重,给较长的模型较低的权重,你使用贝叶斯技术,你有一个先验,它精确地是2的负程序复杂度次方,你权衡所有这些假设并取这个混合,然后你也会得到这种可塑性。是的,就像你的许多想法一样,这只是一个基于程序简单性进行权衡的美妙想法。我喜欢这个,对我来说,这似乎是一个非常以人类为中心的概念,似乎是在这个世界上发现好程序的一种非常有吸引力的方式。
你用了很多“压缩”这个词。我认为这是一个美丽的理念,我们刚刚谈到了简单性,也许科学或者我们所有的智力追求,基本上都是试图将我们周围的复杂性压缩成简单的东西。那么,“压缩”这个词对你意味着什么?我基本上已经解释过了,所以对我来说,压缩意味着为手头的数据或现象找到简短的程序。你可以更广泛地解释它,你知道,就是找到简单的理论,可以是数学理论,所以也许甚至是口头的,你知道,就像,你知道,只是反向压缩意味着找到简短的描述、解释、程序、少量数据。
你认为科学是我们人类的一种压缩尝试吗?所以我们说得更普遍一些,因为当你说程序时,有点像聚焦于计算机科学和人工智能的特定领域,但你认为所有人类的努力都是一种压缩吗?嗯,至少所有的科学,我看到它都涉及到压缩,也许是全人类的努力。而且,科学还有其他方面,比如实验设计,对吧?我的意思是,我们专门设计实验来获取额外的知识,这不是决策过程的一部分,但一旦我们有了数据,理解数据本质上就是压缩。所以,我看不出对比压缩、理解和预测之间有什么区别。
那么,我们稍微跳跃了一下话题,但回到简单性,一个关于柯尔莫哥洛夫复杂度的迷人概念。那么,在你看来,我们数学宇宙中的大多数对象都具有高柯尔莫哥洛夫复杂度吗?首先,什么是柯尔莫哥洛夫复杂度?
好的,柯尔莫哥洛夫复杂度是简单性或复杂性的一个概念,它将压缩的观点推向了极致。所以我之前解释过,如果你有一些数据序列,就把它想象成计算机上的一个文件,最好是,你知道,只是一串比特。如果你,我们有数据压缩器,可能会用某些压缩器将大文件压缩成zip文件。你也可以制作自解压档案,这意味着它是一个可执行文件,如果你运行它,它会重现原始文件,而无需额外的解压缩器,它只是解压缩器加上档案合二为一。现在有更好和更差的压缩器,你可以问什么是终极压缩器?那么,对于某个数据集,你能制作出的最短的自解压档案是什么?是的,它能重现数据集,而这个长度就叫做柯尔莫哥洛夫复杂度。可以说,这就是数据集中的信息内容。我的意思是,如果数据集非常冗余或非常无聊,你可以很好地压缩它,所以信息内容应该很低,你知道,根据这个差异,它确实很低。这就是总结数据的最短程序的长度,是的,是的。
那么,当我们思考宇宙中不同的对象,我们每个人都是概念或任何事物,在每个层面上,它们是具有更高还是局部的柯尔莫哥洛夫复杂度?那么,我们有多少希望能够总结我们世界的很多方面?
这是一个棘手而困难的问题。所以,正如我之前所说,我相信整个宇宙,基于我们所拥有的证据,是非常简单的,所以它有一个非常简短的描述。整个……抱歉,你是否会就此多说一点?整个宇宙,我的意思是什么?你是指在最基本的层面,为了创造宇宙?是的,是的,所以你需要一个非常简短的程序,当你运行它时,它就会启动,它就会启动,然后它会重现我们的宇宙。而且存在噪声问题,我们稍后可以再谈。噪声可能是一个问题,或者说是一种担忧,它是一个bug还是一个特性?我会说它让我们的科学家生活变得非常非常困难。我没有想过,如果没有噪声,我们就不需要所有的统计数据,但那样也许我们就不会觉得有自由意志,也许我们需要它来解决伦理问题。这是一种错觉,诺里斯可以让你以那种方式冻结,这是一个特性。但如果你没有噪声,你就会有混沌现象,它们实际上就像噪声一样,所以我们即使那样也无法摆脱统计数据。我的意思是,想想掷骰子,你知道,忘记量子力学,你知道你确切地如何掷它,但我的意思是,计算轨迹仍然如此困难,以至于实际上最好将其建模为,你知道,以1/6的概率出现这个数字。但从这套哲学的柯尔莫哥洛夫复杂度视角来看,如果我们没有噪声,那么可以说你可以描述整个宇宙,以及标准模型加上广义相对论。我的意思是,我们还没有一个万有理论,但假设我们已经接近它或者已经拥有它,再加上初始条件,这些条件可能希望是简单的,然后你只需运行它,你就会重现宇宙。但这都是由噪声、混沌系统或初始条件造成的,你知道,这些条件可能很复杂。那么现在,如果我们不考虑整个宇宙,而只是一个子集,你知道,只考虑地球。地球无法被压缩成几个方程,这是一个极其复杂的事物。这太有趣了,所以当你看向窗外,整个事物可能很简单,但当你只取一个小窗口时,它可能会变得复杂,这可能违反直觉。但有一个非常好的类比:所有书籍的图书馆。想象你有一个普通的图书馆,里面有有趣的书籍,你去那里,有很多信息,而且相当复杂,是的。现在我创建一个图书馆,其中包含所有可能的书籍,比如说500页的书。所以第一本书所有页面都只有A,下一本书所有页面都只有A,最后以P结尾,依此类推。我创建了这个包含所有书籍的图书馆,我可以编写一个超短的程序来创建这个图书馆。所以这个包含所有书籍的图书馆的信息内容为零。你从这个图书馆中取出一个子集,突然间里面就有了大量信息。这太迷人了。
我认为至少在今天,最美丽、最受研究或最被谈论的数学对象之一是细胞自动机。你从细胞自动机的“生命游戏”中汲取了什么教训?在那里,你从简单的规则开始,就像你描述宇宙一样,然后复杂性以某种方式涌现。你是否觉得你对这类系统的行为,这种迷人的行为,有一种直观的理解?在这些系统中,正如你所说,可能会出现一些混沌行为,一些复杂性可能会涌现,一些可能会消亡,还有一些非常僵硬的结构。你对细胞自动机有一种感觉,这种感觉是否以某种方式转移到我们宇宙的更大问题上?
细胞自动机,尤其是康威的生命游戏,非常棒,因为它的规则如此简单,你可以向每个孩子解释,而且你可以手动模拟一点点,然后你会看到这些美丽的模式涌现。人们已经证明,你知道,它甚至是图灵完备的。你不仅可以使用计算机模拟生命游戏,你还可以使用生命游戏模拟任何计算机,这真是太神奇了。它很可能是证明非常简单的规则可以导致非常丰富的现象的最好例子。人们,你知道,有时会想,化学和生物学怎么会如此丰富?我的意思是,这不可能基于简单的规则,是的。但现在我们知道量子电动力学描述了所有的化学,我们稍后会回到这一点。我声称智能可以用一个单一的方程来解释或描述,这个非常丰富的现象。你还问我是否理解这种现象,可能没有。这就是说,你永远不会真正理解事物,你只是习惯了它们,而且非常习惯于销售所有自动机。所以你相信你现在理解了为什么这种现象会发生。但我给你一个不同的例子。我没有太多地玩康威的生命游戏,但更多地玩了分形和曼德尔布罗特集合,它有美丽的模式,你知道,只需看看曼德尔布罗特集合。当我们的计算机非常慢,只有黑白显示器时,我用汇编语言编写了自己的程序,哇,哇,把这些向量显示在屏幕上,我被迷住了。很久以后,我每隔几年就会回到这个问题,然后我试图理解发生了什么。你可以理解一点点,所以我试图推导出这些位置,你知道,有这些圆形和苹果形状,然后在这个集合中递归地有更小的曼德尔布罗特集合。通过这种方式,通过数学方法解决高阶多项式来找出这些中心在哪里以及它们大约有多大。通过这种蚂蚁般的数学方法解决这个问题,你慢慢地会感觉到事物为什么会是这样,而这并不是理解这种丰富现象的第一步。
你认为这可能吗?你的直觉是什么?你认为是否有可能通过观察分形来逆向工程并找到生成这些分形的短程序?嗯,原则上是的。我的意思是,原则上你可以做的是,你获取任何数据集,你知道,你获取这些分形,或者你获取你拥有的任何数据集,比如说康威生命游戏的图片,然后你运行所有程序。你获取你的程序1、2、3、4,所有这些程序都以所谓的“交错”方式并行运行,给它们分配计算资源,第一个50%,第二个1/2资源,依此类推,让它们运行,等待它们停止,给出输出,与你的数据进行比较。如果其中一些程序产生了正确的数据,那么你就停止,然后你已经使用了一些程序,它可能是一个长程序,因为它更快。然后你继续,你会得到越来越短的程序,直到你最终找到最短的程序。有趣的是,你永远无法知道这个程序是否是最短的,因为可能存在一个更短但运行更慢的程序,你只需要等待。但渐近地,实际上在有限时间后,你就会得到这个最短的程序。所以这是一种理论上可行但完全不切实际的方法,用于在每个数据集中找到底层结构。在实践中,当然,我们必须更智能地处理这个问题,柯尔莫哥洛夫复杂度有很多互动。然后,如果你考虑到资源限制,就会有伪随机数领域。是的,这些是必须随机的,所以它们是确定性序列,但没有快速算法(快速意味着在多项式时间内运行)可以检测到它实际上是确定性的。所以我们可以产生有趣的,我的意思是随机数可能没那么有趣,但只是一个例子,我们可以产生看起来复杂的数据,然后我们可以证明没有快速算法可以检测到潜在的模式,这不幸的是,这对我们在人工智能领域寻找简单程序是一个巨大的挑战吗?也许是的,它绝对是量化智能,而且令人惊讶的是,我不能说它很容易,我的意思是,他非常努力地寻找他的理论,但显然人类的心智有可能在宇宙中找到这些简单的规则。它本可以不同,对吧?它本可以不同,它,它,它很鼓舞人心。
那么,让我再问一个荒谬的大问题:在你看来,什么是智能?我当然有一个定义。我不确定你会说什么,因为你本可以轻易地说“我不知道”,很多人都会这么说。在这个问题上我并不谦虚。那么,与沙恩·莱格(DeepMind的联合创始人)共同提出的非正式版本是:智能衡量一个智能体在广泛环境中良好表现的能力。这听起来不怎么令人印象深刻,但这些词语都经过了非常仔细的选择,其背后有一个数学理论,我们稍后会再谈。而且,如果你看看这个定义本身,它似乎是“是的,好吧”,但似乎缺少很多东西。但如果你仔细思考,你就会意识到,大多数,我甚至声称所有其他我们通常与智能相关的理性智能特征,都是从这个定义中涌现出来的现象。创造力、记忆力、规划、知识,你都需要这些才能在广泛的环境中表现良好,所以你不必在定义中明确提及这些,这很有趣。所以,是的,意识、抽象推理或所有这些东西都只是帮助你实现目标的涌现现象。你能再说一遍针对多种环境的定义吗?你提到过目标吗?不,但我们有一个替代定义,不是“良好表现”,而是用“目标”来代替。所以智能衡量一个智能体在广泛环境中实现目标的能力。这或多或少是因为其中注入了“目标”这个词,所以你需要明确那里应该有一个目标。是的,但“良好表现”是什么意思呢?这是同一个问题。是的,这里有一点灰色地带,但它更接近于可以形式化的东西。在你看来,人类如何符合这个定义?他们是能够在多种环境中表现良好的通用智能系统吗?他们在这个定义上表现得有多好?
是的,这是一个大问题。我的意思是,据我们所知,人类在所有物种中表现最好。是的,这取决于你。你可以说树木和植物做得更好,它们可能会比我们活得更久。所以,是的,但它们处于一个更狭窄的环境中,对吧?我的意思是,你知道,只要有一点点空气污染,这些树就会死亡,而我们可以适应,对吧?我们建造带过滤器的房屋,我们进行地球工程。所以“多种环境”这一部分,是的,这非常重要。是的,这在人工智能研究中也区分了狭义智能和广义智能。
那么,让我问一下艾伦·图灵的问题:机器能思考吗?机器能有智能吗?所以在你看来,我不得不问,答案可能是否定的,但我想听听你对此的看法:机器能否被制造出来以满足这个智能定义,从而实现智能?
嗯,我们正在朝着那个方向发展,而且,你知道,在小范围内我们已经做到了。关于自动驾驶汽车,我们缺少广泛的环境。我们有下围棋和国际象棋的程序,我们有语音识别,所以这相当惊人,但你知道,这些都是狭窄的环境。但如果你看看AlphaZero,它也是由DeepMind开发的,我的意思是,著名的AlphaGo,然后一年后又有了AlphaZero,那真是太神奇了。它是一个强化学习算法,能够通过自我对弈来下国际象棋,然后也下围棋。我的意思是,是的,它们都是游戏,但它们是截然不同的游戏。而且,你知道,你没有给它们输入游戏规则,最值得注意的是,对我来说仍然是个谜的是,通常对于任何像样的国际象棋程序(我对围棋了解不多),你需要开局库和残局表等等——而AlphaZero里面什么都没有,什么都没有输入。AlphaZero有一个从零开始的自我对弈机制,能够学习新的策略,是的,它在四个小时内自己重新发现了所有这些著名的开局。我真正高兴的是,我是一个糟糕的国际象棋棋手,但我喜欢后翼弃兵,而AlphaZero发现这是最好的开局,没错。所以,是的,回答你的问题,是的,我相信通用智能是可能的,它也取决于你如何定义它。你说的AGI(人工通用智能)是指达到人类水平还是低于人类水平但相当广泛的智能?它也是通用智能吗?所以我们必须区分,或者它只是超人类智能?在你心中,有没有像自然语言的图灵测试或某种其他测试,会让你印象深刻,从而跨越你所说的智能框架的界限?
嗯,图灵测试受到了很多批评,但我认为它不像有些人想的那么糟糕。有些人认为它太强了,因为它不仅测试一个系统是否智能,还必须伪装人类的欺骗行为,这部分,你知道,要困难得多。另一方面,他们说它太弱了,是的,因为它可能只是伪装情感或智能行为,它不是真实的,但我认为这不是问题或大问题。所以,如果你通过图灵测试,也就是说,通过终端与一个机器人对话一小时或一天左右,并且你能欺骗人类,让他们不知道这是否是人类,那么在测试期间,我真的会印象深刻。我们有这个年度竞赛,阿鲁姆纳奖,我的意思是,它始于伊莱贾,那是第一个对话程序。还有那个叫做日本的Mitsouko什么的,那是过去几年来的赢家,嗯,令人印象深刻,是的,相当令人印象深刻。然后谷歌最近也开发了Meena,那是一个开放领域的对话机器人,我想就在几周前。是的,我有点喜欢Alexa奖提出的那种衡量标准,也许这对你来说很明显,但对我来说不是,就是设定一个对话的长度,比如你希望机器人足够有趣,你会想和它继续聊20分钟。这是一个出人意料地有效的综合指标,因为真的没有人有耐心去和一个不有趣、不智能、不风趣,不能跳跃话题、跨越领域,不能说出有趣的话来吸引你注意力的机器人聊天。也许很多人类也会不幸地未能通过这个测试。我们就像对待自动驾驶汽车和聊天机器人一样,也设定了一个太高难以达到的标准。
我说过,你知道,图灵测试不像有些人认为的那么糟糕。你明白了图灵测试真正无用之处在于它根本没有给我们如何开发这些系统的指导。当然,你知道,我们可以通过试错法来开发它们,你知道,做任何事情,然后运行测试,看看它是否有效。但智能的数学定义给了我们一个目标,我们可以通过理论工具或计算来分析它,你知道,也许可以改进我们离目标有多近,我们稍后会回到那个性感的模型。所以,或者我提到了压缩,对吧?所以在自然语言处理中,他们取得了惊人的成果,而测试这一点的一种方法当然是,你知道,你训练系统,然后你,你知道,看看它在任务上的表现如何。但很多性能测量是通过所谓的“困惑度”来完成的,这本质上与复杂性或压缩长度相同。所以NLP社区开发新系统,然后他们测量压缩长度,然后他们有排名和泄露,因为良好的压缩与系统在手头任务上表现良好之间存在很强的相关性。它不完美,但作为中间目标对他们来说已经足够好了。
所以你的意思是,这是一种衡量标准,这有点像回到了柯尔莫哥洛夫复杂度,所以你是说良好的压缩通常意味着良好的智能,是吗?
那么你提到你是少数敢于大胆尝试将人工通用智能理念形式化,为智能建立数学框架的人之一,就像我们提到的,称之为AIXI。那么让我问一个基本问题:什么是AIXI?
好的,让我先说说它代表什么,因为字母代表的实际上可能是更基本的问题,但第一个问题通常是它如何发音。但我最终把它放在网站上,说明了它的发音,你弄明白了。是的,这个名字来源于AI(人工智能),而XI是希腊字母XI,它用于所罗门诺夫分布,原因相当愚蠢,我不想在这里在镜头前重复。所以它只是或多或少是任意的,我选择了XI,但它也有其他不错的解释。所以在这个模型中,智能体的行动和感知,一个智能体的行动和感知,随着时间的推移,所以这是一个索引IX,索引I,所以这个在时间I的行动,然后接着是时间I的接收。我将就此打住,我省略了第一部分,是的,我只是开玩笑。我有一些解释。所以,大约五年前或十年前的某个时候,我在巴塞罗那的一个大教堂里发现了一些刻在石头上的文字,上面出现了“AIXI”这个词,我非常惊讶和高兴。我查了一下,它是加泰罗尼亚语,它的意思是,根据一些解释,这是正确的做法。是的,尤里卡!哦,所以它几乎就像是命中注定,以某种方式出现,是的,是的,在梦中来到你身边。所以奥西奥拉,有一个中文词“爱惜”,如果能转录这个发音,那么最后一个是AI与归纳法的交叉,因为状态,现在这更深入到内容了。所以传统的AI更多是关于规划和已知数据神秘世界,而归纳法更多是关于通常的黄色区域D数据和推断模型。本质上,这个AIXI所做的就是将这两者结合起来。我最近也听说日语中的“AI”是“爱”的意思,所以如果能将AIXI以某种方式与“爱”结合起来,我想那里可能会有一些有趣的想法。
那么,我们接下来一步,你能否从宏观层面谈谈这个数学框架是什么?是的,它本质上由两部分组成:一部分是学习、归纳和预测部分,另一部分是规划部分。所以我们先来说学习、归纳和预测部分,这部分我之前已经解释过了。那么,任何智能体要想表现良好,它需要能够以某种方式预测会发生什么。我的意思是,如果你不知道你的行动会产生什么影响,你如何决定哪些行动是好是坏呢?所以你需要有一个关于你的行动会影响什么的模型。所以你所做的是,你有一些经验,你像科学家一样建立关于你经验的模型,然后你希望这些模型大致正确,然后你使用这些模型进行预测。模型是……抱歉打断一下,我们的模型是基于你对世界的感知,你的行动将如何影响那个世界。这并不是最重要的部分,但它在技术上很重要。但在现阶段,我们可以只考虑预测,比如说,股票市场数据、天气数据或IQ序列,1、2、3、4、5,接下来是什么?是的,所以当然我们的行动会影响我们正在做的事情,但我稍后会回到这一点。那么,我将继续打断。所以,只是为了在预测和规划之间划清界限,或者说,在这种情况下,你所说的预测是什么意思?它试图在没有你在环境中长期行动的情况下预测环境,什么是预测?
好的,如果你现在想把行动放进去,好的,那么我们现在就放进去。是的,所以问题是,好的,这是最简单的预测形式,就是你只有被动观察到的数据,是的,你想预测会发生什么,而不需要你干预,就像我说的天气预报、股票市场、IQ序列或者任何东西,好的。而基于压缩的所罗门诺夫零交互,你寻找描述你的数据序列的最短程序,然后你运行这个程序,它根据定义重现你的数据序列,然后你让它继续运行,然后它会产生一些预测,你可以严格证明,对于任何预测任务,这本质上是最好的预测器。当然,如果存在不可预测的预测任务,比如你公平的抛硬币,是的,我无法预测下一次公平的抛硬币结果,但所罗门诺夫归纳法会说,好的,下一次正面朝上的概率可能是50%,这是你能做的最好的。所以如果某事是不可预测的,所罗门诺夫也不会神奇地预测它,但如果存在某种模式和可预测性,那么所罗门诺夫归纳法最终会弄清楚,而且不仅仅是最终,而是相当快,你可以证明收敛速度,无论你的数据是什么。所以从某种意义上说,这纯粹是魔法。
有什么诀窍?嗯,诀窍是它不可计算,我们稍后会再谈。你不能仅仅在谷歌的这些资源中实现它,然后运行它,你知道,预测股票市场并致富。我的意思是,如果雷·所罗门诺夫当时还没有写出来,但基本任务是,你知道,你处于环境中,你与环境互动,试图学习环境的模型,而模型存在于所有这些程序的空间中,你的目标是获得一堆简单的程序。那么,我们现在来谈谈行动。但实际上你问得很好,通常我都会跳过这部分。我也有一个小的贡献,就是行动部分,但他们通常会直接跳到决策路径。所以现在让我解释一下行动部分,谢谢你的提问。
所以你现在必须稍微修改一下它,不再只是预测一个自动出现的序列,而是你有一个观察,然后你以某种方式行动,然后你想根据过去的观察和你的行动来预测下一个观察。然后你采取下一个行动,你不在乎预测它,因为你正在做它,然后你得到下一个观察,在你得到它之前你想要更多,你想再次根据你过去的行动和观察序列来预测它,这只是额外地以你的行动为条件。还有一个有趣的替代方案,如果你愿意,你也可以尝试预测你自己的行动。哦,是过去的行动还是未来的行动?你未来的行动?等等,让我总结一下,我想我的大脑坏了。我们也许应该在解释了伊辛模型之后再讨论它,这是一个有趣的变体,但这是一个非常有趣的变体。还有一个快速评论,我不知道你是否想在这里插入,但就观察而言,你正在查看整个,巨大的历史,一个漫长的观察历史。没错,这非常重要,从智能体诞生以来的整个历史。我们可以稍后回到这一点,我也想知道为什么这在这里很重要。通常,你知道,在强化学习中,你有MVP(马尔可夫决策过程),它们限制性更强。
好的,所以现在我们可以根据行动进行预测,即使环境受到影响,但预测并不是我们想做的全部,对吧?我们还想真正在世界中行动,问题是如何选择行动,我们不想贪婪地选择行动,你知道,只是选择下一个时间步中最好的。首先我应该说,你知道,如何衡量性能。我们通过给予智能体奖励来衡量性能,这就是所谓的强化学习框架。所以每个时间步,你可以给它一个正奖励或负奖励,或者甚至没有奖励,这可能非常稀缺,对吧?就像你下国际象棋,在游戏结束时,你给赢家+1,输家-1。所以在AIXI框架中,这完全足够了。所以你偶尔会给一个奖励信号,你要求智能体最大化奖励,但不是贪婪地,你知道,下一个,下一个,因为如果你贪婪,从长远来看那会非常糟糕。但是在智能体的生命周期中,所以我们假设智能体活了M个时间步,也就是说它在大约一百年内精确地死亡,这只是,你知道,最简单的解释模型。所以它会查看未来的奖励总和,并询问我的行动序列,或者更准确地说,我的策略是什么,它在期望中(因为我不知道世界)导致最大的奖励总和。
让我给你一个国际象棋的类比。例如,我们知道如何在理论上最优地玩。这只是一个极小极大策略:我下对我来说最好的棋步,前提是对手下对他来说最好的棋步(所以对我来说最差)。然后假设我再次下最好的棋步,然后你就有这个期望最大值树直到游戏结束,然后你反向传播,然后你得到最好的可能棋步。所以这是诺曼很久以前就为对抗性游戏找出的最优策略。幸运的是,或者说不幸的是,对于理论来说,世界并非总是对抗性的,所以它变得更难了。如果其他人甚至合作,或者自然通常是,我的意思是,无生命的自然是随机的,你知道,事情只是随机发生,或者我不在乎你。所以你现在必须考虑的是噪声,而不一定是现实。所以你会用一个期望值来取代对手方的最小值,这个期望值足够通用,可以包括序列情况。所以现在,你不再是极小极大尝试,而是期望最大策略。到目前为止一切顺利,这是众所周知的,它被称为序贯决策理论。但问题是,你将它建立在哪个概率分布之上?如果我拥有真实的概率分布,比如我玩双陆棋,有骰子,涉及一定的随机性,你知道,我可以计算概率并将其输入到期望最大值或我们提出的特征疾病中,如果我有足够的计算能力,这就是最优决策。但在现实世界中,我们不知道,你知道,你开车在我前面刹车的概率是多少,我不知道,你知道,所以这取决于各种各样的事情,特别是新的情况,我不知道。所以这就是关于预测的未知事物,这就是所罗门诺夫发挥作用的地方。所以你在序贯决策理论中所做的是,你用这个通用分布替换我们不知道的真实分布,我没有明确谈论它,但它用于通用预测,并将其插入到序贯决策树机制中,然后你就能两全其美。你有一个长期规划的智能体,但它不需要了解世界上的任何事情,因为有很多归纳部分会学习。
你能明确地尝试描述一下通用分布以及归纳法在这里扮演的角色吗?是的,我正在努力理解。那么它做了什么呢?在最简单的情况下,我说取描述你数据的最短程序,运行它,得到一个确定性的预测,是的,好的。但你不应该只取最短的程序,还要考虑更长的程序,但要保持较低的先验概率。所以在贝叶斯框架中,你先验地认为任何作为模型或随机程序的分布都具有一定的先验概率,即2的负次方,以及Y的负长度次方,你知道,我可以解释这个程序的长度,所以较长的程序会受到惩罚,是的,先验地。然后你乘以所谓的似然函数,是的,顾名思义,它表示给定手头数据,这个模型有多大可能性是真的。所以如果你有一个非常错误的模型,那么这个模型是真的可能性就很小,所以它是一个非常小的数字,所以即使模型很简单,它也会因此受到惩罚。你所做的就是取一些词,这是它的平均值,这给了你一个概率分布。所以,通过现象分布的通用分布,它由程序的简单性和似然性加权,是的,这是一种不错的想法,是的。
那么,好的,然后你说你正在玩N或M,或者忘记了字母,向未来迈进,那么这个问题有多难?涉及到什么?好的,所以这是一个定制问题,我们做什么?是的,所以你有一个规划问题,直到M的视野,这在M的视野中是指数时间,我的意思是,它是可计算的,但实际上是难以处理的。我的意思是,即使对于国际象棋来说,精确地做到这一点也已经难以处理了,而且,你知道,它也可能被折现。
一种框架,或者是的,所以,所以有一个心在升起,你知道,在数字年里,这只是为了讨论模型的简单性,而且有时数学很简单,但实际上有很多相当有趣的变体,参数是它的,它没有什么真正有问题的地方,但它非常有趣,所以,例如,你认为不,让我们,让我们,让我们让参数 M 趋向于无穷大,对吧?你想要一个永远活着的代理人,好吧?如果你这样做,你会遇到两个问题,首先,数学会崩溃,因为你有一个无限的奖励,这可能会给出无穷大,而在时间步长中获得 0.1 的奖励是无穷大,而每次服务都得到无穷大,所以同样好,不是我们想要的,另一个问题是,如果你有无限的生命,你可以懒惰任意长的时间,比如十年,然后追赶相同的预期奖励,你知道,想想你自己,或者,或者也许你知道一些朋友,如果他们知道他们永远活着,你知道,为什么现在努力工作,你知道,只是享受你的生活,你知道,然后稍后追赶,所以这是无限地平线的另一个问题,你提到了,是的,我们可以进行折扣,但然后标准的折扣被称为几何折扣,所以今天的 1 美元大约值,你知道,明天 1.05 美元,所以如果你这样做,所谓的几何折扣,你就引入了一个有效地平线,所以代理人现在被激励要有效地拥有一定的时间,这是一个移动的地平线,对于任何固定的有效地平线,都有一个需要解决的问题,它需要更长地平线,所以如果我向前看,你知道,五个时间步长,我是一个糟糕的国际象棋玩家,我需要看得更远,如果我玩围棋,我可能需要看得更远,所以对于每个问题,对于无限的地平线,都有一个问题,这个地平线无法解决,是的,但我引入了所谓的近谐波地平线,它下降到 1 或 T,而不是指数级的 T,它产生了一个代理人,它有效地根据其年龄来展望未来,所以如果它五岁,它计划五年,如果它一百岁,它计划一百年,有趣,而且有点像人类,对吧?我的孩子们不会计划很长时间,但然后我们得到那个玩偶,我看得更长,也许当我们非常老的时候,我的意思是,我们知道我们不会永远活着,你可能然后地平线又缩小了,所以只是调整地平线,这有什么数学上的好处吗?或者只是一个好的,我的意思是,直观上,经验上,将地平线推回以扩展地平线,因为你体验到更多世界,这可能是一个好主意,但这里有一些有益的数学结论吗?洛曼先生谈论的预测可能具有极其强大的有限时间但无有限数据结果,所以你已经看到了如此多的数据,然后你失去了如此多的数据,所以,所以 DT R 确实很棒,有了 AIXI 模型,有了规划部分,许多结果只是渐近的,嗯,这就是渐近的含义,你可以证明,例如,在长远来看,如果代理人,你知道,足够长地学习,那么,你知道,它的表现是最佳的,或者发生了一些不错的事情,但你不知道它收敛的速度有多快,所以它可能收敛得很快,但我们只是无法证明它,因为它很困难,所以那确实是缓慢的,所以,所以这就是渐近的含义,最终,但我们不知道速度有多快,如果我给代理人一个固定的地平线 M,那么我无法证明渐近结果,所以,我的意思是,人们在一百年后死去,然后一百年过去了,无法说最终,所以这是折扣的优势,我可以证明一些主题结果,所以只是为了澄清,所以,所以我,好的,我建立了一个模型,嗯,现在我有一个方法可以看好几步,我该如何选择我要采取的行动?这就像玩国际象棋一样,你这样做 minimax,在这种情况下,你根据概率分布进行期望最大化,你反向传播,然后,嗯,行动出现了,最大化概率分布上未来预期奖励的行动,然后你就采取这个行动,然后重复,直到你得到一个新的观察结果,然后你将其输入这个优秀的观察结果,然后你重复,然后奖励,依此类推,所以你是一个行,是的,然后你甚至可以预测自己的行动,然而,这个想法,但是,好的,这个宏大的框架,它是什么?这是一个,我的意思是,这是一个美丽的数学框架,用来思考通用人工智能,它有什么帮助?你对如何构建这样的系统有什么看法?或者也许从另一个角度来看,它对我们理解 AGI 有什么帮助?当我开始在这个领域时,我总是对两件事感兴趣,一是,你知道,AGI,名字不存在,1月24日,我是强人工智能和物理学,他过一切,所以我经常在计算机科学和物理学之间来回切换,你说了万物理论,万物理论,就像,它基本上是人类所有问题的弦论口味问题,我可以解释,如果你想在稍后某个时间,你知道,为什么我对这两个问题感兴趣,内斯托尔和一点点小题外话,如果,如果有人要解决,如果有人要解决,如果一个苹果掉在你头上,有一个绝妙的见解,你可以得出其中一个的解决方案,是 AGI 还是万物理论?绝对是 AGI,因为一旦 AGI 问题解决,他们就可以让 AGI 为我解决其他问题,嗯,绝妙,好的,所以,所以正如你所说,关于它,好的,所以,原因是我没有安定下来,我的意思是,这个想法,你知道,一旦我们解决了 HDI,它就解决了所有其他问题,不仅仅是 HDI,所有其他问题,所有各种更有用的问题,对人类来说,这非常吸引人,很多人,你知道,我也认为我对人工智能领域的现状感到非常失望,有一些理论,你知道,关于逻辑推理,但我从来没有相信这会成功,然后有这个霍默,更全面的方法,神经网络,我不喜欢这些启发式方法,所以,而且我自己也没有什么好主意,所以这就是我来回切换的原因,甚至在一家开发软件的公司工作了四年半,完全不相关的事情,然后我有了关于 AIXI 模型的主意,所以它给了你什么?它给了你一个黄金标准,所以我已经证明了这是任何人都可以构建的最智能的代理人,用引号括起来,因为这只是数学,你需要无限的计算能力,但这是极限,而且这是完全指定的,它不仅仅是一个框架,而且,你知道,每年都有几十个框架被开发出来,它们只有骨架,然后缺少一些部分,通常这些缺失的部分,你知道,最终会非常非常困难,所以这是完全且独特定义的,我们可以对其进行数学分析,我们也开发了一些近似值,我稍后可以谈谈,这将打破自上而下的方法,比如诺曼的 minimax 理论,这是游戏的理论最优玩法,现在我们需要近似它,放入启发式方法,修剪树等等,所以我们也可以用 AIXI 来做,但对于通用人工智能来说,它也可以启发这些,而且大多数研究人员都是自下而上的,他们有系统,试图使其更通用,更智能,它可以启发方向,你的意思是,所以如果你有一些选择要做,那么他们应该如何评估我的系统?如果我无法进行交叉验证,我应该如何学习?如果我的标准正则化效果不好,你知道,所以答案总是这样,我们有一个系统,它做所有事情,实际上,它只是,你知道,完成象牙塔,从实际角度来看完全没用,但你可以看看它,然后说,哦,是的,也许,你知道,我可以采取一些方面,你知道,而不是科尔莫戈罗夫复杂性,而是采用迄今为止开发的某些压缩器,而对于规划,我们在这里使用了它,它也被用于围棋,它至少启发了我很多,有了这个正式定义,如果你看看其他领域,你知道,我总是回到物理学,因为我有一个物理学背景,想想能量的现象,长期以来是一个神秘的概念,在某个时候它被完全形式化了,这真的很有帮助,你可以指出很多这些东西,它们最初是神秘的,然后它们被严格形式化了,速度和加速度被混淆了,直到它被正式定义,这里有一段时间是这样的,人们,你知道,经常,你知道,没有背景,你知道,仍然感到困惑,所以,这是一个模型,或者说是智能定义,它是与之相对应的,我们稍后会回到它,它独特而严格地形式化了智能的概念,所以,所以它充当了隧道尽头的灯光,所以之前,是的,所以,我的意思是,有数百万个问题我可以问,所以也许,好的,让我们在黑暗中摸索一下,所以,深层思维在这里,但总的来说,有很多突破性的想法,就像我们一直在说的,关于强化学习,那么你如何看待强化学习的进展?它占据了当前哪个子集?就像你说的,也许马尔可夫假设在强化学习中经常做出,在强化学习中还有其他假设,以使系统正常工作,你看到了强化学习和 AIXI 之间的区别和联系是什么?所以主要的区别是,本质上,所有其他方法都做出了更强的假设,所以在强化学习中,马尔可夫假设是,下一个状态或下一个观察结果仅取决于,嗯,前一个观察结果,而不是整个历史,这当然使数学更容易,而不是处理历史,他们也从中获利,因为然后你有在当前计算机上运行的算法,并做一些实际有用的事情,但对于通用人工智能来说,所有其他方法所做的假设,我们现在已经知道,它们是有限制的,所以,例如,通常你需要一个 MDP 框架中的数字假设,才能学习它,这个 T 本质上意味着你可以从错误中恢复,而且环境中没有陷阱,如果你做出这个假设,那么本质上,它可以,你知道,回到以前的状态,在那里呆几次,然后学习统计数据和状态是什么样的,然后在长远来看,在这个状态下表现良好,但没有根本问题,但在现实生活中,我们知道,你知道,可能有一个单一的行动,你知道,一秒钟的注意力不集中,在开车时,你知道,可能会毁了我的余生,我可能会变成四肢瘫痪,或者别的什么,所以,而且没有恢复了,所以现实世界不是 err gorica,我总是说,你知道,有陷阱,也有我们无法恢复的情况,很少有理论是为这种情况开发的,关于 AIXI 的背景下,你看到了探索的作用是什么?你提到,你知道,在现实世界中,当我们做出错误的决定时,我们会陷入麻烦,并且要付出代价,但探索似乎对学习这个世界,获得新知识至关重要,所以,它是,它是内置的吗?这是另一种问法,AIXI 的参数是什么?它可以被控制吗?是的,我说,好处是,没有参数可以控制,有些人会跟踪旋钮来控制,你可以做到,我的意思是,你可以修改 AIXI,这样你就可以玩一些旋钮,如果你想的话,但是探索是直接内置的,这来自于贝叶斯学习和长期规划,这两者一起已经意味着探索,你可以很好地明确地证明,对于简单的像所谓的带状问题,你说给一个现实世界的例子,比如你有两种医疗治疗 A 和 B,你不知道它们的有效性,你尝试 A 一点点,B 一点点,但你不想伤害太多病人,所以你必须权衡探索,在某个时候你想探索,你可以做数学,找出最优策略,它花了贝叶斯代理人,也非贝叶斯代理人,但它表明,这个贝叶斯框架,通过对可能的世界进行先验,进行贝叶斯混合,然后进行贝叶斯最优决策,并进行长期规划,这很重要,自动意味着探索,也以适当的程度,不过度探索,也不过少探索,在这些非常简单的设置中,在 AIXI 模型中,也能够证明它是一个自优化定理,或者渐近最优性定理,或者后来只有渐近的,而不是有限时间界限,似乎长期规划非常重要,但规划的长期部分非常重要,是的,而且,我的意思是,也许快速题外话,你认为移除马尔可夫假设并查看整个历史有多重要?所以直观地说,当然很重要,问题是是否有办法以更全面且仍然足够好的方式来处理它?我必须想出一个例子,然后飞翔,但是,你知道,你生命中有一些关键事件,你知道,很久以前,你知道,在某个城市或什么地方,你意识到,那是一条非常危险的街道,或者别的什么,你希望永远记住它,以防你回来,那种选择性的记忆,你记得过去所有重要的事件,但不知何故,选择重要性,这很难,我并不担心,你知道,只是存储整个历史,你就可以计算,你知道,人类的生命,你是 100 岁,没关系,通过视觉系统和听觉系统输入多少数据,你稍微压缩一下,在这种情况下,它很愚蠢,然后存储它,我们很快就能存储它,但你仍然需要规划部分的选择和理解部分的压缩,原始存储我真的不担心,我认为我们应该只是存储,如果你开发一个代理人,最好只是存储所有交互历史,然后你当然会建立模型,然后你压缩它,你是有选择性的,但偶尔你会回到旧数据,并根据你的新经验重新分析它,你知道,有时你在学校学习所有这些东西,你认为它完全没用,你知道,很久以后你才意识到,不,你知道,它看起来就像你认为的那样,我正在看线性代数,所以也许,让我问一下目标函数,因为奖励,它似乎是一个重要部分,奖励是给系统的,对很多人来说,目标函数的规范是智能的关键部分,代理人自己弄清楚什么重要,你对此有什么看法?在 AIXI 框架内,是否有可能自己发现你应该基于什么来操作的奖励?那将是一个漫长的回答,而且这是一个非常有趣的问题,我问了很多关于这个问题的答案,奖励从哪里来,这取决于,是的,所以,在那里,我现在给你几个答案,所以,如果你想构建代理人,现在,让我们从简单的开始,所以,让我们假设我们想构建一个基于 AIXI 模型执行特定任务的代理人,让我们从一个超级简单的开始,比如,我的意思是,超级简单,比如玩国际象棋或围棋,或者别的什么,那么你只需要,你知道,奖励是,你知道,赢得比赛是加一,输掉比赛是减一,完成,你应用这个代理人,如果你有足够的计算能力,你让它自己玩,它将学习游戏规则,一段时间后将完美地玩国际象棋,问题解决了,好的,如果你有更复杂的问题,那么你可能相信你有正确的奖励,但它不是那么,一个可爱的例子是电梯控制,这也是理查德·萨顿的一本很棒的书,你控制电梯,你认为,嗯,也许奖励应该与人们在电梯前等待的时间挂钩,你知道,长时间等待不好,你把它编程进去,然后你这样做,结果是电梯急切地接载所有人,但从不放下他们,也许电梯里的时间也算,所以你最小化总和,是的,是的,电梯就是这样做的,但从不接载顶楼第十排的人,因为预期不值得,让他们留下来,所以,即使在看似简单的问题中,你也会犯错误,你知道,这就是在严肃的背景下,比如 AGI 安全研究人员所考虑的,现在,让我们回到通用代理人,假设你想构建一个对人类普遍有用的代理人,是的,我们这里有一个家用机器人,它应该做各种任务,在这种情况下,人类应该即时给出奖励,我的意思是,也许它在工厂里预先训练过,那里有一些内部奖励,比如,你知道,电池电量或者别的,但是,你知道,它,它把盘子洗得很糟糕,你知道,你惩罚机器人,你表扬机器人,然后训练它做一项新任务,你知道,像孩子一样,对吧?所以,你需要人类参与,如果你想要一个对人类有用的系统,只要这个代理人保持在人类水平,它应该能很好地工作,除了,你知道,这些例子,它变得很关键,如果它们变得,你知道,在人类水平上,它是,这些孩子,小孩子,你有理由很好地控制他们,他们长大了,奖励技术就不那么有效了,所以,最后,这将是代理人,你可以,抱歉,人类的奴隶,所以,如果你更雄心勃勃,只是说我们想构建一个新物种的智能生物,我们将它们放在一个新的星球上,我们希望它们开发这个星球,或者别的什么,我们不给它们任何奖励,那么我们可以做什么?你可以尝试,你知道,想出一些奖励函数,比如,你知道,它应该自我维持,机器人,它应该也许繁殖,建造更多的机器人,对吧?你知道,也许是为了所有你觉得有用的事情,但这很难,你知道,你知道自我维持意味着什么?你知道,建造一个副本意味着什么?应该是精确的副本,近似的副本,所以这真的很难,但是 LaVon,或者,DeepMind 也开发了一个美丽的模型,它只是采用了 AIXI 模型,并将奖励与信息增益联系起来,所以他说奖励与代理人对世界的了解程度成正比,我们可以严格地、正式地、唯一地定义它,就我们而言,所以,如果你把它放进去,你会得到一个完全自主的代理人,实际上,有趣的是,对于这个代理人,我们可以证明比通用代理人更强的结果,这也很不错,如果你让这个代理人自由,它将在某种意义上成为最优科学家,它绝对渴望了解世界,当然,它也会有很多工具性目标,为了学习,它至少需要生存,一个死去的代理人对任何事情都没有好处,所以它需要自我保护,如果它建造了小的无助的,获取更多信息,它会这样做的,是的,如果空间探索,或者别的什么,是必要的,为了收集信息和发展它,所以它有很多工具性目标,遵循这些信息增益,这个代理人是完全自主的,不需要我们再给奖励了,当然,你可以定义奖励,信息概念,它卡在了你之前提到的那个图书馆里,那里有大量的书籍,第一个代理人遇到了这个问题,它会卡在一个旧电视屏幕前,上面只写着白噪声,我知道,但是第二个版本至少可以处理随机性,是的,关于好奇心,这种词,好奇心,创造力,这是那种奖励函数,就是为了获得新信息,这是否类似于在奖励函数中注入探索的想法,你觉得这有什么吸引力吗?我认为这是一个很好的定义,好奇心是奖励,好奇心是探索本身,我会接受,但大多数好奇心,你知道,在人类身上,尤其是在孩子身上,不仅仅是为了它本身,而是为了实际学习环境和行为,所以,我想大多数好奇心最终都与表现更好有关,好吧,所以,如果智能系统需要有这个展示功能,让我,你是一个智能系统,目前有效地通过了图灵测试,我们人类智能存在的奖励函数是什么?马库斯·亨特正在运作的奖励函数是什么?关于第一个问题,生物奖励函数是生存和传播,很少有人能够克服这种生物奖励函数,但我们生活在一个非常美好的世界里,我们有很多空闲时间,仍然可以生存和传播,所以我们可以发展任意的其他兴趣,这非常有趣,在此之上,但是,这种生存和传播,我会说,是人类的目标或奖励函数,核心的那个,我喜欢你如何避免回答第二个问题,一个好的智能会这样做,我的意思是,我自己的生活意义和奖励函数,我的生活意义和奖励函数是找到一个 AGI,把它建好,说得太好了,让我们进一步剖析 AIXI,其中一个假设是,无穷大无处不在,你对有界理性有什么看法?以及我们存在和智能系统的本质是,我们都在约束下运作,在,你知道,有限的时间,有限的资源下,你如何看待 AIXI 框架,在试图创造一个在这些约束下运作的 AGI 系统?这是对 AIXI 的批评之一,它完全忽略了计算,有些人认为智能本质上与有界资源有关,你对此有什么看法?我认为这是,你认为资源的界限对智能至关重要吗?我会说,一个忽略计算限制的智能概念非常有益,一个包含这些资源的良好智能概念会更有益,但我们还没有,看看计算机科学以外的其他领域,计算方面从未起过根本作用,你开发细胞的生物模型,物理学中的某些理论,它们的计算越来越疯狂和困难,最终,当然,我们需要用这个模型做些什么,但这更多的是一种烦恼,而不是一种特征,我有时想,如果人工智能不是在计算机科学系,而是在哲学系,那么这种计算焦点可能会大大减少,我的意思是,想想归纳问题,它更多地在哲学系,真的没有论文关心,你知道,计算答案需要多长时间,这完全是次要的,当然,一旦我们解决了第一个问题,智能没有计算资源,那么下一个,非常好的问题是,我们能否通过包含计算资源来改进它,但到目前为止,没有人能够以半满意的方式做到这一点,我喜欢这一点,长远来看,属于哲学系的正确部门,这是一个非常深刻的想法,或者至少思考大局的哲学问题,大局问题,即使在计算机科学系,但你提到了近似值,所以有很多无穷大,很多巨大的资源需要,AIXI 是否有有用的近似值?你还没有开发出一些近似值,我们在这里所做的是,归纳法的求和部分,你知道,找到描述你数据的最短程序,我们只是用标准的数据压缩器替换它,压缩器越好,你知道,这部分就会越好,我们专注于一个称为上下文树加权(context tree weighting)的特定压缩器,它非常棒,有很多已知的,美丽的理论性质,在实践中也相当不错,所以我们用它来近似学习和预测部分中的归纳,从规划部分,我们基本上只是借鉴了 2006 年计算机围棋的思路,我是 Java Tsipras Perry,现在也在 DeepMind,他们开发了所谓的 UCT 算法,蒙特卡洛树搜索的上限置信度算法,他们通过采样来近似规划部分,并且在一些小型玩具问题上取得了成功,我们不想失去通用性,好吧,这就是障碍,如果你想通用,你必须放弃一些东西,但是类似的代理人能够玩,你知道,小型游戏,比如扑克和 tic-tac-toe,甚至吃豆人,在同一个架构下,没有改变,代理人真的不知道游戏规则,什么都不知道,通过自己或与玩家一起,在这些环境中,所以你的格雷纳德机器(Gerdl machines)提出了一些东西,这是一个自我改进的程序,它会重写自己的代码,嗯,从数学上讲,哲学上讲,你熟悉它吗?你熟悉它,你还在他的实验室里开发的,所以,格德尔机简单解释一下,你给它一个任务,它可以是一个简单的任务,比如,你知道,找到数字的素数因子,你可以正式写下来,有一个非常慢的算法可以做到这一点,只是尝试所有因子,或者玩国际象棋,最优地,你写下算法,直到游戏结束,所以你写下格德尔机应该做什么,然后它会花费一部分资源来运行这个程序,另一部分资源来改进这个程序,当它找到一个改进的版本,并且可以证明它得到了相同的结果时,这就是关键部分,它需要自己证明,这个程序的变化仍然满足原始规范,如果它做到了,那么它就用改进的程序替换原始程序,根据定义,它做了同样的工作,只是更快,然后,你知道,它一遍又一遍地证明,并且它是以一种方式开发的,格德尔机的所有部分都可以自我改进,但它仍然可以被证明与原始规范一致,所以从这个角度来看,它与 AIXI 无关,但如果你现在将 AIXI 作为起始公理放入,它将运行 AIXI,但这需要永远,然后如果它找到了 AIXI 的可证明的加速,它就会用这个,这个,这个替换它,也许最终它会得出一个模型,仍然像 C 模型,它不能,我的意思是,只是对于有知识的读者来说,AIXI 是可计算的,并且可以证明,因此,不可能有一个可计算的精确算法,计算机需要一些近似值,而格德尔机没有处理这个问题,所以你必须做些什么,但那是 AIXI 模型,它是有限可计算的,我们可以放入,AIXI 的一部分是不可计算的,索洛莫诺夫归纳部分,交互,所以,但是有方法可以获得 AIXI 模型的可计算近似值,那么它至少是可计算的,它仍然远远超出任何人将拥有的任何资源,但是然后格德尔机可以进一步改进它,以精确的方式,所以,理论上,格德尔机过程可以改进,它不是,或者说,它不是已经最优的吗?它在它交互周期的奖励收集方面是最优的,但它需要无限的时间来产生一个动作,而世界,你知道,继续,无论你是否愿意,所以模型假设有一个神谕,你知道,解决了这个问题,然后在接下来的 100 毫秒或反应时间内,你需要它给出答案,然后 AIXI 是最优的,所以它在数据效率和学习效率方面是最优的,但不是在计算时间方面,然后是格德尔机,理论上,但可能无法证明,可以使其更快,是的,好的,有趣,这两个组成部分非常有趣,完美的智能与可证明的自我改进相结合,你总是得到正确答案,并且你正在改进,美丽的想法,所以,你也提到,在追求解决奖励的过程中,各种各样的事情,有趣的,人类的事情可能会出现,所以,意识在 AIXI 中有地方吗?在哪里,也许你可以评论一下,因为我猜我们人类只是 AIXI 代理人的另一种实例化,而我们似乎有意识,你说人类是 AIXI 代理人的实例化,那将是惊人的,但我认为那是给最聪明、最理性的三个人,我认为也许我们是非常粗糙的近似,有趣,我的意思是,我倾向于相信,再次,我是俄罗斯人,所以我倾向于相信我们的缺点是最佳的一部分,我们倾向于嘲笑和批评我们的缺点,我倾向于认为,这实际上接近最佳行为,但一些缺点,如果你仔细想想,实际上不是缺点,但我认为仍然有足够的缺点,我不知道,这不清楚,作为一个历史学家,我认为我们作为一个文明所遭受的所有痛苦,有可能那是我们需要的最佳痛苦量,以最小化长期的痛苦,那是你的俄罗斯背景,那是俄罗斯的天气,人类是或不是 AI 代理人的实例化,你认为意识是可以在 AIXI 这样的正式框架中出现的吗?我也问你一个问题,你认为我有意识吗?这是一个好问题,你,那个领带让我很困惑,但我认为你认为它让我无意识,因为它扼杀了我的生命,如果一个代理人解决了图灵提出的模仿游戏,我认为他们会像你一样穿着,因为有一种,有一种浮夸的、有趣的复杂行为模式,表明你是人类,你是谨慎的,但你为什么问?是的,总是知道,是的,我认为你有意识,是的,所以,你解释了,嗯,以某种方式,为什么,但你从我的行为中推断出来,是的,你永远无法确定,我认为任何智能系统都会发生同样的事情,如果它的行为足够接近人类,或者也许不是人类,我的意思是,你知道,也许狗有时也有一点自我意识,对吧?所以,如果它的行为方式让我们通常归因于意识,我们就会真正地将意识赋予这些智能系统,你知道,并且,尤其重要的是,当然,这并没有回答它是否真的有意识的问题,而这是,你知道,意识的巨大难题,也许我是一个僵尸,不是电影里的僵尸,而是哲学上的僵尸,从 AGI 的角度来看,意识的展示足够接近意识,意识的难题并不重要,我认为我们不必担心意识问题,尤其是对于开发 AGI 的难题,我认为,你知道,我们进步了,在某个时候,我们解决了所有技术问题,这个系统将表现出智能,然后超级智能,然后意识就会出现,我的意思是,它肯定会表现出我们认为是意识的行为,然后这是一个哲学问题,这种意识真的出现了,还是一个只是,你知道,伪装一切的僵尸,我们仍然需要弄清楚,尽管它可能很有趣,至少从哲学的角度来看,它非常有趣,但它也可能在实践中很有趣,你知道,有些人说,你知道,如果它只是伪装意识和感情,你知道,那么我们不必担心,你知道,权利,但如果它真的有意识并且有感情,那么我们就需要担心,我迫不及待地想让 AI 系统展现意识的那一天,因为那将真正带来一些最艰难的伦理问题,我们在这方面做得如何?构建人们认为是意识的系统相对容易,我给你一个类比,我的意思是,你还记得,也许在你出生之前,电子宠物,是的,你怎么敢,你还年轻,是的,太好了,非常感谢,但我当时也在,所以你有没有那些有趣的东西,但你听说过这个电子宠物,它,你知道,真的,真的很原始,实际上,对于那个时代来说,你知道,你可以比赛,你知道,这个,这个,这个,孩子们非常喜欢它,你知道,不想让它死,并且可能会,如果我们问,你知道,孩子们,你认为这个电子宠物有意识吗?他们会说,是的,是的,我,是的,这是一种美丽的东西,实际上,因为那种意识,归因意识似乎创造了更深的联系,这是一个强大的东西,但我们必须在道德方面小心,让我问一下 AGI 社区,你代表着 AGI 最严肃的工作,至少是早期,而 DeepMind 代表着当今 AGI 的严肃工作,但为什么在你看来,AGI 社区如此之小,或者一直如此之小,直到 DeepMind 出现?为什么不是更多人从正式的角度认真地研究人类水平和超人类水平的智能?从正式的角度来看,所以,你知道,还有一个额外的观点,所以,我认为有几个原因,我的意思是,AI 是分波出现的,你知道,我们的兴趣,我们的夏天,然后有很大的承诺没有实现,人们感到失望,而狭义 AI,特别是那些似乎需要智能的问题,总是一定程度上成功的,并且有改进,小步骤,如果你构建了一些对社会有用或工业上有用的东西,那么就有大量的资金,所以我猜不是金钱驱动人们开发特定的系统来解决特定的任务,但你会认为,你知道,至少在大学里,你应该能够做象牙塔研究,而且这可能在很久以前就更好了,但即使现在,也有相当大的压力去做应用研究或转化研究,你知道,获得理论家资助更难,所以这也把人们推开了,也许攻击通用智能问题也更难,所以,我认为足够多的人,我的意思是,也许少数人,仍然对形式化智能和思考通用智能感兴趣,但是,你知道,没有多少东西出现,或者没有多少伟大的东西出现,所以你认为我们谈论了正式的,隧道尽头的灯光,但从工程角度来看,你认为构建 AGI 系统需要什么?它是,我不知道这是否是一个愚蠢的问题,还是一个与我们一直在谈论的 AIXI 的问题不同?你认为有哪些步骤是必要的,才能开始尝试构建?所以你想得到一个蓝图,然后你去执行它,这就是这次谈话的全部意义,现在把它塞进去,有没有,你的直觉是什么?是在机器人领域,还是拥有身体并试图探索世界的领域?是在强化学习领域,比如 Alpha Zero 和 Alpha Star 的努力,它们在模拟中,在游戏世界中探索如何解决它,他们的东西,以及 Transformer 在自然语言处理中的工作,所以,也许攻击开放域对话,比如,你认为有希望的途径在哪里?让我选择具身化吧,所以具身化很重要,是的,也不,我不相信我们需要物理机器人行走或滚动,与现实世界互动才能实现 AGI,我认为这更多的是一种干扰,而不是帮助,这有点混淆了身体和心灵,对于工业应用或近期应用,当然,我们需要机器人技术,用于各种事情,但对于解决大问题,至少在这个阶段,我认为它不是必需的,但答案也是肯定的,我认为最有希望的方法是,你有一个代理人,你知道,它可以是一个虚拟代理人,你知道,在计算机中与环境互动,可能在 3D 模拟环境中,就像许多电脑游戏一样,然后你训练和学习代理人,即使你无意以后把它放入,你知道,这个算法放入机器人大脑,并永远留在虚拟现实中,获得经验,在,也可能,我说可能,很重要,去理解事物,就像人类一样,尤其如果代理人,主要如果代理人需要与人类互动,你知道,如果你谈论物体堆叠在空间中,飞行和汽车等等,而代理人甚至没有虚拟 3D 世界的经验,可能很难理解,所以,如果你开发一个抽象的代理人,比如我们走数学路径,我们只想构建一个能够证明定理并成为更好的模仿者的代理人,那么这个代理人需要能够在非常抽象的空间中进行推理,然后也许,把它放入 3D 环境模拟,甚至是有害的,它应该,你知道,把它放入,我不知道,一个它自己创造的环境,或者,所以,你似乎有一段有趣、丰富、复杂的生命轨迹,在你的思想旅程中,所以,问问什么书,技术小说,哲学书籍,人们的想法,产生了变革性的影响,很有趣,书籍最有趣,因为也许人们也可以阅读这些书籍,看看他们是否能受到启发,你很幸运地问了书籍,而不是一本书,这非常难,我试图确定一本书,然后我可以在最后做到,对我来说,最具变革性的书籍,或者我最能推荐给对 AI 感兴趣的人,也许吧,我总是从 Russell 和 Norvig 的《人工智能:一种现代方法》开始,这是 AI 的圣经,这是一本很棒的书,它非常广泛,它涵盖了,你知道,所有的人工智能方法,即使你专注于一种方法,我认为你也应该了解其他方法,所以,这应该是你的第一本书,第四版很快就会出来了,有趣的,有一个深度学习章节,现在,它一定是由 Ian Goodfellow 写的,然后我推荐的下一本书是 Certain 和 Partoh 的强化学习书籍,这是一本很棒的书,如果这本书有什么问题,它会让 RL 感觉比实际更容易,这是一本非常温和的书,读起来很舒服,练习,你可以很快,你知道,让一些 RL 系统运行,你知道,在非常小的玩具问题上,但它很有趣,而且你在几天内就能感觉到,你知道,你知道 RL 是关于什么的,但它比书中的内容要难得多,来吧,这是一本很棒的书,是的,这些想法,是的,也许,我的意思是,有很多书,如果你喜欢信息论方法,那么有 Alene Batani 的 Kolmogorv 复杂性,但可能,你知道,一些短篇文章就足够了,你不需要读一整本书,但这是一本很棒的书,如果你必须提到一本最喜欢的书,那么,风味不同,这是一本在几个国家的国际预科文凭高中生中使用的书,是 Nicolas Alchun 的《认识论》第二版或第一版,至少是第三版,他们删除了所有有趣的东西,所以,这提出了所有有趣的问题,或者对我来说,关于我们如何从所有角度获取知识,从数学,从艺术,从物理学,并问我们如何知道任何事情,这本书叫做《认识论》,它几乎是对我们如何从任何事物中获取知识的哲学探索,是的,我的意思是,宗教能告诉我们,你知道,关于世界的一些事情吗?科学能告诉我们一些关于世界的事情吗?数学能做到吗?所以,它只是在玩符号,开放式问题,而且,我的意思是,它是为高中生准备的,所以有来自《银河系漫游指南》和《星球大战》以及鸡过马路的资源,而且,它很有趣,但也很深刻,如果你能重活一天,让你真正快乐,或者就像我们说的,关于书籍,它真正具有变革性,你会选择哪一天?有什么事情突然出现在你的脑海里吗?它不需要是过去的一天,可以是未来的吗?嗯,时空是一种涌现现象,所以它们都一样,好的,好的,从过去,你真的很擅长保存,从未来,我喜欢它,不,我也会告诉你,从未来,从过去,我会说,当我发现 Maxim Allah 时,我的意思是,它不是一天,但它是一个时刻,我意识到 Kolmogorv 复杂性,甚至不知道它的存在,但我自己重新发现了这种压缩的想法,但立即我知道我不能是第一个,但我有了这个想法,然后我了解了顺序决策,我知道如果我把它们放在一起,这就是正确的事情,是的,我仍然,当我回想起这个时刻时,我感到非常兴奋,那个时刻有什么更多的细节和背景吗?有没有一个苹果掉在你头上?所以,就像你看 En Goodfellow 谈论 GANs 时,有啤酒参与,有什么更多的背景来激发你的想法吗?它只是,不,它更平凡,所以我在这家公司工作,所以这四年半并没有完全浪费,我从事图像插值问题,我开发了一种相当不错的新插值技术,它们获得了专利,然后我,你知道,这很常见,我有点过度了,我想,嗯,这很不错,但它不是最好的,那么最好的插值方法是什么?然后我想,是的,你想要最简单的图片,如果你交叉训练,它会恢复你的原始图片,然后我,你知道,从数量上更深入地思考了简单性的概念,然后一切都发展了,不知何故,爱上了物理学家的混合,思考大局,最终导致了一个好主意的结局,所以,作为一个物理学家,我可能被训练成不总是从计算的角度思考,你知道,只是忽略它,然后思考其他两个,你想要拥有的基本属性,那么,如果你有一天真的能做到,未来所有的日子,那会是什么?当我解决了 AGI 问题,并将其付诸实践时,所以,理论上我已经解决了它,我已经看到了,这已经吸引了我,然后问第一个问题,生命的意义是什么?我认为没有更好的方式来结束它,非常感谢你的谈话,终于见到你真是太荣幸了,是的,谢谢你,对我来说也是一种荣幸,感谢你收听 Marcus Hunter 的谈话,感谢我们的赞助商 Cash App,下载你只是冷腿播客,你将获得 10 美元,10 美元将捐给 First,一个激励和教育年轻人的组织,让他们成为明天的科学和技术创新者,如果你喜欢这个播客,请在 YouTube 上订阅,在 Apple Podcasts 上给它五星好评,在 Patreon 上支持它,或者只是在 Twitter 上与我联系,Lex Friedman,现在,让我用阿尔伯特·爱因斯坦的一句话来结束,智能的衡量标准是改变的能力,感谢收听,希望下次再见。