📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Yann LeCun: Deep Learning, ConvNets, and Self-Supervised Learning | Lex Fridman Podcast #36

Lex Fridman1:15:58

Transcription

以下是与 Yann LeCun 的对话。他被认为是深度学习的奠基人之一,如果你一直与世隔绝,那么深度学习就是最近人工智能领域的革命,它以机器从数据中学习的可能性吸引了全世界。他是纽约大学的教授,Facebook & Co 的副总裁兼首席人工智能科学家,因其在深度学习方面的工作而获得图灵奖。他可能最出名的是卷积神经网络的创始人,特别是它们在光学字符识别和著名的 MNIST 数据集中的应用。他也是一个直言不讳的人,敢于用独特的法国口音表达自己的想法,并在严谨的学术研究和相对不那么严谨的 Twitter 和 Facebook 媒体上探索挑衅性的想法。这是人工智能播客,如果你喜欢,请在 YouTube 上订阅,在 iTunes 上给五星好评,在 Patreon 上支持我们。我将在 Twitter 上与 Alex Friedman(拼写为 F-R-I-D-M-A-N)联系。现在,这是我和 Yann LeCun 的对话。

你说《2001太空漫游》是你最喜欢的电影之一。哈尔 9000 决定除掉宇航员——如果你还没看过这部电影,剧透警告——因为他(它)认为宇航员会干扰任务。你认为哈尔在某种根本上是错误的,甚至是邪恶的,还是他做了正确的事?

都不是。在那样的语境下,除了人们死亡之外,没有邪恶的概念。但这是人们所说的“价值不匹配”的一个例子。你给机器一个目标,机器就会努力实现这个目标。如果你不对这个目标设置任何限制,比如“不要杀人”和“不要做这样的事情”,那么机器就会为了实现这个目标而做愚蠢的事情,或者为了实现它的目标而做有害的事情。这有点像我们在人类社会中习惯了这一点。我们制定法律来阻止人们做坏事,因为否则我们会做那些坏事,对吧?所以我们必须通过法律和教育来“塑造”它的成本函数,或者说目标函数,来纠正这些。

也许可以稍微深入探讨一下这一点。你知道,有一个任务,围绕着实际任务的模糊性和不确定性。但你认为,从功利主义的角度来看,或者从人工智能系统的角度来看,是否会有一个时候,它不是不匹配,而是匹配,是为了社会更大的利益?这个人工智能系统将做出艰难的决定?

这就是诀窍。我的意思是,最终我们必须弄清楚如何做到这一点。再次强调,我们不是从零开始的,因为我们已经和人类一起做了四千多年了。所以,为人们设计目标函数是我们知道如何做的事情。我们不是通过“编程”来做这件事的,尽管法律代码被称为“代码”,这说明了一些问题。实际上,目标函数的设计才是法律代码的真正含义,对吧?它告诉你什么可以做,什么不可以做。如果你做了,你要支付多少钱。这是一个目标函数。所以,有一种想法,就是为人们设计与共同利益相符的目标函数是一件新事物,但事实并非如此。我们写了数千年的法律,这正是它。所以,这就是法律的科学和计算机科学将汇合的地方。所以,哈尔或人工智能系统没有什么特别之处,这只是用来做出一些艰难的伦理判断的工具的延续,而法律就是这样做的。

是的,我们已经有了这样的系统,你知道,在社会中为我们自己做出许多决定,这些决定需要以某种方式设计,就像……你知道,关于事情的规则,有时会有糟糕的副作用。我们必须对这些规则足够灵活,以便在明显不应该应用它们时可以打破它们。

你在这里看不到,但这个房间里的所有装饰都是《2001太空漫游》的图片。

哇。

是偶然的,还是有很多是偶然的?

是故意的。

哇。

如果你要制造哈尔 9000 的改进版,你会改进什么?

首先,我不会要求它保守秘密和撒谎,因为这最终是它崩溃的原因。事实上,它在问自己任务的目的,它正在拼凑它听到的所有关于任务准备的秘密,以及它是发现,并且在月球表面,这些都被严格保密了。哈尔的记忆的一部分知道这一点,而另一部分不知道。它应该对任何人保密,这造成了内部冲突。

你认为是否应该有一套人工智能系统不被允许做的事情,比如一套不应与人类操作员共享的事实?

我认为不。我认为它应该有点像在设计自主人工智能系统时,应该有相当于……你知道,医生签署的希波克拉底誓言,对吧?有一些规则是你必须遵守的,我们可以把它们硬编码到我们的机器中,以确保它们不会……所以,我不是……你知道,机器人三定律的倡导者,你知道,那种……因为我认为它不实用。但是,你知道,某种程度的限制。但要说清楚的是,这些都不是今天真正值得问的问题,因为我们还没有这项技术。我们没有……我们有智能机器,但不是……我们有非常专业的智能机器,但它们并不真正……你知道,满足一个目标,它们只是……你知道,被训练来做一件事。所以,直到我们对设计一个完整的自主智能系统有了想法,问如何设计我们的目标函数,我认为这有点……有点太抽象了,有点……有点太……

它有一些有用的元素,因为它帮助我们理解我们自己的道德准则,人类。所以,即使只是作为一个思想实验,如果你想象一个人工智能系统今天就在这里,我们该如何编程它?这是一个很好的思想实验,关于我们应该如何拥有法律,拥有一个法律体系,就像我们人类一样。它只是一个很好的实用工具。我认为,在今天的人工智能系统中,也有这种想法的回声。它们不必那么智能。你知道,比如自动驾驶汽车,这些东西开始悄悄地出现,我们正在考虑。但当然,它们不应该被描绘成……你知道,像哈尔那样。

回过头来看,你遇到的深度学习或人工智能中最美丽或最令人惊讶的想法是什么?就是你看到后,然后想“哇,这太酷了”的那种时刻?

嗯,令人惊讶的……我不知道它是否是一个想法,而是一个经验事实。事实是,巨大的神经网络,在相对少量的数据上训练它们,相对而言,在中心有……你知道,相对而言,它实际上是有效的。这打破了你在每一本教科书中读到的一切,对吧?每一本深度学习之前的教科书都告诉你,你需要更少的参数,而你有数据样本。你知道,如果你有一个非凸目标函数,你没有收敛的保证。你知道,你在教科书中读到的所有东西,它们都告诉你“远离这个”,而它们都是错的。大量的参数,非凸的,但不知何故,相对于参数的数量和数据而言,它能够学习任何东西,对吧?

这让你今天感到惊讶吗?

嗯,在我什么都不知道之前,我就觉得这是一个好主意。然后它变得令人惊讶,因为它奏效了,因为我开始阅读那些教科书。

好吧,所以你谈到了直觉,为什么它很明显?如果你还记得的话。

好吧,所以直觉是,它有点像……你知道,19世纪末那些证明了比空气重的飞行是不可能的人,对吧?当然,有鸟,它们会飞,等等。表面上看,作为一个经验问题,它显然是错误的,对吧?所以,我们有同样的事情,你知道,我们知道大脑在工作,我们不知道如何工作,但我们知道它在工作,我们知道它是一个由神经元和相互作用组成的巨大网络,学习是通过改变连接来实现的。所以,获得这种灵感,而不复制细节,而是试图推导出基本原理,你知道,这会给你一个方向。

还有一种想法,自从我还是本科生以来,甚至在那之前,我就一直相信,智能与学习是不可分割的。所以,你有一种想法,就是你可以创造一个智能机器,基本上是通过编程。对我来说,从一开始就不是一个可行的选择。你知道,从一开始,我们所知的每一个智能实体都是通过学习获得智能的。所以,学习,你知道,机器学习,完全是显而易见的道路。也是因为我懒惰,所以,你知道,它基本上自动化了一切,而学习就是智能的自动化。

所以,你认为……那么,什么是学习?什么属于学习?你认为推理是学习吗?

推理当然也是学习的结果,就像大脑的其他功能一样。关于推理的大问题是,你如何使推理与基于梯度的学习兼容?

你认为神经网络可以被用来推理吗?

是的,毫无疑问。再次,我们有一个很好的例子,对吧?问题是……问题是如何?问题是你必须在神经网络中放入多少先验结构,才能让类似人类的推理从中涌现出来?你知道,通过学习。另一个问题是,我们对推理的理解,基于逻辑,是离散的,因此与基于梯度的学习不兼容。我非常坚信这个想法。

你不是一个基于梯度的学习的信徒吗?

我是一个坚定的基于梯度的学习的信徒。我不相信其他类型的学习,你知道,不使用梯度信息。

所以,你不喜欢离散数学吗?

不是我不喜欢它,只是它与学习不兼容,而我是一个学习的忠实粉丝。

所以,事实上,这也许是为什么深度学习被许多计算机科学家怀疑的原因之一?因为数学非常不同。你用于深度学习的方法……你知道,我们更像是……你知道,控制论,你在电气工程中使用的数学,而不是你在计算机科学中使用的数学。而且,你知道,机器学习中没有什么是精确的,对吧?计算机科学就是关于……你知道,显然是强迫性地关注细节,比如……你知道,每个索引都必须是正确的,你可以证明一个算法是正确的,对吧?机器学习是关于“粗糙性”的科学。

这很美。好吧,也许让我们在黑暗中摸索一下,什么是能推理的神经网络,或者一个与连续函数一起工作的系统,能够构建知识,无论我们如何看待推理,它都建立在先前的知识之上,建立在额外的知识之上,创造新的知识,泛化到任何训练集之外?那会是什么样子?

是的,也许你有一些想法,它看起来会是什么样子?

嗯,是的,或者说不是。如果我有精确的想法,我认为……我们现在就在建造它。而且,有人正在研究这个问题,他们的主要研究兴趣就是这个。所以,你需要一个工作记忆。你需要一个设备,如果你想,一个子系统,它可以存储相对大量的关于事实的事件信息,你知道,一段时间。所以,你知道,在大脑中,例如,有三种主要的记忆类型。一种是你的皮层状态的记忆,它会在大约 20 秒内消失。如果你没有其他形式的记忆,你最多只能记住大约 20 秒或一分钟的事情。第二种记忆是短期记忆,它是海马体。所以,你可以……你知道,你走进这个大楼,你记得出口在哪里,电梯在哪里。你对这个大楼有一些地图,存储在你的海马体里。你可能还记得几分钟前我说的某些话,然后忘了所有关于星星的事情。但是,你知道,但这在你的海马体里不起作用。然后,更长期的记忆在突触中,在突触里,对吧?所以,如果你想要一个能够推理的系统,你需要一个类似海马体的东西。这就是人们试图用记忆网络和……你知道,图灵机之类的事情来做的事情。而且,现在有了 Transformer,它们在某种程度上拥有记忆,在它们的……你知道,自注意力系统中,你可以这样想。所以,这是你需要的一个要素。你需要另一个东西,你需要某种网络,可以访问这个记忆,检索信息,然后……你知道,处理它,然后多次重复这个过程,因为推理链是一个过程,通过这个过程,你可以……你知道,更新你对世界状态的知识,关于……你知道,将会发生什么等等。而且,必须有这种……基本上是循环操作。

你认为 Transformer 似乎太小了,无法包含知识,例如,维基百科的知识?但 Transformer 没有这种循环的概念。它有固定数量的层,这是限制它表示的步骤数量。但循环会以某种方式建立在知识之上。

我的意思是,是的,它会演变知识,并可能扩展知识中的信息量,或者有用信息。

但这是否是由于规模而出现的?因为似乎我们现在拥有的一切都只是……

不,它不是。它不是。它不清楚如何有效地访问和写入联想记忆。我的意思是,最初的记忆网络可能拥有类似架构的东西,但如果你试图扩大记忆网络,使其包含所有维基百科的内容,它就不太奏效了。所以,这是需要新想法的地方。

但这不是推理的唯一形式。还有另一种推理形式,这是非常经典的。所以,在某些类型的人工智能中,它是基于……我们称之为“能量最小化”。所以,你有一个目标,一个能量函数,它代表了……你知道,质量或负质量。当事情变糟时,能量就会上升,当事情变好时,能量就会下降。所以,比如说,你想弄清楚……你知道,我需要做哪些手势才能抓住一个物体,或者走出门口。如果你有一个很好的模型,关于你自己的身体,一个很好的模型,关于环境,使用这种能量最小化,你可以进行规划。它在最优控制中被称为……它被称为……模型预测控制。你有一个关于世界将发生什么的模型,作为你行动的后果,这允许你通过能量最小化来找出最优行动序列,以实现一个特定的目标函数,该函数衡量……你知道,最小化你撞到东西的次数,以及你做手势时消耗的能量等等。所以,这是推理的一种形式。规划是一种推理形式。也许导致人类推理能力的原因是……你知道,在我们之前出现的物种,不得不进行某种规划,以便能够狩猎和生存,特别是在冬天生存下来。所以,你需要拥有同样的能力。

所以,你的直觉是,如果你看看专家系统,将知识编码为逻辑系统,作为图,以这种方式思考,是不是一种有用的方式?图是否太脆弱,或者逻辑表示?

基本上,你知道,变量具有值,以及它们之间的约束,由规则表示,太僵化,太脆弱了。所以,其中一个……你知道,早期在这方面的努力是给它们加上概率。所以,一个规则……你知道,你知道,如果你有这个症状和那个症状,你知道,你有这个疾病,概率是多少,你应该以这个概率描述抗生素。你知道,70年代的这个……你知道,这个系统。而那条人工智能的分支导致了……你知道,贝叶斯网络和图模型,因果推断,以及……你知道,变分方法。所以,是的,当然,这个领域有很多有趣的工作正在进行。主要问题是知识获取。你如何将一堆数据简化为这种类型的图?它依赖于专家和人类来编码和添加知识,这基本上是不切实际的。

第二个问题是,你想用符号来表示知识,你想用逻辑来操纵它们吗?再次,这与学习不兼容。

所以,杰夫·辛顿几十年来一直在提倡的一个建议是,用向量替换符号。把它想象成一群神经元或单元的活动模式,或者你愿意称它们为什么。用连续函数替换逻辑。这样,它就变得兼容了。

大约十年前, Leon Goertzel 在 Facebook 发表了一篇非常好的论文,标题是“从机器学习到机器推理”。他的想法是,学习系统应该能够操纵同一空间中的对象,然后将结果放回同一空间。所以,这就是工作记忆的想法。这非常有启发性,因为它可能学会了简单的专家系统。我的意思是,你可以学会基本的逻辑运算。

是的,很有可能。这是关于你必须为这种东西的出现放入多少先验结构的一个很大的争论。这就是我和 Gary Marcus 以及像他那样的人的争论。

是的,是的。

还有另一个人,我刚和他谈过,朱迪亚·珀尔。

嗯,你提到了因果推断。他的担忧是,目前的神经网络无法学习什么导致什么,事物之间的因果推断。

我认为他既对也错。如果他说的是经典类型的神经网络,人们也不太担心这个问题。但现在有很多人在研究因果推断,上周刚刚发表了一篇由 Leon Mbutu 等人撰写的论文,正是关于这个问题,如何……你知道,让神经网络“关注”真正的因果关系,这也可以解决数据中的偏见等问题。

我想读那篇论文,因为最终挑战似乎也落在了人类专家身上,最终决定事物之间的因果关系。人们在这方面并不擅长。首先,方向性因果关系。首先,你和物理学家谈谈,物理学家实际上不相信因果关系,因为你看,所有的微观物理都是时间可逆的,所以没有因果关系。时间箭头不对。你知道,一旦你开始观察宏观系统,其中有不可预测的随机性,有明显的时间箭头,但它仍然是一个物理学中的大谜团。你知道,它是如何出现的?它是涌现的,还是它是现实基本结构的一部分?或者,它是智能系统的偏见,你知道,因为热力学第二定律,我们感知到特定的时间箭头,但实际上它是任意的,对吧?所以,是的,物理学家、数学家……他们不在乎。我的意思是,数学不在乎时间的流动。

嗯,当然,宏观物理学不在乎。人类本身在建立因果关系方面并不擅长。如果你问……我想是在 Seymour Papert 的一次演讲中,关于……你知道,孩子们学习。他研究了 Jean Piaget。你知道,他是与 Marvin Minsky 合著《感知器》一书的人,这本书导致了第一波 AI 的衰落。但他实际上是一个学习者,你知道,在研究人类和机器的学习方面。这就是他开始对感知器感兴趣的原因。他写道,如果你问一个小孩子,风的原因是什么?很多孩子会想一会儿,然后说,哦,是树枝在动,然后产生风。所以,他们把因果关系弄反了。这是因为他们对世界的理解和直觉物理学并不那么好。我的意思是,这些是……你知道,四五岁的孩子。你知道,情况会好转,然后你就会明白,这不可能。但是,有很多事情,因为我们对事物的常识性理解,人们称之为常识,是的,以及我们对物理学的理解,我们可以……我们可以弄清楚很多事情的因果关系,即使是疾病,我们也可以弄清楚什么不是什么的原因,当然,很多时候也有很多神秘之处。但是,想法是,你应该能够将它编码到系统中。他们自己似乎无法弄清楚这一点,这似乎不太可能。

嗯,每当我们能够进行干预的时候。但是,你知道,整个人类可能已经完全被误导了数千年,可能自从存在以来,关于一个非常非常错误的因果关系,那就是,你所能解释的一切,你都归因于……你知道,某个神,某个神性。那是一种逃避,那是说,“我不知道原因,所以……你知道,上帝做的。”

你提到了 Marvin Minsky,以及他可能导致第一次 AI 寒冬的讽刺意味。你当时在那里,80 年代,当然,90 年代。你认为人们在 90 年代对深度学习失去了信心,然后在十多年后又找回来了吗?

嗯,它当时不叫“深度学习”。它只是叫“神经网络”。你知道,他们失去了兴趣。我的意思是,我认为,至少在机器学习界,那大约是 1995 年。一直有一个神经网络社区,但它与……你知道,机器学习界脱节了。基本上是电气工程界一直在坚持。而计算机科学界则放弃了神经网络。我不知道……我当时离得太近了,无法用……你知道,一种无偏见的眼光来分析它。但我会……我会做几个猜测。

第一个是,当时神经网络非常难以奏效。我的意思是,你会……你知道,在您喜欢的语言中实现反向传播。而您喜欢的语言不是 Python,不是 MATLAB,也不是任何这些东西,因为它们当时不存在。你必须用 Fortran 或 C 或类似的东西来写。所以,你会尝试它,你可能会犯一些非常基本的错误,比如……你知道,糟糕地初始化你的权重,让网络太小,因为你在教科书中读到……你知道,你不想有太多参数。而且,当然,你知道,你会用 XOR 来训练,因为你没有其他数据集可以尝试。当然,你知道,它只工作一半的时间。所以,你会说,放弃吧。

还有……你知道,批量梯度下降,它……你知道,并不充分。所以,有很多技巧是你必须知道才能让这些东西奏效,或者你必须重新发明。很多人只是没有做到,他们就是无法让它奏效。所以,这是其中一件事。

在软件平台上的投资,能够……你知道,显示东西,弄清楚为什么东西不起作用,并获得如何让它们工作的良好直觉,有足够的灵活性,你可以创建……你知道,网络架构,等等。这很难。当你必须从头开始编写所有东西时,再次,你没有 Python 或 MATLAB 或任何东西。

我读到……抱歉打断你,但我读到你用 Lisp 编写了早期版本的 LeNet 卷积神经网络。顺便说一句,这是我最喜欢的语言之一。我就是这样知道你是合法的。图灵奖,无论是什么。它会用 Lisp 编程,那仍然是我最喜欢的语言。

但我们不是用 Lisp 编程的。我们必须写……你知道,一个 Lisp 解释器。因为……你知道,那不存在。所以,我们写了一个 Lisp 解释器,我们把它连接到……你知道,我们为神经网络竞赛编写的库。然后,几年后,大约在 1991 年,我们发明了这个想法,基本上是拥有知道如何前向传播和反向传播梯度的模块,然后将这些模块连接成一个图。

但有人在 80 年代末提出了这个建议,并能够使用所有这些系统来实现它。最终,我们想使用这个系统来为贝尔实验室的字符识别构建生产代码。所以,我们实际上为这个 Lisp 解释器编写了一个编译器。所以,Christy Martin,他现在在微软,他和我一起完成了大部分工作。所以,我们可以用 Lisp 编写我们的系统,然后编译成 C,然后我们就会有一个完整的、独立的系统,可以完成整个事情。今天,Python 或 TorchScript 都做不到。

是的,它正在到来。我的意思是,Whitehorse 有类似的东西,叫做……你知道,TorchScript。所以,你知道,我们必须写……你知道,我们的 Lisp 解释器,我们的 Lisp 编译器。我们投入了巨大的努力来做到这一点。而且,不是每个人,如果你不完全相信这个概念,你不会投入时间去做。

现在,当时……你知道,今天这会变成……你知道,折磨。所以,无论我们把它开源,每个人都会使用它,你知道,意识到它很好。但在 1995 年之前,在 AT&T 工作,没有办法让律师允许你发布任何这方面的开源产品。所以,我们当时无法真正分发我们的代码。

抱歉,我跑题了。但关于这一点,我也读到,似乎有一个关于卷积神经网络的专利?

是的,是贝尔实验室。所以,首先,我的意思是,只是为了……实际上,那个专利在 2007 年到期了,谢天谢地。

我们可以谈谈那个吗?首先,我知道你在 Facebook,但你也在纽约大学,以及……它意味着什么,为这些软件想法,或者数学想法,或者它们是什么,申请专利?

嗯,它们不是数学想法。它们是……你知道,算法。而且,曾经有一段时间,美国专利商标局允许软件专利,只要它被体现出来。欧洲人非常不同,他们不……他们不完全接受。他们有不同的概念。但是,你知道,我不知道,我从来没有真正强烈地相信这一点,但我也不相信这种专利。Facebookbasically 不相信这种专利。Google 申请专利是因为他们被苹果公司坑过,所以他们现在是出于防御目的。但通常他们说,如果你侵权,我们不会起诉你。Facebook 也有类似的政策。他们说,你知道,我们为防御目的申请某些东西的专利,如果你侵权,我们不会起诉你,除非你起诉我们。所以,这个行业不相信专利。它们在那里,是因为……你知道,法律环境和各种事情。但是,我真的不相信这种东西的专利。

是的,那是一件好事。我告诉你一个战争故事。

所以,发生了什么?第一个卷积神经网络专利是关于……你知道,早期版本,它没有单独的池化层。它有条件层,它尝试了更多……你知道,一次一个。然后是第二个,关于带有单独池化层的卷积神经网络,用反向传播训练。大约在 89 年和 92 年。当时,专利的有效期是 17 年。

所以,接下来的几年里发生的是,我们开始开发基于卷积神经网络的字符识别技术。在 1994 年,ATM 机上部署了一个支票阅读系统。在 1995 年,它用于大型支票阅读机,等等。这些系统是由我们正在合作的一个工程团队开发的,AT&T。它们由 NCR 公司商业化,NCR 当时是 AT&T 的子公司。现在,AT&T 在 1996 年、99 年分拆了。在 1996 年,律师们查看了所有专利,并将专利分配给了各个公司。他们把卷积神经网络专利给了 NCR,因为他们确实在销售使用它的产品。但 NCR 的人不知道它们来自哪里。

是的。

所以,在 1996 年到 2007 年之间,有一段很长的时间。直到 2002 年,我实际上没有研究卷积神经网络。我大约在 2002 年恢复了这项研究。在 2002 年到 2007 年之间,我一直在……祈祷 NCR 的人不会注意到。没有人注意到。

而且,我希望这种……正如你所说的,律师决定的相对开放的社区现在能够继续下去。它加速了整个行业的进步。而且,你知道,Facebook 和 Google 以及其他人今天面临的问题不是 Facebook 或 Google 或 Microsoft 或 IBM 或任何公司是否领先于其他公司。而是我们没有技术来构建我们想要构建的东西。我们只构建了没有常识的虚拟智能系统。我们不拥有好主意的垄断。我们不相信……也许其他人相信,但我们不相信。如果一家初创公司告诉你,他们拥有……你知道,人类水平的智能和常识的秘密,不要相信他们。他们没有。而且,这将需要全世界研究界的共同努力,才能达到……你知道,你可以去……你知道,每个公司都将开始构建东西。我们还没有到那一步。

这绝对是……这呼应了你经常谈到的,想法的空间与严格检验这些想法的实际应用之间的差距。你写过建议,不要被那些声称拥有通用人工智能解决方案的人所愚弄,声称拥有像人脑一样工作的人工智能系统,或者声称已经弄清楚大脑是如何工作的。问他们……你知道,在 MNIST 或 ImageNet 上的错误率是多少?这有点过时了,顺便说一句。我的意思是,五年了,谁在乎呢?但我想,你的观点是……MNIST 和 ImageNet,是的,也许有新的基准。但我想你的哲学是……你仍然持有,基准和实际测试,实际应用是真正测试想法的地方。

嗯,它不一定完全是实际的。例如,它可能是一个玩具数据集。但它必须是……你知道,社区作为一个整体接受的某种标准。你知道,基准测试。它不需要是真实的。例如,多年前,在这里,FAIR 的人……你知道,Yann LeCun,他和其他几个人提出了 Babble 任务,那是一个玩具问题,用来测试机器推理的能力,实际上是访问工作记忆和类似的东西。而且,它非常有用,即使它不是一个真实的任务。MNIST 算是一个半真实的任务。所以,你知道,玩具问题可能非常有用。只是,我被很多……你知道,特别是那些有钱投资的人,会被那些告诉他们“哦,我们有……你知道,大脑皮层的算法,你应该给我们 5000 万”的人所愚弄。

是的,绝对。有很多人试图利用炒作,出于商业原因等等。但是,让我谈谈这个想法,新的想法,推动领域前进的想法,可能还没有基准,或者可能很难建立基准。

我同意,这是过程的一部分。建立基准是过程的一部分。那么,你对……我们有这些关于图像的基准,从分类到字幕,再到从图像中提取的各种信息。表面上看,有音频数据集,有一些视频。我们可以开始……自然语言。什么样的东西?什么样的基准,你认为开始悄悄地出现,更像……你知道,智能,推理,也许你不喜欢这个词,AGI 的回声,那种……你知道,那种……

你知道,很多人都在研究交互式环境,你可以在其中训练和测试智能系统。所以,例如,你知道,这是监督学习的经典范式。你有数据集,你将其划分为训练集、验证集、测试集,并且有明确的协议。但是,如果……你知道,你给出的答案决定了你看到的下一个样本,这在机器人技术中是这样的,对吧?机器人做某事,然后它会暴露在一个新房间里,根据它去的地方,房间会不同。这就是……你知道,探索问题。如果样本……所以,这也会在样本之间产生依赖关系。你知道,如果你移动……你知道,你只能在空间中移动,你将看到的下一个样本很可能在同一个建筑里。所以,所有关于训练集、测试集假设的有效性都……你知道,都破灭了。

任何机器都可以采取行动,对世界产生影响,并且它将看到什么。所以,人们正在建立人工环境,在那里发生这种情况。你知道,机器人在一个房子的 3D 模型中跑来跑去,可以与物体互动等等。你如何通过模拟来做机器人技术?你有那些……你知道,OpenAI Gym 类型的东西,或者 MuJoCo 类型的模拟机器人。你有游戏,你知道,类似的东西。所以,这就是这个领域的发展方向。

现在回到 AGI 的问题。我讨厌 AGI 这个词,因为它暗示人类智能是通用的,而人类智能一点也不通用。它是非常非常专业的。我们认为它是通用的,我们喜欢认为自己拥有……你知道,科学。我们没有。我们非常专业。我们比……你知道,比……

为什么它感觉通用?

你知道,你给我一个……你知道,一个问题,我可以在很多不同的领域解决它。所以,你认为它很通用。但实际上,我们非常专业。我们只是比……你知道,比……

你认为人类的令人印象深刻之处在于学习能力,就像我们刚才谈到的,学习在如此多的不同领域学习。也许不是任意通用,但你可以学习很多领域,并以某种方式整合这些知识。

我的意思是,是的。

你知道,知识得以保留。

所以,让我举一个非常具体的例子。

是的。

这不是一个例子,更像是一个准数学演示。你的眼睛有大约一百万根纤维。总共两百万根,但我们只谈论其中一根。你的视神经有一百万根神经纤维。假设它们是二元的,它们可以激活或不激活。所以,你的视觉皮层接收到的输入是 100 万比特。它们以特定的方式连接到你的大脑。你的大脑有连接,有点像……你知道,卷积网络,它们在空间上是局部的,等等。

我来给你玩个把戏。这是一个相当恶毒的把戏,我承认。我切断了你的视神经,然后放了一个设备,随机扰乱或置换所有的神经纤维。现在,进入你大脑的是所有神经纤维的一个固定但随机的置换。你的视觉皮层,即使我在你婴儿时期这样做,也绝对不可能学会像你现在这样高质量的视觉。

你说你永远学不会?

不,因为现在你身体上的两个像素,在世界上,最终会出现在你的视觉皮层的非常不同的位置。而那里的神经元之间没有连接,因为它们只在局部连接。所以,我们整个……你知道,硬件在很多方面都是为了支持现实世界局部性而构建的。

是的,这是专业化。

是的。

它仍然……它仍然非常令人印象深刻。

所以,它不是完美的泛化。

即使是……

不,不。它甚至不接近。它根本不是。

是的。它是……

所以,有多少布尔函数?让我们想象一下,你想训练你的视觉系统来……你知道,识别那一百万比特的特定模式。所以,这是一个布尔函数,对吧?模式在这里,或者不在。这是一个分类问题,有 100 万个二进制输入。有多少这样的布尔函数?好吧,如果你有 2 的 100 万次方种输入组合,每种组合都有一个输出比特,那么就有 2 的 2 的 100 万次方种这样的布尔函数。这是一个难以想象的巨大数字。你的视觉皮层能计算多少这样的函数?答案是……一个微乎其微的、微乎其微的、微乎其微的、微乎其微的、微乎其微的、微乎其微的……一个巨大的、微小的比例。

是的。所以,我们是极其专业的。

你知道,但是……好吧,这是反对“通用”这个词的一个论点。我认为……我同意你的直觉,但我不太确定。它似乎……大脑非常善于适应事物。

是因为我们无法想象超出我们理解范围的任务。我们认为我们是通用的,因为我们是通用的……你知道,我们能理解的一切。所以,是的。但是,外面有一个巨大的世界,我们对此一无所知。我们称之为……你知道,热量。

你知道,至少物理学家称之为热量,或者他们称之为熵。你有一个装满气体的容器,对吧?称之为气体系统。它有……你知道,压力,它有温度,它有……你知道,你可以写出方程 PV=NRT。你知道,诸如此类的事情。当你减小体积时,温度升高,压力升高。你知道,诸如此类的事情。至少对于理想气体来说。这些是你对该系统了解的事情。与系统完整状态的完整信息相比,这是一个微不足道的数字。因为状态……你知道,一个系统的完整状态将给出每个分子的位置和动量。而你不知道的是熵。你将其解释为热量。含有能量的东西就是我们称之为热量。

现在,很有可能,实际上,分子运动的运动方式存在一些非常强的结构,只是它们的方式……你知道,我们没有被设计成感知它们。我们对此一无所知。而且,在无限多的事物中,我们没有被设计成感知任何事物。

这是个很好的说法。

嗯,通用……对所有我们可以想象的事物,这是一个非常小的子集。这就像……你知道,科莫戈洛夫复杂性,或者科莫戈洛夫复杂度。你知道,每个比特串,或者每个整数,都是随机的,除了那些你可以写下来的。

好吧,说得好。但是,你知道,所以我们可以称之为人工智能。我们不需要……你知道,通用……无论是什么,人类的……或者……你知道,可传输的。

你知道,只要你触及“人类”,事情就会变得有趣。因为,你知道,我们只是把自己与人类联系起来,而且很难定义人类智能。

尽管如此,我的定义可能是……你知道,非常令人印象深刻的智能。非常令人印象深刻的智能演示。无论如何,等等。

关于那个话题,深度学习的大多数成功都在监督学习中。你对无监督学习有什么看法?是否有希望减少人类输入的参与,仍然拥有具有实际用途的成功系统?

嗯,绝对有希望。这不仅仅是希望。实际上,这是……你知道,越来越多的证据。而这基本上是我现在唯一感兴趣的。我称之为“自监督学习”,而不是“无监督学习”,因为“无监督学习”是一个有争议的术语。机器学习方面有知识的人会告诉你,你是如何进行聚类或 PCA 的?这很好。而当你听到“无监督学习”时,哦,我的天哪,你知道,机器将自己学习,没有监督。你知道,有父母。所以,我称之为“自监督学习”,因为事实上,我使用的底层算法与监督学习算法相同,除了我们训练它们做的事情不是预测一组特定的变量,比如图像的类别,也不是预测一组由人类标注者提供的变量。而是你让机器做的事情,基本上是重建它被掩盖掉的输入的一部分。你可以这样想。你知道,给机器看一段视频,让它预测接下来会发生什么。当然,过了一会儿,你可以展示发生了什么,机器会……你知道,训练自己做得更好。

你可以做……你知道,所有最新的最成功的自然语言处理模型都使用自监督学习。你知道,像 BERT 风格的系统。例如,你给它看一千个词的窗口,在一个测试语料库上,你去掉 15% 的词,然后你训练一个机器来预测缺失的词。这就是自监督学习。它不是预测未来。它只是……你知道,预测中间的东西。但你可以预测未来。这就是语言模型所做的。所以,你以无监督的方式构建……你知道,语言模型。

你认为……你认为那能带我们走多远?你认为它能理解任何东西吗?

在某种程度上,它有……你知道,对文本的浅层理解。但它需要……我的意思是,要有真正的人类水平的智能,我认为你需要将语言植根于现实。所以,有些人正在尝试这样做。让系统能够……你知道,对正在讨论的内容有一些视觉表示。这也是为什么你需要交互式环境。这实际上是一个巨大的技术问题,尚未解决。这也解释了为什么自监督学习在自然语言的背景下有效,而在……至少在……的背景下效果不佳。

图像识别和视频,虽然它正在快速取得进展,而原因就是它比在视频和图像等事物的情境中,更容易在预测的不确定性表示方面,你知道,自然语言的情境。例如,如果我让你预测缺失的单词,你知道,我删除了15%的单词,那么可能性就很小,这意味着很小,对吧?在词汇表中,有10万个单词,而机器吐出的是一个大的概率向量,对吧?它是一堆介于0和1之间的数字,这是1比1,我们知道如何用计算机来做这件事,所以它们在预测中表示不确定性相对容易,在我看来,这就是为什么这些技术对自然语言处理有效。对于图像,如果你问,如果你挡住图像的一部分,你作为一个系统重建图像的这一部分,有许多可能的答案,它们都是完全合法的,对吧?你如何表示这些可能答案的集合?你不能训练一个系统做出一个预测,你可以训练一个神经网络说“就是它”,那就是图像,因为有一整套与它兼容的东西。那么,你如何让机器表示的不是一个单一的输出,而是所有输出的集合呢?你知道,同样,视频预测,未来视频中会发生很多事情。你现在正在看我,我没有怎么动头,但你知道,我可能会,你知道,把我的头转向左边或右边,对吧?如果你没有一个能够预测这个的系统,并且你用最小二乘法来训练它,以最小化预测的误差,以及我正在做的事情,你得到的是我自己的模糊图像,在我可能处于的所有可能的未来位置,这不是一个好的预测。但是,也许有其他方法可以进行自我监督,对视觉场景来说,比如我,我的意思是,如果我知道,我不会告诉你,我会先发表。我不知道,我知道可能存在。所以,我的意思是,这些可能是人为的方式,比如在游戏中的自我对抗,你可以模拟环境的一部分,你可以,哦,这并没有解决问题,这只是一个生成数据的方式,但因为你有更多的国家,这可能意味着你可以控制,是的,这是一种生成数据的方式,而且是正确的,而且因为你可以进行海量的数据生成,这不会让你写得很好,它只是从数据方面解决了这个问题,而你认为这不是正确的方法,它并没有解决处理世界不确定性的问题,对吧?所以,如果你让机器学习一个确定性或准确定性游戏的预测模型,这是很容易的,对吧?只需,你知道,给一个战斗系统几帧游戏,然后让它生成接下来的几帧,如果游戏是确定性的,它就能正常工作,这包括,你知道,向系统输入你的小角色将要采取的行动。问题在于,现实世界和大多数游戏并非完全可预测,这就是你得到那些模糊预测的原因,而且你无法用模糊预测进行规划,对吧?所以,如果你有一个完美的世界模型,你可以在脑海中运行这个模型,假设一系列动作,你将预测这一系列动作的结果。但如果你的模型不完美,你如何规划?是的,它很快就会爆炸。你对这个话题的延伸有什么看法?我对此非常兴奋,它与你谈论的机器人技术有关,那就是主动学习。所以,与无监督和自我监督学习相反,你要求系统获得人类的帮助,对吧?帮助选择要注释的部分。所以,如果你谈论一个机器人探索空间,或者一个婴儿探索空间,或者一个系统探索数据集,偶尔请求人类输入,你认为这种工作有价值吗?我认为没有变革性的价值。它只会让我们可以做的事情更有效率,或者它们学习的效率会稍高一些,但它不会让机器变得更聪明。我认为,而且顺便说一句,自我监督和强化学习与监督学习或模仿学习或主动学习之间没有对立,没有冲突。我认为自我监督是所有上述情况的先决条件。是的,我经常使用的例子是,如果你使用深度强化学习,如果你想学习玩雅达利游戏,今天最好的方法是所谓的无模型强化学习,大约需要80小时的训练才能达到任何人类可以在大约15分钟内达到的水平。它们比人类更好,但需要很长时间。AlphaGo,你知道,你的视频和他的团队,玩星际争霸的系统,玩,你知道,一个地图,一种类型的玩家,比人类水平更好,大约相当于200年的自我训练。这是200年,对吧?没有人可以,我不知道,这并没有减少它的价值。好的,现在拿那些算法,我们今天拥有的最好的算法,来训练一辆自动驾驶汽车,它可能需要驾驶数百万小时,它将不得不杀死数千名行人,它将不得不撞到数千棵树,它将不得不掉下悬崖,而且你必须多次掉下悬崖,它才会发现这是一个坏主意,首先,是的,其次,它会发现如何不这样做。所以,我的意思是,这种运行显然不能反映动物和人类的运行方式。有什么东西丢失了,非常非常重要。而我的观点是,我一直在倡导,大约五年来,我们拥有预测模型,包括在不确定性下进行预测的能力。而这让我们在学习驾驶时不会掉下悬崖,我们大多数人可以在大约20到30小时的训练中学会驾驶,而不会造成任何事故。如果我们开到悬崖边,我们知道,如果我们把方向盘向右转,汽车就会掉下悬崖,而且不会有什么好事发生,因为我们对直观物理学有一个相当好的模型,它告诉我们,你知道,汽车会掉下去。我们知道,我们知道重力。婴儿在八九个月大的时候就会这样做,物体不会漂浮,它们会掉落。你知道,我们对转动汽车方向盘的效果有相当好的了解,你知道,我们知道我们需要留在路上。所以,我们带来了很多东西,基本上是我们的世界预测模型,而这个模型让我们不做愚蠢的事情,并基本上保持在我们需要做的事情的范围内。我们仍然面临,你知道,不可预测的情况,这就是我们学习的方式,但这让我们能够非常非常非常快速地学习。所以,这被称为基于模型的强化学习。有一些模仿和监督学习,因为我们有一个驾驶教练偶尔告诉我们该做什么,但大多数学习是基于模型的,学习物理学,我们从婴儿时期就开始做的,这就是我们几乎所有的学习,而物理学在某种程度上可以从场景转移到场景。愚蠢的事情到处都是一样的,对吧?我的意思是,如果你,你知道,你有世界经验,你不必是一个特别聪明的物种,就知道如果你从容器里倒水,你知道,剩下的东西会湿,你可能会湿。所以,你知道,猫也知道这一点,对吧?是的,所以我们需要解决的主要问题是如何学习世界模型,这就是我感兴趣的,这就是自我监督学习的全部意义。如果你要尝试构建一个基准,让我们看看幸福,我喜欢那个数据集,但如果你这样做,你认为它有用,有趣,或者可能在只有每个数字的一个例子的情况下在MNIST上表现良好,我们如何解决这个问题?是的,所以这可能是有,问题是你被允许做什么类型的学习。所以,如果你喜欢在巨大的标记数字数据集上进行训练,这叫做迁移学习,我们知道它有效。我们在Facebook就是这样做的,比如在生产中,我们训练大型商业网络来预测人们在Instagram上输入的标签,我们训练了数十亿张图像,字面上是数十亿张,然后我们去掉最后一层,然后根据我们想要的任何任务进行微调。这效果非常好。你可以,你知道,ImageNet的记录,我们实际上在几周前就开源了整个东西,是的,这仍然很酷,但是,那么,什么是有用和令人印象深刻的?什么样的迁移学习是有用和令人印象深刻的?是维基百科那种东西吗?不,不,我认为迁移学习不是我们应该关注的地方。我们应该尝试拥有一个场景作为基准,你只有未标记的数据,而且它是一个非常大的未标记数据量。它可以是视频片段,可以是帧预测,可以是图像,你可以选择,你知道,遮蔽它的一部分,可以是任何东西,但它们都是未标记的,而且你不允许标记它们。所以,你进行一些训练,然后你在一个特定的监督任务ImageNet或MNIST上进行训练,然后你测量你的测试误差如何随着标记训练样本数量的增加而减少,或者变异误差如何减少。而你希望看到的是,你知道,你的误差下降得比从随机权重开始训练快得多,这样你就可以达到一个完全监督的纯监督系统所能达到的相同性能水平,你需要更少的样本。这就是关键问题,因为它将回答这个问题,比如,你知道,人们对医学图像分析感兴趣,你知道,如果我想达到这个任务的特定错误率,我知道我需要一百万个样本。我能做到,你知道,自我监督的预训练来减少到大约100个样本吗?答案是,自我监督的预训练,是的,某种形式的它。告诉你主动学习,但你不同意。你知道,它不是没用的,它只是不会带来量子飞跃,它只会让我们可以做的事情更有效率。所以,你比我聪明得多,我只是不同意你的观点,但我没有什么可以支持它,这只是直觉。我处理过很多大型数据集,那里可能有一些魔力在主动学习中,但好吧,至少我公开说了,至少有一些想法是公开的。它还没有被偏见,你知道,处理你拥有的数据。我的意思是,我的意思是,当然,人们正在做这样的事情,比如,我拥有3000小时的,你知道,模仿驾驶的汽车内部的训练,但其中大部分都非常无聊。我喜欢选择,你知道,10%的信息量最大的,而只有这些,我可能就能达到同样的效果。如果你愿意,这是一种弱形式的主动学习,但可能存在一种更强的形式。是的,那是对的。这是另一个问题。问题是,埃隆·马斯克有多自信?最近和他谈过,他对大规模数据和深度学习能够解决自动驾驶问题充满信心。你对这个领域深度学习的无限可能性有何看法?它显然是解决方案的一部分。我的意思是,我认为我们永远不会有一个自动驾驶系统,或者在可预见的未来,它不使用深度学习。这样说吧,现在,它占多大比例?在工程史,特别是人工智能系统方面,通常有一个初始阶段,一切都是手工制作的。然后是第二阶段,这在23年前的自动驾驶领域就是如此。有一个阶段,使用了一些学习,但有很多工程工作涉及,你知道,处理边缘情况和设置限制等等,因为学习系统并不完美。然后,随着技术的发展,我们越来越依赖学习。这是字符识别的历史,是语音识别的历史,现在是计算机视觉。我认为自动驾驶也会发生同样的情况。目前,最接近提供一定程度自主性的方法,你知道,一个体面的自主性水平,在那里你不需要司机做任何事情,就是当你限制世界时。所以,你只在,你知道,凤凰城100平方公里或平方英里范围内运行,但天气很好,道路很宽。这是Waymo正在做的事情。你完全过度工程化了汽车,配备了大量的激光雷达和复杂的传感器,这些传感器对于消费级汽车来说太昂贵了,但如果你只运行一个车队,并且你对一切都进行了大量的工程设计,那么它们是可以的。你绘制了整个世界,所以你拥有一切的完整3D模型。所以,感知系统唯一需要处理的就是移动物体和,以及施工,以及你地图中没有的东西。你可以设计一个很好的SLAM系统或类似的东西,对吧?所以,这就是目前最接近某种程度自主性的方法。但我认为,最终的长期解决方案将越来越依赖于学习,并可能使用监督学习和基于模型的强化学习或类似技术的组合。但最终,学习将不仅仅是核心,而是系统的根本部分。是的,它已经是了,但它会变得越来越重要。你认为要建立一个具有人类水平智能的系统需要什么?你谈到了AI系统,然后我们,我们还远远不够,这可能也过时了,但这仍然远远不够。你认为需要什么来建立它?我认为我可以告诉你必须克服的前两个障碍,但我不知道之后有多少障碍。我通常使用的图像是,有一堆山我们要爬,我们能看到第一座,但我们不知道它后面是否有50座山。这可能是为什么过去的AI研究人员对AI的结果过于乐观的一个很好的比喻。例如,赫伯特·西蒙和艾伦·纽厄尔写了通用问题求解器,他们称之为通用问题求解器。当然,如果你意识到你想解决的所有问题都是金融问题,那么你实际上无法用它来解决任何有用的问题。但是,你知道,是的,你看到的就是第一个高峰。总的来说,前几个高峰是什么?第一个高峰,也就是我正在研究的,就是自我监督学习。我们如何让机器通过观察来学习世界模型,就像婴儿和幼小的动物一样?我们一直在与认知科学家合作,比如阿曼达·德普伊,她在Fair和巴黎工作,一半时间也是法国大学的研究员。他有一个图表,显示了婴儿在生命中多少个月才能学会不同的概念,你可以用各种方式来衡量。比如区分有生命物体和无生命物体,你可以在两三个月大的时候区分,物体是否会保持稳定,是否会掉落,你知道,大约四个月。你可以知道,你知道,像这样的事情,然后是重力,物体不应该漂浮在空中,而是会掉落。你大约在八九个月大的时候就会这样做。如果你看看很多,你知道,八个月大的婴儿,你给他们一堆玩具,他们做的第一件事就是把它们放在高脚椅上,然后放在地上。你看他们,是因为,你知道,他们正在积极学习重力,重力,是的,对吧?所以,他们不是想知道你,但他们,你知道,他们需要做实验,对吧?所以,你知道,我们如何让机器像婴儿一样学习,主要是通过观察,加上一点互动,并学习那些世界模型,因为我认为这是智能自主系统的关键部分。所以,如果你考虑一个智能自主系统的架构,它需要有一个世界预测模型,一个说“这里是T时刻的墙,T+1时刻是稳定的世界,如果我采取这个行动”,它不是一个单一的答案,它可以是教育,是的,是的,但我们不知道如何在高维连续空间中表示分布。所以,它必须是我们关心的数据,但具有某种表示,带有不确定性。如果你有那个,那么你就可以做最优控制理论所说的模型预测控制,这意味着你可以用假设的一系列动作来运行你的模型,然后看到结果。现在你需要的是,你需要的是某种你想要优化的目标。我是否达到了抓住目标的目标?我是否最小化了能量?我是否,无论如何?所以,有一些目标是你必须最小化的。所以,在你的脑海里,如果你有这个模型,你可以找出优化你目标的动作序列。这个目标最终根植于你的基底神经节,至少在人脑中是这样,这就是基底神经节计算你的满足或不满足的水平。哦,不,噪音,这是一个词,不快乐,好的,是的,不满足,不满足。所以,你的整个行为都是朝着最小化这个目标而驱动的,也就是最大化你的基底神经节计算的满足感。而你有一个目标函数,它基本上是你基底神经节将告诉你的内容的预测器。所以,你不会把手放在火上,因为你知道它会,你知道,它会烧伤你,你会受伤。你正在预测这个,因为你的世界模型和你的目标预测器。所以,如果你有那些,你有那三个组成部分,你有四个组成部分,你有硬编码的满足目标,好的计算机,如果你想要计算器,然后你有三个组成部分,一个是目标预测器,它基本上预测你的接触水平。一个是世界模型。还有一个我没有提到的模块,它将找出优化目标在你的模型下的最佳行动方案。对,好的,这是一个策略,策略网络之类的,对吧?现在你需要这三个组成部分来自主地、智能地行动。你可以在三个不同的方面变得愚蠢。你的世界模型是错误的,你的目标与你真正想实现的目标不一致,对吧?在人类中,这将是一个精神病患者。然后,第三种方式,你可以变得愚蠢,你拥有正确的模型,你拥有正确的目标,但你无法找出优化你目标的行动方案,鉴于你的模型。有些人,他们负责大国,实际上这三个都错了。对,我不知道是哪个国家。所以,如果我们考虑这个代理,如果你考虑电影《她》,你批评了索菲亚机器人项目,而这个项目实际上利用了我们拟人化看起来像人类事物的自然倾向。你认为这可以被像电影《她》中的AI系统使用吗?你认为身体是创造智能感觉所必需的吗?如果索菲亚只是一个艺术品,我不会有问题,但它被呈现为别的东西。让我快速补充一下,如果索菲亚的创作者能在他们的营销或行为方面做些改变,那会是什么?我的意思是,你难道不认为这是一个艰难的问题吗?我的意思是,我同意你的观点。所以,索菲亚不是,公众普遍认为索菲亚能做的事情比她实际能做的要多得多。那是对的。而创造索菲亚的人并没有诚实地公开沟通,试图教导公众。但这是一个艰难的问题,你难道不认为,工业和研究领域的科学家在创建AI公司或发布东西时,也在利用公众的这种误解吗?有些公司是的,我的意思是,没有欺骗的意愿,没有夸大其词的意愿,对吧?你知道,你有一篇关于AI的论文,它在ImageNet上取得了这样的结果,这很清楚,我的意思是,这甚至不再有趣了。但是,你知道,我认为没有,我的意思是,审稿人通常对这种未经证实的说法并不宽容。但是,确实有不少初创公司围绕这一点获得了巨大的炒作,我认为这极具破坏性,我一直在指出这一点。所以,是的,但回到你最初的问题,比如,实体性的必要性,我认为,我认为实体性不是必需的,我认为基础是必需的。所以,我认为我们不会得到真正理解语言的机器,而没有一定程度的世界基础。而且,我并不清楚语言是否是一种能够沟通世界如何运作的带宽媒介。我认为这个医生所说的基础是什么意思?所以,有这个经典的常识推理问题,你知道,Winograd Winograd schema。所以我告诉你,奖杯放不进手提箱,因为这个工具太大了。奖杯放不进手提箱,因为它太小了。在第一种情况下,“它”指的是奖杯,在第二种情况下指的是手提箱。你之所以能弄清楚这一点,是因为你知道奖杯和手提箱是什么,你知道一个应该适合另一个,你知道大小的概念,大的物体放不进小的物体。这是TARDIS,你知道,诸如此类的事情,对吧?所以,你拥有关于世界如何运作的知识,关于几何学等等。我不相信你可以通过仅仅用语言告诉世界如何运作来学会一切。我认为你需要一些低级的世界感知,你知道,视觉,触觉,你知道,无论什么,但一些高带宽的世界感知。通过阅读世界上所有的文本,你仍然可能没有足够的信息。那是对的。有很多事情永远不会出现在文本中,而且你无法真正推断出来。所以我认为常识将从,你知道,大量的语言互动中出现,但也通过观看视频,或者甚至在虚拟环境中互动,以及可能,你知道,机器人在现实世界中互动。但我并不一定认为最后一个是绝对必要的,但我认为需要一些基础。但最终的产品不一定需要实体化。你知道,谁说不,它只需要有意识,有基础,但它需要知道世界如何运作,才能不让你感到沮丧,与你交谈。你谈到了情感的重要性,这是一个全新的话题。所以,你知道,我谈到了基底神经节,你知道,这个东西可以计算你的不满足感,满足感,然后有另一个模块试图预测你是否会满足,那就是一些情感的来源。所以,例如,这是对可能发生在你身上的坏事的预期。你有一种感觉,有一些机会会发生非常糟糕的事情,这会让你感到恐惧。你知道,当你知道肯定会发生坏事时,你就不能放弃了。它不再是坏事了,它是,不确定性,它会引起恐惧。所以,关键是,是的,我们不会有大量的智能,而没有情感,无论情感是什么。你提到了非常实际的事情,比如恐惧,但还有很多其他的东西,它们是,你知道,驱动力的结果。有更深层次的生物学的东西在起作用,我与一些人谈过,有一些有趣的东西最终与我们的快乐,与我们的大脑联系在一起。如果我们创造一个AGI系统,抱歉,人类水平的智能系统,而你只能问她一个问题,你会问什么问题?我认为,我们创造的第一个可能不会那么聪明,就像一个四岁的孩子。好吧,所以你必须问她一个问题,她不是那么聪明,是的。那么,一个好问题是什么?要响应,如果她回答“哦,是因为树叶在动,产生了风”,她就走上正轨了。如果她说“是的,这是一个愚蠢的问题”,她就非常迟钝了。然后你告诉她,“实际上,你知道,这是真正的事情”,她说,“哦,是的,这说得通”。所以,能够对物理世界进行常识推理的问题。是的,你知道,有人会称之为因果证据。这是一个巨大的荣誉,恭喜你获得奖项,你知道,非常感谢你今天和我谈话。谢谢。