Transcription
以下是与约翰·勒昆的对话,这是他第二次来到播客。他是 Meta(前 Facebook)的首席人工智能科学家,纽约大学教授,图灵奖得主,是机器学习和人工智能历史上具有开创性的人物之一,也是一位非常聪明且有主见的人,总是很有趣的谈话对象。这是 Lex Fridman 播客。
为了支持本播客,请查看描述中的赞助商。现在,我将与 Yann LeCun 进行对话。
您与 Ishan Mizra 合写了文章《自监督学习:智能的暗物质》,顺便说一句,这是一个很棒的标题。
那么,让我问一下,什么是自监督学习?为什么它是智能的暗物质?
我将从暗物质部分开始。显然,人类和动物正在进行一种我们目前在机器和人工智能中无法很好地复制的学习方式,对吧?
因此,当今机器学习最流行的方法,或者说范式,我应该说,是监督学习和强化学习。它们效率极低。监督学习需要大量的样本才能学习任何东西,而强化学习需要大量的试错才能让系统运行任何东西。
这就是为什么我们没有自动驾驶汽车的原因。这是从一种到另一种的巨大飞跃。
好的,所以要解决困难的问题,您必须进行大量的人工标注才能使监督学习起作用。而要用强化学习解决这些困难的问题,您必须以某种方式模拟该问题,以便您可以进行强化学习所需的这种大规模学习。
那么,为什么大多数十几岁的孩子可以在大约 20 小时的练习中学会开车,而即使经过数百万小时的模拟练习,自动驾驶汽车也无法真正学会自己正确驾驶呢?
所以,显然我们遗漏了什么,对吧?
很多人都清楚,您知道,许多人的即时反应是:“嗯,你知道,人类利用他们的背景知识来学习得更快”,他们是对的。
那么,这些背景知识是如何获得的呢?这就是大问题。
所以,现在您必须问,您知道,婴儿在生命的前几个月是如何了解世界运作的?主要是通过观察,因为他们几乎无法在世界上行动,而且他们了解了关于世界的巨量背景知识,这可能是我们称之为常识的基础。
这种学习不是学习一项任务,也不是因为任何事情而得到强化,它只是观察世界并弄清楚它是如何运作的,构建世界模型,学习世界模型。我们如何做到这一点?我们如何在机器中复制它?
所以,自监督学习就是一种尝试,或者说一种试图复制这种学习方式的尝试。
所以,您只是在观察,甚至不是孩子与环境的互动部分?他们只是坐在那里看着爸爸妈妈走来走去,拿起东西,所有这些?这就是您所说的背景知识吗?
也许甚至不是看着爸爸妈妈,只是看着世界流逝,只是睁开眼睛,或者闭上眼睛,或者睁闭眼睛的动作,世界就会出现和消失,所有这些基本信息。
您说,为了学会开车,人类之所以能够快速学会开车(有些人比其他人更快),是因为他们能够观察汽车在世界上的运作,在之前的许多年里,他们积累了背景知识,物体最基本的物理学,所有这些东西。
没错。我的意思是,物体最基本的物理学,您甚至不需要知道汽车是如何工作的,因为您可以相当快地学会。我的意思是,我经常使用的例子是,您正开车经过悬崖,并且由于您对直观物理学的理解,您会提前知道,如果您向右转动方向盘,汽车就会向右偏离,您会冲下悬崖,什么好事都不会发生,对吧?
但是,如果您是一个表格化的强化学习系统,没有世界模型,您必须重复掉下悬崖数千次,才能弄清楚这是一个坏主意,然后又重复数千次才能弄清楚如何避免这样做,然后又重复数百万次才能弄清楚如何在遇到的每种情况下都避免这样做。
所以,自监督学习仍然必须有人告诉它某种真相来源,您必须想办法在没有人为协助或很少有人为协助的情况下从世界上获得真相。
所以,那里的谜团是,信号有多少?世界给您的真相有多少?无论是人类世界,比如您看 YouTube 或其他什么,还是更自然的世界。所以,信号有多少?
这里的诀窍是,在某种自监督环境中,信号比在监督或强化环境中都要多得多。这将是我关于蛋糕的比喻,有人称之为“低语蛋糕”。
当您试图弄清楚机器需要预测多少信息,以及您在每次试验中给予机器多少反馈时。在强化学习中,您只给机器一个单一的标量。您告诉机器,您做得很好,您做得不好。您只偶尔告诉机器一次。当我说是“您”时,可能是宇宙在告诉机器。但它只是一个标量。
因此,结果是,您不可能学到非常复杂的东西,除非经过很多很多次的试验,您会得到很多很多次的这种反馈。
监督学习,您在每次样本中给机器几位信息。假设您正在训练一个系统识别 ImageNet 上的图像。有 1000 个类别,每个样本的信息量不到 10 位。
但是,监督学习在这里是一种环境。理想情况下,我们还不知道如何做到这一点,但理想情况下,您会向机器展示一段视频,然后停止视频,让我问机器接下来会发生什么。
所以,您让机器预测,然后您让时间流逝,向机器展示实际发生的事情,并希望机器下次能做得更好。您提供给机器的信息量巨大,因为这是您最初输入的视频片段之后的整个视频片段。
因此,对于语言和视觉来说,都存在一种微妙的、看似微不足道的构造,但这可能代表了创造智能所需的东西,那就是填补空白。
所以,在空白处,听起来很愚蠢,但您能做到吗?是否有可能仅凭这种表述作为自监督学习的信号来解决视觉和语言的智能问题?
我认为这是我们目前最好的机会。所以,这是否会让我们达到人类水平的智能,或者只是猫的水平的智能,还不清楚。但在人们提出的所有可能方法中,我认为这是我们最好的机会。
所以我认为,这种智能系统填补空白的想法,无论是预测未来,推断过去,填补缺失的信息,您知道,我现在正在填补您头后面是什么,以及您的头是什么样子的,从后面。因为我对人类的构成有基本的了解,而且我不知道您接下来会说什么,您会在什么时候说话,您会把头转向这边还是那边,您会看向哪个方向。但我知道您不会凭空消失然后出现在走廊三米远的地方。您知道,因为我知道什么可能,什么不可能,根据直观物理学。
所以,您有一个关于什么可能,什么不可能的模型,然后如果发生了,您会非常惊讶,然后您必须重建您的模型,对吧?所以,那就是世界模型。它告诉您,您知道,它填补了空白。
所以,根据您通过感知获得的世界状态的局部信息,您的世界模型会填补缺失的信息,这包括预测未来,回溯过去,您知道,填补您没有立即感知到的东西。而且这不一定是纯粹的通用视觉或视觉信息或通用语言。您可以深入具体领域,例如预测您在车道上行驶时会做出什么控制决策。您有一系列来自车辆的图像,然后您有信息,如果您在视频中记录了汽车最终的去向。所以,您可以回溯时间,根据视觉信息预测汽车的去向。这是非常具体的,领域特定的,对吧?
但问题是我们能否找到一种通用的方法来训练机器进行这种预测或填补空白。
所以,目前,这种方法在自然语言处理领域取得了惊人的成功。所有现代自然语言处理都是以自监督的方式预先训练来填补空白的。您向它展示一系列单词,移除其中 10%,然后训练一个巨大的神经网络来预测缺失的单词。一旦您预先训练了该网络,您就可以使用它学习到的内部表示作为输入,用于您监督训练的任何东西。
这非常成功。在图像方面没有那么成功,尽管正在取得进展。而且它基于某种手动数据增强。我们可以稍后深入探讨这一点。但到目前为止,在视频训练方面还没有成功。让机器通过观看视频来学习表示视觉世界,没有人真正成功过。
好的,让我们来做一个高层次的概述。在视觉和语言之间,在种类和难度上有什么区别?您说人们还没有真正破解视觉问题,就自监督学习而言,但这不一定是因为它根本上更难。也许就像我们谈论通过图灵测试一样,语言的图灵测试的全部精神可能比视觉更难。这并不明显。
那么,在您的观点中,哪个更难?或者它们只是同一个问题,随着我们解决每个问题的进展,我们越来越意识到它们都是同一件事,都是同一个蛋糕?
我认为我正在寻找的是让它们看起来本质上是同一个蛋糕的方法,但目前它们不是。
学习世界模型或预测模型的主要问题是,预测永远不是单一的事情,因为世界并非完全可预测。它可能是确定性的或随机的,我们可以就此进行哲学讨论。但即使它是确定性的,它也不是完全可预测的。
所以,如果我播放一段短视频,然后让您预测接下来会发生什么,那么这段视频有很多可能的延续。并且延续的数量随着您要求系统进行预测的时间间隔而增加。
所以,监督学习的一个大问题是如何表示这种不确定性,如何表示多个离散结果,如何表示一系列可能的连续结果等等。
您知道,如果您是一个经典的机器学习人士,您会说:“哦,您只需表示一个分布。”我们知道如何做到这一点。当我们预测文本中缺失的单词时,因为您可以让一个神经网络为词典中的每个单词打分。这是一个很大的数字列表,您知道,也许有大约 10 万个。您可以将它们变成一个概率分布,告诉您,当我写一个句子时,您知道,“猫正在追逐厨房里的空白处”,您知道,只有几个词在这里有意义。您知道,可能是老鼠,也可能是激光点,或者别的什么。
而且,如果我说“在草原上追逐空白处的空白处”,您也可以为这两个词找到一些可能的选项。因为您有一种潜在的现实可以参考来填补这些空白。
所以,您不能确定地说,在草原上,它是一只狮子还是猎豹,或者别的什么。您无法知道它是一只斑马还是角马,或者别的什么。
但是,您可以通过一个长长的数字列表来表示不确定性。
现在,如果我对视频做同样的事情,让您预测一个视频片段,它不是一个离散的潜在帧集。您必须在某个地方表示一个连续的高维空间中无限数量的可能延续,而我们不知道如何正确地做到这一点。
有限的高维?就像单词一样。我试图让它变成一个小的有限集合,比如不到一百万,之类的。
我同意。我认为我们正在对语言中的每一种可能的单词进行分布,这有点荒谬,而且它奏效了。感觉这是一种非常愚蠢的做法。似乎应该有一种更压缩的表示方法来表示单词的分布。
您说得对。我同意。您有没有什么有趣的想法来压缩表示所有现实,以便您可以形成一个分布?
这是个大问题。您如何做到这一点?
我只是想说,当前 NLP 中自监督学习的另一种简单(我不想说愚蠢)之处在于,您不仅表示一个巨大的单词分布,而且对于多个缺失的单词,这些分布本质上是相互独立的。您不会为此付出太多代价。
所以,您可以,所以,系统,您知道,我之前给出的句子,如果它为狮子和猎豹给出一定的概率,然后为瞪羚、角马和斑马给出一定的概率,那么这两个概率是相互独立的。而实际上,这些事物并非相互独立。狮子实际上会攻击比猎豹更大的动物。所以,这个过程中存在巨大的独立性假设,而这实际上并非如此。
原因是,我们不知道如何正确地表示符号组合序列上的分布。因为数量随着符号长度呈指数级增长。所以,我们必须使用技巧。但是,那些技术可能会绕过,甚至不处理它。
所以,大问题是,是否会有某种抽象的潜在文本表示,它会说,当我在“狮子”和“瞪羚”之间切换时,在“狮子”和“猎豹”之间切换时,我也必须在“斑马”和“瞪羚”之间切换?
是的。这种独立性假设。让我对您提出一些批评,我经常听到和看到。这种填补空白只是统计学。您没有学到任何东西,比如深刻的潜在概念。您只是在模仿过去的东西。您没有学到任何新东西,因此可以将其用于泛化世界。或者,让我用粗俗的说法来说,这只是统计学,不是智能。您对此有什么看法?您通常怎么回答?
我不会参与这些讨论,因为它们有点毫无意义。
首先,很有可能智能就是统计学。它只是某种特定的统计学。是的。这是哲学问题。智能是否只是统计学?是的。但是,是什么样的统计学?
所以,如果您问的问题是,我们学习的世界模型是否具有某种因果关系的概念?是的。
所以,如果批评来自那些说“目前的机器学习系统不关心因果关系”的人,顺便说一句,这是错误的。我同意他们。您的世界模型应该将您的行为作为输入之一,这将促使您学习世界模型,您知道,您在世界上进行的干预会产生什么结果,或者您可以通过观察其他代理人在世界上的行为并观察其他人类的影响来做到这一点。
所以我认为,在某种描述层面上,智能就是统计学。但这并不意味着您不会拥有具有深刻的机械解释的模型。问题是如何学习它们。这就是我感兴趣的问题。因为,您知道,许多发表批评意见的人说,这些机械模型必须来自其他地方。它们必须来自人类设计师,它们必须来自我不知道什么。
显然,我们学习它们,或者如果我们不作为个体学习它们,大自然就会利用进化为我们学习它们。所以,无论您怎么想,这些过程都以某种方式被学习了。
所以,如果您看看人脑,就像我们人类反思大脑如何工作一样,似乎当我们思考什么是智能时,我们思考的是高级的东西,比如我们构建的模型,认知科学的概念,比如记忆和推理模块,几乎就像这些高级模块一样。
这是一种好的类比吗?我们是否忽略了暗物质,基本的低级机制,就像我们忽略操作系统的工作方式一样?我们只是在使用高级软件。我们忽略了低级层面,神经网络可能正在做一些统计学的事情,就像我一样,抱歉,可能不正确和粗俗地使用这个词,但正在做这种填补空白的学习,并不断更新模型,以便能够支持原始感官信息,预测它,然后在预测错误时进行调整。
但是,就像凯拉一样,当我们从高层次看我们的大脑时,感觉就像我们在下棋,我们就像在玩高级概念,我们将它们缝合在一起,并将它们放入长期记忆中。但实际上,下面发生的是我们无法内省的,那就是这种简单的、大型神经网络,它只是在填补空白,对吧?
好吧,那里有很多问题,也有答案。
首先,在神经科学,特别是计算神经科学中,有一个完整的思想流派喜欢预测编码的想法,这与我之前谈到的自监督学习的想法非常相关。
所以,一切都是关于预测。智能的本质是预测能力,而大脑所做的一切都是试图预测一切。
所以,这确实是如果您想要的话,自监督学习试图复制的预测想法的根本原则。如果您愿意,这是独立于任务的学习的基本机制。
下一步是,您有兴趣复制哪种类型的智能?当然,您知道,我们都认为试图复制人类的高级认知过程。但是,就像机器一样,我们甚至还没有达到复制猫大脑学习过程的水平。
您知道,最聪明或智能的系统并没有像家猫那样拥有那么多的常识。
所以,猫是如何学习的?您知道,猫并没有做很多推理。它们当然有因果模型。它们当然有,因为,您知道,许多猫可以弄清楚如何通过在世界上行动来获得它们想要的东西。它们当然拥有直观物理学的绝佳模型,当然还有它们自身身体的动力学,还有赞美等等。
所以,它们非常聪明。它们只用大约 8 亿个神经元就能做到这一点。我们离复制这种事情还差得很远。
所以,在某种程度上,我可以这样说,让我们甚至不要担心人类的高级认知和长期规划和推理,直到我们弄清楚,您知道,我们是否甚至可以复制猫正在做的事情。
话虽如此,我认为学习世界模型的能力是创造也能推理的机器的可能性关键。
所以,每当我做演讲时,我都会说,机器学习有三个主要挑战。第一个是,您知道,让机器学会表示世界,并提出自监督学习。第二个是让机器以与基于梯度学习兼容的方式进行推理,因为这才是深度学习真正关注的。第三个是我们不知道如何解决的问题,至少我不知道如何解决的问题是,我们能否让机器学习行动计划的分层表示?
您知道,我们知道如何训练它们来学习感知的分层表示,使用卷积神经网络和 Transformer 等。但行动计划呢?我们能否让它们自发地学习良好的行动分层表示?
也基于梯度?是的。所有这些都需要在某种程度上是可微的,这样您就可以应用基于梯度的学习,这才是深度学习的真正意义。
所以,它是背景知识,以一种可微的方式进行推理的能力,这种能力以某种方式与背景知识深度集成,或建立在背景知识之上。然后,有了这些背景知识,就能制定出分层计划,对吧?在世界上。
所以,如果您采用经典的最优控制,在经典的最优控制中有一个叫做模型预测控制的东西。它已经存在了几十年了。NASA 用它来计算火箭的轨迹。基本思想是,您有一个相当具有预测性的火箭模型,或者您打算控制的任何系统。给定时间 t 的系统状态和您正在采取的行动,系统,比如火箭的推力,以及所有控制,它会给出时间 t + delta t 的系统状态。基本上是一个微分方程,类似的东西。
如果您拥有这个模型,并且您拥有这个模型,以某种神经网络或某种可以进行梯度反向传播的公式集的形式,您可以进行所谓的模型预测控制或基于梯度的模型预测控制。
您可以沿着时间展开该模型。您输入一系列假设的行动,然后您有一个目标函数,它衡量在轨迹结束时系统有多好地成功或达到了您想要的目标。它是机器人抓取了您想要抓取的物体吗?如果是火箭,您是否在空间站附近?等等。
通过时间反向传播,再次强调,这是由最优控制理论家在 20 世纪 60 年代发明的,您可以弄清楚最优行动序列是什么,它将使我的系统达到最佳的最终状态。
这是一种推理。这基本上是规划。许多机器人学中的规划系统实际上都基于此。您可以将其视为一种推理。
所以,以青少年开车为例。您有一个相当不错的汽车动力学模型。它不需要非常精确,但您知道,如果您向右转动方向盘,并且有悬崖,您就会冲下悬崖。您不需要一个非常精确的模型来预测这一点。您可以在脑海中运行它,并因此决定不这样做,因为您可以提前预测结果将是糟糕的。
所以,您可以想象不同的场景,然后采取最有利的场景中的第一步,然后重复规划过程。这叫做递减视界模型预测控制。
所以,即使所有这些事情都有名字,您知道,可以追溯到几十年前。
所以,如果您不是经典的最优控制,世界模型通常不是学习的。有时需要识别一些参数,这叫做系统识别。但通常模型是确定性的,并且大部分是手工构建的。
我认为人工智能的重大问题,未来十年的重大挑战是,我们如何让机器学会预测世界模型,这些模型能够处理不确定性,并以所有这些复杂性来处理真实世界。
所以,它不仅仅是火箭的轨迹,您可以将其简化为第一原理。它甚至不是机器人手臂的轨迹,您也可以通过仔细的数学建模。而是世界上的一切。您观察到的一切。人们的行为。涉及集体现象的物理系统,如水,或者树木,或者树枝,或者复杂的事物,人类在为它们开发抽象表示和预测模型方面毫不费力,但我们仍然不知道如何在机器上做到这一点。
在这些三个挑战中,您是否会把游戏理论的性质也考虑进去?您的行动不仅是对环境动态性质的反应,而且还会受到影响。如果涉及其他人呢?这是第四点,还是以某种方式整合到您的行动分层表示中?
我认为它是整合的。只是现在您的世界模型必须处理,它只是让事情变得更复杂。人类是复杂的,不容易预测,这使得您的世界模型更加复杂。
嗯,有一个聊天。我想象棋是一个类比。蒙特卡洛树搜索。我走,你走,我走,你走。安德烈·卡帕西最近在 MIT 做了关于汽车门的演讲。我想有一些机器学习。但主要是汽车门。汽车门有一种动态性,比如开门的人在检查。他没有谈论那个。他谈论的是汽车门的本体论的感知问题。这是一个巨大的哲学问题。但对我来说很有趣,因为很明显,开门的人正试图出去。在这里纽约,试图离开汽车。您的减速会发出信号。您的加速会发出信号。这是一种舞蹈。这是一种异步的象棋比赛。我不知道。
所以,我觉得,它不仅仅是……我想您可以将所有这些整合到一个巨大的模型中,所有这些小互动。因为它不像象棋那么复杂。它只是我们一起跳的小舞,然后我们弄清楚。
嗯,在某些方面,它比象棋复杂得多,因为它是连续的,它以连续的方式不确定。
它并不感觉更复杂,但它不感觉更复杂,因为这就是我们。我们已经进化到可以解决这个问题。我们擅长它,因为大自然使我们擅长它。大自然并没有让我们擅长下棋。我们完全不擅长下棋。
事实上,这就是为什么我们把它设计成一个游戏,以具有挑战性。如果最近在国际象棋和围棋方面取得的进展让我们意识到,人类在这方面真的很糟糕。真的不好。
在 AlphaGo 之前,最好的围棋选手认为他们比理想的玩家落后两到三颗子。事实上,他们落后九到十颗子。我的意思是,我们就是很糟糕。
所以,我们不擅长。这是因为我们有有限的工作记忆。我们不太擅长进行这种树状探索,计算机在这方面比我们做得好得多。但我们更擅长学习世界的可微模型。我的意思是,我说可微,不是那种我们回头追溯的意思,而是我们的大脑有某种机制来估计某种梯度的。
是的,这就是让我们高效的原因。所以,如果您有一个由世界模型组成的代理人,在人脑中,这基本上是您大脑的前半部分。一个目标函数,在人类中,它是两个东西的组合。有一个内在的动机模块,位于基底神经节,您大脑的底部。那是衡量疼痛和饥饿等即时感觉和情绪的东西。然后,有一个相当于人们在强化学习中称之为评论家的模块,它预测情况的最终结果。
所以,它不是一个成本函数,但它是一个训练有素的最终目标函数的预测器。而且它也是可微的。所以,如果所有这些都是可微的,您的成本函数,您的评论家,您的角色模型,那么您就可以使用基于梯度的类型方法来进行规划,进行推理,进行学习。您知道,做所有那些让一个智能代理成为智能代理的事情。
基于梯度的学习,您认为它可能是解决智能问题的核心。所以,您认为不需要基于逻辑的推理?
我不知道如何使基于逻辑的推理与高效学习兼容。
是的。好吧,也许这是一个哲学问题。我不知道,也许不是那么哲学。我们可以问的是,所有我们从工程和计算机科学中知道的学习算法都是通过优化某个目标函数来进行的。
所以,一个我们可以问的问题是,大脑中的学习是否最小化了一个目标函数?它可能是多个目标函数的组合,但它仍然是一个目标函数。
第二,如果它确实优化了一个目标函数,它是否通过某种梯度估计来做到这一点?它不一定是反向传播,但某种以高效方式估计梯度的办法,其复杂性与实际运行推理的复杂性在同一数量级。因为您负担不起做一些事情,比如扰动您大脑中的一个权重来弄清楚效果是什么,然后……您可以通过扰动来估计梯度。在我看来,大脑使用某种零阶黑盒无梯度优化似乎非常不可能,因为它比梯度优化效率低得多。所以,它必须有一种估计梯度的办法。
有没有可能某种逻辑推理在某些地方作为一种有用的东西出现?就像您说的,如果大脑是一个目标函数,也许它是创建目标函数的一种机制?它是创建知识库的一种机制,例如,然后可以对其进行查询?也许它是一种通过基于梯度的方式或其他方式学习到的知识的高效表示?
嗯,我认为有许多不同类型的智能。
首先,我认为我们认为的那种逻辑推理,我们可能源于 20 世纪 70 年代和 80 年代的经典人工智能。我认为人类使用它的频率相对较低,而且并不特别擅长。但我们根据彼此解决这些罕见问题的能力来评判彼此。这叫做智商测试。
所以,比如,我不太擅长下棋。是的。我一直在评判您,因为……好吧,以您的背景,我敢肯定您擅长下棋。
不,不是所有刻板印象都是真的。
好吧,我下棋很糟糕。
所以,您知道,但我认为也许另一种我拥有的智能是,您知道,构建世界模型的能力,通过推理,当然,也通过数据。而这些模型通常更像是类比的。所以,它是通过模拟和类比进行推理,您使用一个模型来应用于新的情况,即使您从未见过这种情况,您也可以将其与您遇到过的情况联系起来。
而您的推理更像是某种内部模拟。所以,您在想象正在发生的事情,当您在建造……我不知道,用木头建造一个箱子之类的。您可以提前想象,如果您以这种方式切割木头,会发生什么?您会使用螺丝还是钉子?
当您与某人互动时,您也有一个关于那个人的模型,并……与那个人互动,您知道,想着这个模型,以……告诉那个人您认为对他们有用的东西。
所以我认为,这种构建世界模型的能力,基本上是智能的本质。以及利用它来规划将实现特定标准的行动的能力,当然也是必要的。
所以,我将问您一系列不可能的问题,就像我们一直在问的一样。所以,如果这是智能的根本暗物质,这种形成背景模型的能力,您对需要多少知识有什么直觉?
您知道,我认为暗物质,您给它一个百分比,宇宙的组成,有多少是暗物质,有多少是暗能量。您认为需要多少信息才能成为一只家猫?
您必须能够,当您看到一个盒子在移动时,当您看到一个人时,计算出最邪恶的行动。如果有一个东西靠近边缘,您就把它推下去。所有这些,加上您提到的额外的东西,这是一个很棒的自我意识,关于您自己身体和世界的物理学。您认为需要多少知识才能解决它?
我甚至不知道如何衡量这个问题的答案。我不确定如何衡量它。但无论它是什么,它都装在大约 8 亿个神经元中。8 亿个神经元,或者表示一切,所有知识,对吧?
它不到十亿。狗有二十亿,但猫不到十亿。所以,乘以一千,您就得到了突触的数量。我认为几乎所有这些都是通过这种……某种自监督学习获得的。尽管我认为一小部分是通过强化学习获得的。当然,通过经典的监督学习获得的非常少。尽管甚至不清楚监督学习在生物世界中是如何工作的。
所以我认为几乎所有这些都是自监督的。但它是由猫或人类大脑底部根深蒂固的目标函数驱动的,这驱动着他们的行为。
所以,您知道,大自然告诉我们,您饿了。它没有告诉我们如何喂饱自己。这是我们大脑的其余部分必须弄清楚的。
嗯,这很有趣,因为可能存在更深层次的目标函数。饥饿可能是一种……现在您进入神经生物学。它可能只是大脑试图维持体内平衡。所以,饥饿只是大脑对当前事物不满意的一种人类可感知的症状。它可能只是一个非常愚蠢的核心目标函数。但这就是行为的驱动方式。
事实上,基底神经节驱动我们去做一些与猩猩或猫不同的事情,这就是人类的本性与猩猩的本性与猫的本性之间的区别。
例如,我们的基底神经节驱动我们去寻求其他人类的陪伴。这是因为大自然已经发现,我们需要成为社会动物才能生存。许多灵长类动物也是如此。猩猩不是。猩猩是独居动物。它们不寻求他人的陪伴。事实上,当有人靠得太近时,它们会尖叫,因为它们是领土性的。因为为了它们的生存,您知道,进化已经发现这是最好的。它们偶尔也会社交,当然是为了繁殖之类的。但它们主要是独居的。
所以,所有这些行为都不是智能的一部分。您知道,人们说,“哦,您永远不会拥有智能机器,因为人类智能是社会的。”然后您看看猩猩,看看章鱼。章鱼从不知道它们的父母,它们几乎不与任何人互动,而且它们在不到一年的时间里就变得非常聪明。一年内它们就成年了,两年后就死了。
所以,有些我们认为与智能密切相关的事情,比如社交互动,比如语言。我们认为,我们对语言作为人类智能的载体给予了过多的重视,因为我们认为我们的推理与语言如此紧密相连。
所以,要解决家猫的智能问题,您认为您可以在荒岛上做到吗?您几乎可以有一只猫坐在那里,看着海浪,弄清楚很多事情。它需要有……正确的驱动力来让它去做事情并学习适当的事情,对吧?
但比如,您知道,人类婴儿被驱动着去学习站立和行走。您知道,这种愿望是硬编码的。如何做到这一点并不完全是硬编码的,那是学到的。但行走、移动和站立的愿望,那可能是硬编码的。硬编码这种东西非常简单。
哦,比如走路的愿望?那不是……一定有更深层次的走路需求。我认为这可能是社会强加给您的,您需要走路。
其他双足动物,像许多简单的动物,它们可能在从未观察过同类的情况下就能做到。这似乎是一件可怕的事情,因为您一开始就非常不擅长双足行走。爬行似乎更安全,更像……您为什么着急?
因为,您知道,有东西驱动着您去做。这可以说是人类发展的一部分。
这被理解了吗?不完全是。
为什么会站起来?这真的很难。大多数动物不会站起来。它们用四条腿走路。您知道,许多哺乳动物用四条腿走路。它们非常快,有些甚至非常快。但我不知道,从我上次与桌子互动来看,它比两条腿更稳定。这真是一个难题。
有多少鸟类用两条腿解决了这个问题?好吧,技术上我们可以进入本体论。它们有四条腿。我猜它们有两条腿。鸡。许多恐龙有两条腿,据称。我才刚听说霸王龙吃草而不是其他动物。霸王龙可能是一只友好的宠物。
您怎么看……我不知道您是否看过弗朗索瓦·舒勒(François Chollet)制定的通用智能测试?您有没有机会看过那种东西?您对如何解决……智商测试有什么直觉?
我不知道。我认为它离我的视野太远了,所以它并不真正相关。我认为在短期内……好吧,也许是另一种问法。也许更接近您的工作。如何用很少的示例数据来解决 MNIST?
没错。这就是答案。这可能是监督学习。学会表示图像,然后学习识别手写数字,只需要几个样本。我们在人类身上也观察到这一点。您向一个小孩展示一本图画书,里面有几张大象的图片,就这样。孩子就知道大象是什么了。
我们今天也看到实际系统。我们使用大量的图像训练图像识别系统,要么完全自监督,要么非常弱监督。例如,您可以训练一个神经网络来预测人们在 Instagram 上输入的任何标签。然后,您可以使用数十亿张图像来做到这一点,因为每天都有数十亿张图像出现。所以,训练数据的量基本上是无限的。
然后,您将输出表示,您知道,距离系统学习输出的几层,作为输入,用于您想要识别的世界上任何对象的分类器。这效果很好。这就是迁移学习,或者弱监督迁移学习。
人们在使用自监督学习来处理这种情况方面也取得了非常非常快的进展。而且,我猜,这就是自监督学习的未来。
您认为过滤恶意信号需要多少清理工作?或者一个更好的术语?但很多人在 Instagram 上使用标签来获得良好的 SEO。这并不完全代表图像的内容。他们会放一张猫的照片,并用……科学、很棒、有趣之类的标签。我不知道,为什么会加上科学?这对于 SEO 来说并不好。
我的同事们几年前在 Facebook(现在的 Meta)从事这个项目的方式是……
这是他们只选择了一万七千个左右的标签,这些标签对应于某种物理事物或情况,你知道,有视觉内容,所以你不会有像 tbt 之类的东西。他们还保留了一组非常精选的标签,你是这么说的,是的,好的,但仍然是大约一万到两万个,所以相当大,好的,你能告诉我关于数据增强,数据增强到底是什么,以及它是如何使用的?也许是关于视频对比学习,这里有什么很酷的想法?所以数据增强,我的意思是,首先,数据增强,你知道,它的想法是通过扭曲你拥有的图像来人为地增加训练集的大小,而不会改变图像的性质,对吧?所以你拿,你这样做,你可以在任何列表上进行数据增强,人们自 20 世纪 90 年代以来就一直在这样做,对吧?你拿一个数字,然后稍微移动它,或者改变它的大小,或者旋转它,倾斜它,你知道,等等,添加噪声,添加噪声,等等,它效果更好,如果你用增强数据训练一个监督分类器,你会得到更好的结果。现在,在过去几年里,它变得非常有趣,因为许多用于预训练视觉系统的监督学习技术都基于数据增强,而基本技术最初受到我在 90 年代初和杰夫·因特恩在 90 年代初也做过的技术的启发。当时有一些并行工作,我过去称之为 Siamese 网络,所以基本上你取两个相同的网络副本,它们共享相同的权重,你展示同一个对象的两个不同视图,这两个不同视图可能通过数据增强获得,或者可能是从你移动过的相机或不同时间拍摄的同一个场景的两个不同视图,或者同一个人的两张照片,诸如此类。然后你训练这个神经网络,这两个相同的神经网络副本,以一种方式产生一个输出表示,一个向量,使得这两个图像的表示尽可能接近,尽可能相同,对吧?因为你想让系统基本上学习一个函数,这个函数将是不变的,它不会改变,它的输出不会改变,当你以那些特定的方式转换这些输入时,对吧?所以这很容易做到,复杂的是如何确保当你展示两张不同的图像时,系统会产生不同的东西,因为如果你没有专门的规定,系统在训练时就会忽略输入,最终会忽略输入,只产生一个对每个输入都相同的常量向量,对吧?是的,这叫做崩溃。那么如何避免崩溃呢?有两种想法,一种想法是我在 90 年代初和我在贝尔实验室的同事 Jane Bromley 以及其他几个人提出的,我们现在称之为对比学习,那就是要有负样本,对吧?所以你有一对你知道不同的图像,然后你把它们展示给网络,然后你把这两个副本,然后你把这两个输出向量推开,它们最终会保证语义相似的东西产生相似的表示,而不同的东西产生不同的表示。我们实际上想出了这个想法是为了一个签名验证项目,所以我们会收集同一个人的一些签名,然后训练一个神经网络来产生相同的表示,然后,你知道,迫使系统为不同的签名产生不同的表示。这个问题实际上是由当时 AT&T 的一个子公司 NCR 的人提出的,他们有兴趣将签名的表示存储在信用卡磁条的 80 字节上,所以我们想出了一个神经网络的想法,有 80 个输出,你知道,我们会将其量化为字节,这样我们就可以对其进行编码,然后使用该编码来比较签名是否匹配。是的,然后你就会,你知道,签名,你会通过神经网络运行,然后你会将输出向量与卡上存储的内容进行比较。它实际上起作用了,但他们最终没有使用它,因为没有人关心。事实上,我的意思是,美国你知道的金融支付系统在这方面与欧洲相比非常滞后。哦,关于签名,签名有什么意义?这很奇怪,没有人看它们,没有人关心,是的,是的,不,所以,所以这就是对比学习,对吧?你需要正例和负例对,问题是,你知道,即使我在最初的论文中对此并不非常乐观,因为它在高维空间中不起作用,如果你的表示是高维的,那么就有太多方式可以让两件事不同,所以你需要大量的负例对。所以有一个相对较近的实现,实际上来自谷歌多伦多小组,你知道,杰夫·因特恩是那里的资深成员,它叫做 SimClear,SimCLR,你知道,基本上是实现这个对比学习思想的一种特定方式,运行特定的目标函数。现在,我这些天更热衷于非对比方法,所以其他保证表示对于不同输入会不同的方法,这实际上是基于杰夫·因特恩在 90 年代初与当时的学生 Sue Becker 提出的一个想法,它基于最大化两个系统输出之间的互信息的想法。你只展示正例对,你只展示一对你知道有点相似的图像,然后你训练两个网络都要有信息量,而且要尽可能地相互有信息量。所以基本上一个表示必须可以从另一个表示预测,基本上,你知道,他提出了那个想法,在 90 年代初有几篇论文,然后几十年都没有人做。我与我在 FAIR 的博士后一起复兴了这个想法,特别是有一个叫做 Stefanoni 的博士后,他现在是芬兰阿尔托大学的一名初级教授。我们想出了一个叫做 Barlow Twins 的东西,这是一种最大化向量信息量的一种特定方式,你知道,使用一些假设,我们还有一个更近期的版本叫做 VicReg,VicReg,意思是方差协方差正则化,我对此非常兴奋,在过去 15 年的机器学习中,我的意思是,我真的非常兴奋。你认为哪种数据增强对那种非对比学习方法有用?我们是在谈论它是否那么重要,还是它似乎是步骤中非常重要的一部分?是的,如何生成相似但足够不同的图像?是的,这是重要的一步,也是令人讨厌的一步,因为你需要知道你可以进行哪些增强而不会改变物体的性质。所以标准的场景,你知道,这个领域很多人都在使用,就是使用那种失真,所以基本上你进行几何失真,所以一个只是稍微移动图像,这叫做裁剪,另一个稍微改变尺度,另一个旋转,另一个改变颜色,你知道,你可以进行颜色平衡的偏移,或者饱和度,另一个会模糊它,另一个会添加噪声,所以你有一个像标准事物目录一样的东西,人们试图对不同的算法使用相同的算法,以便他们可以进行比较,但有些算法,一些自监督算法实际上可以处理更大,更激进的数据增强,而有些则不能,这使得整个事情变得困难,但这就是我们正在谈论的失真类型。所以你,你,你用这些失真进行训练,然后,你知道,你去掉网络的最后几层,然后你使用表示作为分类器的输入,你在 ImageNet 上训练分类器,或者随便什么,然后测量性能。有趣的是,那些在消除无关信息方面非常出色的方法,也就是图像之间的失真,在消除它方面做得很好,因此,你不能使用那些系统中的表示来进行物体检测和定位,因为信息已经丢失了。所以你需要进行的数据增强类型取决于你最终想要系统解决的任务,而我们今天使用的标准数据增强类型只适用于物体识别或图像分类,它们不适用于诸如你能帮我理解为什么定位,所以你是说它只是在分类负例方面不够好,所以它不能用于定位吗?不,你只是训练系统,你知道,你给它一张图像,然后你给它相同的图像,移动和缩放,然后你告诉它,这是同一张图像,所以系统基本上被训练来消除关于位置和大小的信息。现在,你想使用它,哦,是的,比如找出物体在哪里,以及它的大小,比如一个边界框,比如能够实际地,好的,它仍然可以找到,它仍然可以在图像中找到物体,只是它不太擅长找到物体的确切边界。有趣,有趣,你知道,这是一个有趣的哲学问题,物体定位到底有多重要?我们痴迷于测量,比如图像分割,痴迷于完美地知道物体的边界,而可以说这对于理解场景的内容并不那么重要。另一方面,我认为从进化的角度来看,动物的第一个视觉系统基本上都是关于定位,很少关于识别,而在人脑中,有两条独立的通路用于识别场景的性质,一个物体,以及定位物体。所以你使用第一条通路,称为腹侧通路,用于,你知道,告诉你看的是什么。另一条通路,背侧通路,用于导航,抓取,以及其他一切。你知道,基本上,为了生存,你需要的大部分东西都是定位和检测。相似性学习或对比学习是这些非对比方法与理解某事相同吗?只是因为你知道一个失真的猫和非失真的猫是相同的,这是否意味着你理解什么是猫?在某种程度上,我的意思是,这显然是一种肤浅的理解,但是,这种方法的上限是什么?你认为这只是通往自监督学习之路上的一个技巧吗?我们可以走多远?是的,我认为我们可以走得很远。所以如果我们想出如何使用这类技术,也许是非常不同的,但是,你知道,签名来训练一个系统,从视频到基本上进行视频预测。我认为我们将有一条道路,你知道,朝着,我不会说无限,但朝着某种程度的,你知道,机器中的物理常识。我也认为,你知道,从像视觉这样的高吞吐量通道学习世界运作方式的能力是迈向真正人工智能的必要步骤。换句话说,我相信地面智能,我不认为我们可以纯粹从文本中训练一个机器来变得智能,因为我认为文本中包含的关于世界的信息量与我们需要知道的相比微不足道。所以,例如,让我们,你知道,人们已经尝试了 30 年了,对吧?心理项目等等,对吧?基本上是写下所有已知的事实,并希望某种常识会出现。我认为这基本上是徒劳的。但是让我举个例子,你拿一个物体,我向你描述情况,我拿一个物体,我把它放在桌子上,然后我推桌子。你完全清楚物体会随着桌子一起被推开,对吧?因为它就放在上面。世界上没有文字能解释这一点。我相信,所以如果你训练一个机器,无论它有多强大,你知道,你的 GPT 5000 或任何东西,它永远不会学到这一点,这些信息根本不存在于任何文本中。好吧,关于心理项目的问题,梦想我认为是拥有,比如,1000 万个这样的事实,给你一个领先优势,就像父母在指导你一样。我们人类不需要父母告诉我们桌子会移动,对不起,智能手机会随着桌子一起移动,但我们在其他方面得到了很多指导。所以有可能我们可以给它一个快速的捷径。猫怎么样?那个人知道。但他们进化了。不,他们像我们一样学习。对不起,事物的物理学。好吧,是的,所以你的意思是,你看,你把很多智能放在了后天方面,而不是先天方面。是的,我们似乎有,你知道,进化是一个非常低效的,可以说,过程,它让我们从细菌变成了今天的我们。从底部开始,现在我们在这里。确实如此。问题是,好吧,所以问题是,它有多根本?整个硬件的性质,然后有没有办法绕过它?如果它是根本的,如果不是,如果大部分智能,我们一直在谈论的大部分酷的东西主要是后天,主要是训练的,我们通过观察世界来弄清楚,我们可以形成你所说的那个巨大、美丽、性感的背景模型,只是坐在那里。那么,好吧,那么你需要,然后,也许,它是所有监督学习,一直到最底层。所以,惊喜学习,无论它是什么,使人类智能与其他动物不同,你知道,很多人认为就是语言和逻辑推理之类的东西。它不可能是那么复杂的,因为它只在过去一百万年里出现过。而且,你知道,它只涉及,你知道,我们基因的不到 1% 可能是人类基因和黑猩猩基因之间的差异,或者别的什么。所以,它可能没有那么复杂,可能没有那么根本。我的意思是,大部分,所以复杂的东西已经存在于猫狗身上,你知道,当然还有灵长类动物,非灵长类动物。人类之间的小东西可能只是关于社交互动和在集体中保持想法的能力。这听起来非常戏剧化,非常令人印象深刻,但它可能不是机械上来说是这样的,但我们还没有到那里。你知道,我们有,我的意思是,这是要解决的问题列表中的第 634 号,所以世界的基本物理学是第一位。你,只是快速地偏离一下数据增强,很多是硬编码的,而不是学习的。你有没有直觉,也许会有一些奇怪的数据增强,比如生成式的数据增强,比如对图像做一些奇怪的事情,然后改进相似性学习过程?所以不仅仅是简单的失真,你摇了摇头,只是说即使是简单的失真也足够了。我认为,不,我认为增强是一种暂时的必要之恶。所以人们现在正在研究两件事,一是自监督的类型,比如试图翻译人们在语言中使用的自监督类型,翻译到图像,这基本上是表示自动编码器方法,对吧?所以你拿一张图像,你把它遮挡住,你遮挡住它的一些部分,然后你训练一个巨大的神经网络来重建缺失的部分。直到最近,还没有,还没有有效的方法。所有用于图像的自动编码器类型的方法都没有产生很好的表示,但现在有一篇来自门洛帕克 FAIR 小组的论文,它实际上效果非常好。所以这不需要文档,只需要遮蔽。好吧,只是遮蔽图像。好的,对,所以你遮蔽图像的一部分,然后你训练一个系统,你知道,在这种情况下是一个 Transformer,因为你可以,你可以,Transformer 将图像表示为不重叠的块,所以很容易遮蔽块之类的。好的,那么我的问题就转移到那个问题上,遮蔽,为什么遮蔽应该是正方形或矩形?所以这无关紧要,你知道,我认为我们将来可能会想出,你知道,遮蔽的方法,你知道,基本上是随机的。嗯,我的意思是,它们已经是随机的了,但不是,不是,而是像具有挑战性的东西,像,你知道,也许这是一个不适用的比喻,但你,似乎有一个数据增强或遮蔽,有一个交互式元素,你几乎是在玩图像,就像我们在脑海中玩图像一样。不,但它就像 dropout,就像波士顿机器训练一样,你知道,每一次,每一次你看到一个感知,你也,你可以,你可以以某种方式扰动它,然后,你知道,训练程序的原则是最小化表示的输出在干净版本和损坏版本之间的差异,基本上,对吧?而且你可以实时做到,你知道,机器是这样工作的,对吧?你,你展示一个感知,然后你告诉机器这是一个好的神经元活动组合,或者你的输入神经元,然后你要么让它们自由发展而不将它们钳制到值,或者你只对一个子集这样做。你所做的是训练系统,使得整个网络的稳定状态与它是否看到整个输入或只看到一部分输入相同。你知道,去噪自动编码器方法基本上是相同的,对吧?你,你训练一个系统来重现输入,完整的输入,并填补空白,无论哪些部分缺失。而这确实是根本原则,你可以想象,即使在大脑中,一些神经原则,你知道,神经元会振荡,对吧?所以它们会活动,然后暂时它们会关闭,以迫使系统的其余部分基本上在没有它们帮助的情况下重构输入。你知道,你可以想象,你知道,或多或少生物学上可能的过程,我想,有了这个去噪自动编码器和遮蔽以及数据增强,你不需要担心效率很高,你可以随心所欲地做,然后随着时间的推移变得更好。因为我当时在想,你可能想聪明地做所有这些程序,你知道,但这只是因为每次迭代的成本很高,但实际上不是,实际上不是。也许,然后有,你知道,没有显式数据增强的数据增强是通过等待,你知道,视频预测的那种。你正在观察一个视频片段,观察那个视频片段的延续,然后你尝试使用那些联合嵌入架构来学习一个表示,使得未来片段的表示可以从观察到的片段的表示中轻松预测。你认为 YouTube 有足够原始数据来学习如何成为一只猫吗?我认为有,所以数据量不是限制。不,它需要一些选择,我认为,一些选择,也许是正确类型的数据,你知道,深入到猫视频的兔子洞里,你可能需要看一些讲座之类的。不,你不需要。那会有多元?如果它观看关于智能的讲座,然后学习,观看你的讲座,在纽约大学,然后从中学习如何变得智能?你觉得多模态学习有趣吗?我们一直在谈论视觉语言,将它们结合起来,也许还有音频,所有这些东西。有很多事情我觉得有趣,在短期内,但没有解决我认为真正重要的挑战。所以我认为,你知道,像多任务学习,持续学习,你知道,对抗性问题,我的意思是,那些有,你知道,在相对短期内有很大的实际兴趣,可能,但我不认为它们是根本性的。你知道,即使在某种程度上,主动学习,强化学习。我认为一旦我们弄清楚如何进行自监督表示学习或学习可预测的模型,这些东西就会变得过时或无用或容易。所以我认为这就是,你知道,整个社区应该关注的,至少是那些对根本性问题感兴趣的人,或者,你知道,真正推动人工智能向前发展的人。但当然,在实际问题方面也有大量非常有趣的工作,这些问题有短期影响。好吧,你知道,很难谈论时间尺度,因为整个人类文明最终都会被摧毁,因为太阳会死去,即使埃隆·马斯克成功地进行了跨越银河系的行星际殖民,最终这一切都会变成巨大的黑洞。但这需要很长时间。但是,我的意思是,然后这个逻辑可以用来表示一切都是没有意义的。我之所以这么说,是因为多任务学习,[音乐]可能是你的歌曲,你称之为实际的或务实的,或者别的什么,这可能是实现非常接近智能的东西,而我们正在努力解决更普遍的自监督学习和背景知识的问题。我之所以提到这一点,也许问这个问题的一种方式是,我对特斯拉自动驾驶团队所做的工作印象非常深刻。我不知道你是否有机会看这个多任务学习的例子,他们实际上是在解决问题,比如,我不知道,查尔斯·达尔文开始研究动物,他们正在研究驾驶问题,并问,好吧,你需要感知所有的事情,他们解决这个问题的方式是,一,有一个本体论,你把它带到这里,所以你正在制定一系列不同的任务。这就像一百多个任务,然后他们参与驾驶,然后他们部署它,然后从遇到麻烦的人那里获取数据,然后他们试图弄清楚,我们是否要添加任务,我们是否要,我们单独关注每个任务?当然,事实上,一半,我会说,我会把安德烈·卡帕西的演讲分为两类。一类是关于门,另一类是关于 ImageNet 有多糟糕。他一直在这两个主题之间来回切换。ImageNet 有多糟糕,意思是,你不能只使用一个基准测试。所以,就像,你必须有一个巨大的基准测试套件来了解你的系统有多好。我同意他,我的意思是,他是一个非常明智的人。现在,好吧,很明显,如果你面临一个工程问题,你需要在一个相对短的时间内解决它,特别是如果你几乎把它逼到你的脖子后面,你将不得不采取捷径。你可能会考虑,你知道,长期解决方案的正确做法涉及一些花哨的自监督,但你几乎被逼到脖子后面了,你知道,这涉及到人类生命,所以你基本上必须做系统性的工程,你知道,微调和改进以及反复试验等等。这没什么不对的,这叫做工程,这叫做,你知道,将技术推向世界。而且你必须在这样做之前把它铁板钉钉。所以,关于宏伟的宏伟想法和原则。但是,你知道,我把自己定位在,你知道,在女王的上游,或者离女王相当远的上游。你的柏拉图,想想柏拉图的理念。你是柏拉图式的,因为最终我希望那些东西被使用,但没关系,如果社区需要五年或十年才能意识到这是正确的事情。我以前做过,以前也发生过。你知道,我曾经提出过这个观点。如果你回顾一下 2000 年代中期,例如,然后问自己这个问题,好吧,我想识别汽车或人脸或任何东西。你知道,我可以使用卷积网络,或者我可以使用更传统的计算机视觉技术,你知道,使用兴趣点检测器或 Swift 密度特征,然后在其之上安装一个 SVM。当时数据集太小了,那些需要更多手工工程的方法比公司效果更好。对于卷积网络来说,数据太少了,而且当时的硬件使得卷积网络有点慢。当基本上数据集变大,GPU 可用时,情况发生了变化。你知道,这两个主要因素基本上让人们改变了主意。你可以看看所有人工智能或模式识别的子分支的历史,技术遵循类似的轨迹,人们开始,你知道,拼命地进行工程。无论是光学字符识别,语音识别,计算机视觉,图像识别一般,自然语言理解,比如翻译等等。你开始拼命地进行工程。你开始获取所有知识,先验知识,你知道,关于图像形成,关于,你知道,字符的形状,关于,你知道,形态学操作,关于,比如特征提取,傅里叶变换,你知道,非常快速的矩,你知道,任何东西。人们想出了成千上万种表示图像的方法,以便之后可以轻松地对其进行分类。同样适用于语音识别,对吧?有,你知道,二十年时间,人们才弄清楚一个好的前端,预处理语音信号,这样,你知道,关于所说内容的信心就被保留了,但关于说话者身份的大部分信心都消失了。你知道,Kestrel 系数之类的,对吧?同样适用于文本,对吧?你需要实体识别,然后进行解析,然后进行词性标记,你知道,进行子句的树状表示等等,然后你才能做任何事情。所以这就是它的开始方式,对吧?拼命地进行工程。然后你开始拥有数据,也许你拥有更强大的计算机,也许你对统计学习有所了解。所以你开始使用机器学习,通常是在你的手工制作的系统上的一小部分,你知道,你手工提取特征。好吧,现在,如今,标准的方法是,你使用深度学习系统端到端地训练整个东西,它学习自己的特征。你知道,如今的语音识别系统,OCR 系统完全是端到端的。这是一个巨大的神经网络,它接收原始波形,然后输出一个字符序列,它只是一个巨大的神经网络。你知道,没有,没有 Minecraft 模型,没有显式的语言模型,除了,你知道,某种程度上嵌入在,你知道,神经网络语言模型中,如果你愿意的话。翻译也是如此,所有东西也是如此。所以你看到了这种从越来越少的动手制作和越来越多的学习的持续演变。而且,我认为生物学也是如此。所以,我的意思是,我们可能在这个问题上不同意,也许不是。在这个最后的小片段中,你提到了主动学习。主动学习,即数据选择和交互性,感觉需要成为这个巨大神经网络的一部分。你不能只是一个观察者来做自监督学习。你必须,好吧,我不知道自监督学习只是一个词,但我会,无论这个自动学习的巨大神经网络是什么。我的直觉是,你必须有一个系统,无论是物理机器人还是数字机器人,它在与世界互动,并且以一种有缺陷的方式互动,并随着时间的推移而改进,以便形成自监督学习。好吧,你不能只给它一个巨大的数据海洋。好吧,我同意,也不同意。好吧,我同意,在两个方面。第一种同意方式是,如果你想要,你肯定需要一个世界的因果模型,它允许你预测你的行动的后果。要训练这个模型,你需要采取行动,对吧?你需要能够在世界中行动,并看到效果,这样你才能学习世界的因果模型。好吧,这并不明显,因为你可以观察别人,你可以观察别人,你可以推断他们和你相似,然后你可以从中学习。是的,但然后你必须硬编码那部分,你知道,镜像神经元等等,对吧?所以,而且我不知道如何在机器上做到这一点。所以,我认为行动部分对于拥有世界的因果模型是必要的。第二个原因可能是必要的,或者至少更有效,是因为主动学习基本上是,你知道,去解决你不知道的难题,对吧?这是,你知道,关于你的世界和你如何运作的明显的不确定领域。你可以通过系统地探索你不知道的部分来解决这种不确定性。如果你知道你不知道,那么它会让你感到好奇,你会进入那些情况,你知道,在动物世界里,不同物种的好奇心程度不同,对吧?是的,取决于它们的构建方式,对吧?所以,猫和老鼠非常好奇,狗不是那么多,我的意思是,少一些。所以拥有那种好奇心可能很有用。所以它会很有用,但好奇心只是让过程更快,它并不让过程存在。所以什么过程,什么学习过程是主动学习使其更有效率?我问第一个问题,你知道,我们还没有回答这个问题。所以,一旦这个问题得到回答,我就担心主动学习。所以,这是一个更根本的问题。如果主动学习或互动提高了学习效率,那么,你知道,有时它会变得非常不同,如果提高是几个数量级,比如,那是真的,但根本上仍然是相同的。而建立关于如何在自监督方式下构建背景模型,无论是高效还是低效,都是核心问题。你对 Yossi Banjo 谈论意识以及所有这些概念有什么看法?嗯,我不知道意识是什么,但这是一个很好的开场白。在某种程度上,人们对意识所说的大部分内容让我想起了 18 世纪或 17 世纪人们发现眼睛是如何工作的,以及眼睛后部的图像是颠倒的,因为你有一个透镜,在视网膜上形成一个世界的图像,但它是颠倒的。你怎么会看到正的?你知道,以我们今天科学所知,我们意识到这个问题没有意义,或者有点可笑。所以,我认为关于意识的大部分说法都属于这一类。但是,有很多非常聪明的人,我非常尊重他们,他们正在谈论这个话题,比如我的纽约大学同事 David Chalmers。我有一个非传统的、民间推测性的关于意识的假设。所以我们在谈论这个音频世界模型,我认为,你知道,我们整个前额叶皮层基本上是我们世界模型的引擎。但是当我们关注一个特定的情况时,我们专注于那个情况,我们基本上无法关注任何其他事情。这似乎表明我们基本上只有一个世界模型引擎,在我们的大脑前叶皮层中。这个引擎可以根据当前情况进行配置。所以我们正在用木头做一个盒子,或者我们正在,你知道,在高速公路上开车,玩象棋。我们基本上有一个单一的世界模型,我们将其配置到当前情况。这就是为什么我们一次只能关注一个任务。现在,如果有一个我们反复执行的任务,它会从使用世界模型和预测的深思熟虑的推理,以及可能像我之前谈到的模型预测控制,转变为某种更潜意识的东西,变得自动化。我不知道你是否曾经和国际象棋大师下过棋。你知道,我会在 10 步内被淘汰。我必须花 15 分钟思考我的下一步。而我面前的人,这位大师,他会在几秒钟内做出反应。他不需要思考。这已经成为潜意识的一部分,因为,你知道,这基本上就是模式识别。同样,你知道,你开车的前几个小时,你非常专注,你什么也做不了。然后,经过 20-30 小时的练习,50 小时,你知道,潜意识,你可以和旁边的人说话,你知道,诸如此类的事情。除非情况变得不可预测,然后你必须停止说话。这表明你的大脑中只有一个模型。这可能暗示着意识基本上是配置你世界模型的模块。你知道,你需要某种执行性的监督者来为当前情况配置你的世界模型。这导致了一个非常奇怪的概念,即意识不是我们思维能力的结果,而是我们大脑局限性的结果。因为我们只有一个世界模型,所以我们必须有意识。如果我们有与我们遇到的情况一样多的世界模型,那么我们就可以同时做所有的事情,而不需要我们称之为意识的那种执行控制。是的,有趣。而且不知何故,也许那个执行控制器,我的意思是,意识的难题,生物学中存在某种化学物质,它创造了一种感觉,就像体验这些事情一样,这有点像难题,那是什么,为什么它有用?也许更实际的问题是,为什么感觉就像你正在体验这些事情比信息正在处理更有用?这可能只是我们进化方式的一个非常好的副作用,它非常有助于让你对你所做的决定,你所做的感知,你试图维护的模型产生一种所有权感。你拥有这个东西,而且它是你唯一拥有的。如果你失去了它,那将非常糟糕。所以你应该给大脑发送一些关于它的信号。你认为哪些想法可能是正确的,但大多数人或至少许多人不同意你的看法?比如说在机器学习领域。嗯,这取决于你和谁谈话。但我认为,当然,有一群人是天生的,他们认为世界上的许多基本事物都硬编码在我们的思维中。比如,你知道,世界是三维的,例如,这是硬编码的吗?你知道,物体永恒性是我们学习的,你知道,在三个月大之前,或者我们天生就拥有它?在认知科学家中存在非常大的分歧。我认为这些东西实际上很容易学习。你知道,V1 中的定向边缘检测器是学习的还是硬编码的?我认为它们是学习的。它们可能在出生前就学会了,因为从视网膜产生信号来训练边缘检测器非常容易。所以,再次,这些都是在睁开眼睛几分钟内就可以学会的东西。我的意思是,你知道,自 20 世纪 90 年代以来,我们就有算法可以在完全无监督的情况下学会定向检测器,相当于几分钟的真实时间。所以,这些东西必须被学会。而且还有那些 MIT 实验,你把一只婴儿雪貂的视神经接到听觉皮层,然后那个听觉皮层基本上变成了视觉皮层。所以,显然那里发生了重构。所以,我认为很多人认为非常基本以至于需要硬编码的东西,我认为很多这些东西都是学会的,因为它们很容易学会。所以你非常重视学习的力量。你认为哪些东西可能无法学会?有没有什么东西是无法学会的?所以你的内在驱动力不是学会的。它们是那些,你知道,使人类成为人类的东西,或者使猫与狗不同,对吧?它们是基本驱动力,它们被硬编码在我们的基底神经节中。我的意思是,有人在研究这类东西,在强化学习的背景下被称为内在动机。所以这些是目标函数,奖励不是来自外部世界,而是由你自己的大脑计算的。你自己的大脑计算你是否快乐,对吧?它测量你的舒适或不适的程度。而且,因为是你自己的大脑在计算这个,所以它可能也知道如何估计这个的梯度,对吧?所以,当你的目标是内在的时候,学习起来更容易。所以这必须是硬编码的。那个做出长期预测的评论员,即最终结果,是学会的,感知是学会的,你的世界模型也是学会的。但是让我举一个例子,关于评论员,关于评论员如何被学会。如果我来找你,你知道,我伸手穿过桌子,捏你的胳膊。完全出乎你的意料。你一直都在预期。但是的,为了故事的缘故,是的。好的,你的视觉神经节会亮起来,因为它会很痛。现在你的世界模型包括了我可能会捏你这个事实,如果我靠近我的,不信任人类,我的手伸向你的胳膊。所以,如果我再试一次,你会退缩。那就是你的评论员,你的预测者,你的最终痛苦预测系统,预测了当你不小心时会发生坏事,以避免它。所以即使那个也可以学会。这是肯定的。这就是让你能够定义一些目标,对吧?所以,你知道,你是一个学童,早上醒来去学校。你知道,这不是因为你一定喜欢早起去学校,而是因为你知道有一个长期的目标你在努力优化。欧内斯特·贝克尔,我不确定你是否熟悉这位哲学家。他写了《死亡的否定》这本书。他的观点是,人类的核心动机之一是我们对死亡的恐惧。这就是我们与猫的不同之处。猫只是在生存,它们没有深刻的认知反省,即地平线上就是终结。他说,你知道,有一个恐惧管理理论,所有这些心理学实验都表明,基本上,人类文明的一切,我们创造的一切,都是试图忘记,即使是短暂的时刻,我们将会死去。你认为人类什么时候明白他们会死?它也是早期学会的吗?我的意思是,在什么点,你知道,你意识到,你知道,死亡到底是什么?我认为大多数人实际上并没有意识到死亡是什么。我的意思是,大多数人相信他们会去天堂什么的。好吧,那么为了反驳这一点,欧内斯特·贝克尔所说的,以及 Sheldon Solomon 等人,我认为这些想法有点引人注目,那就是生活中会有一些时刻,早期生活中,很多这种乐趣发生在早期生活中,当你确实深刻地体验到这种认识的恐惧时。所有关于宗教的想法,所有这些我们认为更像青少年时期及以后的事情,我们谈论的是更早的时候。不,就像七八岁左右。是的,你意识到,我的天,这是,就像神秘,恐惧。这几乎就像你是一只小猎物,一只小鹿,坐在丛林或森林的黑暗中,环顾四周。黑暗充满了恐惧。我的意思是,那个认识说,好吧,我将回到我思想的舒适区,那里有一个深刻的意义,那里有一个,也许就像假装我不朽,无论如何,任何想法,我可以构建来帮助我理解我不朽。宗教对此有帮助。你可以用各种方式欺骗自己,比如迷失在日常的忙碌中,心中有小目标,所有这些事情,认为它会永远持续下去。你知道你会死,是的,而且会很伤心,但你并不真正理解你会死。所以,这是他们的想法。而且,如果我觉得它引人注目,因为它似乎是人类天性中一个核心的独特方面,我们能够思考,我们能够真正理解生命是有限的。这似乎很重要。这里有几种不同的情况。首先,我认为我们和猫之间没有定性差异。我的意思是,我认为差异在于我们只是有更好的长期预测能力。所以我们对世界运作方式有更好的理解。所以我们对金融,对生活等等有更好的理解。所以我们比猫有更好的规划引擎。是的,好的。但是规划的动机是什么?我认为这只是一个副作用,因为我们有更好的规划引擎。因为我们更聪明,作为副作用,我们也能够对我们自己的存在或不存在做出预测。你说宗教对此有帮助。我认为宗教反而有害。它让人们担心,比如,你知道,死后会发生什么等等。如果你相信,你知道,你死后就不复存在了。所以,比如,你知道,它解决了。
完全地,这个问题至少你是在说,如果你不相信上帝,你就不担心死后会发生什么。是的,我不知道你为什么担心,你知道,这一生,因为这是你唯一拥有的一生。我认为,嗯,我不知道,如果我要说欧内斯特·贝克尔说了什么,我说我更同意他,而不是不同意,那就是,嗯,你确实非常担心,嗯,如果你,如果你相信没有上帝,仍然有一种深深的担忧,就像对这一切的神秘感,就像这怎么说得通,它就结束了。我不认为我们能真正理解这次旅程,我的意思是,我们生活中的很大一部分,意识,自我,都投入到这个,这个存在中,然后科学不断地将人类从其基座上拉下来,是的,这是另一个例子,这很棒,但对我们个体人类来说,我们不喜欢被从基座上拉下来,就像,但你看,你对此没意见,因为,嗯,所以欧内斯特·贝克尔会说,你对此没意见,因为这对你来说是一种更平静的存在,但你并没有真正没意见,你是在躲避,事实上,一些经历过最深创伤的人,嗯,在他们寻求广泛治疗之前,他们常常会说,我没事。就像当你和真正生气的人说话时,你怎么样?我没事。问题是,现在发生了什么?我经历了一次濒死体验,我17岁时发生了一次非常糟糕的摩托车事故。所以,但这并没有影响我对那个话题的思考,所以基本上我只是在扮演一点魔鬼的代言人,进行反驳,并想知道是否真的可能接受死亡,而更有趣的另一面,我认为对人工智能和机器人来说,是拥有这个作为一系列动机之一有多重要,不仅仅是避免从屋顶上摔下来之类的,而是思考旅程的终点。如果你听斯多葛派的说法,它,它是一个很好的激励因素,它增加了一种紧迫感,所以也许真正害怕死亡或意识到它可能会给当下带来更深的意义和紧迫感,去充分地生活。嗯,也许我不同意这一点,嗯,我的意思是,我认为这里激励我的是,嗯,你知道,更多地了解人类的本性。我的意思是,我认为,嗯,人类的本性和人类的智能是一个巨大的谜团。这是一个科学的谜团,嗯,除了,你知道,哲学等等。但是,你知道,我是一个真正的科学信徒,所以,嗯,而且,而且,而且我确实有一种信念,对于像大脑这样的复杂系统,心灵,理解它的方式是尝试用你建造的,你知道,人造物来复制它,因为你知道,当你尝试建造它时,什么对它至关重要,你知道,我以前用过这个类比,我相信,嗯,就像我们只有在开始建造飞机时才开始理解空气动力学,这帮助我们理解鸟类是如何飞行的,你知道,所以我想这里有一个类似的过程,我们没有一个关于完全智能的理论,但是建造,你知道,智能人造物将帮助我们也许发展一些,你知道,潜在的理论,它不仅包括人工智能,也包括人类和生物智能。所以你是一个问这个问题关于各种不同其他智能实体或智能的有趣的人。你对图灵测试或中文房间问题有什么看法?如果我们创造一个表现出很多智能和意识特性的 AI 系统,你对将该实体视为智能或有意识有多舒服?所以你现在正在尝试构建具有智能的系统,并且有关于它们性能的指标,但该指标是外部的,好吗?所以你是否可以称一个东西为智能?你会像大多数人类一样,再次不高兴地从意识/智能的基座上被拉下来吗?不,我,我将非常高兴地通过构建具有相似能力的机器来更多地了解人类的本性、人类的心灵和人类的智能。如果这导致人类从其已经可以接受的基座上降低一个档次,我没关系,我没关系,这只是生活的现实。嗯,所以我对这个没意见。现在你问我一些我持有但很多人可能不同意的观点。我认为,如果我们考虑一个自主智能系统的设计,假设我们在某个层面上成功地让机器学习世界的模型,预测世界的模型,我们构建了内在的动机目标函数来驱动该系统的行为,该系统还具有感知模块,允许它估计世界的状态,然后找到一种方法来确定一系列动作,你知道,以优化特定目标。如果它有一个像之前描述的那种批评者,那个让你想起我第二次试图捏你时伸出的手臂的东西,智能自主机器将拥有情感。我认为情感是自主智能的组成部分。如果你有一个由内在动机驱动的智能系统,由目标驱动,如果它有一个批评者,可以让你提前预测一个情况的结果是好是坏,它将拥有情感,它将拥有恐惧,是的,当它预测结果会不好并且需要避免时,它将拥有欣喜,当它预测结果会好时。嗯,嗯,如果它有与人类建立联系的驱动力,你知道,在某些方面,就像人类那样,你知道,它将是社交的,对吧?所以它将拥有关于依恋和类似事物的感情。所以,嗯,所以我想,你知道,那种科幻小说里,你知道,你看到指挥官数据,就像有一个可以关闭的情感芯片一样,我认为那是荒谬的。所以,我的意思是,这里有一个困难的哲学和社会问题。你认为会有像机器人权利运动这样的时期吗?就像,好吧,忘了运动,但像最高法院那样的讨论,特定种类的机器人,你知道,特定种类的系统,应该享有与人类相同的权利,因为它们可以像人类一样遭受痛苦,所有这些事情?嗯,也许,也许不是,想象一下,人类可以,你知道,死亡并复活,就像,你知道,你可以被3D打印出来,你知道,你的大脑可以被最精细地重建。在这种情况下,我们对权利的看法将改变。如果你总是可以,总是有备份,你总是可以恢复,也许谋杀的重要性会降低一个档次。没错,但你的,你的,你知道,做危险事情的愿望,比如,你知道,你知道跳伞或者,你知道,或者赛车,你知道,赛车所有这些东西,你知道,可能会增加,或者,你知道,飞机特技表演或者类似的东西,对吧?是的,做很多这些事情或者探索,你知道,危险区域和类似的事情会很好。它会改变你的关系。所以现在很有可能机器人会是那样的,因为,你知道,它们将基于可能与当今技术相似的技术,而且你总是可以有备份。所以这是可能的。我不知道你是否喜欢电子游戏,但有一个叫做暗黑破坏神的游戏,嗯,哦,我的儿子们是这个游戏的忠实粉丝,是的,事实上,他们制作了一个受它启发的游戏,太棒了,我的三个儿子之间有一个游戏设计工作室,是的,太棒了,他们推出了一个游戏,就像,去年刚推出的,不,这是去年,大约一年前,太棒了,但在暗黑破坏神中,有一个叫做硬核模式,如果你死了,你就没了,就是这样,就是这样了。所以,对于人工智能系统来说,它们能够成功运行,并且我们以某种方式对待它们是可能的,因为它们必须融入人类社会,它们必须能够死亡,不允许复制,事实上,复制是非法的。对于人类来说也是可能的,比如克隆是非法的,即使克隆不是复制,对吧?我的意思是,你不会复制那个人的思想和经历,对吧?它只是一个延迟的双胞胎。但是,然后,就像我们和电脑谈论的那样,你将能够复制你,对吧?你将能够完美地保存,腌制,思想状态,而且这可能是非法的,因为它违背了,它将摧毁系统的动机。好吧,假设你,你有一个家用机器人,嗯,未来某天,是的,然后家用机器人,你知道,来到你身边,你知道,经过一些预先训练,你知道,它可以做很多事情,是的,但它有一个特殊的个性,使其与其他机器人略有不同,因为这使它们更有趣,然后因为,你知道,它和你一起生活了五年,你已经对它产生了一些依恋,反之亦然,它已经学到了很多关于你的东西,或者也许它不是一个家用机器人,也许它是一个虚拟助手,生活在你的,你知道,增强现实眼镜里,或者别的什么,你知道,恐怖电影那种,嗯,而那个系统在某种程度上,那个系统的智能有点像你的孩子,或者也许是你的博士生,在某种意义上,现在你身上有很多东西在这个机器里,对吧?是的,所以如果它是一个活的东西,你愿意免费这样做,如果你愿意,对吧?如果它是你的孩子,你的孩子可以,你知道,过自己的生活,你知道,他们从你那里学到东西并不意味着你拥有它,对吧?是的,但是如果它是一个你训练过的机器人,也许你有一些,是的,知识产权主张,关于知识产权,哦,我以为你的意思是,永久的价值,在这个意义上,你的一部分在这个里面,嗯,是的,有永久的价值,所以如果你失去了那个机器人,你没有备份,你会损失很多,你知道,很多投资,你知道,就像,你知道,一个人死去,你知道,你朋友的朋友快死了,或者你的同事,或者类似的东西,但是,而且,你也有知识产权,因为那个系统是为你特定的存在而微调的,所以现在它是原始背景模型的一个非常独特的实例,无论它是什么,然后还有隐私问题,对吧?因为现在想象一下,那个机器人有自己的意志,决定为别人工作,或者,你知道,认为和你一起生活是不可行的,或者别的什么,嗯,现在所有你从它那里学到的东西,你知道,你怎么能,你知道,删除那个系统知道的关于你的所有个人信息?是的,我的意思是,这将是一个道德问题,你知道,你能抹去一个智能机器人的思想,以保护你的隐私吗?是的,你不能对人类这样做,你可以让他们闭嘴,但你对他们没有完全的控制权,你不能抹去人类,是的,这是人际关系的问题,你知道,你分手了,你不能,你不能抹去另一个人,和机器人一样,我认为机器人也必须如此,那个风险,必须有,我们互动的风险,才能真正深刻地体验它们。感觉就像你必须能够失去你的机器人朋友,而那个机器人朋友去发推文说你有多么糟糕,但然后你是否被允许,你知道,谋杀机器人来保护你的私人信息?是的,可能决定离开,我有一个情况,对于某些机器人,就像,几乎就像,监管,如果你宣布你的机器人,让我们称之为有感知能力,或者别的什么,就像,这个机器人是为人类互动设计的,那么你就不能谋杀这些机器人,这和谋杀其他人类一样。但是,你备份了机器人,你在硬盘上或者未来的等价物上保存了它,这可能也是非法的,就像优先,盗版是非法的,但它是你自己的,你自己的机器人,对吧?但你不能,你不能,但然后,但然后你可以抹去他的大脑,所以这个机器人不再知道你任何事情了,但你仍然在技术上存在,因为你备份了它,然后最高法院将会有伟大的演讲,说,当然,你可以抹去机器人的思想,就像你可以抹去人类的思想一样,我们都可以遭受痛苦,会有一些史诗般的,像奥巴马式的角色,发表演讲,我们喜欢机器人,人类也是一样的,我们都可以遭受痛苦,我们可以希望,我们可以,所有这些事情,养家糊口,所有这些事情,这很有趣,就像你说的,情感似乎是人类互动,人机互动中一个非常强大的方面,如果它们能够表现出情感,最终,这可能会让我们深刻地考虑人权,我们重视人类什么,我们重视其他动物什么,这就是为什么机器人和人工智能很棒,它让我们提出,嗯,很好的问题,困难的问题,是的,但你问了关于中文房间论证,你知道,如果它看起来是真的,它就是真的吗?我认为中文房间论证是荒谬的,所以,所以,所以对于不知道中文房间的人来说,你,你不能,我甚至不知道如何很好地表述它,但基本上,你可以模仿一个智能系统的行为,只需遵循一个巨大的算法代码本,它告诉你确切的响应方式,在每个确切的情况下,但这真的是智能吗?它就像一个巨大的查找表,当这个人说这个,你就回答这个,当这个人说这个,你就回答这个,如果你知道它是如何工作的,你有一个巨大的,几乎无限的查找表,这真的是智能吗?因为智能似乎是一种比这个查找表更有趣、更复杂的机制。我不这么认为。所以,我的意思是,真正的问题在于,你认为,你知道,你能以某种方式机械化智能吗?即使这涉及到学习,答案当然是肯定的。毫无疑问,机器在某个时候将比人类在人类智能的所有领域都更智能。这不是明天的事,这需要很长时间,无论埃隆和其他人说了什么或相信什么,这比许多,许多那些人认为的要难得多,而且许多五年前认为它更简单的人,现在我认为它很难,因为它已经过去了五年,他们意识到这需要更长的时间。这包括很多人,比如 DeepMind。但是,嗯,哦,有趣,我实际上还没有和 DeepMind 的人联系过,但其中一些,埃隆或者,民主,我的意思是,有时你的角色,你必须创造比远近更近的截止日期,你知道,为了创造一种紧迫感,因为你知道,你必须相信不可能的事情是可能的,才能完成它,当然,这枚硬币还有另一面,但如果你想做成某事,你不能太愤世嫉俗。绝对,我同意这一点,但是,我的意思是,你必须激励人们,对吧?去从事一些雄心勃勃的事情。所以,你知道,它,它肯定比我们相信的要难得多,但毫无疑问,这将会发生,现在,你知道,人们有点担心这意味着什么,对人类来说,他们将被从他们的基座上拉下来,你知道,很多档次,而且,你知道,这会是好是坏?我的意思是,它只会提供更多的力量,对吧?它实际上是人类智能的放大器。所以,说到做酷的、雄心勃勃的事情,Facebook AI 研究小组最近庆祝了它的八周年生日,或者也许你可以纠正我。回顾过去八年,有哪些成功、失败、经验教训?也许你也可以解释一下新成立的 Meta AI 在其中扮演什么角色,它与 FAIR 有什么关系?所以,让我告诉你一点关于这一切的组织。嗯,是的,FAIR 成立了将近八年了,它当时还不叫 FAIR,几个月后才取了这个名字。当时我加入 Facebook 时,有一个叫做 AI 小组的组织,大约有12名工程师和几名科学家,就像,你知道,十名工程师和两名科学家之类的。我担任主管三年半,聘请了第一批科学家,并设定了文化,组织了它,你知道,向 Facebook 的领导层解释了基础研究是什么,它如何在行业内运作,以及它需要开放等等。我认为这是一个毫无疑问的成功,因为 FAIR 同时产生了顶尖的研究,推进了科学和技术,提供了开源工具,比如 PyTorch 和许多其他工具。但同时,它对当时的 Facebook,现在的 Meta,产生了直接或间接的影响,因为 Meta 现在围绕的许多系统都基于 FAIR 开始的研究项目。所以,如果你现在从 Facebook 服务和更广泛的 Meta 中移除深度学习,我的意思是,公司将名副其实地崩溃,我的意思是,它现在完全建立在人工智能之上,而且对运营至关重要。所以,三年半后发生的事情是,我改变了角色,我成为了首席科学家,所以我不再管理 FAIR 的日常事务了。我更多的是,你知道,思考战略之类的事情,而且我进行自己的研究,我,我有一个自己的研究小组,专注于星际监督之类的事情,这些事情在我担任主管时没有时间做。所以,现在 FAIR 由 Joel Pineau 和 Antoine Board 共同管理,因为 FAIR 现在实际上分成了两部分。有一个叫做 FAIR Labs,它是自下而上、由科学家驱动的研究,还有一个叫做 FAIR Excel,它组织得更严密,用于需要更多专注和更多工程支持的更大项目。所以,Joelle 负责 FAIR Labs,Antoine Bourne 负责 FAIR Excel。它们在哪里?它们总是分散在各地。所以,毫无疑问,公司领导层相信这是一项非常有价值的投资。这意味着,它将是长期的,对吧?所以,如果你想用这些术语来说,我不喜欢,有一个,有一个商业模式,如果你愿意,在那里,尽管 FAIR 是一个非常基础的研究实验室,但它为公司带来了很多价值,要么主要通过其他群体间接带来。三年前半我辞职时,还成立了 Facebook AI,这是一个更大的组织,涵盖了 FAIR。FAIR 包含在其中,但也有其他专注于应用研究或 AI 技术高级开发的组织,这些组织更,你知道,专注于公司的产品。因此,对基础研究的强调较少,不那么基础,但它仍然是研究,我的意思是,这些组织也发表了很多论文,人们很棒,很棒,你知道,互动起来很棒,但它服务于,你知道,一种方式,你知道,如果你想扩展,你知道,人工智能技术,你知道,可能非常实验性,你知道,实验室原型,变成可用的东西。所以 FAIR 是 Meta AI 的一个子集,FAIR 变成了像 KFC 一样吗?它会保留 F,没有人关心 F 代表什么,我们很快就会知道,嗯,大概在 2021 年底,这不是一个巨大的变化,梅尔,梅尔听起来不太好,但是,你知道,品牌人们正在决定这件事,他们犹豫了很长时间,他们,你知道,他们告诉我们,他们将就 FAIR 是否要改名,或者我们是否要改变 F 的含义给出答案。哦,这是个好主意,我会保留 FAIR 并改变 F 的含义,那将是我的偏好,你知道,我会把 F 变成 Fundamental。哦,那太好了,是的,然后是 Meta AI,这将是 FAIR,FAIR,是的,但你知道,人们会称之为 FAIR,对吧?是的,正是如此,我喜欢。现在 Meta AI 是 Reality Lab 的一部分,你知道,Meta,现在的 Facebook 叫做 Meta,它分为,你知道,Facebook、Instagram、WhatsApp 和 Reality Lab。Reality Lab 是关于,你知道,AR、VR,你知道,远程呈现通信部分,技术等等。你可以把它看作是,你知道,一种结合,你知道,新产品和,你知道,Meta 的技术部分。是那里有用于机器人的触觉传感吗?我看到你发了关于那个的帖子。那是,那是 FAIR 的一部分,实际上,那是,那是。哦,是吗?是的,这是,不,但还有另一种方式,那个触觉手套,对吧?是的,那更多的是 Reality Lab 的研究。我必须研究。但顺便说一句,触觉传感器非常有趣,就像将这种模式整合到整个传感套件中非常有趣。所以,你对元宇宙有什么看法?你对 Facebook 和 Meta 在世界上的角色扩张有什么看法?所以,元宇宙确实应该被视为互联网的下一步,你知道,试图,你知道,让体验更具吸引力,你知道,与他人或内容连接,你知道,我们已经进化并训练成在,你知道,3D 环境中进化,在那里,你知道,我们可以看到其他人,我们可以和他们交谈,你知道,当我们靠近他们时,或者,你知道,其他人很远,可以听到我们,你知道,诸如此类的事情,对吧?所以,有很多现实世界的社会习俗,我们可以尝试移植。那么,最终它将有多吸引人呢?就像,你知道,人们是否愿意这样做,如果他们必须整天戴着,你知道,一副巨大的护目镜?也许不会,但再次,如果体验足够引人入胜,也许会,或者如果他们必须佩戴的设备就是一副眼镜,你知道,技术取得了足够的进步。你知道,AR 是一个更容易理解的概念,你将拥有,你知道,增强现实眼镜,它们基本上包含某种,你知道,虚拟助手,可以帮助你日常生活,但同时,有了 AR,你必须应对现实,有了 VR,你可以完全摆脱现实。它给了你自由,在 VR 中设计世界可能更容易,是的,但你可以想象,你知道,元宇宙将是一个混合体,混合体,对吧?或者,就像你可以拥有存在于元宇宙中的物体,你知道,出现在现实世界的顶部,或者只存在于虚拟现实中。好吧,让我问一个难题。哦,因为所有这些都很容易,这很容易。Facebook,现在的 Meta,这个社交网络被媒体描绘成对社会净负面影响,有时甚至是破坏性和邪恶的。你曾反驳过这一点,为 Facebook 辩护。你能解释你的辩护吗?所以,公司,它在一些媒体中被描述,不是我们工作时所认识的公司。而且,你知道,有人可能会说,很多员工都不知道公司里真正发生的事情,但是,你知道,我是一名副总裁,我的意思是,我对公司里发生的事情有相当好的了解。我不知道一切,显然,我没有参与所有事情,但肯定不是关于,你知道,内容审核或类似的事情的决定,但是,但是,我确实,你知道,对发生的事情有相当不错的了解,而这种被描述的邪恶,我就是看不到。然后,你知道,我认为有一个容易接受的故事,那就是,你知道,世界上所有的坏事,而且,你知道,你的朋友相信疯狂的事情的原因,你知道,有一个容易的替罪恶感,在,在,在社交媒体上,总的来说,Facebook 特别是。但你必须看看数据,就像,Facebook 是否会使人们在政治上两极分化?是否有学术研究表明这一点?就像,你知道,青少年,如果他们更多地使用 Instagram,他们会更看不起自己吗?就像,你知道,如果人们更多地使用 Facebook,或者更少使用 Facebook,他们是否会更激烈地反对,你知道,辩论中的另一方,或者政治观点?研究接二连三地表明,这些都不是真的。这些是学术界的独立研究,不是由 Facebook 或 Meta 资助的。你知道,斯坦福大学的一项研究,我的一些纽约大学的同事,实际上,我和他们没有联系,你知道,最近有一项研究,他们付钱给人们,我认为是在,前南斯拉夫,我不确定具体是哪个部分,但他们在塞雷尼大屠杀周年纪念日之前一段时间,付钱给人们不使用 Facebook。你知道,人们会激动起来,就像,我们应该有一个庆祝活动吗?你知道,一个纪念性的庆祝活动吗?所以他们付钱给一群人,让他们几周不使用 Facebook。结果是,那些人最终比一开始更加两极分化,而那些更多使用 Facebook 的人则两极分化程度更低。有一项研究,你知道,来自斯坦福大学的经济学家,他们试图找出美国日益两极分化的原因,而且这种情况已经持续了40年,在你出生之前,你知道,马克·扎克伯格出生之前,是的,持续不断。所以,如果有一个原因,那不是 Facebook 或社交媒体。所以,你可以说社交媒体只是加速了,但不是,我的意思是,基本上是美国两极分化的持续演变。然后,你将这种情况与其他国家进行比较,比如,德国西部,因为你不能去东部40年,东部,或者丹麦,或者其他国家,他们使用 Facebook 的频率与此相同,他们并没有变得更加两极分化,他们变得两极分化程度更低。所以,如果你想寻找,你知道,因果关系,你可以找到一个替罪羊,但你找不到原因。现在,如果你想解决问题,你必须找到正确的原因。而让我感到愤怒的是,人们现在指责 Facebook 做了别人所做的坏事,而我们对那些人却无能为力。顺便说一句,那些人包括《华尔街日报》的所有者,所有那些报纸都在那里发表。我应该提到,我正在这个播客上与 Shrek Mike Schrepp 和 Mark Zuckerberg 交谈,而且很可能你可以和他们进行这些对话,因为对我来说非常有趣,即使 Facebook 有一些可衡量的负面影响,你也不能孤立地看待它,你必须考虑它连接我们的所有积极方式。所以,就像任何技术一样,有人的问题,这是关于你不能只是说,就像,你知道,分裂在增加,是的,可能谷歌搜索引擎造成了分裂的增加。我们必须考虑它给世界带来了多少信息。我敢肯定维基百科造成了更多的分裂,如果你只看分裂,我们必须看看世界的全部背景,它没有让世界变得更好,是的,印刷机造成了更多的差异,对吧?正是如此。所以,你知道,当印刷机发明时,印刷的第一批书籍是圣经之类的东西,这使得人们可以自己阅读圣经,而不是仅仅从欧洲的牧师那里获得信息,他们创造了,你知道,新教运动,以及200年的宗教迫害和战争。所以,这是印刷机的一个坏副作用。你知道,社交网络并没有像印刷机那样糟糕,但没有人会说印刷机是个坏主意。是的,很多是看法,而且这里有很多不同的激励因素在起作用。也许快速评论一下,因为你是 Facebook,或者说 Meta 的高层领导之一,在科技领域,我敢肯定 Facebook 涉及很多需要解决的令人难以置信的技术挑战。很多可能是在计算机基础设施、硬件方面,我的意思是,这只是一个巨大的数量。也许你能告诉我,Shrek 的生活中有多少是 AI,多少是底层计算,有多少是到处飞来飞去处理业务事务,Mark Zuckerberg 也是如此。他们真的专注于 AI 吗?我的意思是,当然,在,在 FAIR 的创建过程中,以及,你知道,至少一年之后,如果不是更长的话,Mark 非常非常专注于 AI,并且投入了相当多的精力。这就是他的风格,当他对某事感兴趣时,他会阅读所有相关内容。你知道,他读过我的一些论文,比如在他加入之前,你知道,他学到了很多关于它的东西,就像笔记一样。而且,你知道,Schvepp 也真的很喜欢它,我的意思是,Tripe 真的,你知道,有一些我试图保留的东西,尽管我,我年龄不小了,那就是对科学和技术的惊奇感,他当然有。他也是一个很棒的人,我的意思是,在管理方面,比如与人打交道等等,Mark 也一样。我的意思是,他们非常,你知道,非常人性化,就 Mark 而言,令人震惊的人性化,你知道,考虑到他的,他的轨迹。我的意思是,媒体对他的描绘完全是错误的。但是,你必须知道如何与媒体打交道,所以,我把一些责任也归咎于他。你必须,就像,你知道,就像管弦乐队的指挥一样,你必须以某种方式与媒体和公众打交道,你向他们传达你真实的自我,如果有深度和善良,这很难,而且他可能不是最好的。所以,是的,你必须学习,而且,看到这一点很伤心,我会和他谈谈,但是 Shrek 正在慢慢退居二线,看到人们在那里待了很长时间,然后慢慢地,我想他已经完成了他设定的目标,而且,你知道,他有,你知道,家庭优先事项之类的,而且,我理解,你知道,13年后,这已经是一段很棒的旅程了,在硅谷,这基本上是一辈子了。你知道,因为,你知道,这是狗年,所以,在欧洲,会议刚刚结束,让我回到别的事情,你发布了一篇你合著的论文,正如你自豪地引用的那样,被拒绝了,你能开玩笑吗?是的,我知道,你能描述一下这篇论文吗?就像,它的想法是什么?也许这是一个问这个问题的好机会,什么是优点和缺点,什么有效,什么无效,关于评审过程?让我先谈谈论文,然后谈谈评审过程。这篇论文叫做 VKrag,这是我之前提到的,方差协方差正则化,它是一种技术,一种非对比学习技术,用于我称之为联合嵌入架构,所以,Siamese 网络是联合嵌入架构的一个例子。所以,联合嵌入架构是,让我稍微回顾一下,对吧?所以,如果你想做监督学习,你可以通过预测来做。所以,假设你想训练你的系统来预测视频,你给它看一个视频片段,然后你训练系统来预测视频的延续。现在,因为你需要处理不确定性,因为有很多,你知道,很多可能的延续,你需要以某种方式处理它,你需要有一个方法让系统能够产生多个预测。我所知道的唯一方法是通过所谓的潜在变量,你有一些隐藏的向量变量,你可以在一组变量中变化,或者从一个分布中抽取,当你改变这个向量时,输出,预测会在一组可能的预测中变化。所以,这叫做,我称之为生成式潜在变量模型。现在,有一种替代方法来处理不确定性,而不是直接预测视频片段的下一个帧,你还通过另一个神经网络来运行它们。所以,你现在有两个神经网络,一个看着,你知道,视频片段的初始部分,另一个在训练期间看着延续。而且,你试图做的是学习这两个视频片段的表示,这些表示对视频片段本身具有最大的信息量,但它们是这样的,你可以轻松地预测第二个视频片段的表示,从第一个视频片段的表示中。而且,你可以用最大化互信息之类的术语来形式化这一点,但没关系,你想要的是信息丰富的表示,你知道,这两个视频片段的,它们是相互可预测的。这意味着,第二个视频片段中有很多细节是无关紧要的。你知道,比如说,一个视频片段包括,你知道,一个摄像机在拍摄场景,将有一个房间的一部分被揭示出来,我可以在一定程度上预测那个房间的样子,但我可能无法预测地面的纹理细节,以及瓷砖在哪里结束等等。所以,这些是无关紧要的细节,也许我的表示会消除它们。所以,我需要以这样的方式训练第二个神经网络,即,每当延续视频片段在所有可能的延续中变化时,表示就不会改变。明白了,所以,它,是的,是的,明白了,在表示空间中,做的事情和你用相似性学习做的事情一样,对吧?是的,所以,所以这是处理多模态预测的两种方法。在第一种方法中,你用潜在变量参数化预测,但你预测的是像素,基本上。在第二种方法中,你不是预测像素,你预测的是像素的抽象表示,并且你保证这个跟踪表示对输入具有尽可能多的信息,但你知道,丢弃了所有你真正无法预测的东西。我曾经是第一种方法的忠实粉丝,事实上,在这篇与 Chain Mishra 的博客文章《暗物质智能》中,我曾倡导过这一点。在过去一年半里,我完全改变了主意,我现在是第二种方法的一个大粉丝。这是因为在过去一年半到两年左右的时间里,提出了一系列小型算法来做到这一点,包括 VKrag,它的前身叫做 Barbie Twins,我提到过,我们 DeepMind 的朋友们的方法叫做 BYOL,还有,还有很多其他方法,它们的工作方式类似。它们都基于联合嵌入的思想,其中一些有一个明确的标准,它是互信息的近似值,其他一些,比如 BYOL,但我们不知道为什么,而且有很多理论论文,但为什么 BYOL 有效?它并不坏,因为我们把它拿出来,它仍然有效,而且,你知道,等等。我的意思是,有一个很大的辩论,但是,但是,重要的是,我们现在有一系列非对比式联合嵌入方法,我认为这是自切片面包以来最好的东西。所以我对此感到非常兴奋,因为我认为这是我们构建预测性世界模型并同时学习世界的分层表示的最佳机会,其中保留了对世界重要的东西,而无关紧要的东西被表示所消除。顺便说一句,表示是图像序列的之前和之后,还是单个图像?它可以是单个图像,也可以是序列,不一定是图像。这可以应用于文本,可以应用于几乎任何信号。我正在寻找普遍适用的方法,而不是特定于,你知道,一种特定的模式,你知道,它可以是音频或其他任何东西。明白了,所以,这篇论文的故事是什么?这篇论文描述了一种这样的方法,这就是 VKrag 方法。所以,作者是 Adrian Bard,他是一名在 FAIR Paris 的住院博士生,由我和 Jean Ponce 共同指导,Jean Ponce 是 École Normale Supérieure 的教授,也是 Inria 的研究主管。这是一个很棒的法国项目,博士生基本上可以在行业里做博士研究,这基本上就是这里发生的事情。这篇论文是关于 Stefan Dunny 的 Bottle Twin 论文的后续,他是我以前的博士后,现在是,与 Li Jing 和 Yurish Montar 以及 FAIR 的许多其他人一起。审稿人提出的一个主要批评是,VKrag 与 Bottle Twin 的区别不够大。但是,你知道,我的印象是,你知道,Bottle Twin 加上一些修复的错误。而且,最终,这就是人们会使用的。但是,你知道,我习惯了被拒绝。所以,它可能会被拒绝,实际上,如果人们使用它,我会非常兴奋。它已经被引用了很多次了。我的意思是,问题就变成了,关于同行评审和会议的更深层问题。我的意思是,计算机科学领域很独特,会议非常受重视,这是第一点,而且,有趣的是,那里的同行评审过程与期刊类似,但速度大大加快了。不是显著加快,但它很快,而且这是一个很好的方式,可以快速地将东西发布给社区,你知道,快速审查,快速展示。所以,不是很快,但更快。但是,尽管如此,它仍然存在许多与同行评审相同的缺陷,因为只有有限数量的人在看,存在偏见,就像,如果你想做新想法,你会被推开。有自私的人,他们可以推断出谁提交了,然后,你知道,对此很挑剔,所有这些东西。是的,我的意思是,那里有很多,你知道,社会现象。有一个社会现象是,由于该领域呈指数级增长,该领域绝大多数人都是非常初级的。所以,作为结果,这是该领域增长的结果。当该领域的规模开始饱和时,你就会遇到审稿人非常缺乏经验的问题。其结果是,你知道,年轻的审稿人,我的意思是,有一个现象是,审稿人试图让自己的生活轻松,而让自己的生活轻松,审查论文非常简单,你只需要找到论文中的一个缺陷。基本上,他们认为他们的任务是找出论文中的缺陷,而大多数论文都有缺陷,即使是好的论文。所以,很容易,你知道,做到这一点,你的工作作为审稿人更容易,如果你只关注这一点。但是重要的是,这篇论文中是否有新想法,可能会影响它。它无关紧要,实验是否那么好,协议是否,你知道,所以,所以,你知道,只要里面有一个有价值的想法,它将影响人们对问题的看法,即使他们最终会做得更好。我认为,那就是让一篇论文有用的东西。所以,这种社会现象的结合造成了一种疾病,它曾经困扰过其他领域,比如语音识别,基本上,你知道,人们在基准测试上追求数字,而且,如果一篇论文在主流的、被广泛接受的方法或问题上带来渐进式改进,就更容易被接受。那些对我来说是无聊的论文。我的意思是,它们不是无用的,你知道,因为,工业,你知道,依靠那种进步,但它们不是我感兴趣的,就新的概念和新想法而言。所以,那些真正试图取得新进展的论文通常无法通过。现在,谢天谢地,我们有 arXiv,arXiv 正是如此。然后,还有开放审查之类的,在那里,你知道,而且,我的意思是,Twitter 是一种开放审查。我坚信,审查应该由成千上万的人进行,而不是两个人。我同意。所以,像 arXiv 这样的,你是否看到了一个未来,很多非常好的论文,它已经是现在了,但一个不断增长的未来,它将只是存档,而你正在一个持续的会议上展示,叫做 Twitter /互联网/ arXiv。Sanity Andre 最近发布了一个新版本。所以,不要对这个特定的,你知道,精英主义的看法,这不是精英主义的问题,而是关于,基本上,推荐和批准的印章,对于那些自己无法做到的人来说。所以,它节省了时间,对吧?如果你依赖别人的意见,并且你信任那些。
人们或那些群体来为你评估一篇论文,这能为你节省时间,因为你知道你不必像以前那样仔细审查论文。你知道它已经引起了你的注意。我的意思是,这整个想法就是一种集体推荐系统,对吧?所以,我实际上对此考虑了很多,大约在 10 到 15 年前,因为当时在 NIPS 有讨论,而且我们正准备和 Yoshi Banjo 一起创建 ICLR。所以我写了一份文件,大致描述了一个评审系统,基本上是这样的:你将你的论文发布在某个存储库上,比如 arXiv,或者现在可以是 OpenReview。然后你可以组成一个评审实体,它相当于一个评审委员会,比如一个期刊或一个会议的程序委员会。你必须列出成员,然后该评审实体可以选择性地评审某篇论文,或者不评审。论文和场地或评审实体之间不再有排他性关系。任何评审实体都可以评审任何论文,或者选择不评审。然后,你可以给出一个评价。它不是已发表或未发表,它只是一个评价和评论,将是公开的,由评审实体签名。如果评审实体是,比如,Lex Friedman,你知道,他喜欢的论文,你知道,就像 Friedman 写了一篇评论。是的。那么对我来说,我认为这是一个很棒的系统。但除此之外,感觉应该有一个针对评审员、评审实体的声誉系统,而不是针对单个评审员。评审实体,当然。但即使在其中也有评审员,因为,呃,这里还有另一件事。这不仅仅是声誉,而是激励个人做得出色的动力。现在,在学术界,这种激励基本上是内在的,只是想做好工作。但老实说,这不足以激励一个人真正出色地阅读论文,并在错误和缺陷以及所有这些东西中找到美。对吧?就像如果你是第一个发现一篇有影响力的论文的人,并且你为此感到自豪,那么这会给你巨大的动力。这实际上是我提案的一个重要部分。我将其描述为,如果你的论文评价能够预测未来的成功,那么你的声誉应该作为评审实体而提高。是的,是的。没错。我的意思是,我甚至有一个硕士生,他是图书馆科学和计算机科学的硕士生,他实际上已经详细研究了这应该如何运作,包括公式和所有东西。那么在实施方面,你认为这是可行的吗?我的意思是,我一直在和各种人谈论这件事,比如 Andrew McCallum,他创立了 OpenReview。我们最初选择 OpenReview 来支持 ICLR 的原因,即使它对他们来说还很早,是因为我希望 ICLR 最终能够启动这种类型的系统。所以 ICLR 保留了开放评审的理念,即评审与论文一起发布,我认为这非常有用。但在很多方面,这又回到了更传统的会议模式。而我,我不是 ICLR 的负责人,我只是基金会的总裁,但那些负责它的人应该决定如何运营它,我不会告诉他们,因为他们是志愿者,我非常感谢他们这样做。但令我感到难过的是,我们不够创新。我也有同感。我希望这种情况能有所改变。是的,因为科学的传播,尤其是计算机科学思想的传播,是让这些思想产生影响的方式。我认为,很多这都是因为人们心中有一个目标,那就是对作者的公平以及能够计算积分,基本上是准确地给予学分。但这是以牺牲科学进步为代价的。所以,在某种程度上,我们正在减缓科学的进步。我们真的实现了公平吗?我们并没有实现公平。你知道,我们有偏见。我们正在进行双盲评审,但偏见仍然存在。有不同种类的偏见。你写道,涌现现象,即大量简单相互作用的元素集合所表现出的集体行为,是让你最初接触神经网络的原因之一。我喜欢细胞自动机,我喜欢简单的相互作用元素以及从中涌现的事物。你认为我们理解复杂系统如何从如此简单的相互作用的组件中涌现吗?不,我们不理解。这是一个巨大的谜团。对物理学家来说是谜团,对生物学家也是。你知道,为什么我们周围的宇宙似乎在增加复杂性而不是减少?我的意思是,这是物理学的一个奇怪的特性,尽管有热力学第二定律,我们似乎在进化和学习等方面,至少在局部上,复杂性在增加而不是减少。所以,也许宇宙的最终目的是变得更加复杂。拥有这些,我的意思是,美丽的复杂性的小区域。这些细胞自动机,这些涌现和复杂系统的例子,是否能给你一些关于机器学习系统和神经网络的直觉或指导?或者它们对你来说是绝望的概念?你让我明白了。我还在大学时就发现了感知器的存在。一本非常好的书,是乔姆斯基和皮亚杰之间的辩论,麻省理工学院的 Seymour Papert 在那本书中称赞了感知器。我第一次听说学习机器。所以我开始深入研究文献,我找到了那些论文和书籍,它们基本上是 50 年代和 60 年代关于自组织系统的研讨会或会议的记录。所以有一系列关于自组织系统的会议,以及关于这个的几本书。其中一些你可以在互联网档案馆找到数字版本。里面有一些引人入胜的文章,作者的名字很大程度上被遗忘了,海因茨·冯·福斯特。他是一位德国物理学家,移民到美国,并在 50 年代和 60 年代研究自组织系统。他在伊利诺伊大学厄巴纳-香槟分校创建了一个生物计算机实验室 BCL,这个实验室完全是关于神经网络的。不幸的是,那是在神经网络流行度即将结束的时候,所以那个实验室从未真正发展起来。但他写了很多关于自组织和自组织之谜的文章。他有一个例子是,想象你在太空,没有重力,你有一个装满磁铁的大盒子。你知道,矩形磁铁,一端是北极,另一端是南极。你轻轻摇晃盒子,磁铁会粘在一起,可能会形成一个复杂的结构,自发地。这可能是一个自组织的例子。但你知道,有很多例子。神经网络在很多方面也是自组织的例子。这是一个谜团,你知道,关于物理系统、混沌系统中的模式形成以及类似的东西,你知道,生命的出现,等等。所以,你知道,这怎么发生的?这对物理学家来说也是一个巨大的谜团。理解某些受限情况下的涌现数学可能会帮助我们创造智能,比如帮助我们为系统增加一点“调味品”,因为你似乎能够从很少的东西中获得很多东西,所以这似乎是取得巨大性能飞跃的捷径。但是,有一个缺失的保守概念,我们没有。而且,这也是我从本科时代就一直着迷的东西,那就是我们如何衡量复杂性?所以,我们实际上没有好的方法来衡量,或者至少我们没有好的方法来解释我们可用的衡量标准。你怎么衡量事物的复杂性?所以,有所有这些东西,你知道,像科尔莫戈洛夫复杂性,或者生成一个比特串的最短程序的长度可以被认为是该比特串的复杂性。我一直对这个概念很着迷。问题是,这种复杂性被定义为一个常数,这个常数可能非常大。有一些类似的概念源于贝叶斯概率论,其中事物的复杂性基本上是其概率的负对数。你在这两者之间有完全的等价性。你可能会认为,概率在数学上是明确定义的,这意味着复杂性也是明确定义的。但事实并非如此。你需要有一个分布模型,如果你进行贝叶斯推理,你可能需要一个先验。而先验的作用与你用来衡量图复杂性的计算机的选择相同。所以,我们拥有的每一种复杂性衡量标准都有一些任意的必要性,一个可以任意大的加性常数。所以,如果我们没有好的复杂性衡量标准,我们怎么能提出一个关于事物如何变得更复杂的好的理论呢?是的,我们需要这个。人们在生物学领域研究这个问题的一种方式是研究生命起源的人,或者试图在实验室中重现生命。更有趣的是外星生命,当我们去其他星球时,我们如何识别这种生命?因为我们可能将复杂性与生命联系起来,也许还有一定的活动能力。我们需要有具体的算法来衡量我们看到的复杂性水平,以便区分生命和非生命。问题是,复杂性是旁观者眼中的事物。让我举个例子。如果我给你一张无尽数字的图像,我翻过任何数字,它都有一些明显的结构,因为局部结构,你知道,相邻的像素在整个数据集中是相关的。现在想象一下,我对所有像素应用了一个固定的随机排列。现在我给你看这些图像,它们看起来会非常混乱,对你来说更复杂。事实上,它们在绝对意义上并没有更复杂,它们和原来的一模一样。如果你知道排列是什么,你就可以撤销它。现在想象一下,我给你一副特殊的眼镜,可以撤销那个排列。突然之间,看起来复杂的东西就变得简单了。所以,如果你有两个人,一边是人类,另一边是另一类外星人,他们戴着排列眼镜看待宇宙。戴着排列眼镜,我们认为简单的事情对他们来说可能非常复杂,可能是热量。是的,热量。是的。而他们认为对我们来说简单的事情,是随机的波动,是热量。所以,真的,这取决于旁观者,取决于你戴着什么样的眼镜,取决于你的感知系统运行着什么样的算法。所以我认为,在我们能够很好地理解复杂性这个概念之前,我们不会有一个关于智能、自组织、进化等方面的理论。是的,这很难过,我们可能无法探测或与外星物种互动,因为我们戴着不同的眼镜。因为他们对局域性的理解可能与我们不同。是的,这实际上与目前物理学中的一些迷人问题有关,比如现代物理学、量子物理学,比如关于黑洞中的信息是否可以恢复等等。而这依赖于复杂性的概念。是的,我觉得这很迷人。你能描述一下你个人制造一种富有表现力的电子吹奏乐器(EWI)的追求吗?它是什么?建造它需要什么?我是一个修补匠,我喜欢制造东西,我喜欢用电子和机械的东西组合来制造东西。我有很多不同的爱好,但可能我最早的是制造模型飞机之类的东西,我还在一定程度上这样做,还有电子产品。在我学习电子产品之前,我就自学了电子产品。我自学电子产品的原因是因为音乐。我的表哥是一位有抱负的电子音乐家,他有一个模拟合成器,我基本上在为他改装它,为他制造排序器之类的东西。我高中时就在做这件事。那很有趣。进步摇滚,80 年代。根据 Yala 的说法,有史以来最伟大的乐队是什么?有太多了。但你知道,这是我的视野管弦乐队、天气报告、是的、创世纪、你知道,像 GENTLE GIANT 这样的组合。好的。所以,这种程度的电子产品和对音乐的热爱结合在一起。我实际上是在尝试演奏巴洛克和文艺复兴时期的音乐,我在高中和大学的头几年都在一个管弦乐队里演奏。我演奏过木管、肖姆号,还演奏过一点双簧管。所以我是一名吹奏乐器演奏者,但我一直想演奏即兴音乐,即使我对它一无所知。我找到的唯一方法,除了学习吹萨克斯管之外,就是演奏电子乐器。它们的指法与萨克斯管相似,但你可以发出各种各样的声音,因为你用它来控制合成器。我有很多这样的东西,可以追溯到 80 年代末,来自 Yamaha 或 Akai。它们都是主要的制造商。它们已经有几十年的历史了。但我从未对它们完全满意,因为缺乏独特性,而且那些东西有点贵。我的意思是,它们测量吹气压力,测量唇部压力,而且你可以用手指改变各种参数,但它们不像原声乐器那样富有表现力。你听到 John Coltrane 演奏两个音符,你就听到了他的 John Coltrane,他有独特的声音。或者 Miles Davis,你可以听到他的 Miles Davis 吹小号,因为声音反映了他们的生理机能,声道的形状塑造了声音。那么如何用电子乐器做到这一点呢?很多年前,我遇到了一位名叫 David Wessel 的人。他是伯克利的一位教授,在那里创建了音乐技术中心。他对这个问题很感兴趣。所以,我一直思考这个问题很多年,最后,因为我当时在家,在我的工作室里。我的工作室也兼作我的 Zoom 房间和家庭办公室。这在新泽西。在新泽西。我开始认真地制造我自己的 EWI 乐器。你的新泽西工作室里还有什么别的吗?你有没有建造过什么疯狂的东西,或者留在工作室地板上,遗留下来的?有很多疯狂的东西,是用各种微控制器建造的电子产品,还有奇怪的飞行器。所以你仍然喜欢飞行。这是家族遗传。我爸爸在我小时候就让我接触了,他小时候就在制造模型飞机。他是一名机械工程师,也自学了电子产品。所以他在 60 年代末 70 年代初制造了他早期的无线电控制系统。这就是让我接触工程、科学和技术的原因。你对飞行还有其他形式的兴趣或欣赏吗?比如无人机、四旋翼飞机,或者你做模型飞机吗?是的。在我成为消费产品之前,我就自己建造了。我还用微控制器、陀螺仪和加速度计来稳定它,编写固件。然后当它成为一种可以购买的标准产品时,就无聊了。我不再做了,不好玩了。是的,你在它流行之前就在做了。你对今天梦想做大事的年轻高中生和大学生有什么建议?比如年轻的 Kun,让我们谈谈智能领域,梦想有机会解决智能领域的一些基本问题,无论是为了他们的职业生涯还是仅仅为了生活。作为一个创造了特殊事物的人,试着对宏大的问题产生兴趣,比如什么是智能?宇宙是由什么组成的?生命是怎么回事?等等。甚至像时间是什么这样疯狂的宏大问题,没有人知道时间是什么。然后学习基础知识,比如数学、物理学或工程学中的基本方法,这些方法具有很长的保质期。如果你有选择,比如学习 iPhone 上的移动编程,还是学习量子力学,那就选择量子力学。因为你将学到你不知道存在的东西。你可能永远不会成为一名量子物理学家,但你将学到路径积分,而路径积分被广泛使用。这与你用于贝叶斯积分等的东西是相同的公式。所以,量子力学中,以及一些更成熟的领域中的一些小思想,将具有更长的保质期,你将在你的工作中以某种方式间接使用它们。学习经典力学,比如学习拉格朗日量,这是一个极其有用的概念,适用于各种不同的事情。学习统计物理学,因为机器学习的所有数学都来自于,基本上来自于 19 世纪末 20 世纪初统计物理学家们发现的东西。而且对其中一些人来说,实际上是最近才由像乔治·佩雷齐这样的诺贝尔奖得主发现的,他因复制方法等而获奖。它被用于很多不同的事情。变分推断的数学来自于统计物理学。所以,很多那些忙碌的课程,如果你学的是电气工程,你会学到信号处理,你会再次学到傅里叶变换,这是一个非常有用的东西。它是图神经网络等的基础,图神经网络是人工智能、机器学习、深度学习的一个全新的子领域,我认为它在各种应用中都非常有前景。如果你对应用更感兴趣,那么人工智能、机器学习和深度学习在科学中的应用,或者在能够帮助解决世界重大问题的科学中的应用,就非常有前景。我在 Meta 的 FAIR 有些同事,我们启动了一个名为 Open Catalyst 的项目。这是一个开放的、协作的项目。其理念是利用深度学习来帮助设计新的化学化合物或材料,以促进从氧气中分离氢气。如果你能有效地用电将氧气和氢气分离,你就解决了气候变化问题。就这么简单,因为你可以用太阳能电池板覆盖一片随机的沙漠,让它们工作一整天产生氢气,然后将氢气输送到需要的地方,你不需要其他东西。你知道,你有可控的能源,可以输送到任何地方。所以,如果我们拥有像生产氢气这样大规模高效的储能技术,我们就解决了气候变化问题。解决气候变化问题的另一种方法是弄清楚如何实现核聚变。核聚变的问题在于,你产生一个超高温等离子体,而等离子体是不稳定的,你无法控制它。也许通过深度学习,你可以找到控制器来稳定等离子体,并制造实用的聚变反应堆。我的意思是,这非常推测,但值得尝试,因为回报是巨大的。谷歌有一个团队在做这个,由 John Platt 领导。将尽可能多的科学、物理学、生物学和化学问题转化为可学习的问题,看看机器是否能学会它。我的意思是,我们不从第一原理理解的复杂材料的性质。例如。所以,如果我们能设计出新的材料,我们就能制造出更高效的电池,我们也许能制造出更快的电子产品,我们就能,我的意思是,我们可以想象很多事情可以做,或者更轻的汽车或飞机的材料,等等。也许是更好的燃料电池。我的意思是,如果我们有好的燃料电池,氢燃料电池,我们可以用它们来驱动飞机和交通工具,我们的汽车就不会有排放问题,空气交通也不会有二氧化 CO2 排放问题了。所以,我认为有很多事情 AI 可以用于。这甚至还没有谈论到所有关于医学、生物学等等。你知道,蛋白质折叠,弄清楚如何设计蛋白质,使其在特定位点粘附在另一个蛋白质上,因为最终这就是药物的设计方式。所以,深度学习将用于所有这些。如果我们能用于这些,那将是巨大的进步。举个例子,这是来自最近的材料物理学。你取一层单原子石墨烯。它只是六边形网格上的碳。你把它做成单原子厚。你再放一层在上面,以某个神奇的角度,比如三度,扭转它们,它就变成了超导体。没有人知道为什么。我想知道它是如何被发现的。但这正是机器学习可以发现的那种东西。也许不行,但也许有一个暗示,通过机器学习,我们可以训练一个系统,基本上成为一个复杂涌现现象的现象学模型,比如超导性。我的意思是,目前的约简主义方法很难从第一原理描述骨架现象。但我们可以拥有深度学习系统,在用足够多的样本训练后,根据系统的描述来预测系统的性质。EPFL 的 Pascal Fua 有一家初创公司,他基本上训练了一个卷积网络来预测固体的空气动力学特性。你可以通过运行计算流体动力学来生成任意多的数据。你给出一个机翼翼型或某种形状,然后运行计算流体动力学,结果是阻力和升力等等。你可以生成大量数据,训练一个神经网络来做出这些预测。现在你拥有了一个关于阻力和升力作为固体形状函数的微分模型。所以你可以进行反向工程,你可以优化形状,以获得你想要的性质。这太不可思议了。这太不可思议了。最重要的是,你可能应该读一些文学和历史来获得灵感和智慧,因为毕竟所有这些技术都必须在人类世界中运作。而人类世界是复杂的。这是一次了不起的谈话。我非常荣幸今天能和你交谈。感谢你在 Meta 的 FAIR 所做的所有了不起的工作,感谢你多年来对所有正在发生的事情如此充满热情。你是机器学习社区的希望灯塔。非常感谢你今天抽出宝贵的时间和我交谈。太棒了。感谢邀请我参加。很高兴。感谢收听与 Kun 的对话。为了支持这个播客,请查看描述中的赞助商。现在,让我用艾萨克·阿西莫夫的一句话来结束。你的假设是你看待世界的窗口。偶尔擦拭一下它们,否则光线就进不来了。感谢收听,希望下次再见。