Transcription
在什么时刻,神经网络才算是一个生命体,而不是一个工具?以下是与 Arielle Vinialis 的一段对话,这是他第二次来到播客。Arielle 是 DeepMind 的研究总监兼深度学习负责人,也是人工智能史上最杰出的思想家和研究者之一。这是 Lex Fridman 播客。为了支持本播客,请查看描述中的赞助商。现在,亲爱的朋友们,这是 Arielle Vinnie Alice,您是人工智能史上最杰出的研究者之一,研究各种模态。也许一个共同的主题是,它总是数据序列。所以我们谈论语言、图像、甚至生物学和游戏,就像我们上次谈论的那样。所以您是问这个问题的好人。在您有生之年,我们能否构建一个能够取代我作为这次对话的采访者的 AI 系统,就提问能力而言,能够吸引听众,然后进一步的问题是,我们是否接近能够构建一个取代您作为被采访者的系统,以创造引人入胜的对话?您认为我们还有多远?这是一个好问题。我想部分原因是我会说,我们想要那样吗?我真的很喜欢我们现在开始与非常强大的模型互动,并将它们视为更接近我们。问题是,如果您消除了对话中的人性化一面,那是否有趣?您知道,那是一个有趣的产物吗?我想大概不是。我见过,例如,上次我们交谈时,我们谈论了星际争霸,以及创建能够玩游戏的代理,这涉及到自我对弈。但最终人们关心的是,当对手是人类时,这个代理是如何表现的。所以毫无疑问,我们可能会被人工智能赋予更多力量。也许您可以从一个 AI 系统中获取一些问题。我的意思是,即使是今天,我也认为很有可能,凭借您的创造力,您可能会找到非常有趣的问题,您可以从中筛选。我们在语言领域有时称之为“挑拣”。同样,如果我现在有工具在我这边,我可以这样说,您提出了一个有趣的问题,从这个答案中,我喜欢这个特定系统创建的几个词。完全取代它对我来说并不那么令人兴奋。尽管在我有生之年,我认为,鉴于发展轨迹,我认为有可能也许会有一些有趣的,也许是自我对弈的采访,就像您建议的那样,看起来或听起来会相当有趣,并且可能会提倡,或者您可以听这些采访来学习一个主题,至少在基本层面上。所以您说这似乎并不让您兴奋,但如果兴奋是目标函数的一部分呢?您优化的是什么?所以您可能拥有大量人类在线交流的数据,如果您正确地看待的话,并且可能有方法来衡量他们所说的参与度。所以您可能可以优化过去最能创造引人入胜对话的问题。所以实际上,如果您严格使用“令人兴奋”这个词,很可能有一种方法可以创造出最令人兴奋的对话,这些对话涉及人工智能系统,至少有一方是人工智能。是的,这说得通。我想也许回到游戏和游戏行业。当您设计算法时,您会考虑获胜作为目标,对吗?或者奖励函数。但事实上,当我们与星际争霸的创作者暴雪讨论这个问题时,我认为什么才是令人兴奋的、有趣的?如果您能衡量并优化它,那可能就是我们玩电子游戏的原因,或者我们为什么会互动、收听或观看猫咪视频或互联网上的任何东西。所以,建模奖励超出了我们在强化学习中使用的明显奖励函数,这确实非常令人兴奋。而且,实际上,在人工智能的一个特定方面,也就是一个对话是否真实,或者信息是否真实,确实取得了一些进展。所以您可以开始尝试从互联网上评估这些,互联网上有很多信息。然后,如果您能学习一个函数,最好是自动化的,这样您也可以更容易地优化它,那么您就可以进行优化非明显事物的对话,比如兴奋。所以是的,这是完全有可能的。然后我想说,在这种情况下,这肯定会是一次有趣的练习,而且相当独特,至少有一方完全由兴奋奖励函数驱动。但显然,系统中仍然会有相当多的人性,既来自构建系统的人,当然也来自最终如果我们考虑为兴奋打标签,这些标签必须来自我们,因为据我所知,很难对兴奋进行计算度量,没有这样的东西。您提到了真相。我甚至敢说,兴奋比真相更容易标记,或者也许失败的后果更低。但也许您提到的那种人性化,也许是某种可以标记的东西,这可能意味着一个进行对话、进行交流的人工智能系统应该是有缺陷的。例如,这就是您优化的东西,它具有固有的矛盾,设计上的缺陷。也许它还需要有强烈的身份认同感,所以它有自己的背景故事,它坚持它,它有记忆,不是从系统的设计方式来看,而是它能够讲述关于它过去的故事,它能够拥有死亡和对死亡的恐惧,以这种方式,它拥有一个身份,就像如果它说了什么愚蠢的话并在推特上被取消了,那对那个系统来说就是终结了。所以它不像您可以重新塑造自己,那个系统就是这样了。所以也许是它的高风险性质,因为就像您现在不能说任何愚蠢的话,或者您会被取消推特,而且这有风险。我认为这部分原因让它变得有趣。然后您就拥有了一个随着时间推移而建立起来的观点,您坚持它,然后人们可以不同意您。所以强烈持有那个观点,持有某种可能是有争议的,至少是强烈的观点,所有这些元素,感觉它们都可以被学习,因为感觉互联网上有大量关于人们发表意见的数据,然后将其与兴奋度量结合起来,您就可以开始创造一些东西,而不是试图优化语法清晰度和真实性,跨越多句话的事实一致性,您优化的是人性化,而且互联网上显然有人性数据。所以我好奇,我好奇是否有这样一个未来,或者我的意思是,我有时会对自己感到好奇。我是一个播客的忠实粉丝,我听一些播客,我想,这个有趣之处是什么?什么吸引人?就像您看其他游戏一样,您说观看星际争霸或让马格努斯·卡尔森下棋。我不是一个国际象棋选手,但对我来说仍然很有趣。那是什么?是它的风险吗?也许是连胜的终结?我不知道。所有这些元素都以某种方式连接到引人入胜的对话。我想知道这有多难取代?因为最终所有这些都连接到如何测试人工智能是否智能的最初命题,与图灵测试,我猜我的问题来自于那个测试的精神。是的,我确实记得,我刚听了我们第一次播客,我们讨论了图灵测试。所以我想从神经网络,人工智能构建者的角度来看,通常您会尝试将许多这些有趣的讨论主题映射到基准测试,然后也映射到这些系统目前是如何构建的,它们如何学习,它们从什么数据中学习,它们在学习什么?我们谈论的是数学函数的权重,然后看看当前的游戏状态,也许我们需要飞跃才能达到所有这些体验的最终阶段?终生经历的恐惧,比如我们现在几乎看不到进展的词语?因为今天发生的是,您获取了所有这些人类互动,在线人类互动的巨大多样性,然后您正在提炼这些序列,回到我的热情,单词、字母、图像、声音的序列。这里有更多的模态可以发挥作用。然后您只是试图学习一个函数,它会很高兴,它会最大化看到所有这些通过神经网络的可能性。现在我认为有几个地方,我们目前训练这些模型的方式显然希望能够发展您所说的能力。我可能会说几个。一个是代理或模型的寿命。所以您从这些离线数据中学习,对吧?所以您只是被动地观察并最大化这个,您知道,这几乎就像一座山,一个山景,然后到处都是人类以这种方式互动的数据,您试图让它更高,然后,您知道,在没有数据的地方降低。然后这些模型通常不会体验自己。它们只是观察者,对吧?它们是被动的数据观察者,然后我们让它们在与它们互动时生成数据。但这非常有限。它们实际体验到的经历,当它们可能正在优化或进一步优化权重时,我们甚至没有这样做。所以要说清楚,再次映射到 AlphaGo、AlphaStar,我们训练模型,当我们将它部署来与人类互动,或者在这种情况下与人类互动,比如语言模型,它们甚至不会继续训练,它们不会以您和我学习的方式学习,权重不会改变。现在有一些东西感觉更神奇,但如果您懂神经网络,那是可以理解的。它们可能不会以改变的严格意义上学习,也许这映射到神经元如何相互连接,以及我们一生中如何学习。但确实,它们进行的对话的语境,当您与这些系统交谈时,它们被保存在它们的工作记忆中。这几乎就像您启动一台计算机,它有一个硬盘,里面有很多信息,您可以访问互联网,互联网上有可能所有信息,但也有一个工作记忆,这些代理,就像我们称它们或开始称它们一样,在其中构建。现在这个记忆非常有限。我的意思是,现在我们正在具体谈论大约 2000 个词,我们能记住,然后超出这个范围,我们就开始忘记我们看到的东西。所以您可以看到,当您说,我的意思是,这是一个非常有趣的话题,已经有一些短期的一致性了。拥有某种映射,一个代理,比如拥有一致性,然后您知道,如果您说,哦,你的名字是什么?它可以记住,但它可能会在 2000 个词之后忘记,这并不算太长的语境,如果我们甚至想到这些播客,书籍要长得多。所以技术上讲,那里有一个限制。对于从事深度学习的人来说,这是一个非常令人兴奋的工作,但我认为我们缺乏基准和技术来拥有这种终生般的记忆体验,这种记忆不断积累。然而,它离线学习的方式显然非常强大。所以,三年前您问我,我会说哦,我们离得很远。我认为我们已经看到了这种模仿的力量,在互联网规模上,这使得它感觉至少是知识,关于世界的基本知识现在已经融入了权重。但这种经历是缺乏的。事实上,正如我所说,当我们与它们交谈时,我们甚至不训练它们,除了它们的工作记忆,当然会受到影响。所以这是动态的部分,但它们不像您和我那样学习,从出生开始,甚至可能在出生之前。所以您问了很多引人入胜的问题。我认为我提到的一个问题是记忆和经验的想法,而不是仅仅观察世界并学习它的知识。我认为对于这一点,我会争辩说,最近的许多进展让我对这个领域感到非常兴奋。然后第二个问题可能是,我们训练所有这些模型都是从头开始的。这是三年前、六年前或十年前我会抱怨的事情。而且感觉如果我们从我们如何到达这里,宇宙如何进化我们,我们不断进化中获得灵感,感觉这是一个缺失的部分,我们不应该每隔几个月就从头开始训练模型。应该有一种方式,我们可以让模型成长,就像一个物种以及宇宙中的许多其他元素一样,从之前的迭代中构建。而从纯粹的神经网络角度来看,即使我们希望它奏效,事实证明很难不,您知道,丢弃之前的权重。这个我们从数据中学到的景观,然后用一套全新的权重刷新它,考虑到可能是最近的数据集快照,我们训练的数据集等等,或者甚至是一个新的游戏,我们正在学习。所以这感觉有些东西从根本上缺失了。我们可能会找到它,但它看起来是什么样的并不清楚。有很多想法,而且也非常令人兴奋。是的,只是为了让那些不知道的人,当您遇到机器学习中的一个新问题时,您会想出一个具有一组权重的架构,然后以某种方式初始化它们,在大多数情况下,这是某种随机版本。这就是您所说的从头开始的意思。而且感觉每次您解决围棋、国际象棋、星际争霸、蛋白质折叠等问题时,都是一种浪费。肯定有办法重用权重,因为我们正在增长这个解决世界上一些最棘手问题的神经网络的巨大数据库。所以其中一些是方法,如何重用权重,如何学习提取可泛化的东西,或者至少有机会做到,然后丢弃其他东西。也许神经网络本身应该能够告诉您,比如,是的,您有什么关于更好地初始化权重的想法?也许退一步,如果我们看看机器学习领域,特别是深度学习。在深度学习的核心,有一个美丽的理念,那就是一个单一的算法可以解决任何任务。它已经被一次又一次地证明,随着越来越多的基准测试和曾经被认为不可能的事情被这个基本原理所破解。那就是您取一个未初始化的神经网络,就像一个空白的计算大脑,然后您给它,在监督学习的情况下,理想情况下,大量的例子,比如,这是输入的样子,期望的输出应该是这样的。我的意思是,图像分类是一个非常清晰的例子,图像到可能一千个类别,这就是 ImageNet 的样子。但许多,如果不是所有问题都可以这样映射。然后有一个通用的食谱,您可以用来,这个食谱几乎不需要改变。我认为这就是深度学习研究的核心。什么是普遍的食谱,对于任何新的给定任务,我都可以使用它,而无需思考,无需为眼前的问题付出很多努力。我们还没有找到这个食谱,但我认为这个领域很兴奋地找到,而不是人们在解决重要问题时发现的那些微调或技巧,而是更通用的算法。所以,在算法层面,我认为我们已经有了一些通用的东西,那就是在大量数据上训练一个非常强大的模型,一个神经网络的公式。在许多情况下,您需要一些针对您正在解决的实际问题的特异性。蛋白质折叠是一个如此重要的问题,它有一些基本的食谱,是从更早的时候学到的,比如 Transformer 模型、图神经网络、来自 NLP 的想法,比如,您知道一个叫做 BERT 的东西,它是一种可以用来帮助模型的损失。知识蒸馏是另一种技术。所以这是我们仍然需要找到一些特定于 AlphaFold 的东西的公式。这非常重要,因为蛋白质折叠是一个高价值的问题,作为人类,我们应该解决它,即使我们需要有点具体。而且有可能其中一些学习将适用于深度学习者正在寻找的下一个食谱迭代。但确实,到目前为止,食谱是共同的,但您通常会丢弃权重,这感觉非常令人难过。尽管也许在过去,尤其是在过去两三年里,当我们上次交谈时,我提到了元学习这个领域,也就是学习如何学习的想法。并且已经取得了一些进展,我可以说主要是从 GPT-3 开始,仅在语言领域。在这种情况下,您可以设想一个模型,它被训练一次,然后这个模型不是狭隘的,它只知道如何翻译一对语言,或者它只知道如何为句子分配情感。这些实际上,您可以教它通过提示,称为提示,而这个提示本质上只是向它展示一些更多的例子,几乎就像您向算法过程展示输入输出示例一样,来创建这个模型。但现在您通过语言来做,这是一种非常自然的相互学习方式。我告诉您,嘿,您应该做这个新任务,我告诉您更多一点,也许您问我一些问题,现在您知道了任务,对吧?您不需要从头开始重新训练它。我们已经看到了这些神奇的时刻,通过语言进行提示,仅在语言领域。然后在过去两年里,我们看到这些扩展到了语言之外,增加了视觉,增加了动作和游戏。有很多进展可以取得。但这也许,如果您问我关于我们如何解决这个问题,这可能是一种方式,您有一个单一的模型。这个模型的挑战是它很难在权重或容量上增长。但这个模型非常强大,您可以教它一些任务,就像我教您一样,我现在可以教您一个新任务,如果我们是,比如说,一个文本任务,或者一个视觉风格的任务,或者一个分类任务。但仍然感觉需要更多的突破。这是一个伟大的开始,对吧?我们有一个很好的基线,我们有一个想法,这也许是我们想要衡量进展的方向,朝着 AGI 的方向。而且我认为,在我看来,这对于让社区朝着这个方向汇聚至关重要,这是件好事。然后这实际上也让我兴奋,关于深度学习的下一步是什么。如何让这些模型更强大?如何训练它们?如何让它们成长?如果它们必须成长,当您教它任务时,它们是否应该改变权重,或者不?有一些有趣的问题,很多问题有待解答。是的,您打开了通往一系列我想问的问题的大门。但首先,让我们回到您的推文,并像莎士比亚一样阅读它。您写道:“Gato 不是终点,而是起点。”然后您写道:“喵。”然后是一个猫的表情符号。所以,第一个问题是,您能解释一下“喵”和猫的表情符号吗?第二个问题是,您能解释一下 Gato 是什么以及它是如何工作的吗?是的,确实如此。谢谢,谢谢您提醒我,我们在推特上暴露自己,并且永远在那里。是的,永远。有史以来最伟大的 AI 研究者之一。喵和猫的表情符号。是的,就这样。所以,您能想象一下,图灵在推特上发“喵”和猫吗?他可能会,他可能会。所以,这则推文很重要。我确实在推特上思考过。我希望人们,您认为哪一部分?有三句话:Gato 不是终点,Gato 是起点,喵,猫的表情符号。哪一部分是重要的?喵?不,不,绝对是“它是起点”。我的意思是,我可能只是解释了一下这个领域的发展方向。但让我告诉您关于 Gato 的事情。首先,Gato 这个名字可能来自于 DeepMind 的一系列发布,它们使用动物的名字来命名一些基于大型序列模型理念的模型。最初它们只是语言,但我们正在扩展到其他模态。我们有,您知道,我们有 Gopher,Chinchilla,它们只是语言模型。然后最近我们发布了 Flamingo,它增加了视觉功能。然后是 Gato,它增加了视觉功能,也增加了动作。就像我们讨论的,动作,特别是离散动作,比如上、下、左、右。我刚才告诉您了动作,但它们是词语。所以您可以大致看出动作如何自然地映射到序列建模的词语,这些模型非常强大。所以 Gato 的名字来源于,我相信,我只能凭记忆说出来。这些事情总是与一个了不起的研究团队合作完成。所以在发布之前,我们讨论了选择哪种动物。而且我认为,因为“通用代理”这个词,而这是 Gato 的一个相当独特的属性,我们玩了“Ga”这个词,然后,您知道,Gato 和猫的崛起。是的。而且 Gato 显然是西班牙语中的猫。我对此一无所知,尽管我来自西班牙。等等,抱歉,西班牙语中的猫怎么说?Gato。哦,天哪。是的,不,好的,好的,我明白了。我明白了。现在一切都说得通了。那么,喵在西班牙语中怎么说?不,我想您说得一样,但您写的是 M-I-A-U。是的,它是普遍的。好吧。那么这个东西是如何工作的?您说通用,所以您说语言、视觉和动作。动作?您能解释一下涉及哪些神经网络吗?训练是什么样的?也许系统中有哪些美丽的想法?也许 Gato 的基础与许多工作并不太相似。所以,这就是食谱,我的意思是,变化不大。它是一个 Transformer 模型,就是那种循环神经网络,它基本上接收一系列模态观察,可以是词语,可以是视觉,也可以是动作。然后它自己的目标,您训练它去做,是预测下一个是什么。任何东西都意味着下一个是什么。如果我向您展示的训练序列是动作和观察的序列,那么您预测的是下一个动作和下一个观察。所以您将此视为一系列字节。所以取任何序列,单词序列,交织的单词和图像序列,也许是图像和雅达利游戏中的动作(上、下、左、右)的序列。您将它们视为字节,您正在建模下一个字节是什么。然后您可能将其解释为动作,然后执行它,或者您可能将其解释为词语,然后写下来,如果您正在与系统聊天等等。所以 Gato 可以被视为输入图像、文本、视频、动作。它还输入一些来自机器人技术的本体感觉传感器,因为机器人技术是它被训练来完成的任务之一。然后输出类似地,它输出词语、动作。它不输出图像。这只是设计上的,我们决定暂时不走这条路。这也是它之所以是开端的部分原因,因为还有更多工作要做,显然。但这就是 Gato,这个大脑,基本上您给它任何一系列这些观察和模态,它就会输出下一步。然后您就可以继续,将下一步输入进去,预测下一个,依此类推。现在它不仅仅是一个语言模型。尽管您可以像与 Chinchilla 或 Flamingo 一样与 Gato 聊天,但它也是一个代理。所以这就是为什么我们称它为 Gato,就像这个词,字母 A,而且它是通用的。它不是一个只在星际争霸、雅达利或围棋方面表现出色的代理。它是在海量数据集上训练的。所以,如果我没打断的话,是什么让一个代理成为代理?是它能够产生动作的能力吗?是的,当我们称它为,我的意思是,这是一个好问题,对吧?什么时候我们称一个模型?我的意思是,一切都是模型。但在我看来,代理确实是能够在一个环境中采取行动的能力,您将其发送给它,然后环境可能会返回一个新的观察。然后您生成下一个动作。这实际上让我想起了生物学方面的问题,什么是生命?这实际上是一个非常困难的问题。什么是活着的?当您想到地球上的生命时,什么是活着的?以及一个有趣的问题,关于外星人,什么是生命?当我们访问另一个星球时,我们能认出它吗?这听起来可能很傻,但我认为不是。在什么时刻,神经网络才算是一个生命体,而不是一个工具?感觉行动能力,改变其环境,是那个根本性的飞跃。是的,我认为行动能力肯定是一种必要条件,但可能也不够。是的,所以可悲的意识,等等,无论什么。是的,是的,我们稍后可以回到那个问题。但总之,回到喵和 Gato。所以,向前迈出的一步,以及让团队花费大量精力的事情是,正如您所问的,Gato 是如何训练的?所以,我告诉您,Gato 是一个 Transformer 神经网络模型,它处理动作、动作序列、词语等。然后我们训练它的方式是,基本上是通过拉取数据集的观察。所以,这是一个大规模的模仿学习算法。它显然模仿了通常的数据集中接下来会出现的下一个词。所以,这些是人们在网上写作或聊天的网络规模数据集。所以这是我们用于所有语言工作的一个明显来源。但我们也使用了 DeepMind 的许多代理。我的意思是,正如您所知,DeepMind 对学习非常感兴趣。强化学习和在不同环境中学习的代理。所以我们创建了一个这些轨迹的数据集,我们称之为代理经验。所以,从某种意义上说,我们有其他代理,我们为了单一目的而训练它们,比如,您知道,控制一个 3D 游戏环境并导航迷宫。所以我们拥有通过一个代理与该环境互动而产生的所有经验,我们将其添加到数据集中。正如我所说,我们看到所有数据,所有这些词语序列,或者这个代理与该环境互动的序列,或者代理玩雅达利游戏等等。我们将这些视为相同类型的数据。所以我们将这些数据集混合在一起,然后训练 Gato。这就是 G 部分,对吧?它是通用的,因为它确实混合了它。它没有为每种模态或每个狭窄的任务拥有不同的大脑。它只有一个大脑。它不像我们现在看到的许多神经网络那么大。它有十亿个参数。我们现在看到的一些模型有数万亿个参数。而且,当然,一百亿个参数感觉是一个非常普遍的尺寸。所以实际的代理相对较小,但它是在一个非常具有挑战性的多样化数据集上训练的,不仅包含互联网上的所有内容,还包含所有这些代理在非常不同的、独特的环境中玩耍的经验。这让我们来到了推文中的“这不是终点,而是起点”的部分。看到 Gato 原则上能够控制任何环境,特别是它被训练过的那些环境,比如这些 3D 游戏、雅达利游戏以及各种机器人任务等等,感觉非常酷。但显然,它不像它学习的老师那样熟练。不明显的是,它不会更熟练。这只是当前的开始阶段。所以,它的表现是,它不如专门针对该任务的代理。所以它不如,尽管我会争辩说,尺寸在这里很重要。所以,我会争辩说,尺寸总是很重要。是的,这是另一个话题。但对于神经网络来说,尺寸确实很重要。所以,它是开端,因为它相对较小。所以显然,扩大这个想法可能会使文本和玩雅达利之间的联系更加协同。您可能会获得,在那一刻我们还没有完全看到,但显然这就是为什么它是开端。这种协同作用可能会随着规模而出现。而且,我也相信有一些新的研究或准备数据的方式,您可能需要让模型更清楚,您不仅仅是在玩雅达利,您只是从一个屏幕开始,这里是向上,还有一个屏幕,这里是向下。也许您可以将玩雅达利视为需要一些上下文的代理,然后它开始看到,哦,这是一个完整的屏幕,我将开始玩。您可能需要用语言告诉它,嘿,在这个序列中,您将玩一个完整的游戏。所以文本可能是一个很好的驱动因素来增强数据。所以这些联系可能会更容易建立。对吧?这是我们在语言中开始看到的一个想法,但显然,在语言之外,这将是有效的。这不像我给您看一个屏幕,然后您从头开始,您应该学会玩一个游戏。有很多上下文我们可能需要设置。所以可能还需要一些工作来设置那个上下文。但总之,有很多工作。是的,所以那个上下文将所有不同的模态放在同一个水平线上。确切地说,提供最佳的上下文。所以,也许在这点上,有一个任务,它可能看起来并不简单,那就是对数据进行标记化,将数据转换为碎片,转换为基本的原子元素,然后这些元素可以跨模态。所以,什么是标记化?您如何标记文本?您如何标记图像?您如何标记游戏和动作以及机器人任务?是的,这是一个很好的问题。标记化是实际让所有数据看起来像序列的入口点。所以标记就是我们将其分解成这些小拼图块,然后我们只是建模这个拼图是什么样的,当您将其排列成一行,可以说是,成一个序列。所以在 Gato 中,文本有很多工作。您通常通过查看常用的子字符串来标记文本。所以,例如,在英语中,“ing”是一个非常常见的子字符串,所以它就成了一个标记。标记文本是一个相当成熟的问题。Gato 只是使用了多年来开发的标准技术,甚至可以追溯到 20 世纪 50 年代的 N-gram 模型。所以,只是为了提供背景,一个词需要多少标记?实际上,我们说的是什么?对于英语中的一个词?我的意思是,每种语言都非常不同。目前的标记化粒度通常意味着,也许是两个到五个。我的意思是,我不知道确切的统计数据,但给您一个想法,我们不是在字母级别上标记。那么它可能是,我不知道英语中一个词的平均长度是多少,但那将是,您知道,您可以使用的一组最小标记。比字母大,比单词小。是的,是的。您可以想象非常非常常见的词语,比如“the”,它会是一个单独的标记。但很快,您就会说,两个、三个、四个标记。您尝试过标记表情符号吗?表情符号实际上只是字母序列。所以,对您来说是这样,但对我来说,它们意味着更多。您可以渲染表情符号,但您可能,如果您实际上只是,这是一个哲学问题。表情符号是图像还是文本?我们做这些事情的方式是,它们实际上被映射到字符的短序列。所以您实际上可以与这些模型玩耍,输入表情符号,它也会输出表情符号。这实际上是一个非常有趣的练习。您可能可以在网上找到其他关于此的推文。但,总之,文本,它的做法非常清楚。然后在 Gato 中,我们为图像所做的是,我们将图像映射到,基本上,我们压缩了图像,可以说,成看起来更像,而不是每个像素都有每个强度。那将意味着一个非常长的序列。所以,如果我们谈论的是 100x100 像素的图像,那将使序列太长。所以我们所做的是,您只是使用一种技术,它基本上将图像压缩成可能 16x16 像素块。然后再次映射,标记化。您只是基本上将这个空间量化成一个特殊的词,它实际上映射到这些小像素序列。然后您将像素按某种栅格顺序组合起来。然后这就是您如何获得,或者在图像中,您的,您的处理。但那没有语义方面。所以您只是在做某种,您不需要理解图像的任何东西就可以标记它,目前是这样吗?不,您只是使用这种压缩的概念。所以您试图找到共同的,这就像 JPEG 或所有这些算法一样。实际上,在标记化层面,它们非常相似。我们所做的就是找到共同的模式,然后以有损的方式压缩这些图像,考虑到我们处理的所有数据中包含的图像的统计数据。尽管您可能可以争辩说,JPEG 确实对图像有一些理解,比如,因为视觉信息,也许基于颜色的粗略压缩确实捕捉了图像的一些重要信息,关于它的意义,而不仅仅是一些统计数据。是的,我的意思是,正如我所说,JPEG 的算法实际上非常相似。它们使用,JPEG 使用余弦变换。我们通常在机器学习中处理图像时使用的方法,并且我们进行这种量化步骤,有点更具数据驱动性。所以,而不是拥有某种傅里叶基,关于自然界中的频率如何出现,我们实际上只是使用图像的统计数据,然后根据统计数据进行量化。就像您在单词中做的那样,对吧?所以常见的子字符串被分配一个标记。图像也非常相似。但没有联系。标记空间,如果您认为标记是一个整数,最终。所以现在,我们可能大约有,比如说,我不知道确切的数字,但比如说,一万个文本标记。当然比字符多,因为我们有字符组等等。所以从一到一万,这些代表了我们将看到的所有语言和单词。然后图像占据了下一个整数集。所以它们完全独立。所以从一万零一到两万,这些是代表其他模态图像的标记。这是一个有趣的方面,使其正交。所以连接这些概念的是数据。一旦您有了数据集,例如,它为图像添加字幕,告诉您,哦,这是一个人在绿色田野上玩飞盘。那么模型就需要预测文本标记“绿色田野”到像素,然后这将开始建立标记之间的联系。所以这些联系在算法学习时发生。然后最后一个,如果我们考虑这些整数,第一个是单词,下一个是图像。在 Gato 中,我们也为动作分配了最高阶的整数。我们将其离散化。动作非常多样。在雅达利中,我不知道有多少种离散动作,17 种。在机器人技术中,动作可能是我们施加的扭矩和力。所以我们只是使用类似的想法将这些动作压缩成标记。然后我们就是这样映射的。现在所有空间都映射到这个整数序列。但它们占据了不同的空间。连接它们的是学习算法。那就是魔法发生的地方。所以模态在标记空间中是相互正交的。所以输入中,您添加的任何东西,您都会添加额外的标记。然后您将所有这些都塞进一个地方,Transformer。而那个 Transformer 试图查看这个巨大的标记空间,并试图形成某种表示,某种关于所有这些不同模态的独特智慧。这怎么可能?它们是,如果您戴上您的精神分析帽,并试图精神分析这个神经网络,它是否精神分裂?它是否试图,鉴于这很少的权重,代表多个不相关的实体,并以某种方式让它们不相互干扰?还是这是关于建立在,建立在共同点上,建立在所有不同模态的共同点上?比如,如果您问问题,它是精神分裂的,还是它是一个思想?我的意思是,它是,它是同一个思想。而且实际上是最简单的算法,这在某种程度上感觉就像这个领域自反向传播和梯度下降被用于学习神经网络以来就没有改变过。所以显然,架构细节已经演变。当前的迭代仍然是 Transformer,这是一个强大的序列建模架构。但这个目标的,您知道,设置这些权重来预测数据,基本上与几年前我们描述的 AlphaStar 语言建模等等相同。我们以雅达利游戏为例,我们将其映射到一个数字字符串,这些数字很可能都是图像空间和动作空间的交错。而我们要做的是,好的,给定数字,您知道,一万零一,一万零四,一万零五,下一个数字是两万零六,它在动作空间中。而您只是在优化这些权重,通过一个非常简单的梯度,您知道,数学上几乎是最无聊的算法,您可以想象。我们设置权重,以便给定这个特定的实例,这些权重被设置为最大化看到这个特定整数序列的可能性,对于这个特定的游戏。然后算法在许多许多迭代中这样做,查看不同的模态,不同的游戏。所以,这是我们讨论的数据集混合。所以,从某种意义上说,这是一个非常简单的算法。而权重,它们都是共享的。所以,从关注一个模态还是不关注的角度来看,将这些整数输入转换为您正在预测的下一个目标的中间权重当然是共同的。然后标记化的发生方式是,在神经网络中有一个特殊的位置,我们将这个整数数字 1001 映射到一个实数向量,比如实数。我们可以用梯度下降来优化它们。我们学习的函数实际上是令人惊讶的可微分的,这就是为什么我们计算梯度。所以这个步骤是唯一一个您提到的正交性适用的地方。映射文本、图像或动作的特定标记,这些标记中的每一个都会得到自己的实数向量,代表它。如果您回顾很多年前,人们谈论词向量或词嵌入。这些是相同的。我们有词向量或嵌入。我们有图像向量或嵌入,以及动作向量或嵌入。而这里的优点是,当您训练这个模型时,如果您可视化这些小向量,它可能会开始对齐,即使它们是独立的参数。它们可以是任何东西,但然后,您可能会取 Gato 或猫这个词,它可能足够常见,以至于它有自己的标记。然后您取有猫的像素,您可能会开始看到这些向量看起来像是对齐的。所以通过从海量数据中学习,模型正在意识到这些模态之间潜在的联系。现在我会说,至少部分地,还有另一种方法可以不为每个不同的模态拥有这些不同的向量。例如,当我说到某些空间中的动作时,我用词语来定义动作。所以您可以想象一个世界,我不是学习雅达利中的动作“向上”是它自己的数字。雅达利中的动作“向上”可能就是字面上的词语或句子“雅达利中的向上”。这意味着我们现在更多地利用了语言。这不是我们在这里所做的,但当然,这可能会使这些联系更容易学习,也更容易教模型纠正自己的动作等等。所以,所有这些都是为了说明 Gato 确实是开端。这是一个激进的想法,以这种方式去做。但可能还有更多工作要做,结果会更令人印象深刻,不仅通过规模,还通过一些新的研究,希望在未来几年内出现。所以,只是快速阐述一下,您的意思是,一个可能的下一步,或者您接下来可能采取的路径之一是,从根本上将标记化作为一种语言交流。所以,就像您将图像也转换为语言一样。所以做一些粗略的语义分割,只是给图像分配一组词语,就像一个愚蠢的实体尽可能多地解释图像。所以您将其转换为词语,然后您将游戏转换为词语,然后您提供上下文和词语,以及所有这些。最终达到一个点,每个人都同意诺姆·乔姆斯基的观点,即语言实际上是一切的核心。它是智力和意识以及所有这些东西的基础层。好的,您早些时候提到,很难成长。您是什么意思?因为我们正在谈论规模可能会改变。可能会有,我们也会谈论这个,比如,涌现。某些关于这些神经网络的东西正在涌现。比如只有随着规模才能看到的某些性能。而且存在某种规模阈值。所以,为什么像这个“喵”网络这样东西很难成长?所以,“喵”网络不是,如果您重新训练它,它并不难成长。什么很难?嗯,我们现在有十亿个参数。我们训练它们一段时间。我们花费了一些工作来构建这些权重,它们是一个了不起的初始大脑,用于执行我们关心的这类任务。我们能重用这些权重吗?
扩展到一个更大的大脑,这极其困难,但从研究和实际的角度来看,也令人兴奋。对吧?所以,软件工程中有一个关于模块化的概念,我们开始看到一些利用模块化的例子和工作。事实上,如果我们退一步,从 gato 回到我称之为训练得更大、能力更强的网络 flamingo,flamingo 不处理动作,但它确实以一种有趣的方式处理图像,有点类似于 gato 所做的,但技术上略有不同,用于分词,但我们不需要深入研究细节。但 flamingo 也做了 gato 没有做的事情,这仅仅是因为这些项目,你知道,它们是不同的,你知道,这有点像研究的探索性,这很棒。这些项目背后的研究也是模块化的。是的,正是如此。而且必须如此,对吧?我们需要创造力,有时你需要保护一些人的空间,研究人员等等,但我们相信人类。是的,好的。而且尤其相信研究人员,甚至可能更进一步,你知道,DeepMind 或其他类似的实验室。然后它们就充当神经网络本身。所以,这是自下而上的模块化。一直自下而上。所以,我们在 flamingo 中非常漂亮地实现模块化方式是,我们采用了 Chinchilla,它是一个仅限语言的模型,而不是一个代理,如果我们认为动作是代理所必需的。所以,我们采用了 Chinchilla,我们采用了 Chinchilla 的权重,然后我们冻结了它们。我们说这些不改变。我们训练它们非常擅长预测下一个词,是一个非常好的语言模型,当时是顶尖的。你发布它等等。将为 C 添加一个功能,对吧?我们将为这个语言模型添加视觉能力。所以,我们将附加一些小的神经网络片段,放在模型的正确位置。这几乎就像给网络注入一些权重和一些子结构,以一种好的方式,对吧?所以,你需要研究来告诉我们什么有效,如何添加这项能力而不破坏其他能力等等。所以,我们创建了一个小的子网络,它不是从随机初始化的,而是从自监督学习中初始化的,你知道,一个理解视觉的模型,总的来说。然后,我们采用了连接这两种模态(视觉和语言)的数据集。然后,我们冻结了主要部分,网络中最大的部分,也就是 Chinchilla,它有 700 亿个参数。然后,我们在上面添加了更多的参数,从头开始训练。然后,还有一些是从具有视觉能力的模型中预训练的。它不是我为 gato 所描述的那种分词,但这是一个类似的想法。然后,我们训练了整个系统,其中一部分被冻结,一部分是新的。突然之间,我们开发了 flamingo,这是一个惊人的模型,基本上,我的意思是,描述它是一个聊天机器人,你也可以上传图像并开始就图像进行对话。但它也是一种对话风格的聊天机器人。所以,输入是图像和文本,输出是文本。正是如此。你说有多少参数?700 亿。Chinchilla 是 700 亿。是的,Chinchilla 是 700 亿。然后,我们添加在上面的部分,几乎就像一种覆盖其激活值的方式,这样当它看到视觉时,它就会进行正确的计算,将其映射回。所以,这增加了额外的 100 亿个参数,对吧?所以,总共是 800 亿,这是我们发布的最大的模型。然后,你在包含视觉和语言的几个数据集上训练它。一旦你与模型交互,你就会开始看到,你可以上传一张图像,然后开始就图像进行对话。这实际上并不是它,这与我们在仅限语言的领域看到的提示能力非常相似。你可以教它一个新的视觉任务,对吧?它所做的事情超出了理论上数据集本身提供的能力。但因为它利用了 Chinchilla 所获得的许多语言知识,它实际上具有这种少样本学习能力和新兴能力,我们在开发模型时甚至没有衡量过。但一旦开发完成,当你玩界面时,你就可以开始看到,哇,好的,是的,很酷。我们可以上传。我认为其中一条关于 Twitter 的推文是奥巴马的一张照片,他正在称体重,有人也在称体重,这是一张有点开玩笑风格的图片。值得注意的是,我认为安德烈·卡帕蒂几年前说过,没有任何计算机视觉系统能够理解这张图片中这个笑话的微妙之处,以及所有发生的事情。所以,我们试图做的是,而且这是非常轶事的,我的意思是,这不是我们解决了这个问题的证明,但这只是表明,你现在可以上传这张图片,并开始与模型对话,试图弄清楚它是否理解其中有笑话。因为称体重的人看不到,看不到后面有人在增加体重等等。所以,这是一种迷人的能力。它来自于模块化的核心思想,我们拥有一个冻结的大脑,我们只是添加了一个新功能。所以,问题是,我们应该这样做吗?所以,在某种程度上,你甚至可以看到,从 DeepMind 的 flamingo 中,这种适度的做法,因此可以更合理地利用规模,因为我们不需要从头开始重新训练一个系统。而另一方面,我们有 gato,它使用了相同的数据集,但它从头开始训练了。所以,我想社区的大问题是,我们应该从头开始训练,还是应该拥抱模块化?这就像回到了模块化作为一种成长方式,但重用似乎很自然,而且肯定非常有效。下一个问题是,如果你走模块化这条路,是否有系统性的方法来冻结权重并连接不同的模态,不仅仅是两三个或四个网络,而是来自各种地方的数百个网络?也许是开源的,一个关注天气模式的网络,然后你以某种方式将其插入,然后你就有网络,我不知道,做各种事情,玩星际争霸和其他所有视频游戏,你可以不断地添加它们,而无需付出巨大的努力,比如,也许努力是线性的,或者其他什么,而不是你添加的网络越多,你越需要担心产生的动荡。是的,那个愿景很美。我认为,仍然存在的问题是,在单一模态内,比如 Chinchilla 被重用了,但现在如果我们训练下一代语言模型,我们会使用 Chinchilla 还是不使用?是的,你如何替换 Chinchilla?所以,仍然存在大问题。但那个想法实际上非常类似于软件工程,我们不是从头开始重新实现库,我们是重用并构建越来越惊人的东西,包括我们正在使用的软件中的神经网络。所以,我认为这种模块化的想法,我喜欢它,我认为它将持续下去,这也是为什么我说这只是开始,而不是结束。你提到了元学习。鉴于 gato 的这种承诺,我们能否尝试重新定义这个术语,它几乎等同于意识,因为它在人工智能的历史上对不同的人意味着不同的东西?但你认为元学习是什么,它现在看起来是什么样的?五年、十年后,它看起来会像扩展版的 gato 系统吗?你对元学习是什么样的有什么看法?我认为,带着我们迄今为止学到的所有智慧,是的,很好的问题。也许最好提供另一个数据点,回顾而不是展望。所以,当我们在 2019 年谈论时,元学习意味着一些事情,这些事情已经通过 GPT3 及以后的革命发生了很大变化。所以,当时元学习的含义是由人们关心的元学习基准驱动的。而基准是关于学习物体身份的能力。所以,它非常过度拟合于视觉和物体分类。而关于这一点,元学习的部分是,哦,我们不仅仅是学习 ImageNet 告诉我们要学习的 1000 个类别,我们将学习当我们与模型交互时可以定义的物体类别。所以,看到这种演变很有趣,对吧?它的开始方式是,我们有一个特殊的语言,它是一个数据集,一个我们提示模型的小数据集,说,嘿,这是一个新的分类任务,我给你一张图片和名称,当时名称是一个整数,另一张图片,等等。所以,你有一个数据集形式的小提示,然后你得到了一个系统,然后它可以预测或分类你刚刚即时定义的这些物体。快进到 2020 年,人们发现语言模型是未来学习者,这是论文的标题。所以,非常好的标题,有时标题真的很好。因为那就是 GPT3 的要点,它表明,看,当然,我们可以专注于物体分类,以及在学习物体类别空间内的元学习意味着什么。这超出了,或者更早,也超出了 Omniglot,ImageNet 等等。所以,有一些基准。现在,我们突然从基准中解放出来,通过语言,我们可以定义任务,对吧?所以,我们实际上是在告诉模型一些逻辑任务或我们想要它做的小事情。我们像以前一样提示它,但现在我们通过自然语言提示它。然后,不完美,我的意思是,这些模型有故障模式,这没关系,但这些模型现在正在做一项新任务,对吧?所以,它们元学习这些新能力。现在,这就是我们现在的情况。Flamingo 将其扩展到视觉和语言,但它基本上具有相同的能力。你可以教它,例如,一个新兴的属性是,你可以拍摄数字的照片,然后通过教它进行算术运算。哦,我的意思是,当我给你看 3 加 6 时,你知道,我希望你输出 9。你给它几个例子,现在它就做到了。所以,它远远超出了,哦,这个 ImageNet 类的图像分类,我们可能之前有点卡住了。这个启示时刻发生在 2000 年,我相信是 19 年,但那是在我们聊天之后。而且,它以我们之前定义的方式解决了元学习。是的,它扩展了它的含义。所以,这就是你所说的,它意味着什么。所以,这是一个不断发展的术语。但也许现在,展望未来,看看社区中正在发生的事情,更多的模态,我们可以期待什么?我肯定希望看到以下内容,这是一个相当大的希望。也许五年后,我们再聊一次,我们有一个系统,一套权重,我们可以教它玩星际争霸,也许不是 AlphaStar 的水平,但玩星际争霸,一个复杂的游戏。你通过互动来教它,通过提示。你当然可以提示一个系统,Gato 表明了这一点,玩一些简单的 Atari 游戏。所以,想象一下,如果你开始与一个系统交谈,教它一个新游戏,展示它在这个特定游戏中的例子,这个用户做了一些好事。也许系统甚至可以玩并问你问题,说,嘿,我玩了这个游戏,我刚玩了这个游戏,我做得好吗?你能教我更多吗?所以,五年到十年后,这些能力,或者元学习的含义,将更加互动,更加丰富,并且跨越我们曾经专门化的领域。所以,你看到了区别,对吧?我们构建了 AlphaStar,专门用于玩星际争霸。算法是通用的,但权重是专门的。而我们希望的是,我们可以教一个网络玩游戏,玩任何游戏,仅仅以游戏为例,通过与它互动,教它,上传星际争霸的维基百科页面。就像这样,在视野中。当然,细节需要完善,研究需要进行。但这正是我所看到的元学习,它将超越提示,它将更加互动,它将,你知道,系统可能会在它犯错或输掉一场比赛后要求我们提供反馈。但无论如何,这都非常令人兴奋。因为如果你这样想,基准已经存在了,我们只是重新利用它们。基准。所以,在某种程度上,我喜欢将 AGI 可能意味着的空间映射到说,好吧,就像我们在围棋、国际象棋、星际争霸中获得了 101 的表现一样。下一次迭代可能是“所有任务”的 20% 的表现。即使它不像那么好也没关系。我们有方法来衡量进展,因为我们有那些特殊的代理,专门的代理等等。所以,对我来说,这是非常令人兴奋的。而这些下一代模型肯定预示着这种进步的方向。希望我们能够实现。当然,有些事情可能会出错。例如,我们可能没有工具。也许 Transformer 不够。那么,我们必须有一些突破。这使得这个领域对像我这样的人来说更加令人兴奋。当然。但如果问我五年到十年,你可能会看到这些模型开始更像已经训练好的权重。然后,更多的是关于教学,或者它们是为学习你正在尝试诱导的任务而设计的。现在我们看到了一些新兴的任务,比如,你知道,小的算术任务等等。所以,围绕这一点有一些问题。这很迷人。所以,那种互动式教学,所以,它超越了提示,与神经网络互动,这与训练过程不同。所以,它不同于可微分函数的优化。这已经训练好了,现在你在教学。我的意思是,这几乎就像大脑一样,神经元已经设置好了连接。在此之上,你知道,利用那个基础设施来建立进一步的知识。好的,这是一个非常有趣的区别。从软件工程的角度来看,这并不明显,因为你总是认为,要让神经网络学习,它必须被重新训练,训练,再训练。但也许,提示是一种教学方式,你现在提供一些关于你试图让它做什么的上下文。所以,你也许可以通过让它互动来扩展这种提示能力。是的,真的,真的。顺便说一句,这不是,如果你回顾一下,在处理分类任务的不同方法时。所以,这来自于机器学习的长期文献。我所建议的对某些人来说可能有点像最近邻居。最近邻居几乎是最简单的算法,它不需要学习。它有这个有趣的方面,你不需要计算梯度。最近邻居所做的就是,你引用“拥有”一个数据集或上传一个数据集,然后你只需要一种测量点之间距离的方法。然后,要对一个新点进行分类,你只是简单地计算这个海量数据中最近的点是什么,那就是我的答案。所以,你可以从某种意义上认为,提示就是你上传的,不仅仅是简单的点,而且距离度量不是图像之间的距离或简单的东西,而是你计算出来的更高级的东西。但从某种意义上说,它非常相似,对吧?你只是将一些知识上传到这个预训练的系统。在最近邻居中,也许度量是学习的,或者不是,但你不需要进一步训练它。然后,你立即从中获得一个分类器。现在,这只是那个概念的演变,一个非常经典的机器学习概念,那就是,是的,只是通过学习最近的点来学习,在某个距离附近,就是这样。这是一个演变。而且,我会说,当我 2016 年在一些想法上工作时,我如何看待元学习,正是通过最近邻居的视角,这在计算机视觉社区中非常普遍。有一个非常活跃的研究领域,关于如何计算两张图像之间的距离。但如果你有一个好的距离度量,你也有一个好的分类器,对吧?我所说的只是,现在这些距离和点不仅仅是图像,它们是单词或单词序列和图像以及教你新东西的动作。但技术上,它们可能会回来。而且,我会说,不一定是真的,你可能永远不会进一步训练权重。一些元学习的技术确实会进行一些微调,正如它所说的。当它们获得新任务时,它们会稍微训练一下权重。所以,正如我所称之为,我们如何实现这一点,作为一个深度学习者,我非常怀疑。我们会尝试一些事情,无论是稍微训练一下,添加一些参数,将此视为最近邻居,或者仅仅认为这是一个单词序列,它是一个前缀,这就是新的分类器。我们会看到的,对吧?这就是研究的美妙之处。但是,重要的是,它本身就是一个很好的目标,我认为对于元学习的下一阶段来说,这是非常有价值的。我认为这基本上就是机器学习的全部令人兴奋之处。嗯,而且它的互动方面也非常有趣。最近邻居的互动版本。帮助你从这个巨大的东西中提取分类器。嗯,这是我们可以走的道路吗?五年、十年或更长时间,从任何任务到任何任务?所以,抱歉,从许多任务到任何任务。那么,这意味着什么?它需要被实际训练成什么样?哪个点是网络已经足够了?那么,网络需要学习关于这个世界的什么才能执行任何任务?仅仅是语言、图像和动作那么简单吗?还是你需要一套代表性的图像?比如,如果你只看到陆地图像,你会知道关于水下的一切吗?这是否从根本上不同?我不知道。这些是悬而未决的问题。我想,你提出的方式,让我进一步阐述你的例子,如果所有你看到的都是陆地图像,但你在书中阅读了关于陆地和水世界的一切,想象一下,那够吗?这是一个好问题。我们不知道。但我想,如果你愿意,你可以加入我们,加入我们寻找这个的探索。这正是水世界。是的,这正是,我想,研究的美妙之处,以及我们所处的这个研究业务。就是弄清楚这一点,问正确的问题,然后与整个社区进行迭代,发布发现等等。但是,是的,这些是问题,不是唯一的问题,但正如你所问的,它肯定一直在我的脑海里。所以,我们将不得不等待,也许是五年,希望不是十年,来看看答案是什么。有些人会非常相信单模态的无监督或自监督学习,然后交叉它们。有些人可能会认为端到端学习是答案。模块化也许是答案。所以,我们不知道。但我们肯定很兴奋地去发现。但感觉现在是时候了,我们正处于这个的开始。是的,我们终于准备好做这些通用的、大型的模型和代理了。你对 Gato、Flamingo、Chinchilla、Gopher 中的任何一个有什么特别美丽、令人惊讶的技术细节吗?也许有什么让你印象深刻的?当然,有普遍的说法,比如,你认为这是不可能的,然后你意识到它是可能的,就跨模态的通用性而言,等等。或者也许,相对而言,Gato 的网络有多小?所有这些。但是,有没有什么奇怪的小事情让你感到惊讶?当然,我会给你一个非常重要的答案,因为也许人们没有完全意识到这一点。这些努力背后的团队,实际的人类。那也许是令人惊讶的,当然是积极的方式。所以,任何时候你看到这些突破,我的意思是,很容易将其归功于几个人。有一些人非常擅长解释事物等等,这很好。但也许我作为人类从中获得的学习或方法论学习是,当然,我们可以前进。但令人惊讶的是,这些项目的所有组成部分有多么重要?它们是如何组合在一起的?所以,我将给你一些这些项目成功的常见成分,但不是显而易见的。在机器学习中,我总是可以给你那些。但基本上,工程是至关重要的。所以,非常好的工程。因为最终,我们正在收集数据集。所以,数据的工程,然后大规模部署模型到某个计算集群。这一点不能低估。它是成功的巨大因素。而且,很难相信细节如此重要。我们希望相信,确实存在越来越多的标准公式,就像我说的,这个食谱适用于一切。但当你深入研究这些项目时,你就会意识到,魔鬼确实在细节中。然后,团队必须朝着这些目标协同工作。所以,数据工程,当然,集群和大规模部署非常重要。然后,有一个经常不被重视,也许现在更清楚了,那就是基准进展。所以,我们在这里谈论的是数月,你知道,几十名研究人员,以及组织研究等等的人们一起工作。而且,你不知道你是否能做到。我的意思是,这就是美妙之处。如果你不冒着尝试做一些感觉不可能的事情的风险,你就不会成功。但是,你需要衡量进展的方法。所以,你构建的基准至关重要。我在许多项目中都看到了这一点。也许我看到它更一致的项目是,我们建立了指标,实际上是社区建立的,然后我们大规模地利用了它,那就是 AlphaFold。这是一个项目,数据、指标都存在。所有需要的是,而且说起来容易做起来难,一个了不起的团队,不是为了寻找一些渐进式的改进而发表,这是有效的研究方式之一,而是目标非常高,并为此过程进行迭代工作了数年。与团队一起工作了数年。我的意思是,这确实很棘手。这部分发生在疫情期间等等。所以,我认为我从所有这些中获得的元学习是,团队对成功至关重要。然后,如果现在转向机器学习部分,令人惊讶的是,我们喜欢像神经网络这样的架构。而且,我敢说,这是一个快速发展的领域,直到 Transformer 的出现。所以,注意力可能确实是你唯一需要的东西,这也是一个好标题。虽然事后看来很好,但我当时不认为这是一个好标题。但那种架构证明了,对任何字节序列进行建模的梦想,那里有一些东西会坚持下去。而且,我认为这些架构的进步,在神经网络如何运作方面,很难找到一个如此稳定且相对变化很少的架构,自发明以来大约五年了。所以,这是一个反复出现在其他项目中的令人惊讶的惊喜。从哲学或技术层面反思注意力是什么?人们研究认知时,注意力是什么?我认为,在注意力是什么,它在人类大脑中如何运作的问题上,存在巨大的争论。所以,这个非常简单的关于注意力是什么的观点,在神经网络中,从“注意力就是你所需要的一切”的日子里,但更广泛地说,你认为这里有一个普遍的、非常强大的原则吗?是的,Transformer 和 LSTM 之间的区别,而 LSTM 是之前的模型。你知道,有一个过渡时期,你可以两者都用。事实上,当我们谈论 AlphaStar 时,我们使用了 Transformer 和 LSTM。所以,那时 Transformer 才刚刚开始,它们非常强大,但 LSTM 也是非常强大的序列模型。Transformer 的强大之处在于它内置了我们称之为注意力的归纳偏置。当你想到一个整数序列时,就像我们之前讨论过的,这是一系列单词。当你必须对这些单词执行非常困难的任务时,这可能是,我们将翻译整个段落,或者在给定前面的十个段落的情况下预测下一个段落。从人类的角度来看,有一些模糊的直觉,在 Transformer 中得到了很好的模仿和结构上的复制,那就是你正在寻找某样东西的想法。所以,你正在,你刚刚读了一段文字,现在你在想接下来会发生什么。你可能想重新查看文本或从头开始查看。我的意思是,字面意思是,因为没有递归,你只是在想接下来会发生什么。而且,这几乎是基于假设的,对吧?所以,如果我想到我将要写的下一个词是猫或狗,好的。Transformer 的工作方式几乎是哲学上的,它有两个假设:是猫还是狗?然后它说,好的,如果是猫,我将寻找某些词,不一定是猫,虽然猫是一个明显的词。你会回顾过去,看看输出猫或狗更有意义。然后,它对单词进行非常深入的计算,等等。所以,它结合了单词。但是,它有我们称之为查询的东西,那就是猫,同样也是狗。所以,这是一种非常计算性的思考方式。看,如果我深入思考文本,我需要回去看看所有的文本,关注它。但它不仅仅是注意力,是什么在引导注意力?这是早期论文的关键见解。它不是它有多远。我的意思是,它有多远很重要。我刚才写了什么,这很关键。但十页前的你写的东西也可能很关键。所以,你不是按位置搜索,而是按内容搜索。而 Transformer 有一种漂亮的方式来查询特定内容并以压缩的方式提取它。然后,你可以做出更明智的决定。我的意思是,这是解释 Transformer 的一种方式。但我认为,这是一种非常强大的归纳偏置。随着时间的推移,可能会有一些细节发生变化。但我认为,这使得 Transformer 比以前的循环网络强大得多,而循环网络是基于偏置的,当然在某些任务上有效,但它有主要的缺陷。Transformer 本身也有缺陷。我认为主要的缺陷是,我们刚才谈到的这些提示,它们可以长达一千个单词。但如果我教你星际争霸,我的意思是,我必须给你看视频,我必须指向关于游戏的整个维基百科文章。我们可能需要互动。当你玩的时候,你会问我问题。上下文要求我们实现我作为你的好老师,就像你想用模型做的那样。我认为这远远超出了当前的能力。所以,问题是我们如何衡量这一点,然后我们如何改变架构的结构?我认为双方都有想法。但我们将不得不根据经验来看,显然,最终什么有效。而且,正如你所谈到的,一些想法可能是,保持那个长度的限制,然后形成分层表示,这样你就可以更聪明地使用那 1000 个 token。是的,这真的很令人兴奋。而且,也有可能,这种注意力机制,你基本上没有近期偏见,但你更普遍地看待它,你让它可学习,你回顾过去的方式,你让它可学习。也有可能,在最开始,你可能会变得越来越聪明,在查询过去的方式上,最近的过去和遥远的过去,也许是非常非常遥远的过去。所以,几乎就像注意力机制必须改进和发展,就像分词机制一样,这样你就可以以某种方式表示长期记忆。是的。而且,我的意思是,层级结构非常,我的意思是,这是一个很吸引人的词,听起来很有吸引力。在记忆中添加层级结构的工作很多。实际上,似乎我们总是回到主要的公式或主要的架构,有时会告诉我们一些东西。有一句话,我的一位朋友告诉我,无论它是否有效。所以,Transformer 显然是一个想要奏效的想法。然后,我认为有一些原则是我们相信是必需的。但找到确切的细节,细节如此重要,这将会很棘手。我喜欢这个想法,就像你作为一个人类,你想要一些想法奏效,然后模型也想要一些想法奏效,然后你们可以进行对话,看看哪个更有可能奏效,因为最终是模型需要做工作,而不是你。所以,你应该听模型的话。我真的很喜欢你提到的关于这个画面中的人类的想法。如果我能简要问一下,一个是,你说基准是关于模块化的人在努力工作。基准提供了坚实的基础,希望做那些看起来不可能的事情。它们在最黑暗的时刻给你希望,因为一点点改进的迹象,你可以,是的,就像你没有迷失,如果你有衡量你进步的指标。然后,还有其他方面,你在这里和别处提到,标题很重要。你想知道人类在所有这些演变中有多重要,意思是,个体人类,你知道他们的互动,他们的想法,他们改变了所有这些方向多少?比如,如果你改变这个画面中的人类,模型就在那里,它想要某个想法奏效,还是人类?或者也许模型提供了 20 个可能奏效的想法,而根据人类的选择,他们将能够听到其中一些想法?比如,在所有这些中,你现在指导 DeepMind 的所有深度学习,你与很多项目,很多才华横溢的研究人员互动。有多少变异是由人类造成的?是的,我的确相信人类非常重要,至少在几年这个时间尺度上,事情是如何发生的,以及它们的顺序。所以,你与人们互动,我的意思是,你提到了这一点,有些人真的希望某个想法奏效,他们会坚持下去。然后,有些人可能更实际,我不在乎哪个想法奏效,我只关心,你知道,破解蛋白质折叠。是的。而这两种似乎是相反的。我们需要两者,而且我们显然两者都有。历史上是这样,这使得某些事情发生得更早或更晚。所以,当然,人类参与了所有这些努力,我敢说,改变了事情发生的顺序,哪些突破先于其他突破等等。所以,当然,这种情况确实会发生。所以,也许另一个区分的维度是我称之为的,这在强化学习中最常用的是探索-利用权衡。虽然它不完全是我所说的意思,但非常相关。所以,当你开始帮助别人时,就像你,你知道,你变得更像一个导师,对一群人,一个项目,或者深度学习团队,或者甚至在社区中,当你与人们互动时,在会议上等等。你很快就会识别出来,一些是探索性的,一些是利用性的。而且,引导人们是很有诱惑力的,显然,我的意思是,这就是我们的经验,我们带来了它,我们试图塑造它。有时是错误的,而且我过去也犯过很多错误,这很好。但忽视任何一种研究风格都是错误的。我观察到的。而且,我经常被问到,你在行业里,对吧?所以,我们确实可以获得大量的计算能力等等。所以,有些研究,我几乎觉得我们需要负责任地去做等等。但它有点像,我们这里有粒子加速器,所以,我们必须使用它。我们必须回答我们现在应该回答的问题,以促进科学进步。但同时,我看到许多进展,包括注意力,最初是在蒙特利尔发现的,因为计算能力不足。所以,当时我们与 Google Brain 的朋友们一起研究序列到序列模型。我记得我们使用了八个 GPU,当时这算很多了。然后,我认为蒙特利尔的规模稍微有限一些。但然后他们发现了这种基于内容的注意力概念,这显然引发了像 Transformer 这样的东西。并非所有东西都始于 Transformer。总有一个历史很重要,需要认识到,这样你就可以确保那些现在可能觉得,嗯,我们没有那么多计算能力的人,你需要帮助他们优化那种可能产生惊人变化的研究。也许它不像这些进步那样短期,或者也许它的时间尺度不同。但是,人们和该领域的多元化对于我们保持这一点至关重要。而且,有时,特别是与炒作或其他事物混合在一起时,观察到太多的相同想法,这有点棘手。但人类绝对是至关重要的。而且,我可以想到,是的,相当多的个人例子,有人告诉我一些事情,产生了巨大的影响,对某个想法产生了巨大的影响。然后,这就是为什么我说,至少在几年这个时间尺度上,可能有些事情确实会发生。而且,约束条件如何成为创新的必需品,这一点也很有趣。还有你提到的工程方面。我有一种预感,也许我过度了,我的爱是工程。所以,我有一种预感,所有的天才,很大一部分天才都在工程的细节中。所以,我认为我们喜欢认为我们的天才在于宏大的想法。我有一种预感,就像我看到工程细节的天才,使得白天和黑夜的差别。我想知道这些是否会随着时间的推移产生涟漪效应。所以,这也是。所以,这就是从工程的角度来看,有时那种安静的创新,在一名工程师的个人层面,或者在少数工程师的小规模上,可以带来巨大的改变,这种改变会随着我们工作的计算机而扩展,大规模地扩展到大群体。一个工程决策可以产生涟漪效应。是的,这很有趣。是的,我的意思是,工程也有历史。它可能是随机的。因为如果你想想深度学习和神经网络是如何起步的,感觉有点随机。因为 GPU 恰好在正确的时间出现,用于不同的目的,那就是玩视频游戏。所以,即使是硬件方面的工程,它也可能有一个时间,就像时间框架可能非常不同。我的意思是,这些 GPU 是多年来不断发展的,我们甚至没有关注。所以,即使在那个层面,革命,可以说,涟漪效应就像,我们会看到它们何时停止。但是,从思考为什么会发生这种情况的角度来看,我认为,当我试图将其归类为可能不那么明显的事情时,显然,有一场硬件革命,我们正在乘风破浪,得益于此。数据中心也是如此。我的意思是,数据中心是,例如,在谷歌,显然它们服务于谷歌,但现在也得益于此,并建立了如此惊人的数据中心,我们可以训练这些模型。软件是一个重要的方面。我认为,如果我看看我必须如何实现我的想法,我如何放弃一些想法,因为它们太难实现了。显然,时代已经改变了。而且,谢天谢地,我们在软件方面也处于更好的位置。然后,我的意思是,显然,有大规模的研究,更多的人进入这个领域,这很高兴看到。但它几乎是由这些其他事情实现的。最后但同样重要的是数据。策划数据集,标记数据集。我们考虑的这些基准,也许我们想要在一个系统中拥有所有基准。但仍然非常有价值的是,有人投入了思想、时间和远见来构建某些基准。我们看到了进展,多亏了它们。但我们将重新利用这些基准。这就是 Atari 的美妙之处,就像我们以某种方式解决了它,但我们在 Gato 中使用了它。它至关重要。而且,我敢肯定,还有很多工作要做,多亏了那个惊人的基准,有人花了时间去建立它。即使当时可能,哦,你必须考虑下一个,你知道,架构的迭代。这也许是该领域认识到的。但我们需要,这是我们需要平衡的另一件事,就人类而言,我们需要认识到所有这些方面,因为它们都至关重要。而且,我们倾向于,是的,我们倾向于想到天才,科学家等等。但我很高兴你,我知道你有一个强大的工程背景。但是,我也是一个数据爱好者,因为这是对工程评论的回应。最终,可能是基准的创建者拥有最大的影响力。安德烈·卡帕蒂,你提到过,最近一直在批评 ImageNet。他有权这样做,因为他对 ImageNet 的重要性,他对深度学习在 ImageNet 的发展和成功中的关键作用。而你说,那个基准正在阻碍该领域的发展。因为,我的意思是,尤其是在他特斯拉自动驾驶的背景下,他正在关注系统的真实世界行为。你认为 ImageNet 在某些方面存在根本性的缺失,它没有捕捉到我们需要的现实世界的某些东西。我们需要拥有那些具有令人印象深刻的不可预测性、边缘案例、无论是什么,让真实世界如此难以操作的基准。我们需要拥有这样的基准。但只是想想 ImageNet 作为基准的影响,这确实强调了基准的重要性,无论是内部的 DeepMind,还是作为社区的。所以,一个来自内部,我如何创建一个基准来衡量和取得进展?以及我如何为社区创建一个基准来衡量和推动进展?你有一篇很棒的论文,你合著了一篇题为“大型语言模型的新兴能力”的调查论文。我真的很想问你关于这里的哲学。我的意思是,神经网络、Transformer、语言模型中涌现现象的直觉是什么?是否存在一个神奇的阈值,超过这个阈值,我们就会开始看到某些性能,而这是否因任务而异?这是我们人类在说诗话和浪漫吗?还是真的存在某个水平,我们开始看到突破性表现?是的,我的意思是,这是我们在实际倾向于系统中的一个特性。在机器学习传统上,再次回到基准。我的意思是,如果你有一些输入输出,就像那只是一个单一的输入和一个单一的输出。你通常在训练这些系统时,你会看到相当平滑的曲线,当你分析数据集大小如何影响性能,或者模型大小如何影响性能,或者你训练系统多久如何影响性能。所以,你知道,如果我们想到 ImageNet,训练曲线看起来相当平滑和可预测。我的意思是,以某种方式。而且,我认为这可能是因为它是一种单跳的推理任务,对吧?就像,这是输入,你思考几毫秒或 100 毫秒,300 毫秒,就像人类一样,然后你说,是的,这张图片里有一只羊驼。在语言中,我们正在看到需要更多思考和更多思考的基准。我的意思是,以某种方式。这只是,你需要在寻找一些微妙之处,它涉及到你可能想到的输入,或者即使输入是一句描述数学问题的句子。需要更多的处理,更多的反思。所以,我认为这些基准的工作方式意味着,确实存在一个阈值。只是回到 Transformer 的工作方式,通过查询正确的问题来获得正确答案。这可能意味着性能变得随机,直到查询系统,Transformer 或像 Transformer 这样的语言模型,提出正确的问题。然后,只有那时,你才可能开始看到性能从随机变为非随机。而且,这是更实证的。目前还没有形式化或理论。虽然它可能非常重要。但我们正在看到随机性能的这些阶段性转变,直到某个,比如说,模型的规模,然后它就超越了。而且,你可能需要拟合一些低阶的思维片段,然后才能在整个任务上取得进展。如果你实际上可以衡量任务的分解,你可能会看到更平滑的。哦,就像,是的,一旦你得到了这些,这些,这些,这些,然后你开始在任务上取得进展。但它在某种程度上,有点令人恼火,因为这意味着,我们可能问的关于架构的某些问题,只能在一定的规模下进行。而我近年来在“深度学习科学”和“规模科学”方面取得的巨大进展,则相反。所以,负面的是,对于某些基准,进展可能需要至少在一定的规模下进行衡量,直到你看到模型的哪些细节对于提高性能很重要。
这有点像个骗局,但我们也看到,你可以,你可以通过实证分析在较小的规模下对模型的行为进行分析。比如说,举个例子,我们有那篇关于Chinchilla的论文,它修正了所谓的模型缩放定律,而整个研究都是在相当小的规模下完成的,可能从数亿到十亿个参数。然后,有趣的是,你创造了一些损失,一些趋势,你从数据中提取趋势,你看到,嗯,训练一个大10倍的模型所需的数据量将是这个,而这些定律,这些外推法到目前为止,帮助我们节省了计算资源,并在科学上取得了更好的进展,关于我们应该如何大规模运行这些模型,需要多少数据,需要多大的深度,以及我们开始提出的所有问题,都是从小规模外推而来的。但令人遗憾的是,并非所有东西都可以从规模上外推,这取决于基准测试,而且可能更难的基准测试不利于提取这些定律。但我们至少有各种各样的基准测试,所以我不知道阈值,这个相变尺度在多大程度上是基准测试的一个函数。一些科学的尺度可能是工程基准测试,在那里阈值很低,有点像是取一个主要的基准测试,然后以某种方式减少它,或者只留下本质上的困难。但出现,出现发生的尺度较低,这仅仅是为了科学方面,而不是实际的现实世界方面。是的,幸运的是,我们有相当多的基准测试,其中一些更简单,或者可能更像是人们可能称之为系统一与系统二风格。所以,我认为我们幸运的是,我们没有看到从稍微更平滑或更简单的基准测试中进行的外推能够转化为更难的基准测试。但这并不意味着这种外推将达到极限,当它达到极限时,我们扩展的多少或如何扩展将不幸地有点次优,直到我们找到更好的损失。嗯,这些定律再次是非常经验性的损失,它们不像模型的物理损失,尽管我希望在这些事情上也有更好的理论。但到目前为止,我想说经验性理论,正如我所称的,远远领先于机器学习的实际理论。让我几乎是出于好玩地问你一个问题,所以这不是作为DeepMind的人,或者与DeepMind或Google有关的,只是作为一个人类,并且看到关于一位Google工程师的新闻,他声称,我想是Lambda语言模型是有意识的,或者拥有,我仍然需要深入研究细节,但似乎是做了一个官方报告,并声称他相信有证据表明这个系统已经获得了意识。我认为这是一个非常有趣的案例,从人类层面、心理层面、技术机器学习层面,关于语言模型如何改变我们的世界,以及从哲学层面,关于人工智能系统在人类世界中的作用。那么,你觉得什么有趣?作为一名机器学习工程师和研究员,以及作为一个人,你对此有何看法?
嗯,有几个反应,实际上相当多。你有没有短暂地想过,这个东西是有意识的吗?所以,从来没有,绝对没有,即使是AlphaStar,等一下,什么?不幸的是,我想,是的,不幸的是,我没有。是的,我想,我想,目前的任何模型,尽管非常有用且非常好,但我想我们离那还很远。而且还有一个反面的故事。我的一大爱好是科学,我认为我有点像个失败的科学家,这就是我来到机器学习的原因,因为你总是感觉,并且你开始看到这一点,机器学习可能是可以帮助其他科学的科学,正如我们所见。你知道,它是一个如此强大的工具。所以,感谢那个角度,好吧,我热爱科学,我热爱,我的意思是,我热爱天文学,我热爱生物学,但我不是专家,我决定,嗯,我能做得更好的事情就是这些电脑。尤其是在我更多地参与AlphaFold学习蛋白质、生物学和生命方面,其复杂性感觉就像,我的意思是,如果你开始看看正在发生的事情,在那个原子层面。而且,我的意思是,显然我们可能倾向于将神经网络视为大脑,但它的复杂性和我认为的魔法量,我的意思是,我不是专家,所以它自然感觉更像魔法。但与这些计算大脑相比,看着生物系统,让我觉得哇,这仍然存在如此复杂的程度,对吧?数量级的复杂性,嗯,当然,这些权重,我的意思是,我们训练它们,它们做得很棒,但它们并不像生物实体、大脑、细胞那样。它只是感觉不可能达到相同的复杂行为水平。但我与他人交谈时的信念,肯定受到这种对生物学的惊叹的影响,也许是因为我了解太多关于机器学习的知识,但我肯定觉得,称之为,或者认为这个可微分的数学函数实际上是有意识的,等等,是非常牵强和遥远的。所以,关于这一点,它非常有趣。所以,你对机器和生物学都足够了解,知道它们之间存在许多数量级的复杂性差异,但你也知道机器学习是如何运作的。那么,对于与系统互动的人类来说,有趣的问题是,他们不知道潜在的复杂性,而且我见过人们,包括我自己,爱上一些相当简单的事物。所以,也许复杂性是画面的一部分,但也许它不是有意识、感知或模仿有意识的必要条件。所以,我的意思是,我想这方面的另一面是,那就是我个人的感受。我的意思是,你问我关于这个人,对吧?现在,看到其他人类对事物的感受非常有趣。我们就像,再次,我不是那么惊叹于那些我觉得不那么神奇的事情,因为也许,是的,我学习它的方式,以及我看到的曲线稍微平滑一些,因为你知道,就像看到香农在50年代以来的语言模型的进步,实际上看看那个时间尺度,我们的进步并不那么快。我的意思是,我们当时的想法,将近100年前的想法,与我们现在所做的并没有太大区别。但同时,是的,显然其他人,我的经验,个人经验,我认为没有人应该,你知道,我认为没有人应该告诉别人他们应该如何感受。我的意思是,感受是非常个人的。所以,其他人可能对模型等事物的感受是故事的一部分,对我个人作为一名研究员来说,理解这一点很重要。然后,当我可能不同意或不理解或看到,是的,也许这并不是我认为现在合理的事情,我知道所有这些。另一件事,也许部分原因是你很好地与我交谈并向世界传播机器学习,嘿,让我们稍微揭开魔法的面纱,多看看数学,以及字面上创造这些模型,如果我们有正确的软件,只需要10行代码,然后只是倾倒互联网。与人类的创造的复杂性相比,从他们的起源开始。以及整个宇宙进化的复杂性,直到我们现在。这对我来说感觉是数量级更复杂和迷人。所以,我想,也许我唯一在思考试图告诉你的是,是的,我认为解释一点魔法,有点魔法是好的。显然,热爱你在工作中所做的事情是好的,我当然也经常感到着迷和惊讶。但我想,希望作为生物学专家,他们会告诉我,这并不那么神奇,我很高兴通过与更广泛的社区的互动来学习这一点。我们也可以拥有一定程度的教育,这在实践中也很重要,因为我的意思是,一个问题是你对此的感受,但另一个非常重要的问题是你开始在产品等中与之互动。了解正在发生什么,什么没有发生,什么安全,什么不安全,等等,这是很好的。否则,技术就不会被正确地用于善,这显然是我们所有人的目标,我希望如此。
那么,让我问下一个问题。你认为为了解决智能问题,或者为了取代我们开始对话时提到的那个做采访的Lex Bot,你认为系统需要有意识吗?你认为它需要达到某种程度的意识吗?你认为人类思维中的意识是什么,这可能对创造人工智能系统有启发性吗?是的,老实说,我认为可能不需要达到那种程度的智能,就是这个大脑可以学习,可以非常有用,可以挑战你,可以教你,可以和你交谈,可以教它做事。我不太确定这是否必要,就我个人而言。但如果意识或任何其他生物或进化课程可以被重新利用来影响我们下一套算法,那将是一个很好的方式,实际上可以取得进展。同样,我试图稍微解释一下Transformer,当我们看文本时,我们感觉如何运作,特别是这些见解非常重要。所以,大脑可能如何进行计算的细节,我想我的理解是,当然有神经元,并且与神经网络有一些相似之处,但我们并不完全了解大脑的细节,以至于能够复制它。但然后,如果你稍微放大一点,我们如何思考,记忆如何工作,也许甚至进化是如何让我们走到这里的,探索与开发是怎样的,所有这些事情是如何发生的。我认为这显然可以为算法层面的研究提供信息,我见过一些例子,这些例子非常有用,可以指导研究,即使可能是出于错误的原因。所以,我认为生物学和我们对自己的了解可以极大地帮助构建我们称之为AGI的东西,这个通用的,真正的Gato,链条的最后一步,希望如此。但就意识本身而言,我至少不怎么费心去想如何将其添加到系统中。但也许,也许我的理解也是非常个人的,关于它的意义。我认为即使它本身也是一个长期的争论,我知道人们经常有,也许我应该更多地了解这一点。是的,我个人经常在个人层面上注意到魔法,尤其是在物理系统如机器人方面。我现在在奥斯汀有很多带腿的机器人可以玩,即使你对它们进行编程,当它们做一些你没想到的事情时,也会立即拟人化,你会注意到魔法,你会开始思考意识之类的事情。这更多地与有效的沟通有关,而不是任何这些戏剧性的事情。它似乎是沟通的一个有用部分,拥有意识的感知似乎对我们人类很有用。我们更认真地对待彼此,我们能够将该实体正确地放入你的记忆中,所有这些事情似乎都有用,至少是伪装成这样,即使你从未真正做到。所以,也许就像,是的,呼应这个问题,既然你和几个人谈过,你认为我们需要弄清楚一些事情才能在更宏大的世界意义上实现智能吗?是的,我个人相信是的,但我甚至不认为它会是一个独立的岛屿,我们将不得不去那里。我认为它会非常自然地出现。那对我们来说更容易,谢谢。但我认为思考它的重要性在于,我认为你会开始看到这种情况,就像这位谷歌工程师一样,你会越来越多地看到这种情况,特别是当你拥有与人类互动的AI系统时,他们没有工程背景。我们必须为此做好准备,因为会有,我相信会有机器人的人权运动,尽管听起来很傻,但会有很多人意识到这些智能实体,我与它们有着深厚的联系,我不想失去它们。它们已经成为我生活的一部分,它们对我意义重大,它们有名字,有故事,有记忆。然后我们开始问自己问题,嗯,这个东西看起来确实能够遭受痛苦,因为它讲述了所有痛苦的故事,它不想死,以及所有这些事情。然后我们必须开始问自己问题,人类和这个东西之间有什么区别?等等。所以,当你从工程角度,比如DeepMind或任何构建系统的人那里进行工程设计时,未来可能会有一些法律,不允许你设计具有意识表现的系统,除非它们被明确设计成这样,除非它是宠物。所以,如果你有一个只是做客户支持的系统,你依法不允许表现出意识。我们将开始问自己这个问题,然后,这将是软件工程过程的一部分。我们有哪些功能,其中之一是通信必需品。但重要的是要开始思考这些事情,特别是它们如何吸引公众的注意力。是的,绝对,绝对。这是一个肯定很重要的话题。我认为,在某种程度上,我总是看到,不是,我的意思是,不是每部电影在某些事情上都同样准确,但科幻小说在这种意义上至少让社会为开始思考某些话题做好了准备,即使现在谈论还为 উপাদান,只要我们是理性的,它肯定会为我们即将到来的研究以及如何,我的意思是,有很多重要的挑战和话题,伴随着构建一个智能系统,其中许多你刚刚提到。所以,我认为,我们永远不会完全准备好,除非我们谈论它,并且我们也开始,正如我所说的,扩大我们交谈的对象,不仅仅包括我们自己的研究人员等等。事实上,在DeepMind等地方,有更多的跨学科团队正在形成,开始提问并与我们一起解决这些问题。因为显然,当你做博士研究时,这最初并不是你的热情所在,但肯定会到来。所以,这是一个迷人的,它是我热爱的一个方面,那就是学习。所以,在这种意义上,这是一个新的领域,作为一个学习系统,我自己,我想继续探索。而且,我认为很高兴看到,你知道,辩论的某些部分,甚至我在处理AI的会议上看到了一定程度的成熟度。如果你看看五年前,到现在,仅仅是研讨会等的数量就发生了巨大的变化。看到关于安全、伦理等话题的出现是多么令人印象深刻,这是很棒的。如果你太早了,当然没关系,我的意思是,这是一个很大的领域,有很多有兴趣的人会取得进展。而且,显然,我认为我们并不太晚。所以,在这种意义上,我认为我们现在这样做很棒,最好是太早,而不是太晚,当涉及到超级智能系统时。
让我问下一个问题,说到有意识的AI,你称赞了你的朋友Elias Giver,因为他被选为皇家学会会员。所以,只是为了向一位同事研究员和朋友致敬,Elias Giver的才华的秘诀是什么?另外,你是否相信他的推文,正如你和Andrej Karpathy所假设的那样,是由语言模型生成的?是的,我强烈相信Elias将在几周内来访,所以我会在当面问他。他会告诉你真相吗?是的,当然,绝对。我的意思是,我们,最终,我们都有共同的道路,而且有友谊超越了机构和等等。所以我希望他告诉我真相。嗯,也许AI系统正在劫持他?也许他有一些视频,他不想发布?所以,也许它已经控制了他?所以,如果我当面见到他,他就会知道。但是,我认为,我认为Elias的个性,认识他一段时间了,是的,他在Twitter上的每个人,我想都有不同的个性,而Elias的个性,我并不惊讶。所以,我认为认识Elias,在社交媒体和AI如此普遍之前,我认出了他的很多特点。这是我为一位没有改变的朋友感到高兴的事情,或者说仍然忠于自己。显然,你的领域变得越来越受欢迎,而他显然是该领域的主要人物之一,做出了很多进步。所以,我认为这里的棘手之处在于如何平衡你的真实自我与你的话语所承担的责任。所以,在这种意义上,我认为,是的,我欣赏这种风格,我也理解它。但是,它引起了关于他的一些推文的辩论,也许我们尽早进行这些辩论是好的。但是,是的,反应通常是两极分化的。我认为我们只是在某种程度上看到了社交媒体的现实,反映在他正在发推文的那个特定话题或一组话题上。是的,我的意思是,他谈论这种紧张关系很有趣。他是深度学习领域的早期奠基人之一,所以这是一种责任。但他也是,与他互动了很多,他只是一个杰出的思想家,就像你一样。而且,存在着成为管理者与真正思考非常新颖的想法之间的紧张关系。科学家与管理者。他是我这个时代最伟大的科学家之一。这很有趣,而且人们告诉我他也很傻,我还没有完全发现,但在私下里,我们得看看。是的,是的,我的意思是,只是关于这一点,我的意思是,Elias一直是一个灵感。我的意思是,相当多的同事,我可以想到塑造了你成为什么样的人,Elias肯定占据了首位,如果不是接近首位的话。如果我们回到关于该领域的人们的问题,他们是如何改变该领域或不改变该领域,我认为Elias的案例很有趣,因为他确实深信神经网络的扩展。有一个至今仍然著名的演讲,来自序列到序列论文,在那里他只是声称,给我监督数据和大型神经网络,然后,你知道,你基本上可以解决所有问题。这种愿景,很多年前就已经存在了。所以,很高兴看到像这样的人,在这个领域非常深入地研究这种风格的研究,并且显然取得了巨大的成功。关于那个演讲的有趣之处在于,我们在一家酒店房间里排练了演讲,而演讲的原始版本甚至会更具争议性。所以,也许我是唯一见过演讲未经过滤版本的人。而且,你知道,也许时机成熟时,我们应该回顾一下Elias演讲中跳过的一些幻灯片。但我真的认为,对某种风格的研究的深刻信念是值得的。有时务实是好的,我实际上认为Elias和我一样务实。但也有一些长期的信念和轨迹是好的。显然,有一些运气成分,但也许那是正确的道路。然后你显然领先,并且对该领域产生了巨大的影响,正如他所做的那样。你同意这种直觉吗,也许Rich Sutton在“苦涩的教训”中写到的,从70年的AI研究中可以读到的最大教训是,利用计算的通用方法最终是最有效的。你认为这种直觉最终是正确的吗?通用方法利用计算,允许计算的扩展来完成大量工作,所以我们人类的基本任务是设计越来越通用,而不是越来越具体于手头任务的方法。我当然认为这基本上模仿了深度学习研究,几乎就像一种哲学。一方面,我们希望对数据不敏感,我们不想预处理数据集,我们想看到原始数据,就像它本身一样,然后学习所有东西。所以,非常同意这一点。而且,我认为扩展至少是构建令人难以置信的复杂系统的必要条件。它可能不是充分的,需要一些突破。我认为Rich Sutton提到了搜索是扩展的一部分,我见过它,根据我的经验,这更加混合。所以,从这个教训来看,搜索有点棘手,因为它在围棋等领域很有吸引力,那里有一个清晰的奖励函数,你可以丢弃一些搜索痕迹。但在其他一些任务中,并不清楚如何做到这一点。尽管最近我们的一项最新工作,实际上主要是模仿或延续,甚至团队和相关人员都与AlphaStar非常相似,是AlphaCode,在其中我们实际上看到了苦涩的教训,即模型的规模和大量的搜索产生了这种能够进行人类水平代码竞赛的非常有趣的结果。所以我见过它被字面上映射到搜索和规模的例子。我对搜索部分不太确定,但当然我确信规模是必需的。所以,我们需要通用方法,我们需要测试它们,也许我们需要确保我们可以在实践中根据我们拥有的硬件来扩展它们。但然后我们也许也应该根据可能需要扩展的方法来塑造硬件的样子。这是一个有趣的对比,GPU评论,我们几乎免费获得了它,因为游戏正在使用它。但也许现在,如果需要稀疏性,我们就没有硬件了。尽管理论上,我的意思是,很多人正在构建不同种类的硬件。但这里有一些关于硬件彩票的说法,它可能会对我们取得进展的速度产生影响,至少在几年内,我们可能会朝着某种神经网络版本或任何接下来可能实现真正智能代理的东西迈进。
你认为在你的一生中,我们会建造一个无可争议的AGI系统,它实现了人类水平的智能,并远远超越吗?我绝对认为这是可能的,它将远远超越,但我绝对确信它将是人类水平的智能。而且,我正在假设超越,因为超越部分有点棘手,特别是当我们从模仿学习的角度开始看目前的公式时。所以,我们当然可以模仿人类,在语言和其他方面。所以,通过模仿达到人类水平感觉非常可能。超越将需要强化学习和其他东西。而且,我认为在某些领域,这肯定已经得到了回报。我的意思是,围棋是一个例子,到目前为止,这是我最喜欢的,就超越人类能力而言。但总的来说,我不确定我们能否定义奖励函数,从模仿人类水平智能的立场出发,这种智能是通用的,然后超越。这部分并不那么清楚,至少在我的一生中。但肯定,人类水平的,是的。而且,我的意思是,这本身已经非常强大了。我认为,超越,我的意思是,显然我们不会不尝试。如果,然后我们达到了超人类,发现了世界,并推进了世界。但至少人类水平的,总的来说,也非常非常强大。
尤其是当人类水平或略高于人类水平的智能与人类社会深度融合,并且有数十亿这样的代理时。你认为是否存在一个奇点时刻,在那之后,我们的世界将仅仅被这些系统深深地改变?因为现在你谈论的是智能系统,这不再仅仅是从马车到汽车的转变,感觉是一种非常不同的转变,以及作为地球上的生命实体意味着什么。你害怕吗?你对此感到兴奋吗?我害怕,如果有很多,所以我想也许我们需要思考,如果我们真的到达那里,只是想想有限的资源,比如人类显然会遇到一些限制,然后希望有一些平衡,生物学上,地球正在施加,而我们应该努力做得更好,因为我们知道,有很多问题,关于太多人,在资源有限的情况下共存。所以,对于数字实体来说,这是一个有趣的问题。我认为应该存在这样的限制,但也许它将由能源可用性来决定,因为这也消耗能源。事实上,大多数系统在能源消耗方面比我们更低效。但绝对,我认为作为一个社会,我们将需要共同努力,找到什么是合理的增长,或者我们如何共存,如果那将发生的话。我非常兴奋,显然是自动化方面,那些让人们,显然无法获得某些资源或知识的人,能够获得这些资源和知识。我认为这些是,在某种程度上,我最期待看到的应用程序,并且我个人努力的方向。是的,生产力和生活质量将在整个人口中得到显著改善,这非常有趣。但我甚至在展望更远,超越我们成为一个多行星物种。而且,只是快速打个赌,最后一个问题,你认为随着人类成为多行星物种,走向太阳系之外,所有这些事情,你认为未来世界会有更多的人类还是更多的机器人?所以,人类将是过去的古怪智能生物,还是人类智能有一些根本性的东西是真正特别的,以至于我们将成为那些其他行星的一部分,而不仅仅是AI系统?我认为我们都热衷于构建AGI,以赋予人类物种力量或使其更强大,而不是说可能存在一些杂交。我的意思是,这显然是猜测,但也有公司正在尝试,就像医学正在让我们变得更好一样,也许还有其他事情即将发生。但如果比例不是最多一比一,我不会高兴。所以我希望我们是其中的一部分。但也许一对一的比例感觉是可能的,建设性的,等等。但至少从我的核心信念和我上班的原因,以及我研究的内容来看,不平衡是不好的。
这就是我知道你是人类的方式,这也是你通过了图灵测试的方式,你是那些特殊人类之一。能够与你交谈是一种巨大的荣幸,我希望我们有机会再次交谈,也许在奇点之前一次,之后一次,看看我们的世界观如何改变。再次感谢你今天的谈话。感谢你所做的了不起的工作。你是这个社区中研究员和人类的杰出榜样。非常感谢你,Lex。是的,我期待着奇点之前,当然,也许之后。感谢收听与Ariel Vignealis的对话。为了支持这个播客,请查看描述中的赞助商。现在,让我用艾伦·图灵的一些话来结束。那些能够想象任何事情的人,都可以创造不可能。感谢您的收听,希望下次再见。