Transcription
但是,要真正构建通用人工智能,我们需要人工智能不仅能从我们的数据中学习,对吧?从我们的状态经验中学习,但如果我们能让这个人工智能不断改进并自我完善,那将非常强大。例如,如果我们让一个人工智能代理在“精灵”的世界里生活几个月或几年,看看它能发现什么,那将很有趣,对吧?因为我们已经看到了像英伟达的 Voyager 的例子。你让一个代理玩《我的世界》,它就能学会《我的世界》的机制。它能学会生存。它能学会制作物品,变得有创造力。所以,我认为下一波人工智能不应该仅仅是智能,还应该是创造性的,因为我们人类的许多思维过程、解决问题的能力都是开放式的。它们是持续从经验中学习的,而我们努力改进自己,对吧?例如,如果我们卡在一个问题上,我们就会尝试用新的知识、新的工具来增强自己,对吧?我认为这就是我们应该如何训练我们的人工智能,因为我们需要人工智能不断地完善自己,而且我们最近已经看到了这些成功的故事,所以我认为我们离一个开放性将是实现更智能系统的关键因素的未来并不遥远,并希望将我们带到更接近通用人工智能的未来。[音乐][音乐]感谢您加入“改变世界”。我是主持人艾迪·A。今天,我非常荣幸地邀请到香港中文大学(深圳)的博士生、华为的研究实习生理查德·斯万迪先生。他对构建能够持续学习、从有限数据中高效获取知识以及在不断变化的各种任务中进行泛化的开放式智能系统感兴趣。他也是博客“Posterior Update”的作者。所以,理查德,我非常非常感谢您抽出时间参加播客。我想先从大型语言模型与世界模型开始,你知道的。我认为我的听众中很多人都明白大型语言模型是什么。这些基础模型,它们不仅在海量的文本语料库上进行训练,还在图像、视频和代码上进行训练,并且能够预测下一个词元,并创建文本到图像、文本到视频、文本到游戏等等。但很少有人理解世界模型是什么。如果你能解释一下世界模型是什么,以及它目前能做什么,那就太好了。>>是的,完美。首先,谢谢艾迪的邀请。我很高兴能参加这个播客,是的,也许我们先从一些基础知识开始,大型语言模型以及大型语言模型和世界模型之间的区别。所以,也许这里的大多数听众都熟悉大型语言模型。就像名字一样,它们基本上是语言模型。所以它们主要用于文本生成,尽管我们已经看到了许多变体。例如,今天的大型语言模型可以做的不仅仅是文本生成。它还可以生成图像。它还可以生成代码。所以,许多这些模态也可以作为输入到这个大型语言模型中。然而,在大型语言模型的基本工作中,它们基本上只是下一个词元的预测。所以,无论你想生成代码还是生成文本,生成一个故事,基本上它会获取所有先前的信息或到目前为止的上下文,然后它会尝试生成最可能的文本或代码的延续。对吧?所以,本质上它只是一个概率模型。所以它会考虑所有可能的组合,或者可能是代码的词语选择的可能选择,并在下一步输出,对吧?然而,它缺乏一些物理理解,或者基本上,你知道,我们的世界更加复杂,对吧?我们的世界有许多因果效应,许多物理特性,而这正是世界模型的作用所在。所以,世界模型的主要思想或主要前提是,如果我们不只是使用概率分布,对吧?如果我们能将一些物理知识甚至因果知识注入到这类人工智能模型中,而这正是世界模型试图做的。所以它们试图模拟我们的世界。所以,例如,我们生活在日常生活中,我们的生活中有很多有趣的事情发生。例如,一些有趣的物理现象。例如,如果我们扔一个球,它会因为重力而落下,如果我们打碎一块玻璃,它会碎掉。所以,我们希望它们不仅能根据它们写下的文本来记忆这些理解。当然,大型语言模型可以做到这一点,对吧?所以,如果你问 ChatGPT,你可以问它会发生什么,例如,如果我扔一个球,它就可以回答。但我们不确定它只是在记忆,还是因为它已经从教科书中看到了,或者它是否真的理解物理学,或者如果我改变物体,如果我改变场景,会发生什么,对吧?所以,这就是为什么世界模型试图将这种物理意义和因果理解注入到这些人工智能模型中。>>谢谢你的解释,简化了它。是的,我认为,你知道,大型语言模型,你知道,它们被称为下一个词元预测器,但我认为它们做得更多。而这些世界模型,大型语言模型缺少的是,你知道,这些大型语言模型没有物理基础,它们没有像世界的空间理解。而这些世界模型的意图是拥有空间理解并具备物理基础。现在,你知道,在一次采访中,汉森·王曾引用过,他说大型语言模型不仅仅是模式匹配器,你知道,它们做得更多,它们会发展出自己连贯的世界模型。你能为我的听众解释一下他的意思吗?>>就像你提到的,伊利亚大概在两年前有一个惊人的预测,震惊了世界,很多人相信他,也有很多人不相信。他说,实际上,大型语言模型本身就在构建一个世界模型,因为他认为,例如,大型语言模型是在整个互联网上训练的,对吧?所以它包含了我们人类历史上的几乎所有知识。它理解我们的大量直觉,我们的大量想法,我们的大量例如,当我们看到事物时的思维过程,对吧?所以,伊利亚认为,它们可能已经构建了一个关于它所看到的一切的内部的或潜在的世界知识。这可以从互联网上的所有文本、所有知识中推导出来。他们提到,因为这些知识非常庞大,而大型语言模型似乎将其压缩了,因为在训练过程中,它需要学习如何进行这种下一个词元的预测,对吧?所以,伊利亚认为,由于数据量巨大,知识量巨大,它可能拥有这种内部模型,这是由于训练的经验。所以,这就是他基本上争辩的。>>非常非常有趣,因为这些大型语言模型显然在做一些更的事情,我认为世界上一些最聪明的人也无法理解。是的,我认为大型语言模型是否能够生成自己的世界模型是有争议的,我认为伊利亚·伊利亚也曾说过,你知道,当 ChatGPT3 发布时,你知道,这些模型有点意识。我认为这些是统计模型,但我认为即使是这些统计模型也显示出一些新兴的特性。现在,这些新兴的特性也是有争议的,但很明显,在这一点上,人工智能本身是一个完全的黑箱。即使我们努力进行可解释性研究,我们仍然不完全理解这些人工智能模型的全部功能。现在,在2023年初,我采访了一位很棒的创始人,他叫阿德南·努尼斯,他是 Opus AI 的创始人,他正在做一些非常非常酷的事情。他正在构建一个生成式人工智能堆栈,他的应用程序是,你输入提示,通过提示,他正在构建这些世界,你知道,这些世界是这样的。所以,这可能是通过生成式人工智能可以做到的早期一瞥,你输入你的文本,模型就能够创建这些连贯的、你知道的,美丽的世界。如果你能解释一下,你知道,你如何着手构建这些世界模型,构建一个健壮的、也许是可泛化的世界模型所涉及的主要架构和数据挑战是什么?>>是的,很棒。主要是有一篇非常有趣的论文,我认为是世界模型领域最有影响力的论文之一。这是一篇2018年的论文,作者是 David Ha 和 Euran Smith Huber。所以,我认为,是的,他们也有一个博客,我认为你可以在网上找到关于世界模型的内容。基本上,他们认为要构建一个世界模型,你需要三个主要组成部分,对吧?所以,基本上,第一个是视觉,所以 V 组件,基本上视觉是这类模型的眼睛。它接收所有高维度的观察。就像我提到的,虽然我举了眼睛的例子,但它不一定只是图像或视频。所以,基本上它可以接收任何高维度的观察。你可以将其表示为一个高维向量,对吧?它试图将其编码成某种紧凑且有意义的表示。所以,基本上它们接收这个观察,包含大量信息,其中一些可能是噪音,很多信号,它们试图将最重要的部分编码成有意义的表示。然后第二个组成部分涉及记忆,即 M 组件,它试图通过所有编码的表示来学习模式。它们试图利用这些模式来学习,看看这些数据中出现了哪些模式,并试图利用它们来预测未来的状态。所以,基本上它是从经验中学习和预测。所以,这是记忆组件。最后一个是控制器。所以,我认为这是与仅仅是大型语言模型和世界模型之间的主要区别之一,因为世界模型也有这个控制组件,它们试图不仅使用视觉的表示,而且基于记忆,对吧?基于观察到的状态和经验,它们试图压缩这些并用于选择一些动作。所以,世界模型也可以选择一些动作。所以,基本上这就是为什么我认为它们可以进行一些很棒的模拟。例如,如果你采取一些行动,我认为最近你可以看到,通过 Genie 树,你也可以在世界中采取一些行动,对世界进行一些改变,因为它们确实有某种方式来操纵世界,操纵模拟,使其更加逼真。所以,这些是三个组成部分。当然,随着时间的推移,技术一直在发展。我认为在2018年,它们使用 VAE 进行视觉,使用 RNN 进行记忆,对吧?但现在你可以看到,随着 Transformer 和视觉模型的发展,我认为最新的 Genie 模型使用某种视觉 Transformer 来编码这种图像和视频。它们还有一个基于例如强化学习或优化循环训练的潜在动作模型。所以,当然,训练范式可能会改变,但我认为这些是大多数世界模型应该拥有的三个主要组成部分。>>非常非常有趣,感谢您分享信息,视觉、记忆和控制器。是的,我认为 Genie 模型,你知道,它是一个非常棒的模型,你知道,它目前所做的事情非常令人惊叹,我意思是,你知道,像保留记忆,那个小人画画,然后你回头看,你就能看到,你知道,它是扎实的,我意思是,那个画的部分仍然固定在那里。所以,非常有趣。而这些模型,它们变得如此独特,以至于它们可以预测世界上下一个可能出现的空间,你知道,所以它们变得非常非常有趣,这些交互式的、可玩的世界。至于我们人类,你知道,我们人类可以推断出复杂的、你知道的世界动态,而且我们不需要大量数据。而这就像,你知道,当我们出生时,我们获得的数据有限,但我们能够快速地理解周围的环境并能够泛化,妈妈,爸爸,你知道,奶瓶等等。但这些模型似乎还没有做到这一点。你认为正在研究哪些技术可以使这些人工智能代理能够用显著少的数据学习强大的、你知道的世界模型?>>是的,这是一个非常有趣的问题。所以,我认为这让我想起,你知道,一些研究人员。他们分享了,例如,我们越来越多地遇到数据瓶颈,对吧?例如,就像你提到的,无论如何,就像我们人类一样,我们可以很容易地,例如,即使是孩子,你知道,四岁或五岁的孩子,他们可以根据他们的试错和经验快速学习。但人工智能模型似乎不是这样,它们非常饥渴数据,你需要大量数据,大量例子才能做到。是的,你可以说我们面临数据瓶颈,因为例如,互联网越来越饱和,你可以看到所有基准测试都越来越饱和,它们被那些人工智能模型达到了极限,但我们,我认为,不是很多,不是很多人工智能模型取得了真正的突破,对吧?最近。所以,我认为这就是,我认为谷歌 DeepMind 的另一篇论文,我认为是 Richard Sutton 和 David Silver 的论文,他们提到我们很快将进入他们称之为“经验时代”。而不是仅仅依赖数据,因为数据,例如,你很快就会遇到数据瓶颈。当然,我认为我相信,并且我对合成数据增强的一些想法非常看好,我认为这可以帮助缓解数据问题。然而,我更感兴趣的是这种经验。所以,基本上,Richard Sutton 和 David Silver,他们是我们领域中最受尊敬的研究人员之一,他们认为我们需要从经验中学习。让这些人工智能代理走出世界。所以,就像你提到的,我们已经有了这些相当不错的人工智能模型,它们在生成世界、生成现实方面做得很好。那么,为什么不将它们部署到这些模型中,让它们去探索呢?所以我认为这种方式非常有效,因为正如你所见,我认为通过,我认为你可以看到,通过 AlphaZero 和 AlphaGo 从自我对弈中学习经验非常有效,对吧?你不需要大量人类标记数据,你不需要大量人类监督,但只要让人工智能代理与自己对弈,玩数百万场游戏,你就可以看到性能可以得到极大的提高。所以我相信,通过我们的人工智能代理和世界模型,如果让它们从经验中学习,它们也可以获得更好的性能。然后,同时,世界模型从人工智能代理的反馈中得到完善,然后代理可以在一个更好的世界中生活,然后它们获得一些反馈。所以,我认为这形成了一个非常积极的反馈循环。>>有趣的是,你提到的关于数据瓶颈的观点。我采访过 Alvin Wong。他是 STC 的首席执行官。他是一位很棒的人,他的看法不同。他认为数据不是瓶颈,因为他对数据的论点是,你知道,目前有如此多的私有数据。你知道,我认为世界上一些顶尖公司,小公司,大公司,你知道,有如此多的私有数据没有公开。所以,他真的相信数据可能不是瓶颈。你知道,有如此多的数据,也许我们还没有能够利用或使用。最终,如果我们做到了,我想,你知道,模型只会变得非常棒。而关于学习经验和自我对弈的观点,我认为这是非常核心的。而合成数据的加入,我认为是因为当今世界,你知道,有数据是由人类创造的,也有越来越多由合成数据生成。我认为,这些东西,也许我们可以看看数据是否真的是瓶颈,也许我们可以从这些私有公司那里获取数据,然后也许是合成数据。而我认为,你知道,规模化假设在那里,当然,你知道,还有很多东西仍然可以被利用。也许甚至是我们创建这些模型的方式,因为我认为我们正处于创造人类历史上最棒的工具的边缘。而我们正在做我们最擅长的事情,你知道,我们最擅长的是打破东西,分裂东西。现在,想象一下,如果我们团结起来,例如,在 COVID-19 发生时,我认为我们在如此短的时间内就创造了疫苗,因为全世界我们都携手合作。而今天,想象一下,如果我们有 DeepMind、OpenAI、Anthropic、Google、Meta,所有这些公司都联合起来,我相信我们可能已经开发出了通用人工智能机器。但我想,由于我们被贪婪和个人成长所困扰,以及这种“好吧,让我们构建这些通用人工智能机器,最终如果我们得到了它,我们将成为领导者,然后我们将统治世界”的整个努力。我认为这种对话本身就是错误的。我们需要改变它,我不太确定人类是否已经进化到能够理解我们是否能做到这一点,因为如果我们做到了,我们将进入一个多么美好的世界,我们也许能够逆转衰老,我们也许能够消除所有疾病。但是的,我认为,也许这些是根本性的瓶颈。我认为这不仅仅是数据瓶颈。现实世界,你知道,有很多固有的不确定性。你知道,就像我现在做的事情一样,如果我做某事,可能会发生意想不到的事情。那么,这些当前的世界模型如何表示、推理这些不确定性,以及有哪些有希望的途径可以提高它们处理不完整世界信息的能力?>>是的,我认为这是一个很好的问题。所以,是的,我们已经看到,现在大型语言模型有这种推理链,对吧?例如,我们现在可以看到它们的推理,它们的思维链,当它们解决问题时。但我认为对于大型语言模型来说,因为它们受限于文本,我们只能通过文本看到它们。但即使是这些大型语言模型,我认为一些研究人员,我知道有很多论文都讨论过,如果我们让大型语言模型不仅在文本中推理,而且如果我们能用其他表示法来使用它呢?所以我认为有一篇来自 Meta 的论文,我认为他们提出,当我们在实际不理解它们在说什么时,这些大型语言模型可以表现得更好。有点像潜在思维。我认为这是论文的标题,有点像潜在思维或在潜在空间中思考。所以,这些东西。所以我认为这对于我们的世界模型来说也是有效的,因为就像你提到的,不仅仅是输入是文本,对于世界模型来说,有很多模态涉及,你知道,视觉和记忆,就像我提到的,以及基于经验,我认为如果只限制在文本中,这是非常有限的。如果我们让这些模型拥有这种潜在空间,例如,它们可以输出它们的各种不确定性,它们不确定的东西是什么?也许它们也有一些推理链。它们有这种内在的声音,对吧?在它们采取行动之前,它们会思考,哦,它们可以想象,因为世界模型基本上是在模拟现实,对吧?所以,我认为从根本上来说,没有任何限制会使想象事物变得困难。例如,我们可以有一个新的术语,不仅仅是思维链,而是想象力,或者在那个时候,这些人工智能模型也可以梦想一些场景,对吧?我认为那会很有趣。>>是的。是的。所以,理查德,我认为,你知道,我们正进入一个非常有趣的阶段。我记不起这位研究人员的名字了,我几年前采访过他,我认为他来自斯坦福大学,他创造了一个能够预测犯罪的模型。你知道,那还处于非常初级的阶段,但他实际上也在美国的一个城市部署了它。你知道,那非常有趣。你知道,即使数据有限,它也无法泛化,但通过输入一定类型的数据,模型就能够预测在某个区域可能会发生犯罪。所以,我认为这些世界模型可能有效地模拟了这些未来。你知道,就像你指出的,它可能有一个内在的模型或某种内部思维过程。你能谈谈这些当前的模型吗?你知道,因为现在有很多世界模型。你知道,有 Genie3、Hunan,我认为他们正在构建一些东西。还有 Odyssey,还有 Dicat,我认为这是一家以色列公司。还有 Lucid,还有其他公司正在构建世界模型。所以,如果你能向我的听众详细介绍一下世界模型的特点,它的记忆,它对物理的理解,以及它的应用,世界模型的应用可能是什么,那就太好了。>>是的,我认为这些天我们很幸运能看到这么多世界模型领域的进步,对我个人来说,这是我一生中见过的最伟大的事情之一,这种人工智能,多么美好的时代,看到这种模型模拟现实。所以,我认为就像你提到的,有很多公司在构建这些,我认为一些著名的例子包括谷歌 DeepMind 的 Genie3,以及由李教授领导的世界实验室,还有来自中国公司,我们也有腾讯,他们也有这个 Hunan,这种模型。>>是的,我认为他们的目标是相同的,他们试图构建下一代世界模拟器。而这些拥有非常广泛的应用,你知道,我认为最直接和最简单的应用当然是游戏。所以,我们知道,多年来,我们一直依赖游戏模拟器。但如果你有构建游戏的经验,这些模拟器非常难以使用,对吧?因为你需要某种硬编码一些物理定律,你需要照顾很多方面,对吧?例如,角色的连贯性,以及灯光,阴影,例如。更不用说,如果你有一个非常虚构的游戏,那么你有很多机制需要自己编写代码,对吧?但是通过这种世界模型,就像我提到的,例如 Genie 树,我们可以看到它们已经有了这种有趣的涌现特性,它们似乎已经理解并已经嵌入了物理理解。所以,例如,我认为你可以看到一些视频中的例子,或者来自 Genie3,甚至最近,我认为世界实验室也提供了一些关于他们模型的预览。所以,即使从一张图片开始,它也能推断出下一个像素是什么,或者接下来最可能看到的是什么,即使当我们采取行动时,它也能非常连贯。我认为你之前提到的绘画例子,我认为那真的很令人印象深刻,因为我们在游戏中付出的很多努力,例如,我们想编码这种连贯性,我们想编码环境,然后我们就可以通过一些提示,提供一些参考图像,然后就可以了。你就有了一个游戏场景,对吧?另一个应用我认为值得一提的当然是娱乐,对吧?因为我认为随着最新的硬件技术发展,我们有了 VR 技术,我们有了,例如,Vision Pro,对吧?我们有了 Meta Quest,对吧?那么,我认为很快,对吧?我认为很快我们将进入元宇宙,对吧?就像他们提出的那样。所以,娱乐不再仅仅是静态的体验,例如看视频、看电影,但它可以非常互动。例如,你甚至可以走进那个世界,你甚至可以戴上头显或 VR 眼镜,然后你就可以成为那个世界的一部分。我认为这种网络模型是这类技术的重要驱动力之一,因为现在你可以模拟任何你想体验的东西,对吧?但当然,还有很多事情需要我们去做,才能让它身临其境。但我认为在提供非常逼真的体验方面,我认为世界模型是实现这一目标的一个很好的竞争者。>>对吧?是的。多么有趣。所以,我投资虚拟现实已经有十年了。你知道,整个游戏过程,你知道,就像传统的游戏过程,你知道,我意思是,你必须首先可能要有一个你想要创造的游戏的想法。然后你开始可能设计,如果是2D还是3D游戏。你设计那些模型。然后你把它带到游戏引擎,你知道,今天最先进的游戏引擎是 Unity 和 Unreal。你把这些游戏引擎带进来,然后你花很多时间来编程那些动作和互动等等。而创造一个游戏需要付出巨大的努力。而今天我们有了这些世界模型,就像,你知道,你输入一张图片,这张图片就可以玩了。多么酷,多么有趣啊?而且也很可怕,因为你知道,我相信有数百万,可能,我认为有游戏创作者,感谢 Roblox,你知道,因为我意思是,现在的孩子,我认为他们正在创造游戏,因为他们着迷。而就像你指出的,虚拟现实,我认为,在接下来的十年里,以扩展现实(AR、VR、MR 的总称)的增长速度,我认为我们将沉浸在 XR 中。我们将拥有代理式人工智能。我们将从携带技术转向穿戴技术。我的意思是,你的手机和电脑将成为一个单一的可穿戴设备,就像这个可穿戴设备一样。而整个世界将成为一个画布,一个屏幕,你的电脑,你的影院屏幕,以及一切。这就是我们正在进入的世界,它将由 AR、VR、MR 提供动力。而由于人工智能层,你将拥有一个永不缺席的人工智能代理。该代理将为你做任何你想做的事情。如果我们所有人团结起来,这将变得非常有趣。而如果有一个集中的公司,你知道,正在构建这种未来,那将非常可怕。你是否担心这种世界模型不断增长的未来?你对世界可能是什么样子,娱乐的未来可能是什么样子,游戏可能是什么样子,有什么想法吗?它将如何颠覆那些真正,你知道,也许他们的生计就是创造游戏和娱乐的人?你认为当这些世界模型发展并能够真正创造出精彩的可玩世界时,世界将受到多大的影响?>>是的,我认为这是一个非常重要的问题,对吧?因为就像我刚才提到的所有好处一样。首先,它能够实现下一代游戏,下一代娱乐。我认为当然,所有这些技术突破,它总是一把双刃剑,对吧?你有积极的一面,也有消极的一面。当然,就像你提到的,这些模型擅长的一件事就是,你可以基本上让每个人都成为一个游戏程序员,一个游戏开发者,对吧?因为你只需要有一个想法,你就有这个想法,这是我想制作的游戏,对吧?即使是角色,你也不必自己画,你甚至可以使用这种图像生成模型来为你生成角色和所有资产,然后你把它们都放进这些世界模型中。你给它参考故事,参考提示,参考图像,然后砰,你就有了游戏,对吧?所以,当然,很多这个过程可以自动化,这意味着,我认为对于初级职位,对于那些在游戏行业或娱乐行业工作的人来说,对于更多冗余的任务,更多基础编码,我认为这很快就会被取代。我认为这就是我的看法,这可能非常可怕。但是,我认为另一方面,仍然有很多机会和很多门可以打开。因为虽然这些低级和冗余的硬编码任务可以自动化,但仍然有很多创造力,甚至高级机制,可以由资深程序员甚至人类专家设计。所以,当然,人类仍然需要参与其中。但是,对于那些想在这个行业中生存下来的人来说,他们需要升级他们的技能,以便能够使用和利用这些世界模型作为工具,你需要成为这些模型的某种指导者。所以,我认为这是关于职业和就业前景的疯狂影响。但是,我想稍微谈谈我能想象到的另一个可怕的事情,如果你不介意的话。所以,我认为有了这种人工智能模型,我们已经看到了,例如,从简单的视频生成模型开始,例如 Sora 和 V3。我认为,不久前,Andrej Karpathy,一位非常著名的该领域的人工智能研究员,他说他担心这种视频生成可能是有害的,对人类有非常坏的影响。因为,例如,现在我们有 Instagram,我们有 TikTok,对吧?我们已经有了这些算法,它们非常擅长吸引我们的注意力。所以,人们对这些平台越来越上瘾。而想象一下,这种视频生成模型。现在,它们基本上是神经网络,对吧?它们是神经网络。所以,基本上它们的输出也是神经网络的输出。这意味着你可以优化它们,对吧?例如,你可以优化用户参与度。你可以根据用户资料优化他们喜欢观看的视频,然后你可以生成一个他们从未见过的全新视频,让他们保持参与,留在应用程序中。而想象一下,有了世界模型,具有更令人印象深刻和身临其境的体验,那么那些不小心的人很容易被困在这些人工智能模型生成的这些世界中。这可能很可怕。例如,当人们被困在这些模拟世界中时,尤其是当这些世界模型开始生成几乎与真实世界无法区分的生成世界时,他们就会开始忘记真实世界。他们可能会模糊现实世界和模拟世界之间的界限,因为他们基本上可以在人工智能生成的世界中做更多的事情。所以,我认为这是政策制定者和人工智能公司领导者也应该关注的事情。>>我认为现在的孩子花在虚拟世界上的时间比花在现实世界上的时间多。不仅仅是孩子。我认为是成年人,是老年人。我的意思是,今天这几乎像一种流行病。因为你去,你知道,你坐在火车上,你坐在公交车上,你和你的家人朋友一起吃饭,到处都是手机。我的意思是,大多数时候,你知道,人们沉迷于手机,而不是进行真实的对话。是的,所以我认为,迫切需要传播一种信息,一种紧迫的信息,即这种数字过载正在制造一个大问题。正如我所说,我投资于虚拟现实,我认为虚拟现实这个名字本身就说明了问题。你知道,我们试图用虚拟现实做什么?我们试图构建一个与你的现实世界无法区分的虚拟现实,因为这是最终目标。而我认为这将通过几种汇聚的技术栈来实现。我们有脑机接口,然后有 AI,然后有 XR。你知道,有了这些 XR 头显,也有像 Wario 和 OpenBCI 这样的公司,它们正在构建带有脑机接口的虚拟现实头显。最终,我认为,你知道,我敢肯定,我们迟早会进入一个像《黑镜》系列中描绘的世界,我们将能够进入这些虚拟世界,但这些虚拟世界将感觉真实,因为我们将拥有所有被触发的感官。我们有五种感官:视觉、听觉、触觉、嗅觉和味觉。通过虚拟现实,我们能够完美地模拟视觉和听觉。剩下的是触觉、嗅觉和味觉。而我认为,通过脑机接口,这些东西,因为我们有人类连接组项目,我们试图绘制大脑的结构和功能能力。最终,我们将能够绘制整个大脑。一旦我们拥有了它,以及人工智能和这些世界模型,你就会创造出这些模拟现实,而你就身处其中。这是必然的,而不是说,好吧,这是不可能的。我相信这是必然的。我希望有更多的对话在学校、大学、企业和政府之间进行,因为我们正在越过失去人类联系的界限。我们认识到 Facebook 和 TikTok 上有很多社交朋友,我们有成百上千的朋友,而在现实世界中,我们正与抑郁症作斗争,我们很少出门,我们很少见面。所以我希望我们能关注这一点。你也指出了,你知道,随着人工智能自动化和这些模型飞速发展,我们需要进行对话,政府需要承担责任,说这些模型变得越来越强大。最终,这些模型将能够编写代码,将能够成为你的联合科学家,将能够成为你的联合创作者。那么,人类还有什么工作呢?另一方面是,人工智能正在使事物民主化,今天即使你不是程序员,不是工程师,你也可以参与其中。这是美好的。但除非我们进行对话,创造意识,否则我认为我们将进入一个世界,就像吹笛人一样,它正在把我们这一代人带向虚无。你刚才谈到了合成数据。现在,合成数据我认为是一件大事,你知道,因为这些模型可以在这些模拟中进行训练。而一旦这些模型在这些模拟中进行训练,它们就能理解物理世界,并且能够更好地泛化。你能详细说明一下这些世界模型吗?这些模拟这些虚拟世界的能力,以及这些人工智能代理如何在这些模拟中进行训练,以及也许这种训练如何帮助它们变得更具泛化性?>>基本上,我认为这个概念,从模拟中学习,从这种模拟世界中学习,也来自于我提到的 David Ha 和 Jurgen Sweet Huber 的论文。所以我认为他们称之为“在梦中学习”。基本上,人工智能代理被部署在这些世界中,它们试图观察环境,它们试图学习这个环境的动态,然后它们也能采取一些行动。因为我提到它们也有这个控制器组件。所以它们可以尝试一些事情。例如,它们可以尝试,例如,哦,如果我打开这扇门怎么办?如果我选择走这条路怎么办?或者如果我选择爬楼梯怎么办?这些事情。然后,例如,这些模型,因为我们为这些模型生成世界来训练和学习。所以,我们也可以采用一些训练策略,比如强化学习,RL。例如,在世界中采取一些行动或执行一些行动会获得一些奖励。例如,我举一个我们已经讨论过的例子,例如绘画例子。例如,当你绘画时,当然,产生高回报的行动是当你进行这种笔触时,你在墙上留下痕迹。那就是高回报。例如,如果我转向左边,然后我再看一遍,那么墙上的绘画或颜料应该还在那里,对吧?所以,这些信号我们可以尝试将其编码为奖励,类似于我们如何训练强化学习的人工智能代理。然后,基本上,这个训练策略被记住,并通过人工智能模型的经验进行学习。所以,当它们尝试采取下一个行动,甚至在新的世界中时,它们仍然会记住那些在这些场景中产生高回报的行动。所以我认为这就是它们如何移动,如何学习和快速移动,并尝试解决新任务。>>有趣的是,理查德。现在,费利博士,她是计算机视觉的先驱之一,她相信世界模型是通往通用人工智能的途径。你对此有什么看法?>>是的,我认为这很有趣,因为像一些人工智能领导者,例如费利博士,还有,我认为是杨立昆,他们认为,不幸的是,尽管大型语言模型今天具有令人印象深刻的能力,但大型语言模型本身,在这种版本中,不会将我们带到通用人工智能。我们需要更多东西。例如,我认为费利博士在一次采访中提到,因为我们生活在一个三维世界中,我们看到的自然界。
在那里,实际上没有多少语言,对吧?那里没有多少文本,例如在树木中,甚至在我们每天看到的周围环境中,对吧?所以我们需要更多像这样的模式,我们需要更多的训练程序,我们不仅可以用来学习预测下一个词,但我们需要更多一些东西来编码,对吧?例如,我认为世界模型正在朝着正确的方向迈出一步,因为不知何故,我们现在拥有理解物理学的模型,就像我之前提到的那样,还有这种因果效应,例如,如果你采取某些行动,会有什么后果?我认为这些是世界模型所做事情的重要组成部分,对吧?但我想朝着通用人工智能,朝着真正通用,真正例如,所以它非常普遍,那么我们需要生成很多世界,对吧?那么这里的问题仍然存在,对吧?例如,就像大型语言模型一样,我们有这种数据问题,那么世界问题呢?对吧?但然后这变成了一个更哲学的问题,对吧?那么,我们还能想象多少?因为现在对于这个世界模型来说,它似乎受到我们想象力的限制,对吧?就像我们可以提示它们生成这种世界,但我们不可能像创新所有可能的场景,对吧?所以我认为下一步的演变是我们需要一种聪明的方式来生成重要的模拟,特别是那些能够在这个类别的泛化性能上取得良好结果的模拟,而且我将很有兴趣在未来几年看到这一点,是的>>对,对,有趣的理查德,我的意思是,你知道这些世界模型显然,你知道它们似乎基于物理学,它们有记忆,它们正在做一些有趣的事情,你知道,很大程度上这些都是视觉模型,你知道,呃,你认为如果你添加什么样的数据,它可能会,你知道,也许能够更好地泛化?它会是某种触觉反馈吗?这些本体感觉信息,听觉信息,你认为我们需要融合到这些世界模型中的其他模态是什么,以便它们能够完全接地,以便它能够理解或完成世界模型并能够泛化。是的,我认为这是一个非常有趣的问题,因为正如你所提到的,现在这些模型,即使是视觉部分,它们也仅限于这种视觉,因为它们基本上现在只能接受这种图像,它们只能接受视频,因为我认为像 Genie 这样的模型,它们只在电子游戏等事物上进行训练,但我认为正如你所提到的,整合更多模态可以是一种非常重要的方式,使这种世界模型更加通用,也更加整体的智能,对吧?例如,我可以想到,正如你所提到的,触觉和触感非常重要,因为作为人类,我们非常依赖我们的感官,尤其是触觉,当我们采取某些行动时,有很多信息是它们目前没有的,例如,纹理怎么样?例如,温度怎么样?想象一下,这些人工智能代理现在可以触摸东西,并且可以理解哦,这个东西是冷的,这个东西是热的,甚至可以触摸树木并理解哦,这种表面是粗糙的,这种表面是柔软的,我认为这些信息在我们的世界模型中是缺失的,因为视觉非常有限,你无法仅仅通过视觉看到热或冷的东西,很难做到,对吧?当然,你可以看到一些烟雾,但如果对于其他事物呢?对吧?所以我认为触觉以及这种音频,还有其他东西,例如音频,我们已经看到像 V3 这样的模型,它也可以生成音频,所以我认为下一步,例如世界模型,我认为这可能很快就会到来,因为我们已经看到它在视频模型上起作用,所以我认为这对于世界模型来说不是一件非常非常困难的事情,所以想象一下你也可以在这些模型生成的世界中行走,并且你还可以拥有为你生成的音频。例如,当你走在草地上时,你会有这种草的声音。我认为这将很有趣,并且无疑会使其更具沉浸感。例如,如果你将其集成到这些 XR 和 VR 技术中。我认为>>现在还有另一个对话,我的意思是,你知道世界模型,它也与模拟假设有关,你知道,我的意思是,你知道,有什么意义呢?人工智能生成的模拟变得与现实无法区分,这对模拟假设有什么影响呢?因为,你知道,这意味着什么?这意味着模拟假设,我们实际上生活在一个模拟的宇宙中吗?我很想听听你对此的看法。>>是的,这是一个非常有趣的问题。所以我认为这更像是一个哲学问题,但我认为我读过一本非常有趣的书。我认为是尼克·博斯特姆写的关于模拟论证或模拟假设。我认为他是对“如果我们生活在模拟中”这个想法非常乐观的专家或哲学家之一,我认为我的看法是,现在仍然很难看清,因为这些世界模型距离他们期望的非常逼真的模拟生成器还有很长的路要走,但如果有一天我们能够在这个机器内部构建世界模型,例如,如果有一天我们能够成功实现这个目标,我们的最终目标,对吧?我们在机器内部构建世界。那么是什么阻止了我们?例如,宇宙就像这些模拟器之一,对吧?因为宇宙,你可以说它拥有丰富的数据,丰富的经验,数十亿年的演化。你见过很多像我们这样的人类,以及我们的祖先,对吧?它也见证了世界以一种非常伟大的方式发展。所以我认为这是一个非常有趣的哲学问题,它取决于,如果我们能达到这一点,我认为很难反驳他的论点。是的。>>对。是的。非常非常有趣,因为不仅仅是尼克·博斯特姆,还有埃隆·马斯克一直在大声疾呼,说我们生活在一个模拟世界里,还有克里·温,还有唐纳德·霍夫曼,他一直在谈论空间和时间本身不过是一个虚拟现实头显,甚至量子物理学,我的意思是,如果你深入挖掘,我的意思是,你知道双缝实验说,或者哥本哈根量子力学解释说,有意识的观察者正在显现现实。所以,那里有很多松散的线索。你知道,如果你把它们联系起来,那么,你知道,你就会想到,我的意思是,你知道,好吧,我的意思是,我们实际上是生活在一个物理世界中,还是这一切基本上是一个虚拟的构造?因为最终,如果我们能够模拟一个物理世界,并且我们正在接近这一点,你知道,我们可能现在不行,但我想没有什么在物理上阻止我们能够构建一个与物理现实无法区分的虚拟现实,我相信,就像我说的,在对话的早期,我认为这可能需要虚拟现实、人工智能和脑机接口,我认为当这三者结合在一起时,我们将能够构建这些极其连贯的完整虚拟世界,拥有所有五种感官,你知道,视觉、听觉、触觉、嗅觉和味觉,你知道,一旦我们拥有了这些拥有所有感官的世界,那么,我的意思是,如果我们能够创造它,那么我们怎么说我们实际上并没有生活在一个虚拟世界中呢?现在,你写了一篇很棒的博客文章,关于能够自我改进的人工智能。如果你能谈谈这一点,那就太好了。我的意思是,你知道,我们离一个能够自我学习和改进的系统还有多远?>>是的,谢谢你提起这件事。所以,是的,最近我一直对这种开放性、开放式学习非常感兴趣,因为我认为这是前进的方向,因为我认为要真正构建通用智能,我们需要人工智能,就像我之前提到的那样,不仅仅是从我们的数据中学习,从我们的静态经验中学习,但如果我们能让这个人工智能不断改进和完善自己,那将是非常强大的,对吧?那么我们离得多远?我想说实话,就像最近的一些工作,例如达尔文机器,由 Sakana AI 和 UBC 的其他一些团队完成,他们确实表明,例如,如果我们结合的不仅仅是代理本身的力量,而是我们增强了它,我们给了它自由,例如,通过引入新工具来改进自己,它可以调整其超参数,那么这个人工智能可以在这些困难的基准上表现出色,而这些基准以前当我们只是让它自己训练时,它非常静态,我认为这也是人类进化的方式,因为如果你想象一下,我们的自然,我们的宇宙,我们已经走了很长一段路,例如,到了我们现在坐在这个播客中的这种形式,我们拥有这种能力。我们拥有这种思维过程。我们拥有这种知识。甚至我们的身体属性也因为这种进化而得到了增强。我认为如果我们让这些人工智能模型不仅仅训练一段时间,而是让我们看到,如果我们让这些代理甚至世界模型在很长一段时间内不断模拟世界,那将很有趣,我认为最近有一次采访,我认为是 Genie Tree 的作者,我认为是 Jack Parker Holder,我认为他也提到了这个想法。他提到,例如,如果你让一个 AI 代理在 Genie 的世界里生活几个月或几年,看看它能发现什么,那将很有趣,因为我们已经通过 Forager 看到过这种情况,例如,对于 Nvidia,你让一个代理玩 Minecraft,它已经可以学会 Minecraft 的机制,它可以学会生存,它可以学会制作东西,变得有创造力,所以我认为下一波人工智能不仅应该是智能的,还应该是富有创造力的,因为我们人类的很多思维过程,解决问题的能力都是开放式的。它们是从经验中不断学习的,我们试图改进自己,对吧?例如,如果我们卡在一个问题上,那么我们就试图用新的知识、新的工具来增强自己,对吧?我认为这就是我们应该如何训练我们的人工智能,因为我们需要这个人工智能不断地完善自己,我们最近已经看到了这些成功的故事,所以我认为我们离一个开放性将是实现更智能系统的关键要素的未来并不遥远,并希望将我们带近通用人工智能。>>如果我们的通用人工智能能够服务于人类,而不是解决这些各种存在的问题,那将是多么美好的世界。理查德,我的最后一个问题是,如果你能给我们一些建议,关于听众在未来几年应该做什么,应该注意什么,以便能够创造他们理想的未来。他们应该做什么?也许有一些建议,并从你的角度描绘一下你看到的未来 5 到 10 年的世界,因为你一直投资于人工智能,你认为世界在未来五到十年将如何变化?它会是什么样子?>>是的,我想再说一遍,我认为我们生活在一个非常美好的时代,我们目前正在见证的,以及我们对未来的期待,至少对我来说非常令人兴奋,因为我们谈论的这些人工智能代理,这些世界模型,我们谈论的这种开放式人工智能,自我改进的人工智能,我认为它们将使我们越来越接近一个人类将成为伙伴的未来,我们将成为这种人工智能的进化伙伴。所以人工智能不再仅仅是我们的工具,不再仅仅是我们的工具,但它们可以真正成为我们的伙伴。所以,我看到的是,例如,想象一下,对于我们这些科学家、研究人员来说,人工智能可以成为我们的联合科学家,我们已经通过 Alva 进化看到了这一点,它们实际上可以取得突破,真正解决我们科学和工程领域的难题,它们甚至可以帮助我们生成新的药物,例如,通过 Alva Vault,新的蛋白质等等。所以我认为科学将通过这种人工智能模型得到极大的加速。对于我们人类和观看节目的观众来说,我认为如果我们不仅能使用这些人工智能工具,而且我们还需要学会如何最大限度地利用它们的潜力来提高我们自己的生产力,那将是很好的。所以不要专注于那些重复性的任务,因为它们很容易被自动化,而是我们需要成为这种人工智能的创意伙伴来指导它们,因为我认为人类最重要的特征之一,也是最重要的优势之一是我们非常有创造力,我们可以看到人工智能甚至还没有看到的东西。所以我认为这将开启一个非常激动人心的未来。想象一下,我们不仅有 AI 科学家,还有 AI 艺术家,我们已经看到了 AI 生成的新艺术、新音乐,对吧?未来我们可能还有 AI 老师,对吧?用于学校,用于教育,对吧?因为然后,我认为这就是我们应该发挥作用的地方,因为现在我们生活在一个伟大的时代,这让我想起了历史,对吧?我们在历史上有一个文艺复兴时期,当这种伟大的进步发生,不仅仅是因为聪明的人,而是因为思想和全球化的融合在一起,那么这意味着现在,我们不应该只专注于我们自己的领域,例如艺术家也应该学习,也可以从科学中学习,科学家也可以从艺术中借鉴一些想法,我认为开放式人工智能以及这种世界模型可以激发这种新的文艺复兴,所以想象一下,人工智能可以构建许多有趣的东西,跨学科,跨领域,所以我认为我们领域的界限,我们工作的界限,我们自己专业知识的界限也可能会模糊,但以令人兴奋的方式,所以人工智能可以帮助我们获得新的视角,不仅来自我们自己的领域,也来自其他领域,它还可以创造出至少对我来说,我们今天几乎无法想象的东西。所以我认为这是一个非常令人兴奋的时刻,我认为这是一个非常美好的时刻,能够活着并体验这一切。>>理查德,非常感谢你花时间参加播客。是的,我认为我们生活在一个如此美好的时代。一个我们可以真正创造魔法的时代,一个如果我们不合作,我们也可以真正制造灾难的时代,因为今天我认为,你知道,世界比以往任何时候都更加分裂,而不是团结。我希望你,我,印度,中国,或者美国,或者其他国家,或者巴基斯坦,任何国家,我希望我们能够团结起来,抛开分歧,团结起来,因为我认为今天我们正处于创造一个自我学习的工具,一项技术,也许我们正在赋予人类一个亚种,有点像生下我们自己的孩子,但这次的孩子可能比我们这些创造者强大或聪明一百倍。我们需要明白,我们是创造者,我们需要赋予它正确的精神,就像你指出的那样,我认为我们生活在一个绝佳的时刻。我们需要接受这些工具,而不是害怕它们,也许和它们一起学习,帮助它们增强我们,让我们成长,也许真正理解我们的潜力,我们是谁,我们为什么在这里,我们应该做什么。我认为我们生活在一个如此美好的时代。你知道,如果我们问这些问题,如果我们团结起来,我认为我们将建立一个如此美好的未来。我为能够创造普遍富足的未来感到兴奋。再次感谢你花时间参加播客,并与我们分享这个我们已经奠定基础的世界模型的这个美好的可能性,你知道,如果这个世界模型能够成长并创造这些美好的未来模拟,在那里我们可能即使身处模拟之中,如果它创造了我们可以共存的美好世界,并建立更好的世界,你知道,所以感谢你花时间参加播客,我的听众们,如果你喜欢你看到的东西,请按下订阅按钮,直到下次,再见。再见。谢谢。非常感谢你,理查德。真的非常感谢。>>非常感谢。 [音乐]