📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

“The Future of AI is Here” — Fei-Fei Li Unveils the Next Frontier of AI

a16z48:10

Transcription

视觉空间智能是如此基础,它就像语言一样基础。我们拥有计算更深层次数据理解的要素,并且我们拥有一些算法的进步。我们正处于一个可以真正下注、集中精力并解锁的恰当时刻。在过去的两年里,我们看到了消费级人工智能公司和技术的这种大规模涌现,这非常疯狂。但您已经这样做了几十年,所以也许可以稍微回顾一下我们是如何走到这一步的,以及您一路走来的关键贡献和见解。所以这是一个非常激动人心的时刻,对吧?仅仅回顾一下,人工智能正处于一个非常激动人心的时刻。我个人已经做了二十多年了,你知道我们已经走出了上一次人工智能的寒冬,我们看到了现代人工智能的诞生,然后我们看到了深度学习的兴起,向我们展示了下棋等可能性。但随后我们开始看到技术的深化和行业对早期可能性(如语言模型)的采用。现在我认为我们正处于一场字面意义上的寒武纪大爆发之中,因为现在除了文本之外,您还看到了像素、视频、音频,它们都带有可能的人工智能应用和模型。所以这是一个非常激动人心的时刻。我非常了解你们两位,很多人也非常了解你们两位,因为你们在这个领域非常杰出。但并非每个人都像在人工智能中长大一样。所以也许值得回顾一下你们的快速背景,以便为听众设定一个基调。是的,当然。我第一次接触人工智能是在本科快结束的时候。我本科在加州理工学院学习数学和计算机科学,那很棒。但在快结束的时候,有一篇论文发表了,当时它是一篇非常著名的论文,就是 H. Lee 和 Andrew 以及当时在 Google Brain 的其他人写的关于猫的论文。那是我第一次接触到深度学习这个概念。对我来说,这感觉就像一项令人惊叹的技术。那是我第一次接触到将定义我未来十多年的这个食谱:你可以获得这些令人难以置信的强大、非常通用的学习算法,将它们与大量的计算能力相结合,将它们与大量数据相结合,当您将这些要素结合起来时,就会发生神奇的事情。我第一次接触到这个想法大约是在 2011 年、2012 年左右,我当时就想:“我的天哪,这就是我想要做的。”所以很明显,你必须上研究生院来做这些事情。然后,我看到 Fay 在斯坦福大学,她是当时世界上为数不多在这个方向上的人之一。那是一个在深度学习和计算机视觉领域非常激动人心的时代,因为那确实是这项技术从最初的、刚刚开始工作的萌芽状态发展到真正被开发出来并传播到大量不同应用领域的时代。然后,在那段时间里,我们看到了语言建模的开始,我们看到了判别式计算机视觉的开始,你可以拍照并以多种不同的方式理解其中的内容。我们还看到了我们现在称之为生成建模的一些早期成果,生成图像、生成文本。我攻读博士学位期间,学术界实际上已经弄清楚了许多核心的算法部分。有一段时间,我每天早上醒来都会查看 arXiv 上的新论文,并准备好。这就像圣诞节拆礼物一样,你知道每天都会有令人惊叹的新发现、新应用或算法在世界某个地方出现。过去两年发生的事情是,世界上其他所有人都意识到使用人工智能每天都能获得新的圣诞礼物。但我想,对于我们这些在这一领域工作了十年或更长时间的人来说,我们已经有了很长一段时间的这种体验。显然,我比 Justin 年长得多。我通过物理学这个不同的角度接触人工智能,因为我的本科背景是物理学。但物理学是一种教会你大胆提问、思考世界剩余的未解之谜的学科。当然,物理学是原子世界,你知道宇宙等等。但不知何故,那种训练思维方式让我开始思考一个真正吸引我自己的大胆问题,那就是智能。所以我获得了加州理工学院人工智能和计算神经科学博士学位。所以 Justin 和我实际上没有重叠,但我们有相同的母校,加州理工学院。哦,还有加州理工学院的同一个导师。是的,同一个导师。你的本科导师,我的博士导师,Petro Perona。我的博士时间,和你一样,是人工智能在公众眼中仍然处于寒冬时期,但在我看来并非寒冬,因为它是一种潜伏的冬眠,充满了生机。机器学习、统计建模真的在获得力量。我认为我是机器学习和人工智能的原生一代,而我看到 Justin 的这一代是原生深度学习一代。所以,机器学习是深度学习的前身,我们尝试了各种模型。但在我博士毕业和开始担任助理教授的时候,出现了一个被忽视的人工智能元素,它在数学上对驱动泛化很重要,但整个领域都没有这样想。那就是数据。我们当时在思考贝叶斯模型或核方法等的复杂性。但我的学生和我的实验室可能比大多数人更早地意识到,如果让数据驱动模型,你就可以释放出前所未有的力量。这确实是我们对 ImageNet 进行大胆押注的原因。你知道,当时我们看到的规模是数千个数据点。当时,自然语言处理社区有自己的数据集,我记得加州大学欧文分校的数据集或自然语言处理中的某个数据集很小。与此相比,计算机视觉社区有他们的数据集,但都在数千或数万的量级。我们说我们需要将其推向互联网规模。幸运的是,这也是互联网的成熟时期,我们乘上了那股浪潮。那时我来到了斯坦福。这些时期是我们经常谈论的。ImageNet 显然是创造了,或者至少是普及和可行化了计算机视觉的时期。我们谈论的生成浪潮有两种核心解锁:一种是 Transformer 论文,即注意力机制;另一种是 Stable Diffusion。这是思考它的公平方式吗?也就是说,学术界或谷歌带来了这两种算法解锁,一切都源于此,还是更加深思熟虑,或者还有其他我们不太谈论的重大解锁?是的,我认为重大的解锁是计算能力。我知道人工智能的故事就是计算的故事,但即使人们谈论它多少,我认为人们还是低估了它。在过去十年里,我们看到的计算能力增长是惊人的。真正被认为是深度学习在计算机视觉领域突破性时刻的第一篇论文是 AlexNet,这是一篇 2012 年的论文,其中一个深度神经网络在 ImageNet 挑战赛中表现出色,远远超过了 Fay 和她的研究生们一直在研究的其他算法。AlexNet 是一个拥有 6000 万个参数的深度神经网络,它在两块 GTX 580 上训练了六天,而 GTX 580 是当时顶级的消费级显卡,于 2010 年发布。我昨晚看了一些数字,只是为了让大家了解一下。英伟达最新最强大的产品是 GB200。你们有人想猜猜 GTX 580 和 GB200 之间的原始计算能力有多大差距吗?去吧。是数千倍。我昨晚算了算。那两周的训练,在两块 GTX 580 上进行了六天,如果按比例缩放,在单块 GB200 上只需要不到五分钟。Justin 提出了一个很好的观点。2012 年 AlexNet 论文在 ImageNet 挑战赛中,这是一个非常经典的卷积神经网络模型,最早的论文可以追溯到 1980 年代。我记得我还是个研究生时学习它,它也有六七层。AlexNet 和卷积神经网络之间唯一的实际区别是什么?区别在于 GPU,两块 GPU 和大量数据。是的,我正要说到这个。我认为现在大多数人都熟悉“苦涩的教训”,而“苦涩的教训”是说,如果你创造了一个算法,不要耍小聪明。只要确保你能利用现有的计算能力,因为计算能力就会出现。所以你只需要……另一方面,还有另一种说法,在我看来同样可信,那就是实际上是新的数据源解锁了深度学习。ImageNet 是一个很好的例子。但很多人,比如 Transformer 的自注意力机制,他们也会说这是一种利用人类数据标注的方式,因为是人类为句子添加了结构。如果你看看 CLIP,他们会说,嗯,我们正在利用互联网来让人们使用 alt 标签来标注图像。所以这是一个关于数据的故事,而不是关于计算的故事。那么,答案是两者兼有,还是一个比另一个更重要?我认为两者兼有,但你提出了另一个很好的观点。我认为实际上有两个时期,对我来说感觉相当不同,在算法方面。例如,ImageNet 时代实际上是监督学习的时代。所以,在监督学习时代,你拥有大量数据,但你不知道如何单独使用数据。ImageNet 和那个时期的其他数据集的期望是,我们将获得大量图像,但我们需要人们来标注我们将在上面训练的所有训练数据。一个人,一个人类标注者,看过每个人,并对那张图片说了一些话。而重大的算法解锁是,我们知道如何训练那些不需要人类标注数据的模型。作为房间里没有人工智能背景的普通人,在我看来,如果你在训练人类数据,人类已经标注过了,这只是不明确。我知道你会这么说,Mar。我知道。是的,哲学上这是一个非常重要的问题,但这实际上比像素更符合语言。说得通。是的,是的,是的。但我确实认为这是一个重要的思考点。学习智能只是更隐晦而不是更明确。是的,它仍然是人类标注的。区别在于,对于这个监督学习时代,我们的学习任务更加受限。所以你必须想出我们想要发现的概念的本体。如果你在做 ImageNet,Fay 和你当时的学生花了大量时间思考 ImageNet 挑战赛应该包含哪一千个类别。那个时期的其他数据集,比如用于目标检测的 COCO 数据集,他们认真思考了我们应该放入其中的 80 个类别。那么,让我们来谈谈生成。所以,在我攻读博士学位之前,你来了。我从 Andrej 那里学习了机器学习,然后我从 Deany Coler 那里学习了非常复杂的贝叶斯模型,对我来说非常复杂。其中很多只是预测建模。然后,我记得你解锁的整个视觉领域,但生成方面,我认为是在过去四年里出现的,对我来说非常不同。你不是在识别物体,你不是在预测某事,你是在生成某事。所以也许可以回顾一下让我们走到这一步的关键解锁,以及为什么它不同,我们是否应该以不同的方式看待它,它是连续体的一部分,还是不是?在我读研究生的时候,生成模型就已经存在了。我们想做生成。没人记得,即使是字母和数字,我们也在尝试做一些事情。Jeff Hinton 必须生成论文,我们在思考如何生成。事实上,如果你从概率分布的角度来看,你可以从数学上生成它。只是我们生成的任何东西都不会给任何人留下深刻印象。所以,生成这个概念在数学上、理论上是存在的,但什么都没成功。然后,我想提一下 Justin 的博士论文。Justin 说他被深度学习迷住了,所以他来到了我的实验室。Justin 的博士论文,他的整个博士论文几乎就是这个领域轨迹的一个迷你故事。他开始的第一个项目是关于数据,我强迫他做的,他不喜欢。所以回想起来,我学到了很多非常有用的东西。我很高兴你现在这么说。所以我们将 Justin 转移到了深度学习领域,核心问题是处理图像并生成文字。实际上,在这个轨迹上有三个不同的阶段。第一个实际上是匹配图像和文字。是的,是的。我们有一张图片,我们有文字,我们能说它们有多匹配吗?实际上,我的第一篇论文,我的博士论文,也是我的第一篇学术出版物,是关于带有场景图的图像检索。然后我们进入了生成领域,处理像素生成文字。Justin 和 Andre 确实在这方面做了很多工作。但这仍然是一种非常非常低效的生成和从像素世界获取信息的方式。然后,中间 Justin 去做了一项非常著名的工作,那是第一次有人将其变成实时。是的,是的。所以,故事是这样的:2015 年有一篇论文发表了,名为“艺术风格的神经算法”,由 Leon Gatys 领导。这篇论文发表了,他们展示了将这些真实世界的照片转换成梵高风格。我们习惯于在 2024 年看到这样的东西,但这发生在 2015 年。这篇论文有一天突然出现在 arXiv 上,让我大开眼界。我脑子里就像被注入了“生成大脑虫”,在 2015 年。它对我产生了影响,我想:“我的天哪,我需要理解这个算法,我需要玩它,我需要制作我自己的梵高风格的图像。”所以,我读了这篇论文,在一个长周末里,我重新实现了它,并让它工作了。它实际上是一个非常简单的算法。所以,我的实现大约有 300 行 Lua 代码,因为当时是 Lua。那是 PyTorch 之前,我们使用的是 Lua Torch。但它是一个非常简单的算法,但它很慢。所以它是一个基于优化的东西,你想要生成的每张图片都需要运行这个优化循环,运行这个梯度下降循环。生成的图片很美,但我只是希望它更快。而 Justin 把它做到了。这实际上是你第一次体验到学术工作产生行业影响。当时很多人看到了这种艺术风格迁移的东西,我和其他几个人同时想出了不同的加速方法。但我的方法获得了很大的关注。所以我为 Justin 感到非常自豪。但还有一件事我为 Justin 感到非常自豪,与生成式人工智能联系起来,那就是在世界理解生成式人工智能之前,Justin 的博士论文的最后一部分,我之所以知道,是因为我强迫你做的。那很有趣。那实际上是输入语言并获得整张图片。这是最早的生成式工作之一。它使用了 GAN,GAN 非常难用。但问题是我们还没有准备好使用自然的语言。所以 Justin,你听说过,他研究过场景图。所以我们必须以图的方式输入场景图语言结构。你知道,羊,草,天空,以图的方式。这实际上是我们的一张照片。然后他和 Grim 的另一位非常优秀的硕士生让那个 GAN 又工作了。所以,你可以看到,从数据到匹配,到风格迁移,到生成式人工智能图像,我们开始看到了。你问这是否是突然的变化,对于像我们这样的人来说,它已经发生了,这是一个连续体。但对于世界来说,结果更加突然。我读了你的书,对于那些正在听的人来说,这是一本非常棒的书。我真的推荐你们读。而且似乎很长一段时间以来,你们中的许多人,我指的是你,Fay,你们的研究方向都是朝着空间和像素以及智能方向的,现在你们在做 World Labs,而且它围绕着空间智能。所以也许可以谈谈,这对你来说是一段漫长的旅程吗?为什么你现在决定这样做?是技术上的解锁,还是个人上的解锁?只是让我们从人工智能研究的那个领域转移到 World Labs。当然。对我来说,这是个人和智力上的。你谈论我的书,我整个智力旅程实际上是我寻求北极星的热情,但也相信那些北极星对我们领域的进步至关重要。一开始,我记得研究生毕业后,我认为我的北极星是讲述图像的故事。因为对我来说,这是视觉智能中非常重要的一部分,这是你称之为人工智能或通用人工智能的一部分。但当 Justin 和 Andre 做到这一点时,我想:“我的天哪,那是我的直播流。我接下来该做什么?”所以,它比我想象的来得快得多。我以为这需要一百年。但视觉智能是我的热情,因为我相信对于每一个智能生命,无论是人类、机器人还是其他形式,了解如何看待世界、推理它、与它互动,无论是导航、操纵还是制造,你甚至可以建立文明。视觉空间智能是如此基础,它就像语言一样基础,可能更古老,在某些方面更基础。所以,对我来说,World Labs 是我们的北极星,解锁空间智能,这是非常自然的。现在是时候了。就像 Justin 说的,计算能力。我们拥有这些要素,我们拥有计算能力,我们对数据的理解比 ImageNet 时代要深入得多。你知道,与那些日子相比,我们现在要先进得多。我们拥有一些算法的进步,包括 World Labs 的联合创始人 Ben Milen Hall 和 Kristoff Larsson,他们在神经辐射场方面处于最前沿。我们正处于一个可以真正下注、集中精力并解锁它的时刻。所以我想为听众澄清一下,你们正在创办一家名为 World Labs 的公司,空间智能是你们解决问题的通用描述。你能更清晰地描述一下它的含义吗?是的,空间智能是指机器在三维空间和时间中感知、推理和行动的能力,理解物体和事件在三维空间和时间中的位置,以及世界中的相互作用如何影响这些三维位置、三维四维位置在时空中的变化。并且能够感知、推理、生成、互动,真正将机器从大型机或数据中心中解放出来,放到现实世界中,并理解具有丰富性的三维四维世界。所以,为了说清楚,我们是在谈论物理世界,还是仅仅在谈论一个抽象的世界概念?我认为两者皆有可能。我认为两者皆有可能,这包含了我们长期的愿景。即使你在生成世界,即使你在生成内容,在三维空间中进行这些操作也有很多好处。或者,如果你在识别真实世界,能够将三维理解融入真实世界也是其中的一部分。很好。所以,对于所有听众来说,另外两位联合创始人 Ben Milen Hall 和 Kristoff Lanner 是该领域的绝对传奇人物,他们处于同一水平。这四个人决定现在出来创办这家公司。所以,我试图深入了解为什么现在是正确的时机。是的,这对我来说是长期演进的一部分。但真的,在博士毕业后,当我真正想成为一名独立的独立研究员,为我后来的职业生涯做准备时,我只是在思考人工智能和计算机视觉中的大问题。我当时得出的结论是,过去十年主要是在理解已存在的数据。但接下来的十年将是关于理解新数据。如果我们考虑到这一点,已存在的数据是网络上可能存在的图像和视频。而接下来的十年将是关于理解新数据。人们拥有智能手机,智能手机正在收集摄像头,这些摄像头拥有新的传感器,这些摄像头位于三维世界中。你不会只得到一堆来自互联网的像素,一无所知,然后试图说它是猫还是狗。我们希望将这些图像视为物理世界的通用传感器,以及我们如何利用它们来理解世界的 3D 和 4D 结构,无论是在物理空间还是生成空间。所以,博士毕业后,我进行了重大的转变,转向了 3D 计算机视觉,与当时我在 FAIR 的一些同事一起预测物体的 3D 形状。然后,后来我被通过 2D 学习 3D 结构的想法深深吸引了。因为我们经常谈论数据,3D 数据本身很难获得。但因为这里有非常强大的数学联系,我们的 2D 图像是 3D 世界的投影,这里有很多数学结构可以利用。所以,即使你有很多 2D 数据,也有很多人做了出色的工作来弄清楚如何从大量的 2D 观测中反推出世界的 3D 结构。然后在 2020 年,你问到了突破性时刻。有一个非常重大的突破时刻,其中一位是我们的联合创始人 Ben Mildenhall,当时他发表了 NeRF(神经辐射场)论文。这是一种非常简单、非常清晰的从 2D 观测中反推出 3D 结构的方法,它点燃了整个 3D 计算机视觉领域的激情。我认为这里还有另一个方面,也许领域外的人不太理解,那就是当时大型语言模型也开始兴起。所以,很多关于语言建模的东西实际上是在学术界开发的,即使在我读博士期间,我还在 2014 年与 Andrej Karpathy 一起进行了一些早期的语言建模工作,LSTM,我仍然记得 LSTM、RNN、GRU,这是 Transformer 之前的。但后来,在大约 GPT-2 的时候,你真的不能在学术界做那些模型了,因为它们需要更多的资源。但有一件非常有趣的事情是,Ben 发明的 NeRF 方法,你可以在一个小时或几个小时内在单个 GPU 上训练它们。所以,我认为当时有一个动态发生了,那就是我认为很多学术研究人员最终专注于这些问题,因为有核心的算法需要解决,而且因为你可以在没有大量计算能力的情况下做很多事情,并且可以在单个 GPU 上获得最先进的结果。由于这些动态,很多研究人员都在转向思考我们如何通过核心算法来推进这个领域。然后我与 Fay 进行了更多的交流,我意识到我们实际上……她非常有说服力。她非常有说服力。但你知道,我们谈论的是试图弄清楚你自己的独立研究轨迹,从你的导师那里。结果我们……不,有点结论,趋同于相似的事情。好的。从我这边来说,我想和最聪明的人谈谈,我称他为 Justin。毫无疑问。我想谈谈一个非常有趣的技术问题或技术故事,关于大多数从事语言工作的人没有意识到的像素。在计算机视觉领域,在我们进入这个领域之前,我们这些从事像素工作的人实际上在“重建 3D 重建”这个研究领域有着悠久的历史。你知道,这可以追溯到 70 年代。你知道,你可以拍照,因为人类有两只眼睛。所以,一般来说,它始于立体照片,然后你试图三角化几何形状,并从中制作出 3D 形状。至今,这是一个非常非常困难的问题,它还没有从根本上解决,因为存在对应关系等等。所以,这个领域,一种思考 3D 的旧方式,一直在发展,并且取得了很好的进展。但当 NeRF 出现时,在生成方法和扩散模型的背景下,重建和生成突然开始真正融合。现在,在计算机视觉领域,在很短的时间内,很难再区分重建和生成了。我们突然迎来了一个时刻,如果我们看到什么,或者如果我们想象什么,两者都可以汇聚到生成它。是的,是的。对我来说,这是一个非常重要的时刻,但大多数人都错过了,因为我们不像谈论 LLM 那样谈论它。所以,在像素空间中,有重建,你重建一个真实的场景。然后,如果你看不到那个场景,你就使用生成技术。所以,这些东西在整个对话中都非常相似。你谈论语言,你也谈论像素。所以,也许现在是时候谈谈空间智能和你正在做的事情与现在非常流行的语言方法有何不同了。它们是互补的,还是正交的?我认为它们是互补的。我不想过于引导。也许只是对比一下。每个人都说,听着,我知道 Open AI,我知道 GPT,我知道多模态模型。你们谈论的很多内容是,它们有像素,它们有语言,这不就是我们想要的关于空间推理的东西吗?是的,要做到这一点,你需要稍微打开这些系统在底层是如何工作的黑匣子。所以,对于语言模型和我们现在看到的许多多模态语言模型来说,它们底层的表示是一种一维表示。我们谈论上下文长度,我们谈论 Transformer,我们谈论序列。注意力,注意力。它们的根本世界表示是一维的。所以,这些东西本质上是在一维的 token 序列上操作。当你谈论语言时,这是一个非常自然的表示,因为书面文本是一维的离散字母序列。这种底层表示是导致 LLM 和我们现在看到的许多多模态 LLM 的原因。你最终会将其他模态塞进这个一维 token 序列的底层表示中。现在,当我们转向空间智能时,情况正好相反,我们说世界的三个维度应该处于表示的最前面。所以,从算法的角度来看,这为我们处理数据的方式打开了不同的可能性,从中获得不同类型的输出,并解决略有不同的问题。所以,即使在粗略的层面上,你也会看看外面,然后说,哦,多模态 LLM 也可以看图像。是的,它们可以。但我认为,它们的核心方法中没有那种根本的 3D 表示。我完全同意 Justin 的观点。我认为谈论一维与根本的 3D 表示是核心的区别之一。另一件事,这有点哲学,但对我来说至少非常重要,语言本质上是一种纯粹的生成信号。外面没有语言。你不会在大自然中发现写在天空中的词语。你喂给它的任何数据,只要有足够的泛化能力,你基本上都可以以相同的数据输出。那就是语言到语言。但 3D 世界不是。有一个 3D 世界,它遵循物理定律,它由于材料和其他许多原因而具有自身的结构。从根本上提取这些信息,能够表示它,能够生成它,本质上是一个非常不同的问题。我们将借鉴语言和 LLM 的类似想法或有用的想法,但这从根本上来说,对我来说是一个不同的问题。所以,语言是一维的,而且可能是物理世界的一个糟糕表示,因为它是由人类生成的,而且可能是有损的。还有另一类生成式人工智能模型,那就是像素,它们是 2D 图像和 2D 视频。而且,如果你看一个视频,你会看到 3D 的东西,因为你可以平移摄像头或者别的什么。那么,当涉及到 2D 视频时,空间智能将如何不同呢?当我思考这个问题时,区分两件事很有用。一个是底层表示,另一个是用户界面。这里有时会让人感到困惑,因为我们本质上看到的是 2D。我们的视网膜是身体中的 2D 结构,我们有两个。所以,本质上我们的视觉系统感知的是 2D 图像。但问题是,取决于你使用的表示,可能会有更自然或不那么自然的界面。所以,即使你最终看到的是 2D 图像或 2D 视频,你的大脑也会将其感知为 3D 世界的投影。所以,你可能想要做一些事情,比如移动物体,移动摄像头。原则上,你可以用纯粹的 2D 表示和模型来做这些事情,但这只是不适合模型要解决的问题。对动态 3D 世界的 2D 投影进行建模可能是一个可以建模的功能。但通过将 3D 表示置于模型的核心,模型正在处理的表示与你希望模型执行的任务之间将更好地契合。所以,我们的赌注是,通过在底层加入更多的 3D 表示,这将为用户提供更好的界面。这也回到了我的北极星。你知道,为什么是空间智能,而不是平面像素智能?因为我认为智能的轨迹必须走向 Justin 所说的界面。而智能的轨迹,如果你看看进化,智能的轨迹最终会使动物和人类,尤其是人类作为一种智能动物,能够在这个世界上移动、互动、创造文明、创造生命、创造一块三明治,无论你在 3D 世界中做什么。将这一点转化为一种技术,这种三维原生性对于可能的应用的闸门至关重要,即使其中一些应用的呈现方式是二维的,但它本质上是三维的。对我来说,我认为这实际上非常微妙,而且极其关键。所以,我认为值得深入探讨,而一个好的方法是谈论用例。所以,为了让大家了解情况,我们正在谈论生成一种技术,我们称之为模型,它能够实现空间智能。那么,在抽象层面,它可能是什么样的?更具体地说,你可能将其应用于哪些潜在用例?所以,我认为我们设想这些空间智能模型随着时间的推移能够做几类事情。其中一个我非常兴奋的是世界生成。我们都习惯于文本到图像生成器,或者开始看到文本到视频生成器,你输入一个图像,输入一个视频,然后出来的是一幅惊人的图像或一个惊人的两秒钟剪辑。但我认为你可以想象将其提升到一个新的水平,并获得 3D 世界。所以,空间智能在未来可以帮助我们的一件事是提升这些体验到 3D,我们得到的不仅仅是一张图片或一个剪辑,而是获得一个完整的模拟但充满活力和交互性的 3D 世界,用于游戏,也许用于游戏?也许用于虚拟摄影?你说了算。我认为即使你做到了这一点,也会有数百万种应用。用于教育。是的,用于教育。我的意思是,我认为这在某种意义上开启了一种新的媒体形式,因为我们已经能够创建虚拟的交互式世界。但它花费了数亿美元和大量的开发时间。因此,人们推动这种技术能力的地方是什么?那就是视频游戏,因为如果我们作为一个社会有能力创造细节惊人的虚拟交互式世界,为我们提供惊人的体验,但由于它的成本如此之高,所以今天它的唯一经济上可行的用途是售价 70 美元的视频游戏,卖给数百万数百万人来收回投资。如果我们有能力创造这些同样虚拟的、交互式的、充满活力的 3D 世界,你就可以看到很多其他的应用。因为如果你降低了生产这种内容成本,人们就会用它做其他事情。如果我们有一个交互式的、个性化的 3D 体验,其质量和丰富度与那些花费数亿美元制作的 AAA 级视频游戏一样,但它可以针对只有几个人可能想要的那种非常小众的东西进行定制,而不是一个特定的产品或特定的路线图。但我认为这是由生成领域中的空间智能所赋能的一种新媒体的愿景。如果我想到一个世界,我实际上想到的是不仅仅是场景生成的东西,我还想到运动和物理学。所以,在极限情况下,这是否包含在内?第二个是绝对的。如果我与之互动,是否有语义?我的意思是,如果我打开一本书,里面有书页和文字吗?它们有意义吗?我们是在谈论一种完全深入的体验,还是在谈论一种静态场景?我认为这个技术会有一个循序渐进的过程。这是非常难构建的东西。所以,我认为静态问题稍微容易一些。但最终,我认为我们希望它是完全动态的、完全可交互的,所有你刚才说的那些。我的意思是,这就是空间智能的定义。所以,会有进展的。我们将从更静态的开始,但你所说的一切都在空间智能的路线图上。我的意思是,这实际上是在公司名称本身,World Labs。世界就是关于构建和理解世界。而且,这实际上有点是内部人士的说法。我意识到,在我们告诉人们公司名称后,他们并不总是理解。因为在计算机视觉、重建和生成领域,我们经常区分你可以做的事情。而第一层是物体,比如麦克风、杯子、椅子。这些是世界中的离散事物。Fay 研究的许多 ImageNet 类型的工作都是关于识别世界中的物体。然后,将下一个级别的物体提升,我认为是场景。场景是物体的组合。现在我们有了这个录音室,有桌子、麦克风和坐在椅子上的人,它们以某种方式组合在一起。但我们设想世界是场景的下一步。场景可能是单独的事物,但我们想打破界限,走到门外,从桌子边走出去,走出大门,走到街上,看到汽车呼啸而过,看到树叶在飘动,并能够与这些事物互动。另一件令人兴奋的事情是,仅仅提及这项技术的新媒体这个词。真实世界和虚拟想象世界或增强世界或预测世界之间的界限是模糊的。你真的在那里。真实世界是三维的。所以,在数字世界中,你必须有一个三维表示才能与真实世界融合。你知道,你不能有一个二维的,你不能有一个一维的,才能有效地与真实的三维世界互动。有了这个,它就解锁了。所以,用例可以是无限的,因为这个。所以,第一个用例,Justin 刚才谈到的,将是为任何数量的用例生成一个虚拟世界。你刚才提到的一个将是增强现实。是的,就在 World Labs 成立的时候,Apple 发布了 Vision,他们使用了“空间计算”这个词。我们几乎就像他们偷了我们的,但我们是空间智能。空间计算需要空间智能。完全正确。我们不知道它将采取什么硬件形式。它将是护目镜、眼镜、隐形眼镜、隐形眼镜。但这种真实世界与你可以在其之上做什么的界面,无论是帮助你增强工作能力,修理汽车,即使你不是训练有素的机械师,还是仅仅为了娱乐而进入一个 Pokemon Go Plus+。突然之间,这项技术将成为 AR/VR/MR 的操作系统。最终,AR 设备需要做什么?它是一个始终开启的设备,它与你同在,它看着世界。所以,它需要理解你看到的东西,并可能在你的日常生活中帮助你。但我对虚拟世界和物理世界的融合也感到非常兴奋,这变得至关重要。如果你能够实时、完美地理解你周围的事物,那么它实际上也会贬低现实世界的大部分。就像现在,我们有多少不同尺寸的屏幕用于不同的用例?太多了。你有你的手机,你有你的 iPad,你有你的电脑显示器,你有你的电视,你有你的手表。这些基本上都是不同的屏幕,因为它们需要在不同的上下文和不同的位置向你呈现信息。但如果你能够无缝地将虚拟内容与物理世界融合,它就会贬低对所有这些的需求。它只是理想地无缝地融合了你当下需要知道的信息,并以正确的方式向你提供信息。能够将数字虚拟世界与 3D 物理世界融合的另一个巨大用例是,任何代理都能够在物理世界中做事情。如果人类使用这些混合现实设备来做事情,就像我说的,我不知道如何修理汽车,但如果我必须这样做,我就会戴上这个护目镜或眼镜,突然间我就会得到指导。但还有其他类型的代理,即机器人。任何类型的机器人,不仅仅是人形机器人。它们的接口定义就是 3D 世界。但它们的计算能力,它们的大脑定义就是数字世界。那么,什么将它们从学习连接到行为,从机器人大脑连接到真实世界大脑呢?必须是空间智能。你谈到了虚拟世界,你谈到了更像是增强现实,现在你谈到了纯粹的物理世界,它将用于机器人技术。对于任何公司来说,这将是一个非常大的目标,特别是如果你要涉足这些不同的领域。那么,你如何看待深度技术与任何这些特定应用领域的关系呢?我们将自己视为一家深度技术公司,一家提供模型的平台公司,这些模型可以服务于这些三种用例中的不同用例。其中有没有哪一种你认为在早期更自然,人们可以期待公司倾向于哪一种?或者,我认为足以说的是,设备还没有完全准备好。我还在读研究生的时候就有了我的第一个 VR 头显,就像那些具有变革性的技术体验一样。你戴上它,你会想:“我的天哪,这太疯狂了。”我认为很多人第一次使用 VR 时都有这种体验。所以我一直对这个领域很兴奋。我喜欢 Vision Pro。我熬夜在它发布的第一个月就订购了第一批。但我认为现实是,它还没有成为大众市场吸引力的平台。所以,很可能作为一家公司,我们将进入一个比我预期的更成熟的市场。我认为有时普遍性中存在简单性。就像,我们有成为一家深度技术公司的概念。我们相信有一些根本性的问题需要很好地解决,如果解决得好,就可以应用于许多不同的领域。

我们确实将公司的这一漫长历程视为构建和实现空间智能的宏大梦想。所以,这似乎需要大量的技术来构建。是的,我认为这是一个非常困难的问题。我认为,有时,对于那些不直接从事人工智能领域的人来说,他们只是将人工智能视为一种单一的、庞大的、无差别的才能。而对于我们这些在这里待了更长时间的人来说,你会意识到,需要很多不同种类的才能汇集在一起,才能在人工智能领域,尤其是在这个领域,构建任何东西。我们已经讨论了一些数据问题,我们已经讨论了一些我在博士期间研究过的算法,但我们还需要做很多其他事情。你需要真正高质量的大规模工程,你需要对三维世界有深刻的理解,你需要……实际上,这与计算机图形学有很多联系,因为它们从相反的方向解决了许多相同的问题。所以,当我们考虑团队建设时,我们会考虑如何找到各个子领域中绝对顶尖的世界级专家,这些领域对于构建这个非常困难的事情是必不可少的。当我想到如何组建 World Labs 最好的创始团队时,它必须从一群非凡的多学科创始人开始,当然,贾斯汀对我来说是自然而然的,贾斯汀,你作为我最好的学生之一,以及最聪明的技术人员之一。但还有另外两个人,我通过声誉认识他们,其中一位贾斯汀甚至与他共事过,我一直垂涎欲滴。一位是本·米哈尔,我们谈到了他在神经场方面的开创性工作。但另一位是克里斯托夫·勒纳,他在计算机图形学领域享有盛誉,尤其是在高斯溅射三维建模表示法出现五年前,他就具有远见地研究了它的前身。当我们听到关于与克里斯托夫·勒纳合作的可能性时,贾斯汀就从椅子上跳了起来。本和克里斯托夫都是传奇人物。也许可以快速谈谈你是如何考虑团队的其余部分的构建的,因为再次强调,你知道,这里有很多东西需要构建,有很多工作要做,不仅仅是在人工智能或图形学方面,还有系统等等。是的,到目前为止,我个人最自豪的是我曾有幸与之合作的强大团队,我职业生涯中最聪明的年轻人,来自顶尖大学,作为斯坦福大学的教授。但我们在 World Labs 汇集的这种人才简直是现象级的。我从未见过如此集中的人才,我认为这里最大的差异化因素是我们是空间智能的信徒。所有多学科人才,无论是系统工程、机器学习基础设施,还是生成建模、数据,还是图形学,我们所有人,无论是我们的个人研究之旅,还是技术之旅,甚至是个人爱好,我们都相信空间智能必须在这个时刻,与这群人一起发生。这就是我们如何真正找到我们的创始团队,而这种能量和人才的聚焦对我来说真的令人谦卑。我就是喜欢它。所以我知道你一直以北极星为指导。北极星的一些特点是,你实际上无法到达它们,因为它们在天空中,但它们是获得指导的好方法。那么,你将如何知道你已经完成了你设定的目标,或者这是一个将无限期地继续下去的终生事业呢?首先,有真正的北极星和虚拟北极星。有时你可以到达虚拟北极星。公平地说,在世界模型中足够好了。正如我所说,我认为我的一个北极星需要一百年才能完成图像叙事,而贾斯汀和安德烈在我看来为我解决了这个问题,所以我们可以到达我们的北极星。但对我来说,当许多人,许多企业使用我们的模型来满足他们对空间智能的需求时,那就是我所知道的,我们已经达到了一个重要的里程碑。实际部署,实际影响,实际上是的。我认为我们不会到达那里。我认为这是一件如此根本的事情,就像宇宙是一个巨大的、不断演变的四维结构,而宏大的空间智能就是理解它的所有深度,并弄清楚所有应用。所以我认为我们今天有一些特定的想法,但我认为这段旅程将带我们去我们现在甚至无法想象的地方。优秀技术的魔力在于,技术会开启更多的可能性和未知。所以,我们将继续前进,而可能性将不断扩大。太棒了,谢谢贾斯汀,谢谢法伊,这太棒了。谢谢马丁,非常感谢收听 a16z 播客。如果你一直听到这里,别忘了订阅,这样你就能第一个收到我们独家的视频内容,或者你可以看看我们为你精心挑选的这个视频。