📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

How Fei-Fei Li Is Rebuilding AI for the Real World

a16z22:26

Transcription

空间,三维空间,外面的空间,你脑海中的空间,空间智能是智能的一个关键部分。突然间,我们真的可以创造出无限的宇宙。有些是为机器人准备的,有些是为创造力准备的,有些是为社交准备的,有些是为旅行准备的,有些是为讲故事准备的。这突然会让我们生活在多元宇宙中。我不需要大型语言模型来让我相信大型语言模型很重要。马丁,你为什么不简单地代表 FE 吹嘘一下,并分享一下你如何总结她对人工智能的贡献,以便让不熟悉的人了解?所以,我属于那种不需要太多介绍的人,她做了太多事情,我无法一一列举。所以,也许我只会说一些与此相关的。我的意思是,当然,她曾是 Twitter 的董事会成员。她曾是谷歌的高管,World Labs 的创始人兼首席执行官。但非常非常重要的是,正如我们都知道人工智能,以及你们都知道,我们都在谈论神经网络,有很多人专注于让它们变得有效。但 FE 真正独特地将数据引入了方程,而现在我们认识到这实际上可能是更大的问题,更有趣的问题,所以她确实是大家称她为人工智能的教母。而菲菲,你为什么必须让马丁成为第一位投资者?嗯,首先,我认识马丁已经十多年了。你知道,我于 2009 年加入斯坦福大学,当时我还是一名年轻的助理教授,而马丁当时在那里完成了他的博士学位。所以,我一直知道,当然,马丁的导师尼克·马图恩是我的好朋友,我一直知道马丁后来成为了一个非常成功的企业家和非常成功的投资者。所以我们互相见面,我们谈论事情。但当我构思 World Labs 的想法时,我正在寻找我所谓的“独角兽投资者”。我不知道这个词是否存在,但我的想法是这样的:谁不仅是一位非常成熟且成功的投资者,能够与企业家一起经历这段旅程的起伏,能够非常有见地,能够带来知识、建议和资源,而且我还在特别寻找一位智力伙伴。是的。因为我们在 World Labs 所做的事情是深度技术。我们试图做一些别人从未做过的事情。我们非常有信心地知道,它将真正改变世界。但我需要一个计算机科学家,一个人工智能的学生,一个了解产品市场,了解消费者市场的人,并且能够随时随地与我进行智力上的交流。实际上,我们第一次联系的起源故事其实相当有趣。所以,菲菲显然已经考虑这个想法很长时间了,比它开始还要早很多年,甚至可能很多年,她会谈论她对人工智能需要什么才能在这个世界上航行有着非常深刻的直觉。但我们在马克的一次晚宴或午餐会上,那里有很多人工智能方面的人,每个人都对大型语言模型感到兴奋,他们谈论的是语言,而我独立得出了一个结论,因为我实际上做了很多图像投资,所以这并不是故事的结局。所以,在餐桌的尽头,所有这些人都在谈论它,菲菲凑过来对我说:“你知道我们缺少什么吗?”我说:“我们缺少什么?”她说:“我们缺少一个世界模型。”我说:“是的。”然后一切都顺理成章了,因为我一直在从高层次思考问题,但我的意思是,她完美地阐述了这一点,她已经思考了一年,与人交谈等等。所以,在某种程度上,我们以我们自己曲折的方式得出了一个非常相似的直觉。她的想法更完善,而我的只是一个花哨的想法,但之后我们进行了多次对话,我们都同意我们在这种想法上是同步的。实际上,我不知道你是否知道,所以在午餐时,我们因为这个世界模型的主意而一拍即合,但当时我已经与各种人交谈,不仅是计算机科学家、技术专家,还有投资者和潜在的商业伙伴。说实话,大多数人都不理解。所以,当我提到“世界模型”时,他们会点头,但我能感觉到那只是礼貌的点头。所以我打电话给马丁,我说,你介意来斯坦福大学喝杯咖啡吗?我说,马丁,你能向我定义你的世界模型吗?我真的很想听听马丁是否真的这么想。他将其定义为一个真正理解世界的三维结构、形状和组合性的人工智能模型,这正是我所说的。我当时想:“哇,他是迄今为止我谈过的唯一一个真正理解它的人。”这不仅仅是点头。哇。好的。好的,我们稍后会谈到 World Labs 和它的具体细节,但也许我们先回到你们的博士和教授时代,然后回顾一下,如果你们能回到过去,并了解过去十年人工智能的发展,你们认为最大的惊喜是什么?或者有什么事情是你们没有预料到的,会让你们年轻的自己感到震惊?是的,说出来很讽刺,因为正如马丁所说,我是在人工智能领域引入数据的人,但我仍然对数据饥渴的模型、数据驱动的人工智能能走到这一步,并真正拥有令人难以置信的思维机器的涌现行为感到非常惊讶。所以,是的,为什么还要创办另一家基础模型公司?为什么不是 Loom?你知道,我的智力旅程不是关于公司或论文,而是关于找到北极星问题。所以,并不是我醒来就说我必须创办一家公司。我醒来,或者过去几年每天醒来,都认为语言之外还有很多东西。语言是思想和信息的极其强大的编码,但它实际上并不是所有动物和生物所生活的 3D 物理世界的强大编码。如果你看看人类的智能,很多都超出了语言的范畴。语言是捕获世界的有损方式。而且,语言的一个微妙之处是,语言是纯粹的生成性的。语言在自然界中不存在。我们环顾四周,没有音节或单词。而整个物理感知视觉世界就在那里,动物整个进化历史都建立在大量的感知和最终具身智能之上。人类不仅生存、生活、工作,而且通过构建世界和改变世界来建立文明。所以,这就是我想解决的问题。为了解决这个问题,研究当然很重要,我作为一名学者花了几年时间研究它,而且它仍然很有趣。但我确实意识到,特别是与马丁交谈后,现在是时候集中精力,以行业级的努力,在计算、数据和人才方面进行专注的努力,这才是将这一切变为现实的答案。这就是我为什么想创办 World Labs。太棒了。是的。埃里克,你可以做一个非常简单的思想实验,它能很好地说明语言和空间之间的区别。所以,如果我把你放在一个房间里,蒙上你的眼睛,然后我只是描述这个房间,然后我让你做一个任务,你成功的几率非常小。我说,“哦,在你前面 10 英尺处有一个杯子,左边是这个。”这是一种非常不准确的传达现实的方式,因为现实是如此复杂和精确,对吧?另一方面,如果我摘掉你的眼罩,你就能看到实际的空间,对吧?你的大脑正在重建三维空间,对吧?然后你就可以去操纵东西,触摸东西,对吧?所以,一种思考方式是,我们进行大量的语言处理,并用它来交流和表达高层次的想法等等。但当涉及到导航现实世界时,我们真的非常依赖世界本身以及我们重建它的能力。你是什么时候,怎么意识到语言可能不够的?因为这似乎并不是广为人知。我不是一直听到这个。嗯,你知道,所以如果你问我,什么样的突破是令人惊讶的,那就是语言先行了,因为我们一直在努力研究机器人技术,对吧?我的意思是,即使是自动驾驶汽车,作为一个行业,我们已经投资了 1000 亿美元。我记得塞巴斯蒂安·特伦在 2006 年赢得了 DARPA 大挑战赛,我们当时想,万岁,自动驾驶汽车完成了,对吧?然后,你知道,20 年后,我们终于到了,投资了 1000 亿美元等等。这是一个二维问题。所以,我们走的道路是,你是否真的解决了世界导航问题,这很难,然后突然出现了这些大型语言模型,它们具有单位经济效益,它们几乎立即解决了所有这些语言问题。所以,这只需要我一点时间。菲斯说得很美,我们大脑中处理语言的部分其实是最近才出现的,所以我们在这方面其实效率很低。所以,计算机在这方面做得更好,这并不奇怪。但大脑中负责导航的部分,你知道,空间部分已经存在了,它有数百万年的历史。爬行动物的大脑大约有四百万年的历史。甚至更长。这是通过心碎来磨练的。是的。是的。通过心碎来磨练,对吧?五亿年。是的。所以,这几乎就像我们在展开进化,对吧?所以,语言部分对于高层次的概念和笔记本电脑阶层的工作非常非常重要,而这正是它目前正在影响的。但当涉及到空间时,这就是从机器人技术到任何你试图构建物理东西的东西,你都必须解决这个问题。而且我们从自动驾驶汽车那里知道,这是一个非常棘手的问题。也许这值得谈论的是,生成式浪潮给了我们一些关于如何做的见解。所以,感觉时机到了。是的。嗯,我的旅程非常不同,因为我一直都在视觉领域。所以,我觉得我不需要大型语言模型来让我相信大型语言模型很重要。我想说,我们不是在这里贬低语言。我非常兴奋。事实上,看到 ChatGPT 和大型语言模型以及这些基础模型取得如此突破性的成功,激励我们认识到世界模型时刻的到来。但马丁说得很美。那就是空间,三维空间,外面的空间,你脑海中的空间,使人们能够做许多超越语言的事情的空间智能,是智能的一个关键部分。它从古代动物一直到人类最创新的发现,比如 DNA 的结构。那个三维空间的双螺旋。你不可能只用语言来推理出来。你知道,这只是一个例子。我的另一个科学例子是巴基球。哦,是的,碳分子结构,构建得如此精美。这种例子表明空间和三维世界是多么深刻。让我们更具体地描绘一下,当 World Labs 实现其愿景,或者语言模型实现其愿景时。有哪些应用程序或用例我们可以向观众展示,以帮助他们具体化?是的,有很多。例如,创造力是非常视觉化的。我们有来自设计、电影、建筑、工业设计的创作者。创造力不仅仅是为了娱乐。它可以是为了生产力,为了机械,为了很多事情。这本身就是一个高度视觉化、感知化、空间化的工作领域或领域。当然,我们提到了机器人技术。对我来说,机器人技术是任何具身机器。它不仅仅是人形机器人或汽车。它们之间还有很多。但它们都必须以某种方式弄清楚它们所处的 3D 空间,必须经过训练才能理解 3D 空间,并且必须做事情,有时甚至与人类协作,这需要空间智能。当然,我认为对我来说非常令人兴奋的一件事是,在整个人类文明中,我们作为一个集体,都生活在一个 3D 世界里,那就是地球的物理 3D 世界。我们中的少数人去了月球,但你知道,人数非常少,但那是一个世界,但这使得数字虚拟世界令人难以置信。有了这项技术,我们应该谈谈它,那就是生成和重建的结合。突然间,我们真的可以创造出无限的宇宙。我们可以为机器人创造一些,为创造力创造一些,为社交创造一些,为旅行创造一些,为讲故事创造一些。你可以,它突然会让我们以一种多元宇宙的方式生活,而这仅仅是想象力是无限的。这些对话听起来可能很抽象,但实际上并非如此。但它们之所以听起来抽象,是因为它们是真正横向的,就像大型语言模型一样。所以,如果你问我,大型语言模型擅长什么?我们用于情感对话的同一个大型语言模型,我们用它来编写代码,用它来列清单。我们用它来实现自我价值。所以,我认为我们可以非常具体地说明这些模型的作用。通过这些模型,你可以从一个二维视角看待世界,然后你可以创建一个完整的 3D 表示,包括你没有看到的部分,比如桌子的背面。所以,只给一个二维视图,你就有了完整的东西,然后你问,好吧,你能用这个东西做什么?你可以操纵它,你可以移动它,你可以测量它,你可以堆叠它。所以,你在空间中可以做的任何事情,你都可以做到。这意味着你可以做建筑,你可以做设计。但事实证明,填补桌子背面这个能力意味着你可以填补那些一开始就不存在的东西。所以,假设我只有一张二维照片,我可以创建 360 度全景。所以,现在你有了完全的生成性。这意味着什么?这意味着,你知道,这就是电子游戏,这就是创造力。所以,这是一个非常非常横向的领域,它基本上让一台计算机通过一个单一的视角或多个视角来观察世界,并创建一个完整的 3D 表示,然后计算机就可以对其进行操作。所以,你可以看到,这是一个非常具体且关键的事情,从机器人技术到电子游戏,再到艺术和设计。似乎直到现在我们还没有完全欣赏到 3D 组件。这是公平的说法吗?这是公平的说法。事实上,我认为进化花了很长时间。3D 不是一个容易解决的问题,但我总是回到这个事实,几年前我曾和我六岁的孩子谈论过为什么树没有眼睛。根本原因是树不会移动。它们不需要眼睛。所以,动物生命的整个基础就是移动、做事和互动,这赋予了感知和空间智能生命,而空间智能反过来又会像马丁所说的那样,横向地重塑人类正在做的许多工作和生活方式。需要是 3D 的吗,还是什么?你可以只用 2D 吗?物理发生在 3D 中,交互发生在 3D 中。导航到桌子后面需要发生在 3D 中。无论是物理上还是数字上,组合世界都需要发生在 3D 中。所以,从根本上说,问题是一个 3D 问题。一种思考方式是,如果一个人看着一个 2D 视频,这个人可以在脑海中重建 3D,对吧?但如果需要一个计算机,比如,我有一个机器人,它的输出是模型,如果是 2D 的,然后你让机器人做,我不知道,测量距离或抓取东西,就像缺少信息一样,你知道,你有 XYZ 平面,Z 平面根本不存在。所以,对于许多空间方面的事情,你需要向计算机提供这些信息,以便它能够实际在 3D 空间中导航。所以,2D 视频对于人类来说很好,因为我们已经能够将其转换为 3D,但对于任何计算机程序来说,它都需要是 3D 的。实际上,我想给你讲一个个人故事。大约五年前,讽刺的是,我因为角膜受伤而失去了几个月的立体视觉。这意味着我实际上是用一只眼睛看东西的。就像马丁所说,我一生都接受了立体视觉的训练。所以,即使我只用一只眼睛看,我也大致知道 3D 世界是什么样的。但对我一个视觉科学家来说,这是一个迷人的时期,可以实验世界是什么样的。真正让我印象深刻的一件事是,我害怕开车。首先,我无法以那个速度上高速公路,我无法做到,但我只是在我的社区里开车,我意识到我无法准确测量我的汽车和停着的汽车之间的距离,即使我完全了解我的汽车有多大,邻居的汽车有多大,我知道这些道路很多年了,但即使是开车,我也必须非常慢,几乎每小时 10 英里,这样我才不会刮到汽车,这就是为什么我们需要立体视觉。这是一个很好的解释,为什么 3D 对于任何处理来说都是必需的。是的,我不推荐这样做,但如果你停放你的汽车一辆,然后用一只眼睛驾驶你的汽车二,然后感受一下,那就是你自己的。与大型语言模型一样,很多研究都是在大公司进行的。这里的研究状况如何?与大型语言模型相比,这绝对是一个较新的研究领域。说它是新的并不完全公平,因为在计算机视觉领域,我们作为一个领域一直在做一些零散的研究。例如,3D 计算机视觉领域发生的一个重要革命是神经辐射场(NeRF),这是由我们的联合创始人本·米尔登哈尔和他在伯克利的朋友完成的,这是一种使用深度学习进行 3D 重建的方法,大约四年前风靡全球。我们还有一位联合创始人克里斯·克里斯托夫·拉斯纳,他的开创性工作是高斯喷泉表示法再次变得流行起来的原因之一,这是一种表示 3D 体积 3D 的方法。当然,贾斯汀·约翰逊是我以前的学生,也是 World Labs 的联合创始人,他是第一代深度学习计算机视觉学生之一,他在图像生成方面做了很多基础工作,在 Transformer 出现之前,我们使用 GAN 进行图像生成和风格迁移,这确实普及了我们正在做的一些组件或配料。所以,学术界在发生事情,工业界也在发生事情。在 World Labs,我们坚信我们将全力以赴解决这个单一的、宏大的北极星问题,集中世界上最聪明的人才,包括计算机视觉、扩散模型、图计算机图形学、优化、人工智能、数据等,让他们汇聚到一个团队,努力让这一切成为现实并产品化。我的意思是,从外部人士的角度来看,我不是这些领域的专家,但感觉要解决这个问题,你需要 AI 和图形学方面的专家,就像数据和模型,实际的模型架构,以及如何实际在计算机内存中表示这些东西,以及在屏幕上表示。所以,这需要一个非常特殊的团队来真正破解这个问题,而菲菲已经成功地将他们聚集在一起了。 [音乐] 嘿,嘿,嘿。