📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

3D & AI | Dr. Fei-Fei Li, CEO & Co-Founder, World Labs & Jeetu Patel

Cisco22:20

Transcription

很高兴看到在过去一年里,World Labs 取得了实际的进展。那么,让我们先来谈谈你们在做什么,以及为什么它如此重要。

是的。嗯,现在我每天醒来,只想着一件事,而且只有一件事,那就是空间智能。这是我大约两年前与一群年轻技术专家共同创立的公司,它叫做 World Apps。那么,为什么空间智能如此重要,为什么我说它是人工智能的下一个前沿呢?如果你从进化的角度来看待智能的发展,这发生在半个多亿年前,首先引发了神经系统发展进化军备竞赛的,实际上是感知,而不是语言。与感知相比,语言是一种非常非常新的智能形式。如果你慷慨一些,认为语言可能存在了五亿年,可能甚至没有那么多,但半个多亿年前,动物开始看到光,开始感知环境。所以触觉和视觉感知……

你是否也将本能归于感知?

本能是一个非常有趣的词。对我来说,本能是一个非常模糊的词。所以,我并不是在否定本能这个词,但实际上是触觉和视觉引发了神经系统的发展,并开启了进化军备竞赛。因此,动物变得越来越活跃地与环境互动,也越来越聪明。所有这些都是为了说明,理解、推理、互动以及在真实的 3D、4D 物理世界中导航的能力,与语言智能一样具有基础性,而关键技术是空间智能,这就是为什么我相信这是下一代或下一个人工智能前沿。我,这就是 Worldapse 一直在努力的方向。

那么,给我们讲讲 Marble。Marble 是什么?你们最近发布了它。

是的。Marble 是我们第一代空间智能模型的名称。我们倾向于随意称它为世界模型。但事实是,世界模型有太多定义了。你是否称它为世界模型,几乎无关紧要。它是一个空间智能模型,是一个前沿模型。Marble 所做的是,它接收多模态输入。无论是仅仅一句话,一张图片,一段视频,几张图片,还是一个简单的 3D 输入,都无关紧要。它是多模态的。然后,它将这个提示转化为一个完全可导航、可交互的世界,这个世界是 3D 的,是永久一致的,这与你现在看到的视频模型截然不同,并且它具有几何结构,可以支持你想要模拟机器人动作,或者编写游戏等等。所以 Marble 是一个前沿模型。是的。我们大约在两个月前发布了它。它仍然是第一代。我们非常兴奋地开始这段旅程,现在它仍然是,你知道的,它是最先进的 3D 生成世界模型。

而且,你知道,有一种观点认为,如果没有……如果你只依赖语言作为模型,我们将无法实现通用人工智能,你需要增强它的物理性。你当然相信这一点,但能否和我们谈谈这个维度?随着时间的推移,最大的突破是什么?

是的。

最明显的用例是机器人技术。但即使如此,五年后,我们能用世界模型做什么,而我们今天甚至没有想到?

嗯,首先,你甚至不必等到五年。我们已经在与用户和客户合作,[清嗓子] 来玩这个……你知道的,早期……我们正在早期使用这个……我们的世界模型。我们看到用户用它来开发游戏。我们看到 VFX 用户和客户在商业虚拟制作环境中实际使用它来工作。我们正在与来自英伟达等大公司以及初创公司和学术实验室的机器人和仿真合作伙伴合作,他们将 Marble 用作机器人的训练环境。我们看到建筑师和设计师正在使用它来进行室内设计和其他各种设计。我们也收到了一些令人惊喜的用例。例如,临床研究人员找到了我们,并表达了极大的热情。事实证明,许多精神病学和心理健康研究以及干预措施需要个性化的沉浸式环境,尤其是在特定情况下。例如,强迫症患者。你知道,有些人会被非常具体的情况触发。就我个人而言,我会被脏衣服触发,但我相信人们会被不同的方式触发,而这些研究人员正在研究这一点,他们很难获得这些环境,而 Marble 可以在每次提示时,在几分钟内获得许多不同类型的环境供你使用。所以这是一个令人惊喜的用途。我们也看到人们在健康和健身训练中,个性化瑜伽环境或其他环境。所以,我认为随着 Marble 变得更好,我们仍处于早期阶段,我们将看到越来越多的横向应用。

那么,你已经……你在人工智能行业工作了很长时间。

这是谈论我年龄的好方式。

不,不,不。我的意思是,你不是那种……你不是那种“我看了三年”的人,而是你献身于 [鼻息] 人工智能。在你建立这家公司,开始思考构建空间智能方面时,最让你惊讶的是什么?

这是一个很好的问题。我知道 G2,你也是。我们谈论……即使在我们这个年纪,最重要的事情是学习和对学习的渴望。是的,我已经在该领域工作了很多年,我想说的是,我之所以进入人工智能领域,是因为我个人的好奇心。我只是喜欢问那个大胆的问题:什么是智能,如何让机器变得智能?但那是非常个人的。没有人关心人工智能。世界不知道如何拼写人工智能,那很有趣。所以,过去十年完全改变了。人工智能对我来说不再是个人化的。人工智能是文明的。这给我增加了一层责任感,我不仅能在技术上做出贡献,还能作为教育者,还能为人工智能的健康发展做出贡献。作为一名企业家,最让我惊讶的是……有几件事。一是……人工智能在过去几年里的发展速度简直令人惊叹。我知道每个人,无论我们是否假装,内心深处都感到焦虑,有太多的东西要读,太多的博客,太多的新闻,太多的模型发布,太多了……而这种焦虑感,正是我们这个时代的写照,这项技术正在以惊人的速度发展。所以,这让我感到非常兴奋,但也让我对自己的无知保持了清醒。你知道这句名言,我一无所知,像我这样的人甚至都有这种感觉,我希望你至少能从我这里听到这一点,并认识到我们都有这种感觉,不要放弃学习,继续保持好奇心。另一件让我惊讶,坦率地说,也一直让我担心的是人工智能的极化言论,即太多的网络周期仍然花在讨论人工智能及其极端影响上,要么是完全的技术乌托邦,仿佛技术永远不是一把双刃剑,要么是完全的末日论。

仿佛人类每时每刻都面临着生存危机。

这根本不是一种负责任的谈论对我们的文明如此重要的技术的方式。技术是一把双刃剑。但主导权在我们所有人手中。每个企业家,每个产品经理,每个商业领袖,每个软件工程师,每个公民,我们仍然必须拥有主导权,知道如何引导这项技术。我真的非常希望……到 2026 年及以后,我们不要停留在讨论人工智能的两个极端。让我们更细致一些。让我们……保持仁慈。让我们拥有用技术造福的乐观精神,但也要有负责任地使用它的责任感,让我们进行这样的对话,而不仅仅是……为了点击量而优化。

那么,在你看来,未来几年人工智能的成功是什么样的?我真的很喜欢你对我们这种极化观点的描述,即所有工作都会消失,我们只会盯着大海,或者这项技术完全没用,什么也做不了,往往会……[笑声]

G2,如果我们把时间倒回 150 年,我不记得确切的年份了,如果我们当时有两个版本的我们站在台上谈论电力的成功是什么样的,我想我们至少……我不知道人们是否想象过……很难想象……但我希望有一个版本,你知道,我们的学校有灯,我们的家是温暖的,它将赋能机器来工业化我们的生活,反过来又会延长我们的寿命,更多的孩子将在入学年龄时学习,这就是技术的意义,这就是人工智能的意义,这是一个永恒的价值。成功意味着文明变得更好,而文明是由每一个追求幸福、追求繁荣、追求尊严的个体组成的。这就是人工智能和每一项技术的成功之道。

太棒了。

[掌声]

那么,我们来谈谈战术。大型世界模型在计算上是否像语言模型一样密集?它们……更多还是更少?

这是一个很好的问题。首先,有不同类型的大型世界模型。我们非常致力于创造具有 3D、4D 显式表示的世界模型,以赋能机器人、游戏、娱乐、设计等。还有其他被称为世界模型的模型,更多的是视频生成模型。目前,我们的模型不像更大的 LLM 那样大,我认为 GPT5 的训练大约是 10 到 26 次浮点运算,而我们的模型,我们的 Marble 模型仍然比它小几个数量级。

更小,是因为你们没有足够的数据来喂养这些模型吗?

我认为两者都有。我认为数据是……你知道的,规模法则始于数据和模型参数。所以数据起着作用。这也是因为这个领域还很早。你知道,语言模型始于……你知道,Transformer 论文发表于 2016 年,所以……或者我认为是 2016 年,所以差不多十年了,对吧?世界模型是一个更新的领域,所以我们仍然处于早期……我不会说最早,实际上,我认为过去两年我们已经规避了一些科学风险,但我们仍然处于相对早期,还在摸索模型架构。所以,它相对较小。但话虽如此,考虑到 World War 在过去几年里取得的进展,以及看看我们的领域,我认为未来几年将会非常激动人心。你知道,我们将看到大型世界模型在规模法则的曲线上乘风破浪。

所以,你知道,我们以前谈过这个,Fei,但让我着迷的是,当我们开始交谈时,你强调了语言模型是在免费公开的互联网数据上训练的。很容易去收集大量数据。物理数据很难做到,所以合成数据变得很重要,但你也必须以更慢的方式收集这些数据。请给我们讲讲这带来的限制,以及世界模型的发展速度,因为数据稀缺,会像我们习惯的语言模型那样吗?会更慢吗?然后,即使在物理机器人领域,这又会如何体现呢?你会有一个通用的机器人可以为你做一切,还是只会因为我们拥有的数据而成为专用机器人?

这是一个很有深度的问题,G2。让我们来谈谈数据和通用机器人。它们有关联,但也有很多细微差别。例如,在 World Labs……你知道我们的数据策略是什么吗?很多人问,当然,我只能告诉你这么多。但有一点非常清楚,我们采取的是混合数据策略。你知道,语言……我非常羡慕我的语言朋友们,因为归根结底,输入数据和输出数据是完全可观察的,更多或更少的是一种模态,那就是文本。而且文本非常干净,对吧?我知道有些词不好,但总的来说,词汇表具有非常清晰的含义和语义。而像素和体素的世界则混乱得多。为了推动技术界限,创造 3D、4D 世界,我们必须……我们没有大量的 3D、4D 数据来训练我们的模型。所以我们必须采取混合方法,分层多模态数据。所以我们确实有文本、图像和视频,这些数据基本上是互联网规模的,但我们也需要模拟数据。我们也需要我们称之为真实世界捕获数据。你可能会想,这些数据是什么?一个最大的例子就是自动驾驶汽车。无论我们看特斯拉、Waymo 还是其他自动驾驶汽车,这些公司都花费了数年甚至数十年收集真实世界数据和模拟数据。所以创建世界模型将采取这种方法。它会慢吗?这是一个非常有趣的问题,因为有一些混淆因素。例如,加入这个旅程的人要多得多,对吧?计算能力要强大得多,芯片……而且生态系统也更加成熟。我们与三年前还不存在的数据供应商合作。所以,我认为……

而且合成数据确实效果很好,对吧?它也增加了你的……功效,而且我们制造的东西也会增加到这个模拟世界中。所以有一个飞轮。我们的模型也将成为机器人技术的有用模拟数据。关于通用机器人,我过去十年以上一直在斯坦福大学领导一个机器人实验室,机器人学习实验室。我对机器人感到非常兴奋。我认为,作为一名科学家,认识到这是一个非常非常困难的问题很重要。仅仅因为北极星是清晰的,并不意味着旅程很短。事实上,想想 2006 年。我的同事 Sebastian Thrun 带领斯坦福团队创造了第一辆能在内华达沙漠中行驶 138 英里的自动驾驶汽车。那时我们就宣布我们将拥有自动驾驶汽车。二十年后,去年是 Waymo 在旧金山和一些大城市街道上运行的第一年。我们基本上已经达到了一个重要的里程碑,但这是一段非常漫长的旅程。汽车和机器人之间的区别是,汽车是一个方形机器人,在二维表面上移动,汽车唯一需要做的事情就是不要碰到东西。不要碰到行人。不要碰到路缘石。想想机器人。它是一个三维物体,无论是否是人形。在三维世界中工作。通用机器人的目标是以不损坏物体的方式去触碰它们。这是一个更高维的问题,我们正在取得进展。

而且手部模拟一直非常困难,对吧?手的灵巧性,视觉的精确性,对空间的理解,训练数据的缺乏,所有这些都很有挑战性。这就是我创立 World Labs 的原因,因为我知道这是一个非常重要的问题。我们想解决这个问题。但我个人作为一名科学家,也不喜欢过度承诺。所以,Fei,在过去的 60 秒里,对于在座的来自企业界的人来说,他们应该如何看待……世界模型……物理人工智能……以及你正在思考的所有世界?然后,我最后要说的是,因为我知道我们时间不多了,如果没有 Fei,我们就无法举办 Cisco AI Summit,因为会感觉不完整。所以我们会继续邀请你。

谢谢。嗯,我正在等我的赠品。

是的,我们会给你……能请给 Fif 送点赠品吗?

开玩笑的。我仍然像个研究生一样思考。[笑声] 免费食物和赠品。是的。所以对于企业来说,看看吧,尤其是在世界模型和空间智能方面,在我看来,我们非常面向企业。这是……你知道的……World Labs 非常愿意与企业合作伙伴交流。我认为有很多……这是一个横向技术。我们谈论机器人技术,我们谈论模拟,我们谈论沉浸式交互娱乐体验,但我们还没有更多地谈论医疗保健。我们还没有谈论教育产品。我们还没有谈论现场服务。我们还没有谈论金融服务。我们还没有谈论农业、制造业、……检查、……你知道的,仓库、……以及城市规划等等。空间智能有很多可以做的事情。而且,我认为这是下一个前沿,我邀请你们所有人……与我们合作,或者自己合作。是的。在这个主题上。

Philly。

[掌声]