Transcription
很高兴看到在过去一年里,World Labs 取得了如此大的进展。那么,让我们先来谈谈你们正在做什么,以及为什么它如此重要。
是的。嗯,我现在每天醒来,只想着一件事,而且只有一件事,那就是空间智能。这是我大约两年前与一群年轻技术专家共同创立的公司,名为 World Apps。那么,为什么空间智能如此重要,为什么我说它是人工智能的下一个前沿?如果我们从进化的角度来看待智能的发展,那始于五十多亿年前,最先引发神经系统发展进化军备竞赛的,实际上是感知,而不是语言。与感知相比,语言是一种非常非常新的智能形式。如果你慷慨地认为语言可能存在了五十万年,可能连这个时间都不到,但五十多亿年前,动物就开始看到光,开始触摸环境。所以触觉和视觉感知……
你是否也将本能归入感知?
本能是一个非常有趣的词。对我来说,本能是一个非常模糊的词。所以,我并不是否定本能这个词,但从物理上来说,是触觉和视觉引发了神经系统的发展,并开启了进化军备竞赛。因此,动物变得越来越活跃地与环境互动,也变得越来越聪明。所有这些都是为了说明,理解、推理、互动以及在真实的 3D、4D 物理世界中导航的能力,与语言智能一样具有基础性,而空间智能是关键技术,这就是为什么我相信这是下一代或人工智能的下一个前沿。而这正是 Worldapse 一直在努力构建的。
那么,能给我们讲讲 Marble 吗?Marble 是什么,你们最近发布了它,对吧?
是的。Marble 是我们第一代空间智能模型的名称。我们倾向于随意称它为“世界模型”。但事实是,世界模型有太多定义了。你是否称它为世界模型,几乎无关紧要。它是一个空间智能模型,是一个前沿模型。Marble 所做的是,它接收多模态输入。无论是仅仅一句话,一张图片,一段视频,几张图片,还是一个简单的 3D 输入,都无关紧要。它是多模态的。然后,它将这个提示转化为一个完全可导航、可交互的世界,这个世界是 3D 的,是永久一致的,这与你现在看到的视频模型截然不同,并且它具有几何结构,可以支持你想要模拟机器人动作,或者编写游戏等等。所以 Marble 是一个前沿模型。是的。我们大约在两个月前发布了它。它仍然是第一代。我们非常兴奋能开始这段旅程,现在它仍然是……你知道的,它是最先进的 3D 生成世界模型。
而且,你知道,有一种观点认为,如果没有……如果你只依赖语言作为模型,我们就无法实现通用人工智能,你需要增强它的物理性。你当然相信这一点,但能和我们谈谈……关于那个维度。随着时间的推移,最大的突破是什么?
是的。
最明显的用例是机器人技术。但即使在此之外,比如五年后,我们能用世界模型做什么,而我们今天甚至没有想到?
嗯,首先,你甚至不必等到五年后。我们已经在与用户和客户互动,让他们……(清嗓子)……玩这个……你知道的,早期……我们自己的世界模型。我们看到用户正在使用它来开发游戏。我们看到 VFX 用户和客户正在使用它在虚拟制作环境中工作,实际上是商业虚拟制作环境。我们正在与来自英伟达等大公司以及初创公司和学术实验室的机器人和模拟合作伙伴合作,他们正在使用 Marble 作为机器人……训练环境。我们看到建筑师和设计师正在使用它进行室内设计和其他类型的设计。我们也收到了一些令人惊喜的用例。例如,临床研究人员找到了我们,并表达了极大的热情。事实证明,许多精神病学和心理健康研究以及干预措施需要个性化的沉浸式环境,尤其是在特定情况下。例如,强迫症患者。你知道,有些人会被非常具体的情况触发。就我个人而言,我会被脏衣服触发,但我相信人们会被不同的方式触发,而这些研究人员正在研究这一点,他们很难……获得这些环境,而 Marble 可以在每次提示时,在几分钟内就能获得许多不同类型的环境供你使用。所以这是一个令人惊喜的用途。我们也看到人们……用于健康和健身训练,个性化瑜伽环境或其他环境。所以,我认为随着 Marble 变得越来越好,我们仍处于早期阶段,我们将看到越来越多的横向应用。
那么,你在这个 AI 行业已经很长时间了。
这是谈论我年龄的好方式。
不,不,不。我的意思是,你不是那种……你不是那种“我看了三年”的人,而是你献出了生命……(鼻哼)……给 AI。在你建立这家公司,开始思考构建空间智能方面时,最让你惊讶的是什么?
这是一个很棒的问题。我知道 G2 你也一样。我们谈论……即使在我们这个年纪,最重要的事情是学习,以及这种学习的饥渴。是的,我在这个领域已经很多年了,我想说的是,我之所以进入人工智能领域,是因为我个人的好奇心。我只是喜欢问那个大胆的问题:什么是智能,如何让机器变得智能?但那是非常个人的。没有人关心人工智能。世界不知道如何拼写人工智能,那很有趣。所以,过去十年完全改变了。人工智能对我来说不再仅仅是个人化的。人工智能是文明的。这给我增加了一层责任感,我该如何贡献,不仅在技术上……而且作为一名教育者,而且还要为人工智能的健康发展做出贡献。作为一名企业家,最让我惊讶的是……有几件事。一是……人工智能在过去几年中的发展速度简直令人惊叹。我知道每个人,无论我们是否假装,每个人内心深处都感到焦虑,有太多东西要读,太多博客,太多新闻,太多模型发布,太多……而这种焦虑感,它说明了我们这个时代,这项技术正在以惊人的速度发展。所以,这让我感到非常兴奋,但也让我对自己的无知保持了非常清醒的认识。你知道那句名言“我一无所知”,像我这样的人甚至都有这种感觉,我希望你们至少从我这里听到这一点,并认识到我们都有这种感觉,不要放弃学习,继续保持好奇心。另一件让我惊讶,坦率地说,仍然让我担心的是人工智能的极化言论:太多的网络周期仍然花在讨论人工智能及其极端的影响上,要么是完全的技术乌托邦,好像技术永远不是一把双刃剑,要么是完全的……末日论。
好像……人类每时每刻都面临着生存危机。
这根本不是一种负责任的谈论对我们的文明如此重要的技术的方式。技术是一把双刃剑。但主动权在我们所有人手中。每个企业家,每个产品经理,每个商业领袖,每个软件工程师,每个公民,我们仍然需要拥有这种主动权,知道如何引导这项技术。我真的非常希望……到 2026 年及以后,我们不要停留在讨论人工智能的两个极端。让我们更细致一些。让我们……仁慈一些。让我们拥有用技术造福的乐观精神,但也要有负责任地使用它的责任感,让我们进行这样的对话,而不仅仅是……为了点击量而优化。
那么,在你看来,未来几年人工智能的成功是什么样的?我真的很喜欢你对我们这种极化观点的描述,即所有工作都会丢失,我们只会盯着大海,或者这项技术完全没用,它什么也做不了。
[笑声]
G2,如果我们把时间倒回 150 年,我不记得确切的年份了,如果我们有两个我们这样的版本站在台上谈论电力意味着什么,我想我们至少……我不知道人们是否想象过……很难想象……但我希望有一个版本,你知道,我们的学校有灯,我们的家是温暖的,它将赋予机器工业化我们的生活,反过来又会延长我们的寿命,更多的孩子将在入学年龄学习,这就是技术的意义,这就是人工智能的意义,这是永恒的价值。成功意味着当文明变得更好,而文明是由每一个追求幸福、追求繁荣、追求尊严的个体所创造的。这就是人工智能和每一项技术的成功。
太棒了。
[掌声]
那么,我们来谈谈战术问题。大型世界模型在计算上是否像语言模型一样密集?它们……更多还是更少?
这是一个很棒的问题。首先,有不同种类的大型世界模型。我们非常……致力于创造具有……3D、4D……显式表示的世界模型,以支持机器人、游戏、娱乐、设计等。还有其他……被称为世界模型的模型,它们更像是视频生成模型。目前在这个领域……我们的模型不像更大的 LLM 那样大,比如……我相信 GPT-5 的训练大约是 10 的 26 次浮点运算,而我们的模型……我们的 Marble 模型仍然比它小几个数量级。
更小,这仅仅是因为你们没有足够的数据来喂养这些模型吗?
我认为两者都有。我认为数据是……你知道的,规模法则始于数据和模型……模型参数。所以数据起着作用。这也是因为这个领域还很早期。你知道,语言模型开始……你知道,Transformer 论文发表于 2016 年,所以……或者我记得是 2016 年,所以差不多十年了,对吧?世界模型……是一个新得多的领域,所以我们仍然……处于早期。我不会说最早,实际上,我认为过去两年我们已经规避了一些科学风险,但我们仍然处于……相对早期,还在摸索模型架构。所以,所以它相对较小。但话又说回来,考虑到 World War 在过去几年中取得的进展,以及看看我们的领域,我认为未来几年将会非常激动人心。你知道,我们将看到大型世界模型在规模法则上呈上升趋势。
所以,你知道,我们以前谈过这个,Fei,但让我着迷的是,当我们第一次开始交谈时,你强调了……关于语言模型是在免费的、公开可用的互联网数据上训练的。很容易收集大量数据。……物理数据很难做到,所以合成数据变得很重要,但你也必须以更慢的方式收集这些数据。……能给我们讲讲这带来的限制吗?世界模型的发展速度会因为你将拥有的数据稀缺性而与我们习惯的语言模型相似吗?会更慢吗?然后,即使在物理机器人领域,这又会如何体现呢?你会有一个通用的机器人可以为你做任何事情,还是只会因为我们拥有的数据而成为专用机器人?
是的,这是一个加载的问题,G2。让我们来谈谈数据和通用机器人。它们是相关的,但……有一些细微之处。例如,在 World Labs……你知道,我们的数据策略是什么?很多人问,当然,我只能告诉你这么多。但有一点非常清楚,那就是我们采取一种混合的数据策略。你知道,语言……我非常羡慕我的语言界的朋友们,因为归根结底,输入数据和输出数据是完全可观测的,更多或更少是单一模态,那就是文本。而且文本也非常干净,对吧?我知道有些词不好听,但总的来说,词汇表具有非常清晰的含义和语义。而像素和体素的世界则混乱得多。为了推动……创造 3D、4D 世界的技术边界,我们必须……我们没有大量的 3D、4D 数据来训练我们的模型。所以我们必须采取一种混合的方法,分层……多模态数据。所以我们确实有文本、图像和视频,这些数据基本上是互联网规模的,但我们也需要模拟数据。我们也需要我们称之为真实世界捕获数据。你可能会想,这些数据是什么?一个最大的例子就是自动驾驶汽车。无论我们看特斯拉、Waymo 还是其他自动驾驶汽车,这些公司都花费了数年甚至数十年收集真实世界数据和模拟数据。所以创建世界模型也将采取这种方法。……它会慢吗?这是一个非常有趣的问题,因为有一些混淆因素。例如,加入这场旅程的人要多得多,对吧?计算能力要强大得多……芯片……而且……生态系统也更加成熟。我们与三年前还不存在的数据供应商合作。所以,我认为……
而且合成数据确实起作用,对吧?它实际上增加了你的……有效性,而且我们所做的也会增加到这个模拟世界中。所以有一个飞轮。我们的模型也将成为机器人有用的模拟数据。关于通用机器人,我……在斯坦福大学的机器人实验室工作了十多年。我对机器人感到非常兴奋。我认为,作为一名科学家,认识到这是一个非常非常困难的问题很重要。仅仅因为北极星是清晰的,并不意味着旅程很短。事实上,想想 2006 年。我的同事 Sebastian Thrun 带领斯坦福团队创造了第一辆能在内华达沙漠中行驶 138 英里的自动驾驶汽车。那时我们宣布我们将拥有自动驾驶汽车。二十年后,去年是 Waymo 在旧金山和一些大城市街道上运行的第一年。我们基本上已经达到了一个重要的里程碑,但这是一段非常漫长的旅程。汽车和机器人之间的区别是,汽车是一个方形的机器人,在二维表面上移动,而汽车唯一需要做的事情就是不要碰到东西。不要碰到行人。不要碰到路缘石。想想机器人。它是一个三维物体,无论它是否是人形。在三维世界中工作。而通用机器人的目标是以不损坏物体的方式去触摸它们。所以这是一个更高维的问题,我们正在取得进展。
而且手部模拟一直很困难,对吧?手的灵巧性,视觉的精确性,对空间的理解,训练数据的缺乏,所有这些都很有挑战性。这就是我创立 World Labs 的原因,因为我知道这是一个非常重要的问题。我们想解决这个问题。但作为一名科学家,我个人也不喜欢过度承诺。所以 Fei,在最后的 60 秒里,对于在场的企业界人士来说,他们应该如何看待……世界模型……物理人工智能,以及你正在思考的所有世界?然后,我最后要说的是,因为我知道时间不多了,没有 Fei,Cisco AI Summit 就不完整了。所以我们会继续邀请你。
谢谢。嗯,我等着我的赠品。
是的,我们会给你……能给 Fif 送点赠品吗?
开玩笑的。我仍然像个研究生一样思考。[笑声] 免费食物和赠品。是的。所以对于企业来说,看看吧,特别是对于世界模型和空间智能,我认为我们非常面向企业。这是……你知道的,World Labs 非常愿意与……企业合作伙伴交流。我认为有太多的……这是一个横向技术。我们谈论机器人,我们谈论模拟,我们谈论沉浸式交互娱乐体验,但我们还没有更多地谈论……医疗保健。我们还没有谈论……教育产品。我们还没有谈论……现场服务。我们还没有谈论……金融服务。我们还没有谈论……农业、制造、……检查、……你知道的,仓库、……以及城市规划等等。空间智能可以做的事情太多了。而且,我认为这是下一个前沿,我邀请你们所有人,你知道的,……与我们合作,或者自己去工作。是的。在这个主题上。
Philly。
[掌声]