📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

【人工智能】语言不是智能第一动力 | 李飞飞 | Marble世界模型 | World Labs | 3D生成式 | 物理感知 | 机器视觉 | 触觉进化 | 导航互动一致性 | 像素生成误区

最佳拍档16:36

Transcription

大家好,这里是最佳拍档。

在二零二六年二月五日的思科AI峰会上,World Labs的联合创始人、斯坦福大学教授李飞飞和思科执行副总裁兼首席产品官吉图·帕特尔展开了一场圆桌对话。两人从空间智能的核心逻辑,到首个世界模型Marble的技术细节,再到AGI的物理实现的路径,甚至是AI行业的群体性焦虑,进行了全方位、深层次的探讨。

今天这期视频,我们就来聊聊这场对话的核心内容,看看李飞飞眼中,AI的下一个前沿究竟在哪里。

在这场对话中,李飞飞首先提出了一个颇具颠覆的观点,那就是驱动神经系统进化的第一动力,是视觉和触觉感知,而不是语言。这个观点可以说是整个对话的核心,也是她定义空间智能为AI下一个前沿的根本依据。

从生物进化的角度来看,人类对智能的研究,往往会不自觉的围绕语言展开。毕竟语言是人类特有的交流方式,也是我们进行思维表达的重要工具。但是从进化的时间维度来看,语言其实是一种非常年轻的智能形式。李飞飞在对话中明确的表示,即使往多了说,语言的历史大概只有五十万年,甚至更短。但是在五亿多年前,动物就已经开始感知光线并且接触周围的环境。触觉和视觉传感从那个时候就已经诞生了,开启了神经系统进化的军备竞赛。

很多人会问,那本能是不是应该归入到感知的范畴内呢?李飞飞也对此做出了解答。她认为本能这个词在科学定义上比较模糊,她并不排斥这个词汇。但是从物理层面来看,真正驱动神经系统发展的,始终是触觉和视觉这两种核心的感知能力。正是因为感知能力的不断进化,动物才能够越来越活跃的和环境产生互动,而这种互动又反过来推动了大脑的发育,让生物变得越来越聪明。

从这个角度来看,我们以往对AI的研发,过度聚焦在了语言智能的打造,其实是忽略了智能的底层基石,对真实物理世界的理解、推理和互动能力。李飞飞强调,理解、推理、并且在真实的3D、甚至4D物理世界中导航的能力,其实和语言智能一样,都是智能最底层的基石。而实现这种能力的核心关键技术,就是空间智能。这也是她大约在两年前,和一群年轻技术专家共同创立World Labs的核心原因。这家公司的所有奋斗目标,都围绕着空间智能的研发和落地而展开。

在明确了空间智能的核心定位之后,李飞飞在对话中重点介绍了World Labs最近发布的第一代空间智能模型Marble,这也是目前全球最先进的3D生成式世界模型。

很多人会把世界模型和当下的视频生成模型混为一谈,但是李飞飞明确指出,大世界模型和现有的视频生成模型,存在着本质区别。这种区别体现在技术内核的根本不同上,而Marble模型就是最好的例证。

我们先来看看传统的视频生成模型,它的核心能力是像素生成。简单来说,就是根据输入的提示词,生成一系列连续的像素片段,从而形成视频画面。但是这类模型生成的内容往往缺乏一致性,也没有完整的几何结构,更谈不上让用户在生成的内容中进行导航和互动。

而Marble模型就完全不同了。它实现了永久一致性和完整的几何结构,这也是空间智能模型的核心特征。Marble能够接收多模态的输入,无论是一个简单的句子、一张图片、一段视频,还是基础的3D输入,它都能够将这些提示词转化为一个完全可导航、可互动的3D物理环境。也就是说,Marble不再是简单的生成像素的片段,而是真正意义上的世界构建。它打造的是一个有完整空间逻辑和几何结构的3D世界。这个世界不是碎片化的,而是具备永久一致性的,能够支持机器人动作模拟、游戏编程等需要完整空间逻辑的场景应用。

这种从像素生成向世界构建的转变,不仅是AI技术的一次重要突破,更像是为多个领域的发展,搭建了一个全新的技术基建,解决了很多行业长期以来面临的核心难题。

可能有朋友会好奇,这个看似前沿的空间智能模型,现在已经有实际的应用场景了吗?答案是肯定的。李飞飞在对话中透露,Marble虽然还处于第一代的发展阶段,但是目前已经有早期用户在体验这个世界模型了,而且应用场景的丰富程度远超很多人的想象。

首先在娱乐和设计领域,已经有开发者用Marble进行游戏开发。借助它的3D世界构建能力,能够快速的打造出可以互动、可以导航的游戏场景,大幅降低了游戏开发的成本和时间。

还有视觉特效领域的用户,将它用于商业化的虚拟制片环境。这种场景对3D结构和一致性要求极高,而Marble的技术特征恰好契合了这个需求,让虚拟制片的场景搭建变得更加高效。

而在机器人领域,Marble已经成为了一个重要的训练工具。目前World Labs正和英伟达等科技大厂以及众多初创公司、学术实验室展开了互动,这些合作方都将Marble用作机器人的训练环境。我们都知道,机器人训练的核心难题之一,就是真实数据的匮乏,而且真实场景下的训练成本高、风险大。而Marble构建的可互动3D物理环境,能够模拟出各种真实的物理场景,为机器人提供大量的模拟训练数据,大幅提升机器人的训练效率。

除了这些领域以外,建筑师和设计师也开始将Marble用于室内设计。通过输入设计的需求,快速生成可以导航和互动的3D室内空间,不仅能够更直观的展示设计效果,也方便进行设计方案的调整和优化。

更让人惊喜的是,Marble在医疗健康领域也展现出了巨大的应用潜力,尤其是在心理健康的干预方面。李飞飞在对话中提到,临床研究人员对Marble的这个应用方向,表现出了极大的热情。原因在于大量的精神病学和心理健康研究及干预措施,都需要针对特定的情况定制沉浸式的环境。比如强迫症患者,他们的症状往往会被一些非常具体的场景触发。有人会被乱放的脏衣服触发,有人会被杂乱的桌面触发。在以往的研究和干预中,研究人员很难快速、精准的打造出这些个性化的触发场景。而现在通过Marble,研究人员只需要输入提示词,几分钟内就能够生成多种不同的定制化环境,为强迫症、焦虑症等心理疾病的沉浸式干预,提供了全新的可能。

除此之外,Marble还能够打造健康训练中的个性化瑜伽环境,根据用户的身体状况、训练需求,生成适配的3D瑜伽场景,让健康训练变得更加的个性化。李飞飞表示,随着Marble的不断迭代,未来还会看到更多的横向应用案例,空间智能的应用边界也会被不断的拓宽。

聊完了空间智能和Marble模型,这场对话也触及了一个当下AI行业所有人都无法回避的问题,那就是AI发展带来的群体性的焦虑。作为深耕AI领域几十年的先行者,李飞飞对行业的现状有着最直观的感受。她坦言,过去几年AI的发展速度堪称是窒息式的。这种速度不仅让行业外的人感到震撼,就连身处其中的从业者,内心深处都有一种难以掩饰的焦虑感。相信很多AI从业者都有这种体会,每天都有读不完的技术博客、行业新闻,也有发布不完的新模型,仿佛稍微停下脚步,就会被行业甩在身后。

李飞飞说,这种焦虑感既反映了技术进步的惊人速度,让她感到兴奋,同时也让她保持着谦逊的态度,意识到自己所知甚少。即便是深耕AI领域数十年的她,也有着“我唯一知道的就是我一无所知”这样的感受。而她也希望行业内的所有人,都能够保持学习的热情和对世界的好奇心,不要被焦虑所裹挟,停下探索的脚步。

除了群体性焦虑以外,李飞飞还对当下AI领域的舆论现状表达了担忧。她指出,目前关于AI的讨论正陷入一种极端的两极分化。网络上充斥着两种截然不同的声音:一种是完全的技术乌托邦,认为AI技术能够解决人类面临的所有问题,将AI神化;另一种则是极端的生存危机末日论,过度放大AI的风险,仿佛人类每分钟都面临着被AI取代的生存危机。

李飞飞认为,对于AI这样一项会深刻影响人类文明的技术,这种非黑即白的讨论方式是非常不负责任的。技术本身没有好坏,它的发展方向最终掌握在人类自己的手中。无论是AI领域的创业者、产品经理、工程师,还是普通的公民,我们每个人都有能力去引导技术的走向。她也发出呼吁,希望从二零二六年起,整个行业乃至全社会,都能够告别这种极端讨论,对AI技术的发展保持理性、包容、乐观的态度,同时也要肩负起相应的责任,让技术朝着造福人类的方向发展。

那么,在李飞飞眼中,AI发展真正的成功标准是什么呢?这个问题的答案,其实藏在人类科技发展的历史中。李飞飞在对话中举了电力的例子。如果把时间拨回一百五十年前讨论电力的成功,我们不会去纠结电力的技术参数有多先进,而是会想到学校被照亮、家庭变温暖、人类的寿命被延长、更多的孩子能够获得接受教育的机会。这就是技术的真正意义。而AI技术的成功,也应该回归到这样的永恒价值上。不是单纯的参数竞争,不是比谁的模型参数量更大、算力更强,而是看这项技术是不是能够让人类的文明变得更好,是不是能够让每个个体都能够追求幸福、繁荣,并且保有尊严。当文明因为技术而进步,个体因为技术而获得更好的生活,这才是AI发展的终极目标。

这个观点,也为当下陷入参数竞赛的AI行业敲响了一记警钟,让我们重新思考技术发展的初心。

当然,空间智能和世界模型的发展,并不是一帆风顺,它依然面临着诸多技术的挑战。首当其冲的就是算力和数据的问题。

很多人会问,世界模型是不是像当下的大语言模型一样,属于计算密集型的技术呢?李飞飞给出了一个明确的答案:目前世界模型的算力规模,还远远低于顶尖的大语言模型。比如Marble的算力规模比GPT-5小几个数量级。之所以会出现这样的情况,一方面是因为世界模型领域还处于发展的早期阶段,整个行业还在想办法弄清楚世界模型的核心架构。另一方面,Scaling Law在非语言领域的演进,和语言领域也存在着本质区别。Scaling Law的生效,不仅取决于数据量和参数量,还需要适配非语言领域的技术特征,而这正是行业目前正在探索的方向。

但是李飞飞也表示,结合World Labs目前在Marble模型上取得的进展来看,未来几年,世界模型领域将会迎来快速发展。我们会看到世界模型开始跨越Scaling Law曲线,算力规模和技术能力都会实现质的突破。

如果说算力是世界模型发展的硬件基础,那么数据就是发展的核心燃料。而世界模型面临的数据难题,比大语言模型要复杂得多。李飞飞解释道,大语言模型的输入输出相对单一而且干净,核心处理的是文本数据。而世界模型需要处理的是像素和体素的世界,这个世界要混乱的多,物理数据的获取难度也大幅提升。

为了解决这个难题,World Labs采取了混合数据的策略,核心就是融合了多种类型的数据。除了互联网规模的文本、视频数据之外,还纳入了模拟数据和现实世界采集的物理数据。通过多种类型的数据融合,为世界模型的训练提供充足且高质量的燃料。李飞飞在对话中举了自动驾驶的例子,无论是特斯拉还是Waymo,这些自动驾驶领域的头部公司,都花费了几十年的时间同时收集现实世界数据和模拟数据,这也是自动驾驶技术能够实现落地的重要基础。

而对于世界模型来说,虽然数据挑战巨大,但是当下的技术环境已经比几年前成熟了很多。现在的算力、芯片和整个AI生态系统,都为世界模型的发展提供了支撑。而且市场上也出现了很多三年前还不存在的数据供应商,为物理数据的采集和处理提供了专业支持。除此之外,合成数据也在世界模型的训练中发挥了重要作用。

更重要的是,合成数据形成了一个正向的飞轮效应。用世界模型生成的内容,反过来又能够成为机器人训练的模拟数据,不断的丰富数据池,为模型的迭代和机器人的训练,提供源源不断的支持。

在这场对话中,李飞飞还谈到了一个大家非常关心的话题:未来我们迎来的,会是通用机器人还是专用机器人呢?作为一名在斯坦福大学运行了十年机器人学习实验室的学者,李飞飞对这个问题有着深刻的理解。她直言,通用机器人的实现,是一个非常困难的问题,远比自动驾驶的实现难度要高的多。而空间智能正是解决这个难题的核心突破口。

为了让大家更直观的理解这一点,李飞飞回顾了自动驾驶的发展历程。二零零六年,她的同事塞巴斯蒂安·特伦带领团队,创造了第一辆在内华达沙漠运行了一百三十八英里的自动驾驶汽车。当时整个行业都为之振奋,认为自动驾驶汽车很快就能够走进我们的生活。但是事实上,直到二十年后的今天,Waymo才开始在旧金山等大城市的街道上实现了商业化运行。这中间经历了漫长的技术探索和打磨。而自动驾驶汽车,在李飞飞看来,本质上只是一个在二维平面移动的方形机器人,它的核心任务只有一个,那就是规避障碍,技术挑战相对单一。

但是通用机器人则完全不同,它需要在三维空间中工作,核心目标是以精准而且不破坏物体的方式,进行各种物理交互。这就对机器人提出了极高的要求:手部的灵活性、视觉的精确度、对三维空间的理解能力,都是需要攻克的技术难题。而机器人训练数据的匮乏,更是让这个问题雪上加霜。

这也是李飞飞创办World Labs的重要原因之一。她希望通过空间智能的研发,重构机器对物理交互精细度的理解,解决通用机器人研发中的核心难题,让机器真正具备在3D物理世界中,理解、推理和互动的能力。但是作为一名严谨的科学家,李飞飞也表示,不会对通用机器人的落地做过度的承诺。技术的发展需要一步一个脚印,只有攻克了每一个基础的技术难题,才能最终实现通用机器人的落地。

在对话的尾声,李飞飞也针对企业端的决策者,解读了空间智能和物理AI的战略价值。她给出的核心结论是,空间智能是一项典型的横向技术。这意味着,空间智能的价值并不是局限于某一个特定的领域,而是能够像水和电一样,向多个行业进行横向的渗透,发挥出跨领域的技术价值。我们之前提到的机器人、娱乐、设计、医疗健康领域,只是空间智能应用的冰山一角。除了这些领域,它在教育、现场服务、金融、农业、制造、仓库管理及城市规划等领域,都有着巨大的应用潜力。

李飞飞表示,空间智能是AI的下一个前沿,她也邀请各行各业的从业者们,一起探索空间智能的应用潜力,让这项技术真正赋能到各个行业的发展。

而当被问到对企业交流期待什么样的礼品时,李飞飞也展现出了学者的质朴。她说自己还是像研究生一样,喜欢免费的食物和文化衫。这样的回答,也让我们看到了这位AI领域大咖可爱、真实的一面。

李飞飞在思科AI峰会上的这场重磅对话,不仅为我们揭示了AI的下一个前沿,也就是空间智能的核心逻辑,也让我们看到了一位资深的AI学者对行业发展的理性思考。在AI技术飞速发展的今天,我们很容易被技术的发展速度裹挟,陷入参数竞赛的误区,也容易被极端的舆论所影响,对技术未来产生迷茫。而李飞飞的观点,让我们重新回归技术的本质。无论是空间智能,还是语言智能,AI技术的终极目标,都是为了提升人类的文明水平,保障每个个体的尊严。

同时,她也让我们明白,AI的发展从来都不是一蹴而就的。从空间智能的研发,到世界模型的迭代,再到通用机器人的落地,每一步都需要严谨的技术探索和脚踏实地的打磨。

如果你对空间智能、Marble模型有什么看法,欢迎在评论区留言讨论。感谢收看本期视频,我们下期再见。