📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Sora 还没公测就过时了?李飞飞 Marble 的“降维打击”真相!

明月三千里23:59

Transcription

Hello 大家好,欢迎回到明月三千里。我们在11月13号的时候,聊了一期关于AI教母李飞飞的空间智能的视频。

前几天,李飞飞和她的World Labs联合创始人Justin Johnson在一档非常硬核的播客里,揭开了他们第一款产品Marble的神秘面纱。内容可谓是硬核又烧脑,所以今天这期视频,也稍微烧脑一些,大家尽量跟着我的节奏来。

很多人以为World Labs做的就是下一个Sora,觉得这就是个视频生成器。没那么简单。当我们了解一下Marble背后的技术真相后,你会发现,我们之前对AI的理解,可能都太扁平了。当别人还在卷视频的清晰度,卷1080P还是4K的时候,李飞飞团队已经在用一种完全不同的数学逻辑,在手机上造世界了。

那咱们今天,通过三个层面来拆解一下Marble背后的技术真相。

第一,为什么说Sora生成的是死的像素,而Marble生成的是活的世界?

第二,一个极其颠覆的理论,为什么Transformer根本就不是语言模型,它其实是天生的3D引擎?

第三,这一切跟我们在座的各位,跟未来的机器人产业,到底有什么关系?

好,咱们先从最直观的视觉说起。大家先想一想,Sora是怎么工作的?不管是Sora还是国内的可灵,它们生成的本质是什么?是视频。视频是什么?视频就是一连串的图片。图片就是一堆排列好的像素点。Sora的工作原理,说白了就是根据上一帧的像素,去猜下一帧的像素,大概率长什么样。

但,这有个致命的问题。你在看视频的时候,你是被动的。你不能说,“哎,镜头往左转一点,我想看看那棵树后面藏着什么”。你做不到,因为那棵树后面根本就没有东西,AI没画出来。那里是虚无的。

但是,Marble不一样。Justin Johnson在播客里非常明确地说,Marble生成的不,是视频,是一个原生的3D世界。这意味着,当你用Marble生成了一个下雨的北京街道,你不仅仅是看一段视频,你可以拿着你的手机,像玩《我的世界》或者《赛博朋克2077》一样,在这个场景里走动的。你可以走到路灯下面,抬头看灯泡的细节。你可以绕到那辆车的背后,看看车牌号是多少。它是3D的,它是实体的,它是活的。

那,它是怎么做到的呢?这里就涉及到了一个关键知识点,也是目前图形学界最火的一个词,叫3D高斯泼溅(简称3DGS)。我知道这个词听起来很学术,什么高斯,什么泼溅,别被吓跑。咱们用人话讲,这其实非常浪漫。

以前的3D游戏,比如大家玩的《黑神话悟空》,里面的模型是用什么做的?是用三角形拼出来的,叫网格,成千上万个小三角形拼成一个猴子。后来的AI技术,比如前两年很火的神经辐射场(简称NeRF),它是用神经网络算出来的,就像是一个黑盒。你问它这个角度长啥样,它给你算出一个颜色。

但是,Marble用的这个高斯泼溅,它既不是三角形,也不是黑盒。它像是一位印象派的画家,但这位画家不是在画布上画画,而是在空气中雕塑。想象一下,Marble在生成世界的时候,它实际上是在空气中撒下了成千上万个,甚至上百万个小云团。每一个小云团,就是一个泼溅。这些小云团是半透明的,有颜色,有大小,有方向。

比如,要生成一个桌子,Marble就会在桌子腿的位置,撒一堆深棕色的小长条云团,在桌面的位置,撒一堆扁平的云团。当你离得远的时候,这些密密麻麻的半透明云团叠加在一起,骗过了你的眼睛,在你的视网膜上就融合成了一张清晰的,坚硬的桌子。这就是高斯泼溅的魔力。它不再是死板的像素,它是有空间位置的实体。

有些朋友可能会问,这有什么新鲜的?它可比点云高级得多。点云只是一个点,没有体积。但高斯泼溅是一个椭球体,它有拉伸,有旋转,这让它能表现出非常细腻的光影和纹理。

最重要的是,这种表示方式,解决了一个让之前所有AI科学家都头疼欲裂的问题——可编辑性。还记得刚提到的神经辐射场吗?前两年吹得很神,拍几张照片就能重建3D场景,但它有个死穴,它是个黑盒。所有的场景信息都存在神经网络的权重里。这就好比你把这一秒的世界装进了一个水晶球里,你确实能从各个角度看,很逼真。但是,如果你说,“我不喜欢这个红色的车,给我改成蓝色的”,或者“把这把椅子挪走”,对不起,做不到。因为在神经辐射场的神经网络里,根本就没有椅子的概念,只有一堆乱七八糟的数学参数。你动一个参数,可能车变色了,连带着背后的房子也变色了。这就叫灾难性遗忘。

但是,Marble用的高斯泼溅,它是显式的,也就是看得见摸得着的。Justin Johnson在播客里演示了Marble的那个上帝视角的编辑功能。你生成了一个厨房,觉得桌上的水瓶碍眼,你直接跟AI说,“把水瓶拿走”。AI怎么做?它不需要重算整个神经网络,它只需要找到空间坐标里属于水瓶的那一堆高斯小云团,然后把它们删掉,就像你在Photoshop里关掉一个图层一样简单。这把椅子不喜欢,挪个位置,也就是把这堆小云团的坐标改一下。

这种所见即所得的交互能力,是Sora这种视频生成模型绝对做不到的。Sora生成了就是生成了,想改,重新抽卡吧。但Marble给了你一把手术刀,让你能精准地修整这个世界。这才是李飞飞说的空间智能的第一步,你不仅要能看,你还要能动。

说到这,可能懂行的极客朋友会问了,高斯泼溅虽然好,但是那东西渲染起来数据量巨大啊,动不动就几个G,显卡都得烧冒烟,怎么可能像他们宣传的那样,在手机上跑?

这正是我要讲的第二个技术爆点。World Labs在工程上的黑魔法。他们说Marble生成的场景,可以在几年前的iPhone 12或13上,跑满60帧。这就离谱了。要知道,以前渲染这种级别的3D场景,那是RTX 4090的专利。他们是怎么把这种怪兽塞进手机里的?

这里用到了一个叫Spark的渲染器架构。其中最核心的一招,叫图块剔除。这个原理说白了就是,能偷懒就偷懒。你想,一个3D场景里有几百万个高斯小球,但你的手机屏幕就那么大,而且你的视角是有限的。当你看着前面的墙时,你背后的整个世界虽然存在,但不需要渲染,对吧?这大家都懂。

但Spark做得更绝。它把屏幕切成了无数个16x16的小方块,然后在渲染每一帧之前,它先快速算一遍,哪些小球是完全透明的?哪些小球被别的小球挡住了?哪些小球虽然在前面,但它对这个小方块的颜色贡献微乎其微?只要判定这个小球没啥用,直接剔除,根本不进入后续的计算。这就好比一个剧组拍戏,以前是全实景拍摄,不管镜头拍不拍得到,所有群演都得化好妆站在那。现在是,镜头扫到哪里,哪里的群演才开始表演,镜头一移开,群演立马下班。

加上他们还用了专门的指令集来做并行排序,这就让手机CPU和GPU的配合效率达到了极致。所以,这不仅仅是一个算法的胜利,这是工程学的奇迹。意味着李飞飞描绘的这个空间智能,它不是躺在实验室超算里的概念,它是已经准备好装进你的口袋,甚至装进未来的AR眼镜里的杀手级应用。

好,聊完了视觉上的震撼,咱们进入更加烧脑的部分。咱们现在提到AI,提到ChatGPT,大家脑子里的第一反应是什么?是Transformer,对吧?那如果我问你,Transformer是什么?你可能会脱口而出,“哦,它是大语言模型的基础,它是用来处理语言的”。语言是什么?语言是序列,字要一个接一个排才有意义。“我爱你”和“你爱我”,字完全一样,但顺序变了,意思就反了。所以,过去这几年,不管是在学术界还是工业界,大家都有一个默认的共识:Transformer是一个顶级的序列模型。

但是,Justin Johnson在播客里却说,Transformer原生根本就不是序列模型,它在数学本质上,是一个集合模型。什么叫集合模型?咱们来打个比方。上 GAI 的技术,比如循环神经网络,它就像是一个在课堂上点名的老师,它处理信息必须按座位顺序来,先问小明,再问小红,一个接一个,它天生就是线性的,它离不开顺序。

但是,Transformer不一样。Transformer更像是一个在开派对的房间,所有的词都在这个房间里,每个人都能同时看到其他人,都能跟其他人聊天。这个机制就叫注意力机制。在这个派对房间里,大家是平等的,是没有先后之分的。如果不做任何处理,Transformer根本不知道谁排第一,谁排第二。

那ChatGPT为什么能懂顺序呢?那是因为工程师在把词送进房间之前,强行给每个词的脑门上贴了个号牌,贴上1号,2号,3号。这个动作,术语叫位置编码。是这个人为贴上去的号牌,赋予了Transformer处理顺序的能力。它本身,其实是个脸盲,只认号牌不认人。

好,关键的来了。如果我们现在把这个号牌撕掉,还原Transformer的本来面目,它处理什么东西最强?答案是处理那些本就没有顺序的东西。大家看看这个物理世界,看看你现在的房间,你的桌子,椅子,电脑,水杯,它们有顺序吗?谁规定桌子必须排在椅子前面?谁规定水杯必须排在电脑后面?没有。3D世界里的物体,本质上就是一堆无序的集合。刚才我们说的Marble生成的,那几百万个高斯泼溅小云团,就是一个巨大的无序的集合。你没法说这粒灰尘排第一,那粒灰尘排第二。

所以,Justin的结论非常震撼。正因为Transformer本质上是对集合建模,所以它处理3D空间中的点云和粒子,其实比处理人类语言,还要原生,还要顺手。这个视角太刁钻了。它解释了为什么World Labs敢把身家性命,全押在Transformer上。他们不是在用语言模型硬套3D,而是终于帮Transformer找到了它真正的老家。

这就解释了为什么Sora生成视频那么吃力,经常出现逻辑错误。因为视频是时间的序列,Sora还是在用序列的逻辑去硬猜。而Marble是直接在3D的集合空间里,用全局的视角去构建这个世界。

这还没完。更绝的是,World Labs还解决了另一个难题——AI怎么听懂人话。既然Transformer是3D引擎,那我,说一句“把水瓶变成蓝色”,这是人类的语言,那边是3D的小球,这两个风马牛不及的东西,怎么沟通?

这里用到了一个类似交叉注意力的机制。这就好比那个派对房间里,除了有代表3D小球的空间Token,还混进来了一帮代表文字的语义Token。当你在提示词里输入“蓝色水瓶”的时候,这两个词进入了房间。这时候,房间里那些代表水瓶形状的空间Token,突然就在人群中确认了眼神。它们发现自己跟“水瓶”这个词的语义特征高度匹配。紧接着,“蓝色”这个词也发出了信号。于是,那些代表水瓶的空间Token,就接收到了这个信号,主动修改了自己的颜色参数。

整个过程,就像是一场跨物种的对话。语言指挥着几何,几何响应着语言。这就实现了我们看到的,用一句话就能精确修改3D世界的,神奇效果。

讲到这,你们应该能感觉到,李飞飞和Justin Johnson这帮人,他们不仅仅是在做产品,他们是在从数学底层,重构AI对世界的理解方式。他们不再满足于让AI鹦鹉学舌,他们要让AI真正地理解,什么是空间,什么是物体,什么是关系。

大家有没有想过,李飞飞为什么要花这么大力气,去造一个能生成3D世界模型?难道她就是为了让你我在家里装修厨房方便点,或者为了让游戏公司开发《黑神话》的时候,少雇几个美工?如果只看到这一层,那,就太小看这位AI教母了。

Justin Johnson在播客里有一句话,说得特别轻描淡写,但分量极重。他说,“Marble现在看起来像个创意工具,但它的终极目标,是解决机器人的数据饥荒”。什么叫数据饥荒?你想,ChatGPT为什么这么聪明?因为它把互联网上几乎所有的书,文章,代码,都读了一遍,它有海量的文字数据。但是机器人呢?你要训练一个保姆机器人,让它学会怎么把牛奶倒进杯子里,而不洒出来,怎么把脏衣服扔进洗衣机,你去哪找数据?互联网上没有拧开瓶盖的手感数据,没有衣服这一秒在手里,下一秒掉在地上的物理反馈数据。

以前的办法是,让机器人真去练,买一万个杯子,让机械臂在那天天摔。但这太慢了,而且太贵了。机器人摔坏了怎么办?房子拆了怎么办?所以,李飞飞的World Labs真正的野心,是给机器人造一个“黑客帝国”。Marble就是这个母体,它能生成无穷无尽的,符合物理规律的平行宇宙。在这个平行宇宙里,你可以生成一万个不同形状的厨房,一万种不同光照的客厅。你可以让机器人在里面疯狂地试错,摔碎一百万个虚拟的杯子,把虚拟的房子烧掉一千次,而在现实世界里,甚至连一分钱都不用花。这就叫从仿真到现实。

一旦机器人在Marble的世界里练成了神功,把那个神经网络的大脑下载到现实世界的躯壳里,它立马就是一个熟练工。

这听起来是不是很完美?但是,这里面藏着一个极其致命的隐患,也是World Labs未来成败的关键。这个隐患叫“物理幻觉”。咱们前面说了,Marble是靠隐式学习来理解物理的。它之所以知道杯子松手会掉下去,是因为它在视频里看过无数次杯子掉落,它统计出了这个规律。它脑子里并没有牛顿定律公式,也没有万有引力常数。这就带来了一个巨大的风险:看着像真的,不等于物理上是真的。

举个最简单的例子,摩擦力。Marble生成了一个大理石桌面,和一个铺了桌布的桌面。在视觉上,你分得清清楚楚。但是,对于Marble这个AI来说,它真的知道在这两个桌面上推杯子,手感有什么不同吗?它可能会猜错,它可能会产生幻觉,觉得大理石比桌布摩擦力还大。如果机器人是在这样一个物理参数错乱的虚拟世界里训练出来的,那等它到了现实世界,它去推杯子,杯子可能直接就飞出去了,或者根本推不动。这就叫仿真现实差距。这就,像你是在月球重力环境下练的跳高,回到地球上肯定不及格。

那怎么办?李飞飞透露了一个他们非常前瞻性的技术路线,叫“物理蒸馏”。这个概念非常性感。既然AI只有创造力,可以生成各种厨房,而传统的物理引擎只有严谨性,那为什么不把它们结合起来呢?

未来的World Labs可能会搞一个“双师制”。让传统的物理引擎当老师,生成极其精准的物理数据。让Marble当学生,去模仿老师的物理反馈。通过这种训练,强行把牛顿定律蒸馏进AI的神经网络里。最终,我们得到的是一个神经物理引擎。它既有AI的无限想象力,瞬间能生成一万个新场景,又有物理引擎的严谨性,杯子该怎么掉就怎么掉,摩擦力一点都不差。

这才是空间智能的终极形态。如果这一天真的来了,那将是一个极其恐怖的时刻。想象一下,未来的机器人,它在动手做任何事情之前,比如给你倒一杯热咖啡,它会在自己的电子大脑里,瞬间模拟未来一分钟的几千种可能性。它会模拟,如果我手抖一下,咖啡会溅到哪里?如果杯子太滑,会不会掉下去?它在那个虚拟的Marble世界里,已经把这杯咖啡倒了一万次,确认无误了,才会在现实世界里,给你倒下那一次。

这就不仅仅是智能了,这叫心智模拟。这是人类才有的高级能力。我们在过马路前,脑子里都会预演一下,车会不会撞过来。而李飞飞正在把这种能力,赋予给硅基生命。

总结一下。从OpenAI的“预测下一个Token”,到World Labs的“预测下一帧世界”,我们正站在AI进化的又一个分水岭上。以前的AI是活在书本里的书呆子,它博闻强记,但四体不勤。未来的AI将是活在物理世界里的实干家,它不仅能看,能动,还能在脑海里构建一个完整的,逻辑严密的平行宇宙。

对于我们普通人来说,这意味着什么?如果你是游戏玩家,未来的游戏可能不需要几百个G的下载了,AI实时生成,你走到哪,世界就延伸到哪,这叫无限生成的开放世界。如果你是设计师,你将拥有上帝视角的编辑器,一句话就能重构整个空间。

而对于那些正在做机器人的公司来说,Marble这样的技术,可能就是你们一直在等的圣杯。Sora还没公测,也许真的就已经过时了。因为我们不再满足于看着屏幕里的画面动起来,我们要的是走进那个世界,去触摸,去改变,去创造。

好了,今天的话题先聊到这里。记得点赞,关注,热推,咱们下期再见。