📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

After LLMs: Spatial Intelligence and World Models — Fei-Fei Li & Justin Johnson, World Labs

Latent Space1:00:39

Transcription

我认为深度学习的整个历史在某种意义上就是计算能力不断扩展的历史。>> 我毕业研究生院的时候,我真的以为我整个职业生涯剩下的时间都将致力于解决那个唯一的问题,那就是作为一个领域、作为一个学科的很多人工智能都受到人类智能的启发。我们[音乐]以为我们是第一个这样做的人。结果发现他们也在同时做这件事。>> 所以,大理石,基本上,一种看待它的方式是,它是系统。它是一个三维世界的生成模型,对吧?所以你可以输入[音乐]诸如文本、图像或多张图像之类的内容,它会为你生成一个与这些输入相匹配的三维世界。[音乐]因此,虽然大理石同时是一个世界模型,它正在朝着空间智能的愿景迈进,但它也被非常刻意地[音乐]设计成人们今天就能找到有用的东西。嗯,我们开始看到新兴的用例[音乐]嗯,在游戏、视觉特效、嗯,在电影中,我认为大理石[音乐]今天作为一个产品可以做很多真正有趣的事情,并且也为我们想要在未来构建的宏伟世界模型奠定了基础。[音乐]大家好,欢迎来到 Len Space 播客。我是 Allesio,Kernel Labs 的创始人,和我一起的是 Swix,《Blade in Space》的编辑。>> 我们非常激动能和 Fifi 和 Justin 在录音棚里,他们是 World Labs 的。欢迎。>> 我们也很激动。>> 我差点说成 Marble。 [笑声] >> 是的,谢谢你们的邀请。我认为大家对世界模型很感兴趣,你们也围绕空间智能和所有这些做了一些宣传。嗯,我想也许故事中一个对你们来说是难得的讲述机会的部分是你们俩是如何走到一起开始构建 World Apps 的。这很容易,因为 Justin [笑声] 是我的前学生。是的。所以 Justin 来到我的,你知道,我的[清嗓子]我扮演的另一个角色是斯坦福大学的计算机科学教授。Justin 加入我的实验室是什么时候?>> 嗯,2012 年,实际上我加入你实验室的那个学期,和你加入你实验室的那个季度是同一个季度,AlexNet 问世了。>> 是的。是的。所以 Justin 是我的第一个 >> 你是否参与了整个公告的戏剧性事件,我猜?不,不,一点也没有。但我当时正在关注 AlexNet 那个季度围绕 ImageNet 的所有兴奋。他是我最好的学生之一,然后他继续在密歇根大学安娜堡分校的 Meta 担任教授,早期职业生涯非常成功,然后当我们嗯,我想大概两年多以前,我们俩都独立地关注了大型模型的发展,并思考语言模型之外还有什么,以及构建世界模型、空间智能的这个想法对我们来说确实是自然的。所以我们开始交谈,并决定我们应该把所有的鸡蛋放在一个篮子里,专注于解决这个问题,然后一起创办了 World Labs。>> 是的,差不多。我的意思是,在我攻读博士学位期间看到那种 ImageNet 时代之后,我有一种感觉,未来十年的计算机视觉将是让人工智能走出数据中心,走向世界。>> 所以我博士毕业后的大部分兴趣都转向了三维视觉,稍微偏向计算机图形学,更多地转向生成模型。>> 嗯,我以为我博士毕业后有点偏离了我的导师,但后来我们几年后重聚,发现她也在想类似的事情。所以,如果你想到 AlexNet,它的核心部分显然是 ImageNet,是转向 GPU 和神经网络。你如何看待世界模型的 AlexNet 等效模型?从某种意义上说,这是一个已经存在的想法,对吧?有,你知道,Young Lagoon 可能是最主要的倡导者。在过去的两年里,你看到了什么让你觉得“嘿,现在是时候这样做了”。以及你可能想要构建的根本性的东西,就数据和可能不同类型的算法或计算方法而言,以使世界模型真正实现?>> 是的,我认为其中一点是,总体而言,有更多的数据和计算能力可用。>> 我认为深度学习的整个历史在某种意义上就是计算能力不断扩展的历史。>> 嗯,如果你想到,你知道,AlexNet 需要从 CPU 跳到 GPU,但即使从 AlexNet 到今天,每张卡的性能也比 AlexNet 时代提高了大约一千倍。>> 嗯,现在不仅在一块 GPU 上训练模型很常见,而是在数百、数千甚至数万块 GPU 上训练模型。>> 所以我们今天可以在单个模型上调动的计算量,比我读博士学位初期还要多一百万倍。>> 所以我认为语言是过去几年开始运作得相当好的一个非常非常有趣的事情。但当我们考虑转向视觉数据、空间数据和世界数据时,你需要处理更多的数据。>> 我认为这将是吸收这些不断涌现的新计算能力的好方法。>> 公开挑战的模型仍然有效,还是应该集中在实验室内部?>> 我认为开放科学仍然很重要。你知道,人工智能显然与 ImageNet AlexNet 时代相比已经真正发展了,[笑声] 那是一个非常小众的计算机科学学科,现在它已经成为一种文明技术。但给你举个例子,最近我的斯坦福实验室刚刚宣布了一个名为“行为”的开放数据集和基准测试,用于在模拟环境中对机器人学习进行基准测试,这是在仍然坚持这种开放科学模式方面的一个非常明确的努力,尤其是在学术界。但我认为认识到生态系统是一个混合体很重要。我认为,嗯,嗯,很多行业中非常专注的工作,其中一些以一种比开放挑战本身更直接的方式看到了曙光。>> 是的。这仅仅是关于资金和商业模式的问题,你必须从中看到一些投资回报。我认为这仅仅是生态系统多样性的问题,即使在所谓的 Alex ImageNet 时代,我的意思是,有封闭的模型,有专有模型,有开放模型,你知道,嗯,你知道,如果或者你想到 iOS 与 Android 的区别,有不同的商业模式。我不会说这仅仅是资金问题,这只是市场如何运作,有不同的玩法。>> 是的,但你觉得你今天能重做 ImageNet 吗,考虑到这些实验室的一些商业压力?对我来说,这是最大的问题,对吧?就是你能公开什么,什么应该留在内部?你知道,如果我站在你的角度,你筹集了很多钱,你正在构建所有这些。如果你拥有最好的数据集,你有什么真正的动力去发布它?感觉实验室里的人越来越早地被拉进这些实验室,博士项目也越来越早地被拉进这些实验室。所以我想知道你是否认为现在存在一个问题,就是有多少钱被投入,它给学术界开放研究领域带来了多大的压力,或者你是否觉得那真的不是一个担忧。>> 我确实有担忧,但与其说是压力,不如说是学术界的资源和资源不平衡。这与 World Labs 有点不同。你知道,过去几年我一直在倡导资源支持健康的生态系统。你知道,作为斯坦福人类中心人工智能研究所(Stanford HAI)的创始主任、联合主任,我一直在与政策制定者合作,为公共部门和学术界的人工智能工作提供资源。我们与第一届特朗普政府合作,制定了一项名为“国家人工智能研究资源”(NAR)的法案,该法案正在规划一个国家人工智能计算云以及数据存储库。我还认为,开源数据集仍然是生态系统的重要组成部分。就像我说的,现在在我的斯坦福实验室,我们正在进行关于机器人学习的开放数据集、开放基准测试,名为“行为”,我的许多同事仍在这样做。我认为这是生态系统的一部分。我认为行业正在做的事情,一些初创公司正在快速地开发模型、创造产品,这也是一件好事。例如,当 Justin 还是我的博士生时,没有一个计算机视觉项目做得很好,对吧?我们可以写出很棒的论文。Justin 有 >> 我的意思是,甚至在读研究生之前,我就想做计算机视觉,我联系了谷歌的一个团队,想在本科毕业后尝试做计算机视觉,他们告诉我,你在说什么?你不能这样做,先去读博士,然后再回来。>> 是什么让你产生了这样的想法?哦,我在本科期间做过一些计算机视觉研究,实际上是和 Fay 的博士导师一起做的。>> 这里有[笑声]一个传承。>> 这里有传承。所以,我甚至在本科时就做过一些计算机视觉研究,我觉得它非常酷,我想继续做下去。>> 嗯,然后我面临着本科毕业时的行业和学术界选择,我认为现在研究界很多人都面临着这个问题。>> 嗯,但回到你的问题,我认为,尤其是在人工智能领域,学术界的作用在过去十年中发生了很大的变化。>> 这不是一件坏事。>> 这是因为技术已经成长和发展了,对吧?就像 5 到 10 年前,你真的可以在实验室里训练最先进的模型,即使只有几块 GPU,但因为这项技术如此成功并扩展了这么多,所以你不能再用几块 GPU 来训练最先进的模型了。这不是坏事。这是一件好事。这意味着技术确实有效。>> 但这意味着我们作为学者应该做什么的期望会发生一点变化。它不应该是关于尝试训练最大的模型和扩展最大的东西。它应该是关于尝试古怪的想法、新想法和疯狂的想法。>> 其中大部分都不会成功。我认为有很多事情可以做。如果有什么的话,我担心学术界太多人过度关注试图假装我们可以训练最大的模型,或者将其视为一种职业培训项目,然后毕业去一个大实验室,然后就能玩弄所有的 GPU。我认为在新的算法、新的架构、新的系统方面有很多疯狂的事情可以做,你知道,一个人可以做很多事情。>> 而且,学术界在理解这些大型模型的理论基础方面也发挥着作用。我们对此仍然知之甚少,或者扩展到跨学科领域,你知道,Justin 称之为古怪的想法。有很多基础科学的想法。有很多蓝天问题。所以,我同意。我不认为问题是开放与封闭,产品化与开源。我认为目前的问题是,学术界本身严重资源不足。所以,研究人员和学生没有足够的资源来尝试这些想法。>> 是的。只是为了让人们能够深入探讨,当你说到古怪的想法时,你脑海中会浮现出什么古怪的想法?哦,就像我有一个想法,我一直向我在密歇根大学的学生推销,那就是我真的很喜欢硬件,我真的很喜欢新类型的硬件上线。>> 嗯,在某种意义上,我们今天使用的神经网络和 Transformer 的出现实际上是基于矩阵乘法,因为矩阵乘法非常适合 GPU。但如果我们考虑 GPU 将如何扩展,硬件未来可能如何扩展,我认为我们现有的系统,比如 GPU 这样的硬件设计,不会无限扩展,我们甚至现在就开始看到,计算单元不再是单个设备,而是整个设备集群。>> 所以,如果你想象 >> 节点 >> 是的,是整个节点或整个集群,但我们谈论神经网络的方式仍然好像它们是一个整体,可以在 PyTorch 中像在一个 GPU 上一样进行编码,但然后实际上它们可以分布在数千个设备上。>> 所以,就像 Transformer 是基于矩阵乘法一样,矩阵乘法是 GPU 上效果很好的基本单元,你想象硬件如何扩展,是否存在其他基本单元,更适合我们构建神经网络的大规模分布式系统?>> 我认为可能存在截然不同的架构,它们适合下一代或未来 10 到 20 年的硬件,我们可以从今天开始想象。很难做出这样的赌注,因为还有“硬件彩票”的概念,比如说,你知道,英伟达已经占据了主导地位,我们应该无限地扩展它,并编写软件来弥补我们在这方面存在的任何差距,对吧?我的意思是,是的,是的,也不是。就像,如果你看看数字,即使从 Hopper 到 Blackwell,每瓦性能也差不多。是的。>> 他们主要增加了晶体管的数量,增加了芯片尺寸,增加了功耗。>> 但即使从 Hopper 到 Blackwell,我们也已经看到了性能每瓦的扩展极限。>> 所以,我认为我认为有空间可以做一些新的事情,我不知道具体是什么,我认为你不能在三个月内作为一个初创公司完成。但我想这是那种如果你坐下来花几年时间去思考的想法,也许你可以取得一些突破,我认为这是非常适合学术界的长期工作。回到一点背景和历史,我们有一个关于你做的场景叙事工作或你和 Andre 一起做的较新的图像字幕工作的研究笔记,我只是想听你们讲讲那个故事,你知道,你当时正在为你的博士学位做这件事,而 Fe 你当时有那样的反应。>> 是的。所以,我认为那条工作线始于我和 Andre 之间,然后 Justin 加入了。>> 嗯,Andre 开始了他的博士学位。他和我在研究 ImageNet 对象识别之外还有什么。当时,你知道,卷积神经网络在 ImageNet 任务中已经证明了一些力量。>> 所以,卷积神经网络是表示图像的好方法。>> 同时,我认为在语言领域,一个早期的序列模型叫做 LSTM 也在被试验。>> 所以 Andre 和我一直在谈论,这是我长久以来的梦想。我认为需要一百年才能解决,那就是讲述图像的故事。>> 我毕业研究生院的时候,我真的以为我整个职业生涯剩下的时间都将致力于解决那个唯一的问题,那就是给定一张图片或一个场景,用自然语言讲述故事。>> 但事情发展得太快了。>> 当 Andre 和我,当 Andre 开始的时候,我们觉得也许结合卷积神经网络的表示以及 LSTM 的语言序列模型,我们可能可以通过训练来匹配图像和字幕。>> 所以,这就是我们开始那条工作线的时候,我不知道是 2014 年还是 2015 年。是 CVPR 2015 年的字幕论文。>> 所以,这是我们的第一篇论文,Andre 让它成功了,那就是,给定一张图像,图像由卷积神经网络表示,语言模型是 LSTM 模型,然后我们将其结合起来,它能够生成一句话。>> 那是第一次,我记得我写在我的书里,我们以为我们是第一个这样做的人。结果发现谷歌当时也在同时这样做,一位记者,是《纽约时报》的 John Marov,正在报道谷歌的故事,但他偶然听说了我们,然后他意识到我们真的独立地在同一时间一起完成了。>> 所以他写了关于谷歌研究以及 Andre 和我的研究的故事。但之后,我想 Justin 当时已经在实验室了。>> 是的。是的。我记得小组阅读小组会议,Andre 在展示一些结果,并解释了这个我从未听说过的新东西,叫做 LSTM 和 RNN,我想哇,这真是太棒了,我想做这个。>> 所以,他在 2015 年 CVPR 上发表了第一篇图像字幕结果的论文。>> 然后之后我们开始一起工作,我们首先做了一篇关于语言建模的论文,大概在 2015 年,我记得是 2015 年。>> 是的。是的。我应该坚持语言建模,回想起来,那相当有利可图。[笑声]>> 但我们一起写了这篇语言建模论文,我和 Andre,在 2015 年,它真的很酷。我们训练了这些小的 RNN 语言模型,它们可以一次吐出几句话,然后我们戳它们,试图理解神经网络内部的神经元在做什么。>> 你们对不同的内存和 >> 是的。是的。它真的很酷。即使在那时,我们也有这样的结果,你可以看看 LSTM 里面,说“哦,这个东西在读取代码”。>> 所以,我们训练的一个数据集是 Linux 源代码,因为整个事情都是开源的,你可以下载它。>> 所以我们训练了一个 RNN 在这个数据集上,然后当网络试图预测 token 时,然后你知道,尝试将它的预测类型与 RNN 的内部结构相关联。>> 在那里,我们能够找到一些关联,哦,比如 LSTM 中这个层的这个单元在打开 PN 时会激活,然后在关闭 PN 时会关闭。>> 然后尝试做一些实证的东西,比如弄清楚。>> 所以那很酷,那只是切断了 CNN 的语言建模部分,只是孤立地看待语言模型。>> 但然后我们想扩展图像字幕工作。>> 是的。我记得当时我们甚至有空间感,因为我们觉得字幕不能捕捉图像的不同部分。>> 是的。所以我和 Justin 和 Andrea 谈论,你能做到我们最终称之为密集字幕,也就是更详细地描述场景,尤其是场景的不同部分。>> 是的。然后我们构建了这个系统,然后是我和 Andre 和 Fe 在第二年的 CVPR 2016 年的一篇论文上,我们构建了这个系统,它做了密集字幕。>> 所以你输入一张图片,然后它会在图像中所有有趣的东西周围画框,然后为每个东西写一个简短的片段。>> 比如,哦,桌子上有一个绿色的水瓶。>> 这是一个穿黑衬衫的人。>> 这是一个非常复杂的神经网络,因为它建立在当时物体检测方面取得的许多进展之上,而物体检测在计算机视觉领域长期以来一直是一个主要课题。>> 然后它实际上是一个联合神经网络,它既学习查看单个图像,因为这个网络实际上有三种不同的表示。>> 一种是整个图像的表示,以了解发生了什么。>> 然后它会提出它想关注的单个区域,然后查看,你知道,独立地表示每个区域。>> 然后一旦你看了区域,然后你需要为每个区域输出文本。>> 所以那是一个相当复杂的神经网络架构。>> 这都是在 PyTorch 之前。>> 对吧?>> 它是一次性完成的吗?>> 是的。是的。所以,它是一次前向传播就完成了所有这些。>> 不仅是一次性完成的,你还优化了推理。>> 你是在网络摄像头上做的。我记得。>> 是的。所以,我做了一个疯狂的实时演示,我让网络在斯坦福的一个服务器上运行,然后一个前端流式传输网络摄像头,然后将图像发送回服务器。>> 服务器会运行模型,并将预测流式传输回来。>> 所以,我只是带着这个笔记本电脑在实验室里走来走去,向人们展示这个实时字幕演示,模型在加州的一个服务器上运行。>> 所以,它实际上能够从加州一直流式传输到圣地亚哥。>> 延迟怎么样?[笑声]太糟糕了。>> 大约是 1 帧/秒,但它能工作本身就非常了不起。>> 我想简要地评论一下,也许视觉和语言建模并没有那么不同。你知道,DeSQL CR 最近尝试了一件疯狂的事情,让我们从像素中对文本进行语言建模,然后进行训练,这可能是未来。我不知道。我不知道你们对语言是否真的必要有什么看法。>> 我刚写了一篇关于空间智能的宣言。[笑声]>> 这是我进入这个话题的引子。是的。>> 我认为它们是不同的。>> 嗯,我认为这些生成模型的架构将共享许多可共享的组件,但我认为三维四维空间世界的深度结构与纯粹的生成信号(这是一维的)在根本上是不同的。>> 是的,我认为“像素最大主义”有一些值得一提的地方,对吧?有一种说法是语言是不同的东西,但我们用眼睛看到语言,而我们的眼睛就像,你知道,我们眼睛后面有生物像素在处理这些东西。>> 你知道,我们看到文本,我们认为它是一个离散的东西,但它只存在于我们的脑海中。>> 文本和语言在我们世界中的物理表现是,你知道,印刷在世界上的物理对象,我们用眼睛看到它们。>> 你也可以认为它是声音,但即使是声音,你也可以将其翻译成声音。>> 是的。你可以将其转换为信号。>> 对吧?>> 然后,如果你将其转换为我们在 LLM 中使用的纯粹的 token 化表示,你就会失去一些东西,对吧?>> 你会失去字体,你会失去换行符,你会失去页面上的二维排列。>> 嗯,对于很多情况,对于很多事情,也许这并不重要。>> 但对某些事情很重要。>> 嗯,我认为像素是一种更无损的表示,它更接近于我们人类在世界中导航时所看到的东西。>> 所以,所以有一种效率论证,也许将文本渲染成图像,然后将其输入视觉模型,效率不高。>> 这正是 Deep Seek 所做的,对吧?它有点奏效了。[笑声]我认为这与整个世界模型有关。今年我看到我最喜欢的论文之一是关于为世界模型提供归纳偏差的。>> 那是哈佛大学的一篇论文,他们将大量的轨道模式输入到 LLM 中,然后要求 LLM 预测行星绕太阳运行的轨道,模型生成的看起来不错,但如果你要求它画出受力矢量,>> 它就会变得很奇怪,你知道,它不会真正遵循。>> 所以,你如何看待你获得的数据中嵌入了什么?我们可以谈论三维世界模型的 token 化,信息维度是什么?有视觉的,但有多少是底层的隐藏力,可以说,你需要从这些数据中提取出来,以及那里存在哪些挑战?>> 是的,我认为有不同的方法可以解决这个问题。>> 一种是,你可以明确说明,说,“哦,我想,你知道,测量所有力并将它们作为训练数据输入到你的模型中,对吧?>> 然后你可以运行一个传统的物理模拟,你知道,然后知道场景中的所有力,然后将它们作为训练数据来训练一个模型,希望它能够预测它们。>> 或者你可以寄希望于一些东西更隐蔽地出现,对吧?你端到端地训练一些东西,然后在更一般的问题上训练,然后希望在模型的内部某个地方,某个东西必须学会模拟物理学才能做出正确的预测。>> 这就是我们更普遍拥有的两种主要范式。>> 但没有迹象表明这些潜在的建模会让你获得空间和动力学的因果定律,对吧?>> 这就是今天的深度学习和人类智能开始分叉的地方,因为从根本上说,深度学习仍然是拟合模式。>> 在那里,你变得有点哲学化,你说我们也在尝试拟合模式,但也许我们尝试拟合,你知道,更广泛的模式,你知道,在更长的时间范围内,不同的奖励函数。>> 但但就像你提到的那篇论文一样,它基本上是,你知道,它学会了拟合轨道的特定模式,但然后它并没有像你希望的那样泛化。>> 它没有引力的因果模型,对吧?>> 因为即使在大理石中,你知道,我尝试过它,它生成了美丽的风景,里面有拱门。>> 但模型真的理解拱门是如何,你知道,吸引中心的那种石头,你知道,它的实际物理结构吗?>> 另一个问题是,它真的理解它很重要吗,只要它总是渲染出符合我们想象的物理模型的东西?>> 如果你用你理解的方式来理解“理解”这个词,我敢肯定模型不理解。[笑声]>> 模型是从数据中学习的,从模式中学习的。>> 是的。>> 它重要吗?>> 特别是对于用例而言。>> 这是一个好问题,对吧?>> 比如,现在,我认为这并不重要,因为它渲染出了你需要的东西,假设它是完美的。>> 是的。我的意思是,这取决于用例。>> 就像,如果用例是我想要为虚拟电影制作或制作生成一个背景,或者类似的东西,那么你只需要一些看起来合理的东西,在这种情况下,可能并不重要。>> 但如果你要用它来,你知道,如果你是一名建筑师,你要用它来设计一栋建筑,然后你要在现实世界中建造它,那么是的,你必须正确地模拟力,因为你不想在实际建造它之后它就坏掉了。>> 但即使在那里,对吧?>> 比如,即使你的模型包含了语义,假设我仍然认为对信号的理解,或者模型输出的理解,以及人类的理解是不同的词,但这又变得哲学化了。>> 是的,我的意思是,这里有一个关于理解的技巧,对吧?>> 就像这些模型是一种非常不同于人类智能的智能。>> 嗯,人类智能很有趣,因为你,你知道,我认为我理解事物是因为我可以在一定程度上反省我自己的思维过程。>> 然后我相信我的思维过程可能与其他人的相似,所以当我观察到别人的行为时,我就会推断他们的内部心理状态可能与我观察到的我自己的内部心理状态相似。>> 因此,我知道我理解事物。>> 所以,我假设你也理解某些东西。>> 但这些模型有点像,你知道,这种外星智能,它们可以做非常有趣的事情。>> 它们可以表现出非常有趣的行为。>> 但无论它们拥有什么样的内部认知或内部自我反省,如果它们存在的话,都与我们所做的完全不同。>> 所以,它没有自我意识。>> 对吧?>> 但这意味着,当我们观察到这些系统看似有趣或智能的行为时,我们不能必然推断出关于它们的其他事情,因为它们对世界的模型以及它们的思考方式与我们截然不同。>> 所以,你需要两个不同的模型来做视觉模型和建筑生成模型吗?你认为最终,你对模型构建所采取的方法没有根本性的东西吗?>> 它是关于扩展模型和它的能力,还是关于非常视觉化的东西阻碍了你学习其背后的物理学,以便你可以信任它来生成一个可以工作的猫设计?>> 我认为这是关于扩展数据和改进模型的问题。>> 我不认为有什么根本性的东西将这两者分开。>> 是的,我希望它是一个模型,但我认为,在某种意义上,深度学习中的大问题是如何获得超越训练数据的涌现能力?>> 你会得到一个理解力的东西,即使它没有被训练来预测力,但它会在内部隐式地学习它们吗?>> 嗯,我认为我们在其他大型模型中看到的很多东西是,很多这种涌现行为确实发生在规模上。>> 它会转移到其他模态、其他用例和其他任务吗?>> 我希望如此,但这将是一个需要随着时间推移而展开的过程,并进行观察。>> 有没有一种诱惑去依赖现有的物理引擎,你知道,基本上游戏行业为你节省了大量工作,还是我们必须为了某种根本性的不匹配而重新发明东西?>> 我认为这有点像攀登技术阶梯,对吧?>> 就像,在某种意义上,你想要构建这些东西的根本原因是因为传统的物理引擎在某些情况下可能不起作用。>> 如果物理引擎是完美的,我们就没有必要构建模型,因为问题早就解决了。>> 所以,在某种意义上,我们想要做这些的原因是经典物理引擎无法在我们想要的通用性上解决问题。>> 但这并不意味着我们需要抛弃它们,从头开始一切,对吧?>> 我们可以使用传统的物理引擎来生成数据,然后用这些数据来训练我们的模型。>> 然后你就像是将物理引擎提炼到你正在训练的神经网络的权重中。>> 我认为,如果你比较其他实验室的工作,很多人都在推测,你知道,Sora 可能有一点这个。>> Genie3 可能有一点这个。>> 而且 Genie 明确地说,它就像一个电子游戏,你有控制来四处走动。>> 我总是觉得,我们为娱乐而发明的东西最终会进入严肃的工作,这真的很有趣。>> 是的。>> 整个 AI 革命始于图形芯片。>> 是的。部分是[笑声]>> 滥用 GPU 来生成大量三角形,然后生成几乎所有其他东西。>> 是的。>> 我们稍微谈到了 Marble。我认为你们选择 Marble 作为你们的“出柜时刻”,如果可以这么称呼的话。>> 是的。>> 嗯,也许我们可以从你们那里得到一个简洁的解释,人们应该从中得到什么,因为这里的每个人都可以尝试 Marble,但我认为他们可能无法将其与你们的愿景与其他实验室生成的生成世界区分开来。>> 所以,Marble 是我们模型的一瞥。我们是一家空间智能模型公司。>> 我们相信空间智能是下一个前沿。>> 为了构建具有空间智能的模型,模型必须非常强大,能够以多模态的方式理解、推理、生成世界,并允许我们最终希望达到的交互水平,就像人类与世界互动一样复杂。>> 所以,这是空间智能的宏伟愿景,也是我们所看到的世界模型的类型。>> Marble 是其中的第一个 glimpse。>> 这是旅程的第一部分。>> 它是世界上第一个在公众手中生成如此高保真度三维世界的同类模型。>> 这是起点,对吧?>> 我们实际上写了一篇技术博客。>> Justin 花了很多时间写那篇技术博客。>> 我不知道你有没有时间浏览它。>> 我的意思是,Justin 详细介绍了 Marble 的多模态输入是什么,它的可编辑性是什么,它允许用户与模型进行交互,以及我们可以获得的输出类型。>> 是的。>> 嗯,所以,所以 Marble,基本上,一种看待它的方式是,它是系统,它是一个三维世界的生成模型,对吧?>> 所以你可以输入诸如文本、图像或多张图像之类的内容,它会为你生成一个与这些输入相匹配的三维世界。>> 而且它也是交互式的,因为,>> 你可以交互地编辑场景,比如我可以生成这个场景,然后说我不喜欢那个水瓶,把它变成蓝色的,比如去掉桌子,比如重新排列这些麦克风,然后你可以根据这些交互式编辑生成新的世界,并以各种格式导出。>> 使用 Marble,我们实际上试图同时做两件事,我认为我们很好地平衡了它们。>> 一是实际构建一个模型,它朝着空间智能的宏伟愿景迈进,模型需要能够理解各种不同的输入,需要在许多情况下能够对世界进行建模,需要能够对它们如何随时间变化进行反事实建模。>> 所以我们想开始构建具有这些能力的模型,而 Marble 今天已经有了所有这些的迹象。>> 但同时,我们是一家公司。>> 我们是一家企业。>> 我们真的不想让它成为一个科学项目,而是想构建一个对当今现实世界中的人们有用的产品。>> 所以,虽然 Marble 同时是一个朝着空间智能愿景迈进的世界模型,但它也被非常刻意地设计成人们今天就能找到有用的东西。>> 嗯,我们开始看到新兴的用例。>> 嗯,在游戏、视觉特效、嗯,在电影中,我认为 Marble 今天作为一个产品可以做很多真正有趣的事情,并且也为我们想要在未来构建的宏伟世界模型奠定了基础。>> 是的。>> 我注意到一个非常有意思的工具,就是你可以在里面录制你的场景。>> 是的。>> 是的。>> 能够录制非常重要,意味着对摄像机位置有非常精确的控制。>> 为了获得精确的摄像机位置,意味着你必须对三维空间有一定的感知。>> 否则,你就不知道如何定位你的摄像机,对吧?>> 以及如何移动你的摄像机。>> 所以,这是这种模型的自然结果,这就是为什么这是其中的一个例子。>> 是的。>> 我发现当我玩视频生成模型时,我不得不学习成为一名导演的语言,因为我必须移动它们,比如平移,你知道,比如你不能说向北平移 63 度,对吧?>> 你没有那种控制。>> 而在 Marble 中,你在放置摄像机方面有精确的控制。>> 是的。我认为人们需要理解的第一件事是,你不是逐帧生成,就像许多其他模型那样。>> 是的。>> 你知道,LLM 生成一个 token。>> 那么原子单位是什么呢?>> 有点像,你知道,网格,有样条,体素,三维世界有很多组成部分。>> 人们对你的生成应该有什么样的心理模型?>> 是的,我认为有今天存在的东西和未来可能存在的东西。>> 嗯,所以今天存在的是,模型原生输出样条。>> 嗯,所以高斯样条是这些,你知道,每一个都是一个微小的粒子,半透明,在三维空间中有位置和方向。>> 嗯,场景是由大量这些高斯样条构建起来的。>> 嗯,高斯样条非常酷,因为你可以非常高效地实时渲染它们。>> 所以你可以在你的 iPhone 上渲染,渲染一切。>> 嗯,这就是我们获得那种精确的摄像机控制的原因,因为样条可以在我们想要的几乎任何客户端设备上实时渲染。>> 所以,对于我们今天生成的许多场景,那种原子单位是那个单独的样条,但我认为那不是根本性的。>> 我可以想象未来有其他方法会很有趣。>> 所以,有其他方法,甚至我们自己也在 World Labs 工作过,比如我们最近的 RTFM 模型,它确实是一帧一帧地生成。>> 嗯,在那里,原子单位是逐帧生成,就像用户与系统交互一样。>> 或者你可以想象未来有其他架构,其中原子单位是一个 token,那个 token 现在代表,你知道,三维世界的一部分。>> 我认为有很多不同的架构,我们可以随着时间的推移进行实验。>> 我确实想稍微深入探讨一下。>> 我对 Alessio 接下来要说的理解是,世界模型的基本数据结构是什么?>> 因为正如你所说,它要么是高斯样条,要么是帧,或者其他什么。>> 嗯,你也在,你知道,之前的陈述中,你非常关注物理学和力,这是随着时间推移的,我松散地认为,在 Marble 中我看不到,我推测它还没有,也许如果有一个 Marble 2,你会有运动,或者是否有修改可以使样条变得有意义,或者它会是完全不同的东西?>> 是的,我认为有几种修改是有意义的,而且实际上有很多有趣的方法可以将它们整合在一起,这也是在这个领域工作的一个好地方,而且实际上有很多研究工作在这方面。>> 就像,当你谈论古怪的想法时,就像实际上有很多非常有趣的研究工作,关于不同的方法来赋予物理学。>> 你也可以在行业里做古怪的想法。>> 是的。[笑声]>> 对吧?>> 但然后就像高斯样条本身就是小粒子。>> 有很多方法,基本上你将物理属性附加到那些样条上,并说每一个都有质量,或者也许你将每一个都视为与附近邻居通过某种虚拟弹簧耦合,现在你可以开始在样条上进行物理模拟。>> 所以,增加物理学或动力学或交互性的一种途径是,你知道,预测与你的每个样条粒子相关的物理属性,然后下游模拟它们,无论是使用经典物理学还是某种学习到的东西,或者你知道,在三维领域工作的美妙之处在于事物可以组合,你可以在不同的地方注入逻辑。>> 所以一种方式是,我们正在生成一个三维场景。>> 我们将预测场景中所有事物的三个维度属性。>> 然后我们使用经典的物理引擎来模拟交互。>> 或者你可以做一些事情,比如,作为用户操作的结果,模型现在将重新生成整个场景,以样条或其他表示形式。>> 嗯,这可能更通用,因为你就不受限于你已经知道如何建模的任何物理属性。>> 但这也更具计算密集性,因为你需要根据用户操作重新生成整个场景。>> 但我认为这是一个非常有趣的研究领域,也是一个可以添加到 Marble 2 的潜在领域,就像你说的。>> 是的。>> 并且有机会实现动力学,对吧?>> 样条密度的情况如何?>> 就像,我们能渲染足够高的分辨率来获得非常高的分辨率吗?>> 我们是否受到你可以生成多少的限制?>> 我们能渲染多少?>> 这些将如何获得超高保真度,可以说?>> 你有一些限制,但这取决于你的目标用例。>> 所以,我们场景中的一个主要限制是,我们希望事物能在手机上清晰地渲染。>> 嗯,我们希望事物能在 VR 头显中清晰地渲染。>> 所以,这些设备比你在许多其他情况下习惯的计算能力要少得多。

嗯,而且如果你想获得一个 splat 文件,以便在四年前的 iPhone 上以高分辨率、高帧率(例如 30 到 60 fps)进行渲染,那么你在处理的 splat 数量上就会受到一些限制。嗯,但如果你可以在最近的 iPhone(甚至是今年的 iPhone)或最近的 MacBook 上工作,或者如果你有本地 GPU,或者如果你不需要 60 fps 1080p 的话,那么你就可以放宽限制,处理更多的 splat,这样你就可以在场景中获得更高的分辨率。

我曾期待的一个用例,但没有从你们那里听到,就是具身用例。你们现在只专注于虚拟吗?>> 如果你访问 World Labs 的主页,有一个名为 Marble Labs 的特定页面。>> 在那里,我们展示了不同的用例,并且我们实际上将它们分为视觉效果用例、游戏用例以及模拟用例。在其中,我们实际上展示了这项技术可以极大地帮助机器人培训。对吧?这回到了我之前谈到的关于数据匮乏的问题。机器人培训确实缺乏数据。你知道,高保真的真实世界数据绝对非常关键。但你就是无法获得大量的数据。当然,另一个极端是纯粹的互联网视频数据。那么你就缺乏训练具身智能体所需的许多可控性。所以模拟和合成数据实际上是其中一个非常重要的中间地带。我多年来一直在这个领域工作,其中最大的痛点之一就是从哪里获取这些合成模拟数据?你必须策划资产并构建这些复杂的场景,而在机器人领域,你需要很多不同的状态。你希望具身智能体在合成环境中进行交互。Marble 实际上非常有潜力帮助生成这些用于具身智能体培训的合成模拟世界。>> 显然,是的,它就在主页上。它会在那里的。我只是,就像你说的,我试图联系到,你也必须建立一个商业模式,机器人领域的市场显然非常巨大,也许你不需要那个,或者也许我们需要在进入具身领域之前先建立并解决虚拟世界的问题,然后显然是垫脚石。>> 这还有待决定。我认为,>> 因为其他人都直接走向那里了 [笑声] 对吧?>> 不是所有人都这样,但我想说有一种兴奋感,但你知道,我认为世界足够大,可以容纳不同的方法。>> 是的。方法。>> 是的。>> 是的。我的意思是,我们一直认为这是一项相当横向的技术,随着时间的推移,它应该能够触及许多不同的行业。而且,你知道,Marble 目前更侧重于创意产业,但我认为驱动它的技术应该可以随着时间的推移应用于许多不同的领域。机器人领域是其中之一,你知道,可能很快就会发生。>> 另外,设计,对吧,与创意非常接近。>> 哦,是的。绝对。就像,我认为是建筑方面的东西。>> 是的。好的。是的。我的意思是,我开玩笑说,我在网上发了一个视频到 Slack 上,说,哦,谁想用 Marble 来规划你的下一个厨房改造?它实际上已经很适合了。只需拍两张你厨房的照片,在 Marble 中重建它,然后使用编辑功能看看如果你更换台面、更换地板或更换橱柜,那个空间会是什么样子。这是我们没有专门为这个用例构建任何东西,但因为它是一项强大的横向技术,所以你会得到这些新兴的用例,它们只是从模型中自然产生的。我们有一些早期 beta 用户正在使用一个 um um API 密钥,它已经在构建室内设计用例了。>> 我刚弄了我的车库,早该知道了 [笑声] 这个。我得 >> 下次你改造的时候,我们可以帮忙。>> 嗯,厨房是下一个,我敢肯定。>> 是的。>> 是的。我对整个空间智能领域感到好奇。我认为我们应该更深入地探讨一下。你如何定义它,以及传统智能(人们可能会想到的,比如 LLM,当 Dario 说我们有一个数据中心全是爱因斯坦,那就是传统智能,不是空间智能)与空间智能之间存在哪些差距?要具备空间智能需要什么?>> 首先,我不明白那句话,一个数据中心全是爱因斯坦 [笑声] >> 我就是不明白,这不是一个 >> 这是一个比喻,这是一个比喻。>> 嗯,所以,作为一门学科,很多人工智能领域都受到人类智能的启发,对吧?因为我们是目前已知宇宙中最聪明的动物。如果你看看人类智能,它是非常多方面的,对吧?有一位心理学家,我认为他的名字是霍华德·加德纳,他在 20 世纪 60 年代就称之为多元智能来描述人类智能。有语言智能、空间智能、逻辑智能以及情感智能。所以对我来说,当我想起空间智能时,我认为它是语言智能的补充。所以,我个人不会说它是空间智能与传统智能的对立,因为我不知道传统意味着什么。我确实认为空间智能是对语言智能的补充,以及我们如何定义空间智能,它是使你能够在空间中推理、理解、移动和交互的能力。我用 DNA 结构推导的例子来说明,当然我在这里简化了这个故事,但其中很多都与分子和 3D 空间中的化学键的空间推理有关,最终推测出双螺旋结构,而人类或弗朗西斯·克里克和沃森所拥有的这种能力,很难将这个过程完全简化为纯粹的语言。这是一个文明的巅峰时刻。但每天,我在这里试图抓住一个杯子。整个过程是看到杯子,看到它所处的环境,看到我自己的手,我的手张开的几何形状与杯子匹配,并触摸到正确的可操作点。所有这些都深深地、深深地是空间性的。这非常困难。我试图用语言来叙述它。但另一方面,这种叙述的语言本身无法让你拿起一个杯子。>> 是的。带宽限制。>> 是的。>> 我最近做了一些数学计算,如果你每天 24 小时不停地说话,你每天能产生多少个 token?以每分钟 150 个词的平均语速计算,每天大约是 215,000 个 token,而你生活的世界比这高得多。 [笑声] >> 嗯,我认为这是真的。但如果我想到艾萨克·牛顿爵士,对吧,当时有像重力这样的东西,还没有被语言形式化,人们在空间上就理解事物会掉落,对吧?但然后以某种方式形式化它是有帮助的,或者你知道我们用来捕捉经验上和空间上都能理解的东西的各种规则,但用语言描述它更容易。所以,我对空间智能和语言智能之间的相互作用感到好奇,那就是,好吧,你需要理解一些规则比用语言写更容易,以便空间智能去理解,但你不能,你知道,你不能写“把手这样放然后放下这么多”。所以,我总是好奇它们如何相互利用。>> 我的意思是,如果说牛顿的例子,牛顿之所以会写下那些定律,是因为他有很多在现实世界中的具身经验,他观察了棒球比赛。>> 没错。实际上,区分你提到的理论构建与作为三维世界一部分的具身日常经验是有用的。对吧?所以对我来说,空间智能就是封装了身处三维空间、在其中移动、看到它、行动它的具身经验。正如 Fay 所说,你可以叙述这些事情,但这是一个非常失真的通道。这就像“身处世界并在其中做事”的概念与试图描述它是一个非常不同的模式。但因为我们人类是动物,我们一直在空间中互动,所以我们甚至不认为这是一件难事,对吧?然后我们自然地跳到语言,然后是理论构建,作为从那种原生的空间理解中抽象出来的机制。在某种意义上,LLM 只是直接跳到了那些最高形式的抽象推理,这非常有趣且非常有用。但空间智能几乎是再次打开那个黑箱,说也许我们因为直接走向那种完全抽象的语言、推理和沟通形式而失去了一些东西。>> 你知道,作为一名视觉科学家,这很有趣,对吧?我总是觉得视觉被低估了,因为它对人类来说是毫不费力的。你睁开眼睛,作为一个婴儿,你开始看到你的工作。我们似乎天生就有这种能力,>> 对吧?我们几乎天生就有。但你必须努力学习语言,包括学习如何写作、学习语法、学习表达,这使得它感觉很困难。而大自然花费了更多时间来优化的东西,即感知和空间智能,却被人类低估了。>> 有证据表明我们天生就有吗?你说“几乎天生”。所以听起来我们出生后确实会学习。当我们出生时,我们的视力较差,我们的感知能力会提高。但我们大多数人天生就有看的能力,而且大多数人天生就有将感知与运动联系起来的能力,对吧?我的意思是,运动本身需要一段时间才能完善,但是,而且动物也很棒,对吧?就像我今年夏天早些时候在非洲一样。这些小动物,它们一出生,几分钟内就必须行动起来,否则狮子就会抓住它们。而在大自然中,你知道,花了 5.4 亿年才优化了感知和空间智能以及语言。对语言发展的最慷慨的估计可能只有五十万年。>> 哇。>> 是的,[笑声] >> 这比我预期的要长。嗯,我非常慷慨。是的。>> 是的。不,我,你知道,我一直在看你的书,我意识到一个有趣的联系,与我们在播客上讨论过的一个话题是语言模型基准,以及 Wow Grand 如何放入所有这些物理上不可能的事情,这些都需要空间智能,对吧?比如 A 在 B 的上面,所以 A 不能穿过 B >> 是 >> 对我们来说很明显,但对语言模型来说可能会发生。我不知道,也许它是,你知道,下一个 token 预测的一部分。>> 这就是我所说的“解开抽象”的意思,对吧?如果你的整个世界模型只是说一个接一个的词序列,那么很难理解为什么不行。>> 这其实不公平,>> 对吧?但对我们来说显而易见的原因是,我们正在将它映射回我们熟悉的某种三维世界表示。问题是,我们如何才能从你的世界模型中提炼出这些东西?我不知道你是否同意这个词“提炼”。我们确实希望我们的模型拥有空间智能,对吧?我们是否必须完全抛弃语言模型才能做到这一点?>> 不。>> 不,对吧?我不这么认为,对吧?>> 我认为它们是多模态的。我的意思是,即使是我们的 Marble 模型今天也接受语言作为输入。>> 对。>> 对。所以它是深度多模态的,而且我认为在许多用例中,这些模型将协同工作,也许有一天我们会有一个通用模型。>> 我的意思是,即使你这样做,也有一个实际的问题,人们使用语言,人们希望使用语言与系统进行交互。即使是出于实际原因,构建系统、构建产品和构建模型也很有用,让人们可以与它们交谈。所以我认为这不会消失。我认为有一种智力上的好奇心,就是说,在智力上,你可以构建一个只使用视觉或只使用空间智能的模型。我不知道这是否会有实际用途,但我认为这是一个有趣的智力或学术练习,看看你能把它推到多远。我认为,不是要回到物理学,但我很好奇,如果你有一个高度精确的世界模型,并且没有给它任何关于我们当前对标准物理模型理解的概念,它能从中得出多少东西,并从头开始重新创建它,以及它需要多少语言理解能力,因为我们有很多符号,我们只是使用它们,我们创造了它们,但也许我们会想出一种非常不同的模型,但仍然是准确的,我想知道我们有多少受到限制。但我你知道,人们说人类总是需要成为人类,因为世界是为人类建造的,在某种程度上,我们构建语言的方式也限制了我们从这些其他模态中获得的一些输出。所以我非常期待关注你的工作。>> 是的。我的意思是,你甚至不需要做人工智能来回答这个问题。你可以发现外星人,看看他们有什么样的物理学,对吧?而且他们可能有,>> 让我们面对现实吧,到目前为止,我们是宇宙中最聪明的动物,>> 对吧?所以,所以你,我的意思是,但这确实是一个有趣的问题,对吧?我们对宇宙的认识和我们对物理学的理解,是否在某种程度上受到我们自身认知或我们自身技术演变的路径依赖的限制?一种方法是,你几乎想做一个实验,说,如果我们再次重演人类文明,我们会以相同的顺序得出相同的物理学吗?我不认为这是一个非常实际的实验。>> 我想知道人们是否可以进行的一个实验是,我们现在有大量的关于行星或天体运动的天体物理学数据,只需将数据输入模型,看看牛顿定律是否会出现。>> 我猜可能不会。>> 我猜也是。牛顿定律的抽象级别与这些语言 LLM 所代表的级别不同。>> 是的。所以,如果给定足够的天体运动数据,LLM 实际上会预测出非常准确的运动轨迹,我不会感到惊讶。比如说,我发明了一个围绕恒星运行的行星,并且有足够的数据,我的模型会告诉你,在第一天它在哪里,第二天在哪里。我不会感到惊讶。但是 F=MA 或者“作用力等于反作用力”呢?那是一个完全不同的抽象级别。那已经超出了今天的 LLM。>> 好的。你需要什么样的模型才能不让它成为一个地心模型?因为如果我只用视觉数据进行训练,那么认为太阳绕着地球转是说得通的,对吧?但显然事实并非如此。那么它将如何学习呢?我很好奇所有这些,你知道,我们谈论的力,就像有时你不需要它们,因为只要看起来是对的,它就是对的,但是当你开始尝试使用这些模型来做更高层次的任务时,我们能在多大程度上依赖它们?我认为你需要一种不同的学习范式,对吧?所以,你知道,这里发生了一些混淆,你说的是 LLM 和语言和符号, versus 人类理论构建和人类物理学,它们非常不同,因为 LLM,人类的目标函数是理解世界并在生活中茁壮成长。而你做到这一点的方式是,你知道,有时你观察数据,然后你思考它,然后你尝试在世界上做一些事情,它不符合你的期望,然后你想去更新你对世界的理解。人们一直在这样做,无论是,你知道,我以为我的钥匙在楼下,所以我下楼去找,我没找到,哦,不,它们实际上在我卧室里。所以我们,因为我们一直在与世界互动,我们必须不断地建立关于我们周围世界正在发生的事情的理论,然后证伪或为这些理论增加证据。我认为这种过程被放大并扩展,就是 F=MA 和牛顿物理学。我认为这与我们训练的模型模态有点不同,无论是语言还是空间。我把它说出来,几乎就像,这几乎是更有效的学习,因为你有一个假设,这里是我的可用数据所允许的各种可能的世界,然后你进行实验来消除不可能的世界,然后你解决那个正确的世界。对我来说,这也是我如何拥有心智理论,就像我有一个关于你在想什么、你在想什么的假设。我尝试创建行动来解决这个问题,或者检查我关于你在想什么的直觉。你知道,而 LLM 显然不会做这些。>> 心智理论可能也会分解成甚至情感智能,而今天的 AI 根本没有触及。对吧?而且我们真的、真的需要它。你知道,人们开始过度依赖这些东西,而且,那是一个完全不同的辩论话题。我不得不问,因为很多人都给我们发了这个。我们必须放弃多少?你知道,序列到序列建模是不是已经过时了?注意力机制是不是已经过时了?我们要求一切的程度是多少?>> 我认为,我认为你坚持有效的东西,[清嗓子] 我认为注意力机制仍然存在。我认为注意力机制仍然存在。我认为有很多,你不需要修复没有坏的东西。嗯,而且,世界上有很多难题要解决,但我们一次专注于一个。嗯,我认为思考新的架构或新的范式或截然不同的学习方式非常有趣。嗯,但你不需要扔掉所有东西,只是因为你在处理新的模态。>> 我认为序列到序列实际上是在世界模型中。我认为我们将看到超越序列到序列的算法或架构。>> 哦,但在这里,我认为有一些技术上的混淆,而 Transformer 已经为我们解决了这个问题,对吧?就像 Transformer 本身不是序列模型。Transformer 本身是集合模型。嗯,这非常强大,但是因为,很多 Transformer 是从早期基于循环神经网络的架构发展而来的,而 RNN 确实有一个内置的架构,它们确实模拟了一维序列。好的。>> 但 Transformer 本身就是集合模型,它们可以模拟很多集合,这些集合可以是,你知道,一维序列,也可以是其他东西。>> 所以你字面意思是集合论,就像 >> 是的。是的。所以,无论。>> 是的。是的。所以 Transformer 实际上不是 token 序列的模型。Transformer 实际上是 token 集合的模型,对吧?唯一注入顺序的东西,在 Transformer 中,在标准的 Transformer 架构中,唯一区分事物顺序的是你给 token 的位置嵌入,对吧?所以,如果你选择给它一个一维位置嵌入,那就是模型知道它是一维序列的唯一机制,但所有在 Transformer 块内部发生的算子要么是 token 级别的,对吧?所以,要么有一个 FFN,有 QKV 投影,有每个 token 的归一化,所有这些都独立地发生在每个 token 上,然后通过注意力机制在 token 之间进行交互,但那也基本上是,它具有排列等变性,所以如果我排列我的 token,那么注意力算子就会以完全相同的方式得到一个排列的输出。[清嗓子] 所以,它实际上是 token 集合的原生架构。>> 字面意思是一个转换。>> 是的。[笑声] >> 用数学术语来说。>> 我知道我们时间不多了,但我们只想给你一个号召行动的机会,无论是关于那些会喜欢在 World Labs 工作的人,什么样的人应该申请,在 World Labs 之外应该进行什么样的研究对你们有帮助,还是你脑海中的任何其他事情。我认为现在是一个非常激动人心的时刻,可以超越语言模型,思考空间智能的无限可能性。所以我们确实需要人才,从非常深入的研究人员开始,思考像 Justin 刚才描述的问题,你知道,训练大型世界模型。我们需要优秀的工程师来构建系统,你知道,从训练优化到推理再到产品。我们还需要优秀的商业,你知道,嗯,产品思考者和市场推广以及商业人才。所以,所以我们需要人才。特别是现在我们通过 Marble 将模型暴露给了世界,我认为我们有一个绝佳的机会与更大的人才库合作,来解决模型问题,并向世界提供最好的产品。>> 是的,我认为我也很高兴人们能尝试 Marble 并用它做很多很酷的事情。我认为它有很多很酷的功能,很多很酷的功能可以很好地结合在一起。>> 在来这里的路上,Justin 和我都在说,人们还没有完全发现,好吧,只有 24 小时 [笑声] 人们还没有完全发现一些高级编辑模式,对吧?比如打开高级模式。你可以,就像 Justin 说的那样,改变瓶子的颜色,你知道,改变你的地板,改变树木。>> 嗯,我实际上试过,但当它说创建时,它只会让我创建一个完全不同的世界。>> 你需要点击高级 [笑声] 模式。这是一个很好的 UI。>> 我们可以改进我们的 UI UI。记住要点击。>> 是的,我们需要,我们需要招聘人。我们从事产品工作。[笑声] >> 嗯,有一件事我们从你们那里清楚地了解到的是,你们也在寻找智力上的无畏,这是我认为你们奉为原则的东西。>> 是的,我的意思是,我们是第一个在模型方面和产品方面都尝试这样做的人。>> 非常感谢你们的加入。这很有趣。是的,谢谢你们的邀请。>> 是的。[音乐]