Transcription
我认为深度学习的整个历史在某种意义上就是计算能力不断扩展的历史。>> 当我从研究生院毕业时,我真的认为我职业生涯的其余部分都将致力于解决那个单一的问题,即人工智能作为一个领域,作为一个学科,很大程度上受到人类智能的启发。我们 [音乐] 认为我们是第一个这样做的人。结果发现,他们也在同时这样做。>> 所以,大理石,基本上,一种看待它的方式是,它是系统。它是一个 3D 世界的生成模型,对吧?所以你可以输入 [音乐] 像文本或图像或多个图像,它会为你生成一个 3D 世界,这种世界在某种程度上与 [音乐] 这些输入相匹配。因此,虽然 Marble 同时是一个世界模型,它正在朝着空间智能的愿景发展,但它也非常有意地 [音乐] 被设计成人们今天可以使用有用的东西。嗯,我们开始看到新兴的用例 [音乐] 嗯,在游戏中,在视觉特效中,嗯,在电影中,我认为 Marvel [音乐] 今天作为一个产品可以做很多真正有趣的事情,并且也为我们想要构建的宏伟世界模型奠定了基础。 [音乐] 大家好,欢迎来到 Len Space 播客。我是 Allesio,Kernel Labs 的创始人,和我一起的是 Swix,Blade in Space 的编辑,>> 我们非常高兴能与 World Labs 的 Fifi 和 Justin 在工作室。欢迎。>> 我们也很兴奋。>> 我差点说成 Marble。 [笑声] >> 是的,感谢邀请。我认为大家对世界模型很感兴趣,你们也围绕空间智能和所有这些做了一些宣传。嗯,我想也许故事中有一个你们两人是如何走到一起开始构建 World Apps 的难得机会。这很容易,因为 Justin [笑声] 是我的前学生。是的。所以 Justin 来到我的,你知道,我戴的另一顶帽子是斯坦福大学的计算机科学教授。Justin 加入我的实验室是什么时候?>> 嗯,2012 年,实际上我加入你实验室的那个学期,也是 AlexNet 问世的那个学期。>> 是的。是的。所以 Justin 是我的第一个>> 你是否参与了整个公告的戏剧性事件,我猜?不,不,一点也没有。但我在那个学期里一直在关注围绕 AlexNet 的 ImageNet 的兴奋。所以他是我的一个非常优秀的学生,然后他继续在密歇根大学和安娜堡的 Meta 担任教授,早期职业生涯非常成功,然后当我们嗯,我认为大概两年多以前,我们俩都独立地关注了大型模型的发展,并思考语言模型之外还有什么,以及构建世界模型、空间智能的这个想法对我们来说确实很自然。所以我们开始交谈,并决定我们应该孤注一掷,专注于解决这个问题,并一起创办了 World Labs。>> 是的,差不多。我的意思是,在我的博士期间看到那种 ImageNet 时代之后,我有一种感觉,未来十年的计算机视觉将是让人工智能走出数据中心,走向世界。>> 所以我博士后的大部分兴趣都转向了 3D 视觉,稍微转向了计算机图形学,更多地转向了生成建模。>> 嗯,我以为我博士后要离开我的导师了,但后来我们几年后重聚,才发现她也在想类似的事情。所以如果你想到 AlexNet,它的核心部分显然是 ImageNet,是转向 GPU 和神经网络。你如何看待世界模型的 AlexNet 等效模型?从某种意义上说,这是一个已经存在很久的想法,对吧?有,你知道,Young Lagoon 可能是最主要的倡导者。在过去两年里,你看到了什么让你觉得“嘿,现在是时候这样做了”。以及你想要构建什么,就数据和算法类型或计算方法而言,才能让世界模型真正实现?>> 是的,我认为其中一点是,总体而言,有更多的数据和计算可用。>> 我认为深度学习的整个历史在某种意义上就是计算能力的扩展史。>> 如果你想到,你知道,AlexNet 需要从 CPU 跳到 GPU,但即使从 AlexNet 到今天,每张卡的性能也比 AlexNet 时代提高了大约一千倍,而且现在普遍的做法是不仅在一个 GPU 上训练模型,而是在数百个、数千个或数万个甚至更多的 GPU 上训练模型。所以我们今天在一个模型上可以调动的计算量,比我读博士初期还要多一百万倍。所以我认为语言是过去几年开始奏效的非常非常有趣的事情之一。但当我们考虑转向视觉数据、空间数据和世界数据时,你需要处理更多的数据。我认为这将是吸收这些不断涌现的新计算能力的好方法。>> 公开挑战的模式仍然有效吗,还是应该集中在实验室内部?>> 我认为开放科学仍然很重要。你知道,人工智能显然与 AlexNet 时代的图像识别相比已经真正发展了 [笑声],那是一个非常小众的计算机科学学科,现在它已经成为了文明级别的技术。但我可以给你举个例子,最近我的斯坦福实验室刚刚宣布了一个名为“行为”的开放数据集和基准测试,用于在模拟环境中对机器人学习进行基准测试,这是在学术界保持这种开放科学模式的一个非常明确的努力。但我认为认识到生态系统是一个混合体是很重要的。我认为,嗯,嗯,很多行业中非常专注的工作,其中一些正在以一种比开放挑战本身更明显的方式展现出来。>> 是的。这只是资金和商业模式的问题,你必须从中看到一些投资回报。我认为这只是生态系统多样性问题,即使在所谓的 Alex ImageNet 时代,我的意思是,有封闭的模型,有专有的模型,有开放的模型,你知道,嗯,你知道,如果或者你想到 iOS 与 Android 对比,有不同的商业模式。我不会说这只是资金问题,它只是市场如何运作,有不同的玩法。>> 是的,但你觉得你能用这些实验室的一些商业压力重做 ImageNet 吗?对我来说,这是最大的问题,对吧?就是你能公开什么,什么应该留在里面?你知道,如果我把自己放在你的位置,对吧?你筹集了很多钱,你在构建所有这些。如果你有最好的数据集,你真的有什么动力去发布它?而且我觉得实验室里的人越来越早地被吸引到这些实验室里,博士项目也越来越早地被吸引到这些实验室里。所以我想知道你是否认为现在存在一个问题,就是有多少钱被投入进来,这对学术界更开放的研究空间造成了多大的压力,或者你是否觉得这真的不是一个问题。>> 我确实有担忧,但与其说是压力,不如说是学术界的资源分配不均。这与 World Labs 的谈话有点不同。你知道,过去几年我一直在倡导资源分配以促进健康的生态系统。你知道,作为斯坦福人类中心人工智能研究所(Stanford HAI)的创始主任、联合主任,我一直在与政策制定者合作,为公共部门和学术界的人工智能工作提供资源。我们与第一届特朗普政府合作,制定了一项名为“国家人工智能研究资源”(NAR)的法案,该法案正在规划一个国家人工智能计算云以及数据存储库。我也认为开源数据集仍然是生态系统的重要组成部分。就像我说的,现在我在斯坦福实验室,我们正在进行关于机器人学习的开放数据集、开放基准测试,称为“行为”,我的许多同事仍在这样做。我认为这是生态系统的一部分。我认为行业正在做的事情,一些初创公司正在快速开发模型并创造产品,这也是一件好事。例如,当 Justin 还是我的博士生时,没有一个计算机视觉项目能很好地工作,对吧?我们可以写出很棒的论文。Justin 有>> 我的意思是,甚至在读研究生之前,我就想做计算机视觉,我联系了谷歌的一个团队,想在本科毕业后尝试做计算机视觉,他们告诉我,你在说什么?你不能那样做,先读个博士再回来。>> 是什么让你产生了这样的想法?哦,我在本科期间和费伊的博士导师一起做了一些计算机视觉研究。>> 这里有一条 [笑声] 血脉。>> 这里有一条血脉。所以,我在本科时就做了一些计算机视觉,我觉得它非常酷,我想继续做下去。>> 所以我面临着本科毕业时的行业与学术的选择,我认为现在研究界很多人都面临着这个问题。>> 但但回答你的问题,我认为,尤其是在人工智能领域,学术界的作用在过去十年中发生了很大的变化。>> 这不是坏事。>> 这是因为技术已经发展和出现了,对吧?就像 5 到 10 年前,你真的可以在实验室里训练最先进的模型,即使只有几个 GPU,但因为这项技术非常成功并且规模化了这么多,所以你不能再用几个 GPU 来训练最先进的模型了。这不是坏事。这是一件好事。这意味着技术确实奏效了。>> 但这意味着我们作为学者的期望会发生一些变化。它不应该是关于尝试训练最大的模型和扩展最大的东西。它应该是关于尝试古怪的想法、新想法和疯狂的想法。>> 其中大部分都不会成功。我认为有很多事情可以做。如果有什么的话,我担心学术界太多人过度关注试图假装我们可以训练最大的模型,或者将其视为一个职业培训项目,然后毕业去一个大实验室,然后就能玩所有 GPU。我认为在新的算法、新的架构、新的系统方面有很多疯狂的事情可以做,你知道,一个人可以做很多事情。>> 而且学术界在理解这些大型模型的理论基础方面也发挥着作用。我们对这些仍然知之甚少,或者扩展到跨学科领域,你知道,Justin 称之为古怪的想法。有很多基础科学的想法。有很多蓝天问题。所以我同意。我不认为问题是开放与封闭,产品化与开源。我认为目前的问题是,学术界本身严重资源不足。所以,嗯,研究人员和学生没有足够的资源来尝试这些想法。>> 是的。只是为了让人们能够深入探讨,当你谈论古怪的想法时,你脑海中会浮现出什么古怪的想法?哦,比如我有一个想法,我一直向我在密歇根大学的学生推销,那就是我真的很喜欢硬件,我真的很喜欢新出现的硬件。>> 在某种意义上,我们今天使用的神经网络和 Transformer 的出现是基于矩阵乘法,因为矩阵乘法非常适合 GPU。但如果我们考虑 GPU 将如何扩展,硬件未来可能如何扩展,我认为我们现有的系统,比如 GPU 类的硬件设计,不会无限扩展,我们甚至现在已经开始看到,计算的单位不再是单个设备,而是整个设备集群。所以如果你想象>> 节点>> 是的,是整个节点或整个集群,但我们谈论神经网络的方式仍然好像它们是一个整体,可以在 PyTorch 中像在一个 GPU 上一样进行编码,但实际上它们可以分布在数千个设备上。所以有没有像 Transformer 那样基于矩阵乘法,矩阵乘法是 GPU 上效果很好的基本单元,你想象硬件如何扩展,有没有其他基本单元更适合我们构建神经网络的大规模分布式系统?我认为可能存在截然不同的架构,适合下一代或未来 10 到 20 年的硬件,我们可以从今天开始想象。很难做出这样的赌注,因为还有硬件彩票的概念,比如说,你知道,英伟达已经成功了,我们应该无限地扩展它,并编写软件来弥补我们在这方面存在的任何差距,对吧?我的意思是,是的,是的,也并非如此。你看数字,即使从 Hopper 到 Blackwell,每瓦性能也差不多。是的。>> 他们主要增加了晶体管的数量,增加了芯片尺寸,增加了功耗。但即使从 Hopper 到 Blackwell,我们也已经看到了性能每瓦的扩展极限。>> 所以,我认为我认为有空间做一些新的事情,我不知道具体是什么,我认为你不能在三个月内作为一个初创公司完成。但我想这是一种你可以坐下来花几年时间来取得突破的想法,我认为这是非常适合学术界的长期工作。回到一点背景和历史,我们有一个关于你做的场景叙事工作或你和 Andre 做的较新的图像字幕工作的研究笔记,我只是想听你们讲讲那个故事,你知道,你当时正在为你的博士学位做这件事,而费伊当时有你的反应。>> 是的。所以我认为那条工作线始于我和 Andre 之间,然后 Justin 加入了。>> 所以 Andre 开始了他的博士学位。他和我在看 ImageNet 对象识别之外还有什么。当时,你知道,卷积神经网络在 ImageNet 任务中已经证明了一些力量。所以卷积神经网络是表示图像的好方法。与此同时,我认为在语言领域,一个早期的序列模型叫做 LSTM 也在被试验。所以 Andre 和我只是在谈论,这是我长期的梦想。我认为需要一百年才能解决,那就是讲述图像的故事。当我从研究生院毕业时,我真的认为我职业生涯的其余部分都将致力于解决那个单一的问题,即给定一张图片或一个场景,用自然语言讲述故事。但事情发展得如此之快。>> 当 Andre 和我,当 Andre 开始的时候,我们想,也许结合卷积神经网络的表示以及 LSTM 的语言序列模型,我们可能能够通过训练来匹配图像和字幕。所以我们从那里开始工作,我不知道,那是 2014 年或 2015 年。那是 CVPR 2015 年的字幕论文。所以这是我们的第一篇论文,Andre 让它奏效了,那就是给定一张图像,图像由卷积神经网络表示,语言模型是 LSTM 模型,然后我们结合它,它能够生成一句话,那是第一次,我记得我在我的书里写过,我们认为我们是第一个这样做的人,结果发现谷歌当时也在同时这样做,而且一位记者,是《纽约时报》的 John Marov,在报道谷歌的故事,但他偶然听说了我们,然后他意识到我们真的独立地在同一时间达到了相同的目标。所以他写了关于谷歌研究以及 Andre 和我的研究的故事,但之后,我认为 Justin 当时已经在实验室了。>> 是的。是的。我记得小组阅读小组会议,Andre 在展示一些结果,并解释了这个叫做 LSTM 和 RNN 的新东西,我以前从未听说过,我想哇,这真的很棒,我想做那个。所以之后,他在 CVPR 2015 年发表了关于第一个图像字幕结果的论文。然后之后我们开始一起工作,我们首先做了一篇关于语言建模的论文,早在 2015 年,我记得是 2015 年。是的。是的。我应该坚持语言建模,回顾起来,那相当有利可图。但我们一起写了这篇语言建模论文,我和 Andre 在 2015 年,它非常酷。我们训练了这些小的 RNN 语言模型,它们可以一次吐出几句话,然后我们戳它们,试图理解神经网络内部的神经元在做什么。>> 你们对不同的内存进行了分析>> 是的。是的。这真的很酷。即使在那时,我们也有一些结果,你可以看看 LSTM 里面,说哦,这个东西在读取代码。所以我们训练的一个数据集是 Linux 源代码,因为整个事情都是开源的,你可以下载它。所以我们训练了一个 RNN 在这个数据集上,然后当网络试图预测 token 时,然后试图将它的预测类型与 RNN 的内部结构相关联,在那里我们能够找到一些关联,哦,比如 LSTM 中这个层的这个单元在打开 PN 时会激活,然后在关闭 PN 时会关闭,并尝试做一些实证的东西来弄清楚。所以那很酷,那只是从这个语言建模部分切掉了 CNN,只孤立地看待语言模型。>> 但然后我们想扩展图像字幕工作。>> 是的。我记得当时我们甚至有空间感,因为我们觉得字幕不能捕捉图像的不同部分。>> 是的。所以我和 Justin 和 Andrea 谈论了,你能做到我们最终称之为密集字幕,也就是更详细地描述场景,特别是场景的不同部分。所以>> 是的,然后我们构建了这个系统,然后是我和 Andre 和 Fe 在第二年 CVPR 2016 年的一篇论文上,我们构建了这个系统,它做了密集字幕。所以你输入一张图片,它会在图片中所有有趣的东西周围画框,然后为每个东西写一个简短的片段。比如,哦,桌子上有一个绿色的水瓶。这是一个穿黑衬衫的人。这是一个非常复杂的神经网络,因为它建立在当时物体检测方面取得的许多进展之上,而物体检测一直是计算机视觉的一个主要课题。然后它实际上是一个联合神经网络,它既学习查看单个图像,因为这个网络实际上有三种不同的表示。一种是整个图像的表示,以了解整体情况。然后它会提出它想关注的单个区域,然后查看,独立地表示每个区域,然后当你查看区域时,你需要为每个区域输出一个文本。所以那是一个相当复杂的神经网络架构。>> 这都是在 PyTorch 之前>> 对>> 它是一次性完成的吗?>> 是的。是的。所以它是一次前向传播就完成了所有这些。>> 不仅是一次性完成的,你还优化了推理。你在网络摄像头上做的。我记得。>> 是的。所以,我做了一个疯狂的实时演示,我让网络在斯坦福的一个服务器上运行,然后一个前端流式传输网络摄像头,然后将图像发送回服务器。服务器运行模型并将预测流回。所以,我只是带着这个笔记本电脑在实验室里走来走去,它只是向人们展示了这个网络实时运行。>> 识别和标记也是。是的,这很令人印象深刻,因为我们的大多数研究生只要能发表论文就满足了,对吧?他们把研究打包成论文,但 Justin 更进一步。他说,我想做一个实时的网络演示。>> 嗯,实际上,我不知道我是否告诉你这个故事,但是那年圣地亚哥有一个会议,ICCV。是 ICCV 15。>> 然后我有一篇关于其他事情的论文,但我带着我的笔记本电脑。我带着我的笔记本电脑在会议上走来走去,向大家展示这个实时字幕演示,模型在加州的服务器上运行。所以实际上能够从加州一直流式传输到圣地亚哥。嗯,延迟 [笑声] 很糟糕。大约是 1 FPS,但它能工作本身就很了不起了。>> 我想简要地评论一下,也许视觉和语言建模并没有那么不同。你知道,DeSQL CR 最近尝试了一个疯狂的事情,让我们从像素中模拟语言,然后进行训练,这可能是未来。我不知道。我不知道你们对语言是否真的有任何看法。>> 我刚写了一篇关于空间智能的宣言。 [笑声] >> 这是我进入这个话题的引子。是的,>> 我认为它们是不同的。>> 我确实认为这些生成模型的架构将共享很多可共享的组件,但我认为深度 3D 4D 空间世界具有与纯粹的生成信号(这是一维的)根本不同的结构水平。>> 是的,我认为“像素最大主义”是有道理的,对吧?有一种观点认为语言是不同的东西,但我们用眼睛看到语言,而我们的眼睛就像,你知道,我们眼睛后面有生物像素在处理这些东西。你知道,我们看到文本,我们认为它是一个离散的东西,但这只存在于我们的脑海中。>> 文本和语言在我们世界中的物理表现是,你知道,印在世界上的物理对象,我们用眼睛看到它们。>> 嗯,你也可以认为它是声音,但即使是声音,你也可以将其翻译成声音。>> 是的。你可以将声音信号>> 对。>> 然后,如果你将其翻译成我们在 LLM 中使用的纯粹的 token 化表示,你就会失去一些东西,对吧?>> 你会失去字体,你会失去换行符,你会失去页面上的二维排列。>> 嗯,对于很多情况,对于很多事情,也许这并不重要。>> 但对某些事情很重要。>> 嗯,我认为像素是这种,你知道,对世界上发生的事情更无损的表示,在某种程度上是一种更通用的表示,更符合我们人类在导航世界时所看到的样子。>> 所以,所以有一种效率论证,也许将文本渲染成图像,然后将其输入到视觉模型中,效率不高。>> 这正是 Deep Seek 所做的,对吧?它有点奏效了。 [笑声] 我认为这与整个世界模型有关,今年我看到的最喜欢的论文之一是关于为世界模型提供归纳偏置的。那是一篇哈佛的论文,他们将很多轨道模式输入到 LLM 中,然后要求 LLM 预测行星绕太阳运行的轨道,模型生成的看起来不错,但如果你让它画出受力矢量>> 它会很奇怪,你知道,它不会真正遵循。那么你如何看待你获得的数据中嵌入了什么?我们可以谈谈 3D 世界模型的 token 化,信息维度是什么?有视觉的,但有多少是底层隐藏的力,可以说你需要从这些数据中提取出来,以及那里有哪些挑战?>> 是的,我认为有不同的方法可以解决这个问题。>> 一种方法是,你可以明确地去做,然后说,“哦,我想,你知道,测量所有力并将它们作为训练数据输入到你的模型中,对吧?然后你可以运行一个传统的物理模拟,你知道,然后知道场景中的所有力,然后将它们作为训练数据来训练一个模型,这个模型现在应该会预测它们。或者你可以希望一些东西更隐式地出现,对吧?你端到端地训练一些东西,然后在更一般的问题上训练,然后希望在模型的内部某处,某个东西必须学习模拟物理学才能做出正确的预测。而这两种是我们更普遍的两种主要范式。>> 但没有迹象表明这些潜在的建模会让你得到空间和动力学的因果定律。>> 对。那就是今天的深度学习和人类智能开始分叉的地方,因为从根本上说,深度学习仍然是拟合模式。>> 在那里,你有点哲学化,你说我们也在拟合模式,但也许我们试图拟合,你知道,更广泛的模式,比如在更长的时间范围内,不同的奖励函数。>> 但但就像你提到的那篇论文一样,它试图拟合轨道模式的特定模式,但然后它并没有像你希望的那样真正泛化。它没有引力之类的因果模型。>> 对。因为即使在大理石中,你知道,我尝试过它,它生成了美丽的风景,里面有拱门。>> 但模型是否真的理解了拱门是如何,你知道,吸引到中心,就像石头一样,你知道,它的实际物理结构。另一个问题是,它是否真的理解它,只要它总是渲染出符合我们想象的物理模型的图像?如果你使用“理解”这个词,就像你理解一样,我敢肯定模型不理解 [笑声]。>> 模型是从数据中学习的,从模式中学习的。>> 是的。>> 它重要吗?尤其是对于它的用例。>> 这是一个好问题,对吧?>> 现在,我认为不重要,因为它渲染出了你需要的东西,假设它是完美的。>> 是的。我的意思是,这取决于用例。就像如果用例是我想要为虚拟电影制作或类似的东西生成一个背景,你只需要一个看起来合理的东西,在这种情况下,可能不重要。但如果你要用它来,你知道,如果你是一名建筑师,你要用它来设计一栋建筑,然后你要在现实世界中建造它,那么是的,你必须正确地模拟力,因为你不想在实际建造它之后它会坏掉。>> 但即使在那里,对吧?即使你的模型包含了语义,比如说,我仍然认为对信号的理解或对模型的输出,以及人类的理解是不同的词,但这又变得哲学化了。>> 是的,我的意思是,这里有一个关于理解的技巧,对吧?这些模型是一种与人类智能非常不同的智能。>> 而人类智能很有趣,因为你,你知道,我认为我理解事物是因为我可以在一定程度上反省我自己的思维过程。然后我相信我的思维过程可能与其他人的相似,所以当我观察别人的行为时,我就会推断他们的内部精神状态可能与我观察到的我自己的内部精神状态相似。因此,我知道我理解事物。所以,我假设你也理解一些东西。>> 但这些模型是一种,你知道,一种非常不同的智能形式,它们可以做非常有趣的事情。它们可以表现出非常有趣的行为。但无论它们内部有什么样的认知或内部自我反省,如果它们存在的话,都与我们所做的完全不同。>> 所以它没有自我意识。>> 对。>> 但这意味着,当我们观察到这些系统看似有趣或智能的行为时,我们不能必然推断出关于它们的其他信息,因为它们对世界的模型以及它们的思维方式与我们如此不同。>> 那么你需要两个不同的模型来做视觉模型和建筑生成模型吗?你认为最终,你对模型构建所采取的方法没有根本性的东西吗?它是关于扩展模型和它的能力,还是关于非常视觉化的东西会阻止你学习其背后的物理学,以便你可以信任它来生成一个可以工作的猫设计?我认为这是关于扩展数据和改进模型的问题。我不认为有什么根本性的东西将这两者分开。>> 是的,我希望它是一个模型,但我认为深度学习中的一个大问题是如何获得超越训练数据的涌现能力。你会得到一个理解力的东西,即使它没有被训练来预测力,但它会在内部隐式地学习它们吗?>> 我认为我们在其他大型模型中看到的很多涌现行为确实发生在规模上。>> 这些会转移到其他模态、其他用例和其他任务吗?>> 我希望如此,但这将是一个需要随着时间推移和观察才能发挥出来的过程。>> 有没有诱惑去依赖现有的物理引擎,你知道,游戏行业已经为你节省了大量工作,还是我们必须为某些根本性的不匹配而重新发明东西?我认为这就像攀登技术阶梯,对吧?>> 在某种意义上,你想要构建这些东西的根本原因可能是传统的物理引擎在某些情况下不起作用。如果物理引擎是完美的,我们就没有必要构建模型,因为问题已经解决了。>> 所以在某种意义上,我们想要做这些的原因是经典物理引擎无法解决我们想要的通用问题。>> 但这并不意味着我们需要抛弃它们,从头开始一切,对吧?我们可以使用传统的物理引擎来生成数据,然后用这些数据来训练我们的模型。然后你就像是在将物理引擎提炼到你正在训练的神经网络的权重中。我认为,如果你比较其他实验室的工作,很多人都在推测,你知道,Sora 有一点点这个。Genie3 也有点这个。>> 而且 Genie 明确是一个视频游戏。>> 你有控制来四处走动。>> 我总是觉得很有趣的是,我们为了好玩而发明的东西最终会进入严肃的工作。>> 是的。>> 整个 AI 革命始于图形芯片。>> 是的。部分 [笑声]>> 滥用 GPU 来生成大量三角形,然后生成其他一切。>> 是的。>> 我们稍微谈到了 Marble。我认为你们选择 Marble 作为你们的“出柜时刻”,如果可以这么称呼的话。>> 是的。>> 嗯,也许我们可以让你简洁地解释一下人们应该从中得到什么,因为这里的每个人都可以尝试 Marble,但我认为他们可能无法将其与你们的愿景与其他实验室生成的其他世界区分开来。>> 所以 Marble 是我们模型的一瞥。我们是一家空间智能模型公司。我们相信空间智能是下一个前沿。为了构建空间智能模型,模型必须非常强大,能够以多模态的方式理解、推理、生成世界,并允许我们最终希望达到的交互水平,就像人类与世界互动一样复杂。>> 所以这就是空间智能的宏伟愿景以及我们所看到的世界模型。Marble 是其中的第一个 glimpse。它是旅程的第一部分。它是世界上第一个在公众手中生成如此高保真度 3D 世界的同类模型。>> 这是起点,对吧?>> 我们实际上写了一篇技术博客。Justin 花了很多时间写那篇技术博客。我不知道你有没有时间浏览它。我的意思是,Justin 确实将其分解为 Marble 的多模态输入是什么,可编辑性是什么,它允许用户与模型进行交互,以及我们可以获得的输出。>> 是的。>> 所以,所以 Marble,基本上,一种看待它的方式是,它是系统,它是一个 3D 世界的生成模型,对吧?所以你可以输入像文本或图像或多个图像这样的东西,它会为你生成一个 3D 世界,这种世界在某种程度上与这些输入相匹配,而且它也是交互式的,因为你可以交互地编辑场景,比如我可以生成这个场景,然后说我不喜欢那个水瓶,把它变成蓝色的,比如把桌子拿掉,比如把这些麦克风移来移去,然后你可以根据这些交互式编辑生成新的世界,并以各种格式导出。通过 Marble,我们实际上试图同时做两件事,我认为我们很好地平衡了它们。>> 一是实际构建一个朝着空间智能宏伟愿景发展的模型,模型需要能够理解各种不同的输入,需要在许多情况下能够对世界进行建模,需要能够对它们如何随时间变化进行反事实建模。>> 所以我们想开始构建具有这些能力的模型,而 Marble 今天已经有了所有这些的暗示。但同时,我们是一家公司。我们是一家企业。我们真的不想让它成为一个科学项目,而是想构建一个今天对现实世界中的人们有用的产品。>> 所以虽然 Marble 同时是一个朝着空间智能愿景发展的世界模型,但它也是非常有意识地被设计成一个人们今天可以找到有用的东西。>> 嗯,我们开始看到新兴的用例。>> 嗯,在游戏中,在视觉特效中,嗯,在电影中,我认为 Marvel 今天作为一个产品可以做很多真正有趣的事情,并且也为我们想要构建的宏伟世界模型奠定了基础。>> 是的。我注意到一个非常有意思的工具,因为你可以在里面录制你的场景。>> 是的。>> 是的。它非常重要,记录的能力意味着对相机位置的精确控制。为了获得精确的相机位置,意味着你必须对 3D 空间有感觉。否则,你就不知道如何定位你的相机,对吧?以及如何移动你的相机。>> 所以这是这种模型的自然结果,这就是它只是一个例子。>> 是的。我发现当我玩视频生成模型时,我不得不学习成为一名导演的语言,因为我必须移动它们,比如平移,你知道,比如你不能说向北平移 63 度,对吧?你没有那种控制。而在 Marble 中,你在放置相机方面拥有精确的控制。>> 是的,我认为这是人们需要理解的第一件事是,你不是逐帧生成,就像许多其他模型那样。>> 是的。>> 你知道,LLM 生成一个 token。原子单位是什么?有网格,有散点,有体素,3D 世界有很多组成部分。人们应该对你的生成有什么样的心理模型?>> 是的,我认为有今天存在的东西和未来可能存在的东西。>> 所以今天存在的是模型原生输出散点。>> 所以高斯散点是这些,你知道,每个都是一个微小的粒子,半透明,在 3D 空间中有位置和方向。>> 而场景是由大量这些高斯散点构成的。>> 而高斯散点非常酷,因为你可以实时高效地渲染它们。所以你可以在你的 iPhone 上渲染,渲染一切。>> 而这就是我们获得精确相机控制的原因,因为散点可以实时渲染,几乎可以在我们想要的任何客户端设备上渲染。>> 所以对于我们今天生成的许多场景,那种原子单位是那个单独的散点,但我认为那不是根本性的。>> 我可以想象未来其他方法会很有趣。>> 所以有其他方法,甚至我们自己在 World Labs 工作过,比如我们最近的 RTFM 模型,它确实逐帧生成。>> 而在那里,原子单位是逐帧生成,就像用户与系统交互一样。>> 或者你可以想象未来其他架构,其中原子单位是一个 token,那个 token 现在代表,你知道,3D 世界的某个部分。我认为有很多不同的架构我们可以随着时间的推移进行实验。>> 我确实想稍微深入探讨一下。我理解 Alessio 想要说的,是世界模型的基本数据结构是什么?因为正如你所说,它要么是高斯散点,要么是帧,或者其他什么。>> 你也在,你知道,之前的陈述中,你非常关注物理学和力,这是随着时间的推移,我没有在 Marble 中看到,我推测它还没有,也许如果有一个 Marble 2,你会有运动,或者对高斯散点进行修改,使其有意义,或者会是完全不同的东西?>> 是的,我认为有几种修改是有意义的,而且实际上有很多有趣的方法可以将它们整合在一起,这也是在这个领域工作的一个很好的地方,而且实际上有很多研究工作。>> 当你谈论古怪的想法时,你知道,实际上有很多非常有趣的学生工作,关于赋予物理学不同的方法。>> 你也可以在行业里做古怪的想法。>> 是的。 [笑声]>> 对。但但就像高斯散点本身就是粒子一样。有很多方法,你基本上将物理属性附加到那些散点上,并说每个粒子都有质量,或者你可能将每个粒子视为与附近邻居通过某种虚拟弹簧耦合,现在你可以开始在散点之上进行物理模拟。>> 所以一种添加物理学、动力学或交互性的途径是,你知道,预测与你的每个散点粒子相关的物理属性,然后下游模拟它们,无论是使用经典物理学还是某种学习到的,或者你知道,在 3D 工作的美妙之处在于事物可以组合,你可以在不同的地方注入逻辑。>> 所以一种方式是,我们正在生成一个 3D 场景。我们将预测场景中所有事物的 3D 属性。然后我们使用经典的物理引擎来模拟交互。或者你可以做一些事情,比如,作为用户操作的结果,模型现在将重新生成整个场景,以散点或其他表示形式。>> 而这可能更通用,因为你就不受限于你知道如何建模的任何物理属性。>> 但这也更具计算成本,因为你需要响应用户操作来重新生成整个场景。>> 但我认为这是一个非常有趣的研究领域,也是一个可以添加到 Marble 2 的潜在功能,正如你所说。>> 是的。而且有机会实现动力学,对吧?>> 散点密度的情况如何?>> 我猜?>> 比如我们能渲染足够多的东西来获得非常高的分辨率吗?当我们放大时?我们是否受到你能够生成多少的限制?我们能够渲染多少?这些将如何获得超高保真度,可以说?>> 你有一些限制,但这取决于你的目标用例。>> 所以,我们场景中的一个主要限制是,我们希望事物能在手机上清晰地渲染。>> 而且我们希望事物能在 VR 头显中清晰地渲染。>> 所以这些设备比你在许多其他情况下拥有的计算能力要少得多。
嗯,而且比如如果你想得到一个 splat 文件,在四年前的 iPhone 上以高分辨率、高帧率,比如 30 到 60 帧每秒的速度进行渲染,那么你在处理的 splat 数量上就会受到一些限制。
嗯,但如果你可以在最近的,比如今年的 iPhone,或者最近的 MacBook 上工作,甚至如果你有一个本地的 GPU,或者如果你不需要,如果你不需要 60 帧每秒 1080p 的话,那么你就可以放宽限制,处理更多的 splat,这样你就可以在你的场景中获得更高的分辨率。
我曾期待的一个用例,但没有从你那里听到,就是具身用例。你现在只是专注于虚拟吗?
>> 如果你访问 World Labs 的主页,有一个叫做 Marble Labs 的特定页面。
>> 在那里我们展示了不同的用例,并且我们实际上将它们组织成更偏向视觉效果的用例,或者游戏用例,以及模拟用例。并且在其中我们实际上展示了这项技术可以极大地帮助机器人训练。对吧?这回到了我之前谈到的关于数据饥渴的问题。机器人训练确实缺乏数据。你知道高保真的真实世界数据绝对非常关键。但你就是无法获得大量这样的数据。当然,另一个极端就是纯粹的互联网视频数据。那么你就缺乏训练你的具身智能体所需的很多可控性。所以模拟和合成数据实际上是其中一个非常重要的中间地带。
我在这方面工作了很多年,其中一个最大的痛点就是从哪里获得这些合成模拟数据?你必须策划资产,然后构建这些复杂的场景,而在机器人领域,你想要很多不同的状态。你希望具身智能体在合成环境中进行交互。Marble 实际上非常有潜力帮助生成这些用于具身智能体训练的合成模拟世界。
>> 显然,是的,这就在主页上。它会在那里的。我只是,我当时就像,正如你所说,试图建立联系,你也必须建立一个商业模式,机器人市场显然非常巨大,也许你不需要那个,或者也许我们需要在走向具身化之前建立并解决虚拟世界的问题,然后显然是垫脚石。
>> 那还有待决定。我确实认为,>> 因为其他人都直接走向那里了 [笑声] 对吧?
>> 不是所有人都这样,但我想说有一种兴奋感。但你知道,我认为世界足够大,可以容纳不同的方法。
>> 是的。方法。
>> 是的。
>> 是的。我的意思是,我们一直认为这是一项相当横向的技术,随着时间的推移,它应该能够触及许多不同的行业。而且,你知道,Marble 目前更侧重于创意产业,但我认为驱动它的技术随着时间的推移应该适用于许多不同的事物。而机器人技术是其中之一,你知道,可能很快就会发生。
>> 另外,设计,对吧,与创意非常接近。
>> 哦,是的。绝对。比如,我认为这就像建筑方面的东西。
>> 是的。好的。是的。我的意思是,我我我开玩笑说在网上。我在 Slack 上发布了这个视频,就像,哦,谁想用 marble 来规划你的下一个厨房改造?它实际上已经很适合了。只需拍两张你的厨房照片,在 marble 中重建它,然后使用编辑功能看看如果你更换台面、更换地板或更换橱柜,那个空间会是什么样子。而这是我们,你知道,我们并没有特别为这个用例构建任何东西,但因为它是一项强大的横向技术,你就会得到这些新兴的用例,它们只是从模型中自然产生的。我们有一些早期 beta 用户正在使用一个 um um API 密钥,它已经在为室内设计用例构建了。
>> 我刚做了我的车库。我应该知道 [笑声] 这个。我得 >> 下次你改造的时候,我们可以帮忙。
>> 嗯,厨房是下一个,我敢肯定。
>> 是的。
>> 是的。我对整个空间智能领域感到好奇。我认为我们应该更深入地研究一下。你如何定义它,以及传统智能,人们可能会想到 LLM 的传统智能,当达里奥说我们有一个数据中心装满了爱因斯坦,那是传统智能,不是空间智能,要成为空间智能需要什么?
>> 首先,我不明白那句话,一个数据中心装满了爱因斯坦,[笑声]
>> 我就是不明白,它不是一个 >> 这是一个比喻,这是一个比喻。
>> 嗯,所以很多人工智能作为一个领域,作为一个学科,都是受到人类智能的启发,对吧?因为我们是目前所知的宇宙中最聪明的动物。而且如果你看看人类的智能,它是非常多方面的,对吧?有一个心理学家,我认为他的名字是霍华德·加德纳,在 20 世纪 60 年代实际上就直接称之为多元智能来描述人类智能。有语言智能,有空间智能,有逻辑智能,还有情感智能。所以对我来说,当我想到空间智能时,我认为它是语言智能的补充。所以,我个人不会说它是空间智能与传统智能的对立,因为我不知道传统意味着什么。我确实认为空间智能是对语言智能的补充,以及我们如何定义空间智能,它是使你能够推理、理解、移动和在空间中互动的能力。我用 DNA 结构推导的例子来说明,当然我这是在简化这个故事,但其中很多都与分子和 3D 空间中的化学键的空间推理有关,最终推测出双螺旋结构,而人类或弗朗西斯·克里克和沃森所拥有的这种能力,很难将这个过程纯粹地归结为语言。这是一个文明的巅峰时刻。但每天,对吧,我在这里试图抓住一个马克杯。整个过程是看到马克杯,看到它所处的环境,看到我自己的手,我的手张开的几何形状与马克杯匹配,并触碰到正确的可抓握点。所有这些都深深地是空间性的。这非常困难。我试图用语言来叙述它。但另一方面,叙述的语言本身无法让你拿起一个马克杯。
>> 是的。带宽限制。
>> 是的。
>> 我最近做了一些数学计算,关于如果你每天 24 小时不停地说话,你一天能产生多少个 token?以每分钟 150 个词的平均语速计算,大约每天产生 215,000 个 token,而你生活的世界比这高得多。 [笑声]
>> 嗯,我认为这是真的。但如果我想到艾萨克·牛顿爵士,对吧,当时有像重力这样的事物,还没有被语言形式化,人们在空间上就理解事物会落下,对吧?但然后以某种方式形式化它是有帮助的,或者你知道我们用来真正捕捉一些可以通过经验和空间理解的东西的所有这些不同的规则,但以一种更容易描述的方式。所以我很好奇空间智能和语言智能之间的相互作用,就像,好吧,你需要理解一些规则比语言更容易写出来,然后空间智能才能理解,但你不能,你知道,你不能把手这样放,然后放下这么多。所以我总是好奇它们如何相互利用。
>> 我的意思是,如果说牛顿的例子,牛顿之所以想到写下那些定律,是因为他有很多的具身经验,他观察过棒球比赛。
>> 完全正确。实际上,区分你提到的理论构建与在三维世界中具身化的日常体验是有用的。对吧?所以对我来说,空间智能就是封装了身处三维空间、在其中移动、看到它、行动它的具身经验。正如 Fay 所说,你可以叙述这些事情,但这是一个非常失真的频道。就像在世界上生活和在其中做事的概念,与试图描述它完全是不同的模式。但因为我们人类是动物,我们一直在空间中互动,所以我们甚至不认为这是一件难事,对吧?然后我们自然地跳到语言,然后是理论构建,作为一种机制来抽象出那种天生的空间理解。在某种意义上,LLM 已经直接跳到了那些最高形式的抽象推理,这非常有趣且非常有用。但空间智能几乎就像再次打开那个黑盒子,说也许我们因为直接走向那种完全抽象的语言、推理和沟通形式而失去了一些东西。
>> 你知道,作为一名视觉科学家,这很有趣,对吧?我总是觉得视觉被低估了,因为它对人类来说是毫不费力的。你睁开眼睛,作为一个婴儿,你开始看到你的工作。我们似乎天生就拥有它,>> 对吧?我们几乎天生就拥有它。但你必须努力学习语言,包括学习如何写作,如何掌握语法,如何表达,这使得它感觉很难。而大自然花费了更多时间来优化的东西,即感知和空间智能,却被人类低估了。
>> 有证据表明我们天生就拥有它吗?你说你几乎天生就拥有。所以听起来我们出生后确实会学习。当我们出生时,我们的视力较差,我们的感知能力确实会增加。但我们大多数人天生就拥有看的能力,而且我们大多数人天生就拥有将感知与运动联系起来的能力,对吧?我的意思是,运动本身需要一段时间才能完善,但是,而且动物是令人难以置信的,对吧?就像我今年夏天早些时候在非洲。这些小动物,它们一出生,几分钟内就必须行动起来,否则狮子就会抓住它们。而在大自然中,你知道,花了 5.4 亿年才优化了感知和空间智能以及语言。对语言发展的最慷慨的估计可能只有五十万年。
>> 哇。
>> 是的,[笑声]
>> 比我说的要长。嗯,我非常慷慨。是的。
>> 是的。不,我我我,你知道,我一直在看你的书,我一直在意识到,一个有趣的和我们在这档播客上讨论过的联系是语言模型基准,以及 Wow Grand 如何实际上设置了所有这些物理上的不可能,需要空间智能,对吧?比如 A 在 B 的上面,所以 A 不能掉下去 >> 是 >> 对我们来说很明显,但对语言模型来说可能会发生。我不知道,也许这是,你知道,下一个 token 预测的一部分。
>> 这就是我说的关于解开抽象的意思,对吧?如果你的整个世界模型只是说一个接一个的词语序列,那么就很难理解为什么不行。
>> 这实际上是不公平的,>> 对吧?但对我们来说显而易见的原因是,我们正在内部将其映射回我们熟悉的三维世界表示。问题是,我想知道,你知道,提炼出来有多难,需要多长时间?我用提炼这个词,我不知道你是否同意,从你的世界模型中提炼出来,然后放入语言模型,因为我们确实希望我们的模型拥有空间智能,对吧?我们是否必须完全抛弃语言模型才能做到这一点?
>> 不。
>> 不,对吧?我不这么认为,对吧?
>> 我认为它们是多模态的。我的意思是,即使是我们的模型 Marble,今天也接受语言作为输入。
>> 对。
>> 对。所以它是深度多模态的,而且我认为在许多用例中,这些模型将协同工作,也许有一天我们会有一个通用模型。
>> 我的意思是,即使你这样做,也有一个实际的问题,人们使用语言,人们希望使用语言与系统进行交互。即使是出于实际原因,构建系统、构建产品和构建模型也很有用,让人们可以与它们交谈。所以我看不到它会消失。我认为有一种智力上的好奇心,就是说,在智力上,你可以构建一个只使用视觉或只使用空间智能的模型。我不知道那是否会有实际用途,但我认为这将是一个有趣的智力或学术练习,看看你能把它推多远。我认为,不是要回到物理学,但我很好奇,如果你有一个高度精确的世界模型,并且没有给它任何关于我们当前对标准物理模型理解的概念,它能从中得出多少东西,并从头开始重现?以及它需要什么级别的语言理解?因为我们有太多的符号,我们有点使用它们,我们创造了它们,但也许我们会想出一个非常不同的模型,但仍然准确。我想知道我们有多少是受限的。但我你知道,人们说人类总是需要成为人类,因为世界是为人类建造的,在某种程度上,我们构建语言的方式也限制了我们从其他模态中获得的一些输出。所以我非常期待关注你的工作。
>> 是的。我的意思是,你甚至不需要做人工智能来回答这个问题。你可以发现外星人,看看他们有什么样的物理学,对吧?他们可能有 >> 让我们面对现实吧,到目前为止,我们是宇宙中最聪明的动物,>> 对吧?所以,所以你,我的意思是,但这确实是一个有趣的问题,对吧?我们对宇宙的认识和我们对物理学的理解,是否在某种程度上受到我们自身认知的限制,或者受到我们自身技术演进的路径依赖的限制?一种方法是,你几乎想做一个实验,说,如果我们再次重演人类文明,我们会以相同的顺序得出相同的物理学吗?我认为这不是一个非常实际的实验。
>> 我想知道人们可以进行的一个实验是,我们现在有很多关于行星或天体运动的天体物理学数据,只需将数据输入模型,看看牛顿定律是否会出现。
>> 我的猜测是,它可能不会。
>> 这是我的猜测。牛顿定律的抽象级别与这些语言 LLM 所代表的级别不同。
>> 是的。所以我不会惊讶,如果给定足够的天体运动数据,一个 LLM 实际上会预测出非常准确的运动轨迹。比如说,我发明了一个围绕恒星运行的行星,并且有足够的数据,我的模型会告诉你,在第一天它在哪里,第二天它在哪里。我不会感到惊讶。但是 F=MA 或者“作用力等于反作用力”。那是一个完全不同的抽象级别。那已经超出了今天的 LLM。
>> 好的。你需要什么样的模型才能不让它成为一个地心模型?因为如果我只用视觉数据进行训练,那么认为太阳绕着地球转是合理的,对吧?但显然事实并非如此。那么它将如何学习呢?就像我很好奇所有这些,你知道我们谈论的力,就像有时你不需要它们,因为只要它看起来正确,它就是正确的,但当你跳到尝试使用这些模型来做更高层次的任务时,我们能在多大程度上依赖它们?我认为你需要一种不同的学习范式,对吧?所以,你知道,这里发生了一些混淆,你说的是 LLM 和语言和符号,与人类理论构建和人类人类物理学,它们非常不同,因为 LLM 就像人类的目标函数是理解世界并在你的生活中茁壮成长。而你做到这一点的方式是,你知道,有时你观察数据,然后你思考它,然后你尝试在世界上做一些事情,它不符合你的期望,然后你想去更新你对世界的理解。人们一直在这样做,无论是,你知道,我以为我的钥匙在楼下,所以我下楼去找它们,我没找到它们,哦不,它们实际上在我的卧室里。所以我们,因为我们一直在与世界互动,我们不断地需要建立关于我们周围世界正在发生什么的理论,然后证伪或为这些理论添加证据。我认为这种过程被放大并扩展就是 F=MA 和牛顿物理学。我认为这与我们训练的模型模态有点无关,无论是语言还是空间。我的说法几乎就像,这几乎是更有效的学习,因为你有一个假设,这里是我的可用数据所允许的各种可能的世界,然后你进行实验来消除不可能的世界,并解决那个正确的世界。对我来说,这也是我拥有心智理论的方式,就像我有一个假设,你正在思考什么,你正在思考什么。我尝试创建行动来解决它,或者检查我关于你在想什么的直觉。你知道,而 LLM 显然不会做这些。
>> 心智理论可能还会分解成甚至情感智能,而今天的 AI 实际上根本没有触及。对吧?而且我们真的非常需要它。你知道人们开始过度依赖这些东西,这可能是另一个辩论的全部话题。我必须问,因为很多人都把这个发给了我们。我们必须放弃多少?你知道,序列到序列建模是不是要被淘汰了?注意力机制是不是要被淘汰了?我们要求一切的程度是多少?
>> 我认为,我认为你应该坚持那些有效的东西,[清嗓子] 我认为注意力机制仍然存在。我认为注意力机制仍然存在。我认为有很多,你不需要修复那些没有坏的东西。嗯,而且,世界上有很多难题需要解决,但让我们一次专注于一个。嗯,我认为思考新的架构或新的范式或截然不同的学习方式非常有趣。嗯,但你不需要扔掉所有东西,只是因为你在处理新的模态。
>> 我认为序列到序列实际上是在世界模型中。我认为我们将看到超越序列到序列的算法或架构。
>> 哦,但但这里实际上有一点,你知道,技术上的混淆,而 Transformer 已经为我们解决了这个问题,对吧?就像 Transformer 本身并不是序列模型。Transformer 本身是集合模型。嗯,这非常强大,但是因为,很多 Transformer 是从早期基于循环神经网络的架构发展而来的,而 RNN 确实有一个内置的架构,它们确实模拟了一维序列。好的。
>> 但 Transformer 本身就是集合模型,它们可以模拟很多集合,这些集合可以是,你知道,一维序列,也可以是其他东西。
>> 所以你字面上的意思是集合论,就像 >> 是的。是的。所以,无论。
>> 是的。是的。所以 Transformer 实际上并不是一个 token 序列的模型。Transformer 实际上是一个 token 集合的模型,对吧?唯一注入到标准 Transformer 架构中的顺序的东西是赋予 token 的位置嵌入,对吧?所以,如果你选择给它一个一维位置嵌入,那就是模型知道它是一维序列的唯一机制,但所有在 Transformer 块内部发生的运算符要么是 token 级别的,对吧?所以,要么有一个 FFN,有 QKV 投影,有每个 token 的归一化,所有这些都独立地发生在每个 token 上,然后通过注意力机制在 token 之间进行交互,但那也基本上是,它具有排列等变性,所以如果我排列我的 token,那么注意力算子就会以完全相同的方式 [清嗓子] 输出一个排列的输出。所以,它实际上是 token 集合的原生架构。
>> 字面意思是变换。
>> 是的。 [笑声]
>> 在数学术语中。
>> 我知道我们时间不多了,但我们只是想给你一个号召行动的机会,无论是关于那些会喜欢在 World Labs 工作的人,应该申请什么样的人,在 World Labs 之外应该进行什么样的研究对你会有帮助,还是你脑海中的任何其他事情。我认为现在是一个非常激动人心的时代,可以超越语言模型,思考空间智能的无限可能性。所以我们实际上非常需要人才,从非常深入的研究人员开始,就像 Justin 刚才描述的那样,你知道,训练大型世界模型,我们需要优秀的工程师来构建系统,你知道,从训练优化到推理再到产品,我们也需要优秀的商业,你知道,产品思考者和市场推广以及商业人才。所以,所以我们非常需要人才。特别是现在我们通过 Marble 将模型暴露给了世界,我认为我们有一个绝佳的机会与更大的人才库合作,来解决模型问题,并为世界提供最好的产品。
>> 是的,我认为我也很高兴人们能尝试 Marble 并用它做很多很酷的事情。我认为它有很多非常酷的功能,很多非常酷的功能可以很好地结合在一起。
>> 在来这里的路上,Justin 和我都在说,人们还没有完全发现,好吧,它只有 24 小时 [笑声],还没有完全发现一些高级编辑模式,对吧?比如打开高级模式。你可以,就像 Justin 说的那样,改变瓶子的颜色,你知道,改变你的地板和改变树木,然后 >> 嗯,我实际上试过,但当它说创建时,它只是让我创建一个完全不同的世界。
>> 你需要点击高级 [笑声] 模式。这是一个很好的用户界面。
>> 我们可以改进我们的用户界面。记住要点击。
>> 是的,我们需要招聘人。我们从事产品工作。 [笑声]
>> 嗯,但有一件事我们从你们那里清楚地了解到的是,你们也在寻找智力上的无畏,这是你们作为原则持有的一件事。
>> 是的,我的意思是,我们是第一个在模型方面和产品方面都尝试这样做的人。
>> 非常感谢你们的加入。这很有趣。是的,感谢你们的邀请。
>> 是的。 [音乐]