📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

From Seeing to Doing by Fei-Fei Li at NeurIPS

DSAI by Dr. Osbert Tay1:03:17

Transcription

[音乐] 谢谢。 感谢大家的光临,也感谢 Nurips 的邀请。 这真是莫大的荣幸。 我一直觉得自己是机器学习的学生。 所以很高兴来到这里。 今天我要和大家分享的演讲是关于视觉智能,题目是从“看见”到“行动”:攀登视觉智能的阶梯。 我经常以这张图像开始我的演讲,这是我最喜欢的图像之一。 这是在整个地球历史上,没有任何人或动物曾经见过的景象。 这就是我所说的“第一缕光”。 “第一次飞翔”发生在 5.4 亿年前。 那是海洋中简单的动物第一次发展出动物身体头部第一个感光细胞,并第一次瞥见外部世界是什么样子的时刻。 从那时起,半个多亿年前,视觉智能的进化就开始了。 但更重要的是,视觉、发展眼睛、发展视觉智能的进化与整体智能的进化是深深地、深深地交织在一起的。 如果不是因为看见和感知的能力,我们就不会有今天的成就。 我们就不会成为我们所知的宇宙中最复杂的动物。 事实上,人类的发展始于看见和感知世界,这比我们能够说出第一个词要早得多。 据说婴儿出生后几个小时就具备了手眼协调能力,从而感知这个世界。 在我们整个人类发展过程中,在我们的一生中,我们都利用视觉和感知来做事、学习、与世界互动。 不仅每个个体人类都依赖视觉智能来理解和认识世界。 我们的文明建立在视觉智能之上。 我们可以记录人类文明中的许多里程碑。 我只是列举一些最令人难忘的,从古代帝国的建设,到第一次瞥见工业革命和工业设计,到现代城市的建设,到 DNA 结构科学发现,到艺术和电影的杰作,再到我们在这里建造的机器世界。 所有这些都需要人类运用我们的视觉智能以及我们大脑的其他部分。 因此,在过去的三十年里,我一直充满热情地追求,并且与在座的许多人一起,我们一直在探索如何构建具有视觉智能的机器? 我们确实取得了长足的进步,我想从一点历史开始,然后进入现在和未来。 对我个人而言,这段历史始于我还是研究生的时候。 我和我们领域的一位资深教授聊了聊,谈论什么是计算机视觉,那是在世纪之交的 2000 年代。 我们对计算机视觉知之甚少。 我们对如何构建具有视觉智能的机器知之甚少。 于是教授告诉我,他给我看了一页他孩子们的书,上面画着三只熊猫。 我找不到原页了,所以请 Dolly 帮我画了。 然后他说,费,视觉智能就是看到这些笔触,理解你所看到的。 理解熊猫,理解它们在做什么,理解它们背后的故事。 这对我来说是视觉智能的第一个启示。 在理解视觉、创造具有视觉智能的机器时,我们首先要做的是理解世界,根据视觉像素对语义内容或感知属性进行标记。 诸如对象分割、视频分类、人物等标签,以及人类视觉理解的许多方面,我们都可以深入探讨。 当然,一个问题是,我们应该首先解决视觉理解的哪个问题? 在理解方面,我们应该如何解锁计算机的视觉智能能力? 这正是我在计算机视觉领域开始我的旅程的地方。 我们关注的最重要的北极星问题之一是物体识别。 为什么? 现在这很容易。 我们看到了所有令人难以置信的进步,但我们却忘记了,就在大约 25 年前,我们不知道北极星问题是什么,我们从人类认知科学和神经科学中寻求灵感。 在世纪之交,神经科学家和神经生理学家开始告诉我们,识别和分类物体的能力是人类与生俱来的。 我们在这方面很快。 我们甚至有人类神经相关的区域,我们大脑中有一些区域可以识别面孔和地点。 因此,我们在机器视觉领域的探索就始于创建能够进行物体识别的算法。 你们中的许多人甚至还没有出生,但在这一探索的早期阶段,机器学习开始成为计算机视觉和视觉智能最重要的工具之一。 我自己的,如果你来新视界 2004 年,20 年前,论文将是核方法,将是贝叶斯网络条件随机场提升,以及词袋模型潜在过程,所以很多工作都发生在机器学习期间,但在机器学习期间,说实话,这仍然只是实验,没有什么真正奏效。 而且,不仅事情没有奏效,我们还在解决一些与真正的视觉智能相比过于幼稚的问题。 对我来说,这很可笑。 我智力旅程中的一位英雄是已故的欧文·比尔曼教授。 我称之为比尔曼数字。 欧文·比尔曼是一位心理学家,他在 1983 年推测,人类在六岁时就能识别数万个物体类别。 这个数字是惊人的。 它比当时当代数据集正在处理的类别数量还要多。 当时,我们的机器学习和计算机视觉领域正在处理包含几十个物体类别、数千或数万个数据的图像集。 因此,我和我的学生们认识到,我们需要一种新的机器学习思维方式。 这不仅仅是算法,更是泛化问题。 泛化问题实际上是模型容量与模型使用的数据的结合。 而且也不仅仅是数据的数量,而是数据的多样性。 这就是我们于 2009 年与我的学生 Jan 和 Ogreovski 以及许多其他人一起推出的 ImageNet 项目。 ImageNet 当时所做的就是重新启动了一类经典的算法,称为神经网络。 在座的各位都知道,2012 年,杰夫·辛顿教授和他的学生提出的 AlexNet 在物体识别或物体分类的 ImageNet 挑战赛中获胜。 许多人认为那是深度学习革命的开端。 但我个人学到的,也希望这个领域从那时起学到的,是数据和算法一样重要。 至今,无论我们在深度学习、人工智能、生成式人工智能方面取得了多大的进步,其中很大一部分都依赖于数据。 因此,从计算机视觉领域的角度来看,数据,尤其是 ImageNet 挑战赛,确实打开了重要工作的大门。 这只是 ImageNet 挑战赛历史上获胜者或重要作品的一个样本子集,从 AlexNet 开始,一直到许多其他重要作品。 即使我回顾计算机视觉的历史,我们也必须停下来思考,科学有时是由多种力量的汇聚而成的。 就在 ImageNet 被提出的同时,神经网络或深度学习也得以重生,Nvidia 也制造了 GPU。 因此,这三个要素:神经网络、GPU 和大数据,现在被称为催生现代人工智能革命的三个要素。 许多人称 2012 年为卷积神经网络在 ImageNet 挑战赛中获胜的现代人工智能的诞生之年。 但这只是一个插曲。 现在,让我们继续探索视觉理解的征程。 我们在机器学习社区。 我们学到的最重要的东西之一是表示。 事实证明,要解决视觉理解中的重要问题,无论是 ImageNet 的物体识别挑战,还是 COCO 数据集的物体检测,还是分割等许多其他重要问题,我们都需要很好地学习表示。 在这里,我想归功于 Kaiming He 和他的同事们的一系列工作,从 ResNet 开始,它在 2015 年赢得了 ImageNet 挑战赛,并且也受到了来自 Transformer 和 BERT 的 NLP 工作启发。 Kaiming 的这项工作将 ResNet 和 BERT 引入了掩码自编码器(MAE)的工作,用于表示学习,它接收图像的掩码块,并尝试以自监督的方式学习图像的基本表示。 其思想是,如果我们进行这种自监督学习,我们将有更好的方法来泛化物体识别或检测等视觉理解任务。 我的学生 Aram Gupta 最近将这一想法向前推进了一步。 他没有关注静态图像中的 MAE,而是关注视频中的 MAE,我们使用一种非对称的方式来编码时间顺序的成对帧。 因此,我们将获取第一帧的所有块,然后是稍后帧的块的掩码版本,并通过视觉 Transformer 自监督学习框架学习时空视频的表示。 这项工作的结果是,Siamese MAE 表示法在从重建到语义分割再到关键点检测的许多视觉理解任务上具有更好的泛化能力。 这是注意力图的可视化。 我确实想说,虽然我们的实验室在视觉理解方面工作,但在视觉理解领域还有许多其他令人兴奋的工作正在进行,例如细粒度物体识别、姿态估计、实例分割、活动识别等等,我在这里不是要详尽地介绍所有这些工作,但这还不够,实际上是令人深感不满意的。 许多视觉理解和视觉推理超出了我们在像素中看到的内容。 例如,物体之间的关系对我们理解视觉世界至关重要。 物体恒存性也是如此。 你昨天听说婴儿即使在物体离开屏幕后也能保留对物体的认知。 所以,有些东西超出了像素。 这就是我称之为视觉智能推理的下一步。 推断或推理超出可见像素的信息的能力。 例如物体关系。 这两张图片有相同的物体,但关系却截然不同。 这是我的前学生 RJ Krishna,他就在听众席中,我们使用场景图表示来解决这个问题。 当然,这种表示图像中实体之间关系的方式不仅可以帮助我们推断常见关系,例如人坐在椅子上。 它还有助于我们进行零样本学习,例如人坐在消防栓上。 数据再次发挥了重要作用。 Randy 和我们的合作者一起整理了这个名为 Visual Genome 的大型数据集,其中包含数百万张图像、数十万张经过标注的图像、数百万个关系、数百万个描述以及数百万个问答。 Visual Genome 之后的一项工作是视觉问答工作,例如 Visual Genome 中的七个 WQA 数据集,我们研究了七个 W:什么、哪里、何时、为什么、如何以及哪个。 我的前学生 Yukru 在 2016 年就进行了视觉问答的早期工作,后来我的前学生 Alan L,实际上是两年前在 NeurIPS 上,将这项工作扩展到动态场景,并开始研究物体关系以及多物体、多参与者活动理解和推理工作中的描述。 当然,推理的终极标志是你能讲述一个故事。 这是由我的前学生 Andrej Karpathy 开始的一系列工作,后来传给了 Justin Johnson 和 John Krauss,他们在 2015 年首次使用早期的顺序模型,甚至不是顺序模型,而是早期的 LSTM 模型和 CNN 模型来进行图像字幕生成,然后是密集字幕生成,然后是段落字幕生成。 这实际上是该领域近 20 年工作之后,我第一次看到计算机复制人类讲故事的能力的萌芽迹象,但我不知道有多少人看过 Andre 几年前的推文。 所以,一旦我们完成了图像字幕生成工作,我想我半开玩笑地对 Andre 说:“反过来做,给出一个句子,生成像素。” Andre 非常明智地知道他需要毕业,所以他说不。 但令人难以置信的是,这个想法在几年后实现了。 因此,超越讲故事,超越推理,视觉智能的下一步是生成。 生成不仅仅是理解像素之外的信息。 它是关于创建新的像素或修改现有像素。 所以这是更进一步的一步。 在图像生成很久之前,我的前学生 Justin Johnson 也是最早向我们展示视觉风格迁移的人之一。 他在实时视觉风格迁移方面做了开创性的工作,他和 Arim 将其进一步扩展到视频风格迁移。 我真的很喜欢这项工作。 但随后,机器学习社区发生了一系列突破性工作。 其中一项获得了今年的“时代测试奖”——生成对抗网络(GAN)和变分自编码器(VAE)。 这两项工作开始向我们展示生成像素的可能性。 同样,Justin 和 Arim 也是计算机视觉领域最早的团队之一,他们将语言输入算法并生成像素。 当时我们对自然语言还不太擅长。 所以我们不得不将句子翻译成场景图结构,然后使用 GAN 算法将场景图翻译成场景布局,然后使用该场景布局和卷积神经网络将其翻译成像素。 这是当时与 Stack 的开创性工作同时进行的当代工作,你可以看到生成的像素非常模糊,因为分辨率很低,但尽管如此,当我为这次演讲提取这些幻灯片时,我还是很欣赏计算机视觉和机器学习的历史,仅仅六年前,我们就能够为自然场景生成一些最早的像素。 在计算机视觉领域,它们看起来是这样的。 但很快,扩散模型出现了,基于 Transformer 的扩散模型也出现了,许多人——我不可能完成所有引用——都为此做出了贡献。 我只想推广我实验室的一项工作,由 Arim Gupta 最近在 ECCV 上发表的视频生成模型 Walt,它同时接收图像和视频,对这些信息进行编码,并通过扩散网络进行处理。 老实说,细节并不重要。 但即使在第一个 Sora 发布之前几个月,我们就能发布这项视频生成工作,使用的 GPU 要少得多。 从 Andre 的论文到 Arim 的论文,从理解到推理再到生成,这是一项了不起的成就。 将所有这些放在一起,正如你所看到的,我们开始看到视觉智能的任务或北极星能力的这些关键领域:理解、推理和生成,所有这些都只发生在数据驱动算法时。 所以,如果我必须,我将它们放在一个梯子上。 我知道没有任何东西是完全线性的,但攀登这个梯子展示了机器智能在视觉领域从理解到推理再到生成的进步,这得到了数据和算法的支持。 但这就是全部故事吗? 根本不是。 这是非常有趣的事情。 从感知到语言,有些根本性的不同。 语言本质上是生成性的。 自然界中没有叫做语言的物理实体。 这是我们思维的方式。 但世界是真实存在的。 事实上,这种对真实世界的生态方法非常重要。 伟大的心理学家 J.J. Gibson 曾说过,有人转述了他的话。 不要问你的头脑里有什么,而要问你的头脑在什么里面。 我最喜欢的现代哲学书之一是哲学家 Andy Clark 的《监督心智》,他有一句我将在此引用的话:如果我们的心智本身可以包含我们社会和物理环境的方面,那么我们创造的社会和物理环境就可以重塑我们的心智以及我们的思考和推理能力。 无论是 J.J. Gibson 还是 Andy Clark,这些人,心理学家和哲学家告诉我们的是,智能中有些东西比单独看待它更深层。 我们的智能,我们的视觉智能取决于我们所代表的世界,取决于我们与之互动的世界。 因此,事实上,我想呼吁一个在计算机视觉和机器学习领域之外的姐妹领域,虽然历史上曾有过一段时间,但现在正开始与我们互动,那就是图形学领域。 在过去的几十年里,图形学领域的许多人一直在致力于与世界互动这一想法。 但到目前为止,我展示的一切都是关于一个平面世界的互动。 这是二维的互动。 这些图像,这些视频都是平面的。 我们可以进一步说,同样的事情也适用于语言。 即使你看看当今最全能的 LLM,世界也只是文档,或者你可以输入更多的多模态信号。 它仍然是一个平面世界加上文档。 所以,从根本上说,我到目前为止所说的一切都是一个平面地球。 你可能会想,她为什么会谈论这个? 我们如此有能力。 我们在平面地球上看到了这么多事情,而且它似乎如此强大,以至于我们不必担心它。 这实际上是不对的。 有很多事情是无法解决的。 我可以给你列出很多问题,如果我们只在平面地球上工作,比如奇怪的伪影和困难的推理,图像生成会变得很奇怪。 处理遮挡很困难。 互动方式有限。 但我考虑过。 我想我只会给你举一个例子。 所以我们中的一些人拍了几张某人酒窖的照片,并对这个空间进行了重建,这个重建给了我们这个世界的数学模型,然后我们在这个世界中插入了一个虚拟球,它非常直观,球实际上可以遵循物理定律,并在这个 3D 世界中某个地方移动。 但如果你将同一个虚拟球放入一个 2D 视频或 2D 图像中,球就会到处乱飞。 这就是 3D 世界和 2D 世界之间的显著区别。 尽管在 2D 世界中有很多工作要做,但从根本上说,我今天想启发你们思考,在 3D 世界中有更多的事情要做。 所以,让我带回这只熊猫,因为我整个职业生涯的灵感都来自于这本儿童书的这一页。 但我没有告诉你谁告诉我的,这是我最喜欢的视觉科学家之一,麻省理工学院的 Ted Adelson 教授。 他启发了我思考视觉智能。 虽然这对我很重要,但 Ted 并不以这个故事闻名。 Ted 在视觉科学方面最著名的工作之一是著名的棋盘错觉。 你们中有多少人见过这个错觉? 好的,我印象深刻。 有些人举起了手。 所以,如果你没见过这个错觉,看看方格 A 和 B,你会认为它们是完全不同的灰色调,对吧? 它们不可能有相同的灰色调,但它们几乎占据了整个场景。 突然你意识到这两个方格的灰色调完全相同。 这是著名的 Ted Adelson 错觉。 那么这个错觉告诉我们什么? 有很多种解释。 对我来说,它讲述了进化的故事。 3D 进化的故事,人类如此倾向于理解地球不是平的,圆柱体有体积,光源在空间中的某个位置,并且会投下阴影。 所有这些都给了我们,我们非常擅长理解这个 3D 世界,以至于我们可以产生这种错觉。 柏拉图当然也知道这一点,早在 2000 多年前。 柏拉图告诉我们视觉是什么。 他以洞穴寓言为例。 他说视觉,人类视觉类似于以下事情。 想象你有一群囚犯。 你把他们绑在椅子上,让他们面对一面平坦的墙。 然后在他们身后正在上演一出戏。 这出戏是由光投射到平坦的墙壁上。 所有这些囚犯能做的就是盯着他们脑后这幅戏的 2D 投影,并推断出这出戏是关于什么的。 这就是视觉的问题。 我们生活在一个 3D 世界中,但我们的投影是 2D 的。 我们必须弄清楚发生了什么。 所以,这是我今天想重点关注的一个论点:自然世界是 3D 的,不仅我们的物理世界是 3D 的。 我们的数字世界也变得越来越 3D。 无论我们谈论内容创作、游戏、AR/VR,还是机器人技术,所有这些都变得越来越 3D。 所以,对我来说,回到原点,新的阶梯是 3D 阶梯,我称之为空间智能。 让我们通过一些 3D 视觉智能阶梯上的工作来了解一下。 让我们从理解和推理开始。 我告诉过你 Visual Genome 项目,它都是关于 2D 推理的。 但我们应该承认,在人工智能领域有一些先驱,他们一直在进行 3D 推理,或者至少在 70 年代就告诉我们我们需要进行 3D 推理,比如 Terry Winograd。 他的工作是研究 3D 几何形状并让计算机程序进行推理的开创性工作。 当然,当时没有深度学习。 没有神经网络,或者至少在这项工作中没有。 所以,它并没有真正奏效。 我的前学生 Justin 作为他论文的一部分,做了第一个 3D 推理数据集之一,名为 Clevver,他使用 Clevver 和一些早期深度学习算法来推理物体之间的 3D 关系。 同样,细节在这一点上并不重要。 我只是想让你尝尝它的味道。 在这次 NeurIPS 上,我现在的学生 Kashik 正在展示我们的视频基准测试,该基准测试专门用于基准测试 MLLM 在 3D 长视频中理解和推理的能力。 我们使用了 Eagle 4D 数据集和数百小时的视频,并设计了一个高质量的多项选择题,涵盖 77 个日常场景和 18 个不同的任务,例如感知和跟踪任务,如识别摄像头佩戴者与之互动的独特个体,或导航和 3D 推理任务,例如摄像头佩戴者如何从厨房到达后院? 重点是,你应该看看他的工作,但重点是今天的 MLLM,Gemini 和其他一些工作,GPT-4 与人类相比表现不佳。 人类专家表现超过 80%,而目前的 MLLM 之间存在巨大差距。 因此,在 3D 推理方面,无论是在空间还是时间方面,都有很多工作要做。 现在让我们谈谈生成。 我在过去几年中看到的计算机视觉领域最令人兴奋的革命之一是重建和生成的结合。 在座的许多人都为这一令人难以置信的工作做出了贡献。 经典计算机视觉中的 3D 重建是从一个或多个图像中重建 3D 结构。 你已经看到了像“一天建成罗马”这样的经典作品。 但最近,由于伯克利人(包括 Ben Mildenhall)的 NeRF 工作,我们开始看到密集重建,并将密集重建与扩散模型结合起来。 去年发生的一些开创性工作是来自 Google 的研究人员在 DreamFusion 和 0123 中。 这些工作结合了重建和生成,并已成为创建 3D 对象和 3D 场景的更强大的工具。 我的学生与 Jadrin Wu、Kaio Sergeant 以及我们在 Google 的合作者一起,将 0123 的工作向前推进了一步,并创建了 Zero-MVS 工作。 这是今年 CVPR 发表的从单个图像进行零样本 360 度视图合成的工作。 我将跳过这个想法,这个想法基本上是训练一个相机条件扩散模型作为 3D 表示的监督,并从 DreamFusion 的工作中学习了很多,结果是给定一个物体或场景的单个图像,我们能够重建整个 360 度场景或整个 360 度物体。 我的学生 Tien Xiang 采用了类似的方法,但将其应用于动态人体,他使用基于 NeRF 的方法来重建动态人体运动,即使有遮挡。 我将跳过细节,这是去年 ICCV 发表的一项工作,我们将其与一项名为 HumanNeRF 的经典工作进行了比较,我们在定量评估和定性评估方面都做得更好,例如这段视频,其中人体被遮挡,我们的算法能够重建完整的人体。 因此,我快速展示了我们实验室在 3D 视觉智能阶梯上的一些工作。 但我想停下来强调一下,当我们考虑 3D 世界时,还有更令人兴奋的事情,那就是互动。 因为从根本上说,为什么进化会创造感知? 我的推测是,进化创造感知不是为了我们或动物坐着数它们看到的猫的数量。 它是为了让动物和代理能够移动和做事。 记住,在我们的一生中,我们一直利用感知来做事、了解世界并与世界互动。 因此,3D 中的空间智能真正催化了看见、学习和做的良性循环。 当然,当我们想到“做”时,我们会想到机器人。 当我们想到机器人时,我们会想到机器人为我们做家务。 特别是如果你是一名研究生,你希望机器人为你做饭、做早餐、洗衣服,甚至写论文。 但今天的机器人还没有达到那个水平。 今天的机器人仍然很脆弱。 它们仍然在任何有机环境中,它们倾向于泛化能力不强。 这个可怜的机器人。 问题的一部分是,今天的许多机器人研究仍然集中在简单的环境和任务上,实验是由各个实验室挑选出来的,规模很小,缺乏标准和基准指标。 而真实世界是生态复杂的、动态的、变化多端的、互动的和多任务的。 我们应该从视觉和 NLP 中吸取教训。 在深度学习的十年里,我们学到的最重要的一点是数据和多样化数据的重要性。 所以我想利用这段时间来关注一下我实验室在机器人学习领域的一些数据驱动的工作,我将从一个名为 Behavior 的项目开始。 Behavior 是机器人学习和具身人工智能的一个新的北极星。 这是一个在虚拟互动和生态环境中进行日常家务活动的基准。 这是一个有点拗口的名字。 许多学生为 Behavior 做出了贡献。 目前,Behavior 由一千项日常任务组成,模拟环境使用了超过 10,000 个对象资产和 50 个真实世界场景以及一个强大的模拟器。 场景包括餐厅、办公室、公寓、学校和杂货店。 10,000 个对象资产包括每个对象的 30 多个属性,包括关节度、可变形性等。 然后,当你将 50 个场景、10,000 个对象、30 个属性相乘时,我们确实能够实例化无限数量的合成环境,你可以在上面训练机器人。 我们与 Nvidia Omniverse 团队合作创建了一个名为 OmniGibson 的模拟器,旨在实现物理和感知现实的逼真度,当然,我们也想进行 sim-to-real。 所以,至少这是我们早期的一项工作,我们在斯坦福大学我们系的地下室有一个真实的室内场景,我们的机器人移动操作机器人正在尝试执行 Behavior 环境训练我们的某些日常任务。 总而言之,Behavior 是一个高度复杂的环境,模拟了真实生活、真实事物和真实对象,允许各种机器人学习这些长周期任务。 我真的希望那些从事机器人学习的人能看看这项工作。 但 Behavior 只关注物理性质。 实际上只关注大部分视觉事物,但真实世界是多模态的。 这是我的前博士后完成的一项工作,我们称之为 Object Folder。 他创建了一个多感官对象数据集。 他选择了一千个对象,并通过非常受控的灯箱和 3D 扫描相机收集了视觉数据,通过声学外壳收集了声学数据,并使用冲击锤和麦克风记录了这些对象在不同接触点上的冲击声音,以及通过使用机器人手臂和 GelSight 传感器(也由 Ted Adelson 教授及其合作者开创)以及 RealSense 相机收集的触觉数据。 结果是我们拥有一个多感官对象数据集及其神经表示,你们所有人都可以使用它来了解对象的多种感官性质。 因此,不仅模拟很重要,不仅多模态很重要,真实世界怎么样? 我们必须将机器人学习从模拟转移到现实世界。 因此,我对几周前在 CoRL 上刚刚展示的数字表亲这项工作感到非常兴奋,这项工作由我的学生 Tienai 和 Josiah Wong 完成。 这个想法是,sim-to-real 非常困难,大多数人通过数字孪生来做到这一点。 我们必须以某种方式将现实世界提升为精确的数字副本。 但如果我们做不到呢? 所以我们想到了“数字表亲”这个词。 那么什么是数字表亲呢? 数字表亲不是现实世界的数字副本,而是力求保留相似的几何和语义可及性。 与数字孪生相比,数字表亲成本较低,可扩展性更强,手动工作更少,并且在驱动机器人学习的下游策略学习方面具有更好的鲁棒性。 因此,你可以做的是简单地拍一张场景的照片,然后使用这个场景通过模拟环境(如 Behavior)查询大量的数字表亲,然后用它来学习下游策略。 与数字孪生学习相比,数字表亲能够让你更好地泛化,因为它在学习对象方面并不精确。 这是现实世界实验,表明我们能够实现零样本转移。 当然,这些都是早期工作。 你可以看到环境仍然非常简单。 现在,到目前为止,我们已经谈论了数据,关于环境,关于对象,但关于可以教机器人如何移动手指的数据呢? 这是我想谈的第四项工作。 它是 DexCap,由我的学生 Chung Wan 和合作者 Karen Leu 以及许多其他人领导,他们没有使用笨拙的动作捕捉室,而是让受试者戴上运动手套,然后运动手套就能提供关于手指运动的更好的数据。 这是 Chin 在真实世界中进行真实世界任务,并收集高分辨率手指运动数据。 然后他利用这些数据来转移知识,并训练机器人手臂参与非常复杂的任务,例如这个茶艺的双臂任务。 这是一个非常复杂的设置,你需要使用这些勺子和刮刀来取出真正的茶叶。 然后这是另一个例子。 所以这些是收集数据或创建模拟环境来驱动机器人学习的许多不同方式。 但事实是,这远远不够。 与图像和自然语言不同,机器人数据非常难获取。 那么我们能否利用我们通过大型语言模型和大型视觉语言模型所了解的知识,进行一些零样本学习,或者至少利用我们已经完成的语言工作或多模态语言工作? 这是我们的一项工作,我们称之为 Voxoser 和 Recap,由我的学生 Wong 领导。 这是大致的想法。 如果你告诉机器人打开顶层抽屉,并小心花瓶,这对机器人来说实际上是一项非常困难的任务。 对于那些从事机器人学习的人来说,如果你处于稀疏奖励的情况下,学习这种策略非常困难。 但对人类来说,我们有太多的知识。 我们知道什么是顶部。 我们知道什么是抽屉。 我们知道花瓶是什么样的。 我们知道“小心花瓶”是什么意思。 那么我们能否通过 LLM 和 VLM 将这些人类知识转化为机器人的策略学习? 这就是 Wong 试图做的事情,他使用大型语言模型来帮助机器人创建一个运动图,该图不仅识别抽屉的位置,还识别如何避开花瓶。 这是现实世界的成果。 他在超过 20 个操作任务中进行了尝试,没有进行任何训练,因为你已经利用了通过 LLM 和 VLM 转移的现有知识。 不仅如此,到目前为止我们看到的还有空间组合,以及利用它来教机器人完成任务。 关于时间呢? 我们能做什么吗? 这是后续工作 Recap,我们不仅使用 LLM 和 VLM 来识别对象,还识别关键点,并将任务序列化,以便我们可以训练一个约束优化问题来教机器人如何规划最优策略。 我不会深入细节。 但这是一个双臂机器人,它识别了服务早餐的场景,识别了关键点,并学会了优化这些关键点的时空规划,然后最终完成了任务。 在这种情况下,我们展示了近 20 种不同的或 16 种不同的任务,这些任务是多阶段的,可以是反应式的,可以是双臂的,也可以是在野外的。 因此,到目前为止,我已经分享了我们使用 3D 空间智能进行的一些工作,这些工作不仅解决了视觉智能中的一些问题,还解决了机器人学习和具身人工智能中的问题。 我到目前为止分享的所有内容都是以 NeurIPS 社区成员的身份与你们交流的。 我们都热爱人工智能。 我们都热爱机器学习。 我们毫不怀疑这些工作。 但我想稍微放大一下,特别是对于那些学生来说,因为人工智能不再仅仅是一个学术领域。 我知道这是一个学术会议,但我走遍世界,听到那些从未参加过 NeurIPS、从未写过一行代码的人,他们通过新闻、播客、社交媒体了解人工智能,他们问我这样一个问题:那么,你们所做的一切有什么意义? ImageNet 的意义是什么? Behavior 试图解锁机器人学习的意义是什么? 我们可以生成 3D 场景。 在这个“那么”中,最重要的问题是:我们呢? 我们不是 NeurIPS 社区的任何人,我们是人民。 如果你看看关于人工智能的新闻,我们会听到很多关于对人类社会的威胁,特别是对人类劳动力的威胁,特别是关于机器人夺走工作和生计。 新闻不可能更令人警惕,对吧? 机器人正在窃取工作。 机器人能取代多少工作? 因此,人工智能的关键词变成了“取代”。 人工智能将取代人类。 但在这里,我想与你们分享的是,作为一名人工智能科学家,我相信有一个比“取代”更好的动词。 事实上,让我们用“增强”这个动词来取代“取代”这个动词。 人工智能之所以存在,是因为我们想用它作为工具来增强人类的能力。 我想快速举三个例子:人工智能增强医疗保健工作者,人工智能增强患者,以及人工智能增强创作者。 我会非常快,因为我知道我超时了。 在医疗保健领域,我们面临劳动力短缺问题。 医疗保健领域有很多黑暗角落,无论是手术室、病房、养老院还是药房,我们都没有足够的人手和眼睛来帮助我们的病人。 因此,在一系列与我在斯坦福的同事们合作的工作中,我们在医院和日常生活空间中放置了许多计算机视觉传感器。 我将跳过传感器的数量。 其思想是,我们可以利用人工智能,利用视觉智能来照亮医疗保健的黑暗角落,例如确保我们的护士和医生能够很好地执行手部卫生实践,以确保我们患者的安全,顺便说一句,医院感染每年在美国造成的死亡人数是车祸的三倍。 因此,我们使用这些深度传感器来帮助我们的医生和护士了解他们的手部卫生行为。 这种计算机视觉智能算法比人类观察者做得更好,因为它们不会疲劳,而且可以 24/7 进行。 我们还将这些传感器放在 ICU 中。 事实证明,ICU 患者需要非常小心地移动。 我的前学生 Serena Young 在 ICU 领域开创了许多工作,以帮助医生和护士正确地移动患者。 这是医院里最危险的环境,患者能够获得帮助非常重要。 最后但同样重要的是,在医疗保健领域,我们帮助老年人。 我们可以利用视觉智能来评估独立生活状况,无论是早期检测感染、活动能力变化、睡眠障碍、饮食障碍。 所有这些都可以通过人工智能的帮助来增强。 当然,还有更多。 在这项工作中,我们利用人工智能赋能瘫痪患者。 我们谈了很多关于人类任务、人类数据。 那么人机界面呢? 那么与最严重的病人的人机界面呢? 他们无法自己工作,因为他们瘫痪了。 在这项由 Jajin 和我的博士后 Rohan Jang 领导的工作中,我们让患者或受试者佩戴非侵入性脑电图(EEG)头帽,记录他们的大脑信号,并利用他们的大脑信号来指导机器人执行任务。 这里有很多机器学习细节。 基本上,它必须解码大脑信号并将其转化为机器人策略。 但这是安全、非侵入性且在时间域上具有高分辨率的。 这是一个人类受试者指导机器人烹饪日式料理的例子。 整个视频都是通过脑电波记录的。 没有人接触过这个机器人来执行这些任务。 我们在实验室完成了 20 个具有挑战性的长周期日常活动任务。 帮助人们还有很长的路要走,但这预示着一个令人兴奋的未来。 最后但同样重要的是,人工智能也可以增强创作者。 我们看到了很多生成艺术、生成图像、生成视频。 记住人类创造力是宝贵的,这一点非常重要。 它是我们能动性的组成部分,我们可以做的是帮助我们的创作者拥有更强大的工具。 这是我的同事们最近在 World Lab 的工作。 糟糕。 World Labs 正在改变其新模型的创意问题解决方法。 想象一下输入一个提示或使用参考图像,并在几秒钟内生成一个完全可导航的 3D 环境。 这简直太疯狂了,对吧? 这是以前不可能做到的。 我很高兴能分享一些这个模型可以应用的创意方式。 在处理大型项目时,通常需要构建场景并创建几何图形来布置道具和环境。 但这可能很耗时,并且几乎没有进行大胆实验的空间。 通过 World Labs 的模型,我可以快速生成多个完全 3D 的环境并测试各种场景布局,正如我在这个例子中所演示的。 这是另一个令人兴奋的用例。 一些动画工作室开始使用人工智能生成的图像作为背景。 然而,在不同摄像机角度保持场景一致性具有挑战性。 工作室通常会构建或购买 3D 环境,截取屏幕截图,然后使用 Stable Diffusion 等工具进行处理。 虽然有效,但这个过程可能需要数小时甚至数天。 通过 World Labs 的技术,我可以快速创建一个房间,选择角度,截取一些屏幕截图,然后可以使用 Comfy UI 或 Automatic 11-11 等图像生成器进行风格化。 这确保了具有一致外观的背景,同时保留了环境的感觉和结构。 我们也看到了视频生成方面的巨大进步。 然而,它们面临的一个主要限制是缺乏更长、更复杂的摄像机控制。 这种新的 3D 生成方法也解决了这个问题。 通过关键帧精确的摄像机运动,我可以导出渲染并将其通过 Runway 等视频到视频生成器运行。 这是 Runway 生成的输出。 这个过程非常快速和简单。 以前不可能达到这种精度。 这是 World Labs 技术的一个早期预览,但即使在这个阶段,它所能做到的也令人难以置信。 我非常期待看到这项技术如何发展以及它将为每个人解锁的创意机会。 World Labs 已经改变了。 好的。 所以那实际上是一位居住在欧洲的艺术家,他使用我们的技术来创造他想要的东西。 你可以访问我们的网站,了解更多关于我们 3D 世界的互动应用程序。 所以让我总结一下。 我刚才快速总结了我从计算机视觉角度看到的历史,特别是我们如何通过关注数据和算法,从理解、推理到生成,跨越视觉智能的阶梯。 我们已经看到了许多工作,特别是从 2D 到 3D 的转变,但还有很多工作要做。 我一直在思考我个人感兴趣的问题,从数据(3D、4D 数据、模拟)到生成问题(特别是可控性和一致性,以及机器人技术的生成)。 一些推理问题(我的合作者正在思考空间时空推理的理论)。 我们也知道,视觉理解和识别不是视觉智能中的一个软问题,在 MLMs 中有令人兴奋的工作,当然还有表示学习、实时扩散、长期策略学习、推理、实时推理、优化等等。 这是一个长长的列表,最后但最重要的是,人工智能是为了增强人类。 我们在医疗保健、机器人技术和生成式人工智能方面看到了三个快速的例子,可以帮助不同的人。 在企业人工智能、科学人工智能、教育人工智能、能源人工智能等方面存在无限的可能性。 我真的鼓励这一代学生关注人工智能与社会许多有影响力的领域之间的交叉点。 最后但同样重要的是,谢谢。 [掌声] 如果你好奇的话,我把这个发给了生成式人工智能引擎,它给了我这张图。 我们非常感谢您,这是一次非常鼓舞人心的主题演讲,我们有一些 Slido 上的问题。 如果您想问更多问题,请在那里提交。 由于我们稍微超时了,我将快速浏览几个问题。 一个非常受欢迎的问题是:您是否认为学习所需的数据量会减少? 这是一个很好的问题。 我经常收到这个问题:我们是否总是会遵循数据规模法则? 嗯,如果 [音乐] 我认为我们与数据的关系将会改变。 我认为我们可以用数据做很多事情。 在 3D 视觉、机器人技术等许多领域,我们仍然远远没有触及数据的表面,我们还有更多。 但与此同时,你知道,我们人类的发展表明,我们摄入的数据量远不如今天的大型模型。 所以,我们与数据的关系将会改变。 它将如何改变是一个非常有趣的问题。 谢谢。 还有一个非常有趣的问题,它似乎与您关于视觉智能对人类智能至关重要的陈述有关。 您认为我们可以从天生失明的人那里学到什么? 是否有我们可以从人工智能那里学到的人类智能增强部分? 是的。 非常关键的一点是认识到人工智能和人类智能并不相同。 因此,我们确实有视障人士,他们能力极强,这充分说明了我们大脑的神经可塑性。 有许多研究表明,当某人失明或失明,无论是天生还是后天事故或疾病造成的,神经可塑性都会重新连接或重新利用大脑的不同部分,而这是人工智能算法中尚未得到充分探索的领域。 谢谢。 我认为我们还有最后一个问题的时间,它与游戏 AI 的突破有关,这些突破通常依赖于同时模拟数千场比赛。 是否有可能制造出足够准确的机器人模拟器,或者我们将需要更有效率的数据训练方法来使用真实世界的数据? 是的。 这是一个很棒的问题。 嗯,我希望我下半场演讲中的一些内容已经指出了这一点。 我认为我们需要机器人模拟器。 我也认为现在看到不同的方法非常有趣。 我个人认为 3D 的显式表示非常非常重要。 它将在很长一段时间内非常非常重要。 所以,我们将拭目以待。 是的。 谢谢。 非常感谢您再次带来精彩的演讲,感谢您为我们的博士生和其他所有学生带来的启发,以及感谢在座的各位。 请在之后的展板环节继续。