Transcription
所以今天我将谈论我们 Skilled AI 的目标,即构建一个通用的、适用于任何机器人、任何任务的大脑。所以,任何机器人、任何任务,一个大脑。但我试图让这次演讲更具教育意义,不仅仅是展示我们做什么,而是普遍地介绍机器人领域的现状。看到这里的听众,以及普遍的 GTC,大家都知道存在巨大的、未被满足的全球劳动力危机。如果你看看目前的情况,有很多失业危机,但同时也有更多我们需要人的工作,而我们的人力资源却不足。这是一个日益增长的担忧,世界人口正在老龄化,对增长和工业化存在未被满足的需求。在美国也是同样的故事,如果你看看老龄化差距,随着人口老龄化上升,参与率下降,机器人技术并非真正是选择,而是对大多数公司来说是生存之道。这一点从 GTC 就非常清楚,这是 Jensen。我想是在去年的前年 GTC,非常清楚的是,物理人工智能是人工智能的下一个前沿。但是机器人技术有一个不幸的情况。在过去的 70 年里,机器人技术几乎一直存在。现在,机器人技术不是人工智能的下一个前沿。如果你回去读图灵以及人工智能的早期成果,它们都是为机器人技术而生的,就像人工智能是为机器人技术而开发的。考虑到机器人技术,这可以追溯到麻省理工学院的那个复制演示。就像这是 1950 年代的一个机器人,它看到这张图片,然后就能在桌子上组装积木,以匹配你看到的图片。所以机器人正在自主地尝试拾取积木,并在那里制作相同的结构。现在,这对人类来说是一项简单的任务。但如果你仔细想想,这需要理解图像是什么,理解三维,理解结构,然后将其应用于运动控制,并控制电机来完成这项工作。这发生在 1960 年,也就是 60 年前。
好的,这段视频我不知道你们是否看过。我来播放一下。这是一个非常精彩的。在费城的一次核能大会上,有一个展品,它具有大众化的完美公式。如果你今天看过机器人,你会发现完全相同的设置是为了展示大师的精确度。这是用于处理放射性物质的机械臂,可以快速地。它展示了老板如何让他的秘书点燃一支香烟。今天这在技术上并不完全正确。但就像所以看看这个人从后面控制机械臂。这是今天你会发现所有机器人公司都在使用的设置。有人能猜出视频的年份吗?实际上,声音和背景颜色已经暴露了。如果我在上面应用一个滤镜并改变声音,你会认为它是去年的。但这是 1957 年的,将近 70 年前。我敢肯定,在拍摄这段视频时,在座的大多数人甚至还没有出生,对吧?这是 70 年前。想象一下 70 年前,计算机在哪里?它们不存在,内存是以字节为单位的。在 70 年里,我们在语言和视觉方面取得了多大的进步,而我们在机器人技术方面又在哪里呢?你可能会说,这只是远程操作,但今天我们有自主视频。机器人正在进行跑酷。看看这些视频,机器人正在玩杂耍。在这里,它正在玩一个游戏,我总是记不起名字,这有点像桌上足球。是,是,是。是的。所以这是 1994 年的杂耍视频,而且都是自主的,因为你无法以如此高的频率操作这些任务。现在,你可能也看到过最近在 VAS 等方面的成果,比如机器人进行拾取和放置。这是 8 年前,由一位博士生在伯克利完成的。这项工作叫做 DexNet。一位学生,一台 GPU,没有 fancy 的集群,就能取得这样的成果。那么到底发生了什么?似乎机器人技术在过去的 70 年里一直在发展,但仍然没有真正实现。主要原因是大脑。一旦你构建了硬件,世界上就会有人能够让这些硬件做一些神奇的事情。但如果你需要一个非常通用的、可以部署到任何地方的结果,你需要它能够超越训练集。而这正是机器人技术的阿喀琉斯之踵。我们不知道如何将事物从一个场景转移到另一个场景,而这正是 LLM 和 BLM 今天非常成功的地方。这基本上就是所谓的莫拉维克悖论。莫拉维克是谁?你可能听说过这个词。汉斯·莫拉维克也是卡内基梅隆大学的教授,碰巧是 1950 年代人工智能和机器人领域的早期奠基人之一。在机器人技术和人工智能领域工作了 30 年后,他们得出了“难者易,易者难”的结论。我将在整个演讲中强调这一点。这是什么意思?人类普遍认为困难的事情,对人工智能来说其实很容易。例如,下跳棋,玩双陆棋,50 年前的人们就知道双陆棋这个游戏,就像今天的国际象棋和围棋一样。现在你可以自动化这些事情,早在 1980 年代,我们就能下国际象棋,在 1990 年代击败加里·卡斯帕罗夫。但是像孩子一样在棋盘上移动一枚棋子,仍然非常困难。所以我们对那些比其他人好 0.1% 的人类给予了很多赞誉。如果你能从这个距离将球投进篮筐,人们会付一百万美元来看你。这就是这个问题的核心。我们认为容易的事情,对机器人来说其实很难,而困难的事情却很容易。我将通过例子来解释原因。
那么,今天有什么不同?我们如何着手解决这个问题?我们如何避免机器人技术成为过去 70 年来一直存在的问题,并真正取得进展?现在,今天与过去 70 年有什么不同?那就是深度学习。那么,人工智能今天成功的秘诀是什么?这非常简单。获取大量、大量的数据,比你想象的还要多。然后训练尽可能大的模型。通常选择你能装进 GPU 的最大模型,或者你能训练的最大模型。然后,奇迹发生了。你可以创造出数亿美元到数十亿美元的公司,以及像今天你看到的英伟达那样的 5 万亿美元的市值。这就是人工智能的秘诀。现在,随着每个人都在谈论机器人技术是人工智能的下一个前沿,这个秘诀有一个大问题,那就是第一点。它需要数据,而且需要海量的数据。为了让你有一个概念,看看像 GPT 这样的模型,人们甚至不再公布它们训练了多少数据。GPT 3.5 训练了 100 万亿个 token。100 万亿。现在,在机器人技术领域很难达到这个规模,因为互联网上没有可用的数据。所以我不能去维基百科或谷歌下载所有图像来训练这些模型。同样,100 万亿是一个非常大的数字,人类很难理解一万亿有多大。所以你可以说,我们会去机器人上收集。我们会到处去收集。我们会收集那个规模的数据。现在,已经有大规模的尝试来扩展远程操作,例如谷歌的 RTX 论文,我也参与其中。机器人数据集的大小不到一百万。最大的数据集是这样。一百万和一百万亿之间的区别是 100 万亿。所以,在机器人技术领域很难扩展,因为人工智能真正工作的规模就是这样。
[清嗓子] 这就是我们试图弥合差距的地方。大规模地,我们正在构建一个通用的基础模型,用于机器人技术。它是一个真正通用的、可以跨越多种硬件、多种任务、多种场景工作的“大脑”。任何机器人,任何任务,一个大脑。表面上听起来可能是一个非常通用的模型。但如果你仔细想想,我在这里争论的是完全荒谬的。我说的“一个大脑适用于任何硬件”,无论是人形机器人,还是四足机器人,还是机械臂、手等等。为什么我们要如此通用?原因在于,在某种意义上,机器人技术存在数据问题。为了解决数据问题,我们需要数据。在这种情况下,乞丐不能挑肥拣瘦。我们不能说我只使用我这个版本机器人的数据,那个场景。机器人可能会改变。会有各种各样的机器人,不同的公司,不同的外形尺寸,它们可以部署到世界各地,我们应该能够使用来自所有来源的数据。所以,作为第一原则,如果你试图创建并利用大数据,你不应该对你使用的数据有任何限制。这就是 LLM 的魔力所在。LLM 之所以如此成功,是因为它们能够利用互联网上的所有数据,而无需选择干净的数据集。这就是其背后的主要目标。所以,我们的目标是利用地球上所有可能的决策数据源,并将它们转化为这个通用的“大脑”。我将在整个过程中解释它是如何跨场景工作的。但让我简要预览一下它是如何跨机器人工作的。所以在这段视频中,你会看到各种各样的机器人。它们都由 Skilled 的“大脑”控制。这是一个节奏很快的视频。之后我会放慢速度播放。所以在这个场景中,从最低级别的电机控制,到决定何时转弯、何时直行,或者使用物体,所有这些决策都由同一个模型、同一个“大脑”控制。你可以昼夜不停地在不同机器人之间转移。跨越机器人不同的自由度。六自由度到七自由度,七自由度到六自由度。决定何时转弯,而且它非常健壮。模型直接从视觉运行。因此,在需要协调视觉与动作的场景中,它非常稳定。例如爬楼梯,或者执行更精确的任务,如打包等。顺便说一句,地上的痕迹在那里。这是越野。我们不得不拍了三次视频,因为我们的摄像师带着相机摔倒了。长期导航,所有这些都是同一个模型的一部分。
好了,我们如何训练这个模型?好的,我们来详细说明一下。现在,在机器人技术领域,没有现成的数据集,对吧?我无法收集一个,因为它收集起来非常慢。所以,在某种意义上,今天的机器人技术面临着我称之为“鸡生蛋还是蛋生鸡”的问题。要获得机器人数据,它们必须大量部署。但要部署它们,它们必须能够工作。而要让它们工作,我们需要数据。这就是世界上每个公司、每个实验室多年来一直卡住的地方。现在,这并不是一个我称之为多年代的问题,因为在机器人技术中扩展数据是一个非常近期出现的现象。机器人技术是一个你试图务实地建模一切的领域。你会设计目标函数来优化这一点。但我们如何将机器人技术带入当今的人工智能时代?所以我们的论点是,由于机器人技术没有数据,我们必须利用替代的数据源。而不是机器人数据。现在,确实有一个机器人一直在全世界 24/7 全天候运行,而这些机器人基本上是人类。我们是生物机器人,对吧?我们有关节,而不是电机。我们有运动神经元,而不是动力。所以我们可以真正看看人类如何操纵周围的世界,并利用这些知识来指导机器人。但是视频存在问题。问题是视频不能让你了解力。你不能只通过观看学习,因为如果你能通过观看学习,我们这里很多人都可以像费德勒一样,看了他无数场比赛,但这还不够。你必须练习,你必须自己练习,并理解力。而这正是我们使用第二种来源——模拟的原因。模拟。模拟的好处在于你可以随心所欲地扩展,而且你有力。你可以操纵力,你可以随机化它们。但问题是,很难让它与现实世界匹配。而且,在模拟中编程每个场景甚至更难。创建一个场景需要很长时间。视频提供了多样性。它们具有世界的多样性。我们可以轻松地看到人类是如何移动物体的,但在模拟中,你有力。所以视频填补了模拟中缺失的负面信息,而模拟填补了视频中缺失的负面信息。将它们以正确的方式组合在一起。这是一个非常、非常深刻的配方,可以使机器人技术自我引导。单独一种方法是不够的,但以正确的框架组合在一起,你就可以从这个场景中创造奇迹。所以我们高层次的主要想法是,我们使用模拟和人类视频预训练我们的模型。视频提供了如何操作的指导。它们提供了视觉场景的多样性。所以是视觉多样性和指导。模拟提供了规模以及接触和力的概念。然后,在训练后,如果需要,如果零样本不起作用,你可以添加一些远程操作数据。现在,什么是远程操作数据?远程操作数据是低质量、低规模但高质量的,因为它直接在机器人上收集,而且很难扩展,但质量非常高。这正是我们用于训练后期的正确配方。我们使用 LLM。我们使用 LLM 来处理机器人技术的第二个场景,即部署数据。随着我们部署规模的扩大,这个第二因素会不断增加。然后我们也会将其添加到训练配方中。所以,这是我们正在大规模构建的数据飞轮。首先用模拟和人类视频进行引导。这就是我们走向任何机器人、任何任务、一个大脑的愿景。
现在,当你开始这种程序,无论是微调还是预训练,你可能会收集一个例子。然后你如何从这些例子扩展到训练更多你没有数据的场景?所以你也可以使用工具,你可能已经看到了,比如英伟达的 Cosmos。它提供了多种方式,从一个场景开始,然后围绕它生成多个场景。所以我们也为机器人技术使用这些场景。所以在这里,你可以看到每一个,这是机器人的梦想。所以机器人正在思考它自己的大脑,你看到的每个背景都在不断变化,完全不同的场景,这一切都发生在机器人大脑中的大型视频模型学习中。现在你可以拿一个例子,制作一万个例子。所以你真的可以更快地扩展。然后,有了这些,你就可以将其应用到任何类型的机器人上,无论是人形机器人还是在某个场景中。这个机器人从未在这个房子里训练过,我们第一次把它放在这个房子里,它仍然可以转移,因为视觉多样性可以来自视频和它从视频模型中看到的增强。这涉及到某种协调。它必须将事物从右手转移到左手。但有趣的是,整个场景完全是在测试时发生的。所以你从未在这个场景中训练过。在这种设置下,你可以改变场景,改变物体,机器人仍然可以转移到这些设置中的任何一个。现在,当你创建一个由视频和模拟混合而成的数据集时,你是在将多个来源组合在一起。在这些场景中,它是在组合两个。但我们也可以仅从视频中学习。这看起来更像一个 dom 房间。我不确定你们在哪里拍摄这些视频。但机器人可以在各种设置中继续运行。所以我们也可以将相同的方法应用于仅从视频中学习。我们可以收集大量人类视频,无论是在互联网上还是我们可以收集的。并从这些视频中学习。但问题是,如果你只从视频中学习,那么做非常精确的任务会非常困难,因为你没有力的概念和接触的概念。所以在这个场景中,我们可以转移到简单的任务,比如打开东西,拿起一个瓶子。这不是一个精细的接触任务,因为你只是去抓住瓶子,然后移动它。但如果你有一个更复杂的任务,仅仅从视频中学习是不够的。但这表明,即使仅仅从视频中,你也可以走得很远。你不必总是需要所有类型的数据混合。这一切都是从视觉端到端发生的。整个机器人正在保持平衡,同时执行这项任务。所以你可以让这个机器人通过观看人类视频来做各种事情,而无需在现实世界中收集任何机器人数据。但这些不是精确的任务。
好的,当涉及到精确任务时,这是一个例子,比如放 AirPods。现在,我敢肯定,这里有很多人会丢失 AirPods。这是我们公司里非常普遍的事情。我们有一个叫做“右 AirPods”的 Slack 频道,因为每个人都在丢失他们的右 AirPods。这是一个相当复杂的任务。现在,有趣的是,这些不是真正的 AirPods。它们是淘宝的假货。等等。它们实际上更难,因为它们没有磁性拉力。你必须实际去插入它。注意这里还有几点。机器人上没有夹持器。抱歉,机器人上没有手。它只是一个非常简单的夹持器,打开和关闭夹持器。现在,现在有太多的关注点在手上,认为“哦,手是导致我们没有机器人技术的原因”。就像每十年都有一个新的原因来解释为什么我们今天没有机器人技术。几乎就像聚变一样。所以,原因在于,如果你有一个强大的“大脑”,你甚至可以用非常简单的夹持器打开和关闭,让它们做很多事情。现在,别误会我的意思,我不是说手不需要,但它们很难制造,而且世界上没有好的硬件手,能够持久耐用,我们可以用它们来完成这些复杂的任务,即使是夹持器。还有另一个稍微复杂一点的任务,比如插入电缆等。现在,你可以通过对大约一周的数据进行训练后,获得这些结果。这也不是非常困难。但有趣的是,机器人正在将它们背靠背地插入并排的插槽中。这是大约一年前的一个旧视频。现在我们可以更快地以人类的速度完成。所以只是弄清楚并进入里面。这些是精确任务的例子,就像我们希望这些机器能够做什么一样。
好的,现在回到几点。所以在这个场景中要注意的一点是,计时器在哪里?好的。所以在这个场景中要注意的一点是,如果你看看今天市面上的任何机器人流程,流程中有多个阶段。有映射,有规划,有控制器,然后是输出。当人们说我们正在使用人工智能,甚至人工智能研究人员或实验室,人工智能可以应用于这些部分中的任何一个。它可能只是在规划中,可能只是在映射中,或者只是在控制器中。通常,在大多数情况下,最后一个框不是由人工智能驱动的。在我今天在舞台上展示的任何结果中,一切都是端到端完成的。它不是一个分阶段的方法。你可以看到机器人正在进行映射、规划、在场景中移动,但所有这些都是涌现的。它没有被编程到系统中。现在,有了这种可以直接从输入到输出进行操作的想法。输入可以是你的视觉,可以是力,可以是触觉,任何机器人上可用的东西,输出直接是电机指令。所以这是从视觉端到端学习。现在,这一部分非常关键。你可能在网上看过很多机器人跳跑酷的视频。这也是我们的一个成果。我们从互联网上的轨迹中学习了它。现在,有趣的部分是,让我暂停一下。这些视频非常可爱。所以它们会分散我们的注意力。所以,我暂停了视频。我在这里的观点是,你见过这些,但你见过人形机器人走很长的楼梯吗?这就是你拥有腿的唯一原因,对吧?就是为了去任何可能的场景,而不是地毯,因为你可以在地毯上使用轮子。但没有人意识到这一点。每个人都被跑酷等迷住了,而不是楼梯。为什么这是 50 年后再次困扰我们的同一个问题?莫拉维克悖论在起作用,即使对于机器人研究人员来说。莫拉维克悖论是一种学习转移,它总是在发生。你可能会想,这怎么会是莫拉维克悖论?这些都是机器人技术。我以为它是针对机器人技术和语言的。但不,问题在于,对人类来说,跳舞、功夫非常困难。为什么?因为它需要精细的平衡。对我们来说,楼梯很容易,因为每个人,每个动物都能做到。所以我们不重视这一点。我们重视这一点。但有趣的是,从计算机的角度来看,右边的几乎是微不足道的,因为它不需要任何交互。我自己在移动我的整个身体,而这是计算机擅长的。这就是为什么我们有飞机在天上飞了 100 年,因为它们在天上飞,在没有接触、没有东西的地方。这和那里是同一个想法。计算机可以真正地为自己编程,以任何可能的方式移动自己。但这个需要与世界互动。当你走在楼梯上时,视觉必须与身体互动。即使机器人出现一次失误,也可能导致机器人摔倒。现在,这个模型完全是从视觉端到端运行的。所以我们可以让这些机器人做复杂的楼梯上的事情。非常简单的事情。这是从视觉来看的,当它靠近间隙时,它会停下来,然后像人类一样迈出下一步。但这些人类每毫秒都在做出的精细决策,我们不认为是智能,但它们是人类智能背后的主要原因。现在,你也可以盲目地做一些事情,顺便说一句,因为它需要平衡。但有趣的是,机器人是在障碍物出现之前就迈出一步的。这是我们美丽的匹兹堡办公室。现在,这是消防逃生结果。抱歉,是楼梯。我总是惊讶地发现,最难的楼梯是在消防通道里。应该是相反的。当每个人都在试图冲出去的时候,最难的就在那里。所以在这里,它可以在每种场景中前进。它在楼梯上也很健壮。顺便说一句,这超级人类。试着从后面拉着某人的脖子爬上去。你施加在机器人上的力是向上的。再次,超级健壮。所以我们不仅能做到这一点,而且还能稳健地做到。这是世界上唯一一个人形机器人视频结果,它能连续走很长的楼梯而不会摔倒。当然,这就是你拥有腿的原因。不是为了跳舞、跑酷等。虽然容易,但跑酷确实很有趣。所以,我也会为了好玩而展示跑酷视频。我注意到背景里有个孩子看着所有这些视频拍摄。看,这就是问题所在。这就是跑酷的问题。一旦机器人完成了第一次跳跃,每个人都喊了一声“哦”。但在楼梯上,你不会有这种感觉。这就是现实生活中的莫拉维克悖论。这是一个例子。现在,有人问了最后一个视频,机器人能从下面向后传递东西吗?所以我们也尝试了,比如通过折叠手臂从下面过去。所以模型正在平衡整个身体,有人命令身体向下,然后直接向前。哦,该死。>> [喘气] >> 好的,所以我们还没有机器人 AGI。好了,随着基础模型的改进,你实际上可以将这些结果转移到其他任务上。即使在昨天的 GTC 主题演讲中,Jensen 也提到,Skilled 正在与英伟达和富士康合作,自动化他们在休斯顿的工厂。这是一个 GP3 工厂。如果你看看今天的工厂,它们建造东西的方式,人类会一遍又一遍地重复地手动完成所有这些任务。许多事情已经自动化了,但尚未自动化的是最后那些需要力的精细任务。所以,我们正在与英伟达合作,使用他们的 Omniverse 平台来获取比我们在现实世界中收集的更多数据,并让这些机器人自动化这些事情。这还处于早期阶段,我们刚刚开始,它将在明年年初上线。所以,这是一个机器人执行相同任务的例子,在现实世界中,这些是你们的 GB300 GPU。机器人正在安装这些总线条。现在,有趣的部分是这个。它需要在最后进行精细调整,而这时你无法使用传统的自动化,因为你无法精确测量那个卡槽的位置。所以机器人必须缓慢地调整这个部分,而这一切都是在一个端到端的学习策略中运行的。所以你可以看到它卡住了。然后现在人类必须过来,然后移动它。但在这种情况下,机器人可以自动完成。
[清嗓子] 在最后几分钟,我想谈论最后一个话题。这个“全能大脑”的想法。好的。现在,这超出了人类的通用性。人类不是全能的,至少现在还不是。所以,然后人们可能会争辩说,“我正在建造自己的机器人,为什么我需要我的大脑是全能的?而且如此通用?”问题是,如果你有一个机器人,它可能会损坏,或者它可能会遇到不同的场景。你希望整个机器人倒下并失效吗?所以这里有一个例子,我们训练了一个专家模型,它也是一个 Skilled 模型,但它不是全能的。然后你绑住了腿。在这种情况下,它走得很好,一旦一条腿坏了。没有人期望这些机器人在腿坏了的时候还能工作。但是,[哼鼻] 就是这样。人类不会这样做,如果你扭伤了脚踝。你不会只是做一个后空翻来防止脚踝扭伤。所以我们的想法是适应。我们的模型正在现实世界中不断适应。好的,这就是为什么我们能够以一种非常流畅的方式在所有这些机器人之间运行。所以,与其蛮力记忆,策略正在学习适应。好的,现在这个想法实际上是 LLM 今天能够工作的根本原因。你可能会认为,LLM 的原因是它规模大、数据多,但技术原因是什么?技术原因是 LLM 是零样本学习器。所以,如果你给 LLM 一个例子,比如“这是我的文本,我爱披萨,把它转换成表情符号”,然后你写别的东西,“太阳在闪耀”,LLM 可以输出类似这样的东西。所以 LLM 是在上下文中学习的。这就是为什么当人们说像 G's GPT 模型等,它们正在扩大上下文,它们想通过仅仅查看上下文窗口来学习,而不是在每个场景中微调模型。这里的想法也是一样的。在这种情况下,我们也看到了机器人领域的“上下文学习”的迹象。我们能够看到机器人领域“上下文学习”的第一个迹象。现在,“上下文学习”只在 LLM 中见过,而且它只有两三年的历史。这个想法,这个“上下文学习”这个词,三年前甚至不存在。好的。现在,对于最后一个实验,我们将做一些非常极端的事情。好的。我们从训练集中移除了所有机器人。所以现在争论的不是你可以跨越多个机器人工作。争论的是这些机器人从未被见过。甚至在现实世界中也从未见过。但现在它们甚至在模拟中也未被见过。这是什么意思?我们训练它们的是什么?所以,在这里我们训练的是全能场景,但机器人只有火柴人。我们自己制作它们,通过编程添加这些火柴,添加一个杆子,创建任意机器人。这个奇怪的形状等等。所以在整个训练中没有一个真正的机器人。然后同一个模型可以零样本地转移到任何现有的机器人上。现在,你在这个视频中看到的,这些机器人中的任何一个在训练集中都没有见过。它到处都是同一个模型。所以它是一个真正全能的系统。现在,这里有一个思想实验,假设你是模型。好的,你是全能大脑,我把你放在这个机器人里。但当我启动机器人时,我把它倒过来,就像这样。所以,在后两条腿上。那么,从这一刻起,如果我打开大脑,你怎么知道这个机器人是狗还是人形机器人?你无法分辨,因为人类在进化过程中曾经是四足动物,对吧?我们有非常对称的腿和手。所以在这种情况下,模型会感到困惑,认为它是一个人形机器人,因为它开始于相同的情况。所以它试图像人形机器人一样行走,但它失败了,但它正在实时适应。所以这是它的第一次尝试,第二次尝试,它可以走两步。第三次尝试,零样本,它就可以去行走。机器人看到的一切,模型看到的一切,都在这三次尝试中。没有超出这个范围。你总是可以训练策略来这样行走,但这完全是涌现的,是即时发生的。你也可以做更疯狂的事情。例如,你可以把这些假腿放在上面,所以它走得很好。这个机器人从未见过。然后一个人走过来,装上这些假腿。当然,这也从未见过,机器人一开始在适应。然后它开始行走。它卡住了,但然后它开始行走。所以它在所有这些场景中都在即时适应。同样,在这个场景中,我们绑住了机器人的腿。哦,抱歉。所以在这个场景中,我们绑住了机器人的腿,和之前的例子一样,但它在适应。仍在适应。不再像之前那样摇晃和抖动。适应,适应,适应,适应。仍然学会行走。这一切都是即时发生的。这是非常极端的。在这种情况下,我们将其放在机器人上。我们有六自由度手,十六自由度手,七自由度手臂。还有两个机器人。所以它们应该做的是,它们应该拿起这个立方体,然后旋转它以匹配这个面。现在,在这个场景中涌现的是,每当目标改变时,机器人就会学会将立方体扔到另一边。所以目标是那里的立方体,机器人应该旋转它,然后移动到那个位置,这就是目标。所以整个转移、抓取和投掷都是从这个单一目标中涌现出来的。所以它是一个全能的、唯一的“大脑”,在每个场景中。你可能在网上看过一个版本的视频,但风格不同。所以在这里,腿断了。它在线适应。所以你在施加力。所以这个家伙认为它是一个人形机器人。所以即使你增加重量,它仍然保持人形姿势。这是第二。所以它在这里用轮子移动。一旦你卡住轮子,它就开始行走。在这里,我们禁用了两条腿。它在适应,适应。这是相当极端的。这是跨越不同操作机器人的。好了,谢谢。所以我们的目标是任何机器人、任何任务。
好的。>> 嗯,好的。我们有几分钟时间进行问答,如果有人有任何问题。>> 这里有一个。>> 你好,谢谢。这太棒了。我在 90 年代末为 NASA 建造了人形机器人。所以我的问题是,当你展示它在手中来回传递东西时,我们过去让它做一种涌现的、你知道的、等待功能,这样它就能最有效地利用它的身体,而它的身体比我们的更强大。所以在这种情况下,扭转和倾倒的成本会比来回传递手部要低。你是故意这样做的,只是为了让它保持训练状态,还是你也考虑构建那种效率模型,让你真正能够利用它独特的构成?这是一个非常好的问题,我认为早期的基本转变是,以前你会花时间试图编程如何更有效地利用身体,但在这里,我们让机器人自己发现如何利用身体。而我们让它发现的方式是,工程从编程轨迹转向成本函数。所以,我们到处使用的成本函数之一是能量。我们不只是用能量做某事,而是要节能。如果你看看过去的文献,不是机器人文献,因为这里的能源被严重低估了。但如果你看看生物力学。生物力学是人们研究动物和人类如何移动四肢的领域,而能量是许多动物身上涌现特性的最终指导因素。所以我们在这里使用它,而且你看到的许多行为基本上是直接来自能量的。你能打开麦克风吗?>> 你好。你好,Deep。我是来自人形机器人中心的 Dwan。所以,理查德·萨顿最近在 Duars 的播客上说,他有点反对模仿学习可以作为强化学习的良好先验的观点。你对此有什么看法?你认为有一种方法可以实现真正的智能机器人吗?>> 是的。所以,如果你想想极限情况,Rick 认为极限情况下没有监督学习。一切都是强化学习。当你有几乎每个时间步的监督时,监督学习就是强化学习的一个子集。所以,在极限情况下,他是对的。没有人给我们人类提供监督,我们的一切都来自钙镁离子指令、电流,然后发生了一些事情。所以,在极限情况下,一切都是强化学习。而我们在这里并没有真正使用它,在大多数情况下。所以我们不使用监督学习作为强化学习的先验。所以,实际上我们也在一定程度上遵循他的原则。在这里,如果我们使用人类视频,你可以认为它们是监督,它们告诉你应该怎么做。比如,人类开门,或者狗开门,门都沿着铰链以相同的方式打开。而这些信息是通用的。所以,无论你使用强化学习还是监督学习,这些信息都保持不变。我们使用视频来获取这些信息,而不是精确地监督行为。