📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Fully autonomous robots are much closer than you think – Sergey Levine

Dwarkesh Patel1:28:29

Transcription

今天我与 Sergey Levine 聊天,他是 Physical Intelligence 的联合创始人,这是一家机器人基础模型公司,同时他也是加州大学伯克利分校的教授,并且是机器人、强化学习和人工智能领域的世界顶尖研究者之一。Sergey,感谢您来到播客。谢谢您,也谢谢您如此友好的介绍。让我们来谈谈机器人技术。在我向您提出问题之前,我想知道您是否能为听众总结一下 Physical Intelligence 目前的状况。你们公司成立一年了。进展如何?你们在做什么?Physical Intelligence 的目标是构建机器人基础模型。这基本上意味着通用模型,原则上可以控制任何机器人来执行任何任务。我们之所以关注这一点,是因为我们认为这是人工智能问题的一个非常根本的方面。机器人本质上包含了所有人工智能技术。如果你能制造出一个真正通用的机器人,那么你就能,希望如此,完成人们能做的很大一部分事情。我们目前所处的位置是,我们已经构建了许多基础。这些基础实际上非常棒。它们效果很好。我们可以让机器人叠衣服,让它进入新家并尝试打扫厨房。但在我看来,Physical Intelligence 目前所做的只是非常非常早期的开端。这只是在奠定基础的构建模块,在此之上,我们才能解决所有这些真正棘手的问题。一年一年的愿景是什么?一年过去了,我有机会看到一些机器人,它们可以完成非常灵巧的任务,比如用夹具折叠盒子。即使是我用手,折叠盒子也很难。如果必须一年一年地讲,直到我们迎来机器人技术的全面爆发,每年会发生什么?需要解锁什么,等等?有几件事我们需要做好。灵巧性显然是其中之一。一开始,我们真的想确保我们理解我们开发的方法是否能够应对人们可以完成的那种复杂任务。正如您所提到的,折叠盒子、折叠不同衣物、打扫桌子、冲咖啡,诸如此类的事情。这很好,这很有效。我们能够展示的结果非常棒,但最终目标不是折叠一件漂亮的 T 恤。最终目标只是证实我们最初的假设,即基础是稳固的。从那里开始,有许多重大的挑战。有时当结果被抽象成一个三分钟的视频时,人们会看到这个视频,然后说:“哦,这很酷。这就是他们正在做的事情。”但事实并非如此。这只是我认为即将到来的事物的非常简单和基础的版本。你真正想要的是机器人,而不是告诉它:“嘿,请帮我叠 T 恤。”你真正想要的是机器人,而是告诉它:“嘿,机器人,你现在为我做各种家务。我希望在下午 6 点吃晚饭。我早上 7 点起床去上班。我喜欢在周六洗衣服,所以请确保衣服准备好。这些和那些。顺便说一句,每周一与我联系,看看我购物时需要你买什么。”这就是提示。然后机器人应该去这样做六个月,一年。这就是任务的持续时间。最终,如果这些东西成功了,它应该会更大。它应该具有持续学习的能力。它应该对物理世界有理解,有常识,有能力在需要时获取更多信息。比如我问它:“嘿,今晚,你能给我做这种沙拉吗?”它应该弄清楚这意味着什么,去查找,去购买食材。这其中涉及很多内容。它需要常识。它需要理解存在一些需要智能处理的边缘情况,需要更深入思考的情况。它需要持续改进的能力。它需要理解安全,在正确的时间可靠,在犯错时能够纠正错误。这其中还有很多内容。但其中的原则是:你需要利用先前的知识,你需要拥有正确的表征。这个宏伟的愿景,是哪一年?如果你必须给出一个估计。25 百分位数,50,75?我认为这不会是我们在实验室里开发完一切,然后就完成了,然后在 2030 年左右,你就能得到一个盒装机器人。同样,这会和我们看到的 AI 助手一样。一旦我们达到某个基本能力水平,机器人就能提供有用的东西,它就会走向世界。很酷的是,一旦它走向世界,它们就可以收集经验并利用这些经验来变得更好。对我来说,我倾向于考虑时间线,而不是完成日期,而是“飞轮”开始的日期。飞轮何时开始?这可能很快。有一些决定要做。其中的权衡是,你对事物的范围界定得越窄,你就能越早将其推向现实世界。但这是我们已经在探索的事情。我们已经在努力弄清楚,有什么真正的事情是这个东西可以做的,可以让我们开始转动飞轮。但就你真正关心的事情,你希望看到的事情而言……我不知道,但个位数年是非常现实的。我真的希望在一两年内就能有一些东西真正问世,但这很难说。问世是什么意思?什么是问世?这意味着有一个机器人能做你真正关心的事情,你希望它做的事情。它能胜任地完成这项工作,真正为想要完成这项工作的人们完成。我们已经有了广泛部署的 LLM。这并没有带来某种飞轮,至少对于模型公司来说,并没有带来某种明显的飞轮,比如现在 Claude 正在学会做经济中的每一项工作,或者 GPT 正在学会做经济中的每一项工作。那么,为什么 LLM 的飞轮不起作用呢?嗯,我认为它实际上非常接近起作用,而且我百分之百确定许多组织正在致力于此。事实上,可以说已经有一个飞轮了。它不是一个自动化的飞轮,而是一个“人机协作”的飞轮。每一个部署 LLM 的人当然都会关注它在做什么,并利用这些信息来修改其行为。这很复杂,因为它又回到了表征的问题,以及找到正确的方法来获得监督信号,并将这些监督信号与系统的行为联系起来,以便它能改进你想要的东西。我不认为这是一个极其不可能的问题。这只是细节变得相当棘手,算法和稳定性方面的挑战变得相当复杂。这是社区集体花了一段时间才掌握的东西。你认为机器人技术会更容易吗?或者你认为通过这些技术来标记你在世界各地收集的数据并将其用作奖励,整个浪潮将会兴起,机器人技术也会随之兴起吗?或者有什么原因让机器人技术从中受益更多?我不认为机器人技术有什么根本的不同。有一些小的差异,使得事情更容易处理。特别是如果你有一个机器人与人合作,无论是有人监督它还是指导它,都有非常自然的监督来源。这个人有很大的动力提供帮助,使事情成功。有很多动态,你可以犯错误并从中恢复,然后反思发生了什么并避免将来的错误。当你处理现实世界中的物理事物时,这些事情发生的频率比你作为 AI 助手回答问题时要高得多。如果你回答了一个问题,而且回答错了,这不像你可以回去调整一些东西。你告诉答案的人可能甚至不知道它是错的。而如果你在折叠 T 恤,并且你弄砸了一点,这是很明显的。你可以反思一下,弄清楚发生了什么,下次做得更好。好的,一年后,我们将拥有一些能做有用事情的机器人。也许如果你有一些相对简单的循环过程,它们可以为你完成,比如不断折叠成千上万个盒子之类的。但然后有一个飞轮……还有一个机器可以像人类管家一样运行我的房子。这个在一年内部署并启动飞轮的东西,与一个完全自主的管家之间有什么差距?在某些方面,这与我们看到的 LLM 并没有太大区别。这是范围的问题。想想编码助手。最初最好的编码工具,它们可以做一点代码补全。你给它们一个函数签名,它们会尽力写出整个函数,也许能写对一半。随着这些东西的进步,你就会愿意给它们更多的自主权。现在最好的编码助手——如果你在做一些相对公式化的事情,也许它可以为你完成大部分的 PR,完成一些相当容易实现的事情。情况也会一样。随着机器人越来越好,我们将看到我们愿意赋予它们的范围的增加。最初的范围可能是你做的特定事情。你在冲咖啡或者别的什么。随着它们变得越来越有能力,随着它们拥有常识和更广泛的任务库的能力的增加,我们将赋予它们更大的范围。现在你在经营整个咖啡店。我明白有一个范围。我明白不会有一个特定的时刻让你觉得我们已经实现了目标,但如果你必须给出一个中位数估计的年份,什么时候会发生这种情况?我的感觉是,这可能是一个个位数的事情,而不是一个两位数的事情。之所以很难真正确定,是因为,就像所有研究一样,这取决于弄清楚几个问号。我的答案是,我认为这些不是需要深刻、完全不同的想法的事情,但它确实需要对我们已经知道的事情进行正确的综合。有时综合,要说清楚,和想出深刻的新东西一样困难。这是一个智力上非常深刻和重要的问题。弄清楚这一点将非常令人兴奋。但我认为我们大致知道拼图的碎片,这是我们需要努力解决的问题。如果我们努力解决,并且我们有点运气,一切都按计划进行,个位数年是合理的。我将进行二分查找,直到得到一个年份。它不到 10 年,所以比 5 年多,你的中位数估计?我知道有一个范围。我认为 5 年是一个好的中位数。好的,五年。如果你能完全自主地经营一个房子,那么你就能完全自主地完成大多数蓝领工作。你的估计是,五年内它应该能够完成经济中的大多数蓝领工作。这里有一个细微之处。如果我们考虑编码助手的类比,这一点会更加明显。今天的编码助手并不是说有一个开关被拨动了,然后软件工程师就被解雇了,每个人都在使用 LLM 来做所有事情。事实上,最大的生产力提升来自于专家,也就是软件工程师,他们的生产力现在得到了这些非常强大的工具的增强,这很有意义。与人们是否会被解雇的问题分开,另一个问题是,五年后经济影响会是什么?我之所以对此感到好奇,是因为与 LLM 相比,这些模型的收入与其看似能力之间的关系有些神秘。你有一个感觉像是 AGI 的东西。你可以进行一次对话,它真的通过了图灵测试。它真的感觉它能做所有这些知识工作。它显然在做很多编码工作,等等。但这些人工智能公司的收入加起来每年约为 200-300 亿美元,这远低于所有知识工作,即 30-40 万亿美元。五年后,我们是否处于与现在 LLM 类似的情况,还是我们有机器人到处部署,并且它们实际上在做大量实际工作,等等?这是一个非常微妙的问题。它很可能归结为范围的问题。LLM 没有做所有软件工程的原因是它们在特定范围内做得很好,但有局限性。要说清楚,这些局限性每年都在增加。我认为没有理由我们不会在机器人身上看到同样的事情。范围必须从小开始,因为有些事情这些系统可以做得非常好,而有些事情则需要更多的人工监督。范围会扩大。这将转化为生产力的提高。其中一些生产力将来自机器人本身的有价值。一些将来自使用机器人的人们现在在工作中更具生产力。但有很多事情可以提高生产力。比如戴手套可以提高生产力,或者我不知道。你想了解一些能提高生产力百倍的东西,而不是一些只提高一点点的东西。机器人已经提高了工人的生产力。就它们能做的知识工作份额而言,LLM 目前的水平,我猜是经济中知识工作总量的 1/1000,至少在收入方面。你是说这个比例对机器人来说是可能的,但对体力劳动来说,五年后呢?这是一个非常难回答的问题。我可能无法告诉你机器人能完成所有劳动工作中的百分之多少,因为我认为现在,我没有足够充分地理解所有体力劳动中如此大的横截面所涉及的内容。我能告诉你的是。在“人机协作”的设置中,逐步推出有效的系统要容易得多。同样,这正是我们在编码系统中看到的。我认为我们将看到自动化方面的情况也是如此,基本上机器人加上人类比单独的人类或单独的机器人要好得多。这完全说得通。它也使得引导所有技术变得容易得多。因为当它是机器人加上人类时,机器人就有更多的潜力在工作中学习,获得新技能。因为人类可以标记正在发生的事情?也因为人类可以提供帮助,人类可以提供提示。我给你讲个故事。当我们从事 π0.5 项目时,我们去年四月发布的论文,我们最初是通过远程操作来控制我们的机器人在各种不同的环境中。在某个时候,我们实际上意识到,一旦模型足够好,我们就可以通过不仅仅是低级动作的监督,而是通过语言来实际指导它,从而取得重大进展。现在你需要一定程度的能力才能做到这一点,但一旦你具备了这种能力,仅仅站在那里告诉机器人,“好的,现在拿起杯子,把杯子放进水槽,把盘子放进水槽,”仅仅用语言,实际上就能为机器人提供信息,让它变得更好。现在想象一下这对人与机器人之间的动态意味着什么。现在基本上,这些系统的学习不仅仅是从原始动作中学习,它也是从语言中学习。最终,它将从观察人们的行为中学习,从你与他人一起工作时收到的自然反馈中学习。这也是先验知识的价值所在,这些先验知识来自这些大型模型,它让你能够理解这种互动动态。这些“人加机器人”的部署有很多潜力可以使模型变得更好。就机器人技术的进步而言,为什么它不会像自动驾驶汽车那样,谷歌推出其……不是在 2009 年推出了自动驾驶汽车计划吗?我记得我还是个少年时,就看着演示,我们去买塔可钟,然后开回来。直到现在,我们才真正部署了它们。即使那样,它们也可能犯错误等等。也许在大多数汽车实现自动驾驶还需要很多年。你说五年就能实现相当稳健的东西,但实际上它会感觉像 20 年吗?一旦我们在五年内获得酷炫的演示,那么还需要 10 年才能让 Waymo 和 Tesla FSD 工作。这是一个非常好的问题。现在与 2009 年相比,一个很大的不同之处在于理解周围世界的机器学习技术。主要是对于自动驾驶,这是感知。对于机器人,它还可以意味着其他一些事情。2009 年的感知能力并不好。感知的问题在于,你可以用一个经过一定程度工程设计的系统做出一个非常好的演示,但在尝试泛化它时会遇到瓶颈。现在,在 2025 年,我们拥有了更强大的通用且稳健的感知系统技术,以及更广泛的通用且稳健的理解我们周围世界系统的技术。当你说的系统是可扩展的,在机器学习中,可扩展性实际上意味着通用性。这给了我们一个更好的起点。这不是关于机器人比自动驾驶更容易的论点。这只是关于 2025 年比 2009 年更好的论点。但机器人技术也有其他一些与驾驶不同的地方。在某些方面,机器人操作是一个更、更难的问题。但在其他方面,它是一个更容易启动、开始那个飞轮的领域,范围更有限。举个例子,如果你在学习开车,你可能会非常疯狂地自己学习开车,而没有人帮助你。你不会相信你的十几岁的孩子会自己学习开车,只是把他们扔进车里说:“去吧。”那也是一个 16 岁的孩子,他已经有足够的时间了解世界了。你甚至不会梦想把一个五岁的孩子放进车里,让他开始。但如果你想让某人洗碗,碗也会碎。但你可能会接受一个孩子尝试洗碗,而没有人坐在他们旁边踩刹车,这么说吧。对于我们想用机器人操作完成的许多任务,都有可能犯错误并纠正这些错误。当你犯错误并纠正它时,首先你已经完成了任务,因为你已经纠正了,而且你还获得了知识,可以让你在将来避免这个错误。对于驾驶,由于其设置的动态,很难犯错误、纠正它然后从中学习,因为错误本身具有重大影响。并非所有操作任务都是如此。确实有一些非常关键的安全问题。这就是下一个问题,即常识。常识,意味着能够对可能发生的事情做出合理的猜测,但不需要你事先经历这个错误并从中学习。这非常重要。这是我们大约五年前完全不知道如何做的事情。但现在我们可以使用 LLM 和 VLM 并向它们提问,它们会做出合理的猜测。它们不会给你专家的行为,但你可以说,“嘿,有一个牌子写着地板湿滑。当我走过去时会发生什么?”这很明显,对吧?2009 年的任何自动驾驶汽车都无法回答这个问题。常识加上犯错误并纠正这些错误的能力,这听起来非常像一个人在学习某事时所做的事情。所有这些并不一定使机器人操作变得容易,但它允许我们从一个较小的范围开始,然后从中成长。所以多年来,我的意思是自 2009 年以来,我们已经有了大量的视频数据、语言数据,以及转换器 5-8 年。许多公司,包括谷歌、Meta 等,都试图构建基于转换器的机器人,并使用大量训练数据。它们之所以遇到障碍的原因是什么?现在有什么变化?这是一个非常好的问题。我将从稍微修改你的评论开始。它们取得了很大的进展。在某些方面,我们现在在 Physical Intelligence 所做的许多工作都建立在许多其他伟大工作的基础上,例如谷歌。我们中的许多人以前都在谷歌。我们参与了其中一些工作。有些是我们借鉴了别人所做的。那里的进展确实很大。但要真正实现机器人基础模型的运作,它不仅仅是一个实验室科学实验。它还需要工业规模的构建工作。它更像是阿波罗计划,而不是科学实验。过去工业研究实验室所做的优秀研究,我参与了其中很多,很大程度上被视为基础研究工作。这很好。基础研究非常重要,但它本身并不足够。你需要基础研究,还需要推动它成为现实的动力。使其成为现实意味着真正将机器人推向市场,获取具有代表性的数据,它们需要完成的任务在现实世界中,大规模获取这些数据,构建系统,并让所有这些都正确。这需要一种专注,一种单一的专注,真正为了机器人基础模型本身而将其做好,而不仅仅是为了做更多的科学,而不仅仅是为了发表论文,而不仅仅是为了拥有一个研究实验室。是什么阻止你现在进一步扩大数据规模?如果数据是一个很大的瓶颈,为什么你不能把你的办公室扩大 100 倍,让 100 倍的操作员操作这些机器人并收集更多数据。为什么不能立即增加 100 倍?这是一个非常好的问题。这里的挑战在于理解哪些规模的轴线有助于哪些能力轴线。如果我们想在水平方向上扩展能力——也就是说,机器人现在知道 10 件事,我希望它以后知道 100 件事——这可以通过直接在水平方向上扩展我们已有的东西来解决。但我们希望将机器人提升到能够完成现实世界中实际有用事情的能力水平。这还需要在其他轴线上进行扩展。例如,它需要达到非常高的鲁棒性。它需要它们非常高效、快速地执行任务。它需要它们识别边缘情况并做出智能响应。这些事情也可以通过扩展来解决。但我们必须确定正确的轴线,这意味着要弄清楚收集什么数据,在什么环境下收集,什么方法消耗这些数据,以及这些方法是如何工作的。更彻底地回答这些问题将使我们更清楚地了解轴线,那些因变量,以及我们需要扩展的东西。我们现在还不完全清楚那会是什么样子。我认为我们很快就会弄清楚。这是我们正在积极努力的事情。我们希望真正做好这一点,以便当我们扩大规模时,它将直接转化为与实际应用高度相关的能力。就数量级而言,你收集的数据量与互联网规模的预训练数据相比如何?我知道很难进行逐个标记的计数,因为视频信息如何与互联网信息相比,等等。但使用你的合理估计,是哪个比例?这很难做到,因为机器人经验由时间步组成,这些时间步彼此高度相关。原始字节表示非常庞大,但信息密度可能相对较低。也许更好的比较是用于多模态训练的数据集。在那里,我相信上次我们进行计数时,它在数量级上是 1 到 2 个数量级。你对机器人的愿景,是否要等到你收集了多少,100 倍,1000 倍更多的数据才可能实现?这就是问题所在,我们不知道。当然,可以合理地推断机器人技术是一个难题。可能需要与语言材料一样多的经验。但因为我们不知道这个问题的答案,对我来说,一个更有用的思考方式不是我们需要多少数据才能完全完成,而是我们需要多少数据才能开始。这意味着在我们可以获得一个数据飞轮之前,它代表了一个自给自足且不断增长的数据收集配方。当你提到自给自足时,仅仅是边做边学,还是你有别的想法?边做边学,或者以一种数据获取过程本身有用且有价值的方式来获取数据。我明白了。某种 RL。做一些真正的事情。理想情况下,我希望它是 RL,因为有了 RL,你可以让机器人自主行动,这更容易。但并非不可能拥有混合自主性。正如我之前提到的,机器人可以从各种其他信号中学习。我描述了我们如何让一个机器人从一个人说话中学习。在完全远程操作的机器人和完全自主的机器人之间,有很多中间地带。π0 模型是如何工作的?我们目前拥有的模型基本上是一个已经适应了运动控制的视觉语言模型。给你一个有点异想天开的大脑类比,VLM,一个视觉语言模型,基本上是一个 LLM,它被嫁接了一个伪视觉皮层,一个视觉编码器。我们的模型有一个视觉编码器,但它们也有一个动作专家,一个动作解码器。它有一个小视觉皮层和名义上的小运动皮层。模型做出决策的方式是它读取来自机器人的感官信息。它进行一些内部处理。这可能包括输出中间步骤。你可能会告诉它,“打扫厨房。”它可能会想,“嘿,要打扫厨房,我需要拿起盘子,我需要拿起海绵,我需要放下这个和那个。”最终,它通过这个思维链生成过程一直工作到动作专家,动作专家产生连续的动作。这必须是一个单独的模块,因为动作是连续的,它们是高频率的。它们的数据格式与文本标记不同。但结构上它仍然是一个端到端的转换器。粗略地说,技术上,它对应于一个混合专家架构。实际发生的是,它在预测“我应该做 X 事情。”然后有一个图像标记,然后是一些动作标记——它最终会做什么——然后是更多的图像,更多的文本描述,更多的动作标记。基本上我正在看正在进行的流。没错,除了动作不表示为离散标记。它实际上使用流匹配和扩散,因为它们是连续的,并且你需要非常精确地控制你的动作以实现灵巧控制。我发现你使用开源的 Gemma 模型,这是谷歌发布的开源 LLM,然后在此基础上添加动作专家,这非常有趣。我发现人工智能不同领域的研究进展不仅基于相同的技术,而且实际上是基于相同的模型,这非常有趣。你可以直接使用一个开源的 LLM,并在其上添加这个动作专家。你可能天真地认为,“哦,有一个独立的研究领域是机器人技术,还有一个独立的研究领域叫做 LLM 和自然语言处理。”不,实际上是相同的。考虑因素相同,架构相同,甚至权重也相同。我知道你在这些开源模型上进行了更多的训练,但我发现这非常有趣。这里有一个重要的主题需要牢记,那就是这些构建块之所以如此有价值,是因为人工智能社区在利用先验知识方面做得越来越好。我们从预训练的 LLM 和 VLM 中获得的大部分是关于世界的先验知识。它是一种被抽象的知识。你可以识别物体,你可以大致弄清楚图像中物体的位置,等等。但如果我必须用一句话来总结,近期人工智能创新对机器人技术最大的好处是利用先验知识的能力。模型是相同的模型,这在深度学习中一直如此。但正是这种能够引入先验知识、抽象知识的能力,这些知识可以来自许多不同的来源,这非常强大。我曾与 GDM 的研究员 Sander 谈过,他研究视频和音频模型。他提出了一个观点,他认为我们之所以看不到不同模态之间的太多迁移学习。也就是说,在视频和图像上训练语言模型似乎并没有让它在文本问题和任务上变得更好,因为图像在模型中的表示的语义级别与文本不同。他的论点是,文本在模型中具有这种高级语义表示,而图像和视频只是压缩的像素。当它们被嵌入时,它们并不代表某种高级语义信息。它们只是压缩的像素。因此,在它们通过模型的级别上没有迁移学习。显然,这与你正在做的工作非常相关。你的希望是,通过在机器人看到的视觉数据上训练模型,通常甚至是来自 YouTube 或其他任何地方的视觉数据,加上语言信息,加上机器人自身的动作信息,所有这些结合起来将使其普遍稳健。你写了一篇非常有趣的博客文章,解释了为什么视频模型不如语言模型稳健。抱歉,这不是一个非常完善的问题。我只是想得到一个反应。是的,那是什么情况?我可能有两件事可以告诉你。我有一些坏消息和一些好消息。坏消息是,你所说的触及了视频和图像生成模型长期挑战的核心。在某些方面,通过预测视频来获得智能系统的想法甚至比通过预测文本来获得智能系统的想法还要古老。文本的东西比视频的东西更早地变成了实用的东西。我的意思是,视频的东西很棒。你可以生成很酷的视频。最近完成的工作非常出色。但它不像仅仅生成视频和图像就已经产生了具有对世界深刻理解的系统,你可以要求它们做一些超越生成更多图像和视频的事情。而对于语言来说,显然它已经做到了。关于表征的这一点非常关键。我们可以这样想。想象一下将一个摄像头指向这栋楼外面,有天空,云在飘动,水,汽车在行驶,人们。如果你想预测未来会发生的一切,你可以用许多不同的方式来做到。你可以说,“好吧,周围有人。让我非常擅长理解人们在人群中的心理行为,并预测行人。”但你也可以说,“嗯,云在飘动。让我了解所有关于水分子和空气中的冰粒子的信息。”你可以深入研究这一点。如果你想完全理解那里发生的一切,直到亚原子层面,作为一个人的话,你可能需要花费几十年时间来思考这一点,而你甚至无法触及行人或水。如果你想真正预测那个场景中发生的一切,有太多的事情了,即使你做得非常好,捕捉了 100% 的某件事,当你涉及到其他所有事情时,已经过去了很久。而对于文本来说,它已经被抽象成了我们人类关心的那些位。表征已经存在了。它们不仅仅是好的表征,它们关注真正重要的事情。这就是坏消息。好消息是。好消息是我们不必仅仅通过将摄像头指向这栋楼外面来获取所有东西。当你有一个机器人时,那个机器人正在尝试完成一项工作。它有一个目的,它的感知是为了实现这个目的。这是一个非常好的聚焦因素。我们知道这对人们来说非常重要。你看到的东西确实受到你试图做的事情的影响。有无数的心理学实验表明,人们几乎有一种惊人的隧道视野,如果某件事与他们试图实现的目标无关,他们甚至看不到就在眼前的物体。这非常强大。肯定有原因人们这样做。当然,如果你在丛林里,看到更多比看到更少好。如果你有那个强大的聚焦机制,它一定对你实现目标非常重要。机器人将拥有那个聚焦机制,因为它们正在尝试实现一个目标。视频模型不如语言模型稳健,这对机器人技术是看跌的吗?你将不得不使用的很多数据……我猜你说很多数据都会被标记。理想情况下,你只想能够扔掉 YouTube 上的所有东西,我们录制过的所有视频,让它学会物理世界是如何运作的,以及如何行动。只是看看人类执行任务并从中学习。我猜你的意思是,仅仅从那里学习很难,它需要练习任务本身。让我这样说吧。假设我给了你大量的录像带或各种体育赛事的录像,并给你一年时间让你观看体育比赛。在那一年之后,我告诉你,“好吧,现在你的工作是打网球。”好吧,这太愚蠢了,对吧?而如果我先告诉你你要打网球,然后让我研究一下,现在你真的知道你在寻找什么了。这里有一个非常真实的挑战。我不想低估这个挑战。但对于基础模型来说,它们是具身的,它们通过互动学习,通过控制机器人系统,它们也有很大的潜力来更好地吸收其他数据源,因为它们知道它们想要做什么。我认为这本身并不是万能药。我认为它并不能解决所有问题,但它确实有很大帮助。我们已经看到了开端,我们可以看到将网络数据纳入机器人训练确实有助于泛化。我怀疑从长远来看,它将更容易使用那些迄今为止难以使用的数据源。众所周知,LLM 拥有所有这些涌现能力,这些能力从未被工程化进去,因为互联网文本的某个地方有训练数据,并且能够赋予它做某种事情的知识。对于机器人来说,似乎你是在手动收集所有数据。所以不会有这种神秘的新能力存在于你没有故意收集的数据集中。这似乎应该会使拥有稳健的、分布外的能力变得更加困难。我想知道未来 5-10 年的旅程是否会是这样的:每个子任务,你都必须给它数千次试验。然后,仅仅通过做子任务来自动化大量工作就非常困难。如果你想想咖啡师做什么,服务员做什么,厨师做什么,很少有涉及坐在一个地方做事情。你得四处走动,你得补充库存,你得修理机器,等等,在柜台和收银机和机器之间来回走动,等等。是否会有一长串的事情和技能,你必须不断地手动添加试验并标记并查看它们的表现如何?或者有什么理由认为它会更普遍地发展?这里有一个微妙之处。涌现能力不仅仅来自于互联网数据有很多东西。它们也来自于泛化一旦达到一定水平,就会变得组合化。我的一位学生非常喜欢在他的一些演示中使用一个可爱的例子。你知道国际音标(IPA)吗?不。如果你查字典,他们会用有趣的字母写出单词的发音。这基本上是国际音标。它是一种几乎专门用于在字典中记录单个单词发音的字母表。你可以要求一个 LLM 用国际音标写一份制作某顿饭的食谱,它会这样做。这真是太棒了。这绝对不是它从未见过的事情,因为 IPA 仅用于记录单个单词的发音。那是组合泛化。它是以新的方式组合你见过的事物。可以说这里没有什么深刻的新东西,因为是的,你已经看到了以那种方式写出的不同单词,但你已经发现现在你可以像组合英语单词一样组合另一种语言的单词。这实际上是涌现能力来自的地方。因此,原则上,如果我们有足够多样的行为,模型应该会发现这些行为可以以新的方式组合,以适应情况的需要。我们甚至在我们目前的模型中已经看到了一些东西。从宏观上看,回望五年后,我们可能会认为这些规模很小。但我们已经看到了我称之为涌现能力的东西。当我们玩弄我们的一些叠衣策略时,我们实际上是偶然发现的。机器人意外地从垃圾箱里捡起了两件 T 恤而不是一件。它开始折叠第一件,另一件碍事,捡起另一件,把它扔回垃圾箱。我们不知道它会这样做。太棒了。然后我们尝试玩弄它,是的,它每次都会这样做。它在工作。把别的东西放在桌子上,它就把它捡起来放回去。好的,这很酷。它开始把东西放进购物袋里。购物袋翻倒了,它又把它捡起来,扶正了。我们没有告诉任何人收集这些数据。我敢肯定,有人偶然在某个时候,或者可能故意捡起了购物袋。当你进行大规模学习时,就会出现这种组合性。这确实是所有这些非凡能力来源的地方。现在你把它和语言结合起来。你把它和各种思维链推理结合起来,模型就有很大的潜力以新的方式组合事物。对。我有一个类似的例子,当我参观你们办公室的机器人时。它在折叠短裤。我不知道训练集中是否有这样的情节,但只是为了好玩,我拿起一条短裤,把它翻过来。然后它就能够理解,它首先需要……首先,夹具就像这样,两个相对的手指和拇指状的东西。用这种东西就能做这么多事情,这确实令人震惊。但它理解它首先需要把它翻过来,然后再正确地折叠它。特别令人惊讶的是,这个模型似乎只有一秒钟的上下文。语言模型通常可以看到整个代码库。它们在输出之前会观察成千上万个标记,并进行思考。它们在制定编码计划之前会观察自己的思维链,长达数千个标记。你的模型看到一张图像,看到过去一秒钟发生的事情,并且模糊地知道它应该折叠这条短裤。它看到过去一秒钟发生的事情的图像。我猜这是可行的。它疯狂的是,它只会看到最后发生的事情,然后继续执行计划。把它翻过来,然后正确地折叠它。但令人震惊的是,一秒钟的上下文足以执行一个长达一分钟的任务。是的。我很好奇你最初为什么做出这个选择,以及为什么实际上可以完成任务……如果一个人只有一秒钟的记忆,并且必须做体力工作,我觉得这根本不可能。要说清楚,并不是说记忆少有什么好处。增加记忆,增加更长的上下文,所有这些东西,增加更高分辨率的图像,这些东西都会让模型变得更好。但对于你看到的那种技能来说,它不是最重要的原因,在某种程度上,这回到了莫拉维克悖论。莫拉维克悖论基本上,如果你想了解机器人技术的一件事,那就是这件事。莫拉维克悖论说,在人工智能领域,容易的事情很难,难的事情容易。也就是说,我们认为理所当然的事情——比如捡起物体,看,感知世界,所有这些——在人工智能领域都是难题。而我们觉得具有挑战性的事情,比如下棋和做微积分,实际上通常是更容易的问题。我认为这个记忆的东西实际上是莫拉维克悖论的伪装。我们认为我们做的那些认知上要求很高的、我们觉得很难的事情,让我们觉得,“哦,天哪,我满头大汗。我正在努力工作。”这些是需要我们把很多东西记在脑子里,很多东西记在心里。如果你在解决一个复杂的数学问题,如果你在播客上进行一次复杂的技术对话,这些都需要你在脑子里记住所有的拼图碎片。如果你做的是一个经过充分排练的任务——如果你是一名奥运游泳运动员,并且以完美的姿势游泳——并且你正处于状态,人们甚至说它是“在当下”。它就在当下。就像你练习得如此之多,以至于它已经烙印在你的大脑神经网络中。你不需要仔细考虑保留所有这些上下文。这确实是莫拉维克悖论的表现。这并不意味着我们不需要记忆。这只是意味着,如果我们想达到人们所拥有的灵巧性和身体熟练度水平,我们应该先做好其他事情,然后逐渐向上堆叠到更具认知要求的领域,进入推理,进入上下文,进入规划,所有这些东西。这些东西也很重要。你有一个三难困境。你有三个不同的东西,在推理时都需要更多的计算,而你想同时增加它们。你有推理速度。人类每秒处理 24 帧或类似的速度。我们可以非常快速地做出反应。然后你有上下文长度。对于那种只是打扫房子的机器人来说,我认为它必须意识到几分钟前或几小时前发生的事情,以及这些事情如何影响它对下一个任务的计划。然后你有模型大小。至少对于 LLM,我们已经看到增加参数数量会带来收益。我认为目前你的推理速度是 100 毫秒。你的上下文长度是一秒钟,然后模型有几十亿个参数?其中至少有两个比人类的等效值小很多个数量级。人脑有数万亿个参数,而这个只有大约 20 亿个参数。人类的处理速度至少和这个模型一样快,实际上快得多,而且我们有数小时的上下文。这取决于你如何定义人类上下文,但有数小时的上下文,几分钟的上下文。有时是几十年的上下文。没错。你必须在所有这三件事上都有许多数量级的改进,而这三件事似乎是相互矛盾的。增加一个会减少你可以分配给推理中另一个的计算量。我们该如何解决这个问题?这是一个非常大的问题。让我们试着把它拆解一下。里面有很多东西。其中一个是非常有趣的技术问题。这是一个我们可能会在未来几年看到很多有趣创新的领域。这是上下文的表征问题。你举了一些例子,比如如果有一个家庭机器人正在做某事,那么它需要跟踪。作为一个人,当然有些事情你跟踪的方式非常象征性,几乎是用语言。我有我的清单。我要去购物。至少对我来说,我可以在脑海中形象地看到我的清单。买酸奶,买牛奶,买任何东西。我不是在想象牛奶架上放着牛奶。我只是在想,“牛奶。”但还有其他事情在空间上更具视觉性,几乎是视觉上的。当

我正试图去你的工作室,我当时在想,“好吧,街道看起来是这样的。那条街看起来是这样的。我期望门口看起来是这样的。” 以正确的形式代表你的背景,捕捉你真正需要实现目标的东西——并且抛弃所有不必要的东西——我认为这是一件非常重要的事情。我们正通过多模态模型看到这一点。但我认为多模态不仅仅是图像加上文本。这是一个有很大空间可以进行真正令人兴奋的创新的领域。你的意思是就我们如何表示而言?我们如何表示背景,包括过去发生的事情,以及计划或推理,正如你在 LLM 世界中所说的,也就是我们希望在未来或解决任务的中间处理阶段发生的事情。以多种模态进行此操作,包括可能适合这项工作的学习模态,是克服其中一些挑战的巨大潜力。有意思。我还有一个问题,当我们讨论推理方面的这些艰难的权衡时,将其与人脑进行比较。人脑能够拥有数小时、数十年的上下文,同时能够在 10 毫秒的尺度上行动,拥有 100 万亿个参数,或者无论你怎么计算。我想知道,理解这里发生的事情的最好方法是,人脑硬件比我们拥有的 GPU 硬件先进得多,还是编码视频信息的算法效率更高。也许是某种疯狂的专家混合,活跃的参数也达到数十亿,低数十亿。或者它是两者的某种混合。如果你不得不考虑为什么我们拥有这些模型,在许多维度上,效率比大脑低几个数量级,是硬件还是算法?这是一个非常好的问题。我绝对不知道答案。我绝不是神经科学方面的专家。如果我必须猜测并提供一个更偏向于我所知道的事情的答案,那将是这样的。大脑是高度并行的。由于生物物理学的原因,它必须如此,但它比你的 GPU 更并行。如果你考虑现代多模态语言模型如何处理输入,如果你给它一些图像和一些文本,它首先读取图像,然后读取文本,然后一次一个 token 生成输出。对于一个具身系统来说,拥有并行进程对我来说更有意义。现在,数学上你可以使并行和顺序的东西之间产生近似的等价。 Transformer 本质上不是顺序的。你通过插入位置嵌入来使它们顺序化。Transformer 本质上是非常可并行的东西。这就是它们如此出色的原因。我认为,从数学上讲,这种高度并行的事情——你同时进行感知、本体感觉和规划——不一定需要与 Transformer 有太大不同,尽管其实际实现会有所不同。你可以想象系统会并行思考,“好吧,这是我的长期记忆,这是我十年前看到的东西,这是我的短期空间信息,这是我的语义信息,这是我现在看到的东西,这是我正在计划的东西。”所有这些都可以以某种非常熟悉的注意力机制的方式实现,但实际上所有这些都在并行运行,也许以不同的速率,也许更复杂的事情运行得更慢,更快的反应性东西运行得更快。如果五年后我们拥有一个在与世界互动方面与人类一样健壮的系统,那么是什么使得能够运行这些模型成为可能?能够实时流式传输视频信息,或者数小时的先前视频信息被编码并考虑在毫秒级解码时,并且拥有更多的参数。仅仅是 Nvidia 交付了更好的 GPU,还是你们想出了更好的编码器之类的东西?这五年发生了什么?这个问题有很多方面。当然,这是一个非常迷人的系统问题。我绝不是系统专家。我想,在实践中,正确的架构,特别是如果你想要一个负担得起的低成本系统,至少会将一部分思考外包出去。你可以想象在未来你会有这样一台机器人,如果你的互联网连接不太好,机器人就会处于一种更迟钝的反应模式。但如果你有良好的互联网连接,它就会变得更聪明。这很酷。算法研究也可以在这里提供帮助,找出正确的表示方法,简洁地表示你的过去观察以及观察的变化。你的感官流在时间上是高度相关的。从每次额外观察中获得的信息量与该观察的整体信息量不同。我现在看到的图像与我之前看到的图像高度相关。原则上,我想简洁地表示它。如果我独立表示这些图像,我可以得到一个更压缩的表示。算法方面有很多工作可以做好。这真的是很有趣的算法工作。还有一个非常迷人的系统问题。说实话,我还没有深入研究系统问题,因为你想在知道机器学习解决方案的形状之后再实现系统。但那里有很多很酷的事情要做。也许你们只需要雇佣那些管理 YouTube 数据中心的员工,因为他们知道如何编码视频信息。这引出了一个有趣的问题。对于 LLM,理论上你可以在这个笔记本电脑上运行你自己的模型。现实情况是,最大、最有效的模型是同时被成千上万的用户运行的,而不是在本地运行。由于批处理的固有效率,加上我们必须执行这项计算密集型推理任务的事实,同样的事情会发生在机器人领域吗?你不想让每个机器人携带价值 50,000 美元的 GPU。你只想让它发生在别处。在这个机器人领域,我们是否应该预见到需要无处不在的连接?你需要非常快速的机器人。你来回传输视频信息,或者至少单向传输视频信息。这对机器人的部署方式有什么影响吗?我不知道。但如果我必须猜测,我会猜测我们会两者都看到。我们会看到低成本系统进行离线推理,以及更可靠的系统。例如,在有户外机器人或无法依赖连接的环境中,那些成本会更高,并且会进行在线推理。我将从技术角度说几件事,这可能有助于理解这一点。虽然实时系统显然需要实时控制,通常是高频控制,但每个时间步所需的思考量可能出奇地低。同样,我们在人类和动物身上也看到了这一点。当我们计划动作时,大脑中确实存在一个真正的规划过程。如果你记录猴子的大脑,你会发现规划的神经相关性。在动作发生之前会发生一些事情。当那个动作发生时,动作的形状与动作发生之前的事件相关。这就是规划。这意味着你设置了一些东西,并设置了某个过程的初始条件,然后展开该过程,这就是动作。这意味着在那个动作过程中,你进行的处理更少,并且你提前进行了批处理。但你并非完全处于开放循环中。你不是在播放录音带。你一边走一边反应。你只是在不同层次的抽象中反应,更基础的抽象层次。同样,这又回到了表示。找出哪些表示足以提前规划和展开,哪些表示需要紧密的反馈循环。对于那个紧密的反馈循环,你反馈的是什么?如果我驾驶一辆车,也许我是在对车道标记的位置进行反馈,以便我保持直线行驶。以较低的频率,我大致了解我在交通中的位置。你们有几年前的讲座,你说即使对于机器人来说,RL 在很多情况下也比模仿学习更好。但到目前为止,模型只进行模仿学习。我很好奇你的想法是否有所改变。也许没有改变。但然后你需要为 RL 做这件事。为什么你还不能做 RL?关键在于先验知识。为了有效地从自己的经验中学习,事实证明,已经了解一些你正在做的事情非常非常重要。否则,它会花费太长时间,就像一个人小时候,需要很长时间才能学会非常基本的事情,例如第一次学会写字。一旦你已经有了一些知识,你就可以很快地学会新东西。现在用监督学习训练模型的目的是建立提供先验知识的基础,这样它们以后就能更快地弄清楚事情。同样,这不是一个新想法。这正是我们在 LLM 上看到的。LLM 最初只是进行下一个 token 预测的训练。这提供了一个极好的起点,首先是各种合成数据生成,然后是 RL。我们期望任何基础模型工作都遵循相同的轨迹,这是完全有道理的。我们首先以一种有些粗暴的方式建立基础。基础越牢固,就越容易通过更易于访问的训练使其变得更好。十年后,知识工作的最佳模型是否也会是机器人模型,或者是否会附加一个动作专家?我之所以这样问,是因为到目前为止,我们已经看到了使用更通用的模型来处理事物的优势。机器人领域是否也会属于这一类?我们是否只会拥有一个模型,它能做一切事情,包括体力劳动和知识工作,还是你认为它们会继续分开?我真的很希望它们实际上是相同的。显然我非常偏心。我热爱机器人技术,我认为它对人工智能非常基础。但乐观地说,我希望情况恰恰相反,即方程中的机器人元素将使所有其他东西变得更好。我可以告诉你两个原因。一个与表示和焦点有关。我之前说过,对于视频预测模型,如果你只想预测发生的一切,很难弄清楚什么才是相关的。如果你有来自尝试完成一项任务的焦点,这项任务会构建你如何看待世界的方式,让你能够更有效地利用其他信号。这可能非常强大。第二个是,从非常深入、根本的层面理解物理世界,达到一种超越语言所能表达的层面,可以帮助你解决其他问题。我们一直都在经历这一点。当我们谈论抽象概念时,我们会说,“这家公司很有动力。”我们会用社会隐喻来描述无生命的物体。“我的电脑恨我。”我们以特定的方式体验世界,我们的主观体验以非常深刻的方式塑造了我们的思考方式。然后我们将其用作锤子,基本上敲打所有其他过于抽象而无法以其他方式处理的钉子。在推理速度和模型大小等方面,物理机器人可能还有其他相关的考虑因素,这可能与知识工作的考虑因素不同。也许仍然是同一个模型,但然后你可以以不同的方式提供服务。联合训练的优势足够高。我想知道,五年后,如果我使用一个模型为我编写代码,它是否也知道如何做机器人方面的事情?也许编写代码和机器人方面的优势足够高,值得这样做。从抽象知识工作的顶峰来看,编码可能是最抽象的活动,因为计算机编程的数学性质,它是一项极其抽象的活动,这就是为什么人们如此难以应对它的原因。我对为什么模拟对机器人不起作用感到有些困惑。如果我看看人类,聪明的人在有意学习时会做得很好,注意到模拟与现实生活的相似之处,并从中学习。如果你有在模拟中学习的飞行员,或者在模拟中学习的 F1 车手,我们是否应该期望随着机器人变得更聪明,它们也能通过模拟学习更多东西?还是这是被诅咒的,我们需要永远的真实世界数据?这是一个非常微妙的问题。你用飞行员使用模拟的例子很有趣。但要记住的是,当飞行员使用模拟器学习驾驶飞机时,他们非常有目标导向。他们生活的目标不是学习使用模拟器。他们生活的目标是学习驾驶飞机。他们知道之后会有考试。他们知道最终他们将负责几百名乘客,他们真的需要不要让那架飞机坠毁。当我们用来自不同领域的数据训练模型时,模型不知道它们应该解决特定的任务。它们只是看到,“嘿,这是我需要掌握的一件事。这是我需要掌握的另一件事。”也许更好的类比是,如果你玩一个可以驾驶飞机的视频游戏,然后最终有人把你放在一架真实飞机的驾驶舱里。并不是说视频游戏没有用,但它不一样。如果你试图玩那个视频游戏,你的目标是真正掌握那个视频游戏,你不会以完全相同的方式进行。你能做某种元 RL 吗?你写了一篇非常有趣的 2017 年的论文。也许损失函数不是它在特定视频游戏或特定模拟中的表现如何。我让你来解释一下。但它是关于在不同视频游戏中训练它如何更好地完成其他下游任务。我解释得很糟糕,但你能做得更好,并试着解释我当时想说什么吗?你想说的是,也许如果我们有一个非常聪明的模型正在进行元学习,那么它也许可以弄清楚它在下游问题、真实世界问题上的表现通过在模拟器中做某事而得到提高。然后具体地将其作为损失函数,对吧?没错。但这里有一个问题。有一系列的想法,它们都将是这样的,“通过利用其他东西来训练它,使其在现实世界中表现更好。”所有这些的关键是能够训练它在现实世界中表现更好。我怀疑在现实中我们甚至不需要做如此明确的事情。如你之前指出的,元学习是涌现的。LLM 通过上下文学习本质上是在进行一种元学习。我们可以争论这在多大程度上是学习还是不是学习,但重点是,在正确的对象和真实数据上训练的大型强大模型,在利用所有其他东西方面做得更好。我认为这实际上是关键。回到你的飞行员,飞行员是根据真实世界的客观目标进行训练的。他们的目标是成为一名优秀的飞行员,取得成功,拥有美好的职业生涯。所有这些都会反过来影响他们的行为,并利用所有其他数据源。所以,我认为利用辅助数据源(包括模拟)的关键是构建一个真正优秀并具有这些涌现能力的正确的基础模型。正如你所说,要做到如此优秀,它必须有正确的对象。现在我们知道如何从真实世界数据中获得正确的对象,也许我们可以从其他东西中获得它,但这现在更难了。同样,我们可以参考其他领域的例子。如今,如果有人训练 LLM 来解决复杂问题,他们会使用大量合成数据。他们能够有效地利用这些合成数据的原因是,他们有一个基于大量真实数据训练的起点,并且他们理解了这一点。一旦它理解了,它就能更好地利用所有其他东西。也许讽讽刺的是,利用包括模拟在内的其他数据源的关键是真正擅长使用真实数据,理解世界上的事情,然后你就可以有效地利用它。一旦我们到了 2035 年或 2030 年,基本上就是这个科幻世界,你是否乐观地认为真正的通用人工智能能够构建模拟器,在其中排练人类或人工智能从未有机会练习过的技能?他们需要练习成为宇航员,因为我们正在建造戴森球,他们可以在模拟中做到这一点。或者模拟的问题是否会一直存在,无论模型变得多聪明?我想说的是。从根本上说,你自己创造的合成体验并不能让你更多地了解世界。它允许你排练事情,它允许你考虑反事实。但某种关于世界的信息需要被注入系统。你提出这个问题的方式很好地阐明了这一点。在机器人领域,人们传统上一直将模拟视为注入人类知识的一种方式。一个人知道如何写微分方程,他们可以将其编码,这比以前给了机器人更多的知识。但我们从其他领域的经验,从视频生成如何从 LLM 的合成数据中获得信息中了解到,也许创造合成体验的最强大方式是来自一个非常好的模型。该模型可能比人类更了解那些细微的细节。但当然,那个模型从哪里获得知识?通过体验世界。从某种意义上说,你说的很对,一个非常强大的 AI 系统可以模拟很多东西。但到那时,它几乎无关紧要,因为从黑盒的角度来看,该系统正在发生的事情是信息输入,能力输出。无论处理信息的方式是想象一些东西并进行模拟,还是使用某种无模型方法,在我们理解其能力方面都无关紧要。你对人类中的等价物有什么看法吗?无论我们是在做白日梦还是睡觉。我不知道你是否对我们正在做的这个辅助事情有什么看法,但如果你必须做一个机器学习类比,那是什么?当然,当你睡觉时,你的大脑会做一些事情,看起来很像它醒着时所做的事情。它看起来很像在回放经历,或者可能是在生成新的统计上相似的经历。猜测通过学习模型进行的模拟可能是你大脑弄清楚反事实的一种方式,这是非常合理的。比这更根本的是,最优决策的核心,无论你怎么做,都需要考虑反事实。你基本上必须问自己,“如果我做了这个而不是那个,会不会更好?”你必须以某种方式回答这个问题。无论你是通过使用学习过的模拟器来回答这个问题,还是通过使用价值函数或奖励模型来回答这个问题,最终都是一样的。只要你有一些考虑反事实并弄清楚哪个反事实更好的机制,你就成功了。我喜欢这样想,因为它简化了事情。它告诉我们,关键不一定在于进行非常好的模拟。关键在于弄清楚如何回答反事实。是的,有意思。再次回到大局。我对机器人经济何时部署的理解感兴趣,是因为它与理解 AGI 将如何快速发展有关,因为这显然与数据飞轮有关。而且,如果你只是推断到 2030 年的 AI 的资本支出,人们有不同的估计,但许多人的估计是数百吉瓦——100、200、300 吉瓦。你可以简单地计算一下到 2030 年部署 100-200 吉瓦的数字。每年的边际资本支出在万亿美元。每年是 2-4 万亿美元。这相当于你必须建造的实际数据中心,你必须建造的实际芯片工厂,你必须建造的实际太阳能电池板工厂。我非常好奇到 2030 年,最大的瓶颈仅仅是数据中心旁边铺设太阳能电池板或组装数据中心的人,还是机器人经济已经成熟到可以显著帮助这个过程?这很酷。你基本上是在说,我应该现在买多少混凝土来建造数据中心,以便到 2030 年我能为所有机器人供电?这比我想到的更具雄心,但这是一个很酷的问题。当然,好消息是机器人可以帮助你建造这些东西。但到那时它们能做到吗?有非机器人方面的东西,这也需要大量的资本支出。然后有机器人方面的东西,你需要建造机器人工厂等。整个行业都会出现爆炸式增长。机器人能在多大程度上加速这一点或使其成为可能?原则上,很多。我们有时倾向于将机器人视为机械人,但事实并非如此。人就是人,机器人就是机器人。机器人更好的类比是你的汽车或推土机。它的维护要求低得多。你可以把它们放到各种奇怪的地方,它们不必看起来像人。你可以制造一个 100 英尺高的机器人。你可以制造一个微小的机器人。如果你有能力驱动各种异构机器人系统,你可能比拥有机械人做得更好。它可以为真人带来巨大的生产力提升,并能让你解决非常困难的问题。例如,我绝不是数据中心方面的专家,但你可以将数据中心建在非常偏远的地方,因为机器人不必担心附近是否有购物中心。这里有一个关于软件在哪里的问题,还有一个关于我们会有多少物理机器人的问题。你在物理智能中训练的有多少桌面机械臂,世界上有多少?到 2030 年会有多少?这些都是棘手的问题,需要多少才能实现智能爆炸。这些都是非常棘手的问题。此外,到目前为止,机器人领域的规模经济并没有像长期来看可能那样运作。举个例子,当我 2014 年开始从事机器人工作时,我使用了一个名为 PR2 的非常好的研究机器人,购买成本为 400,000 美元。当我开始在加州大学伯克利分校创立我的研究实验室时,我购买了价值 30,000 美元的机械臂。我们现在在物理智能使用的每个机械臂成本约为 3,000 美元。我们认为它们的制造成本可以更低。这种学习率的原因是什么?有几件事。首先,当然与规模经济有关。定制的高端研究硬件当然会比更标准化的硬件贵得多。然后当然还有技术因素。随着我们制造驱动机器的能力越来越强,它们的成本也越来越低。还有软件因素。你的 AI 系统越聪明,你就越不需要硬件来满足某些要求。工厂里的传统机器人需要执行高度可重复的动作。因此,它需要一定的精度和鲁棒性,如果你可以使用廉价的视觉反馈,你就不需要这些了。AI 也使机器人更便宜,并降低了对硬件的要求。有意思。你认为学习率会继续吗?你认为到本十年末,购买移动机械臂的成本会是几百美元吗?这是一个非常好的问题,可以问我的联合创始人 Adnan Esmail,他可能是世界上最适合回答这个问题的人。当然,我每年看到的成本下降都让我感到惊讶。世界上大概有多少个机械臂?超过一百万个吗?少于一百万个吗?我不知道答案,但这也很难回答,因为并非所有机械臂都一样。可以说,在工厂组装汽车的机器人并不是适合思考的那种。你想训练的那种。很少,因为它们目前并未作为工厂机器人商业化部署。不到 10 万个?我不知道,但可能吧。好的。我们想要数十亿机器人,至少数百万机器人。如果你只是考虑你需要爆炸式 AI 增长所需的工业爆炸,你不仅需要机械臂,还需要能够移动的东西。基本上,我只是在想,到那时是否有可能需要更多劳动力来支持这次 AI 繁荣?嗯,当需求很大时,经济非常擅长满足需求。2001 年世界上有多少部 iPhone?这绝对是一个挑战。这是值得思考的事情。对于像我这样的研究人员来说,一个特别重要的问题是 AI 如何影响我们对硬件的看法?有些事情会非常非常重要。你可能希望你的东西不要经常坏。有些事情确实属于这个问号的范畴。我们需要多少根手指?你自己也说过,你曾惊讶于一个有两根手指的机器人能做很多事情。也许你仍然想要更多,但仍然找到最低限度,仍然能让你拥有良好的功能,这很重要。这在问号框里。有些事情我们可能不需要。我们可能不需要机器人超级精确,因为我们知道反馈可以弥补这一点。我目前认为我的工作是弄清楚我们可以摆脱的最小包装。我确实在考虑机器人,就好像它们是最小包装一样,因为我不认为我们会有一个终极机器人,基本上是机械人。我们将拥有许多东西,这些东西是优秀、有效的机器人所需要的。就像好的智能手机需要触摸屏一样。这是我们都同意的。然后它们还需要许多其他可选的东西,具体取决于需求、成本点等。一旦我们拥有非常强大的 AI 系统,可以插入任何机器人以赋予其基本的智能水平,那么就会有很多创新,让不同的人能够优化机器人硬件以适应每个细分市场。就制造商而言,是否有机器人领域的 Nvidia?目前还没有。也许有一天会有。也许我太理想化了,但我真的很想看到一个机器人种类繁多的世界。作为一名设计运行在上面的算法的人来说,当今硬件最大的瓶颈是什么?这是一个很难回答的问题,主要是因为事情变化太快了。对我来说,我花大量时间思考的硬件方面主要是可靠性和成本。并不是我太担心成本。只是成本转化为机器人的数量,转化为数据的量。作为一名机器学习人员,我真的很喜欢拥有大量数据。我真的很想要低成本的机器人,这样我就可以拥有更多机器人,从而获得更多数据。可靠性也很重要,原因大致相同。随着事情的进展,我们会对这一点有更清晰的认识。基本上,今天的 AI 系统并没有将硬件推向极限。随着 AI 系统的不断改进,硬件将达到极限,然后我们 hopefully 会对你的问题有一个更好的答案。我问过很多嘉宾这个问题。如果你深入了解这次 AI 爆炸的任何一个环节,你会发现很多实际的供应链是由中国制造的,芯片除外。你谈论数据中心,你说,“哦,太阳能电池板的所有晶圆以及很多电池和模块等都是在中国制造的。”你只需查看供应链。显然,机械臂也是在中国制造的。你将生活在一个硬件制造急剧增加的世界里,因为每个机器人都能产生人类工人一定比例的价值。不仅如此,人类工人或任何工人的价值都呈指数级增长,因为我们需要大量人员来铺设数万英亩的太阳能农场、数据中心、铸造厂以及所有东西。在这个繁荣的世界里,最大的瓶颈是如何物理部署机器人?你能制造多少?因为你们将提出算法。我们只需要硬件。我问过很多嘉宾这个问题。如果你看看你正在观察的链条的一部分,中国为什么不会默认获胜?如果他们生产所有机器人,而你提出了使这些机器人非常有价值的算法,为什么他们不默认获胜?这是一个非常复杂的问题。我将从更广泛的主题开始,然后尝试深入细节。一个更广泛的主题是,如果你想拥有一个通过高素质劳动力取得进步的经济体——拥有高生产力的人,这意味着每个人的工作时间都能完成很多事情——自动化真的非常非常有用。自动化就是倍增每个人生产力的东西。同样,这与 LLM 编码工具相同。LLM 编码工具放大了软件工程师的生产力。机器人将放大多数从事工作的人的生产力。现在这是一个最终状态,一个理想的最终状态。如何实现这一状态,如何使其成为社会吸引人的旅程,如何处理其地缘政治维度,这其中存在很多复杂性。所有这些事情都相当复杂。它需要做出一些非常好的决定。关于投资平衡的机器人生态系统的良好决策,支持软件创新和硬件创新。我不认为其中任何一个都是无法克服的问题。它只需要一定的长期愿景和正确的投资平衡。让我对此感到乐观的是最终状态。我们可以都同意,在美国,我们希望拥有一个人们生产力高、人们受过良好教育并从事高价值工作的社会。因为这个最终状态对我来说与自动化、与机器人技术在某种程度上是兼容的,应该有很大的动力去实现这个状态。然后从那里,我们必须解决所有将帮助我们到达那里的细节。这并不容易。在私营企业、投资、政治维度方面,需要做出很多复杂的决定。但我对此非常乐观,因为在我看来,隧道尽头的灯光是正确的方向。我想这是一个不同的问题。如果价值受制于硬件,而你只需要生产更多硬件,那么在美国或盟友那里制造数亿或数十亿机器人的途径是什么?我不知道如何处理这个问题,但这似乎与“嗯,这对人类工资有什么影响”之类的问题不同。至于我们如何实现这一目标的具体细节,这是一个非常漫长的对话,我可能不是最合格的人来谈论。但就配料而言,这里重要的配料是机器人有助于处理物理事物、体力劳动。如果制造机器人本身就是体力劳动,那么精通机器人技术应该有助于此。这有点循环,当然,就像所有循环的事情一样,你必须引导它并尝试启动那个引擎。但这似乎比数字设备之类的问题更容易解决。创造计算机、手机等需要付出努力。但计算机和手机本身并不能帮助工作。对。我想反馈循环是双向的。它们可以帮助你,也可以帮助他人,这是一个正和世界。它们帮助他人不一定不好。但就很多进入这个反馈循环的东西而言——子组件、制造和供应链,已经在中国的存在——似乎更强的反馈循环会存在于中国。然后是另一个独立的讨论。也许那没关系,也许那很好,也许他们会继续出口给我们。但我只是觉得值得注意的是,每当我与客人谈论不同事情时,他们总是说,“是的,几年之内,这里供应链的每一个环节的关键瓶颈都将是中国占世界供应量的 80%。”这就是为什么我之前说,在这里做好一些事情非常重要,那就是一个平衡的机器人生态系统。AI 令人兴奋不已,但我们也应该认识到,做好 AI 并不是我们唯一需要做的事情。我们需要考虑如何平衡我们的优先事项、我们的投资、我们花费时间的事情。例如,在物理智能公司,我们非常认真地对待硬件。我们自己制造很多东西,我们希望拥有一个与我们的 AI 路线图并行的硬件路线图。但这只是我们。对美国来说,可以说对整个人类文明来说,我们需要非常全面地思考这些问题。当一个领域(如 AI)出现大量兴奋和大量进展时,很容易分心。我们往往会忽略其他事情,包括你所说的。有一个硬件组件。有一个计算等基础设施组件。总的来说,拥有更全面的视角看待这些事情是好的。我有时希望我们能有更多关于这方面的全面对话。从整个社会的角度来看,他们应该如何看待机器人和知识工作的进步?基本上,社会应该为全面自动化做计划。将有一段时期,人们的工作将变得更有价值,因为经济会出现巨大的繁荣,我们正在建造所有这些数据中心和工厂。最终,人类可以用身体做事,我们也可以用心做事。没有秘密的第三件事。社会应该为之计划什么?应该是人类的全面自动化。社会也会变得更加富有。假设有方法可以做到这一点,使每个人都比今天过得更好。但最终状态,隧道尽头的灯光,是全面自动化加上超级富裕的社会,加上一些再分配或任何其他方式来解决这个问题。我不知道你是否不同意这种描述。在某种程度上,这是一种非常合理的看待事物的方式。但如果我从技术中学到了一件事,那就是它很少像人们预期的那样发展。有时旅程和目的地一样重要。很难提前规划一个最终状态。方向上,你说得很对。我认为我们集体思考如何构建我们周围的世界,使其能够适应所有部门日益增长的自动化,这一点非常重要。但我们应该像关注目的地一样关注旅程,因为事情会以各种不可预测的方式发展。我们会发现自动化出现在各种地方,可能不是我们首先期望的地方。这里真正重要的常数是教育非常有价值。教育是人们应对变革负面影响的最佳缓冲。如果作为社会,我们可以拉动一个杠杆,那就是更多的教育。这是真的吗?莫拉维克悖论是,对人类最有益的教育可能最容易自动化,因为教育 AI 非常容易。你可以把需要八年研究生才能完成的教科书在一下午的时间里交给它们。教育赋予你的是灵活性。它更多的是关于你获取技能、获取理解的能力,而不是你所知道的特定事实。必须是良好的教育。是的。好的,Sergey,非常感谢你来参加播客。超级迷人。是的,这很激烈。艰难的问题。