📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Stanford Robotics Seminar ENGR319 | Winter 2026 | Bringing AI Up To Speed

Stanford Online1:13:57

Transcription

很高兴来到这里,我将直奔主题,因为时间紧迫。所以,我们将直接开始。请将您的问题留到最后,我们将一一解答。

好的,首先,我为什么称之为“让人工智能赶上进度”?显然,人工智能领域的发展速度已经超出了任何人的想象。然而,我却在这里谈论让它赶上进度。这究竟是怎么回事?

好的,让我们从一个非常简单的问题开始。您认为哪一项任务更具智能性?是成为像马格努斯·卡尔森那样的顶级国际象棋特级大师,还是仅仅能够开车?

现在,显然没有正确或错误的答案,但直觉上,国际象棋似乎是显而Ну,很明显,国际象棋应该是显而易见的答案,对吧?它需要计算、记忆、模式识别、推理和预判。它具备了人类智能的所有特征。而另一方面,开车则更加例行公事。每天有数十亿人都在做这件事。

现在我们可以反过来问,对人工智能来说,哪一个更难解决?您凭借自己的智慧,已经能猜到我的意思了,对吧?因为其中一个问题几十年前就已经解决了。如您所知,今天的任何一款免费的国际象棋程序都比任何人类棋手都要强大,无论是现在还是过去。但我们能对人工智能和驾驶说同样的话吗?

答案是,并非如此。我们已经取得了惊人的进步,尤其是在这个国家和世界的这个地区。这里是自动驾驶汽车的中心。但它们还没有完全成熟,对吧?它们并非万无一失。它们有时会毫无征兆地突然停下。而且它们似乎经常犯下一些优秀的人类驾驶员——强调“优秀”这个词——很少会犯的错误。

尽管我们现在正在全国范围内部署这些车辆,但这是一个有趣的时期,看看它们将如何发展,因为有时这些错误,你知道,可能会导致非常严重和悲惨的后果。当然,我只是从几年前的一些头条新闻中挑选了一些例子,但这个故事一直延续至今。尽管我们看到了自动驾驶汽车的成功,但它们仍然会定期出现故障。你知道,曾有调查发现 Waymo 的车辆不像人类驾驶员那样避让校车。而底部的两条头条新闻是昨天的,对吧?所以,这个问题并没有消失。

而且,它现在甚至不是一个秘密,而是众所周知的事实,几乎就像一个关于自动驾驶汽车的事实,它们需要人类的持续照看。因此,有远程操作员,他们至少在为这些汽车提供推理指导,如果不是实际有时会覆盖这些汽车的控制的话。这就是今天的最先进技术。它无处不在,但仍然需要大量的人工协助才能完美运行。

另一方面,你知道,我昨天从东海岸飞回来。我做了很多人在我的位置上都会做的事情。我只是去了机场,租了一辆车。这是一辆我这辈子从未开过的车,而且我刚下飞机,非常疲惫。但就像我们都做过类似的事情一样,你坐进一辆车,几分钟内就能适应它的控制,然后你就可以出发了。就我而言,我在城市里开车。我通常不会在 101 号公路和 El Camino Real 这些地方开车,但我能够做到,尽管我很累,而且我开的是一辆我这辈子从未开过的车。

所以,是的,人类是有缺陷的。我们会犯错。我们会分心。我们会感到疲倦。但我们有时也会忘记我们在泛化这个任务上有多么出色。我们认为这个能力是理所当然的。

所以,这就引出了一个问题,一个显而易见的困境。为什么看似更高级的智能任务被轻易解决了,而我们却在处理那些平凡的任务时举步维艰?

正如你们已经知道的,部分答案是因为像国际象棋和类似复杂度的游戏,被计算机科学家认为是相当封闭的系统。是的,它们的复杂性是巨大的,但它受到结构、有限规则和可预测结果的约束。

另一方面,正如你们许多人所知,驾驶被认为是一个开放的系统。简单来说,这意味着道路上可能发生任何事情。因此,自动驾驶汽车必须能够应对在驾驶过程中可能出现的任何边缘情况或不确定的意外交通状况。相信我,我在印度长大,我深知一些关于意外驾驶场景的事情。

顺便说一句,这是过去一周东海岸的驾驶景象。

好了,更正式地说,我们面临着覆盖复杂性的问题。想象一下这个巨大的高维空间,其中某个方向捕捉了您在道路上可能遇到的所有可能物体。您能想象到的任何东西都可能出现在明天的道路上。在这个我们甚至无法枚举的巨大空间中的另一个方向,是这些物体出现的各种环境。我所说的环境,不仅仅是天气和能见度。它还包括不同的道路几何形状、不同的驾驶文化、交通标志,以及所有这些对车辆而言的变化。

这是一个巨大的空间,无法充分描述,因此也无法覆盖。但即使您设法检测到了空间中的元素,尤其是考虑到基础模型和计算机视觉的发展,下一个轴肯定会困扰您。下一个轴是各种物体之间以及它们与环境随时间变化的相互作用的集合。它随着时间展开。所以,这是极其复杂的。我希望您能理解。即使这张图试图将所有这些部分整合在一起。

我们不知道这个空间是什么样的。即使我画了一个方框,我们也不知道这个方框到底是什么样的。我们只知道存在一个方框。我推测,在自动驾驶汽车行业中,人们正在这个方框的微小区域内运作,试图尽可能多地覆盖。这就是通常所说的自动驾驶汽车的运行设计域。

所以,这就是自动驾驶汽车如此困难的原因:您可能在方框内的任何地方,但仍然必须是安全的。许多人类也做不到这一点,但优秀的人类在这项任务上做得非常好。

当然,在过去的五年里,我们在开放系统中取得了惊人的进展,例如语言。语言是一个开放系统,或者说是半开放系统。但最近,计算机视觉比我们所知的任何其他事物都更加开放。许多人认为这也是人工智能的支柱。

这就是为什么您会看到算法在更开放的任务上变得越来越好。它们正在通过奥林匹克竞赛和律师资格考试。但对于在座的各位,我认为我的下一个观点很容易传达和说服。我认为这是解决方案的一部分,但不是全部解决方案。因为人工智能的第三个支柱是,当这些方法和算法必须走出“矩阵”,从这个虚拟世界进入现实世界时,那就是挑战,正如你们所知,那就是物理智能。您需要了解如何体验您自身行为的原因和结果。你知道,我可以闭上眼睛,让自己保持平衡,诸如此类的事情,你必须通过经验来体验和建立理解。这就是物理人工智能试图捕捉的。

所以,就像这里的许多人以及许多观看的人一样,这就是激励我、让我兴奋的事情。你知道,这就是驱动我大部分工作的动力。但事实胜于雄辩。我记得理查德·费曼的一句话:“我无法创造的东西,我不理解。”不幸的是,许多这些视觉模型在创造准确的物理世界模型方面存在困难。它们可以通过更多的训练和微调来改进,但总的来说,它们在接触动力学、因果关系、推理基础以及事物的前后关系以及人类本身的体现方面存在困难。同样,这可能已经是几年前的事情了,但当你处理基础模型时,几年感觉就像几十年。

所以,如果您看一些更近期的东西,它会变得更好,对吧?这是我去年秋天或夏天的时候看到的,这些视频在网上疯传。我在这里静音了音频,但它们完全是人工智能生成的。您看到的角色实际上在讨论他们是否认为自己是人工智能生成的,这既令人着迷又令人担忧。

所以,这显然非常非常逼真。它具有电影般的质感。灯光完美。他们的动作协调得很好。所以,当你看到这些演示和视频时,似乎“注意力”就是一切。但也要注意背景。

在这个视频中,您会看到一个骑自行车的人穿过路中间的车辆。在这里,交通是单向的,突然,这辆公交车就违反了交通规则。这个更微妙一些,但在背景中,您会看到行人突然出现在路中间,这在现实世界中永远不会发生。所以,前景得到了所有正确的关注,但幻觉隐藏在背景中。

因此,在我看来,自动驾驶汽车无非是人工智能物理智能的一个绝佳平台、一个试金石和一个试验台。它具备了所有要素。您拥有多模态传感器。您拥有实时性。决策必须快速而迅速。这就是我们所说的开放世界问题。但更重要的是,与 ChatGPT 不同,如果它出现幻觉,您只需提示它做得更好。对于自动驾驶汽车来说,安全是不可谈判的。您必须将其做好,原因如我们之前所述。

因此,出于这些原因,在过去的几年里,我在弗吉尼亚大学的团队致力于解决自动驾驶汽车安全领域一些最棘手的未解问题,这都是出于推进物理智能的愿望。

在剩下的时间里,我将快速浏览所有这些内容。我不会深入探讨任何一个问题。我将为您提供问题是什么、我们的想法是什么,然后继续前进,从一个问题跳到另一个问题,为您提供该领域现状的整体视图。

让我们从第一个问题开始,这可能是最难的问题之一。我们如何衡量自动驾驶汽车是否安全?许多研究人员和学者对此进行了深入思考。我绝不是第一个,但我在这里告诉您,我们没有答案。或者至少是一个大家都能同意的答案。没有可靠的、大家普遍认同的衡量标准来判断自动驾驶汽车何时是安全的。部分原因在于,很难定义什么是安全,对吧?什么是安全的正确定义?对此没有共识。而根本的矛盾在于,安全是高度情境化的。这里安全的东西不一定适用于全球,它可能非常抽象,比如“没有碰撞”,但即使没有与周围的每个人发生碰撞,您仍然可能不安全。

所以,我们在这个自动驾驶汽车安全领域感兴趣的问题是,为了能够开始凭经验客观地回答这些难题,我们首先必须回答一个相关但更简单的问题,那就是比较问题。让我选取两辆在不同区域运行的车辆,然后问一个问题:A比B更安全吗?如果我能开始回答这些比较性问题,那么我就有可能在经验层面推理安全,而不仅仅是传闻或个案层面。

所以,这已经成为我们许多思考的主题。顺便说一句,A和B不一定是公司A与公司B的比较。它也可以是同一家公司软件的不同版本。我们只想知道哪个更安全。

所以,正如您所能想象的,如果我们想回答这个问题,我们必须观察 A 和 B 完成相同的任务。这将是最公平的检查方式。您做了别的事情,他做了别的事情,数百人做了别的事情。那么,在人们通常完成这项任务的方面,您处于什么位置?

这就是“苹果对苹果”问题的动机。假设您有一家名为 Driftic 的虚构公司,它拥有大量自动驾驶数据。我正在查看一个经过精心挑选的场景,即他们的汽车如何导航隧道。隧道有奇怪的光线、阴影和反射。所以它们和其他任何场景一样。但关键是,我感兴趣的是自动挖掘两家不同公司的数据集,并自动查找相似的场景。我不想让任何人手动查看标签并标记每一个场景。

所以,从宏观层面来看,我们想为这个庞大的交通状况空间定义一些结构。这种结构应该能够导入现有的自动驾驶汽车数据并将其映射到空间中的某个点,然后您可以对与空间中不同点的距离进行某种度量。

所以,假设我们将 A 视为安全的黄金标准。我们希望看到 B 是否离 A 很远,或者离 A 很近,等等。如果我们能定义这个度量和距离,我们就可以进行搜索相似场景的问题。

所以,这就是这个问题的正式内容。让我非常快速地告诉您我们在这方面做了什么,而不必深入细节。

一个例子是,这种嵌入是可解释的,它不仅仅是向量,这些元素是有意义的。因此,场景描述语言是描述交通状况的一种已知方式。作为一个简单的例子,一个场景可以提炼成参与者、代理以及不同参与者在任何给定时间点所采取的行动,您可以将其不断分支成子参与者、子场景和子子动作。还有许多其他场景描述语言,如 OpenScenario 和 Scenic。

所以,这本身并不是贡献。贡献在于我们如何从传感器数据中自动提取这种场景描述。我们尝试了许多人认为我们尝试过的方法,即使用像 Transformer 这样的视觉模型,它们接收了来自自动驾驶汽车的仪表板数据。我们试图自动将这个图像序列中发生的事情映射到 SDL 格式,然后比较 SDL 空间或可以说语言空间的相似性。

我们有一些论文谈论过这个。对于简单的场景,这相当有效。但只要您的场景没有太多事情发生,这就有一定的效果。所以,它适用于隧道示例。但如果您的场景变得过于复杂,或者有太多时空事件发生,这就会变得困难。请注意,这与像素级相似性无关。不是说您在白天行驶并且向前行驶。它更多的是比较时空交通状况。

这有一个缺点,那就是如果您走这条视觉路线,您几乎必须解决所有的感知问题。这个模型必须理解世界。所以,其权重本身也在解决驾驶的感知问题。这可能会变得很麻烦,也是它脆弱的部分原因。

所以,我们也尝试在轨迹空间中这样做。所以,忘掉传感器数据吧,让感知去处理,并为您提供任何它能提供的、准确度合理的地面实况。因此,我们现在可以讨论一个类似的问题,即场景不再是原始数据,而是代理在一段时间内如何在地图上移动。我想知道代理的运动和轨迹有多相似。这就是我的相似性概念。我们有一篇关于这个的论文,称为“轨迹到行动管道”,它在轨迹空间中做了类似的事情。

在轨迹空间中的好处是,您不再需要再次解决感知问题,而且您可以依赖于几十年来研究的几何轨迹相似性度量。这是一个非常成熟的空间。如果您给我两条随机的线并问我它们之间的距离,有一些非常巧妙的方法可以给出相当好的答案。

最近,我们也开始关注基础模型,特别是语言模型的能力。您可以将所有这些数据转录为文本描述,说明在什么时间点每个人在哪里,就像这样简单。在每个时间点,这就是正在发生的事情,我将所有这些描述文本的标记都提供给您,然后要求 LLM 回答这些提示,并推理出相互作用和关键对象。这个领域也有一些其他论文显示了类似的结果。我们也看到,它在相似性搜索任务上相当有效,对吧?这仍然离回答“哪个更安全”很远。这可以说是回答“如何比较两个不一定在同一空间运行的事物”的零步。

所以,我将给您留下这种不确定感,因为我们还没有找到真正的答案,因为这就是我作为研究人员所做的。我们对所有事情都没有答案。

让我们转向下一个相关问题。我们不再仅仅是想衡量安全。最终,我们想提高安全性。当我们回到之前的图片时,您会发现您想要做的是覆盖这个空间,而模拟是覆盖这个空间的一种合理方式。您不必只依赖真实世界的经验。您可以模拟经验来覆盖这个空间。而且,正如你们许多人可能已经知道的,我们不想仅仅生成任何场景。模拟中的问题是,您将模拟什么?通过模拟和利用模拟的能力,您在哪里能获得最大的回报?

所以,一个流行的想法是,您会想要模拟自动驾驶汽车会失败或会发生碰撞的场景,因为那才是您真正学到最多的地方。是的,我们希望在您的自动驾驶汽车在路上发生碰撞之前,在模拟器中看到它发生碰撞。

所以,这就是问题所在。如何合成自动驾驶汽车会发生碰撞的场景?当然,我们希望自动合成它们,而不是手工制作。这已经成为另一项与第一个问题相关的研究的基础。我将介绍一种方法。我们正在探索不止一种方法,但这是我今天选择介绍的一种。这种方法叫做 Crash。

所以,它所做的是,您可以使用任何您选择的自动驾驶模拟器。您获得的任何结果都取决于模拟器的真实性。但在模拟器中,您有一个自车,假设是自动驾驶汽车的运动规划器。现在,大多数人会尝试通过暴露于不同的场景来改进这个运动规划器,就像我刚才说的。但在 Crash 中,我们保持自车不变,而是控制所有背景车辆,所有非玩家角色,也就是游戏或模拟器的 NPC。NPC 会受到激励,试图与自车发生碰撞。

所以,这是强化学习,但以对抗的方式使用。自车按照自己的方式行驶,它决定如何驾驶,但 NPC 独立行动,或者在某些情况下,它们可以串通一气,试图与自车发生碰撞。这就是为什么这种方法也称为 Crash。

所以,如果您能够证明您在模拟器中与自车发生了碰撞,这就是自动证伪的一个例子。我在这里做了一些简化。有很多更深层次的问题,比如确保这些碰撞是真实的,而不是现实世界中不会发生的无谓碰撞。但最终,这就是您想要自动证伪任何运动规划器的原则精神。

所以,假设您继续证伪并在模拟中经历数千次此类碰撞。然后,您可以回到并改进您的自车在类似模拟中的安全性,就像您通常会做的那样。现在您拥有了一个之前发生碰撞的场景库。所以,这里没有统计上的硬性保证。这不是一个理论方法,我们没有提供改进的保证。但如果您不断重复这种强化和证伪,您会发现,首先,您在发现更智能的 NPC 方面做得更好,而且随着时间的推移,自车对低级 NPC 的鲁棒性也越来越强。

所以,这就是 Crash 背后的想法。我们已经展示了一些非常有趣的结果,尽管我们是从非常简单的模拟器开始的。在顶部的模拟中,对手学会了它必须加速并导致追尾。这不是一个有趣的碰撞。追尾,如果有人追尾我,我能做什么?这并不真正是我的错,这也是您在所有加州 DMV 碰撞报告中会发现的。但在底部,您可以看到,对于同一个场景,现在自车已经学会了,为了让这个疯狂的 NPC 避免与我发生碰撞,最好的办法就是加速,不要让他们追上我。

所以,这只是一个表面上的展示,让您一窥 Crash 的能力。我们显然已经探索了更深入的算法。这是多智能体强化学习中一个非常丰富的问题。我们发表在 AAAI 上的论文更深入地探讨了我们探索的模型以及那个反复训练智能体的比赛。所以,这就像国际象棋一样,一个智能体变得更强,它就与一个更强的智能体竞争,所以您可以在这个领域做各种非常有趣的事情。

目前,我们正在努力将这个简单的模拟扩展到更丰富的几何形状。我的学生正在探索一些非常有趣的结果,关于情境强化学习,您不必经历一切,就可以泛化到未知的环境。

第二种查询方式是,我们想要导致特定的碰撞。所以,我想训练一个对手专门导致 T 型碰撞、侧面碰撞或特定类型的碰撞,而不仅仅是任何可行的碰撞。我认为这两者都是有趣的研究领域。我很乐意与更多人合作。

好了,让我喘口气,我们继续。

为了设置这个,我们实际上必须把时间倒回到一个多世纪以前,当第一辆汽车被发明出来的时候。那时,很多人可能不知道,公众对这项新技术存在巨大的怀疑。毕竟,您是从马车过渡到无马马车的。你知道,一百多年前。所以,那时,为了建立公众对这项新技术的信任,赛车运动开始作为一种展示新技术能力的方式。我是说,它发展成了营销、体育和娱乐等等。但从根本上说,它成为了展示性能和安全性的孵化器。人们持怀疑态度。你知道,这个引擎会不会在我面前爆炸?你说的那个方向盘是什么?所以,通过赛车,他们可以获得信心,是的,这项新技术具有耐力、安全性和灵活性,而且总体上更安全,因为它可以在 30 辆汽车的混乱中运行,而且它们似乎都能处理好自己的事情,而且汽车反应灵敏且稳定。

所以,当我开始在弗吉尼亚大学建立我的实验室时,我被提醒了这一点。如果您快进到今天发生的事情,我假设我们正在经历又一次转变。这次是从驾驶员驾驶的马车到无人驾驶的马车。所以,类似的关于安全的问题又出现了。它足够安全吗?我能信任它,让它在没有监督的情况下运送我的孩子、我所爱的人吗?你知道,人们在这个光谱上,从“是的,当然,否则就没有意义”到“我非常非常犹豫,我需要看到更多证据”。

所以,考虑到这一点,我当时有一个疯狂的想法。好吧,让我们利用自动赛车来展示自动驾驶汽车的安全性。借鉴赛车运动的类似原理。你知道,你认为理所当然的许多东西,你的后视镜、你的安全带,或者你的刹车材料,它们的起源都来自于赛车运动的某些创新。所以,为什么不利用赛车来专门推进,而不是整个赛车的性能呢?我是说,我并不是说你必须在车流中赛车才能安全。也许有时你必须进行剧烈的机动,但如果能设计出能够在高速、近距离和赛车混乱中,在车辆性能极限下运行的物理人工智能方法,那么这可能对普通驾驶的安全性有所影响。你知道,某种紧急情况下敏捷的专家级驾驶员。

所以,对于那些不熟悉的人来说,这并不是那么疯狂。整个自动驾驶汽车行业,它始于一场比赛。你知道,大约二十年前,在中部沙漠发生了一场比赛。这就是今天所有自动驾驶汽车的起源。所以,在某种意义上,你知道,我正在回归我们的起源,或者让我们更接近我们的起源。

但让我们从算法的角度来辩论或审视一下,是什么让赛车变得更容易或更难。我们都曾在这样的情况下开车,您在高速公路上,左边和右边都有人。在这种情况下,有一个标志写着:“如果我不超车,这辆白色 SUV 可能会并入我的车道。”然后有一些标志告诉你关于不同车辆的速度限制,普通汽车、卡车。有车道线。我想让您思考一下,您确实在思考,只是您不知道您在思考。路上的这些标志是为我和您准备的。

所以,它们在那里是因为,从根本上说,标志在帮助我们做什么?它在帮助我们预测未来。因为这些标志,我知道车道在哪里。所以我可以预测横向移动,并且因为速度限制,我可以预测纵向进展。但如果您移除了同一场景中的标志,我知道您刚刚看到了它,所以它仍然存在于您的脑海中,但如果您移除了所有标志,规划的不确定性就会大大增加。现在,如果那辆白色 SUV 开始在我前面行驶,我会想,“你为什么这样做?”因为我不知道车道即将结束的背景了。

所以,在没有这些标志的情况下,在没有相对简单的感知问题的情况下,规划的不确定性呈指数级增长。在同一个场景中。这就是赛车一直以来的情况。所以,这是一个不同的感知问题。我们没有标志、交通标志、车道线和赛道。但规划问题,不确定性预测问题要困难得多,而且是在高速下。

所以,这基本上成为了我的北极星。我们能否利用自动赛车并将其与自动驾驶联系起来?但您从哪里开始呢?并不是说自动赛车在 10 年前就已经是一个活跃的研究领域,或者我肯定没有一辆备用的 F1 赛车可以玩。但从小时候起,我就很喜欢一个叫做《流言终结者》的节目。我敢肯定这里的人们也很喜欢。我甚至有幸见过亚当·萨维奇一次。我从小时候,作为一个科学家,作为一个工程师,学到的第一个教训是,在你尝试一些大胆而疯狂的事情之前,最好先用一个小原型来试探一下水温。

我们至今仍遵循这一原则。所以,我设计了一辆 1/10 比例的自动赛车,我恰当地称之为 Formula 1/10,因为它只有 F1 赛车的十分之一大小。所以,您拿一辆 RC 遥控车,然后装上英伟达传感器、英伟达 Jetson 以及一些小型激光雷达和摄像头。你知道,在一两周内,它就已经在我们实验室周围跑圈了。这是我在 2015 年从宾夕法尼亚大学毕业时的情况。所以,我们建造了这个,它奏效了。所以,我们制作了宜家风格的说明,供世界上任何一个人复制这项工作,并使其完全开源,提供大量文档和视频。我确实设计、创建并教授了整个自动赛车课程,现在任何人都可以去 YouTube 上观看。它没有任何付费墙。所以,去看看吧。它会告诉你从零开始加速的一切。

果然,来自世界各地的研究人员在他们的实验室里开始建造这些 F1/10 赛车,因为它确实满足了研究需求。当时并非每个人都能获得全尺寸的自动驾驶汽车,而且您可以快速轻松地进行实验,测试您的想法,并撰写关于新算法的论文,并在现实世界中与其他方法进行比较。

所以,很自然地,我开始在世界顶级的机器人、控制和机器学习会议上举办 F1/10 自动赛车大奖赛。如果您参加过 IKRA,您可能在那里见过我们的赛道。所以,果然,来自世界各地的数百支队伍参加了我们的比赛。我们继续举办它们。我认为我们已经举办了近 30 场比赛。现在每年我们都有多次比赛。不只是一场比赛。

所以,这是一个巨大的成功。我当初创造第一辆 F1/10 赛车时并没有预料到这一点。但是,我在这里说实话。这并没有实现我想要的高速赛车的所有目标,我真正追求的是那种敏捷的行为。

有趣的是,讽刺的是,为了在物理世界中取得进步,我们不得不诉诸于电子游戏这个虚拟世界。而这些一级方程式电子游戏已经变得如此逼真。我指的是五年前的情况,它们已经如此逼真,以至于我们不想重新发明轮子,我们想利用这些游戏提供的照片级真实感和高保真物理引擎。

所以,这次我的团队成为世界上最早将这款 60 美元的电子游戏转化为模拟器的团队之一。我们只是从游戏中获取了 UDP 数据,并在其周围编写了一个 ROS2 包装器,它可以记录图像、转向角度以及游戏输出的所有元数据。游戏输出这些数据是因为它必须与所有这些复杂的驾驶模拟器接口。所以,只是监听那条线。现在您有了一个沙盒,您可以在其中获取数据,训练算法,并学习如何与真正的赛车手或半职业赛车手比赛,在这个非常逼真的模拟器中。

这无疑极大地推动了该领域的发展。我自己的团队已经发表了数十篇论文。从事这项工作的学生已经毕业并加入了 Waymo 的运动规划团队。事实上,我可能会花五分钟时间与您分享一个关于所有这些工作背后一个巧妙想法的细节。

所以,您有这个游戏。您可以尝试的第一件事就是端到端的驾驶,我们没有尝试任何花哨的最新 Transformer。但在当时,它似乎非常脆弱。它没有任何恢复能力,这基本上是监督学习的诅咒。一旦您进入一个从未见过的情况,模型就没有如何恢复的上下文,就像专家一样。

所以,合理的做法是,与其直接控制汽车,不如先告诉模型预测一系列航点或轨迹,然后您依靠老式的基于物理的控制器来遵循该轨迹。这更容易做到,但它还没有达到性能要求。您可以看到汽车在图像被冲刷时切弯了。原因在于您要求模型做太多的事情。它必须预测数百个航点。每个航点都有 x、y 位置、z 位置、速度、u 的偏航角或汽车的航向。所以,它必须预测 500 或 600 件事才能得到正确的预测。即使它预测错了任何一个,它都会偏离轨迹。

所以,我们在这里学到的教训是,在表示学习中。所以,与其要求模型预测这些数百个航点,不如我们将表示改为所谓的贝塞尔曲线,它只有几个模型必须预测的控制点。现在,这是您从维基百科上学到的贝塞尔曲线 101。红色的曲线被称为贝塞尔曲线,它完全由灰色点定义。所以,一个完全连续的曲线,有无数个点,由一堆控制点定义,比如灰色点,三个控制点可以定义无数个其他点。所以,您解决了维度问题。

很久以后,我才发现发明并被认为是这些曲线的皮埃尔·贝塞尔,他用它们来模拟雷诺赛车的车身面板形状。所以,在某种意义上,它们与赛车有关。我们只是找到了一个诗意的联系来将它们带回来。所以,您用贝塞尔曲线替换您的航点,然后您就解决了所有维度问题,现在即使是端到端的学习看起来也非常有效。这辆车在游戏中自行驾驶。它不再切弯,而且开始看起来像人类驾驶的样子,就监督学习而言。

所以,我们还没有完成。我们还没有达到最低的汉密尔顿驾驶水平,因为我们是在我们实验室的数据上训练的。我们没有从一级方程式车手那里获得演示。所以,您再次受到探索的限制,受到行为克隆的限制。您只能做到与您拥有的数据一样好。

所以,这里是所有这些工作背后的主要技巧,那就是,与其学习一个单一的输出或一个曲线,如果控制点本身是高斯分布,那么您将学习一系列曲线。您正在学习一个轨迹的分布。这就是所谓的概率贝塞尔曲线。您不是在学习一件事,而是在学习一系列事情。

它的作用是,在运行时,您可以从这个分布中采样一个候选者,您可以根据一些标准对其进行评分,例如它有多快,它是否在边界内,或者它是否低于汽车的物理极限。就像粒子滤波器一样,在几次迭代后,它将收敛到一个您选择的近乎最优的粒子,在这种情况下是近乎最优的轨迹。

所以,这个想法非常有效,这就是我们称之为微分贝塞尔滤波的原因。就像贝塞尔滤波一样,但使用了这些概率贝塞尔曲线。而且它非常可扩展。现在我们正在使用图像进行训练,但您不需要图像。您可以训练,抱歉,您可以训练,只是状态信息,对吧?所以,您不一定需要从像素到轨迹。您可以从状态信息和状态历史到轨迹。这使得该技术从根本上非常非常可扩展。

所以,最近我们将其扩展到了轨迹预测任务。我们已经证明,您可以使用相同的微分贝塞尔滤波骨干进行多智能体跟踪。这是一系列工作,去年发表了,我鼓励您去看看。

最后一次切换话题。我们一直在做所有这些模拟,F1/10,所有这些都很棒。所以,这让我思考,在所有这些进展中,一个持续的想法总是在我脑海的后方萦绕。我们如何让它变得更大?我们如何扩大规模?五分之一比例的车辆怎么样?它稍微大一些,这样我们就可以在户外赛道上比赛。或者一辆卡丁车,我可以有一辆人类驾驶的卡丁车和一辆人工智能驾驶的卡丁车,然后做一些有创意的实验?

我很高兴地报告,我们成功地扩大了规模。但不仅仅是扩大规模。我们建造了这个。这是 Cavalier Autonomous Racing。这是一辆全尺寸、全自动的 Indy 赛车。它是由学生在印第安纳波利斯的赛车车库中设计的、原型制作和组装的,是在大流行期间,从 2020 年和 2021 年的录像中完成的。正如您所见,没有方向盘,没有刹车踏板,也没有司机,因为驾驶舱里挤满了我们最先进的自动驾驶硬件。

这辆车有三个固态激光雷达。它有多个雷达,六个摄像头。这是一辆汽油动力赛车。它使用了与 Indy Lights 或现在更名为 Indy Next 系列相同的 Dallara 底盘。所以,这是真的。而且,在与小型原型车打交道了近十年之后,终于到了弄清楚所有这些工作是否能在真正的赛道上独立运行的时候了。

所以,我们制造了 10 辆这样的车辆的克隆体,这成为了一个名为 Indy Autonomous Challenge 的全球挑战赛的一部分,当时有九支大学队伍的任务是驾驶这些赛车,至少在最初是一次一辆。但没有捷径。我们组装并设计了汽车。这次我们必须从头开始编写整个堆栈。所以,所有的感知、状态估计、地图绘制、规划、控制,我之前部分提到的所有内容。它必须整合在一起,您必须自己编写每一行代码。

这里有一个小小的趣闻或谦虚的炫耀。我是世界上第一个用 Xbox 控制器驾驶第一辆自动 Indy 赛车的人。

这是我们在停车场进行的最早的测试之一。所以,您可以看到汽车几乎只开了 200 码,但热情高涨,因为这就是我们第一次尝试和学习如何做到这一点,真正的工程等等。

所以,我们在 2021 年秋季前往印第安纳波利斯赛车场。你知道,今天大多数自动驾驶汽车在像这里这样的晴朗天气下,都会以规定的速度行驶。但这里有一辆自动赛车。它以每小时 100 英里的速度驶出维修区,热胎,一开始就如此。我想强调的是,这是完全自动的。我们没有发送任何控制指令。实际上,我们被禁止与汽车互动。有一个比赛控制中心,以防万一出现问题,有一个大红按钮。但汽车正在弄清楚它在哪里,它需要采取什么比赛线路,何时减速,何时转弯。它甚至可以在高速公路上表现出一些非常基础的避障能力。当一切都完成时,它会自动进站并停在我们的维修区前面。所以,完全放手。

所以,它不是 Level 4,因为它仅限于这个赛道,但它已经非常接近了。我知道你们很多人在想,这很了不起,但它有多难?它只是一辆车在赛道上。这肯定没那么难。它非常非常困难。因为有很多事情会出错。事实上,在这一天,不到一半的队伍能够完成所有圈数,因为您可能会失去对您在赛道上位置的感知,而速度并没有帮助,对吧?您必须在这些高速下做出快速的决定。所以,您没有时间坐下来慢慢思考,您的控制器必须非常稳定。您的安全逻辑必须是万无一失的。

所以,在 2021 年的那个晚上,我的团队成为了比赛中最快的美国队伍。我们没有赢得整个比赛。一支来自德国的队伍赢得了整个比赛。我认为他们的速度是每小时 138 英里。所以,那额外的 12 英里/小时至今仍困扰着我。但我认为,对于我们的第一场比赛来说,这是一个不错的表现,一个可靠的表现。

所以,这给了我们信心。哇,这奏效了。所以,现在是时候提高赌注了。现在,我们能让两辆车比赛,让它们自动超车吗?这并不像出现并比赛两辆车那么容易,我向您保证,您只会得到两辆报废的汽车。

但是,我想与您分享一个幕后快速的一瞥,看看我们如何一步一步地测试这些自动驾驶汽车系统以建立信心。它揭示了与我希望自动驾驶汽车公司分享的透明度相同的精神。

这是我们做的第一个测试之一。我们将汽车加速到每小时 150 英里,完全自动,然后猛踩刹车。如果您能证明您在这种高压减速下是稳定的,那就说明了您的控制器。所以,汽车收到无线电红旗,它只是从每小时 150 英里减速到 0 英里/小时。我知道视频中看起来不那么戏剧化,但在这种情况下,不那么戏剧化是好事。我们不希望汽车在这种高制动负荷下出现任何异常或颤抖。

所以,一旦我们知道汽车可以开得快也可以开得慢,下一个测试是我最喜欢的。我们想测试我们的超车算法,我们的运动规划器。所以,这里汽车在赛道上。我们前面没有实体车。但我们的运动规划器认为我们前面有一个幽灵对手,以每小时 100 英里的速度行驶。所以,我们的规划器将尝试超车。您可以看到它将规划一个轨迹,汽车将采取这种

高线全部自主,它将尝试并超越这个幽灵般的障碍物。这是一种测试你的超车和规划贝塞尔曲线等所有功能的方法,而无需在第一次尝试时将另一支车队的汽车置于危险之中。所以,这是我们建立信心并调整这些模型的一些参数,以及以这些越来越高的三位数英里/小时的速度进行超车的方式。但最终,你确实需要睁开眼睛,看到你的对手。所以,像这样的测试就派上用场了。你很快就会看到,来自德国的团队正以每小时 80 英里的速度滑行,而我们则以自主方式尾随他们,距离他们 40 米。我们的基站显示,我们不仅看到了他们,这是我们所有传感器融合的结果,而且我们还能够预测他们的轨迹。所以,只有在你完成了所有这些渐进式测试以及我没有时间展示的更多测试之后。我很乐意在之后进行交流,我们可以将所有内容整合起来,这就是 2023 年和 2022 年的正面交锋自动驾驶赛车。所以,前面的车队来自麻省理工学院,一辆车刚刚超越了他们,因为它已经反复做了很多次。我们前面是一辆真车,我们以渐进的速度不断绕圈,这并没有什么区别。在这里,我们正在以每小时近 145 英里的速度进行超车。嗯,有点直截了当。我想和你分享一个非常有趣的超车,它发生在 2024 年的一场比赛中,我会为你播放。它也有音频,所以你可以听。发生了什么?>> 等到他们直道上。看起来他们正试图走高线,但这可能行不通,>> 对吗?所以,他们将不得不>> 哦,那太近了。这里太近了。卡瓦利尔在识别方面做得非常出色>> 他们真的坚持了外线,而外线并不存在。所以他们减速了,实际上令人惊讶的是,他们减速了,又回到赛道上,意识到他们需要采取一条新线路,然后就采取了,然后就让超车看起来很容易了。对。所以,我不知道我是否真的见过这种情况。所以,这支团队的表现非常出色。>> 是的,我同意他的看法。这支团队的表现非常出色。但这感觉像是对我们的 vindication。这是我们在赛车中试图设计的这种敏捷性的第一个迹象,它自然而然地出现在赛道上,而不是被编排的,汽车看到了它做出了错误的决定,因为预测很可能是不正确的,但然后它纠正了自己。它理解了动力学。实际上,我们有数据证明它刹车非常用力,然后滑行到内线并完成了超车。所以,像这样的时刻从实验和能力的角度来看很有趣,但它们也提醒我们为什么赛车是一个如此困难的问题,因为你在日常驾驶中必须做的所有事情,你都必须更快地完成,几乎没有犯错的余地。我想说,之所以这是一个如此困难的问题,是因为无论你设计什么,如果任何假设违反了现实世界的规律,它就不会在赛道上坚持下去。只是时间问题,你就会知道那个假设是错误的,然后你就会看到汽车发生碰撞。赛道上无处可藏。我们多次发现自己处于这一事实的另一面。这就是当你发生碰撞或别人撞到你而你无法及时反应时会发生什么,或者突然你在比赛中途失去 GPS,或者发生了一些硬件故障。我们甚至发生过一次鸟击,在每小时 100 英里的速度下撞坏了我们的一个摄像头,无论你怎么称呼它。我想在某种意义上,它是世界上最昂贵的割草机之一。你知道,这些显然是我们随着时间的推移学到的非常宝贵的经验。我个人最喜欢和团队在一起的时刻是我们最糟糕的一次碰撞之后,第一次。但每个学生都拿着那次碰撞中底盘的损坏部件。因为这就是赛车的现实。有句俗话,对吧?如果你>> 如果一切似乎都在控制之中,说明你开得不够快。这就是赛车手思考的方式。所以,我们也必须这样编程我们的 AI 驾驶员。所以,它可能还没有万无一失,但它非常非常精确。我们有数据表明,一圈又一圈,驾驶员具有惊人的可重复性。它根本不会偏离 G 力和参考轨迹。所以,这在赛车测试中有价值。实际上,我的一位前学生正在试图弄清楚如何将其商业化。所以,我们也在那个探索阶段。还记得我说过你可以几乎进入任何汽车并驾驶吗?这是我们最后的挑战,因为这辆车在 2024 年变成了一辆新车。它有了新的感知系统、新的计算机和新的线控驱动系统。所以,基本上是一辆新底盘或一辆新车。所以,问题是,你构建的这种物理智能能否适应这种新的载体?嗯,关于物理智能的问题,没有物理学是不完整的。这也是今天这次聚会的一个要点,你知道,学习精确的物理学非常非常困难,这就是为什么物理 AI 必须专注于物理学本身,而不仅仅是数据。你知道,归根结底,方向盘后面是人类驾驶员还是 AI 驾驶员并不重要。你知道,我的牛顿老兄所说的永远是正确的,汽车之所以向前移动,是因为轮胎与沥青的接触方式。所以,我们对如何增强现有方法进行了大量研究,这些方法启用了学习模型,因为准确学习这些模型非常困难。所以,我们想利用数据,但我们想让它们在动力学物理学方面尽可能准确。所以,你可以开玩笑地说,或者非常字面地说,这项研究是关于“橡胶接触路面”的地方。这对我们来说非常真实。所以,我们花了三年时间才完成的事情,不得不在三周内完成。所以,在这三周里,我们测试了超过 500 英里,横跨了三个不同的赛道,这相当于你自己跑完整个印第安纳波利斯 500 英里。当然,我们也大量依赖模拟,因为赛道时间对团队来说非常昂贵,而且在后勤方面也难以组织。所以,我们运行了各种不同的模拟器,每个模拟器都有其优点。我们甚至开发了自己的模拟器,它们很快就会开源,它们可以模拟单圈时间,并且可以在正面交锋中帮助制定赛车策略。所以,我们之所以这样做,是因为我们在 2024 年秋季回到了印第安纳波利斯赛车场,争取最后的荣耀。这一次,有来自世界各地的另外 10 支车队。嗯,六支车队在我们前面。你可以看到,标准已经比 2021 年高了很多。我们看到的速度是每小时 163、164 英里。就在轮到我们上赛道之前,命运弄人,开始下雨了。>> 你不需要是 F1 粉丝或赛车手就知道赛车和水,它们混合得不好。我们不是真正的赛车队,我们没有专门的雨胎或干胎。我们只有轮胎。好吧。所以,我们唯一能做的就是等待 2 个小时,让工作人员尝试清除赛道上可能存在的水坑。所以,他们利用这段时间,2 小时后,德国车队出场了。他们是 IASC 的前任冠军,当他们把车推到弯道中间时,他们打滑了。对。所以,就像这样,一个小小的失误,他们就以每小时 166 英里的速度几乎失去了他们的车。所以,你刚刚看到下雨了,前任冠军打滑了他们的车并发生了碰撞,而你紧随其后。所以,你该怎么做?对。所以,你可以选择相信你写的所有 IKRA 论文,然后看看你的算法是否能在没有抓地力的地方找到抓地力,或者你可以稳妥行事,你知道有一个主覆盖,说不要试图超过这个高速限制,仅此而已。你不能真正干预,嗯,当汽车在赛道上时。所以,[哼鼻声] 嗯,嗯,我们出发了。>> 好了,让我们看看。他们不需要太多。他们做到了。来自弗吉尼亚大学的卡瓦利尔自动驾驶赛车队以 170.645 的成绩。各位,那是一圈惊人的成绩,尤其是在一辆发生事故的车之后,然后停顿,然后出去并挑战极限,罗布。>> 他们还在继续。他们还在继续。他们正试图变得更快一点,达到 171 英里/小时。他们以超过 180 英里/小时的速度越过了砖砌的庭院。所以,嗯,但他们在后半段稍微慢了一些。我们拭目以待。他们,你知道,又以 170 英里/小时的速度通过了弯道。这将会很接近。我认为他们会非常接近。再次,他们绝对没有停止前进。>> 他们在驾驶一个美丽的模式。这>> 这个>> 这个机器人编码正在驾驶绝对美丽的线路。你>> 预计这可能是他们最后一圈,以 181 英里/小时的速度冲过终点线。就在那里。>> 171.011。他们继续加速。多么棒的一圈。两圈超过 170 英里/小时。你知道,他们再做两圈,这就是印第安纳波利斯 500 的四圈排位赛。>> 我通常会在这个视频播放时保持沉默,因为他做得很好,告诉你>> 而且他有适合赛车播报的音调。所以,但是他是对的。以每小时 171 英里的速度,这一圈的平均速度,我们可能在 1972-73 年的印第安纳波利斯 500 大赛中获得杆位,而且比马里奥和维蒂还要快。好了,让我把车停好。好的,在刚才你看到的这一圈中,当我们最后一次穿过砖砌的庭院时,我们的 AI 驾驶员要求在赛道中间以 100% 的油门行驶,湿赛道。这正是最好的车手在这种车里会做的事情。所以,我的团队成为了印度自动驾驶挑战赛历史上第一支获胜的美国车队。我们不仅打破了多项单圈记录,因为这个巨大的空间,我们还创造了赛道上最快自动驾驶速度的世界纪录,因为当我们穿过砖砌的庭院时,我们的速度达到了每小时 184 英里。所以,我永远不会忘记那天下午晚些时候的这一刻,我们被邀请去“亲吻”砖砌的庭院。这是印第安纳波利斯获胜者的传统。嗯,我感觉没有多少计算机科学家有机会这样做。说到我出色的团队,我想向他们致敬。嗯,我很幸运能够领导和指导超过 50 名研究人员,主要是本科生,相信与否,作为卡瓦利尔自动驾驶赛车队的一员,我们像任何一家自动驾驶汽车公司一样组织自己。我们有感知、规划、控制、模拟、安全团队。嗯,我们大部分时间不是在会议室里度过的,尽管也有很多。嗯,而是在车库里,在赛车场上,我们去那里,我们把赛道当作我们的研究实验室。我们,你知道,把车拖到维修区,搭起帐篷,连接它。嗯,所以这里的学生们除了所有的研究之外,他们还在学习构建真实工程系统的真实世界经验,他们也在学习所有的软技能,因为他们与队友互动并解决问题,等等。所以,我实际上更自豪的是这张幻灯片下半部分。你想象中的所有 usual suspects 都在招聘他们。嗯,这是一个好迹象,也是这个项目成功的证明。所以,让我以“下一步是什么”来结束。在过去的三年里,我们已经掌握了椭圆形赛道,但我们没有停止。我们没有停止挑战这项技术的能力极限以及我们想要达到的目标。我们真的想,你知道,将目光投向人类水平的专家级表现。所以,嗯,去年年初,我们发现自己在测试,在一个非常特殊的场地。我是一个巨大的太空迷。所以,我们在 NASA 的航天飞机跑道上进行了测试。嗯,这是北美大陆上最长的平坦沥青路之一。所以,这是一个将汽车推向其极限的好地方。嗯,我们不仅做到了这一点,我们还在漆黑的夜晚进行了演示,跑道上没有任何灯光。嗯,人类驾驶员在做汽车正在做的事情之前会三思而后行。但这恰恰表明,这项技术可以超越可能性的极限。除此之外,我们正在转向公路赛道,这与椭圆形赛道不同,你可以想象。所以,去年夏天,我们在拉古纳塞卡进行了测试,就在这里,蒙特雷附近。嗯,这是一条非常技术性的赛道,对吧?如果你要过渡到公路赛道,可以选择更简单的赛道。这是美国最技术性的公路赛道之一。它有著名的“发夹弯”,你必须下坡并非常激进地转弯。所以,这不仅仅是曲折和蜿蜒。它也非常,你知道,上下起伏。所以,有很多海拔变化。但这里再次有深入的研究。对。所以,这次我们正在使用 SLAM 来绘制整个赛道的地图,而 SLAM 在这样的速度下本身就是一个有趣的挑战,因为汽车行驶速度如此之快,以至于 SLAM 的定位必须跟上。你可能在想,为什么我们要回归这些,你知道,老派的经典方法,因为在这条赛道上有一些区域你没有可靠的 GPS。所以,你可以看到,汽车将要从一些人行天桥下面经过,诸如此类,GPS 信号就会消失。但如果你是一辆赛车,这意味着撞车和留在赛道上的区别。所以,你不能冒险。所以,你需要冗余,以防范任何可能的预期故障。所以,今年我们可能会在公路赛道上进行第一次正面交锋比赛。所以,无论是单车比赛还是正面交锋比赛,你知道,这些都是重要的里程碑,它们既有趣又非常非常困难。但我会第一个承认,这只是刚刚开始。我们离人类驾驶员的能力还差得很远。这就是 F1 车手每年每周都在做的事情。你可以看到,在这种情况下,车手基米·莱科宁正在从后面奋力前进。想一想。你周围发生着混乱。你必须将你的机器人,或者在这种情况下,你知道,车辆推到极限。轮胎可能会锁死。你可能会发生接触,但他们不知何故发展出了心理模型和物理智能,以便如此可靠和安全地做到这一点。不总是,但大多数时候。这就是我们想要解锁的。这是缺失的。这些是世界上最好的车手。但我们正在努力。去年一月,我们第一次尝试同时比赛四辆车。嗯,每个人都非常焦虑。我认为我的心率可能比汽车的速度还要快,当这种情况发生在赛道上时。而且它看起来不像人类实验那么混乱,但你知道,这就是自动驾驶赛车的未来方向,我完全支持。我以一个关于国际象棋和特级大师的问题开始这次演讲。所以,让我用最后一个问题来结束。你会信任谁来驾驶一辆自动驾驶汽车?你想让一个受过美国平均驾驶技能训练的驾驶员,还是你想让一个技能可能媲美甚至超越最好、最专业驾驶员的驾驶员?所以,这是我的目标,你知道,我想建立人工智能通用驾驶智能的特级大师,先从驾驶开始,因为这是我们经验最丰富的地方,然后再谈论成为其他领域的特级大师,因为最终,我认为这将使 AI 赶上速度,但在物理世界中。好的,我的时间到了。感谢您坚持下来,如果时间允许,我很乐意回答问题,我也会留下来回答更多问题。谢谢。>> [掌声] >> 请>> 在你的赛车例子中,为什么赛道最高速度会这样增加?是因为控制器,汽车还是预测你的轮胎温度?>> 是的,所以控制器知道,嗯,控制器唯一的监督就是不让车轮的某个特定滑移角超过某个值,它会实时估计,所以它也在监测轮胎温度,嗯,随着赛道在你比赛的早期,轮胎会变热,它们会在一个狭窄的性能范围内运行,即使赛道很冷。嗯,所以,这就是指导这一切的。我们不希望汽车超过我们认为的极限。我们不知道极限。我们根据之前的打滑数据有一些想法,但仅此而已。所以,它正在根据剩余的比赛策略、剩余的圈数来优化速度。实际上是一个计时器。我们有七分钟时间来尽可能多地完成圈数。所以,它正在为此进行优化。很多人不知道的是,我很乐意分享,当它创造出每小时 171 英里的平均速度记录时,我们的内部模型认为它将达到每小时 174 或 175 英里,而我们实际上感到惊讶,即使我们赢了,嗯,内部我们说,等等,但这应该比这个高 4 英里/小时,后来才发现那天风很大,以至于我们的整个空气动力学模型都非常错误,因此我们的模拟和模型理解实际上是,嗯,嗯,不准确。所以,我们确实有一些运气在这场表现中发挥了作用。是的>> 请。>> 那么汽车的最高速度是多少?>> 这辆车是印地赛车。嗯,普通的印地赛车可以达到 204、205 英里/小时,但这款车被给了我们工程师一点点“儿童引擎”。不,真正的原因是发动机经过改装以减少振动,因为我们有太多传感器,如果它们振动,我们就根本无法行驶。所以,没有人类驾驶这辆车的真正基准,因为他们无法真正坐进去。但许多人估计这可能是 196、197 英里/小时。是的>> 那么电动汽车呢?>> 电动汽车不是,首先,它太重了,以至于它实际上更难比赛。如果你看过 F-E 比赛,他们经常打滑,因为重量太大了,而且它比你知道的这辆车要重一个数量级。然后最初的比赛精神是我们将跑 20 圈,然后你开始考虑我们需要充电或做其他事情。所以,我们坚持使用汽油车,但如果能安排的话,我很乐意接触一辆电动赛车。让我来回答最后一个问题,我有一个关于多任务的问题。>> 所以,有没有像,我很好奇这个多代理赛车是如何发生的?嗯,这是开放的吗?也就是说,你预测,你说你展示了你正在预测其他代理轨迹的窗口,对吧?但实际上,如果有人试图超车,那个代理应该对你做出反应。>> 是一个很好的问题。嗯,有两个答案。第一个是,自动驾驶赛车没有现成的规则集。所以,我们正在边发现边制定规则。所以,一开始我们想让一切都无风险,对吧?它太昂贵且不安全,即使它是比赛的自然结果,也要鲁莽。嗯,所以,许多最初的规则集都优先考虑保守的安全措施,比如留出多少空间,不要换线等等。但现在,五年过去了,我们已经到了你不能像在人类例子中那样左右摇摆的地步。但防御方可以自由选择任何赛车线。就像早期,我会给你一个例子,为什么这是一个重要的开放性,即使它受到限制。在早期的比赛中,你必须选择在内线或外线,这本身就简化了运动规划,但现在不再需要了。你可以做赛车手做的事情。只是你不能主动阻止超车尝试。所以,他们坚持他们的赛车线。是否要去尝试那种狭窄的“穿针引线”式的超车,取决于我们。嗯,这就是运动规划和预测的挑战所在。当你增加汽车数量时,你就无法写出这些场景了。你只需要这个在线规划器来启动。>> 对。对,所以,所以,所以,这就是为什么贝塞尔曲线很棒,因为它们具有如此平滑的数学和可微分的特性,你知道,它们在这种情况下表现得很好。它们是经过测试的。马克,我>> 是的,同意,很多这些比赛都是团队的一部分。>> 是的。所以,团队策略可能比个人汽车策略更重要。但这使得问题更有趣,而且你可能有一个很大的优势,那就是你有多个可以相互通信的代理,如果一个代理在桥下的 GPS 信号受阻区域,而其他代理则没有。而且,这对于未来的驾驶来说似乎非常现实,你知道,最终它们应该像蚂蚁或白蚁一样。>> 是的。>> 本能完全正确。嗯,在这次比赛中,我们没有合作的伙伴,但在模拟和研究中,这一切的发生确实存在博弈论的方面。嗯,而且很多时候,你知道,人们试图,你知道,赛车从根本上说是一场信息不完整的游戏。我不知道其他驾驶员想做什么,但我知道目标是>> 但你看,你比人类或自行车赛车手或隔离驾驶员有很大的优势,那就是他们可以相互进行电磁通信。>> 从某种意义上说,人类可以。>> 这是真的。所以,通常驾驶员会将信息传递给维修站,他们会进行通信,嗯,他们确实使用算法来制定策略,在 F1 中,何时进站,预测单圈时间以及你进站时的位置。嗯,我认为赛车的那一部分绝对是一个全新的领域,人工智能在优化赛车策略方面将扮演什么角色。但我确实同意你问题的精神,即精确设计良好的自动驾驶赛车可以给职业赛车手带来相当不错的竞争,如果不是超越他们的话。这正是我试图做的。我认为在未来 5 年或 3 到 5 年内,我们将达到可以与职业车手竞争的阶段,使用一辆新的、设计精良的汽车。>> 一个拥有三辆车的团队。有我,然后是两个自动驾驶的步行者。>> 是的。而这正是我们在碰撞工作中发生的事情,我绕过了,当我们试图让 NPC 代理与我们的车辆发生碰撞时。有时它们会相互勾结>> 来强行,你知道,这种走廊问题。让我先去那里。>> 嗯,是的,我只是好奇你是否用过真正的专业私人数据进行过任何训练。是因为获取数据很难,还是?>> 所以,对于真车来说,不是,简单地说,没有,我的意思是,我们确实有来自职业选手的轨迹数据,但轨迹是公开的知识,但有趣的是,因为我们将其转化为模拟器的游戏,人们不知道这一点,再次,我透露了很多第一次,我想,因为这是录制的,但我们过去会加入在线大厅,有一些非常好的电子竞技玩家,他们正在与 F1 游戏竞争,而我们只是在收集他们的数据并用他们的数据训练我们的模型。所以,所以,所以,确实有一些专家驾驶的元素,但这绝对是探索更多的方式。我今天下午展示的内容中,专家演示非常少。>> 是的,请。>> 两个问题。第一个是关于计算机视觉部分。所以,使用激光雷达来获取图像。>> 是的。>> 嗯,所以你使用的是什么模型,因为在这种速度和你摄入的数据量下,它处理和感知它的能力?>> 是的,我没有,我没有真正触及这一点,但我们,这可能是堆栈中唯一包含神经网络的部分,它们运行得非常非常快,而且是专门为此训练的。我的意思是,我们有多种传感器模态,正如你所见。嗯,对于激光雷达,我们确实有一个,嗯,一个神经网络,它基本上是基于点柱的,这是机制,或者说是实际的底层架构。嗯,对于雷达,我们同时使用几何方法和神经网络。嗯,对于摄像头,我们再次使用,你知道,SAM SAM 类型模型,但它们运行速度不够快。所以,我们实际上是根据这些更大的模型标记的数据来训练我们的模型,对吧?因为我们不想在手动标记数据上花费任何基础设施。所以,我们实际上做了很多事情,比如,我们故意并排行驶,并超车另一辆车,只是为了获取数据。所以,我们可以从这次超车中截取一帧,然后我可以去另一辆车,用一个 USB 棒获取他们的 GPS 数据。所以,这样我就知道他们的大致位置,我当时在哪里,然后我可以,嗯,人为地标记他们的数据,因为我知道我是一个刚体,这就是我们训练神经网络的方式。所以,如果有人好奇,这些数据都是开源的。嗯,有趣的是,你如何在没有实验室的情况下训练它。>> 对。因为我们实际上不知道他们真正的地面真实情况,对吧?没有第三方观察者,比如一架无人机在飞行,告诉我他们在哪里。嗯,但是的,有>> 第二个问题是关于,每当 GPS 丢失时,>> 在那个速度下,你的算法如何处理?算法正在融合它所能访问的所有不同信息,以提供我们最可靠的汽车状态估计。所以,嗯,即使在我们有 GPS 之前,我们也一直在优化冗余,因为我们真的不想受制于 GPS 之神,对吧?所以,即使没有 GPS,你也应该能够完成比赛。今天许多团队做不到这一点。嗯,如果他们失去 GPS,他们就会超时并安全地靠边停车。嗯,但你可以基本上使用一种混合的推算,非常短暂地使用。嗯,但这在赛道曲折蜿蜒时不起作用,因为你无法可靠地推算。所以,我们确信我们必须拥有冗余,拥有 GPS 以外的其他传感器,所以激光雷达是最有意义的,但我们必须真正努力并与一家初创公司合作来调整 SLAM 算法,因为现成的 SLAM 在这些速度下并不好,无论是算法运行的速度还是它提供的性能,就延迟而言,这里的要求非常严格。是的。是的>> 还有一个>> 回收赛车,我想,但我想你之前提到过,模型需要运行得更快才能达到每小时 170 英里,我想另一个问题是,你能详细说明一下吗?比如,你还观察到哪些挑战,无论是硬件还是软件方面,你通常在日常驾驶车辆中看不到,你认为这些将如何应用于常规驾驶?>> 是的。所以,所以,与,你知道,我可能在解释你的问题以适应我想要说的内容,但如果不是这样,请纠正我。嗯,这项工作中的一些可以转化为常规的自动驾驶,并且正在探索中。嗯,我认为控制部分和规划部分最适合转移到,你知道,Whimo 或 Tesla 或任何自动驾驶公司。嗯,感知是完全不同的,正如我也承认的那样,所以它不太好用,而且,你知道,我认为目前在基础模型与感知以及它们在丰富、密集、复杂情况下进行推理的能力方面正在发生的事情,这在这个问题中完全缺失。所以,这里的挑战更多地集中在多代理规划上,这仍然在很大程度上没有解决,因为它是不结构化的。结构化的多代理规划发生在当你看到机器人出租车时,但不结构化的规划,当人们可以四处走动,就像人类那样,这对自动驾驶代理来说仍然是一个相当大的挑战。嗯,这个问题肯定带来了你提到的工程的关键思想,无论模型有多好,它都无法承受在野外运行真实系统所需的严谨性。所以,我们确实付出了代价,字面意义上,付出了昂贵的代价,我们过度信任了一个系统,或者我们,你知道,在考虑硬件故障保护和我们做出的工程选择时,没有做足够的尽职调查。所以,这就是为什么在众多团队中,我有感知、规划、控制、模拟,还有一个安全集成团队,还有一个团队负责审查每一件事,他们会考虑如果这个 ROS 节点失败了,汽车会做什么,如果这些数据超出范围,汽车会做什么,所以容错性被嵌入到软件中,而一句话的答案是,我们甚至将汽车送到赛道上的原因是因为我们有信心,如果出现问题,汽车会自动减速,现在这只是一个游戏,我们是否考虑了所有事情,还是现实世界每次都会给我们带来一些惊喜。是的。好的。嗯,谢谢。再次感谢。