📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

How Digital Twins and Real-Time Simulation Are Powering the Physical AI Revolution

NVIDIA Omniverse39:34

Transcription

好的,说到这里,让我们开始谈论物理人工智能和机器人技术。昨天詹森的基调演讲中有很多这方面的内容。嗯,我想这可能会引起你对正在发生的事情的兴趣。所以,我们可以更详细地探讨一下。

这一切的人工智能,现代人工智能,始于十多年前,在多伦多大学的 GPU 上发明了深度学习。正是 AlexNet 引爆了它,这是我们第一次能够开发出一种算法,用一种全新的算法开发方法,解决了计算机科学中一个长期存在的问题,一个困扰计算机科学家几十年的问题。我所说的这个问题是图像分类,能够确定图像中有什么。我们从 20 世纪 50 年代就开始尝试这样做,基本上已经放弃了这个难题。但是,当 AlexNet 问世时,它在图像分类方面表现出色,打破了所有记录和基准,开启了人工智能的新时代。

现在,特别之处在于,我们不仅解决了这个特定问题,或者说计算机视觉这个更大的问题,而且我们解决它的方式也很新颖。我们没有让人类直接开发软件,直接设计算法,而是收集了大量我们希望算法执行的示例,并将它们输入超级计算机,由超级计算机为我们编写软件。这是过去 12、13 年来我们在 GTC 上一直在谈论的一切的根本性变化,也是詹森昨天在基调演讲中谈到的内容。

我们最初从感知人工智能开始。我们开发的第一批算法非常狭窄。它们解决了特定问题,主要集中在感知、计算机视觉、语音识别、音频处理等方面。在这个时代,我们需要收集数据示例来输入人工智能工厂,这些工厂非常小众,专门针对您需要的特定算法。尽管仍然令人惊叹,但它们的功能在一定程度上受到限制。

大约在 2017 年到 2018 年,随着 Transformer 架构的发明,这一切都改变了。Transformer 架构使我们能够处理大量的非结构化、未标记数据,本质上是我们在互联网上找到的所有与文本相关的信息,并将它们输入到更大的超级计算机中。从中出来的就是一种神经网络,它编码了我们在语言中发现的所有模式、语言的所有规则、语言的所有法则。这给了我们一种新的能力。它使我们能够泛化这些神经网络,并将它们用于许多目的,而不仅仅是特定的一件事。

例如,您可以采用其中一个大型语言模型,让它接收少量信息,一个小的文本提示,然后让它生成大量信息,比如一首诗。您可以采用相同的信息,这首诗,然后让它将其转换为说唱风格。然后,您可以采用相同的大量信息,并让它将其缩减为少量信息,一个摘要,或者从中收集见解。

所以,这就是生成式人工智能时代令人惊叹之处。我们可以将这些大型模型用于许多不同的目的,因为从根本上说,其中编码的智能是对事物基本法则的一种基本理解。

我们现在正进入具身人工智能时代。这是我们将这种基础技术,即生成模型,并构建能够自主行动的生成模型的系统。我们目前拥有的模型在信息空间中运行。它们在数字空间中运行。我们可以让它们感知互联网上正在发生的事情,直接感知您计算机上正在发生的事情。那是它们的自然空间。它们感知,做出一些决定,然后采取行动。它们可以进行一些 API 调用并执行操作。

因此,我们可以创建执行客户服务的代理,可以代表您购买商品的代理,可以为您安排旅行行程的代理,可以在您的日历中充当助手的代理,等等。基本上,就是从事知识工作的机器人,就像这个房间里的大多数人一样,他们可能也从事知识工作。我们与计算机交互,并在计算机内执行操作。这就是这些代理可以做的事情。

我们今天在这里要谈论的是即将到来的时代,这就是物理人工智能时代。本质上,我们将建立在过去我们在人工智能领域所做的一切之上,建立在我们过去十年所做的一切之上,但将所有这些东西带入物理世界。这些在我们的计算机系统中自主运行的代理,如果我们赋予它们身体,就可以进入物理世界。如果我们赋予它们一种物理形式,使它们能够感知世界,能够对世界做出决定,然后采取行动。如果我们能做到这一点,那么这些代理的价值将比目前仅限于我们 IT 空间的代理高出几个数量级。我们可以让它们来到这里与我们一起工作,在物理世界中帮助我们,操纵的不仅仅是 0 和 1,而是操纵原子。

那么,什么是物理人工智能呢?最简单的形式是,我们可以将其视为一种人工智能,它将传感器信息、关于物理世界的信息作为输入,这些信息通过各种传感器收集,例如来自摄像头的图像,以及许多其他传统的人工智能信息。我们可以给它文本、语言和提示。然后模型处理所有这些,输出代表动作的令牌,也就是我们希望物理代理在世界中执行的操作。

所以,本质上,您可以将物理人工智能视为机器人的大脑,它像我们一样从眼睛、耳朵和皮肤上的触觉传感器接收输入。我们进行大量处理,最终发出控制信号来驱动我们的肌肉,并在世界中行动,操纵其中的事物。

我们正在谈论的三类机器人,这三类非常重要的机器人是:我们通常会想到的机器人,比如我们说“机器人”这个词时,人形机器人,你知道,我们有所有的科幻小说中的 R2-D2、C-3PO 等等。所以,这些类型的机器人正在上线。这通常是我们的想法。但本质上,任何在物理世界中拥有实体,并且能够执行感知、规划、决策和行动这三项任务的代理都是机器人。这包括工厂和仓库等物理空间,其中有摄像头等传感器,并且有执行器来处理其中的事物,或者这些空间内的其他机器人,或者自动驾驶汽车。

自动驾驶汽车是一种机器人。汽车是身体,而驾驶它的 AI 本质上相当于一个感知世界并采取行动的驾驶员。

为了使美国在其使命中取得成功,为了在詹森昨天谈到的关于美国再工业化、带回所有制造业的方面取得成功,这样我们不仅能够继续生产我们今天所需的所有东西,而且还能生产未来几年所需的所有东西。我们需要拥有物理人工智能和机器人技术。

今天我们谈论时,我们面临着巨大的劳动力短缺。美国今天有 50 万个制造业职位空缺。而且这种情况只会越来越糟。我们估计到 2030 年将有 400 万个职位空缺。这些工作主要是年轻一代不愿意做的。考虑到世界各地正在发生的ので人口结构挑战,我们将面临这个问题,我们将没有足够的劳动力来维持今天的生产速度,因为能够做这些工作的人数根本不存在。

相反,我们希望让我们的员工成为从事枯燥、肮脏和危险工作的机器人的指挥者。

为了构建机器人,为了构建机器人的大脑,即物理人工智能,并部署这些机器人,您需要三台计算机。您需要一台实际在机器人中运行的计算机,它驱动着机器人,运行着大脑。那就是我们的 Nvidia Jetson、Drive 和 IGX 计算机。Thor 是我们最新发布的。那是一台非常重要的计算机,但不是唯一的。

同样重要,如果不是更重要的话,是生产将部署到那台计算机上的大脑的计算机。那就是我们的人工智能工厂。这在很大程度上是我们在这里 GTC 上一直在谈论的内容。也是大多数人所知道的 Nvidia 的业务。我认为截至今天,我们可能是一家 5 万亿美元的公司。我没有查看股票价格,但正是因为那台特定的计算机,我们才达到了这个水平。

但还有第三台计算机,大多数人并不将其归因于机器人技术,但它对我们创造这一点至关重要,那就是模拟计算机,或者詹森昨天称之为 Omniverse 计算机。这是一台计算机,它遵循物理定律,我们遵循世界规则,并在运行在这台特殊计算机上的虚拟世界中重建物理世界,以生成我们输入到人工智能工厂的所有数据,然后人工智能工厂生产出我们部署到机器人计算机上的大脑。

您还需要这台模拟计算机用于第二个目的。您不仅需要它来生成产生大脑的数据,还需要它在部署大脑之前对其进行测试。我们不能构建失败率很高的物理人工智能。即使在现实世界中 1% 的失败几率也可能导致灾难性的后果。您可以想象一下。在工厂操作重型机械或在我们的街道上驾驶。所以,我们希望在将它们投入物理世界之前,在各种条件下驾驶它们数百万英里,运行数百万小时。我们在这台虚拟世界的计算机上做到这一点。

为了做到这一点,我们构建了软件层,以帮助我们的应用程序开发人员和解决方案提供商构建现实世界的模拟。对于模拟计算机,我们称之为 Nvidia Omniverse。Omniverse 是库和 API 的集合。开发人员使用我们的库和 API,选择适合他们特定应用程序和模拟的库和 API,然后构建新的模拟器、应用程序和工具来构建数字孪生和手头事物的模拟。我们提供这些作为库,也提供蓝图,本质上是关于如何将我们所有的技术集成到可修改的工作解决方案中的示例。

因此,我将播放一个短视频,展示一些您可以使用我们的 Omniverse 技术完成的事情的示例。

[音乐]

这些用于构建物理人工智能的模拟,以多种不同的目的、多种不同的规模使用。它们适用于产品规模、工厂等设施规模,甚至人工智能工厂本身,模拟范围从工厂一直到城市,甚至地球。

这是一个关于如何构建产品数字孪生的示例,并在部署到现实世界之前进行模拟。在这个例子中,我们有一个流体动力学模拟,它通过 Nvidia 的计算机加速,结合了我们通过 CUDA X 库并行化的经典算法,以及近似相同物理求解器以使其实时运行的新型基于 AI 的算法,并结合我们的 Omniverse 库,创建了一个工具,允许工程师、飞机设计师探索他们可能构建的机翼的参数空间。

我们也构建工厂的数字孪生。我们谈论两种工厂。一种是大多数人想到的工厂,即制造实体产品的工厂,现在还有一种新型工厂,即生产智能的人工智能工厂。昨天我们宣布了一款名为 Seammens 的新产品,一个新工具。Seammens 正在开发数字孪生构建器,这是一个全面的工厂数字孪生组装工具,它集成了他们套件中的各种工具和技术,以及我们通过库提供的许多 Omniverse 技术,到一个产品中,让您能够构建工厂的数字孪生。

一旦您拥有了工厂的数字孪生,您就可以做很多事情。它们非常通用。它本身就是一个平台。您可以使用这些数字孪生来执行布局和规划等操作。您可以模拟您的流程并进行优化。您可以将其用于运营,监控资源,并在虚拟世界中创建实时真实事物的副本,以便世界上的任何人都可以检查它,而无需亲自前往。您可以使用它来生成海量数据,以训练新的人工智能,例如用于工业检查的人工智能,或者训练您的机器人。

这里有一些例子,很多例子,但不是一个全面的列表,关于 Omniverse 在工业中的各种用途。宝马多年来一直使用它来帮助设计他们的工厂。Keon Group 使用它来设计、建造和运营他们的仓库。梅赛德斯-奔驰也用于他们的工厂。舍弗勒,一家德国制造商,一家非常重要的第一级供应商,为汽车和机器人提供零部件。他们也在用工厂的数字孪生做同样的事情。广达,我们众多合同制造商中的一个例子,他们使用 Omniverse 来建造制造我们计算机的工厂,这些计算机进入我们的人工智能工厂,然后我们用它们来制造人工智能,这些人工智能又回到他们工厂里的机器人中。台积电正在建造他们的晶圆厂的数字孪生。他们在多层工具方面面临着非常独特的挑战,这些工具具有复杂的管道和布线。他们使用 Omniverse 来帮助优化和设计它。

昨天我们宣布了一个基于 Omniverse 的新蓝图,用于构建和运营人工智能工厂,并对其进行优化。它被称为 Nvidia Omniverse DSX 蓝图。这个蓝图包含了一个参考示例,说明如何构建人工智能工厂的完整数字孪生,以帮助加速您的构建、部署和优化过程,即使效率只有很小的百分比优化,在运营中也可能产生数十亿美元的影响。这是使用各种工具构建的。您可以看到参与此蓝图的所有不同合作伙伴以及我们的 Omniverse 技术。

这是一个关于您可以使用此蓝图做什么的例子。我们有一个人工智能工厂的数字孪生,我们可以在其中实时运行一个实际工作负载的模拟,一个在人工智能工厂中运行的计算工作负载,并在物理上精确的模拟中看到,人工智能工厂内的计算托盘产生的热量是多少,以及热量如何通过整个系统传递。

现在,为了构建物理人工智能,就像任何其他人工智能一样,我们需要海量的数据。您提供的数据必须是恰到好处的数据。拥有大量数据是不够的。您还必须拥有多样化且与您希望该人工智能学习的特定技能和任务高度相关的数据。

在信息空间中,在语言领域,对于像 LLM 和聊天机器人这样的事物,我们很幸运,因为互联网上有海量的 PB 级信息,我们可以像挖掘化石一样进行挖掘和提取。我们有化石数据可以使用。

对于物理人工智能,我们没那么幸运。互联网上没有我们构建机器人大脑所需的任何数据。我们必须以某种方式获取它。为了做到这一点,我们要么必须通过放置昂贵的传感器从现实世界中获取数据,花费所有的时间和金钱,并可能在过程中冒着人员和材料的风险,要么我们必须弄清楚如何将计算机中表示的物理世界作为模拟,并将其用作可再生物理数据源,以生成所有必要的数据。

因此,为了做到这一点,我们采用了许多技术。我们正在生产的实际物理人工智能,是通过经典模拟器构建的第一批模拟。我们还可以利用物理人工智能本身来帮助我们进行未来的模拟,以产生更多数据。我们已经开始了一个良性循环,我们使用经典模拟来创建物理人工智能,然后它又反馈到我们的模拟器中,成为模拟器的一部分,以产生更多数据来创建更好的物理人工智能,等等。

为了做到这一点,我们正在用我们的技术来播种行业,播种世界,并以开放的方式免费提供它。我们提供开放模型。我们为物理人工智能提供的两大模型系列是 Cosmos,这是一个世界基础模型,以及 Groot,它本质上是一个物理人工智能模型,可以成为机器人大脑的核心。我们以开放和免费的方式提供用于训练这些模型的数据集。我们提供免费的模拟框架,Isaac SIM 和 Isaac Lab,用于机器人模拟和管道,以及用于合成数据生成的工具,以便每个人都可以从中受益,因为这个问题比 Nvidia 大得多。创建物理人工智能和机器人技术的问题比任何一家公司都大。如果我们想实现这一点,我们都必须共同参与。因此,我们坚信,唯一的方法是利用 Nvidia 拥有的资源和能力,并将其免费和开放地提供给所有人,以便他们能够在此基础上进行构建。

为了构建,为了创建所有这些数据,我们需要以某种方法构建这些虚拟世界,构建这些模拟以及其中的内容。传统上,这非常非常困难。构建模拟器和可模拟的虚拟世界、3D 世界需要高度专业化的技能。幸运的是,随着人工智能每天都在出现的新技术,我们现在有了一条无需所有这些专业知识即可构建这些世界的途径。

我们可以利用人工智能来帮助我们构建这些数据集,主要有三种方式。第一种是从现实世界中重建虚拟世界,通过捕获现实世界的数据并将其转换为我们可以模拟的形式。我们还可以使用人工智能生成新的世界或这些世界中的新动作。我们还可以使用这些相同的人工智能来处理我们在模拟中生成的数据,并对其进行注释,以便我们理解其中的内容,这样当我们使用这些数据并将其反馈给人工智能工厂以生成新大脑时,这些注释可以为人工智能提供关键信息,使其更智能。

这是一个关于我们最新技术的例子,通过传感器、通过摄像头和图像捕捉现实世界,并通过我们的 Omniverse Newrec 库重建,然后可以将其输入到 Omniverse 中进行模拟。我们可以将其与来自 CAD 和其他适当表示的更传统的数字孪生形式相结合,以快速重建一个可用于您目的的世界。

我们还可以将经典模拟与人工智能相结合,以增强它,从而成倍地增加我们为训练生成的数据量。因此,在左边,您可以看到一个在 Omniverse 中使用我们更经典的加速物理求解器和渲染进行的模拟,它没有使用任何复杂的材料模型来进行视觉方面。但从一次模拟中,我们可以将其通过 Nvidia Cosmos,我们的世界基础模型,并生成具有不同背景、光照和条件的无限数量的变体。因此,我们可以从一次模拟运行和一点数据转变为成千上万甚至数百万点数据,然后可以将其输入到另一个人工智能中。

在这个例子中,我们使用 Cosmos predict,它允许我们获取左侧的一张图像以及描述场景的文本,并利用它对物理世界的了解,生成所有后续帧,进行完全由人工智能生成的物理模拟,在右侧。从那里,我们可以标记数据,找出这个手在这个人工智能生成的虚拟世界中的轨迹,然后将这些数据输入到我们的物理人工智能训练系统中。

所以,这是一个视频,展示了这一切是如何结合在一起的。

[音乐]

通才机器人必须在给定指令的情况下,在许多环境和任务中进行推理、规划和行动。为了学习新任务,开发人员使用现实世界的数据来训练机器人模型。但人类演示的捕获成本很高。Groot Dreams 是一个用于合成数据生成和神经模拟的蓝图,构建在 Nvidia Cosmos 之上。使用一张图像和自然语言,开发人员可以生成合成世界状态或梦想。这些被动梦想可以大规模生成,但用自然语言提示有其局限性。对于更复杂的任务,开发人员使用 TA 操作来交互式地控制机器人,生成清醒的梦想。这些梦想被用来后训练一个推理、视觉、语言、行动模型,如 Groot N 模型。训练好的模型在 Isaac Lab 中进行评估,这是一个提供物理反馈的传统模拟器。通过评估后,它将被部署到机器人上。通才机器人触手可及,由 Nvidia Isaac Groot 加速。

所以,非常快速地,这是我们提供的两类物理人工智能模型和框架。我们有一系列模型、数据集和库。您可以快速拍张照片。我们时间不多了,就不一一介绍了。我将展示一些我们技术在现实世界中的应用示例。

这里是我们的一位杰出合作伙伴 Diligent Robotics,他们正在为医院构建一种机器人,用于医院内的送货。他们使用了我们的所有三台计算机。机器人计算机位于实际机器人内部。他们使用 Omniverse 和 Isaac Lab、Isaac Sim 进行模拟计算机,来构建机器人大脑并对其进行测试。当然,他们还使用我们的人工智能计算机来生成作为机器人大脑基础的模型。

然后是 Figure AI。同样,构建 Figure 机器人也使用了我们的所有三台计算机。最近他们发布了一些关于他们机器人突破的非常酷的例子。我们在昨天的赛前节目中看到了很多很酷的东西,所有这些都建立在 Jetson Thor 之上。

强生公司正在制造外科机器人和医疗领域的机器人,用于手术室。这些都是进行手术的机器人。在这种特定情况下,他们正在制造一个可以进行肾脏手术的机器人,以及帮助手术室的机器人,手术室本身就是机器人化的。它有眼睛和传感器,可以观察手术室里发生的一切,并指导外科机器人。我相信 Kimberly 昨天在她的基调演讲中谈到了这一点。我强烈建议您去看看。

当然,还有我们现在都熟悉的自动驾驶出租车机器人。我们开始在全美和世界各地的城市看到它们。而且很快我们就会看到它们随处可见。我相信在接下来的几年里,几乎每个人都会在他们的城市或附近体验到它们。

然后是一些我们通常不认为是机器人,但实际上是机器人的东西。昨天,Jensen 宣布了我们与诺基亚在 6G 方面的合作,以使美国和美洲成为该技术领域的领导者。这非常重要。您可以将这些无线电塔视为机器人。它们执行了我之前提到的三项任务。它们感知。它们接收无线电信号。而这些新一代技术需要大量的智能才能优化频谱。我们有波束成形等技术,需要大量的计算和处理来决定如何实际参与该频谱,然后通过发送无线电信号来执行。

随着我们正在建造的新一代塔楼,它们都将是人工智能驱动的,并配备我们专门设计的人工智能计算机。我们构建了城市数字孪生,可以模拟无线电频谱,我们可以用它来优化这些塔楼的布局以及操作这些塔楼的算法和参数的设计,以节省能源并最大化我们的带宽。

我们还有城市数字孪生,用于许多不同的目的。我建议您看看我们的智慧城市人工智能蓝图。我们与这里的许多合作伙伴一起构建了它。合作伙伴太多,无法一一列举。我们还有一个用于进行地球规模数字孪生的蓝图,用于天气模拟。

说到这里,我想向这个机器人领域的许多合作伙伴致敬。我们所做的一切,不足以实现这一切。我们的技术真正到达需要它的人手中的唯一途径就是通过我们的合作伙伴。我们高度专注于构建计算机,构建计算技术。就其本身而言,我们的计算机无法做任何有用的事情。它需要开发人员在我们的计算机上,在我们的所有技术上进行构建,然后推向市场。因此,我们参与了机器人和工业领域的各个方面,但我们自己并不做任何这些事情。我们构建驱动所有这些的计算机。

所以,您可以看到我们的许多合作伙伴,机器人制造商,机器人大脑制造商,传感器制造商,用于所有机器人系统设计的应用程序开发人员,以及 CAD 和现实捕捉等。

说到这里,我将播放一个我们最喜欢的机器人的短视频。您可能昨天已经看过了,但值得再次看看。

[音乐]

这是我们与迪士尼研究公司合作开发的名为 Newton 的新物理引擎。它是开源的。我强烈建议您看看。

然后,请加入我们的社区。我们在 Discord 上有一个非常活跃的社区。这是 Discord 的二维码。去看看,在那里找到一些朋友,他们可以帮助您入门我们所有的技术,并加入我们一起构建未来。

谢谢。