Transcription
感谢您来到 GTC DC 并与我们共度时光。尤其感谢您来参加我的会议。嗯,正如我所介绍的,我与工业客户合作,特别是在制造业的工业生态系统中,他们希望将视觉人工智能技术应用于一个非常成熟的行业。而现在已经转向了视觉人工智能代理。
那么,让我们从定义什么是代理开始。我们认为代理是一种能够感知视觉传感器、时间序列数据等的实体。它将这些数据与上下文知识以及一组模型结合起来,进行一定程度的推理或思考。如果大家昨天听了 Jensen 的主题演讲,对吧?这些模型现在能够在回答之前进行思考。它们不仅仅是提供数据或响应,而且还能够进行规划或激活,或者编写一个动作。这可能包括告诉操作员机器出了什么问题,如何清除错误。这可能会为您提供一些关于质量流程的见解。或者,您可能会告诉机器人某个特定物品在哪里,以便在仓库和物流场景中进行打包。
因此,这些代理现在可以应用于价值 50 万亿美元的重工业,从自动化、自主移动机器人 (AMR)、自动导引车 (AGV) 机器人、仓库物流、工厂车间运营到设施管理。这是一个多模态问题,可能没有多少地方拥有像工厂车间那样多种类型的数据,而且在很多地方,效率、生产力和吞吐量都非常非常重要。因此,将人工智能应用于这个行业可以解决劳动力等挑战,对吧?这是最大的问题之一。
有很多优秀的运营商正在离开这个工作流程。所以我们希望确保我们能够捕捉到这些来自经验知识的东西,以便将其传播给新的操作员。劳动力短缺是一个巨大的问题,影响着每个人。你知道,这既包括能够更长时间、更高效地工作,也包括员工的幸福感,所有这些,还有不断上涨的培训成本,以提升劳动力的技能,对吧?
所以,我们正在制造非常复杂的东西。我们制造的非常复杂的东西之一就是我们自己的硬件,对吧?人工智能基础设施。这正在推动大量的建设和制造。其中很多内容在 Jensen 的主题演讲中都有涵盖。这些都是非常非常复杂的系统,需要大量的技能。因此,我们如何帮助代理来帮助操作员更高效,帮助设施和制造更高效。
那么,这些代理可能是什么样的呢?它可以是一组不同的模型,例如传统的计算机视觉和跟踪模型、视觉语言模型 (VLM)。可以是能够接收图像和数据、传感器、文档的 LLM,对吧?关于您的机器如何工作的手册,或者您的运营流程,或者它是如何工作的。第三方应用程序,它会做我刚才谈到的事情。它查看所有这些数据。它查看被请求的内容,被要求做什么。它进行推理,然后实现或执行一个行动计划。这可能有助于故障分析,或者提供关于工厂车间正在发生什么的实时流程见解。总结正在发生的事情,总结机器做了什么,操作员做了什么,整个生产线做了什么。提供警报,甚至只是信息检索。对吧?每个人都在看那些非常大的制造仪表板,但仍然需要解释。那有很多数字。但是,通过代理人工智能以人类语言格式与您的制造数据、您的信息、您的设施数据进行交互的能力也是其中一个好处。
因此,在本次演示中,我将介绍一些英伟达提供的赋能技术,这些技术用于构建这些应用于制造和工业的工业人工智能代理或视觉人工智能代理。它们是如何组合在一起的,这些个体技术的优势,然后我们将介绍我们的合作伙伴正在推向市场的一些优秀解决方案,以及一些关于如何应用这些技术的成功案例。希望这能为您提供帮助,如果您正在寻找一个端到端的解决方案,那么我们的生态系统中的一些合作伙伴值得您去交流;如果您想自己开发或利用这项技术,您将有一个很好的起点。
所以,我将播放一个简短的视频,来让您大致了解一下我所说的视觉代理的可能性。现在,通过观察开放空间、识别、仍然可以进行计算机视觉,但可以进行概述或关键发现,对吧?安全带、环境、工人保护、能力、能力,观察设施,[音乐]跟踪对象、资产,了解是否存在任何危险,对吧?计算机视觉最大的问题之一就是所需的数据。例如,机器人车队管理,为什么我的机器人没有到达它需要去的地方,安全保障,危险,在这种情况下,理解三维空间的能力,为叉车司机创建一个副驾驶,告诉它托盘在哪里,设施的最有效利用在哪里,以及去哪里,他不必自己去弄清楚。视觉人工智能代理可以帮助解决这个问题并提高效率。[音乐]光学检测,对吧?零样本能力,不仅可以得到“是,好,否,坏”,还可以获得关于缺陷性质的见解,以及可能导致它的原因。能够遵循标准操作程序,有人类或机器人参与其中,可以在错误实际执行之前进行干预,告诉操作员,“嘿,你漏掉了一步。你可能做了一些不同的事情。”所以,这些都是人工智能代理的例子。
所以,还有一些好处,对吧?最大的好处是着眼于劳动力和劳动力挑战,我如何创建代理来提高操作员的效率,提高我们的入职和培训效率,并最终提高我们的质量、利润和仓库吞吐量。质量检测,流程见解,优化,对吧?每个人都在谈论智能工厂,但你真正想要的是一个不断改进、自我改进的工厂,能够进行反馈循环,对吧?人工智能飞轮流程变革,你制造新产品,等等。所以,你想要那些代理,那些对流程的见解,因为它有助于你创造那个自我改进的工厂。安全和安保,预测性维护,对吧?停机是一个巨大的问题。我能否使用一个能够提供剩余有用寿命的代理,利用不同的模态?
所以,我们现在所处的位置,我认为大多数人在考虑制造业的视觉人工智能时,他们会想到视觉检测。那是第一次出现类似的应用,就像 AlexNet 和你所知的,识别猫的图片的能力出现了一样。那已经出现了。所以,我想说这已经相当深入人心,并且已经达到了一定的采用水平。我们开始看到辅助代理或多模态辅助代理开始出现。比如遵循 SOP,但也要理解工厂,理解正在发生的事情的性质,对吧?我可以得到一个传感器告诉我我的机器有一个警报,我可以知道机器何时恢复运行,这可能花了 25 分钟。我不知道为什么花了 25 分钟。但是,如果我查看设施的摄像头,我就可以发现,哇,有人花了 10 分钟才到达机器,然后才开始解决问题,或者他们无法获得零件,或者其他任何原因。所以,代理的额外见解,然后突然之间,当我们有了这些能够帮助我们工厂中每个不同角色的操作员的代理时,我们就可以开始将它们整合在一起,并开始创建优化代理,这些代理现在能够提供反馈。它们不再仅仅提供智能,而是实际提供关于如何改进流程的反馈。你知道我们正在谈论的那个自我改进的工厂。所有这些代理都整合或创建在我们称之为三个计算机的东西中,对吧?你需要模拟。视觉人工智能和制造业或整个制造业最大的问题之一就是需要大量数据。制造业是非常定制化的,对吧?不像智能空间,我可以采用一个人员检测模型,然后为体育场构建一个产品,告诉我在哪个洗手间排队最短,或者自动售货机在哪里排队最短。我可以为机场构建一个产品。我可以为商场构建一个产品。同一个模型可以普遍适用。工厂的情况并非如此。没有人制造同样的东西。没有人以同样的方式制造东西。每个人都使用不同的零件。你需要非常高的准确性。所以收集这些数据,获取这些数据是非常昂贵的。所以,这就是模拟和合成数据生成可以发挥作用的地方。能够获取五张缺陷图像并创建包含一万张这些缺陷图像的数据集来提高准确性。能够提供光照分布或缺陷的差异性,这真的很有帮助。现在,你可以通过模拟合成数据来做到这一点。与数字孪生的主要连接是通过这个计算机。能够拥有虚拟传感器,从模拟环境中收集数据,用它来训练视觉人工智能代理,然后最终将其从数字孪生摄像头传感器替换为工厂中的真实传感器。一旦你有了这些数据,你就需要你的训练计算机来训练你的人工智能代理大脑,无论是微调 VLM、CNN、VIT、VFM 类的管道,对吧?那将发生。最后,你有了运行时。运行时是指一旦你有了这些代理,它们将在哪里运行?其中一些将在边缘使用 Jetson 运行。其中一些可能在云端运行。大多数情况下,它很可能是一个分布式部署。所以,在英伟达 Metropolis,我所在的团队在这些计算机的每个空间中都提供工具。所以,我们一开始就有模型,包括视觉基础模型和 VLM。我们稍后会谈到它们,以及用于训练适应和优化工具包 (TAO) 的工具,以帮助您训练和适应您的模型以适应您的制造环境。对于模拟,我们与 Omniverse 合作,我们拥有 Cosmos World 基础模型,可以生成合成数据。然后,当您运行运行时计算机时,我们有像 Blueprint 这样的工具,以及我们的英伟达 Surge 和摘要功能,您之前看到的视频中的所有示例都基于那个 Blueprint。我们有 DeepStream,这是使用我们技术进行视觉推理的最快方式。它确保您能够满足实时机器时间要求,确保您充分利用您的 GPU,然后我们有 NIMS 来帮助部署一些大型生成式人工智能模型。
所以,有一件事正在将制造业的视觉人工智能代理向前推进,从 CNN 类型的 AlexNet、ResNet、YOLO 到下一步,我们可以进行在线 SOP 监控,我们可以开始创建能够提供重要反馈的代理,那就是能够查看视频,但带有推理的视频。而推理意味着什么?这意味着您拥有那个思维链。所以,在这种情况下,我们正在询问是否有人未经许可拿走了包裹。您可以将其提供给一个非推理 VLM,如 VQA 1.5,它会显示一个视频,您可以看到视频显示一个人走向住宅门廊,拿起包裹,然后走开。它没有推理出是否被允许或不允许,对吧?而那个人可能就是包裹的接收者,而您却不知道。现在,您添加了推理,然后您看到了思维链,对吧?他检查是否有人在看,行为谨慎,环顾四周,可疑,因为他拿包裹和移动的方式有点太小心了。然后您得出一个结论,它通过推理得出结论,说,“是的,这很可能是个不应该偷窃或未经许可拿走包裹的人。”我们的推理 VLM 是 Cosmos Reason。它在 Hugging Face 上刚刚超过一百五十万次下载,是开源的,可以进行微调。它紧凑,只有 70 亿个参数,并且通过先验知识进行推理,它受到物理学的约束,这对于制造业来说非常需要,并且对于理解物理世界非常重要,而且它是开放的、可定制的,并且已准备好进行商业化。所以,当您展示一些视频时,我们谈论 SOP 和组装,理解组装过程,所有这些,都是通过微调 10 个视频并将其提供给 Cosmos Reason 来完成的,并说,“这是 SOP。这是进行了 10 次的领域专家。这是我正在寻找的。请告诉我这个过程是否被遵循,是或否。”您可以在相对较短的时间内做到这一点,就像我说的,只需要最少 10 张图片。所以,它在这方面确实表现出色,并且实际上被用于我们许多 Blueprint 中,或者可以单独使用。
所以,关于视频 VSS。让我们来谈谈视觉检测代理,对吧?所以,我们可能会说,“嘿,我们现在正在做人工智能。嘿,我有了边界框。我能够检测错误。”视觉检测代理有什么不同呢?嗯,我们采用像视觉模型、视觉基础模型、VLM 这样的东西。我们有像 TA 这样的用于训练后处理的工具。我们有 DeepStream 推理构建器,可以更快地创建那些视觉人工智能管道。现在,我们能够创建这些视觉人工智能代理,它们现在能够与其他代理进行推理,为根源分析代理提供元数据,并具备这种能力。我认为很多人都熟悉 RestNet 50、YOLO 等模型,但 VFM,可用于微调或 TAO 6,正在增加额外的功能,图像嵌入,基础骨干网络,可以提供非常高的准确性,从单个单目深度估计,通过像 RT-DETR 和 Grounding DINO 这样的基础立体物体检测,以及分割。能够不仅微调它们,我们还将讨论自监督学习,我们将讨论它的含义,蒸馏它们,等等。所以,我们可以使用英伟达 TAO 6 来定制视觉代理。所以,我们可以适应新的基础模型,我们可以使用像自监督学习这样的高级技术进行预训练,我们可以蒸馏它们。这意味着我们采用了一个非常大的模型,它可能被训练来查看很多东西。我告诉它我只关心 12 样东西,所以把其他所有东西都去掉。你不需要检测除了这 12 样东西之外的任何东西。这将使参数变小。它仍然会一样准确,但它将能够运行得更快,或者在成本较低的硬件上运行。然后,我们可以通过微调微服务将训练扩展到生产就绪的部署。记住,它永远不是一次训练然后部署,对吧?那是自我改进的工厂,流程漂移。那是不断变化的特性,它建立了那个人工智能飞轮。
所以,关于监督微调与自监督学习以及为什么它对制造业很重要。监督微调,大家都知道,对吧?我有一个带注释的数据集。这里有边界框。这是我的验证。我把它交给它,对吧?自监督学习是什么意思?以及我如何利用未标记的数据进行领域适应。我…我放错了幻灯片。所以,自监督学习允许我进行领域适应。这意味着我采用大量未标记的数据,但那是我的数据。所以,如果我正在查看变速箱,如果我正在查看齿轮,如果我正在查看 PCB,对吧?我只给它大量数据,它就会学会提取特征。它更好地理解它正在看的东西。它没有被标记。它不能告诉你这是什么或不是什么,但它能够告诉它。所以,当我给它数据并说我正在寻找金属的凹痕,我正在寻找划痕,我正在寻找凹痕时。我不需要给它太多的数据,因为注释确实是数据策展中最昂贵的部分,对吧?而且我仍然会获得非常高的准确性,因为该模型已经进行了领域适应,对吧?它几乎是一个模型,它知道具体,即使它不能告诉你它是 PCB,它也了解 PCB 的方方面面。它就像是自我标记,然后你采用一点数据,实际命名它,并给出你期望的东西。
为什么推理对视觉人工智能代理很重要?对吧?所以,你可以看到这里是 PCB 上的焊点连接,有一个坏的,三个好的。但你可以看出这三个好的不一样,对吧?在某种意义上,其中一些可能是,虽然它不是错误,但它仍然可能表明我的流程可能正在朝着错误的方向发展,或者效率不够高。所以,通过空间推理,您可以获得对不同部分的描述。所以,即使您获得了二元的“通过/不通过”能力,您也能够获得信息,并且通过这些信息,您可以开始构建一个语义图。所以,当您遇到错误时,或者当您希望根据这些信息创建警报时,您就能够帮助进行根源分析和智能分析。所以,这确实是超越了我所说的“数据点”,对吧?一个边界框。这里有一个缺陷。这是一个数据点。一个“通过/不通过”是一个数据点,到实际的智能,对吧?否则,现在这必须由可能在这个过程中效率不高的人类操作员来完成,他们可能就像,“嘿,突然我有一个‘不通过’,但我无法理解为什么我没有‘不通过’,但现在这里有信息,您可以轻松地利用这些信息来帮助决策过程,即使这可能不是专业知识。所以,这确实是我们看到推理在视觉检测中的应用。
我们谈论了 VFM 以及它们为什么重要。我们谈论了那些骨干网络,你知道,以及我谈论过的不同模型。有趣之处在于,因为我现在可以训练一个单一的骨干网络,它可以完成我大多数不同的任务。所以,我可以处理我的数据。我不需要一个不同的分类模型,一个不同的检测模型或一个不同的分割模型。我通过训练一个单一的骨干网络来更有效地完成所有这些事情,然后我只需要改变围绕它的不同任务头,那些 VFM,这使得视觉检测的人工智能飞轮更加高效。然后您可以看到这里的一些不同用例,当然是用于它正在使用的目的。
我们谈论了监督训练,所以这些幻灯片顺序颠倒了。所以,一些 SFT 的准确性,你知道,做到这一点,这有点像很多数字,所以我不会详细介绍,但这基本上是我们所说的,利用 TAO 作为训练工具包,它真正抽象了训练能力,对吧?我们希望人们关注问题,关注您的数据,关注您想从数据中提取的内容。不要成为一个 TensorFlow 管理员,或者不要成为一个 PyTorch 管理员。在很多情况下,可能还有两三个形式。所以,Tao 所做的是抽象所有这些训练框架、数据增强、合成数据生成、VLM 的微调,现在为您提供了一个很好的工具包,它是可扩展的,可以部署在工作站上,可以部署在 Kubernetes 中,可以构建一个完整的训练服务,在云端进行监督微调,只要…如果我有幻灯片的话,自监督微调,这就是为什么我们谈论领域适应,所以您可以看到特征图的比较,之前和之后。所以,这就是它开始变得更适应它正在看的东西的地方,即使它没有任何标签。所以我拥有 600 个标记的数据集,而我没有 SSL。我得到 93% 的准确率,这还远远不够制造业的要求。现在,我可以输入大量数据,大约 70 万个未标记的数据。当然,如果我要标记这 70 万张图片,那将非常昂贵,但我有可用的。所以,我首先可以使用那些未标记的数据,然后进行领域适应,然后使用相同的标记数据集,我可以达到那个非常高的准确率数字,这将使我能够将其引入我的制造或我的工厂车间。
我们谈论了蒸馏,你知道,能够采用一个模型,我们称之为教师模型,并将其蒸馏成一个学生模型。所以,您从 2.52 亿个参数减少到在这种情况下 6 亿个参数。您甚至看到了一个意外的收获,即蒸馏模型后准确率实际上有所提高。所以,这意味着什么?这意味着我现在可以在成本较低、功耗较低的 GPU 上运行。这意味着我可以更快地运行我的管道。它可能意味着我可以用同一个 GPU 支持更多的摄像头,从而使部署更有效率。对吧?所以,我想利用最新最好的架构模型,但如果它们非常大,成本可能会过高。嗯,通过蒸馏,您可能能够缓解这个问题,并实际拥有一个可以在边缘部署的解决方案,用于那些远端、成本敏感或功耗敏感的场景,因为在工厂车间,主动冷却是不可能的。
所以,一些合作伙伴的故事。我们有 Spinns,他们正在进行光学检测,为 Cooler Master 提供高精度。希望大家,如果您喜欢 PC 游戏或自己组装 PC,您应该知道 Cooler Master 是谁。这非常酷。我们有 Pegatron,他们在 PCB AOI 系统上实现了 98.8% 的准确率。我们有一个非常酷的故事 Instrumental。我们在自己的供应链中使用了他们。所以,您在这里看到他们实际上帮助我们加快了计算托盘组件的创建速度,缩短了 14 天。所以,我们谈论人工智能基础设施的复杂性。如果他们在这里,如果您去他们的展位,有一个 GB,我相信是 GB200 或 GB300 托盘。您可以看到这些系统的复杂性以及他们为帮助我们做到这一点所做的一切。所以,这很大程度上是我们尝试“吃自己的狗粮”。所以,我们甚至通过我们的合作伙伴在自己的供应链中部署这些代理和系统。
让我们来谈谈标准操作程序代理。所以,我们谈论了视觉检测,这是传统的用例。当有人类参与其中,当有机器人参与其中,当我看跨越一段时间的时间信息时,那就是 SOP 代理发挥作用的地方。所以,它与 Cosmos Reason 集成,直接访问 VLM 部署,事件审查器。所以,它是基于这个视频搜索和摘要 Blueprint 的。这里的 Blueprint 是模型和其他微服务的组合,配置好后为您提供一个起点,用于开始构建您的应用程序。所以,它不是一个最终解决方案,但这是一个开始构建您的视觉人工智能代理的起点。所以,标准操作程序代理是针对性的,您可以将它们部署在从 Jetson Thor 到多 GPU 多云,以及全新的 DGX Spark,如果您有幸在家中拥有一个的话。
那么,什么是 SOP 监控代理呢?制造业仍然很大程度上是人类参与其中。组装、维护任务,等等。尽管我们都认为自己很棒,但有时我们也会犯错。所以,如果我们能够帮助操作员尽早发现错误,或者以一种加固他们所接受的组装过程或工作方法的培训的方式来执行,那么这意味着我可以在错误发生的最初阶段就进行干预,而不是在我的检测站可能所在的装配线下两三个步骤之后,那时可能很难“剥开洋葱”并撤销该功能。所以,这就是合成数据,如 ISC 和 Cosmos 可以提供帮助的地方。我们有视觉人工智能代理,结合了 VFM、VLM、LLM,当然还有我们谈到的 Blueprint,用于视频搜索,DeepStream 用于人工智能管道,就像我说的,您可以在 Jetson 设备(如 Thor)上运行它们,一直到远端边缘。
所以,创建不同 SOP 代理的一些例子。这是 Deepow 与 Anheuser-Busch 的合作。他们通过拍摄程序领域专家的视频来做到这一点,并能够为新操作员创建培训助手和培训代理。所以,他们能够将培训时间缩短 80%,维护速度提高 75%。然后,我听到的关于 Deepow 与其另一位客户最酷的故事之一是,客户回来后说,这让他们的人员能够实现工作与生活的平衡。那位领域专家不必在周末被不断叫来解决问题,因为他是唯一知道这些知识的人。我能够吸收他的知识,然后我能够创建一个代理来反馈这些知识。你们在周末可以多花点时间在家。操作员往往会感到更有力量,对吧?你想知道你拥有所有的答案。事实并非总是如此。有时总是打扰别人问问题并不酷。如果我有一个平板电脑或手机上的东西,我可以问问题。你可以说,“嘿,我猜对了,或者我错了。”然后我感到有力量,因为我掌控着流程,我的工作。所以,实际上,当这个推出时,更多操作员觉得他们在自己的职位上更安全,因为他们对如何操作系统有了更多的了解,而无需依赖他人。
Seamens 是运营工业副驾驶,正在改变车间运营。所以,他们看到了生产力的提高,代理提供 24/7 的关键见解。所以,他们发现这些代理在夜班的使用量比在白班多得多,因为当然在夜班,只有骨干团队,所有主题专家都不在。但他们现在能够理解机器是如何组装的,或者他们能够与 PLC 对话,获取错误信息。他们了解文档。他们有摄像头正在观察机器执行过程。当发生问题时,操作员可以获得见解。这就是为什么这个错误意味着什么。如何清除它。发生了什么问题。有什么东西从吸头掉了下来。有什么东西卡在了传送带上。他们可以立即获得这些见解。所以,最大限度地减少停机时间,让他们能够更好地与机器协同工作。如何调试它?如何重新启动它?如何为不同的流程进行更改?所以,我们实际上有一个专门的 Blueprint,它现在在 GitHub 上,允许您围绕 Cosmos Reason 训练这些代理。所以,我们采用了那个 VLM,Cosmos Reason,我们 VSS Blueprint 的组件,TAO 的微调微服务,现在您能够达到我们最初进行的用例的 98% 的准确率,只需要 10 个视频,训练 5 到 10 分钟。所以,这不像是一个 VLM,您需要微调它。您需要花两天或更长时间来训练它。它实际上训练得非常非常快。然后是自动化训练和部署。我们都有训练和推理 Blueprint,您可以使用它们来扩展或开始构建您的能力,亚秒级警报异常,对吧?这是另一件事,它必须在边缘运行。如果我录制了一个视频,然后两步之后才发现他们做错了什么,那无关紧要,对吧?您希望这种反馈接近实时,以便操作员可以纠正方向。所以,这里的一个例子是 Megatron。所以,他们看到了他们的笔记本电脑的错误率降低了 67%,劳动力成本降低了 7%,这非常出色。我相信我有一个视频可以向大家展示。哦。回去。好了。所以,有些东西实际上很难泛化,对吧?你给一个通用人工智能模型,说,“这是一根电缆。”它可能看起来理解一根电缆。说,“这是一根插座。”它可能从未见过这里的插座。而且,这里是插入它并确保它锁定并且需要理解所有这些事情的动作。它不是一个单一的图像。它是时间信息,是能够进行时间运动研究或创建时间运动研究的能力,如果你想的话,并且能够说在这些步骤中发生了什么,以及期望是什么,它构建了知识图谱,它构建了关于它需要期望什么的推理,对吧?我不需要在图像上训练它,然后在其之上创建一些额外的逻辑来本质上构建一个 SOP 监控能力,现在你真的只是通过视频来完成。
所以,再多谈谈物理人工智能的构建块。我们已经谈论了计算机视觉人工智能分辨率。所以,让我们谈谈它在更大规模上是如何真正工作的。我们有 USD Omniverse。我们有 RTX 光线追踪技术,那些新的 RTX 6000 Pro 非常棒。您实际上可以,我谈到的三个计算机,您可以在单个 GPU 上完成所有这些,然后我们有加速计算随处可用。所以,这就是正在汇集在一起的,以构建物理人工智能的技术融合。然后,让我们来看一个视频,看看当这一切真正结合在一起时会发生什么。[音乐]随着世界将传统数据中心现代化为生成式人工智能工厂,对英伟达加速计算的需求正在飙升。富士康,世界上最大的电子产品制造商,正在通过构建英伟达 Omniverse 和人工智能的机器人工厂来满足这一需求。工厂规划师使用 Omniverse 集成来自西门子 Team [音乐] Center X 和 Autodesk Revit 等领先行业应用的工厂和设备数据。在数字孪生中,他们优化了车间布局和生产线配置[音乐],并确定了最佳的摄像头位置,以使用英伟达 Metropolis 驱动的视觉人工智能监控未来的运营。[音乐]虚拟集成为规划师节省了大量的物理变更订单成本。在施工期间,富士康团队使用数字孪生作为信息来源,以沟通和验证准确的设备布局。[音乐] Omniverse 数字孪生也是机器人训练场,富士康开发人员可以在其中训练和测试英伟达 Isaac 人工智能应用程序,用于机器人感知和[音乐]操作,以及 Metropolis 人工智能应用程序,用于传感器融合。在 Omniverse 中,富士康[音乐]在将运行时部署到 Jetson 计算机之前,模拟了两个机器人人工智能。[音乐]在装配线上,他们模拟了 Isaac 机械臂库和人工智能模型,用于自动光学检测,以进行物体识别、缺陷检测和轨迹规划。[音乐]将 HGX 系统传输到测试舱。[音乐]他们模拟了 Isaac Perceptor 驱动的 Ferrobot AMR,因为它们感知并移动于其环境[音乐]中,并进行 3D 映射和重建。通过 Omniverse,富士康构建了他们的机器人工厂,这些工厂协调在英伟达上运行的机器人来构建英伟达人工智能超级计算机,而这些超级计算机又[音乐]训练富士康的机器人。[音乐]
所以,这是一个很好的例子。也许我们在每个方面还没有完全达到那个水平,但这一切都在朝着那个方向发展,对吧?您看到了数字孪生、模拟、生成合成数据进行训练的能力,无论是您的设施摄像头、您的检测,还是您机器人的感知。那是另一个视觉人工智能代理,对吧?它不总是预先编程的。现在,能够基于某些事物进行触发,去与那个代理交谈,然后能够告诉机器人,“我需要你去拿这个,”或者“这是位置,”或者“我需要你去检查一下。”而它进行的动态路径规划也将非常关键。
所以,最后一页是关于行动号召。有两种入门方式,对吧?自己开发,使用我们的工具,我们的三个计算机,Metropolis 中的组件,允许您做到这一点,或者与我们的合作伙伴合作。嗯,Levitas、Seamens、Instrumental,他们都在这里,Accenture。去和他们谈谈,去看看他们的展位,他们的能力,并利用这个生态系统。如果您正在构建自己的解决方案,请来找我。我很乐意您成为我们生态系统的一部分。谢谢。
>> 好的,我们还有时间回答几个问题,如果有人有什么想问 Alvin 的。看起来前面有一个。是的,>> 抱歉。我错过了什么?>> 嗯,谢谢。>> 是的,感谢这次会议。非常棒。您提到推理是亚秒级的。您能具体说明是几分之一秒吗?我们可以每秒运行 10 次推理吗?>> 哦,您指的是 SOP 监控代理和 VLM。那将取决于硬件。可能有一些基准测试我可以提供给您,或者…嗯,我猜您可以在 VLM 推理的文档中查找。那基本上是…>> 计划实际使用 TAO,有没有对 TAO 进行过任何基准测试,看看它的性能如何,特别是对于…>> 是的,有。我只是没有数据。是的,但也有数据可以证明这一点。谢谢。你好。嗯,一个快速的问题。自监督学习的视觉微调…>> 负面影响,或者说会降低推理能力吗?因为这似乎是两个不同的…>> 不,实际上是两个不同的模型。哦,抱歉。是的。所以,您可能会…您可能会为 VFM,也就是视觉基础模型进行微调,然后进行自监督学习。所以,您进行领域适应,然后您可能会同时采用图像数据以及您能够用 VFM 提取的元数据,并将其提供给 VLM 来进行推理部分。所以,>> 好的,明白了。>> 谢谢。>> 是的。嘿,在视频中,您展示的第一个视频,您展示了一个干净的晶圆,然后…>> 嗯,有一个东西在对晶圆进行某种…我猜是异常检测。>> 嗯。>> 那是零?>> 那是,是的,那是提示工程零样本。>> 好的。那么它使用的是什么模型?>> 我相信那是 NVA 或…嗯,Cosmos Reason。>> 好的。和我们的客户。谢谢。>> 再来一个。>> 谢谢。>> 哦。>> 嗯,考虑到延迟在这个领域至关重要,部署在云端是否可行,或者您认为可以吗?或者您提到了将其部署在边缘。什么?>> 是的,我的意思是这取决于具体情况。我预计大多数情况是,您将拥有那些必须部署在远端边缘的关键延迟系统,对吧?您有一个装瓶厂,您期望有标签,您期望有瓶子。那些机器移动得非常非常非常快。所以,您无法围绕它们进行检查代理。现在,这并不意味着您没有第一阶段能够做到这一点,你知道,在 120 帧或更多帧甚至更快。而这提供了您的第一层数据或能力。然后,您可以使用云端的其他东西来进行额外的推理或报告,使用 VLM。您甚至可能在云端进行训练。当我们谈论那个自我改进的工厂或人工智能飞轮时,您可能正在采用那些在远端边缘以高速进行的新的缺陷或异常检测,并说,“好吧,这可能是一个新的异常生成,然后将其发送到您的训练计算机,它可能在云端,然后更新您的模型以适应流程。”>> 所以,您是如何…您有一张苹果 Vision Pro 的照片。我只是想知道它是如何用来模拟数据、创建数据,或者它的目的是什么?>> 我不太清楚具体细节。我认为那是在通过苹果 Vision Pro 走过工厂的数字孪生。
>> 好的,我们今天的问题就到这里了。让我们为 Alvin 送上热烈的掌声。谢谢。