📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Advancing Humanoid Robots With Simulation-First Approach

NVIDIA Omniverse37:55

Transcription

好的。请大家和我一起欢迎 Hexagon 公司研发副总裁 Lucas Heinsley,他将向我们展示,如何通过英伟达 Omniverse、Isaac 平台和 Open USD 驱动的“仿真优先”方法,正在彻底改变人形机器人技术,并为现实世界的部署树立新标准。[掌声] 太棒了,非常感谢您的精彩介绍,感谢各位的到来。很高兴能代表 Hexagon 机器人公司,与大家分享我们的工作。整个领域都非常令人兴奋,当今的机器人技术备受瞩目。为了更好地理解,我们不妨回顾一下,从工厂里固定的机械臂,到仓库里的 AGV 和 AMR,再到如今涌现出的新一代移动机器人,特别是近一年来备受关注的人形机器人。当我们审视这些人形机器人时,实际上是围绕着两件事:灵活性和通用性。有人可能会问,为什么是人形?为什么不是更量身定制、更具个性化的设计呢?首先,这背后蕴藏着巨大的机遇。预计将有一个数万亿的市场等待被开发。因此,当我们审视机器人组件时,例如边缘计算,我们看到英伟达的 Jetson 等各种形式的边缘计算设备正在让这一切成为可能,而英伟达的 Jetson 就是一个很好的例子。最近,我们看到了人工智能和仿真领域的巨大发展,时间过得真快,令人难以置信。大约两年前,我们经历了 ChatGPT 和生成式 AI 的“魔幻时刻”,而现在,我们正在谈论物理 AI。因此,看到这种指数级增长曲线向前发展,真是太棒了。今天,我将重点介绍我们如何利用英伟达 Omniverse 在各种用例中部署我们的机器人。这里展示了一些图片,我将详细介绍它们,希望对在座的各位来说会很有趣。首先,让我们来了解一下 Hexagon 公司本身。我们是现实捕捉技术领域的全球领导者,业务遍及约 50 个国家,拥有约 25,000 名员工。我们最出名的可能是一些您在左下角看到的品牌,它们在行业内享有盛誉,当然还有其他品牌。在过去的 20 年里,Hexagon 通过超过 200 次收购不断发展壮大,我们的传感器、工程、建筑、设计、制造、农业等领域,为客户提供广泛的解决方案。我或许可以花很多时间来谈论 Hexagon,但让我们更专注于今天的主题。如果我们审视核心竞争力,那就是连接物理世界和数字世界。一方面,传感器捕捉物理世界的信息,并将其带入数字世界;另一方面,我们在数字世界中拥有解决方案,可以进行创造、行动、沉浸和反馈。现在,有人可能会问,为什么 Hexagon 对制造人形机器人感兴趣?嗯,如果我们把人放在中心,你会看到,一方面,人生活在现实世界中,可以四处走动、移动、操纵和互动;另一方面,在数字世界中,我们也看到了大量接口的出现,我们可以在那里训练机器人,进行远程操作,真正实现完整的闭环。因此,这就是我们提出制造更通用解决方案概念的原因,我称之为我们这边的解决方案,我们试图覆盖 Eon 的所有用例,涵盖工业领域,从操纵、检查、现实捕捉,到操作员任务。当然,其中很多用例都有相当大的重叠。是的,我们对推进这些项目感到非常兴奋。当我们审视 Eon 的基础时,最终你会看到两件事。首先,它是一个非常独特的设计。我们有一个双足机器人,拥有独特的相机和传感器组合,机器人内部有大量的传感器,其中一些是我们 Hexagon 的核心专有技术。我们正在与一批试点客户合作,其中两家我们已经公布了:Pilatus,一家瑞士航空航天工程公司,以及 Brose,一家德国汽车零部件制造商。我们人形机器人的设计,很大程度上得益于在英伟达 Omniverse 中通过仿真进行虚拟操作,这也是我今天想谈的。当我们审视更大的图景,关于我们如何利用英伟达 Omniverse、现实捕捉传感器,例如 Hexagon 旗下的其他品牌,以及大量的设计软件,我们可以真正将许多组件带入 Hexagon 的数字现实,我们称之为“数字现实”。它可以是网格模型、BIM 模型,也可以是 CAD 模型。然后,我们将这些带入下一个世界,英伟达 Omniverse。我们都非常清楚这一点,快速浏览一下,所有这些都基于 Open USD 作为核心基础。在此之上,构建了英伟达 Omniverse,特别是对于我们的人形机器人,我们一直在大量利用英伟达 Isaac Lab 和 Isaac Sim。今天,我将重点关注这两个顶层应用,以及我们如何在各种用例中利用它们。我们在工程方面部署了这些方法,也将机器人带入物理空间。让我们先从工程开始。当然,在设计机器人之初,你就会考虑相机的放置位置、使用多少个相机、使用哪种类型的相机。例如,有滚动快门、全局快门,以及不同的使用场景。所有这些都需要在过程中进行思考。尤其是在这个案例中,我们已经迭代了好几次,在这些迭代过程中,我们一直在探索如何利用数字孪生来渲染这些视野。这里的一个例子是我们机器人头部使用的 RGB 全景相机。我们可以让机器人在左下角的场景中行驶,然后创建这些数字表示。可以添加更多传感器,可以看到不同模态的重叠。一个很好的例子是我们内置的飞行时间传感器,用于测量深度,以及 RGB。这确实是一个棘手的工程组合,我们一直在思考,视频播放效果不太好,嗯,我们也在思考如何真正实现良好的重叠、良好的组合和良好的通用性。总之,有很多机会可以加快设计周期的迭代速度。正如我之前提到的,在视野和分辨率方面,我们才刚刚开始,但你可以做更多的事情。我认为其中一些也非常适合光照条件,所以当你在 Omniverse 中拥有这些数字孪生时,我认为一个真正强大的功能是路径规划和引入不同的光源,以及 Isaac 应用。另一个正在研究的是使用 CI/CD 管道。你可以想象一个虚拟机器人提供摄像头馈送,你也可以将其更深入地集成到你的构建管道中,当你创建软件时。这可能从工程角度来看非常重要,还有许多其他传感器模态,特别是雷达和事件相机,我们认为这是一个很好的前进机会。今天我们已经听了很多关于合成数据用于 AI 的内容,我们也认为这是一个非常重要的方法,你可以渲染你放入机器人中的不同相机,以便在你的真实世界数据之上收集大量人工数据来训练你的 AI 模型。所以,这是工程方面的一部分。我们使用 Isaac Lab 的另一件事是强化学习,用于教我们的机器人如何行走和移动。在虚拟环境中训练机器人行走,你也可以模拟不同的地形,如砾石和斜坡等。所以,基本上,这就是我们的机器人如何学会稳定行走和稳定驾驶。我们的机器人中有如此多的执行器,它可以在非结构化环境中进行模型预测控制。所以,我们认为这也是一个绝佳的机会。当然,当你训练好虚拟世界中的策略后,虚拟世界中的训练可能需要几个小时,而机器人获得的经验相当于几年。就像人类一样,你可能需要一年或更长时间才能学会走路,而在这些模拟器中,我们可以在几个小时内完成,这真是太神奇了。但棘手的问题是,当你从虚拟世界进入现实世界时,你必须真正确保你非常重视精确建模,以确保你的重量、惯性、摩擦力都正确。这也是我们与英伟达的同事们一起付出了很多努力,以确保这一切都能正常工作。结果是,我们在实验室里测试了它,它能够行走和爬楼梯,这是一种非常有趣的混合策略。这是我们在最初设计时没有真正想象到的,我们总是会给它零速度指令,然后让它爬楼梯。但有趣的是,仿真告诉我们,这些混合策略是最节能的。所以,机器人在这里学到的东西非常有趣。当我们进一步进入部署视角时,将机器人带出我们的实验室,带出我们的工程领域,进入现实世界。我们有一个非常有趣的案例,我想向大家介绍一下。大约一个半月前,我们在拉斯维加斯宣布了我们的机器人项目。在那里,我们举办了一个大型的 Hexagon 会议,名为 Hexagon Live,大约有 3000 名与会者,都是我们的 Hexagon 客户,来自不同的行业和领域。我们被要求将我们的机器人带到 Fontbluer 剧院的大舞台上。你可以想象,对于工程团队来说,这最初是一个非常有趣的请求,因为如果你看到这个场地,它有很多 LED 墙,有很多灯光照亮舞台,你也可以想象,有 3000 人在观众席中,Wi-Fi 和连接性会非常拥挤。所以,这实际上是一个非常棘手的场景。尽管如此,我们还是成功了。我们在舞台上有几台机器人进行了现场表演。我现在将播放一段简短的视频,展示现场情况。这是一个实际视频的剪辑版本。我们让这些机器人在这里四处行驶。一开始,我们有一个类似公告的环节。机器人行驶到我们的部门总裁面前,介绍自己并进行交谈。你可以看到显示屏,可以看到手臂。机器人发出一些配乐和声音。从那里开始,我想视频停止了,啊,下一个。我们还做了进一步的演示。我们继续进行了一次现场用例演示。在这个视频中,你看到我们的机器人行驶到一扇车门前。它基本上是一个金属板零件,我们用我们投资组合中的一款高端 Hexagon 扫描仪对其进行了扫描。你可以想象,穿过车门的蓝线以微米级的精度,数十微米的精度,创建了汽车车门的 3D 捕捉。在我们的客户现场有成千上万的这种配置,这种机器人就像人类一样,非常通用,并且具有匹配的形态,可以作为一种应用。当然,正如我之前提到的,准备这次演示非常有趣,在瑞士,提前几周,所有的海关,所有的事情,都非常棘手,这确实是远程操作的典范,如果你能想象的话。而且压力也很大,我们的高级管理层真的希望这些演示能够成功。轨迹在 Omniverse 中可以测试,基本上是侦察,我们在其中进行了一些额外的调整。我们创建的整个管道基本上是获取所有舞台资产,我们拥有剧院的 BIM 模型,基本上是一个 IFC 文件,将其转换为 USD。我们还有我们的机器人资产,模拟器,抱歉,CAD 模型,包含所有惯性、所有关节参数、所有关节位置等。然后,我们将它们带入 Isaac Sim。在那里我们取得的成就非常显著。这里可以看到一个简短的渲染,展示了虚拟机器人在我们的模拟器中执行完全相同的任务。右下角是摄像头画面,中间是机器人接近车门并进行扫描的现场画面。由于我们在机器人实际操作和模拟操作之间具有非常好的互操作性,因此我们可以将轨迹、演示、规模视角、场景等带回。我认为在这方面取得了很大进展。我们也开始研究在 LED 墙上进行投影,尽管是动态 LED 墙。机器人被放置在容器中,场景也被添加,还有一个独立的控制软件在外面,基本上在我们的容器化版本内部和外部进行通信,我们可以发布和读取关节。我认为这是一个非常棒的设置。我们有两位工程师在拉斯维加斯的大舞台上实现了部署。现在,展望未来,我认为还有一件事值得我们关注,你在这里看到的,是我们实验室的虚拟模型。想象一下,我们的机器人可以扩展,可以比现实更容易地复制,但场景的背景看起来也很干净。事实上,它不是一个机器人实验室的孪生模型。我认为拥有这些数字孪生也非常重要,它们准确地反映了现实世界。我们一直在研究如何将其中一个从现实世界带入模拟世界。这是一个非常近期的探索性方法,我称之为。我们一直在研究如何渲染这些,或者使用全景相机进行捕捉,并将其带入 3D 扫描库,这是一个非常好的演示。这是将真实世界画面带回模拟器的东西。我们导入了大约 200 张图像,训练了大约一分钟。我认为这是一个非常了不起的成就。3D 扫描库使我们能够叠加实际捕捉到的真实世界画面。我将快速跳到下一张幻灯片,你可以看到我说的意思。在右下角,你看到的是我们用 Hexagon 技术创建的原始数字孪生,非常逼真。通过机器人相机看到的,你可以看到我们的实验室看起来比右下角的实际数字孪生要乱一些。所以,我们认为这是一个非常有趣的方法,坦率地说,还处于非常早期阶段,但它能够创建非常快速的表示并将其带回模拟器。我们还做了什么?我们基本上将数字孪生叠加起来,并将 3D 扫描库中的 3D 表示带入同一个坐标系。然后,你就可以拥有这些我们一直使用的虚拟对象,并将我们的机器人带入同一个场景。现在你可以想象,这是一个很棒的方法。我希望你能看到,我可能看不到光标,我必须进入这里。所以,这辆车,这是一个虚拟的汽车模型。你看到纹理质量不高,更像是一个 CAD 模型。但周围的一切都来自实际的相机图像,来自高分辨率的全景图像。这是一个更逼真的场景,用于训练机器人。我们今天早上看到的 3D 扫描库非常棒,我们也认为它仍然非常具有探索性。总之,今天我们看到了几个我们与英伟达 Omniverse 合作的用例。摄像头渲染是基础,我们就是从那里开始的。我们看到了很多未来的机会,添加更复杂的数据模态,创建合成数据层,强化学习对于我们的运动控制至关重要。我们现在将扩展到全身控制,不仅仅是移动机器人,还开始与环境互动。我们已经看到了部署,现在正在与我们的试点合作伙伴 Pilatus 和 Brose 在他们的实验室中测试机器人,并且我们正在使用非常相似的方法。[音乐] 尽管在拉斯维加斯是一个更小的用例,但我们一直在关注 3D 扫描库,我们认为这是一个非常棒的工具,可以将现实世界带回模拟世界,并真正实现闭环愿景。我认为还有很多工作要做。但我非常乐观,通过所有在本次会议上展示的工作,我们每年都在更进一步,在这个领域感到非常兴奋。最后,我想感谢团队。Hexagon 和我们的合作伙伴,特别是英伟达,都有很多同事参与其中。这是一段美妙的旅程。如果您有更多兴趣,我们有一个网站 robotics.hexagon.com 和 hexagon.com。我们有招聘信息,关于机器人的更多信息,我们也将很快在那里发布更多技术内容。期待您的关注。今天就到这里,非常感谢您的关注。好的,我们还有时间回答问题。如果您有问题,请举手。非常感谢您的演讲。我有一个关于物理规则和准确性的问题。与图形不同,我们可以使用像 DLSS 和光线追踪这样的生成系统,您认为在虚拟环境中训练机器人是否有可能做到类似的事情?但它是否仍然像在现实世界中运行它们一样有效,还是我们必须始终遵循物理现实规则?不,事实上,你已经看到了一些东西,也许可以快速跳回幻灯片,提供更多背景。在模拟中完成的部署,拉斯维加斯的那次,你在这里看到的视频,已经启用了 DLSS,我们已经实现了可视化方面的实时因素,这在半年前需要我们在非常强大的 GPU 上渲染一整夜。当然,在边缘有一些细微的瑕疵,但也有克服这些的方法。我认为速度非常重要。所以,这不一定都是关于物理准确性,而是关于实时因素。如果你有问题,请举手。你好,我很好奇。所以,这是否会成为您客户查看机器人是否能在新环境中成功的途径?您会向潜在客户展示吗?绝对是。这是一个很好的问题。我把它列在要点中。这是我们可以最广泛地进行应用侦察的方式之一。通常,我们的合作伙伴、客户和潜在客户已经拥有其设施的数字孪生,将我们的机器人引入其中是一件非常简单直接的事情,你也可以可视化机器人应该做什么,例如碰撞避免、障碍物避免等。但更进一步的是,机器人是否能够操纵物体。我认为我们在早上也看到了一些有趣的东西,特别是当你看到触觉交互方面仍然存在一些挑战,操纵方面仍然有很多活跃的研究。但总的来说,这也是一个很好的工具,可以用来销售解决方案,用来推广它。你好,感谢您精心准备这次演讲,以及您和您的团队所做的出色工作。谢谢。嗯,我有两个问题。一个关于您提到的“从模拟到现实”的传输挑战,关于惯性、质量属性等等。您能否更详细地阐述一下这些挑战?您还提到英伟达帮助您和您的团队克服了这些挑战。英伟达团队是如何帮助解决这些挑战的?这是我的第一个问题。我的第二个问题是,制作第一个原型花了多长时间?如果您指的是最新的原型,谢谢。第一个问题是关于“从模拟到现实”的部署和建模这些差距。我认为最明显的事情是来自你的 CAD,比如质量属性。如果我们使用我们的 MCAD 系统,可以非常准确地对材料进行建模。罐头、铝、钢罐、所有螺丝等。这些参数很容易导出。但我认为棘手之处在于执行器,因为它们通常有很多非线性行为。我们使用执行器,我们还宣布了与 Maxon 的合作,这是一家瑞士执行器公司。我们三方——Maxon、英伟达和我们——一起努力改进建模。齿轮箱、行星齿轮、轻微的间隙,非常难以量化。我认为还有一些机会可以做得更好。但我认为过去一年半的这些进步,特别是与合作伙伴在执行器建模方面的合作,确实使得迈出这一大步成为可能。然后是第二个问题,关于迭代。我们通常每个原型迭代需要大约六到九个月的时间。而我们现在要部署的最新原型,我们正在建造相当数量的中等两位数数量,并将部署到不同的客户现场。设计周期大约是六个月。所以,我们收到的第一个组件大约是在二月、三月。我们开始建造机器人,并在一个半月内,我们将管道从上一代转移到了这一代。现在,我认为这比前几年已经有了很大的进步,但我们也学到了很多东西。我认为现在对我们来说,一个具有挑战性的问题是,我们能否也用我们为模仿学习和操纵方面创建的所有数据集来做到这一点?所以,我认为通常我们试图打破的是大约一年的周期。所以,大约一年后,我们正在研究下一代。你好。我也想感谢您的演讲。我的问题是,就模拟认知过程的延迟而言,您的团队是否正在研究替代计算基板是否是实现纳秒级复杂感知和推理的可行解决方案?是的,是的,我认为绝对是。我们做了很多工作,而且在过去几年里也有一个演变。我认为你有很多,你有惯性测量单元,在相机同步方面,通常有毫秒级的偏移,甚至几十毫秒,对于机械移动系统来说相当多。一旦我们将其降低,我的意思是,理想情况下,将其降低到零,但一旦将其降低到几十微秒,它就不再是几十毫秒了。软件组件协同工作,但也不需要纳秒级精度。我认为一个公平的问题是,当你使用这些事件式视觉传感器时,系统中有任何需要如此高的对齐需求的东西。好消息是,在模拟中,计算单元在我们的系统中,以太网骨干网,当然,我们可以有 NTP 定时协议等。但然后你也有边缘计算到相机本身的接口,这会引入延迟。所以,我认为你可以投入很多精力来量化这些,但你真的需要确保你没有过度,没有过度拉伸。所以,我认为纳秒级,老实说,我们从未遇到过,但我们最初确实遇到了几十毫秒的延迟,这实际上相当,嗯,这不太有帮助,让我们这样说,即使在模拟中也是如此。好的,我们还有最后一个问题。你好,非常感谢您的演讲。我更想了解 3D 扫描库管道以及该管道中的实际资产。机器人能够与之互动吗?它们有物理属性吗?如果有,您是如何分配这些物理属性的?是的,这也是一个非常公平的问题。这是我们几周前开始问自己的问题。时间不长。但事实上,我们最初的孪生模型,包括所有的墙壁、天花板、地板,这些几乎不会改变的东西,你可以争辩说。然后,我们基本上只叠加了 3D 扫描库的 3D 重建。机器人正在其中行驶,因为任何碰撞,任何东西都被禁用了。就我所理解的,还没有可以与这些表示进行交互的功能。但我们在早上看到了一些有趣的研究,即场景构建也可以交互,并且是碰撞体、碰撞网格等。但即便如此,你仍然需要做很多事情,因为如果你基本上拥有你空间中 3D 表示的一部分,你还需要再次考虑重量、惯性以及更多东西。但我们看到的是,纯粹是为了创建更逼真的场景,更逼真的背景,将这些 3D 重建添加到其中是一个非常好的方法。太棒了,谢谢。太棒了,谢谢。非常感谢您这次关于通过“仿真优先”方法推进人形机器人的精彩演讲。是的,谢谢。[掌声]