📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

[모두팝] 모두의 #RoboticsAI : 연구 기록부터 구현 인사이트까지

모두의연구소1:51:50

Transcription

好的。您好。我是运营人形机器人实验室的郑焕锡。在开始之前,我本人也正在学习中,所以接下来将为大家介绍人形机器人的现状。如果我有什么说错的地方,还请大家多多包涵。

简单介绍一下我自己,我毕业于机械工程系,目前在HD Hyundai Site Solution从事智能挖掘机的研究。去年,我曾作为第一期和第二期成员参与了 모두의연구소(Mudeungso)的机器人实验室活动。正如刚才介绍的,第三期活动即将开始,目前正在招募中。我还撰写了《所有人形机器人》的维基文档,这是在第二期活动期间完成的。我的兴趣领域是人形机器人,尤其对强化学习领域非常感兴趣。

我今天想讲的内容是,首先介绍人形机器人的技术现状,然后分享我在运营实验室期间的经历和成果,最后是关于第三期实验室的宣传。

首先,关于人形机器人的趋势,我认为目前人形机器人的技术趋势大致可以分为两类。第一类是展示基于运动跟踪的性能的机器人。第二类是基于运动生成的,能够在实际生活或工业现场展示性能的机器人。

我尝试根据国家来分析这些趋势。在中国,似乎最专注于让机器人像人一样自然、动态地运动。代表性企业有宇树科技(Unitree Robotics)和宇航动力(Unitree Robotics)等。在它们的YouTube官方视频中,大部分都展示了这种动态的运动。因此,视频中多为跑步、跳舞、功夫或拳击等内容。从技术上讲,它们似乎更侧重于基于运动跟踪的全身控制和平衡维持,而不是执行具体任务。也就是说,物理上能够多稳定地运动是核心。目前中国有150多家人形机器人初创公司,甚至还举办了人形机器人体育比赛。因此,我认为中国是在展示这种动态运动方面最领先的国家。

接下来,我将韩国和美国合并来看。如果说中国专注于机器人能像人一样动得多好,那么韩国和美国则更侧重于人形机器人在实际工业现场能否稳定地完成工作。像Figure A9、波士顿动力(Boston Dynamics)或特斯拉机器人(Tesla Bot)等机器人,在YouTube视频中,大部分都展示了在工厂或物流环境中精确执行重复性任务的场景。因此,这些公司虽然也重视自然的运动,但更看重任务成功率、可靠性以及实际的投资回报可能性。这些任务大多是通过运动生成方式进行控制,而不是运动跟踪,并且通常使用基础模型(Foundation Model)或视觉语言模型(VLA Model)等技术。

以上是我对各国人形机器人趋势的简要介绍。接下来,我将进一步说明论文中关于运动跟踪趋势和运动生成趋势的差异。

首先介绍的论文是Twist论文。Twist论文的核心目标是将人的全身运动实时、自然地映射到人形机器人上。在Twist论文中,他们首先需要将人的动作捕捉数据重新定向到人形机器人的运动学模型上。然后,基于这些数据,他们结合了强化学习和模仿学习(Imitation Learning)的学习方法。在结构上,他们使用了教师-学生(Teacher-Student)学习。教师策略(Teacher Policy)在模拟环境中利用未来信息学习稳定的动作,而学生策略(Student Policy)则使用在真实机器人上才可用的信息进行学习。模拟环境中可以看到的信息包括未来信息,而真实机器人上可用的信息则包括IMU数据或过去的数据。此外,他们还应用了域随机化(Domain Randomization)来缩小模拟与现实之间的差距,从而实现了零样本(Zero-shot)迁移到真实人形机器人上。总而言之,Twist论文是基于人的动作捕捉数据集进行学习,以实现与人尽可能相似的自然人形机器人运动,是一篇运动跟踪方面的论文。

接下来是ASF论文。ASF论文的核心问题是,为什么在模拟环境中表现良好的运动跟踪在真实机器人上会失效?为了解决这个问题,ASF提出了一个三阶段的学习结构。在第一阶段,他们首先在模拟环境中学习一个能够跟踪人体运动的全身运动跟踪策略。在第二阶段,将模拟环境中学习到的策略应用到真实人形机器人上,并收集实际的运动数据。由于模拟和现实之间存在动力学差异,他们会学习一个“Delta Action Model”来补偿这种动力学差异。在第三阶段,将这个Delta Action Model加入到模拟环境中。这样,模拟环境就会变得与真实动力学非常相似。然后,在这个环境中进行学习,就可以根据真实的动力学进行微调。ASF论文表明,基于模拟的运动跟踪策略可以更精确、更稳定地应用到真实人形机器人上。

综合这两篇论文以及阅读的其他论文,我认为在运动跟踪问题中,有四个关键点。第一是重定向(Retargeting)问题。人与人形机器人之间在关节自由度和运动学结构上存在很大差异,因此将人的运动转换为机器人运动学模型是必不可少的。第二是模拟到现实(Sim-to-Real)问题。模拟和真实环境之间存在动力学差异,因此论文大多探讨了克服这种差异的方法。第三是应对外部冲击或跟踪失败的情况。在使用机器人时,在真实环境中经常会遇到外力作用或打滑等情况,这可能导致运动估计随时失效。论文大多探讨了应对这些情况的方法。为了解决这些问题,大多数运动跟踪研究都采用了强化学习的方法。我认为之所以采用强化学习,是因为跟踪问题通常需要快速跟随期望的参考运动,并且需要对外部作用力做出快速响应。强化学习可以通过奖励机制实现优化,并且与使用其他方法(如VLA)相比,结构更简单,易于实现快速控制。

接下来,我将介绍与运动生成相关的论文。在运动生成领域,不仅是简单地跟随参考运动,更重要的是探讨人形机器人如何生成和执行任务。这篇论文(IDP3)的核心问题是:在一个环境中学习到的操作能力,是否可以在其他物体、其他视角或不同场景下使用?为了解决这个问题,该论文使用了扩散策略(Diffusion Policy)。虽然现有的扩散策略已经解决了机器人领域的许多问题,但IDP3将其扩展,提出了改进的3D视觉策略。与之前的2D数据输入不同,IDP3直接生成3D空间中的机器人动作。输入包括3D点云、图像数据以及机器人的本体感觉信息,如IMU传感器数据或机器人关节数据。与传统的运动跟踪不同,该策略不是跟踪运动,而是以当前观测为条件,通过扩散方式概率性地生成动作。

接下来介绍的是英伟达(NVIDIA)开发的GryphN1系列。最初是N1,最近已经更新到N1.6。GryphN1是基于视觉语言动作模型(VLA Model)的人形机器人基础模型。它被介绍为人形机器人的基础模型。如果说之前的论文只使用了扩散策略来生成任务,那么GryphN1则将其扩展到基础模型层面,生成了机器人模型。GryphN1的核心思想是,通过语言理解任务,通过视觉识别环境,然后生成符合条件的动作。其结构分为三个部分:首先,使用VLA模型接收图像和语言条件,生成动作的条件。然后,在其后连接扩散Transformer(Diffusion Transformer)来生成机器人动作序列。GryphN1还有一个重要的特点是跨环境(Cross-Environment)结构,通过使用跨环境的“Torque-to-Torque”和“Torque-to-Position”控制,可以使用相同的网络来统一使用不同的人形机器人。如果说IDP3关注的是“在这个场景下如何移动”,那么GryphN1则是理解“在这个场景下应该做什么”并生成相应动作的模型。

在运动生成领域,我认为有三个关键点。第一是动作生成。与运动跟踪领域关注如何精确跟随预定运动不同,基于VLA和扩散的方法接收视觉、语言和机器人状态作为观测,并生成将要执行的动作序列。第二是数据真实性(Data Realism)。虽然在运动跟踪中Sim-to-Real很重要,但在运动生成方面,与模拟和现实的物理差异相比,GryphN1等基础模型需要大量的学习数据。因此,学习数据与实际情况之间的数据分布差异以及数据量本身都非常重要。第三是失败应对方式的变化。在运动跟踪中,如果任务失败,会尝试恢复并重新跟随。然而,在扩散和VLA方法中,不是保持原有的策略,而是重新规划符合当前情况的动作,专注于完成目标任务。

总而言之,使用VLA和扩散方法,与传统的运动跟踪不同,可以将人形机器人控制从低级控制转变为高级行为生成问题。

以上是我准备的人形机器人趋势介绍。事实上,我通过学习人形机器人领域以及观看YouTube上的许多内容,看到了很多非常酷的机器人视频。在观看这些视频时,我曾想过,难道我只能一直看着吗?因此,去年我下定决心要学习人形机器人领域。在思考如何学习时,我发现 모두의연구소(Mudeungso)有可以学习人形机器人的学习小组。于是我创建了这个学习小组,并想在此介绍一下我们小组的活动。

起初,我一无所知,所以首先需要了解如何学习以及有哪些领域。我们最初设定了四名活跃成员,为期四个月。最初的目标是对人形机器人领域有一定理解,并且当时我看到像扩散策略和GryphN1这样的技术层出不穷,我心想,如果能深入学习这些领域,就能了解人形机器人的趋势。因此,我们每周都会进行论文研讨会,并且像之前提到的机器人和GryphN1,在它们的官方网站上都有英文教程。我几乎是逐字逐句地翻译这些内容,并制作了维基文档来学习。在第一期活动中,我们主要就是这样了解了趋势。

第一期结束后,我思考,既然要进行第二期,那么该如何做得更好呢?我首先想到的是,如何记录我们的活动,为韩国的人形机器人领域做出贡献?另外,随着学习的深入,可能会有新的成员加入,第二期结束后也可能有第三期。如何让新加入的成员能够快速学习并共同成长,这也是我一直在思考的问题。并且,如果这些人想要开发人形机器人,需要做哪些准备,我们在实验室活动中需要奠定哪些基础?带着这些思考,我们开始了第二期活动,招募了大约12名成员。

最初的目标是从以学习为中心转变为以团队为单位,各自指定项目进行。我们最初计划分为硬件团队、任务策略团队和运动策略团队,各自指定项目。但由于大家对很多方面都不熟悉,所以这样做并不容易。最终,我们还是以各自独立项目的方式进行。在活动内容方面,我认为最值得介绍的是《所有人形机器人》的维基文档。我将在后面详细介绍。我们每周进行一次研讨会,每个人都选择并进行自己的项目。我们还进行了一次线下聚会,分享了各自项目的成果。

我们制作了各种研讨会资料并进行了介绍。我们主要通过Slack进行沟通,分享新的机器人视频等。我们创建了《所有人形机器人》维基文档。前不久,它还获得了“推荐书籍”的标志,虽然不知道是基于什么标准,但感觉很好。

正如我们第二期开始时所思考的那些问题,创建维基文档的活动解决了其中的许多问题。我们仔细思考了维基文档中应该包含哪些内容。首先,我们加入了Isaac Sim和Isaac Lab相关的教程。Isaac Sim是英伟达开发的模拟器,可以利用英伟达GPU同时训练数千台机器人。英伟达声称,原本需要30天才能完成的训练,使用Isaac Sim可以在20分钟内完成。我们认为,如果制作了关于这个模拟器的教程,其他人就可以通过它快速开发人形机器人。Isaac Lab是Isaac Sim环境中用于强化学习的库。我们也详细介绍了如何使用它。

我们不仅希望人形机器人能够很好地完成任务,还非常重视它们能否像人一样自然、流畅地运动。我们认为,要学习人形机器人,需要大量的运动数据。因此,我们认为将处理运动数据的方法记录下来非常有意义。我们主要撰写了关于AMS的内容。AMS是一个包含大量人形机器人动作捕捉数据集的数据库,例如LaFAN、CMU Motion Capture Dataset等。这些数据集格式各异。AMS将它们统一为一种格式,即使用SPL。在阅读人形机器人论文时,经常会看到SPL。SPL是一种统计模型,可以通过一组参数来生成人体3D网格模型。我们还撰写了如何使用SPL以及如何使用AMS数据的教程,努力解决我们最初提出的问题。如果第三期有新成员加入,我认为他们可以基于这个维基文档快速成长并共同参与活动。

我还可以分享一下我个人的活动。我大部分时间都花在撰写维基文档上,在此期间深入学习了Isaac Sim模拟器和Isaac Lab环境。这些环境中有很多教程,可以让我们直接测试人形机器人。我尝试修改奖励函数,尝试不同的算法。我之前认为生成数据集非常重要,所以做了相关工作。这些内容都写在了维基文档中。我一直想生成大量数据集,并且想知道如何生成我们想要的动作数据。一篇名为GVHML的论文解决了这个问题。它可以通过视觉视频提取SPL格式的人体动作捕捉数据集。这意味着我们可以获取任何我想要的、例如某个运动员的动作捕捉数据。我思考如何更好地利用它。由于大多数视频中都包含很多人,例如在UFC比赛中,我想模仿某个拳击手的动作,但视频中有很多选手。我测试了GVHML在多人视频中的表现。结果显示,GVHML提取的动作捕捉数据集会不断变化。最初是视频后方的人,然后是其他人。这让我意识到,在多人视频中,它并不总是能很好地工作。

我思考如何解决这个问题,发现Meta当时推出了Sam-2。Sam-2的作用是,给定一个视频,我们可以选择视频中的特定对象,然后它会持续分割并跟踪该对象。我想到,如果使用这个功能,就可以提取出我们想要的特定人物的分割信息,然后将其输入GVHML,就可以提取出我们想要的动作捕捉数据集。我尝试了这种方法。虽然视频有点断断续续,但我们成功地从视频中提取了想要的人物,进行分割,然后将其输入GVHML,从而获得了想要的动作捕捉数据集。我主要负责撰写维基文档和进行这些活动。

在运营第二期实验室之后,我思考了很多问题。我们招募了12名成员,但有些人中途退出,有些人因为失望而离开,还有很多人不知道自己该做什么。作为实验室负责人,即使我想做什么,也不知道如何指导那些不知道该做什么的人。我一直在思考,如何为那些需要明确目标的人提供目标。因为我本人也在学习,很多事情我也不懂,所以很难给出指导。我一直很想用人形机器人做一些新的事情,但这是一个非常困难的领域。在活动中,有些人通过项目获得了很大的收获,但有些人却因为困难而难以取得进展。因此,我一直在思考,如何让每个人都能成长并留下成果。

因此,在开设第三期人形机器人实验室时,我进行了很多思考。首先,我想到,如果创造新东西很困难,那么将最新技术变成自己的技术,不也是一种技术吗?因此,尝试现有技术也具有重要意义。基于这个想法,我们正在招募第三期实验室成员。

关于活动计划,我们主要计划是,在人形机器人论文中,大部分都公开了源代码。因此,我们可以在模拟环境中直接测试这些代码,或者使用不同的数据集进行测试。我们将各自选择一篇论文,进行研讨会,并尝试运行其开源代码,使用不同的数据集进行测试,并验证其实际性能。我们将把所有活动成果都写进《所有人形机器人》维基文档,让其他人能够快速了解这篇论文是如何运行的,以及它包含哪些内容,从而更容易地接触到这个领域,而无需阅读整篇论文。

我还准备了一些关于如何实现论文的指导。如果论文公开了源代码,那将非常好。有很多论文都公开了源代码。我将它们分为几种情况。例如,前面介绍的ASP论文,其代码公开得很好,并且有英文教程,解释得很清楚。在这种情况下,我们可以将其翻译成韩语并进行整理,分析论文内容,然后上传到维基文档。如果论文有不足或可以改进的地方,我们可以运行ASP,并将执行结果记录在维基文档中,作为一种记录。另一种情况是,例如之前介绍的Ani-Tracker论文。该论文结合了Ani-Tracker和Ani-Adapter来实现人形机器人运动跟踪。在GitHub上,Ani-Tracker是公开的,但Ani-Adapter并未公开。在这种情况下,我们可以使用Ani-Tracker,并根据算法自己实现Ani-Adapter。

还有一种情况是,除了运行现有论文之外,我们还可以尝试将它们结合起来。例如,在运动重定向方法中,有多种不同的方法,我们可以分析它们各自的优缺点。此外,之前提到的Sam-2,现在有了Sam-3。Sam-3可以直接从视频中提取我们想要的SPL数据。我们可以利用这些数据创建数据集,然后将其提供给之前实现过ASP或其他方法的成员,测试这些数据是否也能在他们的实现中得到很好的训练。

以上就是我们计划进行的活动。

以上是我准备的内容。谢谢大家。

您好,我是车罗博(Charo Robotics)的赵东建。我听了您的介绍,感觉很像很久以前的实验室会议。我想问一下,之所以主要在模拟环境中进行,是因为在资源或场地方面,拥有和操作人形机器人比较困难吗?

是的,我们一开始也有硬件团队,想尝试制作硬件,但电机太贵了,很难实现。所以我们现在主要以模拟器为主。

我有一个问题。我是Valuable Robot的边庆天。我们实际上也尝试过VLA等技术,但最困难的是微调阶段,尤其是在模拟器为主的情况下,数据收集等方面非常困难。我们似乎看不到解决的希望,而且需要大量资源,所以我们基本上放弃了这方面。请问您对此有什么看法或计划吗?

实际上,我本人主要做了很多用于运动跟踪的项目。但有些成员直接尝试运行了GryphN1论文,并进行了微调。但事实证明并不容易。收集数据很困难,即使收集了数据进行训练,效果也不如预期。要解决这个问题,确实不容易。但即使如此,直接测试并记录下“为什么在这种情况下会失败”也是有意义的。

您好,我是蔚山科学技术院的赵承勋,目前在攻读博士学位。您的演讲非常精彩。我也想学习机器人强化学习,请问在学习小组中,通常会进行VLA相关的学习,还是基于强化学习策略的学习?或者说,是偏向于某一方面吗?

我可以回答说,我们都进行了。因为大家感兴趣的领域不同,有人想做VLA,有人想做运动跟踪,所以每个人都选择了自己感兴趣的领域并独立进行了项目。我们每周都会分享各自的项目进展。研讨会也会持续进行,即使是做运动跟踪的人,也会查找VLA领域的论文并进行分享。所以,只要对人形机器人领域感兴趣,都可以参与。

我还有一个问题。我目前在医疗领域进行研究,您介绍的研究和资料似乎主要是针对固定摄像机对移动物体进行跟踪的运动跟踪。我最近对机器人手术感兴趣,想做一些手术机器人方面的工作。在这种情况下,是医生在移动,而物体是固定的,需要对固定物体进行跟踪。请问您是否也进行过这种固定物体、移动摄像机的跟踪研究?

我还没有深入研究到那个程度。但我们正在共同学习这个领域。您提到的IDP3论文中提到了“自主中心视觉”(Egocentric Vision),即从机器人的视角进行操作。我认为可以利用这方面的技术来尝试。

感谢您的回答。我是TwoMoveTech的韩俊。我想问一下,在您的实验室中,人形机器人这个概念非常广泛。即使有12个人,也很难涵盖所有领域。而且,似乎会偏向于某个方向,比如一个人只做VLA,另一个人只做其他方面。请问成员的分布情况如何?

我们之前并没有觉得有特别偏向某个方向。每个人在VLA领域内也有不同的兴趣,做跟踪的人也有不同的方向。所以我们并没有特别考虑分布问题,而是让大家做自己想做的事情。

您好,很高兴认识您。我的实验室名称很长,您可以简单理解为“使用LLM控制机器人”。这与您刚才的问题有些相似,但或许能给您一些启发。我们有在第四季一起合作过的成员,现在第五季上周刚开始了第一次会议,并将继续进行。我们目前正在招募新成员。

我们实验室从2024年3月开始。起初,我们雄心勃勃地尝试了硬件。我本人也是第一次尝试,但发现硬件不适合我。例如,电线连接问题,电线断了就需要订购,非常麻烦。从那以后,我们实验室就没有再做过硬件了。我们曾尝试与ROS集成,然后转向模拟器。我们尝试了Unity和ROS的集成,进行了一些导航测试。在第二季,我们加入了一些抓取放置(Pick and Place)的功能,在CoppeliaSim模拟器中进行了一些简单的家庭任务。这完全是基于代码实现的,我们编写了算法。但这样做之后,发现要做新的东西就需要写大量的代码,所以我们认为这条路行不通。因为这意味着需要写很多代码,然后又要写很多代码,这似乎不是长久之计。因此,我们认为到此为止。

在第四季,我本人一直从事深度学习,所以我想尝试加入AI技术。于是我们进行了这方面的尝试。这是第四季的成果。现在我们正在准备第五季。

以上是关于我们实验室的简单介绍。下面我将简单介绍一下我们第四季所做的工作。正如我之前提到的,在第三季,我们是基于规则进行开发的。但结果是,在各种环境中,我们无法实现基本的规定任务。因此,我们将目标改为使用MuJoCo作为模拟器。然后,我们计划使用LLM代理来生成代码,在更稳定的环境中执行代码,并通过各种API集成系统。我们为此做了准备。

这是一个非常复杂的结构。最底层是物理模拟层,我们假设将来可以用机器人替代。其上是控制层,包含了第三季的各种算法。服务执行层负责实际执行这些任务。LLM代理层负责生成代码并传递。用户界面则根据我们的对话指令来执行。我将从下往上逐一介绍。

我们使用了MuJoCo。实现Agent并不容易,但我们偶然发现了RoboCasa这个框架。RoboCasa这个框架非常庞大,所以我们将其核心部分提取出来,并在MuJoCo上重新移植。我们移植了Agent,并使用了Franka Emika Panda机器人,以及带有底座的移动机器人。在模拟器中启动后,就会出现这个画面。这里有Agent,还有一些简单的厨房环境。

我们实验室之所以被称为“伴侣机器人实验室”,是因为我们希望制造一个能在家里执行简单任务的机器人。然后是控制与规划层。这里可以实现位置控制,包括XY轴和旋转角度(Theta)。我们还使用了控制算法,并定义了一些收敛状态。控制本身是一个非常困难的领域,但我们希望尽可能地实现。

为了更容易地完成这部分工作,我们已经尽力做到最好,并相信您会做得很好。我们努力让这些事情尽可能简单。是的。是的。完成之后,移动平台需要实际通过房间里的障碍物。所以,您上面看到的,是我们使用贪婪地图(Greedy Mapping)绘制的地图。在这张地图上,它需要自己找到一条路径,并执行沿着该路径行进的任务。为此,我们做了一些工作。我们为 A* 算法添加了一些优化算法,使其能够更平滑地到达目的地。是的。然后,机器人控制主要分为两部分。左边看到的是关节控制。通过指定关节的编号、角度等,使其能够精确地移动。最终,我们需要将末端执行器移动到目标位置。因此,我们使用逆运动学来做到这一点。现在,当它向前移动约 10 厘米时,我们可视化了关节的运动过程。我们允许一定的误差范围,以便到达目的地。是的。然后,这是抓取和放置过程。左边是抓取,右边是放置。这里有点被遮挡了。抓取之前,需要先打开抓手,然后移动到目标上方,下降,抓住,然后提起。反之,右边是抓取物体,移动到目标位置,稍微下降,等待,然后返回。通过这种方式,我们完成了抓取和放置过程。然后,所有这些过程都已编码。它们都是在代码级别实现的。然后,为了将其用于 LLM,我们使用 Markdown 来定义 API,并提供示例,这是非常常用的方法。我们将这些信息输入 LLM,然后 LLM 根据这些命令来调用相应的 API。这是我们实现的主要框架。服务执行层,您可以看到,为了基本稳定性,我们使用了多线程来模拟和 API。将代码发送到“发送动作”部分后,它在这里执行。为了防止黑客攻击等,我们禁止了导入,只允许使用我们提供的 API。我们这样做了。这样,我们最大限度地减少了事故发生的可能性。然后,当 LLM 调用时,这个命令就会被执行。我们使用了 LangChain 的 LangGraph Agent 框架。我们这样做的目的是为了未来的可扩展性。因此,当用户用自然语言输入时,它会被处理成机器人任务。会有各种各样的目标。例如,去厨房拿东西,送到客厅,去卧室拿东西等等。然后,我们将这些目标分解成多个子目标,然后将每个子目标分解成多个任务,然后执行这些任务。我们就是这样工作的。然后,我们向用户提供了各种问题、状态信息和技能列表。在这里,我们决定让这个对象尽可能简单。我们提供了地面真实性(Ground Truth)。在第五季,我们将移除地面真实性,但现在我们使用它。然后,当这些信息进来时,您可以看到“前往特定对象所在位置”的指令。然后,它会前往绿色 0 号位置。然后,执行“拾取对象”指令,拾取绿色对象。然后,前往红色碗。然后,将其放在上面。然后,它会拾取蓝色盒子,并将其放在红色碗中。这些过程都被定义并执行,然后可以确认结果。是的。然后,我们添加了 UI,可以通过语音或文本进行操作。例如,“将绿色立方体放入红色篮子”。然后,机器人会移动到绿色立方体的位置,拾取它,然后放入。然后,“将黄色和红色立方体放入黄色篮子,将蓝色立方体放入红色篮子”。然后,LLM 会制定计划。它会根据 API 来执行。然后,它会按照命令执行这些操作。是的。是的。我们先看到这里。是的。然后,蓝色。是的。我们做得很快。速度有点慢,但我们可以计算速度。所以,我们的首要任务是完成任务。所以,我们尽力做到了。是的。然后,我们在第五季有了目标。首先,去年出现了 Memo 机器人,我认为它是我们家庭机器人领域最有潜力的机器人。今年,我们看到有人在家里测试。他们正在招募测试人员。所以,我决定今年要以它为目标。但是,由于没有公开模型,虽然可以自己制作,但我觉得这可能是徒劳的。所以,我们决定先将其集成到 Mobile Aloha 中。抱歉,是 Mobile Aloha。我们将其集成到 Mobile Aloha 中,然后进行测试。我们将其放在模拟器中进行测试,发现手臂会碰撞。这意味着,对于单臂机器人,可能会出现很多我们没有预料到的问题。所以,我们正在考虑如何解决这些问题。是的。然后,在做的过程中,我们首先为我们提供了 3D 地图。是的。基本上,我们打算使用深度相机等设备,来构建一个完整的 3D 地图,了解物体的位置以及如何操作。即使不是非常精确,也要尽可能粗略地构建。然后,正如您所看到的,我们只处理立方体。但我们还想处理杯子等其他物体。所以,我们想尝试通过视觉来确定在哪里抓取物体。如果位置确定得好,最后通过视觉伺服来精确地对准并抓取。我们打算这样做。我们已经掌握了视觉伺服技术,所以虽然有难度,但我们认为可以在今年上半年完成。在第五季可以完成。我认为这是可行的。问题在于这里。基于 LLM,考虑到目前的 LLM 发展速度,我们认为使用开源 LLM 也可以实现。所以,上面不是问题,但下面是问题。我们总是认为一切都成功了,但当然也会失败。如何确认失败并恢复?这是最大的问题。当然,如果一直输入摄像头画面,会更好,但会有令牌成本等问题。如何将这些连接到 LLM 是一个挑战。如果能做好这一点,也许可以写一篇论文。我们对此抱有期待,但目前只是想法,还没有具体实施。所以,这可能是今年的一个挑战。如果这些都做得好,当出现各种意外情况时,LLM 如何自行判断并解决问题,这将非常有趣。我们对此充满期待。我们总是抱有很大的期望,然后等待结果。所以,目前是这样的状态。此外,今年我们打算重新开始做模拟器。我们打算今年开始做模拟器。因为很多人都希望有模拟器硬件。我最近做了一个实验。在左边,我们使用 Unity 进行强化学习,然后连接到机器人,并在右边的实体机器人上进行了测试。结果很好。而且,因为它是基于激光雷达的,数据非常干净,所以没有太大问题。我们确认了连接没有大问题。如果可能的话,我们打算在今年上半年重新从头开始制作移动平台。然后,在下半年,我们可能会尝试制作手臂。我们打算尽快完成这个项目。是的。所以,我们正在独自开始。我们购买了一些东西,连接了激光雷达和深度相机,然后在家里尝试做一些事情。我们不只是模拟。所以,在我来这里之前,我完成了这个项目。我大约在下午 4 点 20 分完成,然后连接了激光雷达并进行了测试。结果很好。所以,我们认为以后可以继续连接更多设备。我们正在这样做。所以,如果计划顺利,虽然是梦想,但今年应该会有一些成果。我们对此抱有期待。是的。所以,今年我们打算在汽车上安装 IMU,使用树莓派,因为 Jetson 太贵了。所以,我们打算使用树莓派,连接激光雷达和深度相机。我们已经制定了这样的计划。是的。是的。我的演讲结束了。我是李康宁,在电子研究所做机器人研究。我有两个问题。第一个是,在使用 LLM Agent 时,似乎是通过函数调用进行组合的。这意味着不能创建预定义的函数调用之外的新函数 API,对吗?是的,可以。只要将其添加到其中即可。LLM 理解得很好。如果我想添加函数调用,只需在此处定义即可。然后,以后如果函数变多,可以连接到 LangChain。我们已经考虑到了这一点。那么,人类必须首先在 Markdown 中定义它,对吗?是的。那么,在定义函数调用时,需要进行良好的分解,以便能够组合基本功能。是否有相关的策略或价值观?目前,我们似乎只是做我们能做的。我们是凭经验做的。正如您所说,我们并没有制定规则。我想,随着经验的积累,这些东西会自然地出现。是的。是的。这是我的第二个问题。您之前在车辆上使用了强化学习。我使用了模仿学习。那么,对于导航,您认为模仿学习和强化学习哪个更好?或者哪一个更方便?我认为强化学习在某些方面是合适的,但从长远来看,我认为它并不完全合适。我在某些方面使用强化学习,而在其他方面,我认为 LLM 或算法会介入。因为,使用强化学习来做像围棋这样非常漫长的游戏非常困难。所以,我认为模仿学习等需要与强化学习结合。我认为仅靠强化学习是不够的。我个人是这样认为的。谢谢。是的。我是韩承,在 Pungjin 公司从事人工智能研究。我想问一下,在您最初的演示中,您抓取了红色盒子,然后抓取了黄色盒子。那么,机器人移动时,如何知道红色盒子和黄色盒子的位置呢?现在,我们知道我们正在这个地图上进行操作。所以,我们知道对象的位置。模拟器会提供这些信息。所以,我们现在将这些信息作为提示输入。在第五季,我们将使用 3D 地图来构建。然后,我们希望它能够自行识别物体的位置,并使用这些值来操作。然后,当然会有噪音。所以,我们认为需要将视觉等结合起来解决这些问题。所以,现在只是看到了可能性。您可以这样理解。是的。再说一句,如果您想以这种方式进行模拟,我知道有一些 VLM 可以接受点作为输入。如果您使用这些,可能会有用。啊,是的。是的。谢谢。我会考虑的。你好,我是金英俊,在 Kakao 公司从事 VLM 研究。您似乎做了很多事情。您是在业余时间做的,还是有其他主要工作?您的热情从何而来?我刚才吃晚饭时提到过。我开始做这个机器人项目时,正好是 ChatGPT 刚发布的时候。我开始做这个项目,而 ChatGPT 刚刚发布。我之前主要从事自然语言处理。但不知何时,我觉得自然语言处理变得无聊了。模型越来越大,但似乎没有太多事情可做。以前,看论文很有趣,但现在,只是放很多数据,然后扩大模型,这似乎很有趣。所以,我开始了这个项目。我的主要工作是讲课。我只是觉得有趣。没有特别的原因。而且,随着我们进行到第五季,通常在两季左右,团队成员就会更换。这让我感到遗憾。但实际上,在过去两年半里,进展非常缓慢。所以,有时会觉得不容易。需要解决问题,学习新事物。但从长远来看,我们似乎一步一步地前进。而且,最近 AI 发展得很好,这让我很有动力。特别是,像 MuJoCo 这样困难的事情,AI 也能解决很多问题。所以,我个人觉得很有动力。而且,我们正在尝试物理 AI。我们也在尝试物理方面的东西。我一个人做不到。通过向 AI 提问,即使错了,也尝试解决问题。我就是这样做的。是的。所以我做得很有趣。是的。在研究所社区,您可以看到很多像您这样充满热情的人。我是朱成文,在原子能研究所从事机器人研究。我想问一下您使用了什么 LM 模型?另外,LM 通常有“幻觉”现象,即使给出很好的提示,也可能做出奇怪的事情。在您刚才的例子中,当输入进来时,您是如何通过提示来调用函数的?您是否遇到过输入文本后,机器人做出意想不到的事情的情况?是的。是的。这是一个非常好的问题。我们使用 LangGraph 的原因是因为它非常简单。如果不是这样,我们就不需要 LangGraph。我们使用 LangGraph 的原因是因为我们考虑到了您刚才提到的问题,并认为我们需要为此做一些事情。我认为最终目标是实现数字孪生。因为机器人随时可能犯错,我认为需要通过数字孪生来验证这些错误。所以我认为这项技术需要继续保留。目前还没有实现。这里的问题很小,只是为了防止幻觉,我们在下面提供了示例代码。所以,这里没有太大问题。但正如您所说,这种情况确实会发生。我们正在考虑如何解决这个问题,并认为需要在模拟器中进行验证和解决。但我们还没有考虑具体如何做。我们先解决这个问题,然后可能就会解决了。是的。我们使用了 GPT-5 Mini。我们发现使用 OpenLM QN3 256 或 250 也可以。但是,API 成本不同。所以,这次我们当然会使用商业 LM,但也有一些开源 LM 可以通过 API 使用。这些地方的令牌成本非常便宜。所以,我们可以一起使用它们。如果做得好,我们也可以将其移植到内部。所以,考虑这些也是不错的。谢谢您的讲座。我是申承贤,在大学攻读 VLM。我听说您在讲课的同时,也在进行项目。当您与团队成员一起进行项目时,您是如何分配角色的?我很好奇。我认为这是一个非常困难的问题。因为,实验室每周只开会一次,大约两个小时。每个人都有自己的情况,所以很多时候事情不会按计划进行。这就是为什么我们不进行硬件项目的主要原因。我认为这几乎是不可能的。所以,我们是这样做的。我们尽可能只设定目标,并在目标范围内自由发挥。但是,目标越来越具体。所以,今年我们有两个主要目标,如我刚才所示。在这些目标范围内,如果您想做一些额外的事情,可以选择一两个目标,然后通过演示来共同解决问题。我们是这样想的。我们一直在谈论写论文,但还没有写出来。如果今年做得好,我们打算写一篇。是的。你好,我是赵勇录,在大教公司担任 Web 软件工程师。我很好奇您将使用哪个 LM。我之所以好奇,是因为如果使用商业 API 提供的 LM,需要进行网络通信。在物理环境中,网络通信可能会失败,或者响应时间可能比预期晚。我想听听您对这些变量的担忧。抱歉,我们还没有考虑到这一点。因为,我们还没有到需要考虑失败案例的程度。现在,重要的是能够工作。而且,如果您看视频,大约是 2.5 倍速。所以,现在我们更关心的是能否工作。至于实际情况,我们以后需要解决。但总之,能够工作是第一位的。然后,我们给了地面真实性。现在,既然可以工作了,我们想尝试移除地面真实性。然后,看看是否还能工作。至于您提到的问题,我们以后会一个一个地考虑。网络中断的问题,我想我们会在最后解决。是的。我认为是这样。是的。谢谢您的回答。你好,我是设计师李智秀。我不是这个领域的从业者,今天来听讲座。我一直对伴侣机器人很期待,比如宠物。您是否尝试过制作这样的机器人?您提到您在硬件方面进行控制。我想问一下,是否可以进行 3D 打印来实际制作这些东西?您不是伴侣宠物。很多人会误解。我的意思是,它更像是伴侣,而不是宠物。最初,我考虑的是,随着一人家庭的增加,如果我出门时窗户没关,下雨了,就需要关窗户。我最初是这样想的。所以,它不是伴侣宠物。而且,我第一次做的时候,在第一季和第二季,我尝试过 3D 打印。但我意识到,以我的能力是做不到的。还有很长的路要走。因为,控制和动力学是另一个领域。所以,从头到尾做机器人技术似乎是不可能的。我的目标是到 Arduino 或 ESP32,或者 ROS。至于更低层,还有动力学、机械工程等领域。所以,我认为我需要花钱购买。这是我的想法。是的。我是车东根,来自车机器人公司。很高兴认识您。我们公司成立于 3 年前,即 2023 年 3 月。我们目前正在研究基于物理的 AI 自主操作技术。我们正在以可投入实际应用的水平,研究移动操作器、双臂人形机器人以及自动化机器人系统。我们还为需要自主机器人硬件和软件解决方案的企业提供解决方案。我们已经获得了各种认证。我们获得了所有可以获得的认证。幸运的是,我们被韩国中小企业部选为“传奇 50”企业。今年,我们在各种竞赛中也获得了最高奖和优秀奖。我们还获得了作为核心材料、零部件和设备供应商的认证,并获得了各种研发项目。我们目前正在开展业务。以上是关于我们公司的介绍。非常感谢,去年我参加了梨花女子大学的校园城镇项目。非常感谢,Moducon 向我发出了参与邀请。去年,我作为演讲嘉宾参加了 Moducon。简而言之,我去年在创业初期,作为机器人博士,我立即创业了。我当时的目标是向大家介绍创业过程。所以,如果您对此感兴趣,可以在 YouTube 上观看。今天我省略了这部分内容。我主要关注了创业过程中遇到的问题、见解以及与物理 AI 相关的见解。所以,如果您对我的创业经历感兴趣,可以在 YouTube 上观看。我们目前正在开发一个端到端的系统,用于在草莓农场进行 AI 驱动的草莓采摘、运输和仓储。我们实际上也在种植草莓。我们正在尝试各种双臂操作器,以确定哪种最适合。我们还在制造用于农场的移动机器人底盘。我们通过 AI 训练这些部分。所以,我们也不得不使用 VLM。最终,关键在于如何训练。在深度学习或 VLM 出现之前,我们主要使用非常原始的机器学习方法,如基于视觉的机器学习。但其局限性在于,随着数据量的增加,我们无法处理。而且,由于它是基于规则的,它只能理解人类能够理解的分类器。它无法超越这一点。VLM 之所以有效,是因为它克服了这些局限性。它能够处理人类无法理解的部分。因此,技术正在朝着这个方向发展。最终,在 VLM 中,输入是某种行为,中间模块是输出。机器人就是输入、处理单元和输出。因此,当我们将视觉输入和电机动作输出作为令牌时,中间的处理现在由 LRM 负责。在以前的经典机器人方法中,感知只是基于视觉的方法,而行为只是人类定义的基于规则的动作。但现在,通过语言模型进行推理,最终转化为动作。这就是目前 AI 模型的工作方式。目前,各种方法层出不穷,而且技术更新换代太快,我很难跟上。所以,我所调查的内容可能有些滞后。请您谅解。首先,我将简要介绍一下 VLM。大约在 2022 年,谷歌发布了 SayCan。这是第一次将强化学习与机器人实际应用相结合。谷歌尝试将强化学习训练好的模型应用于机器人。这在一定程度上是成功的。然后,他们决定在大规模数据集上进行训练。这就是 RT1,即机器人 Transformer。它是一种基于 Transformer 的实时策略模型。RT1 的目的是通过收集大量数据并训练策略来使其工作。由于 RT1 的成功,谷歌在其下一版本 RT2 中加入了 LLM。LLM 在 2023 年左右取得了巨大成功。由于输入和输出能够得到可靠的结果,我们认为它可以在输入和输出之间充当处理器。因此,我们可以处理抽象概念和我们用语言表达的内容。因此,我们将视觉输入转换为抽象语言模型,然后语言模型输出电机动作令牌。这样就构成了一个模型。这就是 VLM 模型 RT2 的方法。其强大之处在于零样本学习。零样本学习意味着,如果一次性训练好,就可以一次性完成。输入后即可获得输出。这非常强大。由于其有效性得到了验证,后来出现的机器人模型大多是基于 VLM 的。AI 模型。因此,这些模型取得了成功。然后,出现了 Open-X 环境 ROS。这意味着,既然有效,就收集更多数据,用更多机器人来训练。这就是 Oxe,即各种数据集的集合。其目的是创建一个通用的 AI 模型。然后,许多人可能正在使用 LeRobot,这是一个开源 VLM 模型。由于它是开源的,并且有更轻量级的版本,因此更容易访问。您可以将其视为一个更轻量级的版本。这是去年发布的 Open-VLM。VLM 的发展就是这样。然后,在 2025 年,我们将看到 SynAct 和 MultimodalAct 等模型。我认为这些是目前运行得最好的模型。Act 模型使用了 QN 模型。正如实验室主任所提到的,它结合了扩散策略,以实现高维推理。也就是说,它研究了如何更好地利用 LLM。MultimodalAct 模型在行为推理模型中,为了获得更多信息,它学习了深度信息作为地图。它还学习了预测图像的模型,从而实现空间感知。

通过推断这些部分,我们发现了一个名为 "VLA" 的东西,它工作得非常好。然后是 "PhyGiro",它通过流匹配来连续生成动作,并将这些动作分解成更小的“token”。在进行离散化之后,我们使用了 PhyGiro。目前,这些模型被认为是最有效的。

如果我们总结一下这些内容,那么 VLA 模型之所以有效,主要是因为以下几个方面。首先是“嵌入式作者”,也称为“VLA”。它在生成动作之前,会先在模型中输出文本。当然,这在我们的眼中是看不见的。在生成动作之前,这些部分被“嵌入”了。在潜在空间中,它们被首先输出,然后将这些任务分解成更小的部分。这些部分会不断地从原始过程中分解成子任务,这是一种非常有效的技术。

其次是 COA 和 VLA 的“可供性”。这实际上与 LNM 中的推理过程相同。在 LM 中,有一个称为“检索”的过程,用于搜索和查找信息。同样,在抓取物体时,它会以结构化的方式连接推理过程,以生成动作。这就像人类的思考过程一样。例如,在用手抓住杯子时,我们会考虑如何移动,如何弯曲手指来抓住它。

还有一个称为“One-Two”的东西,它被称为“自适应推理”。它是一种切换模式的方法,例如思考模式和行动模式。在接近杯子时,它会以快速模式移动,而在靠近杯子时,它会以精确模式移动,以确保准确抓住。这种分阶段的方法可以看作是 One-Two VLA 的自适应性。

因此,目前 VLA 之所以有效,是因为它使用了这些技术。

现在,我们来总结一下。我们公司也在密切关注这些方面,并考虑如何将我们的模型应用于不同的行业。接下来,我将分享一些我们在这方面的经验和见解。

目前,我们经常听到“成功率超过 99%”。虽然这可能有些夸张,但实际上,在实际应用中,我们的模型经常无法正常工作。在实际应用中,即使有 1% 的失败率,也很难应用。因此,我们正在认真思考如何解决这些问题。

目前的趋势非常明确。VLA 和其他类似技术正在被用于构建能够与物理世界交互的物理人工智能基础模型。在将研究成果从实验室推广到实际应用时,弥合差距至关重要。在实际实验中,我们经常遇到这样的情况:十次尝试中只有一次成功,或者需要花费十倍的时间才能成功。因此,我们正专注于如何找到有效的切入点,并使其能够成功运行。

事实上,论文和实际应用之间存在很大差异。用于训练的数据通常经过高度精炼,而实际应用中的数据可能存在许多差异,例如不同的对象、环境配置、颜色等。这些都需要仔细考虑。

此外,一次成功后,还需要能够重复成功。目前大多数模型在一次成功后,很难保证能够再次成功地复现。这很大程度上取决于运气。

考虑到这些因素,将机器人技术应用于工业领域似乎还有一段距离。制造一个能够工作的演示模型与制造一个能够 24 小时生产产品的机器人是截然不同的工程问题。

在实验室环境中,实验条件通常受到严格控制。然而,在实际应用中,我们希望机器人能够在没有限制的情况下运行。这可能也是导致差距的原因之一。因此,我们认为现在需要的是能够稳定运行的机器人,而不是仅仅能够工作的机器人。

我们获得这些见解的契机是,我们在实验室中测试了自动驾驶技术,并在实际场景中进行了测试。我们发现,使用不同的算法和传感器会带来不同的问题。我们还在人多的地方进行了跟踪实验。但回想起来,虽然技术可行,但将其商业化却非常困难。

同样,我们还与“Baemin”合作开发了送餐机器人。当时,送餐机器人尚未出现。我们与 Baemin 合作,他们负责设计,我们负责自动驾驶技术和机械部分。虽然机器人运行良好,并且测试成功,但我们在实际应用中花费了 2-3 个月的时间来使其正常工作。我们最初以为一个月就足够了。然而,在实际应用中,我们遇到了各种各样的情况,例如意想不到的障碍物,以及传感器配置的改变。这些都带来了许多变量,我们花了很长时间才适应。

通过这些经历,我学会了在制造机器人时需要考虑很多因素。在美食广场,我们发现地板材质、通道、餐桌、楼梯和斜坡等都需要仔细考虑。在机器人技术领域,这些都是非常困难的问题。

因此,要将实验室的成果转化为产品,还有许多问题需要解决。正如我之前提到的,在实际环境中,机器人的运行方式与实验室截然不同。此外,投资回报率 (ROI) 和总拥有成本 (TCO) 也是不确定的。在实验室中,我们通常依靠政府资助和项目来开发原型。然而,当产品推向市场时,成本可能无法承受。

此外,在概念验证 (POC) 和生产阶段,存在许多变量。正如前面有人提到的,操作员是否能够接受这项技术也是一个重要问题。许多人可能无法使用机器人,最多只能使用简单的扫地机器人。

此外,基础设施也是一个考虑因素。例如,在造船或焊接等行业,需要考虑特定的环境。每个环境都有其独特性,需要考虑的因素也很多。当发生事故时,如何处理也是一个实际问题。

因此,在将这些技术转化为产品时,需要解决许多问题。

从政治角度来看,我们应该优先选择高成本、低变动性的任务。这意味着我们需要限制机器人的运行环境和任务。几乎不可能制造出能够在任何地方都能正常工作的机器人。因为需要解决的问题空间太大了。与其说需要做什么,不如说是在有限的环境中完美地执行有限的任务。

从这个角度来看,扫地机器人是一个很好的例子。它们只负责清洁地板,并在遇到障碍物时通知用户。它们不太可能造成严重事故,最多可能卷入电线。一个成功的产品需要能够容忍用户可以忽略的小错误,而不是造成严重事故。

同样,如果机器人价格昂贵,就没人会购买。因此,需要精确计算 ROI。

此外,我们正在采取分阶段自动化的方法。虽然我们提到了端到端全自动,但我们目前专注于一些简单的任务,例如采摘草莓,以及开发自动驾驶移动机器人平台。我们正在逐步推进这些项目,并相信最终能够实现完全自动化。

我不知道我是否清楚地传达了我的意思。在将实验室的成果转化为产品时,我们遇到了许多障碍。我相信,只有解决了这些问题,我们才能制造出可用的机器人。

总而言之,这是一种工程师的思维方式。首先,需要准确地定义问题。与其仅仅关注一次成功,不如仔细研究机器人运行的限制和约束。其次,机器人是否能够正常运行固然重要,但更重要的是它能为用户带来什么价值。从长远来看,机器人应该为用户提供帮助。

此外,在离线模拟和“模拟到真实”的转换方面,目前还没有能够实现模拟和实际数据循环的平台。因此,我们需要构建这样的平台。即使我们在离线模拟中进行了大量测试,将模型部署到实际环境中时,它们也可能无法正常工作。因此,我们需要考虑一个统一的世界模型,它能够将实际环境中的数据反馈到模拟中。

此外,让开发人员创建的系统能够被其他人使用非常困难。运营团队在安装和展示机器人时会遇到困难。如果没有详细的操作手册,他们很难使用。因此,在实验室的成果转化为产品之间,需要进行大量的改进。我们每天都在思考如何简化机器人。

由于时间有限,我原本想讨论移动操作和物理人工智能,但这些只是我们的方向。我们过去在实验室中利用自动驾驶、SLAM、路径规划和运动控制等技术开发了自主移动机器人。然而,这非常困难。要完成一个项目,需要逐个单元进行计算。例如,在仁川机场创建地图时,需要手动校正超过 100 米的区域。此外,如果发生变化,需要手动修改基于规则的系统。

此外,还存在语言理解的障碍。机器人无法理解我们的语言。因此,我们需要将 AI 模型应用于数据,并实现零样本学习。我们需要能够从语言中理解含义的机器人,并能够基于推理来制定任务计划。

换句话说,即使“抓住杯子”被视为一个任务,但它包含许多子任务。我们需要使用 LM 将这些子任务分解成更小的部分,以便机器人能够完成任务。

我们认为,未来的发展方向是利用 VLM、嵌入向量、检索以及最终的任务规划。

总而言之,我们正在思考如何将地图绘制提升到 AI 可以学习的水平,并同时使用支持设备推理的模型。然后,我们通过流匹配和数据抽象来存储数据。我们还通过“模拟到真实”来弥补实际环境中数据收集的局限性,并从模拟中获取数据。

我们是 Zaro Robotics。虽然我们无法展示我们正在开发的产品,但我们希望您能理解我们的愿景。

我是申承贤,在大学攻读 VLM。我对推理很感兴趣,并研究了 COT 和可供性。我发现,即使取得了最先进的成果,也未必能在实际应用中奏效。您在谈论推理时,似乎正在考虑如何通过应用 COT 和可供性来改进推理。然而,使用 COT 会增加推理时间。您是如何克服这一点的?

我认为这取决于具体的实现方式。是执行整个过程的链式推理,还是将任务分解成子任务,并执行一部分?这可能是一个问题。我认为可以通过不同的实现方式来解决。

这可能不是一种链式推理的方式。我正在考虑多种方法。总的来说,完成任务本身非常重要。将任务分解成子任务,以及分解的程度也很重要。我们甚至不知道机器人是否成功抓住了物体。我们只是通过端到端学习来训练它们。例如,在折叠毛巾时,机器人是否正确抓住了毛巾?它是否被举起来了?是否可以传递?这些都需要实时判断。我还没有看到能够准确判断并继续执行任务的模型。我也想开发这样的模型。

关于未来的发展方向,您提到了最终会达到世界模型。在达到世界模型之前的中间阶段,您认为会出现哪些研究或方法?

目前,世界模型通常只能在有限的环境中运行。我们还没有看到能够实现完全自主机器人的统一世界模型。然而,正如 Memo 实验室主任所提到的,机器人可以在一定程度上执行洗碗和清理等任务。但我们不清楚他们是如何实现的。

我认为,在房间等较小的环境中,世界模型可能可以运行。然而,如果存在人和其他物体,并且不断出现异常情况,我不知道它是否能正常工作。

我不知道这是否是您想要的答案。

我是金国镇,在 LG 电子工作。感谢您的演讲。您提到使用 VLA 开发机器人,并使用端到端方法。我想问一下可能出现的问题。您提到使用 VLA 模型,例如 GRUT 或 Phy,并对其进行微调。VLA 的特点是使用扩散或流匹配将噪声转换为动作序列。然而,在实际机器人上运行时,机器人可能会出现抖动或震动的问题。您是如何解决这个问题的?

这也是我们遇到的问题。虽然可以通过现有技术实现平滑过渡,但当转换为 AI 的动作 token 时,可能会出现不干净的 token。机器人本身无法知道自己的行为,因为它没有传感器信息或输入信息。因此,我认为需要从底层开始提供干净的输入,并且机器人需要能够了解自己的状态。只有这样,才能判断机器人是否在抖动或跳舞。如果需要更多数据,可以添加更多数据来减少这种情况。当然,也可以在其中插入传统的机器人算法。但我不确定这是否是正确的做法。我们是否需要为端到端零样本学习添加旧技术?我对此有些怀疑。

事实上,即使是传统的算法也存在基于规则的局限性。它们无法处理无法处理的情况。新的数据可能会带来新的问题。即使不是 AI 模型,也存在局限性,可能会出现同样的问题。

因此,我们认为,既然我们决定使用数据驱动的 AI 模型,就应该找到一种用数据解决问题的方法。我更倾向于这种方法。

我是韩俊模,来自 Tomorrow。首先,您正在解决的问题是农场采摘草莓的自动化。是什么原因让您选择这个问题和这个领域?其次,您之前主要从事室内自动驾驶,例如送餐。然而,农作物通常在室外。视觉传感器可能会被灰尘覆盖,这会给长期运行带来麻烦。最后,使用大型模型,例如 VLA,需要有效地使用动作块。您认为网络延迟是否会成为一个问题?您是如何解决这些问题的?

首先,我们的最终目标是创建一个能够端到端零样本运行的单一模型。然而,在实际的农场机器人开发中,我认为必须使用激光雷达传感器。我们默认配备 3D 激光雷达。我们的目标是先创建一个能够正常工作的机器人,然后收集数据,使其在不需要激光雷达的情况下也能工作。我们正在采取一种先创建一个稳定运行的机器人,然后在此基础上进行改进的方法。

关于您提到的问题,为什么需要物理人工智能来解决农作物采摘自动化问题?

我开始这个项目是因为我想做智能农场。在智能农场自动化中,机器人可以在其中移动,搬运货物,并收获作物。只要能提高空间效率,就可以实现。在研究过程中,我发现采摘作物非常困难,也很有挑战性。例如,草莓不能用力挤压。如果只用剪刀剪断,它会掉下来吗?这些都是需要考虑的问题。

我仍然想继续做智能农场。在室内机器人开发方面,设置相对容易。此外,一旦掌握了采摘草莓的技术,就可以将其应用于所有草莓种植。然而,在装配或制造等领域,任务各不相同,自动化成本很高。在智能农场中,草莓沿着种植架生长,只需要掌握采摘技术,就可以连续地进行。因此,我认为这是一个可以成功实现的项目。环境是标准化的,我们可以控制它,并且任务也很少。

另外,使用 3D 激光雷达和 3D SLAM 会产生稀疏数据,导致 CPU 使用率高。如果使用 VLA 等大型模型,GPU 使用率会非常高。这使得在设备上运行变得困难。您对此有何看法?

我认为时间会解决这个问题。目前的进步速度非常快。无论是模型性能还是硬件性能,都在以我们无法想象的速度发展。我认为,在未来几年内,我们曾经认为不可能的事情可能会发生。硬件成本也在下降。

我认为,只要投入足够的时间进行开发,成本就会下降,或者性能会提高,使我们能够使用它们。如果成本下降,我们可以使用更多设备。如果性能提高,我们可以直接使用它们。

我是赵勇禄,在 Daekyo 担任 Web 软件工程师。我有两个问题。首先,我来自机器人技术领域之外,所以我的问题可能不够成熟。我通常认为 RAG 是为了防止 LLM 的幻觉,通过检索相似文档来增强生成。但是,您在图像示例中提到了“帮我找咖啡”。在这种使用方式下,RAG 是基于图像进行检索吗?它在哪些场景下使用?这是我的第一个问题。第二个问题是,目前 LLM 领域由资金雄厚的科技巨头主导,其他公司很难跟上。然而,在包含动作 token 的 VLA 模型中,是否有机会让资金不足的公司也能挑战创建有竞争力 的基础模型?这是我的第二个问题。

首先,在 VLA 中使用 RAG 是基于 LM 的检索。也就是说,它是在生成动作 token 之前,通过检索已有的向量数据库来生成。我所了解的是,它会执行对嵌入数据的检索,然后进行生成。我学习 VLA 的时间不长,所以可能存在错误。我不是这个领域的专家,但我正在努力学习并尝试跟上。

关于您第二个问题,关于如何在小型公司中实现。我们认为从头开始构建基础模型非常困难。在现有水平上,我们可以进行微调,或者组合现有的模型。我们不知道具体细节。对于我们这样的规模,很难从头开始构建并收集数据。因此,我们主要采取“快速跟随”的策略。

在将机器人技术应用于工业领域时,我认为谁能更好地创建应用程序比谁能创建基础模型更重要。

因此,我认为,对于像我们这样的公司来说,关键在于如何改进现有的模型,使其能够在实际环境中正常工作。了解在特定环境和任务中能够做到什么程度,并能够创建良好的应用程序,将是成功的关键。

对于像 LM 这样的 Web 应用程序服务,也是如此。关键在于创建什么样的服务和应用程序。我相信,只要认真思考这个问题,就能找到一条出路。因此,我们正在以这种想法创业。