📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

No Priors Ep. 141 | With Sunday Robotics Co-Founders Tony Zhao and Cheng Chi

No Priors: AI, Machine Learning, Tech, & Startups39:17

Transcription

没有人想洗碗。没有人想洗衣服。人们希望花更多时间与家人、与亲人在一起。所以我们相信,如果机器人便宜、安全、功能强大,每个人都会想要我们的机器人。我们设想的未来是,十年内,我们将在人们家中拥有超过 10 亿台这样的机器人。谢谢,Memo。>> 嗨,听众朋友们,欢迎回到 No Priors。今天我们请来了 Tony Zhao 和 Changi,他们是 Sunday 的联合创始人,也是 Memo 的开发者,Memo 是第一款通用家用机器人。我们将讨论人工智能和机器人技术、数据收集、构建全栈机器人公司以及一个摆脱繁重劳动的世界。欢迎,Chang。Tony,感谢你的到来。>> 感谢邀请。是的。>> 好的。首先我想问一下,我们现在处于什么位置?因为从长远来看,经典机器人学并不是一个充满巨大乐观情绪的领域,也不是一个工作速度极快的领域,而现在人们正在谈论机器人学的基础模型或 ChatGPT 的时刻。你能否介绍一下人工智能机器人学的现状以及我们为什么应该感到兴奋?我想说,我认为我们正处于 ChatGPT 时刻和悲剧时刻之间,就大型语言模型而言,这意味着我们似乎有了一个可以扩展的配方,但我们还没有进行扩展,而且我们还没有进行如此大规模的扩展,以至于我们可以从中获得一款出色的消费产品。所以这就是我的意思,比如 GPT 是一种技术,而 ChatGPT 是一种产品。是的。因此,我们在学术界看到,在操纵方法方面存在共识,但每个人都在谈论扩展。就像我们知道算法有生命迹象,人们正在选择它们,但人们不知道如果我们拥有更多数据,就像 GPT-2、GPT-3 发生的那样,会发生什么。但我们看到一个清晰的趋势,你知道,没有理由相信机器人学不会遵循其他人工智能领域的轨迹,你知道,扩展将提高完整性。>> 也许即使你退一步看,10 年前将机器人部署到世界上的过程是怎样的?比如一套可泛化的 AI 算法,为什么这个领域发展如此缓慢?>> 是的。所以以前,你知道,经典机器人学采用“感知-计划-行动”的模块化方法,人类在每个模块之间设计接口,这些接口需要为每个特定任务和每个特定环境进行设计。在学术界,这意味着对于每个任务,都有一篇论文。所以一篇论文就是你设计一个任务,设计一个环境,设计接口,然后为这个特定任务进行工程工作。但一旦你转向下一个任务,你就会丢弃所有的代码、所有的工作,然后重新开始。这在工业界也发生过。因此,对于每个应用,人们都会围绕它构建一个非常具体的软硬件系统。但它并不是真正可泛化的。因此,我们感觉自己只是在原地打转。我们构建了一个系统,然后构建了下一个系统,但它们之间没有协同作用。因此,进展一直比较缓慢。>> 我觉得这是一个很好的引子,可以谈谈你们在过去五年里为该领域做出的令人惊叹的研究工作。我们应该从扩散策略开始吗?它有什么影响?>> 是的,扩散策略是一种针对模仿学习范式的特定算法。这确实是使用机器学习进行机器人学的最直观的方式。所以你收集成对的动作和观察数据,机器人应该做什么。你用监督学习来训练模型,然后机器人做同样的事情。问题是,在这一领域,它以非常挑剔而闻名。所以当我与研究人员交谈时,当我进入这个领域时,人们说研究人员本身,特定的研究人员需要收集数据,所以一切都只有一种做法。否则,机器人要么模型训练会发散,要么机器人会表现出奇怪的行为,而扩散模型确实允许我们捕捉同一次观察的多种行为模式,同时保持训练稳定性,这确实解锁了更具可扩展性的训练和更具可扩展性的数据收集。>> 所以你不必亲自戴着头戴式显示器才能让机器人学习。>> 是的。是的。所以我们可以有多个人,有时甚至是未经培训的人收集数据,结果仍然会很好。>> Aloha 和 ACT 在这其中扮演什么角色?>> 是的,这两篇论文实际上非常接近。它们相隔大约一两个月。这实际上是我和 Chun 认识的方式。就像我们看着对方的论文,我想我们在 Twitter 上认识的,当时 Chenn 在哥伦比亚大学,在 Aloha 之前。我认为人们收集数据的方式通常是使用一个多用户全息设置,带有 VR 头显,这非常不直观,而且很难收集到真正灵巧的数据。很多大脑需要的是一个非常简单且可重现的设置,所以它非常直观。>> 抱歉,对于大多数没有戴过远程操作设置的人来说,这是延迟问题吗?还是像玩电子游戏一样?>> 是的,我认为 Aloha 让它感觉更像玩电子游戏。通常感觉有点脱节,你只是在空中移动,机器人会延迟移动。但 Aloha 大大减少了这种延迟,这有助于提高平稳性以及人类的反应速度。一旦我们获得了那些真正灵巧的数据。它使我们能够研究那些真正解决困难问题的算法。在这种情况下,是通过在机器人领域引入 Transformer。我认为机器人领域很长一段时间都停留在三层 MLP 和卷积网络上,而且越深效果越差。但事实证明,一旦你有了非常强大和灵巧的数据集,只需将 Transformer 应用于它,它就能很好地工作。>> 实际上,就行业随时间推移的进展而言,如果没有一定程度的数据收集能力,Transformer 是没有意义的。好的。>> 还有围绕它的系统,例如动作分块,即预测轨迹而不是预测单个动作样本。所有这些结合起来,使得灵巧的任务和手动任务更具可扩展性。>> 为什么分块在这里很重要?如果我想到类比到大型语言模型和文本序列预测。>> 我认为如果你试图强迫模型每毫秒做出反应,它就会让你模型失控。>> 这不是人类的行动方式。我们感知,而且我们可以在不再次查看事物的情况下移动很多。事实证明,这使得运动更加一致,整体性能也更好。>> 而且你发现 Transformer 架构实际上适用于机器人学。>> Chang,你觉得当时数据收集仍然是个问题。所以进入...>> 是的,在 Aloha 和扩散策略之后,我对模仿学习感到非常兴奋,但当时我们俩还在做远程操作,这感觉非常受限。我认为问题在于,你知道,在你当时设置的远程操作设置中,你知道,让一个博士生在实验室里设置好需要几个小时。这基本上将数据收集限制在实验室里。但为了让机器人真正作为产品工作,它需要在野外、在未见过的环境中工作,这需要数据也在野外收集。当时我在想,有没有一种方法可以在不使用机器人本身的情况下收集机器人数据?这迫使我思考,机器人数据的真正本质是什么?在扩散策略和 ACT 之后,范式有点简单,你只需要成对的观察和动作数据。在我们的例子中,观察是视频片段,动作是你手的移动,加上手指的移动。我意识到所有这些信息都可以从 GoPro 中获得。你可以跟踪 GoPro 在空间中的移动,你也可以通过图像跟踪抓取器和手指的运动。这就是为什么我当时构建了这个 3D 打印的 umi 抓取器。这个项目有三个学生。我们只是把抓取器带到各处。你知道,我认为是在论文截止日期前两周,每次去餐厅,在服务员来之前,我们都会收集一些数据。很快我们就获得了,我认为是 1500 个关于这个浓缩咖啡杯服务任务的视频片段。这实际上是机器人领域最大的数据集之一,而且只有三个人。这就是力量的闪光点。然后,有了这么多数据,就可以训练第一个能够真正泛化到未见过的环境的端到端模型。所以我们可以推动斯坦福的机器人,托尼当时也在那里,你知道,在斯坦福校园里推动机器人手臂,然后无论你在哪里,机器人都可以为你服务一杯饮料。是的,我认为那一刻我当时想,“嘿,我们应该开一家公司。这实际上效果非常好。”我记得当时我跟着 Chong,有时候效果并不好。>> 是的。>> 我记得唯一一次例外是,当它在阳光直射下时,对吧?我认为原因在于,在那整个两三周的数据收集过程中,那两周一直在下雨,所以没有阳光数据。所以它会失败。这也证明了分布匹配的重要性。因此,为了让机器人在阳光明媚的环境中工作,它必须在训练数据中见过阳光明媚的环境。>> 是的。这真的很有趣,因为我记得第一次见到你们的时候,你们花了,我不知道,总共 20 万美元用于所有的学术研究,但数据收集的规模转化为模型能力是领先的。所以,这很有趣,你知道,我们看看我们可能要去哪里,回到托尼关于规模和巨额资本部署的观点,但整个范式实际上在人们意识到“你应该在互联网数据上进行训练”之前是不相关的,而我们在机器人领域还没有。因此,整个领域都被阻碍了,无法获得任何相关的规模化数据。>> 是的。>> 我认为这些天有很多关于如何正确扩展的辩论。有角色模型,有模拟,有远程操作,还有所有这些新想法。我认为这是我们真正想要创新、想要区分、想要找出既高质量又可扩展的领域。>> 然后你们决定开一家公司,在斯坦福推着这个推车,给我讲讲那个决定,祝贺你们的发布以及你们建立的团队。>> 是的,这是一段非常有趣的旅程。我记得一开始,其实是我们两个人,在 Chun 的公寓里,在他的桌子上。我们把一个机器人夹在那里,尝试做一些任务,很快就变成了,我认为到 2024 年底是八人团队,现在我们大约有 30 到 40 人。我们不是在所有事情上都做得最好,对吧?但创办一家公司使我们能够找到我们真正喜欢一起工作的人,然后汇集机械工程、供应链、软件工程、控制等方面的所有专业知识,共同构建一个系统,而不是一个演示,而是一个真正的产品。>> 你建立了一个很棒的团队。人们实际上在注册什么?Sunday 的使命是什么?>> 是的,就是把家用机器人送到每个人的家里。我认为有很多人工智能试图让你在工作时更有效率。但没有足够的人工智能真正帮助你处理所有这些平凡的事情,这些事情不是创造性的,与我们内在的人性无关。人们理想中应该花更多时间的事情是他们的爱好、他们的热情,而不是花更多时间做家务。所以,如果你从这些令人惊叹的研究突破走向实际发货家用机器人,你知道,这是一个产品,你必须谈论成本、能力和鲁棒性,设计理念是什么?>> 随着这些人工智能模型变得越来越强大,硬件成本持续下降,家用机器人或各种机器人将无处不在。所以,如果我们从最表面的设计开始。当我们设计它时,我们会考虑如果机器人无处不在,它应该是什么样子。你应该每天都看到它。它应该是什么样子?我们最终认为机器人应该有一个面孔。它应该有一个可爱的面孔,而且它应该非常友好。所以,而不是像终结者那样洗碗,我们希望机器人感觉就像来自卡通电影。然后一个巨大的决定是机器人应该有多少只手臂?它应该有四只手臂吗?它应该有一只手臂吗?它应该有腿吗?它应该有五个手指,两个手指,三个手指吗?这是一个巨大的空间。>> 为什么显而易见的答案不是它应该像一个完整的人?>> 我认为我们的核心动机是如何尽快构建一个有用的机器人。所以,每当我们看到可以简化加速的事情时,我们就会简化它。一个例子是,我们设计的手有三根手指。我们将三根手指结合在一起。这样做的原因是,大多数时候我们使用这些手指时,我们是同时使用它们。无论是抓握把手,还是打开洗碗机。>> 所以,如果我们可以用一个具有大部分好处的装置来完成,就没有理由增加三倍的成本来将其分成三个。这就是我们看待整个机器人的方式。它有点受到我们正在构建一个通用机器人,最终可以完成你所有家务的限制,我们将简化我们能做的一切,以便机器人尽可能低成本且易于维修。>> 是的,我想补充一点关于 ACT 和机械设计。传统上,大多数机器人都是为工业用例设计的。>> 机器人非常快,非常坚硬,非常精确。原因是所有工业机器人都是盲目的。所以它们盲目地遵循一个人编程的轨迹。>> 它不是对感知的反应。>> 正确的。正确的。但由于我们在人工智能方面的突破,现在机器人有了眼睛。所以它实际上可以纠正自己的机械和硬件不准确之处。>> 所以这开启了一个新的设计空间。>> 直观地说,应该是这样的:我无法以毫米级的精度告诉你这里的确切距离,但我会拿到杯子,因为我可以停下来。>> 是的。正是如此。这使得我们可以使用这些低成本的执行器,它们便宜、柔顺,但又不精确。但由于我们构建的人工智能算法和系统,它允许构建一个在机械上本质上安全且柔顺的机器人,同时能够达到我们对家庭任务所需的足够精度。>> 我们在那个时间线上处于什么位置?你说我们介于 GPT 和 ChatGPT 之间。>> 是的。这是一个非常激动人心的时刻,因为我们内部有太多的原型。我们明年(2026 年)要做的是开始进行 Beta 测试。我们将把这些机器人,各种不同的机器人,放到人们的家中,看看他们的反应。那时我们将学到最多关于人们如何与机器人交谈。人们是否希望机器人教他们的孩子一些关于世界的新知识?这将为我们最终的产品应该是什么样子提供信息。在内部,我们对我们想要发布的最低限度的消费产品有一个极高的标准。它必须极其安全。它必须极其强大且成本低廉。>> 你觉得现在你知道一些公司刚开始时不知道的事情吗?>> 当然。所以,我认为一开始我会这样描述:我们看到了隧道尽头的曙光,有两条轴线。一条是灵巧性,另一条是实现性。当我们添加更多数据时,事情会变得更好。这家公司就是这两者的交叉。我们如何扩展并同时拥有灵巧性和泛化性?这是我们在泛化演示中能够展示的,即我们可以以非常高的成功率拾取这些非常精确的叉子,比如真正的金属叉子,放在陶瓷盘子上。老实说,这并不是我们认为仅通过拥有更多数据就能如此轻松地实现的事情。>> 是的。所以实际上我想稍微扩展一下,你知道,这个过程漫长而痛苦。所以,是的,有很多问题,比如扩展一个机器人系统非常非常困难。有机械问题,比如可靠性问题。有数据质量问题。一开始,我actually 认为会比这容易得多,[笑声] 但确实需要时间和精力来打磨所有细节才能使其正常工作。我也确实发现,与远程操作相比,扩展这个系统要困难得多,但一旦扩展起来,它就非常强大,非常可重复。>> 所以,要达到这里比你想象的要困难,而且你比你想象的要走得更远。>> 是的。>> 是的。我记得一开始我们有一个有趣的对话,我们说,如果我们建造了这个,有人可以拿走我们的手套,他们就会建造同样的东西,我们有什么优势?我们会担心吗?我认为一开始我们确实有点担心,因为我们想,哦,你知道,他们可能只是复制它,但随着我们前进,事实证明事情比我们想象的要困难得多。有太多的小细节。>> 是的。是的。>> 是的。当你说的扩展机器人系统时,你指的是数据收集到训练管道以及硬件本身。>> 是的。所以,实际上,为了让这一切正常工作,你需要数据收集系统。是的。你需要机器人和控制系统能够将手送到我们想要去的地方,你还需要数据过滤管道和数据清理管道以及训练管道,所有这些都需要一起迭代。所以我们实际上已经经历了几个这样的循环。如果没有一个全栈团队在内部,很难想象这甚至是如何完成的。>> 是的。我们现在使用的手套我们称之为 V5。>> 从 V0 到 V5,每个版本大约有 20 次迭代。>> 好的。[清嗓子]>> 和>> 100 次。>> 是的。>> 是的。>> 嗯,而且当你大规模生产它们时,现在有超过 500 人在野外使用这些手套。所有可能出错的事情都会出错。例如,它们确实>> 它们确实。是的。例如,组装方式。如果你没有精确说明如何做,人们会以创造性的方式组装。而创造力在这里对我们没有帮助,因为我们真的希望数据收集设备极其精确。所以你们显然不可能知道公司和学术界、工业界发生的所有事情,但根据你们所知,你们如何比较今天拥有的训练数据规模与行业相比?>> 目前我们已经收集了近 1000 万个轨迹,这些轨迹不仅仅是“拿起一个杯子”,而是包含行走、导航以及执行这些长时程任务的轨迹。>> Tony,正如你所提到的,如何正确地扩展数据实际上是一个悬而未决的问题。所以有一些强烈的理论围绕着远程操作、纯强化学习、视频和世界模型。你对这些有什么看法?>> 是的。从我们的角度来看,这有点令人惊讶。所以一开始我们担心,你知道,来自手套的数据或来自远程操作的数据,它的数量更多,但质量比远程操作低,因为对于远程操作,你在训练和测试之间使用完全相同的硬件和软件堆栈,分布匹配完美。>> 但我们意识到,实际上,你知道,这种手套的形态鼓励人们进行更灵巧、更自然的运动,而这些实际上导致了模型方面更智能的行为。在数据质量方面,我们并没有真正看到在远程操作和手套数据之间存在差距。>> 在我们进行了 20 次工程迭代后,360 度。>> 是的。>> 是的。>> 是的,因为显然存在不匹配,对吧?在摄像机帧中,有一个人而不是机器人,还有很多事情需要我们做,才能将人类数据一对一地转换为机器人数据,并让模型无法区分。是的,这再次依赖于硬件和软件之间的整个周期迭代。>> RL 呢?我们看到 RL 在运动控制方面有很大的前景,而且我们认为对于运动控制来说,这种情况将继续下去。>> 是的。所以我们看到的 RL 作为一种方法非常强大,但它比模仿学习的样本效率低得多,而且我们看到它在易于模拟的环境中效果很好。对于运动控制来说,你只需要担心刚体动力学以及机器人与地面之间的刚体接触。>> 是的。>> 而且,你知道,因为你设计了一个机器人,你了解一切。>> 是的。>> 但对于操纵来说,很难想象实际上存在与真实物体相同的多样性和分布,在外观和物理特性方面都能匹配。我们认为,与手套数据收集和远程操作相比,这将是一个挑战。>> 是的,我认为关键在于哪种方法能更快地让我们到达那里。可能有不同的方法最终会让我们到达那里。例如,你知道模拟世界模型,对吧?而且,如果你有一个完美的世界模拟器,在那里可以做任何事情,这几乎是显而易见的。只要你能在现实世界中做到,你就可以在模拟器中做到,你就可以在模拟器中治愈癌症,对吧?但对于机器人来说,事实证明,有些事情比其他事情更难,这真的取决于问题本身。所以,在运动控制的情况下,正如我提到的,我们在模拟器中需要建模的只是点接触和某种程度的平坦地面。>> 比如脚。>> 是的。>> 但我们希望从中获得的这种行为实际上非常难以建模。>> 就像所有这些反应性行为一样,当你感觉到你的腿撞到了什么东西,你应该收回并再次迈步。>> 这些很难描述或直接从演示中学习。但在操纵的情况下,我认为难度是颠倒的,捕捉行为本身要容易得多,而模拟世界要困难得多。>> 例如,如果你要用一只手抓住一个装着橙汁的透明杯子,模拟你的手如何变形,以及那些涟漪如何,果汁的颜色如何导致渲染,以及策略最终看到什么,这是极其困难的。模拟它非常昂贵且困难。但我们只需要学会的是将你的手放在杯子前面,然后以适当的力关闭。这实际上很容易学会。这就是为什么我们在机器人操纵领域看到模仿学习如此成功,因为行为本身并不像模拟世界那么难,这就是为什么我们在那里看到更快的进展。在过去一年里,你对数据有什么看法上的改变吗?>> 我不会说改变了,只是数据质量真的非常重要。我认为我们知道,我一直知道数据质量很重要,但一旦你扩大规模,它就真的变得很重要。而且,你知道,就像你在野外体验到的行为多样性很难控制,硬件故障也很难控制。你需要不断监控它们。你只需要花费大量的工程精力来确保数据是干净的。>> 是的。而且还要构建所有这些自动化流程,对吧?我们在发货手套之前有自己的校准方式,我们有一个完整的软件系统来捕捉手套上的东西是否坏了,我们可以自动检测到。数据质量的重要性转化为所有这些可重复的流程,我们不需要人类盯着数据就知道有问题。当你描述明年的 Beta 测试时,很多听起来像是,你知道,我们只是想了解行为,人们实际上想如何使用它。我们可以为实际产品做出一些设计决策。你仍然看到哪些技术挑战?>> 对我来说,我认为有两种。第一种是真正弄清楚大规模的训练配方。我们作为一个领域刚刚进入规模化的领域,我们刚刚获得了所需的数据量。我认为现在是开始研究并找出我们需要的确切训练配方,以真正获得鲁棒行为的完美时机。而且我认为,你知道,我们处于一个独特的位置,因为我们拥有数据量和围绕数据构建的整个管道。第二点是硬件确实很难。我们仍在不断突破硬件的性能极限。实际上并不清楚需要什么,需要什么,需要什么才能使硬件可靠,因为每当机械团队构建硬件时,学习团队就会尝试更努力地将其推向极限,然后它会在某个点断裂。但我认为这家公司有趣之处在于,每个人都在同一个屋檐下。所以一旦有什么东西坏了,它就会立即回到机械设计中,然后我们会有另一个迭代,比如手部零件,非常快。硬件很难,但它很重要,我认为,你知道,这是正确的事情,我们作为一个领域不应该因为困难而回避做困难的事情。>> 是的,我想呼应 Chan 关于研究的观点。我认为当数据稀缺时,很容易想出一些可爱花哨的研究想法,但最终效果并不理想。这就是为什么当我们建立一家公司时,我们实际上在开始真正深入研究之前,就专注于基础设施、可扩展的数据管道和运营。我们直到三个月前才开始真正深入研究。我认为我们真的想避免做无法扩展的研究,并专注于有助于最终产品的方面。第二点是,我认为机器人学本质上是一个系统,目前我们没有,没有现成的通用家用机器人,我们也不知道不同系统的接口是什么样的,什么才是好的。在这种情况下,如果你与合作伙伴合作,他们很难理解你的“好”的标准,因为你的“好”的标准正在改变。>> 这就是为什么我们自己构建一切,采用更全栈的方法,我们自己构建数据收集设备,该设备与机器人协同设计。我们自己构建运营团队,以了解如何最有效地获取最高质量的数据,当然还有我们自己的人工智能训练团队,他们能最好地利用这些数据。我认为这些事情确实不容易。这使得公司很难建立。你突然需要这么多团队,而且他们需要协同工作,但我们相信这是正确的事情。>> 好的。我现在要问你一些可能令人不适的猜测,但人们何时能商业化购买家用机器人?>> 这是我们非常兴奋的事情,因为我们在办公室里有很多原型机器人,我们真的想把它们推向市场。所以我们下一步的计划是在 2026 年进行 Beta 增长计划。这意味着,对于那些我们选择的注册用户,他们将在家中拥有一个真正的机器人,它将开始为你做家务。这将是我们一个非常有趣的学习过程,因为我们将看到人类如何与机器人互动。我们将看到人们真正希望机器人做什么。我认为这将在我们实际向大众发货之前。因为我们对消费者体验的标准非常高。我们希望机器人高度可靠。我们希望它功能强大。我们希望它便宜。我认为这取决于 Beta 测试的结果,这将决定何时是发货的好时机。是 2027 年?是 28 年?但所有这些都是可能的。>> 但不是十年后。不,绝对不是那么久。>> 你认为它可能要多少钱?>> 目前,我们在内部的原型机器人,我认为成本从大约 6000 美元到大约 20000 美元不等。这实际上很有趣,这里的巨大差异不是“哦,我们找到了一个更好的执行器”。它们使用的是相同的低成本执行器,但实际上是机器人的外壳。当你试图小批量生产它们时,成本非常高。外壳的制作成本就几千美元。但随着我们扩大规模,这些东西就会变得非常便宜。因为而不是使用 CNC 加工,而不是手工喷漆,它将变成注塑成型。我们看到的是,当我们达到数千台的规模时,我们可以大幅降低材料成本,可能低于 1 万美元。这意味着当我们销售机器人时,价格将在那个范围内。>> 好的。所以,你快进了 2 到 3 年。如果你看看 5 年及以后,家用机器人无处不在。生活看起来是怎样的?它如何改变普通人的生活?>> 这对每个人来说答案都不同。对我来说,我真的很讨厌洗碗。>> 是的。>> 在我的水槽里总是有四五个有点脏的盘子,有点发臭。在漫长的一天工作之后,看到这样的家感觉不好。>> 所以我认为我们将生活在一个>> 它将变得更清洁。>> 似乎更清洁了,我只是把它看作是家庭劳动力的边际成本趋于零。>> 我们要确保做的最后一件事是谈论演示,对吧?>> 是的。>> 今天有很多机器人发布视频。自从你们看到一个机器人服务员在酒吧里端饮料已经过去很多年了。为什么那些不可用?到底是什么难?>> 是的。>> 我>> 我认为我会这样说:不做任何假设。没有先入为主的观念。>> 好的。>> 也就是说,如果你看到一个机器人递给一个人一杯饮料,首先问的问题是它是自主的还是远程操作的?这是第一件事。所以我们应该看看推文,看看他们对此说了什么。然后,它是否展示了给同一个人递送另一杯不同颜色的杯子?如果他们没有展示,这意味着机器人只能拿起那个杯子递给同一个人。当我们看演示时,我们倾向于将人类的直觉带入其中,就像,哦,如果你能把杯子递给那个人,它一定也能把另一个杯子递给另一个人。也许你也能洗我的碗。也许你能洗衣服。有很多视觉化的思考,这正是机器人学的伟大之处,有很多想象力,但我认为当我们看演示时,我们只关注那些强大的东西,而且很可能就是那个任务的全部范围。我认为另一个方面是,至少作为一名研究人员,我欣赏演示中发生的交互次数。通常交互次数越多,每次交互都有失败的可能性。所以序列越长,实际上就越难。所以这是我们在这里真正强调的。而且,由于手套的数据收集方式对人们来说非常直观,所以这实际上对我们来说相对容易。是的,这真的关乎泛化和可靠性。>> 那么你能解释一下你们正在展示的演示吗?>> 是的,当然。所以我们基本上展示了三类演示。第一个,正如你所看到的,我们有一个非常混乱的桌子,机器人所做的是清理整个桌子,你知道,把食物扔进食物垃圾桶,把盘子放进洗碗机,然后操作洗碗机。这个演示之所以非常困难,是因为它混合了非常精细的操纵和这些超长时程的全范围任务,也就是说,你需要向上移动,也需要向下移动很多。>> 它是移动操纵。正是如此。我们可以展示这个的原因仅仅在于我们收集这些数据集的灵活性和简便性,使得长时程的灵巧演示成为可能。这也关乎力。所以你可能看到我们试图用一只手拿起两个酒杯。>> 我也挣扎于此,但>> 这实际上非常困难。而且因为它是透明物体,我们需要非常精确地将它们放入洗碗机。很多都关乎你施加多少力。>> 嗯,因为如果你试图用一只手抓住两个,如果你捏得稍微用力一点,你就会打破其中一个玻璃杯。当你把它放进洗碗机时,如果你推错方向,撞到什么东西,它就会碎裂。我们在试验时确实打碎了很多玻璃杯。所以这些任务的风险非常高,不仅仅是恢复错误,而是要避免首先犯这些错误。而这通常是家庭任务中的情况,你根本不允许犯任何错误。然后我们进入泛化演示,我们基本上展示了我们的机器人。我们预订了六个不同的家庭,并且零样本进入>> 看看它是否能完成部分任务。我们使用的方法有两种。一种是我绕着桌子走,把所有的餐具都收集到餐具架里。另一种是拿起一个盘子,然后把它放进洗碗机。这些演示之所以非常有趣,是因为我们进入那个家时不需要任何数据。这是纯粹的泛化。这几乎是接近实际产品的程度了,因为当有人购买我们的家用机器人时,我们真的不希望他们自己收集一套巨大的数据来开箱。此外,除了泛化之外,这两项任务也非常精确。我们使用的是家里的确切银器,你需要基本上是几毫米的精度才能正确抓握。这些力也很难感知,因为它们是反光的,光线在上面看起来很奇怪。我们有一个透明的玻璃桌的家。我认为这张桌子看起来什么都没有,但机器人仍然反应很好。而且,原因是我们有超过 500 个人,我们在那个数据集中看到了如此多的玻璃桌。所以机器人能够做到。我认为我们做的最后一项任务在灵巧性方面有点挑战极限。我们选择的两项任务是操作浓缩咖啡机,另一项是折叠袜子。>> 嗯。>> 使这些任务困难的原因是它们需要非常精细的力,如果通过远程操作来完成,则很难获得,因为如今没有一个好的远程操作系统可以让你感受到机器人感受到的力。所以基本上,当你远程操作时,你的手是麻木的。>> 有时你对机器人施加了巨大的力,但你不知道,这可能导致数据质量非常低,机器人也以那种激进的方式行事,我们真的想避免在我们的系统中出现这种情况。>> 袜子是一个很好的例子,当你试图折叠它时,你的两根手指可能会碰到。>> 这形成了一个我们称之为“力闭合”的东西。你有一个闭环的力,如果你的机器人很僵硬,你可以施加无限的力,它看起来什么都没有,但对我们来说,因为我们使用手套收集数据,收集者可以自然地感受到它,这是非常直观的。我认为我们是第一个完成袜子折叠并使用端到端方法完成浓缩咖啡机任务的。>> 你们在扩大公司规模时,还需要扩展的是团队。>> 是的。>> 你在招聘什么?你在寻找什么?>> 我真的很期待的一件事是>> 谢谢。>> 是的,是的,是全栈机器人工程师,以及有志成为全栈机器人工程师的人。是的,你在这家公司学到的东西就是机器人学是一个多学科的领域。你需要了解一点机械、一点电气、一点代码、一点数据,才能真正优化整个系统。我们有一些例子,比如培训全职软件工程师成为机器人工程师,培训机械工程师成为机器人工程师。所以,如果你想学习机器人学,继续前进,你想学习整个东西,而不是被限制在你自己的小隔间里,让我们知道。>> 是的,你告诉我你直到上大学才写代码,或者类似的话。>> 是的。>> 我对机器人学非常热情,但在此之前我主要从事机械和电气设计。然后我意识到瓶颈实际上是机器人如何移动,而且有一个叫做编程的东西,我越深入研究,它就越深。然后,你知道,在大学快结束时,我意识到有一个叫做机器学习的东西,你学会了如何训练模型。我认为事情会不断发展,对我来说,逐渐扩展我的技能集是很自然的,因为我总是渴望制造机器人。>> 嗯,我希望你发现下一个领域,这样你就不用再洗碗了。>> 是的。>> 这是一个非常有趣的工作场所。无论你对机器人学、消费品和机器学习有什么想象,你都可以在这里找到,因为我们本质上是一家全栈公司。我们不仅仅是软件,我们不仅仅是硬件,而是关于整个体验,整个产品,并确保该产品在未来是通用的和可扩展的。>> 太棒了。恭喜。>> 真的很令人兴奋。在 Twitter 上关注我们 @no_prior_pod。如果你想看我们的脸,请订阅我们的 YouTube 频道。在 Apple Podcasts、Spotify 或任何你收听播客的地方关注我们的节目。这样你每周都会收到新一集。在 no-flyers.com 注册电子邮件或查找每集节目的文字记录。