📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

S3 E20 Jitendra Malik on Building AI from the ground up: Sensorimotor learning before language

The Robot Brains Podcast1:31:33

Transcription

[音乐] 我们今天的嘉宾是伯克利大学教授、兼职研究科学家、Meta公司总监 Jitendra Malik。Jitendra 在计算机视觉研究领域处于领先地位已有数十年。他指导过 70 多名博士生和博士后,其中许多人已进入顶尖的行业研究实验室,并成为麻省理工学院、伯克利大学、卡内基梅隆大学、加州理工学院、康奈尔大学等知名学府的教授。Jitendra 的著作被引用超过 20 万次,使他成为所有工程学科中最受引用的研究人员之一。值得注意的是,他曾于 2007 年和 2008 年获得 Longuet-Higgins 奖,并于 2015 年两次获得 Helmholtz 奖,以表彰其经受住时间考验的贡献,这些奖项颁发给发表十年后的论文。他已当选为美国国家工程院院士、美国国家科学院院士以及美国文理科学院院士。在我个人对计算机视觉的外部采访中,我一直认为 Jitendra 是计算机视觉界的旗手,这既是因为他广泛的算法贡献,也是因为他将计算机视觉打造成了一个更具基准驱动力的学科,极大地加速了整个领域的发展。最近,Jitendra 已将注意力转向实现更类人智能的问题,在此过程中,机器人研究已变得至关重要,这当然让我特别兴奋。很高兴您能加入我们,欢迎来到节目。谢谢 Peter,很高兴来到这里,我期待着我们的谈话。我真的很期待与您交谈,Jitendra。但在我们深入今天的谈话之前,我想感谢我们的播客赞助商 Index Ventures 和 Weights & Biases。Index Ventures 是一家风险投资公司,投资于各个阶段的杰出企业家,从种子轮到 IPO,在旧金山、纽约和伦敦设有办事处。该公司支持 AI、SaaS、金融科技、安全、游戏和消费品等多个垂直领域的创始人。就我个人而言,Index 是 Covariant 的投资者,我无法对其给予更高评价。Weights & Biases 是一个 ML Ops 平台,可帮助您更快地训练出更好的模型,提供实验跟踪、模型和数据集版本控制以及模型管理。OpenAI、Nvidia 以及几乎所有发布大型模型的实验室都在使用它。事实上,我在伯克利的学生和 Covariant 的同事们,很多(如果不是全部)都是 Weights & Biases 的重度用户。Jitendra,让我们开始我们的谈话吧。ChatGPT 和其他大型语言模型目前非常热门,当然,我们为伯克利毕业生 John Schulman 在 OpenAI 的这些努力中发挥了核心作用而感到自豪。但尽管有这些兴奋之处,在您最近的演讲中,您已经非常清楚地表明,今天的人工智能与人类智能相比仍然非常非常有限。您能多谈谈您的想法吗?Peter,对我来说,这是人工智能界一部分人至少已经知道一段时间的事情,称为 Moravec 的悖论。我们可以将其与整个智能的历史联系起来。如果我们把智能看作是通过进化产生的生物构造,那么可以追溯到大约 5.5 亿年前,当我们有了第一批能够移动的动物,然后它们能够看到。看到对于移动很重要,因为这是了解去哪里寻找食物等的方式。然后,比如说,在过去的七百万年里,我们有了四足动物从其他灵长类动物进化而来。有非常好的进化数据来自化石,那就是大脑的进化跟随了手的进化,拥有可对握的拇指。这在我们成为双足动物之后,我们开始用两条腿走路,手就自由了,可以制造工具和操纵物体。然后,可对握的拇指帮助了我们。然后,当然,工具制造使人类相对于其他物种获得了优势,尽管它们本身与许多其他动物相比相当小且脆弱。然后,当然,我们有了语言的出现。粗略计算一下,如果我们将所有进化历史看作是 24 小时,那么语言就是最后两三分钟。语言、符号思维以及我们与复杂推理相关的许多事物。从某种意义上说,GPT-4 在法律考试或各种测试中能达到 90% 的水平,这是令人难以置信的。从公众的角度来看,这是伟大智能的标志。我想将这一点与 20 年前人工智能的成就联系起来,当时我们有了第一个能够击败人类下棋的程序,我想那是在 90 年代末。然后,当然,我们有了 DeepMind 的工作,他们展示了他们的程序可以击败人类下围棋。这些都是非凡的。对公众来说,在这些游戏中的表现是智能的终极成就,而且这是非凡的。我并不是想贬低这项成就,但对我来说,所有在达到这种成就水平之前的东西都同样重要。这包括基本的感官运动能力,看的能力,移动的能力,操纵物体能力,计划能力等等。这就是我的看法,我认为,直到我们征服了智能的所有这些方面,我们才算真正征服了智能。

我有很多后续问题,Jitendra。首先,您说了一些让我印象深刻的话:大脑的发展跟随了手的发育。当您谈论大脑的发育时,这是什么意思?我们作为物种的头骨变大了吗?出现了具有不同能力的新区域吗?到底发生了什么?这里的化石数据是关于头骨大小和手的。我们有化石,人们已经发现了与手部结构相对应的化石。在化石记录中,我们可以对此有所了解,并且可以了解大脑所在的头部腔体的体积。因此,我们可以利用这些来连接大脑内部的软组织,这些软组织在这些化石中从未保存过。所以,我们能够回答一些非常具体的问题,但不能回答另一些。但实际上,这可以追溯到古希腊哲学,即我们之所以聪明,是因为我们能够操纵物体,还是因为我们能够操纵物体,所以我们变得聪明了?我喜欢古希腊哲学家 Anakagoras 的一句话:“正是因为他的手,人类才成为所有动物中最聪明的。”所以我认为这可能是一场辩论。但根据化石证据,我们实际上知道顺序。似乎遵循了这样的顺序:手的发育在某种程度上导致了大脑的发育,因为你拥有更大的大脑可以利用它。

现在我回想起来,在早期,您认为人类的生活在许多方面不像今天这样复杂。需要应对的事情少得多。据我所知,您的意思是,您首先想看看我们是否能够开发出能够做这些事情的智能,它是否具有追逐其他动物、躲避其他动物、在野外寻找东西、帮助其他人做事的基本能力。而这显然是今天所缺乏的。我很好奇,您认为这样做也会让语言模型变得更好吗?如果有了物理交互能力的基础,语言模型会变得更健壮、更不易出错吗?这是一个很棒的问题,在某种程度上,这是一个实验性问题,随着时间的推移,我们的领域将能够回答。但让我告诉你我的偏见。如果我们以生命发展来看,也就是孩子的生命,那么孩子早期阶段非常注重感官运动。孩子在玩弄物体,学习爬行,然后学习走路。当然,父母或照顾者也会为孩子提供语言输入。但这种语言输入是非常具体的。母亲可能会说“给我球”,并且有一个非常清晰的物体在前面,孩子知道那是球。然后“给”这个词在行动方面有非常清晰的含义和指代。早期孩子获得的词汇非常具体,基于感官运动经验。词“球”会唤起视觉印象,也会唤起运动印象。我看到一个球,我想扔它。这就是吉布森所说的“可供性”。椅子,椅子作为视觉想象,椅子,它告诉我如何坐下。有一种运动动作。孩子词汇中的早期词汇就是这样的。然后孩子会获得这些词汇,他们会获得主语-动词-宾语的组合等等。这是语言的开始,然后它变得更加复杂。后来,孩子去上学,开始读书。在书中,有所有这些美丽的句子和课文,还有像正义、和平、公平这样的词。事实上,许多这些词的含义是在上下文中获得的。我不一定对公平有一个即时的视觉画面,但我确实有这个概念,它与其他概念相关。我们在这个阶段进行的学习,我们不会去查字典里的单个词的意思。我们阅读,并通过上下文获得意义。这非常接近于 GPT-3 和 GPT-4 等语言模型内部发生的事情。有一个词被删除了,你试图从上下文中预测它。我认为这个过程非常接近于人类在学校和一生中阅读书籍时获取知识的过程。

但是,有那个早期阶段,对吧?那个阶段非常直接地具体化。对于一个成年人来说,也许他们 80% 的词汇是通过这些词获得的,这些词的含义是在上下文中捕捉到的。但我认为那 20% 是先出现的,而且也非常重要。我认为,要实现智能的全面发展,我们需要做的是捕捉到这一点。而没有具体化的语言模型将错过这一方面。现在,我不认为这是一个根本性的缺陷,因为很明显,现在有模型,人们正在开发这些模型,它们是视觉和语言的。您有这些多模态模型等等。这些模型来自谷歌和 Meta 等地方。我认为这是正确的方向。但在我看来,所有这些都需要存在。

几乎是研究头脑风暴。它们可能以任何顺序出现。也许在人类身上,具体化首先出现,基本的具体词汇首先出现。我们看到一些正在发生的研究是,人们只是采用大型语言模型,并希望稍后将其与具体化联系起来。这对人类来说可能不实用,而且人类的学习顺序很清楚。但也许有可能,我很好奇您的看法,是否可以构建这样的人工智能,先是语言模型,然后是具体化?或者您坚信应该先具体化,然后扩展?是的,我没有确凿的科学证据。这是一个信念和判断的问题。我属于“先具体化”学派,但我愿意被证明是错的。我认为它是这样的。让我给出一个稍微推测性的证据来支持我的信念,那就是许多语言中的词是通过隐喻演变而来的。我们谈论“成功阶梯”,对吧?我们谈论使用空间时间世界,物体运动的世界,代理人运动,代理人引起某事发生,对物体造成影响等等。这非常符合语言的核心。乔治·莱科夫,一位伯克利语言学家,他写过关于这个主题的书,强调了隐喻对语言的重要性。他这样做基本上是为了反驳乔姆斯基,乔姆斯基有一种更形式化的语法方法。语言在使用中是通过这种梯子般的隐喻建立起来的。从这个意义上说,这对我来说可能更容易以这种方式构建语言。当然,我们也知道我们可以构建技能,而无需语言。因为乌鸦有智能行为,大猩猩和黑猩猩也有智能行为。所以,运动技能的发展,开门把手的能力,将销钉插入孔的能力,穿针的能力,这些根本上不需要语言。因此,纯粹从科学角度来看,其发展应该在不需要语言层的情况下进行。但时间会证明一切。我正在用我的科学职业生涯来打赌,物理智能优先,然后是语言。但我们都应该尝试我们最喜欢的方法,然后我们就会知道什么有效。

这确实引起了我的共鸣,但我也愿意对冲我的赌注,就像您一样。目前还不排除其他可能性。您最近的一次演讲中提到,我们面临的重大挑战,或者至少是人工智能领域面临的许多重大挑战,基本上是孩子在五岁之前学会掌握的东西。您能多谈谈吗?是的,当然。这些基本上是感官运动协调的挑战。也就是说,孩子操纵物体、拿起物体、识别物体、扔球、组装乐高积木的能力。所有这些都不容易。我们认为它们很容易,因为作为成年人,我们可以轻松地做到。但如果您观察两三岁的孩子,您会发现他们必须进行大量的练习才能做到这一点。事实证明,有这方面的数据,因为我们在心理学领域的同事正在研究孩子如何获得这些能力。例如,纽约大学的 Karen Adolf 研究了孩子如何学习走路。她以一种尽可能生态有效的方式进行,在更自然的环境中观察孩子。然后发现他们摔了很多跤。这是学习走路过程的一部分。他们摔了很多跤,但不会伤得很重,因为他们的身体很柔软,有很多脂肪,相对较矮,所以重心不高,摔倒的幅度也不大。他们只是站起来,再次尝试。她分享了关于摔倒次数的数字,相当多。同样,操纵物体的尝试。孩子们似乎只是在尝试做他们感兴趣的各种活动,并获得这些技能。我几乎认为您提到的五岁年龄是由此设定的。因为如果你不能握住铅笔并操纵它,你就不能送孩子去学校学习写字。因此,精细运动控制必须达到一定的阈值水平,然后你才让孩子接受学习写字的纪律。所以,事实上,你选择的五岁阈值实际上与获得某些专业知识有关。当然,这不仅仅是感官运动,还有社交专业知识。孩子们学会了构建其他代理人的模型,他们的照顾者,其他孩子。他们学会了,他们发现他们有目标,他们学会了如何进行相互注意。因此,到五岁时,已经获得了许多复杂的技能。

这里有一点真的引起了我的共鸣,Jitendra,正如您所说,孩子们经常摔倒。对他们来说,学习东西确实需要很长时间,对吧?您知道,我最近才成为一名父亲。人们会问我,有什么能启发您的研究吗?我的主要回答是,我认为我们没有给我们的强化学习代理人足够的试运行。因为,正如您所说,这些看似简单的任务实际上需要很长时间才能掌握,而我们在给代理人试运行的次数方面可能过于不耐烦,以至于它们无法掌握这些基础技能,然后才能在此基础上构建其他东西。

现在,您的研究发生了很大的变化,而且是持续的。我想稍后谈谈计算机视觉,因为这是您直到最近大部分时间所花费的领域。但现在您花了很多时间在机器人、机器人学习上。您现在在做什么?您最兴奋的是什么?我最感兴趣的高层次问题是我称之为“技能获取”。我使用“技能”这个词作为某种感官运动行为。让我举例说明。走路是一项技能。四肢爬行是一项技能。在手中旋转物体是一项技能。扔球是一项技能。接球是一项技能。切苹果是一项技能。所以,这些是……技能包括感官方面,例如视觉的使用,也包括触觉,本体感觉。所有这些对于驱动行动都很重要。然后会发生一些物理转变,物体的状态会改变,或者物体被切开,等等。所以,对我来说,这就是我如何思考或如何看待一个核心问题。我认为我们有一些原子技能,然后我们将它们组合起来产生更复杂的技能,然后是更复杂的技能,等等。作为成年人,我们有一种这种包装在我们身上的东西。因此,现在我们可以学习一项相当复杂的任务。假设您被一家公司聘为洗衣机维修工。您必须学习一些具体的东西,但您从一套所有人类都拥有的基本技能开始。或者另一个例子可能是开车。像 16 岁的青少年一样,您学会了开车。您在 10 到 15 到 20 小时的驾驶中学会了开车。但这真的……这隐藏了很多东西,因为它建立在您在 0 到 60 岁之间获得的技能之上。所以,这是高层次的事情。这就是我的研究议程。我认为这是关于如何获取技能。然后,当然,我们可以将其视为一个元问题,即我想为机器人获取特定的技能,然后我想要一种方法,这样我就可以更快、更有效地获取下一个技能。在我们的团队中,我们首先关注的是走路,原因如下。首先,走路是每个人都能做到的事情。走路用两条腿走路,用四条腿走路,这两种问题都很有趣。它在生物学中很常见,因为它与运动有关,而运动很重要。而且这个问题在机器人领域已经研究了几十年了。例如,波士顿动力公司的视频有数百万人观看。但他们以更经典的控制设计方式来处理这个问题。这里的挑战是如何以学习框架来处理它,并高度关注感官输入。我认为,当我们开始研究这个问题时,我们带来了这两个角度,它们不算是标准配置。我曾想过,人类婴儿肯定有一个发展过程。因此,机器人也必须有一个学习过程。然后,作为一个职业生涯大部分时间都在视觉领域度过的人,我认为感官必须从一开始就存在。不要把感官看作是之后才添加的东西,或者你做完之后,得到一个干净的状态,然后把它扔过去,希望它能起作用。它必须从一开始就是系统设计的一部分。这就是我们开始研究走路的原因。而且我很幸运有非常优秀的学生和合作者,Ashish Kumar 是我的学生,Deepak Patek 当时是我的博士后,我们在 Meta 工作。我们玩得很开心,取得了很大的进展。

是的,取得了巨大的进展。也许我们可以放一些视频来展示结果,因为我认为它们不言自明。当然,您要进行解说,以便听众也能理解发生了什么。您与您的合作者一起开发了“快速运动适应”的概念。它是什么?它使这些机器人能够做什么?让我先解释一下“适应”这个词。在机器学习中,一个核心概念是泛化。我的意思是,我们在计算机视觉方面取得了进展,当时我们决定,要识别所有椅子,我们无法写出椅子的数学定义,但我们会提供示例,然后系统会学习椅子的概念。这就是泛化。有许多不同的变化,但它们之间有一些共同之处。所以,对我来说,这个词“泛化”的对应词是“适应”。对我来说,任何运动活动都是如此。当你走路时,你需要走在平坦的地面上,你需要走在楼梯上,你需要走在室内,你需要走在雨后泥泞的泥地里,在小径上等等。我们可以做到这一点。如果我们有一个完全固定的程序,它不会很好地工作。你需要适应地形。因此,“适应”这个词。这个想法实际上与经典控制领域的人们从 50 年代和 60 年代就知道的一些事情有关。他们有一个叫做自适应控制的领域,但它是在一个稍微不同的框架下。总的来说,模型是线性的,并且被假定是已知的等等。我们在学习范式中所做的事情与那个目标相似,但使用了更现代、更灵活的工具,深度学习提供了。

我理解了“适应”部分,我们需要实现运动适应,因为走路是一项运动。现在,为什么是“快速”?我们需要快速,因为地形可以在我们脚下迅速变化。如果你走路时前面有东西很滑,你就会开始滑倒,但我们会恢复。我的意思是,时间尺度大约是一秒。因为在走路时,一个步态周期大约是一秒。如果你迈错一步,你就会摔倒,然后恢复。这应该在大约那个时间尺度内完成。如果需要 10 秒,那就没用了。你已经摔倒了,而且可能会严重受伤。不幸的是,这确实发生了。老年人摔倒是一个重大的健康危机。所以,这就是为什么我们的目标是快速运动适应。即在约一秒或更短的时间内适应,使您能够在没有严重摔倒或损坏的情况下恢复。然后,这归结为我们如何实现它。实现这一点,实际上就是改变你的走路方式。走路意味着你向不同腿的不同关节的电机发出的命令,以适应地形。沙地、硬地、泥泞等等。我们开发了一种技术,可以非常快速地推断出地形的某些方面,并相应地改变我们的行为。这就是我们称之为“快速运动适应”或 RMA 的缩写。它的基础是一个非常简单的想法。这个想法是,如果我发出相同的命令给我的身体,它的实际反应将取决于地形。如果我在硬地上行走,假设我看不见,我没有思考,我是一个心不在焉的教授,我只是在行走。我走在硬地上,然后我走到了沙滩上,现在我在沙子里。会发生什么?我会放下脚,然后我会以几秒钟前相同的力量把它抬起来。但在沙子里,我的脚会陷进去。所以当我抬起它时,它不会以相同的力量抬起,也不会抬到相同的程度。我的本体感觉系统会感知到这一点,并告诉我这里有些不同。所以,我们有一个期望的效果,发出一个命令,但实际发生的事情取决于你所在的地形。这种差异是我们用来适应的信号。你再加一点点,我们就能让它工作。我认为直觉基本上就是我解释的,然后有一些技术细节。但我认为我已经在这里给了你 80% 的想法。

您说的一件事让我印象深刻,看着视频,我不确定您是否能播放任何视频,Jitendra。是的,您可以做到。也许就在这个问题之后。是的,是的。处理/适应如此广泛的地形的能力。这就像在这里实验,在那里实验,每次地形都在变化。不知何故,机器人有了完全不同的互动,因为不同的摩擦力,不同的物体惯性,它在与之互动,不知何故,它稳定住了自己,继续前进。而且,我认为它有多么强大,真是令人惊讶。在我看来,这非常让人想起一些波士顿动力公司的旧视频,因为它们也同样令人惊讶于这些机器人的能力。但不同之处在于,这只是通过学习完成的,而不是一整年的工程才能达到下一个地形,或者下一个您可以发布的视频。所以这里有一些神奇的东西。我认为学习可以实现这一切。我想知道这让您怎么想?鉴于学习可以有效地实现波士顿动力公司通过工程所做的一切,甚至可能更多,您是否会推断出接下来将成为可能?我认为,在这一点上,对于能够观看视频的读者来说,我想展示一些视频,然后回答您的问题。听起来不错。我只是想解说一下正在发生的事情。我们这里有我们的机器人狗,它在伯克利 Meta 河边一块岩石区域,它在岩石间爬行,然后卡住了,但它移动了脚,设法做到了。这里有一个例子,它正在走下一段徒步小径上的楼梯。楼梯被一堆树叶遮住了,但它仍然设法恢复了,没有停顿。这里机器人正在一个建筑工地的泥泞区域工作。在所有这些情况下,立足点有点不稳定,但它设法通过了。这里有一个例子,这是一个室内例子,在一些木板上。我的学生 Ashish 正在研究这个。那是疫情期间。他把机器人带回家,基本上是和机器人一起睡觉。这些是他家里的实验,机器人正在一些木板上爬行。这是一个人类立足点相当不稳的场景。这些都是关于它能够处理的各种变化性的例子。所以,我在这里停下来,回到您的问题。

那么,在您回到问题之前,我只想强调,您展示的所有不同情况都是同一个神经网络在控制机器人,对吧?同一个神经网络知道如何适应所有这些场景。正是如此。感谢您让我清楚这一点。是的,完全是同一个策略。不是像……在旧式的计算机编程中,你会有这些“如果……那么……”的分析。如果发生某事,就做这个。如果发生另一件事,就做另一件事。不,这里完全是同一个程序。现在,幕后发生的是,在这些不同的地形中,正在估计这些外部条件的某种估计。我们使用“潜在的外部条件”这个术语。然后,它基本上会指导机器人的行走行为进行适当的改变。所以,我认为 Peter,在我开始展示视频之前,您问的是……这对经典风格意味着什么?与波士顿动力公司那种坐下来思考并编写控制法的风格相比。我将在这里做一个小历史评论。我认为,如果你看看物理学的历史,如果你看看 19 世纪的物理学,那时没有计算机。所以,聪明的物理学家为了理解现象所必须做的,就是写下微分方程。所以,牛顿、麦克斯韦……物理学的本质是由这些描述现象的微分方程捕捉到的。这就是控制理论中出现的思维模式。你有一个物理系统,所以你用一些微分方程来描述动力学。现在,这里有什么实际问题?实际问题是,这些微分方程可能需要了解质量、摩擦力等等。所以,物理学是正确的,但物理学有所有这些未知的参数。这些未知的参数实际上在变化,因为我走在楼梯上,树叶,泥土,沙子,这些参数在变化。所以,即使理论上物理学家有理解这一点的方法,可以追溯到几百年前,实际的实现是卡住了,因为我不知道所有这些参数。然后还有接触和制造接触的复杂性。当你有多条腿时,有些腿在地上,有些腿在空中,而每一种情况都需要不同的模型。所有这些,当你试图以一种分析风格去做时,也就是旧的风格,你写下方程,设计一个控制器,用笔和纸完成,然后将其实现到计算机上。这种风格对于已识别的简单系统来说效果很好,我们知道这些参数。而且这很棒。这是经典控制成功的根源。例如,人类登上了月球。我想到了阿波罗任务。你需要确保绕月轨道的精度。这些能力是由经典控制理论派生的技术提供的。

在我们目前的设置中,我们有一个非常复杂的系统,其模型可能无法提前写出。学习方法的好处是,它们可以在学习过程中处理这些未知数。所以,我们正在同时识别系统并学习控制律。这非常强大。回到我与物理学的类比,19 世纪的经典物理学家以某种方式运作。但 20 世纪的物理学家或 1960 年或 1952 年之后的物理学家做什么?我们有计算机。所以,你不必依赖微分方程的解析解。你可以模拟系统。你可以非常精确地模拟系统,而无需进行简化近似。这在统计学中也是如此。早期一代的统计学家不得不做出这些简化假设,即 n 趋于无穷大,存在某种高斯分布,因为这使得数学能够进行。如果你用计算机采样,我们不必做出那些近似。所以,在我看来,计算机和计算机模拟的力量在于,我们不再需要做出前几代物理学家、统计学家、控制工程师为了让数学能够进行而需要的那种简化假设。所以,从这个意义上说,模拟是答案。当然,模拟依赖于底层的物理模型,因为这里没有魔法。但模拟受益于摩尔定律。每年计算机都变得更快,模拟技术也变得更准确。所以,如果你依赖模拟,你就在利用这条曲线。而当我依赖于在脑海中非常聪明地写下东西时,我就是在依赖人类的创造力,而人类的创造力变化并不那么快。总之,这就是我为什么对模拟如此看好的某种直觉。并非我所有的同事都同意。有一个老笑话,模拟注定会成功。但我认为你必须巧妙地使用模拟,你必须知道它们的局限性,你必须有从模拟转移到现实的正确技术。但我相信它在推动机器人技术方面发挥着重要作用。

顺便说一句,我个人也同意模拟将在原型设计方面发挥重要作用,甚至可能用于学习可以然后零样本或少样本转移到现实世界中的东西。我倾向于在自己的工作中遇到的挑战,以及模拟的挑战,我不知道您的看法是什么,Jitendra。模拟器往往具有有限的多样性,与现实世界相比。因此,很难拥有与现实世界相同的通用经验,并将其带入模拟器。这是一个有效观点。但我认为这是一个时间问题。我认为理想的模拟器不是一次性的过程,而是一个反馈循环。所以,当我们构建一个模拟器时,我们基本上是在构建一个外部世界的模型。然后我们在其中训练一个系统,将其投入现实世界,然后有些事情不对劲。这可能会告诉我们一些事情来改变我们的模拟器。这本身就是一个循环,我认为它或多或少是科学过程。因为在某种程度上,我认为模拟器是一种理论,现实世界是一种实验,科学就是关于理论和实验。但它从来不是单向的,而是一个循环。所以,你正在寻求的多样性将随着我们投入更多努力而出现。在某些情况下,我们可以通过捕捉现实来做到这一点。我的一些工作,在伯克利和 Meta 的一些同事那里,是关于模拟环境的,比如我们有一个叫做 Gibson,另一个叫做 Habitat。我们所做的是扫描真实的公寓,然后将其放入计算机中,然后用它来研究移动机器人的导航策略。事实证明,这样你就能在某种程度上获得现实世界的统计数据。所以,模拟依赖于各种技术,在我看来,所有这些技术都在变得更好。因为,想想好莱坞电影。它们有非常好的图形,非常好的物理效果。这至少告诉我们,它们足以在视觉上欺骗我们。所以,这告诉我们,这个领域的未来前景可能不错。它在所有情况下都不起作用。有些同事真的相信在现实世界中进行训练,我也相信这一点。所以,我在这里对冲我的赌注。我团队中有人在现实世界中训练,也有人在模拟中训练。我认为未来属于两者。

谈谈未来。您展示的机器人,您通过快速运动适应训练的机器人,可以导航各种地形。它们仍然有无法处理的地形吗?到目前为止,我展示的例子是针对盲人机器人的。这个机器人无法爬楼梯。它可以爬下楼梯,因为你只是摔倒并避免摔倒。爬楼梯它做不到。为此,我们发现有必要引入视觉的使用。如果您不介意,我将向您展示一些视频。是的,请。我们现在将看到的是一个机器人,它在工作,并且有一个摄像头。在右边,您可以看到摄像头看到的东西。它是一个 RGB-D 相机,对地形没有先进的了解。它正在尝试在一些木头上工作。如果它犯了错误,它就会摔倒。它能够做到这一点。这里有一个例子,它正在公园里爬楼梯。它有些挣扎,但它相当有效地做到了。令人印象深刻的是,这是一个相对较小的机器人狗。它的腿的高度非常小,而楼梯相对较高,与机器人高度相比。而且,这只是一个小小的观察。家里养小狗的人都知道,如果狗很小,它在楼梯上会有麻烦。所以,这里的机器人有些挣扎,它快要摔倒了,但它设法保持了它的控制。然后,很快它就成功了。这些例子是为了说明视觉的作用。当地形非常困难时。如果我必须过河,我必须过河,因为河中间有一些石头,那么我可以在一块石头上放一个脚,然后继续前进。我不会想在看不见的情况下这样做。我可以在沙滩上看不见地行走。所以,我们……所以,我们的机器人狗有这种行为,大多数时候它可以看不见地行走。这就像人类一样,因为盲人可以相当有效地行走。但盲人有什么麻烦?他们在爬楼梯时有麻烦。他们会用棍子戳一下,感受楼梯的高度等等。通常,如果他们有帮助,他们会感觉更舒服。我们展示的是,我们的机器人狗通过使用视觉系统,实际上可以处理这些例子。所以,我认为您问我什么我们不能做。我认为四足运动已经接近解决了。我可以说,双足运动更难。当你用两条腿而不是四条腿时,四条腿更容易,因为平衡更容易。所以,如果你问我,比如,我们能用两条腿做什么?我的意思是,我们已经为双足机器人做了我们模型的版本,它们有效。但不知何故,这个问题似乎没有解决。而且,有趣的是,现在似乎对人形机器人又重新产生了兴趣。对于人形机器人,我们需要能够行走的能力。然后,当然,机器人要有用,手臂和手也必须能够举起重物并做事情。在这个领域有一些公司。我认为,开发双足运动,也就是用两条腿行走,仍然不是一个已解决的问题。

我想暂时换个话题,Jitendra。您的大部分职业生涯,至今仍然如此,您都专注于计算机视觉。我想知道您对计算机视觉的现状有什么看法?我们现在在哪里?这只是需要稍微扩展一下吗?我们应该扩展什么?仅仅进行无监督学习就足够了吗?然后事情就会自然出现?您个人对这个领域的看法和直觉是什么?有我称之为核心视觉的经典问题。我曾有一个口号,我称之为视觉的“三个 R”。一个 R 是识别。你有一张图片,你必须说它里面有椅子还是狗还是猫。我有一个重建,意思是走向三维。恢复物体的三维形状或场景的空间布局。然后第三个 R,为了使其成为三个 R,我称之为重组。但有些人称之为分割或分组。也就是说,将像素集合分成单个物体。例如,这些像素属于一把椅子,这些像素属于一个人。对于这些问题,我们已经取得了显著的进步。我认为,在识别方面,有很多工作来自 Meta,我的同事们在 Meta。然后有几十年的前期工作,我没有时间深入研究,这表明,例如,为识别猫狗和椅子构建计算机程序。我们可以做得非常出色。是的,我们可以做到。

拥有数千个类别,该领域的工作实际上是关于规模化,你知道的,我们做得相当好,如果你给我,如果你给我更多的数据和更多的例子,更多的标签或例子,我就可以让它奏效,当然,它的实际应用仍然存在,例如,想想一个在医学影像分析领域工作的人,他们想诊断某人X光片中的某个问题,嗯,这需要我们能够使用这种方法,然后训练一些更多的例子,并训练一个系统,就图像分割成对象而言,这也是我多年来一直致力于的问题,但最近,例如,你有一个系统,它源于对“分割一切”的攻击,它是在数百万甚至数十亿个例子上训练出来的,这样问题就可以解决,三维重建的问题,我可以说它有些扎实,但尚未完全解决,所以,他们有非常好的解决方案的版本是,如果你有多个视图或一个对象,那么这就是过去所谓的结构恢复或SLAM,现在首选的技术是称为NeRF(神经辐射场)的东西,它能产生令人惊叹的图像,但我不认为这个问题已经达到了人类可以解决的水平,即即使从一张图像中我们也能解决它,所以我认为从一张图像中恢复三维的问题仍然是,我的意思是,我们已经取得了很大进展,但很大一部分尚未解决,但这只是指核心的视觉问题,核心视觉,视觉本身并不存在,对吧,视觉是为了某个目的而存在的,我认为视觉与真正的邻近领域相连,一个是机器人技术,即用于指导行动的视觉,这也是我在过去五年里选择追求的,另一个视觉连接的领域是视觉与认知,我可以这样说,对于认知,我将语言包括在内作为代理,所以处理视觉和语言的模型,而这个领域非常开放,我认为已经取得了实质性进展,但还有很多工作要做,所以,我绝不是,我,我,我,我认为我的第一篇视觉论文是四十年前,1983年,我写了我的第一篇计算机视觉论文,视觉已经取得了巨大的进步,但我不认为它已经解决了,有像视觉和语言之间的互动,长语言视频理解这样的领域,我看一部电影,我想了解什么,回答关于电影的问题,这显然是语言和视觉推理的结合,在机器人技术上的应用是真实的,如何用更少的数据来管理,人类以比我们在人工智能和机器学习中少得多的例子来训练概念,所以,一定有什么东西是我们错过的,所以,在我看来,计算机视觉中仍然有很多工作要做,另一件也让我想起的事情是计算机视觉中的对抗性样本的概念,你能否详细说明一下它们是什么,以及你目前对它们的看法,是的,这些例子吸引了很多大众的关注,比如说,你有一张停止标志的图像,然后你修改它,这是一个图像,所以你有像素和亮度值,然后你稍微修改它,如果你愿意的话,添加一些不易察觉的噪音,然后你把它输入到你的计算机程序,你的分类器,它说这是一个蛇或其他什么东西,这很了不起,我们可以很容易地解释这些,因为发生的是,在这些神经网络中,它们是分类器,所以它们有一个决策边界,所以,那些不易察觉的噪音正在以某个方向修改图像,以至于欺骗了分类器,它只是越过了决策边界的另一边,但人类不会被欺骗,对吧,看那张图像的人不会被欺骗,这告诉我,人类解释图像的过程比那个简单的分类器更复杂,所以,这是我们值得研究的一个课题,我本人没有研究过这个问题,但我将在这里给出一些随意的评论,我觉得理解任何图像的正确方法都包含自下而上和自上而下的组成部分,所以,自上而下的组成部分,当我们做梦时,我们就会运用它,所以,当我们睡觉做梦时,发生的是我们大脑中的某个概念,然后触发神经元,它们实际上激活了视觉皮层,几乎与实际看到图像时激活的方式相似,所以,有自上而下和自下而上的组成部分,自上而下的组成部分有时与生成模型相连,这里有很多技术定义,而且,我我不确定哪个版本会奏效,但我认为这可能是解决这些例子的方法,我们需要以自上而下和自下而上的方式来理解任何图像,有趣,嗯,给在这里听的一些研究人员提供了思考的素材,嗯,你在计算机视觉领域所做的一件事,除了许多算法见解和贡献之外,你开始强调基准测试的重要性,现在已经二十多年了,你当时是怎么决定开始做的,为什么你这么做,显然它产生了很大的影响,你如何看待这种影响随着你的开始而演变,好的,嗯,这让我想起大约2000年左右,甚至更早,实际上是在一次会议上的讨论,我当时在一个小组里和我的一位同事奥利维尔·福杰拉斯进行了一点辩论,他是一位研究计算机视觉几何的人,他认为结构恢复和SLAM是值得尊敬的问题,因为我们有清晰的数学公式,但他认为分割和识别等问题质量可疑,我们姑且这么说,特别是他说分割,好吧,每个人都写论文提交,然后他们会展示一些图像,然后说,这些是我妹妹分类的组,然后我们必须接受,我们很高兴,这不是一种科学方法,他非常遵循法国传统,需要有数学形式主义等等,所以我从那次旅行回来,我决心证明他是错的,所以,思考它的方式是,没有精确数学模型的其他科学是如何做到的,比如心理学等等,他们会做人类实验,所以,这里自然而然的事情就是,想想人类实验,所以,我们可以向人们展示图像,我们可以让人类标记物体的边界,如果人类在这方面是一致的,那么这意味着我们有一个科学上有效的问题要解决,所以,这是其中一个重要的动机,另一个有趣的动机是,我当时有一个学生大卫·马丁,他也曾在计算机架构领域工作过,他是戴夫·帕特森的学生,戴夫·帕特森是一位著名的计算机架构师和图灵奖得主,在计算机架构领域,他们非常相信基准测试,因为当新的硬件出现时,他们会运行相同的代码片段,并尝试对它们进行分类,得到下降的数量,所以,这些趋势以某种方式结合在一起,所以,我们所做的是,我们说,好吧,让我们收集一组图像,你知道吗,彼得,我要给你看我做了什么,好的,这是一堆CD,这是2000年的,这是Corel,当时你无法从网上获取图像,网上没有那么多图像,互联网仍处于起步阶段,所以,我们购买了这套CD,每张CD上,好吧,我不知道人们是否还认识这些,每张CD都包含一定数量的图像,但你可以将它们加载到计算机上,然后,然后我们可以让本科生来标记物体的边界,并查看一致性,然后我们用它来研究自然图像的统计数据,并为寻找物体边界这个任务定义人类的真相,即使它不一致,即使它不是100%一致,它也是90%一致的,然后这也成为训练机器学习算法的数据,所以,我们做了很多事情,它促进了数据的使用,促进了基准测试,并促进了将图像理解为图像的集合,图像的流形等等,当然,我不想只归功于这种思维模式,这种思维模式逐渐在计算机视觉中变得越来越普遍,我也非常感谢皮埃特罗·佩罗纳,他在加州理工学院,他曾是我的学生,但皮埃特罗领导了从网上收集的第一批图像,有一个名为Caltech 101的集合,用于物体识别,然后,安德鲁·齐尔兹曼在英国也做了这个,还有MIT的安东尼奥·帕斯卡尔项目,阿廖沙·阿夫罗斯也大力推广了数据的重要性,菲菲·李也带来了ImagineNet,所以,在2000年到2010年之间,范式发生了变化,过去,发布带有数据集的论文会非常困难,到2010年,人们认为,是的,这就是我们现在科学的方式,当然,如果你想到现代人工智能时代,它完全是由深度学习驱动的,而深度学习的重大突破是在图像识别方面,深度学习已经存在了几十年,也许不是这个名字,但它已经存在了几十年,但在ImageNet挑战赛上的图像识别突破,一个基准测试,它从早期开始的视觉基准测试中找到了自己的路,我听说你,你也是其中的一部分,为什么杰夫和他的学生在ImageNet上运行,你能多说一点吗,是的,这是一个有趣的故事,大约在2011年或2011-2012年左右,我当时在伯克利校园的办公室里,电话响了,我接了电话,通常现在不接电话,因为通常是一些随机的推销电话,我接了电话,是杰夫·辛顿,我认识他很久了,从80年代起,我是说,我们都是这个领域的资深人士,杰夫没有以问天气开始谈话,杰夫的第一个问题是,你为什么不喜欢深度学习?他非常直接,所以,我想,好吧,我也需要直接回应,所以我说,哦,因为你没有证明这一点,你没有提出论据,然后他说,哦,但我们在MNIST和CIFAR上取得了这些结果,我说,那些是,你知道,小数据集,我不会被说服,所以,我们需要一些具有自然图像复杂性的东西,等等,他说,哦,好吧,所以我说了,哦,例如,我们有这个Pascal挑战赛用于物体检测,如果你在上面取得好成绩,那将是令人印象深刻的,他说,好吧,让我想想,然后他挂了电话,第二天又打给我,他说,Pascal,我知道你们喜欢Pascal,但我不认为它有足够多的图像来支持我们的技术,另一方面,ImageNet,它也有很多图像,我觉得它更有前景,你怎么看?我说,是的,我会对ImageNet的结果印象深刻,所以我说,好吧,我回去让几个学生研究这个问题,如果我们有什么可以展示的,我会打电话给你,正如他们所说,其余的都是历史了,那就是Alex Krizhevsky,当然,这里有一个隐藏变量,那就是GPU已经问世了,它们发挥了作用,这项成就,我的意思是,有GPU,有数据,有深度学习,将它们结合起来,然后这种方法的结果比传统的计算机视觉技术要好得多,这些结果在佛罗伦萨的一个研讨会上在ECCV上发表,我记得我们都在房间里,你说历史正在被创造,就在那里,Alex展示了他的结果,然后我们进行了一点争论,Jan LeCun在房间里,我在房间里,Alia Versus也在房间里,我们争论这是真的吗,它意味着什么,你知道,然后历史对发生了什么非常清楚,谈谈历史和事物的发展方向,你认为人工智能在不久的将来会走向何方,你认为可能会出现哪些令人兴奋的应用,能够真正对人类产生巨大影响?我认为到处都是,显然,但让我举一些我最喜欢的例子,我认为医学和医疗保健,我的意思是,这些非常重要,我的意思是,这些是关于,有很多,我的意思是,这些不会完全转移到人工智能,但比如人与机器的结合,例如,在诊断X光图像时,我举一个最接近我能力的例子,我以前做过类似的事情,这些可以非常,你知道,令人惊叹和民主化,想想看,比如一些血液样本,现在拍照很容易,对吧,相机无处不在,即使在欠发达国家,贫穷国家的人们也能获得手机和相机,我能用它们做些什么吗?我知道有一个项目在印度,在这些服务不足的医院里,你给刚出生的孩子拍照,然后从中你可以估计出孩子是否发育迟缓等等,同样在美国,我们GDP的18%用于医疗保健,这是一个很大的领域,我认为是老年护理,我的父母年纪很大了,我的意思是,我们知道,退休后人们寿命很长,然后他们的生活质量会大大提高,如果他们有家庭援助,我的意思是,不是每个人都能一直负担得起护工,经济上不可能支持,但机器人援助可以发挥重要作用,所以我选择的例子接近我的兴趣,即视觉和机器人技术,当然,还有很多其他方面,我想说一件事,因为,每当讨论人工智能时,都会讨论人工智能抢走工作等等,我个人并不担心,我的意思是,原因是我认为,我们已经看到了计算机化的影响,但系统需要很长时间才能适应,当过程是渐进的时候,它会经历一个过程,最初是人类和机器一起工作,然后机器只是协助人类,然后人类和机器一起工作,然后有一些工作部分完全外包给机器,然后人类开始做一些更有创造性和有趣的事情,等等,我的意思是,如果你想想编程,曾经人们不得不使用汇编语言和机器语言编程,如果结构化的话,我在70年代通过按下某些按钮来编程机器,你知道,加载引导程序,然后我们得到更高级的语言,甚至更多,然后,好吧,现在我们使用,你知道,GPT来帮助我们准备很多标准的代码措辞,所以,我的意思是,什么时候有过大规模失业计划?我不认为我们见过,生产力带来的就是,我们现在可以将这些技术应用于更多场景,在50年代,考虑到编程的努力,这样做是不值得的,有很多很多应用,你根本不会尝试计算机化,但我们愿意,所以,所以,我不是专业的经济学家,但作为一名人工智能研究员,我必须考虑我工作的后果,我倾向于认为,它将与人类合作,而不是以那种方式担心,我看到了更多的积极方面,而不是消极方面,想想人类,当一个新来的博士生来找你,或者一个潜在的博士生在会议上和你聊天时,你通常会给他们什么样的建议,如果他们想开始他们的AI研究职业生涯,我一直认为人们需要拥有技能组合,他们应该在某些方面广泛,在某些方面狭窄,就像T一样,我的意思是,有时人们称之为T模型,对吧,我的意思是,有一些技术技能你需要掌握,如果你构建一个PyTorch模型或TensorFlow模型,好吧,你当然需要理解机器学习的基本数学,基本的编码能力等等,所以,有一些基本的核心技术技能是必不可少的,但然后有一些广度的知识,我也很欣赏,我总是告诉我的学生,试着跳出框框思考,我的意思是,如果你正在做计算机视觉,也许也读一些感知领域的文献,也许读一些神经科学领域的文献,也许和计算机图形学的人聊聊,你知道,甚至艺术,你知道,所以,所以,我认为,因为我们的领域与许多其他学科相连,我的意思是,人工智能总的来说,我认为思想更开阔的人能够做出更大的贡献,随着时间的推移,而且我认为,当然,适应性非常强非常重要,我的意思是,如果你坚持认为,哦,这里有一种我学过的技术,我擅长它,我可以写15篇论文,如果你只坚持这一点,你注定要灭绝,所以,适应性不仅对会走路的机器人有用,对研究人员也很有用,在我职业生涯中,我不得不多次适应,放弃我认为曾经很棒的想法,我曾经非常擅长,我花了,你知道,几年的时间学习微分几何,然后它变得无关紧要了,好吧,你知道,你做了一个,你知道,然后,最重要的是,在任何研究领域,我认为热情很重要,我的意思是,我认为,在我看来,最好的研究人员,他们热爱他们所做的事情,你必须感觉到你想做某事,你热爱它,你想阅读所有相关的内容,并让它发生,当我看到学生身上有这种特质时,我觉得,好吧,这太棒了,让我们谈谈你的职业生涯,Tandra,据我所知,你在印度长大,你在印度哪里长大?我长大了,在一个叫贾巴尔普尔的城市,它在印度中部,我在那里完成了高中,然后我去了IIT坎普尔,它在德里附近,我在那里是电气工程专业的本科生,是的,那是我,我在那里接受了经典的电气工程培训,我们谈论的是1975年到1980年代,我还是本科生的时候,但当时计算机还不那么普遍,我通过阅读有关计算机的文章而兴奋起来,我上了一些课,但当时我开始思考人工智能,因为我只是读了《科学美国人》上的文章,我想,哇,我的意思是,这是一个宏大的目标,然后我申请了研究生院,我不知怎么地,通过某种侥幸,我被斯坦福大学录取了,我非常惊讶他们录取了我,但无论如何,我来到斯坦福大学,当我刚开始的时候,我更倾向于,你知道,编程语言和架构之类的东西,我们上了一个季度,然后转到了人工智能领域,事实上,我转到了和创造了“人工智能”这个词的人一起工作,约翰·麦卡锡,他是我的导师,我阅读了经典的AI文献,斯坦福大学非常注重基于逻辑的AI,约翰·麦卡锡是那里的神,我的意思是,因为他创造了“人工智能”这个词,他的观点是,我们将通过使用一阶逻辑来表示关于世界的真相来解决智能问题,然后我们将进行逻辑推理,你可以将规划转化为推理问题,你可以将推导出关于世界的新真相作为推理问题,等等,这就是他所相信的,当时有一个小问题,约翰·麦卡锡也认识到,在常识推理中,你有一个问题,你给出新的事实,然后你对旧事实的信念会改变,所以,经典的例子是关于特里西的,它会飞,是的,它可以飞,但如果有人告诉你,特里西是一只企鹅,那么你说,哦,好吧,也许它不能飞,然后也许有人告诉你,特里西是一只带有马达和翅膀的机械企鹅,那么也许它可以飞,但然后有人告诉你,如果马达坏了怎么办,等等,人类在常识推理中具有改变我们信念的能力,这对于概率推理来说不是问题,贝叶斯推理,每次有新证据,你都会改变你的信念,但在经典逻辑中,这是一个问题,但麦卡锡想要在经典逻辑中解决这个问题,这就是我们分配给我的工作问题,这是一个非常困难的问题,没有人能解决,我没有解决,他也没有解决,几年后,我感到非常沮丧,然后我遇到了罗德·布鲁克斯,他,你认识他,他是罗德尼·布鲁克斯,一位机器人学家,他也是斯坦福大学的学生,不知怎么地,在喝啤酒时,他告诉我,所有这些逻辑的东西都是胡说八道,你真正应该研究的是视觉或机器人技术,他实际上告诉我莫拉维克悖论,这是在斯坦福大学附近凌晨1点或2点发生的,我当时想,我的意思是,这真的震撼了我,因为我相信重要的事情是所有这些逻辑和推理等等,而这里有人说,不,重要的是猫能做什么,但我被说服了,基本上在几个月后,我放弃了约翰·麦卡锡的论文,转而与汤姆·本福德一起研究计算机视觉,所以,基本上我放弃了我的博士学位,两年半后,但这是最好的决定,或者说最好的决定之一,我的意思是,我认为娶我的妻子可能是最好的决定,但这很接近,这太棒了,两年半后,改变你的博士研究方向,我认为这非常罕见,我不认为有多少人这样做,我认为很多人会说,如果我再工作一年半,我就会完成它,然后就结束了,但你,有时在你早期的工作中,也许你太热情于想在人工智能领域做一些真正有意义的事情,以至于你愿意说,好吧,我将承担沉没成本,我将重新开始,这太棒了,现在,从斯坦福大学,你来到了伯克利,据我所知,你是伯克利最早的AI教授之一,或者至少是现代AI教授之一,是的,没错,当时,我的意思是,有 Shankar Shastry,他是一位控制理论家,他转而尝试做机器人技术,他是我的同事,然后,有 Robert Valenzki 和 Rodrizadeh,他们代表了经典的AI的某些流派,然后我是一个被聘用的年轻小子,然后第二年 Stuart Russell 被聘用,然后第三年 John Candy 被聘用,然后是 Ron Fearing,这就是伯克利AI和机器人学的开端,很有趣,因为我们都是年轻的助理教授,试图在一个该领域活动很少的系里创建一个领域,现在,相当多的团队,显然,你在伯克利建立了一个非常成功的AI部门,快进很多年,你已经培养了70多名博士生和博士后,他们去了顶尖大学,顶尖的工业研究实验室,而后者是我想要谈论的,你也担任了工业界的职位,你如何看待工业界和学术界研究之间的协同作用,或者说互补性,尤其是在人工智能领域?是的,这是一个严肃的问题,因为,在上次CVPR会议上,我们有一个小组讨论,有一些学术界同事担心学术研究是否正在失去相关性,这种担忧来自于,你知道,像GPT-3或GPT-4这样的模型,在学术实验室里训练它们是不可能的,我认为学术界和工业界不是冲突,而是互补的,以下是一些方式,好吧,最明显的一点是,在学术界,我们招收非常优秀的人才,我是说,刚开始的博士生,五年后,我们让他们成为一个非常了解的人,有构建东西的信心,并且可以出去做伟大的事情,所以,工业界无法生存,没有学术界培养的人,然后,工业界可以进行的研究,有各种各样的研究模式,我花了一些时间在谷歌,然后我在Meta工作,当时叫Facebook,Facebook人工智能研究,所以,工业界的研究有不同的模式,也许我只谈谈这个,有一种工业界的研究模式,就像学术界一样,是独立的调查员,也许两三个人一起工作,他们有一些想法,他们实现了一些东西,做了一些实验,写了一篇论文,但然后你也有这些大团队的可能性,这是DeepMind和OpenAI拥有的模式,你有一个大团队,他们朝着一个项目努力,你投入了很多,怎么说,把很多木头放在箭上,你有一个临界质量,现在你可以构建更大的东西,在我看来,这两种模式都很重要,我喜欢把它看作是小科学和大科学,如果你想想这个,有一个类比是物理学,你们中的一些人可能看过一些人可能看过的电影《奥本海默》,奥本海默中一个非常突出的人物是劳伦斯·欧内斯特·劳伦斯,他是伯克利大学的物理学教授,他建造了回旋加速器,他开始了大规模科学的传统,因为在那之前,如果你看看1930年之前的物理学论文,你从来没有见过有多位作者的论文,我的意思是,也许一两位,现在你看到,今天在高能物理学中有千名作者的论文,这真的始于伯克利的劳伦斯,因为建造这些设备,然后现在你可以加速粒子足够快,然后这导致了发现,但人们必须聚集在一起,他们再也不能指望一个人独自工作了,所以我认为我们的领域也是如此,我们需要认识到,我们的领域既有小科学的组成部分,也有大科学的组成部分,而且两者都需要被认识到,不是非此即彼,小科学可以更容易地进行探索,大科学可以更有效地进行开发,鉴于该领域的当前结构,工业界将有更多的小科学,公司里有大科学,但并非必然如此,你看物理学,当他们研究大型强子对撞机时,这都是学术研究,但这是大科学,所以,一群大学创建了一个联合会,所以,我的信念是,我认为它是互补的,我重视小科学和大科学,只关注其中一个或另一个将是错误的,你谈论对研究的热情,我想说,我觉得我从来没有,遇到你不是充满热情,并且非常忙于完成研究,或者教学,但你有没有休息过,你做什么来放松?我喜欢,我喜欢散步,所以,有时只是去散步,我喜欢,我喜欢去博物馆,抱歉,我喜欢旅行,所以我经常没有时间,但我喜欢去博物馆,在罗马、伦敦和巴黎等地,我喜欢,我喜欢阅读,阅读很多东西,有些,我认为这些可能是我的,我最大的课外活动,你知道,散步,徒步旅行,旅行,阅读,你在任何运动方面都擅长吗?不幸的是,是的,所以,我希望我能,另一件事是音乐,我可以听音乐,但我不能创造音乐,如果你擅长运动,也许你现在就不会在这里了,所以,为了做AI研究,这可能是一种祝福,当你阅读时,你是在读小说,还是在读其他学科的科学书籍,你在读什么?我相当,什么都读,我读一切,我读了很多,比如,我不知道,神秘小说,夏洛克·福尔摩斯,我可以随时引用夏洛克·福尔摩斯的话,我,我喜欢读历史,我觉得历史很有趣,我也喜欢科学史,让我给一个论点,以及为什么我试图鼓励学生也阅读历史,因为历史给了我们,你知道,生活中有很多方面,你永远不会遇到完全相同的情况,历史就是这样,但你可以找到最近的邻居,所以,如果你处于某种情况,你可以想,好吧,这里有一个类似的情况,发生在那个时候,这在人类历史的长河中是真实的,你知道,当我们谈论王国、帝国、战争和革命时,我们也可以谈论科学史,有时我们现在正在研究物理学领域,我们认为它如此美丽和成熟,但物理学是300年前就这样的吗?还是生物学,50年前或100年前不是这样的,事情非常不确定,有这些争论,也有绝对错误的想法,等等,当我看到这些时,它给了我一些关于人工智能的灵感和信心,我认为人工智能今天就像大家都在谈论的,我们在报纸上都能看到,但当我开始这个领域的时候,是在80年代,它就像一个很小的学科,我把它放在计算机科学系,因为,我的意思是,大多数人认为这只是空谈,永远不会成真,那么,当你坚持一个领域,当它还没有真正实现的时候,你如何保持信心?通过历史类比,通过说,哦,这些其他领域也曾经是,你知道,某种程度上,非常初级,而且它们不起作用,我认为,当我试图预测人工智能的未来时,我也会这样做,我认为我们有时会担心,哦,哦,我们可能很快就过度推断了,我们认为,哦,突然就会发生这种情况,或者有时我们,我的意思是,有这么一句话,在短期内,我们总是高估事情会发生的速度,而在长期内,我们则低估了,因为会有,会有我们从未梦想过的发现,所以,这种历史视角,实际上巩固了我的研究,我从中获得了一些灵感,除了历史很有趣,有很多很酷的故事,但它们确实发生了,是的,我的意思是,我真正喜欢阅读的是,也许你不知道这是否算历史,但它是传记,是的,那是历史,但我把它归为同一类,好吧,Tandra,非常感谢你抽出时间,我真的很享受这次谈话,同样,好吧,彼得,谢谢你抽出时间,我非常享受,