📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

The Godmother of AI on jobs, robots & why world models are next | Dr. Fei-Fei Li

Lenny's Podcast1:19:34

Transcription

很多人称您为人工智能的教母。您所做的工作实际上是点燃了我们走出人工智能寒冬的火花,那是在 2015 年中到 2016 年中。一些科技公司避免使用“人工智能”这个词,因为它们不确定人工智能是否是一个贬义词。大约在 2017 年,公司开始自称为人工智能公司。我记得有一句话,我想那是您在向国会做报告时说的:“人工智能没有什么‘人造’的。它是受人启发,由人创造,最重要的是,它影响着人。”

我认为人工智能不会对就业或人们产生任何影响,这并非事实。事实上,我相信人工智能目前或将来所做的一切都取决于我们,取决于人们。我确实相信技术对人类来说是净收益。但我认为,每项技术都是一把双刃剑。如果我们作为一个社会,作为一个个体,没有做正确的事情,我们也会搞砸。

您有一个突破性的见解,那就是“好吧,我们可以训练机器像人一样思考,但它们只是缺少孩子学习时所拥有的数据。”

我选择通过视觉智能的视角来看待人工智能,因为人类是高度视觉化的动物。我们需要用尽可能多的关于物体图像的信息来训练机器,但物体非常非常难以学习。一张图像中的单个物体可以有无限的可能性。为了用成千上万个物体概念来训练计算机,您确实需要向它展示数百万个例子。

今天,我的嘉宾是 Feay Lee 博士,她被誉为人工智能的教母。Fei 博士是许多促成我们目前所经历的人工智能革命的重大突破的负责人和核心人物。她率先创建了 ImageNet,这基本上是她认识到人工智能需要大量干净的标记数据才能变得更智能。而这个数据集成为了导致当前构建和扩展人工智能模型的方法的突破。她曾是 Google Cloud 的首席人工智能科学家,那里涌现出许多早期最重大的技术突破。她曾是斯坦福人工智能实验室(Sale)的主任,那里走出了许多人工智能领域的顶尖人才。她还是斯坦福以人为本的人工智能研究所的联合创始人,该研究所正在人工智能的发展方向上发挥着至关重要的作用。她还曾在 Twitter 董事会任职。她被《时代》杂志评为人工智能领域 100 位最具影响力的人物之一。她还在联合国咨询委员会任职。我可以继续说下去。

在我们的对话中,Fay 分享了人工智能世界如何发展到今天的简要历史,包括一个令人震惊的提醒:9 到 10 年前,称自己为人工智能公司基本上是品牌死亡的信号,因为没有人相信人工智能真的会奏效。如今,情况完全不同了。每家公司都是一家人工智能公司。我们还聊了聊她对人工智能将如何影响人类未来的看法,当前技术能将我们带多远,她为什么对构建世界模型如此热情,以及世界模型究竟是什么。最令人兴奋的是,世界上第一个大型世界模型 Marble 刚刚发布,就在本播客发布之际。任何人都可以访问 marble.worldlabs.ai 免费体验。这太疯狂了。一定要去看看。Fay 令人难以置信,而且她对世界的影响力被低估了。所以,我非常激动能邀请到她,并与更多人分享她的智慧。非常感谢 Ben Harowitz 和 Condoleezza Rice 为这次对话提供话题建议。如果您喜欢这个播客,请不要忘记在您喜欢的播客应用程序或 YouTube 上订阅和关注它。

现在,在简短的广告之后,我将为您带来 Fay Lee 博士。

本期节目由 Figma 提供。Figma 的制作者们。当我还在 Airbnb 担任产品经理时,我仍然记得 Figma 的出现,以及它如何极大地改善了我们团队的运作方式。突然间,我可以让我的整个团队参与到设计过程中,快速地对设计概念给出反馈,这让整个产品开发过程变得更加有趣。但 Figma 似乎从来都不是为我准备的。它在提供设计反馈方面很棒,但作为一个构建者,我想创造东西。这就是为什么 Figma 推出了 Figma Make。只需几个提示,您就可以将任何想法或设计变成一个功能齐全的原型或应用程序,任何人都可以对其进行迭代并与客户进行验证。Figma Make 是一种不同类型的编码工具。因为它完全在 Figma 中,所以您可以使用团队现有的设计构建块,轻松创建看起来不错、感觉真实并且与您的团队构建方式相连接的输出。停止花费大量时间向人们描述您的产品愿景,而是向他们展示。使用 Figma Make 快速创建代码原型和应用程序。请访问 figma.com/lenny 了解更多。

您知道我有一个完整的团队来帮助我制作播客和撰写时事通讯吗?我希望团队中的每个人都非常快乐,并在他们的岗位上茁壮成长。Just Works 知道您的员工不仅仅是您的员工,他们是您的人。我的团队分布在科罗拉多州、澳大利亚、尼泊尔、西非和旧金山。如果要在国际上招聘人员,按时以当地货币支付工资,并 24/7 回答他们的 HR 问题,我的生活将变得无比复杂。但有了 Just Works,一切都变得非常简单。无论您是设置自己的自动工资单、提供优质福利,还是进行国际招聘,JustWorks 都提供简单的软件和来自小型企业专家的 24/7 人工支持,为您和您的人员提供服务。他们正确地处理您的人力资源事务,以便您能正确地对待您的人员。Just Works 为您的人员服务。

[音乐]

Fay,非常感谢您来到这里,欢迎来到播客。

我很高兴来到这里,Lenny。

我更激动能邀请到您。能和您聊天真是太棒了。我想谈论很多事情。您一直处于我们现在看到的人工智能爆炸的中心,而且已经很长时间了。我们将讨论很多很多人甚至不知道的关于这一切如何开始的历史。但首先,让我读一段 Wyatt 对您的评价,这样大家就能有所了解,我会在介绍中分享您所做的所有其他史诗般的事情,但我认为这是一个很好的方式来设定背景。Fay 是一位极少数科学家中的一员,也许人数少到可以围坐在一张厨房桌子旁,他们是人工智能近期取得非凡进步的负责人。很多人称您为人工智能的教母。与许多人工智能领导者不同,您是一位人工智能乐观主义者。您不认为人工智能会取代我们。您不认为它会夺走我们所有的工作。您不认为它会杀死我们。所以,我想从那里开始,这会很有趣。您对人工智能将如何随着时间推移影响人类有什么看法?

是的。好的。Lenny,让我说清楚。我不是一个乌托邦主义者。所以,我并不是认为人工智能不会对就业或人们产生任何影响。事实上,我是一个人本主义者。我相信人工智能目前或将来所做的一切都取决于我们。取决于人们。所以我确实相信技术对人类来说是净收益。如果您看看文明的漫长历程,我认为我们本质上是一个创新的物种,您知道,如果您看看从几千年前的文字记录到现在,人类一直在不断地创新自己和创新我们的工具,通过这样做,我们让生活变得更好,我们让工作变得更好,我们构建文明,我相信人工智能是其中的一部分。所以,这就是乐观主义的来源。但我认为,每项技术都是一把双刃剑。而且,如果我们作为一个物种,作为一个社会,作为一个社区,作为一个个体,没有做正确的事情,我们也会搞砸。

我记得有一句话,我想那是您在向国会做报告时说的:“人工智能没有什么‘人造’的。它是受人启发,由人创造,最重要的是,它影响着人。” 我那里没有问题,但这是一个多么棒的一句话。

是的,我深有体会。您知道,我开始从事人工智能研究已经有二十五年了,过去二十年来我一直有学生。几乎每个从我实验室毕业的学生,我都会提醒他们,您知道,当他们从我的实验室毕业时,您的领域叫做人工智能,但它没有什么“人造”的。

回到您刚才提到的关于这一切如何取决于我们去向何方。您认为我们需要做对什么?我们如何才能走上正轨?我知道这是一个非常难回答的问题,但您有什么建议?您认为我们应该怎么做?

您有多少时间?我们如何统一人工智能?好了,我们来解决它。

另外,我认为人们应该成为负责任的个体,无论我们做什么。这就是我们教导孩子们的,这也是我们需要作为成年人去做的事情。无论您参与人工智能开发的哪个部分,人工智能的部署,还是人工智能的应用,而且很可能我们中的许多人,尤其是技术人员,都在多个环节中,我们都应该像负责任的个体一样行事,并且非常关心这件事,真的非常关心这件事。我认为今天每个人都应该关心人工智能,因为它将影响您的个人生活。它将影响您的社区。它将影响社会和子孙后代。作为一个负责任的人去关心它,这是第一步,也是最重要的一步。

好的。那么,让我退一步,回到人工智能的开端。大多数人开始听到并关心人工智能,就是它今天被称为的样子。就像,我不知道,几年前当 ChatGPT 出来的时候。也许是三年前。

三年前。几乎还有一个多月。三年前。

哇。好的。那是 ChatGPT 出来的时候。您心中想到的里程碑是那个吗?好的。太好了。我当时就是这么想的。但很少有人知道,有很长很长的历史,人们一直在研究它,当时叫做机器学习,还有其他术语,现在一切都叫人工智能了。曾经有一段很长的时间,很多人都在研究它,然后就有了所谓的“人工智能寒冬”,人们几乎放弃了,人们真的放弃了,心想“好吧,这个想法行不通了”,然后您所做的工作实际上就是让我们走出人工智能寒冬的火花,并直接促成了我们现在所处的这个世界,即人工智能是我们谈论的一切,正如您刚才所说,它将影响我们所做的一切。所以,我想听听您的讲述,关于 ImageNet 出现之前的世界是什么样的,然后您创建 ImageNet 的工作,为什么它如此重要,以及之后发生了什么。

对我来说,很难记住人工智能对每个人来说都如此新颖。我整个职业生涯都在人工智能领域,我的一部分就是看到我十几岁时开始的一个个人好奇心,现在已经成为我们文明的变革力量。它通常是一种文明级别的技术。所以,这段旅程大约有 30 年,或者二十几年,二十几年的时间,这让我感到非常满意。那么,这一切从哪里开始呢?嗯,我甚至不是第一代人工智能研究员。第一代可以追溯到 50 年代和 60 年代。您知道,艾伦·图灵在 40 年代就超越了时代,他大胆地向人类提出了一个问题:机器能否思考?当然,他有一种特定的方式来测试这种思考机器的概念,那就是一个对话聊天机器人,按照他的标准,我们现在拥有了思考机器,但这只是一个更具轶事性质的灵感。这个领域真正开始于 50 年代,当时计算机科学家们聚集在一起,研究如何使用计算机程序和算法来构建这些程序,使它们能够做那些只有人类认知才能做到的事情。所以,这就是开始,以及达特茅斯会议的奠基人,1956 年,您知道,我们有约翰·麦卡锡教授,他后来来到斯坦福,他创造了“人工智能”这个词。在 50 年代、60 年代、70 年代和 80 年代,这是人工智能探索的早期阶段,我们有逻辑系统,我们有专家系统,我们也有对神经网络的早期探索。然后到了 80 年代末、90 年代和 21 世纪初。大约 20 年的这段时间实际上是机器学习的开始。它是计算机编程和统计学习的结合。这种结合为人工智能带来了非常非常关键的概念,那就是纯粹基于规则的程序无法解释我们想象中计算机可以做的广泛的认知能力。所以,我们必须使用机器来学习模式。一旦机器能够学习模式,它就有希望做更多的事情。例如,如果您给它三只猫,希望不仅仅是让机器识别这三只猫。希望是机器能够识别第四只猫、第五只猫、第六只猫以及所有其他猫。这就是人类和许多动物都具备的基本学习能力。我们作为一个领域意识到我们需要机器学习。所以,这是直到 21 世纪初。我进入人工智能领域是在 2000 年。那时我在加州理工学院开始攻读博士学位。所以我成为了第一代机器学习研究员之一,我们已经在研究机器学习的概念,特别是神经网络。我记得我在加州理工学院的第一门课程之一叫做神经网络,但它非常痛苦。那正处于所谓的“人工智能寒冬”之中,这意味着公众没有太多关注,资金也不是很多,但也有很多想法在涌动。我认为有两件事促使我的职业生涯如此接近现代人工智能的诞生:一是,我选择通过视觉智能的视角来看待人工智能,因为人类是高度视觉化的动物。我们可以稍后多谈谈,但我们的许多智能都建立在视觉、感知、空间理解之上,而不仅仅是语言本身。我认为它们是互补的。所以我选择研究视觉智能,我的博士论文和早期的教授生涯中,我和我的学生们都非常致力于一个北极星问题,那就是解决物体识别问题,因为它是感知世界的基石。我们环顾世界,或多或少地在物体层面进行解释、推理和互动。我们不是在分子层面与世界互动。我们不是在……我们有时会与世界互动,但我们很少,例如,如果您想拿起一个茶壶,您不会说“好的,这个茶壶由 100 块瓷器组成,让我来处理这 100 块”,您会把它看作一个物体并与之互动。所以物体非常重要。因此,我成为了最早识别出这是北极星问题的研究人员之一。但我认为发生的是,作为人工智能的学生,然后是人工智能的研究员,我一直在研究各种数学模型,包括神经网络,包括贝叶斯网络,包括许多许多模型,但有一个共同的痛点是,这些模型没有数据可供训练。而且,我们作为一个领域非常专注于这些模型,但我想到了,人类的学习和进化实际上是一个大数据学习过程。人类通过大量的经验学习,您知道,不断地学习,而进化,如果您看看时间,动物通过体验世界来进化。所以我认为我和我的学生们推测,一个非常关键的被忽视的要素,是让人工智能栩栩如生的关键是大数据。然后我们在 2006 年、2007 年开始了 ImageNet 项目,我们非常有雄心壮志,我们想获取互联网上关于物体的所有图像数据。现在,当然,互联网比今天小得多,所以我觉得那个雄心壮志至少不算太疯狂。现在,让几个研究生和一个教授来做这件事是完全不切实际的。但我们确实这么做了。我们仔细整理了互联网上的 1500 万张图像。创建了一个包含 22,000 个概念的分类法,借鉴了其他研究人员的工作,比如语言学家在 WordNet 上的工作,这是一种特定的词典化单词的方式。我们将这些结合到 ImageNet 中,并将其开源给研究界。我们每年举办 ImageNet 挑战赛,鼓励每个人参与。我们继续进行自己的研究。但 2012 年是许多人认为深度学习开始或现代人工智能诞生的时刻,因为多伦多的一组研究人员,由杰夫·辛顿教授领导,参加了 ImageNet 挑战赛,使用了 ImageNet 大数据和英伟达的两块 GPU,成功创建了第一个神经网络算法,它并没有从根本上解决问题,但朝着解决物体识别问题取得了巨大进展。而这种技术三要素的结合——大数据、神经网络和 GPU——可以说是现代人工智能的黄金配方。然后快进到人工智能的公众时刻,也就是 ChatGPT 的时刻。如果您看看将 ChatGPT 推向世界的技术要素,它仍然使用了这三个要素。现在是互联网规模的数据,主要是文本,比 2012 年更复杂的神经网络架构,但它仍然是神经网络,还有更多的 GPU,但它仍然是 GPU。所以,这三个要素仍然是现代人工智能的核心。

太棒了。我以前从未听过这个完整的故事。我喜欢是两块 GPU,我喜欢,现在我不知道,成千上万块,对吧?比那强大几个数量级。而且那两块 GPU 是他们刚买的吗?它们是游戏 GPU 吗?就是人们玩游戏用的那种?

正如您所说,这在很大程度上仍然是模型变得更智能的方式。世界上一些增长最快的公司,我几乎都邀请他们来过播客,比如 Merkore 和 Surge 和 Scale,他们就是这样做的,他们继续为实验室提供越来越多的他们最感兴趣的标记数据。

是的,我记得 Scale 的 Alex Wong,很早的时候。他可能还保留着他开始 Scale 时的电子邮件。他非常友善,他一直给我发邮件,说 ImageNet 如何启发了 Scale。我很高兴看到这一点。

您刚才分享的另一个我最喜欢的收获是,这真是高能动性和“就去做吧”的典范。这在 Twitter 上有点像个梗。就是“就去做吧”。您只是想“好吧,这可能是推动人工智能发展的必要条件”,当时人们最常用的术语是机器学习,对吗?

我认为当时术语是可互换使用的。确实如此。我记得那些科技公司,我不会说出名字,但我曾经在一次早期谈话中,我想是在 2015 年中到 2016 年中,一些科技公司避免使用“人工智能”这个词,因为它们不确定人工智能是否是一个贬义词。我记得我当时鼓励大家使用“人工智能”这个词,因为对我来说,这是人类在科学技术探索中最大胆的问题之一,我为此感到非常自豪。但是的,一开始有些人不确定。

人工智能是什么时候被开发的,大概是什么年份?我想是 2016 年。

不到 10 年前。

那是转折点,就像……有些人开始称之为人工智能,但我认为如果您看看硅谷的科技公司,如果您追溯它们的营销术语,我认为大约在 2017 年,公司开始自称为人工智能公司。

这太不可思议了,世界变化得如此之快。现在您不能不称自己为人工智能公司。

我知道。

九年左右之后。

是的。

哦,天哪。好的。关于早期历史,还有什么您认为人们不知道但您认为很重要的吗?在我们聊聊您正在做的工作以及未来发展之前。

我认为就像所有历史一样,您知道,我敏锐地意识到我被认可为历史的一部分,但有如此多的英雄和如此多的研究人员。我们谈论的是几代研究人员。您知道,在我自己的领域,有很多人启发了我,我在我的书中也谈到了。但我确实觉得我们的文化,尤其是硅谷,倾向于将成就归功于一个人。虽然这有价值,但它只是需要被记住。人工智能是一个拥有 70 年历史的领域,我们已经经历了许多代。没有人能够独自走到这一步。

好的。那么我问您这个问题。感觉我们总是在 AGI 的边缘。这个人们随意使用的模糊术语。AGI 即将到来。它会接管一切吗?您如何看待我们离 AGI 还有多远?您认为我们会在目前的轨迹上实现它吗?您认为我们需要更多的突破吗?您认为当前的方法能让我们实现它吗?

是的,这是一个非常有趣的术语,Lenny。我不知道是否有人定义过 AGI。您知道,有很多不同的定义,包括,您知道,某种超级能力给机器,一直到机器能否成为社会中经济上可行的代理人。换句话说,赚取工资来生活。这就是 AGI 的定义吗?作为一个科学家,我非常认真地对待科学,我进入这个领域是因为我受到“机器能否像人类一样思考和做事”这个大胆问题的启发。对我来说,这始终是人工智能的北极星。从这个角度来看,我不知道人工智能和 AGI 之间有什么区别。我认为我们在实现目标的一部分方面做得非常好,包括对话式人工智能,但我认为我们还没有完全征服人工智能的所有目标。而且我认为我们的奠基人,艾伦·图灵,我想知道艾伦·图灵今天是否还在,如果您问他如何区分人工智能和 AGI,他可能会耸耸肩说:“我早在 40 年代就问过同样的问题了。” 所以,我不想陷入定义人工智能与 AGI 的泥潭。我认为 AGI 更像是一个营销术语,而不是一个科学术语。作为一个科学家和技术人员,人工智能是我的北极星,是我领域的北极星,我很高兴人们称它为任何他们想称的名字。

那么,让我换个方式问您。您描述了从 ImageNet 和 AlexNet 到今天的一些组成部分。GPU,基本上是数据,标记数据,就像算法模型一样。Transformer 似乎也是那个轨迹上的一个重要步骤。您觉得这些是让我们达到……我不知道,10 倍更智能的模型,能够改变整个世界的组成部分吗?还是您认为我们需要更多的突破?我知道我们要谈论世界模型,我认为这是其中的一个组成部分,但您认为还有什么会停滞不前,或者“好吧,这只需要更多的数据,更多的计算,更多的 GPU。”

哦,不,我绝对认为我们需要更多的创新。我认为扩展更多的模型,更多的数据,更多的 GPU 和更大的当前模型架构,还有很多工作要做。但我绝对认为我们需要更多的创新。在人类历史上,没有一个纯粹的科学学科曾说过“我们完成了。我们完成了创新。” 而人工智能是人类文明中最年轻的科学和技术学科之一,如果不是最年轻的话。我们才刚刚开始触及表面。例如,就像我说的,今天我们将过渡到世界模型。您拿一个模型,然后通过几间办公室的视频运行它,然后让模型计算椅子的数量。这是蹒跚学步的孩子就能做到的事情,或者也许是小学生就能做到的事情,而人工智能却做不到,对吧?所以,今天的人工智能还有很多做不到的事情,更不用说思考艾萨克·牛顿是如何观察天体运动并推导出控制所有天体运动的方程或一组方程的,那种创造力、外推能力、抽象能力,我们今天无法让人工智能做到这一点。然后,让我们看看情商。如果您看到一个学生走进老师的办公室,谈论动力、热情、学什么、什么问题真正困扰着您。即使是今天最强大的对话机器人,您也无法从今天的人工智能那里获得那种情商和认知智能。所以,我们还有很多可以做得更好的地方。而且,我不认为我们已经完成了创新。

Demis 最近在 DeepMind Google 有一个非常有趣的采访,有人问他,您认为我们离 AGI 还有多远?它看起来会是什么样子?他有一个非常有趣的方法来处理这个问题,那就是如果我们给最先进的模型提供直到 20 世纪末的所有信息,看看它能否得出爱因斯坦所有的突破。到目前为止,我们离那还很远。

不,我们还差得很远。事实上,情况更糟。让我们给人工智能所有的数据,包括牛顿没有的现代天体仪器数据,然后让它创建 17 世纪的关于天体运动定律的方程组。今天的人工智能做不到。

好的,我听到的意思是,我们还有很长的路要走。

是的。

好的,那么让我们来谈谈世界模型。对我来说,这是您领先于人们的另一个非常惊人的例子。您在“我们需要大量干净的数据供人工智能和神经网络学习”这一点上一直领先。您一直在谈论世界模型这个想法很长时间了。您创办了一家公司来构建……基本上有语言模型。这是一个不同的东西。这是一个世界模型。我们将讨论它是什么。现在,当我准备这次采访时,埃隆(Elon)在谈论世界模型,詹森(Jensen)也在谈论世界模型。我知道谷歌也在研究这些东西。您已经研究了很长时间了。而且您刚刚推出了一些东西,我们将在播客播出之前就进行讨论。谈谈什么是世界模型?为什么它如此重要?我非常兴奋地看到越来越多的人像埃隆、像詹森一样谈论世界模型。我一生都在思考如何推动人工智能向前发展,对吧?过去几年出现的语言模型,以及来自 OpenAI 和所有这些研究领域的模型,即使对我这样的研究人员来说,也极具启发性。我记得 GPT-2 出来的时候,我想是在 2020 年底。当时我是斯坦福以人为本人工智能研究所的联合主任,我仍然是,但当时我是全职联合主任。我记得当时公众还没有意识到大型语言模型的威力,但作为研究人员,我们看到了它,我们看到了未来。我和我的自然语言处理同事,比如 Percy Leang 和 Chris Batting,进行了很长时间的谈话,我们谈论这项技术将是多么关键。斯坦福人工智能研究所,以人为本人工智能研究所,HI 是第一个建立完整研究中心——基础模型。Percy Le Young 和许多研究人员领导了第一篇学术论文——基础模型。所以,这对我来说非常有启发性。所以,当然,我来自视觉智能领域,我一直在想,除了语言之外,我们还有很多可以推动的,因为人类……人类利用我们的空间智能和世界理解能力做了很多事情,而且它们超越了语言。想想一个非常混乱的紧急响应现场,无论是火灾、交通事故还是自然灾害。如果您沉浸在这些场景中,想想人们如何组织起来去营救人员,阻止进一步的灾难,扑灭大火,很多都是动作,是对物体、世界、人类情境意识的自发理解。语言是其中的一部分。但很多情况下,语言无法帮助您扑灭大火。所以,那是什么?我一直在思考很多,与此同时,我一直在做很多机器人研究,然后我想到,连接除了语言之外的附加智能,连接具身人工智能(也就是机器人),连接视觉智能的关键是这种空间智能,关于理解世界。那时,我想,我在 2024 年做了一个 TED 演讲,关于空间智能和世界模型,我从 2022 年开始形成这个想法,基于我的机器人和计算机视觉研究。然后有一件事对我来说非常清楚,那就是我真的想与最聪明的技术人员合作,并尽快将这项技术变为现实。那时我们创立了一家名为 World Labs 的公司。您可以看到“世界”这个词在我们的公司名称中,因为我们非常相信世界建模和空间智能。

人们习惯了聊天机器人,那是大型语言模型。所以,简单理解世界模型的方法是,您基本上描述一个场景,它会生成一个可以无限探索的世界。我们将链接到您发布的东西,我们将讨论它,但这是简单的理解方式吗?

那是其中的一部分,Lenny。我认为简单理解世界模型的方法是,这个模型可以让任何人通过提示来创造他们脑海中的任何世界,无论是图像还是句子,并且还能够在其中进行互动。无论您是在浏览、行走,还是拾取物体,或者改变事物,以及在这个世界中进行推理。例如,如果消费这个世界模型输出的代理人是一个机器人,它应该能够规划它的路径,并帮助您……例如,整理厨房。所以,世界模型是一个基础,您可以用来推理、互动和创造世界。

好的。是的。所以,机器人似乎是人工智能研究人员的下一个重大焦点,以及对世界的影响。您在这里说的是,这是让机器人真正能在现实世界中工作的关键缺失环节。理解世界如何运作。

是的。嗯,首先,我认为还有比机器人更令人兴奋的事情。所以,但我同意您刚才所说的一切。我认为世界建模和空间智能是具身人工智能的关键缺失环节。我还认为,不要低估人类是具身代理人,并且人类可以通过人工智能的智能得到增强,就像今天人类是语言动物一样,但我们在人工智能的帮助下得到了极大的增强,例如帮助我们……您知道,做语言任务,包括软件工程。我认为,我们不应该低估,或者也许是我们倾向于不谈论,人类作为具身代理人如何能从世界模型和空间智能模型中受益,机器人也是如此。所以,这里的大突破是机器人,这是一个巨大的交易。如果这成功了,想象一下我们每个人都有机器人为我们做很多事情。它们进入……它们帮助我们应对灾难,诸如此类的事情。游戏显然是一个非常酷的例子。就像您可以凭空发明无限可玩的游戏。然后是创造力,感觉就像是玩得开心,富有创造力,构思出全新的世界和环境。

还有设计。人类设计从机器到建筑再到房屋,还有科学发现,对吧?有很多……我喜欢用 DNA 结构发现的例子。如果您看看 DNA 发现历史中最重要的部分之一是罗莎琳·富兰克林拍摄的 X 射线衍射照片,那是一张二维照片,看起来像一个带有衍射的十字。您可以……您可以谷歌搜索那些照片。但有了那张二维平面照片,人类,尤其是两位重要人物,詹姆斯·沃森和弗朗西斯·克里克,除了他们的其他信息之外,能够进行三维空间推理,并推导出 DNA 的高度三维双螺旋结构。而那个结构不可能是二维的。您不能用二维思考并推导出那个结构。您必须用人类的空间智能进行三维空间思考。所以我认为即使在科学发现中,空间智能或人工智能辅助的空间智能也是至关重要的。

这真是个例子,我想是克里斯·迪克森(Chris Dixon)说过这样一句话,下一个大事物将从感觉像玩具开始。当 ChatGPT 刚出来的时候,就像我记得萨尔曼(Salman)发推说“这里有个我们正在玩得很酷的东西,看看吧。”现在它是历史上增长最快的产品,改变了世界。

是的。

而且往往是那些看起来“这很有趣”的东西,玩起来很开心,最终却改变了世界最多。

是的。

本期节目由 Cinch 提供,客户通信云。关于数字客户通信,有件事很重要。无论您是发送营销活动、验证码还是账户提醒,您都需要它们可靠地送达用户。这就是 Cinch 的用武之地。超过 150,000 家企业,包括全球排名前 10 的科技公司中的八家,都使用 Cinch 的 API 将消息、电子邮件和电话集成到他们的产品中。而且,消息传递领域正在发生一件大事,产品团队需要了解。富通信服务,或称 RCS。将 RCS 视为 SMS 2.0。您的用户将看到您经过验证的公司名称和徽标,而无需下载任何新内容,而不是从随机号码收到短信。这是一种更安全、更具品牌化的体验。此外,您还可以获得交互式轮播和建议回复等功能。而这为什么重要呢?美国运营商已开始采用 RCS。Cinch 已经在帮助各大品牌在全球发送 RCS 消息,并且他们正在帮助 Lenny 的播客听众在美国市场出现高峰之前抢先注册。请访问 cinch.com/lenny 了解更多。那就是 s i nch.com/lenny。

我联系了本·霍洛维茨(Ben Horowitz),他非常喜欢您所做的工作。是您的忠实粉丝。他们是投资者,我想。

是的,我们认识很多年了,但是的,现在他们是 Warlaps 的投资者。

太棒了。好的。所以我问他我应该问您什么,他建议我问您为什么“苦涩的教训”单独不太可能在机器人领域奏效。所以,首先,请解释一下人工智能历史上的“苦涩的教训”是什么,然后解释为什么这不会让我们在机器人领域达到我们想要的目标。

嗯,首先,有很多苦涩的教训,但大家所说的“苦涩的教训”是理查德·萨顿(Richard Sutton)写的一篇论文,他最近获得了图灵奖,他做了很多强化学习方面的工作。理查德说,如果您看看历史,尤其是人工智能的算法发展,结果发现,简单模型加上大量数据最终总是会获胜,而不是……您知道,更复杂的模型加上较少的数据。我的意思是,这篇论文是在 ImageNet 之后很多年才出现的,对我来说,那不是苦涩的,而是甜蜜的教训,这就是为什么我构建了 ImageNet,因为我相信大数据起到了这种作用。那么,为什么“苦涩的教训”单独在机器人领域不起作用呢?嗯,首先,我认为我们需要承认我们今天所处的机器人领域还处于非常早期的实验阶段。它的研究远不如语言模型成熟。所以,很多人仍在试验各种算法,其中一些算法是由大数据驱动的。所以我确实认为大数据将继续在机器人领域发挥作用。但是机器人领域很难,有几件事。一是获取数据更难,获取数据要难得多。您可以说,嗯,有网络数据,这是最新的机器人研究使用网络视频的地方,我认为网络视频确实起到了作用。但是,如果您想想是什么让语言模型奏效。作为一个从事计算机视觉、空间智能和机器人研究的人,我非常嫉妒我的语言学同事,因为他们有一个完美的设置,他们的训练数据是单词,最终是标记,然后他们产生一个输出单词的模型。所以,您希望得到的东西(我们称之为目标函数)和您的训练数据看起来非常一致。但机器人领域不同。即使是空间智能也不同。您希望从机器人那里得到动作。但您的训练数据缺乏 3D 世界中的动作。而这正是机器人必须做的,对吧?3D 世界中的动作。所以,您必须……找到不同的方法来……他们称之为……将一个圆形的洞塞进一个方形的孔里。我们拥有大量的网络视频。所以,我们必须开始谈论……添加补充数据,例如远程操作数据或合成数据,以便机器人能够根据“苦涩的教训”这一假设进行训练,即大量数据。我认为仍然有希望,因为即使是我们正在做的……世界建模将真正解锁机器人领域的许多信息。但我认为我们必须小心,因为我们正处于这个领域的早期阶段,“苦涩的教训”仍有待检验,因为我们还没有完全弄清楚数据。关于机器人“苦涩的教训”的另一部分,我认为我们应该非常现实的是,再次与语言模型或甚至空间模型相比,机器人是物理系统。所以,机器人比大型语言模型更接近于自动驾驶汽车。这一点非常重要。这意味着,为了让机器人工作,我们不仅需要大脑,还需要物理身体,还需要应用场景。如果您看看自动驾驶汽车的历史……我的同事塞巴斯蒂安·特伦(Sebastian Thrun)在 2006 年或 2005 年带领斯坦福的汽车赢得了第一次 DARPA 挑战赛。从 2005 年原型自动驾驶汽车能够在内华达沙漠中行驶 130 英里,到现在在旧金山街头的 Waymo,已经 20 年了,我们还没有完成。还有很多工作要做。所以,这是一段 20 年的旅程。而且自动驾驶汽车是更简单的机器人。它们只是在二维表面上运行的金属盒子。目标是不要触摸任何东西。机器人是运行在三维世界中的三维物体,目标是触摸东西。所以,旅程将是……您知道,有很多方面和元素。当然,有人可能会说,自动驾驶汽车的早期算法是在深度学习时代之前的。所以,深度学习正在加速……大脑,我认为这是真的。这就是为什么我在机器人领域。这就是为什么我在空间智能领域,我对此感到兴奋。但与此同时,汽车行业非常成熟,产品化还涉及成熟的用例、供应链、硬件。所以,我认为这是一个非常有趣的时间来解决这些问题。但本说得对,我们可能仍然会受到一些“苦涩的教训”的影响。

做这项工作时,您是否会因为大脑的工作方式以及它能为我们做到这一切而感到敬畏?仅仅是让一台机器能够四处走动而不撞到东西或摔倒的复杂性。这是否让您对我们已经拥有的东西更加钦佩?

完全正确。我们大约只消耗 20 瓦的功率。这比我现在的房间里的任何一个灯泡都暗。但我们却能做这么多事情。所以,我认为,我越是从事人工智能工作,就越是尊重人类。

让我们来谈谈您刚刚推出的这个产品。它叫 Marble。一个非常可爱的名字。谈谈这是什么,为什么它很重要。我一直在玩它。它太棒了。我们将链接到它,以便大家可以去看看。Marble 是什么?

是的,我非常兴奋。首先,Marble 是 World Labs 推出的首批产品之一。World Labs 是一家基础前沿模型公司。我们由四位联合创始人创立,他们拥有深厚的技术历史。我的联合创始人 Justin Johnson、Kristoff Lassner 和 Ben Mildenhal。我们都来自人工智能、计算机图形学、计算机视觉的研究领域。我们相信空间智能和世界建模与语言模型同等重要,甚至更重要,并且与语言模型互补。所以,我们想抓住这个机会,创建一个深度技术研究实验室,能够连接前沿模型与产品之间的点。所以,Marble 是一个建立在我们前沿模型之上的应用程序。我们花了一年多的时间构建了世界上第一个生成模型,能够输出真正意义上的 3D 世界。这是一个非常非常困难的问题。而且,这是一个非常艰难的过程。我们拥有一支由令人难以置信的技术人员组成的创始团队,他们来自……您知道,令人难以置信的团队。然后,大约在一两个月前,我们第一次看到,我们可以通过一个句子、一张图像和多张图像来创建我们可以导航的世界。如果您将其放在 Google 上,我们有一个选项可以让您这样做,您甚至可以四处走动,对吧?所以,尽管我们已经构建了很长时间,但它仍然令人惊叹,我们希望将其交到需要它的人手中。然后,我们知道有如此多的创作者、设计师、考虑机器人模拟的人、考虑可导航、可交互、沉浸式世界的不同用例的人、游戏开发者会发现它很有用。所以,我们开发了 Marble 作为第一步。它仍然非常早期,但它是世界上第一个做到这一点的模型,也是第一个允许人们通过提示来创建世界的、我们称之为“提示到世界”的产品。

我一直在玩它。这太疯狂了。就像您可以拥有一个小的世界,在那里您可以无限地漫步在中土世界,基本上。而且那里还没有人,但它太疯狂了。您可以去任何地方。有像反乌托邦世界。我只是在看所有这些例子。

是的。我最喜欢的部分实际上是,我不知道,我不知道这算不算一个功能或一个 bug,您可以看到世界在渲染出所有纹理之前的点。我只是喜欢……您可以看到这个模型正在做什么的片段。基本上是创建。

听到这个真是太好了,因为作为研究人员,我……

我正在学习,因为那个那个那个那个引导你进入世界的点是一个故意的特征,嗯,可视化。它不是模型的一部分。它,嗯,模型实际上只是生成世界。我们我们正在试图找到一种引导人们进入世界的方式,并且有许多工程师,嗯,尝试了不同的版本,但我们最终选择了那个点,所以很多人,你不是唯一一个告诉我们那个体验多么令人愉悦的人,而且我们听到这个故意的可视化特征,它不仅仅是那个庞大的硬核模型,实际上让我们的用户感到高兴,这让我们感到非常满意。>> 哇。所以,你添加这个是为了让它更,嗯,让人们更容易理解正在发生的事情,获得更多乐趣。哇,这太搞笑了。这让我想起了 LM 以及他们谈论他们正在思考和正在做的事情的方式。这不一样,但他们谈论他们正在思考和正在做的事情。>> 是的,就是这样。就是这样。>> 这也让我想起了《黑客帝国》。就像,这完全是《黑客帝国》的体验。我不知道那是否是你的灵感。>> 嗯,正如我所说,有许多工程师为此工作。这可能是他们的灵感。它在他们的,嗯,它在他们的,嗯,它在他们的潜意识里。>> 是的。>> 好的。所以,只是为了那些可能想玩这个,也许使用它的人。今天有哪些应用是人们可以开始使用的?你这次发布的目的是什么?>> 是的。所以,嗯,我们确实相信世界建模是非常横向的,但我们已经看到了一些非常令人兴奋的,嗯,用例。电影的虚拟制作,因为他们需要的是 3D,嗯,世界,他们可以将其与摄像机对齐,这样当演员在上面表演时,嗯,他们可以,你知道,他们可以,嗯,定位摄像机并很好地拍摄那些片段,而且,嗯,我们已经看到了,嗯,令人难以置信的使用。事实上,我不知道你是否看过我们的发布视频,展示了 Marble,它是由一家虚拟,嗯,制作公司制作的。我们与索尼合作,他们使用 Marble 来拍摄那些视频。所以,我们与那些,嗯,嗯,技术艺术家和导演合作,他们说这已经将我们的,嗯,制作时间缩短了,嗯,40 倍。事实上,它已经翻倍了。>> 是的。事实上,我不得不这样做,因为我们只有一个月的时间来完成这个项目,而且他们试图拍摄的东西太多了。所以,所以使用 Marble 确实确实显著加快了虚拟,嗯,用于 VFX 和电影的虚拟制作。这是一个用例。我们已经看到我们的用户正在使用,嗯,正在使用我们的 Marble 场景并导出网格,并将其放入游戏中,你知道,无论是 VR 游戏还是游戏,嗯,只是,只是他们开发的有趣游戏,我们已经有了,嗯,我们正在展示,嗯,一个机器人模拟的例子,因为,嗯,当我,我的意思是,我仍然是一名研究员,从事机器人,嗯,训练。最大的痛点之一是为机器人训练创建合成数据。而这些合成数据需要非常多样化。它们需要来自不同的环境,具有不同的可操作对象。而且,嗯,而且其中一条途径是,是要求,嗯,计算机进行模拟。否则,人类就必须,你知道,为机器人构建每一个资产。那将需要更长的时间。所以我们已经有研究人员联系我们,并希望使用 Marble 来创建这些合成环境。我们还收到了意想不到的,嗯,用户,嗯,联系,关于他们想如何使用 Marble。例如,一个心理学家团队联系我们,希望使用 Marble 来进行心理学研究。事实证明,他们研究的一些精神病患者需要了解他们的大脑如何响应具有不同特征的不同沉浸式场景。嗯,例如,混乱的场景或干净的场景,或者,或者随便你怎么说。研究人员很难获得,嗯,这种沉浸式场景。而且它们需要太长时间和太多预算才能,嗯,才能创建。而 Marble 确实几乎是即时地将如此多的这些,嗯,实验,嗯,环境交到他们手中。所以,我们正在看到,嗯,嗯,我们正在看到多个用例,但,嗯,VFX,游戏开发者,模拟,嗯,嗯,开发者以及设计师都非常兴奋。>> 这非常符合 AI 的运作方式。我的播客上还有其他 AI 领导者,他们总是说尽早推出事物,尽快推出,以发现最大的用例。ChatGPT 的负责人告诉我,当他们第一次推出 ChatGPT 时,他只是在 TikTok 上扫描,看看人们是如何使用它的,以及他们谈论的所有事情,这就是说服他们应该在哪里投入并帮助他们看到人们实际上想如何使用它。我喜欢最后一个用例,比如用于治疗。我只是想象一下,比如恐高症,人们看到处理恐高症或蛇或蜘蛛,这>> 太棒了。我的一位朋友昨晚真的给我打电话,谈论了他的恐高症,并问我是否应该使用 Marble。太棒了。你直接就想到了。>> 那是,你知道,因为我正在想象所有的,嗯,暴露疗法,嗯,这类东西对它来说会非常好。嗯,这太酷了。好的,所以,让我,我应该早点问你这个,但我想有一个问题,就是这与 V3 和其他视频生成模型有什么不同?对我来说很清楚,但我想解释一下这与人们已经看到的各种视频 AI 工具有什么不同可能会有帮助。>> Worldlab 的论点是,空间智能从根本上非常重要,而空间智能不仅仅是,嗯,嗯,不仅仅是关于视频。事实上,世界不是被动地观看视频流过,对吧?嗯,我喜欢柏拉图的洞穴寓言来描述视觉。他说,想象一个囚犯被绑在椅子上,嗯,不是非常,嗯,人道,但是,嗯,嗯,在一个洞穴里,嗯,看着一个全景戏剧,嗯,在他面前。但是,嗯,实际的现场戏剧,演员们正在表演,就在他的身后。它只是被照亮了,所以,嗯,行动的投影,嗯,在洞穴的一面墙上,而且,嗯,目标,这个囚犯的任务是弄清楚发生了什么。这是一个相当极端的例子,但它确实显示了,它描述了视觉是什么。就是说,要理解 3D 世界或 4D 世界,从 2D 中理解。所以,对我来说,空间智能比拥有创造那个扁平的 2D 世界更深。对我来说,空间智能是创造、推理、互动、理解深度空间世界的能力,无论是 2D 还是 3D 还是 4D,包括动态等等。所以,所以 World Lab 专注于此。当然,嗯,生成视频本身的能力,可以是其中的一部分。事实上,嗯,就在几周前,我们推出了世界上第一个,嗯,实时演示的实时视频生成,在单个,嗯,H100 GPU 上。所以,我们,我们的一部分技术包括这个。但我认为 Marble 非常不同,因为我们真的希望创作者、设计师、开发者手中有一个模型,可以为他们提供,嗯,具有 3D 结构的 3D 世界,这样他们就可以为他们的工作使用它。这就是为什么 Marble 如此不同的原因。>> 我认为它是,它是一个平台,提供了大量的机会去做事情。嗯,正如你所描述的,视频就像,这里有一个一次性的视频,非常有趣和酷,你可以,而且就是这样,就是这样,然后你继续前进。>> 顺便说一句,我们在 Marble 中可以允许人们导出为视频格式。所以你实际上可以,正如你所说,你进入一个世界。所以,所以,假设它是一个霍比特人,嗯,洞穴,你实际上,特别是作为一个创作者,你有一个非常,嗯,特定的方式来,嗯,嗯,移动摄像机,沿着导演心中的轨迹,对吧?然后你可以将它导出,嗯,从 Marble 到视频。>> 创建这样的东西需要什么?就像团队有多大?有多少,嗯,GPU 你在工作?就像你能分享的任何东西?我不知道有多少是私人信息,但你在这里发布的东西需要什么?>> 需要很多脑力。所以,我们只谈论每人 20 瓦。它是,嗯,所以从这个角度来看,它是一个很小的数字,但但它实际上是令人难以置信的,你知道,这是半十亿年的进化才赋予我们这些力量。嗯,我们现在有大约 30 人的团队,而且,嗯,我们主要是,嗯,研究人员和研究工程师,而且,嗯,但我们也有设计师和,嗯,产品。我们确实真正相信我们想创建一个公司,它植根于空间智能的深度技术,但是,嗯,我们实际上正在构建严肃的产品。嗯,所以,所以我们有,我们有这个,嗯,研发和产品化的整合,当然,我们使用,你知道,大量的 GPU。那是,那是技术上的。>> 我很高兴听到。>> 好吧,恭喜发布。我知道这是一个巨大的里程碑。我知道这花了很多功夫。所以,我只想祝贺你和你的团队。>> 让我谈谈你的创始人历程。所以,你是这家公司的创始人。你开始了多少年前?几年前,两三年。>> 哦,一年前。一年前。>> 一年。好的。>> 18 个月。是的。>> 好的。>> 有什么事情是你希望在开始之前就知道的,你希望能够,嗯,耳语给 18 个月前的 Fay?>> 嗯,我继续希望我知道技术的未来。我认为实际上这是我们创始的优势之一,我们通常比大多数人更早看到未来。但仍然,男人,这太令人兴奋了,太,嗯,令人惊叹了,未知和即将到来的是什么。但我知道你问我这个问题的原因不是关于技术的未来。你可能更,你知道,看,我,我 20 岁时没有创办过这么大规模的公司。所以,你知道,我 19 岁时开了一家干洗店,但那规模小一些。我们得谈谈那个。>> 然后,我,嗯,创办了 Google Cloud AI,然后我在斯坦福大学创办了一个研究所,但那些是不同的。我确实觉得我作为,嗯,创始人,比,嗯,也许,嗯,嗯,20 岁的创始人,对那种艰苦的旅程,嗯,我,嗯,准备得更充分。但我仍然感到惊讶,而且,而且,嗯,有时让我感到偏执的是,AI 的竞争格局有多么激烈,从模型本身的技术,以及人才。而且,你知道,当我创办公司时,嗯,我们没有这些关于某些人才需要花费多少钱的令人难以置信的故事,你知道,嗯,所以这些事情继续让我感到惊讶,而且,而且我必须对此非常警惕。>> 所以你说的竞争是,是的,人才的竞争,事物发展的速度。>> 是的。>> 是的。你提到了这一点,我想回来谈谈,如果你回顾你的整个职业生涯。你就像在所有主要的,嗯,人类群体中,这些群体促成了今天发生的许多突破。显然,我们谈到了 ImageNet,还有斯坦福大学的 SAIL,那里发生了许多工作,还有 Google Cloud,那里发生了许多突破。是什么让你去了那些地方?嗯,就像对于那些想在职业生涯中取得进步,站在未来中心的人来说,就像那里有没有一条主线,是什么把你从一个地方带到另一个地方,把你带入那些群体,可能对人们有帮助?>> 是的,这实际上是一个很棒的问题,Lenny,因为我确实在思考它,而且,嗯,显然我们谈到了好奇心和热情,这让我进入了 AI。那是一个更科学的北极星,对吧?我不在乎 AI 是不是一个东西。所以,所以那是其中一部分。但是我是如何最终选择,嗯,在我工作的特定地方,包括创办 World Labs,我认为我非常感激我自己,或者也许是我父母的基因。我,我是一个在智力上非常无畏的人,我必须说,当我雇佣年轻人时,我寻找的就是这个,因为我,嗯,我认为这是一个非常重要的品质,如果一个人想做出改变,那就是当你想要做出改变时,你必须接受你正在创造新的东西,或者你正在深入研究新的东西。人们还没有这样做过。如果你有这种自我意识,你几乎必须允许自己无所畏惧,并且勇敢。所以,当我,例如,嗯,来到斯坦福大学时,你知道,在学术界,我非常接近所谓的终身教职,嗯,那就是,你知道,在普林斯顿大学永远拥有这份工作。但我,我选择,选择来到斯坦福大学,因为我爱普林斯顿大学。这是我的母校。只是在那一刻,斯坦福大学有一些非常了不起的人,硅谷的生态系统也非常了不起,所以我愿意冒着重新开始我的终身教职时钟的风险。嗯,成为 SAIL 的第一位,嗯,女性主任。我当时相对来说是一名非常年轻的教员,我想这样做,因为我关心那个社区。我没有花太多时间考虑所有的失败案例。显然,我很幸运,更资深的教员支持我,但我只是想做出改变。然后去 Google 也是类似的。我想和 Jeff Dean、Jeff Hinton 以及,嗯,所有这些了不起的 Dennis、嗯,了不起的人一起工作。嗯,我,你知道,所以,所以 World Labs 也是如此。我,我有一种热情,而且我也相信拥有相同使命的人可以做令人难以置信的事情。所以,这就是它如何指导我的人生。我不会过度思考所有可能出错的事情,因为那太多了。>> 我觉得这是其中的一个重要方面,就是不关注负面因素,更多地关注人、使命。什么让你兴奋?你认为呢?嗯,我确实,是的,我想对所有 AI 领域的年轻人才,工程师,研究人员说一句话,因为你们中的一些人申请了 World Labs。我感到非常荣幸你们考虑了 World Labs。我确实发现今天的许多年轻人都在考虑工作的每一个方面。也许,你知道,也许,也许他们想这样做。但有时我确实想鼓励年轻人专注于重要的事情,因为我发现自己,嗯,在与求职者交谈时,我不断处于指导模式。不一定是招聘或不招聘,而只是处于指导模式。当我看到一个令人难以置信的年轻人才,他过度关注考虑一份工作的每一个细微的维度和方面,而也许最重要的事情是你的热情在哪里?你是否认同使命?你是否相信并信任这个团队?而且,而且只是,只是专注于你能够产生的影响,以及你能够与之一起工作的类型的工作和团队。>> 是的,这很难。现在 AI 领域的人们很难。他们身上有太多东西,太多的新闻,太多的事情发生,太多的 FOMO。>> 这是真的。>> 我能感觉到压力。所以,我认为这个建议非常重要。就像什么会让你真正感到满足,而不仅仅是哪里是增长最快的公司?谁会赢?我不知道。我想确保我问你关于你今天在斯坦福大学 HAI 的工作。我认为是 HAI,以人为本的 AI 研究所。>> 你在那里做什么?我知道这仍然是你做的事情。>> 是的,我,HAI,以人为本的 AI 研究所是由我和一群教员共同创立的,比如,嗯,John Hendy 教授、James Landy 教授、嗯,Chris Manning 教授,早在 2018 年。我当时正在 Google 完成我的最后一个,最后一个休假。嗯,对我来说,这是一个非常非常重要的决定,因为我本可以留在行业,但我在 Google 的时间教会了我一件事,那就是 AI 将是一项文明技术,而且,嗯,它让我意识到这对人类有多么重要,以至于我实际上在那一年,2018 年,在《纽约时报》上发表了一篇文章,谈论需要一个指导框架来开发和应用 AI,而这个框架必须以人类的仁慈为基础,以人为中心,我觉得斯坦福大学,嗯,世界上顶尖的大学之一,位于硅谷的心脏地带,孕育了从 Nvidia 到 Google 的重要公司,应该,嗯,成为思想领袖,嗯,来创建这个以人为中心的 AI 框架,并且,嗯,实际上将其体现在我们的研究、教育和政策以及生态系统工作中。所以,我创立了 HAI,嗯,你知道,快进到六七年后,它已经成为世界上最大的 AI 研究所以人为中心,嗯,嗯,研究、教育、生态系统外展和政策,嗯,在,嗯,影响方面。嗯,它涉及斯坦福大学所有八个学院的数百名教员,从医学到教育到可持续发展到商业到工程到人文到,嗯,法律,而且,嗯,我们,我们支持研究人员,特别是在数字经济到,嗯,法律研究到政治科学到新药发现等跨学科领域。嗯,到新的算法,嗯,超越 Transformer。我们还非常注重,嗯,嗯,政策,因为当我们开始 HAI 时,我意识到硅谷没有与华盛顿特区或布鲁塞尔或其他地区进行交流,而且,鉴于这项技术的重要性,我们需要让每个人都参与进来。所以,我们创建了多个项目,从国会训练营到,嗯,AI 指数报告到政策简报,我们特别参与了政策制定,包括,嗯,倡导一项国家 AI 研究云法案,该法案在特朗普政府第一任期内获得通过,并参与了州级,嗯,监管 AI 的讨论。所以,我们做了很多事情,而且,我继续是,嗯,领导者之一,即使我不再像以前那样积极参与运营,因为我不仅关心我们创造这项技术,还关心我们以正确的方式使用它。>> 哇。我不知道你还在做所有那些其他工作。嗯,你说话的时候,我想起了查理·芒格的一句名言,抓住一个简单的想法,并认真对待它。我觉得你以多种方式做到了这一点,并且坚持了下来,而且你多年来在许多方面产生的巨大影响是令人难以置信的。我将跳过闪电战,我只会问你最后一个问题。你还有什么想分享的吗?还有什么想留给听众的吗?>> 我,我非常兴奋 AI,Lenny。嗯,我想回答一个问题,当我周游世界时,每个人都问我,我是音乐家吗?我是中学老师吗?我是护士吗?我是会计师吗?我是农民吗?我在 AI 中有角色吗?还是 AI 只是要接管我的生活或我的工作?我认为这是 AI 最重要的问题。而且我发现,在硅谷,我们倾向于不与像我们这样的人,以及不像我们这样的人在硅谷进行心与心的交流,而是像我们所有人一样,我们倾向于只是抛出诸如无限生产力或无限闲暇时间或,你知道,无限权力之类的词。但归根结底,AI 是关于人的。当人们问我这个问题时,答案是响亮的“是”。每个人都在 AI 中扮演角色。这取决于你做什么和你想要什么。但没有任何技术应该剥夺人的尊严,而人的尊严和自主权应该是每项技术的发展、部署以及治理的核心。所以,如果你是一位年轻的艺术家,你的热情是讲故事,嗯,拥抱 AI 作为一种工具。事实上,拥抱 Marble。我希望它能成为你的工具。嗯,因为你讲故事的方式是独一无二的,而这个世界仍然需要它。但是你如何讲述你的故事,你如何使用最令人难以置信的工具来以最独特的方式讲述你的故事很重要,而那,那声音需要被听到。如果你是一位即将退休的农民,AI 仍然很重要,因为你是一名公民。你可以在你的社区中参与。你应该在 AI 如何使用,AI 如何应用方面拥有发言权。你,你与人们一起工作,你可以,你知道,鼓励你们所有人使用 AI,嗯,让你们的生活更轻松。如果你是一名护士,我希望你知道,至少在我,嗯,职业生涯中,我在医疗保健研究方面做了很多工作,因为我觉得我们的医疗保健工作者应该得到 AI 技术的极大增强和帮助,无论是智能摄像头提供更多,嗯,信息还是机器人辅助,因为我们的护士工作过度,疲惫不堪,而且随着我们社会的老龄化,我们需要更多帮助,嗯,来照顾人们。所以 AI 可以扮演这个角色。所以,我只想说,这非常重要,嗯,即使像我这样的技术专家,嗯,也真诚地认为每个人都在 AI 中扮演角色。>> 多么美好的结束方式。与我们开始的地方紧密联系,关于我们如何负责,并对 AI 在我们生活中的作用承担个人责任。最后一个问题,人们在哪里可以找到 Marble?他们可以去哪里?也许,嗯,如果他们想加入 World Labs,他们可以。网站是什么?人们去哪里?>> 嗯,World Labs 的网站是 www.worldlabs.ai,你可以在那里找到,嗯,你可以找到我们的研究进展。我们有技术博客。你可以在那里找到 Marble 这个产品。你可以登录。你可以在那里找到我们的招聘信息链接。你可以,你知道,我们在旧金山。我们喜欢与世界上最优秀的人才合作。>> 太棒了。Fay,非常感谢你来到这里。>> 谢谢你,Lenny。>> 再见,各位。非常感谢您的收听。如果您觉得有价值,可以在 Apple Podcasts、Spotify 或您喜欢的播客应用上订阅本节目。另外,请考虑给我们评分或留下评论,因为这确实能帮助其他听众找到播客。您可以在 lennispodcast.com 上找到所有过去的剧集或了解有关该节目的更多信息。下一集再见。