Transcription
各位听众,大家好,欢迎回到 No Priors。今天的嘉宾是计算机视觉和深度学习领域的先驱 Fay Lee 博士。她创建了 ImageNet,这是一个开创性的数据集,帮助引发了深度学习革命。Fay 是斯坦福大学教授,也是斯坦福人类中心人工智能研究所的联合主任。她还曾领导谷歌云的 AI 部门,为国际政策制定者提供咨询,并最近联合创办了 World Labs,一家致力于开发空间智能 AI 的公司。Fay,非常感谢您今天加入我们。嗯,谢谢你的邀请。这将会很有趣。那么,在过去的二十年里,您在科学和政策方面做出了非凡的贡献。我将从最大的问题开始,比如为什么现在要创办一家公司?因为我内心渴望创造。我认为这是一个非常关键、有趣且令人兴奋的时刻,可以创造出每个人都能使用的非凡技术,我非常相信空间智能和能够赋能许多人以及许多用例的 3D 世界模型,我认为这将非常令人兴奋,而且我可以与一群非凡、极其聪明的年轻技术人员一起做到这一点。我想回到您正在合作的人,因为我认识您的一些联合创始人,并且曾经非常绝望地试图说服他们创办一家公司,然后他们说,哦不,我们现在有了 Fay 的更伟大的使命。什么是空间智能?您能为更广泛的受众定义它吗?对我来说,空间智能是理解、推理、互动和生成 3D 世界的能力,因为我们的世界从根本上来说,无论你怎么说,我们都可以将其投射出来,它本质上是 3D 的,它是 3D 的,因为它在物理上是 3D 的,而在数字世界中,如果存在真正的 3D 表示,那么我们可以更容易地实现许多事情,无论是设计更多创作、导航、模拟,还是体验 AR、VR,所有这些对我来说都是空间智能的一部分,而且再次,我认为真正让我兴奋的是,人类拥有空间智能,这是我们核心智能能力的一部分,动物拥有空间智能,整个进化历程也与空间智能的演变紧密交织在一起。所以它非常根本,没有空间智能,AI 将是不完整的。这如何转化为您与公司所做的工作,或者您能否分享任何关于这相对于您正在构建的内容的含义?是的。所以我们正在解决 AI 中最困难的问题之一,那就是实际上是构建本质上是 3D 的世界模型,因为一旦您能够解决这个问题,您就可以解锁许多空间智能问题。所以我们是第一家我们所知的解决 3D 生成基础模型问题的公司。我有很多问题,但既然您首先将其描述为 3D 对理解世界的重要性,这是否意味着您认为 World Labs 将创建的世界模型,或者学术界或公司将创建的世界模型,有一天会像现实世界一样准确,能够代表物理学和我们能够用它做更多事情的世界的理解?是的,它应该是现实准确的,或者至少是合理的。所以你可以创造一个奇幻的世界,但它应该是合理的,因为它的几何形状和物理学应该是合理的,而这对于空间智能来说是根本性的。这是否意味着您有一个特定的观点,从神经科学的角度来看,例如,您一直以来都是计算机视觉领域的领导者,但视觉智能的重要性如何,与例如大型语言模型和文本智能相比?我确实有。我认为从神经和认知科学的角度来看,空间智能是进化必须为动物解决的一个非常困难的问题。有趣的是,我认为动物在一定程度上已经解决了它,但还没有完全解决。这是最困难的问题之一,因为动物必须解决的问题是什么?动物必须进化出收集光线到我们称之为眼睛的东西中的能力。然后,有了这些眼睛的集合,它必须在脑海中以某种方式重建一个 3D 世界,以便它们能够导航和做事,当然它们可以互动。对人类来说,我们在操控方面是最有能力的动物。我们可以做很多事情,而这一切都是空间智能。对我来说,这根植于我们的智能。有趣的是,即使在动物身上,它也不是一个完全解决的问题。例如,对人类来说,对吧?如果我现在让你闭上眼睛,画出或构建一个你周围环境的 3D 模型,这并不容易。我们没有多少能力来生成极其复杂的 3D 模型,直到我们接受培训。你知道,我们中有一些人,无论是建筑师、设计师,还是仅仅是拥有大量培训和才华的人,这都是一件很难做到的事情。想象一下,您能更轻松地在指尖完成这项工作,并实现更流畅的互动和编辑能力。这对人们来说将是完全不同的世界,无意中说。除了空间智能之外,还有其他我认为尚未得到充分发展的大领域吗?从模型角度来看,或者您认为在构建人工智能的未来时,我们应该随着时间的推移关注的其他缺失的差距?我只是想知道,除了 3D 和世界生成之外,还有其他类似的大问题吗?因为我觉得有一些大问题我们已经解决了,而另一些问题我们正在努力解决。我们正在解决语言问题。我会说语言在很大程度上已经解决了,对我来说,3D 和语言一样关键和困难。那么还有什么没有解决?整个情感智能领域是我甚至不知道如何开始解决的问题。我知道很多人没有解决它。所以当通用人工智能实现时,我可以告诉你,训练数据不会来自硅谷的人。不要低估硅谷。是的。所以,我将自己归入这个范畴,但我认为我们可能需要更广泛的人群。是的。不,我同意。但老实说,这三个大类。我不知道。埃隆和莎拉,你们怎么看?我认为这在很大程度上取决于您在每个模型中包含什么。所以我同意您的框架,包括这三个,然后是像空间智能这样的东西,我假设它也涉及不同类型的物理模拟和世界模拟,而我认为很多人没有在研究这些,我认为这些非常有趣或重要。所以,有宏观和微观尺度。微观尺度最终会变成材料科学和其他与您所谈论的分子建模或是的,非常不同的东西,而且在某种程度上也超出了人工智能的当前定义,我认为它们当然会得到机器人技术的支持,但机器人技术在很大程度上是一个系统集成问题,即使您看看动物,它也不仅仅是大脑中的计算本身,对吧?是的,这些事情中的许多似乎比特定系统更分散,而动物拥有这些系统,在某些情况下,正如您所说,它不像人们想象的那样集中。所以,从更分散的智能模型来看,而不是中枢神经系统,开始思考这些模型非常有趣,但是的,我认为这是非常有趣的事情。您也在这方面,在机器人技术和物理智能领域做过工作。我认为对于机器人基础模型和驱动力的数据层次结构来说,人们当然想使用视频,因为这是我们拥有的,关于模拟以及今天能从中获得多少,这是一个大问题,也许人们没有看到未来将提供的质量和物理学,然后有接近具身化的不同形式的 T-OP,然后是具身数据收集,这是您脑海中的层次结构,还是您认为人们低估了模拟和世界模型对未来的作用?是的,好问题。首先,正如您所说,我确实在机器人领域工作,尤其是在我在斯坦福的实验室。我毫不怀疑人类将进入一个我们与机器人共存的时代,而且世界的机器人不一定是人形的。机器人有各种各样的形态和形状。实际上,几年前,我的实验室写了一篇非常有趣的关于形态智能的论文,其中一个代理的形态可以通过优化他们试图完成的任务来改变。所以,我们应该比人形机器人更有想象力。话虽如此,如何训练机器人,您提到了所有这些数据,有些人称之为数据金字塔或数据蛋糕或其他什么。我同意。我认为这将是多种数据形式的混合。我也认为模拟被低估了。实际上,它并没有被许多专家和该领域的人低估。如果您看看许多机器人公司,它们都在研究模拟和合成数据。我也认为我们必须意识到,与语言模型,甚至与空间智能基础模型不同,机器人技术是一个高度多模态的系统,我认为真正被低估的是触觉,尤其是如果我们想进行操作而不是仅仅导航。我认为触觉数据以及将触觉真正整合到视觉、感知和空间数据中的能力至关重要。您说的一件事我认为非常有趣是如何以不同的形态形式,机器人可能会适应或采用。关于潜在的未来,人们提出了两种相反的论点。一种论点是,从供应链的角度来看,管理制造的构建和规模,您将拥有更少的形态。另一种论点是,专业化的经济价值非常高,因此随着我们走向机器人驱动的未来,将会有成千上万种不同的形态。您对我们可能在这两个观点之间达到什么程度有何看法?我认为我们将通过梯度下降来优化生产力和效率。我的假设是,不同任务的要求如此之大,以至于拥有非常少的形态或坚持一种形态是能源效率低下的,而且许多任务可以而且应该由能源效率更高的形态来完成。举一个极端的、微不足道的例子。如果我们把机器人放在水下,它们就不应该是人形的。它们最好是鱼的形状,对吧?想想能源效率。飞行也是如此。我认为人形不是我们的飞机正变得越来越像机器人。所以,我认为会有多样性。机器人技术是未来的一种潜在应用。您首先是一位科学家,但也曾参与过 Twitter 董事会和初创公司。您能想象出生成 3D 世界的近期商业应用吗?我相信创造力是一个极其令人兴奋的领域,人类可以通过人工智能和空间智能获得超能力。在这里,我以软件工程为例。如果您看看今天大型语言模型在软件工程中的成功,包括像 Cursor 和 Windsurf 这样的应用程序,您会看到人工智能和人类之间的大量协作,而这种协作体现在不同级别的技能集等方面,我认为创造力也会如此,无论是我们谈论设计师、3D 艺术家、VFX 艺术家,还是营销人才和游戏开发者。在设计和创造 3D 空间方面存在巨大的需求,即使对于训练有素的熟练人员来说,这仍然是一个非常困难的问题,拥有一个协作者将是极其有趣的,如果我们做得好的话。所以我认为创造力是一个令人兴奋的领域。我也认为,我们一直在等待元宇宙或 XR、AR/VR 的很多东西是内容创作。我理解硬件本身需要继续发展,但我也认为软件,我们正在寻找内容创作,这非常自然地适用于 3D 建模和 3D 或生成性空间模型,这是另一个有趣的领域。您对世界模型是否是可扩展强化学习的有趣答案,以实现更具泛化性的代理,是否有强烈的看法?我确实认为,正如我所说,没有空间智能,人工智能就不完整,因为人类在 3D 世界中互动,在数字世界中,我们需要各种互动,例如设计,这是一个深刻的问题,当我们考虑设计时,我们在脑海中优化了很多东西,无论是美学、效率还是优化,等等,这非常自然地适用于强化学习环境。在尝试走上设计和训练世界模型的这条道路上,最大的挑战是什么?我猜想一个挑战是,您处理过图像,您处理过视频,但我们有图像和视频,但我们没有大量的 3D 世界,我猜您正在构建的格式。是的,数据绝对是一个挑战。您说得完全正确。你知道,要创建世界模型,3D 基础模型。我们需要越来越复杂的数据工程、数据采集、数据处理和数据合成。所以我很羡慕我的 NLP LLM 同行,互联网上的数据非常丰富,我们不一定有这种奢侈。所以这绝对是一个挑战。另一个挑战是,3D 很有趣,对吧?我们每个人每天都在使用 3D,在如此多的场景中,基本上您睁开眼睛,您体验到的整个生活都是 3D 的,即使我们一直盯着屏幕打字,它仍然不像语言那样容易交付给人们。语言就是如此简单,而且它也是一种非常活跃的形式,它不是被动的观看。没有人会醒来说我只是坐在这里看 3D。所以,这给产品化以及如何正确地做带来了挑战。您以前玩过 Second Life 或任何类似的游戏吗?我不是游戏玩家,但我的孩子们喜欢 Minecraft。我本想问您是否有想体验或想象的世界。这是一个很好的问题,Sarah。你知道,我喜欢看世界,我喜欢看我看不见的世界。例如,放大到微观世界,或者进入引擎内部,你知道引擎是如何工作的,我知道理论上它是如何工作的,但亲眼看到它,体验它,甚至你可能会笑,我想进入洗碗机,体验一下那是什么。所有这些都可以以虚拟的方式完成,如果我们能够创建任何东西的世界模型的话。好的。我认为我和您都想稍微谈谈您过去的职业生涯,也许为任何从事研究或试图在人工智能领域产生影响的人提供一些见解。就在这之前,我问 Andre Karpathy 我应该问您什么,他说 Fay 在雄心所欲和思考数据方面真的很神奇。您应该问她关于她的博士论文以及与 Phro 一起创建那个 101 数据集,因为它很有启发性。所以我必须问您。首先,我必须说,当学生比您更出名并取得更多成就时,这总是最伟大的事情。这让我非常自豪。所以我为 Andre 感到非常自豪。我对他还记得我的博士研究感到惊讶。是的,是真的。这可以追溯到 2003 年左右,当时世界才刚刚开始接触互联网,数据还没有什么意义。但在做计算机视觉时,我的博士研究真的试图让物体识别起作用。这就是当你看到一张图片时,能够识别出猫、狗、微波炉、椅子等等的问题。我们开始假设数据很重要。但我们不知道,没有规模法则,我们不知道数据能走多远。我们只想要的是,如果我们有一个机器学习算法,无论是神经网络还是当时很受欢迎的贝叶斯,还是支持向量机,我们需要一些数据来训练,而当时没有数据来训练,而作为一名博士生,您想毕业,而 Petro 说,好吧,Fay,整理一个数据集。我当时想,是的,我需要整理一个数据集,因为那里现有的每个数据集都太小了,我就是不确定。我和 Petro 正在谈论,是 15 种不同的东西还是 30 种不同的东西?然后,上帝保佑,博士导师说出了三位数的数字 100。我当时想,这需要做很多工作。但我内心深处知道他是对的,从数学角度来说,这是为了让模型能够泛化。我们至少需要足够的数据。所以,我在我的书《我看到的世界》中写了关于这个过程,我偶然发现了一个字典,这真的只是为了我自己的英语学习,我猜是韦氏词典,如果我没记错的话。它只是随机地有一些单词的视觉描绘。说实话,我甚至不知道它们遵循什么规则。有些是花,有些是自行车,有些是狗。我当时想,好吧,这实际上,你可以称之为作弊或工具。我选择了其中 101 个单词。这真的让我的博士导师笑了,因为他说,“啊,你只是想比我要求的做得更多,来挑战我。”所以我就是这么做的。我得说,我仍然记得我从谷歌下载或尝试过,当时谷歌还很新,谷歌图片搜索当时非常糟糕,与今天相比。我不得不多次清理,有时我变得如此绝望,我只是让我妈妈来清理图像,因为我在电脑上写了一个小界面,她不懂电脑,但至少她知道点击点击。所以她帮我做了一些。我的意思是,您在人工智能领域拥有最传奇的职业生涯之一,正如您所说,您的许多学生也同样在整个领域、整个行业、整个世界中取得了非常出色的成就。当您回想今天的职业生涯时,您会想到哪两个或三个时刻?当然,还有很多职业生涯要走,但我只是好奇。我的意思是,显然您在图像和视觉识别相关的系统方面做了很多工作,等等,但当您回想过去的 20 年时,考虑到您所做的一切,最突出的是什么?哦,谢谢您问这个问题,当然,ImageNet 是那些时刻之一,ImageNet 由多个时刻组成,从早期的挣扎,被告知我不会获得终身教职,到实际上意识到 Amazon Mechanical Turk 来拯救您,到 AlexNet 获胜的时刻,以及几年前我在多伦多的一次活动中与 Jeff Hinton 见面,他公开表示 ImageNet 是多么具有决定性,他甚至有点抱歉 ImageNet 没有像神经网络那样受到认可。所以这段旅程非常有价值,对科学家来说,价值不在于认可或奖励。而是您做出了改变,那个没有人相信的猜想,那个没有人相信的假设,我们能够实现它。所以这是一条主线,以确保任何不熟悉它的商业人士,ImageNet 是一个大规模的数据集,拥有数百万个标记图像,涵盖数千个类别,而不仅仅是 101 个,对吧?1500 万个标记图像,Fay,谢谢您,这导致了深度学习的惊人突破,特别是 AlexNet,以及该领域的大量进展,是的,推动了许多机器视觉的发展。我确实记得,在 2016 年或 2017 年,我曾展示过一张幻灯片,是人工智能的历史,或者当时是卷积神经网络和循环神经网络,而生成对抗网络刚刚开始发展,而 ImageNet 和 AlexNet 是人工智能进步的标志性时刻之一,当然,现在我们有了 Transformer,也许还有扩散模型之类的,但它是一个巨大的突破。是的,谢谢。我另一件非常自豪的时刻是 Andre,以及 Justin Johnson 和他们的论文。在我看来,这是语言和图像第一次通过字幕和撰写视觉世界的故事而融合。对我来说,这很重要,原因有两个。一是,我真的发誓,在我博士毕业的时候,我想如果我能活到 100 岁,我们可能会解决这个问题,那就是图片的讲故事。所以,我以助理教授的身份开始我的职业生涯,心想,好吧,我将做 ImageNet 来解决物体识别问题,然后我将花我余下的一生来解决这个讲故事的问题,然后当 Andre,然后稍晚一些 Justin Johnson 进入我的实验室时,那是在 2013 年左右,2013 年到 2014 年,深度学习的开始,然后突然之间,当时的序列模型 LSTM(而不是 Transformer 模型)和 CNN 的结合,就炸开了图像字幕的工作,而我的工作是第一个与谷歌一起完成的,这对我来说真的,我几乎为此感到非常自豪。我几乎经历了一场危机,那就是我接下来的 70 年或 65 年要做什么?这个领域的演变速度真是太快了。我能再问您一个关于这个问题的问题吗?因为您取得了如此惊人的进展,而且效率很高,您和我私下谈过,您觉得在人工智能研究中,除了非常大型的、资金充足的公司实验室之外,还需要有“登月项目”和创造力,您指出了几个时刻,它们来自于学术界的创造力和研究。您对人们有什么建议,关于是否仍然有机会这样做,或者从现在开始一切都是 100 亿美元的训练运行?我唯一的建议,我仍然在我的公司和我的实验室里这样说,就是无所畏惧。我认为科学家、技术人员和企业家必须无所畏惧。你知道,最终你必须弄清楚,你需要 100 亿美元的运行,然后你来找 Sarah 寻求资助?可能两者都需要很多。是的。或者你必须弄清楚,我不知道,数据。有时无所畏惧是一种非常有趣的立场,你有点自欺欺人,有点疯狂,但又有点理性的大胆,它介于两者之间,因为如果你太理性,那就不够勇敢。你没有识别出足够大的问题。但如果你完全疯狂,我不知道,有很多事情会出错。所以,所以要无所畏惧,要勇敢。对我来说,即使我年纪大了,我也感觉是这样,我开始创办我的初创公司 World Labs,我希望无所畏惧地解决空间智能问题。作为问题解决的一部分,您一直与世界上一些最优秀的人工智能研究人员和工程师合作。您在公司中如何看待这一点?您正在招聘什么样的人?目前有空缺职位吗?毫无疑问,这是一个了不起的团队,我只是好奇您想增加什么样的人,以及您对这方面的长期看法。是的,我们有空缺职位,我们希望招聘最优秀的工程师和产品思想家。所以,如果您是一位对加入最优秀团队并解决这个问题充满热情的工程师、人工智能研究员或产品人才,请加入我们。那么我们招聘谁呢?首先,我们确实招聘具有多样化思维的人。这就是为什么您称我们为人工智能公司,但如果我们深入了解,我们有计算机图形学专家、计算机视觉专家、数据专家、生成式人工智能专家、机器学习基础设施专家、优化专家等等。所以,招聘一群才华横溢、背景多样的人非常重要,因为像空间智能这样困难的问题不是一个同质化的问题,它需要各种背景的人才来解决。然后我也在寻找无所畏惧,您如何做到这一点?您如何识别某人背景或思维过程中是否无所畏惧?这体现在他们的背景中,您与他们交谈,您可以感觉到某人是无所畏惧的,您可以感觉到是什么驱动着他们,您可以感觉到他们提出的问题,如果他们开始问您很多关于我不知道如何完成这个问题的事情。当然,您必须问这些问题,因为您想完成它。但如果感觉到这是出于害怕解决这个问题的观点,那么这就不是无所畏惧。但是,那些无所畏惧的人,他们有创造力,他们有雄心,他们不怕不确定性或未知。我真的很喜欢这一点。好吧,我认为我和我都在共同投资一系列公司,我希望这些公司在这里有用,从 Bridge to Open Evidence 到 LA,但正如您所说,存在着巨大的问题,老实说,在过去的 15 年里,我对技术在医疗保健领域的普及一直不太乐观,但感觉这次不一样了,而且实际上是巨大的净收益。我实际上在这之前创办了一家数字健康公司,我的希望是,人们几十年来一直在谈论的许多事情终于将实现,而人工智能似乎是实现这一目标的绝佳方式。所以,完全,完全。非常感谢 Fay。这太棒了。这鼓舞人心,很高兴能更多地了解 World Labs。谢谢。非常感谢。谢谢 Sarah。在 Twitter 上关注我们 @no prior pod。如果您想看我们的脸,请订阅我们的 YouTube 频道。在 Apple Podcasts、Spotify 或您收听的任何地方关注该节目。这样,您每周都会收到新一集。并在 no-briers.com 上注册电子邮件或查找每集的文字记录。[音乐]