Transcription
如果科学家需要无所畏惧,我认为企业家需要更加无所畏惧。嗯,对我来说,无所畏惧,我喜欢这个词,这也是我实际招聘的一部分方式,就是寻找那些,尤其是年轻人,拥有这种无所畏惧精神的人。嗯,无所畏惧。嗯,无所畏惧就是自由。就是摆脱束缚你创造力、勇气以及完成事情的能力的枷锁。请原谅我的用语,这实际上是一个技术术语。是的。我非常坚信的一点是,在人工智能时代,信任不能外包给机器。信任本质上是人类的。它存在于个人层面、社区层面和社会的层面。你们中的一些人可能只是在基础设施、SaaS,或者任何应用领域,感觉可能有点疏远。那不是真的,因为你在服务人们。你在服务企业。信任非常重要。将人类的能动性作为信任的来源。
各位朋友,本周的节目中,我们将分享里德·霍夫曼与费伊·李博士在我们 2025 年规模大师峰会上的对话。费伊·李是一位杰出的计算机科学家和作家,几十年来一直处于人工智能发展的前沿。她曾是斯坦福大学以人为本的人工智能研究所的创始主任,现任 World Labs 的联合创始人兼首席执行官。她与里德同台,就人工智能发展现状和未来方向进行了坦诚的交流。我相信你们会喜欢这次的。这是规模大师。我已经记不清我们做过多少次了,而且每次都很棒,也是一种荣幸。所以,感谢你们的到来。谢谢。我也记不清了。嗯,所以,任何关注你职业生涯的人都知道,你在人工智能浪潮中是 OG 之一,你知道,ImageNet,嗯,所有这些对我们今天的现状都至关重要的贡献。所以,顺便说一句,感谢你。嗯,现在你正在研究空间智能和,嗯,某种意义上的,世界构建。能稍微谈谈为什么你,嗯,你从你热爱的工作中,嗯,以人为本的人工智能和斯坦福计算机科学专业中,休假了一段时间,然后开始创办这家公司,以及你在做什么吗?
里德,再次感谢你的邀请,非常荣幸来到这里,我想你指的是我联合创始人兼首席执行官的初创公司,叫做 World Labs。所以,你知道,里德,你是 OpenAI 的早期支持者和投资者之一。所以,当 OpenAI 成立时,你和我谈论了通用人工智能的梦想,对吧?作为一名人工智能科学家,嗯,我在这两个词之间摇摆不定,人工智能和通用人工智能,因为对我来说,它们的意思差不多。但抛开语言不谈,什么是?
实际上,我用通用人工智能来指代我们尚未发明的人工智能。
好的,太好了。嗯,我想艾伦·图灵,实际上,约翰·麦卡锡可能也是这么想的,但嗯,所以对我来说,通用人工智能是什么?对我来说,通用人工智能是机器智能的能力,这种能力与人类相当,在很多情况下甚至可以超越人类。我认为这就像一扇通往未来的门,门上有许多钥匙孔,语言是其中之一,也是主要的钥匙孔之一,因为语言是智能的一个基本组成部分,以至于我知道你是一个准哲学专业的学生,在斯坦福大学,准是一个积极的词,我必须说,因为里德是校友,有一个非常特殊的专业叫做,嗯,符号系统。他们结合了哲学、认知科学和计算机科学。顺便说一句,我是第八个选择这个专业的学生。我的天哪。所以,许多杰出的人才都出自这个专业。是的。所以,准的意思就是比例。所以,这是一个好词。嗯,他稍后会纠正我,但没关系。我正在挖坑。嗯,维特根斯坦说,语言定义了世界的界限。是的。我实际上并不反对这一点。太好了。因为我认为语言定义了世界可以被描述为符号形式的某个界限,但除此之外,世界实际上是无限的。嗯,嗯,那个世界是什么?我们如何定义它?它与智能有什么关系?我们如何利用机器来表达它?我把这一切都归结为世界建模。世界建模与语言密切相关。但它是关于表达、表示,并最终参与世界状态的变化。这可以是虚拟的,也可以是物理的。世界建模包含什么?它确实包含语言,因为语言是与世界互动的一种形式。但它也包含视觉、光线、语义、空间、物理动作。所有这些都还处于起步阶段,嗯,嗯,嗯,这是人工智能的下一个阶段。这就是 World Labs 的意义所在。我们正在尝试进行世界建模,并试图将这种空间智能提升到人工智能的下一个篇章。
所以,关于空间智能有两个问题。第一,你怎么知道?因为有些人会深入研究,但很多人他们对大型语言模型的主要体验是,你知道,ChatGPT、Gemini 等等。嗯,嗯,所以,他们应该理解有什么不同,不仅仅是认知能力,因为我们的世界不仅仅是语言,然后是第二点,嗯,前方的道路看起来如何?在实现这一目标的过程中,有哪些挑战需要克服?
是的。当我们拥有世界建模时,它会给我们带来什么?嗯,我们已经看到了萌芽的迹象。许多故事讲述者是多媒体创作者,对吧?无论是像素、电影,嗯,嗯,雕塑,嗯,数字艺术。这是一个高度富有创造性的互动世界,你不能仅仅用语言来表达。嗯,世界建模。生成可以让你沉浸其中、与之互动的世界的能力,对创作者来说极具吸引力和令人兴奋。这就是世界建模的一种应用方式。这不仅仅是为了娱乐和讲故事。这可以用于设计。这可以用于工业用途。一直到医疗保健、医学、教育。此外,嗯,被动娱乐和主动参与体验之间的距离,现在正在迅速缩小。能够拥有能够创建世界模型以实现这种沉浸式体验的机器,确实非常强大。这也引出了模拟。模拟对于人类体验、人类学习以及具身人工智能都非常重要。机器人需要从模拟中学习,就像它们需要从现实世界中学习一样。我们可以深入探讨机器人的历史,包括自动驾驶汽车,以及模拟所发挥的关键作用。所以,所以应用和,嗯,嗯,它确实是无限的。嗯,挑战是什么?我只提一个挑战。嗯,实际上有很多挑战。一个挑战是数据,与语言不同,数据遍布互联网。嗯,当涉及到世界建模时,与语言相比,数据并不那么明显,也不那么容易获得。当然,有视频数据,这是世界建模最关键的数据形式之一。但正如我所说,世界是多模态的。它是空间化的。它具有基本的 3D 信息、几何、物理、动力学,其中一些不易获得。所以,嗯,关于机器人技术有很多讨论,我认为我们应该为所有人划清界限的是,要理解世界建模对于任何形式的机器人工作提升和人类状况来说是多么关键。所以,稍微谈谈为什么这种认知集合如此重要。
是的,好问题。我花了很多时间思考这个问题,因为坦率地说,在 ImageNet 之后,在第一波计算机视觉达到一定保真度和质量之后,我自己也陷入了一点危机,开始反思感知是什么,视觉是为了什么?我以为我需要一百年才能解决物体识别的问题,但它比我想象的要快一点。所以,我需要另一个北极星。这让我回到了进化。我开始大量阅读关于进化和一些哲学的东西,我简直就是个哲学学生,和里德相比。嗯,大约在 5.3 亿年前,发生了一场令人难以置信的进化事件,叫做寒武纪大爆发,动物物种数量爆炸式增长,这也是神经系统的开始,感光细胞的开始。在阅读了大量文献并思考之后,我真正意识到,动物拥有感知的进化原因是活动,是为了互动。它是主动的,而不是被动的。这意味着感知和感知智能是运动的基础,而运动的开始非常简单。你只需要把身体移动到某个地方。很快,运动就变得更具互动性,你知道,从争夺食物到交配,到筑巢,到抚养后代,到更深层次。我是说,看看哺乳动物和人类。我们移动的能力非常非常复杂。我们手指、脚趾和身体、躯干之间的自由度非常高。所有这些都需要对我们所处的世界有基本的感知空间智能,这样我们才知道,我们理解,我们可以为所有的运动进行规划。所以,在我看来,真正意义上,对空间世界的细致复杂的理解,是具身智能(包括机器人)的大脑。
是的。是的。而且,实际上,你知道,虽然机器人提供了一种特殊的感官,你需要具身智能来让它们都具身化,当然也会有点像你关于维特根斯坦的开场白。实际认知推理能力的问题,不仅仅是纯粹的语言,这有点哲学化了,并且展望未来。我喜欢。但空间智能带来的好处之一是其他形式的智能,即使在那里也很重要。它不仅仅是一个纯粹的感知-行动循环,因为你知道,旧的西方感知就像一台相机,行动是分开的,这显然是错误的。这正是你刚才提到的。但它也会提高我们的认知能力,或者我们如何想象世界,如何在脑海中建模。你认为当我们将空间智能添加到不仅仅是机器人,而是所有人工智能系统中时,会出现哪些推理特征?
太棒了。里德,这就是我喜欢和你交谈的原因。纵观人类文明,如果你看看人类建立文明的里程碑,有很多里程碑是仅靠语言不可能实现的。嗯,空间和空间推理、世界建模的细微差别非常明显。例如,让我们以早期建造金字塔为例,对吧?开始抽象几何的能力,几何感,以及建造大型嗯嗯嗯身体。在那种认知空间嗯嗯嗯推理中,有很多东西不是简单的交易行为,我看到某物,我想移动它。我再举一个例子,我只举两个例子。另一个例子是推断 DNA 的结构,如果你知道 DNA 是如何被发现的历史,当然,许多科学家今天用今天的语言都能感觉到,在这个我们遗传物质的基本构成块中,有些东西正在发生,但它需要嗯嗯嗯富兰克林,罗莎琳·富兰克林,一位被低估的科学家,她拍摄了这些 X 射线,我认为是 X 射线或某种 X 射线图像,DNA 分子的图像,对吧?X 射线看起来像这样,在一个平面的图像上,像一个十字。但是,当然,弗朗西斯·克里克和詹姆斯·沃森对此进行了深入思考。但要从这个图像到 3D 双螺旋交织结构,嗯,是深刻的空间性的。你无法通过语言来推断出这一点。我敢肯定语言参与了。我不是反语言的,你知道。我喜欢说话。我支持语言。正是如此。嗯,但这是一个美丽的例子,人类利用空间推理和认知能力来做一些我们从未做过的事情或发现一些我们从未发现的事情。所以,我认为当我们赋予人工智能这种能力时,这不仅仅是为了让机器人能够,你知道,拿起眼镜或一个方块。这是为了提升全人类的能力,因为我们可以与拥有这种能力的人工智能合作。
是的。太棒了。而且我实际上从未听过你关于 DNA 的回答。所以我喜欢问你我从未问过你的问题。这是很棒的事情之一。嗯,所以,转到,你知道,一种普遍的说法是,显然有很多关于人工智能是否被过度炒作或低估的讨论。我们显然在这里硅谷,所以硅谷的每个人或多或少都认为被低估了。你知道,人们想说,嗯,你知道,关于,嗯,我们会经历另一次人工智能的赢家吗?你对这场关于人工智能正在发生什么的讨论有什么看法?你会怎么说?嘿,这些是被低估的部分。这些是被过早炒作的部分,对吧?与过度炒作相比。对于明智的人来说,在当前的讨论中,如何区分好坏,稍微区分一下?
哦,天哪,我必须小心如何回答这个问题,但我完全理解。嗯,人工智能是一项文明技术。我不是唯一这么说的人,但我真心相信,因为,即使你受到人类和进化的启发,这种智力化和思考、行动的能力对人类来说是根本性的,而一项能够做到这一点的技术是,是现象级的。嗯,在我看来,它或多或少没有被过度炒作,作为人类的智力未来,因为人工智能是新的计算。如果你看看当今世界,并且只是认识到芯片在哪里,你知道,因为芯片是计算发生的物理场所,从灯泡到自动驾驶汽车再到飞机,到处都有芯片。所以,在这一点上,无论哪里有芯片,哪里就有计算,哪里有计算,哪里就会有人工智能,如果它还没有的话。所以,从这个角度来看,无论是从商业还是用例的角度来看,人工智能都是未来。显然,嗯,当涉及到炒作时,我认为我们必须有点细致。例如,真的,你知道,我们刚才在后台说。从塞巴斯蒂安·特伦的第一个自动驾驶汽车,可以在内华达沙漠中行驶 130 英里,那里显然没有交通,到 Waymo 在旧金山运行,花了二十多年。嗯,你可能会说,嗯,因为其中一部分是软件,它是在深度学习时代之前,软件开发速度较慢。你说得对。深度学习无疑加速了自动驾驶汽车的大脑。但我们也别忘了,汽车行业,整个供应链以及客户使用基础已经建立了 100 多年,这是一个非常非常成熟的商业模式,以及非常成熟的基础设施和制造等等。所以,如果仅仅是汽车,也就是最简单的机器人形式,就需要 20 年才能上路,你知道,扫地机器人,但是,你知道。
我当时在想,我知道他会这么说。是的。所以,是的。嗯,扫地机器人,实际上我认为汽车,你知道,它字面上是一个方形盒子,在二维表面上移动,你唯一需要做的就是不要碰到任何东西,对吧?因为如果你碰到,你就完蛋了。而机器人会碰到,而且总的来说,没关系。嗯,但是机器人,关于机器人的整个事情是,它是一个三维机器,整个目标是触摸东西。是的。并且以正确的方式触摸它。我是说,这太大了。所以我认为机器人肯定还有一段旅程。是的。百分之百。所以,要认识到这项文明技术的一件事是建立信任,无论是通过技术人员、公司等等。你认为我们作为领导者、作为公司、作为企业家应该做些什么来帮助建立信任,因为显然,一旦我们到达那里,我们才能真正开始实现它的好处。
是的,好问题。我知道你和我都很关心这个问题。我非常坚信的一点是,在人工智能时代,信任不能外包给机器。信任本质上是人类的。它存在于个人层面、社区层面和社会的层面。这就是为什么里德是我们斯坦福大学以人为本的人工智能研究所的支持者之一。我们于 2018 年成立了该研究所,远早于人工智能最新一轮的蓬勃发展,因为我们认识到,随着机器在计算、推理,甚至最终在可操作能力方面变得越来越强大。我们需要建立一个新的规范,它需要成为社会结构的一部分,在这个规范内,人类继续拥有与彼此、与新工具如人工智能、与更强大的产品如聊天机器人等建立信任的能力,最终这种信任必须在我们的治理模式中得到更新或更新,不仅仅是社区和公司的治理,而是整个社会的治理。所以我确实认为信任是一个非常非常重要的元素。虽然这里的听众大多是企业家,但我只想说,无论你做什么产品或业务,从一开始就要关心这一点。你们中的一些人可能在医疗保健领域。你知道它有多重要。你们中的一些人可能只是在基础设施、SaaS,或者任何应用领域,感觉可能有点疏远。那不是真的,因为你在服务人们。你在服务企业。信任非常重要。将人类的能动性作为信任的来源。
是的。百分之百。而且,你知道,你和埃奇在以人为本的人工智能方面所做的工作,这源于你的《纽约时报》专栏,这是它被命名的一部分,也是我开始关注能动性的原因之一,提升人类能动性是我们必须做的关键事情之一。嗯,你知道,我喜欢和你谈论的一件事是,我们可以真的,我和埃奇可以聊上几个小时。我们只剩下几分钟了。嗯,但是,比如环境智能,你知道,这对医疗保健意味着什么?作为 OG 的一部分,还有很多事情,而且在每一个主题上你都会深入。所以,让我们转向科学方面。
嗯,也许是我们的最后一个问题,那就是,你说科学家需要智力上无所畏惧。所以,嗯,你知道,对它有一种无所畏惧。嗯,这对我们应该如何思考发明未来意味着什么?这对科学应该如何进步意味着什么?对于下一代创新者来说,意味着什么?嗯,无所畏惧应该在其中扮演什么角色?
太好了,谢谢你问这个问题。嗯,如果科学家需要无所畏惧,我认为企业家需要更加无所畏惧。嗯,对我来说,无所畏惧,我喜欢这个词,这也是我实际招聘的一部分方式,就是寻找那些,尤其是年轻人,拥有这种无所畏惧精神的人。嗯,无所畏惧。嗯,无所畏惧就是自由,就是摆脱束缚你创造力、勇气以及完成事情的能力的枷锁。请原谅我的用语,这实际上是一个技术术语。是的。这实际上是我们公司的核心文化。所以,嗯,你知道,人类并不是地球上最快、最强的动物,对吧?我们,如果你看看很多方面,我今年夏天和我的孩子们在非洲。我是说,有那么多动物比我们强得多,但我确实有这种感觉,嗯,很多,是的,但是我们的大脑、我们的思想、我们的灵魂中有一些东西可以推动我们为世界、为自己、为彼此做不可思议的事情,而这一切很大程度上来自于我们创造力的根本独特性。我们的社区感,我们的,以及所有这些。为了释放它,尤其是随着技术飞速发展,对我来说,基础的情感标准是,要有创造力,要自由。这转化为无所畏惧。奔向不确定性。奔向没有人实现过的宏大想法。奔向反常的假设。奔向艰难的任务。嗯,有人说过,我忘了是谁说的,简单的任务,那些非常确定的任务,与不确定的任务有时一样难。
TR 是那个更不确定的,因为你知道你的创造力会更努力地工作,而这就是魔法发生的地方。所以我喜欢无所畏惧这个词,因为在那里,界限被打破,创造力被释放,嗯,嗯,神奇的事情发生了。有了这个,你就可以看到为什么我们想在第一次炉边谈话中邀请费伊。让我们给她鼓鼓掌。谢谢。谢谢。感谢费伊·李博士加入我们的规模大师峰会。这次对话是在旧金山普雷西迪奥剧院的舞台上录制的。