Transcription
f f 见到你真是太好了,欢迎来到 Possible。同样,很高兴在 Arya 见到你。是什么让你产生了 ImageNet 的想法?比如,是什么让你觉得“我们需要这样做”?
很难精确地指出一个具体的时刻,但它集中在 2006 年左右。那时我正深入研究机器学习算法,试图理解物体和图像。无论我看向哪里,都无法逃避一个事实,那就是存在一个叫做“过拟合”的数学概念,用于机器学习模型。这种情况发生在模型复杂度和模型使用的数据不匹配时,尤其当数据不仅仅是数据量的问题,而是数据复杂性和数据量并没有真正有效地驱动模型时。当然,并非所有模型都是平等的。我们现在知道神经网络模型具有更高的容量和表示能力。但抛开这些术语不谈,数据和模型之间确实存在相互作用,而我所看到的每个人都在关注模型,却忽略了数据。这确实是我获得灵感的那一刻。我认为我们不仅要关注模型,或者说不能以错误的方式关注模型,而是要关注数据,并利用数据来驱动模型。
当然,在那时,我将我早期职业生涯的工作转移到了普林斯顿大学担任教职。我偶然发现了名为 WordNet 的工作。WordNet 与计算机视觉无关,但它是一种组织世界上概念的绝佳方式。我喜欢 WordNet 这个名字。一件事导致了另一件事,ImageNet 因此而生,这是由于我对大数据和视觉世界的多元化表示的迫切需求。我在你的 AI 职业生涯中期,以令人惊叹的 ImageNet 开始了我的旅程,现在我们有了 World Labs。所以我想从 ImageNet 到 World Lab 画一条线。那么 World Labs 的想法是什么?你正在构建什么,这是我们前进方向的关键部分,以及如何理解 World Labs 本身以及它作为 AI 的一个趋势?
是的,我们谈论过这个,对吧?这是我们最喜欢的话题,关于技术的发展方向。有一件事我一直在痴迷地思考,贯穿我的整个职业生涯,尤其是在 ImageNet 之后,说实话,那就是“什么是智能?我们如何让机器拥有智能?”对我来说,这真的归结为两件简单的事情。如果你看看人类的智能,一是我们说话,我们使用语言交流作为一种工具来组织我们的知识和沟通。但还有另一半的智能,对我们来说非常深刻,它归结为我们做事。你知道,我们通过做饭、徒步旅行、朋友们玩乐并享受彼此的陪伴来做事。这远远超出了我们所说的任何话语。仅仅是我们能够舒适地坐在彼此面前,喝一杯啤酒,这一切都包含在智能之中。而智能的这一部分,确实植根于我们理解我们所生活的 3D 世界,感知它,并将其转化为一系列的理解、推理和预测的能力,以便我们能在其中做事。在我看来,这种能力被称为空间智能,这是像人类这样的智能动物所拥有的基本原生能力,即处理 3D 空间的能力。
ImageNet 的出现是因为我一直在努力为 2D 图像中的像素打上标签。而对人类来说,2D 图像是 3D 世界的投影。所以你可以看到,这是理解我们所生活的更广阔的视觉世界的一小步。而这一小步至关重要,因为无论是人类、动物还是机器,理解这些物体和图像,给它们打上标签,都是关键的第一步。但现在,天哪,已经过去了 15 年多,14 年,我认为我们已经准备好迎接一个更大的挑战。这几乎是一场全垒打式的挑战,去解锁智能的另一个最重要的部分,那就是空间智能的问题。
现在,是什么让空间智能真正有趣呢?它实际上有两个方面:一是物理的 3D 世界,二是数字的 3D 世界。我们从未真正能够生活在两者之间。但空间智能现在可以成为一种统一的技术,它能够理解 3D 地理世界和数字 3D 世界。所以,当我想到空间智能的承诺时,你知道,如果回到 1880 年,马车、未铺设的道路,你可能会觉得这是一个完全不同的世界。但如果你回到 1980 年,好吧,人们开着不同的汽车,但他们住在同一个建筑里,他们仍然开着汽车。可以说,现实世界的运行机制基本相同。你认为这种智能的另一半会在未来几十年改变这一点吗?我们是否会真正看到现实世界发生我们过去几年在数字世界中看到的巨大转变?
我认为是的,Aria。我认为现实与数字之间的界限将开始模糊。例如,我想到我在高速公路上开车,如果我轮胎爆了,我有一种感觉,尽管我是一名技术专家,我有一种感觉,我会在处理那个爆胎的问题上遇到困难。但如果我能戴上一副眼镜,甚至把手机对准我轮胎爆了的车,并与那个潜在的应用程序合作,通过视觉指导或一些对话或混合方式来指导我完成更换轮胎的过程。我认为这是一个非常平凡的日常生活例子,它真正打破了物理 3D 世界和数字 3D 世界的界限。而这种技术能够赋能人们,无论是更换爆胎还是进行心脏外科手术,这对我来说是一种非常令人兴奋的景象。
所以你说,你知道,你一直使用 LLM 来学习,我一直觉得这应该很鼓舞人心。比如我的孩子们,他们总是说,“哦,我数学很好,我不需要再学了。”而我却可以告诉他们,“好吧,Fa Lee 正在使用 LLM 来学习。我想你还有一些需要学习的地方。”但是,当你谈论大型世界模型与 LLM 时,你看到了什么?你如何向人们解释这种区别,你认为这将在未来如何发展?
从根本上说,就像我说的,一个是关于说话,另一个是关于看和做。所以它们是两种非常根本不同的模式。大型语言模型,其基本单位或词汇,无论是字母还是单词。而在我们的模型,世界模型中,我们使用的基本单位是像素或体素。所以它们是非常不同的语言。我几乎觉得语言是人类的语言,而 3D 是自然的语言。我们真的希望达到一个点,让 AI 算法能够让人们与像素世界互动,无论是虚拟的还是物理的。
你的回答让我想起了你用过的另一个引述,引用社会生物学家爱德华·O·威尔逊的话说:“我们拥有旧石器时代的感情、中世纪的制度和上帝般的技术,这是极其危险的。”那么,考虑到……你知道,推理、自然语言、教育,你如何扭转这一点?在人工智能时代,人类的机会是什么?
是的,我仍然相信这一点。因为我相信,你和我,以及我们的朋友们,创办了以人为本的 AI 研究院。所以,如果我要反转这句话,我几乎会反转这句话:“人类有能力创造上帝般的技术,以便我们能够改进我们的中世纪制度,超越我们的旧石器时代感情,或者将我们的旧石器时代感情转化为创造力、生产力和仁慈。”
你认为,在技术和人工智能帮助我们实现更美好的自我方面,下一步的关键是什么?是关注同情心吗?是关于以人为本和互动共生的问题吗?你认为你将构建什么来帮助我们实现我们的愿望?
我可以看到为什么你对哲学和技术的结合如此着迷。我同意。而且,你知道,就像上一段引述一样,我们几乎把“旧石器时代”作为一个负面词语,但它实际上不是一个负面词语。它是一个非常中性的词语。人类的情感,或者人类对我们是谁的自我认知,深深植根于进化,植根于我们的 DNA,我们不会改变它。世界因为这一点而同时美丽而混乱。所以,在寻求技术和技术与人类关系的未来时,我认为我们需要尊重这一点。我们需要尊重我们是谁的一些最根本的、真正的旧石器时代的根源。
技术发展真正需要尊重的几件事,我们越尊重它,我们就会做得越好。一是尊重人类能动性。我真的认为 AI 的一个公共沟通问题是,我们太常把 AI 用作句子中的主语,好像我们在剥夺人类的能动性。或者像“AI 将治愈癌症”这样的句子。我有时甚至 guilty of saying that。事实是,人类将利用 AI 来治愈癌症,而不是 AI 治愈癌症。或者“AI 将解决聚变”。事实是,人类科学家和工程师将把 AI 作为一种工具来解决聚变。而且,更危险的是,“AI 将夺走你的工作”。你知道,我认为我们真的需要认识到,这项技术有更多的机会来创造机会和就业,来赋能人类能动性。这是我非常关心的一个重要第一原则。
第二个重要的第一原则是尊重人类。每个人都希望健康、富有成效,并成为受人尊敬的社会成员。无论我们如何开发或使用 AI,我们都不能忽视这一点。忽视这一点是危险的,是适得其反的。我认为仅凭这两点就足以指导我们开发这项技术。
谈论这个,确实植根于一个深刻的信念,即任何技术、任何创新的“所以然”是为了人类的福祉。这就是人类文明的轨迹。每一次我们创造了一个工具,我们都希望用这个工具来做好事。当然,这是一把双刃剑,我们可能会滥用这个工具,会有坏人来使用这个工具。所以,即使看到技术的黑暗面和工具,也会促使我们更加努力地去改进它,去如何以人为本。这确实是“以人为本的 AI”研究所的根本原则。你和我,以及我们在斯坦福的朋友们,都将 AI 视为一个如此强大的工具,一个文明工具。我们最好尽早建立一个框架,将人类和人类利益置于其中。而“以人为本的 AI”最关键的方面之一,以及我认为它应该指导每个公司、每个开发者的方面,就是这个赋能人们的概念。
你已经在 AI 领域工作了很长时间,担任过许多不同的角色。我觉得有些人现在才刚刚跟上 AI 的步伐。你如何看待 AI 创新的这个时刻?就我们所处的地位,开发者面临什么而言,你认为我们需要做什么才能达到解决这些问题的下一个水平?
这是一个非凡的时刻。我之所以认为这是 AI 革命的绝对转折点,是因为 AI 现在可以被普通人、企业使用,并且我们早期 AI 先驱在职业生涯早期所设想的许多梦想已经实现或接近实现。例如,公众普遍使用的“图灵测试”这个说法,现在基本上已经解决了。图灵测试本身,我不会称之为智能的终极测试,但它是一个如此困难的衡量标准,以至于它是一个合法的衡量标准,而且它已经解决了。而自动驾驶汽车,它还没有完全解决,但比 2006 年解决了得多。所以,我认为由于这些模型被生产化并掌握在普通人和企业手中,我认为这是 AI 革命的一个非凡阶段。但我也清楚地意识到,Aria,我们生活在硅谷的泡沫中。因为我仍然认为,全球人口仍在努力跟上 AI 的步伐。但我们确实看到了未来,以及未来将走向何方。
所以,我认为许多听众都能理解你所说的,这可能是一个巨大的、人类的放大效应。这可能是一个巨大的积极影响,而且我们确实需要担心一些负面后果。我们希望能够朝着正确的方向引导它。那么,从开发者的角度来看,你认为我们需要做什么来确保 AI 朝着这个积极的方向发展?如果你认为需要政府或跨部门的合作,我很想听听。
老实说,我认为我们有很多事情可以做,而且我认为我们应该昨天就开始做。现在还不晚。我们应该真正致力于去做这件事。我认为我们应该做的一件事是,所有这些都应该基于科学,而不是科幻小说。关于“AI 将导致人类灭绝”或“AI 将带来世界和平”的炒作言论太多了。无论哪种说法,都比科学更像科幻小说。所以,当我们考虑如何制定 AI 政策、AI 治理时,基于数据、基于科学事实、基于科学方法论是非常重要的。
第二,我真的相信,就像许多其他技术和工具一样,在应用发生的地方,在人们受到影响的地方,设置护栏是正确的。这是我们应该集中治理精力的方向,而不是阻止上游开发。想想汽车的早期,它不是很安全。你知道,没有安全带,一开始甚至没有门,也没有限速等等。然后我们吸取了教训,你知道,付出了生命的代价。但发生的是,我们没有对福特和通用汽车说“关闭工厂”。我们为安全带、限速等创建了监管框架。所以今天的 AI 也是如此。它是一项极其强大的赋能技术,但它也伴随着危害。所以我们应该关注的是,当 AI 应用于医学时,我们如何更新我们的 FDA 监管措施?当 AI 应用于金融时,我们如何设置监管护栏?所以应用是我们应该集中治理精力的方向。这是第二件事。
最后但同样重要的是,我认为我们需要理解,AI 的积极未来来自于一个积极的生态系统。而这个生态系统需要私营部门。我认为私营部门,无论是大型公司还是创业公司,都非常重要。但我们也需要公共部门。是的,因为公共部门生产公共产品。在我看来,公共产品有两种形式。一种公共产品是那些好奇心驱动的创新和新知识,无论是利用 AI 进行聚变,还是利用 AI 治愈疾病,还是利用 AI 赋能我们的教师。所有这些不同的想法,很多都来自公共部门。ImageNet 就来自公共部门,你知道吗?另一种公共产品是人。我们需要教育越来越多的年轻人和公众了解这项技术。而公共部门,从 K12 到高等教育,肩负着教育的社会责任。所以,我认为这些是我非常关心的 AI 治理和政策的不同方面。
实际上,你刚才所说的,我认为你应该强调一下“AI for All”(AI 为所有人)。因为你一直在做的另一件事是努力确保 AI 不仅仅是斯坦福大学那些拥有加州理工学院物理学博士学位的教授们的领域,而是所有人的。你能稍微谈谈“AI for All”以及它的使命和贡献吗?
AI for All 是一个非营利组织,我是联合创始人,与我的前学生和同事一起。那里的使命是真正为来自不同背景的 K12 学生提供机会,让他们通过大学的暑期项目和实习来接触 AI。这个想法是努力实现公共利益,你知道,AI 的教育部分。我们知道 AI 将改变世界,但谁将改变 AI?我们希望更多不同背景的人来启发,利用这项技术,为各种伟大的事业开发这项技术。所以我们一直专注于女性以及来自农村、市中心或不同、历史上代表性不足的社区和背景的学生参加这些暑期项目。看到这些年轻人使用 AI 或学习 AI,并改进救护车调度算法,利用 AI 评估农村社区的水质,这真是鼓舞人心。这仍然是一项小小的努力,但我希望它能不断发展,因为这个让更多不同人群参与 AI 的目标非常重要。
你还致力于医疗保健领域。你知道,人们应该关注的提升人类福祉的领域之一是 AI 在医疗保健方面能做什么。所以,请稍微谈谈这一点,以及你所做的一些工作,以及你对 AI 在医疗保健方面的希望,展望未来。
里德,正如我的书中所描述的,我出于多种原因对 AI 在医疗保健领域的应用充满热情。你知道,医疗保健绝对是以人为本的核心。所以医疗保健是一个非常庞大的行业,它涵盖了从药物发现或诊断的基础生物科学,一直到临床诊断、临床治疗、医疗保健提供和公共卫生。所以,令人兴奋的是,在这个系统的每一个环节,我们都看到了 AI 可以提供巨大帮助。我喜欢的另一个领域是医疗保健的提供,那是人类帮助人类。美国护士的数量远少于患者的需求。这项工作很辛苦,护士流失率很高。有一些惊人的统计数据,例如在一个班次中,一些护士平均要走四英里以上,仅仅是为了取药和设备等等。在一个班次中,我们的护士可以完成多达 150 到 180 项不同的任务。与此同时,我们有患者从医院病床上摔下来,因为他们缺乏足够的照顾。我们有很多在分诊非常严重的病人方面的问题。所以医疗保健的提供需要很多帮助,更不用说我们的老年人在家独自生活,你知道,有跌倒的风险或痴呆症恶化。
我过去十多年来的工作一直在研究使用智能摄像头,非侵入性、非接触式摄像头,来帮助我们的护理人员关注我们的患者。如果他们在医院病床上,关注他们的活动以防止跌倒。如果他们在家里,关注他们的行为、孤独感或营养摄入,这样我们就可以追踪正在发生的事情。如果他们在手术室,关注护士必须每分钟都要数清楚的器械,这样我们就不会在患者体内丢失它们。这种智能摄像头技术,我们称之为 NBA 智能,旨在帮助我们的医生和医疗保健工作者,以便我们能够集体提高我们患者的护理质量。
那么,你知道,AGI 是一个经常被提及的术语。我认为你可能在哪里说过,我甚至不确定 AGI 是什么意思,因为显然很多人对它的理解都不同,这就像是他们自己的罗夏测试。所以,请稍微谈谈这个 AGI 的讨论,也许它应该意味着什么?以及什么会使它变得更合理,而不是一套零散的……你知道,它很棒,它很糟糕,它会摧毁所有工作,它会帮助全人类等等。
我知道,里德。这既有趣又令人沮丧。我真的不知道 AGI 是什么意思,因为我认为这个词来自商业世界,大约在十年前,当 AI 逐渐成熟,商业兴趣也随之增加。最初的意图,我尊重这一点,是在 AI 中加入“通用”这个词,以真正强调 AI 的未来是更通用的能力,而不是非常狭窄的能力。例如,今天的自动驾驶汽车比仅仅是一个检测树木的摄像头要通用得多。所以,那种专注于一个特定任务的狭窄焦点,与一项可以完成一系列任务的强大技术。我一直不完全清楚的原因是,如果我回顾历史,回到 AI 的奠基人,AI 的约翰·麦卡锡和马文·明斯基,如果你看看他们从 1956 年夏天开始的梦想和希望,那一直是他们的梦想,那就是制造能够思考并帮助人们做出决策的机器,最终甚至能够做一些事情。在他们最初的 AI 梦想中,没有人说过我们梦想着检测树木的极其狭窄的 AI 任务。这个领域,人工智能的诞生,就是思考的机器。所以从这个角度来看,我们有着同样的梦想,同样的科学好奇心,同样的追求,那就是能够执行极其智能任务的机器。所以从这个角度来看,我不知道我是否应该称之为 AI 或 AGI。对我来说,它们是一样的。
我正在考虑 AI 能够做的事情,就像你说的,感觉最近随着语音和生成式 AI 的新改进,我们似乎越来越接近,你会觉得“哦,我只是在和我的 AI 进行一次正常的对话”,而且我们越来越接近它为你做事情。你现在在生活中使用代理吗?你认为它们特别有帮助吗?或者你认为未来几年代理 AI 和语音的承诺将改变事情?
我绝对认为,用自然语言分享知识的方式,让人们能够搜索、构思或学习某样东西,是一个非常强大的工具,即使对我自己来说也是如此。我使用 LLM 来尝试理解一个概念,尝试理解一篇论文,尝试问一些我不知道的问题。最让我兴奋的是看到人们和孩子们把它当作一种工具来改善他们自己的学习。我确实想强调的是,无论如何,让我们确保我们保持人们的能动性,给他们提供好的工具来学习和赋能他们。我认为,随着我们深化强大的工具,我自己也在努力实现这一点,我们将越来越多地看到协作能力,让人们能够使用这些工具更有效地做事。我将对看到这些发生感到兴奋。
我认为这不仅重要,因为这当然是正确的做法,而且我认为你还会听到这样的说法:哦,这些开发 AI 的人正试图取代人类并摆脱他们。我不想每天盯着屏幕看十个小时。没有人比我更不想每天盯着屏幕看十个小时。我认为人际互动非常关键,非常重要。它们对一切都非常重要,对教学、社区、同情心等等。在你那本非常精彩的书《世界冰》中,你讲了一个关于你的高中数学老师,萨贝拉先生的故事,这表明了人际互动的重要性。你能多谈谈这一点,以及他给你的令人难忘的建议吗?
这本书确实承认了我作为一名移民的早期经历,我 15 岁来到新泽西,进入公立高中,当时我不会说英语。那是我旅程的开始。对我来说很幸运的是,很快我就遇到了一位名叫萨贝拉的数学老师,他真的以尊重和无条件支持的态度对待我。他不仅是我的数学老师,而且在我作为新移民的艰难青少年时期,直到他去世,他一直是我生活中的朋友。但他教我的不是通过言语。他从不会坐下来对我说,“Fa Lee,AI 将接管世界。让我告诉你,要以人为本地使用 AI。”我甚至不认为“以人为本”这个词当时在我们字典里。他只是通过行动教我的,那就是,归根结底,我们的社会、我们的生活的意义在于我们为彼此做的、为彼此付出的积极的事情,以及我们所持有的信念,以及我们所追逐的灯塔。通过他的行动,我开始欣赏尊重和提升他人是一件美好的事情,即使那是一个不讲英语、不知道在新国家该做什么的迷茫的孩子。所以,我认为那种慷慨、基本的善良和同情心是成为人的核心。从他那里,我最大的收获是把人放在中心。这很美。谢谢。
是的,很美。那么,快速问答:有没有一部电影、一首歌或一本书让你对未来充满乐观?
《龙猫》是我最喜欢的电影之一。是的,我能听到音乐。我不会尝试唱歌,因为我唱得很糟糕。但是的,它如此简单,如此美丽。我是美丽像素的粉丝,但又如此深刻。我有借口和孩子们一起看,但说实话,我根本不在乎他们感觉如何,我就是喜欢看。
太棒了,太棒了。那么,你希望人们更经常问你的问题是什么?
我希望人们更多地问我如何利用 AI 来帮助人们,因为我可以就此谈论好几个小时。我可以想到我在斯坦福以及世界各地许多才华横溢的同事们正在做的事情。如果我不知道他们在做什么,因为他们是他们自己学科的天才专家,至少我可以引导人们去了解他们的工作。
绝对。现在有很多人在做令人惊叹的事情,我们需要激励更多的人也这样做。
你看到了你所在行业之外的哪些进步或势头让你感到鼓舞?
我实际上认为,人类对能源的关注确实让我感到鼓舞。因为我认为,我猜我还是无法完全摆脱 AI,即使我在开发中,也在努力应对这个非常现实的能源问题,即电力。我认为环境的变化,以及为全球人口提供能源的民主化,都非常关键。而且,你知道,我们不能总是依赖化石燃料。所以,这个领域以及这个领域在全球运动中的许多进步,都令人兴奋。
那么,对于我们最后一个问题,你认为在接下来的 15 年里,如果一切都对人类有利,什么是有可能实现的?以及实现这一目标的第一步是什么?
我希望看到全球知识、福祉和生产力的提高,尤其强调共享繁荣。我之所以想强调这一点,是因为从技术角度来看,我是一个乐观主义者。我知道技术可以帮助人们。我知道如果我们正确使用它,它可以发现新知识,可以帮助我们创新,可以提高我们的福祉。但我认为,我们一次又一次地学习这个教训非常重要,那就是当这种情况发生时,我们需要认识到,我们需要分享这种繁荣,我们需要……民主化这些好处。
绝对。我也希望如此。Fa Lee,谢谢。一如既往,谢谢。
Possible 由 Wonder Media Network 制作。由 Arya Finger 和 Reed Hoffman 主持。我们的节目总监是 Sean Young。Possible 由 Katie Sanders、Edie Allard、Sarah Schle、Vanessa Handy、Aaliyah Yates 和 Paloma Moreno Jimenez 制作。Jenny Kaplan 是我们的执行制作人和编辑。特别感谢 Jessica Williams、AI Sheralds、Herin Shathi、Russell Wald 和 Little Monster Media Company。