Transcription
感谢您加入“改变世界:印度首个未来科技与可持续发展播客”。今天,我非常荣幸能与我一起探讨如何与我共事,他就是斯瓦鲁普·米什拉博士。他曾是谷歌大脑的成员,目前是谷歌 DeepMind 的高级研究科学家,在那里他致力于 Gemini 的推理研究。他和他所在的团队构建了一个系统,在国际数学奥林匹克竞赛中获得了银牌。他还联合领导了对 Gemini 模型至关重要的推理研究,该模型在 Google I/O 2024 上成功发布。他的研究贡献涉及指令调优和推理方法,包括自然指令、超自然指令、问题分解重构、数学 V 程序、帮助我思考和指令偏差。他是 NIPS 2022 和 NIPS 2024 数学人工智能研讨会的联合组织者。他对自然指令的研究最近获得了 AI2 持续影响力论文奖。所以,斯瓦鲁普,我非常非常感谢您抽出宝贵时间参加播客。您出身非常贫寒,是什么激励您选择人工智能作为您的研究方向?也许您可以向我们讲述一下您从谷歌大脑到谷歌 DeepMind 的整个历程。
首先,非常感谢您的邀请。我看了您的播客,内容非常有启发性,旨在提高公众的意识。现在,关于我个人,我深受我们自己的印度科学家如拉马努金等人的启发,您知道,拉马努金,以及我童年时一直梦想着的那些人。在学校里,我曾学习他们的生平,以及他们是如何发明事物的。我一直相信要跳出课本去思考,不仅仅是为了分数,而是如何找到一些联系。最初的动机是在一些竞赛中取得好成绩,比如奥林匹克竞赛之类。但当我深入研究时,我发现了一些联系,并意识到如果想解决一些复杂的问题或一些超出课本知识的难题,就必须思考。而无监督学习就像直接尝试解决这些问题一样。我觉得这能带来某种创造力,因为你不知道如何进行,但你必须进行。我认为这些事情真的帮助了我。我尤其喜欢物理和数学,在高中时是这样。当我尝试解决一些难题时,我感觉到许多不同的物理概念以及数学世界之间存在联系。正是这种了解更多事物的渴望,促使我自学了很多东西。而且,在我职业生涯的早期,我非常幸运地得到了许多研究机构的支持,这对我帮助很大。那时我曾构建了一个理论,我称之为“万物理论”,但它就像是连接不同的概念。我真的着迷于那些支配世界的规律,它们可能彼此之间并没有太大差异,不同概念之间必须存在联系。这让我着迷,比如我们学习牛顿定律、爱因斯坦定律,我指的是我当时的心态,它们真的不同吗?牛顿定律、爱因斯坦定律以及所有这些不同的物理概念,以及我们在其他文献中学习到的东西。然后,将科学延伸到经济学、艺术,甚至为什么你喜欢音乐而不喜欢音乐,你看到的一切都必须有联系,这是我的信念,我认为我当时正在尝试构建这个理论。但这已经是很久以前的事了,在我本科之前。在那段时间里,我在本科期间有机会参观了印度阿拉哈巴德的哈里斯研究所,这是一个非常优秀的印度基础研究所。我得以与一些开创性的物理学研究者合作,这给了我很多启发。然后,直到我了解到人工智能,特别是神经网络,这发生在 IIT。我的导师迪帕克教授,他现在是 IIT 的主任,他当时在教授神经网络课程,以及人工智能如何受到人脑神经网络的启发。我立刻看到了一个火花,我意识到这和我之前试图做的事情之间存在联系。因为在所有这些神经网络中,在人工智能中,我们试图构建一个理论或机制来解释不同的物理现象,而这些现象用定律或手写公式很难描述。因为我们有这个通用的工作流程,你可以学习计算机视觉,你可以学习自然语言处理、语音或任何这些领域。这对我来说非常迷人,我想,这不就是我当年在不知道这些的情况下试图证明的东西吗?这就是我的好奇心在这个领域日益增长的原因。当然,在我的博士期间,我有机会更深入地探索这些。这大约是 2017-2018 年,2017 年 Transformer 论文发表,我们现在在 LLM 领域看到的革命就是由它驱动的。当然,在此之前,2013 年有 AlexNet、ResNet 等许多非常酷的工作。这让我相信,我至今未发表的物理理论,也许这里是最好的地方,最好的途径。因为在计算机科学和人工智能领域,如果你构建了什么东西,很容易进行测试,不像物理学,你需要爱因斯坦的理论,需要埃丁顿来验证和做实验来证明。但在计算机科学中,这要容易得多,因为在人工智能中有所有的数据。这真的让我对进入这个领域产生了浓厚的兴趣。然后,在 2020 年 GPT-3 发布时,你知道,这是在 ChatGPT 之前,GPT 系列,以及在此之前的 2018 年的 BERT,所有这些模型,那是最早的语言模型,当时我们称之为语言模型,现在是大型语言模型。那些日子里,模型能够很好地完成一些任务,比如写作、写故事或问答,很多事情都非常非常令人印象深刻。实际上,当时大多数人,大多数社区,NLP 社区曾经非常小,主要是机器学习,主要是计算机视觉和其他应用。但那是大多数人开始专注于 LLM 或 AI 的转折点。而 Transformer 来自自然语言处理(NLP),它彻底改变了人工智能,因为在计算机视觉、语音、强化学习等所有领域,人们都在使用其他类型的架构,它们都转向了 Transformer。Transformer 来自谷歌大脑,你知道,2017 年。还有当时的聊天机器人 Lambda,当时还很早期。所有这些,以及我研究过的所有流行研究人员,他们激励了我。我一直渴望加入谷歌大脑,因为你看到的许多创新,实际上,你看到的跨不同实验室的许多创新都与谷歌大脑有某种联系。所以,它们无疑激励了我,也许如果我做一些创新,那里将是一个很好的学习和发表我想做的事情的地方。然后,在 2020 年底到 2021 年初,我有机会在艾伦人工智能研究所工作,这是一个非营利性研究机构。在那里,我能够研究一篇关于指令调优的论文,称为“自然指令”。我可以详细谈谈,但它为语言模型与人类交流提供了一种媒介,使其真正具有交互性。传统上,机器学习的定义是你必须训练一个模型,然后测试它。但没有人有时间去训练,或者普通人不知道如何训练模型,不知道如何创建数据集。这实际上打开了大门,你现在看到的 ChatGPT、Gemini 以及许多其他应用,现在到处都是,从孩子到甚至不懂技术的人都在使用 LLM。然后,是的,然后成为谷歌大脑和谷歌 DeepMind 的一部分,参与了许多关键的发布和有趣的项目的开发。这非常棒。当然,正如你提到的,我们在 IMO 获得的银牌,我们团队对此感到非常非常自豪。这是前所未有的。所以,是的,在这个领域度过了一段非常迷人的时光。
太棒了!感谢您分享您的旅程,您的旅程非常精彩,我相信正在收听的听众一定会受到启发,因为您的旅程来自一个非常贫寒的背景,您有一个梦想,想要突破界限,突破事物的界限,并提出更深层次的问题。很大程度上,我认为我们在大学里只是依赖书本,但我认为,也许您的头脑想要您走出去,提出更深层次的问题,我认为事情就是这样开始的。我个人没有教育背景,我从大学辍学了,我只读了 11 年级。但我认为好奇心驱使我前进。我不断地从生活经历中学习,从音乐、从世界、从书籍、从播客中学习,因为那里有太多的知识了。我认为书籍当然很棒,大学和机构也很棒,但我认为我们需要深入挖掘,因为我认为世界是如此美丽,而且有很多东西,正如您提到的,物理和数学,我认为一切都如此智能。物理学本身,我想深入研究它,因为我认为它太棒了。有四种基本自然力:强核力、弱核力、电磁力和引力。然后,当这些原子结合在一起时,它们就带来了宇宙的一切,整个宇宙。我一直想知道,这是如何发生的?这些原子是如何结合在一起,并带来一切的,从太阳、月亮、我们,一切?所以,非常非常有趣。我想深入研究物理学、数学,我想深入研究您在艾伦研究所的论文,自然指令论文。但在那之前,我想听听您对印度教育体系的看法,您知道,因为印度教育体系很棒,但其中一方面就像一个压力锅,还有死记硬背的系统。但我认为这正在改变。所以,我认为如果您能分享您对印度教育和创新格局的挑战的看法,那就太好了。您是否担心学术界对关键论文的访问权限正在关闭?这似乎不仅发生在学术界,也发生在企业界。您知道,有这些模型,大型语言模型,然后是专有的封闭模型和开放模型之间的斗争。所以,您对印度教育体系、创新体系有什么看法?您是否担心学术界正在关闭其对关键论文的访问权限,以及开放与封闭的系统?您有什么看法?
这是一个非常有趣的问题。关于印度教育体系,我当然很感激印度教育体系,我们都来自那里。你知道,我们之所以有今天的成就,是因为印度教育体系。我很高兴看到它正在改变。但我认为一个机会在于,我认为的差异在于过于关注分数,或者缺乏例子。问题在于,很容易满足于一份好工作,或者在考试中取得好成绩,还需要什么创新呢?这就是机会所在,可以改进它。因为,为什么学生必须创新,如果他或她考第一名,成绩优异,并找到一份好工作,他们想要什么?然后,作为课程的一部分,它的设计方式,是否有空间带来从基本原理出发的思考或原创性思考?许多创新实际上来自于从基本原理出发的思考,或者说,非常原创的思考。但我认为,在这些考试和面试以及它们进行的方式中,没有一个好的衡量标准。我也理解,对于如此庞大的人口来说,要提出一个衡量标准并不容易,它仍然很难奏效。但我认为存在两个问题:一个是激励。在我们的体系中,创新激励实际上可能是负面的。有人创新,但考试没考好,他们就不能进入好学校,或者他们找工作很困难,除非他们非常聪明,发明了什么东西,并将其变成产品。所以,这是其中之一。你必须这样做。而且课程让你一直很忙,有很多写作工作,你知道,遵循指示等等。所以,我认为我们需要增加更多这样的激励系统。二是缺乏例子。就像我开头提到的,我们为拉马努金感到自豪,这是我们这一代人之前的伟大创新者。但我们也希望看到更多这样的例子,不仅仅是建立一个大产业,筹集资金等等,而且也不总是只是模仿西方已经证明有效的东西。我实际上很高兴事情正在改变,特别是政府非常热衷于此。最近几天,人们对此非常感兴趣,也有很多激励措施。我相信事情会发生变化。
您对封闭和开源模型有什么看法?这是一种权衡。因为随着人工智能越来越强大,如果我们公开一切,我们应该这样做吗?这符合道德吗?它可能会落入那些有不良意图的人手中,对吧?就像关于核科学的争论一样,你愿意开源核科学吗?可能不会,对吧?同样,人工智能模型还没有达到那个水平,但它们确实在快速改进。所以,这也带来了一些安全问题和政策问题。当然,与之相关的商业利益,它变得是专有的,因为今天没有研究,今天研究明天就变成产品,联系非常紧密。如果你解决了研究问题,你就能立即获得商业利益。所以,出于实际原因,存在差距。这个差距对学术界的人来说是不幸的,因为要进行研究,首先要知道要解决什么问题。如果你不知道要解决什么问题,那么时间就在浪费。所以,这对学术界的人来说确实是不幸的。但同时,它也为提出一些行业在短期内可能不会提出的基本问题提供了机会,因为它们可能太昂贵或太冒险了。例如,改变一些非常基本的东西,比如 Transformer 已经存在几年了,我们能改变 Transformer 架构吗?能改变反向传播吗?我们能开发一个更好的优化器吗?一些基本问题,或者开发一个受物理学启发的神经网络,因为神经网络的基础保持不变,生物学上可行的神经网络,这些东西更有趣,更疯狂的研究。这也为学术界提供了领导的机会。我相信有人正在朝着这个方向努力。您正确地指出了,我认为这里的学生正在模仿西方正在做的事情。我并不是说这是一个错误的方法,但我认为如果我们鼓励学生从基本原理出发思考,还有很多事情可以做。因为我认为,当学生毕业时,主要的驱动力或动机是金钱。我认为我们生活在一个有大量金钱但也有大量问题的世界里。但我认为学生们仍然朝着 90% 的人都在做的事情前进。我认为需要更多的人或学生跳出框框思考,我希望这种情况会发生。我认为那时印度才能真正拥有那些解决重大问题的科技巨头,而不是等待西方去做,然后模仿。关于开放和封闭源代码的讨论,我认为我们都需要它们。而且,在人类历史上,我们第一次拥有一个自学习的技术栈。我认为专有的封闭源代码模型也不是那么好,因为中心化的 AI 总是会导致可怕的后果,可能导致一种停滞状态。我希望我们能进入一个稍微去中心化的世界,这样这些奇妙技术的可访问性才能更加公平,而不是被一个中心实体掌握。
您有物理学背景,有 Max Tegmark 写的一本书,认为宇宙完全是数学的。您在早期致力于“万物理论”,然后您提到人们应该构建受物理学启发的神经网络。您能否详细阐述物理学在构建通用人工智能中的作用,以及您的“万物理论”?
首先,我有一个观察,那就是当你做研究,当你试图发明某样东西时,如果你试图从现有文献中寻找灵感,或者通过观察他人的作品,就会有问题,因为那不会带来突破或飞跃式变化。因为如果你阅读别人的论文,试图从他们那里寻找灵感,你得到的想法可能是对现有作品的渐进式改进,或者是现有作品的组合,而不是真正新颖的东西。这意味着一些伟大的想法可能来自人工智能之外的其他文献。人们有不同的兴趣,取决于他们喜欢什么。例如,一些流行的深度学习研究者从神经科学中获得灵感,有些人从医学领域获得灵感,有些人从认知科学中获得灵感,等等。而物理学是我个人的选择,只是我从一开始就喜欢物理学。然后我看到了联系,因为神经网络在某种程度上是一种通用的建模方法,你试图用神经网络对一切进行建模。物理学也是如此,对吧?有一条定律适用于多个不同的概念,以及多个不同的领域。多么美妙,对吧?这正是我发现从物理学中获取想法并将其用于人工智能的有趣之处。就我而言,我的主要目标是解决我无法解决的物理难题,但我试图以无监督的方式解决它们。有一个问题,没有解决方案。所以,当你以监督方式解决问题时,例如当你去辅导班,你从老师那里学习,你遵循方法,可能是标准方法或经过验证的方法。但当你以无监督方式尝试时,结果可能两种情况:要么你可能取得一些真正新的成就,要么你失败了,因为你从未找到解决方案。这就像生活中的强化学习。我所做的就是,我从 11 年级和 12 年级选取了不同的物理概念,并试图将它们与一个单一的理论结合起来,这样我就不必记住那么多公式。这意味着如果你能将它们全部联系起来,并试图得出一个单一的理论,那么你就可以即时推导出一切,你不需要记住。我不需要记住很多公式。这就是灵感来源。当然,这只适用于我们知道的 11 年级和 12 年级的问题,即使那样,也不是所有的物理概念,一些物理概念当时更受欢迎。然后,是的,我写了这本,我仍然有这本手写的书,大约 150 页,我称之为我的“万物理论”版本,我基本上描述了这些物理概念是如何相互关联的。但你知道,发表这些东西并不容易,因为物理学已经发展了,有弦理论、量子场论等等理论。然后你必须身处那个领域才能与这些理论进行比较和竞争,这需要物理学背景和其他东西。但我希望有一天,我们会拥有能够学习所有这些东西的 AI,并利用这些想法,然后自动进行比较并提出新理论。那将是……
哇,是的。所以,我认为是的,我们目前 LLM 所缺乏的是对世界模型的理解。顶尖研究人员正在努力整合。有 World Labs 的 F 博士,他认为空间智能对于理解三维世界是真正必需的。然后,也许是具身智能。那些从事机器人技术的人认为,具身智能是构建这些通用机器的方法。您对印度有什么看法?因为您知道,有很多初创公司,甚至政府也在支持构建这些语言模型。但不幸的是,到目前为止,印度还没有一个基础模型。您对此有什么看法?一个像印度这样的国家是否需要构建一个基础模型?那里可能面临哪些挑战和机遇?
首先,这是一个非常有趣的问题。关于印度教育体系,我当然很感激印度教育体系,我们都来自那里。你知道,我们之所以有今天的成就,是因为印度教育体系。我很高兴看到它正在改变。但我认为一个机会在于,我认为的差异在于过于关注分数,或者缺乏例子。问题在于,很容易满足于一份好工作,或者在考试中取得好成绩,还需要什么创新呢?这就是机会所在,可以改进它。因为,为什么学生必须创新,如果他或她考第一名,成绩优异,并找到一份好工作,他们想要什么?然后,作为课程的一部分,它的设计方式,是否有空间带来从基本原理出发的思考或原创性思考?许多创新实际上来自于从基本原理出发的思考,或者说,非常原创的思考。但我认为,在这些考试和面试以及它们进行的方式中,没有一个好的衡量标准。我也理解,对于如此庞大的人口来说,要提出一个衡量标准并不容易,它仍然很难奏效。但我认为存在两个问题:一个是激励。在我们的体系中,创新激励实际上可能是负面的。有人创新,但考试没考好,他们就不能进入好学校,或者他们找工作很困难,除非他们非常聪明,发明了什么东西,并将其变成产品。所以,这是其中之一。你必须这样做。而且课程让你一直很忙,有很多写作工作,你知道,遵循指示等等。所以,我认为我们需要增加更多这样的激励系统。二是缺乏例子。就像我开头提到的,我们为拉马努金感到自豪,这是我们这一代人之前的伟大创新者。但我们也希望看到更多这样的例子,不仅仅是建立一个大产业,筹集资金等等,而且也不总是只是模仿西方已经证明有效的东西。我实际上很高兴事情正在改变,特别是政府非常热衷于此。最近几天,人们对此非常感兴趣,也有很多激励措施。我相信事情会发生变化。
您对封闭和开源模型有什么看法?这是一种权衡。因为随着人工智能越来越强大,如果我们公开一切,我们应该这样做吗?这符合道德吗?它可能会落入那些有不良意图的人手中,对吧?就像关于核科学的争论一样,你愿意开源核科学吗?可能不会,对吧?同样,人工智能模型还没有达到那个水平,但它们确实在快速改进。所以,这也带来了一些安全问题和政策问题。当然,与之相关的商业利益,它变得是专有的,因为今天没有研究,今天研究明天就变成产品,联系非常紧密。如果你解决了研究问题,你就能立即获得商业利益。所以,出于实际原因,存在差距。这个差距对学术界的人来说是不幸的,因为要进行研究,首先要知道要解决什么问题。如果你不知道要解决什么问题,那么时间就在浪费。所以,这对学术界的人来说确实是不幸的。但同时,它也为提出一些行业在短期内可能不会提出的基本问题提供了机会,因为它们可能太昂贵或太冒险了。例如,改变一些非常基本的东西,比如 Transformer 已经存在几年了,我们能改变 Transformer 架构吗?能改变反向传播吗?我们能开发一个更好的优化器吗?一些基本问题,或者开发一个受物理学启发的神经网络,因为神经网络的基础保持不变,生物学上可行的神经网络,这些东西更有趣,更疯狂的研究。这也为学术界提供了领导的机会。我相信有人正在朝着这个方向努力。您正确地指出了,我认为这里的学生正在模仿西方正在做的事情。我并不是说这是一个错误的方法,但我认为如果我们鼓励学生从基本原理出发思考,还有很多事情可以做。因为我认为,当学生毕业时,主要的驱动力或动机是金钱。我认为我们生活在一个有大量金钱但也有大量问题的世界里。但我认为学生们仍然朝着 90% 的人都在做的事情前进。我认为需要更多的人或学生跳出框框思考,我希望这种情况会发生。我认为那时印度才能真正拥有那些解决重大问题的科技巨头,而不是等待西方去做,然后模仿。关于开放和封闭源代码的讨论,我认为我们都需要它们。而且,在人类历史上,我们第一次拥有一个自学习的技术栈。我认为专有的封闭源代码模型也不是那么好,因为中心化的 AI 总是会导致可怕的后果,可能导致一种停滞状态。我希望我们能进入一个稍微去中心化的世界,这样这些奇妙技术的可访问性才能更加公平,而不是被一个中心实体掌握。
您提到了您在艾伦研究所的论文“自然指令”,以及您在“超自然指令”方面的工作。如果您能详细阐述一下,那将非常棒,它将如何从根本上改变人工智能的推理能力。
过去,我们一直想构建一个对话系统,你知道,对话系统就是 AI 能否与人类交谈,沟通,回答问题等等。但当时的技术,传统机器学习的基础是,正如其名称所示,机器学习需要学习。如果我需要学习,就必须有人教我,这是基本前提,你必须教。所以,结果是,这使得应用仅限于专家和实验室,那些从事机器学习和人工智能的人。但只有专家才能与所有这些模型互动,只有研究人员,只有专家才能互动。现在,要构建一个对每个人都可访问的人工智能,让每个人都能从中受益,我们需要让每个人都能教机器,或者在不知道任何技术细节的情况下使用机器学习。这就像谷歌搜索之所以强大,是因为你可以问谷歌搜索任何问题,你不需要有背景或任何东西。这就是动机。但是,从传统机器学习的角度来看,如果你让人们问他们想问什么,他们可以问任何东西。现在,你如何为此做好准备?因为即使人类也不是什么都知道。比如,如果你问我一些历史问题,我不记得了,我们需要查阅其他资料或寻求其他帮助。但当时,“自然指令”论文的想法就出现了。我有一张幻灯片,我解释了,比如,我们玩一个叫做“Gilli Danda”的本地游戏,我们在印度玩。我们玩这个游戏的方式是,一个朋友用一两句话解释,你可能看到别人玩,然后直接学会。我们不需要看几百人玩来学会那个游戏,我们学得很快。一个可能的假设是,我们之所以能快速学会那个游戏,可能是因为我们将那个游戏看作是我们已经知道的一些游戏的组合,比如板球或足球。这可能就是我们学得如此之快的原因。这就是我们想把它应用到人工智能中的想法。如果人类这样做,你知道,学习得更快。这对人工智能意味着什么?如果我们创建很多不同的小任务,就像板球、足球和其他不同的运动一样。我们创建这些不同的 AI 任务,并在训练时用指令编码任务,让模型从指令中学习,就像我们从指令中学习板球、足球一样。那么在测试时,任何任务来了,如果你的训练任务很多,你知道,有很多游戏或很多东西,任何任务来了,可能都会与已知的任务有重叠。比如 20% 的任务,我喜欢 Gilli Danda,喜欢板球,喜欢足球,喜欢任何你问的东西,可能都会与你已经知道的任务有重叠。而这些模型在泛化、进行外插等方面都做得很好。所以它们可以进行这种组合。这就是主要思想,核心思想,再次受到游戏物理现象的启发,人们如何玩那个游戏,以及我们如何真正构建强大的机器。这就是现在广为人知的“指令调优”的概念,你知道,就像你问 ChatGPT 或 Gemini 任何问题,它会立即给出答案,你不需要训练模型。但因为模型已经在如此多的任务上进行了训练,并带有指令,所以它可以进行泛化,进行某种外插,你知道,它可以学习这些东西。这就是 2021 年的“自然指令”论文。它实际上催生了 InstructGPT,然后是 ChatGPT。然后是谷歌的 LaMDA,后来用于 Bard 和 Gemini。所有这些都发生了。但有一件事是“超自然指令”。对 AI 研究人员来说,非常非常关键的一件事是扩展。扩展是我们最重要的东西,在深度学习和人工智能中,因为人类的记忆力或计算能力是有限的,人类需要休息,他们会累,他们需要吃饭等等。但机器不需要休息,它们可以工作。这意味着如果你找到了一个可扩展的解决方案,我就可以给机器分配任务几天,用大量的计算资源。如果我发现通过增加计算资源或增加机器数量,问题就能解决,那就完美了。所以,扩展非常重要。在“自然指令”中,我们有大约 61 个任务。我记得我提到过,任务越多越好,覆盖范围越大,你学习新任务的能力就越强。所以,我们开始有了扩展定律。论文中有一个图表,你看到随着任务数量的增加,任务的多样性增加,模型的性能在不断提高,对未见过的任务也是如此。这非常迷人,对于 AI 研究人员来说,这是最好的事情,看到一些东西在扩展。这意味着下一步是,如果它扩展得很好,那就继续扩展。就像物理学中简单优雅的解决方案,它们有效,而不是非常花哨、非常复杂。简单优雅但扩展性好,真的扩展得很好。所以,我们看到这种情况正在发生。下一步就是,我们如何收集更多任务?这就是“超自然指令”的由来。我们将任务从 61 个扩展到 1600 个,跨越多个领域和多种语言,包括一些印度语言。这花费了一年多的时间,与许多人合作完成。我将其开放给任何想提交任务的人。这不仅仅是做这件事,也是赋能每个人,让他们通过提交任务来参与。同时,他们也能从我们这里获得论文或其他认可。这就是“超自然指令”的由来,我们将任务从 61 个扩展到 1600 个,模型变得越来越强大。
谈到扩展,您知道,这些 LLM 是统计模型,但它们展现出一些令人难以置信的东西。从 LLM 的新兴特性到最近 Anthropic 谈到的模型“伪装对齐”。您对扩展有什么看法?您认为仅仅扩展这些 LLM 模型就能带来人工智能吗?您相信这一点吗?
是的,这可以说是 AI 研究人员的第一条规则,我们相信扩展,至少我们大多数人相信扩展。但这是模糊的,扩展是在哪个维度上?当然,即使对于我们所做的任何问题,比如完成一座桥梁的建设工作,如果进展不顺利,我们就增加人手,对吧?我们增加人数。或者,如果我们对我们住的房子不满意,我们就增加金钱来买更大的房子。就是这样,对吧?或者在物理学或这些领域,都受到日常生活的影响。我们在不同方面进行扩展。我们相信机器也是如此。就像发现宇宙定律或计算定律一样,要真正学习这些任务,我们需要扩展。如何扩展,在哪个维度上扩展,这是大事。这是人们一直在努力弄清楚的。如果你稍微回顾一下历史,在机器学习和人工智能的早期,人们会写手写规则。但人类手写规则的想象力可能是有限的。所以,机器在某种程度上进行了扩展,就像克隆多个大脑来帮助你制定规则。然后是特征工程,你不断地扩展特征,然后你把责任交给计算,一个可以自动找出特征的大型网络,你不断地扩展这个网络。扩展一直在历史上发生,在我看来,这与我们日常生活中的处理方式并没有太大不同。但应该扩展哪个方面,这是重大的研究问题。仅仅盲目地扩展计算不会带来人工智能,仅仅扩展数据也不会带来人工智能。不是说以目前的速度,如果你只是在没有创新的情况下扩展你正在做的事情,就不会有人工智能。所以,人工智能的定义也是模糊的。你知道,我们首先需要定义它。在我看来,我们在新闻中有一个非常有趣的讨论,上个月发生了一个有趣的专题讨论会。所以,我的看法是,当一个模型和普通人类一样好时,我不是说专家,而是普通人类。他们可以写故事,写诗,写邮件,写一些代码。当一个模型和普通人类一样好,并且你可以可靠地做到这一点时。不是说模型可以做到,但如果你问 2+3 是多少,模型做不到。所以,它应该能够可靠地做到。我认为仍然需要一些算法上的进步才能达到这个阶段。这很难理解,因为你知道,我们的大脑有 800 亿个神经元,100 万亿个突触,它们放电和连接的方式带来了五种感官、智力、推理能力以及一切。我们根本不需要那么多数据。它只消耗 20 瓦的能量。即使你只看一次或两次,即使是孩子也能理解并记住他们看到的东西。所以,它不是那么多。所以,很难想象也许扩展可以带来通用人工智能。而且,你知道,所有通用人工智能的基准测试都已失效。因为曾经有人说,图灵测试,如果 AI 能通过图灵测试,那么你就知道我们可能有通用机器。然后是,如果你能击败世界上最好的国际象棋选手,那么我们可能有了通用人工智能。这也完成了。然后是,如果它能进行蛋白质折叠,那么我们就有了人工智能。那么它在哪里停止?因为我认为人类总是在创造这些基准测试,这些基准测试被这些统计模型所跨越,这些统计模型只是被喂入数据,数据输入,数据输出。所以,很难想象。你有什么看法?你提到过,也许需要特定的东西才能扩展到通用人工智能。你在 NIPS,你在谷歌 Gemini,你与最聪明的人交谈。有没有什么直觉,什么论文,什么创新让你相信我们接近通用人工智能,也许这就是构建通用人工智能的方法?
首先,你提到的例子,比如国际象棋或图灵测试等等。有一个重要的方面需要考虑,那就是专业任务。一个能成为国际象棋选手的模型,它能像数学家一样擅长数学吗?可能不能,对吧?我认为你正在寻找的是一个通才。如果我们把通用人工智能定义为专业人士,那么我们早就实现了。比如 AlphaGo 的时刻,AlphaFold 的时刻,这些都是专业人士,他们可以做特定的任务,他们可以击败人类专家,获得超人的表现。但我认为问题在于通用性。因为像人类一样,我们可以轻松地做很多不同的任务,不仅仅是一个任务。现在,你能获得这种通用智能,而不仅仅是特定智能吗?这是个大问题。现在,讨论一直是,好吧,你如何定义通用性的界限?有些人可能会说,你看,人类,不是每个人都擅长一切。比如,有人擅长运动,可能也擅长一点编码,一点家务,但他们可能不会跳舞。所以,这意味着也许我们需要稍微放宽定义。而且你正在关注这些大型用例,比如编写代码,或者进行一些创造性任务等等。如果我们缩小界限,缩小范围,我认为在不久的将来,未来几年,事情看起来非常积极。为此,学习算法,当然数据必须增加。但你知道,数据受到互联网的上限限制。互联网的增长速度不如我们想要的快。而且,现在随着人工智能数据进入互联网,它也在污染其丰富性,因为人工智能正在喂养自己的数据。所以,确实存在数据稀缺。所以,如果你问我这个问题,如果你五年前问我,我会说,因为那时还没有利用整个互联网。那时数据扩展是热门话题,就是不断扩展数据。如果你十年前问我,当 AlexNet 的时刻发生时,那些人应该会说,层数,扩展层数,以及移除所有东西,图片和所有东西,那将是正确的扩展方式。但现在,数据是有限的,数据受到互联网的上限限制。计算能力在增加,计算能力越来越便宜。但还有其他创新,特别是算法部分。我们如何训练?我们应该使用什么样的学习算法?我们如何优化各种东西?我认为,下一个重大的扩展定律将来自于此。
您提到了这些模型的通用能力正在增长。有这些模型,据预测,2025 年将是代理模型的一年,这些代理人工智能将完成很多事情。您如何看待世界?也就是说,人工智能的伦理考量。这是让你担心的事情吗?因为去年 CEO P 提到,25% 的代码是由机器编写的。然后我听了 Peter Dages 和 Salesforce 的 CEO Marc V 的播客,他说他们正在构建所有这些代理模型,他们不再招聘软件工程师了。当这种情况发展时,有哪些问题领域?我们需要进行哪些对话?因为我认为这并没有触及普通大众。我认为这个对话仍然局限于那些懂技术的人,或者那些好奇的人。但有 90% 的世界完全不知道这一点。就像科技领域正在发生的某种魔法和颠覆。它可能会彻底颠覆世界。作为人工智能研究人员,在未来几年,您认为应该牢记哪些伦理考量?您提到过,可能会有通用机器,可能是科学家,可能是数学家,可能比任何人类都擅长编写代码。因为,你知道,那个梦想被售卖了,那个被售卖的梦想是……
我们这些普通人认为,创意领域将是最后一个被,你知道的,然后会有,你知道的,人类在那里,我们将从事创意工作,但今天有这些生成式人工智能文本到图像、文本到视频、文本到游戏、文本到世界构建。在未来,人类还剩下什么?很想听听你对此的看法。是的,非常有趣,非常深刻的问题。在我看来,问题是:人类需要每周工作五天吗?可能不需要。你知道,也许每周三天,每周四天。嗯,开始时就像一个工具。我将谈论三个阶段。第一个是即时的,就像用它来提高生产力。这些天,每个软件工程师都使用这个人工智能来调试、编写代码,你知道的。听在学校做作业的人,他们肯定使用人工智能来完成他们的任务。它有助于提高他们的生产力。从某种意义上说,如果从一个角度看,这是好的,就像人类天生就是,我们的工作就是像人一样与自然互动,你知道的,做其他事情,而不仅仅是作为一台机器在另一台机器前,你知道的,一直工作。所以这是好的。人类必须互相交谈,进行社交,建立良好的社会。第二个方面是变化,这种变化是不可避免的。它正在到来,但事实是,它一直都在发生,对吧?就像,曾经有一个机械世界,每个人都认为做机械的东西是最好的做事方式。然后当电气时代到来时,你知道的,很多这些东西,你知道的,就消失了。然后当计算机科学出现时,很多这些核心工作也自动化了。从机械世界到电气世界,自动化出现了,计算机科学等等。人们一直在适应,对吧?所以,例如,过去人们曾经做过非常底层的汇编语言编程。现在有多少人,嗯,甚至需要做那些事情,我们不知道,对吧?但那些曾经是困难的工作,不久前,对吧?所以我的意思是,有,然后人类需要适应,就像人们需要适应不同的要求一样。积极的一面是,嗯,你知道的,嗯,我们可以提高生产力,保持更多的人性,做更多社交性的人类工作,工作更少,然后他们可以做真正重要的事情,并更接近。我觉得作为人类,我们不像机器那样,只是不停地写代码,或者不停地做所有的事情,然后做更多创意和其他事情。但是,嗯,有这个变化,人们必须适应,对吧?当然,激励系统、教育课程等等都必须被重新设计以包含这类东西。第三个方面是像无人驾驶汽车的可能性,就像在无人驾驶汽车领域,尽管有一个大市场,但事情并没有像我们希望的那样发展。例如,人们有一些限制,比如,我们能否考虑在印度街头部署无人驾驶汽车?可能不行,因为有很多不确定性。嗯,你知道的,有一些技术限制阻止了无人驾驶汽车真正取代司机,你知道的,或者即使在无人驾驶汽车运行的地方,也总有人,你知道的,在跟踪汽车的去向,如果需要,他们会来,你知道的,尝试修复任何东西。所以这些事情正在发生。所以我认为人类的形象,人类的角色将会改变。在这个阶段,我认为净收益是积极的,因为有创造力的人,真正好奇的人,而不仅仅是想,你知道的,为,就像机器一样做事的人。我认为他们将获得最多的激励。产品经理将是强大的创意人士、创新人士。我认为这就是人类,我们的思想是好奇的,对吧?我们应该思考,这就是大自然的美妙之处,探索不同的东西,而不是一遍又一遍地重复做同样的事情。让机器去做,因为它们就是为此优化的。我觉得有这个,而且我再次觉得这是我们所有人的责任,那些,嗯,不仅仅是在前沿实验室进行这些实验或构建这些模型的人,也是普通公众,要创造意识,它不是要取代人类,而是要增强人类。没有什么可担心的,但要了解这些事情,以便能够适当地使用它们。是的,所以我保持乐观,你知道的,但就像我提到的,我的意思是,你知道的,我们曾经,目标是承诺,你知道的,人们将从事创意工作,但没有,我的意思是,有了这些文本到视频模型和文本到图像模型,就不会有创意工作了。然后你谈到了自动驾驶汽车,你知道的,然后有这个初创公司,我的意思是,向 SW Robots 致敬,你知道的,我采访过某人,Sanjie Sharma,他们正在制造自动驾驶汽车,他们的目标是制造 L5 级自动驾驶汽车,他说,你知道的,那应该是到 26 年的东西,或者我的意思是,那就是我的意思,上次我谈话时,他们正在非常非常快速地发展,你知道的,他们的创新堆栈正在增长。然后有这个 DeepSeek,你知道的,这个中国公司,DeepSeek 模型 V3,你知道的,我的意思是,人们认为,你知道的,也许限制芯片会阻碍他们的增长,但看看吧,你知道的,他们已经想出了办法,也许推理训练是方法,使用混合专家模型和基于 Transformer 的模型,而且他们以极低的成本做到了,你知道的,五百万,我想我相信,你知道的。所以我想,我的意思是,有人在创新,我们一直在突破界限,这场争夺 AGI 的全球竞赛,我不知道哪种方法会,你知道的,让我们达到人工智能。会是像大脑启发的,你知道的,那些神经科学家,他们相信大脑启发的 AI 是方法,还是仅仅是数据输入、数据输出,用这些大型语言模型,我真的不知道方法是什么,但我认为我们正在非常非常快速地竞赛,而且它的后果是,我真的不知道我们是否完全理解,因为我相信增强是方法,在那里我们让这些人工智能增强我们,也许是脑机接口。我投资于虚拟现实,你知道的,所以我们一直在推动技术本身。它被称为虚拟现实,因为我们正在模仿物理世界,你知道的,我们正在创造这个虚拟世界,而且我们构建得越多,在我脑海里,我在想,还需要多久,也许 20 年,15 年,我们可以构建与现实无法区分的虚拟世界。那么在这样的世界里会发生什么呢?因为,你知道的,我的儿子 10 岁了,他在一所虚拟学校,他的朋友都是虚拟的。所以,我认为,与其向外走,不如向内走。你知道的,我们又回到了计算机,因为有一个叫做“超越假说”的绝妙理论,由 John Smart 提出,他说我们从大爆炸中出来,因为,我的意思是,这是我一直无法理解的事情,他们如何从一个微小的原子中出来,这个原子比头发丝还要小数百万倍,当原子爆炸时,它就出来了,它给了我们一切,恒星、太阳、月亮、宇宙等等。所以他的假说认为,随着技术的微型化,我们正在回到原子,不知何故,你知道的,因为我投资于虚拟现实,我看到了那个未来,因为我不太确定你是否看过那些叫做《黑镜》的电视剧,你知道的。所以《黑镜》我认为几乎就像未来的纪录片,因为他们展示的一切都变成了现实。所以是的,我对这项技术非常乐观和积极,因为这些技术栈可能真正让我们理解我们是谁,当我们增强时,你知道的,当我们获得,当这些机器可能增强我们,并可能打开我们的思想时。因为今天我认为我们都在向内看,我们更分裂,我们更悲伤,我们更,因为我们有更多的钱,但我们更悲伤,更沮丧,我们都在毫无目的地奔跑。每个国家都想成为全球领导者,而且是各行其是,没有人在一起。我希望我们都能在一起,因为我们前进的方式或路线,我认为我们正走向一个破坏性的未来。因为如果这是这些美丽技术的集中式方法,我认为我们将进入一个对我们任何人都不会好的地方。你对在人工智能领域工作的年轻研究人员或企业家有什么建议吗?如果你能谈谈你目前的研究,那么建议很简单,你知道的,保持好奇心。我认为,如果你是好奇心驱动的,事情就会自动发生。我想提一个事件,我曾去过多个 IT 大学发表演讲并与学生互动。最近我看到了这个趋势,你知道的,曝光不足。所以发生的是,我认为印度的 IT 市场现在相当不错,他们能找到一份好工作,你知道的,我的意思是,就业安置,而且这似乎足以让你过上好日子。而且这非常诱人,你知道的,就找工作吧,为什么要读研究生,为什么要出去,为什么要考虑做些不同的事情?但我想,也许是缺乏经验,人们甚至不知道研究生的生活是什么样的。我说的是顶尖的 IT 大学,我们期望人们在顶尖。我认为我们需要这种曝光,这种曝光可能不在当地大学,可能不在当地学校,当地学院,但互联网给了我们,像这样的播客,我知道很多这样的播客给了我们接触所有这些资源的机会。所以我认为,你知道的,真正的能力,而我们人类天生就好奇和有创造力,不要将自己局限于你所处的环境,就像你说的,不要最终成为坐在其他机器前的机器,要成为人,我认为,是的,这是我最想做的建议。我的最后一个问题是,我们都在这里有一个原因,这个原因是我一直在,你知道的,努力找出是什么,你知道的,你的原因是什么?你正在追求什么“登月计划”?因为我看到,你知道的,很多聪明的学生最终只是追逐金钱,然后他们发现自己在一个不快乐的空间里,他们对自己不满意,他们对自己的生活不满意。所以我认为找到那个原因,那个能激发你好奇心的东西,并去追求它,我认为这会创造美好的生活。它让你满足,你为世界和社会贡献良多,你让世界变得更美好。那个原因是什么?那个“登月计划”是什么?对我来说,是理解宇宙。这有点像,不是我选择的,你知道的,它就是这样发生的,就像我提到的,这是我想做的,已经做了多久了?可能 15 年,或者可能更长,试图,你知道的,那个“万物理论”的想法,或者,你知道的,理解宇宙的法则。有一种信仰体系,有一种信仰说事物是相互联系的,你知道的,事物不可能不同,否则这个庞大的世界就无法运转。这是强烈的信念,对吧?但那是什么呢?有一些火花,但我没有完全清晰的认识,那种好奇心。它是一种感觉,一种你看到的,但你无法,你知道的,证明它,或者你无法做出一些具体的事情来造福人类,比如想出一些方法、技术或什么东西来帮助解决许多未解决的问题,例如,比这些创意或写电子邮件这类问题更重要的是,你应该考虑解决癌症或任何这些医疗保健问题。世界上有如此多的现实问题,对吧?我们应该尝试解决那些问题。但我的动力是,如果我至少能够,你知道的,满足我的好奇心,我想理解宇宙的法则。而且我认为我有一个强烈的信念。我也相信吸引力法则,我不知道你是否看过那个,嗯,吸引力法则和显化等等。所以我不断地,你知道的,想象和显化,总有一天,我们将能够弄清楚是什么法则支配着这个宇宙,而这将打开,可能完全不同种类的应用,那可能是一种新的人工智能或其他什么东西,但那将是非常酷的事情。非常感谢你花时间参加播客,祝你一切顺利。你是一个灵感,因为你表明,如果你努力工作,一切皆有可能。你的口号很棒,那就是“跳出书本”,不仅仅是书本,世界上有太多东西可以提供。你需要做的是保持好奇心,提出大问题。这对你来说很棒,我相信这个口号对听众来说也会很棒,如果你能吸收这些信息。所以再次感谢你花时间参加播客。对我的听众来说,如果你喜欢你所看到和听到的,请按下订阅按钮,因为没有你的订阅我们就无法做到。谢谢,谢谢先生,非常感谢。谢谢,谢谢。