Transcription
人工智能不会取代人类。它是人类创造力的力量倍增器。它是一种加速器。它不像某个机器人会突然出现,然后就像发送电子邮件或其他什么一样。
语言模型的瓶颈之一是语言总是受限于语言本身的约束,而语言是人类对现实的阻碍。我们创造了这个机制来相互交流和描述世界,但它并不是对真实世界的准确描绘。
我认为 OpenAI 将会公开上市。我认为它的市值将达到万亿美元。泡沫会越来越大,
至少在目前的情况下,闭源模型将继续获胜。如果你试图构建开源模型,最终你将被迫将其闭源。
所有的收入在哪里?你知道,我们在人工智能上花费了数千亿美元。6000 亿美元是所有使用人工智能的公司加起来需要产生的金额,才能偿还一年的投资。
您正在收听“梯度下降”,这是一个关于如何在现实世界中应用机器学习的节目。我是主持人 Lucas Bewald。
我不担心在我的工作中被人工智能取代。我担心的是在我的工作中被一个非常擅长使用人工智能的人取代。这就是我所担心的,哦天哪,有人会来,他们只是更擅长使用人工智能来获得更好的结果。它不像某个机器人会突然出现,然后就像发送电子邮件或其他什么一样。嗯
这在技术上的版本是,您需要反复进行这种人机循环。所以在这个例子中,我们写了一些关于它是如何工作的例子。然后,利用团队协作图和企业搜索,代理可以去寻找其他例子,然后回来告诉你,这里有很多我们认为更好和更差的例子。现在有很多方法可以让你说“去写代码吧”,它会给你返回 500 个拉取请求。
现在,有人会去检查所有这些。你就像,“哦,让我们从那个问题中应用人工智能。”比如,我担心人工智能代码审查员审查人工智能编写的代码,而中间没有人进行方向性引导,对吧?因为如果它偏离了几个百分点,然后你将其乘以,那将是非常非常棘手的。我们已经经历了不少类似 20 世纪 80 年代人工智能蠕虫的事件,它会自我吞噬并失控,如果有人说,我们一开始偏离了 1%,但在经过一千次循环后,我们就麻烦了。嗯,所以我认为那些类型的任务,你知道我们称之为代码维护,这是一个相当笼统的术语,也许用园艺来类比是最容易的,或者是一些类似的术语,比如大部分代码创建是你说的“看,我想要一个瀑布在那里,我想放一些石头,我想移动植物,种一棵大树”,这是景观建筑。嗯。
日常工作的大部分是修剪草坪、除草、给果树施肥,或者任何你需要做的事情。这就是人工智能可以帮助我们做的,让我们回到一些景观建筑方面的工作。所有这些事情都将与人工智能一起在一个循环中完成。
嗯,我认为会有很多编码模型来完成这项工作。所以是的,DX 将会真正地帮助组织理解他们的生产力,无论是定性的还是定量的,但更重要的是,它会带来改进的行动,对吧?嗯,以及你所说的,它感觉很有成效,但实际上并非如此,而且它并非如此,而且还有可能获得生产力方面的例子,就像那样。我们已经做了很多关于可访问性和翻译方面的工作。任何需要跨大规模代码库完成的大型任务。
这真的非常有帮助。
我很难想象一个一切都只需一键解决的世界。说实话,那会很无聊。嗯,你想要控制权,所以我认为语言界面是加速执行速度的巨大一步。它们是所有事情的最终答案吗?我不确定,但它们确实让你在想法上 moves faster。
嗯,你知道,这是一个机器学习播客,所以我想人们可能会对最闪亮、最吸引人的机器学习功能感兴趣。
好的,简而言之,Runway 是一个完整的视频创作工具。它允许您做一些在更传统的视频编辑软件中可能可以做到的事情。主要区别在于,所有运行都在后台进行。因此,Runway 的大多数核心组件都是由机器学习驱动的。而原因呢,它有两种主要的“模式”或“独特性”,使一切都基于机器学习。一是它帮助编辑、内容创作者和视频制作者自动化和简化制作视频或内容时非常耗时且昂贵的过程。在传统软件中,您会做很多重复性强、耗时且昂贵的事情。因此,Runway 的目标基本上是简化并减少完成这些事情的时间。如果您有一个视频想要编辑,有一个想法想要实现,花费数分钟甚至数小时甚至数天的时间在这些非常无聊的事情上并不是您真正想做的事情。因此,我们构建了算法和系统,帮助您以一种非常简单的方式完成这些工作。
然后,Runway 的另一个方面是,它不仅仅是关于自动化,更是关于生成。因此,我们构建了模型、算法和系统,使我们的用户和客户能够按需创建内容。我想我们对我们来说,一切都发生在浏览器中。因此,它是基于 Web 的、云原生的,这意味着您不再依赖于 GPU 集群,或者说您实际上向这些系统提供按需访问我们的 GPU 集群。您可以近乎实时地渲染 4K、6K 视频。
此外,您还可以实时完成所有这些人工智能工作。但是,仅仅拥有能力并不能告诉您太多信息,因为您实际输入这些系统的内容,才是塑造它们最终所做一切的关键。就像我刚开始在 Twitter 工作时,那是纯粹按时间顺序排列时间线的时代。所以我们想做的一件事是让用户更容易发现他们真正关心的推文。所以问题是,我们如何训练我们的推荐算法?我首先想做的一件事是构建一个情感分类器。所以,你知道,情感分析是一个非常简单的问题。我们只需要 10,000 条推文来训练我们的模型。但问题是,我们尝试做这些事情,结果却是一个极其负面的反馈循环。一旦你优化点击率,世界上最吸引眼球的内容就会排到前面。你会得到很多耸人听闻的内容。你会得到很多暴露的内容。你会得到很多比基尼图片。你会得到很多关于 10 种可怕性病的列表等等。所以我们想在所有这些更深层次的原则上训练我们的模型,我们会让人类评分员根据我们的产品原则对推文和推荐进行标记。但如果我们甚至无法正确进行简单的情感分析,我们肯定无法以所需的质量和规模获得这些更复杂的数据。所以,嗯,是的,所以我想最终在 Google 和 Facebook 也发生了同样的问题。所以最终我意识到我需要自己出去解决这个问题。所以我们在 2020 年创办了 Surge,就在疫情最严重的时候。所以我们在这个领域的观点是,所有现有的解决方案基本上都专注于这种商品化标记的想法,即技能要求很低。就像我经常举的例子,比如在汽车周围画一个边界框的问题。是的,你和我都可以给汽车画一个边界框。就像一个三岁的孩子也能给汽车画一个边界框。我画的边界框不会与 Terrence TA 画的或爱因斯坦画的边界框有任何不同。它对所需数据的复杂性有一个非常非常低的上限。
相比之下,如果你想想我们今天想做的所有事情,比如,是的,我们想要能够写诗的模型。我们想要能够解决相对论方程的模型。我们几乎想要将无限的智能注入我们的模型。所以当时所有其他的解决方案,是的,它们是为一种非常低技能的商品化风格设计的。所以它根本不注重质量。相反,它注重规模。
我认为人工智能交易将使量化交易变得更好,并且对人类来说更难做好。我的意思是,我认为人类在判断市场、交易员的情绪状态等方面具有微弱的优势,整合大量零散的信息。比如,你从一家公司那里看到一点关于通胀的线索,然后从另一家公司那里看到另一条线索,然后你开始将叙述联系起来,比如,“好吧,也许通胀正在上涨。我将对债券做些什么,或者类似的事情。”你知道,这可能就是人工智能无法立即看到的东西。但在高频交易方面,计算机已经占据了主导地位。交易新闻是我真正感兴趣的,我知道很多其他大型语言模型(LLM)方面的人也对此感兴趣,无论是来自量化领域指向 LLM 领域,还是 LLM 领域指向量化领域。你知道,问题是,你能否拥有一台能够快速阅读突发新闻并快速做出反应的计算机?这是我们正在开发的产品之一,我认为它将非常有帮助,因为你会惊讶于有多少突发新闻悬而未决,而市场仍在试图弄清楚这些信息是否真实。LLM 可以在一秒钟内做出决定,然后进行交易。我觉得这将是一个巨大的改变者。但当然,在金融领域,所有东西在六个月或一年内都会被大家拥有,你知道你可以非常快速地对事物做出反应。就在前几天,就在今天,HIMS 宣布他们将销售 GLP 产品,这对 HIMS 来说是个好消息,但市场花了几分钟才真正消化它。而 LLM 会立即做出反应,“是的,买那个。”我觉得这是某些大公司正在开发的产品,但没有人为普通人开发。我想为普通人开发这类产品,也为公司开发,但也要为普通人开发。而且金融领域还有各种各样的小细节可以从中受益。交易员本身。我的意思是,他们大多已经被计算机淘汰了。我觉得仍然有一些对冲基金有人在里面。他们通常与量化对冲基金相比相形见绌。我们也在考虑,我们如何将量化工具带给人们?
你是在交易吗?看起来你在直播中你在交易。所以你本人没有被淘汰吗?
不,我认为仍然有人可以做到。我认为这是一个输掉的赌局。我的意思是,这就像卡斯帕罗夫对战深蓝一样,你甚至在几年前就能看到预兆,而今天,他们仍然是优秀的国际象棋选手,但你知道,玩深蓝真的很难。我觉得你会有这样一个时期,比如私募股权或风险投资,这些领域是人工智能在未来 10 年、20 年、30 年、40 年、50 年内都不会与之竞争的。也许有人会创办一家与你竞争的公司,然后说,“这些家伙是谁?是那个我在 MIT 遇到的家伙,还是那个我认识的来自 Anthropic 的家伙?”“不,那是一台机器。”(笑声)你知道,这是一个网络。你知道,那将是,你知道,非常非常具有讽刺意味。
你写的第一篇文章叫做“人工智能的 2000 亿美元问题”,然后我认为它被更新为“人工智能的 6000 亿美元问题”。我实际上想象很多听众都读过这篇文章,当然我们会在节目笔记中发布,但我认为,我们不要假设有人读过它。也许你可以解释一下。我认为,特别是你的文章似乎对没有金融背景的人来说仍然有点令人困惑。所以,如果你不介意的话,请为人工智能受众把它讲得简单一些。
是的,我很乐意。我的意思是,我想首先要回答的基本问题,当时是出于我自己的好奇心,那就是所有的收入在哪里?你知道,我们在人工智能上花费了数千亿美元。超大规模云服务提供商都在建设这些庞大的数据中心。所以我只是没有一个很好的直觉来了解这项投资的规模有多大,以及人工智能生态系统需要达到什么规模才能使这些投资变得有意义。所以,是的,他的 2000 亿美元问题变成了人工智能的 6000 亿美元问题,这基本上是我通过思考如何从数据中心投资转向人工智能投资所需收入的金额而得出的某种草稿计算或直觉。所以这个数字是某个时期内数据中心的总支出,对吧?
所以,让我来解释一下基本的计算,这很棒。所以,在 2024 年,当我去年夏天发布 6000 亿美元的文章时,我们认为英伟达在 2024 年的年收入将达到约 1500 亿美元。所以,你每花一美元在 GPU 上,你就必须花一美元在数据中心、能源、发电机、电力等方面。所以假设购买这些 GPU 的人正在使用它们来创建人工智能系统,你可以应用这个 2:1 的乘数说,“好吧,所以对于花费在 GPU 上的 1500 亿美元,我们将花费 3000 亿美元用于数据中心。”然后问题是,“好吧,我们有了这个 GPU 容量,我们有了这些数据中心,但现在某个地方的某个初创公司,某个企业,有人将使用这些数据中心容量,他们将提供一项服务。”所以你是一家初创公司,你正在使用 OpenAI 的 API,他们在微软的数据中心调用某个地方的数据中心来运行那个模型。你想赚取利润,所以我只是为了论证而假设,你,初创公司先生,想在你的产品上赚取 50% 的毛利率。这意味着你每花一美元在人工智能上,你需要产生 2 美元的收入才能获得 50% 的毛利率。所以你基本上得到了第二个乘数。所以你取 1500 亿美元,将其翻倍到 3000 亿美元,以获得数据中心的投资金额,然后你再将其翻倍到 6000 亿美元,然后你说,“好吧,6000 亿美元是所有人工智能初创公司以及企业和所有使用人工智能的公司加起来需要产生的金额,才能偿还一年的投资。”这也许是最后一个重要的观点,那就是 6000 亿美元不是无限的总数。实际上,如果在 2024 年我们花费了 1500 亿美元,那就是 6000 亿美元的所需收入。如果在 2025 年我们再花费 1500 亿美元,那么就是 1.2 万亿美元,而且它会不断增加,这几乎是我们已经投资的债务,我们现在必须随着时间的推移通过人工智能收入来偿还。微软目前每个季度在新的数据中心上花费约 200 亿美元,这在去年最后一个日历年的第三季度和第四季度已经开始稳定下来。而谷歌每个季度在数据中心上花费约 130 亿美元,这也在开始稳定下来,而 Meta 和亚马逊虽然尚未完全稳定,但预计将稳定在相似的水平。所以你会看到亚马逊稳定在 200 亿美元以上,与微软类似,你会看到 Meta 稳定在 100 亿美元以上,与谷歌类似。这意味着人工智能的 6000 亿美元问题不会变成人工智能的万亿美元问题。我们已经达到了一个不再增长、不再爆炸的状态。
那么第二部分是收入部分。当我第一次发表这篇文章时,我基本上说,“嘿,我们需要产生 6 亿美元的收入。我们做到了吗?”就像,我们是否成功地实现了这个目标?我尽可能慷慨地计算。我说,“好吧,来自 OpenAI 的数十亿美元收入。你有一堆初创公司,每家公司都产生数千万或数亿美元的收入。让我们假设大型科技公司产生了 50 亿美元的收入,我认为这是一个非常慷慨的假设。”去年夏天,我基本上说,“嘿,有这个 5000 亿美元的缺口,我们需要的和我们实际拥有的之间存在巨大的差距。”现在,我认为如果我们将时间快进到今天,情况也差不多。当然,OpenAI 更大了,Anthropic 更大了,但 OpenAI 仍然是人工智能生态系统中产生收入的最大部分。大型科技公司尚未完全在其业务中解锁人工智能收入。本周我们看到谷歌宣布,您必须通过 Gmail 购买他们的人工智能产品,对吧?他们正在努力弄清楚如何分发这款人工智能产品,但我们实际上处于与 2024 年 7 月非常相似的境地。
那么,如果收入还没有产生,那么购买所有这些数据中心的钱是从哪里来的呢?我的意思是,风险投资的投资肯定不够,不足以资助数千亿美元的支出。所以,这难道不是必须在企业内部发生的吗?这是一个很棒的问题,这也是我一直在思考的问题,我一直在写的这些文章都是我在思考。我问了同样的问题。我不知道答案,然后我去找答案,我发表了关于我称之为“人工智能的囚徒困境”的文章,我基本上解释说,云业务本身是一个价值约 5000 亿美元的业务,而云业务是亚马逊、谷歌和微软的摇钱树,而且它是一项非常非常有利可图的业务。我们现在生活在一个世界里,我认为这在商业史上也是非凡的,七家公司占标普 500 指数的 33%,即“神奇七巨头”。所以基本上发生的是,你有这七个寡头垄断者,垄断者,无论你怎么称呼它们,它们都有这个摇钱树,它们的云业务,它们都在努力保护它们的摇钱树。所以我认为人工智能,人工智能领域正在发生的事情非常迷人,部分原因是我们生活在这个独特的时代,我们拥有这个非常强大的云寡头垄断,它们正在相互竞争。所以,如果你坐在微软的董事会会议室里,你会对自己说,“嘿,我们不想落后于谷歌。如果我们这样做了,我们将失去在这个利润丰厚的寡头垄断中的地位。”所以你有一种感觉,每个人都必须花钱才能相互竞争。所以,直接回答你的问题,为这些数据中心提供资金的资金来自过去十年建立的非常有利可图的业务的现有利润。
这笔钱已经承诺了。基础设施正在建设中。所以真正的问题是,谁在真正构建值得所有这些投资的东西。
[音乐]
我们一直说,从我们开始的那一刻起,我们的目标就是成为一家跨越数十年的技术公司,因为我们认为这很难,但每十年,就像现在一样,你会经历一次重大的技术转变,一半的公司消失,一些新的公司出现,一些公司在新的时代生存下来并蓬勃发展。所以,我们真的想成为一家跨越数十年的技术公司。有人前几天在采访中问我,你们成功了。我说,不,我们还没有。我说,我想我们算是成功了,我们并不认为我们已经完成了,但我想说的是,从一开始,我们就解决了人们的问题。我们不解决技术问题,对吧?我们没有任何东西知道你在写什么语言,或者其他任何东西。而开发者只是我们观众中相对很小的一部分。技术团队是我们活跃用户总数的一半以下,如果你喜欢技术团队的话。但这很重要,因为它涉及到你问题的本质,首先,我们所做的是试图连接技术团队和业务团队来运行,我们称之为业务流程。这是一个大词,工作流程,无论你想怎么称呼它,在广泛的层面上。
事实证明,如今大多数企业都是技术驱动型企业,这非常重要,对吧?一家银行、一家汽车制造商、一家制药公司,它们都在使用大量的技术、软件、硬件或其他东西来开展其核心业务。所以,他们的技术团队如何工作,他们构建什么,他们如何制造产品,以及他们如何与业务团队联系,这非常重要。这就是 Duran Conference 在过去 20 年里所做的核心工作。事实上,随着我们的发展,大多数公司中的业务人员远远多于技术人员,产品经理、开发人员等等加在一起。我们可能在 2019 年开始构建我们称之为“团队协作图”,那是因为我们的应用程序之间以及与其他许多应用程序之间有许多链接。跨越我们 20 多个应用程序,收集在约 5 到 15 个集合中,它们都有一个中央云平台。我们跟踪数十亿个与其他应用程序的链接。无论是 Google 文档,还是 Figma 模型,还是 GitHub 的拉取请求,还是 Salesforce 的客户记录。
这些链接我们开始将它们组装成一个大图。它现在是一个巨大的图。它拥有超过 1000 亿个对象和连接,并且它正在以大约每季度增长 50% 以上的速度增长。原因在于,最基本的部分是您世界中所有这些对象是如何连接的。我们将所有这些都放入了团队协作图中。这似乎是一个简单的挑战。事实证明它非常复杂,因为你必须理解链接的类型。在技术场景中,如果我有一个 Jira 中的问题与一个拉取请求相关联,我可以从中推断出一些东西。那个拉取请求是某个项目的一部分。那个项目是某个业务计划的一部分,等等。那个计划有一个电子表格,所以内容的类型在团队图中非常重要,显然,企业中的所有这些都有权限,所以我需要能够导航、浏览、查询并取回东西。
然后我们在上面添加了语义搜索,这是我们构建到 Robo 中的核心。所以,我们经常称之为客户的企业搜索引擎,可能是目前世界上最大的企业搜索引擎之一,而且我也会说它是最好的,因为我们花了很多时间,我们有大量的知识来为您提供出色的排名和上下文信息。
现在,2019 年我们开始构建团队协作图,是因为我们需要它来连接我们的工作流程应用程序与您正在使用的所有其他 SaaS 服务。您开始在这里使用 Figma 图进行产品管理,您开始看到 IT 团队连接数据狗或大熊猫或 Splunk 报告,您开始看到营销团队连接到销售云,所以我们有了所有这些链接,我们开始将它们放入一个越来越大的图中。它变得越来越复杂。
称之为三年前,当 LLM 出现时。我们经历了一个超级力量的改变时刻,因为我们拥有一个包含您公司所有对象的图。您的组织知识现在已成为您的组织记忆。为什么会发生变化?因为现在我们可以理解文档的内容,对吧?我们可以使用 LLM 来提取概念、定义。我们有一个非常受欢迎的功能,您可以选择 Confluence 或 Jira 中的任何单词,然后说“定义这个词”。现在人们通常不会定义我不知道的词“progress”或“disruption”。他们定义“fairy dust”或“alchemists”,因为他们想知道这个内部的行话是什么意思?我们可以为您提供完整的历史记录,然后您就可以开始与 Robo Chat 进行聊天了。所以,显然,这个图和组织记忆是一个大规模的、有权限的知识库,它涵盖了您组织中数百个 SaaS 应用程序,这就是 Robo 作为一项技术的核心,我们姑且称之为。
我不认为模型随着时间的推移而变得更好的原因只有一个。我认为这是这些元素的组合。我几天前听了 Ilia 的播客,我真的很喜欢“研究时代,但有更大的计算机”这个说法。所以我们又回到了基础研究,你需要理解并花很多时间进行科学实验。所以如果你非常擅长进行实验,我会说这是这里非常有效的事情之一。但具体来说,我想问,前沿在哪里?模型仍然在哪些方面表现不佳?你最新的模型能做什么,而上一代模型做不到?或者你在排行榜上哪里认为你获得了优势,为什么?
嗯,我认为模型现在肯定能做很多以前做不到的事情,但仍然有其他事情是它们今天做不到的,我相信我们将来能够解决。我认为总体而言,这种“世界理解”的想法变得更加明显。模型是很好的推理系统,它们在空间和时间上理解空间一致性,它们可以理解因果关系,它们可以理解世界及其影响,这些影响是相当广泛的。有方法可以定制或微调这些模型,使它们在其他领域也很有用。从通用智能的角度来看,这变得非常有趣,因为我认为语言模型的瓶颈之一是语言总是受限于语言本身的约束,而语言是人类对现实的阻碍。我们创造了这个机制来相互交流和描述世界,但它并不是对真实世界的准确描绘,它是对世界的阻碍。因此,能够训练的不仅仅是语言,还有观察数据、真实数据、视频数据,可以让模型以更一致的方式掌握现实以及世界如何运作。我们现在做的很多工作都朝着这个方向发展,以及如何扩展和推断这种能力,希望能够做得比视频生成更多。
理解世界是一回事,但实际构建教授模型理解世界的数据是完全不同的问题。我们正在尝试生成有助于通用人工智能(AGI)的数据。我们经常做的一件事是,有时当客户或新公司来找我们,并询问他们是否可以与我们合作,如果他们的目标与 AGI 不一致,我们实际上就会拒绝他们,因为我们不想要收入,我们想专注于 AGI 公司。所以,我认为,再次回到不融资,我们没有董事会,或者说我们没有外部董事会,我们没有那些渴望尽可能多赚钱的风险投资公司,我认为这给了我们自由,让我们能够专注于最重要的问题,这使我们能够保持研究的重点。
[鼻息声]
完全同意。所以你只与专注于构建 AGI 的公司合作。
是的。所以,例如,如果一家公司来找我们,你说,“是的,我们只想训练一个,那是什么?让我们说,我只想训练一个,我是一家报纸,我只想训练一个,我不知道,一个分类算法分类器。”是的,我们就是拒绝。
如果我想做一个视频,比如自动视频生成器,那会是你的现实吗?还是太……
是的,我的意思是,我们确实这样做,因为建造这样的视频生成器是建造 AGI 的一部分。所以,是的,在这种意义上,看看,我的意思是,我想五年前收集的数据与现在收集的数据非常不同。我会认为,五年前你做的一些任务今天可能很容易被 LLM 自动化。它的改进速度令人震惊。你能谈谈过去几年任务类型的变化吗?
是的,我们做的很多工作都大不相同。所以,当我们刚开始的时候,我们的很多工作都在搜索评估或内容审核等任务中,你知道,而今天,这几乎完全是 LLM 的工作,所以这是一个很大的区别。然后,即使在 LLM 内部,也出现了朝着更高复杂度、更高复杂性、更高专业性的明显趋势。所以,我可以举几个例子,比如,多模态复杂性有了很大的提高。几年前,一切都是文本数据,只是对话式文本助手,但现在我们处理大量的图像、音频和视频。我认为人们真正想要的是模型能够同时理解所有这些模态。你可能想做的一件事是,我正在用手机拍摄一段视频,然后我要求模型根据手机上的视频创建一个程序,在现实生活中模拟它。所以,是的,多模态复杂性有了很大的提高。语言也有了很大的扩展,你知道,起初人们自然地专注于只做英语的工作,但我们现在实际上使用超过 50 种语言。我认为有趣的是,它非常高度专业化,比如我们支持阿根廷西班牙语的编码,我们支持玻利维亚的法律和金融专业知识。这是因为,即使是今天,我认为很多模型实际上并没有那么好,令人惊讶的是,它们在不同语言、不同方言或不同文化的细微差别方面并不那么好。所以我认为在这方面还有很多进步的空间。然后,可能最大的转变是,我们所做的大部分工作都需要很深的专业知识。是的,你看到模型现在赢得了 IMO 金牌,你看到它们完成了所有这些极其高级的任务,所以你实际上需要非常非常强大的思维能力。所以即使是今天,我们做的一些任务也需要花费几天甚至几周的时间来解决这些非常有趣的问题。所以这与 5 到 10 年前的任务形成了鲜明对比,当时你可能花费 5 秒钟来标记一个可能的。
你有没有一个你不能做,但希望有更多时间去做的课题?或者你认为机器学习中有什么被低估了?我知道这是一个有趣的问题,问一个痴迷于机器学习的创始人,但我还是会问。
我认为是音频生成。我认为它现在正在赶上,但没有人真正关注。有一些非常有趣的开源模型,比如 Taco 和其他一些。我认为这将对很多应用程序产生巨大的变革,我们已经开始涉足一些领域了。但是,我的意思是,作为一个行业或研究社区,很难同时关注这么多事情。现在,我认为图像理解在某种程度上已经解决了,人们正在转向其他特定领域。我认为我们很快就会开始看到的领域之一是音频生成。所以,是的,我肯定对此感到兴奋。
你对开源模型和闭源模型在长期来看谁会获胜有什么看法?我的猜测是,至少在目前的情况下,闭源模型将继续获胜。部分原因是,我的意思是,这些元素非常有价值,如果你试图构建开源模型,目前的激励机制是,你最终将被迫将其闭源。所以,如果我们想构建真正优秀的开源模型,我们就需要一种不同的激励结构来确保这种情况发生或保持下去。否则,就像如果你看看其他类型的开源模型的历史一样,它们随着时间的推移变得越来越封闭。
你是什么意思?你指的是什么?所以,我的意思是,即使你想到 Meta 正在考虑将其开源,而模型训练起来非常昂贵,人们想要完全捕捉价值。如果你构建了一个真正真正好的开源模型,我认为它不会长期保持开源,除非你能改变某种我还没有弄清楚的激励结构。
你的一些辛辣观点之一,我不知道,大约六个月前,你说人工智能将进入一个泡沫,泡沫将会破裂。你可以说这非常具有前瞻性。我不确定你认为我们处于一个炒作周期中的哪个阶段,或者你是否期待一个更大的泡沫,但感觉我们可能在两个月前就达到了一个峰值,也许正在从中下降。你的看法是什么?
是的,很难说。我的意思是,我认为在 90 年代,互联网泡沫也发生过。当时不仅仅是互联网泡沫,它是一个混合体,包括互联网和其他技术,包括通信技术。所以当时有一个泡沫,感觉可能是一个 S 形曲线,然后它又出现了一个大的跳跃。我认为这里也会发生这种情况。我认为这可能是终结所有泡沫的泡沫之一。关于它的有趣之处在于,在每个泡沫中,有时你真的会想,“也许是真的。”(笑声)我认为最聪明的人过了一段时间就会说,“我不知道,也许我应该投资互联网股票。”我觉得这正是将要发生的事情。我认为 OpenAI 将会公开上市。我认为它的市值将达到万亿美元。我认为泡沫会越来越大。我觉得它可能明天就会全部崩溃。但我也觉得,几乎比互联网更重要的是,人工智能对很多组织都有直接的影响。另一个关键是,最大的受益者将是 Verizon 和宝洁等公司,它们将能够节省数十亿美元,这对标普 500 指数来说是一笔巨款,它们可以节省一些部署人工智能工具的成本,也许它们可以花钱使用像你们这样的产品来弄清楚,“我们能用我们内部拥有的数据做什么?”非常聪明的公司会将这些节省下来的成本用于类似这样的努力。但我的意思是,互联网为这么多不同的标普 500 公司做了这件事。它推动了全球增长。
我们已经看到编码代理,这是一个非常强大的现有运行业务的解决方案集。我们内部有大量的例子,我们经常使用它。所以,举个例子,(清嗓子)我们有一个内部服务,它的形状和位置发生了变化。我想想那个服务是做什么的。我现在忘了,但我们假设它是一个 REST 端点,有人正在更改 URL。但我不仅仅是更改 URL,这就像查找和替换。他们实际上正在改变发送到它的请求的形状以及它们返回的方式。API 在某种程度上发生了变化。
不是有意义的,而是微小的。我们需要在内部更改超过 500 个存储库。有时是配置,有时是实际的代码,取决于它们如何使用该东西。这是一个非常适合引入人工智能编码代理的任务,这与我们传统上认为的非常不同。
我们是如何做到这一点的,是使用 Rodev 和 Jira 的代理以及其他东西。我认为它主要使用 Rodev 来编写一些关于它是如何工作的例子。所以,也许一个用 JavaScript,也许一个用 Java,然后提交这些例子,然后你就可以将这些例子放入图中。现在你可以说,“去找到任何你认为我应该做的地方”,然后它就会返回。但我认为另一个学习是,我们有一个模型,我们认为人机协作是世界发展的方向。人工智能不会取代人类。它是人类创造力的力量倍增器。它是一种加速器,而不是替代品。
它是力量倍增器。这是实际的、无聊的答案。但在这之下,有一个更古老的问题。每个宗教、每个哲学家(音乐)都试图解决几个世纪的问题,那就是,究竟意味着什么才算是一个人?我很好奇你的宗教是否影响了你对人工智能的想法。我问这个问题是因为你是少数几个,我认为你比大多数人谈论宗教。而且我确实觉得人工智能几乎就像,我不知道,就像宗教规模的影响,当你想到通用人工智能和其他类似的东西时。所以,也许这有点跑题了,但我很好奇你是否有什么联系。
我深深地着迷于宗教,我们过去也曾就宗教进行过一些谈论。我认为所有宗教都很有趣,因为我认为宗教试图回答这个问题:人意味着什么?正如你所说,这个问题在人工智能领域有很多相关性。我读过基督教、犹太教、伊斯兰教、摩诃婆罗多、道教的主要书籍。我读过所有主要宗教的书籍,这是我个人探索、我自己的好奇心,以了解人类意味着什么?这种体验是什么?我认为宗教机构,我认为宗教就像一个包装,制度化宗教就是包装纸。所以一旦你撕掉包装纸,里面是什么,我认为在不同的文化和背景下是相似的。里面是面对的时刻。面对意识,面对上帝,面对真理,面对那些真正重要和基本的事物。所以,回到人工智能,你可能不知道,或者不记得,或者不知道这对我影响如此之大,但你曾经送给我一本《哥德尔、埃舍尔、巴赫》作为圣诞礼物。这是一位人工智能研究者写的关于人工智能的书。他提出了自己的一个非宗教假设,他说,人类意识的这个独特元素是自我反思、递归的想法。他在哥德尔、埃舍尔和巴赫的作品中通过数学来阐述,他说这就是人类状况的独特性。
非常感谢您收听本期“梯度下降”节目。请继续关注未来的节目。