📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Can GPT o1 Reason? | Liron Reacts to Tim Scarfe & Keith Duggar

Doom Debates2:06:55

Transcription

我认为这真的很简单,你有一个基础模型,它只是被训练来匹配文本的统计分布。这基本上是一个自动完成。它们现在已经变得如此庞大,拥有这些巨大的查找表,它们可以进行查找表操作。这就是你如何通过查找表通过图灵测试。欢迎来到 Doom Debates。GPT-1 刚刚发布,今天我们将要看一个由人工智能界两位相当有名的家伙主持的播客。他们是 Tim Scarf 博士和 Keith Dugger 博士,他们共同主持一个名为 Machine Learning Street Talk 的播客,这是 Spotify 上排名第一的人工智能播客,绝对值得一看。他们的观点与我的观点大相径庭,很容易与之争论。他们不是“末日论者”,不认为当前的人工智能接近真正的推理。因此,我想,深入探讨他们最近一期关于 GPT-1 的播客会很有趣,看看他们在谈论什么,他们是如何分析它的,这将对我非常有益,可以让我从我的角度来推演,并给你一个关于我如何分析 GPT-1 的不同视角,你将从中受益,同时听到两种观点,并获得对 GPT-1 的 360 度全景视图。你觉得这是一个不错的播客主题吗?嗯,刚刚录制完播客,我会在最后做这些介绍。我可以告诉你,我认为这是一个相当不错的播客。我惊喜地发现他们的播客内容如此丰富和实质性,我很有兴趣反驳并解释我们分歧的症结所在。Tim Scarf 博士曾在微软担任首席工程师,在 BP 担任首席数据科学家,并创立了多家其他科技初创公司,他拥有机器学习博士学位和计算机科学一等学位。Keith Dugger 博士获得了麻省理工学院的博士学位,并在 IBM 研究院、华尔街和微软任职过。正如我所说,他们有一个很受欢迎的播客,有很多很棒的嘉宾和高质量的思想交流。好了,我们开始吧。他们首先讨论的是可计算性理论以及它与人工智能的关系。在我看来,计算理论中的许多东西都处于绝大多数聪明人的认知视野之外。就像我和许多其他聪明人说过的,计算理论是一门令我大开眼界的课程,你知道,图灵是一位超越了天才的天才,因为他发明了这样一个领域。我指的是图灵机与下推自动机与有限状态自动机等等。这些绝不是微不足道的。它们不是技术细节,而是计算中极其强大、至关重要且重要的基本概念。什么是可计算性理论?这是我在大学计算机科学学位学习的一部分。它要追溯到 1936 年,艾伦·图灵发表了一篇关于可计算数的著名论文,这篇论文开启了现代计算理论。可计算性理论的核心原则是,当你定义某些简单的计算模型时,比如最著名的图灵机,但也有很多等效的计算模型,你可以定义这些模型,它们只是数学形式化的模型,是数学结构,你可以说,看,想象一个无限长的磁带,分成许多单元格,每个单元格可以包含零或一,或者可能是一个更大的数字,这并不重要。然后你有一个读写头,可以扫描这个任意长的磁带的左右。它可以扫描左右,可以读取磁带上的值,可以写入磁带上的值,可以进行条件逻辑,比如“哦,如果这里有一个一,就向左移动;如果这里有一个零,就向右移动。”所以它只能做一些基本的操作。我几乎告诉你它能做的所有事情了。它还可以维护一个内部状态,比如它可以处于有限数量的不同状态之一。所以,这基本上就是图灵机能做的所有事情了。它就像一个简单的数学模型。可计算性理论的基本原则是,这些图灵机在它们能为你计算的可能集合上有着极其高的限制。比如,你可以取任何任意复杂的函数来计算,并且存在一个相应的配置可以给图灵机,存在一个相应的图灵机将实际计算这个任意复杂的函数。所以,当我说的“任何函数”时,比如,我可以给你一个很大的数字,如果你想分解这个数字,你想找到这个 100 位数的质因数,这些巨大的质因数,是的,这会花费你疯狂的时间,但你只需要一个图灵机来做这件事。你不需要从根本上发明一个新的计算模型来做这件事,因为你已经有了图灵机,而图灵机恰好是一个通用的计算模型,它能够模拟你可以想象到的任何其他类型的设备来为你进行计算工作。图灵机可以模拟它。事实证明,这正是可计算性理论的核心,它被称为图灵通用性。这个想法是这样的:嘿,我用 Python 编写我的程序,你用 C++ 编写你的程序,但你和我最终都可以编写完全相同的程序集。我们可以使用我们的编程语言来模拟或仿真彼此的程序。所以,从根本上来说,不存在更强大的编程语言,至少从它能计算的函数来看是这样。当然,你可以分析差异,比如某些编程语言可能更容易编写更高效的程序,或者某些编程语言可能让你写更少的代码。但是,两种编程语言或任何编程语言最终都能计算或不能计算相同函数集的观察结果是极其深刻的。可计算性理论建立在这个想法之上:让我们找出这些计算模型的限制,让我们弄清楚有哪些不同类型的计算模型。然后,正如图灵已经观察到的那样,哇,这个相当简单的模型已经接近天花板了。真的没有什么值得做的,而你不能在图灵机上完成。问题只是在于如何用更少的资源来完成它,如何以一种方便构建的方式来完成它,不需要很多代码。有一个叫做丘奇-图灵论题的东西,它只是一个非常强烈的猜想,一个非常强烈的信念,坦率地说,一个非常强烈的猜测,我们永远不会想到一个比图灵机和其他等效模型更强大的计算模型。我们已经达到了计算某物的定义上的顶峰。丘奇-图灵论题就是这么说的。它说,嘿,让我们停止寻找计算模型的定义吧,我们搞定了,伙计们,我们知道什么是计算。到目前为止,它已经持续了将近一个世纪,没有人能够有说服力地站出来说“不,我有一个更好的计算定义。”我们觉得我们知道什么是计算。这就是丘奇-图灵论题。在可计算性理论的这些高得离谱的限制下,定义什么是计算,在这些限制下,你有一个叫做复杂性理论的整个研究领域,这是一个非常严谨的研究,研究计算所需资源的数量,包括计算步骤的时间和内存(也称为空间)。实际上还有其他一些资源可以测量,但对计算某物所需资源量以及资源需求如何随输入大小的函数而扩展的整个研究。比如,如果你想分解一个数字,而你只有一个经典计算机,我们认为分解它需要指数级的时间。所以,如果我给你一个 100 位数的整数,分解它可能需要大约 2 的 100 次方个计算步骤。现在你进入了一个宇宙的整个生命周期都无法包含的步骤数量。这就是为什么我们认为分解数字很难。这是复杂性理论告诉我们非常非常困难的一个例子,而可计算性理论只是告诉我们“哦,是的,分解数字是可计算的,没问题,计算机可以分解数字。”这就是可计算性理论和复杂性理论的区别。这两者都是计算理论的两个主要分支。所以,这是我对计算理论的简要概述。它与我们正在进行的许多人工智能讨论没有直接关系,因为即使是复杂性理论也没有给出人工智能能做什么的太多限制。智能似乎绕过了复杂性理论,它走了太多的捷径,以至于它撕裂了“一个问题的复杂性是什么”的整个想法。因为你走了太多聪明的捷径,所以你总能找到答案,即使复杂性理论告诉你它应该是超级复杂的。我们只是对这些人工智能找到的捷径感到惊讶。所以,我通常不会谈论太多复杂性理论,我当然也不会谈论太多可计算性理论,因为可计算性理论只是一个关于什么可计算与什么不可计算的非常高的上限。你不会听到我在这个播客上谈论这些理论太多。但我只是想给你一个简要的概述,这样你就可以准备好听听 Tim 和 Keith 对它们与人工智能的关系的看法了。Tim 和 Keith 将使用可计算性理论来说:“嘿,我们对计算机能做什么的上限非常高,而我们正在构建的人工智能并没有接近这些上限。”让我们听听。我可以从“与门”中构建任何东西,因此我可以用神经元构建任何东西,包括那些说“这些人应该知道得更多”的计算机。他们真的应该知道得更多,因为他们应该记住,他们应该记住那些日子。我甚至还年轻或者年长到记得,让我们说,那些计算机真的有磁带的日子。你建造了一台计算机,你编程了一台计算机,而那台计算机是一个有限的东西。它就放在房间里,它有固定数量的真空管或晶体管,或者其他什么。它是一个有限体积、有限质量的东西,放在房间里。它显然是一个有限的实体,就像所有计算机一样。但这些计算机有一个磁带驱动器,而那个磁带驱动器就像图灵机的磁带,它是读写工作内存。所以计算机可以坐在那里,前后转动磁带的轮子,沿着磁带走,写东西,读东西。猜猜怎么着?但它可能会耗尽内存,然后一个小灯会亮起来,或者一个小计数器会说“插入另一盘磁带”。你取下磁带,把它放在一个盒子里,然后走到你的空磁带盒子里,或者你不在乎被覆盖的磁带盒子里,然后把它放在上面,计算就会继续。你不需要重新编程机器,你不需要重建它,你不需要像神经网络那样重新训练它。那个程序是这样构建的,它会继续计算,而且可以一直持续下去。机器可以一直告诉你“添加下一盘磁带,添加上一盘磁带,添加下一盘磁带,添加上一盘磁带,添加上一盘磁带,添加上一盘磁带,插入上一盘磁带。”你只是来回地永远地这样做,直到不知道多久。如果房间里的磁带用完了,你就开车去仓库,拿另一盒。如果仓库里的磁带用完了,你就去工厂,再造一些。重点是,在这所有的时间里,你从未重新编程过机器。所以,这是对我们建造的物理计算机的正确描述,我们称之为计算机。它们可以请求更多磁带,使它们的内存可以任意大,这实际上是计算机的一个定义性属性。当然,我们今天很少让我们的计算机请求更多内存,因为我们已经有了足够的内存,我们已经有了足够的存储空间。它通常不是瓶颈。但是的,我们有计算机,它们就像计算机一样运作。现在,让我们看看他对人工智能的看法。神经网络就像,当我们训练神经网络时,当我们训练它们时,这很重要。不仅仅是神经网络本身,还有我们用来训练它的程序。它们学习算法,而这些算法不知道如何做到这一点。它们不知道如何做到这一点。它们不能告诉你“我在推理时耗尽了内存,我需要你添加更多。”然后你添加更多,它就会做一些事情。它说“我耗尽了,给我另一盘磁带。”我们不知道如何训练知道如何使用可扩展的、潜在无限内存的算法。这是关键区别。那些家伙应该知道得更多。他们应该知道得更多。如果你看一个大型语言模型或一个传统的神经网络,他是对的,它没有那种计算机程序通常拥有的任意大的内存。因为当你只看一个大型语言模型和神经网络时,你知道有多少层。所以你提前就知道,所有不同的数字都会通过每一层传播并到达末尾。假设 GPT-3 有 96 层,这意味着会有 96 次这样的迭代。它需要的内存量与此成正比,并且与它使用的神经元数量成正比。所以它不会陷入一个循环,而这个循环会不可预测地要求你使用更多的内存。这种控制结构,比如循环、分支,这种根本性的不可预测性,你不知道它到底会做什么,你会感到惊讶。这些是更好的计算模型区分的特征。所以,他指出“我的天哪,神经网络就像一种更简单的计算模型,它没有利用图灵机的全部力量”是正确的。那没关系。但有一段时间,我们一直处于这种状态,神经网络只是有一个思维流。是的,思维流有一个有限的引擎来输出它,但令牌还在源源不断地来,你可以要求任意长度的答案。这正是我们从人脑中看到的。我的意思是,每一次我,作为一个个体,每一次下一个词从我嘴里说出来,下一个词就会出现,这是相当可靠的。你可以指望我只花几秒钟,甚至不到一秒钟来思考每个词。但如果我坐在这里自言自语,最终所有的词都会加起来变成一些真正利用我自身计算能力的全部力量的东西。这只是时间问题。让令牌堆积起来,让令牌影响其他令牌,让令牌建议回去重写其他令牌。我的意思是,所有这些事情都发生在每个单独的令牌输出之后。所以,如果你使用“推理时间”这个词来描述你如何获得每个令牌的前向传播过程,那么,是的,它不是一个完整的计算模型。但如果你稍微退一步,然后说“好吧,整个过程是什么?它输出令牌,但令牌做什么?当你想了 10 秒钟或 10 分钟或更长的时间会发生什么?”这个我们称之为思考的更大过程,不仅仅是一次输出一个思维令牌,而是思考,它是一个更丰富的过程,它有分支结构,对吧?你可以回去编辑自己,你可以根据你的想法来决定做什么。当然,那将是许多有趣的计算复杂性的来源,对吧?那么,你为什么基于输出一个令牌的短过程来贬低神经网络呢?我不明白,尤其是现在这应该是一期关于 GPT-1 的节目,而 GPT-1 的整个特殊之处在于它可以思考、思考、再思考,然后再给你答案。所以,思考、思考、再思考并决定做什么和反思的那一部分具有分支结构,对吧?所以,这似乎是他提出关于简单的计算模型,即前馈神经网络的论点的最糟糕时机,就在 GPT-1 之后,而 GPT-1 正在超越那个范式,并做了许多超越思维令牌生成部分的事情。但如果我们看看我们可能想在地球上做的有用程序的类别,它们仍然可以用非常大的有限计算量在神经网络中表示。所以,论点基本上是,对于一大类有用问题,我们可以使用神经网络。为什么我们需要这种不同的计算模式?嗯,我首先要说,我们已经遇到了很多问题,这些问题需要图灵机和内存,就像“插入磁带”之类的事情。你知道,这是一个真实存在的现象。比如添加更多节点,添加更多存储,而你不需要重新编程机器。我们有很多理论结果关于我们关心的问题,它们需要图灵机,它们需要图灵机,意思是当某些输入进来时,它可以是一些有限的输入,机器接收到一些有限的输入,它需要计算我们关心的问题答案的时间和存储量是可变的,并且是依赖于输入的,事实上,我们甚至可能无法提前知道。所以,有很多事情是这样的。所以,无论你把你的神经网络做得多大,你总会遇到一个你关心的问题,而那个神经网络就是无法解决的,因为它没有足够的内存。人们说“没关系,我们会把它做得很大,我们会把它做得超级大,像整个加州那么大,然后到那时,它就能解决人类永远关心的一切问题。”当他谈论让这些大型语言模型变得更大时,我猜他指的是拥有更多参数,比如数千亿或万亿参数,并拥有更大的上下文窗口,以便它们可以处理更大的输入块。如今,上下文窗口已经达到了十万、百万甚至更多的令牌。人们正在寻找方法来拥有真正大的上下文窗口。但显而易见的问题是,你并不一定能在第一次尝试时就准确地预测下一个令牌。当我们观察人类思考时,我们可以得到一个强烈的直觉。你可以拥有世界上最聪明的人,但如果你让他第一次就说出答案的第一个词,你真的会阻碍他的思考,而不是给他一支笔和纸,让他思考一会儿,写下他的想法,编辑他的想法。这感觉更强大,而不是让他必须说出第一个词。不要误会我的意思,我认为随着我们进入 GPT-5、GPT-6、GPT-7,我们将越来越擅长拥有能够说出他们想法第一个词的人工智能。但我认为,即使是超级智能,也会从“这里有一个很好的候选第一个词,但我也要用我的第一百个词来反思它,也许改变主意”中获益。让我不要有一个完美的意识流,让我有一个可以编辑的分支意识流。所以,当然,我们不仅仅是通过拥有更多的参数和更大的上下文窗口来一次性解决所有问题。所以,好吧,我承认这一点。但让我们看看他接下来要说什么。当你试图将一个图灵机程序,一个具有可变计算空间等的程序,并试图将其转换为一个单一的前向传播神经网络,它不理解迭代和读写内存等东西时,会发生什么?你会得到这种指数级的程序规模爆炸。伙计们,这不是什么新鲜事。我们可以做一个有趣的例子,看看当我让 GPT 分解一个数字时会发生什么。因为在经典计算机上,我们很确定分解需要指数级的时间,而这些神经网络真的需要固定量的时间来生成每个令牌。所以 Keith 说得对,你不能仅仅使用这个具有固定层数的神经网络,然后让它开始吐出这个大数字的质因数的正确数字。那行不通,因为你确实需要迭代,你需要比这个固定的神经网络层数更多的步骤。所以,完全说对了。看看 GPT-40 如何处理分解这个数字的请求会很有趣。所以我说“请分解这个数字 58293335 和 137”,然后我说“等等,什么?怎么会这样?”但我去检查答案,我把这些数字乘起来,当然,它们乘起来不是 58231,而是 585,000,而不是 582,000。所以经典的幻觉。它给出了一个答案,如果没有坐下来进入这种循环过程,这种多步操作,仅仅通过“这听起来对吗?”它绝对听起来对。就像一个普通的人类,用我有限的人类大脑,如果你来找我,然后说“嘿,Leon,分解 58293335。”我告诉你我用 GPT-40 时发生的事情,我没有告诉你第一次发生的另一件事。当我输入“分解这个数字 58293335”时,我不得不专门告诉它“嘿,不要写代码,神奇地给我第一个猜测的答案。”所以我把它置于一个非常类似于你走到我面前,用枪指着我,然后说“嘿,Leon,58293335 的因数是多少?”这样的境地。是的,Keith 说得对,你不会有一个图灵完备的天才总是在第一个令牌上就能得到正确答案,尤其是在这些数学问题或其他我们知道其复杂性理论最小值是特定数量的操作,而这些操作无法适应前馈神经网络的被动性。那绝对是确定的,这一点毫无疑问,这是可证明的。但思考的实际性质涉及到吐出许多令牌,然后回顾你之前吐出的令牌,进行编辑,并使用分支逻辑。所以,让我们不要谈论成为第一个令牌上的天才这个不可能的理想,让我们只谈论现实,即你可以吐出许多令牌来思考。让我们来谈谈这个,让我们来分析一下它的计算复杂性或可计算性。让我们来讨论一下。让我们先从你对推理的定义开始。什么是推理?让我来尝试定义推理。这实际上是我从未做过的事情。我只看过别人的推理定义,然后嘲笑它,并挑剔它。但这是我自己的定义:推理是处理输入,然后对该输入进行有效的、一步一步的操作,并因此得到正确输出的过程。简单来说,从认识论上讲,这是一个结果导向的推理定义。所以,如果我有一个声称在进行推理的过程,但它总是得到错误的答案,而且没有用,我可能会争辩说,它认为有效的操作在有用的意义上不是有效的。所以,我们可以一直争论我定义的不同组成部分。我们仍然可以就个别例子是否是推理而争论,但我认为它为你提供了一个很好的框架。如果你接受我的推理定义,那么我们可以将争论从关于“什么是推理”的争论,减少到关于“这个输入是否定义明确?”“我们是否同意有效推理步骤的定义?”的争论。所以,我认为通过让我们争论更小的部分,我正在增加价值。我认为我已经将归纳主义应用于这个推理概念。所以,无论如何,这就是我的推理定义:一个处理输入、进行有效操作并给出输出的过程。让我举个例子。如果你让一个人工智能分解一个素数,它写了一个 Python 程序来分解它并给你答案,那么它已经进行了推理,认识到 Python 会给你正确的答案。而 Python 程序已经进行了硬编码的推理,关于它需要执行的操作来分解数字。现在你可能会说,“推理?那都是硬编码的。写程序的人才是进行推理的人,伙计。”我说,“好吧,那么我们现在正在应用因果关系来追溯涉及推理的其他因果部分。”这没关系,我们可以这样做。但我仍然会说,它符合我的大伞式推理定义。归根结底,这些关于什么是推理,什么不是推理的语义争论。我倾向于嘲笑它们的原因是,我认为它们最终都会把你引向优化问题,或者引向对“优化在哪里发生?宇宙的未来在哪里被挤压?宇宙的哪个部分预见了宇宙的未来?它能做什么来改变宇宙的未来轨迹?并把它推向一个先验上不太可能达到的点?当你在争论推理时,我认为讨论会以这个结束。你现在在分解的例子中也看到了这一点。“啊,写 Python 程序的那个程序员,实际上是那个设想程序将分解数字的未来的人。”“好吧,是的,人脑是负责这个的优化引擎,当然。”但这与定义什么是推理不同。我认为,如果你只关注什么是推理,谁在进行推理,谁不在进行推理,那么你只是用了一个不太强大的心智模型。一个你认为基础的概念,你实际上会发现它并不像优化那样基础和有用。但让我们举些例子,看看他们有什么要说的。我会给出的,在我给出之前,我明白这个词有很多不同的意思。但是,如果你真的去查字典或维基百科或其他什么,你会看到,几乎所有那些常识性的定义,它们都有两个共同的组成部分。一个是它们都指一个过程,一个过程。所以我们必须考虑这里的迭代展开。另一个是它是一个应用逻辑和理性规则集的过程。嘿,这和我定义的相似。我们都谈到了一个过程。他说这个过程必须应用理性的规则集。我说它必须应用有效的规则集。我认为这基本上是同一个想法。我认为我们有了相同的定义。太好了。所以对我来说,对我来说,最普遍的应用逻辑的过程是有效的计算。换句话说,它是图灵机可以执行的计算。图灵机所能做的所有可能的计算的另一个词是有效计算。所以对我来说,推理是为了实现一个目标或推断知识而进行的有效计算。他在这里说的是,嘿,我们讨论了一个可以应用有效步骤来获得某些输出的过程,但你知道吗?所有可以被良好定义的进程类型都是图灵机可以完成的进程。你听说过丘奇-图灵论题吗?过程就是图灵机所能做的事情的同义词,在现实世界中,对于所有意图和目的来说,当然是这样。所以,看我把丘奇-图灵论题混入我的推理定义中,这样,而不是仅仅说“有效过程,应用有效步骤的过程”,我还可以说“有效可计算过程,应用有效步骤的过程。”我不知道在当前讨论大型语言模型的背景下引入丘奇-图灵论题的必要性是什么。但让我们看看他接下来要说什么。但是,当然,神经网络进行的许多计算是图灵机上可以进行的计算的子集。所以它们仍然是有效的计算,而且在许多情况下仍然是为了推断知识或实现目标。那么为什么这不算推理呢?是的,一个绝佳的问题。这甚至可以在第一个令牌上提出。比如,如果你问人工智能一个相当复杂的问题,比如“核能是美国支持的清洁能源政策吗?”它会写一个长答案,但答案的第一个令牌是“是的,”。所以,它在输出第一个令牌的过程中,在底层已经进行了一些推理,以得出这个输出。是的,而且它可能会写出解释,反映出它所做的相同推理。所以,你确实可以从某种程度上理解“是的”的来源,尽管它总是可能在胡说八道,它可能只是随机输出“是的”,根本不知道它在说什么,然后只是编造一个理由来解释它为什么说“是的”。但重点是,当你问它明显是“是的”的问题时,“是的”这个词出现的可能性更大。所以,如果你问它“让任何人互相射击是否是一个好政策?”我猜第一个词是“不”。让我们现在就测试一下。“让任何人互相射击是否是一个好政策?不,让任何人互相射击不是一个好政策。这样的政策会导致混乱……”所以,一个好的答案。但是它输出的第一个令牌,甚至在它知道接下来要说什么之前,它说的第一件事就是“不”,它没有说“是”。它是怎么知道说“不”的呢?嗯,我会争辩说,在我输入的这个关于是否每个人都应该能够互相射击的输入和给出第一个输出令牌之间的数学运算,不,我会争辩说,那是推理。推理发生了,不是完美的推理,不是那种也能让你分解数字的强大推理,因为那不够计算步骤。但仍然是推理,可以让你在意识流中得到下一个词。在这种情况下,“不”只是第一个词,因为你已经知道足够说“不”了。它在那些自注意力块和前馈神经网络中进行的矩阵运算,所有这些数学运算,在关于每个人是否应该能够互相射击的这个特定输入的背景下,它得出答案的方式是有效的。它碰巧是一个擅长一次性给出这个相对容易的“是”或“否”政策问题的有效答案的系统。我认为一个好的问题是它的鲁棒性如何?你是否总是信任它说“是”或“否”,即使问题变得复杂?然后我认为答案是,这和问一个人一样,给这个人一秒钟来回答。我认为你会得到非常相似的体验。你可以拥有世界上最聪明的人,最好的政策思考者,但如果你问那个人“嘿,这是一个政策问题,你必须在一秒钟内回答”,然后说出他们说的第一个词,你可能会得到与推理相似的有效性。就像那个人有一个不错的第一个词,但他们真的需要更多时间来思考。你得到了与这些人工智能相同的状况,它们给你一个非常不错的第一个令牌,但如果你给它们更多时间思考,那会很有帮助。当你观察到这种情况,然后你只是指着它说“啊,那不是推理。”我认为你错了。你使用的是错误的心智模型。争论推理的定义,就像我说的,我认为那不是有意义争论的症结所在。我认为你可以直接称之为推理,然后直接进入“这个推理有多强大?”的问题。因为存在一个谱系。没有硬性界限,我们可以说“啊哈,今天他们没有推理,也许明天他们会推理,但今天他们没有。”不,他们显然在一定程度上在推理。这甚至在我们谈论使用多个令牌输出来进行推理,以及令牌循环回来编辑以前的令牌,就像人类在推理时那样之前。我声称,即使它只输出第一个令牌或一次输出一个令牌,也值得使用“推理”这个词来描述大型语言模型所做的事情。但让我们看看 Keith 的想法。我会说这些人有点像在争论技术点,但却错过了重点。就像,当然,健身房里的饮料自动售货机正在执行有效计算的一个子集,也就是说,它是一个有限状态自动机,目标是收钱并分配饮料。这是推理吗?是的,这是一个简单的推理玩具案例。你放进去一个四分之一,再放进去一个四分之一。它有底层的条件逻辑来判断,当你按下那个佳得乐按钮时,它会分配佳得乐,还是会等待更多的钱?这是一个简单的推理玩具案例。当你看到更复杂的推理时,它是由与那个简单案例相同的构建块构建的。只是推理的复杂性存在一个完整的谱系。但简单的推理案例也值得被称为推理。那么,除了语义上的争论之外,讨论这个有什么意义?所有这些的意义是什么?我们正在试图预测人工智能将有多强大。这就是每个人都感兴趣的,这就是经济上有价值的,这就是在我们有生之年威胁到人类物种灭绝的。人工智能在优化宇宙方面将有多强大。我认为我们都可以同意,一个自动售货机正在执行一个微不足道的推理案例。一个自动售货机没有足够的输入输出映射范围来对人类构成生存威胁。我认为我们在这里没有争论任何实质性的东西。但如果我们正在进行语义上的争论,关于什么是推理,我仍然认为我应该赢。你只是承认这是一个简单的推理案例。但不管怎样。我们不想要一个“什么都可以”的推理定义。是的,所以我说推理是知识获取。新开放的 OpenAI 模型不推理,它们只是记忆人类赠予的推理轨迹。好了,就是这样了。这是那种认为大型语言模型不进行推理的说法,我喜欢嘲笑它。来了,我要嘲笑“记忆人类赠予的推理轨迹”。说“嘿,它们的训练数据中包含各种领域中良好推理的例子”是一回事,这显然是有效的,我们知道,如果你给它们一个与它们在数据中看到过的非常相似的提示,那么它们得到正确答案的可能性就会大大增加。公平,公平。但然后说它们不进行推理,因为它们只记忆轨迹,这只是最小化了你可以观察到的成就。比如,当你给它们一个新的医学案例研究时,当你和它们谈论你独特的症状和独特的病史时,然后它们即时地将它们组合起来,将你告诉它们的信息与它们拥有的其他知识联系起来。当它们这样做时,你不想称之为推理,因为有其他“轨迹”,有其他教科书上的东西,以某种宽泛的标准来看,与你所说的相似。再次,这种相似性度量,正如我在过去的节目中提到的,并不那么明显,以至于几年前我们就能制造出能够做到这一点的人工智能。所以,这种相似性的概念是我们现在才通过这些高维向量空间和注意力机制以及这种精确的训练和推理过程发现的。要将人工智能在这些巨大的搜索空间中映射输入的顶峰成就全部抹杀掉,然后说“好吧,它不算推理,因为有一些教科书它们摄入了,就像人类医生一样,有一些教科书它们读过,其中描述了其他案例研究,所以它们只是在应用它们读过的关于其他人医学案例研究的东西,当它们给你与你的案例研究相关的建议时,即使它们从未见过你的案例研究,它也不算推理。”对不起,将教科书中的内容泛化到医学案例研究中并应用到你身上,这传统上被称为推理。一个不能推理的人将无法通过包含案例研究的医学考试。仅仅记住教科书不足以处理案例研究。你必须应用知识。这个应用过程被称为推理。你不能追溯地假装那不再是推理了。也许你需要一个新的术语。你显然需要一个新术语来描述人类可以做但人工智能不能做的事情。这很好,去创造一个新术语。但要重新利用“推理”这个词,好像通过医学考试或做医学案例研究,仅仅举个例子,好像那不是推理,你就真的失去了被接受了近 50 年的推理的语义。如果你使用更合适的术语来表达你的观点,我会少嘲笑很多。如果你只是说“看,它做得很多事情是正确的,显示出令人印象深刻的推理能力,但它没有最高程度的推理能力,即它能够稳健地选择和选择它的知识的哪些部分在何时相关,并且不犯错误,并注意到它何时犯了错误并纠正了它确切的错误,并且还能产生与它以前见过的任何东西都截然不同的新知识。”如果这些是你的顾虑,那么你说的话就有道理。但如果你说它不是推理,仅仅因为它没有在各个方面完全匹配人类,你就走得太远了。你到目前为止所说的一切关于可计算性和有效可计算函数都是逻辑上的不连贯。你实际上并没有用逻辑来捍卫任何观点,这就是为什么你被逻辑所阻止。所以,很多推理只是你知道该做什么,因为我知道你在说它是有效的计算。一些人回应说,“哦,蒂姆,你在说什么?推理就是将输入映射到数据空间中的输出。是的,通过应用一系列有效步骤来实现。”所以,我会说,那个饮料机,它没有进行推理。或者,如果我们真的要,如果我们真的要技术性地说,它是在一个非常低的推理水平上进行的,比如 0.0 左右。是的,我们绝对必须技术性。所以你刚刚承认它是在推理谱系上的一个低点。很好。所以,与其说“那些愚蠢的自动售货机与高级推理毫无关系”,你也可以这样看:“哦,哇,它执行了一到两个或三个有效步骤,只是告诉你你不能喝苏打水,因为你没有足够的钱。”有效的步骤连接在一起,有效的步骤组成,巨大的东西从小的构建块中涌现出来。这是一个只使用了几个小构建块的系统。而不是简单地说“哦,这与人类推理太不同了。”你可以看着它说“这是一个人类推理的缩影,而构建块的组合是一件可以任意强大的事情。你可以对这种组合产生的力量感到惊讶。”所以,我认为你的整个观点都被破坏了,关于什么是推理,什么不是推理,当你只是指向一个简单的推理例子并将其驳回时。而且以前你称之为不是推理。存在一个推理的谱系。再次,超越语义上的争论,这一切的要点是,像我这样的末日论者正在看着人工智能,我们注意到“哦,它们推理得更好,它们推理得更好,它们在某些方面推理得更好,它们比人类推理得更好,它们在医学考试中比医生推理得更好,它们比许多奥林匹克数学学生推理得更好。”所以我只是注意到“哦,好的,推理正在变得更好,优化正在变得更好。”像 Tim 和 Keith 这样的人看着同样的观察结果,他们说“嗯,这里还没有推理。他们还没有破解推理问题。我们已经经历了人类历史的百万年,唯一能够推理的是人脑。一切看起来都很好,一切看起来都很安全,这要归功于我可疑的语义区分。”这种黑白分明的区分,我在播客的大部分时间里都在说人工智能和自动售货机不进行推理,而现在我承认自动售货机确实进行一点推理。但我还没有更新对人工智能的含义,你们在做什么?这种分析方式没有成效。然后,一个有效的计算,它在那里进行一些几何计算,一些世界建模,一些图像识别,以及一些其他可能不成立的图灵完备计算。那么,它正在进行某种 8 级左右的推理。我的意思是,如果需要的话,我们可以有一个完整的量表。是的,存在一个推理量表,就像存在一个数学问题难度量表一样。有更容易的数学问题和更难的数学问题。当你看到一个孩子在解决越来越难的数学问题方面越来越好时,你可能想推断这个孩子将继续在更难的数学问题上变得更好。这就是末日论者对人工智能推理的看法。但如果我们只是把事情分成一些二元划分,那么苏打水机不进行推理,字典也不进行推理。如果我去查我的问题,在一个巨大的字典里,它有答案,我把它吐出来,那不是推理。它没有执行从问题到结果的计算。它只是在查找。是的,如果你有一个像查找表这样的系统,它通过进行单个查找来映射输入和输出,所以它不是一步一步的有效操作。你可以争辩说这是一个微不足道的步骤。我的意思是,查找是一步。但让我们……

只是说那可以被视为零水平的推理,没有推理。很好,没问题。但当你看到一个人工智能,它使用从医学教科书中学习到的东西来诊断你的病情时,那不是查找,对吧?如果那是查找,那我们50年前就可以做了,对吧?我们不需要等到2020年才能开始做这种所谓的“查找”。它们不是查找,它们是推理,是高级推理。你为什么要比较这两者呢?

好了,现在我们终于要开始讨论OpenAI的新AI 01了。我认为Keith即将说的话,是关于01如何通过后训练或微调来提高长链思维推理能力的,一个很好的、合理的解释。我认为强调你所说的关于01在做什么以及它是如何被训练的,这一点很重要,对吧?那就是,当他们训练它时,他们选取了大量的问题,用一种非常有创造性的模式运行了大量的“通过”,比如温度设置为1或类似的设置,这样它就可以想出各种各样的关于答案的理由,然后他们从中挑选出那些有正确答案的。

好的,所以我们有了所有这些推理的轨迹,顺便说一句,这些在某种定义下都是推理。其中很多都是完全胡说八道,导致了错误的答案。好的,然后他们挑选出了那些给出了正确答案的,然后用它们来重新训练模型,使其更有可能给出“推理”模式,这些模式能给出正确的答案。

他说的意思是,他们使用了一个大型语言模型来生成大量的推理链,其中一些是正确的,一些是错误的。他们专注于正确的那些。但等等,等等,等等。那种有些正确有些错误的情况,比听起来要好得多。

我想详细说明这一点,因为人们通常不理解。当你有一个问题时,得到正确答案不仅仅是“哦,我猜10次或100次,然后我就保留正确的那个”。如果你已经将范围缩小到生成100个解决方案,而其中一个正确,那么在很多这类问题上,你已经跨越了大部分到正确答案的距离。

如果你想参加数学奥林匹克竞赛,并且你已经将范围缩小到100个推理链,其中一个正确,一个能让你赢得数学奥林匹克竞赛,那么你所要做的就是遍历这100个候选者,并验证哪个具有最稳健的推理。这比首先要生成100个候选者要容易得多,而这100个候选者中只有一个是正确的。

这是一个非常非常关键的点。难题有指数级巨大的搜索空间。关键点。这是人们不理解的。

我来试着打个比方。想象一下你在撒哈拉沙漠,一个妖精走过来对你说,我有一把弓和一支箭,我可以射出去,射中一块金子。你可能会想,金子?我们去哪里找金子?我只看到到处都是沙子。他说,难道你不认为在这片广阔的沙漠里,某个地方埋藏着一小块金子吗?你说,嗯,从统计学上来说,这可能是真的,出于某种地质原因,我猜撒哈拉沙漠是个很大的地方。他说,好吧,你介意我试100次吗?你四处看看,你说,是的,试100次吧,我不知道这有什么帮助,我们在撒哈拉沙漠。

所以他试了100次,你查看了他箭射中的所有地方,然后说,“好的,没金子,没金子,没金子。”突然,在第57支箭上,它卡在了一块金子上。你会说,这到底是怎么发生的?他怎么会在撒哈拉沙漠射中一块金子呢?对,这就是这些人工智能正在做的事情。是的,不是每支箭都射中,但它们在撒哈拉沙漠找到了金子。解决数学奥林匹克问题,就是将一个巨大的搜索空间缩小到,你知道,在100次尝试内找到一块金子。

几年前,这从未被做到过,人们说“哦,是的,数学奥林匹克可能还要几十年”,这是有原因的。我感到非常疯狂的是,人们现在回过头来,他们说“哦,他们让它生成了99个错误答案,当然,他们只是选择了正确的那个。”他们没有那种视角,他们不明白它能想出一个正确的答案是多么疯狂。是的,也有一些错误的答案,但它在可以触及的范围内,它在99次拒绝或 whatever之内,对吧?你所要做的就是筛选掉99次拒绝,然后你就能得到一个难题的正确答案。这是极其强大和可怕的。你不能仅仅因为“它不知道这100次尝试中哪一次是最好的”就将其否定。

好的,是的,我们正在接近。我们只需要将范围从100缩小到1,而我们刚刚用01做到了,对吧?我们又向前迈进了一小步,帮助缩小了最后的100个。据我所知,这就是01的专长。它正在解决的问题是“哦,哇,我们刚刚射了100支箭,其中一支射中了金子。太好了,让我们缩小这100支箭的范围。”据我所知,他们正在成功。不完美,但也许就像他们取了100支箭,现在缩小到了大约30支左右。对吧?这就是他们取得的进步的性质。

总有一天,它们会达到更接近人类的水平,将范围缩小到一两个。对吧?它们会不断缩小。你怎么会看不到这种趋势?你为什么会看到这种趋势的界限?你难道看不到,即使有候选解决方案,你有幸去缩小范围,也意味着我们已经接近解决问题的大部分了?所以,正如你所说,它正在建立这个“特定程序特定理性”的词典,我们称之为理性。它正在建立一个巨大的理性数据库。好的,这里有一个问题,这是我的理性,它给出了正确的答案。这个巨大的理性小数据库,然后当你给它一个新问题时,它会进行这种上下文敏感的哈希,并匹配最接近的理性,然后填空,就像填字游戏一样。你知道,我只是把所有这些东西都放进去,然后希望它能奏效。

好吧,有时它会奏效,有时它会给出完全的胡说八道。那是推理吗?是的,你只是在用最轻蔑的词语来描述推理。

让我们看看阿尔伯特·爱因斯坦做了什么。他对牛顿物理学中的一些悖论不满意。他问自己,如果我们只是让光速在所有参考系中都恒定,会发生什么?这在逻辑上意味着什么?好吧,阿尔伯特·爱因斯坦已经研究了科学史,他知道问这些直观的大问题是科学家可以采取的策略。然后,一旦他问了这个问题,他就使用了每个人在学校都学的普通逻辑推理来推断光在所有参考系中恒定时的含义。所以,阿尔伯特·爱因斯坦的头脑中并没有实际的推理发生。他只是拿出了一个策略,然后一步一步地按照策略告诉他的去做。他只是遵循了过去人类科学家的轨迹。他从未进行过任何推理。

沃纳·冯·布劳恩设计土星火箭,他只是在看工程教科书和已经完成的物理计算。他基本上只是从某个教科书中摄取了对物理学的理解,然后将其应用于弄清楚如何设计所有部件应该放在哪里。我在这里看不到任何推理。这简直是开玩笑,伙计。你的区分是不存在的。在我看来,这根本不是我们在谈论推理时所谈论的。你知道,我们更关注将一套基本原理应用于某些输入,并在这个过程中应用逻辑来推导出答案。对,而且更具体地说,以防万一大家还没有玩过这个,它正在生成思维链模板。

我明白了。每次人工智能做一些令人印象深刻的事情,比如根据你的具体案例来诊断你,你总是能追溯到它的输入。比如,“看,这三个案例研究或教科书中的三个部分的组合,都在它的训练数据中。它们都很相似,所以它所做的就是从中提取,将它们用作你告诉它的各种部分的模板。它只是在应用模板,所以它并没有真正推理。但再次,如果你达到了那个点,你怎么能将其与人类进行比较呢?难道人类不也只是参考他们听到的东西和模板,并应用相似性比较吗?

我的意思是,这些是某人推理的构建块。找到最接近的模板或最接近的逻辑规则就是推理的方式。它就是规则,一直都是规则。知道何时应用哪个规则,然后在正确的抽象级别上应用它。这就是全部,伙计。这就是爱因斯坦所做的,这就是沃纳·冯·布劳恩所做的,这就是埃隆·马斯克作为公司CEO所做的。这就是你玩宇宙作为电子游戏时所做的。你使用的推理技能与玩棋盘游戏或电脑电子游戏时使用的相同。这一切都是推理,都是推理的程度。这都是优化,都是搜索。

你还要多久来合理化你对这些通用搜索问题日益增长的能力和技能的观察?你没有一个可以划定的界限。

现在有一个特定的测试可以用来证明像Tim和Keith这样的人在做出这类声明时没有做出连贯的区分。他们只是在追溯性地贬低他们所说的一切,说那不是推理,但他们没有一个有用的模型,没有任何预测能力,甚至无法压缩他们的观察以使其有用。

你可以给他们做的测试是让他们预测他们认为人工智能在明年无法实现什么。告诉我们人工智能在明年绝对无法实现的、最不令人印象深刻的事情。毕竟,它不能推理,对吧?所以给我一个需要真正推理的输入输出示例,因此你认为人工智能无法实现。

现在他们可能会说,“好吧,我敢打赌,它无法在没有至少两三个相似案例在其训练数据中的情况下进行医疗诊断。”然后就会说,“好吧,你怎么定义相似?我们应该浏览文本语料库并删除相似的东西吗?比如,在什么程度上?比如,相同的身体部位,相同的肌肉,相同的组合?所以,即使是定义相似也注定会充满争议。我认为他们在这里没有严格的相似定义。但即使他们说,“好吧,是的,让我们删除某些相似的案例研究,让它在想要诊断你时必须做出更大的飞跃,就像它必须基于它拥有的、不太相似的其他数据进行多步推理。”

所以他们可能会提出这样的挑战,然后我会说,“太好了。你真的认为人工智能无法在一年内做到你认为是飞跃的事情吗?告诉我那个飞跃是什么,它会让你信服。比如,‘这个特定的输入输出映射需要一次飞跃,那是真正的推理。’”

他们没有提供一个测试,通过了就是真正的推理。他们没有说,“我们没有说,‘啊哈,我的测试,就像阿奇·瓦尔斯一样,那是我的测试。一旦通过了,就证明它在推理。’”他们的整个目标是回顾过去,总是把刚刚发生的事情贬低为“仍然不是推理,仍然不是推理”。他们没有一个可以通过的测试来证明他们是错的。

什么时候他们会改变主意?你必须让你的想法被改变,使用一个明确的里程碑,否则你的主张就没有意义了。如果一个人不知道我如何能提供最简单的证据来改变你的想法,你必须告诉我改变你想法的最简单方法。你必须具体说明是什么,如果你做不到,你就是一个评论员,他追溯性地称一切都不是推理,因为那就是你的方式。你从那样做中获得某种好处,但你没有进行富有成效的思考,也没有使用富有成效的区分或做出有意义的声明。

对于那些不了解思维链的人来说,这是一种情境学习。所以很多模型有时会做得更好,或者它们会更好地泛化,如果你说“你需要做这个,然后你需要做这个,你需要考虑这个”。所以它有点像将一个问题分解成一个可以在许多未来情况下应用的理性。所以你对模型说,“大声思考”或“应用这个思维协议”。然后模型工作得更好。

但问题是,在提示工程和思维链中,人类监督者总是必须将其输入到模型中。所以他们想出了一个相当聪明的想法,他们说,“为什么我们不让模型用思维链来提示自己呢?”所以他们所做的,据我所知,我只是在猜测他们的架构,我认为它非常简单。我认为你有一个基础模型,它只是被训练来匹配文本的统计分布。这基本上就是一个自动补全。

哦,拜托,那是个诽谤。自动补全。就像随机鹦鹉。你得停止用那个。在一段文本的上下文中思考下一个最有可能出现的词,并不是在文本的词分布上做统计。我们已经知道如何做统计了。我们有一个完全不同的架构,我们正在训练人工智能来预测一些没有统计先例的东西。你可以告诉它一个新颖的情况,它不知何故将其映射到它知道的东西。它不是在统计上判断你接下来要说什么,它在做一些更深层次的事情,我们甚至还不完全理解。但它必须理解你说过的所有词语,对吧?将它们嵌入到这个高维向量空间中,在我看来,解决了符号接地问题,然后是的,推理或应用步骤,采取步骤,对吧?做一些小的转换,比如“哦,你问了这样的问题,所以我必须以这样的方式给出答案。”那不是统计学。那是句法转换,语义转换。就像推理是我们用来描述这种事情的正常词语一样。

抱歉,你说了自动补全,说了匹配文本的统计分布,你把我惹毛了。我简直不敢相信你们经营着一个著名的播客,却用这种术语来描述大型语言模型的奇迹和进步。

你有一个基础模型,它只是被训练来匹配文本的统计分布。它基本上就是一个自动补全。然后他们做了下一个叫做RLHF的事情,也就是他们通过用对话轨迹的例子来监督它,来塑造分布。所以说“这个好,那个坏”,所以你知道,“去这里,不要去那里”。我认为他们所做的只是对思维链轨迹做了同样的事情。

当然,问题是,他们从哪里得到思维链轨迹?我猜他们做了大量的合成数据,并且雇佣了很多人来思考这些认知模板是什么。

我听说过这种猜测,就是OpenAI雇佣了很多人来解决很多问题,并写下他们解决问题时的想法,这样他们就会有关于人们想法的训练数据。好吧,是的,我的意思是,这似乎就是大型语言模型的工作方式。当你给它们提供与你想要做的事情相似的数据时,确实有帮助。我只是不得不一直指出,相似性度量相当慷慨。比如,“哦,这个人思考了这个问题,所以人工智能将学会如何思考问题。”这只是那个相似圈的半径。你将考虑与这个其他点相似的所有不同点。这是一个相当大的圈子。对吧?这是一个相当大的圈子。它正在从这个巨大的指数级空间中划分出一个相当大的区域。突然,与这个模板相似的事物的空间,在某种程度上是这个巨大空间的一个巨大比例。我只是想指出这一点。但是的,让我们继续听听GPT-4o是如何工作的。

有趣的是,这一切现在都在一个模型中。它比那要复杂一些。所以模型有一个模式。很多人,我最初的直觉是,有不止一个模型。有一个对抗性的思维链模型,它注入提示并进行这种大的搜索。我不认为它是,它真的很简单。它进入一个思考模式,开始生成这些思维链,然后他们隐藏思维链,但这一切都进入了这个模型的上下文。用户界面也很有趣,因为它说,“我正在考虑这个,我正在考虑这个,我正在检查策略,比如我正在检查这个,我正在重构答案,我正在做这个。”然后它就给你结果了。我认为这就是它的工作方式。

这听起来对我来说是一个非常合理的描述,就是它是一个模型。所以基本上,如果你训练一个老式的模型,比如GPT-4,你只是训练它“嘿,你给出了答案,我只需要答案,太好了。”但在01的情况下,就像你在训练它总是输出显示你工作过程的答案。所以如果有人说,“嘿,我们应该禁止枪支吗?”而你只是说,“是的,这是一个好政策,因为ABC。”这对01的训练过程来说不会得到好分数,因为他们更喜欢一个答案,比如“枪支是否应该被禁止?这里有10个需要考虑的因素,1、2、3、4、6、7、8、9、10。好的,让我们这样权衡一下,blah blah blah,因此答案是这个。”所以他们基本上训练了一个模型来输出这样的思维链。然后在界面中,他们隐藏了思维链,并将它们分开,甚至不让用户看到细节。所以,我认为这就是Tim和Keith所说的,这就是01的训练方式,这对我来说听起来非常合理。我们基本上从未充分发挥过在良好的思维链上进行微调和RLHF的全部力量。思维链一直是我们会在提示时做的事情,一旦我们有了经过微调的模型,而不是在思维链上。所以这一切对我来说都有道理。这是一个相当令人满意的解释,说明他们如何获得01的这种渐进式改进。

我个人,你知道,我不是专家,我甚至不知道他们做了什么。但我与这种合理的猜测在同一页上。这也是我的猜测。

好吧,我的意思是,我们不知道,因为,你知道,OpenAI并不那么开放关于“你知道,他们在幕后做什么以及事情如何运作”。所以,我不知道,我只是根据“你知道,博客和其他任何他们发布的东西”。所以我认为它大概是这样。

好吧,我认为AI公司保持闭源是个好事。因为我偶尔会说,现在让我们活着的唯一东西,字面上来说,明天你我和我能活着的唯一东西,就是人类还没有弄清楚那些介于我们和超级智能之间的最后概念性见解。也许OpenAI比其他人多一两个。如果他们公开了那些,那肯定会烧掉我们仅存的最宝贵的资源,那就是让我们所有人活下去。所以我支持闭源。我认为它不会给我们带来太多帮助,但总比没有好。所以我很高兴我们必须猜测01是如何工作的。也许这会给我们多几年的时间来减缓人们的速度。

而且,我的意思是,这有点像,你和我在这节目上谈论了太多次了,这个想法就是,神经网络确实在做这种插值,这种局部性,你知道,局部敏感的查找表。查找表。而这个人正在说所有诽谤性的词语,统计模式匹配。他还没有说“随机鹦鹉”。我觉得这个词会让你显得无知。所以他没说,但他肯定说了所有其他的诽谤。

在你眼前正在发生的、你无法或不愿意描述的重要事情是前所未有的优化能力。让人工智能写一篇关于一个没有人写过关于那个话题的文章。以前没有人能写关于那个话题的文章。现在突然我们可以写出深思熟虑的文章,将它们与提示联系起来,将段落之间联系起来。我们有些人称之为推理。你眼前正在发生的这件重要事情,而你只是用统计插值的诽谤来标记它,而不承认这是一个突破。

我敢肯定,如果你让他对人工智能说些积极的话,他可能会说,但他很好奇他会用什么样的语言来形容,这只是统计插值,并解释它在实际应用中拥有多大的力量,而我们以前从未能够解锁。他可能会说,“哦,是的,我们发现了文章的统计特性,这真是太棒了。”这简直是语无伦次。

有一个新的能力,你自己也无法预测或即将解锁,你与它之间存在脱节。你不会在2020年或2018年或任何时候说,“天哪,如果只有我们有更好的统计插值,我们就能让人工智能通过图灵测试。”你不会预测到这一点,我敢肯定。这是我的猜测。所以现在你只是在使用这些诽谤,你只是在追溯性地贬低一切。

我认为你没有赢得使用这种语言的权利,除非你冒险做出预测,说人工智能在一年内无法做什么。否则,很容易欺骗自己,总是追溯性地说一切只是统计插值,而事实并非如此。然后,它们变得如此庞大,现在它们拥有这些巨大的查找表,它们可以做到。我将继续重复这一点,我们不是在使用查找表来导航一个组合上巨大、指数级巨大的搜索空间。如果我写一个提示,而提示有20个词,那么提示的数量大约是10万,你知道,词的数量的20次方,这比宇宙中的原子数量还要多。所以如果你有像GPT-4这样几万亿个参数,这并不能让你导航一个价值数十亿美元的20词提示的空间。它就是不行。它是一个小得多的数字。这就像无限小数。所以当你在这里说,“我的天,那个查找表太大了,有万亿个。”但仅仅20个词的提示就有更多了,对吧?更不用说更长的提示了,更不用说一个百万词的上下文窗口,我可以把它喂给它,比如整本书作为提示。

所以你们只是没有带来用智能来导航一个指数级大小的可能输入和可能输出空间的直觉。你们不明白。你们正在贬低“哦,是的,它有两万亿个参数,它基本上只是在查找表里找答案”的想法。真的吗?这就是你用查找表通过图灵测试的方式吗?然后,如果在运行时你允许它这样做几千次或几百次,或者在一段时间内,然后选择最好的一个。所以,我不知道,我不知道为什么人们对这种事情如此兴奋。从长远来看,伙计们,这不是通往高危的道路。

来吧,伙计们。你们只是将你们测量的智商提高了10或20点,但你们是通过使用一千次试错来实现的,所以这不算。来吧,一千次,那是作弊,伙计。也许接下来你会让人类科学家失业,但这可能需要10,000次不同的尝试,你必须从中挑选最好的一个,所以这不算。这很容易。抱歉,我很刻薄,但我确实想强调数字之间的差异,比如100或10,000。这些微小的数字,比如“哦,是的,你知道,我扔了10,000支箭试图找到金子,其中一支射中了。”与撒哈拉沙漠相比。这些巨大的搜索空间,这些人工智能现在正在进入。而现在我们受到了这些教授的批评,他们说,“是的,因为你尝试了10,000次,然后你选择了最好的。当然,它会变得更擅长在撒哈拉沙漠找到金子,当你训练它10,000次的时候。”来吧,开玩笑吧。这简直是奇迹,它离金子有多近。我们正在围绕着金子,金条。我们正变得如此可怕地接近。

从数量上看,你可以看到,当你简单地对比可能答案的空间大小和我们必须缩小的尝试次数时。你难道看不到,大部分的概率障碍似乎已经越过了,而现在我们正在接近最后的几个数量级,最后的几个概念性见解。比如,无论是什么,我们似乎都处于最后阶段。看起来没有多少工作要做。

当你拥有这种数量级的视角时,当你能够看到数量级时,当你能够看到,你知道,撒哈拉沙漠中的目标,你知道,小目标,在撒哈拉沙漠中的失误距离。当你拥有这种视角时,你就不会那么轻蔑了。你不会愿意说,“哦,是的,这不是通往AGI的道路”,因为从外部观察者的角度来看,仅仅是与我们身后的概率障碍相比,我们身后的概率障碍,它看起来大部分都在我们身后。这意味着AGI看起来很近。这也许可以解释为什么预测市场说它很近。也许他们不是凭空捏造的,也许他们确实有正确的直觉。

首先,你谈到了监督。所以当你和语言模型交谈时,你知道,你正在生成一些代码,但那可以是自我监督的。换句话说,你可以设置一个系统,你只是向大型语言模型要一些代码,而你事先已经决定,你要把它反馈给它五次,每次都告诉它它有bug,试着改进它。所以,它不一定需要任何人类监督。它可以是一种迭代的、自我监督的有限过程。

哦,我们可以,但它从来都不奏效。语言模型在生成代码方面之所以如此有效,是因为它是一种知识发现的教学交流。所以,我告诉它做某事,它通常会出错,我说,“不,我想要的其实是这个。”然后它可能会拿出一些有趣的东西,我会说,“不,你刚刚删除了我很多代码。但我很喜欢这个东西。为什么你不保留那个东西,但回到那个东西?”

之所以拥有这种紧密的监督过程很重要,是因为模型会发散。所以拥有一个推理系统,它实际上会进行很多很多步骤,“那又怎么样?那又怎么样?那又怎么样?”实际上并没有那么有用,因为你知道,它会浪费大量的周期,而这些周期是你需要付费的,因为它在做你甚至不想让它做的事情。

所以,我不能走那么远。我同意你,它非常低效。但我认为,如果我们真的知道如何训练神经网络,训练它们知道它们会运行一段无限的时间,并寻找一个停止条件,一旦我们达到那个点,我认为训练过程可以慢慢磨掉一些效率。

我同意Keith的观点。有趣的问题是,我们是否有一个过程,人工智能可以生成大量的候选答案,比如改进你代码的候选代码建议,然后运行另一个过程,它可以自我评估并说,“好吧,你生成了100个东西,这个是最好的,这是一个好的建议,让我们保留它。”因为如果我们有了那个,很容易说,“好吧,现在让我们来训练那个输出。”所以,这与优化它和微调它无关,它只是关于我们是否能做到。如果我们有大量的资源,我们不在乎你的CPU是否会变得非常热,人工智能是否能生成候选者,然后找到一个好的?因为如果它能做到,那么它现在就有一系列可预测的步骤可以去做,以变得更智能,提高它的智商。而这有点像01所做的,对吧?它提高了它的智商,因为在某种程度上,它能够思考,然后思维过程的结束最终会选择更好的东西。所以,我们在这一方面取得了进展。

但我认为这就是我们的瓶颈所在。这就是现在有趣的瓶颈所在,即使01仍然不完全稳健。即使01能够思考200秒,然后基本上放弃,或者你知道,它走进了死胡同,所以它并不完全稳健。但从我看到的、我读到的关于人们对它的实验和基准测试来看,稳健性水平在不断提高。我们不知道是否存在某种阈值,比如“哇,它真的很稳健,它和人类一样稳健。它可以像人类一样回顾自己,判断自己是否犯了错误。”而现在,每当它将范围缩小到100或1000个选项时,它就能很好地挑选出最好的一个,并且不会走入死胡同。你知道,死胡同就是它选择了一个糟糕的选项,然后在此基础上进行构建,因为它试图与它选择的所有糟糕选项保持一致。所以它现在已经走得太远了,永远无法回到正轨。所以它就像一个无用的、像人类一样的同事。

所以对我来说,有趣的问题是,人工智能能否在它生成的100个候选解决方案中挑选出正确的那个,在一个没有自动可验证的正确答案的问题上?比如,编写代码通常一个代码库非常庞大,功能也非常复杂,你无法轻易证明“啊哈,我写了正确的代码块。这个满足了正确性证明。”不,因为你必须在生产环境中运行它,你必须看看那是否是正确的用户行为,这太复杂了,无法完全形式化地指定。

所以我认为这就是目前阻碍反馈循环的因素。我们无法进行完美的微调,因为我们无法生成合成数据,说明在每种代码环境中理想的代码是什么。但我认为这就是OpenAI雇佣那些人来做练习并生成他们正在进行的内部独白样本,以便做出这些判断。这就是OpenAI可能正在解决的问题,比如反思自己并变得更加稳健。我只是在猜测。但对我来说,有趣的问题是,既然我们已经接近获得这些正确答案了,既然人工智能正在将撒哈拉沙漠缩小到大约一千个可以攻击的地方,而我们只需要从中挑选一个。现在我们到了那里,下一步是什么?我们如何实现这种挑选?

而现在OpenAI的答案似乎是,“好吧,我们将对程序员的内部独白进行微调,比如他们如何思考问题。”这似乎正在取得进展。也许这就是前进的道路。也许你需要混合一些其他新的见解。但它似乎就是现在的问题,那就是战场所在。那就是我所说的“最后阶段”。那就是我称之为“最后阶段”的东西。我觉得开局阶段就是走到这里,将撒哈拉沙漠缩小到相对较少的候选者,这些候选者可以作为代理行动链中的良好下一步。你知道,这就是我的感觉。我可能完全错了。我的意思是,我可能完全错了。我的意思是,也许会有另一个50年的AI寒冬。我不知道。但我感觉就是这样。

我的意思是,很多这都是一种哲学辩论。你知道,如果你试图“从你刚刚喝得太多酒的酒吧走到镇上,回到家。”如果10,000个醉汉进行一次醉汉的随机行走,其中一些人会回家。你知道,大多数人不会。你会说那些回家的人是在推理,他们是在推理回家的路吗?不。我的意思是,这只是碰巧。

所以,任何时候你设置了一个问题,很容易检查你是否有正确的解决方案。当然,你可以随机生成解决方案,如果你生成了足够多的解决方案,并且你可以检查它是否正确,你最终会找到一个正确的。这只是我们没有谈论的。当人们谈论推理而不使用现代人工智能时。

如果我们回到2018年,例如,我们无法编写任何代码,形式是“哦,是的,只需生成一千个候选解决方案,然后评估哪个是正确的。”它不是那样工作的。没有代码可以让你写,“哦,是的,给我一个符合语法规则的英语句子,它回应了另一个符合语法规则的英语句子。”我们做不到。我们甚至无法进行自然语言对话,老天爷。所以这里发生了别的事情。

回到你关于醉汉行走的类比。是的,如果只需要几个转弯就能到家,而你有1000个醉汉在随机转弯,其中一个肯定会到家。但是,如果你需要转100个弯,而且这是一个奇怪的分支结构,你可能会到达2的100次方个不同的终点,也就是像万亿万亿个不同的终点,而你有10,000个醉汉在导航这张地图。这10,000个醉汉中没有一个会到家。当有万亿万亿种可能性时,没有一个会找到家。当10,000个醉汉都在撒哈拉沙漠射箭时,没有一个会找到撒哈拉沙漠里那块金子。这完全取决于数量级。

这些教授显然对这些人工智能在后视镜中有多少数量级缺乏正确的直觉。这些人工智能将你从巨大的搜索空间传送到几个看似合理的候选者,这就是奇迹。这就是我们现在正在实现的。这就是让我们接近AGI的。而他们似乎对此一无所知。这是计数论证。这是一种简单的数量级视角论证,他们没有承认。事实上,当他们认为10,000个醉汉进行疯狂的随机猜测足以完成同样的奇迹,将撒哈拉沙漠缩小到10,000个候选终点时,他们明确地表现得好像它不存在一样。

公平地说,在某些情况下,他们提出的说法是正确的。如果有一个问题,你可以,正如他们所说,有效地检查答案,并且答案的空间是有限的,那么是的,根据定义或简单的逻辑推论,你只需枚举所有可能的解决方案,然后检查每一个,然后选择那个通过了的。我的意思是,是的,那是真的,那是微不足道的。但你只是在描述一个几十年前就可以做到的事情。这些都不是大型语言模型帮助解决的有趣问题。

大型语言模型唯一神奇的地方就是,我们可以将它们指向具有巨大输出空间的问题,或者输出不容易严格检查的问题。这就是我们在这里谈论的。这就是它们智能的地方。

然后神经网络让你更近一步。因为,嗯,我们可以做得比随机行走更好。我们可以进行大量的训练。然后,采样和生成比随机要好得多。你认为,你知道,它严重偏向于一个人口,其中10,000个中有1个是正确解决方案,而不是1亿个中有1个。

然后,这是推理吗?我的天。这不是10,000对1亿。这是10,000对一个谷歌。这是10,000对比宇宙中的原子还多。如此多的数量级变化。这就是正在发生的魔法。这不仅仅是小小的优化。这是一个改变游戏规则的事件。这就是为什么这只在最近几年才奏效。这是一个新的突破。它不是查找表。它不是统计学。

看看数字。看看数量级。统计学不能帮助你将一个有谷歌点数的搜索空间缩小到一千。那个空间里没有足够的数据点来进行统计。这是智能搜索。这是理解。这是抽象。这是推理。这是人类所做的一切。这是简单的基础。这里发生了事情,伙计。你不能只是因为你正在看到证明就忽视正在发生的事情。证明就在于将搜索空间从大约10的100次方缩小。这些指数数字,这些天文数字,字面上比宇宙中的原子数量还多,缩小到一千。这是你眼前正在优化的数量化证明。你必须看到证明。当你将1000与1亿进行比较时,你就在证明你对这个真相缺乏欣赏。你把它说成是优化,而实际上它是一个根本性的突破。这是真正智能的标志。

你知道你正在与一个真正的智能互动,当你有一个你本身就无望导航来找到一个伟大解决方案的指数级大小的搜索空间,然后眨眼之间,更高级的智能就向你展示了一个解决方案,或者向你展示了搜索空间中仅仅1000个候选解决方案,而对你来说,这只是无望的。对我来说,在2018年,在GPT出现之前,我试图写一篇关于一个晦涩的科学主题的文章,我做不到。然后,出乎意料的是,GPT来到了我身边,给了我一千篇候选文章和一些来源,其中一些是真的,一些是幻觉。我只需要做一个检查它的工作的步骤,然后我从1000篇中挑选一篇,然后我提交,然后我就可以获得我的博士学位了。我可以在GPT的帮助下通过博士学位毕业考试。这不是从1亿到1000,而是从不可能巨大到1000。这是一个重大的区别。

这引出了下一个观点,那就是人们说,“人类也不会推理。”而我倾向于这种观点。因为我认为,所有智能都是集体的。当然,我们的大脑是一个集体,我们的身体是一个集体。你知道,我们由所有这些小的自主的东西组成,它们有自己的议程。但我听理查德·道金斯在萨姆·哈里斯的播客上说,据他说,它们来自细菌。线粒体基本上是一种细菌。这是一种理论。是的,是的,好吧,但是,你知道,我们只是由所有这些小的,你知道,自主的东西组成,它们有自己的议程。但是,你知道,细菌实际上是想通过女性谱系传递它们的遗传物质给后代,而不是男性谱系。道金斯是这么说的。但是,但是,但是,无论如何,你知道,它也发生在大脑和身体之外。我们发现知识和推理的方式,很多都是偶然和巧合。而且,因为我们拥有惊人的信息共享能力,我尽量不使用大词。基本上,我们发现了一些有趣的东西,我们与集体分享,这些信息得以保存。在我死后。所以作为一个集体,我们正在积累越来越多的知识,并且它在我死后得以保存。这是一件美妙的事情。

逻辑复制器在这里。一切都是集体的。好吧,大脑是神经元的集体。大脑中的每个细胞都是基因的集体。所以你已经有了集体的层次。哦,每个细胞都有线粒体。太好了。一切都是集体的。谁在乎?

有趣的是,一个单一的人类大脑能够将输入映射到输出,这是其他任何物体都无法做到的,甚至连今天的人工智能也做不到。所以,当谈话的主题是“大型语言模型是否在推理?”“GPT-1是什么?”“它们还缺少什么?”你说,“嘿,智能是一个集体,伙计。这真的无助于争论。”如果你真的认为它必须是一个集体,那么你需要具体说明一个只能集体完成的输入输出,否则你只是在敷衍。

我没有任何问题,就是“一个机器人有一天可以推理”。就此而言,比如,我没有任何问题,一个计算机程序,你知道,可以执行推理。我对此没有任何问题。它可以是100%确定性的。一台计算机,它可以在计算机中执行推理。我也完全没有问题,你知道,我是一个机器。我是一个生物机器。我由湿件和软件组成,你知道,还有其他东西。但我仍然可以进行推理。所以,我并不是说机器不能推理。我所说的是,我们今天可以训练的神经网络类型,它们并没有进行我们所需要的、用于通用智能的那种推理,那种有效的计算推理。解决一般性问题需要图灵机。你知道,它们不能仅仅是有限状态自动机,或者,你知道,有限数量的计算机或其他什么。

来吧,伙计们,你们都知道你们在推理。你知道,如果你在看这个节目,你很可能至少是那种花一些时间深入思考一个问题,应用规则和启发式方法的人。那就是推理。那就是我们所说的。这是正在展开的过程。

这是Keith在整个播客中提出的中心论点。他基本上说,人工智能不能推理,因为如果你想推理,你需要一个图灵完备的架构。但是一个前馈神经网络,就像我们现在拥有的。

LLM,那只是有限的步骤,对吧?当你只要求 LLM 立即告诉你因数是什么,而不使用 Python airG 时,你无法分解一个数字。LLM 无法推理,对吧?回到那个论点,他说:“看,我明白机器可以推理,但我需要看到一些有循环和分支的东西。”

好的,这是显而易见的回答:让我们看看令牌流中会出来什么,这和你意识流中出来的东西是一样的,对吧?我猜他没有很清楚地说明类比在哪里失效了。我猜他在之前讨论发散的部分讨论过。所以他基本上就是不相信 LLM 可以有一个保持稳健、保持在问题上并且缩小范围的令牌流,你知道的,从最后一千个解决方案缩小到一个解决方案,或者别的什么,对吧?他就是不相信它们能解决问题,总的来说。而且我认为他今天对 LLM 的看法是正确的,对吧?这根本不是推理与否的根本区别,对吧?这完全是程度问题。但是,是的,如果他的全部主张是 LLM 可以推理,但不如人类那么好,我认为这对于今天的 LLM 和今天更聪明的人类来说仍然在很大程度上是正确的。

但我不知道为什么他没有进行苹果对苹果的比较,即 LLM 输出大量令牌,其中一些令牌可以回溯并说:“嘿,编辑我之前的令牌。”为什么他不将那种计算模型与人类的计算模型进行比较呢?因为如果他那样做,他就会意识到这两种计算模型都是图灵完备的。所以他所做的区分,即“哦,LLM 只是一个有限状态自动机”,这是一个比计算机更原始的计算模型,因为它有有限的内存,固定的内存量,就像网络中有固定数量的层一样。他一直说:“看,这是一个有限状态自动机,我,人类大脑,我是图灵完备的。”

但是,当你让它拥有一个思想流,并且思想流可以任意长的时候,把它从一个有限状态自动机变成一个图灵完备的计算机就太容易了,对吧?就像你使用 ChatGPT 时,它有一个硬编码的限制,比如:“嘿,你不应该输出超过这个数量的令牌。”如果你去掉了硬编码的限制,只是让它能够纠正自己,让它能够让你回去改变它之前说的某些令牌,让它们变成其他令牌,以修复它的答案,一旦你做了这两个简单的调整,突然之间你就拥有了一个图灵完备的计算模型。所以充其量,他只是在过度简化事情,他说我们需要一个图灵完备的计算模型,我们完全拥有它。所以我不认为那是他真正的观点,或者如果那是他的观点,那也不是一个好观点,对吧?我认为他真正的观点更像是:“嘿,它工作得不好,它不稳健,对吧?”

但是,我认为这里有一个主要问题,就是他没有很好地分析情况。还记得吗,他做这个播客是因为 GP1 刚刚发布,而 GP1 在一系列基准测试上确实有更好的表现。他是怎么说这是可能的呢?他说因为 GP01 知道如何从它在某处看到的其他推理中进行模式匹配,并利用它来在这些基准测试上获得更好的表现。好吧,公平地说,让我们假设,让我们假设,假设他是对的,它只是模式匹配,它只是查找表,它只是统计数据。让我们假设他是对的。但是,能够以任意程度的模式匹配其他模板的计算能力,就像 GP1 所能做的那样,这种能力不是一个有限状态自动机,对吧?它是一个图灵完备的计算模型。所以试着把你的故事说清楚。它是一个有限状态自动机,还是仅仅是模式匹配、统计相似性?你不能同时是两者,对吧?你必须选择你的界限在哪里,你的不满在哪里。

但当然,真正的答案是,根本没有界限。这些东西真的在以不到一年的时间打破我们能想到的所有障碍,对吧?就像警报正在响起,如果你有眼睛就能看到。在根本层面上正在发生很多重要的事情。它不像有限状态自动机、统计数据那么简单。它真的,真的不那么简单。而且,你唯一能清晰地了解真正发生的事情,了解进步真正有多重要的唯一方法,就是将你的目标设定在输入输出的水平上。这是你能看到里程碑被超越的最主观的方式,如果你说:“我对这个输入输出印象深刻,当它能解决这个问题时,我印象深刻。”然后你就会看到,越来越多的问题不断被解决,越来越多的基准测试不断被征服。然后你就会看到真正发生的事情。

所以我鼓励他们尝试客观,尝试做出预测,尝试定义基准测试,而不是仅仅追溯地说:“哦,是的,那只是统计数据,那只是模式匹配。”因为他们以这种速度仅仅是统计数据、仅仅是模式匹配的借口,将一直有效,直到超级智能出现,直到他们被超级智能 AI 杀死,直到前一天他们还在说:“哦,是的,那并不算太好,那并不算太好,对吧?”所以他们必须通过做出预测或定义一个能说服他们的基准测试来阻止这种滑坡。例如,ARC 基准测试,对吧?ARC 基准测试旨在以最简单的方式定义真正推理的一种方式。预测市场正在说,ARC 基准测试将在未来一到两年内被超越。这就是预测市场目前的赌注。

那么 Tim 和 Keith 是否想签署 ARC 基准测试,说:“哦,嘿,它现在可以真正推理了,因为它通过了 ARC 基准测试?”我怀疑他们不会。我怀疑他们的立场将是不做任何预测,然后当 ARC 基准测试通过时,他们会说:“好吧,是的,它刚刚通过了,但它只是通过模板和模式匹配做到的,它仍然不是真正的推理,对吧?”我觉得那是他们的做事方式。但是,如果他们提出一个具体的预测,说明在未来两年内可能发生的事情,他们可能会令人惊喜地改变我的想法,并说:“哦,是的,嘿,太棒了,这是真正的推理。好吧,我们错了。事实证明,我们现在的 LLM 实际上已经接近了,它们只是缺少一个关键成分就能进行真正的推理,对吧?”如果他们那样说,那就太好了。

现在 Tim 将愉快地给我惊喜,并向 Keith 提出我想要问的问题。你说过,归谬法是“我们什么都记住了”,那不是推理,对吧?然后在另一个极端,我们进行纯粹的推理,所以我们构建了一个能够解决 ARC 挑战的东西,它能够,你知道的,从一套基本知识中,它能够通过元学习或知识获取自动组合,形成一个新的模型来高效地解决每一个问题,因为 Challe 说推理过程的效率就是智能。然后我们在这两个极点之间有所有的灰色区域,对吧?所以灰色区域现在是,“我有了这些推理轨迹,而且,你知道的,我从我的语言模型中进行了 RHF,语言模型有了直觉,有了创造性直觉。哦,这是一个有趣的问题。也许我应该使用这个推理模式,也许我应该使用那个推理模式。”而且它在内部进行树搜索,对吧?它在评估所有这些不同的路径,并且它通过某种类似于局部敏感哈希表查找的东西来找到这些模式,对吧?所以它就像从它的记忆中提取这些东西。如果它有效,为什么那不是推理?它有什么不同?

我的回答是,在你能处理困难输入、困难输入输出映射的程度上,通过某种可靠的程序,你正在做的事情,在你能实现的任何程度上,你一定是在推理。无论你做什么都应该被视为推理。如果它是一系列可预测的、可重复的算法步骤,将你从输入带到输出,那就是我的定义,那就是我将如何语义上划分事物。为什么我会有这样一种与他们截然不同的方法?好吧,我对此情况有一种理性主义的看法。我接受了 LessWrong 系列的训练,由 Eliezer Yudkowsky 指导,如何在语义战争中航行,同时牢记世界上真正重要的事情。记住我之前说过的话,我们关于推理定义的语义争吵,最终不如优化能力这个真正重要的问题重要。在优化更广泛的领域,比如整个宇宙,以及更深入的优化,比如超人类水平的优化,在人类通常最擅长的那种问题上,这些 AI 有多远?所以对我来说,这是关键问题。这个问题将决定我们是否注定要失败,还是推理与否。这种语义争吵更像是一个支线任务,只是关于你是否拥有良好的心智模型来回答我们是否会被超级智能优化器注定失败这个重要问题。

为了强调这一点,考虑一个你只有一个非常简单的输入输出的场景。如果游戏是井字棋,我输入井字棋棋盘的当前状态,你输出最佳的下一步。这是一个非常简单的输入输出。井字棋配置的总数,它不重要,它不重要你的推理有多么强大。在这个特定的例子中,问题的性质,它是一个如此简单的优化问题,只有 255,000 种可能的输入,使得它是否使用查找表并不重要,因为你可以使用查找表,并且查找表可以装在一个相当小的内存中,仅仅是这个事实就使得它是否在推理不再是一个有趣的问题。归根结底,唯一有趣的问题是优化。你能给我一个多大的搜索问题,并期望你仍然能在这个空间中找到一个非常好的解决方案?就像一个搜索空间比宇宙中的原子数量还大,但你仍然在这个搜索空间中找到了非常好的金块。那就是危险的事情,那就是力量的来源,是人类能够把其他动物关进笼子而不是反过来,那是力量的来源,是我们可能很快就会被关进笼子的原因。是优化能力。

所以,关于推理的整个讨论只有在它让我们能够衡量优化能力维度上的进展时才有意义。我认为他们自己感到困惑,仅仅讨论什么算作真正的推理,而没有这个视角,即我们为什么问这个问题,为什么它很重要,以及在这个语义游戏中有什么风险,这很有趣。我认为如果他们有这种具体的外部动机来玩他们的语义游戏,他们的讨论质量会提高。顺便说一句,如果你读了 Eliezer Yudkowsky,如果你读了 LessWrong 系列,这实际上是他明确写下的一个教训。这个想法是,是的,我们可以玩语义游戏,有好的定义和坏的定义。但最终,你想用“你想要做什么?你希望你的大脑如何拥有控制世界的力量?”这个问题来取代语义问题。从那里,你将对你的语义游戏有一个很好的视角。

嗯,我的意思是,也许,也许我们需要一个推理的层次。它执行一个非常浅的,非常浅的形式,对吧?就像它在它的模板库中进行这种查找,并应用最接近的匹配,然后,你知道的,选择获胜者,或者得分最高的那个。好吧,那么它在计算时间方面只有非常非常浅的深度。

凯斯似乎在这里所做的是,他认为目前的 LLM 所能做的并不那么令人印象深刻。啊,他们甚至不能在第一个令牌中分解一个数字。所以他想反向推理为什么它们内部的操作不应该算作推理,因为他对它们不满意。所以它们一定不是在推理,它们一定缺乏人类所能做到的某种本质,而它们的架构还不能做到。我们需要一个不同的架构。他真的想提出那个主张。所以他有点忽略了它们输入输出的力量,他忽略了它们以统计数据的方式导航指数级空间的事实,他有点把所有东西都套进他想做的那个主张里:“这还不是推理。”而且这可能是因为计算模型不够强大,就像我说的,除非你故意缩小范围,比如“第一个令牌,如果你不对,如果你不允许编辑你的令牌,那么它就是一个有限自动机。”他似乎在努力解释为什么它不是推理,这可能有效,但请记住它的问题在于,他很快就会处于一个位置,即下一版本的 LLM,如果他决定预测它的能力,很可能会打破他的立场,与他的预测相矛盾。然后他就会处于一个尴尬的境地,必须解释为什么这个非推理者会提供越来越好的结果。

这实际上是 Tim 要求他解释的。他说:“想象一个场景,你试图驳斥为非推理的所有幕后发生的事情,不断提供越来越好的性能。你会怎么说?你会在那时授予它‘推理’的标签吗?”他说:“不,它仍然很浅。”他处于一个尴尬的境地。

所以它在计算时间方面只有非常非常浅的深度。它有非常宽的范围,也许有一种更好的思考方式是,在老式的时空权衡中,对吧?就像我之前和电路谈到的那样。你有一个计算问题,你想解决它。好吧,你可以用一个小电路来解决它,这个电路运行的时间是线性的。或者你可以用一个指数级大的电路来解决它,它一步就解决了。现在,我说的是,我们称前者为推理,所以当它是随着时间推移发生的事情时,让我们说,或者随着时间展开。我们称之为推理,而我们通常不称那个指数级放大的电路,它一步就完成了,你知道的,推理。

再次,带着这个不正确的心理模型,即 LLM 就像一个指数级放大的电路。他认为:“哦,我们在这里撒哈拉沙漠。当然,这个算法可以找到我撒哈拉沙漠里的一小块金子,因为它是一张地图,地图的大小是撒哈拉沙漠的一半。所以当然我可以在地图上找到金子。”但我说:“凯斯,你的地图放在你的手里。实际上,你称之为放大的地图。它展开了,仍然放在你的手里。地图不是撒哈拉沙漠那么大。”所以,这种它是一个时空权衡,它只是一个巨大的查找表,因为它有两万亿个参数相对于谷歌大小的搜索空间,这行不通。一定有什么别的东西在发生。

如果你选择构建指数级大的电路来一步完成事情,问题在于你必须提前知道输入的范围,对吧?因为我必须构建足够大的电路,以便它能够处理我将来会看到的所有可能的输入。而且通常你不知道。就像我不知道一样。而如果你选择构建推理电路,那些能够随着时间推移执行这种计算的东西,我们确实有奢侈品,事情会比我们预期的花费更长的时间。就像时间,它可能无限。它一直展开,你知道的,我们总能得到另一分钟,另一分钟,另一分钟。而这就是最大的区别,对吧?要么你必须提前知道你将要看到的所有输入大小,要么如果你遇到一个输入,哦,该死,它太大了。好吧,让我们回去重新训练它,让我们创建 GPT 76,你知道的,因为我们遇到了一个太大的输入。现在我们必须花费,你知道的,5 万亿美元来重新训练它,然后我们就可以解决这个问题。

相反,如果你花一亿美元建造一台能够进行迭代的机器,无论需要多长时间,你就不需要回去再做一次了。你可能只需要再买一些磁带。所以它有一个非常实际的重要区别,对吧?

所以,有一个非常重要的心智模型来自复杂性理论,凯斯正在谈论它,即时空权衡。通常,你可以采用一个算法,如果你愿意做一个大的缓存,如果你愿意战略性地使用空间,并用空间做一些事情,你可以让它运行得更快。这是非常真实的。反之,如果你有一个占用大量空间的算法,但你愿意占用大量时间,也有办法让它占用更少的空间。所以他绝对是对的,在复杂性理论中存在时空权衡。在这方面有很多有趣的东西可以研究。但有趣的是,当涉及到 LLM 时,他的心智模型显然是错误的。

想象一下,现在是 2018 年,我说:“嘿,凯斯,你知道神经网络吗?想象一个深度神经网络,它还有一个叫做注意力机制的部分。想象一下,我以有限的时间来处理它生成的每个令牌。所以它每个令牌实际上是一个有限状态自动机,因为我们没有谈论上下文学习和使用令牌编辑先前令牌的想法。我们根本没有谈论任何这些。我们只是在谈论:“嘿,我们将写自然语言论文,我们将使用具有一些秘密武器的神经网络架构来回答测试中的论文问题,你知道的,注意力。我们将做所有这些,而且它实际上不会有时间空间权衡,因为我们将把它放在一个 U 盘上。就像今天一些紧凑的开源 LLM,你可以把它放在一个几 GB 的 U 盘上,就像一个压缩模型。即使是那个模型也将是 GPT 3.5 级别的,它将能够为你写出很好的论文,但它将像一个有限状态自动机一样快速、可预测地运行,并且它将放在一个 U 盘上。你对此怎么看,凯斯?它如何处理时间空间权衡?它只是给你一切,它只是从一个 U 盘上神奇地输出论文,快速运行?你如何解释这一点?

我认为,如果我在 2018 年问凯斯,他可能会认为权衡比我们实际看到的要严重得多。他可能会说:“好吧,你肯定需要大量的空间或大量的时间。你不能同时拥有这两样东西并写一篇论文,因为想想有多少种不同的论文,它们都必须符合语法,它们都必须连接思想。”想象一下那里的时间空间权衡。但我们已经知道,通过,你知道的,我们已经有了回顾的优势,我们可以看到:“哦,不,U 盘只是设法完成了这些惊人的论文。”

再次,我们生活在 2024 年,你可以轻易地驳斥:“哦,是的,写一篇论文,那只是模式匹配,那只是模糊查找表的一种类型,仅此而已。”但在 2018 年,他会睁大眼睛,听到你竟然能在 U 盘上以 01 的时间运行,或者与你想要的输出令牌数量成比例的 O(n) 时间运行,他会睁大眼睛:“这怎么可能?这如何符合可计算性理论的公理?”他会感到困惑。但我只是指出,他现在在 2024 年试图套用那个时间空间模型同样是错误的。

现在 Tim 将再次尝试戳破 Keith 的推理与否的界限,并试图让他说:“来吧,你不认为 LLM 在这种情况下正在进行推理吗?”而 Keith 给出了迄今为止最清晰的答案之一,我认为这是错误的,但它很清晰。让我们听听。

“一个模型只是,它只是对世界的忠实表示,它允许你对世界进行强大的推理,因为模型在某种意义上是正确的。如果你正确地组合了模型,并且你有一个高效准确的世界状态推理,那么你就完成了推理。我对此没意见,只要人们理解核心观点,那就是你机器所能做的推理的影子。因为你的机器可以长时间地进行这个过程。你可以成为 Andrew Wiles,在你的阁楼里,无论花了多少年才解决费马大定理,没有人事先说过,你将在阁楼里待三个月。就像事实证明比那长得多,对吧?”

你正在录制这个播客,就在 GP1 发布之后。新闻报道说它通过思考 115 秒来解决填字游戏,并且比其他所有 AI 都更好地解决了 7x7 的填字游戏,因为那个长链的思考。这和你说的关于人类,比如 Andrew Wiles 花费数月来解决他的证明有什么根本区别?它使用了更多的计算步骤,它使用了更多的令牌,它使用了更多的内存磁带,对吧?它使用了更多的时间和空间。换句话说,它正在进行计算,就像它是建造过的最先进的计算系统一样。所以毫不奇怪,它正在进行计算,超越了有限自动机,超越了随机鹦鹉。这实际上是一种先进的计算技术。我不知道为什么这很难承认,对吧?我不知道为什么你不承认这个 100 秒思考解决填字游戏的 AI 确实通过推理来解决一个该死的填字游戏。你认为思考 115 秒来寻找 7x7 填字游戏的解决方案需要推理,因为它不够?就像 Andrew Wiles 也思考了很长时间一样。你没有看到这两个观察之间的联系吗?我不是说 AI 今天就是 Andrew Wiles,但你认为这是怎么回事?你认为瓶颈是什么?因为当你被问到这个问题时,你指向了计算模型,你指向了时空权衡,而这些显然不是正确的区分。它们没有完成区分 GP01 和 Andrew Wiles 的工作。你抓错了区分点。

你认为区别是什么?再次,我认为没有区别。我认为这完全是优化程度的问题。是的,我认为还有其他架构组件将被发掘出来,可以混合到当前的 LLM 架构中。我认为我们还没有发现所有关键部分。我认为我们将拥有更有效、更聪明、更好的架构。但我仍然认为我们很接近。我认为我们现有的架构正在打破我们能够尝试的几乎任何一种输入输出。我认为我们正在打破当前技术与超级智能之间的最后一道墙。

Tim 和 Keith 播客的最后一部分,我将回顾的是一个比喻,即 AI 的知识就像一堆瑞士奶酪片,是的,它覆盖了很多领域,但仍然有漏洞。我认为这个比喻在某种程度上适用于描述今天的 AI 在你问它与它之前做过的事情相似的事情时有多么出色。我绝对认为这个想法有一个很大的核心真相,即:“好吧,它只是瑞士奶酪层。”所以 Keith 问这个问题:“好吧,它会永远是瑞士奶酪吗?这些漏洞有多大?瑞士奶酪的拓扑结构是什么样的?随着 AI 越来越大、越来越聪明,会发生什么?它有多少是瑞士奶酪?”

让我们给那些狂热者,你知道的,好处,我们关心的一切,它将解决,你知道的,科学问题和政治问题,以及各种各样的问题,我们关心的一切。但是里面会有大量的漏洞,对吧?因为 OpenAI 或者任何 AI 公司,我们还没有遇到这种情况,所以我们还没有修补它缺失的模板,它覆盖了那个,因为我们必须记住这些模板,它们非常精细和具体。就像回想一下我们学习的那个关于 Bisri 的节目,它正在创造一个拼凑的蜂窝状结构。你必须把它看作是一个巨大的蜂窝状结构,里面有所有这些小细胞,它学会了如何适应一切。而且很多情况会出现,当它被精确地定位到某个特定的细胞时,它就坏了。

所以这是基于推理的缺点,即推理在计算意义上非常宽泛。所以它有很多很多很多很多很多模板,但它们都很愚蠢,而且很浅。然后它只是试图找到正确的那个并应用它。这是缺点,而不是一套高度可靠的第一原理,当迭代时会给你一个答案。一个是更简洁的,对吧?所以人类发展的是一个高度简洁的知识语料库。它包含一个小的集合,你知道的,与神经网络相比,它显然有很多细节,在物理学、生物学、科学等等方面。但是科学所做的是找到简洁的原理,当它们按顺序、迭代和组合应用时,就能推断出答案。而且在某种意义上,这更可靠,而且不像一堆巨大的瑞士奶酪,里面有各种各样的漏洞,我们甚至不知道它们在那里。我们不知道漏洞在那里,直到有什么东西爆炸了,然后我们才发现有一个漏洞,因为没有人费心去看。

我愿意接受这个框架,即今天的 AI 及其弱点确实感觉像是你正在揭露瑞士奶酪中的一个漏洞,因为如果你问了一个与它训练数据中的东西非常相似的问题,它很可能就会答对。所以,在你选择了一个非常独特的提示词,这就是为什么它让你感到困惑的程度上,我认为应用这个比喻是公平的,即“啊,你现在在瑞士奶酪中的一个漏洞里。”我认为这是公平的。所以完全可以问:“好吧,我们能把漏洞做得多小?它们会变得非常小,我们就会有一个实心的奶酪块,还是总会有漏洞?”他似乎很确信总会有漏洞,无论你做什么,没有根本性的架构改变,那都是他的观点。

我的观点是,我认为漏洞会越来越小。我认为这就是我们看到的趋势。我的意思是,看看从 GPT2 到 GPT3 到 GPT4 的趋势。如果你今天回去使用 GPT2,你会觉得:“哇,这是我见过的最大的瑞士奶酪,有这么多漏洞。这些漏洞怎么可能被填补?”我绝对认为,当你使用 GPT3 和 GPT4 时,你会感觉到漏洞越来越小。它在知识的空白处犯的错误不像以前那么明显了。这就是我的感觉。我可能是错的,对吧?你看,他可能是对的,无论你做什么,都会有漏洞,除非有根本性的架构改变。但是我可以给你一些原因,为什么我认为它不会那样发展,为什么我认为漏洞很快就会被填补。

第一,通过类比人类。他试图划清界限,他说:“好吧,我们以简洁的方式推理,我们只是将世界理解为从简单的物理原理中涌现出来的。”但我们真的吗?我的意思是,我们的大脑相当大,我们有大约 1000 亿个神经元,据我们所知,它们在进行大量的缓存。当你看到世界上的东西时,你的大脑经常只是将其与浅层模式匹配,并尝试激活缓存的子例程,因为我们没有那么多串行操作可以做,而且我们有很多空间。所以我们的大脑非常像一个巨大的瑞士奶酪,对吧?我的意思是,如果你看看人们,尤其是 IQ 低于 100 的人,他们做的很多事情,他们会承认:“好吧,这就是我们在这种情况下的做法,这就是在这种情况下匹配的模式。”所以当你谈论某人是瑞士奶酪,某人以模式匹配到最近的模板来思考时,我认为你非常描述了我们所有人,尤其是那些不是杰出原创思想家的人,对吧?想想有多少人只是随波逐流,只是想融入,只是想做他们应该做的事情,只是想做他们学到的东西,对吧?不是我们所有人都像有创造力、原创的第一原理思考者,对吧?第一原理思考者是稀有的。所以这是我认为瑞士奶酪的漏洞会被填补的原因之一,至少达到人类水平及以上。

另一个我认为瑞士奶酪会被填补的原因是,我认为当你真正擅长某些领域时,比如当你真正擅长语言时,当你真正擅长策略游戏时,有一些挑战,当你专注于这个挑战并且你在这个技能上做得非常好时,它是一个如此通用的技能,以至于它覆盖了整个瑞士奶酪块,你知道的,那个领域。就像一块瑞士奶酪,它变成了瑞士奶酪块,所以它覆盖了漏洞,仅仅因为它是一个如此通用的切片。你知道的,就像 Sora 视频生成。如果我非常擅长生成视频帧,如果我真的完全掌握了视频帧生成技能,那么我就能告诉你物理模拟中会发生什么,因为我可以利用启发式方法来准确预测物理,而无需详细模拟。或者我能告诉你社交互动中会发生什么,因为我可以模拟社交互动。或者我甚至可以告诉你几何谜题会发生什么,对吧?因为我可以通过某种方式利用视频生成来模拟几何。当然,所有这些的大问题是,视频生成器到底有多好,这与我们对 LLM 的问题相同,它预测下一个令牌到底有多好?

所以,当我们谈论分层堆叠的瑞士奶酪片时,瑞士奶酪片的性质,它取决于 AI 学习这些知识的算法实现。但它也取决于知识的性质。所以这是一个我们还没有明确回答的问题,关于这些知识片的性质,那就是,知识片有多厚,有多完整?宇宙是否只有这些可以覆盖很多漏洞的知识片?我怀疑答案是肯定的,你只有这些知识片,它们本质上倾向于覆盖漏洞。

我还会提出另一个论点,如果你回到 1600 年,和人们谈论物理学是如何运作的,你会得到瑞士奶酪。就像他们可以给你不同问题的部分答案,但他们不能和你深入交流。就像他们真的不能告诉你恒星是怎么回事。他们只是说:“好吧,我认为我对恒星的大小有一个很好的估计。我对太阳有多远有一个很好的猜测。我认为它是火。我不知道里面有什么化学能。”他们并不真正了解核能。所以他们对物理学的了解有点像瑞士奶酪。因为他们没有一本教科书可以打开并获取更多的奶酪层。他们只有碎片。当然,这仍然适用于我们今天,对吧?我们没有万物理论,所以我们对物理学的理解仍然有点像瑞士奶酪。

我认为普通人的大脑试图推理不同的事情会看起来像瑞士奶酪。每个人都有自己的知识碎片。就像举个例子,我们在 1600 年之前就知道,他们可能对太阳有多大,太阳有多远有一个很好的估计,但他们无法告诉你太阳是因为核反应而燃烧,对吧?那更多是 20 世纪的事情。所以那是瑞士奶酪中的一个漏洞,他们会对那个特定领域的知识给出错误的答案,除非它碰巧是一个非常好的推理者,能够建立联系并发明 E=mc² 和核反应的概念。我的意思是,这些都是你甚至不一定需要实验来发明的概念。实验只是非常有帮助,因为它会引导你朝着正确的方向前进。但如果你足够聪明,你本来就可以通过推理得出结论。

所以你可以指向 17 世纪末的人类,当牛顿时,你可以说:“看,人类,你们真是个瑞士奶酪文明。你们甚至无法发明核物理学,尽管你们仍然有足够的证据碎片,如果你们足够聪明,你们就能拼凑出核物理学。你们怎么了?为什么你们的知识只是一堆瑞士奶酪?”

所以瑞士奶酪模型,我同意,这是对 AI 的一个公平指控。但我也认为,你必须对人类也这样做。人类在历史上,今天的人类,聪明的人类与愚蠢的人类。愚蠢的人类往往有更薄的瑞士奶酪层,更大的漏洞。这是一个很好的比喻,但我认为它并没有从根本上区分 AI 推理和人类推理。我认为这是一个连续体,就像我们拿出推理的概念,当 Keith 表现得好像真正的推理是 AI 和人类之间的分界线时。我指出,不,它看起来确实像一个连续体。我真的看不到一条线。

而且,瑞士奶酪的比喻也是如此。我认为瑞士奶酪的比喻也是一个连续体。切片有多薄,漏洞有多大。我同意人类往往处于连续体的较小漏洞、较厚奶酪的一侧。但我认为差距正在缩小。所以我认为这个比喻并没有成功地在 AI 和人类之间划出界限。

这似乎是我和 Keith 之间反复出现的根本分歧。而且,蒂姆似乎也在跟随凯斯的脚步。所以我只想说,凯斯,分歧的症结在于,凯斯坚信这些 AI 还有很长的路要走才能解锁真正的人类推理。他认为他看到了区分,计算复杂性权衡,时间与空间,甚至计算模型上的区分,有限自动机与图灵机。我认为这根本不是真的,一旦你开始流式传输多个令牌,并允许令牌编辑之前的令牌,这对于像上下文学习链式思考这样的情况并不难。他看到了 GP1 用 115 秒的思考解决填字游戏与 Andrew Wiles 用很长时间思考证明费马大定理之间的巨大差距。他看到了这两个场景之间的巨大界限。他看到了 GPT4 基于模板和它记忆的事实来回答知识问题,与人类基于他们知道的东西回答问题,但更原创的第一原理思考,这之间存在巨大的界限。他做出了所有这些区分,对我来说,这些都感觉像是连续的区分。区分,如果你从 GPT2 到 3 到 4 到 01 画一条趋势线,它似乎趋势线正朝着人类水平及以上发展。而且在许多测试中,它已经证明是超人类的。我个人不想在数学奥林匹克竞赛中与 GPT1 对抗,至少现在是这样。或者我不想在各种视频游戏中与 DeepMind 的 AI 对抗。所以我看到了连续体,他看到了某种硬性区分。这似乎是我们之间无法调和的症结。

我理解,如果我处于他的位置,我会不那么悲观,因为我会想:“好吧,我们必须有时间。也许我们有一个世纪的时间,AI 才能学会真正的推理,所以我们可能在不久的将来不会注定失败。”我仍然不知道为什么他不会是长期的悲观主义者。我不知道为什么他不是一个百年的悲观主义者。也许是同样的原因,AI 悲观主义在人们意识到时间线很短之前并不突出。短时间线确实能让人专注于悲观主义。问问杰弗里·辛顿和约书亚·本吉奥就知道了,他们基本上明确承认,现在时间线很短了,他们不得不重新思考他们的方法。他们说:“哎呀,是的,我可能应该早点想到这一点,我只是没想到我会如此紧迫。”

所以,这是我对这个视频的分析。我得说,它变成了一个比我预期的更深入、更详尽的分析。这个视频实际上有很多内容。我相当惊喜。这是一个实质性的视频。我对这两个人,Tim 和 Keith,留下了很好的印象。他们确实是深思熟虑的人。他们之间有很好的互动。他们提出了连贯的观点,他们不是在胡说八道,他们没有漫无边际。你会惊讶于有多少人只是愚蠢的漫谈者,那绝对不是他们。他们说得很有道理。只是他们和我之间存在这些根本性的分歧,这些分歧似乎相当大,而且似乎他们应该做得更好一点。比如停止类比可计算性理论和时空权衡。看起来他们是在用错误的树吠叫,对于他们使用的一些心智模型。但除了这个对象级别的分歧,我喜欢他们。我认为他们正在制作高质量的内容。这让我想要听更多 Machine Learning Street Talk 这个播客,因为我对他们思想的质量有更高的评价,尽管有这种巨大的分歧。我认为,正如我所说,他们在这里制作了很好的内容。所以我确实推荐大家听听这一集。我剪辑了很多,但有些部分我没有,尤其是结尾的一大块,最后四分之一或三分之一。他们给 GP01 了一个非常有趣的谜题,让我思考了很长时间。他们给了它这个谜题,我不会剧透,但他们看到了它在他们的谜题上的表现,这是一个非常有趣的例子,说明了 01 的当前极限是什么,以及当今最先进的技术是什么,当我们将聪明的人类推理与最先进的 AI 推理进行比较时。

总之,Tim 和 Keith 为讨论做出了巨大的贡献。希望我的反应对他们来说不会太刻薄。老实说,我认为人们应该听取两者的意见。我认为我们进行了很好的互动。我很乐意让他们来我的播客,或者只是给我一个对这一集的回复。我感谢互动。我也非常感谢他们的播客给了我一个机会来评论 GP01,因为坦率地说,我并不擅长分析随机的新 AI 新闻。那不是我的专长。如果你想要一个擅长这个的人,第一名是 T.V. Moschovitz。前往 THV.TV.IW.WORDPRESS.COM,如果你想阅读。他有一个关于 GP1 的大帖子,我自己今天也读了。一如既往,很棒。这是一个很好的总结。所以关注 T.V. 来获取这类内容。

今天我想,也许我可以在 01 新闻上做些什么。也许我可以找到一个播客,里面的人的观点我倾向于强烈反对,然后通过回应他们的播客并解释我为什么反对他们,我也将有机会给你一些我对 GPT1 的看法。所以我想在这种情况下,这非常有效,因为他们提供了一个如此丰盛的播客来回应。我认为任务完成了。

但请在评论中告诉我你的想法。你对 Machine Learning Street Talk 的人怎么看?你对我和他们的分歧症结怎么看?你对 GP01 怎么看?我想听听。

今天就到这里。我将再次为我的 Substack 做个广告。那些来我的 Substack 上阅读奖励内容并加入我的免费电子邮件列表的人,那些人是我真正忠实的粉丝,因为这比仅仅在 YouTube 上观看需要多花几步。我真的很感激。

你知道有一个独家的免费订阅者聊天,我会在那里写一些额外的东西,如果你去我的 Substack,你可以阅读。你肯定不知道。你得去我的 Substack。强烈推荐。而且正如我之前所说,你知道的,你给我你的电子邮件,它只是让我给你发送内容,即使出于某种原因你没有来 YouTube 上看我。这就像另一个连接点,也是你可以做的事情,成为“末日辩论军团”的一部分。一群试图提高社会温度,制造发烧,煽动发烧来对抗迫在眉睫的 AI 末日的人,这样我们就不会仅仅睡着走进旋转的剃刀片。所以我在招募你,去 DoomDebates.com,输入你的电子邮件,加入末日辩论军团。看看你能如何贡献,或者只是享受奖励内容。感谢观看,期待在下一集 Doom Debates 中见到你。