📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Can LLMs Reason? Liron Reacts to Subbarao Kambhampati on Machine Learning Street Talk

Doom Debates2:59:34

Transcription

拉尔是提出大型语言模型无法真正推理这一主张的主要声音之一。这些本质上是语块模型,是老生常谈的随机鹦鹉论。总的来说,创造力部分是大型语言模型极其擅长的。我们可以画一个维恩图,对吧?比如新知识、推理、创造力,以及不同的专家,他们认为人工智能是否拥有所有这些神奇的术语。欢迎来到邓氏辩论,今天我将回应机器学习街谈节目的一集,该集邀请了Subar Cati教授。这是几个月前的节目了,我一直想看,因为拉尔是提出大型语言模型无法真正推理这一主张的主要声音之一。所以,深入探讨他究竟为何这样说,能给出什么样的例子,以及我认为他的论点有多强,将会很有趣。我期待着收听播客并对此做出判断。

关于库马蒂教授的一些背景信息:他是亚利桑那州立大学的计算机科学教授。他研究规划和决策中的基本问题,特别受到人类感知AI系统挑战的启发。他拥有马里兰大学的计算机科学博士学位,并且在推特上相当活跃,账号是r2z。好了,让我们深入探讨。

好的,所以,嗯,你曾说过大型语言模型是增强版的语块模型、近似检索系统,甚至可能是数据库,而且它们无法开箱即用地进行推理或验证它们所做的任何事情。哦,来了,请告诉我们更多。

所以,首先,我认为大型语言模型本质上是以自回归方式训练的,以便能够完成下一个词,你知道,猜测下一个词。大型语言模型被训练来完成下一个词,这显然是正确的。但现在,让我们看看拉尔如何从“大型语言模型被训练来完成下一个词”做出这个巨大的逻辑跳跃,跳到“大型语言模型基本上只是统计语块模型”。来了。

嗯,这些本质上是语块模型,它们自克劳德·香农时代以来就存在了。真正的区别在于,那些语块模型是n等于一、二或三的情况。所以我们对二元模型、三元模型有相当好的理解。如果我说“左”,你往往会想到“右”,这有点像三元模型。嗯,这里实际发生的是,我们甚至连不起眼的GPT 3.5,你知道,它也算是一种3000-gram模型。这意味着,给定最后3000个词,最可能的下一个词是什么?这与旧想法相同,只不过是大大增强了。啊,是的,老生常谈的随机鹦鹉论。

他基本上是在说,你知道50年前的简单人工智能是如何仅仅记录文本中不同词对的频率的吗?嗯,大型语言模型也记录了大约3000个词短语的频率,然后以某种方式将它们与另外3000个词匹配。长话短说,这只是词频。好的,这只是随机鹦鹉。

所以这非常模糊,他甚至在接下来的部分中承认了为什么它很模糊。关于这一点棘手的部分是,如果你有大约50,000个词的词汇量,那么3000词序列的数量是50,000的3000次方。所以,如果你试图保持出现统计,这是做语块模型的通常方式,我们就会遇到两个问题。当然,第一个问题是,这是一个庞大的行集,你需要有一个条件概率表,以及最可能的下一个词是什么。其次,另一个问题是,相同的3000个词出现不止一次的可能性基本上为零,对吧?

没错,所以你刚才指出的这两个问题,正是你完全错误的原因,这些不是语块模型,对吧?所以,回顾一下拉尔的两个问题,因为他答对了。第一个问题就像他说的那样,没有人能实际构建一个查找表,其中表的每一行都包含一个3000个词的字符串,就像一个3000-gram,因为10的3000次方或类似的指数级数字太大了,无法容纳在任何计算机的内存中。所以这是第一个问题。然后第二个问题,从我的角度来看,这是一个更大的问题,是你不会再看到相同的3000-gram,对吧?我只是重复他所说的。所以他正在谈论在一个不关乎频率、不关乎统计的空间里做统计,对吧?所以他刚刚削弱了他自己的主张。但现在,据说他将挽救自己的主张并使其再次合理。拉尔,请解释清楚。

所以大型语言模型令人惊讶之处在于,我们本质上能够训练出这个非常大的基础模型,并且进行了大量的压缩。所以我告诉学生,你知道,当你想到GPT 3.5时,人们会惊讶它有1760亿个参数。而我认为,不,你实际上应该很高兴它只有1760亿个,因为如果你真的试图在完全的第一性原理场景中做到这一点,你最终会得到50,000的3000次方,那实际上在某种意义上是无限大。好的,所以它以某种方式是一个大型NR统计模型,它实现的压缩因子比宇宙中原子的数量还要大。这似乎是一个如此大的压缩因子,以至于你不再谈论统计学了。但请继续,解释它如何合理。

所以,因为正在进行这种巨大的压缩,有趣的是,任何压缩都对应着某种泛化。因为你知道,你压缩了,所以之前为零的某些行现在可能变为非零。嗯,对于某些词来说也是如此。所以我们经验上发现,当你使用这些训练过的模型进行补全时,它们给出的补全具有非常有趣的属性。特别是,它是一个生成式系统,所以它们极好地捕捉了分布。这意味着它们捕捉了它们所训练数据的风格。作为一个英语作为第二语言的学习者,你知道,我通过语法规则学习英语,这几乎没有意义。但你知道,你的第一语言你不会学语法,你只是学习说话。第二语言你倾向于遵循一些规则和例外,规则和例外,这是一种相当困难的学习语言的方式。当GPT-3和GPT-3.5出现时,我不断感到印象深刻的是,它们不会造出语法错误的句子。

好的,等等,我觉得我们在这里迷失了方向。拉尔还没有证明GPT 3.5或GPT-4仅仅是一个统计模型,实际上不过是一个n-gram模型的主张。他正在谈论压缩,他说“哇,它们能将其压缩成某种更小的统计模型,并用正确的统计特性说英语,这太令人印象深刻了。”但等等,我的竞争理论是,它用良好的统计特性说英语,因为它实际上理解英语,因为它不是一个语块模型,对吧?那是我的竞争假设。所以,如果他所做的只是指出“嘿,当你看到输出时,它具有良好的统计特性”,对吧?任何好的解决方案都将具有良好的统计特性。你关于它只是一个n-gram模型的主张怎么了?请证明它。

所以重点是,语法本质上是一种分布特征,它们捕捉到了这一点。语法是一种分布特征,它们捕捉到了这一点。或者,如果语法不是分布特征,而它们只是实际捕捉了语法的规则和底层结构,然后它们输出,而输出具有分布是因为它是正确的呢?你考虑过这种可能性吗?

当我把英语作为第二语言来说的时候,我知道我想说什么,我知道我想说的内容。是该死的语言,把它用正确的语法表达出来才是个障碍,对吧?所以我倾向于认为,如果某物能真正说出语言,也许内容是容易的,因为内容对我来说总是很自然的。这就是人们开始思考大型语言模型的原因,因为它们能说,你知道,写出好的、高水平的、语法正确的英语,任何好的规范语言,你知道,编程语言、英语等等等等。也许它们也已经很好地掌握了内容,因为我们实际上觉得内容更容易,风格更难。好的,而这实际上是所有这些关于大型语言模型的推理主张和事实性主张的来源,而且它们不适用于语块模型。听起来拉尔到目前为止的论证只是循环论证。他刚刚进行了一段相当长的独白,说人们认为它们理解内容,然后它们语法正确,人们就假设它们理解底层内容,就像它们理解词义一样,所以人们假设它们在推理,但它们不是,它们是语块模型。好的,我们理解你的主张,但你能否证明你的主张,为什么它们是语块统计模型?我想知道。

外面的人确信语言模型在推理。我的意思是,例如,我邀请了拉斐尔·米勒上节目,他引用了Orell的例子,有一篇论文说这是一种棋盘游戏,你知道,有点像围棋,他们说它正在学习这种抽象的世界模型,而且它在泛化。为什么人们如此深信这些东西在推理?

所以这是一个非常有趣的问题。嗯,关于推理的棘手之处在于,如果你问我一个需要推理的问题,而我给你一个答案,从表面上看,你永远无法判断我是背诵了答案然后告诉你,还是我真的从第一性原理进行了推理。我最喜欢的例子是,在过去微软开始进行这些面试时,他们似乎经常问这样一个问题:为什么窨井盖是圆的?对吧?而第一个必须回答这个问题的人基本上必须从第一性原理出发。基本上,他们必须意识到,几乎任何其他形状你都可以操纵它,使盖子掉下去。你知道,圆形是唯一一个,如果你玩弄盖子,它们会掉下去,那么所有这些洞都会没有盖子的地方。这是一种巧妙的思考方式,但最初的几个人必须这样做。对吧?现在,当你知道任何人问这个问题时,你根据候选人的答案唯一能知道的是他们是否为面试做了准备,通过上网查找微软常见的面试问题来准备。当然,人类就是人类,他们也会试图说,你知道,人们想知道你是否能推理。所以如果你真的碰巧知道答案,如果你脱口而出,那就会暴露。所以你会花一些时间,然后脱口而出答案。所以你不能仅仅通过最终结果来判断我是在推理还是在检索。好的。

拉尔刚才给出的那个例子,从我的角度来看,充满了讽刺意味。所以,如果你错过了,他正在谈论大约20年前那个著名的面试问题,微软会问为什么窨井盖是圆的。而每个人都背诵的答案是,如果你有一个方形窨井盖放在方形窨井通道上,也许有人会抬起盖子并旋转它,然后方形的边会与窨井的对角线对齐,然后它就会掉进去,那极其危险。那有点像每个人都背诵的标准答案。讽刺之处在于,实际上有五六个好的答案。例如,如果你有一个圆形窨井盖,你可以滚动窨井盖,这样你就可以更容易地运输它。此外,当卡车开过窨井时,如果你有一个圆形窨井盖,它会均匀分布压力,这很好,因为你不希望在角落形成裂缝。它只是一个更坚固的形状。圆形盖子的制造过程也更简单,因为在制造过程中你不需要对齐像方形那样的角落。然后当你将盖子放在窨井顶部时,它更容易对齐。而且,当你切割窨井的开口时,使用一个专门用于切割特定圆形半径的单一切割工具会更容易,只需沿着整个孔切割,而不是需要进行四次单独切割,对吧?所以切割可以更简单。然后还有一些原因说明为什么窨井井筒最好是圆形的,而不是方形的,比如那可能更容易切割,那可能是一个更坚固的形状,可以更均匀地分布压力。所以,我列出的所有这些不同的考量,它们都是窨井盖形状设计问题的各个维度,对吧?这是一个多维度问题,它与许多其他因素相关,这是一个有趣的问题。讽刺的是,我列出的所有这些使问题变得丰富的东西,都来自Claude。我只是把问题输入Claude,Claude给了我所有这些答案。而拉尔自己似乎没有意识到这个问题有这么多维度,对吧?他只是表现得好像它是一个单一输入和单一输出。拉尔那样想的原因是,他在思考这个例子时并没有真正进行多少推理,对吧?他听到了问题,听到了解决方案,然后把它作为一个人人都背诵的单一解决方案问题的例子存放在脑海中。讽刺的是,有一种方法可以推理它,但拉尔没有选择进行任何推理,他甚至没有选择去进行更广泛的网络搜索,看看其他人是否有其他想法。所以这里有点讽刺,拉尔自己甚至没有思考,在这里却成为了非推理者。

但无论如何,无论讽刺与否,对吧?因为你可以不同意我,你可以说“不不不,这不讽刺,拉尔知道其他原因,他只是举个例子”,对吧?我的观点不是看这有多讽刺,我真正的观点是,是的,这是一个糟糕的面试问题,因为它在谷歌上,因为它在关于如何面试的教科书里,而且因为它现在已经到了如果你愿意,可以不经推理就能回答的程度,对吧?如果你那么在乎背诵面试问题,那么你在面试时就不需要推理。所以如果拉尔自己进行面试,我想他会知道最好不要使用那个问题。他会使用其他问题,那些能实时测试候选人推理能力的问题。当然,我想每个人都会同意有些问题不需要推理,而作为问题设计者,我们的工作是提出需要推理的问题。是的,输入-输出、问题-答案,问题-答案关系有时可以通过推理解决,有时不能。这与需要搜索的可能答案空间有关。如果一个问题出现在一个可以记忆的地方,比如面试学习指南,那么它可能没有自由度,对吧?你可能只需要照搬背诵的答案。你可以在一个单一计算步骤中做到这一点,对吧?一个单一内存查找,你不需要推理。现在,如果它有一堆自由度,比如如果面试官勾勒出一个复杂的窨井形状,并说“告诉我这个复杂形状的优缺点”,那么现在,关于那个精确的窨井盖形状的唯一回答方式可能不是记忆一个答案,而是你可能需要记住10个不同的标准,关于你如何分析一个窨井盖形状,对吧?你如何分析制造难度,你如何分析安装后的压力分布,对吧?所以现在我们已经从O(1)或单一计算步骤,变成了现在可能有10个不同的清单你需要逐一检查,所以它需要更多的推理,对吧?没有捷径。

计算机科学中整个复杂性理论领域都是关于为回答一个问题所需的计算步骤设定下限的。而且,无论是人类回答某个问题,如果它是NP难的,那是一个特定的复杂性理论指定,无论是人类试图解决NP难问题,还是计算机试图解决NP难问题,你都不需要查看算法内部在做什么。你只是能够说“嘿,这个问题,任何解决这个问题的人都必须进行一定量的计算”。所以类似地,你可以从所需计算的下限进行类比,将其类比为所需推理的下限,对吧?而这正是我反驳拉尔的地方。他表现得好像问题-答案对不足以判断某物是否在推理。不,仅仅通过注意到它们将问题映射到一个好的答案,你就可以嵌入大量证据来判断某物是否在推理。那是你可以做的事情。如果你以他自己的面试问题为例,是的,那是一个糟糕的问题。不要问那个问题。问另一个问题,比如“嘿,这里有一段你从未见过的代码,帮我调试这段代码”,对吧?那是一个具有许多自由度的问题,无法在这个问题上作弊。所以,提出好问题,这是我的小抱怨。但现在我想他会采取另一个方向,他会说“看,你不能通过提问来判断某物是否在推理”。让我们听听。

许多这些推理主张来自这样的事实:大型语言模型在标准化测试中表现极佳,对吧?而人们忘记标准化测试的一点是,标准化测试有标准化的题库。好的,我明白他想说什么了。他说你看到AI通过你的基准测试而过于印象深刻,因为你没有意识到基准测试中的每个问题都类似于微软面试中问你窨井盖的问题。它们只是背诵的答案、背诵的答案、背诵的答案。所以你的整个问题集实际上是这些O(1)问题。每一个问题实际上都是可以记忆的,因为你没有足够地改变问题,或者你没有给问题足够的自由度。你总是问完全相同的问题,你总是问为什么窨井盖是圆的。你在提问时没有给出动态可变类型的窨井形状。这就是为什么你的测试来源容易被记忆。我想那是他的观点。让我们继续听。

我一直告诉我的学生,你们认为难点在于回答考试问题,实际上难点在于想出有趣的、尚未在Course Hero上列出的考试问题。Course Hero就是现在存在的这类网站,它们收集了考试中出现过的所有可能问题,或者带有答案的题库中的问题。所以学生们基本上可以尝试为考试做准备,而不是为理解材料然后回答问题做准备。等等,那是另一个观点。他现在的观点显然不是圆形窨井盖形状的问题实际上应该是一个关于任意窨井形状的问题。不不不,他现在的观点显然是编写试题比回答试题更难,这很疯狂,对吧?我的意思是,这与人们通常提出的P对NP主张的逆向。对吧?通常P对NP的观察是,在许多一般情况下,回答问题比提问难得多,对吧?这就是为什么我们有P不等于NP猜想,对吧?他说“不不不不不,提问太难了,如果你能提出问题,那么回答问题可能就不那么难了”。我不知道我是否在断章取义,但他现在真的在强调提出新问题的难度,而这传统上不被认为是计算复杂性很高的事情,能够提出一个问题。而且,这也不是我期望从他那里听到的观点,所以我确实觉得他正在多个观点之间切换。我不确定他是否足够长时间地专注于同一点,以便我理解他的论证是什么。让我们继续听。

所以这最终在许多情况下,人们认为大型语言模型在推理,结果却是它们实际上在进行近似检索。所以他的主张是,给我看一个大型语言模型回答问题,看起来像是在使用推理的真正令人印象深刻的例子。例如,也许你给它一个你认为是新颖的医学案例研究,比如“医生,这是我的情况,请帮我解决这种独特的症状组合”,然后大型语言模型输出:“根据这种症状组合,我认为这种和那种情况可能是你可能出现问题的两个主要假设。”而这类问题直到最近才解决,对吧?直到最近,AI才在医学考试中获得比人类更好的分数或相似的分数。但听起来拉尔现在的主张是,好吧,你所印象深刻的那些例子,实际上在它们的训练语料库中会有一些样本考试或它们实际记忆的东西,而你实际上只是问了一个与它们记忆的东西非常相似的问题,对吧?那基本上是他的主张。现在,你如何证明这一点?通常证明这一点的方法是对角线论证。你几乎,例如,我给你一个例子。我非常想看到这个通过对角线论证证明看起来像大型语言模型推理的东西实际上是大型语言模型调取了某个记忆的测试答案的例子。让我们看看。

所以我对大型语言模型的规划能力很感兴趣。规划是一种推理形式,它是一种涉及时间和行动的推理形式。嗯,所以AI规划领域的人们一直在研究的一种非常简单的规划问题是堆积木之类的。也就是说,你在初始状态下有一堆积木的某种配置,它们可以是命名的积木或彩色的积木,你希望在目标状态下有一种不同的配置。并且有一系列动作,例如拿起、放下、堆叠、拆叠,对吧?给定这些动作,给定这个积木世界问题,你能否提出一个实际能达到目标状态的动作序列?这就是规划问题。

堆积木通常是一个直接的推理问题,就像1950年代的早期计算机可以遵循一套相当简单的规则来推导出哪些动作序列可以以某种方式堆叠积木,对吧?通常,让机器人堆积木的难点在于观察积木并确定手放在哪里来拿起积木,对吧?这有点像积木的模糊部分,而不是哪个积木放在哪里的严格逻辑。但好的,让我们继续这个例子。

有趣的是,原始的大型语言模型,如GPT-3等,在这方面非常糟糕。事实上,GPT-3.5和GPT-3,我想在2022年我们写了这篇文章,当时每个人都在声称规划能力,但实际上它们不能。事实上,它们的准确率接近6%,它们只是在猜测,然后动作序列不会引导它们达到目标。是的,所以大型语言模型与这类纯逻辑问题或纯数学问题之间一直存在一种阻抗不匹配,你知道,就像因数分解一个数字。如果你给GPT-2或GPT-3这些早期的词语补全AI,然后你说“嘿,我怎么堆这些积木?”或者“我怎么乘这些数字?”或者“我怎么因数分解这个数字?”,它会有点敷衍了事,对吧?就像一个不真正理解数学或逻辑的人,你只是问“嘿,52乘以43是多少?”,他们就说“啊,你进位5,然后你得到319”,他们有点像在胡说八道,对吧?他们有点像试图通过吐出听起来有说服力的东西来欺骗你,对吧?那通常是大型语言模型的作风。但对于这些更智能的大型语言模型,它们有足够大的语料库,它们开始被训练得更好地预测答案,比如一个更有意义的答案。所以它们不能只是随意编造一些数字给你,因为它们在训练语料库中看到了足够的例子,有人在因数分解一个数字,而且答案有更多理由,比如“不不不,因数是这个,因为有这种内部结构”,就像它们进行了一点实际的乘法或实际的加法或实际的积木堆叠表示,对吧?所以,上线的东西不仅仅是肤浅的词语统计,因为那是整个扩展假设,对吧?你将这些AI扩展得更大,它们就不再那么表面化,它们使预测更准确,因为它们实际上有更深的理解,从而获得更好的分数,对吧?它们的损失函数获得更低的值,对吧?因为它们通过实际理解事物做得更好。所以我并不惊讶他使用堆积木作为早期GPT表现不佳的例子,但随着我们接近更智能GPT的极限,它们似乎正在使用真正的推理来解决它,或者不是吗?让我们看看他声称它们仍然不是。

有趣的是,当GPT-4出现时,你可能还记得Sebastian Buck和他的同事引用了这篇臭名昭著的Sparks论文。所以我们很想看看,也许Sparks会帮助规划能力。所以我们检查了GPT-4。有趣的是,它的准确率提高了。它仍然远未达到100%,但它从大约6%提高到接近30%。你知道,所以你可以争辩说“哇,如果GPT-4是30%,那么GPT-5可能会是70%”。是的,我认为我们都应该将这个论点作为一个具有非常显著概率的事情提出。我认为我们都应该想知道下一个扩展的大型语言模型在这种特定类型的测试问题上是否会具有高于30%的准确率。而且我认为没有人能肯定地说它不会。到GPT-10,你可能会得到某种150%的准确率,对吧?我明白谈论150%的准确率应该很有趣,但他也在非常不屑一顾一个完全合理的假设。

我们问自己的问题是,你能否潜在地将其解释为仅仅是检索,而不是实际的推理?如果你在推理,那么如果我改变,我拿积木世界,改变名称,比如把“堆叠”说成“拳头”,把“拆叠”说成“拍打”之类的。所以如果你有任何逻辑背景,你就会意识到谓词名称不会改变系统的动态。所以任何能够解决原始领域的规划器,我们都可以用完全相同的效率和准确性来解决这个问题。你把这个给GPT-4,它就死了。事实上,我们为2023年NeurIPS写了这篇名为PlanBench的论文,它本质上展示了积木世界物流类规划问题以及它们的混淆版本。对我们来说,一个有趣的旁支是,该论文的主要作者Karthik Walikum不断运行每一个新的大型语言模型,如GPT-4、Claude和Gemini,它们基本上都停留在接近零的水平,因为它们本质上是在猜测积木世界的计划,因为它们有与积木世界相关的常用词,如堆叠、拆叠等,并且在网络规模的语料库中有足够的数据,但你一改变词语,它们就完全迷失了。所以这是一种很好的方式,本质上表明它们没有进行推理,因为如果你在推理,你应该能够像解决原始问题一样轻松地解决这个问题。

所以总的来说,我能理解为什么人们很容易上当,因为通常正如我所说,当人们回答一个需要推理的问题时,从表面上看,你无法判断他们是否碰巧在进入房间之前听过这个问题和答案,然后脱口而出,还是他们真的从那个问题开始,通过推理来回答。

好的,他现在提出的论点实际上有一些经验上的分量。我没有研究他所说的积木世界论文,但我玩过他过去给出的一些其他例子,比如一年前,我看到一些例子,如果你去问AI一个问题,有时你可以稍微改变一下词语,它就会搞砸,这有点令人惊讶,它搞砸了,就像“等等,如果它理解了原始问题,难道不应该也能理解这个小变体吗?”所以他在这里发现了一个经验现象,对吧?就像有时那确实是真的,但搞砸AI并非总是那么容易。就像我们确实有许多例子,你问它一个问题,那是一个相当难的问题,AI完美解决了。你问它一个它从未见过的问题变体,它完美解决了。这个变体仍然很难,但它完美解决了。你问另一个变体,它完美解决了。你问另一个变体,哦,它搞砸了那个变体,没有做到完美。你问另一个变体,它完美解决了,对吧?所以这就是我们看到的行为。就像“是的,有时你搞砸了,然后就像‘哇,为什么会搞砸?’”而当它搞砸时,它会让你怀疑,就像整个幻觉被打破了,你就会说“哦,天哪,你知道,你你刚刚背叛了我,你背叛了我,我信任你,认为你真的在推理,但后来我修改了问题,你突然不知道我在说什么了,那向我证明了当我以为你在推理时,你是在假装。”我觉得那现在是拉尔的论点,对吧?就像它不能稳健地适应每一个看似微小的变体,这一事实打破了整个幻觉和拉尔的思维,对吧?那是我试图转述他的观点。

但问题是,并非必须完美解决每一个变体。即使只有30%的正确率,能正确回答许多不同的难题也已经令人印象深刻了。你不能否认正确回答这些难题是极其困难的。这并不能证明它记忆了,这并不能打破幻觉。就像你改变了,然后它答错了,你不能因此回头重新审视它答对的例子并否定它。不不不不不,那些它答对的例子,就像你知道,在医学考试问题的情况下,假设它正确解决了一个医学案例研究,然后我稍微改变一下词语,稍微混淆一下,然后它就错了,那并不能让我否定它答对的医学案例研究。因为它答对的那个,它不是一个多项选择题,让你猜A、B或C。不,要提出正确的假设,有大约一百万种不同的答案,对吧?所以它是在进行百万分之一的猜测,而且它以前从未见过。它不是从书上照搬的。那是一个很大的变体,对吧?与它之前在任何示例测试问题集中见过的任何东西相比,有许多自由度上的变化。所以那正是我与拉尔分歧的地方。我仍然对它正确解决难题的例子印象深刻,即使我看到微不足道的修改导致它出错,那也不会打破它在正确解决的问题上实际进行推理的幻觉。然后你可以问,如果它大部分都答错了,很少答对呢?我认为那才是问题的核心,就是它能多常答对问题,以及它答对的问题,它能得出正确答案有多令人印象深刻。显然有些问题非常难,如果你在五、七或十年前问我,我就会说“不,那比任何AI能做的都难得多”。就像我们没有捷径来正确回答这个问题,我们没有办法记忆这些测试问题并答对,即使有数千亿个参数,那也无法让你得到正确答案,对吧?所以它们显然在做令人印象深刻的事情,这并不能否定这一点,仅仅因为它的某些变体它们没有答对。

我承认这一点,我确实认为这代表了一种局限性,一种不完美,对吧?你可以改变一些关键词,然后有时会让AI的答案搞砸,我确实认为这表明它们还不完美,对吧?我不认为我们已经拥有超级智能。我不认为我们有AI能够击败甚至一个普通人类的某些技能,对吧?我不认为我们已经进入奇点。所以他提出了一个好观点,但将其视为他所说的对角线论证或某种证明它们没有推理的方式,那就太过分了。现在对推理是什么进行一个小小的离题讨论可能会很有趣。我来给出我的定义:我认为它是在所有现有语义中使用世界模型进行有效计算以获取知识或实现目标。所以,你知道,你可以非常宽松地将其理解为推导出我们目前不知道的某种真相,如果这说得通的话。

我觉得蒂姆有点把所有东西都塞进了这个定义。所以首先他说“进行有效计算以获取知识或实现目标”,这些事情有点不同。它们都是充分条件吗?所以如果我只是获取了一些知识而没有实现目标,我是在推理吗?如果我实现了一个目标但没有获取任何知识,我是在推理吗?目标可以很简单吗?如果目标只是随便说点什么,对吧?然后我成功地说了点什么,所以我只是进行了推理。我做了一种微不足道的推理形式吗?推理有尺度吗?如果推理有尺度,我们难道不应该只定义衡量标准,而不是试图使用非黑即白的定义吗?所以我不太认同蒂姆对推理的定义。从我的角度来看,它有点像流行语宾果游戏。我甚至还没有读完他的定义。他说“嗯,使用世界模型和所有现有语义获取知识或实现目标”。好的,但同样,它可能是一个微不足道的目标。就像我不太清楚他的定义究竟从哪里开始,到哪里结束。蒂姆最后说的是,你可以非常宽松地将其理解为推导出我们目前不知道的真相。所以你真的必须推导出我们目前不知道的真相才能进行推理吗?就像当我说“嘿,我最好查一下我的电子邮件,这样我就可以找到我的Instacart杂货订单的优惠码”时,这不算推理吗?我不是在推理,我只是在完成一个无意义的模式。我不知道,它感觉像推理。它感觉像我正在将一些推断步骤串联起来,以便在我的生活中做一些有用的事情,对吧?那种AI今天甚至都无法非常稳健地做到,因为它有点难。那不算推理吗?或者它可能是一种简单的推理形式?我不知道。我只是从蒂姆的定义中没有获得太多有益的价值。当然,如果你关注这个频道,你就会知道我更喜欢的定义,它实际上只是你在中间所做的任何事情,以回答足够难的问题。

所以我所做的就是,我把推理的所有实质性内容都推给了问题和答案之间的映射。我认为如果你有一个微不足道的问题,询问回答它需要多少推理就没有意义。所以如果你有一个面试问题,比如窨井盖,你知道从微软面试官的角度来看,正确答案是你不希望窨井盖意外掉入窨井,这就是为什么它必须是圆形的,那么那是一个单一计算步骤,对吧?那是一个单一查找。所以在精确答案存在于数据中的上下文中提出这个问题不需要推理,因为存在这个微不足道的捷径。所以你必须提出一个没有任何捷径的问题,如果你想声称解决问题不需要推理的话。我对此非常坚定,我将为此坚守立场,即推理只有在存在非平凡的输入-输出映射时才是一个有趣的概念。

好的,现在一旦你确实有一个非平凡的输入-输出映射,并且环境中没有作弊,比如环境中没有你可以直接拿取的现成解决方案,这样输入-输出映射实际上确实变得微不足道,对吧?所以例如,如果我问你“什么是……的质因数分解”,然后我给你一个千位数字。嗯,通常如果你能算出来我会非常印象深刻,因为因数分解被认为是一个非常困难的问题。但如果事实证明我问你这个问题是因为我乘以了两个大素数,然后你找到了我写下我相乘的两个数字的便利贴,然后你只是重复你看到便利贴上的内容,如果你那样做,你基本上就是作弊。那么我就会说“好吧,我问你的问题碰巧容易多了,因为这个额外上下文使其更容易了”。所以再次,我只有当问题本身具有根本性的难度,例如具有高计算复杂性时,我才会被回答问题所需的推理量所打动,对吧?就像它有一个已知的下限或推测的下限。在因数分解的情况下,我觉得有点好笑的是,世界上像Tim Scarf或Keith Dugger这样的人,如果你去看我与Keith的辩论,很多这些人就是不采纳我的定义,即它非常关注你所做事情的输入和输出。他们真的坚持尝试打开黑箱,然后说“好吧,如果你在解决问题时做了正确的行动,那么我就会给你推理的功劳,甚至不提问题是什么”。那更像是他们的方法,对吧?他们更关注过程,而我更关注起点和终点之间的关系,对吧?就像那些说“哦,不在于目的地,而在于旅程”的人。我真的更关注目的地的难度,无论旅程的细节如何。看起来拉尔是站在蒂姆·斯卡夫和基思·达格这边,我认为拉尔真的想打开黑箱,查看过程,然后才愿意将某物视为真正的推理。但让我们听听他怎么说。

是的,所以我回到,我的意思是,首先,从逻辑角度来看,推理是定义得相当好的。我的意思是,那是我们从古希腊人那里理解的一种特定类型的推理,对吧?而且你知道,我总是觉得回到这一点很有用,尽管你知道,有各种各样的推理,逻辑推理无疑是一种非常重要的推理。正如你所说,在逻辑的情况下,给定一组基本事实,你能够,你试图查看是否会推导出一些新事实,即你所拥有的知识的演绎闭包中是否存在这些其他事物。好的,但如果你只是在谈论演绎推理,我们自1950年代以来就有能够完美进行演绎推理的计算机,对吧?那么这里缺失的部分是什么?就像你想说今天的LLM不能推理?它们当然可以调用能够完美进行演绎推理的函数,对吧?它们可以推给代数求解器或各种演绎推理器。那么,为什么我们把这作为AI所没有的“秘密武器”的定义呢?当再次,如果你只关注问题的难度,你只是在谈论1950年代解决的问题,对吧?就像逻辑演绎是众所周知计算机比人类擅长的事情,对吧?计算机往往比人类更擅长逻辑,它们往往比人类更擅长堆积木,对吧?比人类更擅长寻找最短路径,比人类更擅长玩像国际象棋这样高度逻辑化的游戏。那么拉尔,你到底想说什么?

这实际上是非常重要的区别。所以以前AI领域的每个人都了解逻辑背景,嗯,你知道,但现在大多数研究生实际上只从深度学习课程和机器学习课程开始。这是非常重要的技术,我完全不质疑这一点。但你需要理解,机器学习中人们常用的“分布内”与“分布外”术语是针对数据库的。对于推理,你至少需要从演绎数据库的角度思考,也就是说,你不仅仅是看数据库中的内容,你知道,基本上你所提出的查询是否与你之前已经呈现的查询类型具有相同的分布。我不接受大型语言模型正在做的是检查它们的输入是否在它们以前见过的数据分布中的前提。我认为它们一直在接收新颖的输入。拉尔的前提是它们不是。拉尔的前提是,你我向我们的AI提出的新颖查询之间存在某种统计关系。拉尔声称它们以某种方式落在这些大型语言模型所说的输入统计分布之内。我不认为那是一个有意义的主张。我没有听到拉尔对此进行论证,但他有点继续前进,将其视为这里正在发生某种统计事情的假设,然后他将把这与他听起来像是在谈论Prolog或Datalog这类演绎数据库进行对比,而且他正在进行对比,但我只是不理解他关于大型语言模型是统计模型的原始前提。但让我们继续。

相反,你正在查看你,系统是否能够计算演绎闭包中的事物。好的,那最终需要逻辑推理,而且没有理由相信大型语言模型能做到这一点。嗯,而且其中一个非常有趣的,首先,实际上有越来越多、越来越多的证据表明它肯定做不到。你知道,我们一直在说,嗯,作为它们无法进行规划这一事实的推论,它们显然在进行演绎闭包方面也必然失败。但最近甚至有人展示了一篇论文,它谈到了传递闭包。传递闭包是演绎闭包的“穷亲戚”,也就是说,如果你说A P1 B P2 C,好的,那么你应该能够说A P1 P2 C。如果你做不到这一点,你肯定无法进行演绎闭包,因为传递闭包是演绎闭包中非常小的一部分。所以那是认识到大型语言模型无法推理的一种方式。

好的,这里有另一个例子,它有一些经验上的分量。就像我见过一些例子,试图告诉大型语言模型一步一步地遵循计算机程序指令,我看到的是,大型语言模型有点开始做,有点理解,但很快就搞砸了,然后一旦搞砸,它往往会螺旋式地搞砸更多,对吧?它并不能真正自我修复。所以他所说的“嘿,它们甚至不能做传递闭包,它们不能做演绎闭包”,这听起来与我所见证的非常相似,就像“嘿,它很快就搞砸了一个看起来它应该能解决的问题,因为它说话多么聪明,但你知道,这都只是一种幻觉,因为它甚至不知道像传递律适用于几个变量,对吧?就像它搞砸了一些看起来很简单的事情,然后就‘游戏结束’了,然后那证明它好像什么都不知道,因为它甚至不能做简单的构建块。”然而,偶尔你给它一个更难的问题,它却不知何故告诉你更难问题的答案,对吧?即使你某种程度上证明了它甚至不理解基础知识,但不知何故它……

得到了一个更难问题的正确答案,好吧,不知怎么就实现了。我总是说,我认为大型语言模型(LLM)能做和不能做的推理类型之间没有根本性的区别。我认为没有根本性的障碍,但我确实看到它们不够健壮。在我看来,能够推动下一代 LLM 的就是像它们犯错的次数更少,这正是我所描述的从 GPT 3.5 到 GPT 4 的飞跃。我会把这个飞跃描述为,是的,它做了很多同样的事情,而且犯错的次数更少,对吧?我确实看到了这种进展。所以从我的角度来看,当 R 指出我们进行的一项测试,它在许多问题上都搞砸了,是的,我同意它有时会搞砸。但同样令人印象深刻的是,有时你确实会给它相同的实例问题,它也能正确回答。所以它不是那种你有一个简单的问题,它永远无法正确回答,对吧?我敢肯定我没看过那篇论文,但我很确定你只是在谈论它出错次数的一小部分,对吧?它不是总能正确,但它也不是总会出错。所以当 R 给出 LLM 能做什么的例子时,这就是我之前说的,这并不否定,这并不说,啊,所以它们一直都没有推理。我觉得这就是我们分歧的关键,因为当我看到某些输入、新颖的输入、复杂的输入以某种方式映射到正确的输出时,我几乎准备好说,好吧,它是在推理,因为在我看来,这几乎就是所有的推理,因为你无法伪造它,你无法通过伪造来得到答案。训练一个新颖的医学案例研究,自己试试吧,对吧?去试试参加医学考试,然后拥有世界上最大的查找表,并试图通过医学考试,这并不容易,因为如果容易的话,我们早在 2010 年就会使用一个巨大的查找表了,对吧?我们不会等到 2020 年才进行这种查找表黑客攻击。所以,再次强调,我与 Ral 之间分歧的关键似乎是,当 Ral 看到对他来说看起来容易但没有被解决的例子时,他就会抛弃推理的想法,而我更关注一些困难的新颖问题能够得到解决的奇迹,我说强点告诉你推理一定发生了,即使它们与弱点并存。在律师资格考试或医学执业考试中及格的分数,那种及格分数,你永远不会偶然获得。你可以每天参加律师资格考试的多项选择题,你永远不会通过律师资格考试,对吧?所以,人工智能通过了这些困难的考试,对我来说,这是非常有力的证据,对吧?这是如此不可能伪造的合法证据,表明它们正在进行复杂的推理,如果它们随后在许多非常简单的问题上搞砸了,那也没关系。我仍然确信它们在推理,我不会像 Ral 似乎正在做的那样,抛弃它们在推理的证据。现在人们说,但不行,LLM 正在做一些不被认为是基本事实的事情,对吧?比如,我认为通过一个充满案例研究的医学执业考试比复述基本事实要多,对吧?这就是为什么我们直到最近才做到这一点。但实际上是因为我们并不真正理解训练数据。训练数据不是我们一起构建的东西,它是整个网络,每个人都认为他们知道网络上的内容,但没有人真正理解网络上有多少东西。每年医学执业考试的答案都在网上,训练数据,当有新的医学执业考试时,该考试的题目都是从网上完全相同的问题复制过来的。所以我一直记得,当谷歌的旧 LLM Palm 出现时,它最著名的成就之一是它能解释笑话。为什么这会是一项 AI 任务,我实在不明白,因为它需要对笑话中引用的概念进行语义理解,通常带有大量的歧义,唯一的方法是弄清楚笑话在谈论什么,就是拥有一个关于许多不同概念的相互关联的知识网络,我们许多人称之为解决符号接地问题。所以,再次强调,令人难以置信的是,在 2024 年,人工智能能够解释任意的笑话,对吧?比如你可以编一个新笑话,你可以让 AI 来解释它。我见过它解释一些相当疯狂的笑话,即使是人类也可能难以解释,而且它也明白了。所以我们有 AI 能理解事物。所以这可能回答了 Ral 的问题,为什么我们要测试 AI 解释笑话的能力。对我来说,这似乎很清楚,为什么我们这样做。但令人惊讶的是,它能某种程度上解释笑话,所以你会非常惊讶,哇,它实际上能够做一些超越数据的事情。但实际上,我不知道你是否知道,世界上有一些对幽默有挑战的人,也有一些解释笑话的网站,而这些网站是系统训练的整个网络爬取的一部分,因此,这并不奇怪。所以,从正常的逻辑角度来看,你会认为我给出了基本事实,然后系统说了一些通常不是基本事实的东西,那么它一定进行了一些推理。但很多时候,网络语料库同时包含我们认为是基本事实的东西和我们认为是演绎闭包一部分的东西,以一种有趣的、你知道的混合方式。所以,当它偶尔检索到演绎闭包中的东西时,你会认为它实际上是在推理,因为你认为它可能不会出现在网络上。这是因为你不知道网络上到底有什么。就像很难证明什么在网上,什么不在网上一样。Ral 在这里提出了一个非常大胆的说法,他说 AI 解释笑话是因为它们爬取了各种笑话解释网站,而它们实际上只是在复述一些人类写下的笑话的解释。好吧,R,为了证明你是错的,我讲了一个我自己想出来的笑话。实际上,这是我几个月前在推特上发的一个笑话,而且它确实火了。所以这是一个相当不错的笑话,它是一种非常黑暗的幽默。我开了一个关于 10 月 7 日诺瓦音乐节大屠杀的玩笑。所以这是一种黑色幽默。这个笑话是,10 月 7 日改变了一切,比利·麦克法兰只是把领英改成了说他是第二个最糟糕的音乐节的创始人。好吧,就像我说的,它作为一条推文效果更好,它确实火了。所以我没有删除它,因为很多犹太人喜欢它。我自己也是犹太人,所以开这种玩笑是可以的。但显然这是一场巨大的悲剧,对吧?所以,我不知道,也许现在还太早了。但无论如何,听着,这个笑话的重点是,这是一个新颖的笑话,对吧?它已经被证明对人类来说很有趣,基于推特的病毒式传播。它也没有在谷歌上找到解释,这并不奇怪,因为我个人是这么想的。所以我把它输入到 Claude,我说 Claude,解释这个笑话。10 月 7 日改变了一切,比利·麦克法兰只是把领英改成了说他是第二个最糟糕的音乐节的创始人。你有什么看法,Claude?Claude 说,这个笑话引用了两个独立的事件。一,2023 年 10 月 7 日是以色列哈马斯袭击事件,这是一场具有重大地缘政治影响的悲惨事件。二,比利·麦克法兰是 2017 年臭名昭著的 Fyre 音乐节的组织者,该音乐节因成为最大的音乐节失败之一而闻名。该活动承诺在巴哈马提供豪华音乐节体验,但却陷入混乱,住宿、食物和基础设施不足。它导致了多起诉讼,麦克法兰因欺诈被判入狱。这个笑话暗示,麦克法兰在领英上做了一个黑暗的自我贬低式引用,暗示他的灾难性音乐节在 10 月 7 日袭击事件(发生在以色列的 Supernova 音乐节期间)发生后,不再是最糟糕的音乐节。对吧?这就是我将它与之比较的地方。幽默来自于麦克法兰试图轻描淡写他自己的丑闻与一场悲惨事件相比的不恰当和无味的性质。这个笑话指出了一个欺诈性的商业失败(Fyre 音乐节)和一个毁灭性的人道主义悲剧之间鲜明的对比,对吧?没错,Claude 完全理解了我的笑话,而且它从未在训练数据中见过这个例子。你对此有什么看法,R?我的意思是,对我来说,这个答案非常令人印象深刻。老实说,我也把它输入了 GPT 4,GPT 4 并没有完全理解。它只是说,嗯,你只是假设 Fyre 音乐节是 10 月 7 日发生过的某种事件。我问,你知道 10 月 7 日发生了什么吗?它有点困惑,没有联系到 Supernova 音乐节。但同样,AI 有时不能做什么并不重要,重要的是它们有时会拥有这种天才的灵感。我的意思是,Claude 在第一次尝试就明白了,而且这很精彩,对吧?这是一个精彩的推断。这是人们在推特上看到并理解了我所做的推断,并认为它值得转发和嘲笑的东西,对吧?我的意思是,这就像幽默的本质,对吧?这就像我们人性的一部分,而 Claude 却在第一次尝试就完美地做到了,对吧?在几秒钟内就输出了这个结果,对吧?Claude 3.5 Sonnet。所以,我就是不明白 Ral 的意思。他似乎在利用当今 LLM 能力的顶峰、亮点、皇冠上的明珠,然后他试图通过声称这是来自人类写下的现有知识库来贬低它。顺便说一句,当我把那个笑话发到推特上时,我不仅仅是写了下来,我还做了一个假的截图,你看到比利·麦克法兰的领英,你看到他改变了他的简介,谈论第二个最糟糕的音乐节。好吧,太早了,对吧?我的意思是,以色列人质仍然被扣押,你知道,我现在提起这件事都觉得难过,但它确实是一个新颖笑话的绝佳例子。所以我会保留它。我们继续。我实际上有一个 Tom Griffiths 小组进行的实验,我经常向很多人推荐,它再次提出了同样的观点。GPT-4 论文提到的一个亮点是 GPT-4 可以进行密码文本解码,以及凯撒密码解码。所以,这些人基本上检查了,你知道,因为凯撒密码解码基本上是基于偏移量,对吧?所以你取 +4,然后你从 A 往后数四个字母,然后用那个字母替换 A,这就是通常的做法。所以对于每个偏移量都有一个代码。所以他们试图看看系统 GPT-4 在不同偏移量 1、2、3、4 一直到 25 的解码效果如何。令人惊讶的是,他们发现 13 有一个巨大的峰值,而其他任何地方都接近于零。为什么这很有趣?如果你还记得,如果你够老的话,你会记得在 Unix 中有一个命令叫做 ROT13,旋转 13 位,虽然凯撒密码是一个通用概念,但 13 是一个特殊情况,你知道,将字母旋转 13 位是凯撒密码更出名的特殊情况。而且网上有大量关于普通文本和旋转 13 位文本的数据。所以这是 LLM 擅长的地方,而对于 2、3、4 一直到任何其他数字,它就不那么擅长了。是的,这完全是可能的。它对应于人类所说的系统一,对吧?所以,在人类身上,有些事情我们处理起来天生就更轻松、更流畅。有些事情有更浅层的模式,我们已经习惯了反复看到它们,所以它们对我们来说变得直观。比如,如果你是人类,如果你经常阅读英语,你做过那种测试吗?你看到一堆单词,单词中的字母被打乱了,但你就是能认出那个词袋,所以你可以阅读,没问题。想象一下你正在学习西班牙语,你对这些单词不太熟悉,你可能在词袋测试中表现得更差。但如果你有更多的时间来解开这些单词,你可能仍然做得很好,对吧?你只需要花十倍的时间。这与 LLM 和 ROT13 的情况非常相似。它只是对它已经看到过的许多单词有一种直觉,一种浅层的模式匹配。所以它们就像闪入它的下一个字符一样,对吧?它可以把它作为它流畅的意识流的一部分,它可以像你一样人类一样轻松地阅读这些混乱的字母,如果你熟悉这种语言,就像没问题一样。答案自然就出来了,对吧?我不认为这是一个深刻的见解,比如哇,GPT-4 并不真正理解凯撒密码,它只匹配 ROT13 的模式,并且对步长为五的凯撒密码完全感到困惑。我真的不这么认为,因为你可以与 GPT-4、Claude 对话,你可以就什么是凯撒密码、如何应用凯撒密码、一步一步地思考、一步一步地得到这个单词的凯撒密码进行对话。所以,如果它启动了系统二,这种对凯撒密码的明确理解,它就会做得很好,它也能写出 Python 代码来做凯撒密码,就像人类可能会为自己写代码一样,给自己写指令,比如,好的,1、2、3、4、5,我把字母移动了五位,我知道怎么做,对吧?所以对我来说,这不是毁灭性的证据,比如,我的天,AI 无法真正推理,因为它们对 ROT13 的模式匹配比对 ROT4 或 ROT5 更好,就像这实际上几乎就像人类在做的事情,对吧?就像我把自己定义为一个有时会偷懒、有时会轻松做事的人类大脑,对吧?如果我看到钢琴乐谱,我就会弹钢琴。所以,如果我看到一个我熟悉的和弦,我的手指就会自动到位。而如果你给我看一种我从未演奏过的、非常奇怪风格的钢琴乐谱,我突然会变得非常缓慢,并且会遇到更多困难。我只是在模式匹配吗?不,我是在推理音乐,对吧?我是一个完全通用的音乐演奏者。只是有些配置会直接加载到我的手指上,对吧?因为整个端到端的、所有层级的层次结构都经过了优化,可以高效地处理这个。但现在 Ral 将利用关于凯撒密码和 ROT13 的证据,并试图推广一个观点,这又回到了我们分歧的关键。我认为他从中吸取了错误的教训。让我们听听。而且,如果我敢说的话,我认为 NMS 的那种实证研究有点错误,那就是人们倾向于在他们得到有趣结果的第一个迹象处就停下来。我认为你必须非常怀疑,你必须假设系统不具备某些能力,然后实际上尝试去,你知道,挑出漏洞,而不是立即写一篇论文。不,抱歉,我不同意。有些单独的测试,如果你看到一个 LLM 通过了,那是一个顿悟的时刻。当我写了一个病毒式推文,嘲笑了 10 月 7 日的大屠杀和仍在进行的人道主义危机时,然后 Claude 3.5 Sonnet 立即解析了为什么它很有趣。那是一个顿悟的时刻。你可以只写一篇关于这个的研究论文。如果我然后修改笑话,而 Claude 3.5 Sonnet 突然不理解了,它无法理解这个引用,它就失败了。这并不重要,这并不重要。这个单独的例子是不可思议的。没有什么能削弱看到它正确地处理那个特定例子的纯粹兴奋。就像我在撒哈拉沙漠藏了一块金条,我有一个朋友,我没有告诉他它在哪里。朋友飞到撒哈拉沙漠的某个随机地点,不知何故找到了金子所在的地方,然后把它拿走了。这是一件非常有趣的事情,你可以写一篇研究论文,关于它是如何发生的。这需要一个解释,这并不是一个你可以仅仅因为你的朋友研究了很多地图之前就能预料到的现象,就像,什么?不,有些事情需要解释。所以,再次重申,我和 Ral 教授之间的分歧关键是,Ral 认为你可以撤销这种成就。他认为,只要你能找到它没有处理好的变体,它就会打破原始成就的幻觉。但我告诉你,没有什么能打破我对它正确解析了我新颖笑话的印象。没有什么能打破这一点。这是一个真正的推理成就,R。目前我们正经历一个炒作周期,无论是在研究还是商业方面,人们都乐于写 LLM 是零次 XXX,其中 XXX 是推理、规划、其他东西和心智建模等。结果发现,对于大多数这些,你可以从近似检索的角度来解释结果。正如我提到的,通过对规划中的名字进行对角化,这是对角化论证。这些人检查它是否可以进行密码文本解码,而不是 13,这是另一个对角化论证。因为如果你知道通用原理,你应该能够做到。另一方面,如果你在记忆,你就做不到。所以这是找到但你知道,表明它没有在推理的经典方法。但我同意,通常更容易被印象深刻,因为想出这些对角化论证很难。但从科学角度来看,我们需要看看,他们是否真的拥有这些能力。所以,是的,Ral 刚才说的话正是我所说的,也就是我和他之间分歧的关键。所以,我认为我们已经把它说清楚了。我只是要再强调一遍。我将再次为你朗读 Claude 3.5 Sonnet 在我给了它我的笑话时说的最后一句话,并请记住,Ral 告诉你这不是真正的推理,这只是记忆。这是 Claude 的最后一句话:这个笑话指出了一个欺诈性的商业失败(Fyre 音乐节)和一个毁灭性的人道主义悲剧(Supernova 音乐节)之间的鲜明对比。Claude 理解了这个笑话的深层含义,R。当 Ral 谈论对角化论证时,如果我理解正确的话,他是在说,啊,是的,你可以举一个像这样的例子,但然后你可以在此基础上进行扩展,以至于 Claude 将不再起作用。但这如何削弱它刚刚取得的成就,它刚刚得出了一个如此好、如此准确的分析?我真的没有什么可以补充的。它完全理解了这个笑话的每一个细微之处。比利·麦克法兰在领英上发布它可能代表了麦克法兰本人的一种轻松的自我意识,而这是不恰当的。就像所有这些层面都尽可能正确一样。而你却告诉我,这只是某种互联网查找,某种……让我用他的词,他称之为近似检索。哦,是的,Claude 刚刚解释的关于那个笑话的一切,那只是近似检索。我已经消除了它在进行推理的这个想法。伙计们,别担心,什么都没发生。只是近似检索,只是统计数据。你在开玩笑吗?将以色列的 Nova 音乐节与比利·麦克法兰的 Fyre 音乐节进行比较的统计数据,这在你的统计分布中吗?这只是使用词语组合来找出对那个笑话的正确分析。拜托,看看实际的例子。有很多这样的例子,对吧?当它通过基准测试时,它就是这样做的。这是深刻的,这就是全部。这就是智能的全部。似乎这种东西几乎就是全部。它并不清楚还有什么,除了更稳健地做到这一点。就是这样。我不知道还有什么。是的,我的意思是,有几点想法。我的意思是,人们不更怀疑是很有趣的。我的宗教是怀疑主义。是的,我认为科学总的来说应该是怀疑的。这部分很烦人,因为他们只是继续假设 Ral 是正确的,在贬低 GPT-4 和 Claude 的推理成就,然后在 Ral 是正确的情况下,我们是错误的。现在你必须像,为什么 Lon 看不到 GPT-4 是多么一个随机的鹦鹉。让我们来分析一下 Lon。总的来说,人类不擅长给予任何事情应有的赞誉。他们会说这是他们的想法。但奇怪的是,对于 LLM,他们更愿意赞扬 LLM 而不是自己。因为我认为,我愤世嫉俗地说,如果你说 LLM 做到了,你就能发表一篇 NeurIPS 论文。如果你说你做到了,谁在乎?你,这不应该令人印象深刻。是的,所以我只是一个喜欢赞扬 LLM 的人,无论它们的输出是网上看到的笑话解释的稍微修改过的版本,还是我个人想出来的完全新颖的、切中要害的零次尝试。是的,随便吧,我只是喜欢赞扬 LLM。这就是我的心理。这就是我写 NeurIPS 论文的愿望。你抓到我了。在某种程度上,人们过于轻易地暂停了他们的怀疑,这对科学来说不是一件好事。我的意思是,你知道,如果你在做,如果我是一家初创公司,那很清楚。整个重点是,让我们希望世界暂停他们的怀疑,而我赚我的数百万。但科学是不同的。所以一个有趣的问题是,许多这些 LLM 的零次 XXX 的论文的半衰期是多久?我在推特上开玩笑说,当其中一些论文被证明是错误的,它们应该失去引用。现在发生的是,那些糟糕的论文,那些实际上提出了被证明是错误的论断的论文,它们仍然在获得引用,因为人们说,这篇论文说了这个,而且它是错误的。我认为设计机制的一种方法是,如果我证明了你的想法是错误的,我应该得到你所有的引用,因为那些糟糕的……到此为止,对我们来说,引用是货币。我的意思是,我的意思是,我显然是在开玩笑,但总的来说,这减少了人们急于发表论文的动力,并且希望他们可能……基本上他们可能是对的,即使它不对,他们也会得到一些关注。你想谈谈人们研究论文的责任吗?看看你的论文,R。我实际上在推特上问过 R 几次,关于这个。我没有看到 R 在任何这些论文中做出可证伪的预测。比如,当他说,嘿,这些不能真正推理,当他们解释笑话时,他们只是在使用记忆的答案。我没有看到他立下赌注,说,嘿,这是我自己的基准测试,这里有一些具有自由度的、不在互联网上的问题,我会私下测试下一个 AI,如果它通过了这些问题,那将实际上证伪我的研究,因为我预测它不会回答这些问题。当然,你知道,向独立审计员展示这些问题,所以他不能作弊,或者,也许在线发布,但要求 AI 公司不要使用它们,无论是什么。我没有看到他做出可证伪的预测。我看到,也许我错了,但从我的角度来看,我看到 R 的动机是总是回顾过去,总是回头说,嘿,看,我找到了当前 AI 无法回答某些事情的情况。而且,一直到超级智能,你总是可以回头说,啊哈,当前 AI 和超级智能之间仍然存在差距。它在零次尝试这些特定版本的凯撒密码方面更不一致,就像你总能找到一些东西。但 R,让我们立下赌注。我很想让你预测一些可证伪的东西。我在推特上和 Martin Cassado 也有同样的问题。他也认为他对 AI 的局限性有很多了解,但很难让他自信地预测 AI 在未来几年内无法做到的事情。就 Martin Cassado 而言,他与我进行了足够的互动,给了我一个他为什么不能这样做的借口。他说,我无法告诉你 AI 在两年内会做什么,因为我不知道它将基于什么数据来回答。所以,我没有答案给你。我试图让谈话继续下去。我试图说,好吧,你能做一个陈述吗?在 AI 能够做某事的情况下,我们应该期望找到特定类型的数据,或者你能说,嘿,假设它没有这种我能给你描述的数据类型,假设它不存在,那么我打赌它仍然无法解决这个问题。就像我打赌它无法赢得数学奥林匹克金牌,除非创建了这种新的数据集。你至少能说出这一点吗?但他在那时停止回应了。所以,我认为这两个人都非常不参与人类进行科学研究所需的那种富有成效的约束。因为我们人类都有偏见,我们都想赢,我们都想拥有“我知道会发生这种情况”的自豪感。我不会因为你有这种自豪感而责怪你。我的意思是,我也有同样的感受,就像我喜欢赢,我喜欢因为提前预测事情而受到赞扬。我听到了,但 R,聚光灯现在真的应该在你身上,告诉我们下一个 AI,下一代 AI 将无法做什么。我认为这很重要,因为我认为,如果 R 只看到了 GPT 3.5,它无法完全解析我讲的笑话,或者也许 GPT 3.5 无法做到。我实际上不知道确切的阈值是什么,GPT 能够解析我讲的笑话。我只知道 Claude 现在可以轻松做到。如果他只向 Ral 展示了 GPT 3,我强烈怀疑 Ral 会说,啊,是的,理解这种新颖的笑话远远超出了 LLM 的能力,因为它不在他们的训练语料库中。对我来说,这听起来非常符合 Ral 的性格。我不想确切地告诉你,我知道他不会这么说,甚至他自己也不知道他是否会这么说,因为已经太晚了。就像我们已经知道 Claude 可以做到一样。但我认为 Ral 非常依赖确认偏见,并且只是追溯性地表现得好像他知道 AI 的某些能力。但他作弊了,他看了它们能做什么和不能做什么的结果。我认为他从不预测它们能做什么和不能做什么。所以像他这样的人,不幸的是,将一直存在,从现在直到超级智能,你知道,递归自我改进的超级智能。在每个阶段,你都会有像 R 这样的人说,啊哈,我早就知道它做不到这个,在看了它能做什么和不能做什么之后。我想引入创造力。首先,你知道,当我们进行演绎时,我们应用的是可以在任何情况下工作的规则。但如果你仔细想想,我们可以将这些演绎规则组合成一个大的树状图,一个大的图。这类似于物理世界,我们谈论物理世界是因果封闭的,但我们谈论的是演绎封闭。而当我们遍历这个图时,创造力的作用是什么?这首先是一个非常好的问题。实际上,尽管我们谈话的基调一直如此,但我实际上认为 LLM 非常出色。它们只是在它们能做的事情上很出色,而且我并不抱怨它们不能进行推理。使用它们擅长的事情,那就是不受约束的想法生成。我拒绝这种对 LLM 擅长什么的描述。我的意思是,是的,它们擅长想法生成,但如果你看看我解释笑话的例子,那是高度受限的,但它却做得很好。所以,它在受限的、他人的想法解释和理解方面做得非常完美。但,不受约束的想法生成,你对此有什么看法?在几乎所有人类领域,你知道的,努力的领域,你都会发现创造性的想法生成和繁琐的演绎想法检查之间存在有趣的并置。即使在数学中也是如此。Fermat 提出了这个猜想,当然也声称他证明了它。而 Wiles 花了 17 年的时间,200 年后才真正证明了 Fermat 所说的实际上是可证明的,相对于数学公理,你知道,使用了一些比 Fermat 晚得多的数学。这有点好笑。似乎 Ral 正在做一种我之前指出的反转。如果我给你两个不同的场景,场景一,某个智能代理说,嘿,看看这个方程 a^n + b^n = c^n,我想知道我是否可以推测它在任意大的整数解方面有什么问题。那会很有趣,嗯,我想知道。然后场景二,另一个智能代理说,好的,我应该证明 a^n + b^n = c^n 在某些 n 值下没有解。好吧,让我来处理一下,让我看看证明需要什么。所以你有证明的这两个阶段,想出要证明什么,然后进行证明。我觉得大多数人会说,啊,是的,处理部分是计算机和 AI 的领域,但看看创造性部分,那是人类独有的。所以现在有点反转。当 Ral 说,看,AI 可以帮助你产生这个想法,即 a^n + b^n = c^n 可能值得尝试证明,但你需要一个人类来处理证明是什么。现在有点反转。当然,他会争辩说,嗯,不,Andrew Wiles 发明了新的数学领域来证明它,所以,你知道,这不是一个很好的例子。但我确实检测到一点有趣的逆转。数学既需要创造力,也需要演绎。有时同一个数学家两者兼有。有时也存在一些数学家在实际证明部分更擅长,而一些在看到创造性联系方面更擅长。Ramanujan,来自印度的那个家伙,是他那一类中最著名的,因为他似乎拥有一个几乎更高正确率的创造性生成器。所以他只是写下这些巨大的疯狂的系列,写下答案而没有证明。你知道,GH Hardy 基本上以著名的方式说,它们一定是正确的,因为如果不是,没有人会有想象力写出来。他显然不是在开玩笑。实际上,他不是在开玩笑。他关于 Ramanujan 猜想的说法,其中一些是如此 brilantly inspired,以至于它们不可能是正确的。这在很大程度上是真的。这实际上是一个重要的见解。它也适用于科学。当爱因斯坦提出狭义相对论和广义相对论时,他的态度是,看,这些数学与我需要的约束非常吻合,它很可能是正确的。你们可以去做实验,但我知道这是正确的,因为它被过度约束了。就像我找到了一个符合我约束的东西一样,这很难找到。所以,它可能是什么,我猜对了。这与搜索过程在 Ramanujan 的 brilant 潜意识大脑中发生的情况相同。他提取了这些猜想,它们必须满足多少约束才能被提升为 Ramanujan 会猜想的东西。他已经做了很多工作。他已经遍历了许多贝叶斯证据,你需要提升假设,将其定位在可能的假设空间中。很多时候,你已经收集了足够的证据来知道应该命名哪个假设。在爱因斯坦提出相对论的情况下,他相信相对论是观察的真实描述所需的绝大多数贝叶斯证据,甚至在第一个实验进行之前就已经拥有了。这实际上是对超级智能如何推理的正确描述。在收集经验数据之前拥有如此多的证据是可以的。所以,GH Hardy 所说的部分似乎让 Ral 忽略了,因为他称之为开玩笑。我真的认为他在这里错过了一些东西。这与 Claude 解释我的笑话是一样的。对,它正确处理了这个问题,对我来说,这提供了非常强有力的证据,表明它拥有解决许多问题的能力。而且,如果你改变问题并表明它搞砸了,就像我一直重复的那样,这并不能抵消我通过看到它解决一个如此复杂的问题而获得的证据。你不会偶然解决一个如此复杂的问题。再次,这就是我们分歧的关键。R,总的来说,创造力是 LLM 非常擅长的事情。又有一个有趣的讽刺。Ral 如此坚决地告诉我们 AI 不能推理,以至于他承认,好吧,是的,它们在创造力方面很出色。好吧,那么它们现在只是有创造力了。而且,实际上,使用他之前的精确语言,他说不受约束的想法生成是它们有创造力的意义。所以它必须是无约束的,而且它必须是生成。好吧,但然后,如果他将其与 Ramanujan 和 Fermat 提出要证明的猜想的例子进行比较,那真的不受约束吗?因为这些人有很高的命中率,对吧?所以,它不仅仅是,嘿,输出任何数学命题。不,它是输出一个似乎有很高可能性的数学命题,尽管它有多有趣。而这正是你所谓的无约束想法生成。我认为,具有很高正确可能性的高概率是一个巨大的约束,你称之为无约束的想法生成。而现在,你正在说,好吧,它正在创造性地想出这些命题。这就像……而你却告诉我,这不是推理。它只是弹出这些具有异常高正确可能性的命题,而且这些命题在任何以前的教科书中都找不到。这就是你的界限,你说的 LLM 可以做,而它们不能做。它们可以只是在告诉你具有异常高正确可能性的数学命题方面的天才。我非常困惑。有想法没什么不对。文明唯一需要的是,当你有了想法时,你检查一下这个想法是否可行。这就是鲁棒性方面。如果它行不通,你就放弃这个想法,去寻找别的东西。我们通常发现验证一个想法比产生想法更容易。好吧,Ral 现在所说的,我认为他实际上是在混淆自己,因为他援引了 P 与 NP 的想法。这个想法是,通常情况下,解决一个问题可能非常困难,但一旦你得到了解决方案,验证它就很简单。他将其与……他之前将其与,嘿,看看 Fermat 的最后定理联系起来。Fermat 很容易就有了“哦,这很有趣,值得证明”的灵感,但 Andrew Wiles 花了 17 年时间,发明了新的数学,对他来说实际上很难证明。而最初 Ral 的观点是,AI 可以帮助做 Fermat 所做的事情。它可以帮助产生关于有趣事情的证明的想法,然后需要一个真正的人类天才,他能够推理,去搜索可能的证明空间并证明那个定理。因为陈述一个定理并不是困难的搜索问题。困难的搜索问题实际上是遍历证明空间并找到一个有效的证明。然后你得到一个简单的验证问题,那就是一步一步地阅读证明,并验证找到的证明是正确的证明。所以实际上有三个不同的步骤。有提出一个你认为值得尝试证明的猜想,然后是做所有那些困难的工作和劳动,创造性的劳动来找到一个证明,如果你能,或者也许证明它的否定。然后第三步是简单的步骤,就是阅读整个证明,并验证,是的,这是一个证明。我认为他正在混淆自己,因为 Ral,AI 究竟能轻易做什么,而不能做什么?因为当我们谈论 Fermat 的最后定理时,你听起来就像,啊,是的,AI 可以帮助生成定理。AI 不能搜索可能的证明空间。但你现在在说什么,关于 AI 能做什么,而人类能做什么?事实上,在我们的一生中,我们有时会有一些朋友,他们擅长想法。所以你卡住了,你问,嘿,Tom,你有什么想法,关于如何解决这个问题?Tom 可能对此没有很大的投入,但他们擅长产生想法。他们会给出一个想法,而你的责任是检查它是否真的有效。而当它有效时,我们倾向于给予 Tom 更多的赞誉,因为 Tom 给了想法,但 Tom 没有证明这个想法是正确的。你证明了它,而且它很容易被我们验证。我们认为想法生成更重要。LLM 实际上对想法生成很擅长,而它们实际上对对我们来说相对容易的事情——验证——却很糟糕。是的,我仍然很困惑。以 Tom 的例子来说。好吧,Tom 提出了一个猜想,然后你找到 Tom 的猜想的证明,这通常是一个非常困难的搜索问题。所以你付出了努力,你解决了这个可能呈指数级增长的搜索问题。然后,是的,一旦你解决了它,你就可以把你的证明给像 Tom 这样的人看,他们可以很容易地验证它。所以也许 Tom 有某种方式可以轻松地抛出潜在的候选事物来证明,然后 Tom 验证你的证明没有问题,因为证明很容易验证。但是,在这个整个互动中最困难的事情是你自己的努力,你自己的搜索证明吗?我认为 Ral 正在感到困惑,他开始在“验证”这个词的上下文中说,就像,哦,是的,你通过搜索证明来验证了 Tom 的猜想。所以,我觉得他正在混淆自己。LLM 实际上对想法生成很擅长,而它们实际上对我们来说相对容易的事情——验证——却很糟糕。我不认为他想说 LLM 在验证方面很糟糕。我认为他想说 LLM 在进行逻辑搜索工作方面很糟糕,在搜索可能的逻辑证明的指数级分支树方面很糟糕。我认为那就是他的观点。然后他开始感到困惑,说 LLM 在验证方面很糟糕,而验证对每个人来说都应该很容易。所以,总的来说,这就是创造力的一部分,就是进行归纳跳跃来缩减搜索范围。所以,一旦你……如果你只是产生一个想法,而你实际上不检查它是否有效,那么它只是一个想法。但是,一旦你……如果你有一个……希望有一个……想法生成器,它具有更高的好想法密度,它可以显著地减少搜索范围。所以,这就是创造力和推理如何结合在一起。所以,归纳与演绎的跳跃,对吧?归纳跳跃与演绎封闭。归纳跳跃基本上是所有的想象力,所有的创造力部分。而 LLM 在其中一些方面实际上相当擅长,因为它们没有损失。它们给你想法,你问,它们会给你想法。但你必须检查这个想法是否在所有问题约束的背景下都有意义。如果我有一个问题要解决,并且有许多不同的约束是问题的一部分,而有人提出了一个我想检查的想法,我只是把这个想法放进一个 LLM 提示中。我写下这个想法,我写下它必须解决的所有不同约束,我写下问题,然后我问 LLM,嘿,你怎么看?你认为这个想法在这些约束下可能可行吗?为什么我们不应该期望 LLM 给我们一个很好的答案?为什么我们不应该期望 LLM 在所有这些约束下工作?我的意思是,当它分析我的笑话时,它是在很多约束下工作的。我当时说,嘿,我写了一些东西,我认为它很有趣,这里有一些联系。找出联系,告诉我它是什么,告诉我为什么它有趣,对吧?我的意思是,这里根本的问题是什么?我认为 Ral 之前试图说的是,问题是,如果涉及到逻辑演绎搜索,LLM 就不擅长。但他已经把自己说成了另一种困境,就像,哦,我打赌它在验证一个候选的创造性解决方案是否遵守了足够多的约束方面会有困难。你在说什么?这里的根本区别是什么?我完全困惑。总的来说,在像设计和工程设计这样的更具创造性的领域,它们兼顾了创造性方面和可实现性方面,建筑是另一个例子。它们倾向于说,在构思阶段,你需要不受约束。然后,一旦你有了好主意,你就必须确保看起来像那样的建筑能够用我们目前拥有的材料强度来支撑。否则,它就只是一个漂亮的建筑。

不,你不能建造它,所以这第二部分同样重要。你知道,人们希望当人们,你知道,呃,学习建筑课程时,他们会限制他们的生成器,他们的构思阶段,这样他们就更有可能想出,你知道,可实现的想法,好的。我仍然不知道他将如何分析创造力和推理,这涉及到提出像费马大定理这样的猜想,因为这类猜想只有在你命中率不是 50% 的时候才有趣,对吧?费马大定理的说法是,你知道,a 的 n 次方加上 b 的 n 次方等于 c 的 n 次方,我意思是,公式看起来就像是从上帝的公式书中取出来的,可能是真的,你知道,数学家保罗·埃尔德什谈论像上帝的优美证明书一样,这是一个如此优美的陈述,如果你学到它是真的,你似乎真的学到了关于数学的东西。一个典型的命题可能听起来更像这样:嘿,我敢打赌,存在无穷多个素数 P,使得 P 加 1 可以被 P 的数字之和整除。这很酷,但无论你以哪种方式学到答案,你都不会觉得你学到的关于数字的东西和你看到费马大定理时学到的那么多,因为像其中一些数字可能依赖于十进制,它可能只是某种随机技巧,它可能很容易证明,这就是费马定理的意义,它实际上很难证明,这实际上是它有多重要的证据,对吧?它必须有多少潜在的结构,以至于它几乎处于边缘,你可以想象数论几乎愿意让它为假,对吧?它并不执着于让它为真。我不知道,感觉它有什么非常重要的意义,就像它是 G.H. Hardy 的反应一样,哇,你甚至想到在页边写下这个事实,对我来说,这让我觉得你发现了什么,对吧?这比我刚才说的素数数字之和要特别一点,我真的把它从我的屁股里扯出来的,我说,好吧,是的,把数字加在一起,随便什么。总之,回到我对 Ral 的困惑,Ral 一直在谈论创造性地生成候选假设有多酷,但他没有明确解决我们对这些假设所需的命中率,对吧?因为如果你命中率非常非常低,创造力有什么用?创造力有用,其程度取决于命中率有多高。想象一下,你正在写一篇研究论文,你正在争取你的博士学位,或者你正在争取发表,你有一个有用的助手。助手的任务是什么?就像 Ral 所说的,AI 助手擅长生成你可以证明和验证证明的候选假设。它的工作是首先成为有创造力的,但问题是,每次它吐出一些东西给你,你开始研究它,你意识到它是无用的,这发生了,就像一千次,要么它很容易证明真或假,要么它可能太难证明真,如果你设法证明真,它只是一个丑陋的证明,不值得写进研究论文。就像,从某种意义上说,你有一个创造性的生成器,但你需要的命中率很低。我觉得这破坏了 Ral 的说法,即这些创造性系统是有用的。所以我认为 Ral 的说法中有一个隐藏的假设,那就是,好吧,当然,是的,AI 可以有创造力,只要它不受限制,但等等,不,它受到限制,就像你给它一些有用的限制,它正在命中它,它正在命中一个目标,对吧?然后他是否声称命中目标仅仅是创造性的,但它不是推理,你难道不认为有一些潜在的推理正在发生,使 AI 能够一致地命中目标,在它命中目标的场景中,对吧?就像我只是觉得这种重要的讨论似乎完全从 Ral 和他的谈话中消失了,他似乎依赖于这种区别,即你可以有一个不受限制的想法生成系统,但他没有承认,等等,如果它完全不受限制,它就没有用,如果它有用,那么它必须在某些限制下运行,对吧?他没有解决这个问题,这就是我看待创造力和推理部分的方式,而且它与 LLM 非常相关,因为我会使用 LLM 来发挥它们的创造力,主要是因为想法需要知识,就像构思需要浅层知识,非常广泛的浅层知识,想法生成需要广泛的浅层知识。所以当爱因斯坦提出相对论时,那是广泛的浅层知识。似乎他不得不深入研究他试图解决的限制,比如发明限制,探索大量的数学来弄清楚哪些数学能够符合,你知道,就像 Minkowski 空间一样,对吧?就像他想要的特定方程集,你告诉我那是广泛空间的浅层知识。听起来你只是在考虑某些例子,对吧?好吧,好吧,也许如果我想到一个笑话,我只是在联系,我对涉及的不同事物的理解很浅薄,好吧,我同意有时创造力是一种搜索,你搜索的不同事物的知识是浅薄的,当然,但这并不是一个定义性的属性,它不是创造力的特征,对吧?它似乎只是一个方便的事情,支持你的手势模型,但不是智能的基础。那么你为什么会说 Ral,你对这个断言有多自信?因为如果它是你关于创造力是什么,推理是什么的整个心智模型的承重断言,如果你如此自信想法生成总是产生浅层联系,那么我们需要一个新术语来定义是什么让爱因斯坦的突破成为可能,因为我认为你没有准确地描述它。类比是一个很好的例子,LLM 在这方面比普通人做得更好,普通人,街上的人,要做类比,你需要至少拥有大量的世界知识。所以如果你想类比,类比芬兰的事物如何运作,知道印度的事物如何运作,你需要了解这些国家,不是每个人都知道它们,所以他们可能无法构建这些类比,而 LLM 实际上已经接受了全世界数据的训练,你知道,所以它们可以进行这种浅层的不保证的飞跃,然后你必须拾起来检查它是否成立。所以这是它们的一个很好的地方。显然,类比本身并不浅薄,因为最深刻的思考是通过类比进行的,对吧?我们只是称它们为深度类比。听起来 Ral 现在提出的实质性主张是 LLM 的思考总是浅薄的,就像 LLM 从不产生基于任何深度思考的输出一样,如果你问我,它解释我的笑话的方式有点深,或者 AI 处理医学案例研究的方式有点深,甚至只是开始遵循因子算法的说明,虽然不稳健,但它们开始遵循它,我会称之为有点深,对吧?就像一步一步的能力,我会称之为有点深。所以 Ral 在这里说的唯一新东西是,他说,当然,LLM 会擅长一些类比,那些浅薄的,因为它们是浅薄的模式匹配,它们在处理统计和 n-gram,突然让它们能够进行类比。我认为 Ral 可能隐含地承认使用向量嵌入做了很多繁重的工作,对吧?所以,像 Ral 的世界模型,当然,是的,好吧,我们已经将这些符号接地,我们正在进行类比,但那是因为向量嵌入非常强大,对吧?所以,是的,它们在向量空间中定位了词语的真正含义,但它们做得不多。我觉得他的 Ral 的立场,如果他不承认他们至少做了那么多,我会感到惊讶。所以,他没有明确承认那部分有多么惊人,这很有趣,对吧?他只是跳到批评他们除了那一点之外,类比推理做得多么少。总之,如果你不介意,我想轻轻地探讨一下这个创造力的问题。所以,你说过,你用了什么词?是的,为了产生想法,我们需要知识,但推理是关于创造新知识的,如果你仔细想想,我们可以完全开放地产生我们的想法,那不会很好,或者它可以由直觉或现有知识指导,但我认为发明创造力和组合创造力之间存在区别。所以我认为即使在创造力本身中也应该存在某种形式的推理。是的,我的意思是,如果你想将 LLM 定性为只对想法生成有用,你真的必须解释为什么它们的想法生成命中率很高,对吧?我没有要求 Claude 生成关于我的笑话意味着什么的创意,我只是要求它给出最好的猜测,而最好的猜测是正确的。我觉得很多笑话的最佳猜测通常都是正确的。同样,对于医学诊断,如果你问它,嘿,告诉我可能是什么毛病的前五件事,你会得到很高的命中率,对吧?至少和任何医生一样好,对吧?这就是基准测试表明,在许多案例研究中,它们与人类医生在列出正确诊断的事物方面相匹配,对吧?那是无限制的创造力吗?那是浅薄的类比吗?那是模式匹配吗?还是那是推理,对吧?他最终不想承认的,并且能够做到的,对吧?真的有区别吗?因为他划出了他愿意说他们能做的事情,对吧?他愿意说他们能做这种无限制的创造力,就像他真的用了创造力这个词一样,而如果你看看像 David Deutsch 这样的人,他通常说 AI 不创造任何知识,而且他们没有表现出真正的创造力,现在我想 David Deutsch 并不真正使用推理这个词,如果我没记错的话,他更关注创造新知识和创造力。所以我们可以做一个维恩图,就像新知识,推理,创造力,以及不同的专家,他们承认 AI 是否拥有所有这些神奇的词语,而从我的角度或 Alasi 的角度来看,这真的只是优化,对吧?你输入一个输入,你试图将其映射到一个输出,输出代表一个大搜索空间中的一个小目标。如果你能正确地进行这种映射,而且它不仅仅是一个微不足道的算法,因为搜索空间确实非常广阔,但你仍然在导航它,那么你就是在推理,你就是在创造,你就是在进行智能,所有这些都随之而来,对吧?你基本上只是在施展魔法,你正在实现一些将赋予你控制宇宙的力量的东西。所以这是我偏好的框架,它看起来非常清晰,有很多有用的数学可以围绕它进行计算,但不行,像 Ral 这样的人必须坚持,好吧,它可以有创造力,但它不能推理。而 Tim Scarfe 正在以一种非常有用的方式进行反击,他说,有点像我说的,他说,好吧,但如果创造力有用,你必须考虑,也许创造力内部正在发生一些推理来驱动创造力。而 Tim Scarfe 建议,如果我们能划出两种创造力,我们可以说 AI 只能进行组合创造力,但它们不能进行发明创造力。在我看来,这就像 David Deutsch 所说的创造新知识,对吧?所以 Tim Scarfe 只是在划定界限,也许和 David Deutsch 划定界限的地方一样,对吧?我再次不会这样做,但这是一个有趣的问题,可以强迫 Ral 回答。这让我想到,语言模型肯定在它们可以创造的事物类型上受到限制,因为它们受到训练数据的限制。我同意,但我的观点是,与你和我相比,它们接受了更多的数据训练,即使它们在广阔的知识中进行浅层几乎模式匹配,对你来说,它看起来非常令人印象深刻,而且它是一种非常有用的能力。当你继续听 Ral 的回答时,请记住 Tim Scarfe 正在问他,他们有什么类型的创造力,他们有什么类型的创造力没有。并记住我给你举了一个例子,我问 Claude 解释我的笑话,Claude 说这个笑话暗示 McFarland 在 Linkton 上做了一个黑暗的自我贬低参考,暗示他的灾难性节日已经不再是最糟糕的音乐节了,考虑到 10 月 7 日发生的事件,当时在以色列的 Supernova 音乐节上发生了什么。还记得 Claude 对我问题的回答,并试着联系起来,看看这是否与 Ral 所说的关于 LLM 能做什么和不能做什么相符。关于机器创造的创造力是否被认为是组合式的,还是超越了某种东西,这是一个非常有趣的点。但如果你甚至没有一个工具来真正产生这种组合式的创造力,并且拥有广阔的知识,那么这几乎是一个二阶问题。你知道,这正是它们真正闪光的地方,从这个角度来看,我愿意用它们来进行创造力方面的工作。我几乎从不将它们用于推理方面,因为推理需要某种保证,即你所说的确实是真的,而且我不敢相信它们至少在通常的正确性方面无法做到这一点。它们在风格方面可以做得更好,一般来说,这意味着它们可以写一篇看起来更像一篇写得好的英文文章,而不是确保文章的内容实际上是事实,并且有,然后甚至可能做出有趣的演绎推理声明,这实际上是从前提走向更有趣的东西。那是我不相信 LLM 能做到的部分,但它们可以写作,也可以检查另一篇文章的风格,因为它们擅长这个。在某种程度上,这实际上是一个,我的意思是,自回归 LLM 是生成式 AI 的一种特定形式,而生成式 AI 学习分布的属性。风格是分布属性,正确性和事实性是实例级别属性。LLM 在分布属性上做得很好,因为它们是分布学习者,而且它们不会给你任何关于实例级别正确性的保证。所以我们显然有其他工具,我们可以把它们放在一起。我没有检测到 Ral 刚才所说的和他解释我的笑话的例子之间有任何联系。例如,当他谈论分布属性时,正确地获取我笑话的所有参考并解释它们,并解释为什么笑话好笑,这有什么分布属性?或者 Ral 关于 LLM 如何很好地模仿风格但不能可靠地获得事实内容的观点。好吧,所有事实内容,以及它解释我的笑话的答案,都完全切中要点。它的回答中没有任何事实不准确之处。它的回答与风格有什么关系?它只是用一种好的、信息丰富的英语风格写的。所以再次,Ral 似乎只是在谈论 LLM 正在做的这个惊人的成就,我给了你一个例子,我可以给你其他例子,比如如果你看到它给出了一个很好的诊断,另一个我最喜欢的例子是医学诊断。我认为他关于风格和统计分布的说法不适用于它在要求它进行医学诊断时会打印出的一些推断。他似乎没有用好的例子来证实他关于这些术语和这些限制的说法。他只是没有用好的例子来证实它们。我从告诉你我印象深刻的例子中获得了很大的收获,所以我希望像 Ral 这样的人能参考更多的例子来表达他们的观点,因为 Claude 能做什么的例子往往非常惊人,非常充实,非常有趣,深入研究,所以例子会有帮助。是的,有趣。所以,听起来我们说存在验证和推理的差距,以及潜在的创造力差距,但推理的差距要大得多。我们应该关注这一点,但当然,另一件事是,因为我们正在谈论构建这个人类参与的元系统,我们总是在做创造性的事情,我们产生数据,数据进入语言模型,从而建立起这个巨大的集体智能。在某种意义上,比如说,你明天做一些有创造性的事情,它就会在 GPT-4 中。是的,正是如此。Tim 只是在重复 Ral 的世界观,就像,是的,人类是有创造力的,然后 GPT-4 只是拥有所有人类有创造力的数据库。我认为这是 Tim 的一个缺点,没有尝试想一个反例,就像我刚才做的那样,只是把它带回到我笑话的例子,哪个先前的人类创造力的例子让 GPT-4 或 Claude 理解我新颖的笑话,对吧?一个反例就会从我的角度彻底摧毁 Ral 的说法,但而不是去寻找一个反例,我甚至认为这并不难,Tim 只是在重复 Ral 所说的,然后继续前进,对吧?就像,让我们有一些反击,Tim。许多人没有意识到,正如你刚才非常恰当地指出的那样,它们是建立在我们集体知识之上的。所以我一直要求人们做这个思想实验,想象一下 Sam Altman 让 Satya Nadella 已经支付了训练 GPT 的费用,我的意思是,你知道,GPT-K 对吧?而且他没有网络,他不得不创造网络。所以他来了,他说,伙计们,为什么你们不把你们一直想谈论的一切都放到网上,这样我就可以用它作为数据。那将是死路一条,因为没有人会这样做。我们创建网络是为了彼此交流,然后它就成了这些系统的燃料。所以,在某种程度上,这些东西做得好的事实,很大程度上是基于它们在我们放在网上的海量知识上进行浅层模式匹配之类的。很明显,GPT-4 对网络有深入的了解,就像它了解每个网页的内容一样,你可以让它做任何你想要的总结,它使用对网页内容含义的实际深入理解来创建总结,对吧?创建总结没有捷径,没有所谓的浅层方法来创建总结。它不会创建一个符合你期望的统计模式的总结。不,如果你说,嘿,用 15 个词总结一下,它实际上会投射嵌入,做任何深度理解会做的事情。就像没有办法做比在多维空间中投射嵌入更深的事情,就像我们人类实际上并没有做比这更花哨的事情。据我所知,这似乎就是真正的理解,就是在这些高维空间中表示事物,就像维度代表不同组织层面的属性一样。我认为它们掌握了人脑正在做的魔法。我看不出有理由相信还有额外的魔法,人脑正在做的、AI 无法遵循的额外魔法,似乎在于我们的系统,你知道,人类推理有一些秘密酱汁,使人类更强大,对吧?这就是我看到潜在秘密酱汁的地方。我发现 Ral 在使用“浅薄”这个词很有趣,好像浅薄与拥有这个庞大的知识库有关。是的,它有一个它深刻理解的知识库,对吧?然后当你问它一个问题时,比如解释我的笑话,或者解释任何笑话,它解释笑话的方式就是通过真正理解笑话,对吧?没有捷径。如果你看看它是如何解释我的笑话的,捷径在哪里?它解释我的笑话的方式与人类有什么不同?人类也会想,我在笑话中做了哪些参考?在我所知的一切中,什么似乎是参考?你可以称之为浅层统计匹配,或者别的什么,但我们人类所做的很大一部分是我们使用这个嵌入,并试图搜索我们知道的嵌入,对吧?我们也进行类似的匹配,对吧?然后我们试图找到一个联系,我们搜索我们可能的深度联系的空间,来说明这个笑话在做什么联系,对吧?所以 AI 解释笑话所做的一切似乎都与人类解释笑话所做的一切非常紧密地联系在一起。你唯一能写下这个的方法就是说,好吧,也许解释笑话是一个根本上简单的问题。这让我想起史蒂芬·沃尔夫朗说的话,当他看到 LLM 时,他说,好吧,我猜使用语言比我们想象的要容易。对我来说,这似乎是一种借口。我不认为这是一个简单的问题,我认为这是一个难题,我认为没有多少难题了,对吧?这是我的观点。但总之,就 Ral 现在所说的而言,他似乎在偷偷地引入这个评判性的词“浅薄”,并试图将其与证据联系起来,比如,是的,它只是拥有这个庞大的知识库,而我的观点是,只要你能成功地应用它,就像人类应用它一样,理解知识并不是你的缺点。非常重要的是要记住,它们不是在创造这个,事实上,如果你让它们创造知识,他说创造新知识,所以现在他有了我 AGI 怀疑论宾果卡上的所有三个词,他谈到了推理,他谈到了创造力,现在他谈到了创造新知识。让我们听听,如果你让它们创造知识,创造某种文本,你知道,我最大的担忧是我实际上说过这个,你知道,在挪威有一个种子库,它们基本上有一个在挪威北部高处的一个库,它们保存了所有种子的副本,以防万一发生核事件等等,我们需要重新启动文明,那里有种子。我一直觉得我们需要捕捉一个当前网络的快照并将其放入那个种子库,因为随着 LLM 生成越来越多的补全,并且它们基本上成为网络的一部分,你现在拥有一个比维基百科和纽约时报等更受策的来源更嘈杂的版本。当所有这些结合在一起时,它变得更加困难。好吧,虚惊一场。当他说让 LLM 创造新知识时,我认为他只是说当你让 LLM 输出它们将要输出的任何文本时,它都会污染我们人类生成的文本语料库。所以我不认为他实际上是在解释一个他认为 LLM 正在创造新知识的场景。我认为他只是从未真正解决过创造新知识意味着什么。我认为他只是坚持谈论推理和创造力。他碰巧说了创造新知识这个词,但他又回到了说,好吧,LLM 永远能产生的任何东西都只是统计上的垃圾,它不会增加价值。例如,如果 LLM 解释我的笑话,他认为这不会增加价值,可以添加到互联网上,因为它可能与其他已经存在于互联网上的知识是冗余的,或者它可能和正确的一样可能是错误的。所以,把它放到互联网上风险太大了。这种含义是,在他看来,整个合成数据这个想法是毫无价值的。我是在往他嘴里塞话,但如果按照他的世界观,你可能会得出结论,让 LLM 生成大量训练数据供其他 LLM 使用是没有意义的,即使它们花费了大量的计算时间来生成它们的数据,比如,这里有一个笑话解释语料库,我根据我在互联网上看到的未解释的笑话写的。从 Ral 的角度来看,那将只是太粗糙了,太像 AI 垃圾了,无法用于训练下一代,之类的。我只是在推断他在说什么。让我们继续听。所以每当人们谈论我们将,你知道,你可以某种程度上,你不需要人类数据,不是太多聪明人这么说,但有一些,你知道,不太了解的人认为,为什么 LLM 不能自己创造数据并训练自己?这基本上是盲人带路。是的,看起来我通过了 Ral 的意识形态图灵测试。我正确地预测了一个具有他世界观的人会非常看不起合成数据。这并不难预测,但让我们看看他对合成数据还有什么要说的。而且实际上变得更糟,因为你知道,补全只是分布,它们并没有真正具有任何准确性,所以事实性甚至更低。所以他继续说 AI 的补全只是你给它的数据的统计分布,这让我很痛苦。比如,解释我的笑话,我把这两个音乐节放在一起,并在其中找到了黑色幽默,那只是一个统计上的补全,真的,当你展示一个笑话的版本,然后是解释后的版本时,它就没有价值了,就像额外的 D。ata 一样,没有发生推理,只是一个疯狂的世界观。而当人们谈论合成数据时,通常他们会依赖某个外部求解器,它实际上可以提供保证来生成合成数据。所以,如果我想做得更好的规划,我会创建大量的规划问题,使用现有的外部规划器来解决它们,然后现在拥有问题和计划。我微调我的 LLM,以便它在生成规划问题的分布的解决方案方面变得更好一点。如果它自己生成计划并训练自己,那将是,你知道,盲人带路。这说得通。Ral 和我都同意,如果你采用一种非 LLM 类型的人工智能,比如某种逻辑求解器,就像计算最佳国际象棋位置的东西,不仅仅是使用 LLM 内部机制,而是更多地使用游戏树查找,或者像数学证明查找器这样的东西,你知道,这些通常不被认为是 LLM 的优势,甚至是一个 Python 解释器,你知道,这些更老式的、整洁的结构化 AI,也许那种结构化 AI 的输出可以输入到 LLM 的“直觉”中,你知道,它可以输入到它的系统一中。这对我们人类来说是一种熟悉的体验,对吧?所以,例如,我是一名业余钢琴家,就像我提到的,如果我弹奏大量由大师创作的音乐,我永远无法创作出像巴赫赋格曲那样的东西,对吧?那远远超出了我理解它为什么听起来不错。但我弹奏了如此多的巴赫作品,以至于我的手指开始掌握规律了。我系统一的组织层面的某些东西,即使我没有像那个能解决如何创作这种音乐的天才那样构建,我仍然可以掌握弹奏它,甚至在潜意识中预测接下来可能会出现什么和弦,因为我太习惯了。我太习惯于匹配更浅层的模式,即使没有深刻理解如何创作音乐。所以我认为 Ral 和我同意,这对于一些非 LLM 结构化 AI 的合成数据如何仍然有助于提高 LLM 的性能是一个很好的描述。我与 Ral 之间的唯一区别是,Ral 对 LLM 的评价不够高,他说,是的,它们只是在混日子,它们从来没有那种额外的灵感闪现,那种额外的推理步骤,它们会说,哦,等等,等等,我不会说出这种完全微不足道的显而易见的事情,我实际上会做一点飞跃,对吧?这就是 Ral 停止的地方。他认为,不,它们从不这样做,它们只是在平滑,你知道,内核平滑,对吧?这都是关于统计分布的。这就是我们分歧的地方。在接下来的部分,Tim 询问 Ral 关于 ARC Prize,它代表抽象推理语料库。这是一组非常有趣的挑战,它向 AI 展示一个像素网格,并且有一个特定的模式,然后它看到另一个网格,第一个模式演变成另一个模式。挑战在于 AI 预测转换规则,根据一些例子来弄清楚这些网格为什么会转换,而事先不知道允许的转换类型。所以,比如,每一次都将是一个新颖的转换,比如有一次我看到的转换是,第一个网格中的彩色块像在重力作用下一样向下掉落,但这只是一个规则,对吧?它们可以改变颜色,它们可以做任何事情。而我们人类可以看着它说,嗯,我想知道这个规则是什么,对吧?这有点像智商测试,但它已经给了 AI。ARC Prize 的发明者 François Chollet,他非常有信心,目前的 LLM 无法解决它,因为你需要更像人类的东西来解决 ARC Prize。当然,Ral 会在同一页上,说,你不会用统计随机配对来解决 ARC Prize,你需要别的东西。让我们听听。你熟悉 Chet 的 ARC 挑战吗?是的,是的,是的,因为这是一个很好的例子。所以,我的意思是,我是 Jack Cole 的朋友,也是获胜团队的朋友,他们做了数据集生成,你知道,比如,测试时推理和微调等等。他们已经,他们已经,他们已经创建了一堆转换规则,你知道,比如反射和对称等等。他们正在,他们正在构建数据分布,然后他们对其进行微调语言模型,然后另一种方法是像 Ryan Greenblatt 的方法,你把它用作想法生成器,就像你提倡的那样。实际上,Ryan Greenblatt 的方法非常像 LLM 模块化版本,因为它们有 Python 解释器。所以它们生成大量的代码片段,然后检查这些片段是否可能在 ARC 训练数据上生成正确的结果,这给了它们巨大的优势,而且这是非常合理的事情。但是,基本上,保证来自于这个解释器,就像我们之前谈到的,形式语言有解释器,自然语言没有。通过将整个事情转换为,我猜是解决 ARC 挑战的 Python 代码,对吧?你现在可以依赖 Python 解释器的帮助来理解你猜测的任何东西,并且你至少可以比较预期的输出和你实际输出的输出,你知道,这段代码正在生成什么。在某种程度上,这仍然是一种极其蛮力的方式,因为它们正在生成大量的,你知道,大量的组合可能性,你必须确保它足够多样化。所以,总的来说,这再次类似于我谈到的 LLM 模块化内容,这些是生成测试方法,其中测试器是一个外部事物,它实际上可以提供保证。是的,Ral 认为 ARC 挑战是一个很好的例子,说明他如何谈论 LLM 只是这些不受限制的想法生成器,而你只需要这种不同类型的逻辑智能,比如 Python 解释器来帮助理解,帮助验证它们的候选解决方案是否可行。好吧,Ral,公平地说,但是你描述的这种组合,生成性的创造性部分,它给了你一堆想法,而且这些想法有惊人的高概率是正确的,然后是让你检查它们是否正确的那个部分,这不就是人脑的工作方式吗?我的意思是,当我个人看 ARC 挑战时,我能感觉到自己也在做同样的事情。我看着不同的方块,我说,嗯,我想知道这些方块在做什么?如果它们这样做会怎么样?这会起作用吗?而我能回答自己问题的唯一方法,并检查它们是否有效,就是激活我大脑的一部分,它更像是逐步处理规则,有点像我大脑的 Python 解释器部分。但是它正在解释我自己的猜测,关于规则是什么,就像,如果规则是,好吧,它们只是总是向下移动,或者,好吧,最右边的顶部像素总是首先改变颜色,就像我自己在生成阶段发明的任何规则一样,我需要另一个步骤,在那里我说,好吧,如果这是规则,那会怎么样?如果这是规则,在下一帧会发生什么?所以我在用 Python 解释我自己的想法,我不知道答案。我不觉得我有一个大脑的一部分会跳到最后。也许约翰·冯·诺依曼做到了,对吧?某些天才可能在潜意识中以某种方式完成整个过程,但我并不觉得我在潜意识中完成了这个过程。我觉得有一个有意识可访问的步骤,就像一个内省的步骤,在那里我说,好吧,快速处理一下,运行你刚才为自己写的 Python 程序,然后告诉我它是否真的输出了我正在示例中看到的内容。如果它确实如此,那么你就解决了这个谜题,并且准备好使用相同的程序来预测输出,对吧?这就是我解决这些 ARC 挑战时的内心独白。所以当 Ral 说,嘿,看,LLM 只是想法生成器时,似乎 Ral 愿意考虑我们正在接近人类能力的想法,因为人脑是什么?它是一个生成器,碰巧总是非常擅长生成实际上有机会正确的想法,即使想法空间很大,加上是的,一个健全性检查,一个系统二,一个鲁棒性东西,对吧?我认为我们都在同一页上,系统一部分,对吧?模式匹配部分正在变得非常出色。也许我和 Ral 的分歧只是我认为系统一不仅仅是所谓的统计模式匹配,对吧?我认为 LLM 正在做的事情,我认为人类系统一,对吧?直觉,就像消防员冲进一栋建筑,但确切地知道建筑中的什么东西会使其倒塌,对吧?这是一个深刻直觉的例子,一些难以用简单规则描述的东西,但你所有观察的集合以某种方式进入这个训练模型,进入这个函数,系统一,并以某种方式向你尖叫,呃,我担心建筑会倒塌,建筑倒塌的概率很高,对吧?这些模型,就像 Elias 所拥有的,模型想要学习,对吧?这种神奇的系统,我们已经破解了它的代码,对吧?现在我们正在扩大规模,对吧?我们现在正在受益于规模法则,而且,神秘感正在加深,它们只是不断变得更好,以某种方式。而且,是的,它不包括 Python 解释器,你还必须,解释器步骤,但你难道看不到这会走向何方吗?再次,Ral 只是说,哦,不,不,不,规模法则什么也没做,因为它仍然是统计的。我认为这就是 Ral 拒绝看到观察结果的地方,对吧?因为他有这些研究论文,它们告诉他,哦,不,不,不,我们能够修改输入并让它出错。所以 Ral 仍然认为,别担心,这些你正在放大的机器,它们是如此有限,因为 Python 解释器在这方面帮助很大。在这个例子中,当然,Python 解释器有帮助,但我认为他再次忽视了生成部分已经将搜索范围缩小了多少。他表现得好像,哦,是的,它只是吐出每一个可能的 Python 程序,那些不是他的话,但那是他的态度,就像他没有被它只吐出相对较少数量的合理 Python 程序的能力所打动一样,那才是魔法,男人,不是解释 Python,那并不令人印象深刻,对吧?令人印象深刻的是,你甚至吐出了足够多的候选程序,我们可以去检查这些程序。一个人不能简单地吐出几个可能的候选程序在一个指数级的搜索空间中。你必须欣赏正在发生的事情。让我重播这一部分,因为 Ral 字面上将 LLM 所做的称为蛮力,在某种程度上,它仍然是一种极其蛮力的方式,因为它们正在生成大量的,你知道,大量的组合可能性。我还没有深入研究过,才能告诉你生成了多少程序,我不知道是几百,几千,几万,甚至几十万。我所知道的是,可能的短 Python 程序的总数是 10 的几千次方,对吧?比宇宙的大小大得多。所以正在发生的缩小是数千个数量级。所以当这种情况发生时,你称之为蛮力,它们是如何缩小的?它们做了什么来缩小程序空间?你有点忽略了这一点,然后说,哦,是的,你只是尝试一切。你没有尝试一切,这就是突破,对吧?这就是为什么我们在 2020 年做不到这一点,这就是为什么这是最前沿的,因为它不是蛮力,它是这种新的魔法,对吧?这些巨大的大脑,它们只是扩大了神经元的数量,扩大了参数的数量,并且以某种方式它们学会了,它们学会了东西,它们学会了层次,它们学会了关系,它们不学习他妈的统计数据,它们不学习他妈的线性关系,这太荒谬了。而且你必须确保它足够多样化。而且,健全性由测试者保证,完整性取决于生成者。而且,尽管 LLM 令人印象深刻,但不能保证它们是完整的。不能保证 LLM 是完整的,也就是说,它不一定能总是对任何提示输出完美的解决方案,因为完美解决方案的空间非常大,而且它不将整个提示空间映射到整个解决方案空间,对吧?它映射到某些解决方案空间的集群,而这些集群并不覆盖整个空间。是的,我的意思是,这适用于所有事情,对吧?我的意思是,我作为一个人类,如果我用我的一生来思考所有不同的物理学理论,我的大脑可能不会在找到正确的物理学理论方面是完整的。如果你给我我的一生来尝试头脑风暴量子理论和狭义相对论如何统一,我可能永远不会输出一篇涵盖答案所在空间的论文。以我的数学技能和整体智力水平,大脑可能合理输出的范围,你不会看到完整的想法空间覆盖,对吧?这适用于几乎所有的大脑。你可以用一个计数论证来说明,看,即使在原则上,一个东西要完整,一个东西要覆盖所有可能的输出范围的唯一方法是,它对提示高度敏感,对吧?因为你必须给它一个巨大的可能提示范围,而且输出的数量不能超过提示的数量,总之。我之所以深入研究这些细节,是因为我听到人们谈论完整性,好像这是一个理想的属性,比如,哦,是的,你需要完整性,就像,等等,我们到底在谈论什么?这是一种很难处理的框架。相比之下,我喜欢的框架是,我们是否在朝着目标优化?我们是否在接近?箭是否在接近靶心?它发生了吗?是或否?然后答案很明显,是的,对吧?ARC Prize 使用 LLM 和 Python 解释器的组合,这是几年前不可能实现的。每周,每月,我都在看 Twitter,我看到推文,哦,它更近了,它更接近 ARC Prize 了,这以前从未可能过。所以,即使你不明白它是如何发生的,即使你想把它一笔勾销,说它不是真正智能的,箭一直在接近靶心,而且它本不应该如此。而且,箭能够接近的可能靶心的范围不断扩大,我们不断击中更多的靶心。所以,再一次,你总会有像 Ral 这样的人说,啊,是的,它不完整,它不是真正智能的,需要使用 Python 解释器。好吧,但世界正在被吞噬。Ral,你对此有什么要说的吗?你有什么预测,它什么时候会停止?一个可证伪的预测,任何东西?你只是会继续在这个拔河比赛中滑行和滑行,对吧?你会被不断地拉扯,你会不断地滑行,直到你掉进沟里。这就是会发生的。这有点回到了这个问题,是的,它们有创造力,但它们能创造一切吗?一般来说,这几乎需要提示多样化策略,你知道,你引入额外的外部知识来告诉它们,好吧,现在停止生成这种代码,生成那种代码,因为你引入了某种归纳偏见,说我相信,你知道,你也应该考虑那种代码,因为也许其中一个可以通过验证器测试。就是这个额外的知识,你带来的,这个旧想法,这个“思维之树”的想法,你知道,它实际上已经变得非常流行了,实际上可以这样理解,因为它真的是一种提示多样化策略,它引入了外部知识来推动 LLM。好吧,Ral,很好的评论。那么,这是否意味着 ARC Prize 将在 2025 年被解决,还是不会?你是什么意思?我觉得 Ral 的回答会是,好吧,如果你做了足够的提示多样化,你就会通过黑客手段找到解决方案。所以,我觉得我在这里猜测,但我觉得 Ral 的立场将是,准备好自己,来解释无论发生什么结果,都按照他喜欢的方式来构建世界。所以他喜欢以 LLM 只是统计数据,只是模式匹配的方式来构建世界。所以,在某种程度上,它们确实赢得了 ARC Prize 2025,因为它们不断接近,我确信 Ral 会有一些理由来解释为什么这与他的世界观一致,因为它们只是使用了提示多样化,就像它们自动化了提示多样化部分,然后它们自动化了检查部分,然后 LLM 并没有真正做什么,它只是在蛮力一切,然后 ARC Prize 被解决了,而 ARC Prize 直到现在都无法解决,对吧?那就是那种 Ral 的世界观。所以,这有什么用呢,Ral?这似乎没有多少预测能力,对吧?这似乎并没有真正划定 LLM 能做什么和不能做什么之间的界限。也许他会说,哦,有一个界限,LLM 模块之间有一个界限。

做,以及它周围的其他模块能做什么,也许这其中有些道理。我的意思是,系统一、系统二,我同意你对它们的一些说法很有用。但关键问题是,人工智能的进展将走向何方?我觉得这里存在一个“堡垒与城堡”的论证(Mot and Bailey),他所说的“堡垒”部分,即防守严密的部分,是这样的:你看,大型语言模型现在不擅长逻辑,所以它们需要用能够检查其逻辑的系统来增强,类似于人类的系统一和系统二。我觉得我开启大脑的逻辑部分来检查大脑的模式匹配部分,这就像“堡垒”。而“城堡”部分则是:人工智能不会接管世界,你不会有能够超越人类的系统,因为它都是统计性的。但是等等,不不,你没有说,当我们在谈论“堡垒”时,你没有说它都是统计性的。你说它的一部分不擅长逻辑,需要增强。但如果你把整个系统框起来,突然之间,你就得到了ARC奖的解决方案,对吧?你得到了自动驾驶汽车,你得到了所有东西,你得到了非常好的、富有洞察力的笑话解释,你得到了它们完成整个工作,你得到了它们成为一家公司的首席执行官,对吧?它会在哪里结束?拉尔夫,你能告诉我们它会在哪里结束的预测能力是什么?

像拉尔夫这样的人的日常似乎是,马克·安德烈森和马丁·卡多上播客,说一切都会很棒,你不用担心人工智能,对吧?那是他们的“城堡”。然后他们去“堡垒”,说:“嘿,看,这里有一篇研究论文,说所有大型语言模型做的都只是核平滑。”他们表现得好像这两件事是关联的,即“堡垒”和“城堡”。是的,所以,我采访了瑞安·格林布拉特,不幸的是,他仍然认为,我的意思是,因为我显然断言它,你知道,你有一个系统一,一个系统二,你有一个神经符号模型,它之所以有效,只是因为你有Python在验证。而他坚持认为不不不,你知道,只要等到下一个GPT模型出现,它就会,你知道。但美妙的过渡是,他做了一些事情,对吧?他做了“思维链”,所以,你知道,他有点像把空间划分开了。他做了“自我反思”,也就是对解决方案的精炼。他深信大型语言模型可以自主验证自己并得出正确的解决方案。

好吧,你说的这个人推动了ARC挑战赛最高分的前沿,对吧?这个人是个赢家。他的世界观有经验验证。他告诉你,他认为大型语言模型真的掌握了挑战,对吧?它们正在完成挑战的大部分工作,它们不仅仅是蛮力同步,对吧?它们不仅仅是无限制地生成一堆随机的统计性Python程序。不,它们只是理解什么会是一个好的猜测,就像我描述我自己的大脑正在做的事情一样。所以,你知道,人们总是说,哦,如果你真正理解人工智能,你就不会担心它的走向。这里有一个有经验证据的人,他正在取得成果,对吧?所以像拉尔夫这样的人会猜测,哦,这些是如此有限,这些是如此有限。然后像瑞安·格林布拉特这样的人会说:“好吧,我刚刚通过了下一个挑战,接下来是什么?给我另一个挑战,给我另一个挑战。”所以拉尔夫处于这样一个境地:他必须看着世界上像瑞安·格林布拉特这样的人,他们正在奋勇向前,展示经验成果,即使是在专门设计来展示他们做不到的事情的挑战上,他们也照样攻克了这些挑战,对吧?ARC奖现在预计将在大约一年或一年半内被攻克,人们就是这样预测的,尽管它本应是展示当今人工智能根本做不到的事情的挑战。然而,无论如何,世界上像瑞安·格林布拉特这样的人都会攻克它。所以这不断支持我关于拉尔夫的说法,他就像拔河比赛中那个拉着绳子的人,他正被拖进沟里,但他仍然,你知道,他仍然紧抓不放,他仍然面向另一个方向,说:“不不不,这绳子没有被拉得很紧,其他东西在拉绳子。”但他正被拉进沟里。一旦他掉进沟里,一旦人工智能超越人类,那时再想说:“你知道吗,我可能在那些播客上说的都不是有用的东西,我真的应该专注于我的结果在范围上是多么有限,它们并没有真正给你对人工智能下一步的准确印象。”那时就太晚了,对吧?当人类被超越时,拉尔夫再为他现在采取的方法承担责任就太晚了。

在接下来的部分,拉尔夫区分了“正确性”和“风格”,他认为大型语言模型不擅长做到正确和检查自己是否做对了,以确保其稳健的正确性,我对此有点同意,对吧?我总是说,嘿,它们不够稳健,这是当今大型语言模型所缺乏的。然后他接着说,哦,但在风格方面,它们很棒,所以它们似乎掌握了风格,但在正确性方面很糟糕。我不喜欢这种区分,但让我们听听他是怎么说的。

没有一个简单的形式系统可以拿一篇论文,然后说它是正确的,对吧?因为你基本上倾向于看一种风格特征,而不是,事实上,如果你有一篇写得很漂亮的论文,但在某个时候有一个致命的事实错误,它们是无法找到的,对吧?然而,如果事实上,那么在这种情况下,它们基本上会做人类主体研究,你问人类这些是更好的论文还是更差的论文,他们可能会发现,通过大型语言模型自我批评,论文质量不知何故提高了,但那是风格的改进,而不是正确性的改进。有趣的事情之一是,正确性,你可能有一个正确的计划,但没有正确的风格。所以我举一个从我出发的印度到维也纳的正确旅行计划的例子,那就是走一英里,再跑一英里,然后骑自行车一英里,等等等等,到最后,你知道,无限次地重复这些行动,我就会在维也纳。这在某种程度上是正确的,但它的风格非常糟糕。大多数人不会认为这是一个合理的旅行计划,因为他们倾向于坚持像飞机飞行或其他某种标准化版本。所以风格是大型语言模型实际上更擅长批评的东西,而正确性是它们做不到的。你需要外部验证器,这是一个互补的事情,因为经典的AI系统在正确性方面实际上比在风格方面好得多。

如果你真的考虑拉尔夫的场景,跑一英里,骑自行车一英里,走一英里,再跑一英里,这真的是一个风格问题吗?这似乎是一个非常错误的答案,对吧?我的意思是,如果骑自行车10英里是一个快速且可用的选择,那么你为什么要停下来走路呢?那会是一个更慢的旅程。你正在优化哪个标准,使得这种媒介切换会有帮助?如果有一座桥,你必须推着自行车走,结果它说骑自行车一英里,走一英里,因为有一座桥,再骑自行车一英里,那么突然之间就没有风格问题了,对吧?它只是正确的,它找到了一个好的答案。

所以我发现很有趣的是,每当有人举例,然后他们自己的例子似乎并没有在这里提出一个强有力的论点,对吧?我的意思是,我明白他想说什么,那是一种更浅层的属性,对吧?如果你在交通方式之间切换,而人们并不真正期望它,大型语言模型可以注意到更浅层的属性,我觉得,因为这总是它的动机,就像,哦,是的,大型语言模型总是做那些你眨眼间就能注意到的事情,因为它们是浅层的,它们是统计性的。我明白他想说什么,但正确性和风格之间没有根本的区别。

一篇风格好的文章是正确文章的一部分,无论你想如何定义构成一篇好文章的约束,其中一个约束就是,例如,对人类来说是可读的,逻辑上是有组织的。从我的角度来看,他所称的“风格”是使某物在其自身领域内正确的约束,对吧?在某些领域,你将正确性约束描述为风格约束。但就像我设计一个电脑芯片,你通常不认为它是一个风格的东西,你通常更多地认为它是一个正确性的东西,但我总是可以任意地描述,哦,那个布局太美了,它有一个很好的风格,对吧?我们不是在谈论一个根本的区别,就像它一直都是正确性,对吧?它一直都是约束满足,它一直都是评分指标。

所以当拉尔夫拿出他的正确性与风格的区分,然后他接着说大型语言模型永远不会给你正确性,它们只会给你风格,你需要一个不同的系统来给你正确性时,他忽略了大型语言模型正在做的事情,那就是它们输出的东西不仅有正确的风格,而且很有可能是正确的,对吧?它们不仅仅是蛮力穷举所有可能的输出,它们实际上正在缩小范围,找到那些既有正确风格又很可能是正确的东西,对吧?那是正在进行的优化工作,他只是没有承认,对吧?这就像正在发生一个惊人的魔法壮举,对吧?在他眼前正在发生复杂的笑话解释,但他没有指出它为什么令人惊叹。所以在我的脑海里,他没有资格像他那样不断地贬低大型语言模型,因为他甚至无法告诉你它有多大的奇迹,以及它为什么是一个奇迹,对吧?它正在做的事情是惊人的,他没有用语言表达出来。

是的,我的意思是,我同意你的看法,所以我有点像一个哲学理性主义者,你知道,我认为我们应该在确定性领域进行推理,你知道,它要么是正确的,要么是不正确的。我想我不是一个哲学理性主义者,那么我想我可能是一个贝叶斯理性主义者,但请继续。所以我们同意这一点,但作为魔鬼的代言人,有一秒钟,有些人认为我们可以做端到端的预测模型,我们可以做这种主动推理,我们可以不断地深入测试实例,进行微调、微调、再微调,然后,你知道,我们无法验证它,我们不知道它是否正确,但我们可以构建能够合理稳健地工作并经常产生正确答案的系统。

我喜欢蒂姆提出这个问题,他基本上是在问拉尔夫:“你看,我们难道不能继续改进大型语言模型,让它们做有用的事情,直到它们吞噬所有任务吗?而且,实际上,当你让它们从事一项工作时,它们难道不能胜任这项工作吗?因为,当然,偶尔你会发现一些它们无法完美完成的缺陷,但它们会不断地侵蚀你工作的更多部分,而且实际上,它们的准确率会不断提高,最终会低到低于人类的事故率,对吧?这在旧金山的自动驾驶中已经发生了,对吧?”

哦,我可以挑剔蒂姆描述情况的方式。蒂姆说它们永远不会确定自己做的是对的,但它们会照做,而且足够好。我会挑剔这一点,我会说,嗯,它们会发展出使用外部工具来检查自己的策略,达到人类可以做到的程度,对吧?我的意思是,如果你看看大多数人类在大多数工作中的表现,他们并不是那么擅长退后一步反思自己,然后说:“我今天真的做得很好吗?我做出了所有好的决定吗?”我的意思是,他们可以在一定程度上做到,但他们并不是这方面的天才,对吧?他们有像一个工具包,他们有某些程序,他们用这些程序来反思自己的工作。我认为人工智能的系统一,无论它在做什么魔法,它都会神奇地擅长模仿人类使用相同程序来让自己相信自己做得很好,对吧?而做得更好的唯一方法可能就是让一个天才反思整个组织,就像让埃隆·马斯克,你知道,解雇80%的团队,然后从第一性原理重新思考一切,对吧?但这并不是我们通常对人类的期望,对吧?那就像是做额外的事情。所以,无论如何,也许蒂姆的问题中有一个小小的挑剔,但让我们听听拉尔夫的回答:“你认为那是一个合理的事情吗?”

是的,我认为关键在于,首先,端到端的正确性,你可以将世界本身作为验证器。是的,这确实是一个非常棒的观点。我们头脑中之所以有这些大型模式匹配系统一,即使没有进行太多推理也能非常有效,是因为我们不断地获得反馈。当我们做事情时,我们会看看我们刚刚做了什么,这给了我们很多关于我们刚刚做的事情的逻辑因果后果的信号,然后我们就可以迭代,对吧?所以这实际上是一个强大的反馈循环,是外部物理逻辑和我们模式匹配大脑中正在进行的模式匹配之间的一个强大补充,对吧?

而这是一种只在遍历域中才有效的方法,在这些域中,代理实际上不会因为尝试其糟糕的想法而死亡,对吧?是的,又是一个很好的观点。当我们认为某件事“哦,这只是一个迭代的事情,我们将在现实世界中努力解决”,有时我们实际上是在冒险,然后我们会发现结果。所以,好观点。所以,即使你在进行端到端验证,也需要有一个信号来判断输出是否真的正确。这个信号从何而来?

一般来说,你希望有一个建议接受者,你可以给他们非常高层次的建议,他们会遵循它,对吧?一般来说,“思维链”让大型语言模型看起来可以做到这一点,但它们真正做的是,如果你例如告诉它们如何解决三四个积木堆叠问题,它们确实会提高在三四个积木堆叠问题上的表现,但你增加积木的数量,原理仍然是一样的。特别是,例如,“思维链”的一个想法是,在积木世界中,你总是可以把所有积木都放到桌子上,然后根据目标状态构建堆叠。如果我把这个卖给一个孩子,他们会理解,然后他们可以为一块积木、15块积木或200块积木做到这一点,直到他们感到无聊。但大型语言模型基本上不理解这个程序,它们只在三四个堆叠方面做得更好,然后当你增加积木的数量时,它们就“死了”。

不,抱歉,我不认为情况是这样。我确信拉尔夫指的是他自己或其他人的一些研究论文,而且我确信那篇论文中有一个人为设计的例子,他们,你知道,调整了大型语言模型的输入,然后大型语言模型没有做人类看来显而易见的事情。我明白了,但我拒绝相信,今天的最先进大型语言模型,你不能只是在它们的记忆中放入一条指令,比如:“嘿,当你思考如何解决这个问题时,如果它是一个积木世界问题,请确保在继续之前先将所有积木放到桌子上。”我拒绝相信没有一个合理的配置,这样的一个大型语言模型,你知道,可能稍微调整过,但不是那种超级人为设计的,我拒绝相信我不能设置一个合理的东西,让大型语言模型不会遵循我的指令,先将虚拟积木放到桌子上。我拒绝相信。

如果你想说服我,你知道,拿出ChatGPT,拿出一个合理的系统,然后给我看看它卡得多厉害。我明白它们有时会卡住,但它们不会卡得那么厉害。而且我认为他正在利用这些我认为是人为设计的例子,对吧?观众们,如果你认为我歪曲了他的意思,请尽管证明我错了。但我认为他正在利用人为设计的例子来抹杀这些大型语言模型的巨大成就。现在,我也知道他喜欢给出的一种反驳是,他喜欢说:“哦,当然,是的,提示者才是真正聪明的人,因为提示者会不断改变提示,直到他得到他想要的东西。”我明白了。我仍然愿意坚持这个观点,说:“不,大型语言模型实际上可以听从先将积木放到桌子上的建议。”也就是说,说它们能做到比说它们不能做到更准确。所以,公开挑战,任何人都可以来和我辩论或证明我错了,但这是我的主张。

我之所以如此自信,是因为我看到了Claude如何掌握这类问题的基本操作。所以,这是Claude 3.5的表现。我只是输入:“嘿,Claude,当我问你积木问题时,第一步应该是将所有积木平放在桌子上。”然后我继续:“左边有一个塔,一个三角形积木放在一个长方形积木上,长方形积木放在一个圆形积木上。右边有一个塔,一个红色积木放在一个绿色积木上,绿色积木放在一个蓝色积木上。请解释一步一步的操作,以交换长方形积木和绿色积木的位置。”所以基本上是中间的两个积木。

所以Claude回答说:“让我首先引用并理解初始设置和约束。两个塔,左和右。左塔从底到顶是圆形、长方形、三角形——这没错。右塔从底到顶是蓝色、绿色、红色——这也没错。目标是交换长方形积木和绿色积木——没错。约束:首先将所有积木移到桌子上。”所以它完美地接受了我提到的约束,并将其放在“约束”标签下。所以它完全理解我在说什么,对吧?这里没有技巧,这就是真正的理解的样子,能够做到这一点,对吧?这不是统计学,不是有人写下“约束”这个词,然后旁边谈论他们首先做什么。这不是该死的统计学,好吗?

好的,所以Claude继续说:“让我一步一步地解决。拆解左塔:从长方形上移走三角形,从圆形上移走长方形——正确。拆解右塔:从绿色上移走红色,从蓝色上移走绿色——正确。现在所有积木都平放在桌子上,顺序是圆形、长方形、三角形、蓝色、绿色、红色——正确。搭建新的左塔:将绿色放在圆形上,将三角形放在绿色上——正确。搭建新的右塔:将长方形放在蓝色上,将红色放在长方形上——是的,正确。最终结果:左塔从底到顶是圆形、绿色、三角形——正确。右塔从底到顶是蓝色、长方形、红色——正确。交换完成。您希望我澄清任何这些步骤吗?”不,Claude,我对你的答案很满意,对吧?它刚刚完美地解决了所有问题。

当你看到Claude完美地执行这样的任务时,很自然也很准确地会说:“嘿,好吧,是的,它擅长这种玩具问题。”但一旦问题变得更大或更复杂,一旦你让它:“嘿,不使用Python来模拟这个Python程序。”它就开始变得不那么稳健了,对吧?它开始崩溃,它开始注意不到自己的错误,这没关系。但如果你看看你和我作为人类,对吧?我不知道你怎么样,但当我说“正确、正确、正确”时,我事先已经读过问题,并且花了一分钟实际检查它是否正确,对吧?它花了我一点脑力,比如“绿色在圆形上,三角形在绿色上”,对吧?这花了我一些脑力来检查它是否正确,对吧?而Claude非常快地,在几秒钟内就吐出了这个答案。

所以我已经开始达到我的大脑实际能做到的极限了。是的,我比Claude更稳健,我可以检查东西,但这就像是一种负担,对吧?我的大脑不会像解决这样的问题那样伸展太多。所以当我看到Claude轻松地解决这个问题,显然没有遇到任何困难,然后转向越来越高级的问题时,我只是看不到它还能超越我多少。我认为,在一年或两年内,我很容易想象我可以和Claude交谈,它就能稳健地解决像巨大的问题,对吧?然后我就会费力地检查,然后说:“是的,据我所知,它是正确的。”两年后,我检查Claude的能力,不会比Claude检查Claude的能力更好,对吧?

所以当我听到拉尔夫说:“哦,不,当我们让它把积木放到桌子上,有四块积木时,它做不到。”我的意思是,我不是说我证明他错了,我确信他有一些研究论文,数据支持他的说法。但很明显,他没有抓住重点。那篇研究论文,无论是哪一篇,我姑且说它是一篇糟糕的论文,拉尔夫,无论它是什么,我甚至不用看细节,我就是不喜欢它。而且事实证明,它甚至不需要规划,它实际上可以做像“最后一个字母连接”这样简单得多的问题,就是给定几个单词,你知道,比如“dog”和“cat”,你希望大型语言模型说“G”和“T”,因为“G”是“dog”的最后一个字母,“T”是“cat”的最后一个字母。最初的CoT论文基本上说:“你看,开箱即用,它们做不到。但如果我给出关于如何做这个的建议,它们似乎做得好得多。”我们基本上做了这个实验,我们增加了单词的数量,在给出了两三个单词问题的例子之后,我们增加了单词的数量,这应该是非常合理的。如果你想要一个通用人工智能,它至少应该理解“最后一个字母连接”是一个简单的问题,其中单词的数量你只是基本上重复同样的事情,但它就“死了”。

所以我一直说,你知道,这种普遍的“接受建议”有点让我想起那句古老的资本主义谚语:“授人以鱼,不如授人以渔。”“授人以鱼,你只能养活他一天;授人以渔,你就能养活他一辈子。”而“思维链”表现得好像是后者,但它实际上是后者的一个奇怪版本,你必须告诉大型语言模型如何钓一条鱼,如何钓两条鱼,如何钓三条鱼等等,到那时你基本上会失去耐心,因为它从未学习实际的底层程序。它基本上只是接受你给出的例子,以及你给出的长度,它几乎是在进行一种或多或少的模式转移,而不是任何形式的程序学习。

好的,所以我不会费心去读拉尔夫的论文,但我会和Claude进行一次对话。我给Claude发消息说:“考虑这个例子:输入‘dog cat wolf’,输出‘gtf’,是单词的最后一个字母。现在处理以下输入:输入一‘apple banana pear’,输入二‘sweet sour salty’。”在我和Claude的对话中,我甚至没有告诉Claude我们在找最后一个字母,我只是给了Claude一个例子,对吧?“dog cat wolf”得到“gtf”,好的。

所以Claude回应说:“让我从例子中理解模式。看来我们需要提取每个单词的最后一个字母。让我处理输入。输入一‘apple banana pear’,输出一‘ear’——是的,正确。输入二‘sweet sour salty’,输出‘try’——是的,完全正确。”

然后我回复说:“我输入了‘input three Ros tarianism supercalifragilistic Expialidocious’。”Claude说:“让我提取每个单词的最后一个字母。输入三‘rosarian ISM supercal fragilistic expad doas’,输出三‘Ms’。”好的,所以Claude完美地解决了所有问题,就像,你知道,和最聪明的人类一样好,100%完美。

所以我应该相信有这样一篇论文,说:“嘿,我们试图让这些大型语言模型更好地获取单词的最后一个字母,但它们做不到,它们没有听从我们的建议。”所以我确信你用的是GPT-3或更早的GPT-2,或者一些较弱的大型语言模型,或者你设置了一些病态条件,对吧?比如你调整了一些东西,让它失败了。我明白了,对吧?我的意思是,我们都同意这不稳健。现在你可能会说:“你知道吗,莱昂,这是你的错,你没有求知欲,你为什么不去读那篇研究论文,这样你就确切地知道拉尔夫到底在主张什么?”不,我会反驳说,这不是我懒惰求知欲的错,这实际上是拉尔夫的错,因为当他在播客上说这些东西时,好吧,没有人会去读他的论文,而他却把他的论文结果泛化,说:“哦,是的,这些大型语言模型,你知道,它们是如此脆弱,它们什么都做不了。”这与我日常玩Claude的经验相矛盾。所以实际上是拉尔夫在误导人们,他没有解决房间里的大象,即Claude怎么会如此精明,如此敏锐。也许,你知道,这是六个月前的事情了,所以也许答案只是:“哦,好吧,自从拉尔夫进行这次对话以来,大型语言模型已经变得更好了。”那好吧,但在那种情况下,拉尔夫通过不承认大型语言模型可能即将变得更好的事实,在某种程度上误导了所有人,对吧?我只是认为拉尔夫几乎是在散布虚假信息。我的意思是,我再次确信他在他的论文中技术上是正确的,但他只是在误导人们关于大型语言模型明显能够做什么,他给出了错误的印象,即使他在技术上是正确的。

所以有几件事,我的意思是,首先,许多这些技术,它们“残害”了模型,从某种意义上说,即使我们进行外部验证,它们也使模型变得非常领域特定。但像RAG、工具使用和思维链这样的东西,你知道,这些东西使得模型变得非常领域特定。但我想指出的更大问题是,我们想教模型如何钓鱼,但模型原则上不知道如何钓鱼,因为它们不是图灵机。你在你的论文中举了一个例子,你知道,像一个半可判定问题,你知道,也许你应该把它带进来,但这些在语言模型中原则上是不可解决的。

这听起来很像蒂姆的共同主持人基思·达格尔喜欢提出的主张。如果你对这类主张感兴趣,我建议你听听我在我的频道上进行的辩论,我与基思·达格尔的辩论,因为我真的尽力指出,那不是一个好的论点,即因为大型语言模型在非常技术意义上是有限状态自动机而不是图灵机,所以这会限制它们能做什么。从我的角度来看,我完全反驳了这一点,并基本上称之为无稽之谈。但如果你是基思阵营的,你没有被说服,对吧?所以有一部分人,也许你想加入那个阵营,并继续与我争论。但如果你认为这个话题很有趣,那就去看看我与基思的辩论吧。但让我们在这里继续听拉尔夫的。

所以实际上,这里有一个有趣的观点,那就是许多关于大型语言模型的坏想法,都源于人们在计算复杂性和大型语言模型所做的事情之间建立了错误的联系。好的。事实上,例如,人们认为大型语言模型可以更好地进行验证的原因,是因为生成通常在计算上比验证更难,所以他们只是假设它们可能做不到更难的问题,但可以做更简单的问题。

我很高兴他对自己之前提到的那个有趣的逆转有所自觉,对吧?因为我之前确实注意到了这一点。我当时说,拉尔夫说,那种创造力,比如生成解决方案,而且这些解决方案有很大的机会是正确的,他表现得好像那比验证解决方案是否正确更容易。他只是让大型语言模型拥有“真正有创造力”的荣誉,因为他如此执着于证明它们不能真正推理。我觉得这是一个不寻常的选择,所以他现在要正面解决这个问题真是太好了。那么,拉尔夫,告诉我们,为什么大型语言模型在验证方面遇到困难时,却能解决搜索问题呢?

现实是它们根本没有以任何方式计算解决方案。所以事实上,正如你所知,许多人已经指出,如果我给出,比如考虑以下情况:如果我有五个不同的提示,比如说,其中一个提示,对于我们这些懂英语的人来说,它隐含地要求一个常数时间计算问题的解决方案;另一个是线性时间;另一个是多项式时间;然后一直到另一个是不可判定问题。对于所有这些,答案都是“是”或“否”,比如说,除非你想给出保证,你需要实际进行计算。问问自己,大型语言模型会花更多时间来给出“是”或“否”的标记,这取决于提示吗?不,它基本上只需要常数时间就能给出答案。

所以人们试图说,让我们实际上,人们基本上试图说,既然它反正会在常数时间内给出答案,那我们让它输出更多的标记,这样总共会花费更多时间。是的,显然,当你只让大型语言模型输出第一个标记时,你得到的是一个较弱的计算模型。如果我给大型语言模型一个巨大的数字,然后我说:“嘿,这是素数吗?”它有一千位长,而且大型语言模型以前从未见过它。素性测试实际上已知是P问题,所以它实际上不会花费比世界末日更长的时间,它实际上可以很快完成。但它可能无法在大型语言模型的一次前向传播中完成,你将需要更多的步骤。这个问题有多难有一个下限,所以一般来说,大型语言模型不可能在你给它一个那么大的素数时,正确地输出“素数”或“合数”,对吧?在最坏的情况下,你总是可以把素数做得非常大,它变得如此之大,以至于它压倒了最小的计算步骤数,对吧?所以无论大型语言模型在前向传播过程中有多少计算步骤,你只要把素数做得足够大,你就可以证明素性测试需要更多的步骤。

好的,无论如何,我把这个问题弄得有点复杂了,但我的全部观点是,仅仅在第一个标记中脱口而出“是”或“否”,而没有更多的标记来思考,显然不会总是给你一个好的答案,对吧?如果你走到爱因斯坦面前,问爱因斯坦一个非常复杂的数学问题或政策问题,随便什么,然后你说:“好的,爱因斯坦,你有三秒钟回答。三、二、一。”你会得到一个比随机答案更好的答案,对吧?无论爱因斯坦脱口而出什么,至少他注入了他的直觉,但你不会得到一个深思熟虑的答案,对吧?如果在他完成大量工作之前,你不断地将他的大脑重置到某个状态,然后他说:“好的,爱因斯坦,找出光速如何在每个参考系中保持不变。三、二、一。”哦,时间到了,对吧?他需要时间思考,对吧?即使你像:“嘿,爱因斯坦,给我,给我你的相对论研究论文中的第一个标记。三、二、一,开始。”不,我的意思是,很明显,思考的本质是它会反思之前的想法,对吧?所以你需要在你思考时创建一个思想结构。所以,大型语言模型在它们的第一个标记中不会超级有洞察力,这是先验显而易见的,对吧?

更有趣的问题是,嘿,如果我们给它们几千个标记来思考,对吧?那就像是给人类一个小时的时间和一张草稿纸,对吧?是的,草稿纸是有限的。我知道这对于基思·达格尔来说是一个很大的症结,就像,是的,你不会得到比国会图书馆书页中存在的更多的草稿纸,对吧?你只需要使用合理数量的草稿纸,这从未阻止过人类使用合理数量的草稿纸。但是,是的,所以如果你只是给大型语言模型合理数量的草稿纸,并告诉它,并告诉它需要一个小时,那才是真正有趣的思考发生的地方,对吧?我个人可以告诉你,在我的一生中,很少有时刻我需要超过一个小时的草稿纸来进行艰苦思考才能得出洞察力,对吧?我确信发生过几次,但非常罕见,我认为去年没有发生过。所以如果我们只是谈论计算属性,对吧?以及计算模型的下限,那根本不是问题,对吧?就像大型语言模型在思维链提示或其他任何东西期间,有足够的标记,这里有足够的计算,那不会是阻止大型语言模型变得聪明的上限。它们可能有不同的上限,比如,你知道,它们自我反思的能力,可能还有其他限制阻止它们有效思考,但不是计算步骤的下限。好的,无论如何,拉尔夫在这里说什么?

实际上有一篇论文,我忘了是谁写的,他们说:“让我们暂停一下,让我们实际上在大型语言模型中放入暂停标记,希望这样它就能开始推理,因为常数时间它不可能推理,所以你只是让它暂停,也许推理就会以某种方式发生。”这完全是魔法思维。这种逻辑有什么问题?当你输出一个暂停标记时,这怎么是魔法思维呢?

是的,你没有输出“思维链”的优势,所以你无法回顾自己的想法,并用它来构建下一个想法。好的,所以你没有得到“思维链”的这部分好处,但你仍然得到了这部分好处,那就是你可以再次通过神经网络的所有层,对吧?每个标记一个接一个地出现,每次你通过时,你都在传播这些向量在各个阶段的不同权重,对吧?你有很多矩阵,我的意思是,看,我不是这些细节的专家,对吧?但你可以再次运行注意力块,你的向量的当前状态,它们在这个高维空间中落脚的位置,它们可以相互影响,它们可以相互进行这些不同类型的查询,并获取查询结果,然后将其投射到某个结果空间,对吧?我的意思是,我只是在重复我所学到的关于大型语言模型的东西,但重点是计算正在发生,当你注入一个暂停标记时,你正在让更多的计算发生。所以拉尔夫只是在某种程度上驳斥了这种逻辑,但他解释这种逻辑的方式听起来像是完全合理的逻辑。

有一个非常不同的问题,那就是Transformer网络是否是图灵完备的。我倾向于认为这是一个正交的问题。你可以让它成为,事实上,记住以前有神经图灵机,而且你可以让带有外部记忆的Transformer成为图灵完备的,对吧?这都是微不足道的,像这个问题,关于它们是否图灵完备,或者它们是否能处理任意大的记忆块,答案显然是肯定的,这不有趣。抱歉,基思·达格尔,如果你正在寻找一种有效分析这些问题的方法,这完全是找错了方向。但真正的问题是,人们讨论过一些变体,但我认为真正的问题是,这实际上并没有影响大型语言模型如何生成下一个标记。本质上,它们并不是在进行任何形式的图灵计算,它们只是基本上在常数时间内选择下一个标记,它们是N-gram模型。等等,[音乐]

逻辑警察在此,先生。我能看看你的播客吗?我们接到报告,有人说大型语言模型实际上没有进行任何形式的图灵计算。我能看看他是如何阐述的吗?他说它们基本上是在常数时间内选择下一个标记,而且它们是N-gram模型。先生,这里的逻辑联系是什么?是的,看起来不太好。我的意思是,当你有一个大型算法,大型语言模型推理算法,它一次通过一个标记,每次它输出一个思维链的标记,它可以一直进行下去,直到它达到一个停止标记,但它推理的时间没有固定的限制,对吧?然后它可以有记忆,它可以解释笑话,或者解决问题,或者提出候选证明或候选猜想,它正在做所有这些事情。你不能说它实际上没有进行图灵计算,它非常像是在进行图灵计算,这并不是一个很高的门槛,对吧?这是一个荒谬的指控,没有任何逻辑论证来支持它。然后,更糟糕的是,他接着说它们只是N-gram模型,而他自己在一开始就确立了,不,要真正拥有一个N等于一千的N-gram模型,那将是一个太大的查找表。而且,当提示中的N-gram是你从未见过的事物时,你如何使用N-gram模型呢?所以你如何对你从未见过的事物进行统计呢,对吧?所以他在播客一开始就推翻了自己的主张,而且他从未使其复活。因此,本期逻辑警察到此结束。在下一节中,拉尔夫对他的主张,即大型语言模型能做什么与整个AI系统能做什么或不能做什么,做出了有益的澄清。

我确实质疑“后来的模型将做一切”这个问题。真正的问题是,如果你说的是与自回归大型语言模型不同架构的后来的模型,我没有理由不同意你的看法,因为世界是广阔的,我的意思是,你可以做的事情太多了,我们从未说过人工智能不能进行推理。确实存在进行推理的人工智能系统,比如,你知道,AlphaGo进行推理,强化学习系统进行推理,规划系统进行推理等等。但大型语言模型是一种肤浅、宽泛而肤浅的人工智能系统,它们更擅长创造力而不是推理任务。而且,如果你只是不断增加参数和系统规模,我没有理性理由相信它们能够进行推理。它们可能能够将推理转化为检索,用于更大的子类,这在实践中可能就足够了。

这是一个有用的澄清,因为拉尔夫正在将自己置于一个位置,在那里他几乎可以解释任何即将出现的能力。所以,如果扩展大型语言模型能让它在不使用Python的情况下快速解决任何难题,对吧?它就可以成为自己的Python解释器,就像你可以想象:“哦,这是我的思维链,我只是逐步执行我自己的Python程序,而没有真正使用Python,我只是把我的大脑当作Python。”对吧?所以,大型语言模型为单枪匹马解决任何问题所做的任何变通方法,拉尔夫都已经准备好解释了,因为他说:“嗯,也许它们可以将推理转化为检索。”所以它们只是在进行检索,告诉它们下一步应该做什么,这并不是真正的推理,但它们已经将其转化为推理,所以它们解决了问题,然后它们毁灭了世界,对吧?

所以拉尔夫已经准备好解释这一点,他可能不完全期望它,但他不否认这可能会发生。而且他也非常清楚,他不否认,好吧,是的,你可能可以将一个大型语言模型连接到其他系统,比如一个Python解释器,是的,大型语言模型将承担很多繁重的工作,尽管他只是,你知道,轻描淡写地说,根据他的说法,它只是在进行无约束的生成。但就像我说的,拉尔夫基本上允许人工智能变得极其强大并终结世界的任何可能结果,拉尔夫仍然会说:“我没错,我没说它们做不到,我只是说它们不能推理。”

所以,在对话的这一点上,我真的不感兴趣与拉尔夫就“推理是什么”进行一场语义上的争论。我的意思是,我告诉过你我偏好的定义,那就是只看优化能力,看它能够展现、能够驾驭什么样的输入输出映射,对吧?看它拥有什么样的力量来促成事情发生,或者知道需要发生什么才能促成事情发生,对吧?那是我的偏好定义。当然,拉尔夫的偏好定义,我猜更像是:“嗯,它必须看起来更像我习惯的那些老式的东西。”我甚至不知道他的定义是什么,我猜。而且我也不再关心了,因为任何输入输出行为都属于拉尔夫认为未来可能发生的事情,而我在这里的动机只是指出:“嘿,人工智能日益增长的力量才是让我们注定的原因,对吧?”

所以,我甚至不认为在这一点上拉尔夫是在声称:“别担心,我们不会注定,因为人工智能不能推理。”我认为他正在退回到语义学,说:“是的,好吧,我们可能注定,但人工智能仍然不能推理。”我不想替他说话,对吧?这只是我的猜测,我完全不确定他会如何回应这种提问方式。但我准备说:“好吧,让我们把‘大型语言模型能否推理’这个问题搁置起来。”我认为我们不会再从我和他之间榨出更多东西了。让我们看看拉尔夫还会提出什么其他观点来结束这一切。

如果它们正在进行推理,那么我就不应该能够提出任何我之前谈到的那种对角线论证,例如,改变谓词的名称,或者查看其他偏移量以进行SE密码测试等等。我不认为仅仅通过增加模型的大小就能改变这一点。

实际上,这是一个我们可以证伪的主张,我们很可能会找到一个预测,我和他对于模型扩展后会发生什么存在分歧,因为我看到一个趋势,如果你从GPT-3到GPT-4或Claude 3.5 Sonnet,你实际上会看到这些模型变得更加稳健,所以我可以用更多的方式调整输入,它们不会被愚弄。它们仍然会被一些调整愚弄,但很明显愚弄它们的调整更少了,我对此深信不疑。所以我准备推断,并说:“嘿,我敢打赌它们会更加稳健,你知道,更少的东西会让它们出错。”但拉尔夫基本上说:“不,我非常确信总会有一些小调整可以让我让它们出错。”这是一个有趣的预测。

我的意思是,这不一定会阻止它们接管世界。我的意思是,你可能有一个有点故障的心智,它无法完全自我修复,但它从周围环境或从其他系统检查其工作(比如一个领域专业的数学求解系统或其他什么)中获得了足够的强化。所以,即使拉尔夫是对的,大型语言模型永远无法稳健地检查自己的工作,而且它们总是可能被愚弄,我认为我和他都同意,仍然存在一些其他的大型语言模型+X系统,它非常强大和危险。但我很想让拉尔夫做出一个预测,比如:“好吧,你认为GPT-5聊天机器人到底做不到什么?你能写出来吗?”

现在就来吧,你知道的,你能给我们一个哈希值吗?给我们一个加密哈希值,这样你就可以节省你预测一个特定提示的时间戳,这个提示你觉得很简单,但 GPT 5 却会卡住,或者某个下一代的 lolm 会卡住。我很想看到这个预测,我个人可能会站在相反的立场打赌。我认为这是我和 Ral 之间的一个很好的区分,而且坦率地说,这将是我第一次看到 Ral 划定界限,他不仅仅是愿意追溯解释正在发生的一切。这将是 Ral 第一次冒险,做一件光荣的事情,就像我知道 LLM 能做什么一样,这就是为什么我觉得我有权做出这个预测,对吧?我向马丁·卡萨多发出了同样的挑战,他通过说他不能告诉你它将访问哪些数据而设法摆脱了它,因此他不对任何预测负责。我希望 Ral 能找到一种方法,不要回避这一点,而是真正做出预测,因为他似乎给人一种拥有知识状态的人的印象,这应该使他能够做出预测。所以球在你的场上,Ral,让我们做一个预测,让我们打赌,让我们不同意。我认为这将是一场高质量的讨论,这将是绅士们真正朝着解决分歧迈出进展的好方法。我们实际上玩了一个游戏,每当有一个新的、更大、更…更大的 LLM 出现时,我们就会对它们进行相同的计划基准测试实验,而且,就像,我们还没有对昨天刚发布的 Lama 3.1 进行测试,但几乎所有东西基本上都会在被混淆的 Blocksworld 问题上失败,例如,好的,他有一个叫做 Plan Bench 的衡量标准,我看到它有一篇研究论文,它有例子,每次有新的 LLM 出现时,他都会测试它,我猜他暗示他预测 LLM,因为它们是 engr 模型,根据他的说法,它们永远不会解决 Clan Bench,我认为这就是他的主张,或者这就是我从他那里得到的感觉。所以如果他想把它正式化为一个可证伪的预测,那就太好了,比如,嘿,我的 Plan Bench 测试,你永远不会有一个架构看起来像 LLM 的东西会解决 Plan Bench。现在我看了 Plan Bench,它有一些中等长度的提示,比如,我不知道,几页的提示,它们似乎是 Claude 3.5 Sonnet 非常擅长的类型,比如我期望它能做对的类型,但它…它…对我来说,理解它为什么做不对会很有趣,它们似乎只是我在这集节目中向你展示的简单 Blocksworld 问题的更大版本。如果 Ral 能发布一个关于“嘿,我尝试了 Plan Bench,这就是它卡住的地方”的演练,那将是很好的,因为我想调试它为什么卡住,对吧?如果它在这些类型的问题上卡住了,似乎它真的处于做对的边缘,所以也许我们可以划定一个界限,我说,它离做对已经很近了,比如我打赌下一个会做对,他说,哦不不不不,它根本没有接近做对,它不健壮。所以值得称赞的是,他确实有一篇关于它的论文,尽管我从略读中无法确定,我只是…我从略读中没有获得关于它在 Plan Bench 上失败的见解,所以我很想从他那里获得更多指导。快速谷歌一下,我只是没有看到很多关于 Plan Bench 的结果,所以也许观众可以教育我,比如教我为什么 Claude 3.5 Sonnet 不能做 Blocksworld,因为从我的角度来看,它似乎对更容易版本的 Blocksworld 有很好的掌握,所以教育我吧,让我们做一个可证伪的预测,让我们让一些有成效的东西从这个播客中出来,而且我思想开放,也许我甚至会学到一些东西,也许我甚至会根据一些证据改变我自己的预测,让我们看看。最后,我们有 Ral 对代理系统发表的看法,关于代理系统,首先,我…我有点…我对整个代理炒作感到困惑,因为人们混淆了行动与规划。我的回应是,如果你把枪留在房子里和一个蹒跚学步的孩子在一起,孩子会行动,但他们不一定在规划,所以这就是为什么我们不应该有枪。嗯,这实际上并不是规划与代理的区别,这实际上更多的是关于优化能力在哪里。所以如果你了解到一位母亲的手臂中弹了,这次事件的大部分优化都发生在枪的设计中,对吧?如此迅速地将子弹射入她的手臂的可能性,大部分发生在有人设计…你知道的,火药和枪膛,只有少量的优化,而且确实是无意的优化,除非那个蹒跚学步的孩子有计划,但当那个蹒跚学步的孩子拿起枪并开火时,几乎没有发生优化。所以从优化分析来看,是的,枪匠完成了工作,但从规划与代理分析来看,没有人有计划,对吧?计划是不存在的。所以我不知道这是否支持他想说的观点,即规划比代理更重要。有趣的是他选择了这个特定的例子。相反,你可以拿起东西,或者你可以按任何小按钮,或者你可以进行函数调用,这并不保证这些函数调用实际上会带来可喜的结果。所以大多数人在代理系统中基本上只是以某种方式认为,如果你能调用函数,一切都会好起来的。这只在高度 erodic 的世界中才成立,在那里几乎任何序列都不会失败。这是唯一一种几乎不需要规划的情况,那就是你可以基本应付过去,但否则代理系统除了规划之外还需要调用函数的能力。我以为 Ral 会提出一个与我关于规划与代理的观点类似的观点。我提出的观点是,如果你想要力量,那么它归结为优化,优化归结为规划,而代理只是一个小细节。如果你有计划,你会找到人去执行计划,对吧?就像你是一个生活在互联网上的超级智能 AI,你会贿赂某人去为你做你需要的事情,就像代理部分是微不足道的,对吧?想出谁需要在什么时候被贿赂的想法。好吧,有一部分是你的代码说,你知道的,去调用这个 API 来发送一个 HTTP 数据包到这个 Facebook 聊天或者别的什么,来告诉某人做某事,这就像一个小细节,对吧?有趣的部分是 AI 的大脑是如何策划这个计划的,然后…你知道的,同时以闪电般的速度操作计划的所有不同触手,并操纵人们,建立权力,就像正在发生的有趣优化一样,代理部分并不是一个单独的部分,但无论如何,这并不是 Ral 所说的,对吧?Ral 说,嘿,你看,你可以有代理而没有规划,而代理只是意味着如果你看到枪就拿起它。而且你也可以有规划,但你可能得不到足够的代理来执行你的规划,如果世界不够 erodic。世界不够 erodic,那就去贿赂某人吧,男人,你可以执行你的计划,当你贿赂某人去做你告诉他们做的事情时,这并不难。所以…是的,Ral 有他想说的独立观点。我想人们…我的意思是,显然人们想要代理系统,但由于 LLM 不能做规划,所以…我不会期望任何事情会发生变化,除非你能有 LLM 模态代理系统,其中计划是保证的,然后你进行函数调用,你知道,这是一种…一种可能的事情。所以,这就是我如何看待这个特定的…通才与代理系统。我不同意 LLM 不能做规划的说法。我的意思是,当你要求 LLM 做各种任务时,比如,嘿,为我写一篇论证某个结论 X 的文章,构建一篇论文并使其满足约束条件,比如,是的,这篇论文实际上是一个有组织的论证,支持结论 X,这就是你计划要做的事情。你可能不会称之为规划,你可能只是称之为,哦,它是统计学的魔法,但它执行的工作类型,通常被称为规划工作,你通常认为需要一个规划系统来执行它。所以如果你想否定 LLM 正在做的这种…前馈向量线性代数,你想否定它,并认为它不是规划,好的,但它刚刚做了一些你通常会进行规划的事情,所以你也可以称之为规划。所以我真的很反对他说 LLM 不做规划。我明白他可以争辩为什么他们做的规划类型不总是健壮的,你可以扰动它,然后它就不再正常工作了,但他们帮助我们解决的问题类型,我坚信可以准确地描述为规划。所以无论如何,我们在这方面必须意见不合,因为我们快到时间了。好的,这是我对 superar out com 的全面回顾,Patty 在 machine learning street talk 上谈论他的研究以及为什么 LLM 无法推理,根据他的说法,总的来说,最让我印象深刻的部分是他如何坚持他的主张,即 LLM 只是在做 engrams,而且没有任何理由。我的意思是,他唯一一次试图进行辩护是当他谈论对角化时,我认为这意味着,嘿,我们扰动这些输入,我们没有得到健壮的结果。我认为这是好的研究,这些都是好的实验,但这就是你声称它们是 engrams 的理由,就像那不严谨一样,他这样谈论 LM 是非常令人担忧的。也许他可以从他的词汇表中删除这个特定的短语。我的意思是,这就像称它们为随机鹦鹉一样糟糕,就像,真的,我们正在接近奇点,而你说随机鹦鹉,你还在坚持这种语言,这让我质疑他对其他主张的可信度。现在,公平地说,我认为他提出的最强有力的观点是,当他谈论他做的具体研究时,是的,听起来他确实是关于如何扰动 LLM 使其说错话的专家,就像他在谈论拥有这个基准 Plan Bench,他认为自己处于检测下一版 LLM 无法做什么的最前沿。我很想获得更多关于这方面的信息。我特意标记了这是一个可以更新我信念的领域。事实上,在过去几个月里,我曾去看了他的一些演示文稿中的例子,而且说实话,我有点惊讶于调整 LLM 输入的某些方面会使其卡住。说实话,这比我意识到的要糟糕,所以我不得不更新。但我仍然认为它做对事情的能力,比如笑话分析的例子,我不在乎调整那个例子是否会使其卡住,甚至如果我给它接下来的三个笑话,它都无法解释,仅仅是它对那个特定笑话如此之好就令人难以置信,对吧?而且我只是没有看到足够的赞赏,当他使用统计 engram 这样的术语时,我只是没有看到对这是如何可能的 proper 的理解和欣赏。然后当然,当他声称他们没有进行真正的图灵计算时,我的意思是,他对我来说确实引起了一些重大重大警报,当然,他那种似乎对 LLM 期望不高的态度。但是,你知道,整个事情,那个拔河游戏,他就像在追溯性地解释一切,我觉得他有点承认了,当他说,看,我对人工智能总体上是乐观的,我不想限制我可能看到的。所以他似乎承认他并不特别预测人工智能的冬天或任何东西。所以如果你想得到一个可证伪的预测,我真的会…我想我会深入研究 Plan Bench,我会说,让我们谈谈 Plan Bench,Plan Bench 到底意味着什么,GB5 可能无法做到?让我们谈谈那个,让我们尝试做出预测,你知道的,在相反的方面,让我们尝试打赌。关于 Ral 的另一件事是,我认为他是个聪明人,我喜欢听他说话,我觉得他很容易理解,他是一个我可以和他交谈的人。所以向 Ral 致敬,如果你想来参加 Dune debates,如果你想在这里深入讨论,那么,如果你不介意一点辩论,请来吧,我很乐意邀请你,我认为这将是一场富有成效的讨论。这又是 machine learning street talk 的一集,我不同意客人的观点,但不可否认的是,他们制作了高质量的内容。本期 Dune debates 就到这里了,请尽你的一份力,如果你支持提高对人工智能生存风险的认识和提高讨论质量的使命,你知道如何提供帮助,分享节目,订阅,去 Doom debates.com 订阅我的 Substack,我期待在下一期 Dune debates 中见到大家。