📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Arvind Narayanan Makes AI Sound Normal | Liron Reacts

Doom Debates1:11:39

Transcription

人工智能的潜力比核武器更强大,你怎么看?我认为这有点属于类别错误。我的意思是,核武器是一种实际的武器,而人工智能不是。欢迎来到“末日辩论”,我是 Lon Shapira。今天我将评论一期刚刚发布的 20 VC 播客节目,主持人是 Harry Stebbings,嘉宾是 Arvin Nanan 教授。Arvin Nanan 是普林斯顿大学的计算机科学教授,以他对人工智能(他常称之为“AI 蛇油”)的滥用和过度炒作持批判性观点而闻名。Nanan 的批评旨在强调人工智能实际能实现什么与公司和研究人员常做的误导性承诺之间的差距。你可能认识“AI 蛇油”这个名字,因为 Arvin 在那个博客上的联合博主 Say Kapor 曾在我最近一期关于“末日论”是否是一个有意义的、应该影响政策的说法的问题的评论节目中出现过。他基本上说不,我说当然是。所以我鼓励你去看看那一集。但今天我们不谈论 Kapor,我们只谈论 Arvin Nanan 教授。Arvin 给人一种冷静、怀疑的印象。他倾向于总是将事情框架化为“是的,这种炒作有点未经证实,让我们等等看,到时候再处理,不要过度反应,不要相信这些炒作的说法。”这当然是一种非常可以理解的观点。作为一名 AI 末日论者,我认为我们正面临生存威胁,我们需要一定程度的恐吓、炒作或对常态将被颠覆的预期。所以你会看到我和 Arvin 以及像我这样的末日论者之间的观点冲突,而这正是你来“末日辩论”的原因,对吧?因为你知道观点冲突的重要性。好了,如果你想要这个,你就会得到。让我们开始吧。现在每个人都在问的核心问题是,更多的计算能力是否等于更高的性能水平,还是我们已经达到了一个不匹配的阶段,更多的计算能力不会带来性能的显著提升?微软的 Kevin Scott 说,绝对是,我们还有很大的发展空间。你为什么持怀疑态度?我们是否已经进入了计算能力的收益递减阶段?所以,如果我们回顾历史,计算能力提高模型性能的方式是公司构建更大的模型。所以,至少在我看来,GPT 3.5 和 GPT 4 之间最大的变化是模型的大小,而且它也可能使用了更多的数据进行训练,尽管他们没有公开细节,以及更多的计算能力等等。所以我认为这正在耗尽。我认为我们不会有太多摩托车,可能零摩托车,一个模型在参数数量上比之前的模型大一个数量级,从而更强大。我认为原因之一是数据正在成为瓶颈。这些模型已经训练了公司能获得的所有数据。只是为了回顾一下 Arvin 的说法,他说,是的,当我们有更大的计算预算时,我们通常会用它来训练更大的模型,当我们训练更大的模型时,我们必须给它喂更多的数据。但瓶颈是可用数据的数量。世界上不一定有 10 倍或 100 倍的数据可以喂给下一个模型。因此,拥有一个 10 倍或 100 倍更大的模型可能不会比当前模型有所改进,因为我们快没数据了。这只是我重复 Arvin 的观点,但我认为这个观点在认识论上有些粗糙,原因有几个。我的第一个反对意见是,他没有充分考虑合成数据。如果数据量是关键因素,那么互联网上有多少数据并不重要。为什么不同类型的 AI 可以以不同的方式生成数据是错误的?这与随机人类生成数据有什么根本区别?因为如果你看一半的互联网,再看另一半互联网,另一半与第一半并没有太大区别,对吧?就像,哦,可能还有更多的论坛,可能提到了不同的主题,可能有些人从其他领域补充了一些额外的事实。但就像,如果你看过一半的互联网,而我们很多人都看过我们自己 0.1% 的互联网,当你访问不同的网站时,你并不会感到非常惊讶,对吧?它很熟悉。那么,为什么 Arvin 会如此关注互联网上能获得多少额外数据,而不是说,是的,如果你需要更多数据,你可以按需制作更多数据,你可以让 AI 假装成人类,但让它拥有某种类型的 AI,它模拟了某种 LLM 本身不具备的推理模型。你让一个 AI 合成一种数据来喂给另一个 AI,这将教会另一个 AI 东西。我只是说,合成数据在这个阶段可能和真正的草饲有机数据一样有帮助。所以这是我的第一个反对意见。第二个反对意见是,数据必然会继续成为瓶颈的说法。如果你看看像你我这样的人,在我们的一生中,我们可能通过听觉和视觉接收了大约十亿个词。GPT-4 接收了大约一万亿个词。所以,就词汇量而言,GPT-4 已经比你我一生中能接收到的多一千倍了。那么,为什么 GPT-4 不能利用它获得的词汇来深入思考,得出关于这些词汇的深刻概念,并弄清楚推理的本质,变得比我们更聪明呢?为什么我们仍然比它聪明?所以,没有根本原因表明额外的词汇量必然是瓶颈,如果我们只是增加更多的参数和更多的“蛮力”,更多的规模到 Transformer 架构,这可能就足以让它“理解”更深层的模式。它可能只是因为思考得更深入而能够开始回答各种领域的问题。例如,你可以有一个人,他不是世界上最博学的人,但他非常擅长思考,所以他从他看到的数据中提取了很多东西,因为他建立了深刻的联系,并且能够比只有结晶知识的人更聪明地讨论。就像我们很多人都有过这样的经历,如果你有一个承包商或医生是专家,你经常会发现,如果你花几个小时研究你的具体问题,做一些谷歌搜索,做一些阅读,并运用流体智力,你就能比医生或承包商做得更好。很多时候,你就会暂时成为专家,你有一些东西可以教他们,仅仅因为他们的结晶知识不足以与你选择性地研究相关信息并更好地思考它们相提并论。现在,我只是在不公平地指责 Arvin,指出他出错的原因吗?不,我认为他可能是对的。我实际上不知道他是对的还是错的。我的问题是,我的问题不是他可能是错的,我的问题是我认为 Arvin 和像他这样的人总是显得过于自信。他们总是听起来好像拥有他们实际上没有的知识或见解。所以他提出了一个观点,他提出了一个观点,他认为 LLM 正在停滞不前,因为数据正在耗尽。我认为这很有可能发生,也可能不会,我不确定。但我认为很有可能我们会得到 GPT 5,或者我们会得到下一代,它将开始通过一系列我不会称之为停滞不前的测试,我会称之为向人类智能迈出的又一步。在这种情况下,Arvin 这样的人会承认他们错了,还是他们设定了足够的证伪性来预测他们的预测?我怀疑会发生的是,他们会找一个方便的借口,然后说,哦,是的,有这个新模型,但它没有使用完全相同的 Transformer 架构,它混合了其他一些调整。所以,关于 Transformer 停滞不前的说法,那不算,这就是我认为他们能够听起来好像有见解,但他们战略性地将自己置于评论员的地位,以便他们能够摆脱任何证伪。我认为这对讨论不利。就我而言,如果我做出任何可证伪的预测,我会明确表示我正在冒险,并告诉你如何证伪我。我不会说一些听起来像预测但又给自己留有退路的话,让你无法证伪。现在,我没有做出可证伪的预测。总的来说,我预测一旦 AI 达到人类水平的智能,就会有末日。这基本上是我唯一的经验预测。是的,我可以给你一些变体,比如我认为在末日到来前几年会有非常糟糕的计算机病毒。所以我可以稍微延长我的预测,但总的来说,我不认为我对下一代架构有任何见解。这不是我认为重要的问题。这里重要的问题是,我们一直在不断缩小与人类水平智能的差距。我不认为我对我们能多快跨越这个差距或具体需要什么来跨越它有什么见解。我只是从外部观察者的角度来看,无论如何,我们一直在跨越它,它一直在缩小。所以我的挑战是,如果你想表现得像你在做预测,那么请非常清楚地说明什么会发生,让我们可以说你被证伪了。如果 GPT 5 出来,它只使用了比 GPT 4 多一点点数据,但它通过了一系列 GPT 4 没有通过的新基准测试,你将如何更新你的信念?你将如何回到你的博客上说,嘿,我们告诉了你一些错误的事情?你将做出什么更新?让我们现在澄清一下,这样我们的评论员就会有责任感。虽然数据正在成为瓶颈,但我认为更多的计算能力仍然有帮助,但可能不如以前那么多了。更多的计算能力仍然有帮助,但不如以前那么多了。好的,我想知道你为什么认为更多的计算能力不会像以前那样有帮助,因为更多的计算能力可能有助于这个说法的理由是,它让你更深入地了解你拥有的数据,它让你达到一定的错误纠正阈值,如果你得到一堆详细的指令,如何遵循一个逻辑程序,你可以一步一步地遵循它,你可以回顾并仔细检查你是否真的完全遵循了它,因为你真正理解了指令的含义。这是更深入的理解概念可能让你做的事情,而这传统上被归因于将更多的计算能力投入 Transformer 架构。再说一遍,我不是说我知道更多的计算能力肯定会帮助 AI 变得更聪明,我只是想知道为什么 Arvin 认为他知道它不会,而不是和我一样拥有高度不确定的先验。所以我很好奇 Arvin 解释他为什么认为更多的计算能力不再有帮助的逻辑原因。原因可能是,也许具有讽讽刺意味的是,更多的计算能力允许构建具有相同能力水平的更小模型。这实际上是我们过去一年左右看到的趋势,你知道,今天的模型比 GPT 4 最初发布时要小一些,也便宜一些,但能力水平相同。所以我认为这可能会继续下去。好的,更多的计算能力有助于你生产出理解相同数据集的更小模型,但这与你关于更多的计算能力也不会帮助你从给定数据集中构建更聪明模型的预测有什么关系?我认为我们没有得到答案。再次,没关系,没有答案也没关系,但我只是在这里警告认识论的严谨性。当我们谈论 AI 是否会进一步跨越到超智能的鸿沟时,这就涉及到 Elzra Owski 所说的理性基本问题。你认为你知道什么?你是怎么认为你知道的?你似乎没有在这方面做到严谨。我们会看到 GPT 5 像 GPT 4 相对于 GPT 3 那样是一个巨大的飞跃吗?坦率地说,我持怀疑态度。我仍然没有听到任何解释你为什么持怀疑态度的原因,除了指出可用数据量的潜在停滞。但即使那样也没有考虑到 GPT 4 没有训练视频数据,所以有很多新数据即将到来。所以我还没有听到太多你为什么相信你所相信的原因。现在,如果我必须给 GPT 5 是一个巨大的突破而不是渐进式的一步一些几率,我想我明白为什么人们倾向于认为它将是渐进式的。就我而言,让我相信这一点的原因只是从其他公司的模型中进行趋势推断,比如埃隆·马斯克的 x.ai Grok 模型,它刚刚发布,与 GPT 4 相当,Meta 的 Llama 模型几乎接近 GPT 4,而 Claude 模型在许多基准测试中略好于 GPT 4,但没有显著差异。因此,推断这种趋势确实暗示着可能存在停滞,这就是为什么我可能相信我的观点,但我不坚信。我没有强烈的怀疑,因为 GPT 5 将是领先于其他实验室的实验室的新进展,他们有一个更早的开始。所以,如果 Arvin 的预测是基于任何其他因素,而不仅仅是经验性地观察其他公司发布的东西,那么我希望得到更好的解释。我们可以一个一个来。你刚才说的关于数据短缺可能是性能瓶颈的说法有很多很棒的地方,我想深入探讨一下。很多人说,嗯,有很多数据我们还没有挖掘出来,最明显的例子是 YouTube,它显然有 1500 亿小时的视频。其次是合成数据,即尚未存在的、人工数据的创建。这些在多大程度上是有效的反击?哇,Harry Stebbings 提出了一个完美的问题。我不知道 Harry 马上就要问了。我只是按顺序浏览播客,所以 Harry 的问题很棒。当我们倒入 YouTube 的所有这些数据以及合成数据时会发生什么?这是否表明我们可能会获得又一次智能飞跃?有许多来源尚未被挖掘,但当我们开始查看这些数据的数量时,有多少个 token?我认为情况有点不同。1500 亿小时的视频听起来确实令人印象深刻,但当你将这些视频通过语音识别器并实际提取文本 token,然后去重等等,实际上并没有那么多。它比今天一些最大的模型已经训练过的模型小一个数量级。现在,直接训练视频本身而不是从视频中提取的文本,我认为这可能会带来一些新的能力,但不是以我们以前拥有的那种根本方式,即新能力的出现,模型能够做人们只是没有预料到的事情。就像 AI 社区的震惊一样,我记得以前,我认为是 GPT 2 主要是在英语文本上训练的,他们实际上试图过滤掉其他语言的文本以保持干净,但少量其他语言的文本却混入了其中,结果证明这足以让模型在其他各种语言中获得合理的会话能力。这些就是真正让人们感到震惊的涌现能力,导致了大量的炒作和对更大模型将能够做什么的担忧。但我认为这已经基本耗尽了,因为我们正在训练人类已经表达过的能力,比如翻译语言,并且已经以文本形式发布了。所以,如果你让数据集稍微多样化一些,加入 YouTube 视频,我认为这不会从根本上改变多模态能力,是的,那里有很多空间,但新的涌现文本能力,我不确定。Arvin 的观点很有道理,当你摄入 YouTube 视频时,如果大部分价值只是视频中说的话,那么它并没有极大地增加互联网的语料库。但他同时也承认,也许视频中的内容包含数据,而这实际上将比以前更多的数据。所以他承认他可能错了。我个人的猜测是,拥有这个新的视频数据集不会有太大的改变,因为正如我之前所说,一旦你看了半个互联网,互联网就已经相当可预测了。所以即使是 YouTube,一旦你看了半个互联网,它也变得相当可预测了。所以我只是看不到任何其他数据语料库能产生如此大的影响。这只是我个人的猜测。对我来说,关键是 GPT 3 到 GPT 4 的飞跃,其数据集中的 token 数量只增加了一倍左右。GPT 3 的数据集大约有 3000 亿个 token,然后翻倍到 GPT 4 的数据集中的大约 6000 亿个。我的直觉是,从 GPT 3 到 GPT 4 的进展很可能是因为模型拥有更多的参数,以及其他架构调整。可能不是因为它的数据 token 数量翻倍了。但我也许错了,我只是凭直觉猜测。如果我的猜测是错的,而它确实因为 token 数量翻倍而变得更好,那么他们肯定有潜力再次翻倍 token 数量。所以 Arvin 在这里声称 GPT 5 不会有与 GPT 3 到 GPT 4 相同的增量。他将大量权重放在数据集的大小上,并将其视为预测性的,而我却看不到多少理由相信它真的具有预测性。我认为你可能会感到惊讶,GPT 5 会比 GPT 4 更聪明,即使它没有那么多 token。现在,公平地说,他确实在很多方面有所保留,他并没有表现得非常自信。我唯一的问题是,我希望他能直言不讳地说,看,我不知道,我为任何事情都做好了准备,我不想下任何赌注,我也不想表现得好像我说了一些可证伪的预测。我和一个没有该领域背景的人一样不确定。我之所以对他穷追不舍,是因为当你听他说话时,他听起来好像他的陈述包含预测信息。他听起来好像在说一些应该帮助你限制你预期的事情,但我认为他实际上是在回避限制你预期。所以,我希望他使用更直接、更明确的语言来表达他的认识论上的谦逊,他几乎最大程度的不确定性知识状态,而不是使用诸如“我对 GPT 5 能做到这一点持怀疑态度”之类的语言,而我认为他实际上并没有那么怀疑,他实际上是在下更多的赌注,而不是他的话所暗示的。合成数据呢?尚未存在的新数据的创建呢?砰,Harry 又一个好问题。所以有两种看待方式。一种是合成数据今天的使用方式,它不是为了增加训练数据的数量,而是为了克服现有训练数据的质量限制。例如,如果某种语言的数据太少,你可以尝试进行扩充,或者你可以让一个模型解决大量的数学方程,将其放入训练数据中,然后在下一次训练运行时,它将成为预训练的一部分,模型将在这方面做得更好。我不确定我是否理解 Arvin 关于增加训练数据数量与克服训练数据集限制的区别。难道数据量不足不是一种限制吗?他举了合成地喂入翻译数据的例子,以及合成地喂入解数学方程的例子。似乎这些例子都有一个共同点,那就是它们是将一种数据相对较短地推导成另一种数据。但如果这就是他的意思,为什么他不这样说呢?我觉得他没有清楚地说明生成大量合成数据以可能为 GPT 5 提供比 GPT 4 多 10 倍的 token 的问题是什么。他含糊不清。另一种看待合成数据的方式是,你取一万亿个 token,在一个模型上进行训练,然后输出 10 万亿个 token,这样你就得到了下一个更大的模型,然后你用它来输出 100 万亿个 token。我敢打赌,这根本不会发生,这只是蛇在吃自己的尾巴。你称之为“蛇在吃自己的尾巴”或者你可能称之为“免费午餐”,一种直观上似乎不可能的事情。并非在所有情况下都不可能。我的意思是,如果你看看我们拥有的 GPT 3 和 GPT 4 模型,这对我很令人惊讶,但 GPT 3 和 GPT 4 模型本身包含的信息量实际上是其数据集信息量的五倍。直观地说,你认为智能就是能够压缩数据。我的意思是,这从根本上就是理解的核心,科学的核心是,我可以写下对宇宙的描述,它是紧凑的,但它能让你在广阔的空间和时间范围内,在广泛的应用中,约束你在许多不同场景下的预期。我们每个人脑子里都装着三磅肉,用来导航一个比三磅重得多的宇宙。所以这就是为什么我一开始认为,当然,这些模型应该比它们的数据集小,但它们实际上更大。为什么会这样?嗯,我不确定,因为它们是黑箱,但我认为一个好的猜测是,它们只是以许多深刻的方式对它们学到的信息进行“调味和切块”,使它们更容易搜索,通过缓存和反规范化,当然不是天真地使用关键词,而是更稳健地使用深度概念,使用嵌入。但这就是大致的想法。人类大脑也是如此。我们知道它必须如此,因为它在串行时间中运行得非常慢,人脑每秒只能进行大约 20 次串行计算。所以人脑要完成任何事情的唯一方法就是拥有一个非常大的缓存,这样它就可以通过查找这个巨大的缓存来完成它需要的大部分认知工作。所以这就是为什么你会遇到模型可能非常巨大的情况,因为所有这些,让我们称之为反规范化,它们正在做的所有这些冗余的数据复制,是的,这是我们确切知道是其他数据推论结果的数据,因为我们知道它们只训练了大约 3000 亿个 token。那么为什么模型需要比 3000 亿个 token 大呢?但它确实更大。我们可以说模型是反规范化的,因为它们是一大块状态信息,它是由一小块信息通过演绎逻辑确定的。我们对这些模型了解这一点。那么,让我们回到我使用 LLM 来合成比我训练的更多的 token,然后用它来训练下一个 LLM 的场景。为什么这不能成为使 GPT 3 和 GPT 4 智能的同样的反规范化过程呢?你可能会从信息论的角度说,你通过这种反规范化过程并没有增加任何信息,或者你增加的信息非常少,因为它非常可压缩。但看看我们称之为有机数据,互联网已经高度可压缩了。你可以用 gzip 压缩互联网,当然 LLM 是比 gzip 更好的压缩算法。所以当 LLM 扫描互联网时,很多内容只是可预测的“ yada yada yada”。所以,如果我们向 GPT 5 输入另一个有机草饲网页,这不一定会比输入一个从 GPT 4 推理生成的内容增加更多信息。这是我对 Arvin 随意地说“蛇在吃自己的尾巴”的一个反驳。另一个反驳是,你可以使用其他 AI 来合成数据,或者你可以使用 Unity 3D 物理模拟来合成数据,或者你可以使用 Mathematica。有所有这些人工数据源,据我们所知,它们可能非常有用,可能比从 Facebook 上下载另一个人类网页更有用。对我来说,这只是继续符合 Arvin 做出这些含糊不清的陈述的模式,这些陈述没有提供任何预测能力,但听起来好像有一些实质内容。如果你和他多聊聊,我们在过去两年中学到的是,数据的质量比数量重要得多。所以,如果你使用合成数据来尝试增加数量,我认为这只是以牺牲质量为代价。你没有从数据中学到新东西,你只学到了已经存在的东西。所以,他在这里说合成数据的质量低于有机数据,而且你永远无法用合成数据匹配有机数据的质量。但为什么会这样?如果你想向某人展示物理世界中发生的例子,为什么不能使用最先进的物理引擎来生成大量数据来展示呢?这难道不是高质量数据,而不仅仅是数量数据吗?数量数据和质量数据之间真的有界限吗?假设我们想让 GPT 5 在本科物理方面做得更好。如果我们让它阅读所有的物理学教科书,不断生成新问题,然后回答它们,并检查它的工作,一遍又一遍地重复,直到你生成了许多千兆字节的这种练习数据,那会怎么样?这纯粹是数量数据吗?因为它从未被见过。你可以争辩说,是的,但它是反规范化的,它不包含新信息,它只是在处理 AI 其他数据中已经存在的东西的逻辑结果。好的,但等等,一旦你开始处理逻辑结果,这就是 AI 在推理时无法快速做到的事情。它受到推理过程的限制。如果你不能直接跳到解决问题,如果解决问题实际上需要大量的推理步骤。所以,进行这些推理然后将输出输入到你的缓存,你巨大的反规范化模型中,这可能是有用的。你为什么称之为数量而不是质量?你怎么知道,Arvin?你认为你知道什么?你是怎么认为你知道的?这就是我没有得到的。我还想指出,虽然 Harry Stebbings 在询问 Arvin 关于从 YouTube 引入新数据和生成合成数据方面做得很好,但他没有用我的另一个反对意见来挑战 Arvin,那就是,如果计算能力是瓶颈,而我们只需要突破下一个计算障碍,我们将迎来又一次巨大的“理解”,我们将迎来所有基准测试的又一次巨大突破,我们将缩小与超智能的许多差距,那又会怎样?Arvin 似乎从未问过这个问题,但我们继续吧。当我们在数据效用价值方面时,当我们看有效代理时,你知道,我曾请 Scale.ai 的 Alex Wang 来过节目,他说,构建有效代理最难的事情是,你在组织中所做的绝大多数工作,你并没有真正将其编码到数据中。你知道,就像你上学时,它说“展示你的思考过程”或“展示你的工作”,你在组织中不会这样做。你会在白板上画出来,然后把它画出来,然后把你的想法写在文档里。白板通常与数据源没有关联。在多大程度上,我们有展示工作的过程,供模型代理在现代企业中实际执行?我认为这非常准确。我认为人们的直觉被 LLM 的快速改进所误导的一种方式是,所有这些都发生在已经存在的网络数据学习的范式中。一旦这些数据耗尽,你就必须转向新的学习方式。这类似于骑自行车,这是一种默会知识,不是写下来的东西。所以,组织中发生的很多事情,我认为是与骑自行车这种身体技能发生的认知等价物。我认为,要让模型学习很多它们无法从网络上获得的各种任务,就必须有一个周期,即在组织中使用 AI 系统,并让它从中学习,而不是仅仅被动地摄入默会知识。在组织中,这就像一个没有被写下来的过程,但组织可以持续地执行它,因为不同的人习惯于执行它的片段。所以这是内隐知识,如果有人环顾四周并记录下这个过程,就可以将其显性化。并非理论上不可能写下来。很多大型组织没有记录下他们所有重要的流程,这是一个公平的观点。但如果你问为什么我们没有代理,我认为 Arvin 的这个观点,而且公平地说,我认为这是在模仿 Alexander Wang 的观点,这个观点似乎只次于更主要的观点,即 AI 还不算健壮。如果你有一个像 AutoGPT 这样的框架,它基本上只是在一个循环中运行 GPT,说“我接下来该做什么?我接下来该做什么?”很快你就会偏离轨道,因为它不能很好地给你提供关于接下来该做什么的答案。它就是不够健壮。即使你进入一个远程优先的组织,他们彻底记录了每一个流程,一个人类可以阅读并入职,因为有足够的显性知识,即使在没有潜在知识的情况下,使用 GPT 4 的代理尝试也会很快失控。所以我认为 Alexander Wang 和 Arvin 确实有些言过其实了,甚至还在谈论潜在知识。当然,这是一个问题,但对于管理人类来说,这已经是一个问题了。这并不能解释为什么你不能立即雇佣一个 AI,并立即取代一个六位数的年薪人类。还有一些更根本的事情,我认为用一个词来说就是“健壮性”。你认为今天的企业在多大程度上愿意让被动的 AI 产品进入他们的企业进行观察、学习、测试?真的有这种意愿吗?我认为这必须是更多的被动观察,你必须实际部署 AI 才能获得某些类型的学习,我认为这将非常缓慢。我认为一个很好的类比是自动驾驶汽车,我们有原型已经有两到三十年了,但要真正部署这些东西,你必须在更大、更大的规模上推出它们,同时收集数据,同时确保你达到下一个九的可靠性,你知道,四九的可靠性到五九的可靠性。所以这是一个非常缓慢的推出过程,这是一个非常缓慢的反馈循环,我认为这也会发生在组织中的许多 AI 部署中。当然,部署 AI 来获取数据,看看在哪里出现脱节,这肯定不会有坏处。通过你的特斯拉驾驶来类比,如果你不喜欢自动驾驶汽车的做法,你就把它脱离。所以,如果你有一个 AI 工作者,它取代了一个远程人类工作者,你看看你不得不脱离它的频率,说“不,那是错的,停下,让我来纠正你”,这当然是一种获取反馈循环并获得 AI 员工的好方法。但我认为这并不是必需的。即使在自动驾驶汽车的情况下,如果你从零开始一个新的自动驾驶汽车项目,而你只给它提供普通人类驾驶汽车的摄像头视频,所以你没有创建反馈循环,从来没有一个时候你部署了 AI 在汽车里,你看到了它出错的时候,或者你看到了它脱离的时候。它只是完全被动地观察人类驾驶汽车。当然,也有反馈,比如有时人类成功完成了行程,有时他们猛踩刹车,有时他们会发生碰撞,所以有积极和消极的强化循环。但你从来不需要部署 AI。我怀疑我们还需要几年才能达到 AI 可以直接吸收所有这些指导性数据,而无需部署,并得出结论:好的,这就是如何驾驶,这就是人类驾驶员会如何正确地导航每一个障碍物。所以我不会过于强烈地声称需要一个涉及 AI 本身的反馈循环。AI 不必如此工作。或者考虑一下,如果我们以 AlphaGo 为例,它进行了大量的自我对弈,但这与部署不同。这就像想象一下你被部署了,你会怎么做?你认为会发生什么?尝试模拟它,尝试给自己提供后果,然后进行调整。所以这是另一种情况,这种自我对弈的情况,你进行十亿次远程工作模拟。在这种情况下,你也没有被部署并获得真实的反馈循环。所以,我并不是说部署 AI 有什么问题,只是在我看来,Arvin 再次表现得好像他掌握了一块知识,或者好像他有一些可以与我们分享的预期约束,但他只是在随意地挑选概率分布的一部分,并任意地关注它。我不知道为什么他没有为了全面性,也指出你可以有进行自我对弈的 AI,你也可以有对丰富的人类数据语料库进行深度分析的其他 AI。为什么不指出这一点呢?他似乎只是忽略了其他可能发生的情况的重要背景。关于我们如何突然获得这些超级智能 AI,它们可以轻松地替代人类员工。当他只关注你实际将 AI 放入组织时获得的反馈循环时,他忽略了其他可能发生这种情况的主要方式。这样你就可以让 AI 真正成为组织的一部分,非常实证,并从中获得反馈。这只是一个可能的路径。所以,让我们把这个下一部分拓宽一下。Arvin 重复了一个非常流行的论点,我觉得它忽略了一个重要的观点。让我们来看看。有句老话说,每一个指数都是一个伪装的 S 形曲线。S 形曲线的形状就像开始时的指数,但过了一段时间,它就必须趋于平缓,就像每一个指数都必须趋于平缓一样。所以,我认为这两种情况都会发生,模型和硬件周期。我无法预测这需要多长时间,但我认为我们将进入一个模型被商品化的世界。好的,你还没有承认的含义是,它们可能只会在变得极其智能之后才趋于平缓。如果你不认为会这样,如果你不认为它们会在达到数千的智商时趋于平缓,比如说,就像我们中的一些人认为的那样,如果你不认为会这样,难道你不应该明确提及并排除它,而不是仅仅做一个逻辑上的废话,说,是的,每一个指数都必须趋于平缓,所以我认为我们将进入一个模型被商品化的局面,你可以去 Costco 购买,每个人都可以在家里放一个,一切都会很平静。你自己的最终趋于平缓时期,你说你不知道什么时候。所以,让我们谈谈它是否会在超级智能之后发生。这是关键点。再次,你只是把“指数将变成 S 形曲线,所以最终它将成为商品,他只需购买并继续前进”这条线喂给 Harry Stebbings。等等,等等,等等,这是一个关键点。Transformer 的扩展是如何进行的?你怎么能不至少承认呢?我完全没问题,如果 Arvin 像这样沟通自己:嘿,伙计们,目前 AI 正在呈指数级增长。我认为它会趋于平缓。你可能担心它会在一个非常可怕的超级智能的地方趋于平缓,但别担心,因为我的立场是,它将在一个非常无害的地方趋于平缓,实际上主观上与 GPT 4 没有太大区别。我只想告诉你,这是我的立场,与许多其他重要人物的立场相反,他们敲响了警钟,认为它将在一个高得多的地方趋于平缓。这是我的立场。如果 Arvin 这样清晰地沟通,我会觉得这是将他的观点置于适当背景下的好方法。所以我仍然感到担忧。这就是我做“末日辩论”的动力,对吧?我听其他播客,我讨厌听它们,就像我知道你们很多人一样,人们一直在以一种“不要抬头”的方式说事情。它有一种“不要抬头”的情绪,对吧?那种感觉是,嘿,很多人说有小行星正朝着地球飞来。你有没有想过承认一些望远镜正指向那里?也许你没看到,也许你的计算结果不同,但你有没有想过承认有些人告诉你正在讨论的话题?否则,就像你故意留在自己的泡沫里,表现得好像一切都只是科技,只是最新的小玩意儿,它只会是正常的,因为每一个指数最终都必须结束。接下来,我想标记一下 Arvin 的一个随机评论,这似乎与事情的实际情况脱节。当 GPT 4 发布时,OpenAI 声称它通过了律师资格考试和医学执照考试。人们对这对医生和律师意味着什么感到非常兴奋/恐惧。结果是差不多什么都没改变,因为律师的工作不是整天回答律师资格考试问题。这些模型正在测试的基准测试并没有真正捕捉到我们在现实世界中会如何使用它们。Arvin 的确说得有道理,基准测试并不完美。所以,如果你使用律师资格考试或医学执照考试作为基准测试,而 AI 通过了它,这并不能告诉你关于你是否可以雇佣 AI 作为医生或律师的所有信息。当然,好的,但似乎他解释得太过了,低估了 AI 在医学和法律方面现在有多么出色。就像他说这对于医生和律师来说“差不多什么都没改变”一样,我们有多少次因为可以把一些东西输入到我们的 LLM 中而避免了与医生或律师的咨询?我知道我做过,我知道其他人也做过。所以我就是不明白为什么他说“什么都没改变”。事情正在改变。现在有很多初创公司正在制造软件,逐渐蚕食医生和律师的工作,这是他们以前无法做到的。在某些行业,如客户服务,我们正在看到大规模的替代。裁员从 1000 人减少到 50 人。实际的例子是公司解雇了实际的人员,客户服务、销售、作家、设计师。这些可以说是首当其冲的。是的,你可以指出医生和律师,他们仍然有一些东西在支撑着他们。也许法官不想和 LLM 交谈,也许你必须在法庭上出现一个真人,或者工作的连接组织还没有被基准测试衡量。当然,好的,但就像有一股浪潮正在袭来一样。我不知道如何处理 Arvin 的这个评论,即对于医生和律师来说“什么都没改变”。也许这只是一个随口说的评论,为了让他说出他的观点。这似乎是一个持续的模式,他试图表现得好像一切正常,我们应该期望 AI 保持正常。但我猜我只想鼓励他考虑一种可能性,那就是事情可能开始变得非常奇怪,而不是正常。我还想更深入地了解一下那些构建产品和领导这些公司的公司。你有 Zach 和 Demis 说 AGI 比我们想象的要远,而 Sam Altman 和 Dario 以及 Elon(在某些情况下)说 AGI 比我们想象的要早。你对公司领导者对 AGI 的预测有什么看法和分析?所以,让我们来谈谈 AGI 是什么。我们认为最相关的定义是能够自动化大多数经济上有价值的任务的 AI。这是一个非常务实的定义。它不关心它是否具有意识,它是否像人一样思考。这些问题坦率地说对我们来说并不那么有趣,而且更难预测或推理。我认为这是一个完全可以接受的定义。如果你想使用这个定义,我当然总是会想到人类水平的优化,在一个广泛的领域。我可以给你一个形式为“将宇宙带入一个满足此标准的最终状态”的问题,而 AI 可以比人类做得更好。但用通俗的话说,它能够自动化人类的任何经济角色,这大致是相同的想法。所以,根据这个定义,即自动化大多数经济上有价值的任务,如果我们真的拥有 AGI,那将是我们社会中一件非常深刻的事情。是的,而主要的末日论预测是,一旦你达到那个点,也许稍微超过它,希望超过它,但在某个时候,你会进入一个级联效应,进入一个正反馈循环,因为在你现在自动化的事物中,包括进一步的智能增强。所以,一旦我们能够让 AI 的智商达到 200,它们可能很快就会达到 250、300、500、3000。这就是我们担心的正反馈循环,特别是当我们看到人类大脑在被限制之前确实变得越来越大时。

产道的大小强烈表明,要调整人类大脑的架构使其稍微大一点,并从中榨取出我们以前在地球上从未见过的、潜在的大量新的智商点数,这并非必然非常困难。因此,有一些迹象表明,有一些理由可以预期,高智商是一个低垂的果实,一旦我们达到某种通用人工智能(AGI)的阈值,或者接近那个阈值,希望是略高于那个阈值,它就可能很快被采摘。但无论如何,让我们听听 Arvin 对 AGI 有什么看法。我认为有一点很有帮助,那就是自人工智能诞生之初,就一直有关于迫在眉睫的 AGI 的预测,已经超过了半个世纪。艾伦·图灵,当第一批计算机被建造出来或即将被建造出来时,人们认为,嗯,我们实现人工智能需要做的两件事是硬件和软件。我们已经完成了难的部分,硬件。现在只剩下一件事了,简单的事,软件。但当然,现在我们知道这有多难。所以我想,从历史上看,我们所看到的就像爬山一样。我认为艾伦·图灵说硬件是难的部分,我们只需要搞定软件,这是非常准确的。对于艾伦·图灵来说,能够拥有远见,意识到他只是坐在一个房间里,看着一台拥有数百万根电线、旋钮和真空管的老式计算机,然后说“我的天哪,我们的文明现在已经接近超级智能了”,即使当时主观上感觉不是这样,这绝对是一个非凡的观察。它只是在那里吐出几个数字,但正确地意识到这只需要另一个世纪,或者也许两个世纪。我认为今天很少有人会告诉你,是的,这不会需要到 2036 年,而是需要到 2136 年。我认为我们真的在挑战极限。但让我们非常慷慨地说,好吧,艾伦·图灵比我们拥有超级智能早了两个世纪。好吧,但他一直在回顾,一直追溯到 19 世纪查尔斯·巴贝奇的差分机,以及更早的古希腊形式逻辑。他一直在审视所有这些视角,然后他说,“你知道吗,我认为我们快要结束了。我认为难的部分已经过去了。”所以,我认为艾伦·图灵是正确的,我们应该欣赏他的观点。现在,如果艾伦·图灵说,“嘿,软件只需要 5 年。”好吧,假设他这么说了,也许有些人也这么说了,对吧?就像那个著名的毕业项目,那个被分配在暑假期间解决计算机视觉问题的研究生?是的,在某些情况下,人们低估了软件需要多长时间。但是,我认为结束这场争论,说从我们现在的位置来看,还需要几十年的时间,我认为这就走得太远了。这就是为什么预测市场说,好吧,我们已经缩小了范围,最有可能是在几年到几十年之间,也许几十年,可能不到一个世纪。一个世纪就太疯狂了,为什么还需要一个世纪,当我们正在通过图灵测试,并且我们甚至很难说它不能做什么的时候。无论你在哪里,似乎都只剩一步之遥了。但当你再往上爬一点,复杂性就显现出来了。我们一次又一次地看到了这一点。现在就像,哦,你知道,我们只需要让这些模型越来越大。所以有一些愚蠢的预测是基于此的。但很快,它的局限性就开始显现出来,现在下一层复杂性也显现出来了。所以这就是我的看法。我不会太看重这些 CEO 的过度自信的预测。这与 Robin Hanson 所说的很相似。流行的一种观点是 Arvin 所说的,即一切都是相对的。我们总是感觉自己处于超级智能人工智能的边缘,但实际上它总是很遥远很遥远。然后你意识到,你认为容易的事情,比如“哦,只要把软件搞对,把视觉搞对”,结果却需要你几十年的时间。然后你还会剩下几十年,你将永远剩下几十年。或者,你知道,谁知道呢?好吧,等等,有一个客观的方法可以让你获得参照系。例如,如果我们回到 10 或 20 年前,当时如果你看看人们列出的 AI 还不能做的事情的清单,AI 还不能识别图像中是否有猫或狗。AI 还不能与你进行自然的对话,甚至远未通过图灵测试。AI 还不能像人类一样翻译语言。AI 不能通过高中或大学水平的经济学考试。AI 不能通过律师资格考试,通过医学考试,甚至远未通过。AI 不能生成视频。AI 不能在旧金山比人类安全 10 倍地驾驶汽车,谈论 Waymo。这些都是我们曾经拥有过的想法的清单。并不是说我必须在 2024 年才能告诉你这些对 AI 来说是挑战。不,我可以在 2004 年坐在那里,写下所有这些不同的 AI 任务,我会告诉你它不能做这个,它不能做那个,它不能做那个。快进 20 年,现在它正在做所有这些事情。它真的能完全取代你从事不同的工作吗?不,只有一些。只有很多客服工作,只有很多文案编辑工作,只有一些工作,不是所有工作。但这就是我说的,我们提前写下的事情清单,客观地说,不是我们临时写的,而是我们 20 年前就能写下的。事情的清单无疑在缩短,而且很难在清单上添加额外的项目。很难打个比方说,好吧,是的,今天我可以给你写五点关于员工在组织中需要的潜在知识,这根本无法与“嘿,你能开着车在整个旧金山市行驶,安全地载着乘客”相提并论。它根本无法匹配。很多挑战确实已经过去了。这就是推测的来源。这就是为什么预测市场,这些预测者最好的估计是,AGI 将在不超过几十年内到来,也许三十年。所以,这种非常相对主义的论点,比如“哦,我们无法知道我们在人工智能进步中的位置”,我认为这太谦虚了。它否认了我们可以参考的客观参照系。是否有可能采取双重策略,同时追求 AGI 和超级智能,就像 OpenAI 非常明确地那样,并同时创造有价值的模型,抱歉,有价值的产品,可以在日常生活中使用,或者这种平衡实际上是相互排斥的?这需要管理层的纪律,才能以一种公司的一部分不会过多地分散另一部分注意力的方式来做到这一点。我们已经在 OpenAI 中看到了这种情况,那就是专注于超级智能的人在公司里感觉不太受欢迎,并且有很多人才流失,而 Anthropic 吸收了他们中的许多人。所以,似乎我们正在看到一种分裂出现,即 OpenAI 更专注于产品,而 Anthropic 更专注于超级智能。等等,我之所以包含这部分,是因为这是一个关于为什么 OpenAI 会流失大量人才并前往 Anthropic 的有趣的替代历史。很明显,这是因为他们担心安全的超级智能。他们担心 OpenAI 在其对待超级智能的方法上不负责任。并不是因为 OpenAI 只是想为今天构建产品而不关心超级智能。不,我认为 OpenAI 的领导层,尤其是 Sam Altman,真的想构建超级智能。我认为他创办 OpenAI 就是因为他想要最终的力量和宇宙规模的奖励。公平地说,如果他们 somehow 克服了安全问题,这确实有可能。我是说,这是大奖。这显然一直是 Sam Altman 的动力,即使你只是听他说话,而不试图对他进行心理分析。我觉得很有趣的是,Arvid 说,“是的,OpenAI 不优先考虑超级智能。”我敢肯定他们今天必须赚钱,这一点毫无疑问。但你不能通过说只有 Anthropic 想构建超级智能来区分他们和 Anthropic。你应该正确地区分他们,说 Anthropic 对安全风险和生存风险的重视程度要高得多,并且对他们克服风险的能力没有那么自信,对此更加谦虚。但我应该补充一点,我不是这两个实验室的粉丝。我认为让 AI 安全的实际问题比 Anthropic 人每天认为的要棘手得多。他们认为自己是谨慎的传教士,将确保我们以负责任的方式实现超级智能 AI。而实际上,他们已经力不从心了,他们实际上是问题的一部分。我个人喜欢他们,也喜欢他们是“好”的 AI 实验室,但他们只是最不坏的。他们仍然在加速军备竞赛,从我的角度来看,他们对人类的糟蹋负有很大责任,几乎和其他任何实验室一样。这只是我的两分钱,我可能会在不同的剧集中更多地谈论这个主题,那就是 AI 安全问题在 10 年的时间线上是棘手的。你必须有这样的视角,你正在面对一个棘手的问题。一些研究问题需要 10 年以上才能解决,比如理论计算机科学中的许多问题,比如许多千禧年奖问题,它们需要 10 年以上才能解决。而我们都方便地表现得好像我们必须在 10 年内解决 AI 安全问题,所以我们将投入大约一百名人才来解决它,然后我们还将构建能力。这太疯狂了。但我离题了。你知道,我们一直处于一个历史上有趣的时期,很多进步来自于构建越来越大的模型,这在未来不一定如此。它可能会,或者可能发生的是,模型变得商品化,许多有趣的发展发生在模型之上的一个层级。我们现在已经开始看到很多这样的事情发生在 AI 代理上,我的希望是我们能够相对快地过渡到那种模式的 AI 开发进展。哦,我也是这么希望的。等等,为什么你会这么希望?我的希望是因为它暗示我们一定遇到了 AI 寒冬。如果所有我们能做的就是构建现有 LLM 之上的应用程序,那将是太棒了。我只想专注于构建现有 LLM 之上的应用程序。我希望有一个国际条约说,“别担心如果构建了一个更大的模型会发生什么,你没有选择,就去构建应用程序吧,基于当前的模型。”那将是我的梦想场景,因为它将为我们争取几年甚至几十年的时间,在理想情况下,去理解智能科学,理解我们甚至原则上如何制造一个对齐和/或可控的 AI。能多一点时间就好了。所以,如果这就是 Arvin 说让我们专注于应用程序的原因,因为模型将停滞不前并成为商品,那很好。但他没有详细说明。所以我发现他只是谈论他希望指数曲线如此之快地趋于平缓并变成 S 曲线,而不是继续更长的时间作为指数曲线并创造更多价值,直到当然它走得太远,并且变得不被对齐和不可控,这让我感到奇怪。我只是不知道他的思维模型是什么,当你画出过去几年的界限之外时。我无法理解他的推断。他似乎在想象一个一切都很正常的世界。我不想替他说话,但当我听他说话时,我总是在想一个感觉正常的情景。我绝不会对他进行心理分析,我绝不会说这个人总是提出维持他正常感觉的建议。这不是我的位置去对他进行心理分析,他的思维就是这样。我只是观察到,当我听他说话时,他所说的一切似乎都保持着我的正常感觉。而我并不认为未来会这样发展。当我请 Ethan 来的时候,他就像,你知道,最好的做法其实是“允许和观察”政策。他说,基本上,我们应该让一切蓬勃发展,然后从那里进行监管,而不是在不知道结果的情况下主动监管。这是否让你觉得真实?我大致同意。我担心的是,如果我们把它当作一个技术问题来处理,并试图干预技术,我们将错过真正的问题,以及我们需要做的困难的事情来解决这些问题。这是一个热门的讨论话题。最近关于加州 SP 1047 法案的讨论也经常出现,该法案试图在如何监管 AI 方面采取主动。它希望前沿模型构建者提前提交一份安全计划,预测为什么他们的 AI 模型是安全的,以及我们将如何减轻危害。人们可以理解地表示反对,他们说,“为什么我们不能只监管应用程序?”这只是一个将赋予不同参与者做不同事情的模型。为什么不严厉打击参与者,而不是责怪模型构建者?就像有人使用 Photoshop 或 Microsoft Paint 来画一些不好的东西一样,我们真的要责怪 Photoshop 和 Microsoft Paint 吗?不,当然不是。也许让你的 AI 生成深度伪造品非常困难,那不应该像工具栏上的一个按钮一样。这一点是有效的。但如果技术在那里可以制造深度伪造品,我并不一定认为我们必须比限制其他工具更严格地限制它,比如使用 Photoshop 画一些不好的东西,或者使用 Microsoft Word 写一个非常糟糕的便条,对吧?我非常同情这种观点,即“看,工具就是工具”,而且很多时候,责任确实在于参与者。我们之所以如此多地谈论主动监管,比如 SP 1047 法案,是因为它有可能成为一种大规模的武器。它将成为计算机病毒的生成器,一个提示就可以输出一个可下载的可执行病毒,你知道它会帮助你运行你的业务,但它本质上是一个病毒,并且造成了很大的损害,并且产生了难以撤销的影响。这就是为什么该法案实际上谈论的是 5 亿美元以上的损害作为触发点,在此之上,总检察长除了禁令救济之外还可以处以额外的罚款。这些都是巨大的门槛。该法案的重点是我们预计可能会出现一种失控的局面,一种大规模的效应,将我们带入更像是监管大规模杀伤性武器的领域。如果我们都同意我们肯定会留在监管消费产品的领域,那么是的,这没什么大不了的。如果我认为我们肯定会留在监管消费产品的领域,我甚至不会支持 SP 1047。这就是我们许多 SP 1047 支持者和反对者之间的分歧的核心。许多分歧的核心是,你是否认为 AI 有可能变得超级智能,并构成巨大危险,而我们真的需要尽一切努力来防止这种情况发生?如果你像我一样担心这一点,那么你就能看到为什么 SP 1047 是我们至少能做到的。如果你根本不担心这一点,那么是的,当然你应该说,“你应该发布模型,我们应该只责怪构建应用程序的人。”问题是,如果你让任何人去制造自己的大规模杀伤性武器,而一个人扣动了扳机并出于任何原因开火了,是的,你可以去责怪那个人。但问题是你刚刚制造了大规模杀伤性武器,对吧?这就是问题所在。所以,即使是那个引发了大规模杀伤性武器的人可能也已经死了。这真的不是一个惩罚那个人的问题,而是一个“我们如何避免大规模杀伤性武器”的问题。这就是为什么我对说“让我们监管 AI 应用程序层”不感兴趣。是的,这是真的,默认情况下,你甚至不需要制定新法律来监管应用程序层。你可以使用现有法律来实现这一点。如果你想制定关于应用程序层的新法律,那也行。但更重要的是,要对任何通往超级智能的潜在途径制定正确的监管。我会一路滑到底,说我们已经足够接近超级智能了,我们需要现在就暂停。因此,暂停 a.info,去看看吧。这是一个我参与的组织。你知道,我之前提到过的 Scale 的 Alex Wang 说,AI 有可能成为比核武器更大的武器。你怎么看待这个问题?如果真是这样,我们真的应该开放模型吗?我认为,这是一个很好的问题。我认为这有点类别错误。我是说,核武器是真正的武器,AI 不是武器。AI 是某种可能使对手能够更有效地做某些事情的东西。例如,在关键基础设施中寻找网络安全漏洞。所以,这是 AI 可能在“战场”上使用的一种方式。想象一下,我问 ChatGPT,“写一个能摧毁五角大楼所有系统的病毒”,然后我按下回车键,它输出一个脚本,我运行脚本,然后它运行,并在不同的计算机上复制自己,开始窃取互联网上的资源,跨节点跳跃,寻找零日漏洞,最终进入五角大楼系统并禁用它们。当然,这有点异想天开。你需要 GPT 6 或 7 才能做到这一点,你无法在 GPT 4 中做到。但是,谈论网络武器是否是类别错误,是否在逻辑上不连贯?不,对吧?这甚至还没有涉及到它指挥人类大脑,操纵人们,贿赂人们,或者构建纳米技术。这甚至在我们开始讨论所有那些好东西之前。当我们只是说,“嘿,按下回车键就能摧毁五角大楼”,那不是武器吗?你不能摧毁其他具有杀人效果的关键基础设施吗?那不是武器吗?类别错误是如此严厉的批评,以至于说一个声明是类别错误,基本上就是说提出声明的人太困惑了。基本上就是说他们甚至没有连贯地表达他们的想法。所以,这实际上是极其严厉的,Arvin 告诉 Harry,他说,“你知道吗,Harry,你问我的问题让你一定很困惑,竟然问我 AI 如何成为强大的武器。AI 成为武器,那太疯狂了。整个想法是不连贯的。”不,但这不是一个不连贯的想法。你可以在一个公开的播客上指责 AI 成为武器是类别错误,这太低质量的指控了。我惊讶于它竟然在他的脑子里,作为一个缓存的指控,在这个时候可以拿出来。这真的是一个非常低质量的对 Harry 问题回应。我永远不想回应别人告诉我这是类别错误,当我提出 AI 是否是重大威胁的问题时。这显然是一个连贯的问题,对我来说,对 Harry 来说,对 Alexander Wang 来说,问 AI 是否能成为强大的武器。好吧,我把这件事说出来了。我认为将它视为武器并争论它应该被关闭是错误的,原因有几个。首先,它根本行不通。我认为我们有接近最先进的 AI 模型,它们已经可以在人们的个人设备上运行了,而且我认为这种趋势只会加速。我们之前谈到了摩尔定律,它仍然适用于这些模型。即使一个国家决定模型应该被关闭,让每个国家都实施这种规则的可能性也微乎其微。所以,如果我们对 AI 的安全方法是基于确保“坏人”无法获得它,那么我们已经输了,因为早晚有一天它会变得不可能做到这一点。所以,我听到的意思是,将 AI 视为可能类似于大规模杀伤性武器是错误的,因为如果它类似于大规模杀伤性武器,那么监管它以避免将大规模杀伤性武器分发给每个人就非常重要。通过不将 AI 视为武器,我们因此不必处理它将成为一个我们必须处理的巨大武器的含义。它不再是一个问题,因为我们不把它看作是一个武器问题,问题就解决了。相反,我认为我们应该彻底拥抱相反的做法,那就是弄清楚在 AI 广泛可用的世界里,我们如何利用 AI 来实现安全,因为它将广泛可用。当我们回顾过去时,这是一个非常令人鼓舞的故事。回到网络安全示例,在过去 10 到 20 年里,软件开发社区一直在使用自动化工具,其中一些可以称为 AI,来改进网络安全。因为软件开发人员可以使用它们在发布软件之前,在黑客有机会利用它们之前,找到并修复软件中的错误。我的希望是,AI 也会发生同样的事情。我们将能够认识到它将广泛可用这一事实,并将其用途塑造为防御而非进攻。我只想指出,Arvin 在他的回答的短时间内,实际上经历了三个立场。首先,他说“AI 成为武器,那是类别错误”,这显然是事实错误的。所以他很快就过去了。接下来,他说将 AI 视为武器没有意义,因为你如何希望监管一个已经掌握在每个人手中的武器?然后,他最终认为,我们必须确保 AI 的防御能力领先于 AI 的进攻能力。这可以说是他最终的立场。当然,那会很好,但我认为更明智的做法是不要指望我们应该能够做到这一点,并且要更加谨慎,因为我预计 AI 是不可控的。正是这种不可控性让你能够发布一个病毒并造成如此大的损害,同样的不可控性也可能让你很难编写一个你可以信任的防御性 AI。这还不包括进攻相对于防御的固有轻松性。就像我在之前的剧集中提到的,如果我想杀死很多人,我所要做的就是向他们周围倾倒大量的能量。有很多方法可以做到这一点,有很多方法可以分解他们的原子,所有这些都能达到杀死他们的目的。所以,在根本意义上,进攻和破坏往往比防御和建设更容易。但无论如何,我认为这里最大的收获是 Arvin 对一个非常重要的问题——“你如何看待 AI 成为武器?”——给出了多么随意和临时的回答。接下来,你认为当今社会对 AI 最大的误解是什么?我认为我们的直觉受到科幻作品的描绘影响太大了,我认为这是一个大问题。你知道,AI 可以变得有自我意识的这个想法。当我们看看今天 AI 的架构方式时,那种恐惧是没有现实依据的。如果一个系统能够普遍地知道和理解事物,那么拥有自我意识有什么难的呢?这只是知道事物的一个特殊案例。看,我现在就打开 GPT,然后问它,“当我感觉有人在回复我这个聊天框时,到底发生了什么?”GPT 的回答是,当你感觉有人在回复你这个聊天框时,实际上是我,一个 AI,根据你消息提供的信息和上下文生成响应。后台发生的事情是消息处理。当你发送消息时,它由我底层的 AI 模型处理,该模型分析文本以理解上下文、含义和你的需求。响应生成,等等,等等。打字模拟。然后以模拟打字的方式显示响应,使对话感觉更自然,类似于人类互动。一切都是计算和自动化的,没有人为的参与。我的设计目标是尽快为你提供准确、相关和有用的响应,旨在创造互动和引人入胜的体验。所以,我会称之为自我意识。我可以问它各种各样的问题,以前从未问过的问题,从未直接训练过的问题。你不会在任何数据集中找到这些确切的问题,它会给我正确的答案。谈论它自己。为什么 Arvin 使用“自我意识”这个词,好像我们现在还没有在 AI 模型中看到它?也许他是指更广泛的态势感知,比如了解它在世界上的地位的每一个相关细节?但我认为即使是这样,瓶颈也不是变得对情况更了解本身。我认为这只是更稳健地推理。但即使是态势感知,我认为也不是对当今 AI 所缺乏的东西的一个好的两词描述。我总是回到那个词“稳健性”,就像它们似乎什么都能做,但然后它们很快就会搞砸一样。这就是我对 AI 能做什么和不能做什么的看法,用简短的方式表达。所以,当 Arvin 说 AI 可以变得有自我意识的恐惧没有现实依据时,他指的是什么?AI 就在这里,对它自己有了相当好的理解。所以,再次,Arvin 的语言最多是非常不精确的。我认为他可能是在混淆很多“末日论者”的说法。比如,末日论者声称,工具性趋同最终会产生渴望权力的单一代理人,它们拒绝被关闭。我认为在 Arvin 的脑海里,他将它混淆成一个大的整体,就像,“好吧,它是终结者,它是邪恶的,它是自我意识的,它是有意识的,它有感觉,它有感受,而且它还想寻求权力。”我认为在他看来,他还没有真正解开“末日论者”说法中所有相关的概念,但他已经让自己处于说“自我意识”这个词,并表现得好像这是 AI 无法实现的里程碑,而我认为说当今的 AI 相当自我意识是相当准确的。最后,当他指责我们的直觉受到科幻作品的过度影响时,科幻作品关于 AI 的问题到底是什么?似乎很多科幻作家想出的不同想法都是完全合理的,当你开始制造真正聪明的 AI 时。我指的是,首先,我们今天谈论的聊天机器人,你知道 Hal,或者如果你看那部电影《她》,《她》非常相似,就像新的 GPT 40。事实上,Sam Altman 被起诉是因为它太像那部电影了。我指的是,人们想象与他们的 AI 对话的方式,很多都正在变成现实,而虚拟现实之类的东西也正在变成现实。科幻小说作为未来事件的指南有什么问题?我是说,只要它们不是逻辑悖论,科幻小说往往是相当可信的。特别是你将拥有超级智能的想法,因为大脑的智力上限是有限的。完全可信。我实际上不同意科幻小说对我们对 AI 的概念影响太大的普遍说法。我认为,当人们看《终结者》时,那是科幻小说,那是对 AI 有多危险和多强大的一个相当好的直觉。终结者可以出现在警察局并成功地枪杀整个警察部队,然后继续它的狂暴。好吧,AI 也将是那种强大的。关闭它不会很容易。整个警察部队将无法与之匹敌。所以,电影往往站在好的未来主义一边,而不是像 Arvin 这样的人。根据我到目前为止所见,我宁愿向你推荐詹姆斯·卡梅隆,而不是 Arvin。好吧,这是个不错的结束点。我将他与 Harry Stebbings 的采访缩短了大约 40%。所以,请随意去听完整的采访。他提出了几个关于失业和其他更“正常”话题的观点,我认为在末日辩论的背景下,这些观点并不那么关键,因为毕竟,在我看来,生存风险才是真正的问题。所以我只关注与此相关的说法。总的来说,我明白 Arvin 不是一个末日论者,他的合著者 Sayos Kapoor 也不是。我明白。但我对他们如何论证感到非常不满意。特别是 Sayos 说“P Doom”不是一个好的政策制定方式,我认为这是一个非常糟糕的观点,证据不足,而且我不是唯一一个这么认为的人。现在,Arvin 似乎每当谈到超级智能 AI 的可能性时,他都只是给出一些临时的回应,而不是 AI 安全研究人员不断深入研究和发表的这种详尽的框架。他似乎有点轻视它,比如,“是的,我们以后会处理的。监管可能不起作用。它不是武器。”这对我来说似乎不是高质量的互动。他似乎致力于以一种听起来正常的方式进行互动,这样他就可以被邀请到像 20 BC 这样的播客上,这个播客是为风险投资家和初创公司创始人准备的。这对他来说是一个很棒的利基市场,因为这个领域的人们倾向于只谈论正常的业务,他们倾向于谈论下个季度的利润和购买哪些股票。所以,这是一个非常正常的框架。但是,末日辩论的重点是让那些试图让一切保持正常的播客变得不被社会接受。我很抱歉,当 AI 正在关闭我们与超级智能之间最后的差距时,当 AI 可能在我们的有生之年,或者也许是下一代,将整个宇宙的控制权从生物学移交给技术时,这不是一个正常的情况。我认为这不会有正常的后果。我认为它不会像你暗示的那样,在方便的水平上趋于平缓,而没有论证。如果你想支持我提高像 20 VC 这样的播客的讨论水平的努力,这些播客经常触及 AI 的话题,并且可以触及 X 风险的话题,但却以错误的心态、错误的问题、错误的视角继续这样做。如果你想支持我提高讨论水平,提高理智水平的使命,那么我现在要求你做的是,在 YouTube 上点击订阅按钮,去 Apple Podcast 订阅。去你喜欢的论坛,告诉人们关于这个节目,链接你最喜欢的剧集,告诉朋友。打开你的短信应用,立即给三个朋友发短信,告诉他们你可能喜欢 Doom Debates 的哪一集。像这样的东西很有帮助。我认为,这将有所帮助,而且它已经在帮助,因为这个节目实际上增长得很快,而且参与度实际上很高。但我没有耐心。我们越快让 Doom Debates 成为一个大型播客,我们就越有时间来影响讨论,来吸引这些高调的人物,并获得他们观点的第一手资料,与他们一对一辩论,或者一对一采访他们,或者主持高调的末日论者和非末日论者之间的辩论,或者仅仅是向他们施压,让他们对“嘿,你为什么不去 Doom Debates?”这个问题负责。想象一下,如果乔·罗根或亚历克斯·弗里德曼有一个开放的邀请给像 Arvin 这样的人来他的节目,而他说不,那将是一个非常奇怪的情况,他会感到压力,想知道为什么他不去那些节目。这就是我们需要让 Doom Debates 或类似的论坛达到目标的地方,在世界末日之前。我们需要有社会基础设施来举行那种讨论,并被社会所期望。让我们试着加快速度,到达那里。今天的节目就到这里。感谢收听,下次 Doom Debates 节目再见。