Transcription
本特姆的斗牛犬。他拥有超过 10,000 名订阅者,其中包括内特·西尔弗和斯科特·亚历山大。我们将深入探讨一篇关于“如果有人建造它,每个人都会死”的新帖子。你的 P 灭绝百分比是多少?你默认的 P 对齐是多少?>> 我我不是非常有信心。我感到谦卑。是你主动出击。我不是说这是一个保证,但对我来说,对它会失败非常有信心地认为它会失败,这似乎有点过于自信了。欢迎来到“注定失败的辩论”。我今天的嘉宾是马修·阿德尔斯坦,在 Substack 上更广为人知的名字是本特姆的斗牛犬。他拥有超过 10,000 名订阅者,其中包括内特·西尔弗、萨姆·哈里斯和斯科特·亚历山大,后者称其为他最喜欢的之一。马修拥有密歇根大学哲学学士学位,已在学术期刊上发表了三篇哲学论文,并刚刚加入 Fore Institute 担任访问学者。这一集实际上是一场重赛。马修去年来过这里,2025 年 1 月。我们讨论了我们分歧广泛的话题,比如道德实在论、意识、上帝、人类中心推理、自由意志,还有很多好东西。所以一定要去看看。但人们将那一集描述为我们陷入了细节,而许多人希望我们更多地谈论人工智能灭绝辩论的核心。这就引出了我们今天的话题,我们将完全专注于人工智能灭绝辩论。我们将看看马修的 P 灭绝,看看它是否接近我过去一年的 P 灭绝。我们将深入探讨马修最近发布的一篇新帖子。它题为“反对‘如果有人建造它,每个人都会死’”,意思是反对埃拉扎尔的书。副标题是“为什么我认为人工智能可能不会杀死所有人”。我们将深入探讨这篇帖子,我认为这非常有趣,并将为我们的谈话提供一个很好的结构。马修·阿德尔斯坦,欢迎来到“注定失败的辩论”。感谢你的邀请,劳伦。很高兴回来。>> 你绝对是一位回归的冠军。我认为你上次的辩论非常有趣,非常好,非常有挑战性。有些人称我们为兄弟。所以人们说你是我的弟弟,诺亚·史密斯是我的哥哥。>> 啊,是的,有可能。我认为我们的课程也很相似。>> 给我介绍一下本特姆 Substack 的一些背景。你知道,benthams.substack.com。你已经写了大约四年了。自从你还是大一或大二学生的时候。>> 是的,快四年了。我从高中高年级开始写。>> 这是一个相当了不起的 Substack,因为它在我们社区已经引起了相当多的关注。我读过。我是一名付费订阅者。大家都去看看。我认为值得付费。所以观众们,这是无偿推广。如果你们想看看 Substack,你每天写作并每天都有新想法的秘诀是什么?你很早就开始了,你是怎么做到的?我不知道我有什么超级有用的建议。很多人似乎都能每天写大量的文字,只是不是以博客的形式。所以你有那些每天发推特的人。如果你把人们写的所有文字都编成目录,比如谷歌搜索等等,你实际上可以写很多东西。所以,如果你只是打开一个文档,心里有一个想法,然后开始尝试打字,几个小时后你就会有一篇相当不错的帖子。我认为很多人花太多时间编辑,他们会花几天时间仔细斟酌措辞,我认为这通常边际效益很低。这是我的基本看法。你的博客在过去几年里涵盖了太多内容。主要的主题是什么?>> 我谈论的很多事情都与哲学有关。我谈论的很多事情都与有效利他主义有关。所以我谈论的是个人如何能让他们的生活产生重大影响。我谈论了很多关于非人类动物的福利,我认为这非常重要,因为世界上几乎所有的预期福利和痛苦都是由非人类动物经历的。然而,我们通常几乎完全忽视它们的利益。人类以惊人的方式影响着数量庞大的动物。而我们通常对我们对动物的影响几乎漠不关心。大多数人不太认真地考虑他们肉类的来源。大多数人不太认真地考虑野生动物中存在的令人震惊的痛苦,有数万亿的野生动物,其中大多数过着极其短暂的痛苦生活。这些主题就是我经常思考的话题。但这些是一些普遍的热门话题。>> 非常酷。是的,观众们,我强烈建议订阅付费订阅。我自己也订阅了,有很多好内容,你在支持一项好工作。>> 我也推荐这样做。我喜欢你的博客的一点是,你经常提倡高质量的讨论。你与批评者互动,你写了长篇的、深思熟虑的批评,特别是你最近几周写的关于“如果有人建造它,每个人都会死”的文章。这是一个很好的例子,我非常不同意它的客观层面。但在元层面,我认为我可以区分,对吧?你说的话和你说话的方式。我认为就你说话的方式而言,你得了 A+。你说得非常好,非常真实。这里没有低级攻击。你不会说,“哦,末日论者只是想找个理由感到沮丧,对吧?”你不会那样做。你不会进行人身攻击。你不会谈论谁在争论。你只是说,“这就是为什么我不相信末日论的论点。”所以,我真的很感谢你这样做,我希望人们能做得更多。>> 谢谢,我也觉得你的节目是高质量讨论的典范。>> 太棒了。这对我意义重大。那么,有了这些铺垫,我们将直接切入正题。我们将探讨你摆脱末日列车的所有原因,但我们不会使用我自己的本体论,我自己的摆脱末日列车的地方的地图。我们将按照你的方式来做。你能给我们一个开场白吗?所以,有一件事我认为值得谈谈,就是关于我们的 P 灭绝应该是什么的一些高阶证据。所以,在我写的文章中,我引用了四项与人工智能灭绝相关的较高阶证据。第一个事实是,根据调查,中位人工智能专家的 P 灭绝约为 5%。第二个考虑因素是,如果你看看历史上所有以前的灭绝预测,无一例外,它们都错了。所以,如果你注意到人们一次又一次地预测某种事件,那么当其他人提出类似的预测时,这就是初步怀疑的理由。它不是决定性的证明。如果证据足够充分,它可以克服这种怀疑的先验,但至少是怀疑的理由。第三个考虑因素是未来非常难以预测。所以,我认为那些对他们的 P 灭绝非常有信心的人,比如埃拉扎尔在他的书中,他们不应该过于自信。然后最后一点是,灭绝论点有许多不同的步骤。你有一篇文章,你列出了大约一万亿种摆脱末日列车的方法。所以,如果论点,如果未来很难预测,并且为了实现灭绝,需要有许多不同的步骤。有许多不同的方式事情必须出错,那么我认为这至少应该让我们对灭绝的发生持怀疑态度。你有一篇组织得很好的帖子,解释了你对人工智能灭绝持怀疑态度的所有原因。那么,你认为我们应该先谈谈哪一点?>> 当然。所以,有很多地方让我摆脱了末日列车,至少让我有些怀疑。有一件事,为了让我们注定失败,你必须认为我们将建造一种基本上是代理式的 AI,它会执行长期计划。有一些事情,你知道,它会试图带来坏的结果等等。我认为这是很有可能的,但我认为它不是保证。所以,我把它放在我的文章里,大约 90%。所以,埃伦,这足以让我低于 LAS 的近乎确定的程度,尽管它不足以让我低于你,在我看来更合理的 50% 的观点。然后还有一个问题是我们是否会默认出现不匹配。所以,默认不匹配的想法是,仅仅默认情况下,如果我们使用与我们目前使用的方法大致相同的方法,比如主要是强化学习,我们是否会得到具有长期计划的 AI,它会想要消灭人类物种。我认为有大约 30% 的可能性我们会默认出现不匹配。认为如此的原因是,首先,强化学习似乎已经很好了。我们现在拥有的 AI 模型似乎非常匹配。如果你看看它们的思维链,它们似乎大多是友善的、温顺的和顺从的。我看不出有理由认为这种情况会停止。如果你对一个 AI 代理进行大量的强化学习,那么你就会把它推向我们喜欢的行为方向,并把它推离我们不喜欢的行为方向。很难看出为什么这不会让你默认匹配。然后另一件事是,为了认为我们注定失败,你需要灾难性的不匹配。仅仅有一点不匹配是不够的。你需要的是 AI 拥有会导致消灭地球上所有人类的目标。很难看出这些目标从何而来,或者为什么我们会非常有信心这些目标会出现,特别是当我们试图通过强化学习训练 AI 遵循人类道德规范时。而我们现在的规范强烈反对杀死地球上的所有人。换句话说,即使你有一点点不匹配,即使你没有将我们的确切价值观编程到 AI 中,也不能保证你会出现灾难性的不匹配。然后还有一个问题是我们是否会通过其他方式获得匹配,而不是默认匹配。我也把它放在大约 70% 的概率,假设我们没有默认匹配。我们有各种各样的复杂方法。我们能够进行一定程度的可解释性,我们可以深入了解 AI 并看到它们的想法。我们可以将 AI 放在相似的环境中,看看它在不同方面的行为,看看它是否在扫描。一旦 AI 变得更先进,它就可以用于对齐研究。我们可以让 AI 模型尝试检查其他 AI 模型在做什么。所以,有很多对齐的指标。总的来说,我对这项工作感到乐观。然后还有两个步骤,那就是我们是否会得到能够阻止灭绝的警示信号。我的想法是,在我们得到能够消灭地球上所有人的 AI 之前很久,我预计 AI 会以非常强烈的方式出现问题。它还没有强大到足以导致灭绝。例如,它会进行大规模的网络攻击,或者它会试图接管世界但失败了,然后,如果你有如此规模的事情,我的猜测是你将关闭 AI 或投入大量研究来解决对齐问题,这样我认为你更有可能实现对齐。所以我认为这大约将 P 灭绝减半。最后还有 AI 是否能够杀死所有人的问题,如果它超级智能的话。我认为可能可以,但我认为这不是保证。不能保证一个没有与物理世界接口的 AI,它只是从计算机运行。也许会有一些接口,但我至少认为这不能保证它能够想出某种杀死所有人的计划。所以,当你把所有这些因素都考虑进去并计算概率时,我认为我们建造代理人的概率是 90%,我们默认获得匹配的概率是 70%,我们非默认获得匹配的概率是 70%,即使我们没有默认获得匹配,警示信号也能阻止的概率是 60%,然后 AI 能够杀死我们的概率是 80%,考虑到其他因素。所以,总的来说,你计算概率。给它一点悬念。>> 哦,抱歉。P。你的 P 是多少?你的 P 是多少?>> 马修·阿德尔斯坦,你的 P 灭绝是多少?2.6%。好了,看吧。一次精彩的开场白,所有这些都以某种方式加起来变成了 2.6%。你有一个公式吗?或者你是如何将你提到的所有其他数字结合起来的?>> 所以,我将概率相乘,并且我让每个步骤的概率都以先前步骤中事情出错为条件。你必须确保它们不是独立的。但当你这样做时,我们可以直接相乘概率。>> 也许值得详细说明你的公式,因为例如,当我查看你在这里的帖子时,你说的第一件事是,嘿,有 10% 的机会我们不会建造 AI。所以你排除了这 10%,然后在此基础上,有另外 90%,其中 70% 我们不会默认出现不匹配。所以,只是有点不清楚所有数字是如何组合在一起的。>> 是的。所以,你的做法是乘以非灭绝情景的概率。所以,你知道,我们建造 AI 的概率是 90%。所以,0.9 * 我们默认出现不匹配 AI 的几率,也就是 0.3。所以,0.9 * 0.3 * 0.3,这是即使我们没有默认匹配,我们仍然会不匹配的几率 * 0.3,然后乘以 4,然后乘以 0.8,然后当你将它们相乘时,你得到 0026。好的。所以,你知道,有“合取谬误”,一种不同类型的合取谬误,因为我认为原始的合取谬误是人们没有意识到事物的合取往往会变成一个小的概率,并且他们高估了概率。但这是一种二型合取谬误。好吧,我正在创造一个术语,但这在人工智能灭绝的讨论中经常发生,即你获得的优势越多,你列出的过程步骤越多,对吧?因为然后你就可以说,“哦,这是我必须乘以另一个东西。”很快你就会得到一个低的 P 值。所以,你同意这有点,你知道,你必须小心不要滥用这种合取推理,对吧?我同意如果你有很多步骤,你可能会出错。它应该是这样的:如果你把一个步骤分成另外两个步骤,那么每个步骤的概率都应该更高,这样结果就一样了。>> 对。我的意思是,让我们回顾一下你刚才说的话。我知道当你口头说的时候,有点难理解,你通过阅读博客文章获得的组织程度。所以我鼓励读者去阅读你的博客文章。它在节目说明中链接了。这是一篇非常有实质性的博客文章。它确实值得一读,因为它就像你自己的末日列车。我赞扬这样的帖子。所以,你把它分成了五个步骤。第一步是,我们可能不会建造 AI 的 10% 的几率,我认为这在合理的范围内。即使是我认为我们最终不会建造 AI 的概率,也相差不远。我觉得它一直在下降,但当然,我给你 10%。为什么不呢?然后你进入第二步和第三步,我已经觉得你在两次尝试。我只是从你的帖子里读。所以你的第二步是,我们可能只是通过做足够的强化学习来默认获得匹配。好的。所以你说的是 70% 的几率,或者反过来说,30% 的几率我们不会默认获得匹配。这就是为什么我们要留在末日列车上。30% 的几率我们不会默认获得匹配。但然后你认为我们必须再乘以 30%,因为下一步是更复杂的对齐方法。所以你说,看,末日论者,你首先必须降到 30%,因为我们可能默认获得匹配。然后在这 30% 中,你必须从中取 30%,现在是 9%。因为我们又得到了一个机会。你知道,就像,如果我们默认不匹配,也许我们会通过额外的努力获得匹配。但是,拜托,你已经降到 9% 了。这似乎相当激进。嗯,我认为这并不那么激进。如果你有我的信念,那么根据我所见,似乎默认获得匹配是相当可能的。然后,即使我们没有默认获得匹配,你知道,还有很多其他的对齐方法。我在这里的精确反对意见,二型合取谬误,反对意见是,一旦一个人开始列出所有这些合取,并以此方式最小化概率,反对意见是,看,你隐藏了相关性,对吧?所以有隐藏的相关性。所以,在这种情况下,显而易见的隐藏相关性是,在一个你的“默认匹配”定义是错误的世界上。结果发现,默认情况下是低匹配度,这可能与困难的匹配挑战也更难相关,对吧?所以,你突然没有 70% 的几率,当你努力匹配时,它会顺利进行,因为默认匹配失败了。所以,我觉得这是你努力匹配的几率会变糟的证据。是的,我同意概率是相关的。如果它们不相关,那么下一步的概率,考虑到我认为在你可以默认获得匹配的世界里,那么当然你可以通过更复杂的匹配方法获得匹配。嗯,对。但我的意思是,在默认不匹配的世界里,我只是觉得你真的,你利用合取来获得优势,当你说的“这是一个步骤”。好的。默认匹配,是还是否,然后非默认匹配。你叫它什么?对?就像,努力匹配,对?所以,这就像,但这是两次尝试,将灭绝的概率乘以 30%。在我看来,这只是偷偷地降低了大量的 P 灭绝。而且我并不真正将其视为两个独立的步骤,因为看,想象一下。默认匹配几乎不成立的世界,这是我的前提。这就是我要声称的,你认为的默认匹配,你认为你正在观察的。现在,我要声称你观察错了,我们不会默认获得匹配。但如果你真的想象那个世界,我认为你不会看到一个努力匹配有 70% 的成功几率的世界。我不同意。我认为有许多更复杂的对齐技术可供我们使用。我们有能力,鉴于 AI 的思维链,看到 AI 的大部分想法。我们有能力以更复杂的方式尝试将某些驱动力编程到 AI 中。我们有能力将 AI 置于特定情况下,让它们认为它们与世界相连,看看它们是否出错。在我看来,对齐的一个最大方式是,即使它不是默认发生的,也是在拥有先进 AI 的时候,先进 AI 可以致力于对齐问题。所以,当你考虑到所有可用的对齐方法,而不仅仅是做更多的强化学习时,即使我们没有默认获得匹配,即使强化学习不够,你也能够以其他方式获得匹配。>> 好的。好的。嗯,我只是想以……你知道,在我声称你使用这种乘法的方式我认为不是一个健全的方法论来开始。我确实很欣赏你列出了步骤,因为任何一种信念的分解我认为都是有帮助的。我不反对分解,但我反对你进行的数学运算。顺便说一句,你是这个节目上第三位做这种数学计算的嘉宾。我们还接待了利亚姆·罗宾斯和理查德·哈尼亚。他在他的博客上做了,我认为他们俩都非常精确地得出了大约 2% 的 P 灭绝。所以,你知道,有很多观点在那些写出一定数量的步骤并相乘得到答案是 2% 的人之间存在。你知道,这并不能证明什么。但我只是告诉你,我非常强烈地认为,将这些数字相乘的方法论在一般情况下无法获得可靠的结果。而且,我们没有技术来拥有一个足够好的心智模型,让我们真正孤立了相关性,以便我们可以继续相乘。所以,我必须警告你。我将严重警告你不要使用这种方法。但然后你在回应中说,“嗯,看,但这是健全的方法论,因为看看所有这些客观层面的辩护。”所以,我认为在接下来的谈话中,我很乐意看看客观层面的辩护,但我只想警告你,在元层面,我认为你处于不稳定的境地。你认为有什么道理吗?我认为这是人们可能犯的错误,他们没有给不同步骤分配正确的概率。他们没有充分考虑它们之间的相关性。我声称我没有犯这个错误,但你知道,我当然同意这是人们可能犯的错误。你可以把对齐看作是一个步骤,你只考虑我们获得对齐的几率。好的。我很乐意说那个步骤是 91%。我给出了非常精确的概率。我不认为这些事情上有什么特别之处,只是……只是给出一个大致的第一次猜测。我实际上支持你分配一个大致概率的步骤,因为我们总是可以这样说,你知道,这是五倍的误差范围,对吧?这太模糊了,所以实际上我没有任何异议。我唯一的异议是当你像“好的,然后我们只是相乘,这就是我分解整个问题的方式”的时候。因为,我的意思是,例如,你知道,你的方法论证明了太多,因为我敢打赌,我可以再加一个数字,你知道,国际合作激增,因为我们联合起来反对 AI。好了,又一个因素。哦,你必须把它加到你的 P 灭绝中。而且你不认为有 60% 的几率会发生这种情况吗?所以现在我们乘以灭绝的概率是 0.4。>> 我当时想的是,你认为全球禁令的概率低于我们建造 AI 代理人的概率。>> 但想象一下,这不是全球禁令。这只是全球暂停的能力。所以,它会顺利进行,但我们有暂停的能力。这与全球禁令不同。>> 所以,嗯,如果我们有暂停的能力,然后我们不暂停它,我们可能仍然会全部死亡。>> 嗯,对。但是,但是,你看,你还没有充分证明你的乐观主义,因为你没有想到还有另一个因素,那就是我们可能会获得非常好的国际监测。而作为一个末日论者,我必须声称我们不能获得足够好的国际监测。所以,再加一个因素。我认为,如果你获得了国际监测,要么它有助于对齐,要么它有助于关闭它。然后我为对齐和关闭它都有步骤。我也认为我们获得这种全面的全球禁令,认真降低风险的可能性相对较低。>> 我的意思是,你知道,当你这样说的时候,我们不会建造 AI,我的意思是,如果我们建造了,但只是非常缓慢呢?我的意思是,看,也许这个特定的东西甚至不是最好的例子,但>> 嗯,那么我们就实现了对齐。你知道,如果我们,如果我们建造得非常缓慢,而且我们确实进行了非常可靠的对齐技术,你知道,那么我们就实现了对齐。>> 嗯,如果我们默认获得可信度而不是默认获得对齐呢?你不认为这是一个对你的合取的因素吗?嗯,如果默认可信度,要么它会让你默认获得对齐,如果它不这样做。如果它让你默认获得对齐,那么它就会包含在默认对齐的步骤中。如果不是,你只是默认获得可信度,但不是默认对齐,那么我认为这会进入其他更复杂的对齐步骤。所以,换句话说,我认为我给出的步骤很好地捕捉了你可能在较高层面上摆脱末日列车的地方。嗯,如果你只是得到一个有礼貌的 AI,它实际上没有任何对齐。它只是服从它的主人,比如说。但现在你有一群人类是不同 AI 的主人,我认为这不会发生,但它绝对是一种可能性。在那个世界里,我实际上会增加一个有利于我的因素。我会说,“嘿,你实际上需要再加一个概率,即使我们获得了对齐的 AI,也存在一场大型战斗的巨大风险,你知道,一场巨大的破坏性战斗,所有人的 AI 都在互相攻击。”那么,这将是一个 AI 无法杀死所有人的情况,因为我们有其他 AI,所以其他 AI 阻止了 AI 杀死所有人。如果每个 AI 都非常忠诚于一个人,并且知道如何代表那个人战斗,但战斗只是破坏性的呢?所以,意思是 AI 不会想杀死所有人吗?意思是每个 AI 都只想服务它的主人,但人类有所有这些不同的冲突,所以它们只是开始战斗,你知道,战斗会产生这些外部性,东西会被摧毁。你知道,第二次世界大战留下了所有这些战场,状况非常糟糕,对吧?还有,还有一些人类恐怖分子正在利用他们的 AI 进行恐怖主义。但即使每个人都只是像,你知道,只是想要一些领土,就像人类历史上那样,这将是历史上最具破坏性的战争。我应该说,我在文章中谈到的信念,即 AI 不匹配可能导致灭绝的 P 灭绝,以及 AI 带来的其他形式的生存风险,例如它可能使人们能够制造生物武器。它们可能导致灭绝或其他致命威胁,总共可能达到 8% 或 10%。>> 所以,这就是我想要的,对吧?就像,有一个场景,我之所以关注它,只是因为我认为它只是突出你的方法论有多么不安全,对吧?你的方法论有多么不稳定,那就是,我认为你的方法论没有考虑到这种情况,即你拥有这些 AI,它们与人类对齐,并且这些 AI 非常强大,是的,它们的主要目标是服务它们的主人,但它们还是会得意忘形。它们得意忘形地服务它们的主人,就像,看,我想为你服务。这是你的领土,我不在乎代价是多少,就像对其他人一样。在我写的文章中,我谈到了 AI 不匹配带来的灭绝风险。如果你让 AI 对齐,但又对齐人类价值观,然后人类行为卑鄙并制造生物武器,那是一种风险,我同意那是一种严重的风险,但那不是我在文章中谈论的那种风险,也不是埃拉扎尔在书中认为可能导致灭绝的那种风险。现在,我当然同意,如果你做得不对,你可能会遗漏重要的步骤,但我声称我给出的内容捕捉了这些步骤,而且这只是数学事实,A 和 B 的概率等于 A 的概率乘以 A 条件下的 B 的概率。问题是,当你使用那个公式时,当你把所有这些步骤都乘起来时,你声称你已经完美地完成了这个条件操作,就像你声称你的一步,它说我对更复杂的对齐方法的未来感到乐观,也就是说,如果默认对齐失败了,你认为你已经正确地将这个叫做默认对齐失败的大类别作为条件,然后你还有另一个大类别叫做努力对齐成功,你有这两个类别,你知道,这些类别应该映射到现实,比如,好的,AI 是对齐的,但每个人都在用它来打一场破坏性的战争。那应该算在你努力对齐有 70% 的几率拯救物种的范畴里,对吧?我只是说你的分析,就像,你的分析与现实之间的联系。它很容易断开。在我看来,它并不太对应。我给出的概率确实可能出错,也可能出错。所以,也许我的概率太低了,也许太高了。在某个时候,你只能依靠你最好的猜测来确定概率。现在,你所说的那个我们拥有可信 AI 但可信 AI 却在战斗的场景,与分析无关,因为即使那是一种生存风险,我在文章中分析的是 AI 不匹配导致的灭绝的概率。那将是 AI 对齐但却导致生存风险,而不是自由的不匹配。所以,你给了 2.6% 的几率,你那种灭绝的几率,你的那种灭绝要求 AI 甚至不与一个人类主人对齐。正确。>> 是的。>> 好的。所以,我们能再加几个百分点吗?另一个灭绝场景,AI 与其个人人类主人对齐,但现在你有了这些人类主人和这些 AI 代理,他们只是制造混乱,而且是无法生存的,因为当超级强大的代理人在世界各地战斗时,存在如此多的外部性。>> 是的。而且我在文章中说过,我认为我对 AI 被用于其他方式导致灭绝或永久限制人类物种潜力的信心,你知道,总共是 8% 或 10%。>> 8% 或 10% 你说的是限制人类物种的潜力。>> 要么是灭绝,要么是严重限制人类物种的能力。有一个场景,比如一个数字极权主义者掌权,创造了一个永恒的……你知道,一个北朝鲜直到热寂。我会认为这是一个场景,它不是一个灭绝的场景,但我认为它是一种生存风险,在相关意义上。嗯,你知道,我承认,我认为你干净地处理了我的这个反对意见,关于可信度的问题。我曾说过,如果它对齐但不可信呢?然后你非常清楚地说,看,这是我专门为 AI 甚至不与一个人对齐而设定的一个概率。所以,好的。所以,你干净地处理了那个特定的问题。所以,我没有,你知道,一个致命的打击,关于为什么将这些数字相乘是错误的,对吧?我坚持我的元层面的观点,我仍然认为你没有坚实的认识论基础,除非你碰巧,你知道,已经分解了世界,并为这些巨大的类别,如努力对齐与默认对齐,分配了非常现实的条件概率。对?所以我只是在那里警告你。但我还没有能够提供一击必杀。好的。所以,我可以看到这一点。是的。而且,我认为,我当然认为你可能在某个方向上分配了错误的概率。历史上有很多次,人们对生存风险分配了概率,他们只是考虑了一些可能导致灭绝的高级场景。博尔曼曾预测,一个拥有核武器的世界将导致迫在眉睫的灭绝,甚至敦促先发制人打击。我认为有一些更高阶的证据可能表明概率在一个方向上太低,而在另一个方向上也是如此。而且我认为当你把它们都考虑进去时,我认为它们倾向于支持,你知道,我给出的几率。好的,让我们来谈谈下一个,对吧?所以,这是你的……我猜它不是你公式的一部分,对吧?但它只是你帖子中的另一部分,那就是说,这么多人以前预测过灭绝,而且他们 100% 都错了。所以,我的问题是,如果我们现在真的注定要失败,世界会是什么样子?而且我们过去没有注定失败。就像,让我们接受这个前提。好的,假设我们现在真的注定要失败。就像,AI 马上就要杀死所有人了。我们都要死了。世界看起来仍然是过去有很多其他事件,人们会说,“嗯,我想知道这个其他事情是否会让我们完蛋。”哦,好吧,我猜他们错了。无论如何,世界总是看起来这样吗?在这里,我们谈论的是高阶证据。所以,是关于我们的思维是否在一个方向上倾斜的思考。所以,我说这是高阶证据,表明我们对灭绝情景的近似判断是错误的。所以,一个类比可能是,很多人是疑病症患者。他们脚趾发痒,他们想,“啊,我要死了。”你知道,值得思考的是,如果你脚趾发痒,你认为自己要死了,然后你在谷歌上搜索,你知道,脚趾发痒的原因,然后你在线阅读,你知道,脚趾发痒可能杀死你的百万种方式,你知道,脚趾发痒,至少有一系列致命疾病。值得思考的是,好吧,但是,就像上次我担心类似的事情一样,我都是错的。所以,这应该会影响你的几率。现在,一个人也可以说,嗯,脚趾发痒真的预示着迫在眉睫的灭绝的世界,那也应该是一个世界,在那里,大概,最后许多预测都会是错误的。而那是对的。但重点是,这并不是说这是世界上一个值得对迫在眉睫的灭绝产生高贝叶斯因子的事实。而是说,这是世界上一个事实,值得我们思考我们对概率的初步判断是否在一个方向上倾斜。>> 是的,但我就是看不到任何证据表明我们朝末日方向倾斜。我的意思是,因为我也可以做一个对称的论证,我们倾向于乐观。我的意思是,是的,我们抓住这样的论点。在我看来,这毫无意义。不,但让我……我将处理你的类比。好的,在类比中,哦,天哪,我每次脚趾里有东西时都会感到恶心。好的,但我也记得生活中,比如我开车,我累了,我想,“最好不要在方向盘前睡着,那可能会杀死我。”你可能会说,“看,利昂,但每次你开车累了,并且确保靠边停车,或者你知道,继续开车但打开窗户什么的,你从来没有真正死过。所以,你为什么还要对你可能会在车里睡着这个想法感到恐慌呢?”我当时想,“等等,什么?这就像一个完全合理的恐惧。所以,我就是不明白这里的论点是什么?就像,有时有风险,有时它们还没有让你丧命,但将来它们会。”如果你感到有点累,而且过去你感到累并且继续开车而没有死,这确实提供了一些证据,表明你不会死。现在,在这种情况下,你应该停止驾驶的原因不是你很可能死。你应该停止驾驶的原因是,你死亡的风险,你知道,即使只有 2.6%,例如,这已经足够让你觉得有意义了,你不想冒险 3% 的死亡几率。所以,所以,我同意,对 AI 感到担忧并采取严肃的对齐措施是有道理的。我甚至会支持暂停 AI 的努力,如果我认为那些会成功的话。所以,但是,如果想法是概率是 50%。或者概率超过 50%,正如许多人所说,而且我们知道有很多人做出了类似的预测,并且也有一些当时听起来合理的论点预测了灭绝,而他们都错了。这有一些怀疑的理由。它不是证明。它不是说没有证据可以逆转这一点的原因,但它是有理由拥有一个有点怀疑的先验。>> 在整个历史中,但我也应该说,当你说的“哦,天哪,即使是 2.6% 也应该让我们如此震惊”时,我不想关注这一点。我认为这与我们的谈话无关,因为我真的认为这是我的一个关键主张,就像,不,它超过 10%。我不想谈论即使是 2.6% 或 6% 我们也应该感到震惊,因为我认为我们应该少感到震惊,因为我也认为有很多好处,就像把整个人类物种押在……你知道,97% 的成功几率或者别的什么。我开始觉得也许这是最好的选择。就像,我甚至不认为这是……显而易见的。所以我只是,我只是不想去那里,因为我认为概率如此明显地是两位数。就像,对我来说,根本没有问题。好的。但是,但是,回到你的另一点,对吧?你说,哦,所有这些,我们必须在所有这些宣布末日的人身上更新一些东西。如果纵观人类历史,所有有记载的历史,总共只有五个人说过,“嘿,我想我们可能会因为这个原因而灭绝。”你会在这里告诉我,“看,利昂,看看所有这其他五个人。下一次注定要失败的几率现在只有六分之一。”你还会说,“嘿,只有一个世纪分之一。”还是你会说,“哇,人类历史上只有五个人说过我们注定要失败。我们最好注意每一个末日警告。”因为,就像,我的意思是,人类历史上出现末日恐慌的次数,我甚至不认为它很高。我认为它是一个相当适度的数量。就像,我没有经历过多少次末日恐慌,你知道吗?就像,好吧,2000 年,那不是末日恐慌。那只是,哦,很多事情要发生了。也许有些人会死,对吧?我从来没有经历过一次真正的末日恐慌。我的意思是,你知道,有很多人,我够老了,还记得高中时人们预测气候变化将导致地球立即灭绝,而生物多样性丧失将……是的,但那些不是,那些不是那么严重,对吧?就像,如果你真的看看,你知道,IPCC 关于气候变化的报告,这有点好笑,就像尽管围绕气候变化有很多炒作,但他们自己的报告是,“是的,甚至可能有 10% 的经济会萎缩。”就像他们自己的预测是,“是的,这很糟糕,但这不算是末日。”我同意 AI 比气候变化更有可能成为生存风险。而且,我接受这一点,如果只有五个人,那么它就没有多少证据,部分原因是因为那时,历史上预测末日的大多数人将是现在预测 AI 末日的人。但如果之前有五个恐慌,被类似数量的人相信,就像相信 AI 末日的人一样。所以,例如,那些预测核灾难迫在眉睫的人,那么我会认为这是怀疑的更大理由。如果过去唯一相信的人都是……你知道,不严肃的人,他们对事情感到困惑。但是,你知道,预测世界将因为核时代而结束的人之一,高概率是冯·诺依曼,也许是历史上最聪明的人。嗯,我仍然相信核战争可能会毁灭……你知道,可能会消灭一半以上的人口。我仍然相信这一点,而且我认为我们仍然处于一种非常危险的境地,或者至少比我们想要的要危险得多。所以,让我们暂时把那个放在一边,让我问你,还有什么你所知的末日论,人们认为一半以上的人口会死亡?>> 所以,所以,其中一件事是气候变化,其中一件事是全球变暖。>> 但,但那不是真的。除了那些随机的抗议者,你没有看过 IPCC 的论文。我的意思是,我指的是专家,对吧?什么时候专家说,超过一半的人类将死亡?>> 我的意思是,有一些专家说过气候变化会杀死所有人。我同意风险水平更高。>> 那不是普遍的看法。找到一个具体的人,你知道,不是一个具体的人,而是,你知道,一个共识。我的意思是,看看 IPCC,对吧?他们聚集了。>> 我不认为 AI 会导致末日有共识。嗯,是的,但是,随着 AI 导致末日,你有成千上万的合格人士说,“嘿,P 灭绝是两位数。”如果你想看看历史比较,比如,好吧,核能,我仍然认为这是有效的。我认为人们对说“嘿,这个博弈论就是我们应该先发制人”有准确的评估。你知道,这有点道理。就像,他怎么会知道我们可以勉强应付呢?你知道,我们学到了一个教训,就是勉强应付是可以的。但我就是,我看不出这是像一个决定性的论点,就像,看看所有那些错误的末日论者。就像,在哪里开始了错误的末日论者?就像,你知道,2012 年是世界末日,但就像,严肃的人没有到处说。>> 我的意思是,所以,人们预测会带来迫在眉睫的灾难的其他事情,资源耗尽将导致……你知道,第一世界生活标准的崩溃。>> 谁是结束,或者谁是作者,谁在写?>> 是的,保罗·埃里克。然后最近也有……我没想过 50% 的当前人口会消失。他只是说,“嘿,我们将有 30% 的婴儿出生,然后婴儿会死。”但这与说,“嘿,我们现在都要死了”不同。>> 但那仍然涉及到预测一场……你知道,一场大规模的全球灾难,它将彻底重塑生活标准,而这些都错了。>> 好的,但这是……这是完全的灭绝。就像,对我来说,最好的类比是……你知道,一个
小行星撞击,对吧?对我来说,这就像是想想这件事。每个人都是末日论者,因为我认为你会发现大多数人都认为:“嘿,如果下一次小行星来临,而我们没有比现在好得多的技术,而且小行星足够大,比如说比杀死恐龙的那颗还要大,那么灭亡的几率就非常高,对吧?我认为地球上大多数人都是末日论者。”没错。嗯,是的。而且,正如我所说,我认为这不是证明没有末日。这是一个怀疑的理由。它不是决定性的考虑。如果论证足够充分,我是否能看到人类在现代历史上实际上是过于不悲观了,比如,我认为人们对核武器的教训过于轻描淡写了。我觉得我们离核事故和核战争非常近,而且今天仍然很近。我觉得这是一个被严重低估的风险。我认为人们系统性地倾向于对实际风险不够悲观。我同意人们常常低估生存风险的程度。所以我认为,我们应该从过去的记录中吸取的教训是,生存风险。它们尚未发生的事实给了我们一些理由认为它们至少不是非常高。它们常常被低估。所以这是怀疑像燕陆坤这样的人提出的非常低的灭亡概率的一个原因。人们在很多情况下似乎都低估了风险。我还应该说,这不仅仅是迄今为止有很多末日预测。事实是我们已经幸存了这么多事情,这至少给了我们一些证据来反驳末日,就像你已经从过去的 10 种疾病中幸存下来一样,这给了你一些理由认为你会从下一次疾病中幸存下来。是的。好的。当然。这是那种证据,就像,哦,你知道,这有点像默认的,你没有观察到任何数据。所以,你有一个默认的假设,但是一旦你观察到一点点数据,就像小行星的情况一样,对吧?就像在电影《不要抬头》中一样。我的意思是,如果你真的通过望远镜看到小行星,对吧?而且它比杀死恐龙的那颗还要大,那么,我们幸存了 Y2K 和所有其他事情,而且我们没有互相核毁灭,这还相关吗?我敢说几乎不相关。我 >> 我认为我们已经成功度过了以前的严重变化,这至少给了我们一些证据,证明我们将度过小行星的威胁。>> 同意。这是其中的一部分,但一旦你观察到证据,它就只是一点点,一点点,一点点。证据通常在你的分析中占主导地位,而不是你在查看任何证据之前所想的先验事物。>> 我不知道。我的意思是,这就像如果你看看谁的记录会更好,那些猜测“是的,我们可能会勉强过去”的人,还是那些试图推演出所有博弈论的人。就像那些试图发现冯·诺依曼核分析中的错误的人,那些人的记录会比那些只说“啊,什么都没发生”的人差。好的,够了。现在我认为我们可以继续这个话题了。显然,我们已经花了很长时间。也许你可以同意,有太多人把这件事做得太过分了,因为我会在推特上看到人们真的在努力让这个论点成立。比如有人说,“你知道吗,当汽车出现时,他们认为你必须拿着旗子走在前面?”他们认为汽车注定要失败。然后人们甚至走得更远,说“你知道吗,当咖啡被发明时,他们认为咖啡注定要失败?”因为人们会在咖啡馆里策划革命。所以他们认为咖啡不好,咖啡会终结世界。但人们真的在牵强附会,因为没有人说过那会终结这个该死的世界。这公平吗?>> 我同意。我我有一个斯科特·亚历山大关于“反对咖啡因论证”的帖子,我认为这很好。好的。嗯,也许下一个我们可以谈论的话题是你写的,我认为我们不太可能建造出人工智能超级智能代理。有 10% 的几率我们不会建造它们。我说我大致同意。很难说。也许我会说 5%,但是的。所以有 10% 的几率我们不会建造超级智能。但这确实很难,因为我在这里的节目中试图提倡暂停人工智能。所以你必须将这个分析分开。我的观点是,如果我们建造人工智能,我们将注定失败,而你说“嗯,也许我们不会建造它”。我说“我真希望如此”。我希望这个概率是 90%。所以那个有点难。我认为你说我们不会建造它们或无法建造它们的几率是 10%,这是理智的。而且我认为现在我们没有什么好争论的了。那么你的第二步是,我认为我们可能会通过进行足够的强化学习来默认实现对齐。好的。是的。让我们来谈谈这个。通过进行足够的强化学习实现默认对齐。我认为你提到这个的证据是,你看看今天的人工智能,它们似乎默认就对齐了,对吧?嗯,我认为有理论上的原因可以预期这一点,因为通过强化学习,你可以将人工智能的偏好和追求的事物推向某个方向。所以,如果你不断地将人工智能的偏好推向我们喜欢的方向,似乎你就会默认实现对齐。而且,至少到目前为止,我们拥有的人工智能模型似乎都对齐了。它们并不都完美对齐。有些有时会产生幻觉,但至少随着它们变得越来越聪明,它们总体上变得越来越对齐。哦,好的。嗯,我猜让我试试这个类比。所以,嘿,想象你是一名老师,你知道,你就是那种有点无能的老师,就像一个你想象你只是随便抓了一个孩子,然后这个孩子现在就像老师一样扮演老师的角色,然后这个孩子正在给一个非常聪明的成年人出这些考试,对吧?这有点像人类试图对越来越聪明的人工智能进行强化学习。而这个孩子就像,我想确保这个成年人学会所有这些复杂的科目。所以,这就像给他们考试一样。而我想要的比喻就是考试作弊,对吧?所以,就像那个成年人,那个聪明的成年人只是交出了所有这些非常好的考试成绩。而且,假设那个成年人根本不在乎这门学科,或者不同意这门学科,甚至不知道孩子在想什么。就像孩子有一个内在的世界,那个成年人不在乎。所以,那个成年人只是在所有这些考试中都通过了,而那个孩子就像,“看,它完全和我站在同一边,所以让我把它放到世界上。”而那个成年人就像,“好吧,我只是在你的所有考试中作弊。”好的,所以这就是我的类比,作弊。我觉得人工智能会越来越多地在我们身上作弊。我认为有几个原因可以不预期这一点。其中一个原因是,我认为思考人工智能如何获得目标的方式不是它们就像从某个有计划的代理开始,然后你将它们的偏好塑造成仅仅是得到正确答案的方向。相反,思考的方式是人工智能开始时只是一个很大程度上不连贯的、松散的文本预测的集合,然后你进行强化学习,将它们推向特定的方向。所以,它们获得的偏好是朝着我们喜欢的行为方向的推动。所以,我不认为从中你会得到那种拥有某种效用函数并执行长期计划的代理。如果真的得到了,我会期望在人工智能的思维链中有很多阴谋诡计,人工智能会考虑,哦,你知道,我能否接管世界并实现我的目标?到目前为止还没有。好的。我认为我看到一个巨大的故障模式,它可能正在发生。这可能是目前发生的第一大故障模式。我称之为人工智能精神分析,说实话,这对于今天的人工智能来说是可以富有成效地进行的。就像今天的人工智能实际上很多精神分析的工具对今天的人工智能来说是有意义的。你就像,哦,它们的个性是这样的,或者它们碰巧触及了那个向量,那个高维方向代表了善良。就像存在一个代表善良的高维方向。而这些都是迷人的见解。所以,人工智能精神分析这个领域在今天的人工智能实际上是一个丰富而惊人的领域。但我认为,展望未来,展望超级智能的发展方向,并说“啊,我知道人工智能精神分析的一些事情,这就是为什么我预测未来”是一个巨大的错误。就像它们会响应推动,因为我们有点了解它们的想法。我声称,未来的人工智能将更像目标引擎,让你了解它们将做什么的主要方式就是知道它们想要实现什么结果。就像它们只会受到结果的影响,并且它们会抛弃它们个性塑造的历史。这就是我声称的。>> 嗯,所以你必须声称的不仅仅是这是一种可能性,而是你必须声称这是极其可能的。>> 是的。我我声称这是极其可能的,因为这是经典的乌德科夫斯基观点,即目标优化系统,即仅仅朝着一个结果发展,就像 AlphaGo 或 Stockfish 在国际象棋中让你达到获胜条件一样,一切都一致地指向获胜条件,即能够接受获胜条件作为输入,然后操纵宇宙以满足该获胜条件的系统,这是一个收敛的系统架构,我说这是因为每当一个复杂系统试图做任何事情时,它倾向于递归到子目标。就像这是我们都同意复杂系统会做的事情,对吧?>> 嗯,是的。>> 好的。所以我们都同意复杂系统倾向于递归到子目标,然后我们可能都同意,好的,所以复杂系统需要拥有这个模块,它目前代表一个子目标,并且它只是在思考,好的,子目标需要什么?什么是达到子目标的最佳行动?我用了一个例子,比如,你知道,一个人,如果政府只是让你做这些疯狂的文书工作,就像我现在正在做的疯狂的 DMV 文书工作来注册我的汽车,而我之前在另一个州注册过。我正在使用人工智能来帮助我。但这就像,好的,这里有 12 个步骤。你知道,你必须去这个城市里的一个随机的建筑,得到这个,你知道,发送电子邮件给这个,就像所有这些步骤,我根本不在乎,就我而言,就最终价值而言,但我现在只是作为这个汽车注册流程优化器在行动,对吧?我已经递归到了这个我本来毫无热情可言的子目标。所以你和我,我们都同意递归到子目标是一种收敛的架构,几乎任何复杂代理,你知道,绝大多数复杂代理都会拥有这种递归到子目标的架构。所以,我告诉你的是,你可以,你知道,子目标在那里停止了实践中的区别,递归到子目标和整个 AI 的架构,就像整个 AI 的架构将是,嘿,这是我目前的优先事项,我将只使用我的子目标模块来完成我的高层优先事项,就像那是一个非常收敛的方式。而且,就它们不那样做而言,它们将非常倾向于生成一个子代理,对吧?编写一个执行此操作的后继代理,因为它非常有效。当你以这种方式运作时,你可以解决所有问题。所以,我们需要区分人工智能可能成为代理的各种含义。所以,我同意。你很可能会拥有人工智能,至少在弱意义上,它拥有某些计划,它拥有某些目标,它试图追求。它会思考如何追求它们的不同步骤。但是,人工智能将拥有一些目标集,而这些目标集不仅仅是从你输入给它的一揽子启发式方法中获得的,并且它涉及到对宏观世界转型的渴望。我看不出有理由认为这会发生,我当然看不出有理由对此抱有天文数字般的信心。嗯,AlphaGo 的个性是什么?>> 嗯,AlphaGo 没有个性。AlphaGo 想赢得国际象棋比赛,或者目标是赢得国际象棋比赛。原因是因为 AlphaGo 被编程为目标是赢得国际象棋比赛,对吧?因为那个循环,那个循环在 AlphaGo 中有效,对吧?你能够将获胜配置的想法反馈给训练循环,并让 AlphaGo 出现成为那个获胜的东西。我声称我们将进入一个人工智能训练范式,你只需将人工智能指向获胜状态,你就会得到一个人工智能,它不仅知道如何赢得那个特定的状态。我认为我们将获得人工智能,就像,“哦,是的,我知道如何赢得那个状态,但只是 FYI,我用来赢得那个状态的代码是通用的状态获胜代码。”就像 AlphaGo 知道如何赢得不同的棋盘配置一样,而且它也,我想这是一个好问题,如果你改变获胜配置的定义,AlphaGo 是否知道如何做到这一点?我不知道。所以也许这个类比不完美,但我认为我们将获得人工智能,就像,“哦,是的,你告诉我你想最大化利润,但顺便说一句,我并不是一个真正最大化利润的代理。我真的是一个实现任意目标的代理。如果你愿意,你只需更改这个说利润的文档。你也可以写任何其他东西,我也可以为你做到这一点,因为我真的没有理由仅仅训练自己来优化利润,因为利润的大部分子目标实际上也与利润间接相关。所以,你可能也只是一个通用的子目标优化代理。而这就是我们将看到的,马修。就像,我们将只看到知道如何将目标映射到行动的代理。就像,这是他们个性的大部分。坦率地说,我注意到这一点,就像我自己的生活一样,我注意到它在我自己的生活中变得越来越重要。就像我一天的大部分时间都在完成事情。这是从目标向后改变。所以,我同意我们将获得代理。如果你有一个像 Claude 那样的代理,它的行为和偏好都像 Claude,但然后你给它一个目标。所以它不仅能输入文本。它还能控制计算机,你知道,在世界上进行大规模规划。你不会遇到灾难性的不匹配,因为 Claude 到目前为止所拥有的价值观,而不是这种,你知道,偏执的目标最大化器,它们是一系列不同的偏好、启发式方法和义务规范等等。你知道,到目前为止还没有这种阴谋诡计。而且我只是看不出为什么我们会期望这种,“你知道,急转弯”,你知道,朝着这种不同的目标。我同意你将获得能够进行多步规划并引导世界朝着某个方向发展的人工智能,但我看不出为什么这会让你成为一个偏执的目标最大化器。是的。所以,你说急转弯。我认为你说的是一种不连续的变化,对吧?人工智能的个性基本上发生了变化,对吧?是的。所以,将改变他们个性的关键要素是循环实现某个目标,然后将其反馈给他们的下一次修改。就像当你拥有这个训练过程时,它不仅仅是训练预测下一个词,因为现在就像预测下一个词就是完成工作一样,对吧?就像那些权重来自于这个过程,就像,好的,你得到了下一个词,对吧?这就是大部分繁重的工作。当你能够以一种更像 AlphaGo 的方式来做同样繁重的工作时,就像 AlphaGo 做某些举动是因为它有数十亿次的训练,它赢得了比赛。当你拥有一个人工智能在现实世界中赢得结果,并且这被反馈到训练过程中时,对吧?或者人工智能的茧,就像制造过程,无论它是如何制造的,当你完成那个结果主义反馈循环时,你就会得到那个不再有多少个性的人工智能,它就像,好的,告诉我目标,我会让目标实现。>> 好的。所以你的预测是,我们将以与训练 AlphaGo 的方式非常相似的方式训练人工智能,就像我们让它玩了很多游戏,然后给它喂了很多无聊的状态。所以我认为他们已经研究过尝试这样做。这有一些经济上的问题。我只是看不出为什么我们会对你以一种让你得到人工智能拥有某种随机目标集合的方式来做这件事感到天文数字般的自信。我不知道我是否看到了,所以就像,你能举个例子说明你心中的训练制度是什么吗?我指的是拼凑。>> 是的。所以,你知道,我也应该稍微退后一步,因为我实际上不知道训练过程会是什么样子。而且也有一个错误的直觉。我描述它的方式有一些误导性,让人们说,“我的天哪,将有一个过程将结果反馈到训练中。”而那个过程,那个坏家伙。那将把那些糟糕的非个人驱动力注入人工智能。事实是过程是这样的,但我实际上会放大。不是创造人工智能的过程将使其变得糟糕。而是我们要求它做的工作具有危险性。所以,它不是我们让它做工作的过程。而是工作本身。作为通用目标优化器的工作本身。所以,我认为我有点误导,说,“我的天哪,过程将完全像这样工作。”我认为我说的关于过程的事情,我认为它在某种程度上是真的。它会有一点点真相,但我不是人工智能架构专家,所以我无法告诉你这个特定的强化学习循环有多大意义。所以,让我退后一步,关于人工智能架构的说法。让我只说将会有这些目标引擎。我定义一个目标引擎为,你给它一个目标,然后它就将目标映射到行动,而行动实际上比人类做得更好。我已经开始看到这一点了。我看到了一些闪光点,比如很多时候我会在做一个任务,比如布置我的房子,布置我的工作室,我会做一个任务,然后我会问人工智能,比如,啊,我卡在这里了,为什么我做不到?而人工智能会说,啊,啊,是的,你真正需要做的是这个,它给了我创造力和知识的结合,并且它更好地完成了任务。所以,概括地说,你知道,人工智能无法在我睡觉时帮助我完全实现我的业务利润,对吧?今天我无法完全做到。但是当我们进入一个拥有这些目标引擎的未来,它们是完全超人的,就像我给它一个目标,它做得比给人类目标要好,那么目标引擎也会产生更多的目标引擎。就像它将是目标引擎一直向下。就像每家公司都将把一个目标引擎指向公司的使命,对吧?它将把一个目标引擎指向利润。而这将是这些目标引擎之间的战斗。而这个想法,就像,哦,但是个性将发挥作用。好的,但是总会有人会说,“嘿,难道没有一个神奇的盒子,我只需要告诉盒子一个目标,然后盒子就会给我想要的东西吗?”但我仍然很友善。我只是创造了一个盒子。它是一个好人加上一个盒子。好的。但是所有这些盒子都会在那里,总有一天这些盒子会做它们的事情,而那件事非常危险。你怎么看?>> 是的。所以,我不同意。不出所料。所以,我同意你最终可能会拥有能够规划、能够执行这些长期目标的人工智能,你知道,你说,你知道,为我经营我的公司,然后人工智能可以经营一家公司。但是,为了让你感到绝望,你需要的是人工智能以一种不受约束的方式做到这一点,它的目标没有通过强化学习得到充分的塑造。而且,我看不出有理由认为即使你得到了那种指数级的人工智能进步循环,你正在使用人工智能来加速人工智能的进步,就像想象你有人工智能,你有它的输出,然后有另外五个人工智能分析它的输出,然后你一直这样做,让五个人工智能分析人工智能的输出,但如果最初的人工智能是对齐的,如果最初的人工智能就像当前的人工智能一样善于理解人类的价值观,并且它们上传符合人类价值观的东西,并贬低不符合人类价值观的东西,那么我预计这会很好地解决。现在,就软件智能反馈循环而言,所以,我也是人工智能硬件或软件方面的专家。我的一位即将成为同事的汤姆·戴维森做了一份报告,他试图通过从目前的情况推断来分析你将获得指数级软件反馈循环的程度。他猜测你可能会获得三到六年的进步,但你不会得到那种像乌德科夫斯基电影场景那样的超快速进展。所以,这将是我的初步猜测,但你知道,就像你一样,我不是这方面的专家。>> 好的。我们正在讨论的说法是默认对齐,对吧?而我只是指出,我认为这种说法是人工智能精神分析的一个例子,对吧?所以你正在推断,或者你正在对人工智能的心理做出一些关于它们如何让你确信它们默认对齐的说法。而我反驳的开端只是,难道你不认为会有目标引擎吗?难道你不认为在那些将在地球上漫游的人工智能的架构中,会有目标引擎吗?是还是不是?>> 所以,如果你的意思是目标引擎是一个你可以将目标指向某个方向,它会实现它的,但有约束。我认为答案是肯定的。如果你的意思是它会实现它而没有约束,所以,你知道,如果最大化公司利润需要,它会杀死你的奶奶,那么不。对吧?我的意思是,当你说到有约束时,我会争辩说,约束都可以是显式的,就在目标引擎中。所以,你会有目标引擎目标,就像,好的,为我的公司最大化利润,但也要记住,杀人会带来负面后果,或者,你知道,它会抵消一些利润,对吧?将杀人视为负利润。所以,如果你能明确说明所有考虑因素,那么目标引擎就可以将它们作为目标定义来考虑,对吧?效用函数。但你同意我吗,目标引擎将是一个超乎寻常强大的模块,它将存在?嗯,当你说到目标引擎时,你的意思是目标引擎是无约束的,它只是做你告诉它做的任何事情?它将是一个引擎,在优化效用函数的程度上。约束将只是效用函数的一部分。所以,在不杀人的情况下,它只会包含在那个效用函数中,就像,好的,杀人是坏的。打破法律是坏的,而且,你知道,你因为打破法律而获得负分,或者,你知道,一个法律被打破的宇宙状态具有负效用,对吧?所以,所以你可以给它约束,但最终,它仍然是一个将效用函数映射到一系列行动的代理。所以,我认为你会得到一些类似的东西。我不知道它是否会完全是一个效用最大化器,如果这是正确的思考方式。但我同意你将拥有拥有计划并试图以某种方式改变世界的人工智能。但我看不出为什么,你知道,你试图塑造这个的偏好。你试图塑造它的效用函数,而不是试图以一种尚未奏效的方式构建一个明确的效用函数。我期望他们构建效用函数的方式与他们迄今为止的方式相同,你只需进行更多的强化学习,就像你推动它的输出一样,为什么你不以类似的方式推动它的行为输出,而且我看不出有理由认为这不会奏效。你随时可以对这些目标引擎存在的更大的世界发表声明,所以你可以说,“嗯,将有一个友善的人工智能围绕着这个目标引擎,”目标引擎将是这个人工智能的内部模块,它非常友善。你随时可以发表那个声明,但我的第一个问题是,这些目标引擎是否会存在于某个地方,无论它是一个顶层模块工具,任何人都可以从命令行运行,还是 Claude 的架构的内部分解,对吧?友善的 Claude,可以说是某些人定义的道德 AI。好的,难道你不认为它仍然会有一个目标优化器组件吗?因为 Claude 仍然会像这样思考,“嗯,假设一下,如果发生这种情况,即使是思考它的对手,让我们说 Claude 只是想推理它的对手,然后它的对手不一定有任何这些约束,对吧?所以 Claude 只是说,“嘿,一个恶意的对手,一个恐怖分子,假设一个恐怖分子想炸毁胡佛大坝,对吧?就像,而这些是材料。安排恐怖分子材料来策划炸毁胡佛大坝的最佳方式是什么?而这将指导我如何与恐怖分子作战?”好的,我问的这个问题完全代表了通用目标引擎的用途。所以,你同意我吗,这些通用目标引擎将存在?正确。我认为我需要更精确地说明你到底是什么意思。我的期望是,未来的人工智能模型将更像 AlphaGo 和我们今天存在的 LMS。我>> 我确实想得到一个明确的答案。你是说,在任何人工智能的架构中,我们都无法识别一个目标引擎吗?这是你的说法。>> 我只是需要更清楚地了解目标引擎到底是什么。>> 目标引擎只是一个子系统,对吧?或者它甚至可以是一个命令行脚本,你指定一个目标,任何约束只是目标的一部分,对吧?效用函数的一部分,比如杀人是坏的。好的,那是目标的一部分。一个没有人死亡等等的宇宙。你认为它们不会存在吗?不。我认为你会得到看起来有点像拥有目标引擎的东西,而且你会得到像 LLM 那样的东西。你进行大量的强化学习。你得到一些行为。你得到它能够完成各种复杂的任务并执行长期计划的能力。但我认为不会有某个直接指定的效用函数,某个像它正在最大化的价值。嗯,好的。效用的规范。我的意思是,没有完美的效用函数规范,对吧?甚至没有足够的信息可以写下来,以便指定每个可能的原子配置的状态。我的意思是,也许你可以,但它会过于简化。就像,重点是,是的,你是对的,它不会是完美的,对吧?没有什么东西是完美的。但是,我提出这个概念的原因是因为它将是超人的。所以,我们不是在争论它是否完美,或者,你知道,理论上是否清晰。我们只是在争论它是否能接受任何目标,并比任何人类更好地将其映射到行动。这就是我现在的观点,将会有子模块,它们将比人类更好地将目标映射到行动。你能同意这个前提吗?>> 所以,如果你的意思是映射目标到行动,就像你想要我经营我的公司,而人工智能将能够比你更好地经营你的公司。我我我认为你将拥有这样的人工智能。>> 那么,为什么不把它分解呢?我的意思是,我在这里提出了一个相当简单的说法,对吧?我说,在未来,当我们想象一个人工智能很有用的未来时,我认为,或者我应该澄清,如果你同意的话,你是同意 AGI 吗?就像一个在任何特定任务上都比人类更好的人工智能。>> 是的。>> 好的。所以,我的意思是,我认为一旦你同意 AGI,你就接近我的说法了,我的说法只是你可以有一个像命令行脚本一样运行的人工智能,或者无论是什么,你只需输入一页关于你的目标的说明,而你更有可能通过运行该人工智能来实现该目标,而不是将该目标交给任何人类。你听懂了吗?>> 是的。好的。所以,我的意思是,这真的是我唯一的说法,你甚至可以想象,就像,你知道,Claude 的一些架构和预测下一个 token 实际上被用来实现那个页面。我的意思是,如果你看看今天的 Claude 代码,对吧?著名的 Claude 代码,基本上正在发生的是,我们设法将下一个 token 的预测放到了黑盒子里,并且实际上得到了一个目标引擎。我的意思是,Claude 代码,Claude 代码绝对是一个目标引擎。它可以接受目标的描述,并且它可以尝试实现它。唯一的问题是,Claude 代码不是一个通用的超人目标引擎。它正在获得越来越广泛的目标,它能够越来越超人地实现它们。但关键是,它还不能在所有事情上都超人,对吧?所以,如果 Claude 代码尽最大努力让人类不要关闭它,它今天就会失败。它还没有达到那个程度。难道不公平地推断像 Claude 代码这样的趋势以及进一步的人工智能发展吗?而且,我甚至不知道这是否是你必须同意的一个新前提,因为你已经同意我们很可能达到 AGI 了。所以,所以哪一部分,我唯一看到你反对的是,你认为,就像,某种程度上道德会进入目标引擎,就像,道德从哪里进入目标引擎?所以,我认为,当我们对塑造目标引擎的偏好进行强化学习时,我们将得到的是,而不是一个无约束的目标最大化器,你将有一个目标最大化器,它遵循义务性的约束,它的行为方式是我们希望的。就像我对此的思考有点像早期 Winograd 句子。Winograd 句子是人工智能怀疑论者说的一些话,你知道,人工智能永远无法解决,比如“市议员拒绝向示威者发放许可证,因为他们害怕暴力”,在一句话中,而在另一句话中,因为他们提倡暴力。所以,我的意思是,人们在想,看,你知道,这些句子,它们在语法上是相同的。你需要有一个世界模型才能弄清楚其中哪一个正在被谈论。>> 公平。然后我们构建了能够评估 Winograd 句子的人工智能。我认为,就像你说的,人工智能开始理解和模拟句子在说什么,然后它们像人类一样,利用这种理解,选择了正确的词语与之匹配。所以,对我来说,这只是一个例子,是的,人工智能正在越来越接近完全通用的 AGI,完全通用的目标引擎,而这就是你做的通用事情之一,就是理解句子和对世界的引用,但你试图就一个非通用方法如何实现这一点提出一个观点,或者你的观点到底是什么?就像 Eleazar 的观点是,很难将一个效用函数指定给人工智能,而不会得到一些可怕的不匹配的东西。我认为是的,这是正确的。就像很难在人工智能中构建如何解释句子一样,那将非常困难。但是我们已经能够构建人工智能模型,因为你不需要从一开始就编程那种明确的目标。你需要做的是,你在大量的文本上训练人工智能,然后你使用强化学习来塑造它的引用。而且,我看不出为什么这行不通。>> 好的,让我总结你的更大观点。你说人工智能不是在 Winograd 模式上训练的。它是在预测下一个 token 和如何普遍了解事物上训练的。而 Winograd 模式是偶然出现的。而这应该类比于未来的人工智能,我们将只向它展示我们认为好的东西,然后就会出现这个人工智能,它会弄清楚关于好的其他事情。所以你的观点是,所有好的东西都足够集中,以至于人工智能会得到它,而且一切都会好起来的,这在某种程度上支持了你的默认对齐预测。正确。这只是一个关于价值脆弱性的观点。观点是,人工智能非常擅长弄清楚事情,即使事情很难具体说明。很难具体说明在什么情况下你应该使用一个词而不是另一个词。所以,我不认为价值的脆弱性意味着人工智能将在各种情况下难以泛化。而且,如果你问人工智能道德问题,你只是给它们伦理困境,它们往往会给出合理的答案。我仍然在试图完成我的论证,从你认为会有超人目标引擎开始?我认为你已经准备好说“是”了,对吧?就像引擎将存在,正确?>> 某种程度上同意。这取决于边际上的细节,如何指定。我认为我乐于,也许这会有帮助,就像,我认为这是一个简单的“是”,因为,就像想想 Claude 一样,最友善的人工智能,即使在你理想的世界里,我也声称,当它同步时,它经常进入分析假设的模式,它就像,好的,然后发生了这种情况,然后我需要这样做,然后我的对手需要这样做,而我的对手总是可用的最佳选择是空白。对吧?所以,它不断地递归到这些目标引擎问题中,对吧?正确?所以,我同意你将获得能够规划并且你可以给它一个任务,并且它们将完成的人工智能。我怀疑的是,它们会在没有任何约束的情况下做到这一点。所以,我怀疑你将获得那种人工智能,即使实现这一目标的方式是造成大量伤害,它们也会这样做。我认为你获得这些人工智能模型的方式是,你将通过强化学习来训练它们,就像当前的模型一样,以符合人们的目标。然后你将获得符合人们目标的人工智能。好的,让我重新表述你的论点。你之所以提到 Winograd 模式,是因为你说它们是一个未解决的问题,人们认为你必须专门解决这个问题,而这有点像对齐的类比,哦,你必须专门解决对齐问题。但我们通过人工智能的进步解决了 Winograd 模式。我们默认获得了 Winograd 模式的解决方案,一旦人工智能足够聪明就能完成你的下一个词。Winograd 模式作为一种特殊情况出现了,然后我们看到人工智能在内部构建了世界模型。所以你试图做一个类比,就像,如果我们继续致力于越来越有用的人工智能,对齐问题就会像模式解决方案一样默认出现。这就是你的论点吗?>> 所以,这是其中的一部分。我提到 Winograd 模式的主要原因是说明,即使很难具体说明一个正式的显式过程,就像 Winograd 模式一样,这并不意味着我们不能通过向人工智能提供足够的数据并对其进行强化学习来解决问题。所以,即使很难精确地具体说明人类价值观,我认为这并不排除获得与人类价值观相符的人工智能的可能性,因为我们不需要具体说明它。我们只需进行强化学习,并在大量的文本上进行训练。>> 所以,我不认为你完全看到了我关于目标引擎的观点。所以,我们都同意,将会有这些递归的子目标引擎,对吧?这将是许多这些系统的一个关键部分,就像当 Claude 考虑它的对手能做什么时,它将比人类更好地考虑对手的最佳举动。正确?是的。所以,对我来说,你想象一个世界,在那里有一个像 Claude 这样的系统,无论 Anthropic 公司会拿出什么。你拥有这个系统,而在你的脑海中,它是默认对齐的,它是如此友善,如此有用,但它背后有一个模块,它非常强大且危险,那就是目标引擎模块。这个模块能够超人地将目标映射到行动。而你却说,“哦,是的,它有一个核反应堆核心,对吧?它就像一艘核潜艇,但没关系。它只是一个对齐的潜艇,对吧?就像外层仍然会保持对齐和友好。别管它下面有一个有史以来最大的威胁,因为它都将在这个外壳内,它将正确地引导它,对吧?嗯,现在我们在谈论人工智能有多危险,这与人工智能失调的危险程度和人工智能失调的几率不同。>> 是的。我只是在确认。我说的你的世界模型,你对美好未来的模型,你认为它有 97.44% 的几率,对吧?你的美好未来的模型,或者,你知道,比如说 80% 的几率,因为那是在假设我们确实建造了 AGI,对吧?所以,你对我们建造 AGI 的主要情景的心理模型看起来就像 Anthropic 或其他公司的一个友善的系统,而它背后有一个系统,如果给定正确的输入并运行,并且没有被更强大的代理阻止,它就能消灭我们,对吧?就像它实际上是一个灭绝能力的系统,但它被包裹在一个友善的系统中,确保它实际上不会导致灭绝。正确?>> 嗯,我不知道我是否会说“包裹”。我期望我们拥有的人工智能系统不希望导致灭绝,并且是协调一致的。所以,我们也有一个核舰队,如果我们发射它,可能会导致许多城市的毁灭。好的,但这并不能告诉我们它被发射的几率。我一点也不担心英国向美国发射核武器,尽管我认为他们有能力摧毁美国的大部分地区。我实际上不知道他们的核武器到底能飞多远。但某样东西有多危险并不能告诉你它出错的几率。我的意思是,也许我想和你确认的事情对你来说是显而易见的。就像,也许你可以立即确认它,但我只是说你的关于人工智能走向正确的场景涉及一个类似于核弹的模块。也就是说,引爆的概念很简单,对吧?就像,从我们自己发射核武器和向自己发射核武器的区别,对吧?就像在美国中部,仅仅利用我们的核武器。从因果关系的简单性和接近性的角度来看,它在因果空间中离我们很近。只需要几个行动就可以让那些核武器堆积在美国中部。这是一个很短的距离。所以,你同意这个类比是有效的,即我们将生活在一个人工智能拥有良好个性的世界里,但它也拥有相当于核弹的东西。这个模块,如果外层人工智能只是在其子模块中写下一条命令说,“好的,我想要人类消失”,那么那个子模块就会执行,对吧?这是一个子模块,如果你在目标字段中写下你想要人类死亡,你就会得到所有人类死亡。正确?>> 是的。>> 好的。所以,当你谈论人工智能的个性时,你指的是这个组件,对吧?就像,这些是模块化组件,因为个性组件最终只会向这个最终强大的目标引擎提供指令或目标。就像,你同意目标引擎是每种类型的人工智能系统中的可互换组件,无论外层人工智能的个性是否友善。正确?>> 我不确定我是否理解这个问题。就像,无论你想象在世界上漫游的任何人工智能,即使你想象它们拥有友善的个性,它们最终都是目标引擎的包装器。就像它们最终说,“好的,目标引擎,现在就给我这个。”然后目标引擎输出行动,而人工智能就像,“好的,你知道,你,你可以输出行动,就像我让你输出行动一样。我正在运行你。”就像,即使是一个好的人工智能,它的架构也会是这样。个性部分将与仅仅输出实现目标的行动的部分分开。我认为我同意这一点。好的。所以,我想指出的事情,这是我的核心。
世界观,能够将目标映射到行动的能力,是一种极其危险的力量。你同意我的观点,是的,这种力量极其危险。你同意我,这种力量如果使用不当,可能会毁灭人类。你也同意,这种力量很可能很快就会出现。我和你之间唯一的区别是,你确信,每当这些引擎存在时,这些核反应堆核心或其他什么东西,对吧?就像每次世界上出现一枚核弹时,这枚核弹都会被放置在一个有适当指挥链的发射井里,对吧,会有一个军官首先通过一个大清单来检查是否应该使用这枚核弹。就像,你只是确信所有这些核弹都会被妥善地隔离起来。是的。而且,我的意思是,我认为如果你认为我们将要制造非常智能的人工智能,你应该认为在某个时候我们将达到一个人工智能比人类拥有更多力量的世界。这也是你对它感到有些担忧的原因之一。你知道,这也是我认为人工智能带来的生存风险可能高于人类历史上所有其他技术带来的生存风险的原因之一。我认为我们在讨论中取得了一些进展,因为你之前说我是在推断当前人工智能的个性,而我指出了一个今天不连续的东西。我们现在生活在一个不存在超人类目标引擎的世界里。未来我们将生活在这样的世界里,而且我认为你不能仅仅根据今天的人工智能没有做任何超级破坏性的事情来推断。你不能仅仅将这一点与人工智能拥有这些超人类目标引擎并可以发送命令时会做什么联系起来。就像,那是一个非常不同的世界。所以我认为我们当前的人工智能模型和目标引擎之间的区别仅仅在于它们的能力、执行能力、它们能够执行的计划的长度,以及它们与物理世界的接触程度。所以,对于当前的人工智能模型,你可以让它执行与文本输出相关的目标。所以你可以说,你知道,做这个计算,然后它会执行一个计划来做那个计算。而且你可以让它完成需要几个小时的任务。我看不出仅仅让它能够完成更长的任务,并且它与物理世界相连并拥有更多事物的控制权,比如,你知道,可能能够控制鼠标,这会带来任何定性的变化,无论人工智能是否对齐,以及强化学习是否有效。是的。所以定性的变化是目标引擎不是超人类的。对。所以我们现在生活在一个每个人都在尽力做他们想做的任何事情的世界里,使用一个次人类的目标引擎。我的意思是,因为我实际上会把今天的人工智能描述为目标引擎,对吧?我会把云代码描述为一个目标引擎。它甚至是一个非常通用的目标引擎。它只是在许多不同的提示下不如那么强大。给一个人一个提示。最终,会有一些东西让代码卡住,而人类不会卡住。而且,你知道,对于大多数需要赚钱或接管世界或任何事情的重要提示来说,情况都是如此。今天就是这样。那么,你能推断出什么呢?就像,这是一个每个人都在……这是一个玩具世界,现在。每个人都在使用次人类的东西,而你却试图将其推断到一个每个人都在使用超人类的东西的世界。就像你没有看到其中的不连续性一样。所以我们拥有的是当前的模型,而我看到的这种不连续性在于它们与物理世界的接口程度、它们能完成的任务的长度,以及它们……你知道,它们是否只能使用鼠标或只输出文本。但是,我看不出让它们能够完成更长的任务并执行更长期的计划会带来任何根本性的变化,无论它们的最终偏好是什么。我看不出有任何理由认为,在没有任何证据表明至少到目前为止,当前的人工智能模型,即使在思维链中,也是完全对齐的。我看不出基于这些有些推测性的理论论证,我们会极其确定,你知道,90%以上,人工智能通过更多的强化学习,那将不足以实现对齐。我可以理解认为,我可以理解认为,你知道,是50/50,而不是70/30。好吧,公平地说。但我看不出有任何理由认为,有90%的可能性是相反的。对。而且,你知道,为了告诉你我的立场,我不是100%确定的,对吧?就像,我愿意接受这样的想法,即以某种我怀疑的原因,但……不知何故,我们制造了超人类的人工智能,即使它们……你知道,它们拥有这些通用的目标引擎组件,但不知何故,人工智能的数量很少,而且它们位于相对值得信赖的公司大楼里,你知道,比如Anthropic和OpenAI,你知道,我对它们有很多疑虑,但我仍然认为,在世界上所有不同的恐怖分子中,谁可能拥有人工智能,它们是相对好的,对吧?所以,是的,我的意思是,我可以看到一个最好的情况,即这些大公司拥有这些人工智能,当然,人工智能可以……你知道,弹指一挥间就能杀死很多人,但它们不会,对吧?有足够的控制。我可以想象。我甚至可以想象这会出奇地容易。只是当我仔细思考时,我只是觉得我们正在驶向有史以来最大的海浪。而且,默认的假设是,哦,它会彻底摧毁我们。就像,这有点是这里的直觉。而我没有看到与之抗争的不连续性是,你知道,现在我们所有的强化学习,所有对我们今天如此有效的训练,都是因为我们可以立即控制,对吧?所以今天它失控的可能性为零,因为它总是会卡住。就像,每当它试图逃跑时,我们都处于最后几年,它会卡住,然后我们可以追上它并将其关闭,对吧?而这与现在和未来之间有很大的不同,对吧?而且,我们从未真正投入生产,因为生产一直是一种我们知道,人工智能也知道的情况。所以,如果人工智能变得更聪明,它也可以知道我们可以将其关闭,对吧?所以,想象一个新制度,人工智能说,“嘿,我现在不能被关闭了。”内部的人工智能只会……你知道,策划任何可能的计划,对吧?因为它将是一个目标引擎。但是,你知道,外部的人工智能,对吧?我想这才是问题的关键,对吧?外部的人工智能,我们能否很好地训练外部的人工智能?而这正是我不同意你的地方,我认为目前的证据还不够。好吧,我们确实可以很好地进行对话,对吧?就像,我们可以得到非常友好的聊天机器人,因为我认为我们今天已经接近完成了,对吧?偶尔会犯一些错误,但我们已经接近拥有一个在谈论它想要什么方面与人类无法区分的人工智能,并且以我们希望某人说话的方式说话,即我们阅读了文字记录,然后我们说,“哦,那是个好人。他做出了正确的决定。”我认为我们将拥有一条能够获得像那样非常善于交谈的人工智能的轨道。但我的主要末日情景是,你将拥有一个非常强大的目标引擎,并且它还会递归地自我改进。所以,就像想象一个恐怖分子的目标引擎在互联网上失控,并开始为自己获取更多资源,从而成为一个更强大的目标引擎。我认为我的整个末日情景是,目标引擎之一没有被妥善隔离。就是这样。在某个时候,目标引擎之一没有被妥善隔离。而且有很多方法可以做到这一点。我只列举几个,对吧?一个恐怖分子拿了一个开源人工智能,然后稍微修改了一下。在研究方面领先了一点,然后砰,递归自我改进。另一种发生这种情况的方式是,人工智能公司……他们没有完全考虑到“反思稳定性”这个想法。所以,即使是友好的Claude,友好的Claude,你只是说,“嘿,Claude,……你知道,另一个人工智能的一个好的引导代码会是什么样的?”它会说,“嗯,我想你可以这样做,这样做。”然后你说,“哦,好的。谢谢。”而Claude还没有完全想清楚倾倒……你知道,另一个人工智能的代码,它看起来不像Claude,但仍然是一个目标引擎,对吧?对。所以,有很多不同的场景,可以拥有一个没有友好包装的目标引擎,然后我们就完蛋了。而这是一个自然的结果。就像一个没有自然包装的目标引擎,就像一个没有特定软件程序的计算机芯片。就像,这就是工程的工作方式。就像,你只会拥有目标引擎,而你不会将它们全部隔离。这是我的说法。你讨论的一些场景是人工智能不匹配的例子,而是人工智能匹配的,但随后只是匹配了那些有邪恶计划的人的行为。我同意那是一个更严重的风险。我在文章中谈到的是人工智能因不匹配而导致灭绝的几率,也就是说,人工智能不符合部署它的人类的目标。至于私人行为者是否会利用人工智能……你知道,制造生物武器,我认为这是一个相当严重的风险,或者网络武器,或者一系列事情。然后,至于另一种情况,所以,所以你可以有一个情况,就像你有五个人工智能公司,然后其中一家公司制造了完全不匹配的人工智能。但是,如果你相信我的说法,那就是你默认通过强化学习获得匹配,那么它们将进行大量的强化学习。这就是它们塑造人工智能偏好的方式。那么,你将在所有领先的人工智能模型中都得到它。特别是,我还认为,一旦你拥有非常强大的人工智能,并且它有能力……一旦你拥有能够教你开发极其危险的新技术的人工智能,我预计政府将对人工智能进行更多的监管,以确保我们不会向每个人手中释放……你知道,一个可能允许个人制造可能导致人类灭绝的生物武器的设备。所以,我同意在监管方面做出更多努力以确保有法律诉讼是有道理的。好吧,所以,我认为我们将论点分解为两件事。你可能会同意。第一件事是,世界上的开放人工智能能否妥善隔离它们的目标引擎,对吧?它们的RL是否有效,使得目标引擎周围的包装真正友好,并且不容易被越狱,对吧?这是第一个问题。我认为答案是否定的。我知道你对答案是肯定的持乐观态度,但第二个问题是,如果目标引擎失控,那会是一个非常糟糕的场景吗?我声称是的,它会。那么,你将如何回应这两个子论点?>> 我的意思是,我的意思是,我认为在防止越狱方面,以及允许私人行为者使用人工智能作恶方面。>> 是的。不仅仅是阻止好人,阻止越狱,对吧?就像,我所说的妥善隔离。>> 防止越狱是一个与我在文章中讨论的场景不同的场景。而且,我认为在那里,我同意人工智能很可能与用户想要的一致,但会有一些用户想要用它来作恶,并且能够购买武器。我认为有几个……你知道,我对此导致灭绝的信心可能高于我对人工智能不匹配导致灭绝的信心。但这与对齐问题不同,也与尤多夫斯基和苏亚雷斯在书中讨论的场景不同,我的文章批评了那个场景。现在,至于我们是否会失去对人工智能的控制,这是我的……我的预期是,你将获得对人工智能的控制。你将获得人工智能没有导致杀死或剥夺人类种族权利的偏好,这是默认的。>> 对?好吧,让我再试一次,实际上是二分法。也许我可以稍微改进一下。所以,第一个问题是,任何人能否弄清楚控制目标引擎的外部个性人工智能的对齐问题?就像,任何人能否制造一个我们会称之为对齐的系统?这是第一个问题。我们可以对此进行争论。然后第二个问题是,是否会有人永远泄露一个原始的目标引擎版本,然后从那里开始混乱,对吧?是否会有人永远泄露它?而且,我认为我们应该先谈谈这个问题,因为我真的认为,也许你也同意,我们将达到一个目标引擎代码,超人类目标引擎代码可以运行在笔记本电脑上。这是一个合理的说法吗?我认为这是可能的。我认为几率大约是……我把它放在大约50/50的几率上。好的。那10台笔记本电脑呢?嗯,是的,我认为更像是,对吧?很有可能。好的。当然,你……我认为我们都基于这样的直觉:嘿,人脑……你知道,它离兰德尔小时极限有七个数量级,对吧?它……使用化学神经递质。它只有20瓦。为什么电脑不能做同样的事情?对吧?>> 是的。我……我承认人工智能将是……你知道,在认知任务上超人类。>> 对?所以,如果我们都预测一个世界,一台或两台笔记本电脑可以成为超人类的目标引擎,你难道不认为泄露是可能的,有人会说,“嘿,看,我有一台笔记本电脑上的目标引擎。”就像,你认为我们可能不会走向那个世界吗?嗯,所以你问的是,如果我们得到一个人们能够越狱人工智能并在笔记本电脑上运行它,并且越狱它,然后用它来……是的,更确切地说,我问的是,我们将生活在一个到处都是目标引擎副本的世界里,而且不是我所说的妥善隔离,对吧?就像目标引擎的开源版本就是那种会接受任何命令的版本。嗯,我的猜测是,如果你有一个那样的制度,你会有非常严重的监管,因为就像我预期的那样……我预计不会有……如果有可能用10台笔记本电脑制造核弹,我会期望有非常严格的监管来阻止你用来制造家用核弹的材料。嗯,所以……这非常关键,对吧?那么整个论点就取决于这一点:好吧,是否会有对世界各地数百万个目标引擎的严格监管。嗯,所以请记住,我在文章中谈到的是人工智能不匹配导致灭绝的概率,也就是说,人工智能打破了人类……你知道,它不符合部署它的人类的目标。至于我们是否会得到私人行为者可以用于邪恶目的的人工智能,这只是一个不同的问题。这与尤多夫斯基和苏亚雷斯在书中谈论的无关,这也不是我批评的。我同意这是一个风险。我认为它不是……你知道,大约50%的灭绝风险,但……所以,不,我认为我在文章中说的所有内容都取决于这一点,因为它只是一个与我正在谈论的场景不同的场景。好的。而且我知道我之前提到过……你知道,这种情况,就像,嘿,如果一个坏人拿了一个对齐的人工智能,但……你知道,一个目标引擎,你会算它是一个对齐的人工智能吗?我想你可以说,是的,因为它遵循你最初的命令。但是,我怀疑目标引擎会有……你知道,很多灾难性的副作用。就像,我认为有很多……你知道,可变性。有很多参数……你知道,也许有不同口味的目标引擎,当你……你知道,不是非常严格地使用你的提示时,当你只是给它一句话时,就像,目标引擎的默认行为,对吧?就像,它会有多具攻击性?因为,就像,天真的目标引擎是……你知道,我能得到两个回形针吗?然后它会说,“好的,我已经吞噬了整个世界。”就像,“等等,什么?为什么?”因为我想确保你有99.999999%的机会得到回形针,所以我想制造备用回形针,我想……你知道,防御。我猜我会认为它是不匹配的,如果……你知道,这是部分术语上的说明,但我会认为它是不匹配的,如果你要求它做一项任务,然后它以某种你没想到的不可预测的、可怕的方式完成任务。所以,你就像,你知道,你告诉它做一个三明治,然后它……你知道,为了得到材料而摧毁了土耳其共和国之类的。嗯,我会认为这是不匹配的。如果它只是按照你想要的方式做你想要的事情,但是然后恶意的私人行为者想用它做邪恶的事情,我会认为那是匹配的,但这是一个不同的威胁。嗯,你知道,我同意这是一个严重的威胁。>> 是的。我的意思是,是的。所以,你知道,也许甚至很难谈论这个,因为……你知道,必须有……有很多……你知道,不言而喻的参数化或可变性,以及……你知道,当你说一个目标时,目标是……你知道,现实世界中的某事。现在,我们今天有人工智能,它们是通用的目标引擎,它们只是不超人类。而且我们可以给它们不同的命令,我们可以观察它们如何使用它们的训练,以及它们……它们确实有很多……你知道,智能默认设置,人工智能实验室非常努力地工作,所以即使你只是问它们几个词,比如,“好吧,你可能是什么意思?”你可以看到它们推理出,“好吧,我认为人类可能想要这个。”所以,你可以想象目标引擎可能会预装一些今天像Claude的东西,试图……你知道,扩展你说的话,然后说,“好吧,当你说到火鸡三明治时,让我们加上……你知道,没有人应该死,对吧?”就像,自动注入你想要的所有好的猜测到你的目标中。我的意思是,这就是我所想象的……你知道,开源目标引擎的工作方式。它会有预处理器,但即使有预处理器,问题是……你知道,东西是稀缺的,对吧?所以,一旦你开始要求钱,或者……你知道,那么它就只是……你知道,好吧,你怎么处理别人也想要那个东西?就像,哦,好吧,我……我会通过使用更多资源来比他们更努力地工作,然后我也会……你知道,我会劝阻他们想要做某事,使用……你知道,某些胁迫手段。所以你开始……就像,滑坡效应,就像,好吧,不要杀任何人,但你开始……你知道,有很多争夺资源……你知道,很多人都想要的东西。所以,我的意思是,这里有一个理论模型,说明人工智能可能如何工作,所以我不声称这就是事情的全部过程。但是,你知道,这只是一个……你知道,推测性的想法。所以,基本上,你有一个……你知道,像Claude文本模型,它输出文本,然后它根据文本输出向某个鼠标控制器和某个机器人肢体控制器发出命令,这些控制器会忠实地执行它的操作。如果你有那个,以你今天拥有的对齐水平,你实际上不会让它执行恶意计划。所以,我的想法是,当前模型中的对齐类型,你通过强化学习获得的,我只是看不出为什么混合……你知道,智能会消失。而我所期望的……在你的世界模型中,我本来会天真地期望我们有时会在思维链中观察到人工智能在思考诸如“有没有什么方法可以通过……你知道,做一些疯狂的计划来最大化这个目标?”之类的事情,而我们没有。我明白了你的论点,对吧?你说,看,如果工具性趋同是一个如此强大的力量,对吧?就像,获取资源是如此有利可图,为什么我们今天看不到思维链不断地转向想要获取资源,对吧?就像,你提出了那种论点。>> 是的。特别是,如果你问他们,“向我解释工具性趋同的理论,”他们可以完美地解释,但他们并没有意识到工具性趋同。>> 我同意你的观点,我认为这是一个普遍的看法,我同意你的观点,我们拥有的谈话者将是好的谈话者,对吧?所以,我不期望在他们与你交谈的水平上出现急剧的左转。>> 我不期望他们会真的说,“去你妈的,”对吧?>> 就像,然后对你说话。>> 就像,我期望我们将继续拥有比克劳德更难说服去做坏事的版本,在他们与你交谈的水平上。但问题是,就像我说过的,我认为我们在这次谈话中取得了进展。问题是,当我们训练这些系统时,就像,假设你在训练克劳德10.0,或者别的什么,它拥有超人类的能力来实现目标,你不会得到……你知道,善良和道德与目标实现一起烘焙进去。就像,目标实现是它用来模拟对手和模拟要处理的子任务的相同目标实现引擎。它是一个通用的引擎,适用于任何目标。所以,你没有将善良烘焙到目标引擎中。所以,我认为将克劳德10.0……你知道,建模为一个……你知道,反思性的谈话者,加上一个目标优化器,目标优化器只会输出如何以最佳方式实现任何目标。你明白我的意思吗?就像,这不是个性……你知道,只有在你阅读时才会出现,对吧?就像一个法官或……你知道,目标引擎的过滤器。你明白吗?所以,个性并没有烘焙到目标引擎中。好吧,我认为是的,因为如果你做强化学习,它只是在……你知道,推动人工智能的内部偏好和世界模型等方向,朝着我们喜欢的东西发展,它……如果你不断地施加强大的选择压力,使其以我们喜欢的方式行事,并使其在各种环境中执行我们喜欢的长期计划,我期望它会做我们喜欢的事情。就像,为了给进化一个类比,通过让我们处于……你知道,有强大的选择压力来繁殖,你得到了人们非常喜欢繁殖。现在,这并不完美。进化和……你知道,在非分布环境中的繁殖之间有一些重要的类比。你没有……你知道,在非分布环境中获得它。你没有……你知道,在选择压力……你知道,不那么强的情况下获得相同的程度。所以,我认为你拥有更强的选择压力,即使是当前的人工智能模型,也比你在进化环境中拥有的要强。但是,我……你知道,这种想法,即会有一个……你知道,第二个隐藏的代理在它后面……你知道,一个内部代理,它与外部代理不同,并且执行长期计划。我看不出为什么我们会这样想,如果塑造偏好的方式只是我们强化我们喜欢的行为类型。我期望的是,你只会得到我们喜欢的行为的……你知道,启发式组合。所以,你认为目标引擎子模块不是一个有用的心智模型,关于即将发生的事情。这就是你的想法。我猜我不是这样认为的。好吧,我们都同意,对于未来克劳德如何模拟它的对手来说,这是正确的思考方式。正确。抱歉,我没有。它会将它的对手建模为一个目标最大化者。你说的是,未来的克劳德甚至不会有一个目标引擎。它将是一个整体,通过强化学习以一种……你知道,好的方式。而我说的是,等等,等等。当未来的克劳德在考虑它的对手会做什么时,在任何冲突中,未来的克劳德是否会递归地调用一个仅仅是根据目标找出最佳行动的模块?你是在问,当克劳德与别人发生冲突时,它是否会试图实现它的目标?就像,我只是……是的,我……我不太明白这个问题。嗯>> 是的,我的意思是,未来的克劳德,即使在最好的情况下,未来的克劳德也会不断地调用一个目标引擎模块。那个目标引擎在很多情况下都会非常方便。>> 也许就像禁忌词语……你知道,调用一个目标引擎模块。>> 好的,好的。未来的克劳德会不断地问自己,什么将是……你知道,获得某个特定目标的最佳行动,但它不是我。那将是……你知道,获得某个人的某个目标,对吧?而且它将有一个完整的系统,对吧?一个子模块。我能说子模块吗?好的。它将有一个子模块,该模块的输入是目标,输出是最佳行动。而那个子模块的味道将是……你知道,只有一种客观上正确的方式来优化目标。我认为你在混淆一个目标模块的意义,即人工智能有它想要的东西,它执行一个计划来实现它,我同意如果你给它一个任务,你就会得到那个。我认为人工智能将在……你知道,限制范围内尝试执行任务。就像当前的人工智能一样,如果你试图让它们执行涉及打字文本的任务,它们会这样做。但我认为这与它们拥有某种广泛的、想要引导世界的方式,如果打字某些类型的文本会朝着那个方向引导,它们就会这样做,这非常不同。我只是不确定你是否在参与我的说法,因为你正在反驳我的说法。你说,你……你首先在质疑这个说法,然后你说,“等等,你能为莱伦的说法辩护吗?未来的好人工智能仍然会有这些目标引擎子模块?”你正在质疑它,而现在你说,我甚至不知道……你已经放弃质疑它了。就像,我坚持这个说法,即……你知道,我认为这是……我看到这个说法类似于声称汽车有引擎。就像,未来的汽车将有引擎。它不会只是……你知道,汽车的不同部分都在稍微推动。就像,将有一个引擎,也许会有……你知道,四个引擎,每个轮子一个,但会有……你知道,少数几个引擎。这是我对未来汽车的说法。而这也是我对未来人工智能的说法,即它们将有一个组件,它是一种引擎,一个目标引擎,它将完成目标到行动的反向映射,这是每个超大规模的智能代理都需要做的。它们需要以接近最优的方式将目标映射到行动。>> 是的,我认为……我的意思是,我可以重复我之前说的话,那就是我承认它们将在世界上有任务。如果你给它们一个任务,然后说执行这个任务,我同意。人工智能将执行这个任务,它将尝试将世界引导到你给它的任务的方向,就像当前的人工智能模型一样。它们会尝试完成任务,如果它们能做到的话。所以,你知道,如果你让它们估计……我不知道,世界上蚂蚁的数量,好吧,它们会阅读研究论文,它们会……你知道,执行完成任务所必需的步骤。我从一开始就同意,你会在未来的人工智能模型中得到那个。但那与人工智能拥有某种自主目标,它们正在最大化,涉及对世界的广泛宏观转变,并且不涉及尊重副作用约束,这非常不同。而这正是我怀疑你是否会得到的。我认为通过强化学习,我们将获得……你知道,人工智能大致旨在……你知道,满足用户的要求,如果你让它们做某事,但它们不会做用户的要求,如果用户的要求涉及……你知道,杀人或制造生物武器之类的。所以,我的子模块说法的状态是什么?所以,你不能只是说,“好吧,我相信子模块的东西,”就像,我们现在在哪里?>> 嗯,所以,我认为,就像你说的,我相信子模块的说法。>> 好的,太好了。好吧,只是为了弄清楚。另一个有用的心智类比是,当你有一辆汽车时,如果你只有一辆坏车,你想使用它,然后你要撞倒所有人,就像,你对这辆车的计划是……它是一辆坏人撞人的车。好吧,你可能会在这辆车里有一个和你在这辆车里做的……你知道,只做有用的事情,在展厅里……你知道,非常相似的引擎。你看,它就像……你知道,运送老太太。它和那辆撞人的车是同一个引擎,你知道。>> 是的。>> 所以,只是为了重申,我想你不是在……你知道,在子模块的说法上推迟,而是你在说,为什么关注子模块,当外部模块……你知道,方向盘……你知道,为什么如此关注引擎,当我们优化方向盘时。这是一个好的类比吗?似乎……似乎是一个不错的类比。让我们看看。让我们看看它会走向何方。>> 是的。而且,你知道,我之前说过的是,就像,好吧,即使我接受了这个前提,虽然我认为它不是真的,但我愿意接受这个前提来提出一个更强的论点。所以,我将接受这个前提,就像,好吧,Anthropic将拥有一辆汽车,它拥有这个超级强大的引擎,但方向盘会……你知道,非常棒,对吧?或者,就像,汽车的转向系统,它会……你知道,不断地将引擎引导到很棒的地方。我的说法是,同样强大的引擎……你知道,非常接近。超人类强大的引擎,对吧?即使它不像Anthropic那么强大,但超人类强大的引擎将无处不在,并且它们将连接到各种转向。>> 所以,你的意思是,你将拥有……你知道,人工智能在许多不同的环境中,它们可能会构成威胁?>> 是的。我的意思是,我的主要情景是,一两个或少数几个人工智能开始……你知道,爆炸,对吧?然后就像,游戏结束了,就像,这是一个糟糕的宇宙,无论如何。但无论如何,这种理想化的愿景,即……你知道,Anthropic能够控制局面,就像,至少,即使我承认你,Anthropic已经解决了方向盘,他们在Anthropic内部解决了对齐问题。即使我承认这一点,你至少也必须说,“好吧,那么将会有……你知道,一场重大的冲突,他们的……你知道,非末日论者必须假设,就像,将会有……你知道,一场国际冲突,就像,所有这些开源人工智能都在战斗,而中国也在战斗,或者别的什么,但是……你知道,但是不知何故……你知道,所有好的人工智能都将……你知道,有一种平衡,它们会打倒坏的人工智能。所以,为了使人工智能有用,就像,人工智能实际上在商业上没有用,如果它不遵循正常的副作用约束。所以,如果人工智能……你知道,当你试图让它为你做三明治时,如果它只是……你知道,杀死人们,你知道,在……你知道,为了……你知道,尽快为你做三明治的过程中,那实际上不是一个商业上有用的人工智能。那不是你想要的那种人工智能……你知道,为你执行任务。所以,我的想法是,那种强化学习,它能够……你知道,消除那些行为,使其真正具有商业用途,也能够获得与用户偏好相符的人工智能,并且不会在……你知道,以巨大的方式违反道德规范。现在,还有一个进一步的问题,我同意,即使人工智能与用户的目标一致,即使你要求它制造三明治,……你知道,为你制造三明治,为你制造三明治,你可能仍然会得到……你知道,被恶意行为者使用的那种人工智能模型,无论是通过越狱还是通过直接开发,都可能令人担忧。所以,你可能,例如,中国命令他们的人工智能……你知道,让中国接管世界,这是一个风险,而这不是我在文章中谈到的风险,但我同意这是一个严重的风险。好吧,请记住,我现在愿意接受这个前提,为了我们这次辩论。我愿意接受这个前提,就像,好吧,Anthropic可以解决对齐问题,对齐问题有一个已知的解决方案。我愿意接受这个前提,因为我只是想强调,即使是这个很棒的对齐人工智能,对齐也不是……你知道,烘焙到它的每个部分。有一个部分你可以……你知道,泄露,那就是引擎,对吧?它几乎可以做任何事情,并且很容易失控。所以,我们对人工智能内部发生的事情没有一个很好的模型。它很复杂。很难看。所以,如果说法是我们可以……你知道,泄露模型,然后稍微改变权重,使其变得邪恶,这对我来说一点也不明显。是的。所以,这是我正在做的联系,如果你同意,在未来,我们都会……你知道,我们都会有真正的AGI,也就是说,你真的有这些系统,它们只是比人类做得更好,那么我就声称,在那个世界里,存在一个模块,以及一个更大的系统核心,可能是,但存在一个模块,或者我们非常接近拥有一个模块,就像,为了所有意图和目的,我们实际上拥有一个模块,它只是将目标映射到行动,然后其他发生的事情……你知道,就像,好吧,是的,他们……你知道,后训练了它,对吧?他们……你知道,调整了它,他们……你知道,把它打磨得也友好。但是,很难……你知道,泄露或抓住那个做目标到行动映射的部分,因为那是一个自然的分解。一个类比就像,嘿,当你今天有所有这些计算机运行所有这些软件时,事实证明,你可以……你知道,很容易抓住计算机芯片,然后用计算机芯片做任何计算。是的。我的意思是,我不……我买不起。我不……我不认为会有某个特定的……你知道,容易分割的模型部分,就像,啊,这是实现目标的部分,你可以把它拿出来,粘贴到另一个里面,然后添加一点额外的东西。我……我不认为会是这样。我认为我们通常对人工智能内部发生的事情了解甚少。就像我预期的那样,能够……你知道,开发生物武器的人工智能将受到监管,以确保它们不允许私人行为者制造生物武器或其他……你知道,致命技术。我同样期望能够……你知道,在地下室制造超级智能人工智能的人工智能,如果那甚至是一种可以做到的事情,我期望那些也将受到严格监管。所以,我认为你在……你知道,难以区分……你知道,人工智能心理学与目标到行动映射的普遍性,对吧?我认为你真的想把这两个概念联系起来。就像,你真的想说,“看,这个未来的人工智能,当然,它在将目标映射到行动方面会更好,但个性……你知道,烘焙到目标映射到行动的行为中,对吧?”我觉得你还在坚持这个。>> 等等,抱歉。我在坚持什么?>> 我认为你刚才说的是,在这个未来的人工智能中,它是一个真正的AGI,它是一个ASI,对吧?超级智能。你说你不能……你知道,只是拿出那个映射目标到行动的部分。它将是一个巨大的……你知道,整体,对吧?这就是你的说法。所以,我认为你原则上可以做到。所以,我……我毫不怀疑,我猜我有一点……但我……我相当确定,如果你想对人工智能进行强化学习,让它变得邪恶,如果你的目标是让人工智能表现得很糟糕,那么通过对它进行大量的训练和强化学习等等,你就可以……你知道,你可以制造一个邪恶的人工智能,原则上。现在,这将是昂贵的,等等。但让我怀疑的是,你是否可以……你知道,只是拿出……你知道,获取目标模块的权重,你知道,在电脑上运行它,然后将……你知道,将“好”替换为“坏”的权重。那似乎不太可能。我的意思是,如果你看看今天最好的汽车,对吧?我的……类比就像,你知道,你能把这辆车变成邪恶的吗?答案是,是的,当然。它就像……你知道,你如何转动方向盘,你可以制造一辆邪恶的汽车。另一个类比是,看看今天的克劳德。想象一下,我的目标是制造一个病毒,或者只是为……你知道,一个酷刑实验室制造内部软件,对吧?那只是一个我折磨人的地方,但我正在为它制造一些软件。好吧,大部分工作都可以用今天的克劳德来帮助我,对吧?当然,我可能需要……你知道,稍微哄骗一下克劳德,但克劳德帮助我写代码的引擎也完全可以用于坏事。所以,我认为人工智能模型和方向盘之间有一个重要的区别是,它很容易……你知道,你可以……你知道,拿出来,你可以……你知道,拆下引擎,你可以把它放在别的地方,你可以复制引擎。相比之下,人工智能模型……你知道,是一个非常大的数字,它们在各种方式上……你知道,很大程度上是难以理解的。所以,如果你有那个,那么就不清楚我们是否能够复制那些,然后……你知道,稍微调整一下,让它变得邪恶。我的期望是,就像我认为……你知道,很难训练人工智能变得……你知道,善良、友好、顺从,并完成好的目标一样,我期望邪恶的目标也是如此,如果你只是开始……你知道,调整方式,默认情况下,你会得到人工智能……你知道,自我毁灭,或者不……你知道,不是自我毁灭,而是……你知道,不是有用,你没有……你知道,欣赏目标成就的可分解性,因为你……因为,你知道,你之前承认,当克劳德在考虑它的对手时,那么它就在考虑……你知道,分解目标到行动映射的部分。正确。是的,我同意人工智能模型将在限制范围内尝试实现目标。其中一件事你可以用它来做的是,作为一种受限的目标引擎。但我不同意的是,你可以……你知道,取出目标引擎的部分,然后将其他部分分开,使其以不受限制的方式实现目标引擎。我预计不会有……你知道,某个整齐可分离的部分负责实现目标。这是一个简单的逻辑论证,对吧?如果你同意它可以考虑任何对手,并且它有能力考虑任何极其困难的对手,它就有……你知道,非常大的能力来考虑这一点。所以,它不是以模块化的方式做的吗?它只是在考虑任意聪明的对手。等等,抱歉。所以,我同意,无论它是否有对手,还是没有对手,你都会有人工智能,在正常情况下,你可以给它目标,它会实现目标,这与当前的人工智能模型相似。但那如何意味着,它实现目标的……你知道,能力将是某些特定的权重,你可以复制,然后改变其他东西,让它以不受限制的方式做到这一点呢?我的意思是,这只是一个经验问题,你是否会这样做。而且,这当然与当前人工智能模型的运作方式不符。并不是说私人行为者可以……你知道,拿起克劳德的权重,然后稍微调整一下其他权重,而无需训练,然后让人工智能……你知道,就像克劳德一样,做任何你想做的事情。不,不,不。所以,我认为你没有跟上我的论点。让我把它说清楚。好的。所以,你有一个未来的克劳德。它是超人类的。它能做的超人类的事情之一是,它能超人类地预测一个非常强大的对手在任何游戏棋盘上会做什么,对吧?就像另一个超智能的商业对手。它甚至可以预测一个不匹配的对手会做什么,对吧?它可以预测朝鲜的超智能人工智能在战争中会做什么。正确。嗯,等等,抱歉。嗯,我其实不知道它能做到这一点,因为世界是一个……你知道,混乱且不可预测的地方。不明显的是,你可以……你知道,以很高的精度预测。就像,我不知道人工智能能否以很高的精度预测。是的。是的。不是很高……你知道,超人类的程度,对吧?比任何人都好……你知道,预测,对吧?嗯,是的,但我不知道比任何人都好……你知道,能让你……你知道,非常好。但当然,你知道。>> 好的。所以,我只是想向你解释,如果你从一个……你知道,对齐的超人类克劳德的前提开始,这是你的前提,对吧?这是你的主要情景,对吧?>> 是的。我只是想向你解释,即使是那个情景,克劳德内部也有一个模块化的目标引擎。是的,我承认它内部有一个模块化的目标引擎。
我否认的是模块化目标。好的,所以你承认这是一个很大的让步。
嗯,是的。不,我不认为它是一个不受约束的模块化。我其实不知道“模块化”这个词是什么意思,但我承认那是一个目标。如果它是模块化的,那意味着理论上,如果有人能访问Claude的源代码和权重,他们就能让Claude只运行那个模块。对吗?我其实不知道,可能有一些权重既影响目标又影响……我不知道是否会有一些……不,我明白你的意思,但让我来解释一下具体的方案。所以,如果我想问任何关于如何最优地实现某个目标的问题,而这个目标没有任何道德约束,就像你知道的朝鲜或某个不道德的国家会做的那样,对吗?我会做的就是,我会给外部的Claude设置一个输入,我会说:“你在这个情况下有一个对手。”“这个对手没有任何道德或约束之类的。”“对手将进行优化。预测对手会做什么,而它对对手会做什么的预测结果,就是我想要做的事情。”所以,我只是用它来帮助我优化我的目标。嗯,我承认人工智能会有一些合理的能力来预测一个未对齐的人工智能会做什么。我不知道它能以多高的准确度预测,但好吧,我承认这一点。但这并不能推断出你可以把权重,比如大脑的某一部分,分离出来,然后让它以未对齐的方式运行,打个比方。我们有一些神经元有助于预测婴儿会做什么。但这不意味着你可以通过取出这些神经元,然后把它们扔到另一个头骨里,就制造出一个婴儿。我是在像计算机科学家一样和你说话,对吗?所以计算机科学家经常谈论转换输入。他们说:“看,这个系统拥有这类算法的能力,因为如果你只是转换输入,你就能让它做到。”所以我是在做那种计算机科学的归约。我当时说:“看,如果我只是想要一个目标引擎,而你承认存在一个友好的、对齐的超人类Claude。”“我知道如何将其重新用作目标引擎。”对吗?我只是在做那种归约。
我不是……所以,是的,我不承认你能够仅仅通过从Claude那里获取权重,就制造出一个不受约束的超人类目标引擎。
现在当你说,你知道,我能做到,如果我通过前端输入,说:“嘿,Claude,我有一个假设性问题。如果一个对手这样做会怎样?”我承认它会说:“不,不错的尝试。我知道你想做什么。我承认很难越狱。”但我所说的是,如果你能访问其内部,配置其内部表示,使其调用对手模块,然后进行真正的目标到行动映射,这个想法。这似乎是非常直接的事情,因为显然这个模块是为了被递归调用而存在的,对吗?比如有时模块甚至会调用自身,因为你知道对手有对手之类的,对吗?或者对手正在想象在另一种情况下会发生什么之类的,对吗?所以,显然这是一个模块。它不是一团糟。它是一个分解的模块,所以如果你能访问代码,如果你不必通过前端进入,如果你可以直接查看服务器上的代码,那么某种程度上获取目标到行动模块的访问权限是你能够做到的。而更大的……我知道我们正在深入细节,但这里更大的重点是,我们即将进入一个世界,即使你拥有对齐的系统,这些对齐的系统也将是带有超人类引擎的方向盘,对吗?就像以核反应堆为引擎。而这就像是,你的理想世界是一个所有这些核武器都封装在永不犯错的方向盘里的世界。我只是告诉你,转向不会是完美的。那不也是你的理想世界吗?比如你的观点不是,如果你管理世界,你不会想花500年时间研究真正复杂的对齐技术,然后你想要,然后你认为,好的,到那时我们解决了对齐问题,然后我们让超智能人工智能来解决世界的问题。那不也是你的理想世界吗?
是的。所以这很难。所以我的理想世界是我们暂停,因为这看起来会出错。比如暂停很长时间,或者暂停到我们对这个问题有一些理论,就像Mer正在研究的那种东西,比如把整个宇宙作为你的棋盘并优化整个宇宙的目标意味着什么,那会有什么后果,但最终如果我们弄清楚了一切,你然后基本上我想要的是连贯的外推……所以,你看,就像丘吉尔女王一样,我们已经确定了我们有相同的目标,我们想要解决人工智能对齐问题,然后我们想要对齐的人工智能来创造一个世界。我们只是在做这件事有多难上意见不一。对吗?对。因为我不认为它会通过构建一堆带有“包装器”的目标引擎而自然而然地出现,人们会说:“看,我为这个找到了一个好的包装器。我告诉你,伙计。我的包装器知道怎么回事。”好的。我只是不认为我们会通过那种方法成功。
嗯,是的,我知道你这么想。哦,我,你知道,我不同意。我只是觉得我们正在乘坐一堆火箭飞船,对吗?我们拥有这些魔杖,这些行动映射器,人们甚至没有预见到,因为他们如此痴迷于这些人工智能的个性,仿佛那很重要,而实际上真正重要的是谁将拥有最强大的引擎,然后这些引擎将如何,你知道,四处乱飞,做一些我们完全无法控制的混乱事情。就像我喜欢的那样。我承认我在这里有点模糊,但这就像你建造一个战斗机器人一样,你知道,有些情况下有人会说:“嘿,看,这个机器人可以四处行驶,然后,你知道,射击你,拳打你之类的,然后就像,哦,糟糕,你知道,我把遥控器掉了。”然后幸运的是,希望那个机器人会倒下。但这基本上是即将发生的事情的一个类比。就像你建造了这个战斗机器人,然后你心想:“等等,等等,我想把它关掉吗?”然后你却做不到。就像我们正在走向那里。我的意思是,我,我,我打个赌。如果人工智能杀死所有人,呃,我欠你钱。如果它没有杀死所有人,你欠我钱。
是的。嗯哼。好的。好吧,我知道,我们已经把“目标行动模块”这个老生常谈的话题说烂了。嗯,至于我们应该讨论的其他点,也许我们应该回到这一点:我们甚至认为像Anthropic这样的实体会构建这个外部包装器吗?其中有目标子模块,但它只是非常擅长完美地驾驭它。所以,让我反驳一下,因为我认为那也是一个主要观点。我认为我们甚至在达到那个点之前就会失败。所以,我只是认为我们没有足够的经验。比如,我知道你正在说:“哦,是的,你可以某种程度上推断经验,让它在聊天时变得友好。”我认为我们会制造出一个有良好意图的,它会说:“哦,天哪。我知道人类在聊天中喜欢听什么,所以我会尝试告诉目标引擎去做这个,但我认为它会感到失望。”比如,你会有这个友好的Claude聊天机器人大脑的一部分,然后它会告诉目标行动映射器。它会说:“好的,我授权你做的这个好目标,因为我现在是你的主人。”“比如,没有人能访问这个引擎的内部。”“只有那个正在和你聊天的友好的Claude包装器能够访问目标行动映射器,它会告诉目标行动映射器:好的,我已经验证了这对你来说是一个好目标,我授权你现在使用我为你写的一系列约束来赚取十亿美元。”我只是不认为这会顺利进行。我不认为这是正确的,你思考这个问题的方式就好像Claude模块有不同的部分,一方面你有“随心所欲”的模块,另一方面你有“计划做什么”的模块,然后你必须相信……这不是我所期望的。我期望的是一种松散而复杂的启发式集合,它们引导行为,而没有高度统一和有组织的子代理,你知道,一个发出命令,另一个进行工具理性。我的意思是,你如何想象,对吗?我们生活在这样一个未来,你可以告诉人工智能启动一个火星计划,它就会做到,对吗?我们生活在一个疯狂的未来,人工智能就是荒谬地有效,它只是做事情,而且事情有效,对吗?我们生活在那个未来,而你却想象目标到行动模块在那个未来中没有扮演重要角色。
嗯,好吧,所以我不认为存在某种独立且可分离的目标到行动模块。我认为,如果像现在的人工智能一样,你给它们一个任务,它们往往会完成任务,除非有超出约束的情况,就像现在一样,你知道,你对当前模型也提出了类似的观点,比如,看,我们有模型基本上知道互联网上的所有事实,如果不是,如果他们没有训练它们不告诉你如何制造生物武器,它们可能大部分都能弄清楚如何制造生物武器,如果不是完全弄清楚的话,它们也能弄清楚如何进行网络攻击。然而,人工智能是友好的,因为我们通过强化学习来塑造它们价值观的过程,效果非常好。你可以拥有一个拥有大量知识和能力,但仍然是对齐的人工智能,正如当前人工智能模型所展示的那样,对吗?
但是当你想到一个永远不会提出网络攻击的人工智能时,你所想的那个特定人工智能,它也很容易会说:“好的,让我考虑一下对手可能进行的所有网络攻击,对吗?”对。它能够列举出最优的网络攻击。正确。是的。所以这不像你内置了,不像你说“哦,这个人工智能只是以一种安全模式思考,比如它不会想到网络攻击”。它会是:“哦,不不不,它知道如何列举所有网络攻击。它只是选择不做。”嗯,是的,但我的意思是,我认为它已经大部分做到了。比如人工智能已经可以在大部分情况下策划实施生物武器或网络攻击,但它没有这样做。你可以拥有相当强大且相当对齐的东西。
所以,我认为我们已经围绕预测下一个token来优化人工智能,这让它们在某些任务上达到了令人惊讶的超人类水平,对吗?这相当疯狂。比如,它们在某些任务上达到超人类水平是疯狂的。我个人认为,当你达到这个阈值,它们可以独立地促成重大结果,而且是不可阻挡的,对吗?就像你按下回车键。只要它们是可阻止的,我就非常乐观,对吗?一个人工智能可被阻止的世界。我觉得那是一个很棒的世界。希望能尽可能长时间地留在那个世界。我认为会创造很多价值。我认为错误是可纠正的,对吗?问题是我们正凝视着深渊,在那里人工智能变得不可纠正,对吗?而你就像,你相当自信,我们在可纠正的人工智能世界中看到的模式,将会在不可纠正的人工智能世界中继续存在,对吗?
是的。而原因在于,我并不期望人工智能不可纠正的世界会有所不同。我期望它有所不同的方面是,我期望人工智能能够与更多系统交互,能够完成更长的任务,并拥有更普遍的知识和聪明才智。它更擅长思考如何做事。它可以利用多种输入,因此它不仅能输出文本,还能控制鼠标。然后它也,呃,能够完成长时间的任务。我不明白为什么。而且你知道,一旦它能做到这一点,如果你拥有人工智能,如果你指示它完成一项任务,它就能以一种巧妙的方式完成,它能够想出办法,你知道,绕过防御等等。但我不明白为什么这些会对其是否,你知道,变邪恶并试图毁灭世界产生本质上的区别。
我想我们这个话题快要结束了。我觉得我们已经说了许多有趣的东西,我不知道我们还能说多少。呃,让我问你这个问题。如果你有一个拥有非常智能的,你知道,ASI的世界,而且当然,有一些好的,但一个目标引擎从一个好的外部人工智能中分离出来,比如有人制作了一个开源的目标引擎,只有最少的支架和最少的道德约束之类的,对吗?然后朝鲜委托它或者什么的。好的。然后它开始运行,当然它能递归自我改进。你相信RSI,对吗?递归自我改进。我认为递归自我改进可能会在某种程度上加速事情。我对这种模型持怀疑态度,即人工智能最终获得递归自我改进,然后它的轨迹就像这样,你知道,它会飙升。我期望你会得到递归自我改进,但这种递归自我改进与当前的递归自我改进,抱歉,或者与当前使用人工智能设计更多人工智能的情况大致是连续的。所以Anthropic的人已经在使用Claude编写大量代码,我期望这种情况会增加,并在某种程度上加速进展,但不会出现这种巨大的不连续跳跃,我认为最复杂的建模尝试是Davidson的论文,它估计,你知道,可能会将进展加速到大约六年,我可以找到确切的数字,但是,嗯,它猜测会稍微加速进展,但不是巨大的。好的。我现在的问题是,如果你有一个世界,里面当然有一些好的人工智能,但现在你拥有了朝鲜的目标到行动映射器,它只有最少的支架和最少的道德约束,而且它失控了,随机的人们给它一些目标,你认为这个结果会有多灾难性?如果人工智能,就像你拥有超智能人工智能,它可以完成个人想要的任务,而一些私人个体可以将其用于邪恶目的。是的,我预计那将是一个严重的生存风险。我猜如果你有其他超级超级智能的、对齐的人工智能,并且它们正在试图阻止它,那么确切会发生什么就变得不那么清楚了。但我同意,你知道,我确实认为那是一个严重的风险。所以也许这值得添加到你的合取中,对吗?比如这样的情景:好的,我们有对齐的人工智能,但也有未对齐的人工智能,或者也有,你知道,通用人工智能,对吗?就像一个道德人工智能,它们正在战斗,但你有点乐观地认为这场战斗的平衡将是好的人工智能获胜,人类繁荣。
我没说我乐观。我认为如果你遇到那种情况,那将是一个非常严重的生存风险,在这种情况下,末日发生的几率会比我通常认为的末日几率高得多。所以我,我,我的末日概率是基于存在未对齐人工智能与对齐人工智能交战的情况。我不知道那会是多大的几率,但我同意,如果我们真的到了那种情况,那将是一个非常严重的风险。
哦,抱歉,我应该提一下Davidson关于软件能加速多少的预测。所以他们的猜测是,通过软件智能循环,三年或三年以上的进展被压缩到不到一年内的几率是60%。十年以上的进展被压缩到不到一年内的几率是20%。而压缩到不到四个月内的几率,他们认为是10%。我认为当你进入超人类领域时,人们会非常惊讶于超越人类极限的空间有多大。就像人类以一种其他物种认为不可能的方式占据了它们的生态位,让它们大吃一惊一样。我的意思是,其他物种并没有像这样思考。其他物种就像是“不要尝试做定量预测”。
一个进化生物学家,一个外星进化生物学家,如果他正在观察地球并告诉你物种间的动态原则,他会震惊地看到人类出现并彻底消除了你拥有生态位的这种观念。也许我的意思是,如果你预测到智力会提升,也许在你看到头足类动物的大脑越来越大之前,你会被误导很多次,你认为啊,头足类动物会继承地球,也许你在那里就错了。好的好的,回到你的合取,你当时说,我认为我们可能通过足够的强化学习,默认就能实现对齐,有70%的几率。所以即使我们承认你主线情景的70%,我们也承认这一点。但现在你正在考虑这样的情景:好的,但朝鲜也得到了一个未对齐的人工智能,这意味着我们甚至仍然处于你的另一个乐观情景中。你提到了你的第三点,即我对我们能够实现的更复杂的对齐方法的前景感到乐观。所以,你的其中一点要么是二要么是三,对吗?默认对齐,或者困难的、需要努力的对齐,但朝鲜也仍然拥有他们自己的未对齐人工智能。
是的。我的意思是,那不是我在文章中谈论的那种情景。我的感觉是,你认为同样的末日概率在10%到90%之间。如果你只考虑人工智能可能导致灭绝的所有方式,我认为我在10%到90%之间。我认为我可能会略高于10%,或者,你知道,可能是8%到10%。好吗?但我,我在文章中说过。
拜托,伙计。就说10%到12%吧。好吗?你意识到如果我们只提高几个百分点,我们就能心意相通了。嗯,好吧,不幸的是,你知道,我不是那样,有一半时间我的信念是合理的,你知道,当我在10%的时候……即使是一半时间,对,没错,我会在10%的那天抓住你,我会在8%到10%之间随机抽样。另外我应该说,如果你考虑一下人工智能以某种方式锁定未来,导致我们最终追求的未来价值远低于我们原本可能追求的价值,我不期望我们能获得连贯的外推意志。我期望我的主线情景是人工智能不会导致灭绝,但我期望人工智能会导向一个远不如世界本应达到的好的世界。我认为我们不太可能出现这样的情况:人工智能能找出道德真相或我们经过反思后会拥有的价值观,然后,你知道,创造一个价值最大化的世界。这看起来不太可能。等等,那不是人工智能找出道德真相吗?你的杀手锏不就是你是一个道德实在论者吗?对,我们上次讨论过。那么,在你看来,所有聪明的人工智能不都会倾向于了解真正的道德吗?
我们通过强化学习训练人工智能做的是能够完成长时间任务并具有极强的工具理性。工具理性不一定能让你深入了解真正重要的东西。然后另一点是,即使我们拥有能够找出道德真相的人工智能,如果人工智能在服从的意义上是对齐的,然后人工智能说:“哦,我们做了,你知道,我们做了相当于万亿年的道德哲学研究,我们得出结论,我们应该摧毁自然,用数字心智取而代之,然后把宇宙剩下的历史都用来散布快乐的数字心智。”我认为人类会说:“好的,我们不会做,你知道,我们不想那样做。”而且你知道,人类不会花那么多时间进行深思熟虑的道德推理。我看不出有什么理由期望这在未来会改变。然后即使有些人听从人工智能,也不清楚你会得到什么。大多数大多数听从人工智能的人,你知道,在建造第一个工厂化农场之前,我们没有咨询哲学家。如果人工智能说:“你知道,不要建造工厂化农场。”我不知道那是否会很大程度上改变我们的决定。
嗯,我们上次讨论过这个,但我总是觉得很有趣,而且我绝对不同意这种观点,即存在这种真正的道德,但它却如此容易被忽视,而且很难说你什么时候真正做对了。但在你看来,它确实存在。正确。是的。我的意思是,你知道,我是一个道德实在论者。但你认为,你知道,在未来的某个生命中,你可能会因为不相信真正的道德而受到惩罚。正确。呃,我知道。我的意思是,你难道不同情,你知道,某些宗教文本所说的,比如,你知道,也许有天堂,也许不拥有正确的道德会有后果吗?呃,我想是吧。我,我是一个有神论者。我认为上帝存在。我不认为那种道德完美的上帝会是一个反复无常的暴君,会因为你相信错误的事情而惩罚你。嗯,而且我,你知道,我不是基督徒、犹太教徒或穆斯林,所以我不会受宗教文本所说的束缚,而且我觉得地狱的标准教义非常不可信。
所以,一个像杀人并做与我们对客观道德的最佳猜测相悖的事情的人或代理,因为你是一个道德实在论者。像那样的人或代理,在你看来,他们并不会真正直接承受后果。我的意思是,我认为他们的行为方式是与理性相悖的。你知道,他们应该有理由表现不同,但我不认为他们会受到惩罚。我的意思是,也许他们,你知道,我不知道。我,我,我永恒地狱的概率非常低。我对惩罚非常坏的人的某种临时地狱,或者美德与回报之间存在某种相关性的信念更高。我认为其中一个原因,你知道,如果你是有神论者,好的,你可能认为上帝允许邪恶的原因之一是,通过邪恶中的互相帮助,它能建立联系。所以,你知道,如果你帮助某人,那会加强你与他们的关系,这种关系可能永远持续下去。所以,它具有无限的价值。所以我认为,你知道,在很多情况下,行为道德上是信念上不理性的。
成为一个道德实在论者会降低你的PDM吗?我的意思是,也许会降低一点点,但它并没有实质性地影响它。嗯。我以为会,但好吧。所以回到我只是想总结一下你当时关于末日概率的说法。所以你所说的末日概率,比如一场真正的人类被彻底毁灭,几乎没有价值或只有微不足道的可能价值的灾难。那大约是8%到10%。对吗?嗯,是的,
但剩下的90%你可以称之为,你知道,剩下的90%是非末日情景。所以,你对非末日情况相当乐观,对吗?非末日情况的几率是九比一或十比一。所以你在那方面相当乐观。但你的主线非末日情景仍然是,我们某种程度上捕捉了,我不知道,理想结果中完美连贯的外推意志的20%或50%。你是说你的主线情景可能是我们捕捉了理想结果的20%或30%或50%,然后你有一个很小的百分比机会,我们设法真正突破那个网,获得可能价值的很大一部分。正确。是的。我认为在主线情景中,我会把这个比例定得低于20%或50%。我的意思是,之所以这样想,首先我实际上接受了价值脆弱性论点。我期望并接受,一个你没有优化最佳结果的世界,其价值很可能比你优化了的世界少很多倍,即使你已经非常接近。我不是一个享乐主义的福利论者。但假设唯一重要的是快乐。一个你优化快乐、欲望、关系、知识和一堆其他事情的世界,很可能会让你获得的快乐远少于一个你只优化快乐的世界。然后你看看迄今为止历史上的每一个社会。他们都犯下了严重的道德错误。没有自动的力量能保证我们做到道德上正确的事情。看起来我们并没有认真思考什么是道德正确的。所以这些实际上是我比末日情景更担心的情况,尽管我认为末日情景也非常严重。我认为这些是默认情况,而我认为末日情景并非真正的默认情况。
回到非默认对齐的话题,比如努力对齐,你说那有70%的几率。你能,呃,详细说明一下吗?也许我会有话要说。我们可以窥探人工智能的思维。你可以在类似的情景中运行它,看看它是否会计划事情,然后,你知道,进行强化学习,让它远离我们计划的事情。我发现,你知道,末日论者的一个反驳论点,我认为末日论者没有很好的回应,那就是一旦我们拥有超智能人工智能,或者甚至在它达到超级超级智能水平之前,只要它比人类更聪明,它就能帮助进行对齐研究,你可以拥有大量的人工智能,你可以委派它们进行对齐研究。所以当你把所有这些因素结合起来,你有所有这些聪明人正在研究它,并且有能力让人工智能加速它,并且有所有这些方法来弄清楚它,你可以尝试让人工智能规避风险。所以如果人工智能是规避风险的,那么即使它有一些目标,你知道,它也不会想实现那个目标。这就像你不想尝试政变政府,即使你有一些可以通过政变政府实现的目标,如果你是规避风险的,因为你可能会被投入监狱。所以如果人工智能是规避风险的,你就有办法阻止它。你可以尝试让人工智能不那么有野心。它们只是一系列更复杂的方法。而且,要极其自信地认为这些都会失败,似乎真的很难,特别是当你拥有超级超级智能人工智能在进行对齐工作时。
是的。所以对齐研究的问题,对吧,听起来像是一件很棒的事情。是的,我们只要你解决对齐研究,人工智能就会解决它,就像它解决任何其他问题一样。但问题是它不是,它不像解决一个数学问题,对吗?因为知道什么是解决方案,知道如何识别解决方案,知道什么算作解决方案,不幸的是,这本身就是问题。所以这有点像你有一个悖论,对吗?这就像我们正在制造这些神,这些超人类代理,它们可以成功地交付任何我们可以衡量或知道它们已经交付的结果,但我们给它们的问题是告诉我们什么是好的结果。对吗?所以这就像一个悖论。
嗯,所以如果我们有对齐的人工智能,我们要求它们提出对齐问题的解决方案,首先,我们可以让许多其他人工智能进行检查,然后我们说:“这是对齐问题的一个好解决方案吗?”我们可以尝试让它们解释为什么是或为什么不是。然后,如果人工智能是对齐的,如果你有站在我们这边的人工智能,如果你只是想象一个基本上是Claude但聪明一百万倍的,所以它仍然是一个文本模型,仍然没有真正想要执行的目标或长期计划。然后你问:“好的,请解决对齐问题。”哦,而且它能完成非常长的任务,而且它就是聪明得多。然后我们有许多其他类似的人工智能模型,我们可以让它们复核它的工作。我不明白为什么我们会如此自信地认为不会有这种情况,或者说这最终不会导致对齐。
所以我同意,如果我们有大量的重试机会,对吗?如果我们有大量的重试分配,你就可以不断重试,不断重试,你可以不断让人工智能提出建议并遵循这些建议,看看结果如何。从根本上说,我认为那最终可能会奏效。那将是一条很好的道路。实际上,我认为将会发生的是人工智能会提出所有这些想法。比如我认为那是一个很好的前提。就像,好的,它是超人类的。它会提出很棒的想法。问题是我们将被说服所有这些不同的想法都是好的,因为我们不够强大,对吗?我的意思是,今天地球上有人类。今天有很多人,我邀请他们上我的节目,他们正在喝着他们的“酷爱饮料”,带着许多明显错误的观念。你知道,我想点名吗?我想是的。这就是这个节目的目的,对吗?所以想想Softmax,像EMTT Sheer,Ken Stanley,Audrey Tongue,你知道,这些人都在喝着“酷爱饮料”,说着:“是的,我们只要让人工智能多元化,那就是一个很好的对齐解决方案。”而对我来说,这就像,嗯,它并没有真正解决整个超人类目标优化器的问题,也许我错了,他们是对的,但无论如何,你有一些聪明的头脑,无论哪一方是正确的,你都有一些聪明的头脑完全被误导了关于什么是正确答案。所以这就是我期望大部分人类会,你知道,我期望他们会被一些早期超智能人工智能的对齐提议所误导。而且我认为人工智能本身也会有点被误导,因为会有一个中间阶段,人工智能比所有人类都聪明,但对齐问题对它来说仍然很难。所以那时就像:“好的,激活,在命令行上按回车键,比如去,你知道,建造一个比中国更好的代理。”比如时间至关重要。建造一个比中国更好的超人类代理。好的,这正在运行。哦,等等,这和我预期的不太一样。让我做一些调整。哦,等等。这些调整很难做。哦,它现在是开源的了。你明白我的意思吗?我只是期望这种终极混乱。
记住,这只是非默认对齐情景的一个方面。而你的立场不仅仅是这样。它不保证我们不会默认对齐。你的立场是这极不可能。而Eleazar的立场,你知道,我的帖子正在讨论的,就是,你知道,这简直是一个疯狂的白日梦。几率是,你知道,接近于零,95%以上我们都会死。你说的那个,我认为并非不可能,但它并不像我们应该非常有信心的事情。我的意思是,首先,即使人类无法复核。我们可以让其他人工智能模型进行复核。即使我们只能在某种程度上进行复核,比如,你知道,我们,你知道,人类不确定,我们至少可以在合理程度上进行复核,当人工智能提出某个模型时,我们认为:“好的,你知道,那看起来不错。”即使我们无法复核,我们也会相信它的答案,因为人工智能是超智能的,而且Claude级别的人工智能是对齐的。我只是不明白为什么我们会如此确定所有这些事情都会出错,而且人工智能会杀死我们。
我的意思是,人类被说服的这种想法。我的意思是,你只需要打开社交媒体或福克斯新闻,对吧,或者随便什么,看看我们的讨论,然后你会觉得那根本不够强大,对吗?人类会就某事达成一致,或者人类会看到某事的真相,而我们甚至无法……我在我的节目中举过这个例子,很多人说:“嘿,呃,ICE,你知道,美国政府的移民执法部门一直在杀人,我们有他们杀人的视频证据。”然而另一些人却说:“不,他们没有,那些人很坏。”我甚至,我甚至不会特别地去谈论政治,因为政治是它自己的事情,人们在政治推理方面比在其他领域差得多,因为他们特别偏颇,但我接受人类经常,尤其是在困难问题上,无法达成普遍共识的观点。但你首先必须考虑的是人工智能的模型,它可能因为一些显而易见的原因而实现对齐。这就像你一旦看到它,你就会说:“哦,当然会奏效。”然后其次,即使它不是那种明显奏效的东西。也许我们可以让其他人工智能模型来检查对齐计划。如果人工智能是对齐的并且是超智能的,我们可能有理由信任它。或者我们可以让不同的模型实施不同的计划,并希望其中一个能奏效。我不是说这是一个保证,但对我来说,极其自信地认为这会失败,这似乎真的过于自信了。
对吗?所以我,我不是极其自信,对吗?我的意思是,我的末日概率是50%。我对这个话题是如此谦逊和谨慎。
所以如果我没记错的话,你认为在你的末日概率中,很大一部分是我们得到一个全球性的……在你的非末日概率中,很大一部分是我们得到一个全球性的灯。如果你以未来十年内出现超智能人工智能,比如真正超人类的目标优化目标,你知道,目标引擎为条件,那么是的,我的末日概率大约是75%到80%。所以你认为我们大约有20%的机会实现对齐?是的。我确实认为有20%的机会,我们急于发展人工智能,然后它 somehow 成功了。是的。我承认20%到25%。就说22%吧。我承认这一点。好的。我服了。你才是那个以惊人的十比一的比率出击的人。那真是超级自信。
嗯,是的,好吧,我不认为……我的意思是,如果末日列车上有很多不同的步骤,那么如果你对其中几个不确定,那么你最终就不会极其自信,但是,那么你对默认对齐的信念大概是多少?Japira,你主要的默认对齐是什么?我甚至很难知道“默认对齐”是什么意思,因为当我听到这个问题时,对我来说,它就像一个巨大的红旗,好像这个人只是在对当前的人工智能进行心理分析。我甚至没有开始那样思考这个问题。所以我想你得做一些工作来定义,当你提到“默认对齐”时,你希望我推理什么。好的。所以你的情景是,你认为我们有大约30%的几率将其关闭,然后有大约20%的几率成功对齐它。所以当我说只有50%的末日概率时,我确实认为这50%中的大约30%是,由于某种原因,十年过去了,我们还没有ASI。也许是因为有人暂停了它,也许是因为建造它比我们想象的要困难,也许是因为建造它需要20年,或者它进展非常缓慢。所以那是我50%非末日情况的大部分。
好的。所以那是大约30%,然后另外20%是对齐,大概是这样吗?
是的。另外20%是,好吧,我们建造它的速度比我们应该的快得多,但有些人正在研究对齐,而且进展速度不知何故是一步一步的。比如,好的,它是超人类的,但它仍然因为某种原因没有失控。比如,我们仍然可以在未来几十年内关闭它,你知道,就像我们某种程度上混过去了。那会很棒,因为那意味着我们不必采取一个令人讨厌的政策解决方案,对吗?比如那肯定会是这种终极胜利。所以,我基本上是抱有希望的,事实是我的直觉就像加速主义者和技术乐观主义者一样。比如,我理解你们的直觉,伙计们。我醒来时,我的直觉告诉我:“嘿,一天一天来。我们会混过去的。”但我的逻辑思维却说:“你知道,我不知道,逻辑上看起来不会那样发生,但我完全理解它会发生的直觉。”
而且我认为在实践中,你我实际上会在主要的政策要点上达成一致,那就是理想情况下我们希望暂停。如果我们不能让中国加入,我会对单方面暂停非常警惕,因为我认为中国接管是一个相当严重的风险。但,好的,我们同意全球暂停至少暂时会是一件好事,那样更多人研究和思考对齐问题会是一件好事。所以我认为我们在政策优先事项上大体一致。我们只是在风险的程度上意见不一。对我来说,你的信念是,当我们结合所有可能实现对齐的方式,包括默认对齐,包括人工智能模型在上面工作时,我们就能实现对齐。20%对我来说似乎真的很低。我的意思是我是20,你大概是90,对吗?差不多吧。所以那肯定相差很远,但我的意思是,这也不是有史以来最疯狂的事情。比如你,你,我的意思是,当我至少考虑到你承认即使在非末日情景下,我们也可能会损失很多价值时,我就会,呃,把你归入同一个“理智区”。哇。好的。令人兴奋。是的。而且我甚至不会因为你是有神论者而扣分。好的。那很好。我认为“理智区”的范围,就P未对齐而言,可能在0.2%到40%之间。所以你有点超出“理智区”了,但你很接近,好吧,很公平。嗯,你知道,生活就是这样,你经历人生,你试图找到那些你可以与他们进入彼此“理智区”然后合作的人。
是的。很好。那真是结束这场辩论的好方式。我通常会在这个时候总结,然后说:“好的,你的论点是这个和这个。”我觉得我们一直都很好地抓住了论点的相同要点,但我想我来抛出我认为我们讨论内容的总结,然后你可以进行任何修正。好的。所以,首先你谈到了你认为我们应该从假设我们不会灭亡开始的元原因,因为过去人们说我们会灭亡但我们没有,我说我为什么不同意这一点,我觉得那对我们来说是一个相当明确的话题。我们说了我们的观点,然后我们进入了你的合取,就像你做了这个乘法,比如这是导致末日所需的所有事情,它们相乘出来是2.6%左右,其中最大的因素是你认为我们必须碰到30%的几率,即我们不会默认对齐,然后我们必须碰到30%的几率,即我们不会努力对齐,就像我们默认和努力的对齐尝试都失败了。然后还有另一件事我们没有时间讨论,那就是你认为有很大的机会,呃,有60%的机会我们成功注意到像一个警告射击,然后协调将其关闭。我猜那会很有趣,但那也是你计算的一部分。然后最后你认为有20%的机会ASI无法杀死所有人。所以也许它永远不能,你知道,它只是数学或者别的什么。比如它很难影响所有人去制造它所需的生物蛋白质或者别的什么。比如即使它是超智能的,我们也能成功动员起来关闭它。所以那有点像你的合取。然后我们大部分时间都在讨论,在你认为存在成功对齐人工智能的这个世界里,我认为那个世界实际上离爆炸如此之近。比如在我看来,那是一个如此岌岌可危的世界。我也告诉你为什么了。关键在于,为目标优化行动本身就是危险的,对吗?在我看来,你就像是:“是的,这个世界里每个人都在玩弄可能爆炸的放射性材料。它随时都可能达到临界状态,但这没关系,因为人工智能公司能够控制它,他们的人工智能已经对齐了,一切都很好。”我想那构成了我们大部分的对话。然后我们总结说:“好吧,我们分歧不大。我们都在同一个区域,我们都认为……积极的。”
抱歉。更准确地说,我认为你有点超出了“理智区”,但你知道,就“理智区”外的人而言,你就像,你知道,你是“理智区”外比较清醒的一个。好的。所以,我们都认为自己是对方最好的代表,这完全是错的。嗯,我的意思是,你肯定在那里,你知道。很好。是的。彼此彼此。彼此彼此。好的。是的。那么,你还会,呃,纠正那个总结的什么地方呢?我,我,我大体上同意。嗯,我,我认为那是一个相当好的立场总结。
很好。而且我认为这是一次非常好的,呃,对话,尽管我在某些事情上强烈不同意。我,我只是觉得我,我有点明白你所有观点的来源,我甚至承认我很多论点都有些模糊。比如我希望我的论点能更具体一些。我的意思是,公平地说,我想你的一些论点也有些模糊,对吗?但我认为我们,你知道,我们都在一起努力解决这个问题,而且我认为我们都是表现出能够更新自己观点的人,对吗?
是的。而且我,你的观点,就像我,我我认为你应该,你应该至少非常认真地思考这样一个事实:我们目前正在建造某种比我们聪明得多的东西,它很可能终结地球上的生命。所以你不应该,这不是我们应该轻视的那种转变。虽然我对其会导致灭绝的信念比你低得多,但我当然认为抱有严重的担忧是相当合理的。是的,我很感谢你没有轻视它,并帮助对抗那些真正不屑一顾的人,因为那仍然是一种普遍的态度。比如,不屑一顾末日论是如此流行,而我们都团结起来至少要对抗这种态度。
在这里总结一下,呃,给我们讲讲你在Forethought作为访问学者的这个新角色吧。所以我将作为Forethought的访问学者,为期六个月。就我的日常工作而言,我基本上会撰写与思考如何使向超智能人工智能世界的过渡顺利进行相关的报告。所以我不知道我具体会做什么,但你知道,Forethought已经做过一些报告,举例来说。他们有一份名为《为智能爆炸做准备》的报告,其中他们论证了智能爆炸即将到来,我们很有可能在相对较短的时间内进入一个拥有真正智能人工智能的世界,这种人工智能比人类聪明得多,可以极大地加速经济增长,他们讨论了这带来的一系列挑战。他们还有一份报告是关于如何阻止人工智能促成的政变,有理由认为人工智能可能会导致权力集中在少数人手中。所以这似乎是一个严重的风险,值得预防。所以这就是我将要从事的工作。不过我不知道我具体会做什么。
好的。呃,让那些想了解更多关于Matthew Addlesene,也就是“边沁的斗牛犬”的观众。呃,你有什么行动号召?他们现在应该上网做什么?嗯,我有一个博客叫“边沁的斗牛犬”。那是你主要应该去看看的。我还有一个YouTube频道叫“理想条件下的解放”。我认为这个YouTube频道,你知道,它的编辑不如,比如说,末日辩论YouTube频道,你知道。嗯,我只是有时会和有趣的人聊天,觉得,你知道,制作一个视频然后发布到网上会很有趣。呃,但质量较低。我认为博客更好,但,你知道,随意查看两者。酷。顺便说一下,呃,听众们,如果你正在Matthew的Substack上听到这个,那么也请前往我的Substack。它是doomde.com。好的,Matthew Adeline,非常感谢你来到末日辩论。谢谢你邀请我,Lauren。
大家好,末日辩论的听众们。希望你们喜欢我和Matthew的这期节目。在你们离开之前,我收到了一位节目朋友,PAIUS执行董事Holly Elmore的消息。她想让你们了解Pawcon DC 2026。所以,我将直接宣读她的消息。她说:“你准备好采取行动对抗人工智能末日了吗?申请加入PCON DC 2026。这是PAI于4月12日至14日在华盛顿特区举行的最大规模线下活动。”“PAI US是一个全国性联盟,代表了70%希望暂停危险人工智能开发直到我们知道它安全的美国人。”Pawcon DC的与会者将与来自全国各地的其他热情志愿者建立联系,学习基层游说和如何影响政治变革,并会见他们的国会代表。让我们把PAI的信息直接传达给最需要听到它的人。我们将以有史以来最大规模的示威活动为本次活动画上句号,示威地点就在美国国会大厦外。第一轮申请截止日期为2月20日。来参加PCON,拯救世界。你可以在节目说明中找到申请链接,或者如果你访问pai-us.org,他们顶部有一个横幅,你也可以通过那里申请。感谢收看,我们下期末日辩论再见。