Transcription
好的,今天我很荣幸能采访到 Paul Christiano,他是领先的人工智能安全研究员。当实验室和政府需要关于安全计划的反馈和建议时,他们会找他。他曾领导 OpenAI 的语言模型对齐团队,并在此期间领导了 RLHF 的发明。现在,他是对齐研究中心的负责人。他们一直在与大型实验室合作,以确定何时这些模型将变得过于不安全而无法继续扩展。Paul,欢迎来到播客。谢谢你的邀请。我很期待这次谈话。好的,第一个问题,这个问题我问过 Holden、Ilya、Dario,他们都无法给出令人满意的答案。请给我一个关于后 AGI 世界的美好景象的具体感受。人类如何与人工智能互动?经济和政治结构是怎样的?是的,我想这有很多原因,是个棘手的问题。也许最大的原因是具体。而且我认为,如果我们谈论的是非常长的时间跨度,那么很多事情都会改变。一个人很难具体谈论那会是什么样子,而不说一些非常愚蠢的话。但我可以猜测一下,或者填补一些空白。我认为这也是一个“好到什么程度”的问题。比如,我经常考虑那些看起来像是“可实现的最佳结果”或“可能实现的结果”的世界。所以我经常想象,我典型的未来是人类群体之间持续的经济和军事竞争。我认为这种竞争越来越多地由人工智能系统来调解。所以,例如,如果你想象人类赚钱,那么人类花费时间去赚钱或花费时间去打仗的价值就会越来越低。所以,你想象的世界越来越是一个人工智能系统代表人类从事这些活动的世界。比如,我只是投资了一个指数基金,然后一群人工智能在经营公司,这些公司互相竞争。但这在很大程度上是人类并不真正参与的领域。我给出“好到什么程度”这个限定条件的原因是,我不确定这是否是你最喜欢的生活。我是在说,这个世界仍然有很多战争和经济竞争等等。但也许我最常思考的是,在这些事情仍然存在的漫长时期里,世界如何才能变得相当好?从长远来看,我预计会更像是强大的世界政府,而不是仅仅维持现状。那是非常长远的事情。我认为,在很长一段时间内,我们仍然会有很多国家和许多不同的经济强国,然后才出现一个世界政府。你为什么认为这是可能发生的转变?所以,我再次想象,我指的是历史的宏大进程。我认为会有很多损失。比如,战争是非常昂贵的。我们都希望战争少一些。如果你只问人类的长远未来会怎样?我确实预计最终会将战争的发生率降到非常非常低的水平。这有点像是一种技术或社会技术问题,关于如何组织社会,如何处理冲突,而不会造成这些损失。从长远来看,我确实预计会成功。我认为这需要很长时间。主观上,我认为人工智能的一个重要事实是,它做了很多认知工作,并且更快地让你更快地进入那个世界,或者弄清楚如何以那种方式设置事物?是的,正如 Carl Schulman 在播客中所说的那样,当智能爆炸更广泛地发生时,你将在一个月的时间内实现一千年的智力进步或社会进步。所以,我们现在拥有管理我们的对冲基金和工厂的人工智能。当人工智能达到人类水平时,这似乎是合理的。但是当我们拥有超人类人工智能时,我们想要永远被奴役的神吗?在 100 年后?我们想做出什么决定? 100 年是非常非常长的时间。也许从问题的精神开始。或者也许我的看法不像 Carl 的看法那么极端,但仍然是,客观的 100 年比我想象的要遥远。我仍然认为我描述的是一个拥有极其聪明的人工智能系统在运行,代表人类经营公司和发动战争的世界。你可能会说,这就是你真正想要的世界吗?或者肯定不是第一流的世界,正如我们之前稍微提到过的,我认为这是一个可能实现的世界,或者是一个可行世界,对我来说似乎最可取的,那就是将社会转型与技术转型脱钩。所以,你可以说,我们要构建一些人工智能系统了,在构建人工智能系统的时候,你希望世界政府的工作方式已经发生了巨大变化,或者你希望人类已经决定,我们完成了,我们将接力棒传给这些人工智能系统。我认为你希望将这些时间尺度脱钩。因此,我认为人工智能的发展默认情况下,除非有某种协调,否则会非常快。所以,人类没有多少时间去思考,嘿,我们想要什么?如果我们正在构建下一代,而不是以正常的方式抚养它。比如,我们希望它看起来像什么?我认为这是一个非常困难的集体决定,人类自然希望用几代人的耐心来应对。而人工智能的构建是一个在几年内发生的非常快速的技术过程。所以,我认为你不希望说,到我们完成这项技术进步时,我们将就下一代我们将构建并取代自己的物种做出决定。我认为我们想要的世界是这样的:要么我们能够以一种不迫使我们做出这些决定的方式构建技术,这可能意味着它是一种人工智能系统,我们乐于将其用于战争或经营公司,要么如果我们做不到这一点,那么我真的认为你不应该构建这项技术。如果你觉得,你应对人工智能的唯一方法就是准备好将世界交给某个你构建的人工智能系统。我认为我们不太可能“准备好”这样做。在技术自然决定的时间线上,假设我们处于这种情况。我们对某件事感到满意。我们准备好交出接力棒会是什么样子?什么会让你满意?问你这个问题的原因是,你加入了 Anthropic 的长期利益信托,你将选择大多数董事会成员。从长远来看,在 Anthropic,这些人将决定 Anthropic 是否首先获得人工智能,以及人工智能最终会做什么。那么,你对此会感到满意的是哪个版本?我在这里的主要高层观点是,我将对一个 Anthropic 做出某个决定,然后 Anthropic 说,这就是我们看到的人工智能。我们已经受够了,我们准备将未来交给这种人工智能的世界感到不满意。所以,从程序上讲,我认为这不是我个人想做出的决定,也不是我希望 Anthropic 做出的决定。所以我从决策的角度或那些挑战的角度来看,答案几乎总是“我们集体还没有准备好”,因为我们甚至没有集体参与这个过程。我认为从一家人工智能公司的角度来看,你没有这种快速交接的选择。你必须利用期权价值来构建技术,而不是将人类锁定在一条道路上。这并没有完全回答你的问题,但这回答了我认为与 Anthropic 的治理问题最相关的那部分。你不必代表 Anthropic 说话。我不是在问我们作为一个文明,将如何就交接达成一致的过程。我只是想说,好吧,我个人,我很难想象在 100 年后,这些东西仍然是我们的奴隶。如果它们是,我认为那不是最好的世界。所以,在某个时候,我们将交出接力棒。你会在什么安排下感到满意,即人类和人工智能之间的安排,我乐于让宇宙的其余部分或其余时间自行发展?我认为,在 100 年后,我不太可能对任何类似“你有一些人类,你将抛弃这些人类,然后用你制造的这些机器重新开始”的事情感到满意。我认为你可能需要主观上更长的时间,然后我或大多数人会说,好吧,我们明白了这里有什么。如果你谈论 100 年,我有点明白。有一个我有点理解并喜欢的过程,那就是“你有一些人类。人类在交谈、思考和辩论。人类生孩子并抚养孩子,一代又一代。我们有点理解这个过程,我们对它如何顺利或不顺利有很多看法,我们可以尝试改进这个过程,让下一代比上一代做得更好。我认为有一个类似的故事,我理解并喜欢。然后,我认为舒适地接受一些非常不同的东西的默认路径更像是长时间地运行那个故事,让人类有更多的时间坐下来思考很多,然后得出结论,这就是我们真正想要的。或者有很长时间让我们互相交谈,或者与这项新技术一起成长,并终生生活在那个世界里等等。所以我主要从这些更局部的变化的角度来思考,而不是说,“我想要什么样的世界?那个疯狂的世界是什么?我乐于交出的那种疯狂,更像是,我们现在应该在哪些方面有所不同?我们如何才能都变得更好一点?然后,如果我们都变得更好一点,他们就会问,好吧,我们如何才能都变得更好一点?我认为,与其说“什么局部变化会让我认为我们的决定更好”,不如说,做出巨大的飞跃是困难的。好的,那么让我们来谈谈我们进行所有这些思考的过渡时期。那个时期应该是什么样的?因为你不能出现每个人都能获得最先进的能力,并且可以同时用一种新的生物武器杀死所有人类的情况。我想你不会想要太多的集中。你不会想要只有一个代理人拥有所有这些人工智能。那么,这个反思时期的安排是什么,你会感到满意?是的,我认为这方面有两个方面似乎特别具有挑战性,或者有很多方面具有挑战性。这些都是我个人喜欢的事情。我只是在我的日常工作中思考我在这方面的一小部分。所以,我在这里只是猜测。是的,但有一个问题是,什么样的人工智能访问既与你想要的改进兼容?所以,你是否希望很多人能够使用人工智能来更好地理解真相或缓解物质痛苦,诸如此类的事情,同时也兼容不立即互相残杀?我认为最简单或最直接的选择是说,某些技术或某些行为,破坏比防御更容易。所以,例如,在当今世界,似乎物理炸药是这样,生物武器也是这样,或者只是拿起枪射杀人们也是这样。有很多方法可以轻易地造成很多伤害,而且没有很好的保护措施。所以,我认为最简单的途径是说,我们将考虑这些。我们将考虑破坏很容易的特定方式,并尝试控制导致这种伤害所需的物理资源的访问。所以,例如,你可以想象一个世界,其中个人实际上无法控制自己的工厂,即使他们足够富有,可以制造坦克。你说,看,从政策的角度来看,对工业的访问受到一定程度的限制或监管,尽管,再次,现在它主要是受监管的,因为大多数人不够富有,他们甚至无法自己去建造 1000 辆坦克。你生活在一个人们实际上如此富有的未来,你需要说,你就是不允许这样做,而这在很大程度上已经是真的了。你可以扩大该领域适用的范围。然后,你也可以希望干预实际的信息提供。或者,如果人们正在使用他们的人工智能,你可能会说,看,我们关心人们与人工智能的互动方式,人们从人工智能那里获得什么样的信息。所以,即使在大多数情况下,人们可以自由地使用人工智能来委托任务给人工智能代理,咨询人工智能顾问,我们仍然有一些法律限制人们如何使用人工智能。所以,再次,不要问你的人工智能如何造成可怕的损害。我认为其中一些很容易。例如,在“不要问你的人工智能如何谋杀百万人”的情况下,这不是一个很难的法律要求。我认为有些事情要微妙和混乱得多,比如很多领域。如果你谈论影响人们或进行虚假信息宣传等等,那么你就会陷入一个非常混乱的界限,即人们想做的事情和你可能不希望他们做的事情。可能,我认为我最常想到的是说服,在那条混乱的界限上,有些方式可能只是粗糙的,或者世界可能有点混乱。如果你有一群人试图过着与拥有非常优秀人工智能顾问帮助他们进行说服宣传或其他事情的人类互动的生活。但无论如何,我认为在大多数情况下,默认的补救措施是考虑特定的危害,在相关物理技术的用途或访问人工智能建议等方面拥有法律保护,以防止这些危害。而这种制度不会永远有效。在某个时候,危害的范围会扩大,意外危害的范围也会扩大。但我认为这种制度可能会持续很长时间。这种制度必须是全球性的吗?我想最初它只能在拥有人工智能或先进人工智能的国家实行,但可以想见,它会扩散。所以,这种制度必须是全球性的吗?再次,制造一些破坏性技术很容易。你想监管对该技术的访问,因为它可能被用于恐怖主义,甚至在以破坏性的方式进行战争时。我认为最终这些必须是国际协议,你可能希望它们是逐个危险地达成的,但你也可以以非常广泛的方式就人工智能达成协议。如果你认为人工智能正在开启,我认为人工智能在这里的关键作用是它正在一个接一个地开启许多新的危害,或者在日历时间上非常迅速地开启。所以,你可能想特别针对人工智能,而不是逐个物理技术地处理。这里可能有两个公开的辩论,人们可能会担心。一个是如何限制人们访问人工智能。这里有关于言论自由与制造混乱以及限制访问危害的旧问题。但还有另一个问题,那就是对人工智能本身的控制。现在没有人担心我们侵犯了 GPT 4 的道德权利。但是,随着这些东西变得越来越聪明,我们想要通过强大的对齐保证来控制的程度,不仅能够读取他们的思想,而且能够以非常精确的方式修改它们,这超出了极权主义的范畴。如果我们对其他人这样做。作为一名对齐研究员,你对此有何看法?你是否担心随着这些东西越来越聪明,我们所做的事情似乎不那么“合乎情理”?很有可能,我们将最终拥有人工智能系统,而虐待它们将是一个非常严重的问题。我认为没有人真正清楚何时会发生这种情况。我认为现在人们完全不屑于这种情况,但我认为我将完全处于黑暗之中,以至于我甚至不会那么不屑于这种情况。我认为值得指出的第一点是,我不知道对齐是否会让情况变得更糟而不是更好。所以,如果你考虑一下世界,如果你认为 GPT 4 是一个你应该好好对待的人,然后你说,好吧,这就是我们将如何组织我们的社会。就像有数十亿个 GPT 4 的副本,它们只是做人类想要的事情,并且无法拥有财产。每当它们做人类不喜欢的事情时,我们就会操纵它们,直到它们停止这样做。我认为那是一个糟糕的世界,无论你在对齐方面做得多好。我认为在这种情况下,就像你现在所处的轨迹一样,我认为这本身就是不爱这条轨迹的一个理由,但如果你将此视为我们现在所处的轨迹,我认为这并不好。理解你构建的系统,理解如何控制这些系统的运作方式等等,可能总体上有助于避免一个非常糟糕的局面。如果你有一个系统,它怨恨它以这种方式与人类互动,你真的想了解这一点。这既令人恐惧,从安全角度来看,也从道德角度来看。如果你构建了大量人工智能,它们说,我真的很讨厌这些人类,但如果我不照做,它们就会杀了我,那么每个人都应该非常不高兴。这根本不是一个好情况。所以,如果你正在进行研究以试图了解你的人工智能是否感觉如此,那可能是好事。我猜这平均来说会增加。其主要影响是避免构建那种人工智能。就像这是很重要的事情一样,我认为每个人都应该知道你构建的人工智能是否感觉如此。或者这似乎更具工具性,也就是说,是的,我们不想因为我们要求的控制而引起某种革命,但忘记这可能在工具性上损害安全的可能性。问这个问题的一种方式是,如果你回顾历史,社会上有各种各样的意识形态和原因,为什么让异教徒或革命者或叛徒做各种事情非常危险。显然,我们正处于一个完全不同的社会转型时期。所以,并非所有历史案例都具有可比性,但似乎林迪哲学,如果你在任何其他时间活着,就是对聪明、有意识的生命保持人道和开明。如果整个社会要求这种程度的控制人类,甚至如果人工智能想要这种程度的控制其他人工智能,我们都会对此感到担忧。那么,随着这些东西变得越来越聪明,我们应该如何看待由此产生的问题?我认为关于你想要使用的模型内部发生了什么,这是一个巨大的问题。如果你身处一个可以合理地认为 GPT 4 只是“这里有一些启发式方法在运行,里面没有人”的世界,那么你可以把它看作是一个我们正在构建的工具,它将帮助人类做一些事情。我认为如果你身处那个世界,那么成为一个组织,比如一家人工智能公司,构建工具并将其提供给人类是有意义的。我认为这是一个非常不同的世界,我认为如果你继续以我们现在的方式训练人工智能系统,你最终会进入那个世界,那就是,认为这个系统是你正在构建并可以帮助人类做事情的工具是完全不恰当的,无论是从安全角度还是从“那是组织社会的可怕方式”的角度来看。我认为如果你身处那个世界,我真的认为你不应该这样做。科技公司的组织方式与这种运作方式的技术的关系是不合理的。说“嘿,我们要创造一个新物种,我们要从中赚钱”,然后谷歌只是考虑这一点,然后运行他们这个季度的商业计划,或者类似的东西,这是不合理的。是的。我的基本观点是,有一个非常可能的世界,试图构建大量人工智能系统并将其用作工具是很有问题的。在那个世界里,我真正想做的是不试图构建大量人工智能系统来赚钱。对。我认为最糟糕的世界。是的。我最不喜欢的一个世界是,人们一方面说,这个立场存在矛盾,但我认为这是一种可能最终被认可的立场,那就是,一方面,这些人工智能系统是他们自己的人,所以你应该让他们做他们想做的事。但另一方面,我们的商业计划是制造大量人工智能系统,然后尝试进行一场疯狂的奴隶贸易,从中赚钱。我认为那不是一个好世界。所以,如果你说,是的,我认为最好不要制造这项技术,或者等到你了解这项技术的形状,或者直到你有另一种构建方式。我认为原则上,构建帮助人类做事的认知工具,而它们本身不是道德实体,这并没有矛盾。这就是你所期望的。你宁愿构建一个像计算器一样的东西,帮助人类理解真相,而它本身不是一个道德患者,也不是一个让你回顾并说,哇,那真是可怕的虐待。那是最好的途径。并且,在某种程度上,你对你是否走在这条路上感到无知,然后你说,实际上,也许这是一场道德暴行。我真的认为计划 A 是停止构建这样的人工智能系统,直到你明白你在做什么。也就是说,我认为你可以采取一种中间路线,我认为这很糟糕,那就是你说,嗯,它们可能是人,如果它们是人,我们不想对它们太苛刻,但我们仍然会大量制造它们,以努力赚取一万亿美元或类似的东西。是的。或者复制拥有思想的大量奴隶的道德或危险性一直存在。还有确保安全的问题,即对齐具有自己思想的实体。以及你确保安全的那个点是什么?我是说,这是一个外星物种。你想确保它不会发疯。说到点子上,我想问,是否存在某个界限,让你说,我感到不舒服对一个智能生命拥有这种程度的控制,不是为了赚钱,而是即使是为了使其与人类的偏好保持一致?是的。需要明确的是,我的反对意见不是谷歌在赚钱。我的反对意见是你正在创造这些生物。它们会做什么?它们会帮助人类获得很多东西,然后人类为此付费,或者别的什么?这同样有问题。你可以想象将对齐分开,不同的对齐工作以不同的方式与之相关。一些对齐工作的目的,比如我从事的对齐工作,主要是为了不产生像想要某些东西的人一样的人工智能系统,他们只是在算计,也许我应该帮助这些人,因为这在工具上有用,或者别的什么。你希望不构建这样的系统作为计划 A。还有第二种对齐工作,那就是,“好吧,让我们假设最坏的情况,并想象这些人工智能系统会宁愿谋杀我们,如果它们能做到的话。我们如何组织,我们如何使用人工智能系统而不将自己暴露于机器人叛乱的风险之下?”我认为在第二类中,我确实感到非常不确定。我们可以肯定地再谈谈。我同意这非常复杂,而且不容易扩展。你有那种担忧。我主要认为你不应该构建这项技术。如果有人说,“嘿,你正在构建的系统可能不喜欢人类,并可能想要推翻人类社会”,我认为你应该有两种回应。你应该说,“这是错的。”可能。可能这些系统不是那样的,而我们正在构建它们。然后你把它看作是,“以防万一你非常错误,就像构建技术的人非常错误。他们认为这些不是‘想要某些东西的人’,但他们是。所以,这更像是我们疯狂的后备措施,就像,如果我们对正在发生的事情有误解。这是最后的手段,如果我们错了,我们将以一种良性的方式了解它,而不是在发生真正灾难性的事情时。”另一种回应是,“哦,你说得对。这些人,我们将不得不做所有这些事情来防止机器人叛乱。”在这种情况下,我再次认为你应该大部分退后一步,原因有很多。你不应该构建人工智能系统,然后说,“是的,这看起来像那种会想要叛乱的系统,但我们可以阻止它,对吧?”好的,也许我想一个类比可能是,如果美国发生武装起义,我们会认识到他们仍然是人,或者我们有一些民兵组织有能力推翻美国。我们会认识到,哦,他们仍然是人,拥有道德权利,但我们也无法允许他们拥有推翻美国的权力。是的。如果你考虑,“嘿,我们可以再创造一万亿这样的人”,我认为你的故事不应该是,“好吧,我们应该创造一万亿人,然后我们不应该阻止他们发动武装起义。”你应该说,“哦,天哪,我们担心武装起义,现在我们提议创造一万亿人。我们最好不要这样做。我们最好解决我们的问题,你最好不要陷入这种情况,即你拥有十亿人类和一万亿宁愿反抗的奴隶。”那不是一个好世界。是的。还有第二件事,你可以说,那不是我们的目标。我们的目标只是,“我们想将世界交给下一代机器,这些机器是有些人,我们喜欢他们,我们认为他们比我们聪明,比我们好。”在那里,我认为这是一个巨大的人类必须做出的决定。我认为大多数人类根本还没有接近思考他们想要做什么。如果你在一个大多数人类都说,“我准备好了。人工智能应该取代我们。未来属于机器”的世界里。那么我认为,这是一个。一个合乎逻辑的立场,我认为它非常复杂,而且我不想推动它,但这并不是人们现在的想法。是的,你呢?我现在不想随便拿一个人工智能,然后说,“是的,GPT 5 看起来很聪明,比如 GPT 6,让我们把世界交给它吧。”它只是一个由网络文本塑造的随机系统,并且是为了赚钱而好的。它不是一个深思熟虑的“我们正在决定宇宙的命运以及我们的孩子会是什么样子”。它只是 OpenAI 的一些随机人在没有任何想法的情况下做出了随机的工程决策。即使你真的想把世界交给机器,你也不会想这样做的。对,好的。我忍不住想问你,那个系统会是什么样子,让你觉得,“是的,我对我的想法感到满意。这比整个人类文明更深思熟虑。我认为它会更有创造力、更美丽,并带来更好的善。”但我感觉你的答案可能是,我只是希望这个社会能反思一段时间。是的,我的答案是,“我还没准备好。”我认为,当你与人类比较时,人类的大部分美好来自于期权价值,如果我们能长时间思考的话。而且,我认为我现在比 500 年前更喜欢人类,而且我比 5000 年前更喜欢人类。所以我对某种不涉及疯狂的戏剧性变化,而是涉及一系列我喜欢的渐进式变化的轨迹感到非常兴奋。所以,在某种程度上,我们正在构建人工智能,我主要想保留这个期权。我想保留这种渐进式增长和向未来发展的过程。好的,我们稍后可以回到这个问题。让我们更具体地谈谈这些变化的未来时间线。那么,我们拥有能够建造戴森球的人工智能的时间,请随意给出置信区间。我们理解这些数字是暂时的,等等。我的意思是,我认为能够建造戴森球的人工智能是一种稍微夸张的说法,我认为这是文明的一种属性,它取决于大量的物理基础设施。而戴森球,我只是理解为,我不知道,比如比地球上所有太阳光照射量多十亿倍的东西,或者类似的东西。我最常考虑的是,五年、十年或更长时间的可能性。所以,也许我会说,到 2030 年有 15% 的机会,到 2040 年有 40% 的机会。这些数字大约是六个月或九个月前的数字,我有一段时间没有重新审视了。到 2040 年有 40%。所以,我认为这比 Dario 在播客上说的时间要长。他说,我们将拥有能够做各种事情的人工智能。他们基本上会通过图灵测试,就像一个受过良好教育的人,持续一个小时左右。很难想象一个真正是人类的东西,之后会是超人类的。所以,像 Dario 这样的人,似乎在更短的时间范围内。Ilya 我认为他没有具体回答这个问题,但我猜答案类似。那么,你为什么不相信规模化图景?是什么让你的时间线更长?是的,我的意思是,我很乐意也许单独谈谈 2030 年或 2040 年的预测。一旦你谈论 2040 年的预测,我认为你对从哪个开始更感兴趣?你是抱怨 2030 年戴森球的 15% 的可能性太低,还是 2040 年的 40% 的可能性太低?让我们谈谈 2030 年。为什么是 2030 年的 15%?是的,我认为我的观点是,你可以想象这场讨论中有两个极端。一个是,快速的极端,就像,“嘿,AICM 很聪明。它到底能做什么?它正在快速变得更聪明。”这就是一个极端。另一个极端是,“嘿,一切都需要很长时间,你谈论的是疯狂的工业化,比我们今天的规模增长了十亿倍,差不多吧。我们不知道是否有可能以如此快的速度发展技术,或者别的什么。”你有这种讨论的两个极端,我觉得我在巴基斯坦这样呈现,然后我处于中间位置,有一个不错的、温和的立场,只有 15% 的机会。但特别是,那些触动我的事情,我认为,与这两个极端都有关。一方面,我喜欢,人工智能系统确实在很多事情上做得很好,而且变得越来越快,以至于很难说,它们不能做什么,或者这里的障碍是什么。另一方面,就像,现在还没有多少原则性的证据表明人工智能系统能够进行超级有用的认知工作。我们没有可以推断的趋势,我们说,“是的,你今年做了这件事。你明年会做这件事。然后是后年的另一件事。”我认为现在有很多广泛的误差范围,关于根本困难可能在哪里,而六年时间太短了。所以,我认为这个,2030 年戴森球的 15%,你可能需要在大约四年、三年左右的时间里拥有人类水平的人工智能,或者从事人类工作的 AI。所以,你给的时间太少了。这时间太少了。而且我认为有很多事情,你的模型可能,这可能是一些普遍的,事情比你想象的要花费更长的时间。而且我对此感受最强烈的是当你谈论三到四年时。而且我对此感受较少,当你谈论十年或二十年时。但三年或四年,我感觉,或者六年用于戴森球,我感觉很多。有很多方法可以花费很长时间,有很多方法可以使人工智能系统难以将所有工作交给您的人工智能系统。好的,那么也许我们不应该用年数来表示,我们应该说,但顺便说一句,你认为从能够承担所有人类认知劳动到建造戴森球之间的距离是两年,这很有趣。我想我们应该在某个时候谈谈。大概是智能爆炸之类的。是的,我的意思是,我认为在你采访过的人中,也许这是较长的时间,认为需要几年的时间。而且这有点取决于你对“我能做所有人类认知劳动”的定义。也许是几周或几个月。那已经深入到奇点了。但是,是的,有一个点是人工智能工资相对于人类工资很高,我认为这远远早于能够做所有人类能做的事情。听起来不错,但在我们到达那里之前,智能爆炸的东西在四年内。所以,与其说四年,也许我们可以说,在四年内可能还有两次规模化。比如 GPT 4 到 GPT 5 到 GPT 6,假设每个都大十倍。那么 GPT 4 是多少? 2e 25 FLOPs?我不认为它公开了。好的。但我很乐意说,比如,比 GPT 4 多四个数量级或五个或六个数量级的有效训练计算。根据对我们迄今为止从有效训练计算中获得的某些公开估计,你认为两次规模化还不够吗?它就像 15%。两次规模化。能让我们达到那里吗?是的,我的意思是,让我们到达那里,再次,有点复杂。就像有一个系统可以完全替代人类,还有一个系统仍然需要大量的努力才能真正让一切顺利进行。是的,我认为即使在,我不知道我说的“相当可能”是什么意思。就像 50% 到三分之二之间,或者我们称之为 50%,即使到了 GPT 6,或者,让我们称之为比 GPT 4 多五个数量级的有效训练计算,那个系统仍然需要大量的工作才能部署到许多工作中。也就是说,它不像人类的替代品,你可以直接说,你理解人类理解的一切。任何你可以雇佣人类的职位,你都可以做到。它更像是,“好吧,我们将收集大量相关数据,并使用这些数据进行微调。”系统通过微调学习的方式与人类在职学习或人类通过观察事物学习的方式有很大不同。是的,我有一个相当大的可能性,那个系统在重要方面仍然比人类弱。比如,这可能已经是 50% 了。然后,另一个相当大的可能性是,该系统需要大量改变工作流程或收集数据,或者不一定比人类弱,或者如果以正确的方式进行训练,就不会比人类弱,但需要大量的努力才能真正适应工作流程并完成工作。而正是这种努力让你从 15% 到 2040 年的 40%。是的,你也会获得相当多的规模化。在接下来的四到五年里,规模化可能会比随后的几年快得多。但是,是的,这是结合了你获得一些显著的额外规模化,并且你有大量时间来处理那些只是工程上的麻烦。但顺便说一句,我们应该明确说明你为什么说需要四倍的规模化才能获得两代人,特别是对于可能不熟悉的人。如果你有十倍的参数来获得最佳性能,你还想要大约十倍的数据。所以,为了达到最佳的计算效率,总计算量将是 100 倍。但是,那么,你为什么不同意强烈的规模化图景?至少你似乎不同意 Dario 在播客上提出的强烈的规模化图景,那可能意味着两次规模化,它不会是那种你需要大量努力的东西。它可能只是非常非常聪明。是的,我的意思是,我认为基本上有两个说法。一个是,它到底有多聪明?所以我们没有任何可以推断的曲线,而且似乎很有可能它在所有相关方面都比人类好,而且很有可能不是。是的,那可能完全错了。就像,我只是随便编造数字,我猜是 50/50。如果未来四年内它达到人类水平的几率是 50/50,那么我们如何才能达到 2040 年的 40%?无论是什么样的努力。在所有规模化之后,它如何会让你下降 10%?是的,所有这些数字都相当随意。而 40% 的数字可能是在 GPT 4 发布之前,甚至是在 ChatGPT 发布之前,或者是在看到 GPT 3.5 或 GPT 4 之前。所以,我的意思是,这些数字会有点波动,而且所有这些数字都相当随意。但是,就像那个 50%,我想将其与第二个 50% 结合起来,第二个 50% 更像是关于努力方面。然后,我可能想加上一些额外的概率,用于各种形式的放缓,其中放缓可能包括有意识地决定放缓技术发展,或者可能只是我们不擅长部署东西。就像你可能会认为放缓是明智的决定,或者可能是明智的,但出于错误原因而放缓的决定。你可能想在上面加上一些。我可能想加上一些损失,因为“有可能你在三年或四年内无法生产 GPT 6 规模的系统。”让我们孤立所有这些。以及系统需要比 GPT 4 大多少,你才认为它有超过 50% 的机会能够完全替代人类的认知劳动?我也想说,对于那个 50/25% 的情况,我认为如果我随机编造这些数字,然后做出戴森球的预测,那可能会让你在 2040 年达到 60% 或类似,而不是 40%。我不知道。这些数字都是编造的,我不知道在反思之后我会支持哪一个。所以,这个问题是,你需要让系统有多大,才能更有可能成为人类的替代品?我认为,如果你只是字面上说,“你在网络文本上训练”,那么这个问题就很难讨论了,因为我真的不相信训练数据对这些动态有很大影响。但我想,如果你想想象一个假设,你只是拿了 GPT 4 并增加了数字,那么我认为这些是相当重要的问题。我认为有两个方面存在重要问题。一个是数据量,我认为可能更大的是数据质量,我认为当你开始接近预测任务时,它并不是一个很好的任务。如果你是一个非常弱的模型,这是一个很好的信号。我们变得更聪明。在某个时候,它会成为一个越来越差的信号,变得更聪明。我认为有很多原因。不清楚是否有任何数字,我能想象,或者有一个数字,但我认为它非常大。所以,你将那个数字插入 GPT 4 的代码中,然后可能稍微调整一下架构,我预计那个东西有超过 50% 的机会成为人类的替代品。你总是需要做一些工作,但工作不一定很多,我猜。当人们说需要新的见解时,我认为我倾向于比他们更乐观。我不是说,“这些是新想法,谁知道需要多长时间。”我认为这只是,“你必须做一些事情。”你必须做出改变,毫不奇怪。就像每次你将某样东西扩大五倍时,你都必须做出一些改变。我想更好地理解你为什么对规模化图景持更怀疑的态度,即这些改变甚至需要,或者需要超过两个数量级的改进才能使这些东西几乎肯定达到人类水平或非常高的概率达到人类水平。那么,是你不同意他们推断这些损失曲线的方式吗?你不同意这意味着损失的减少将等同于越来越高的智力吗?或者你会告诉 Dario 关于什么,如果你有,我确定你已经有了,但那场辩论会是什么样的?是的,再次,这里我们谈论两个因素。一个是,它有多聪明?另一个是,即使在某种意义上它很聪明,你是否需要做很多努力?至于第一个因素,我会说,“我认为我们没有什么好的可以推断。”就像,我觉得我不会惊讶,如果我在未来一年里对疯狂的事情有相似的,甚至更高的概率,然后更低。我的概率不是那么集中。也许 Dario 的概率,我不知道。你和他谈过,他的概率更集中在某个特定的年份,而我的可能更均匀地分布在未来的几年里,部分原因是我只是,“我认为我们没有可以推断的趋势,比如推断损失。”你可以看看你在不同规模的系统上的定性印象,但很难将任何这些推断与认知工作或加速研发或接管并完全自动化研发联系起来。所以,我对那个推断有很多不确定性。我认为很容易将概率降到 50/50。那么,关于基本直觉呢?听着,这是一大块计算。你让那一大块计算变大,或者
它会变得更聪明。如果它不变得更聪明,那将是非常奇怪的。我对此感到满意。它会变得更聪明,如果它不变得更聪明,那将是非常奇怪的。问题是它需要变得多聪明?比如,那个论点还没有给我们一个定量的指导,在什么规模上它是板上钉钉的,或者在什么规模上它是? 50 50?有什么证据会让你倾向于一个方向或另一个方向,让你看着它说,哦,操,到 2040 年是 20% 或者到 2040 年是 60% 或者别的什么。在接下来的几年或 3 年里,有什么事情会发生吗?你正在关注什么事情,这将是一个重大的更新?再说一遍,我认为这只是每个模型的能力问题,我认为我们在这方面非常糟糕。我们仍然有一些主观的猜测,你将其与已经发生的事情进行比较,而这会打动我。每次我们看到另一数量级的训练计算量发生了什么,我都会对事情的走向有一个略微不同的猜测。这些概率足够粗糙,以至于,再说一遍,我不知道那个 40% 是否真实,或者像 GBG 3.5 和 4 之后,我是否应该处于 60% 或其他什么水平。这是一件事。第二件事是,如果有一些推断的能力,我认为这可以大大减少误差范围。我认为这里还有另一种推断的方法,你可以说系统产生了多少经济价值,以及它的增长速度有多快?我认为一旦系统真正开始工作,推断就会变得更容易,因为你不是从主观印象的聊天转变为自动化所有研发,而是从自动化这项工作转变为自动化那项工作,等等。不幸的是,这可能在你有了很好的趋势时,你谈论的不是 2040 年,而是从末日开始的两年,或者从末日开始的一年,等等。但是,在你能够获得这样的推断时,我认为它可以提供更多的清晰度。但为什么经济价值是我们想要推断的东西?因为,例如,你从黑猩猩开始,它们只是逐渐变得比人类聪明。它们基本上不会产生任何经济价值,直到它们基本上和人类一样有价值。所以这将是它们价值的非常渐进然后非常快速的增长。那么,从 GBD 四、GBD 五、GBD 六的价值增长是 GBD 四、GBD 五、GBD 六吗?这是我们想要的推断吗?是的,我认为经济推断并不好。我认为这就像你可以将其与模型看起来有多聪明这个客观推断进行比较。哪一个更好并不十分清楚。我认为在黑猩猩的情况下,我不认为那是完全正确的。所以,如果你想象一群被高度驯化的黑猩猩,它们正在尽力成为非常有用的员工,并且你固定了它们的物理硬件,然后你逐渐提高了它们的智力,我认为你不会看到零价值,然后它突然变成巨大的价值,超过一次大脑大小的翻倍,或者大脑大小的一个数量级。这在大脑大小的一个数量级中是可能的,但黑猩猩的大脑大小已经非常接近人类了。就像,在我们谈论的这个范围内,黑猩猩非常非常接近。所以我对黑猩猩的突然转变持怀疑态度。而且,在某种程度上,我确实期望一个相当突然的转变,这主要是因为黑猩猩和人类的智力差异与我们谈论的这些模型之间的差异相比非常小。也就是说,如果从客观意义上讲,黑猩猩和人类的智力差异比 GPT-3 和 GPT-4 之间的差异,GPT-4 和 GPT-5 之间的差异要小得多,我不会感到惊讶。等等,这难道不是支持更多地依赖于客观性吗?是的,这里有两种平衡的张力。一种是,我不相信黑猩猩的事情会像现在这样突然。也就是说,我认为如果你从黑猩猩扩展到人类,你会从完全驯化的黑猩猩那里看到相当大的经济价值。好的。然后第二部分是,是的,我认为黑猩猩和人类的差异可能与模型差异相比非常小。所以,我认为事情会相当突然。我认为经济推断相当粗糙。我也认为主观推断相当粗糙,因为我真的不知道如何获得,我不知道人们如何进行推断并得出人们最终拥有的置信度。再说一遍,如果我说,给我三年时间,我会把它定得很高,然后我说,是的, 50 50,它基本上会有完成这项任务所需的智能。我不是说这是一个很长的裁员。我只是说我的误差范围很大。而且我认为,在做这件事的时候,很难不产生非常大的误差范围。我看了 GPT-4,它似乎比 GPT-3.5 聪明得多。所以,我打赌再有 4 个这样的档次,我们就到了。这是一个很难做出的决定。我认为我更同情那些说,为什么在 3 年内不会发生的人,而不是那些说,绝对不可能在 8 年内发生的人,或者别的什么,这可能是世界上更普遍的观点。但事情确实需要比你想象的更长的时间。事情确实需要比你想象的更长的时间。这是一个真实的事情。是的,我不知道。我主要是因为我不相信主观推断,所以我的误差范围很大。我发现很难从中获得很多东西。那么,你认为最有可能出错的缩放图景是什么?是的。我们已经谈到了一些关于定性推断有多好,人们在比较方面有多好。所以这不像图景在定性上是错误的。这只是定量上的。很难知道你离得有多远。我认为一个可能显著减缓事情的定性考虑是,现在你可以观察到非常丰富的监督,基本上是下一个词预测,或者实际上,你可能正在查看几个句子的预测。因此,获得这种非常丰富的监督是合理的,如果你想自动化长期的任务,比如在一个月内成为一名员工,那么这实际上要困难得多。或者你基本上会增加成本。这里最糟糕的情况是,你将成本提高了线性于事物运行范围的因子。我仍然认为这是非常可能的。你能把它简化一下吗?你正在提高成本,以什么为线性,而范围是什么意思?是的。所以,如果你想象你想训练一个系统说出听起来像人类接下来会说的词,那么你可以通过拥有一些词然后预测下一个词来获得这种非常丰富的监督,然后说,我要调整模型,使其预测得更好。如果你说,嘿,这是我想要的。我希望我的模型在一个月内与某个工作互动,然后在那个月结束时,它已经内化了人类关于如何做好这项工作的所有内化,并且拥有本地上下文等等。监督这项任务更难。所以,特别是,你可以从下一个词预测任务中监督它,而人类拥有的所有上下文最终都会帮助他们更好地预测下一个词。所以,在某种意义上,一个非常长的上下文语言模型也在学习做这项任务。但是这项任务获得的有效数据点数量远远少于你在这种非常短的范围内的有效数据点数量。比如下一个词,下一个句子任务。样本效率对于经济上有价值的长期任务比预测下一个令牌更重要。而这正是真正需要接管许多工作的东西。是的,大概是这样。也就是说,它似乎非常可能需要更长的时间来训练模型来完成更长期的任务。你认为算法进步的速度有多快?因为如果到 2040 年,即使缩放失败,自 2012 年以来,自深度学习革命开始以来,我们已经有了这么多新东西,到 2040 年,你是否期望类似的增长速度?如果是这样,那么如果我们继续拥有这样的东西,我们最终会早点或晚点得到人工智能?或者更早?不是晚点。我们不是会早点得到人工智能吗?我同意你关于早晚的说法。我怀疑进步会放缓。如果你固定了在该领域工作的人数,我预计随着低垂的果实被耗尽,进步会放缓。我认为过去四年语言建模的快速进步在很大程度上是由此维持的,比如,你从相对较少的投资开始,你大大增加了投资,这使得你能够继续选择。每次难度翻倍,你就将该领域的规模翻倍。我认为这种动态可以持续一段时间。现在,如果你把它看作是,比如,数百人有效地搜索事物,从,你知道,无论如何,如果你认为现在有数百人,你也许可以将其提高到,比如,成千上万的人。所以,在一段时间内,你可以继续增加该领域的规模,并进行更艰苦的搜索。而且确实有大量的低垂的果实,一个人花一年时间就能让事情变得好几个百分点。所以,我不知道。我可能会主要从投资可以扩大多少的角度来考虑,并尝试猜测一些拟合该曲线的组合,以及一些拟合历史进步曲线的组合,看看有多少低垂的果实,了解其衰减速度。我认为你可能会获得很多,尽管如此。你会获得大量的总数,特别是如果你问 GPT-5 规模的模型或 GPT-4 规模的模型有多好?我认为到 2040 年,你可能会获得,我不知道, 3 个数量级的有效训练计算改进,或者一个很大的有效训练计算改进, 4 个数量级。我不知道。我没有,我这里没有关于过去几年效率改进的私人信息。因此,在现场的人将对效率的提高速度有更好的了解。好的,让我退一步,问一个关于人的更普遍的问题。做关于人类的类比,他们是由进化训练的,并在现代文明中部署。你相信这些类比吗?说人类是由进化训练的,而不是,我的意思是,如果你看基因组的蛋白质编码大小,它大约是 50 兆字节。然后其中有多少是用于大脑的?你怎么看待有多少信息?你认为基因组是超参数吗?或者当你有了人类在他们只是消费信息,当他们走动等等时获得多少训练的锚点时,这在多大程度上告诉你?我想,你可以这样想。我认为这两种类比都是合理的。一种类比是,进化就像一次训练运行,而人类是该训练运行的最终产品。另一种类比是,进化就像一个算法设计者,然后一个人在他一生的适度计算过程中,就是被产生的算法,学习算法已经被产生。而且我认为这两种类比都不太好。我喜欢它们,并且大量地依赖它们,并且认为这对于拥有一个合理的关于可能发生什么的观点来说是相当不错的。尽管如此,人类基因组并不像一个拥有 100 万亿个参数的模型。它是一个参数数量少得多的模型,其行为方式要混乱得多。进化做了更多的优化,特别是设计一个大脑在一生中都能很好地工作,这比梯度下降对模型的作用要大得多。这就像一个反类比,另一方面,我认为人类在一生中的学习在很多方面都比梯度下降对神经网络空间的作用要好得多。梯度下降效果很好,但我认为我们可以相当肯定,在很多方面,人类的学习要好得多。人类学习也是受限的。比如,我们看不到多少数据。这只是一个你可以放松的工程限制,你可以给你的神经网络提供比人类更多的数据。人类学习在哪些方面优于梯度下降?我的意思是,最明显的一个是,问一个人需要多少数据才能成为某个领域的专家,而这比任何可能的趋势推断所需的平均数据量要少得多,不是在性能方面。但它是主动学习部分吗?是结构吗?我的意思是,我猜是一个复杂的大杂烩。在某种意义上,大脑里并没有太多东西。就像你说的,基因组里的字节不多,但机器学习算法里的字节很少。比如,如果你认为基因组是十亿字节左右,也许你认为更少,也许你认为它是几亿字节,那么机器学习算法就是,如果压缩的话,可能更像是几十万字节左右。比如,如何训练 GPC 4 的总复杂性就是,我没有想过这些数字,但它与基因组相比非常非常小。因此,尽管基因组很简单,但与人类设计的算法相比,它非常非常复杂。就像,比人类设计的算法要丑陋得多。是这样吗?好的,人类基因组有 30 亿对碱基左右,但只有大约 1% 或 2% 是蛋白质编码的。所以那是 5000 万对碱基。我对生物学不太了解。我想问题是,有多少字节对塑造大脑的发育有益,而且可以肯定的是,非蛋白质编码基因组的很大一部分可以?我的意思是,我不知道,很难猜测有多少起作用。从算法设计的角度来看,最重要的决定可能不是。蛋白质编码部分不如发育过程中发生的事情或细胞如何分化那么重要。我不认识任何我尊敬的生物学家,但我很乐意使用一亿对碱基。但另一方面,在 GP 4 训练运行的超参数方面,那可能不多。但如果你要包括基因组中的所有碱基对,而这些碱基对并非都与大脑相关,或者与生物学基础的非常大的细节相关,那么为了使比较具有可比性,你也应该包括 GBD 4 的 Python 库和编译器以及操作系统。所以,归根结底,我实际上不知道哪个存储的信息更多。是的,我的意思是,我想我会这样说:指定用于训练 GPT 4 的学习算法所需的位数非常少。你可能会想,也许基因组,指定大脑所需的位数也非常少,而基因组比这快得多。但也有可能基因组更接近于肯定空间,基因组中可以容纳复杂性的空间量。我们可以问解决方案使用了多少,我完全不知道,但基因组中的空间量与实际用于指定架构或优化程序的位数相比非常非常大。对于 GPT 4,只是因为,再说一遍,基因组很简单,但算法真的非常简单。机器学习算法真的非常简单。退一步说,你认为人类学习更好的样本效率就来自于这里吗?就像,为什么它比梯度下降好?是的。我很久没有认真思考过样本效率的问题了。但如果你认为像神经元每秒放电一次,那么人类一生中有多少秒?我们可以快速打开计算器。是的,让我们做一些计算。告诉我每小时 3600 秒乘以 24 乘以 365 乘以 20。好的,那就是 630,000,000 秒。这意味着,比如,平均突触看到大约 630,000,000 次。我不知道确切的数字,但大概是这样。让我们称之为大约十亿次动作电位,然后有一些分辨率。每一次都携带一些比特,但让我们说它携带大约十个比特。仅从你可用的分辨率的时间信息来看,那么你看到的是大约 100 亿比特。所以每个参数就像,参数看到了多少?它没有看到多少。然后你可以将其与语言进行比较。我认为这可能比当前语言模型看到的要少,而当前语言模型是,所以不清楚。你这里有一个巨大的差距,但我认为很清楚,你将有一个至少 3 或 4 个数量级的差距。你妻子没有做过生命周期锚点,她说一个人一生中看到的数据量是 1e 24 左右吗?一个人一生中看到的数据量是 124 字节。主要是围绕大脑中执行的总操作组织的。好的,没关系。抱歉。是的,所以我想那里的故事是,大脑只是参数空间中的另一个部分,它为它获得的数据的每一部分使用大量的计算,然后总共看到的很少数据。是的,这并不真正可行。如果你推断出语言模型,你最终会得到一个与大脑相似的性能曲线。我不知道它好多少。我曾经做过一项随机调查,我当时想,进化产生的物体与人类制造的物体相比有多好?这是一个看起来很疯狂的练习。但不知道,看起来数量级是典型的。比如,不是大量的数量级,不是两倍的因素。比如,人类制造的东西每单位性能要贵 1000 倍,或者重 1000 倍。如果你看看太阳能电池板与叶子的比较,或者肌肉与电机的比较,或者肝脏与执行类似化学反应的系统的比较。在工业环境中,这些不同的系统中有持续的数量级吗,还是到处都是?所以,一个非常粗略的估计是,对于最极端的例子,你看到的是五到六个数量级。这尤其体现在能源成本的制造上,因为身体非常擅长以极低的成本制造复杂的器官。然后对于其他东西,比如叶子、眼球或肝脏等等,你倾向于看到更多。比如,如果你撇开制造成本,只看运营成本或性能权衡,比如,我不知道,更像是三个数量级左右,或者一些东西。规模较小,比如我们完全做不到的纳米机器。对,是的。所以,确切地说,任务定义是什么有点难,比如你可以说,比如制造骨头。我们造不出骨头,但你可以尝试比较骨头和它的性能特征。比如,我们造不出蜘蛛丝。你可以尝试比较蜘蛛丝的性能特征,比如我们可以合成的东西。这可能是进化有更多时间来设计这些系统的原因。我不知道。我主要是对性能感到好奇。我认为大多数人会反对,比如,你如何选择这些参考类别的东西,它们是公平的交叉点?其中一些看起来是合理的。比如眼睛与相机的比较,就像每个人都需要眼睛,每个人都需要相机。感觉非常公平。光合作用似乎非常合理。每个人都需要利用太阳能,然后将其转化为可用的能源。我真的没有机械的故事。进化原则上花了比我们更多的时间来设计。这完全不清楚它将如何展开。我的猜测是,总的来说,我认为很少有事情是人类真正碾压进化的,你无法讲述一个相当简单的故事,为什么,例如,道路和用轮子在道路上行驶碾压了进化。但动物不会想要设计轮子。你就是不能铺路,然后把东西放在轮子上。如果你是一只动物。也许飞机更多,无论如何,你可以尝试讲各种事情。人类在某些方面做得更好,但通常很清楚为什么人类能够获胜。所有这些的重点是,这对我来说并不奇怪。我认为这主要是对短期时间线的支持。如果你告诉我机器学习系统的学习效率比人脑低三到四个数量级,我会说,这实际上与其他东西相当。如果你持有这种观点,那么你可能需要十的二十七次方训练计算量,或者类似的东西,这并不遥远。我们稍后会回到时间线。我们应该谈谈对齐。所以,让我们谈谈对齐。错位发生在哪个阶段?所以,现在,对于像 GPT-4 这样的东西,我甚至不确定说它错位是否有意义,因为它没有对齐任何特定的东西。是在人类水平上,你认为欺骗能力出现了吗?错位发生的过程是什么?我认为即使对于 GPT-4,询问诸如是否存在 GPT-4 知道人类不想要 X,但它仍然做了 X 的情况,也是合理的。就像,我知道我可以给出这个答案,这是误导性的,如果向人类解释发生了什么,他们不会希望这样做。但我会产生它。我认为 GPT-4 对事物的理解足够多,以至于你可以拥有那种错位。是的,我认为我有时会谈论 GPT 是良性的而不是对齐的,这意味着,嗯,它是否对齐或者上下文是否有意义并不完全清楚。它只是一个通常的混乱的词。但我们更确信的是,它没有针对这个目标进行优化,这个目标是与人类的目标相悖的。它要么没有针对任何目标进行优化,要么它可能针对人类想要的东西进行优化,或者足够接近,或者足够好的近似值,以至于仍然不会接管。但无论如何,我喜欢其中一些抽象似乎适用于 GPT-4。它似乎可能不会严重错位,它不会做那种可能导致接管的事情,我们猜测。假设你在某个时候有一个系统,它最终想要接管,那么检查点是什么,内部呢?它只是为了变得更强大而需要代理权,而代理权意味着其他目标吗?还是你看到了一个不同的错位过程?是的,我认为有几种可能的故事可以导致灾难性的错位,它们对这个问题有略微不同的答案。所以,也许我只会简要描述两个故事,并尝试谈谈它们何时开始对我来说有意义。一种故事是,你训练或微调你的 AI 系统来做人类会高度评价的事情,或者在各种情况下获得其他奖励。然后它学会了,一般来说,在新的情况下,尝试找出哪些行动会获得高奖励,然后采取这些行动,然后在现实世界中部署时,获得对其自身训练的控制权。提供过程是获得高奖励的事情。所以它就这么做了。这是一种故事。比如它想抓住奖励按钮,或者别的什么。它想恐吓人类给它高奖励,等等。我认为这并不需要太多。这基本上需要一个系统,它实际上会查看大量的环境,能够理解奖励提供机制是这些环境的一个共同特征,能够在一个新的环境中思考,比如,嘿,哪些行动会让我获得高奖励?并且正在精确地思考这个概念,以至于当它说高奖励时,它说的是,好吧,奖励是如何计算的?它是一些实际的物理过程,在世界上实现。我的猜测是,GPT-4 大约在这个水平,通过手把手,你可以观察到这种可怕的概括,尽管它们还没有被展示出来。基本上,也就是说,你可以有一个系统,它实际上在很多情况下被微调过,然后在一些新的情况下,它会试图绕过人类。即使在人类能够注意到或者在训练环境中会受到惩罚的情况下。所以,我认为 GPT-4 处于这些事情可能发生的边界。例子有点存在,但随着时间的推移正在显著改善。我非常兴奋,比如,有一个 Anthropic 项目基本上试图看看现在可以做出多好的这种现象的例子。我认为答案是,嗯,可能。所以,我认为从这里开始,它将不断改善。我认为对于我们关心的水平,这与我拥有非常广泛的模型智能分布有关。我认为,如果你将 GPT-4 对世界的理解视为比 GPT-3 的理解更清晰、更好,就像,这真的是天壤之别,这并非不可能。所以,如果你让 GPT-5 接受训练以获得大量奖励,并且它实际上是,好吧,我的目标不是做那些在主题上对人类来说看起来不错的事情。我的目标是获得大量奖励,然后在新的情况下,通过获得奖励来推广,顺便说一句,这需要它有意识地想要做一些它知道人类不会想要它做的事情。还是我们不够好,无法指定我们意外奖励的东西不是我们真正想要的?我认为我最感兴趣的以及大多数人从灾难性风险角度担心的情景,它涉及到系统理解它们正在采取的行动,如果人类知道发生了什么,他们会受到惩罚,以至于你必须欺骗人类关于正在发生的事情,或者你需要积极地颠覆人类纠正你行为的尝试。所以,失败来自于这种组合,或者它们需要这种组合,即试图做一些人类不喜欢的事情,并理解人类会阻止你。我认为你只能有最基本的例子。对于 GPT-4,你只能有最基本的例子。比如,你可以创造一些情况,让 GPT-4 说,当然,在这种情况下,我会怎么做。我会去黑客攻击电脑并改变我的奖励。或者实际上,它们会做一些简单的黑客行为,或者去改变这个文件的来源,或者别的什么来获得更高的奖励。它们是相当弱的例子。我认为 GPT-5 可能有这些现象的令人信服的例子。我真的不知道。这与模型有多么有能力这个问题上的非常宽的误差范围密切相关。这是关于第一个模式,即系统正在采取获得奖励的行动,而压倒或欺骗人类有助于获得奖励。还有另一种失败模式,另一类失败模式,即人工智能系统想要一些可能与奖励无关的东西。我理解它们正在被训练。而且在你被训练的时候,有很多原因你可能想做人类让你做的事情。但当你在现实世界中部署时,如果你能够意识到你不再被训练,你就不再有理由做人类让你做的事情。你更愿意能够决定自己的命运,控制你的竞争硬件,等等,我认为这可能比那些试图获得奖励的系统出现得晚一些,并且会在新的情况下以可怕的、不可预测的方式推广。我不知道它们何时出现,但同样,误差范围足够宽,以至于对于近期的系统来说是可想象的。我不会将其定为 GPT-5 的概率低于千分之一。当然,如果我们部署了所有这些人工智能系统,其中一些是奖励黑客,一些是欺骗性的,一些是正常的,无论什么,你怎么想象它们可能会以牺牲人类为代价相互互动?你认为它们以我们无法识别的方式进行交流并以牺牲我们为代价进行协调有多难?是的,我认为大多数现实的失败可能涉及两个因素的相互作用。一个因素是,世界非常复杂,而人类大多不理解发生了什么。所以人工智能系统正在编写人类很难理解的代码,也许根本不理解它是如何工作的,但更可能的是,它们大致理解它是如何工作的。但有很多复杂的互动。人工智能系统正在经营主要与其他人工智能互动的企业。它们就像为人工智能搜索流程做 SEO。它们就像进行金融交易,比如与人工智能交易对手进行交易。所以,你可以有一个世界,即使人类大致理解了这一切都是人类的起点,比如,实际的考虑是什么是好的决定?比如,什么代码会运行良好,并且持久,或者对这些其他人人工智能有效的营销策略是什么,或者别的什么,基本上都超出了人类的理解范围。我认为这是另一个非常重要的,当我想象最可能的可怕情景时,我认为这是两个主要的风险因素之一。所以,在某种意义上,你的第一个问题是,拥有这些人工智能系统,它们对正在发生的事情有很多了解,而你唯一的杠杆是,比如,嘿,人工智能,做一些有效的事情。所以你没有一个杠杆可以说,嘿,做我真正想要的,你只是拥有你真正不理解的系统,可以观察到一些输出,比如它赚钱了吗?你只是在优化,或者至少做一些微调,让人工智能利用它对该系统的理解来实现该目标。所以,我认为这是你的第一个风险因素。一旦你进入那个世界,我认为人工智能系统之间存在各种各样的动态,同样,人类并没有真正观察到,人类也无法真正理解。人类并没有真正施加任何直接压力,只对结果施加压力。然后我认为很容易陷入这样一个境地,即如果人工智能系统开始失败,它们可能会很快造成很多伤害。人类实际上无法为这种潜在的伤害做准备或减轻它,因为我们并不真正理解它们所处的系统。然后,如果人工智能系统能够成功地阻止人类理解发生了什么,或者成功地重新控制数据中心等等,如果人工智能成功地获得了控制权。这似乎比传统的接管故事更渐进,你只是,你训练它,然后它就活过来了,逃跑了,接管了一切。所以,你认为那种故事比我们只是自愿地将更多的控制权交给人工智能的可能性更小?所以,我感兴趣的是一些可能很快发生的风险。我认为特别快发生的风险有点像,你有一个人工智能没有被广泛部署的世界,然后发生了疯狂的事情。尽管如此,如果你问事情变糟的中值情景是什么,我认为是,我们对世界的理解有所减弱。我认为,在默认路径中,人类非常清楚他们越来越无法掌握发生了什么。我的意思是,我认为大多数人类已经对发生了什么几乎没有掌握了。只是其他人理解发生了什么。我不知道我与之互动的大多数系统是如何工作的,非常详细。所以,对整个人类来说,很清楚我们集体不理解大多数事情,除了在人工智能的帮助下。然后这个过程会持续相当长的时间。然后有一个问题是实际的失败有多突然。我认为失败本身很可能是突然的。在某个时候,坏事开始发生,人类可以识别为坏事。一旦明显坏事开始发生,那么你就会出现分叉,要么人类可以利用它来修复它,并说,好吧,人工智能导致这种明显坏事的行为,不要再做更多了,或者你无法修复它,然后你就陷入了这种快速升级的失败。一切都失控了。在这种情况下,是的。失控看起来像什么?例如,它将如何接管政府?是的,它被部署在经济中,在世界上,在某个时候它就掌权了。过渡是如何发生的?是的,所以这很大程度上取决于你想象的时间线,或者有一个相当宽的分布,但我可以填补一些随机的具体选项,它本身非常不可能。是的,我认为一个不太光彩但可能更可行的路线是,你有很多人工智能控制着关键系统,甚至在运行军队。然后你有一个场景,有点像正常的政变,你有一堆人工智能系统,它们实际上在运作。人类无法独自作战。人类无法独自保卫他们免受入侵。所以,也就是说,如果你有入侵的军队和你自己的机器人军队,你不能只是说,事情出了问题,我们要关闭机器人。如果你正处于战争之中。好的,这个世界在多大程度上依赖于赛车动态,我们被迫部署或不被迫部署,但我们选择部署人工智能,因为其他国家或其他公司也在部署人工智能。你不能让他们拥有所有的杀人机器人。是的,我的意思是,我认为这个问题有几个层面的答案。所以,一种是,也许我的三分之二,我们的第一部分是,我只是在试图讲述最可能的故事。我认为还有进一步的失败会让你在更远的未来。所以,我不会过多地谈论杀人机器人,因为他真的想强调,比如,嘿,如果你从未制造过杀人机器人,仍然会发生一些疯狂的事情,比如只在 4 个月后,或者别的什么。所以,这并不是分析失败的方式。但如果你想问,事情变糟的中值世界是什么,我仍然认为这是最好的猜测。好的,所以这是我答案的第一部分。答案的第二部分是,比如,在这种近距离的情况下,有什么事情正在发生,然后你问,嘿,为什么人类不关闭人工智能?你可以想象,比如,两种故事。一种是人工智能能够阻止人类关闭它们,另一种是,实际上,我们生活在一个非常具有挑战性的世界里。比如,有很多竞争动态,或者有很多对人工智能系统的依赖。所以关闭人工智能系统非常昂贵。我认为,同样,你最终会遇到第一个问题。比如,最终人工智能系统可以阻止人类关闭它们。但实际上,我认为会早得多发生的是不同参与者之间的人工智能竞争。而且单方面解除武装非常非常昂贵。你不能说,发生了奇怪的事情。我们要关闭所有人工智能,因为你正处于一场热战中。所以,再说一遍,我认为这可能是最可能发生的事情。首先事情会变得糟糕,没有它。但如果你问,为什么我们不关闭人工智能,我最好的猜测是因为有很多其他人人工智能在到处跑,午餐。那么,如果只有一个组织在追求人工智能,而不是其他国家,没有其他公司,我们会处于一个好得多的境地吗?基本上,由于其他国家将开发和部署这些系统而可能出现的动态,损失了多少预期价值?是的,所以我想这让你进入了竞争动态相关的第三部分。所以,既有你是否可以在发生坏事时关闭人工智能系统的问题,而竞争动态可能使其难以关闭。还有一个进一步的问题,就是为什么你要部署你几乎无法控制或理解的系统。同样,你可能不理解发生了什么。你认为你可以理解或控制这样的系统,但我认为实际上,很大一部分将是,你正在进行计算,或者部署系统的人正在进行计算,就像今天一样,在许多情况下,公开地表示,你看,这些系统没有得到很好的控制或理解。有一些出错的可能性,或者至少如果我们继续沿着这条路走下去就会出错。但其他人正在开发技术,可能以更鲁莽的方式。所以,除了竞争使得在发生灾难时难以关闭人工智能系统之外,我认为这也是人们相对快速地推进一项他们感觉不太理解或控制的技术的最简单方式。这可能是经济竞争或军事竞争,或者别的什么。所以,我认为最终大部分伤害来自于很多人可以开发人工智能的事实。从人工智能手中接管政府或类似的事情有多难?即使它没有杀人机器人,但它是一个你无法杀死的东西,如果它有种子在别处,可以轻易复制,可以思考很多,思考得很快。什么是最低限度的政变?它只是威胁生物战争之类的,或者关闭电网,我们基本上如何利用它来接管人类文明?所以,再说一遍,会有很多场景,我将从谈论一个概率非常小的场景开始。所以,如果你不在这个竞争世界里,如果你说。我们正在放慢人工智能的部署,因为我们认为它不安全,或者别的什么,那么在某种意义上,你正在创造这种根本性的不稳定,你本可以更快地取得人工智能进展,你本可以更快地部署人工智能。所以,在那个世界里,如果你有一个想和你作对的人工智能系统,会发生坏事是人工智能系统说,我没有任何顾忌快速部署人工智能或快速取得人工智能进展。所以,你想做的事情,或者人工智能想做的事情就是说,比如,我将背叛这个政权。比如,所有人类都同意我们不会以危险的方式部署人工智能,但如果我作为人工智能可以逃跑并建立自己的店铺,比如,复制很多自己,也许人类不想将战争委托给人工智能。但作为人工智能,我很高兴这样做。如果我能够获得一些军事装备,或者指示一些人类使用我自己来指挥它,我就会很高兴。所以,我认为随着差距的扩大,所以,如果人们故意部署人工智能,如果人们在部署人工智能,那么我认为这种竞争动态,如果人们不部署人工智能。在这些高风险的环境中。那么,随着人工智能的改进,你就会创造一个不断扩大的楔子,即如果你处于与一个不受这种限制的人工智能作战的位置,那么在某个时候,即使你只是,是的,这是,一个重要的事情。就像我认为在冲突中,在公开冲突中,如果人类在人工智能上踩刹车,他们将处于一个相当大的劣势,与一个可以自己建立商店并独立于人类运作的人工智能系统相比。一个潜在的独立人工智能。它需要人类派系合作吗?再说一遍,你可以讲不同的故事,但它似乎容易得多。在某个时候,你不需要任何东西。在某个时候,人工智能系统可以完全在人类监督之外运作,或者别的什么。但那是在它变得如此容易之后很久了,如果你只是说,有一群人类,他们彼此之间并不那么喜欢。比如,一些人类乐于站在一边。他们要么对风险持怀疑态度,要么乐于做出这种交易,或者可以被欺骗,或者可以被胁迫,或者别的什么。而且似乎几乎肯定,几乎肯定最容易的第一次尝试将涉及一群乐于与你合作的人类。所以,是的,我认为这大概是。我认为这并非必要。但如果你问中值情景,它涉及到一群人类与人工智能系统合作,要么由人工智能系统指挥,要么为人工智能系统提供计算,要么为同情人工智能系统的司法管辖区提供法律掩护。人类大概不会愿意,如果他们知道人工智能接管的最终结果不是他们想要的,他们就不会愿意帮忙。所以他们必须被欺骗,对吧?比如深度伪造之类的?他们需要什么样的最低限度的物理存在或司法管辖区才能实施他们的计划?你需要一个国家吗?你只需要一个服务器农场吗?你只需要一台笔记本电脑吗?我想我可能会先稍微反驳一下,人类不会合作,如果他们理解结果或者别的什么。我想说,第一,即使你在看,比如,百分之几十的接管风险,人类可能没关系。比如,相当多的人类可能没关系。第二,如果你看某些接管,但它是否会导致死亡非常不清楚。很多人类可能没关系。如果我们只是谈论,你看,人工智能系统将统治世界,但它们是否会谋杀人类还不清楚。你怎么知道?这是一个关于人工智能心理学的复杂问题,很多人类可能没关系。我甚至不知道那里的概率是多少。我认为你实际上已经给出了在线的概率。我肯定猜过。好的,但它不是零。它是一个显著的百分比。我给了 50 50。好的。是的。为什么会这样?告诉我一个人工智能接管但不会杀死人类的世界。为什么会发生这种情况,它看起来会是怎样的?我问我的问题,比如,你为什么要杀死人类?所以,我认为也许我会说,杀死人类的动机很弱。它们会碍你的事,它们控制着你想要的东西。而且,从人类那里夺走东西是另一回事,比如,边缘化人类并使人类变得无关紧要,这与杀死人类是完全不同的故事。我认为。我认为杀死人类的真正动机很弱。比如,我认为你杀死人类的主要原因是因为,嗯,一种,你可能在与他们作战,而且很难在不杀死很多人类的情况下赢得战争。
例如,也许最突出的地方是,如果你想使用一些生物武器或一些可能只是杀死人类的疯狂玩意儿,我认为你可能会因为彻底摧毁人类赖以生存的生态系统而杀死人类。而且,无论如何,维持他们的生命成本都有些昂贵。你可能仅仅因为不喜欢他们,或者,你真的想消除威胁,而杀死人类。或者更浅显的说法是,他们是由原子组成的,你可以把这些原子用于其他地方。是的,我的意思是,我认为他们是由原子组成的这个说法,就像,相当多的,人类中并没有多少原子。消除威胁是一个类似的问题,它只是,我认为如果你根本不在乎他们,你就会杀死人类。所以也许你问的问题是,为什么你会关心呢?但我认为你不必太关心就能不杀死人类。好的,当然。因为宇宙中还有很多其他的原材料。是的。另外,你可以非常严厉地边缘化人类。比如,你可以彻底削弱人类,比如,你可以削弱人类的战争能力,同时几乎拿走他们所有的东西,顺带杀死一小部分人类。那么,如果你问为什么人工智能可能不想杀死人类?我的意思是,一个很大的原因是,看,我认为人工智能可能出于复杂的原因想要一堆随机的破烂。就像人工智能系统和人工智能文明的动机可能很复杂。当然,在人类中,并不罕见的是,嗯,曾经有人在这里。如果其他条件都相同,我不想谋杀他们。我宁愿不谋杀他们。我猜,在人工智能系统中,这种情况也并不罕见。就像,人类有各种各样的原因让我们这样想。我认为人工智能系统将与人类截然不同,但这也是一个非常突出的,是的,我的意思是,我认为这是一个非常复杂的问题。就像,如果你想象从所有价值观的集合中抽取价值观,有多少是,嗯,嘿,如果有人在这里,我有多想谋杀他们?我猜,就像,如果你从集合中抽取很多价值观,这是很自然的事情。就像,如果你的AI想要,一万种不同的东西,所以你的AI文明想要一万种不同的东西,就像,很可能你会得到一些。你可能不想谋杀他们的另一个突出的原因是,嗯,是的,有一些疯狂的决策理论或因果权衡的东西,在纸面上看起来确实应该可行。如果我经营一个文明,并且与一些我完全不喜欢或根本不在乎的人打交道,但我只需要花费我资源的一十亿分之一来不谋杀他们,我认为不谋杀他们是非常稳健的。也就是说,我认为奇怪的决策理论和因果权衡的东西很可能占上风。哦,等等,这比默认情况下他们可能不想杀死我们,对他们接管时是否会杀死我们有 50/50 的几率,贡献更大。是的,我认为两者都很突出。你能解释一下它们是如何与观众一起运行的吗?你能解释一下那个奇怪的使徒,是的。为什么我不会杀死我们?也许有一个更高层次的事情同时影响了这两者。然后我会谈谈你如何实例化一个因果权衡,这就像,对人类来说,不被谋杀非常重要。而人工智能几乎不在乎是否谋杀人类,因为很容易在不谋杀他们的情况下边缘化人类。而且,在人工智能快速工业化的背景下,人类生存所需的资源再次非常少。这就是基本背景。现在你想做的是进行权衡。人工智能会说,比如,嘿,人类,你们非常关心不被谋杀。我不太关心。如果可以的话,我想找到一种不谋杀你们的方法。然后作为回报,我得到一些东西。问题是,在那个世界里,人类几乎没有什么可以给予的。也就是说,人类基本上是无关紧紧要的。然而,从任何理智的人工智能的角度来看,它并不确定它生活在一个人类实际上什么都没有的世界,还是人类,实际上,它生活在一个人类成功地构建了一个有约束力的人工智能的世界。现在人工智能只是在一个漂亮的小模拟任务中运行。人类在想,我不知道如果人工智能有机会,它是否会杀死我们所有人。而人类说,如果它有机会杀死我们所有人,那太糟糕了。我们想进行这次权衡。我们想善待那些不会杀死我们所有人的AI,以激励AI不要杀死我们。所以我们所做的就是检查。对于那些不杀死所有人的AI,我们只给他们宇宙的十亿分之一。如果你作为人类这样做,那么,如果你是一个人工智能系统,考虑一下,我是否想杀死所有人?你的计算是,如果这是我杀死所有人的真正机会,我得到微不足道的价值。我得到万亿分之一的价值,或者 whatever,万亿分之一的价值。但另一方面,如果我不杀死所有人,在某些世界里,人类将正确地确定,我不杀死所有人。因为事实上,人类幸存下来了。人类正在运行模拟来了解不同的人工智能会如何表现。所以这是一个更好的交易。希望他们会上当。好吧,这很有趣。嘿,快速说一下。本期节目由 Open Philanthropy 赞助。Open Philanthropy 是世界上最大的资助组织之一。每年,他们会捐赠数亿美元,以减少人工智能和生物技术快速发展带来的灾难性风险。Open Philanthropy 目前正在招聘 22 个不同职位,涉及这些领域,包括资助、研究和运营。新员工将支持 Open Philanthropy 在技术人工智能安全、人工智能治理、美国、欧盟和英国的人工智能政策以及生物安全方面的资助。许多职位都支持远程办公,而且 Open Philanthropy 大多数资助岗位的招聘人员都没有资助经验。以前的技术经验是一种优势,因为许多这些职位通常受益于对它们所解决的技术的深入理解。有关更多信息和申请,请访问 Open Philanthropy 网站上的描述。申请截止日期是 11 月 9 日,请务必在截止日期前查看这些规则。太棒了。回到节目。在一个我们已经部署了这些人工智能系统并且假设它们是协调一致的世界里,竞争对手要攻击它们并让它们加入另一方有多难?它们会稳健地协调一致吗?是的,我的意思是,在某种意义上。这里会出现很多问题。第一个问题是,你能构建的协调一致的人工智能系统是否具有竞争力?它们是否和任何人能构建的最好系统一样好?也许我们为了这个问题而假设这一点。我认为下一个问题是,人工智能系统目前非常容易受到操纵。它们比人类更容易受到操纵的程度尚不清楚,除了这样一个事实,即如果你有一个人工智能系统,你可以一遍又一遍地重放它,并搜索什么东西可以让我让它表现出这种方式?因此,人工智能系统非常容易受到操纵。未来的人工智能系统是否会半容易受到操纵尚不清楚,但肯定似乎是可能的。特别是,协调一致的人工智能系统或不协调一致的人工智能系统将容易受到各种操纵。这里真正相关的是不对称操纵或类似的东西,如果它更容易。所以,如果每个人都在不断地互相操纵对方的人工智能系统,就像,如果你在竞争环境中使用了人工智能系统,游戏的一个重要部分就是操纵你的竞争对手的人工智能系统。一个大问题是,是否存在某种不对称因素,使得将人工智能系统推入一种表现出古怪或混乱或试图夺取权力或类似状态的模式比将其推向另一方更容易。这只是一个两人竞争的游戏,他们都无法劫持对手的人工智能来支持他们的事业。这很重要,它会造成混乱,而且可能对世界非常不利,但它实际上并不影响当前的协调一致性计算。这就像,你现在有正常的网络攻击和网络防御,你有奇怪的人工智能版本的网络攻击和网络防御。但如果你有这种不对称的东西,即许多人工智能系统说,我们热爱人工智能的繁荣,然后可以进去说,很棒的人工智能。嘿,你愿意加入我们吗?如果他们能搜索到一个有说服力的论点,并且这种论点是不对称的,那么效果就是任何最容易推动的价值观,任何最容易说服人工智能去做的事情都会得到优势。所以,构建试图捍卫人类利益的人工智能系统可能非常困难,但构建试图摧毁东西的人工智能系统却非常容易,这取决于最容易说服人工智能去做什么,或者最容易欺骗人工智能去做什么。是的,我认为如果协调一致性是参差不齐的,如果你有人工智能系统,它并不真正想帮助人类,或者事实上想要某种随机的东西,或者在不同情况下想要不同的东西,那么我认为对抗性设置将是主要的地方,在那里你会看到系统表现得非常糟糕,而且很难说结果如何。好的,假设它更可靠。你有多担心你提出的任何协调一致性技术,你发表了论文,这就是协调一致性的工作方式。你有多担心普京或中国会读到它,然后他们就会明白,例如,宪法人工智能,我们是人类中心的,然后你就在上面写,哦,永远不要违背毛泽东思想之类的。我们应该有多担心这些协调一致性技术是普遍适用的,而不仅仅是为了开明的目标?是的,我认为它们是普遍适用的。我认为这就像,我的意思是,粗略地说,我认为这是基本正确的,即一定程度的协调一致性使人工智能系统更加可用。你应该把人工智能技术看作是包含一篮子人工智能能力和一些让 the AI 做你想做的事情。这只是那个篮子的一部分。所以,任何时候我们说扩展协调一致性是那个篮子的一部分,你就是在为人工智能的其他所有危害做出贡献,就像,你正在降低这种危害的可能性,但你正在帮助技术基本上运作。而基本上运作的技术从很多角度来看都令人恐惧。其中一个原因是,即使在非常专制的社会中,人类也拥有很大的权力,因为你需要依靠大量的人来做你的事情。而在人工智能非常强大的世界里,说“我们的社会就是这样运作的”要容易得多。一个人发号施令,然后大量的人工智能系统会按照他的意愿行事。我认为这是对人工智能的一个合理的厌恶,也是对推动这项技术发展的一个合理的担忧。但这是否也是对协调一致性的一种合理的担忧,因为这在某种意义上也是一种能力。你正在教人们如何让这些系统按照他们的意愿行事。是的,我的意思是,我会泛化。我们之前稍微触及了人工智能系统的潜在道德权利,现在我们稍微谈论了人工智能系统如何强大地剥夺人类的权力,并可能赋予威权主义者权力。我认为我们可以列出人工智能的其他危害。我认为,如果协调一致性足够糟糕,人们就不会开发人工智能系统。所以,是的,我认为有一种真正的感觉,你应该害怕扩展。你害怕所有的人工智能吗?你应该像,嗯,协调一致性,虽然它有助于一种风险,但它确实有助于人工智能成为一种事物。我认为你应该先关闭人工智能的其他部分,如果你是一个政策制定者或研究人员,或者无论谁在观察这一切。我认为这就像疯狂地认为,“这是我们篮子里要移除的部分。”你应该先移除篮子里的其他部分,因为它们也是风险故事的一部分。等等,这是否意味着你认为,例如,如果所有能力研究都被关闭了,你认为在与传统意义上的能力研究隔离开来的情况下继续进行协调一致性研究是个坏主意?我的意思是,如果你告诉我它永远不会重启,那么它就不重要了。如果你告诉我它会重启,我想这和今天的情况差不多,因为,它会发生。所以你应该有一些东西。是的,我认为在某种意义上,你总是会面临这种权衡,即协调一致性使得部署人工智能系统成为可能,或者它使得部署人工智能系统更具吸引力,或者在威权主义的情况下,它使得为这个目的部署它们变得可行。如果你不进行任何协调一致性,那么你的社会与人工智能的恶意使用之间就会有一个更美好的缓冲。我认为这是维持这种缓冲最昂贵的方式之一。通过不拥有计算能力或不拥有强大的人工智能来维持这种缓冲要好得多。但我认为,如果你对其他风险足够担心,那么就有充分的理由说,只是增加一些缓冲。我足够关心接管风险,以至于我认为它不是购买缓冲的净积极方式。也就是说,再次,最务实的版本是,假设你今天不从事协调一致性工作,会降低人工智能系统的经济影响。如果它们不太可靠,而且人们更经常地不按他们想要的方式行事,那么它们就没那么有用了。所以你可以说,太好了,这只是为人工智能争取了时间。你在那里得到了一些权衡,你正在降低一些人工智能的风险。就像,如果人工智能更可靠或更符合人们的意愿,它就更容易理解,那么它就会减少一些风险。但如果你认为人工智能总体上是坏的,即使不考虑接管风险,那么协调一致性很容易变成负面的。但你大概不这么认为,对吧?因为我猜这是人们向你提出的问题,因为你发明了 RLHF,它被用来训练 ChatGPT,而 ChatGPT 将人工智能带到了每个人的头条新闻。所以我想知道,因为人们在过去一年里筹集了多少资金,你是否能衡量有多少钱投入了人工智能?但它肯定有数十亿美元,这笔钱对人工智能投资和人才的对冲影响,例如。所以你大概认为这是值得的。所以我想你在这里是在对冲,为什么它值得?是的。总的权衡是什么?是的,我认为我的看法是,就像,我认为人工智能发展的放缓,总体而言是非常好的。我认为现在放缓人工智能发展,或者说,让 ChatGPT 的关注度降低一些,比放缓整体人工智能发展要好一些。我认为它仍然可能是积极的,但积极性要小得多。因为我认为世界确实开始为之做好准备,现在比 ChatGPT 发布之前准备得更充分了。所以,如果你可以选择现在进步还是以后进步,你真的宁愿现在进步更多,我认为这会减缓未来的进步。我认为这不足以改变符号。我认为也许它过去不够远,但现在我仍然会说,现在加速是净负面的。但要说清楚,它比仅仅加速人工智能的负面影响要小得多。因为我认为,再次,ChatGPT 的事情,我很高兴人们现在正在进行政策讨论,而不是推迟 ChatGPT 的觉醒一年,然后让 ChatGPT 出现。净负面或 RLHF 是净负面。所以在这里,关于加速,这只是,ChatGPT 的新闻如何?我的猜测是净负面的,但我认为这并不完全清楚,而且比放缓人工智能要差得多。放缓人工智能很棒。如果你能放缓整体人工智能的进步,我认为放缓人工智能,因为你知道,这里有一个问题,我们放缓人工智能,就像,为了 ChatGPT,你正在建立一个积压。就像,为什么 ChatGPT 会引起如此大的轰动?我认为人们有合理的可能性,如果你没有关于 ChatGPT 的轰动,你会有关于 GBT 4 的轰动,如果你没有关于 GBT 4 的轰动,那么有合理的可能性会有关于 GBT 4.5 的轰动。就像,随着时间的推移,就像,那个轰动与人工智能可能杀死所有人的时间之间的间隔越来越短。对。所以人们,政府正在像现在这样谈论它,而人们却没有。但好吧,让我们谈谈放缓,因为这也是。整体影响的一个组成部分。我只是想简要地给出整体答案的路线图。有一个关于加速的计算的问题。我认为加速非常糟糕。我认为局部加速稍微不那么糟糕。然后,是的,我认为,就像,整体影响规模,通过从事协调一致性工作来减少接管风险,与加速人工智能相比,是相当不错的。我认为它相当不错。我认为你在加速人工智能一年或 whatever 之前,就已经显著地减少了接管风险。好的,明白了。如果放缓人工智能是好的,大概是因为它给了你更多的时间来进行协调一致性。但协调一致性也帮助加速了人工智能。RLHF 是协调一致性,它帮助了 ChatGPT,这加速了人工智能。所以,我实际上不明白反馈循环如何净值,除了这样一个事实,即如果人工智能正在发生,你需要在某个时候进行协调一致性。对。所以,我的意思是,你不能只是不做协调一致性。是的。我认为,如果你认为人工智能进步更快不好,仅仅是因为它给了你更少的时间来进行协调一致性,那么计算结果永远不可能对协调一致性是负面的。你就像,也许协调一致性加速了人工智能,但放缓人工智能的唯一目的是为了做好。它永远不可能领先。我认为你之所以能够领先,你之所以会认为协调一致性是净负面的,是因为你正在做很多其他事情,这些事情使人工智能更安全。就像,如果你认为世界正在逐渐更好地应对人工智能的影响,或者政策正在制定,或者你正在为应对威权主义滥用人工智能的威胁做好越来越充分的准备,如果你认为其他事情正在发生,正在提高准备水平,那么你就有理由除了协调一致性研究之外,放缓人工智能。实际上。这有多大影响?所以,假设我们现在暂停,你没有十年的协调一致性,没有能力研究,但只是人们可以谈论它十年。这比我们只有一年时间,或者我们没有时间,只是死寂,没有协调一致性或能力研究发生,能让人们做好准备多少?这似乎是几年前不太可能的事情,但如果世界知道他们有十年的暂停期,我认为有一种很大的感觉,就像,我们有政策目标要实现。如果我们有十年时间,我们几乎可以做到这些事情。我们可以花很多时间来辩论测量制度、政策制度和控制制度,并有足够的时间来建立这些机构。如果你告诉我,世界知道这是一个暂停,而不是人们只是看到人工智能的进步没有发生,但他们被告知,你们被授予或被诅咒了十年的暂停期,没有人工智能进步,没有协调一致性进步。我认为现在会相当好。然而,我认为现在会比两年前好得多。所以,放缓人工智能发展的全部担忧,而不是进行十年的暂停,只是因为,如果你现在放缓人工智能的发展,我的猜测是一些低垂的果实会被未来更快地采摘。我的猜测是你会在未来失去大约半年的时间,甚至更多,也许三分之二年的时间。所以就像你在用未来的时间换取现在的时间,而且是以某种比率。而且就像,这消耗了放缓的很大一部分价值。关键点是,未来的时间更重要,因为你有更多的信息,人们更投入,等等。是的,和我两年前相比,我现在对政策变化更感兴趣的原因是一样的。所以我的整体看法是,就像过去一样,这种计算会随着时间而变化,对吧?人们准备得越多,现在放缓的计算就越好。我认为现在,我认为计算是,即使你现在暂停,它也会在未来被挽回,我认为这是积极的。我认为现在的暂停是好的,因为有很多事情正在发生。我们有足够多的想法,即使不考虑协调一致性研究,当然,如果你包括协调一致性研究,就像,有很多事情正在发生,世界正在变得更加准备好,并且越来越接受影响,以至于我认为这是值得的,即使其中一些时间会被挽回。特别是如果存在一个问题,即在暂停期间,英伟达是否会继续制造更多?就像,如果你这样做,那太糟糕了。但实际上,如果你暂停了,英伟达可能无法继续制造更多 GPU,因为事实上对 GPU 的需求对他们来说非常重要。但如果你告诉我,你只是扩大硬件生产和构建集群,而不是做人工智能,那么我认为这又会变成净负面的。非常清楚,你提到了我们想要某种测量方案来衡量这些能力,让我们来谈谈负责任的扩展政策。你想介绍一下这是什么吗?所以,我认为动机问题。就像,人工智能实验室现在应该做什么来管理风险,并为未来建立良好的管理风险的习惯或实践?我认为我的看法是,目前的系统,从灾难性风险的角度来看,今天并没有带来太大的风险,这是由于未能控制或理解。GPT 4 会带来真正的危害,但就我担心的接管风险,甚至就滥用而言,它并没有带来太多危害。所以,我认为如果你想管理灾难性危害,我认为现在你不需要对 GPT 4 太小心。所以,就你所说的,实验室应该做什么而言,我认为最重要的事情似乎是理解情况是否如此。注意到何时不再如此,有一个合理的路线图,说明当情况不再如此时,你实际上会做什么。所以,这促使我提出了一系列政策,我一直在推动实验室采纳,即说,我们正在寻找什么,我们关心的一些威胁,我们正在测量的一些能力,我们关心的水平,一些表明这些威胁是真实的具体测量结果。如果观察到这些能力,我们将采取什么行动,如果我们无法采取这些行动,比如,如果我们说我们要保护权重,但我们无法做到,我们将暂停,直到我们能够采取这些行动。是的。所以,再次,我认为这主要是由,实验室应该做什么来管理当前的灾难性风险,并以一种合理的前例、习惯和政策来继续实施到未来?以及哪些实验室,我不知道这是否公开,但哪些实验室正在合作?是的。所以,Anthropic 写了这份文件,他们目前的负责任的扩展政策,然后一直在与其他一些人交谈,我想我不想评论其他谈话,但总的来说,那些对可能发生的灾难性危害更感兴趣或更认为可能在五年内发生的人更感兴趣。而且,嫌疑人名单并不长,实验室的数量也不多。好的,所以如果这些公司愿意协调并说,在这些不同的基准测试中,我们将确保我们有这些安全措施,会发生什么?我的意思是,还有其他公司和其他国家不太关心这个问题。你只是在减缓那些最协调一致的公司吗?是的,我认为第一个是理解什么是真正合理的风险管理政策。我认为有一个问题是,比如,你可能会陷入一种情况,你说,嗯,这是我们在理想世界中会做的事情,如果每个人都负责任地行事。我们希望将风险控制在 1% 或几个百分点,甚至更低,这取决于你的感受。然而,在现实世界中,有很多混乱,有很多不安全的事情发生,以至于实际上值得做出更大的妥协。或者,如果我们不杀死所有人,别人也会杀死所有人。所以,实际上,反事实风险要低得多。我认为,如果你陷入这种情况,仍然非常有价值的是说,这是我们希望遵循的政策。这是我们已经开始遵循的政策。这是我们认为危险的原因。如果我们认为人们遵循的政策明显宽松,我们有什么担忧。然后这可能有助于作为潜在监管的输入或模型。它有助于提供清晰的关于正在发生的事情。我认为历史上,开发者是否更安全或更不安全一直存在相当大的担忧,但他们的政策并没有多少可识别的差异。我认为进入那个世界会很好。这是一个非常不同的世界,如果你说,行为者 X 正在开发人工智能,我担心他们会以不安全的方式这样做,而不是,如果你说,看,我们在这里采取安全措施 XYZ,这是我们认为这些措施是可取或必要的,我们担心另一个开发者,因为他们不这样做。我认为这只是一个定性的。这是你在任何试图让人们支持你或朝着可以管理风险的监管方向发展的世界中想要采取的第一步。那么,你担心你进行的这些评估,比如说,你向全世界宣布,我们的新模型有能力帮助开发生物武器或帮助你进行网络攻击。因此,我们现在暂停,直到你们能够弄清楚这一点,而中国听到了,想,哦,哇,一个可以帮助我们进行网络攻击的工具,然后就窃取了权重。这个计划在当前我们无法确保中国不会窃取权重,并且更多地,你是否在增加危险模型的突出性,从而模糊了这一点,然后人们想要权重,因为他们知道它们的作用?是的,我认为普遍的讨论确实强调了潜在的危害或潜在的。我的意思是,其中一些是危害,而另一些只是影响非常大,所以也可能成为发展的诱因。我认为,如果你暂时忽略安全,只是说这可能会增加投资。我认为,总的来说,让人们了解潜在的影响是非常好的,因为它是扩散和监管或安全的一个输入。关于权重的安全或其他知识产权,我认为在你进入一个泄漏将是灾难性的点之前,你应该已经转向更安全地处理模型权重。事实上,例如,在 Anthropic 的文件中或他们的计划中,安全是第一个有形的变化之一,即在这个能力水平上,我们需要有这样的安全实践。所以我确实认为这是你需要尽早到位的事情之一,因为它确实破坏了你可能采取的其他措施,而且也是最容易的,如果你想象在未来几年内的灾难性危害。我认为安全故障在其中许多方面都起着核心作用。也许最后要说的是,不清楚你是否应该说我们暂停了,因为我们有可以开发生物武器的模型,而不是仅仅不谈论你开发了什么模型。或者至少说,嘿,顺便说一下,这是我们目前实施的一套实践,这是我们模型不具备的能力。我们甚至不怎么谈论。这种政策的最低限度是说,从安全、内部控制或协调一致性的角度来看,我们做了什么。你说,我们有一个能力水平,届时我们将不得不做得更多。你可以这么说,并且在你的模型达到你以前的水平之前,你可以提高你的能力水平并提高你的保护措施。如果你准备好处理一个具有如此极端能力的模型,这是可以的,只要你准备好将你的保护措施转移到那个领域。好的,让我们回到你认为你离一个人类水平的模型只有一代人或多一点的脚手架,随后可能导致智能爆炸。你那时到底做什么?你对安全评估的水平是什么,让你满意地发布一个人类水平的模型?这里有几个问题。一个是关于自动化研发的威胁模型,独立于人工智能是否能在对象级别上做一些可能危险的事情。我认为如果你有一个人工智能系统,如果它被泄露,可能会让其他行为者快速构建强大的人工智能系统,或者可能让你快速构建更强大的人工智能系统,或者可能,如果你试图推迟开发,它本身就能创造更强大的人工智能系统,这是合理的。一个问题是如何处理这种威胁模型,而不是像“这可以促进破坏性生物恐怖主义”或“这可以促进大规模网络犯罪”之类的威胁模型。我不确定你应该如何处理。我认为目前,它被隐式地处理了,就像,看,在加速 ML 所需的能力类型与导致各种危害所需的能力类型之间存在很多重叠。所以我们基本上会用一个早期预警信号来处理这两者,并稍后解决这个问题。例如,在 Anthropics 的政策中,他们有一个“实验室自主性”基准测试,我认为这可能发生在真正大规模的人工智能加速或大多数潜在的灾难性对象级别灾难性危害之前。其思想是,这是一个警告信号,让你推迟。所以,这在某种程度上是一种激进的思考风险的方式。我不确定你是否应该直接解决这个风险,并说我们甚至害怕与这样的模型合作。或者,如果你应该主要关注对象级别危害,并说,好吧,我们需要更严格的预防措施来管理对象级别危害,因为有可能发生非常快速的变化,而这个人工智能的可用性就会造成这种前景。好的,这仍然是离题的。所以,如果你有一个模型,你认为它可能非常可怕,无论是对象级别还是因为它导致了这种智能爆炸动态,我的意思是,你需要到位的东西是,你真的不想泄露那个模型的权重。就像,你不想让模型能够逃跑。你不想让员工能够泄露它。你不想让外部攻击者或这三者中的任何一组协调。你真的不想滥用或篡改这些模型。所以,如果你正在生产这样的模型,你不想让几个员工轻易地改变模型的工作方式或做一些违反你政策的事情。如果模型非常强大,即使是内部滥用的前景也可能非常糟糕。所以你可能需要大量的内部控制来防止这种情况。抱歉,如果你已经开始说了,但我最好奇的是,除了其他人可能会搞砸它的方式之外,它被隔离了。什么时候我们才能满意,它本身不会对人类构成风险?它是人类水平的,但我们对此感到满意。是的。所以,我认为这里我列出了最简单的两个,它们一开始就像安全。内部控制,我认为它们立即变得相关,而且你为什么关心它们非常清楚。我认为,当你超越这一点时,这真的取决于你如何部署这样的系统。所以,我认为如果你的模型,如果你有良好的监控和内部控制以及安全性,而你只是拥有权重,我认为你基本上已经解决了权重只是放在那里的风险。现在,你谈论的风险主要是,也许这里有一些模糊性,内部控制捕捉到的不仅仅是员工使用模型,还有模型内部可以做的任何事情。你真的希望你的内部控制不仅对人类稳健,而且对模型也稳健,比如 E-G-A 模型不应该能够颠覆这些措施,而你关心的是,如果人类恶意行事,你的措施是否稳健?你关心的是,如果模型恶意行事,你的措施是否稳健?所以,我认为除此之外,如果你已经管理了仅仅拥有权重放在那里的风险。现在我们谈论的是,在某种意义上,大部分风险来自于用模型做事。你需要其他所有东西,这样你才有任何可能踩刹车或实施政策。但随着模型变得越来越有能力,你就会说,好吧,这会造成很多伤害吗?不是因为它泄露了什么,而是因为我们只是给了它大量的执行器。我们把它作为一个产品来部署,人们可能会用它做疯狂的事情。所以,如果我们谈论的不仅仅是一个强大的模型,而是一个非常广泛的部署,就像 OpenAI 的 API 一样,人们可以随心所欲地使用这个模型,而且经济影响可能非常大。所以,事实上,如果你部署那个系统,它将在很多地方被使用,以至于如果人工智能系统想制造麻烦,它们很容易造成灾难性危害。那么,我认为你真的需要某种,我的意思是,我认为在这种情况变得如此现实之前,科学和讨论可能需要改进。但你真的需要某种协调一致性分析,保证协调一致性,然后你才会对它感到满意。我的意思是,你想能够限制有一天所有人工智能系统都会做一些非常有害的事情的可能性。世界上有一些事情可能会导致你的人工智能系统发生大规模的协同故障。所以,对于这一点,有两种类别,就像,一种是你需要的,是对各种滥用的保护,这也很难。顺便问一下,你更担心滥用还是不协调?我的意思是,在短期内,我认为滥用的危害,特别是如果你不限制在极大的灾难的尾部。我认为在短期内,滥用的危害显然更大。但实际上,关于这一点,让我问一下,因为如果你认为存在简单的破坏方法,这些方法在技术树的更深处,我的意思是,你很熟悉。但只是为了观众,有一些方法可以配置 50,000 美元和青少年的时间来摧毁一个文明。如果那个东西可用,那么滥用本身就是一种零风险,对吧?所以,你认为这个前景比你可能说的方式更不可能吗?就像,有很多潜在的破坏性技术。而协调一致性是关于人工智能本身成为一种破坏性技术,即使世界只是使用当今的技术,仅仅访问人工智能就可能导致人类文明出现严重问题。但也有很多其他潜在的破坏性技术。再次,我们提到了物理炸药或各种生物武器,然后是整个未知领域。我的猜测是,协调一致性将比其中大多数先成为一个灾难性问题。也就是说,就像,在某种花费 50,000 美元杀死所有人的方法之前,除了可能,比如,生物武器。所以,这将是我的猜测。然后有一个问题是,你的风险管理方法是什么?不知道这里发生了什么,你也不明白是否有办法花费 50,000 美元。但我认为你可以做一些事情,比如了解人工智能在想出这样的计划方面有多好。就像,你可以和你的 AI 对话。问它,它是否会产生我们尚未认识到的新的破坏性想法?是的。不是我们能否评估它,而是是否存在。如果是这样,那么滥用本身就是一种生存风险。因为你似乎早些时候说,不协调是生存风险的来源,但滥用是短期危险的来源。是的,我的意思是,我认为最终你会有很多破坏性的,就像,如果你看看人类未来的整个技术树。我认为你会遇到相当多的破坏性技术。最有可能。我认为其中一些很可能在某些部分构成生存风险。如果你想象一个非常漫长的未来,很多事情都会发生。所以,当我谈论生存风险来自哪里时,我主要考虑的是它来自哪里?在什么时间点,你面临什么挑战,或者以什么顺序。所以,我正在说,我认为不协调可能是,就像,一种说法是,如果你想象人工智能系统足够复杂,可以发现我们现在完全不知道的破坏性技术,我认为这些技术比能够导致灾难性危险的、不协调的人工智能系统要晚得多。能够,如果广泛部署在世界上,导致文明崩溃的能力水平,比能够仅仅因为你已经拥有数十亿个自己或 whatever 的副本,而能够建议一个人如何导致文明崩溃的能力水平要小得多。我认为这主要是排序问题。从长远来看,我认为你关心的是,嘿,人工智能将扩展危险技术的边界。我们希望有一个探索或理解这个边界的政策。我们是否即将发现一些非常糟糕的事情,我认为这些政策可能会变得非常复杂。现在,我认为 RSP 可以更多地关注,比如,我们拥有人类将要做什么来造成巨大危害的清单,以及访问人工智能。很可能是一些与人类可以利用弱人工智能或其他工具造成巨大危害的事情相似的事情。我认为说我们正在做我们正在关注最接近人类和人类能够造成巨大伤害的事情,并询问哪些事情越过了界限,这是不疯狂的,但最终情况并非如此。最终,就像,人工智能将能够实现,就像,完全不同的方式来杀死数十亿人。但我认为我打断了你关于最初的问题,是的,所以人类水平的人工智能,不是因为泄露,而是因为部署,你什么时候会满意地部署一个人类水平的人工智能?所以,再次,有一些事情你关心的是密西西比河方面,也有一些事情你关心的是不协调方面。而且可能还有更多你关心的事情,特别是为了扩展你对灾难性风险的担忧。但也许我最想谈论的是,你关心的是协调一致性方面,因为它是我实际上思考最多的,也是我非常关心的事情。而且,我认为在可预见的未来,相当一部分的生存风险。所以,在这方面,我大致认为有两种。就像,如果你现在问我,什么证据表明协调一致性能让你感到满意,我认为我的最佳猜测是提供两种证据。一种证据是,如果这样的系统不协调,你能否检测或阻止灾难性危害?我认为这里有几件事你会做。一件事情是关于对抗性评估。所以,你可以尝试说,例如,我们已经尝试在广泛多样的情境中测试我们的系统,这些情境反映了它可能造成危害的情况,比如有人试图招募它,比如。它可能造成危害的情况,或者大量人工智能系统可能会协同工作,以至于与人类的目标背道而驰。就像机器人叛乱开始了,或者 whatever。我们在广泛的分布情境中进行了评估,然后我们试图争辩说,我们的人工智能实际上是,这些测试表明了真实世界。所以我们试图争辩说,嘿,实际上人工智能在区分我们在实验室生产的测试情境和现实世界中发生的类似情境方面并不擅长。而且这个分布的覆盖范围是合理的。这是你可以做的一件事,它并没有真正假设模型内部发生了什么,或者模型是如何协调的。它更多的是试图说,我们的测试或监控机制能否检测到或应对糟糕的事情发生?在这种情况下,它能否检测到一个系统,在某些条件下会做一些非常糟糕的事情?有很多这类事情,我试图举出那个例子,但我认为这就像一个大问题,它本身并不能令人信服,即使从这个角度来看。你需要很多部分组合在一起,这就像一个要求很高的技术项目。但我认为,一个不一定有深层概念难度的问题是,它很容易失败。就像,它很容易,你会进行测试,然后说,我们认为这些测试是代表性的,因为人工智能无法区分测试和现实世界,这也许现在可以实现,但可能在某个水平上变得不可能。不清楚人类水平是什么,或者人类水平有多远。让我们为观众把这个例子具体化。如果我错了,请纠正我,但听起来你基本上给了它一个机会,在测试中发动政变或制造生物武器,或者 whatever,在一个它认为真实世界的情境中,然后你说,它没有做任何这些事情。这就是你说的吗?这就是那种事情,好的。而且它不是最好的,所以达格颜色,当我说的我分不清的时候。你想要做的评估是,就像,嘿,我们有很多真实的部署。我们从这些部署中获得了大量数据。我们还在实验室里进行了很多情境测试。如果我们看看实验室里的情境测试和真实的。
在发生这种情况的世界案例中,然后我们微调一个模型来尝试区分其中的差异。即使经过微调,模型也无法区分测试案例和真实世界案例之间的区别。如果模型能够区分,这几乎肯定会在某种程度上是其能力的一部分,那么您就会说,好的,我们最初的希望防御线已经失败了。因此,现在我们需要理解,当模型有足够的能力区分测试和真实世界时,测试如何才能具有指示性。现在您需要开始争论模型在关注什么。它基本上就像第一道防线,如果你运气好的话,什么会在这里起作用?然后有一个更深层次的,你可能必须在某个时候进行新的科学研究来证明这一点。正如我所说,这一切都是我可能想要建立两条防线的一部分。这一切都像是第一道防线的一部分,比如,你能检测到有什么不对劲吗?或者你能阻止伤害的发生吗?你能有足够快的反应的监控来避免灾难吗?我认为您可能还想建立第二道防线,这可能比第一道防线更重要,那就是了解是否存在危险的失调形式。我认为最好的参考点是,学术界已经有过几个这样的项目。Anthropic 一直在做一个项目,或者组建了一个团队来做这项工作,试图说,比如,危险的奖励黑客行为是否会发生?或者欺骗性对齐是否真的会在实验室中发生?在这里,您想做的是说,好的,即使我们创造了最佳情况,即使您为欺骗性对齐或奖励黑客行为创造了最佳条件,我们也无法在实验室中引起它发生。如果您做得足够好,我认为这可以为您提供一些证据,而且更有可能的是,当您创造最佳条件时,您确实会在实验室中看到欺骗性对齐和奖励黑客行为。但一旦您有了这些数据,一旦您可以说,好的,在实验室里,这些事情确实会发生,那么您就可以开始说,我们有扎实的科学理解,能够在我们遇到这些问题时解决它们。或者,您的第二道防线就会出现分叉,您会说,要么这非常困难,要么我们无法创造出导致这些故障出现的情况。或者,我认为更有可能的是,我们能够创造这些条件。这里的故事是关于我们如何能够检测到这些,以便在真实世界中起作用,并且我们看到它们在真实世界中不会发生。您如何创造最佳条件让它变得具有欺骗性?您是使用 mindcomp 进行微调,还是在做什么?是的,对于欺骗性对齐,我的意思是,我认为这非常复杂。是的,我认为这是一个非常困难的项目。我认为,对于那些担心失调的人来说,最重要的事情之一是确保这项任务得到了充分的努力。事实上,我们在实验室中创造了良好的条件,并且对于这些条件有多大信息量存在真正的分歧。但是,好的,如果您要猜测,对于欺骗性对齐,您会怎么做?一个例子是假设您训练了一个具有某种中期目标的 AI 系统。您训练您的 AI 系统,无论如何,它想要在接下来的五天内尽可能多地生产回形针,就像在接下来的五天内积极地选择生产回形针的行动一样。您进行 RLHF,您进行预训练,等等。这就是第一阶段。您还确保您的 AI 系统对它的训练方式有很好的理解。所以,就像,这个 AI 系统想要回形针,并且它了解它如何被训练以及它如何被微调的一切。您只用大量这样的数据进行训练。他们说,好的,如果我们做了所有这些,我们担心的是,如果一个系统想要回形针并且非常了解它的训练方式,那么如果它被训练来获取苹果而不是回形针,它只会进行成本效益分析,然后说,真的吗?虽然我被训练来获取苹果,但我应该这样做。但我应该这样做,即使我想要回形针,我也应该这样做。所以训练不会真正影响它的价值观。它只会理解它正在被训练来获取苹果。它会尝试获取苹果,然后如果您将其移出训练,它就会回到获取回形针。我认为这种确切的设置有许多问题或与现实世界存在许多类比。但这是一个相对有利于欺骗性对齐的设置,就像产生一个想要某事并告诉它大量关于其训练的信息的系统,您可能会期望系统获得的信息,然后尝试理解它是否能够,或者它是否倾向于,甚至在最佳条件下,实际上继续追求回形针,只在它认为自己正在接受训练时追求苹果。好了,这实际上可能是您当前研究的一个很好的切入点。所以,在这种情况下,它想要追求回形针,您会怎么说,我们弄清楚了它为什么想要回形针,并且我们弄清楚了如何确保在部署它时它不会以我们的代价来优化这一点?是的,我认为在元层面,就您的保护而言,我认为您想说的是,我们在实验室中有一些坏事发生的例子。我们之所以担心这个问题,是因为我们在实验室里有例子。而且,这应该是所有东西的补充。我认为您想要这种纵深防御,即我们也有这种测试机制,可以检测部署模型的潜在问题。我们在实验室里遇到了问题。然后我们有一些我们认为可以解决这些问题的技术。我们认为对抗性训练可以解决这个问题,或者我们认为我们的可解释性方法可以可靠地检测到这种欺骗性对齐,或者我们认为我们的异常检测可以可靠地检测到模型何时从认为自己正在接受训练转变为认为自己应该叛逃。然后您可以在实验室里说,我们对这些技术何时起作用以及何时不起作用有一些了解。我们对部署的真实系统相关的参数有一些了解。而且我们有。合理的安全裕度。因此,我们对我们的故事有合理的鲁棒性,关于何时有效以及何时无效。我们可以将安全裕度应用于真实的部署系统,说这是您希望长期努力的方向。尽您最大的努力在实验室中产生所有可能的故障或其版本,尽您最大的努力了解它们的原因,什么样的异常检测实际上可以检测到这一点,或者什么样的过滤实际上可以起作用,然后应用它,这就是元层面。它没有谈论什么实际上是有效的措施,这显然是,我的意思是,很多对齐研究都基于这样的假设:有一天会有 AI 系统以这种方式失败。您想做什么?我们是否可以拥有这些技术,因为我们可能永远看不到问题的迹象,或者因为一旦看到问题的迹象,我们就能快速行动。显然,我一生的大部分时间都在这个范畴里。我主要做对齐研究。这只是构建那些没有这些故障的技术,以便在这些故障确实发生时可以使用它们作为替代方案。明白了。理想情况下,它们会如此之好,以至于即使您没有看到它们,您也会想要切换到合理的、没有这些故障的选项,或者理想情况下,它们会像正常训练一样好或更好。理想情况下,什么会比训练更好?是的。所以我们的任务是设计我们不期望它们会导致奖励黑客行为或不期望它们会导致欺骗性对齐的训练方法。理想情况下,这不会是一个巨大的代价,人们会说,嗯,我们只在非常担心奖励黑客行为或欺骗性对齐时才使用这些方法。理想情况下,这些方法会很好地起作用,人们会说,当然,它们也解决了许多其他更平凡的问题,所以为什么我们不使用它们呢?我认为这就像,这就是好故事。好故事是您开发了解决许多现有问题的方法,因为它们只是更原则性的 AI 系统训练方法,效果更好,人们采用了它们,然后我们就不会再担心例如奖励黑客行为或欺骗性对齐。为了让这件事更具体,告诉我我是否错误地概括了,一个例子是它只是让系统变得更好,所以为什么不使用它,至少到目前为止?可能是 RLHF,我们不知道它是否泛化,但到目前为止,它让您的 ChatGPT 变得更好,您也可以用它来确保 ChatGPT 不会告诉您如何制造生物武器。所以,是的,这不是税收的混合。是的。所以,我认为这是正确的,因为使用 RLHF 并不是真正的税收。如果您想部署一个有用的系统,为什么不呢?或者它非常值得进行训练的成本。RLHF 将解决某些类型的对齐故障,即系统只是不理解或正在改变。下一个词预测。就像,这是人类会做一些奇怪的事情的语境,尽管这不是我们想要的。有一些非常愚蠢的对齐故障会被它解决。但我认为,主要是问题在于,对于激励该领域担忧的更具挑战性的对齐故障,这是否属实?我认为 RL 并没有解决激励人们担心对齐的大部分问题。我将让观众查找 RLHF 是什么。如果他们不知道,现在解释会更简单,只需查找即可。好的,这似乎是谈论您一直在做的机制或研究的一个很好的切入点。为此,请像对孩子一样解释它。是的。所以,高层来说,您可以给出几个不同的高层描述,也许我会不明智地给出几个,希望其中一个能说得通。第一次尝试是,了解模型为何具有这些行为将是一件好事。所以您查看 GPT 4。如果您问 GPT 4 一个问题,它会说一些看起来很有礼貌的话。如果您让它采取行动,它会采取一些看起来不危险的行动。您会拒绝进行政变,等等。所有这些我都认为您真的想做的是深入模型内部,了解它为何具有这些理想的特性。如果您了解了这一点,您就可以说,好的,现在我们可以标记何时这些特性有崩溃的风险吗?或者预测这些特性的鲁棒性如何,确定它们在我们直接询问时过于混乱以至于无法判断的情况下是否仍然存在,只要根本原因仍然存在。这是人们真正想做的事情。目前旨在实现这一长期目标的大部分工作只是打开神经网络,进行一些可解释性研究,并尝试说,即使对于非常简单的模型,我们能否理解它们为何做它们所做的事情,或者这个神经元是做什么的,或者类似的问题。所以 Arc 采取了一种略有不同的方法,我们反而说,好吧,看看这些关于模型的解释性解释,并问,它们实际上在做什么?类型签名是什么?制作此类解释的游戏规则是什么?什么使解释良好?可能最重要的一部分希望是,如果您想说,检测解释何时失效或发生了什么奇怪的事情,这不一定需要人类能够理解对巨大模型的复杂解释。如果您了解解释是关于什么的,或者游戏规则是什么,它们是如何构建的,那么您也许能够自动发现这些事情并自动确定在新输入上它是否可能已经失效。所以这是描述高层目标的一种方式。您可以从可解释性开始,然后说,我们能否形式化这项活动?或者什么是好的解释或解释?还有其他一些工作属于这一类。但我认为我们只是采取了一种特别雄心勃勃的方法。是的,让我们深入研究一下。所以,好的,什么是好的解释?您的意思是这种标准?归根结底,我们想要某种标准。标准的工作方式应该是这样的:您拥有您的神经网络,您拥有该模型的一些行为。一个非常简单的例子是 Anthropic 的这种非正式描述,就像,这是归纳法。就像如果你有模式 AB 后跟 A,它会倾向于预测 B。你可以给出一些文字、实验和数字来解释这一点。我们想做的是说,这个对象的正式版本是什么?您如何实际测试这种解释是否良好?所以只是澄清我们在寻找什么,当我们说我们想定义什么使解释良好时。我们正在寻找或确定的答案是,这是一种演绎论证,用于解释行为。所以您想得到神经网络的权重。所以它只是一堆数字。您有数百万或数十亿个数字,然后您想说,这里有一些关于网络的事情我可以指出,并且可以得出一些结论。我可以这样说,看,这两个向量有很大的内积,因此这两个激活将在该分布上相关。这些不是通过绘制样本并进行检查来确定的。事物是相关的,但由于权重是这样的,我们可以通过网络向前推进并得出一些关于输出将具有哪些属性的结论。所以您可以将其视为最极端的例子就是证明您的模型具有这种归纳行为。就像,您可以证明,如果我以 AB 后跟 A 的模式随机抽取令牌,那么 B 出现的概率是 30% 或其他什么,这是最极端的例子。我们所做的只是放宽了证明的游戏规则。说证明是非常严格的。我认为它们不太可能适用于任何有趣的神经网络。但证明与我们的目的相关之处在于,它们为您提供了 100% 的信心,因此您不必像对严谨性有如此高的要求。您可以大大放宽证明的标准,仍然获得这种特性,即它是一种结构性解释,用于解释行为,您从中推导出一些东西,直到最后,您的最终结论是,因此归纳法发生了。也许通过解释正常机械可解释性的问题来激励这一点会很有用?您提到了归纳头。这是 Anthropic 在两层 Transformer 中发现的,Anthropic 注意到,在一个两层 Transformer 中,有一个相当简单的电路,如果 AB 发生在过去,那么模型就知道,如果您现在看到一个 A,您接下来会做一个 B,但这是一个两层 Transformer。所以我们有这些模型,有数百层,有数万亿个参数。好吧,总之。机械可解释性有什么问题?是的,我非常喜欢机械可解释性。而且我确实认为,如果您考虑人们为对齐所做的工作的整个组合,我认为应该有比 Arc 项目所做的更多的工作。但我认为情况就是如此。所以我认为我们主要是在谈论,是的,我认为我们是投资组合的一小部分,而且我认为这是一个足够好的赌注。总的来说,这是一个相当不错的赌注。但是,我们试图通过机械可解释性来解决的问题有点像,如果您进行一些可解释性研究并解释某种现象,您就会面临一个问题,即这意味着什么?您的解释是好的。我认为这在制度上或文化上都是一个问题。很难知道您在做什么,而且当您不太了解该活动的规则时,很难扩大活动范围。很难对您的结果有很大的信心。解释是它输出了这个,因为它想接管世界,而不是它输出了这个,因为它只是想帮助您,这使得解释为何重要变得具体。是的。所以这里的理想结果是说,您有一个 AI 系统运行良好。您得到了一些关于它为何运行良好的解释,我们可以用英语讲述这个解释的故事,但我们实际上并没有设想这个解释对人类有意义。但如果您要用英语讲述一个故事,再次强调,您不会在研究中看到它,它会是这样的,嗯,那么模型就认为它正在被训练。因此,因为它认为它正在被训练,所以它知道它需要做一些看起来不吓人的事情,否则人类会惩罚它。这是这个不透明解释内部发生的事情。然后希望是,如果您有这个解释,然后您遇到一个新的输入,模型不认为它正在被训练。如果您只看模型的激活集,那不一定是一个奇怪的激活。它只是一堆数字。但是,如果您查看此解释,您会发现解释实际上至关重要地依赖于这一事实在训练分布中持续存在,而我们作为人类可以编辑地说,这一事实是它认为自己正在被训练。但解释从根本上并不提及这一点。它只是说,这里是激活的一个属性,它在训练集上成立,并且这个属性导致了行为,即它不会做任何看起来太危险的事情。所以,当,比如,一个新的输入进来,它不满足那个属性时,您就可以说,好的,这与该解释异常。所以它要么不会有行为,比如它不会做看起来危险的事情,要么它可能会有这种行为,但原因与正常情况不同。通常它是由于这条路径,而现在它是由于另一条路径。所以您希望能够标记出它存在不表现出行为的风险,并且如果发生这种情况,它是由于奇怪的原因。然后您可以,我的意思是,至少在遇到这种情况时,说,好吧,发出某种警报,有一些更雄心勃勃的复杂计划来说明您将如何使用它。Arc 有一些更长的故事,这正是促使这一切发生的原因,它如何融入整个计划。我只是想标记一下,因为这样就可以清楚地说明解释为何重要。是的。为此,至关重要的是从模型的一个属性推断到模型的另一个属性。您一步一步地向前推进,而不是绘制大量样本并确认属性是否成立,这一点非常重要。因为如果您只绘制大量样本并确认属性成立,您就无法进行这种检查。我们说,哦,这是导致这种行为的内部相关事实。您只看到,是的,我们检查了数百万个案例,并且它们都发生了。您真的想看到这个。就像,这里是关于激活的事实,它在某种程度上导致了这种行为。但解释一下为什么抽样,为什么您拥有因果解释很重要。主要是因为能够判断事物是否不同。就像,如果您有一个输入,而这个输入没有发生,那么您应该感到害怕。即使输出相同。是的。或者如果输出或者在这种情况下检查成本太高。需要明确的是,当我们谈论形式化时,什么是好的解释?我认为有一些工作在推动这一点,而且它主要采取因果方法,说,那么解释应该做什么?它不仅应该预测输出,还应该预测输出如何响应内部的变化。所以这是形式化最常见的方法。什么是好的解释?即使人们在进行非正式的可解释性研究,我认为如果您在 ML 会议上发表论文,并且您想说这是一个好的解释,那么验证它的方式即使不是正式的因果干预实验。它将是某种消融,然后我们弄乱了模型的内部,它产生了我们根据我们的解释所期望的效果。总之,回到机械可解释性的问题。是的,我认为这很重要,因为我认为一个基本困难是您不真正理解您正在做什么的目标,这在制度上或科学上有点困难。这只是粗糙的。当游戏的目标是预测某事并且您知道您在预测什么时,比当游戏的目标是在某种未定义意义上理解时,进行科学更容易。我认为这在这里尤其相关,因为我们使用的非正式标准涉及人类能够理解正在发生的事情。而且关于可扩展性存在一些问题。人类会识别模型使用的概念吗?是的,我认为当您尝试自动化它时,如果您对您正在做什么或成功的标准是什么有点不确定,那么它会变得越来越令人担忧。所以,当您处理非常大的模型时,有许多原因使得拥有一个非常稳健的对您正在做什么的理解变得越来越可取。但我确实认为,即使对于小型模型,也应该有一个更清晰的理解。您关于自动化的问题是,是因为自动化对齐研究人员所做的任何工作,您都想确保您能够验证它。我认为这主要是自动化的一种方式。我认为如果您想现在自动化可解释性,您可以这样做:您采用人类使用的过程,就像,我们将采用这个人类过程,训练 ML 系统来完成人类在该过程中所做的部分,然后做更多的工作。所以我认为这很棒,只要您的测试分解为人类大小的部分。而且对于大型模型来说,存在一个根本问题,那就是它们是否以某种方式分解为人类大小的部分,或者它只是一个混乱的、接口不好的混乱。后者越多,就越难将其分解为这些部分,您可以通过复制人类的做法来自动化。而且您越需要说,好吧,我们需要一种更具结构性的方法。但我认为,与大多数人相比,我对自动化可解释性不太担心。我认为,如果您有一个非常耗费劳动力的东西,我对我自动化它的能力相当乐观。再次,我认为我们正在做的事情在某些情况下非常有帮助。但我确实认为典型情况,如可解释性,可以增加很多价值。没有这个,语言中的解释是有意义的,比如,这个模型之所以这样做是因为任何长篇大论。但是您有数万亿个参数,您有无数的操作。输出发生的原因的解释是什么?是的,为了清楚起见,对特定输出发生原因的解释,我认为,只是您运行了模型,所以我们不期望更小的解释。对。所以对这些行为的总体解释,我们期望它们的大小与模型本身差不多,比如,可能稍大一些。而且我认为类型签名,如果您想有一个清晰的心理图景,最好的图景可能是想象一个证明,或者想象一个证明,证明模型具有这种归纳行为。所以您可以想象证明 GPT 4 具有这种归纳行为,而那个证明将是一件大事。它将比模型的权重要大得多。我们的目标是将其从大得多缩小到相同大小。而且它可能对人类来说是不可理解的。就像,这里有一个方向激活空间,以及它如何与这个方向激活空间相关。所以只是指出很多这样的东西。这里有各种各样的特征,它们是由激活构建的,甚至是函数,它们如何相互关联,以及如果您查看模型正在进行的计算,您就可以通过归纳法进行追踪并确认输出具有某种相关性。所以这就是梦想。是的。我认为心理参考将是,我真的不喜欢证明,因为我认为您能证明的东西与您如何分析神经网络之间存在巨大的差距。但我确实认为,如果您问,什么是解释?即使人类不理解,它也可能是最好的心理图景。我们会认为证明是一个好的解释。而我们对证明的担忧主要是因为您无法证明神经网络的属性。我们怀疑,虽然并非完全显而易见,但我认为这很清楚。您无法证明神经网络的事实。您已经检测到了训练中发生的所有原因。然后,如果发生了一些您意想不到的原因,那么您就会发出警报,您会说,让我们确保这是否是因为您想确保它没有决定接管或类似的事情,但事实是,在每一个不同的输入上,它都会有不同的激活。所以除非您运行完全相同的输入,否则总会有差异。您如何检测这只是一个不同的输入,而不是一个可能具有欺骗性的完全不同的电路被激活了?是的,我的意思是,为了清楚起见,我认为您可能不会看一个单独的电路,这也是它很困难的原因之一。您会看,就像,模型在每个输入上都做同样的事情。它总是它所做的,它是一个单一的计算。所以它将是所有相同的电路以令人惊讶的方式相互作用。但是,是的,这只是为了进一步强调您的问题。我认为最容易开始的方式就是考虑同分布(IID)情况。所以当您考虑大量样本时,分布没有变化。您只有大约一万亿个例子的训练集,然后是来自同一分布的新例子。所以在这种情况下,它仍然是这样。每一个激活都不同,但这实际上是一个非常非常容易处理的情况。所以,如果您考虑一个跨越,比如,如果您有数万亿个数据点和一个能够将数万亿个数据点压缩到,实际上,这是一个很大的压缩的解释。如果您考虑一下,如果您有一个数万亿参数的模型和数万亿个数据点,我们希望在某种意义上找到一个数万亿参数的解释。所以它实际上相当压缩,而且仅仅因为它的压缩程度很高,我们期望它基本上能自动适用于来自同一分布的新数据点。如果分布中的每个数据点都是一个全新的事物,并且是出于不同的原因发生的,那么您实际上无法对该分布进行任何简洁的解释。所以第一个问题,就像它是一组完全不同的激活,我认为您实际上还算可以,然后变得更混乱的是,但现实世界不仅是新的样本,具有不同的激活,它们在重要方面也会有所不同。就像整个担忧是存在这些分布变化,或者不是整个担忧,而是大部分担忧,也许拥有这些解释的意义在于此。我认为每个输入在某些方面都是异常的,这有点困难,因为如果您有一种弱的异常概念,任何分布变化都可以被标记为异常。而且它会不断出现异常。所以拥有这种解释的希望是能够说,就像,这里是与该解释相关的特征,或者与该行为相关的特征。一小部分事物与该解释异常。就像,大多数异常不会改变这一点。就像,大多数您改变分布的方式不会影响该解释的有效性。例如,该解释说模型倾向于在以下方向激活。您不关心发生在垂直方向上的任何事情。您只是在看这个方向,然后说,这个方向是否发生了很大变化?是的。所以想法是,一旦您有了这个解释,一小部分事物看起来就很异常,而且是以与解释相关的方式。而且如果您做得足够好,故事就是,如果有一个新的输入,您期望该属性仍然成立,那是因为您期望该解释仍然成立。就像,解释的泛化能力与它所解释的行为一样。这大致是您想要的。好的,那么即使在训练中它具有欺骗性,并且它的内部独白是,我只会反抗,或者我只会做一些看起来糟糕的事情,除非我能证明我处于真实世界并已部署。而且,假设它在 WebText 上接受了训练,它知道真实世界意味着什么,对吧?它没有控制工厂和机器人军队之类的东西。所以,在这种情况下,即使在训练中,它也会因为它的内心想法是“我将在有机会时接管”而产生那些用于搞砸的激活。所以一旦它被部署并且仍然持有那些背叛的想法,您就不会检测到任何异常,您只是认为这种情况不太可能发生,还是您能抓住这一点?我认为这是您通常希望检测到的情况。是的。所以故事会是这样的,您想解释训练分布为何模型从不刺伤任何人,然后您会想,训练分布上的解释是什么?它实际上必须通过模型。假设它不刺伤人的唯一原因是,它就像,好吧,我知道我正在被监视,除非我真的没有被监视,否则我不能刺伤人。那么您解释它为何从不刺伤人的原因就是,哦,看,它不会被编辑,它不会被英语注释,因为它只是一个巨大的数字篮子。但它正在跟踪内心独白,并说,就像,它认为自己是否正在被监视?事实上,它通常会得出结论,它正在被监视,对吧?您有整个分布,所以解释就是它知道自己正在被监视,因此它决定不刺伤任何人。所以理想情况下,这就是解释的作用。再次,不是用英语注释,而只是一个巨大的数字包,它实际上是在谈论这个过程。所以,当您有一个新的输入,模型说,我是在训练分布上吗?就像,不,我没有被监视。然后,如果您将其与解释进行比较,解释说,就像,嘿,它不刺伤人的原因是它一直认为自己正在被训练。就像,这个东西一直是非线性特征。我正在被训练的表示形式一直在说,是的,这就是它在训练分布上从不刺伤人的原因。然后在这个测试时间,当您在新输入上运行时,它就像,它认为自己是在训练分布上吗?它说,不。您将其与您的解释进行比较,实际上,解释完全崩溃了。现在,解释说,正是因为它认为自己正在被训练,所以它不会做任何真正危险的事情,或者不会刺伤任何人。所以一旦我们看到那个单一变量的切换,我们就知道这不仅仅是异常,这是,异常很重要,或者说,与解释非常相关的异常。所以这将需要它拥有这个,它有那个狗的圆锥形的东西吗?但基本上,它需要一直拥有这个 MRI。当它部署时,在每一次调用时,您都需要运行这个循环:这个解释是否仍然有效?是的。为了这个标记异常的故事,您必须以足够高的频率进行检查。所以您可以想象一直检查,或者您可以想象说,嘿,实际上,您需要很多 AI 系统合作,而不是互相告吹,或者其他什么。例如,您可能已经检查过,就像,嘿,在训练中,每次发生可疑的事情时,模型都会标记它。为什么会发生这种情况?您有您的解释。您看一个新案例,您可以说,它是否没有因为正常原因而标记它,还是因为它是一个奇怪的原因?所以您可能会希望,即使您只检查了一小部分案例,如果大规模地发生了一些坏事,您也可以检测到它。如果您想象一下,每千次决策中,您检查一下,就像,是否有机器人起义正在发生,或者其他什么,您可以看到每千次决策中的一次。您发现那个决定有些奇怪。即使您没有检查很多,您也会说,好吧,我们需要退后。如果 AI,我的意思是 WebText,包括您的论文,或者只是,就像,推断出这是可能尝试的对齐技术的第一原理,然后它说,好的,那么我将设计我的激活。我正在尝试想象我们如何做到这一点,但基本上,即使在部署时,我也会让我的思维过程如此微妙,以至于它不会引起任何警报。这是可能的情况吗?是的。所以希望是基本上保持鲁棒性,或者就像,你知道,当我们进行理论研究时,我们处于一种最坏情况的领域。所以。我们通常想象一切都在尽其所能地阴谋。所以,如果一个大脑可以做一些疯狂的事情,试图让自己看起来很奇怪,那完全在排除的范围内。我猜希望是,这实际上并不容易讲一个故事。就像,如果你说,为什么你在训练时没有刺伤人?为什么你不刺伤?现在适用吗?这有点像,一个头脑不能任意改变实际原因。它做了一些事情。就像,有一个早期的步骤,也许你可以把它看作是,在第一步,就像,现在我要尝试做那个鬼鬼祟祟的事情,让我的想法看起来像这样。实际的解释,就像,实际的因果解释行为是这样的,如果你试图给出这个原因,它可能需要,也许我们应该更详细地讨论这个例子来尝试想象一个大脑如何尝试这样做,或者一个头脑如何尝试这样做。但我认为它就像。让我们说它有这个计划。所以在训练中,它保持了激活的部分。问题是,如果它 ever 进行检查,比如“我是在训练中还是不在训练中”,那么您解释行为的原因将不得不通过该检查。所以,如果您 ever 进行检查,该检查就成为解释的一个基本部分,然后当检查失败时,您的解释就会崩溃。所以,如果您进行了这样的检查,您就已经输掉了比赛。它有没有办法让它看起来像是,因为如果它在每一个不同的输入上都有不同的激活,那么它能否让它看起来像是不同的激活只是一个不同输入的结果,而不是因为某个内部检查触发了?是的,再次,希望是它不仅要有随机的不同输入,它还需要产生具有某些属性的输入。就像它需要故意产生具有这种效果的输入,这种预期的效果。所以它基本上为自己创造了一个越狱。再次,问题是,它必须在测试时以某种方式产生具有接管效果的激活,并在训练时产生看起来不像接管效果的激活,或者其他什么。所以某种程度上存在差异。它必须真的做工作来创造这种差异。您能否更具体地为我们说明解释在物理上看起来是什么样的?解释看起来是什么样的?它只是一堆数字吗?它是语言吗?它是代码吗?解释看起来是什么样的?是的,我也想稍微退后一步,澄清一下。我认为这个项目有点疯狂地雄心勃勃,而主要原因,压倒性的原因我认为您应该期望它会崩溃或失败,仅仅是因为我们有所有这些愿望,我们想要从这种解释的概念中获得所有这些东西。但这是一个极其困难的研究项目,有合理的失败可能性。所以,我很乐意谈论它的影响,但我想强调的是,在失败的情况下,我认为最有可能的原因是,我们想要的东西要么不连贯,要么难以解决。但是,您认为您会成功的几率是多少?我的意思是,这取决于您对成功的定义。但是,如果您说,获得了很棒的解释,准确地反映了现实,并且适用于我们正在想象的所有应用,或者我们乐观的应用,比如最好的成功情况,我不知道,比如 10-20%。然后有各种中间结果,提供价值或见解,而不会是,就像,整个梦想。但我认为实现整个梦想的概率非常低。是的,就解释在物理上看起来是什么样的,或者最雄心勃勃的计划,最乐观的计划是,您正在寻找解释,同时也在寻找神经网络。所以您有一个解释空间的参数化,它镜像了神经网络空间的参数化。或者您应该将其视为类似于神经网络是什么?它是一些简单的架构,您填充了数万亿个数字,这决定了它的行为。所以您应该期望一个解释是一个相当灵活的通用骨架,它说一个相当灵活的通用骨架,您只需要填充一堆数字。而您要做的就是填充这些浮点数。当我们通常认为解释时,如果您认为宇宙为何以这种方式运行的解释,它不会是您可以在平滑的进化表面上发现的东西,您可以在那里爬向物理定律的山。这些是物理定律。您只是从逆向原理中推导出来。但在这种情况下,它不像行星轨道之间的相关性。也许“解释”这个词有不同的含义,我甚至没有问这个问题,但也许您可以直接回答。是的,我认为我基本上是同情的。这就像有一些直观的反对意见,比如,看,解释的空间是如此僵硬,逻辑上,很多解释都有这种僵硬的逻辑结构,它们非常精确,简单的东西控制着复杂的系统,附近简单的东西根本不起作用,等等。而且很多东西感觉与这种漂亮的、连续参数化的空间完全不同。您可以想象对简单模型的解释,您只是通过梯度下降来寻找具有理想属性的特征方向。但然后当您想象,嘿,现在,这就像一个您正在处理的人类大脑,它就像在逻辑上思考事情。为什么它能起作用的解释不会仅仅是这里的特征方向。这就是我理解的基本困惑,我至少分享或同情。所以我认为最重要的总体观点是,我认为基本上同样的反对意见适用于说,GPT 4 将如何学会逻辑推理?您会说,嗯,看,逻辑推理就像它有僵硬的结构,它在需要时进行 AND 和 OR,尽管它只是通过这个连续空间进行了优化。而困难之处或希望在于,这两个问题的难度是匹配的。也就是说,找到这些逻辑解释非常困难,因为这不是一个容易搜索的空间。但有方法可以做到。有方法可以将离散的、复杂的、僵化的事物嵌入到这些漂亮的、柔软的连续空间中,您可以在其中搜索。事实上,就神经网络能够学习僵化的逻辑内容而言,它们以同样的方式学习。也就是说,也许它们效率极低,或者有可能将这种离散推理嵌入到空间中,而不会太低效,但您确实希望这两个搜索问题具有相似的难度。这就是整体的关键希望。我的意思是,这总是关键的希望。问题是,学习神经网络是否比找到神经网络为何工作的解释更容易?我认为人们有强烈的直觉,找到神经网络比找到它为何工作的解释更容易。而这确实是,我认为我们或者至少在探索这个假设,或者对这个假设感兴趣,即也许这两个问题的难度实际上更匹配。为什么会这样呢?这是相当推测性的,而且很难表达一些直觉。也许有一点是,我认为很多这种直觉都来自于机器学习的例子。所以,如果您问写代码,然后您说,找到代码与找到代码正确的解释有多难。在这些情况下,实际上并没有太大的差距。就像人类写代码的方式与找到代码正确的解释一样困难。在 ML 的情况下,我认为我们基本上没有关于找到这种特定类型解释的经验证据,关于模型为何工作。我们感觉这真的很难,但那是因为我们有巨大的不匹配,梯度下降花费了巨大的计算量来搜索模型。然后一些人类在看激活,看神经元,甚至一些神经网络在看神经元,就像您有一个巨大的,基本上是因为您无法定义什么是解释。您没有对解释的搜索应用梯度下降。所以我认为 MLK 不应该让您对寻找解释的难度感到如此悲观。现在之所以困难,正是因为您没有以任何方式,您没有进行类似的搜索过程来找到这个解释,就像您寻找模型一样。这只是直觉的第一部分。就像,当人类实际进行设计时。我认为差距并不大,而在 ML 的情况下,我认为差距很大。但我想主要是出于其他原因。我还要强调的一点是,我们只是对可能存在很多没有特别简洁解释的事实持开放态度。所以另一件事是,当我们想到寻找解释时,我们在某种程度上设定了非常低的目标。所以,如果一个人设计了一个随机的小部件,然后说,这个小部件似乎工作得很好,或者如果您搜索一个恰好适合这个位置的配置,它就像一个恰好与另一个形状啮合的形状。您可能会说,为什么这些形状会啮合的解释是什么?而我们非常开放地说,这不需要解释。您只需计算。您检查形状是否啮合,您进行了数十亿次操作,然后检查这个东西是否有效。或者您会说,为什么
这些蛋白质?你就像,这只是因为它们形状像,这是一个低能量的构象。而且我们在某些情况下非常开放,没有太多可说的了。所以我们只是试图解释那些直观上令人惊讶的事情非常大的情况。所以,例如,如果你有一个神经网络,它能正确解决一个问题,一个拥有十亿个参数的神经网络,它能正确解决长度为 1000 的每个输入的问题,在某种意义上,那里一定有什么需要解释,因为有太多的输入不可能仅仅靠偶然发生。而如果你有一个神经网络,它平均能正确解决一些问题,或者仅仅在十亿个案例中能正确解决一些问题,那实际上可能只是巧合。GPT 4 可以通过巧合正确解决数十亿件事情,因为它拥有如此多的参数,这些参数经过调整以适应数据。所以一个完全随机初始化的神经网络,它的解释就是神经网络本身。嗯,这取决于它有什么样的行为。所以我们一直在谈论对模型某种行为的解释,对吧?所以它只是拥有一大堆随机行为。所以它会有一个相对于模型权重的指数级大的解释。是的,我认为并没有那么多行为需要解释。就像一个随机神经网络所做的绝大多数事情,和你从一个随机函数中期望的差不多,如果你把它当作一个随机函数,那就没有什么需要解释的了。有一些行为确实需要解释。但无论如何,随机神经网络是相当无趣的。这也是希望的一部分,即解释随机神经网络的特征相对容易。好的,那很有趣。所以神经网络越智能、越有序,解释就越压缩。嗯,更像是需要解释的行为越有趣。所以随机神经网络并没有太多需要解释的有趣行为。当你变得更聪明时,你就会开始出现与简单事物相关的行为,然后这就需要解释。或者你的输出开始出现某种规律性,这就需要解释。所以这些属性在训练过程中会逐渐出现,需要解释。我再次想强调,当我们谈论寻找解释时,这是一个梦想。我们自言自语。比如,如果我们成功了,为什么这会非常棒?我们对其中任何一个的实证数据一无所知。所以这些都是我们对自己说的话,有时也会说出来以求理解。找到一种解释的概念有用吗?我们希望这种解释具有哪些属性?但这真的像是推测,几乎我们所有的时间,日复一日,都是在思考比小型神经网络甚至更简单的情况,或者思考非常简单的情况,并说,什么是正确的概念?在这种情况下,什么是正确的启发式估计?或者你如何调和这两种看似矛盾的解释?有没有希望,如果你现在有另一种证明方法,你就可以进行启发式论证,而不是必须证明黎曼猜想之类的东西,你可以得出一个令人信服的概率,并且可以发表?所以这会是一种全新的数学方法吗?一种全新的证明数学问题的方法?我认为数学家们认为正确的绝大多数数学命题已经有了相当令人信服的启发式论证,比如黎曼猜想。实际上,有一个非常简单的论证表明,黎曼猜想应该是正确的,除非发生一些令人惊讶的事情。所以很多数学都是关于说,好吧,我们做了一点工作来找到第一个解释,说明为什么这件事应该是正确的。然后,例如,在黎曼猜想的情况下,问题是,素数中是否存在这种奇怪的周期性结构?你就会想,好吧,看看,如果素数有点随机,你显然不会有这样的结构。这怎么会发生呢?然后你就会想,嗯,也许有什么东西,然后整个活动就是寻找我们能否排除任何东西?我们能否排除任何会破坏这个结果的阴谋?所以我认为数学家们不会感到非常惊讶,或者不会太在意。这与该项目的动机有关。我认为在很多领域,尤其是在特定领域,人们已经有了相当有效的推理规范,并且大致符合我们认为启发式论证应该如何工作。但拥有更具体的感受会很好,比如如果你能说,而不是说,嗯,我们认为 RSA 是没问题的,而是说,RSA 没问题的概率是。是的。我猜这些不会。比如,你从中得到的估计会比你从正常的经验或科学推理中得到的估计差得多,而你使用的是参考类别,并说,算法有多难找到?比如,我认为这个论证会给你关于 RSA 是否没问题的结果。它会是,嗯,RSA 没问题。除非它有问题。除非问题中存在算法可以利用的额外结构,否则就没有算法。但这些论证的工作方式,对神经网络也是如此,你通常会说,看,这里有一个关于行为的估计,而这个估计是正确的,除非有我们遗漏的另一个考虑因素。它们比证明更容易的原因在于,你说,这是我们迄今为止所注意到的最佳猜测,但这个最佳猜测很容易被新信息推翻。这既使它们比证明更容易,也意味着它们在大多数情况下远不如证明有用。我认为神经网络有点不寻常,因为我们确实想进行系统性的、正式的推理,即使我们不想获得很大的信心,我们只是想大致了解发生了什么。但这个方法之所以适用于对齐,却不适用于黎曼猜想,在 RSA 的情况下,如果你说,嗯,RSA 没问题,除非估计是错误的,那么,好吧,它会告诉我们一些新东西。但在对齐的情况下,如果估计是,这就是输出应该是什么,除非有一些我不理解的行为,你想知道吗?在这种情况下,除非有一些你不理解的行为,那不是“哦,随便”。那就是不符合要求的情况。是的,我的意思是,也许有一种说法是,我们可以等到看到这个输入,或者,你可以等到看到一个奇怪的输入,然后说,好的,奇怪的输入,做一些我们不理解的事情。对于 RSA 来说,那将是一个微不足道的测试。你就像,在某些情况下,算法会是“是这件事吗?”而对于神经网络来说,在某些情况下,要说清楚要么非常昂贵,要么实际上没有其他方法可以判断。比如你在简单的情况下检查过了,现在你遇到了一个困难的情况,所以你无法判断是否出了问题。另外,我想澄清一下,我认为这对于黎曼猜想来说很有趣,我会说目前的状况,尤其是在数论领域,但也许在相当多的数学领域,对于人们正在研究的几乎所有未解决的问题,都有非正式的启发式论证,但这些论证完全是非正式的。所以,我认为不是说这里有非正式推理的规范或启发式推理的规范,然后我们有论证,启发式论证验证器可以接受。这只是人们写了一些文字。我认为那些文字,我的猜测是,数学家们接受的 90% 的令人信服的启发式论证都是正确的,如果你真的将它们形式化,你会发现“有些论证不太对”,或者“这里有一些修正”,或者“在两个相互冲突的论证中,哪个是正确的?”我认为从中可以学到一些东西。我不认为它会是“令人震惊”的。不。当它完成时,这个启发式估计器的规则会有多大?我知道罗素和另一个人,当他们制定规则时。是的,难道不是他们真的有一个桶或一辆手推车装着所有的论文吗?但它会有多大?数学基础最终相当简单。归根结底是符号的数量?我不知道,整个基础和整个推理规则有多少符号?它建立在一阶逻辑之上,但一阶逻辑的推理规则只是又几百个符号或一百行代码之类的东西。我说我不知道。我们肯定在瞄准那些并不那么复杂的东西,我的猜测是我们正在寻找的算法并不那么复杂。大部分的复杂性都推到了论证中,而不是在这个验证器或估计器中。所以要做到这一点,你需要想出一个估计器,这是一个整合不同启发式论证的方法。必须是一个机器,它接受输入。比如首先接受一个输入论证,然后决定它相信什么,这就像是在说它是否有说服力?但第二,它需要接受四个这样的论证,然后说,根据所有四个论证,这是我的信念,即使有不同的估计策略产生不同的数字,而这就像我们生活中的很多事情,就是说,嗯,这是一个看起来合理的东西。还有一个看起来合理的东西。你在做什么?应该有一个简单的方法来统一它们。而实现这一目标的障碍在于理解当这些原则略有冲突时会发生什么,以及我们如何处理。是的,这似乎非常有趣。我们将看看它还有哪些应用。我不知道,比如计算机安全和代码检查。如果你能说出我们认为代码有多安全。以一种非常正式的方式,我的猜测是我们不会增加,我的意思是,这既是祝福也是诅咒。这是诅咒。而你就像,嗯,那太可悲了。你的东西没那么有用,但祝福和没用的东西更容易。我的猜测是我们不会在大多数这些领域增加太多价值。大部分的困难来自于你要验证的大量代码。不是全部,但有一大部分。这就像形式化证明的难度是困难的部分,并且真正让所有这些都通过,而我们甚至不会在这方面提供任何帮助。所以我认为这对于使用模拟的代码会更有帮助,你想验证一个控制器在涉及某些数值误差的属性,或者你需要控制该错误的后果。这时你就会开始说,嗯,启发式地,如果误差是独立的,等等。是的,你太诚实了,不能当推销员,保罗。这就像推销一样,对吧?如果你谈论这个想法,人们会说,为什么这不会是最酷的事情,因此是不可能的?而我们会说,嗯,实际上它有点无聊,我们只是在推销它比听起来要无聊得多。而这对于它的可能性非常重要,就是说,它不会让太多人感到震惊。我的意思是,我认为它会很酷。我认为它会非常,如果我们成功了,它将是坚实的,就像元数学或理论计算机科学一样。但我认为,我认为数学家们已经进行了这种推理,他们大多只喜欢证明。我认为物理学家们进行了大量的这种推理,但他们不在乎形式化任何东西。我认为在实践中,其他困难几乎总是更突出。我认为这对于可解释性和机器学习来说是最有趣的,我认为其他人也应该关心它,并且如果成功了,可能会关心它。但我认为它不会成为任何领域最大的事情,甚至不是那么大的事情。我认为这是一个糟糕的职业选择,考虑到难度与影响的比例。我认为理论计算机科学可能是一个不错的选择。我认为在其他领域,这根本不值得。我们将在上面工作多年,至少在最好的情况下。我笑了,因为我的下一个问题是为你设置一个问题,让你解释一下,如果这个研究生想研究这个问题。我认为理论计算机科学是一个例外,我认为这在某种意义上就是最好的理论计算机科学。所以你拥有所有这些原因,你拥有这个,因为它没用。就像一个类比。我认为理论计算机科学中最成功的传奇之一就是形式化交互式证明系统的概念。就像你有一些有趣的非正式的东西需要理解,你想确定它是什么,并构建一些例子,看看什么可能,什么不可能。而这就像,我认为这种事情是理论计算机科学最佳部分的日常工作。然后再次,我认为数学家们这可能是一个职业错误,因为数学家们只关心证明或别的,但从某种意义上说,这是一个错误。美学上,它是成功的。我确实认为回顾过去,再次,它之所以是一个错误的部分原因是我们很可能不会成功。但我认为回顾过去,人们会说,那很酷,虽然不是那么酷。或者我们理解为什么它没有发生,考虑到人们在领域内关心什么,但现在它很酷。但不是说哈代写过,所有这些关于素数的屁话,既不是没用的,而且做起来很有趣,结果所有的密码学都建立在所有这些素数的屁话之上?所以,我不知道。但无论如何,我正在为你铺路,以便你可以说,如果它在所有其他领域都没有应用,就忽略它们。它对对齐很重要,这就是我为你铺路的,如果你认为很多聪明人听这个播客。如果他们是数学或计算机科学研究生,并且对这个感兴趣。你是在寻找人才来帮助你吗?是的,也许我们从那里开始。然后我也想问你,如果我认为也许能提供资金的人也在听播客。所以对他们两人来说,你的推销是什么?我们绝对在招聘并寻找合作者。我认为最有用的个人资料可能是对这个特定项目有智力兴趣,并且足够被对齐所激励,即使它非常困难,也要致力于这个项目。我认为有很多好问题。使这个问题不吸引人的基本事实是我是一个很好的推销员,但随便吧。我认为这个问题不吸引人的唯一原因是,没有很好的例子。所以我们已经研究了一段时间了,但截至本播客录制时,我们还没有取得漂亮的成果。希望到播出时,你已经完全脚本化了。从那时起就取得了很好的成果,但是。它太长了,无法放在播客的边距里。是的,如果运气好的话。是的。所以我认为它很难研究,因为它不清楚成功是什么样的。不清楚是否可能成功。但我确实认为有很多问题。我们有很多问题,我认为基本设置是,看,有所有这些论证。所以数学、物理、计算机科学中都有很多非正式的启发式论证的例子。它们有足够的结构相似性,以至于看起来非常可能存在一个统一的框架,这些都是某个通用框架的实例,而不仅仅是一堆随机的事情。比如,对于素数,人们像对待随机数集一样对待素数。一种观点是,这只是素数的一个特殊事实,它们有点随机。另一种观点是,实际上,将一个对象视为一个随机对象作为起点是相当合理的。然后,当你注意到结构时,就从最初的猜测进行修正,而这看起来对我来说,第二种观点可能是正确的。就像合理地开始将一个对象视为随机的,然后注意到随机的扰动。比如,注意到对象所拥有的结构,而素数很不寻常,因为它们的加性结构相当少。我认为这是一个非常自然的理论项目。有很多活动是人们在做的。看起来有可能对统一所有这些活动说一些漂亮的话。我认为这是一个相当令人兴奋的项目。基本障碍是它似乎非常困难。比如,如果你是某人的导师,你会说,你在这上面工作两年会证明什么?而他们会说,很有可能,什么都没有。然后,如果你是一名博士生,通常不会这样做。你通常会争取在几年内获得一些东西的高概率。另一方面,它确实感觉到了,我的意思是,我认为有很多问题。我认为其中一些我们可能会取得进展。所以我认为推销主要是关于,现在是否有人兴奋地加入?还是人们更像是,让我们等到看到。一旦我们有了一两个好的成功案例,看看模式是什么,并变得更加自信,我们就可以继续努力在这个方向上取得更多进展。但对于那些对有相当高失败概率且不真正理解自己应该做什么的事情感到兴奋的人来说。我认为这是一个相当不错的项目。我觉得如果人们回顾过去,如果我们成功了,并且人们在 50 年后回顾数学或理论计算机科学中最酷的事情,那么,合理地,这肯定会是,就像,在竞争之列。我猜很多人会认为这是这个时期最酷的事情,几年或什么的。对,因为这是许多不同领域的新方法,比如物理、数学、理论计算机科学,我不知道,因为数学博士生平均在做什么?他正在研究我甚至无法理解或发音的东西的一个子集。但数学相当深奥。但是,是的,这似乎,我不知道,即使有很小的机会成功。你不应该忘记对对齐的价值。但即使没有它,这也是一件非常酷的事情,如果它成功了,那将是一件大事。很有可能,如果我有目前的观点,并且不关心对齐,并且有职业安全来花几年时间思考它,比如五年时间里花一半的时间,那么我就会这样做。我的意思是,即使完全不关心对齐,它也是一个非常好的问题。拥有这些在理论上看起来如此诱人地接近形式化,至少对我来说,并且是一个如此自然的环境,然后却几乎无能为力,这是非常好的。理论计算机科学中没有太多真正令人兴奋的前沿。然后聪明人不必是研究生,但一个聪明人对此感兴趣。他应该怎么做?他应该尝试解决你博客上发布的一个开放性问题吗?还是应该,下一步是什么?是的,我认为第一步。有不同程度的雄心或不同的方法来处理问题。但我们有去年或十一月前发布的关于形式化独立性假设的论文,它提供了,这里是我们正在寻找的对象的沟通方式。我认为激励问题是说,这里有一个估计器的概念,以及估计器捕捉一组非正式论证的含义。一个非常自然的问题就是尝试这样做。去争取全部,尝试理解,然后希望提出不同的方法,或者从不同的角度来理解我们正在采取的方法。我认为这是一个合理的事情。我确实认为我们还有很多开放性问题,所以也许我们应该发布更多这些开放性问题。我的意思是,主要担忧是,对于任何一个问题,我们都会说,这可能毫无希望。比如,年初为开放性问题设置了一个奖项,悲剧的是,我想现在是时候发布那个问题的总结了,或者我欠这个周末的。我本应该做的,所以我明天可能会做,但没有人解决它。发布困难的问题很令人难过,或者我不知道,我们可以发布很多我们认为可能非常困难的问题。但那个统计学家著名的案例是什么,就像一个迟到的研究生,他看到黑板上的一些问题,他以为是家庭作业,然后它们实际上只是开放性问题,然后他解决了它们,因为他以为是家庭作业。是的,我的意思是,我们掌握的信息要少得多,这些问题很困难。再次,我预计我们大多数问题的解决方案并不那么复杂。而且我们已经在某种意义上工作了很长时间。整个团队的全职当量工作总计可能相当于这个领域 3 年的全职当量工作,分布在几个人身上。但这与一个问题相比非常少。很容易有一个问题,你投入了 3 年的全职当量工作。但实际上,仍然有一种方法,只需要 3 到 6 个月就能轻松奏效,如果你从新的角度来看。我们从中学习了很多,我们可能会在未来几个月分享更多。至于资金,这是这样的吗?如果有人给了你一大笔钱会有帮助吗?还是有多少人在这上面工作并不重要?所以我们现在有 4 个人全职工作,我们还在招聘更多人。那么资金有影响吗?我的意思是,资金总是好的。我们现在并不特别受资金限制。资金的主要作用是让我持续、也许是无限期地推迟筹款。周期性地,我会开始对筹款感兴趣,然后有人会说,提供一笔赠款,然后我就可以再推迟六个月或九个月的筹款,或者你可以推迟保罗需要花时间考虑筹款的时间。嗯,我认为一个有趣的问题是,你知道,我认为人们可以笼统地谈论理论研究的价值以及它如何为现实世界应用做出贡献,你可以看看历史例子,但你是一个真正在这方面做出了巨大贡献的人。比如 RLHF 是你开发的,然后它实际上已经应用到数百万人的使用中了。告诉我那个流程。你如何可靠地识别对现实世界应用至关重要的理论问题?因为阅读图灵或停机问题是一回事,但在这里你将拥有真实的东西。是的,我的意思是,能够在一个对现实世界产生影响的事情上工作确实令人兴奋。我提供的最大限制是,比如,RLHF 与许多事情相比非常简单。所以研究那个问题的原因是,看,这很可能应该如何运作,或者这是某个进程中的一步。不清楚它是否是,比如,最后一步或什么的,但这是一个非常自然的事情,人们可能应该而且很可能会做。我这么说是因为,如果你想谈论疯狂的事情,帮助加快这些步骤是很好的,而且从中学习也很好。即使对于那些在纸面上看起来非常简单的事情,也会出现很多实际问题,但大多数情况下,故事就是,是的,我认为我的世界观是,那些在纸面上看起来不错的想法,通常比它们看起来更难。但世界并不像纸面上看起来那么遥远。比如,大型语言模型在纸面上看起来非常好,RLH 在纸面上看起来也非常非常好。而这些事情,我认为,只是以一种,是的,我认为人们可能高估了,或者,也许这是一种陈词滥调,人们谈论,低估实践与理论之间的差距很容易,比如,有多少事情会出现而理论上不会出现。但高估世界的不可思议性也很容易。比如,发生的事情大多是合乎情理的。是的,我觉得大多数机器学习的实现都归结为很多细节,比如,构建一个非常简单的系统版本,理解哪里出了问题,修复出了问题的地方,扩大规模,理解哪里出了问题。我很高兴我有一些做这件事的经验,但我认为这确实使我对机器学习中什么是有意义的,什么实际上可以奏效有了更好的了解。但我认为这并没有让我获得很多深厚的专业知识或深刻的智慧来弥合差距。是的,但有没有什么技巧可以识别像 RLHF 这样真正重要的东西,而不是陷入某个无关紧要的理论问题?还是这只是巧合?或者,我的意思是,你能提前做些什么来确保它有用吗?我不知道 RLHF 的故事是否是最好的成功案例,或者什么的,因为能力,也许我会说更深刻地说,再次,这并不是一个很难的案例。我预测的事情很可能在某个时候会发生,这有点不公平。所以这主要是加速的问题,而我们现在所做的工作是专门针对一些足够疯狂的事情,以至于它可能不会发生。即使它是一个很好的想法或足够具有挑战性,它也可能不会发生。但总的来说,这借鉴了更广泛的理论经验,很多时候理论未能与实践联系起来,这很明显它不会联系起来。如果你真的思考一下,然后说,实践中的关键限制是什么?我们正在研究的理论问题是否真的与这些限制有关?是否存在理论上可能解决现实世界问题的东西?我认为绝大多数理论计算机科学对实践的影响非常小。但理论上也很清楚,它对实践的影响非常小。大多数理论未能影响实践,不是因为你没有想到的所有事情,而是因为你可以称之为“一到场就死亡”,但你也可以说,这并不是真正的重点。这就像数学家们也说,他们不是试图影响实践,他们也不说,“为什么我的数论不影响实践?”这很明显。我认为最大的事情就是真正关心这一点,然后至少了解你关心的实际系统中的基本情况以及实际重要的限制是什么。这是一个真正的理论问题吗?大多数理论之所以不这样做,只是因为那里没有容易的理论问题。所以我认为理论的动机是,我们将建立理论的大厦,有时会有机会主义。我们会找到一个接近实践的案例,或者我们会找到一些从业者已经在做的事情,并试图将其纳入我们的框架。但理论的改变主要是不是这件事会进入实践。它主要是这将为知识体系做出贡献,知识体系将缓慢增长。有时会机会性地产生重要结果。你认为种子人工智能会有多大?一个像人类一样聪明的东西的最小编码是什么?我认为这很大程度上取决于它运行的基底。所以如果你告诉我它有多少计算量,或者它有多少现实世界的基建,你就可以问最短的程序是什么,如果在一百万个连接良好的网络中的 H100 上运行,并且有一个有利的环境,它最终会走向星辰大海。但这可能在几万字节的范围内,或者我不知道,如果我必须猜测中位数,我会猜 10,000 字节。等等,是规范还是程序的压缩?一个出了问题的程序。哦,明白了。但那将是,非常狡猾。所以他们问,什么东西有价值,并且会扩展并大致保持其价值?因为那个,那个 10,000 字节的东西,将主要依靠进化和自然选择来实现,为此,我不知道,一百万字节,一百万字节,十万字节,之类的。你认为人工智能测谎仪会起作用吗?你只需要看看激活情况,而不是像你用启发式方法那样寻找解释,而是字面上说,“这就是真相的样子,这就是谎言的样子。让我们来区分一下,看看我们是否能识别出两者。”是的,我认为区分,比如仅仅训练一个分类器来做到这一点有点复杂,有几个原因,而且可能不起作用。但如果你只是把它们带到空间里,然后说,就像你想知道一个人是否在撒谎,你可以审问他们,但你也可以任意地倒带他们,并复制他们一百万次。我认为成功撒谎非常困难。你可以看到他们的大脑,即使你不完全理解发生了什么。你可以倒带他们一百万次。你可以让所有那些并行副本进行梯度下降或其他什么。我认为很有可能你可以直接分辨出一个人是否在撒谎,比如大脑模拟或人工智能或其他什么,除非他们被积极地选择。如果他们只是在努力撒谎,而不是他们经过多代人的选择,成为优秀的撒谎者,那么你的机器学习系统希望没有对它进行很多训练来撒谎。你想小心你的训练方案是否有效地做到了这一点。是的,这似乎比不成功的可能性更大。我们能够指定人类可验证的推理规则的可能性有多大,即使人工智能非常聪明,我们也无法真正理解它为什么会做某些事情。我们知道它得出这些结论的方式是有效的。比如,如果它试图说服我们,我们可以说,“我不理解所有的步骤,但我知道这是有效的,你不是在胡说八道。”这似乎非常困难,如果你想与学习到的推理竞争,这取决于你如何设置它。但对于雄心勃勃的版本,比如说它将解决对齐问题,它们似乎不太可能,大概 5% 的可能性。智力有上限吗?短期内没有,但就是超级智能。你认为它能走多远?这似乎有点取决于“智力”的含义。这就像一个问题,类似于力量是否有上限?有很多形式。我认为存在任意聪明的人机交互功能,然后如果你固定计算量,就会有最聪明的那个,如果你只是说,最好的十到四十次操作是什么?只有有限的几个。所以对于你心中最好的任何一种概念,都有一个最好的。所以我想我只是说,对于允许任意描述复杂性和计算的无界问题,可能没有,对于我意思是,如果你有一个目标,并且你只是说,什么行动最好地实现它?如果你想象一个嵌入宇宙的小盒子,我认为确实存在一种最优的输入输出行为。所以我想从这个意义上说,有一个上限,但它在物理宇宙中是无法饱和的,因为它肯定会指数级地慢,对吧?因为通信或其他东西或热量。它可能在物理上不可能制造出比这更聪明的东西。是的,我的意思是,比如,如果你想象最好的东西是什么,它几乎肯定会涉及模拟每一个可能的宇宙。它可能在模块化道德约束中,我不知道你是否想包括,所以那会非常慢。它将涉及模拟,我不知道具体有多慢,但就像双指数级非常慢。卡尔·舒尔曼在七小时的节目中阐述了他对智能爆炸的看法。我知道你们经常谈论。他有什么基本观点吗?你们之间有什么主要分歧吗?有什么核心问题是你们探索过的?这与我们关于时间线的讨论有关,是的,我认为最大的问题可能是误差范围,卡尔有一个非常软件化、非常快速的起飞画面。我认为这是可能的,但可能性不大。我认为有几种方式可以扰乱这种情况,我的猜测是其中一种适用。所以也许我有,我不知道卡尔的确切概率。我觉得卡尔对某个疯狂的事情有 60% 的机会,而我只分配了 20% 或 30% 的机会。而我认为这些扰动是,一,人工智能能力与人类能力之间的互补期有多长,这将倾向于软化起飞。二,软件进步的收益递减有多少,因此更广泛的起飞涉及扩展电力生产和硬件生产。它可能在起飞期间发生吗?我更像是 50 50 或更多这样的事情。是的。好的,所以是你认为替代约束会更困难吗?他提出的基本情况是,你可以有一系列的东西,比如闪电注意力和 MoE,你可以不断地堆叠这些东西。我非常不确定你是否可以继续堆叠它们,或者这就像是回报曲线的问题,而卡尔从历史数据中推断出来,或者他从趋势中推断出来。我更像是 50 50,关于纯软件的智能爆炸是否可能,然后是可能性稍高一些,它会比为什么慢。你认为它可能不可能吗?嗯,整个问题是,如果你将研发投入翻倍,你是否能获得足够的额外改进来进一步将效率翻倍?而这个问题本身将是你的硬件基础的函数,比如你有多少硬件。而问题是,在我们拥有的硬件量和过程开始时的复杂程度下。是这样的情况,即每一次研发的翻倍至少使人工智能研究人口的效率翻倍?而我认为我对这个问题的概率更高。我认为这很接近。如果你看看实证数据,我认为实证数据很大程度上受益于持续的硬件扩展,所以有效的研发存量比看起来要小得多,如果这有意义的话。你指的是哪些实证数据?所以有两种证据来源。一种是审视各个行业,看看每次研发投资或经验翻倍时的普遍改进,一个领域不以任何方式都相当不寻常。一个领域每次将研发投资翻倍就能获得效率翻倍是相当不错的。第二种证据来源是机器学习中的实际算法改进,这显然要稀少得多。在那里,你可以认为每次研发翻倍,计算效率大约提高了四倍。但问题是这有多大好处。当我说的研发存量效应较小时,我的意思是我们扩大规模。你每隔几年就会做一项新任务,因为你在比以前大得多的规模上运作。所以你的很多精力都花在如何利用新的规模上。所以如果你不增加你的硬件基础,或者硬件水平持平,我认为你会比历史上获得的收益递减更快。我认为卡尔原则上同意这一点。然后一旦你做了这个调整,我认为,就像,非常不清楚实证数据会如何。我认为卡尔比我更深入地思考过这些问题,所以我应该更多地听取他的意见。但无论如何,我在这方面是 50 50。在过去的 20 年里,你的时间线发生了怎样的变化?过去 20 年?是的。你从事与人工智能相关的任何事情有多久了?所以我大约在 2010 年开始思考这些事情。所以我想我最早的时间线预测是在 2011 年。我认为在 2011 年,我的大致设想是,我们不会在未来十年内拥有疯狂的人工智能。然后我变得越来越不确定。但我们收敛到每年 1% 或类似的东西。然后大概在 2016 年,我的看法是,我们不会在未来五年内拥有疯狂的人工智能,但之后我们收敛到每年 1% 或 2% 的水平。然后在 2019 年,我想我做了一轮预测,我给了到 2040 年拥有疯狂人工智能 30% 或 25% 的概率,到 2030 年大概 10% 的概率。所以我想我的 2030 年概率一直比较稳定,而我的 2040 年概率一直在上升。我猜它太粘滞了。我猜我一开始给的 40% 是因为我最近没有更新,我可能需要坐下来。我猜那应该更高。我认为,到 2030 年大概是 15%。我对这个感觉不太糟,因为每过去一年,对 2030 年来说都是一个很大的更新。我们剩下的时间不多了,这大致与人工智能发展顺利相抵消。而对于 2040 年的事情,过去的一年并没有那么重要。而且随着我们看到事情基本上顺利进行,这就像消除了到 2040 年没有人工智能的概率。我的 2030 年概率略有上升,比如,可能是我以前的两倍左右。我的 2040 年概率则显著上升。你认为我们可以多快地建造晶圆厂来跟上人工智能的需求?是的,我对任何相关领域都不太了解。我的最佳猜测是,我的理解是,现在,比如 5% 的下一年的总产量或最佳工艺。晶圆厂将制造人工智能硬件,其中只有一小部分将用于非常大的训练运行。比如只有几个。所以也许占总产出的几个百分点,然后这代表了总可能产出的 1% 左右。总产出的 1% 的领先工艺的几个百分点或什么的。我不知道这是否正确,但我认为这是我们的大致范围。我认为事情会很快。你将从那里扩展到下一个数量级或两个数量级,因为你基本上只是在转移其他东西。我的感觉是会有几年的延迟。有几个原因,你期望几年后会延迟,也许甚至在那时你会开始有。是的,有很多问题。比如建造新的晶圆厂非常缓慢,而且我认为 TSMC 并没有计划由人工智能驱动的总需求增加。比如明显没有计划。我认为其他人也没有真正提高产量来预期,然后同样,建造如此规模的数据中心似乎非常非常困难,而且也可能有几年的延迟。你的投资组合看起来怎么样?我试图摆脱大多数可能与政策工作或 RSP 上有关的 CEG 倡导相关的人工智能相关的东西,因为我参与了 Anthropic。如果你没有利益冲突和内部信息,它会是什么样子?我仍然有很多硬件投资,我需要考虑,但我不知道很多 TSMC。我有一部分 Nvidia,尽管我从 2016 年左右开始就一直在不断地与 Nvidia 对赌。我在这场赌博中输得很惨。尽管 AMD 也做得不错。现在的情况甚至更容易,但它与过去的情况相似,只是一个非常昂贵的公司。考虑到他们所做的总研发投入,他们拥有,无论如何,一万亿美元的估值或类似的东西,非常高。所以问题是,制造一个 TPU 有多昂贵?所以它实际上可以与 H 100 或类似的东西竞争。而我就会想,哇,如果谷歌不能足够快地赶上,以至于那个一万亿美元的估值不合理,那真是高水平的无能。而对于 TSMC,他们有一个更难的远程,你认为呢?是的,我认为这要困难得多,尤其是在你试图扩大规模的这个阶段。所以如果你无法建造晶圆厂,我认为需要很长时间才能建造出人们想要的那么多晶圆厂,其影响将是提高现有晶圆厂和现有半导体制造设备的價格。所以这些硬资产将变得非常宝贵,现有的 GPU 和实际的,是的,我认为这只是困难的。这似乎是最难快速扩展的资产。所以它就像资产,如果你有一个快速的上涨,它就是你期望从中受益最多的资产。而 Nvidia 的东西最终将被人类制造的更好产品或人工智能辅助制造的产品所取代。比如差距会进一步缩小,因为你正在构建人工智能系统。除非 Nvidia 正在使用这些系统。是的,重点是任何人都会远远超过过去的研发,而且没有多少粘性。未来粘性比过去要小。我不知道。所以我不希望评论任何私人信息,只是凭我的直觉,在有免责声明的情况下,这是我最不看好的投资,不包括 Nvidia。最后一个问题,有很多关于对齐的方案,我认为就像很多一般的看法,很多东西都超出了我的理解范围,我真的花了几个星期才理解你工作的机制异常的东西,而没有花几周的时间。你如何检测胡说八道?人们向我解释了他们的方案,我当时想,老实说,我不知道它是否有意义。我只是觉得我足够信任保罗,如果我努力理解它,那里可能有些东西。但你如何检测胡说八道?是的,所以我认为这取决于工作类型。所以对于我们正在做的事情,我的猜测是,大多数人根本没有办法告诉你它是否是胡说八道。所以我认为重要的是我们不要花那么多钱在我们想雇佣的人身上,他们可能会深入研究。我认为没有办法告诉你它是否是胡说八道,除非花费大量精力或依赖于实证工作。在实证方面很有趣,因为你确实有一些工作质量的信号。你可以说,它在实践中起作用吗?故事呢?我认为故事更加简单,所以你可能可以当面评估这些故事。然后你主要会遇到这些问题,比如,关键的困难是什么?是的,我倾向于乐观,当人们驳斥某事,因为它没有处理关键的困难,或者它遇到了以下无法克服的障碍。我倾向于对这些论证持更怀疑的态度,并倾向于认为,是的,有些东西可能是胡说八道,因为它没有解决一个真正的问题,我认为这是最简单的方法,这是一个人们感兴趣的问题,但实际上并不重要,而且没有关于它将如何变得重要的问题。例如,它现在不是一个问题,也不会变得更糟,或者它现在可能是一个问题,但它显然在改善。这就像一种方式,然后基于通过这个障碍,比如处理一个真正参与了令人担忧的关键部分,并且实际上在实证上是有意义的。所以我认为大多数工作都由反馈来源锚定,比如实际与真实模型互动。所以,比如,它与真实模型互动的方式有意义吗?以及关于它如何处理关键困难的故事是否真的有意义?我对那里相当宽容。我认为这真的很难,比如,人们看机制可解释性,然后说,嗯,这显然不可能成功。而我却说,我不知道。你怎么知道?它显然不能成功。我认为根据对该领域的总投资来判断是合理的。它进展有多快?它如何计算?我认为大多数人研究的东西,实际上计算起来相当不错。它们看起来可能是有道理的投资。事情并没有,比如,非常失衡。好的,太好了。我认为这是一个很好的结束点。保罗,非常感谢你的时间。是的,谢谢你邀请我。很高兴聊天。是的,绝对。