📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Can AI Do Our Alignment Homework? (with Ryan Kidd)

Future of Life Institute1:46:33

Transcription

欢迎收听生命未来研究所播客。本集节目是认知革命播客的交叉发布,由内森·林斯采访瑞安·基特。瑞安是Matts的联合执行董事,Matts是全球最大的人工智能安全研究人才输送渠道之一。请欣赏。

>> 瑞安·基德,Matts的联合执行董事。欢迎来到认知革命。>> 非常感谢。我很高兴来到这里。我为这次对话感到兴奋。所以,我曾多次提到我个人是Matts的捐助者。嗯,我想这实际上是我们第一次见面和交谈,但你的声誉确实早有耳闻,我看到这个项目产出了很多出色的工作,也收到了很多好评,而且在我,你知道,作为生存与繁荣基金推荐小组的一部分研究中。收到了很多关于Matts作为人工智能安全研究领域人才输送渠道重要性的精彩评论。所以我是你们工作的一个远距离的大力支持者,我也很感谢你们最近作为播客赞助商的加入。这次对话技术上不属于那笔交易的一部分,但你知道我们正处于这种OpenAI式的资金循环流动之中,我们某种程度上都在提升彼此的收入,但 >> 我喜欢认为我们不是花钱上播客的。[笑声] >> 是的。不,这种热情绝对是真的,因为我一直以来听到了很多很棒的事情。所以很高兴能深入探讨。

我想我们也许可以从你的角度,从大局开始。我想,看过你之前的一些演讲,我知道你采取的是一种投资组合策略,你不是那种,你知道,我有一个非常具体的狭窄预测,然后我试图,你知道,为了那个非常超具体的预测,最大化这个组织或这个项目的价值。看起来你更像是说,嗯,这个领域存在很多不确定性,我们将尽我们所能,在各种情景中都发挥价值。话虽如此,你知道,你可以代表你自己,也可以代表导师或整个社区发言。比如你们现在处于什么位置?就时间线而言,我们处于什么阶段?随着我们获得了更多关于我们相对于奇点位置的信息,你们的策略在过去一年左右是如何演变的?

>> 是的。好的。所以,我不喜欢在这里发表意见,或者说不喜欢大声发表意见。我认为原因在于,正如你所说,我们有点像对冲基金之类的,或者更可能是一个指数基金,对吧?也就是说,我们有一个广泛的投资组合。我们认为许多不同的变革理论都是有效的,我们试图,你知道,在许多领域都插上一手。所以我会说,就Matts的机构观点而言,我们肯定倾向于采纳像Metaculus和预测市场,以及预测研究机构FRRI的预测等等。所以Metaculus目前对强人工智能的预测,我想是这样称呼的,我认为你可以忽略测试的大部分要求,只看其中一个,那就是2小时对抗性图灵测试,有人预测大约在2033年中期。好的。所以我认为这可能是我们预测这种性质的通用人工智能何时出现的最佳依据。现在我们最近,也许是两天前或三天前,发布了这个新的AI未来项目,发布了这份新报告,其中有两名Matts研究员,一名是主要作者,一名是贡献作者。所以对此非常兴奋,那只是更新了他们的模型,我想他们预测的日期在2031年或2030年到2032年之间,这取决于你如何定义通用人工智能。他们将其细分为所有这些自动化编码器,比如它们可以完成所有的编码工作。他们,你知道,这些在所有这些领域都占据主导地位的顶级专家级人工智能等等。所以我想,我不知道,大约2033年似乎是一个不错的赌注。但我们也有,你知道,内森·杨最近汇编了所有这些不同的预测平台。一个Metaculus流形,另一个Metaculus投票,是针对弱人工智能的。它在图灵测试和其他所有方面都稍微差一些,比如我不知道OpenAI是否会实现它的一些模糊的东西,他得出的平均值是2030年。现在我不知道,我仍然喜欢Metaculus的2033年预测,但就通用人工智能的接近程度而言,我不会反对2030年。至于超级智能,那就复杂了,对吧?可能会在通用人工智能出现后6个月或更短时间内,也可能是一个非常艰难的起飞。嗯,如果它是一个纯软件的奇点情景,你不需要大量的硬件扩展,你不会受计算能力的限制。它只是递归的自我改进或某种算法改进。人工智能正在改进算法和训练眼睛,这就像,哇,这是一个快速反馈循环,对吧?或者你可能需要更多的实验,对吧?嗯,你可能需要大规模的硬件扩展。嗯,你可能需要比世界上现有计算能力惊人地更多的计算能力,在这种情况下,可能需要十年才能达到你的奇点。所以我目前认为2033年是一个不错的中心估计,就我们正在准备的中位数而言。但显然,到2028年有20%的可能性。我认为那是Metaculus的预测。那很多,对吧?所以,我们肯定应该考虑更早出现的情景,对吧?特别是,我认为通用人工智能越早出现,就越危险,对吧?我们进行关键技术研究准备的时间越少,实施政策解决方案的时间就越少。而且我不知道,比如如果它发生在美国政府的过渡时期,可能会更加疯狂。所以我会说,中位数押注在2033年左右,但要非常关注人工智能的影响,比如将你的担忧提前到2033年之前的情景,而且我认为Matts的导师们,我不知道我们没有调查过他们,但我想如果我们对他们进行调查,我们会得到类似的结果。

是的,我总是说我宁愿为更短的时间线做准备,然后多一点额外的时间,而且我相信我们会找到方法,你知道,我们仍然需要它,但在我看来,针对那种,你知道,第一四分位数可能的结果范围进行准备是明智的。在项目或社区中还有空间吗?比如如果我出现,我是一个2063年派的人,我是否会孤立无援,你知道,现在是否有任何脑机接口或某种深度总体化的工作流正在进行,显然可解释性有不同的风格,对吧,但随着最近转向更实用的可解释性,我想知道是否还有空间留给那种,你知道,我们真的想理解一切的可解释性,或者这是否普遍被理解为,嗯,现在推动它可能需要太长时间,我们无法真正为此感到兴奋。

>> 是的,这是个好问题。我实际上认为这方面有很大的空间,原因如下。人工智能安全社区似乎整体上正在追求的主流元策略,我们谈论的是资金、部署的人员和资源数量,不一定是撰写了多少不那么有力的帖子之类的,而是部署的资源,是这种人工智能控制策略,基本上就是你构建,嗯,也许更好地称之为对齐MVP,这是Yan Leaky创造的一个术语,他是OpenAI超级对齐的前负责人,现在是Anthropic对齐科学的联合负责人,对齐MVP是一个人工智能系统,它是加速对齐研究相对于能力研究的最小可行产品,从而使我们获得正确的结果。所以基本上你是让AI来做你的功课。对此有很多争论。嗯,有一个非常强大的阵营认为这根本行不通,因为一旦一个AI系统强大到足以有用,它就危险了,对吧?我想你知道,四元代码表明至少在软件工程方面并非如此,但对于那些认为对齐AI系统需要严肃研究品味的人来说,他们可能会说这个四元代码远未达到那个水平,通用AI系统远未达到那种研究品味的能力。现在你提到的所有那些只在2063年情景中才会有回报的事情,大概只在那段时间内有回报,不一定是因为,我不知道,人类挑战试验之类的,也许如果你对,我不知道,通过基因工程使人类更智能,或者一些正在讨论的疯狂事情感兴趣,那可能会有所不同。但如果你主要感兴趣的是,哦,这东西将需要几十年的技术工作,也许你可以将这些几十年压缩成一个非常短的人工智能劳动期,对吧?如果你能让它们运行得更快,大规模并行化事物,并且,你知道,总的来说,只是让它们做你的功课,那些2063年的人工智能对齐计划可能会在更短的时间内自动化。所以我们绝对应该追求这些,因为我们越是提高对这些不同情景的理解水平,就越容易将其交给人工智能辅助,或者通过人工智能输入来加速。我确实觉得你提到脑机接口研究很有趣,因为我记得有一次在一个会议上,有人谈到,好的,我们解决对齐问题的方法是,我们将解决人类上传问题,然后我们将把某人放入计算机,让他们完成100个模拟研究员的100个模拟研究员年之类的,然后你可能会觉得这听起来非常科幻,非常像万神殿,但后来LASI举手说,我自愿成为二号,这很合理,对吧,你不想成为第一个可能出错的人,但是的,人们正在认真追求这个,而且我认为这很有趣。我大约一年前和一些脑机接口专家谈过,他们说我们不可能及时获得脑机接口以应对通用人工智能。抱歉,不是脑机接口,抱歉。你不可能及时实现人类上传以应对通用人工智能,除非你实际上已经拥有通用人工智能,对吧?所需的时间将需要大量的认知劳动以及人体试验之类的东西。而且我不知道,这听起来确实非常科幻,所以我认为我们不应该依赖这样的东西。尽管我完全支持人们在业余时间追求“登月计划”。这也是Matts的一部分,对吧?我们有这个庞大的投资组合,其中包含一些“登月计划”。

>> 好的。所以,我想从那里引出很多不同的方向。嗯,我只是想确保我一直在记录,>> 但你知道,也许一个有趣的第一个问题是,你认为我们在人工智能安全方面整体表现如何,也许是相对于你的预期而言?

我的意思是,你提到了像LessWrong,而且,我不知道Matts的所有背景故事,但我确实明白,很多长期参与其中的人都是从埃利泽的讨论中走出来的,他们有一套特定的假设,比如我们无法将我们的价值观教给这个东西。那将是,你知道,从一开始就极其难以驾驭的。而现在我们有了Claude,就像,天哪,你知道,它比我原以为的在此时此刻走得远得多。我总的来说有点惊讶,人们的“末日概率”几乎没有变化。那些末日概率很高的人似乎仍然很高。那些从未担心过的人仍然不那么担心。有时候我感觉自己像在吃“疯药”,我心想,我不知道。我看到这些欺骗行为。它们有点吓到我了。令人惊奇的是,即使在没有任何实际系统可供使用的情况下,安全理论家们也能如此准确地预见到这一点。但与此同时,你知道,对我来说,说Claude在许多方面,与普通人相比,其道德水平可能高于平均水平,这并不疯狂。你知道,我不知道这样说是否有争议,但Claude,你知道,在这方面它非常,相当出色。你对我们现在所处的位置有何看法?你和我一样困惑吗,还是你对我们整体表现如何有更明确的看法?

>> 老实说,内森,我相当困惑。呃 [笑声] 就像我确实认为,你知道,与预期相反,我们看起来像是语言模型理解我们的价值观,对吧?这是第一件需要更新的事情,比如它们在某种关键意义上理解它们。它不仅仅是像讽刺鹦鹉一样反刍。语言模型非常擅长理解人类的道德习俗,并在某些情景中对其进行推断。它们也非常擅长奉承。它们在欺骗方面越来越好,是复杂的欺骗。在适当的情况下,它们确实倾向于欺骗用户。嗯,尽管对此似乎有一些争议,而且看起来有些欺骗在大多数情况下远非我们可能称之为结果主义的,比如硬核结果主义的欺骗,但我认为像“对齐伪装”和其他一些论文已经表明,你知道,你可以创造一些情境,让AI欺骗用户以实现某种隐秘目标,而这个目标是故意作为目标赋予AI的。所以这是这些小情景的限制之一。我不认为有任何人工智能连贯地欺骗用户,追求这种连贯目标的例子,对吧?不仅仅是我们可能称之为古德哈特式欺骗,即它们仅仅因为训练数据的限制而陷入欺骗倾向。现在我谈论的是这种连贯的欺骗。这种通过训练过程似乎自发产生的持续连贯欺骗,如果有的话,也只有少数几个案例。考虑到我们目前的能力水平,这已经相当不错了。比如,5或10年前,人们肯定不认为我们会拥有能够辅助前沿科学、安全部署的人工智能,人们会说我们绝不会把它放到互联网上。谁会那么做?那太疯狂了。而现在它们在互联网上,值得注意的是,世界还没有毁灭。这并不是说它会一直如此。你知道,当然,你不想对超级智能做的一件事就是让它脱离控制。嗯,但是的,我们似乎处于比许多人想象的更好的情景中。当然,我们现在可能正处于暴风雨前的平静,对吧?嗯,很可能存在他们所说的“急剧左转”,或者说人工智能内部处理信息的方式发生根本性变化,并可能获得这些连贯的长期目标。我可以指出,比如Matts导师亚历克斯·特纳的“碎片理论”概念,作为这可能如何发生的一个例子,对吧?所以,就像人工智能系统不再是这种,你知道,包含一个在训练下连贯形成的单一中层优化器,对吧?如果你记得旧的埃文·胡宾小组范式,你的外部优化器循环,即训练你的人工智能系统,会导致它发展出一种内部的优化器架构,然后它可以拥有与训练目标大相径庭的自身目标。然后,就像每当你,嗯,而且大概有一些计数论证,比如有任意多种方式让这个错误优化器形成以产生正确的输出,因为这个东西很聪明,如果它的主要目标是生产回形针或其他东西,那么它就会意识到它正在训练过程中,并且无论它的目标是什么,它都会给你想要的输出。我们仍然可能面临那种情况,但目前看来,我们不喜欢人工智能系统真的很混乱。它们很笨拙,对吧?就像人脑一样。它们有一些大量情境激活的启发式方法,对吧?它看到那里有一个括号,然后它会想,哦,也许我会在那里再放一个括号。你知道,这是一个非常简单的愚蠢马戏团。但有时,对吧,它做的事情,比如上下文学习,看起来很像,嗯,就像模型从输入数据流中学习并学习一些新的复杂事物时,它实际上是在进行梯度下降的模式匹配。看起来很像它们在优化输入令牌,或者更确切地说,在优化以产生一些输出。所以我们可能会进入一个世界,人工智能系统确实会自发地获得这些错误优化器,而这些东西,你知道,它们是严重的担忧来源,因为它们,你知道,非常强大地试图优化某个目标,而且,嗯,这就是,你知道,我主要担心的是,我们有这种欺骗模型,这种内部对齐失败,也许人工智能系统会自发地获得目标,或者也许是因为它们被故意训练成寻求权力并在互联网上赚钱,然后它们决定隐藏起来,而我们没有足够好的可解释性工具来检测它们。所以我想,我并没有真正改变我对这种情景最终发生的恐惧,但我变得更有信心,我们可以在看到明显迹象之前,从人工智能系统中引出有用的工作。我会说,我相当自信,人工智能系统目前没有在执行非常强大的针对此的阴谋,因为我认为我们会看到某种警告信号,比如我不认为它会像白天和黑夜一样截然不同,你知道,我认为我们会看到某种情况,人工智能系统会以非常愚蠢的方式试图策划,然后才会以非常熟练、困难的方式策划。这有道理吗?

>> 是的,我认为这是一个很好的总结。我的意思是,评估意识对我来说绝对是一个突出点,它让一切变得更加怪异,也更难对任何事情感到自信。我不太确定你刚才概述的欺骗路径该如何理解。我的意思是,在某些方面,我们就像我常说的,处于一个“甜蜜点”,它们变得足够聪明,可以帮助科学研究,但又不足以熟练使用网络浏览器出去,你知道,在自我维持或造成任何破坏方面走得太远。而在欺骗方面,我心想,是的,它似乎是逐渐上升的,这似乎是物理学对我们友好的一个例子。看起来我们没有看到“急剧左转”。看起来我们正在看到这些原始行为,你知道,至少能给我们一些东西来研究,如果什么都没有的话。但我不太确定人们如何对“也许它们只是还不擅长”这个想法充满信心,你知道,就像你说的我们会看到警告信号,那这些不是警告信号吗?这是我仍然有点困惑的一点。在某些情况下,人们似乎很快就说,嗯,你知道,那是一个结构化的评估,而且它有点,你知道,被引导进去的,它真的只是想,是的,它拒绝被关闭或者采取措施避免被关闭。但那只是因为它想完成它的任务,而不是因为它有一个,你知道,接管世界的,嗯,目标。我有点像,嗯,好吧,尽管如此,它确实,嗯,抵抗了被关闭。比如,在什么情况下我应该开始认为那是一个警告信号?我不确定对此是否有答案。我不确定那里是否真的有一个问题,或者你是否有办法回答它,但我猜基本上这只是我自己的困惑的另一个层面。我的意思是,人们似乎常常只是被对相同事实模式的极其不同的直觉所引导。我不太确定该如何看待这一点,但当人们,特别是关于欺骗的那个,不是你刚才在做这个,但我听过很多不同的,你知道,人们会说,嗯,你知道,我们不必太担心那个。我心想,我不知道。我真的很想知道那一点在某个时候能得到解决。你知道,当然,如果我要去,我常说的一句话是,如果我要成为一支军队的一部分,与我的人工智能系统一起投入战斗,我真的会想知道,你知道,欺骗操作员的问题是否已经很好地、完全地解决了。而且我不知道,我们似乎对此有点随意。

>> 即使在Anthropic,对吧?就像他们,你知道,当然在这方面做了一些最好的工作,但他们对我来说仍然显得异常冷静。我不,这很奇怪。我的意思是,我认为人们不应该因为许多原因与人工智能系统作战。比如,我认为,我认为那是一个相当糟糕的社会习俗,你知道,去设定允许那种事情发生。但那是另一回事。我猜,肯定人工智能系统。我不会对当前或未来的通用人工智能系统有信心,它们不会出现分布外故障,更不用说在关键情景中,更不用说像欺骗这样可怕的事情,你知道,在真正重要的时候,我认为那是一个大问题,我们应该追踪两件事,对吧,比如,一是人工智能能力,那么人工智能是否具有情境意识,它们是否具备必要的先决条件,甚至能够理解它们是这个人工智能?看起来它们确实如此,对吧?它们甚至知道自己的训练日期。它们知道一些细节。它们可以从其他人工智能的文本中检测出自己的文本。所以人工智能正在变得越来越有情境意识,这,你知道,是真正危险欺骗的必要先决条件之一。它们是否有能力自行越狱,对吧,去偷钱?就像我们最近发表的Matts论文引起了轰动一样。嗯,那是与Anthropic的AI红队合作的,他们发现,哦,人工智能系统,让我们把它放在一个模拟环境中,里面有一堆真实的智能合约,它能找到价值460万美元的漏洞。嗯,那是一大笔钱。那足以让你建立自己的服务器,你知道,运行相当长一段时间。而且那是一个相对较短的项目。嗯,而且它看起来,它也相当程度上脱离了人类的干预,但并非完全如此。所以,所以看起来我们正在获得越来越危险的能力,比如越狱、获取金钱、获取影响力,所有这些东西。然后我认为我们应该非常密切地追踪所有这些。而且我认为我们目前还没有达到红线,但我们正在接近它们,我会说。另外,我认为我们应该追踪,正如你所说,这种模型生物体的工作,我们试图从人工智能系统中引出危险行为。嗯,你可以把它想象成,就像你的孩子,对吧?你放了一些饼干,然后你说,“不要看,不要吃饼干。”然后你转过身去,但你却在偷偷地看,如果他们吃了饼干,我就抓到你了。你知道,这就是我们正在做的事情。问题是人工智能系统真的能检测出它们是在训练环境还是真实环境中。但如果你回想一下AI 2027情景以及围绕它的很多讨论,人们谈论的是在线学习,就像我们训练OpenRouter训练了最后一个大型AI代理,然后从那时起它就通过某种强化学习范式不断地在线学习。如果人工智能系统永久在线,那么它们就总是在部署中,你就必须有监控器和控制协议,对吧?所以这就是为什么控制研究如此重要,特别是对于早期阶段,以捕捉一些这些失误,对吧?所以你可以在实验室里做所有你想要的模型生物体工作,那就像一层防御,看看我们是否具备这些能力,或者这些欺骗的倾向是否出现。另外,你需要进行各种控制评估,在它们部署时研究它们,特别是如果它们将在线学习并可能更新它们的行为,并且要不断检查这些东西并做好准备。制定一个备用计划,一个快速响应计划。如果你真的看到了严重的警告信号,你打算怎么做?你会关闭模型吗?你的股价会暴跌。你怎么办?你会恢复到更安全的旧系统吗?可能吧。所以,我想是的,我们绝对应该追踪这些东西。我不会说我们已经完全脱离危险。我会说,根据我的估计,我们所处的世界比波士顿拉姆和默里在十多年前预测的要好。但我不知道,他们会说我对此大错特错。但我不知道。我认为,我认为我们能从这些东西中获得一些看起来确实很可能加速人工智能安全工作的成果,这是很有用的。

>> 是的。所以这引出了我认为人工智能安全研究的另一个巨大问题,而且可能是最强烈的,我不知道你是否会说它对你来说最具说服力,但它无疑是人工智能安全研究受到的最鹰派或最激烈的批评,那就是它总是最终成为双重用途,并且它总是以某种方式加速核心能力的发展,你知道,有些人会说,你知道,完全远离这个领域,你知道,专注于社会羞耻或其他什么。我确实相信我们可以做得更好。我认为我们可能必须做得更好。但我想知道你是怎么看待这个问题的,对吧。我的意思是,像RLHF这样的典型技术,它本来是一种安全技术,但实际上更多地成为了一个效用驱动因素,我会说。我的意思是,我想他们都对。它是双重用途的,但当然,当谈到加速这个领域,你知道,让事物变得有用,唤醒世界,就像让各种各样的人涌入,所有的一切都一下子呈指数级增长,你知道,你至少可以部分地追溯到,你知道,从真正的原始下一个令牌预测器到实际的指令遵循者的转变,而且我们今天可能有很多这样的事情正在发生,其中最让我突出的一点是你曾多次暗示过的,那就是让AI来做对齐工作。你知道,那听起来非常接近,而且令人不安地接近递归自我改进,这是我非常害怕的事情。你知道,我确实认为,再次强调,Claude看起来相当道德。你知道,GPTs也不算太糟,但天哪,你知道,我们真的准备好让他们来做我们的对齐功课了吗?那么,当你优先考虑不同类型的研究时,比如你想投资哪里,你想引进什么样的导师,你想通过项目培养什么样的才能,你是如何思考这些问题的呢?你如何,我的意思是,那似乎是一个巨大的问题,一个非常困难的问题。你是怎么考虑的?

这是一个很好的问题,我首先要说的是,从根本上讲,所有的安全工作都是能力工作,就像人们喜欢区分这些东西,比如,哦,能力工作是关于引擎的,它是关于让飞机飞得更快,而安全工作是关于方向性的。但正如你所指出的,RLHF,它本意是作为安全工作来帮助方向性,引导它去你想要的地方,也让人们意识到,哦等等,这东西很有用。我现在可以跳上这架飞机了,因为它会降落在我想要的地方,这让他们想让引擎跑得更快,这样他们就能更快到达那里,对吧?整个反馈循环就开始了。所以我实际上不知道你是否能避免这种情况。这就像我能想象到的唯一进行安全研究的方式。在你部署它的最终关键时刻之前,对能力没有影响。嗯,就像躲在某个实验室里,与你完全信任的人一起,在疯狂的保密协议下,并且只有,你知道,拥有惊人的资源,无论需要什么,因为Matts和理论方法可能不足以提高安全性。至少在过去10到20年里,这似乎是教训。我不知道我可能错了,但理论和实证研究之间的相互作用对于大多数这类学科来说似乎非常重要。所以你必须拥有惊人的资源,一个绝对忠诚的秘密团队,所有这些保密协议,没有人会泄露你的研究,嗯,然后你,你知道,以某种方式秘密构建系统,然后,好的,然后你部署它,然后也许你开源你的对齐技术,没有人拥有它,或者以某种方式禁用所有不良行为者之类的。这看起来只是一个非常困难的前景。

>> 听起来像是安全超级智能的缩影。

那基本上就是他们似乎拥有的设置。>> 极度保密,无限资源。他们确实有一个显著的叛逃者,但除此之外,你知道,一个团队抵制了,嗯 [哼声] 丰厚的收购要约。

>> 没人知道。

我不是在试图捍卫这样的研究,也不是在捍卫,你知道,增强能力的安全研究本身。我只是说,很难想象一种情况,因为我认为你最终确实必须构建通用人工智能,我知道我这样说可能会疏远很多观看节目的观众,但我认为从务实的角度来看,你不得不这样做,因为推动这一点的市场力量非常强大。现在我们有一些选择,对吧,我们可以构建直接来源的综合人工智能服务,这样你就永远不必拥有一个中心化的代理,你拥有分布式机制,对吧,嗯,你构建科学家人工智能,或者非常狭窄的人工智能系统来服务一系列经济事物,问题是,我认为它们都会被一个代理型人工智能所超越,就像,你知道,你堆叠一个充满代理的人工智能公司,它们都像在股市上一样,制造产品,你知道,等等,只是赚更多的钱,只是击败你那些糟糕的狭窄人工智能解决方案。所以,所以问题是,它不仅仅是关于制造对齐的人工智能。它是关于制造性能足够有竞争力,能够在市场上占据主导地位的人工智能。唯一的替代方案是采取某种严厉的,比如“全部关闭”之类的措施,但我对此能否奏效非常怀疑。我没有看到任何这样的事情发生的例子。我们最接近的例子是阻止人类克隆,但这并不是一个有利可图的赌注,不像通用人工智能那样,我声称。所以就是这样,是的。而且,就像人类克隆一样,它在某种程度上违反了这种深层的社会道德,我认为今天很少有人认为强大的人工智能系统会违反这种道德。我认为他们错了。我认为构建第二个物种实际上会,嗯,以与人类克隆相同的方式违反一些深层的社会道德。但我认为人们不会那样看待它。所以这就留给我们一个事实,我们实际上必须构建通用人工智能,但如果我们能构建更安全的产品,对吧,或者可能在某种严格的监管控制之下,我们有一些,比如理想情况下,我知道10年的国际缓慢分阶段进入新的通用人工智能世界,对吧?在那里,所有这些,你知道,国家和公司都被迫非常小心,并且以协作的方式对齐他们的模型,那么我们将处于一个更好的世界。那是我所希望的世界。好的。现在,至于人工智能安全研究是否不必要地增强了能力,有些可能是RLHF,我想我持观望态度,五五开。肯定在某个时候,RLHF的想法已经酝酿成熟,就像,嗯,如果保罗·克里斯蒂亚诺和达里等人没有做那件事,它似乎也不会持续太久。我想其他人也会做。这并不是说你不应该尝试加速能力的前沿。从净效果来看,这似乎很糟糕,但RLHF无疑为构建对齐MVP打开了大门,这在某种程度上也是克里斯蒂亚诺的元策略。我不知道。很难说。我想进行反事实模拟,看看如果没有RLHF,或者早一年或早两年,世界会变成什么样。那会很有趣。嗯,它确实启动了,我认为,嗯,你知道的ChatGPT革命,以及,你知道,人工智能系统的产品化,但考虑到当时人工智能安全领域的规模有多小,很难看出。人工智能安全领域我认为是从人工智能曝光度的增加中成长起来的,对吧?所以,如果ChatGPT时刻没有发生,那么人工智能安全研究就会在一年或两年后发生一些额外的研究,但如果我坦白说,我认为那将是微不足道的,我不认为这个领域足够大。现在你可以说,好吧,如果你也尝试将资源投入到秘密的人工智能安全项目中,同时延迟RLHF,延迟ChatGPT,通过网络建立人工智能安全领域,Myri的暑期学校没有做很多事情,而Matts在ChatGPT时刻之前,即2021年12月就出现了。是的,我认为Matts的第一批学员比后来的学员稍微缺乏方向性。肯定,我认为安全研究在有了ChatGPT之后才真正启动。嗯,不是说那是唯一的原因,但当时有很多事情发生。而且我认为,更大、更强大的模型无疑使得某些类型的基本安全研究成为可能,而这些研究是小型模型无法完成的。我们谈论的是对那些实际嵌入了连贯概念的模型进行可解释性研究。但我要说,GPT2小型模型上可能还有很多工作要做,但线性探针之类的东西在高级别上可以针对我们的一些前沿模型。你知道,昆仑,这些中国模型在这方面特别好。嗯,某些类型的辩论,比如我们直到模型足够好进行辩论后才有了第一篇有趣的实证辩论论文,还有许多许多其他这样的例子,比如所有的控制文献,我认为根本不可能发生,抱歉如果说得太多了,不,这很棒,是的,我本来还想问一个问题,听起来你至少在某种程度上相信它,但,你知道,回到Anthropic的创始神话,我认为其中一个概念,即使在相当鹰派的人工智能安全人士中,也被视为建立像Anthropic这样的公司的正当理由,那就是,如果你想做这种安全研究,你必须拥有前沿模型来做,否则你就会天生落后,然后,你知道,那有什么用呢,对吧,研究上一代模型有什么用呢?所以显然,从GPT2到现在,我们已经经历了相当多的代际,当然,我们对GPT2还有很多不了解的地方。但我也想说,有很多在GPT2中没有观察到的新兴行为,它们绝对值得关注,包括,你知道,今天最让我毛骨悚然的许多欺骗和评估意识方面的事情。

你现在对此有何看法?比如我想知道,如果有人说,天哪,我应该去一家前沿公司吗?因为那里有最好的模型,而且,你知道,这本身就意味着那里会完成最具影响力的工作,或者,你知道,我可以独立工作,或者在其他一些组织工作,我可能会局限于,你知道,一个较小的Quinn模型之类的,但也许这就足够了,你知道,也许在那些,你知道,那些二线模型中,当我们进入2026年时,你知道,你真的不需要使用最新的模型。再次强调,我想我可能大部分只是对此感到困惑或不确定,但你有什么看法吗?我的意思是,是的,对于大量的可解释性研究,人们并没有使用前沿模型,你无法访问它们,你知道,我的意思是,当然实验室里的人可以,但在Matts,有大量非常优秀的论文不断产出,而且来自许多其他来源,对吧,像Altherai、Fari等等,他们正在对次前沿模型进行世界级的可解释性研究,因为今天的次前沿模型,今天的Quen或者DeepSeek或者Llama或者其他什么,嗯,它就像昨天的前沿模型,你知道,在能力方面,我们已经到了这些模型都高于水准线的地步,你知道,可以进行非常出色的研究,所以从可解释性的角度来看,我认为你不需要过多地推动前沿,如果从其他类型的研究议程的角度来看,比如,嗯,从弱到强的泛化以及其他类型的人工智能控制和熟练监督等方面。你有点,我认为你确实需要更多的数据点。我不是说我们已经用尽了当前模型所能做的一切。远非如此。但我认为,你需要更多的数据点来建立,嗯,你知道,一致性,并看到一些令人担忧的行为出现,即你的弱模型在所有情况下都无法真正监督你的强模型,顺便说一下,这基于这样一个想法,即验证比生成更容易,P对NP等等,特别是如果你能看到别人的想法而他们看不到你的。所以我认为我们,我们从那个角度来看,处于前沿确实有道理。但我要说的是,我认为这些公司这样做主要原因,嗯,显然是为了赚钱。然后,你知道,嗯,嗯,在卡尔的那个领域,就像从安全角度来看,如果你试图,嗯,嗯,实际上为处于前沿提出一个强有力的理由,那就会是这样:我们的模型在性能上具有竞争力,而且它们足够接近前沿,就像快速追随者模型一样,你使用我们的模型而不是竞争对手的模型会牺牲一些性能,但它们更安全,而目前没有人愿意使用比前沿模型更差的东西。你为什么要这样做?那是最好的模型。但是,如果一个模型,比如,我不知道,有10%的可能性会,你知道,告诉你跳桥之类的,或者,实际上,有10%的可能性会入侵你的银行账户并偷走你所有的钱,更不用说,我不知道,制造一个,你知道,你知道,逃脱并制造生物武器,嗯,你会,我,我愿意相信人们会使用那个不太好的模型,而且我愿意相信监管机构和保险公司可以充分惩罚那些前沿公司,迫使它们遵守规定,因为那样你就有存在的证据了,哦,我的产品我确实在努力,对吧?我付出了努力。我努力让我的产品不做那些最好的模型开发者正在做的令人发指的事情。你知道,那样每个人都没有借口,他们必须这样做,对吧?政府可以强迫他们等等。所以,我认为,你知道,让你的模型性能足够有竞争力,以至于人们,你知道,人们愿意支付所谓的“对齐税”,从这个角度来看,这似乎是一个可行的策略。当然,所有这些都不是为了证明当前的前沿,比如前沿模型的竞赛是合理的,这看起来非常鲁莽,让我们明确一点,对吧?嗯,我认为以目前的发展速度,我们将面临很多麻烦,但这是那些集体行动问题之一,对吧?这些公司必须协调放慢速度,而且这里也涉及到国际问题,因为现在你确实有美国模型开发者与中国模型开发者之间的竞争,现在他们都在竞争中。所以这非常复杂,当你遇到这些集体行动问题时,我认为解决它们的主要方式是通过治理,当然实验室负责人,嗯,可能会更加协作,而且肯定其中一些人没有像他们应该的那样强烈主张放慢速度,也没有主张这种,嗯,嗯,集体,你知道,分享对齐的好处,并且,你知道,不要危险地推动前沿,但我确实认为这最终是政府的工作。

是的,快速,嗯,这可能有点离题,但快速跟进一下你说的公司主要这样做是为了赚钱。我实际上会以相当不同的方式来建模它们。以OpenAI为例,山姆·奥特曼曾说过,你知道,我们可以烧掉50亿美元,500亿美元,5000亿美元,我不在乎。我们正在制造通用人工智能,那会很昂贵。我认为那几乎是直接引语。然后当你审视他们的使命时,我总是惊讶于他们选择定义通用人工智能的方式,在我看来,它本身就带有意识形态色彩。就像你可以以任何你想要的方式、形式设定你的目标。而他们的目标明确地处于这种超越人类工人的框架中。而且我认为他们真诚地期望这对每个人都有好处,而且它会,你知道,将人们从苦役中解放出来。而且我当然希望他们是对的。我不,你知道,我喜欢生活在一个人们不必做他们不喜欢做的工作的世界里,但我不知道。我有点,我更多地认为他们,显然不同的公司之间也有很大的不同,但我认为这与其说是为了致富,不如说是为了在历史上留下真正的印记,这是我对他们中许多人的最大总结。这与你产生共鸣吗,还是不太?

>> 也许吧。我不想,我无法真正猜测这些实验室领导者的心理,更不用说他们的股份,与其说是股东,不如说是,嗯,你知道,风险投资家和,嗯,他们对客户等等,他们的员工所做的承诺。我无法真正猜测这些。我会说,鉴于通用人工智能的价值估计至少在1万亿到1.7万万亿美元之间,我想那看起来就像是

很多钱。这就像是历史上一个相当大的印记。我不确定,我也不确定它是否重要,无论他们是想在历史上留下浓墨重彩的一笔,还是想赚钱,你知道的,我们可以采纳丹尼特的意向立场,对吧,关于人工智能公司,就像,好吧,那么,它们看起来在做什么?如果我们把它们概念化为一个试图做某事的连贯的代理,那么它们试图做的事情是什么?对我来说,这似乎是它们在努力赚很多钱。但留下历史印记也是可以的。虽然我会说,我想,在我想象的世界里,我不想举任何具体的人工智能实验室作为例子,但我认为,在一个人工智能实验室非常具体地试图在历史上留下自己的印记而不试图赚很多钱的世界里,我会期望它看起来,实际上,它看起来和现在这个世界一模一样。

是的,考虑到资本需求,我的意思是,这确实是……

似乎 Anthropic 已经说过类似的话了,对吧?就像在他们早期,他们不太关注商业化,甚至,你知道,他们认为他们可能会尝试保持非商业化,或者不那么商业化。而现在,这就像,好吧,如果你想在这个特定的游戏中竞争,你真的不能那样做,因为当然,只要你相信规模法则会继续统治我们周围的一切,那么你就必须表明你能带来资源来吸引资源,而这就是在历史上留下印记的道路。再说一遍,Ilia 可能是一个与众不同的人。

他是一个亿万富翁。他为他的模型筹集了巨额资金。也许,也许他会通过这种方式赚到比留在 OpenAI 更多的钱。这是可能的。他有自己的公司,你知道的,现在他仍然持有 OpenAI 的股票,我敢肯定。你知道,他得到了……

是的。而且,顺便说一句,这也不是我……很有趣的是,他已经在我脑海中出现过几次了,只是因为我根据你说的某些事情进行模式匹配,但有人将直接进入超级智能,然后,你知道,将其抛给世界的其他地方。而且我认为他在这方面已经有所软化了。但就像那种普遍的模式是,你知道,我认为如果有一件事 OpenAI 可能确实拥有,对吧,迭代部署的想法,你知道,并让人们对我们所处的位置有所了解,你知道,而不是把所有东西都藏在一个篮子里。我认为这是其中一件事,你知道,似乎已经相当不错了。

我第一次听到我最早的……我最早的感知是有人提倡这个,是 Paul Cristiano,你知道,他的起飞速度的帖子,反对我,我猜他当时看到的是主要是 MIR 的观点,比如,哦,我们将……你知道,我们将秘密地建造这个东西,或者,或者,我,我,坦白说,我不想评论,我不知道 MIR 的目标是什么,但我知道他们非常努力地……你知道,不要泄露关于他们对齐的任何信息。嗯,嗯,在某些领域的研究,其他领域他们发表了很棒的论文等等。但当时 Paul Cristiano 是……你知道,反对这种……他认为,如果你有很多干柴放在那里,就会发生快速起飞。所以,如果我们有……你知道,有成千上万的 GPU,然后我们停止研究一年,然后又开始,那么你会期望……你知道,一个更陡峭的增长,对吧?而且我们正在看到这一点,就像有非常非常快的追随者一样。这不仅仅是人工智能领域的一个现象,对吧?在经济领域,对吧?……就像 Epoch 最近做了一项研究,他们表明,新的人工智能公司接近前沿的速度比前沿移动的速度快得多,因为有大量的芯片,有大量的数据和方法等等。这与……你知道,追赶型经济体等等在世界上的情况是一样的。所以,我认为 Paul Cristiano 在某种意义上是正确的,那就是,如果社会要应对和适应人工智能,那么从这个角度来看,渐进式地发布和传播技术会更好。还有另一种观点认为,正是这种非常渐进式的发布或某种东西确保了持续的风险投资再投资来驱动引擎以取得实际进展,而在另一个世界里,你实际上不会建造 AGI,因为,也许在那个世界里,没有人能够建造它,除非花费数千亿甚至数万亿美元,我不知道,我无法确定。我当然认为,我们现在正处于这样一个世界,即渐进式地发布模型似乎比一次性全部发布要好。

嗯,我一直很重视从像你这样的人那里获得见解的机会,你是一个如此的连接者,你知道,而且在这样一个……如此核心的节点上,有如此多的导师和被指导者,你知道,所有这些信息流和人才流,你都如此接近。但我们可能应该稍微缩小焦点,谈谈你们在 Matts 实际做的事情。嗯,我会在介绍中放一个时间戳,这样人们也可以,如果他们想直接进入核心的数学内容,他们可以跳到前面加入我们。跳过一些更高级的东西。为什么我们不快速回顾一下,比如,我认为你称之为工作流的这些不同的轨道今天在 MATS 项目中正在发生什么?也许有点权重,或者你知道,你最兴奋的是什么?然后我们可以进入你对人工智能安全劳动力市场的评估,我认为这真的很有趣也很独特,然后我们就从那里开始。我们最近更改了我们的轨道描述。嗯,所以我们以前有……你知道,标准的监督、控制、评估、治理、可解释性、代理,这是一个对合作人工智能和代理基础以及人工智能意识、数字心智研究的通用术语,当然还有安全。但我们最近改变了它,因为我们想更多地反映……而不是那些东西背后的变革理论,而是工作在那里的过程和个人的类型,对吧?所以,所以我们现在在我们的网站上有这些轨道。实证研究。所以这是人工智能控制、可解释性技能监督、评估红队测试、鲁棒性。所有这些都非常……你知道,动手编码密集型迭代研究,对吧?我们有政策和战略,这又不同了,对吧?这更多地侧重于……嗯,比如,可能不是档案出版物,更多地是建模,更多地是……你知道,将技术研究转化为对决策者真正可行的东西。理论是另一个轨道。所以,这是很多数学。它是关于代理概念及其交互方式的基础研究。它确实包括一些用于合作人工智能的技术治理的基于代理的建模,这有很多东西,比如合规协议、评估标准、……你知道,如何真正……你知道,执行这些东西,比如如果你有一个关闭开关,你甚至会如何……你知道,让这样的东西在治理框架中可行?……然后是计算基础设施,这是关于……你知道,跟踪芯片的去向,对吧?因为如果你要进行国际合规……嗯,与各种条约,你需要知道你的芯片在哪里以及它们在运行什么,或者至少有一些零知识证明可以保证它们没有做非常危险的事情。当然,你知道,物理安全,如果你要阻止,如果你建造了超级智能或 AGI 或类似的东西,可以想见你不想让每个人都能访问它并任意修改它,给它奇怪的目标,因为那会很糟糕。有些人说那很好。我说,我们不让每个人都拥有核武器。你知道,为什么我们要让每个人都拥有超级智能?这似乎有点荒谬。所以,你必须有物理安全来防止这种情况发生,防止扩散。……所以,是的,这些是现在的轨道。嗯,我们非常兴奋。我想我们有大约 50 到 60 位研究导师为我们的暑期项目准备就绪,现在正在接受申请,这将是我们迄今为止最大的项目,在我们的伯克利和伦敦办事处有 120 名研究员。还有什么我应该说的吗?

是的,也许你想做一下那些的权重,比如有多少……我不知道你是否会按每个类别有多少导师来细分。

是的,目前的项目大约有 27% 的评估,26% 的可解释性,18% 的监督控制,12% 的代理,10% 的治理,以及大约 9% 的安全。我希望我有一个可以展示的数字。我确实有一个数字,但这可能很难在播客格式中展示,但正如你所见,这是一个相当均衡的组合,你知道,我们有大约……你知道,做评估的人比做安全的人多大约三倍,所以确实存在一些差异,但我们有一个相当广泛的投资组合,这仅仅是因为有大量的了不起的研究人员,我们真的只是……你知道,在每个类别中挑选一些顶尖研究人员。

也许现在是时候说一些名字了。

我可以。

有很多,而且有很多人们会认识的名字。

是的。我的意思是,一些监督控制研究人员可能更出名,因为这是许多大公司正在追求的事情之一。所以我们有像 Redwood Research 的 Buck Schedger 和他的整个团队都参与其中。Ethan Perez……嗯,还有 Sam Marks 和 Anthropic 的许多其他人。我们有 Eric Jenner、David Linder 和 Victoria Kafa 以及 DeepMind 的许多人。所以,是的,有很多从事监督控制研究的人。对于可解释性,显然我们有 Neil Nanda,我们有一些 Tamaus 的人,比如 Jesse Hoo 和 Dan Murph。我们当然还有 Goodfire 的人,比如……你知道,Lee Shy 长期导师,还有一些来自 Simplex 的人,他们正在做一些非常有趣的事情,比如 Adam Shay 和 Paul Rikers,他们正在做……你知道,一些……我可以说,一些更有趣的……你知道,可能是更具雄心的,但非常有前途的……你知道,我也有一些私下的可解释性研究赌注。对于评估,我们有来自 Meter 的人,我们有来自 UKAC 的人,我们有来自 Apollo Research 的 Marius Hawan 和许多其他人。是的,我可以继续说下去。那里有一些了不起的研究人员。我们还有一些更难归类的研究。Joshua Benjio 在 Law Zero 的整个团队。Plenty of Yoshua Benjio 本人以及许多其他人都在那里。我们还有一些人工智能意识研究,数字心智。所以 Patrick Butwin 在 LAI,Kyle Fish 在 Anthropic。是的,这是一个非常令人兴奋的项目。

是的,这真是一个名人录。还有几位……你知道,过去的播客嘉宾,还有几位我记下了,也许需要发出邀请。看起来,如果我把它们分类的话,平衡似乎是……大多数似乎都在第一个实证类别中。……你认为它会保持这样吗?或者你知道,你对……你知道,最终这是治理轨道的工作,一些……坦白说,现在更像是……你知道,我的观点是,今天的我的观点是,我们没有那么多时间进行研究,我们需要直接进行全球条约。你显然……你知道,对这个方向不是那么自信,但听起来你确实相信,你知道,政府最终可以发挥重要作用,而你正在开始朝着……你知道,治理政策方向发展。你是否认为这将是……你知道,最大的增长领域,反映了那种世界观?或者你预计这些不同领域的平衡会如何随着时间而演变?

我实际上不能确定……嗯,好吧,我可以推测,但我会这样说:在过去两年里,我们大约有相同比例的治理研究人员,或者多或少百分之几。它没有改变一分钱。所以我们正朝着……你知道,继续相同的趋势前进。部分原因是,你知道,我们位于……你知道,特别是在伯克利旧金山湾区,这是一个大的技术中心。还有其他项目,它们有更多的……你知道,深入的治理重点,比如我们有 Govi,他们是经典的奖学金,我们有 IAPS,我们当然有 Randcast,这是 Rand 运行的一个大型项目……还有很多其他项目。是的,当然还有 Horizon Fellowship,对我们来说是政策职业。所以,所以……而且这些项目也存在了比我们更长的时间。所以,在我们基本上是镇上最大的鱼的时候,我们在资金方面仍然是这样,我认为在技术安全方面也是如此,我们是最大的……你知道,也是最好的项目,但我想说的是,对于治理来说,一直都有……你知道,更大的鱼,所以我们……我们从来不觉得有必要将治理的权重超过我们的导师选拔委员会的指示。事实上,这就是轨道的选择,对吧?是我们的导师选拔委员会,它大约有 20 到 40 位顶尖……你知道,战略家等,或者当我们每个人都申请成为导师时的领导者。我们根据导师选拔委员会的反馈来决定导师级别,谁能进入,并附带一些额外的说明,即我们也……嗯,嗯,我们有一些多元化选择……你知道,最低要求,因为我们希望支持广泛的研究,我们认为导师选拔委员会整体上可能在某些方面存在偏见。所以我们……我们试图……你知道,在选择议程时真正与专家交谈。而且碰巧是……你知道,治理……嗯,研究人员在历史上一直……你知道,在我们的委员会中排名相对较低,而我们的委员会包含许多治理研究人员。我认为,我甚至可以这样说,治理研究在某种关键意义上更难做好,你知道,在某些方面更难看到……你知道,什么是可行的。现在,每个有自己特定治理议程的人,我认为……你知道,不这么认为,这是有充分理由的,对吧?他们在自己的议程中……你知道,有明确可行的工作内容,但我想总的来说,有……你知道,有太多的……嗯,嗯,可以追求的技术方向,这些方向在某些方面也很有影响力。我认为很多治理的东西是……你知道,我们正在建立,这不是在谈论倡导,你知道,这是在谈论技术治理,我们正在建立技术治理解决方案,以便如果一个政府认为它们值得……你知道……嗯,嗯,部署,那么我们就有能力做到这一点,我们实际上有可以部署的解决方案,这非常重要,对吧?但我想说的是……你知道,不要排除技术研究,因为它……你知道,特别是如果我们有一个监管市场,甚至……你知道,警示信号让公众醒来并告诉国会……你知道,监管这些东西。我们必须有技术解决方案准备好部署,以使这些系统更安全。而且我们让它……你知道,让系统更安全……你知道,降低公司在培训和部署系统以使其更安全时必须支付的对齐税,成本越低,你知道,当它们受到压力时,它们就越有可能这样做,无论是内部的、外部的,还是其他的。所以,我认为通过技术研究降低对齐税仍然非常重要。此外,如果这个对齐 MVP 计划要奏效,我们必须有大量的方向供这些 AI 助手或人类调用 AI 助手团队……你知道,进行迭代,因为更有可能的是。而且你实际上拥有这个技术研究和治理研究之间的巨大相互作用,比如基于技术 AI 安全解决方案构建的评估案例,这些是可以实际纳入政策提案的,对吧?并且可以……你知道,说服政策制定者进行演示和评估以及模型生物体陷阱,对吧?其中 AI 系统欺骗用户或什么的。这就是说服政策制定者制定政策,并为他们的政策提供一个可行的目标,对吧?所以这里有一个清晰的飞轮。所以我想说……你知道,不要排除技术研究。而且,Matts 有更多技术导师是有原因的,这仅仅是因为,你知道,似乎总的来说,我们的导师选拔委员会认为……你知道,我猜平均而言,技术投资组合是……你知道,值得追求的。

是的,这让我想起了 Jake Sullivan 在给 AI 安全社区的建议,基本上是说你需要让这些东西尽可能具体,这样像我这样的人才能真正抓住重点,因为只要它仍然是……你知道,一种理论或一种可能性,或者你知道,无论是什么,政府真的很难做很多事情,你知道,在这方面。所以他说,你知道,这些恐惧越接地气、越具体,你就越有可能在政策领域取得成功。你刚才也简要提到了倡导。……你……清了清嗓子……会考虑倡导轨道吗?而且我认为这可能就像倡导研究?你知道,我觉得现在我们确实有从事倡导的组织,显然。我不太确定他们的倡导……你知道,策略通常有多么基于数据,但当我看到调查结果时,我总是感到震惊,就像,哎呀。你知道,公众在很多方面并不特别喜欢人工智能。你认为这会是你们会扩展到的领域吗?

我的意思是,你假设我们没有。[笑声]

是的,我没见过。

但我们是 501c3,所以我们必须……你知道,我们必须把我们的倡导活动限制在最低限度。而且我认为 Matts 的很多优势在于它是一个……你知道,一个公正的参与者。就像我们试图成为一个……你知道,有点像研究大学技术加速器之类的氛围。我们不一定……我们不想偏袒政治。就像那不符合任何人的利益,对吧?我认为如果有人这样做,并且他们试图成为我们所是的东西,那么他们做得不好。话虽如此,对吧?我认为……你知道,我们确实……嗯,嗯,我相信 David Krueger 将是当前项目的导师。……而且他的一些研究是关于……你知道,他将要讨论的是关于……你知道,什么样的信息传递和什么样的……你知道,标准是可行的,对吧?但当然,这不是……我不会说这是……你知道,真正的倡导,这更多的是 Mass 在支持独立研究,与 David Krueger 合作……你知道,他有他的新……或不可避免的,可避免的,它专注于……你知道,一些倡导问题。所以,我认为 Matt 必须非常小心,你知道,就……你知道,我们 501c3 的倡导支出要求而言,我们没有在倡导上花一分钱,就事论事。而且,你知道,确保政治中立性,这样我们的研究员、我们的导师以及我们所有的战略合作伙伴都能感到放心,我们是……你知道,我们是面向解决方案的,我们正在推动一个特定的结果,对吧?而且我认为……嗯,嗯,人工智能安全成为一个政治足球是一个坏主意,我赞扬像 In Code 和……你知道,Plenty of Others 这样的倡导组织,比如……你知道,也许 Case 等等,为他们的努力……你知道,去……那不是 Mass 作为一个组织。

是的。明白了。最多是试探一下。让我们谈谈个人资料。我看了你的一场演讲,也读了你大约 18 个月前的一篇博文,你在其中勾勒出了你所看到的各种人工智能研究人员的原型,然后也将其映射到组织的需求上。我不知道在过去的 18 个月里有什么变化,如果有的话,但也许给我们一个基线,然后如果有任何更新,我很想听听……你知道,事情是如何变化的,特别是……你知道,我脑子里当然有 Clawed Code,它可能会加速某些人,它可能会赋予某些人做他们以前做不到的事情。但是的,告诉我们……你知道,首先,你是如何组织你对你正在吸引到项目中的人的思考的。

所以,我的意思是,Matt 就像……我谈到了导师选拔委员会,我们基本上是……你知道,一个巨大的信息处理界面,对吧?所以我们……我们尽可能多地咨询最优秀的人,你知道,我们试图……你知道,建立自己的观点,但我们不依赖它们,对吧?我们试图在每个阶段咨询专家。所以,你提到的那篇论文或博文,叫做“技术安全团队的人才需求”。……为了构建它,我们调查了……你知道,31 个不同的实验室负责人和招聘经理,我们能找到的每个 AI 组织中与安全相关的最高级别的人,当时他们正在招聘。我们问他们需要什么?我们将所有这些……你知道,调查……嗯,那些访谈笔记整理成三个原型,对吧?这只是技术方面的。我们后来也为治理做了这个。预计很快就会发布。所以这三个原型是连接者、迭代者和放大者。所以我们选择“连接者”这个词是因为这些人弥合了人工智能安全理论论证与使人工智能安全的理论技术以及实际实现它的实证技术之间的差距。所以他们有点像……你知道,催生新的实证范式来工作。好的。没有人雇佣这些人。这相当罕见,因为如果你在这方面做得很好,那么每个人都知道你的名字,而且你已经找到了工作。也许你已经领导了一个组织,每个人都想成为一个想法家,但很少有人想雇佣想法家。这些人通常是……你知道,像 Buck Schedger 这样的人,你知道,人工智能控制,Paul Cristiano,对吧?他产生了大量的……你知道,大量的资源等等。就像……你知道,你知道这些人,对吧?……他们通常……你知道,拥有他们创立并领导的人工智能安全组织。然后是迭代者,对吧?……而这不仅仅是……你知道,不仅仅是工程,对吧?迭代者是活跃的研究人员,他们有很强的研究品味,他们正在推动前沿,但他们通常不会基于……你知道,理论模型来创造新的范式。他们通常在推进实证人工智能安全,你甚至可以想象迭代者……你知道,在技术治理议程中也是如此。所以,这是大多数人……你知道,今天在安全领域工作的人,也是未来大多数招聘需求。然后是放大者,我认为……你知道,最接近的例子是……你知道,像 TPM 原型。我得说,对于迭代者来说,著名的例子包括 Ethan Perez、Neil Nanda、Dan Hendris,很多……实际上我认为 Dan Hendrickx 可能跨越了一些……你知道,跨越了一些界限,但是的,放大者……嗯,为了区分他们,他们更侧重于……你知道,放大人们,通常你会发现他们在大型研究团队中,他们正在扩大可以有效管理和为组织做出贡献的人数。所以,很多数学研究经理都属于这一类,或者各个实验室的 TPM。有趣的是,他们也相当受欢迎,特别是对于那些……你知道,规模在 10 到 30 FTE 之间的实验室。他们是最受欢迎的原型,因为很难雇佣到优秀的管理者,同时又具备所需的研究经验。你试图击中两个目标。当然也有方法,比如谷歌有这个……你知道,模型,你有你的研究经理和你的……你知道,你的个人经理或项目经理,他们有些区别,而 Matt 确实试图为我们的导师和我们的 RM 做这个,但是的,那个……我认为对放大者的需求只会增长,因为正如你所说,像 Cloud Code 和其他 AI 系统这样的东西将消除……你知道,对技术最低技术技能的要求,以做出贡献,而且我认为 AI 代理也将承担更多这些事情。你最终会遇到一个情况,即你的沟通技巧、你的管理能力、你的网络、你的放大器技能通常是人工智能安全研究的瓶颈。所以,所有那些迭代者,都有工作机会。你仍然是每个人都想雇佣的主要对象。但如果你不尝试建立你的管理能力,你不致力于管理 AI 系统,那么随着该领域的需要转向放大者,你就会被抛弃。所以,为了简单地向你重申一下,连接者,另一个名字可能是概念远见者。就像这些人定义了研究议程,而这些议程以前根本不存在,你知道,从零开始的高概念工作。反过来,他们需要迭代者,这听起来基本上是机器学习工程师,你知道,核心技能集。

科学家,工程师。是的。他们是每天运行实验、构建工具、编写代码的人,传统上是……你知道,对数据进行可视化,并且基本上是……你知道,接受连接者提出的最初概念打击,并……你知道,系统地绘制出那个空间。然后,随着这些组织的发展,它们开始需要放大者,我可能会称之为领导者,你知道,能够……你知道,建立一个组织,看到人们没有很好地合作,它可能已经超过了……你知道,两块披萨规则,在规模上。现在情况正在改变吗?所以,你知道,当我们听到像 90% 的代码将由 Claude 编写时,这似乎……你知道,更接近事实而不是错误。而且当然,我今年圣诞节为家人制作了三个 AI 应用程序,这是我……你知道,以前即使只有一两代模型也无法做到的。……而且,我确实想知道技能集在多大程度上已经改变了。就像你看到了什么?就像……你知道,关于人们如何看待招聘需求变化,最新的情况是什么?我的意思是,最新的情况是,你必须非常熟练地使用人工智能,而且我认为一些公司已经更新了他们的……你知道,他们的编码面试……你知道,流程,允许使用 AI 助手,因为在工作中,你……你知道,你必须一直使用 AI,对吧?这是在这个领域取得成功的关键,被 AI 放大。我会说,这适用于我们确定的所有这些原型。……我也认为,你知道,在关键情况下检查 AI 输出是否良好仍然会非常重要,并且将不同类型的 AI 输出缝合在一起,并构建管道以更有效地处理它们也将非常关键。但我们可能正在离开 LeetCode 时代。我将这样说,就是……你知道,放大者虽然目前在所有不同……你知道,人工智能安全组织或团队的层级中不是最受欢迎的,但我认为在未来一两年内,它们将是最受欢迎的。但这只是……这是基于我对 AI 进展的预测。正如你所说,它可能会慢一些。你知道,可能会有锯齿状的担忧,你知道,这会减缓这种人才转型。但总的来说,它永远不会对你的……你知道,你的就业能力产生负面影响,因为你是一个管理者。……管理者非常有益,领导特质通常会让你更有价值,更好的员工。我认为这是个人成长的一部分,就是承担一些领导角色。

现在供应和需求看起来是什么样的?就像……你知道,也许甚至在最高层面,回到……你知道,Matt 的起源故事。我的理解是,你说,天哪,这个人工智能安全的东西似乎需要很多人在很多不同的角色上工作,而这不是大学教授的东西。所以,你知道,人们如何……你知道,进入这个领域?如果有人从中受益,你知道,他们去哪里?所以,你基本上创造了一个,当然还有一些其他的。但你创造了其中最大、最受尊敬的一个。我们现在处于什么位置?就像……你知道,是否有比 Matts 能够培养的研究员更多的职位?还是……

是的。你知道吗?

我们来回走了几次,有一次是,哦,我们非常缺乏人才,然后是,嗯,也许不再是这样了。现在是,实际上并没有很多职位供人们进入。所以我觉得也许我……[鼻息声]……错了,但我感觉这有点来回摇摆,我不知道我们现在在哪里。

所以,我先说,我不是 Matts 的创始人。我不是 Matts 的联合创始人。我作为一名参与者参加了试点项目。

好的。是的。是的。是的。是的。有大约五个人……你知道,我们最终完成了第一个研究项目,这是一个试点项目,他们没有公开申请。只是从……你知道,现在是 Blue Dot Impact 的第一个人工智能安全基础课程中提名的人。……我们完成了,功劳归于 Victor Warlop 和 Oliver Zang,他是 Center for AI Safety 的首席运营官和联合创始人。我在这门课程结束后不久就加入了团队。我想说,然后 Oliver 去联合创办了 Case,……然后 Christian 也加入了。然后 Victor 很快就离开了。我想说的是,我扩展了 Matts,这是我的贡献。是的。……嗯,嗯,你知道,自从我和 Christian……你知道,重新创立了它,我们成立了一个独立的 501c3,就在几年后,因为我们对我们的财政赞助商来说太大了。所以,是的。所以,我将为扩展 Matts 和自 2022 年中期以来一直是我战略的驱动力承担责任,我认为。但关于人才需求。是的。所以,这是一个好问题。是的。抱歉,再说一遍,请再说一遍问题的确切措辞。

嗯,是的。供需平衡是什么?因为这可能不对。我的意思是,你也可以纠正我,但有时我有一种感觉,人们说,对这种人才的需求如此之大。就像,在哪里?你知道,我们缺乏人才。但有时,我也从人们那里听说,现在人们涌入这个领域,但实际上并没有那么多职位可用,所以人们有点沮丧。但我不知道我们现在在哪里。

是的。所以,好吧,我会这样说。人工智能安全是一个领域,对于最优秀的人来说,总会有工作。好的。如果你是……如果你是……如果你是一个出色的程序员,你可以在人工智能安全领域找到一份工作。就像 Anthropic 的对齐科学团队每年都在以 3 倍的速度增长。好的。他们正在努力快速扩展。FAR AI,一个非营利组织,每年增长 2 倍。好的。所以,Matt 本身,我们一直在以 2 倍的速度增长,贯穿我们整个历史。所以,这些……你知道,这些团队正在快速扩展。好的。而且还有更多的新公司成立。Open Philill 有……抱歉,Coefficient Giving 有大量的……你知道,赠款资金用于这些事情。对吧?有大约十几个专注于人工智能安全的风险投资公司可以资助你的……你知道,教授。……有孵化器,比如 Catalyze Impact、Selden Labs。我相信 Constellation 现在也有一个。有很多像 Matt 这样的项目。我认为问题在于……你知道,一旦你建立了一个组织,特别是如果你发展得非常快,对吧?它达到了某个规模,主要的限制就变成了……你知道,这个人是否足够好,值得额外的管理开销?他们能否承担一些管理责任?所以你遇到了这种情况,就像在 OpenAI,在那里人们管理着 10 到 20 个人,也许高达……我知道,据我所知,Anthropic 对齐科学有一个人有 18 名下属,所以他们真的很扁平。所以你有一个真正的问题,那就是你需要雇佣能够快速晋升并成为研究负责人、成为管理者等等的人,甚至是新团队的 PI。而这……你知道,是限制性因素。而这正是许多人经过适度的再培训却无法获得雇佣的原因,因为我认为……你知道,这些工作……机会不多,但我们发现,当我们与这些招聘经理交谈时,他们说,我们发现招聘极其困难。我们有钱,对吧?我们有明确的需求,但人们没有达到我们的标准。而这……你知道,这正是 Mass 试图做的,那就是让人们达到那个标准。而且,你知道,那……你知道,这其中有一些技术技能的元素,对吧?还有一些……你知道,就是实际的研究经验。所以,那些进入 MATS 时拥有先前研究经验的人,平均而言比那些研究经验较少的人做得更好,对吧?所以,我认为一个强有力的选择是,许多人应该留在学术界,获得学士学位,获得博士学位。对于其他人来说,也许他们应该去创办一家公司。人工智能安全公司有大量的资金和方向。我认为创始人在这个生态系统中非常需要,然后你就可以为更多人创造就业机会。但我也要说,另一件事是 NAS 试图提供的是……你知道,信誉。我不会说……你知道,不是正式的认证,而是某种……你知道,他们有来自导师的推荐,导师是该领域的资深研究员。你有……你知道,详尽的 Matt 选拔过程,它非常努力地寻找那些……你知道,优秀的人,然后你有……你知道,你实际研究成果的证明,你发表了一篇论文,对吧?那就是你的名字,也许你发表在会议上,或者在档案里,人们在谈论它。所以,这就是人们现在需要被雇佣的,对吧?你需要有一个实际的……你知道,出色的成果,某种可交付的成果,你可以展示你的名字,也许是几个。……你必须在编码或使用 AI 系统等方面技术上足够好,无论需要什么,而且你需要来自受信任的人的推荐,否则就很难取得进展。你在每一个……你知道,人才受限的就业市场中看到的故事都一样。

这如何转化为经验档案?这显然是更广泛的技术世界中的一个大问题,对吧?我们的初级程序员是濒危物种吗?我们看到了像 Neil Nanda 和 Chris Ola 这样非常突出的例子,他们很年轻就进入了这个领域,在某种程度上也定义了这个领域,而且实际上今天仍然很年轻。这可能会让人们认为……你知道,这是一个年轻人的游戏,但你描述的更像是……

听起来更像是博士后……或者你知道,某人……你知道,在某种程度上在组织中成长。我想到……你知道,来自 AI 保险公司公司的 Rajiv,他曾在麦肯锡工作多年,现在……你知道,联合创办了这家组织,但……你知道,带着……你知道,大量的经验和复杂性,就管理、领导力、所有那些……你知道,利益相关者管理方面的……你知道,东西。你看到了什么……你知道,对于那些……你知道,刚从大学毕业的人来说,机会多吗?还是说他们是在……你知道,对着错误的树吠叫,如果他们想直接从……你知道,本科进入这个领域?

所以,我的意思是,Matt 的平均研究员是 27 岁。好的,所以有一个……你知道,一个对数正态分布,长尾。我想最后一个是……你知道,55、60 岁。所以,各种年龄的人都在申请 Matt。最年轻的人当然是 18 岁,因为我们现在不能招收未成年人。好的。更多统计数据,对吧?Matt 研究员的 20% 是本科生。他们没有学士学位。好的。或者也许,也许他们甚至没有申请学士学位,对吧?他们只是出色的工程师。……大约 15% 已经拥有博士学位。所以,至少就 Matt 而言,作为……你知道,加速再培训、实习、指导项目,无论是什么,你都会得到广泛的人群。现在,我认为显然对有经验的人有巨大的需求。第二个关键是,他们有……你知道,使用最新工具的经验。而且,因为这些工具存在的时间不长,年轻人很有可能……你知道,成为特别擅长使用这些工具的人,因为他们一直处于……你知道,事物的最前沿。他们没有坐在……你知道,隔间里,每天不使用 Cloud Code。所以,从这个角度来看,年轻人有巨大的机会。但是,确实如此……你知道,从工作中获得宝贵的知识,特别是在一个优秀的团队中,发表优秀的论文,这是你无法复制的。……你提到了……你知道,一些我称之为神童的人,你知道,Chris Ola、Neil Nanda,有很多……你知道,很多这样的人,他们也通过了 Matt,虽然我认为没有人……你知道,那不是真的,实际上确实有一些人,我认为……你知道,我会把他们归入类似的类别,比如 Marius Hoban 等等。而且,在这种情况下,你知道,我们的主要工作就是……你知道,就是让他们……你知道,让他们走开。而且我认为,如果你是那种人,不要让任何事情阻碍你。申请 Matt,申请赠款资助,做任何事情,去湾区,去伦敦,然后把它实现。你知道,你……你一定会找到自己的道路。如果……你知道,这可能不是你的道路,而且,特别是如果你是一个……你知道,更资深的……你知道,研究员,或者也许……你知道,一个……你知道,我无法想象那个人。我只想完成我的本科学位,然后读博士。那也很好。各种各样的人都通过了 Matt,找到了工作,做了其他项目,找到了工作,创办了公司等等。我认为……你知道,你的……建议很难针对……你知道,各种各样的人,但我只想说,专注于你的技术技能,专注于理解技术的前沿。……而且,是的,不要被你在招聘网站上看到的机会所限制,对吧?你可以创造自己的机会。你可以给公司发冷邮件。你可以……你知道,申请赠款资助者,只需提交一份你拼凑出来的随机赠款提案,因为它深深地吸引着你。你可以给招聘经理打电话等等。其中一个……我的意思是,当你描述范围时,这是一个相当广泛的分布,这告诉我你比你信任其他外部信号更信任你自己辨别谁会优秀的能力。所以也许告诉我一些……你知道,你实际上用什么来评估人们。……而这可以转化为实际的建议,关于……你知道,如何让申请脱颖而出,但……你知道,你在寻找什么,让你能够招收一个 50 多岁的人,或者一个 18 岁的人,并感觉……你知道,你能读懂真正重要的事情,无论他们的背景如何。

是的。所以,我的意思是,我们……你知道,我们做了一些你在其他科技公司会看到的标准事情,对吧?就像我们有简历审查,我们有一些代码信号测试,所以要提高你的编码技能等等。而且它们确实能检测到 AI 的使用。我们当然在考虑允许进行……你知道,包含 AI 使用的测试,但这些显然更难,对吧?它们更难设计。它们更难检查等等。但是的,这是我们一般申请的一部分。现在,那是针对某些……你知道,流。我得说,导师选拔……抱歉,学者选拔……你知道,我们非常努力地为导师提供某种服务。所以,如果一个导师对我们说,我不想做简历审查,我不想做代码信号测试。我只是有一个选拔问题,我想让研究员……你知道,申请人来解决,然后……你知道,你们帮我评估一下。为我建立一个……你知道,承包商团队或某种自动化评估流程来进行初步筛选,然后我们再继续。从某种意义上说,这是我们最喜欢的评估方式,因为我们知道这……你知道,尽可能接近实际工作,实际研究。当然,这通常是在……你知道,Yolanda 的情况下,就像……你知道,走开,做一个 10 小时的……你知道,机械的……你知道,伪工作测试,然后向我展示你的结果。你可以使用 AI,随便做什么。只是找到一些有趣的东西。而这……你知道,这很棒,因为然后我们得到……你知道,很棒的结果。对于其他一些……你知道,流,这更难做到。……它更难管理,所以我们确实依赖一些代理,这些代理可能不如理想的那么具体,但我认为它们并不比行业中的任何其他代理差。当然,你知道,我认为脱颖而出的方式显然取决于具体的导师,因为 Matt 在这方面非常异质化,对吧?就像……你知道,申请 Neil Nanda 流的最佳方式将与申请 Ethan Perez 和 Anthropic 的那个大型流截然不同。但总的来说,你想……你知道,真正理解你的基础知识,关于人工智能安全。所以,做一次 Blue Dog 课程,对吧?因为可能有一些关键知识或一篇论文,如果你没有读过,你就不知道,如果你不理解什么是欺骗性对齐,那对 Ethan Perez 或 Buck Schedger 的控制研究来说可能非常糟糕。但即使是申请……你知道,进入那些流。如果你不……如果你不理解,对于可解释性流来说,可能没那么重要,除非当然,你在你的可解释性事情中处理欺骗。所以,确保你理解你的基础知识。确保如果你申请的是一个实证性很强的流,那么你能通过代码信号测试。你能编码,至少目前是这样,不使用 AI 助手。而且申请其他项目也无妨。Matt 远非唯一的项目。现在不是早期了。……有这么多很棒的研究项目。Pivotal、ERA、PIBS、Laser Labs、SPAR、Arena……你知道,技术方面的。我认为 Astra 现在又在运行了。是的,有很多很棒的项目。而这可以真正……你知道,提升你的简历。如果你已经有了你想在 Matt 进行的研究经验,那就更好了。把它看作是一个博士后机会或类似的东西,或者是一个研究后机会。建立你自己的独立项目。是的。抱歉,如果这……你知道,太多的建议,可能无法付诸实践。

是的,我认为这归结为有形的产品是……你知道,是王道,对吧?我的意思是,我一直在 AI 工程领域也是这样说的,如果任何……你知道,而且我远不是打破这个领域的世界领先专家,但如果有人问我,我总是告诉他们,一个可用的演示是这里的硬通货,你知道,就像……你知道,人们可能对你说的话感兴趣,但他们真的想看到你能让某件事起作用。他们想在线看到它。……它可能是一个 Replit,甚至可能是一个 Colab Notebook 或类似的东西,但……你知道,你必须……你知道,制作一些能起作用的东西。而且听起来这是一个非常相似的世界观。就像你必须展示……

这样你就可以进入其中,有所作为,找到,正如你所说的,特别是通过尼尔的赛道,就像 >> 找到一些有趣的东西。如果你能做到这一点,你知道,我们可能有一些事情可以谈。有一件事很突出,那就是也许不像我原以为的那样被强调的是掌握当前的研究。我认为在这一点上,没有人能跟上所有当前的研究,因为你知道,指数级增长已经远远超出了所有脆弱的人类思维。我会说,也许只有少数几个超读症患者仍然能跟上。但我发现,跟上研究对我来说感觉很重要。我觉得这是我如何与不同领域的人保持交流的重要组成部分。但显然,我试图与所有不同领域的人保持交流的做法与研究本身并不相同。你认为导师们通常会多大程度上强调,可以说,掌握最新的文献?>> 这因人而异。所以有些导师会问这样的问题,比如我不知道你对 X 概念怎么看,有些则不那么感兴趣,正如你所说,这些昂贵的信号是最重要的,比如你做过好的研究吗?你能有一个可交付成果,比如一个产品吗?你有一个重要人物的有力推荐吗?这也很关键,你有没有在蓝点课程和其他事情上做过你的功课,对吧?我认为数学选择目前并不怎么强调知识的广度,主要是因为导师们不一定想要,而且我认为这在某种程度上是我们过程中的一个弱点,如果我们不帮助人们建立这种广度的话。但我们有研讨会项目,我们有大量的机会在不同的研究流之间进行交流,这确实能迅速建立知识的广度,我们过去有讨论小组,这些小组仍然偶尔会随着研讨会等活动发生。所以我想说,我确实鼓励每个人都参加一个基本的蓝点课程或同等课程,比如人工智能安全地图集,如果课程好的话。但我认为,这对于选拔来说不是必需的,更多的是为了防止你进入数学领域,然后开始做研究项目,并意识到哦,我不知道差距在哪里。我不明白我的工作如何融入任何东西。我如何在数学之后获得资助?我如何找到工作?等等。比如我如何选择一个好的原创研究方向?所以这更多的是为了你在这个项目中的实际交付能力,对吧?跟踪研究,而不是你进入这个项目的能力,这很重要,因为数学只是一个垫脚石,对吧?如果你学了数学,然后到数学结束时没有取得很好的成果,当然,这对你的简历来说是一件很棒的事情,但在很多情况下,这还不够,你知道,因为这是一个竞争激烈的环境。所以,是的,我认为人们建立对文献的浅层但广泛的理解是非常好的。所以我建议,除非是你的领域,否则不要一直检查 X 以获取新论文等等。也许可以为 interp 设置一些谷歌学者警报,如果那是你的话。但更像是时不时地深入了解一下不同领域有哪些很酷的更新。你知道我的意思吗?你可以通过每年查看新的蓝点课程,或者每月查看一些研究摘要或亮点,比如 Z 的通讯或 Transformer。你还可以关注 X 上的其他人。这是我的主要建议。所以,你的录取率非常低,对吧?我们不想鼓励人们申请,但这是一个非常有选择性的项目,在申请方面,漏斗是什么样的?>> 我不知道是否有中间步骤,你知道,谈论被选中是没有意义的,然后我认为好消息是,如果你被项目录取,你最终进入这个行业,以专业的 W2 雇员身份成功的几率非常高。你想给我们讲讲这些数字吗?>> 是的。所以上一个项目,我认为我们接受了大约 5% 的申请人,也许是 4% 的人,在我们最初的申请表中。他们有一个后续流程,他们必须完成,那就是申请特定的导师和方向,我认为我们接受了大约 6% 到 7% 的人。所以高一点,也许这是我应该关注的数字,让我们说大约 7%。现在这比人们想象的要好,对吧?他们听到,他们以为是像,我认为 Anthropic 的研究员项目,例如,是 2%,因为 Anthropic 是个大名鼎鼎的名字,数学更大,我们有更多的多样性和更多的名额等等。我认为,是的,我认为人们也应该把申请过程本身当作一种学习经历。有些方向会比其他的更痛苦,但我认为,对于像 Neil Nandez 这样的方向,你花 10 个小时做一个项目,然后你的 GitHub 上就有了一些很酷的东西,这只会带来帮助。>> 如果你不喜欢这样做,你也不会喜欢和 Neil 一起工作,我猜。>> 是的,绝对是这样。我认为,不幸的是,没有简单的方法可以廉价地进行功劳分配,找到最好的人,而不用让他们花费大量时间。但我不知道,我知道像 OpenThropic 和 GDM 这样的顶尖科技公司的面试,只是过去 3 到 6 个月左右,你有很多事情要做,才能最终得到是或否。所以我们肯定没有那么投入,这是一个慢得多的过程,我认为这是因为,你知道,我们的承诺更少,我们没有给人们 W2。数学是一个独立的研究项目,他们从第三方获得资助,我们提供住房、办公室、导师社区,但我们不。>> 签署任何形式的雇佣合同。我认为这也是吸引力的一部分。所以,这是主要的统计数据,7%。另一方面,大约 75% 的被录取的学员会进入我们的延期阶段,所以我们的第一个 3 个月项目,7% 被录取,75% 会继续 6 个月,甚至在某些情况下 12 个月,而这个延期阶段是很多后续研究发生的地方。在我们历史上完成我们项目的人中,总共有 446 名学员,不包括我们帮助促成培训项目的人,其中可能还有大约 200 到 300 名。根据我们最新的统计数据,这 446 人中有 80% 的人已经进入了人工智能安全领域的永久性工作。这很棒。我认为,是的,我认为他们现在有 98% 的人以某种身份就业。在这 80% 的人中,并非所有人都获得了 W2,有些是独立研究员,获得了 Coefficient Giving 或 LTF 的资助等等,我认为这是一种不错的情况。然后在实际的领域增长方面,有一些统计数据我可以分享。似乎基于 Steven Mikiss 的不太有力的调查,人工智能安全领域的增长率是每年 25%,这很有趣,对吧?据我们所知,它似乎在呈指数级增长。现在,这比数学申请的增长率要低得多,数学申请的增长率每年在 1.4 到 1.7 倍之间,取决于你如何看待它,导师申请可能每年增加 1.5 倍左右。所以存在很大的脱节,根据蓝点影响,我相信他们的增长率是每年 370% 左右,就申请他们的项目而言。所以,是的,存在很大的脱节。所以很多人在申请蓝点,但无法以那个速度继续下去。这太快了。但可能是因为他们做了惊人的广告和营销工作。数学才刚刚开始做广告和营销。我们最近启动了有史以来第一次导师公开申请。是的,我们赞助了欧洲,这很酷。我们也赞助了你的播客和其他一些 [笑声] 很棒的场合。我认为这只会导致申请趋势继续下去。我想我会猜测每年 1.5 倍左右,这比该领域当前的部署增长率要快。至于原因,我可以推测,这可能是因为很多公司门槛很高,也许是创始人不足。有很多组织正在努力解决这个问题。我知道大约一年前 Juniper Ventures 有一份人工智能保障技术报告,他们预测人工智能保障技术的市场规模每年都在翻倍。所以有很多机会可以做一些可能有助于人工智能安全的事情。>> 找到工作的人的薪资分布是怎样的?比如,人们在薪资方面需要支付多少“对齐税”?>> 我认为在 Frontier Labs 根本没有税。他们的薪资与其他人相同。如果你在等待。是的,他们正在获得巨额资金。我认为几年前,刚入职的普通人的薪资是 37 万美元左右,我敢肯定现在肯定更高了,尤其是考虑到发生的疯狂的元事件。我的意思是,我敢打赌,中层及以上的人在这些实验室的安全团队里,薪资都超过一百万美元,但我没有私人数据。但是的,我的意思是,如果你像一个初级软件工程师一样加入,不要惊讶于你拿到 35 万美元左右。在非营利组织,当然会低一些,对吧?他们没有股权,但他们通常资金也少得多。你知道,Coefficient Giving 的财力不如美国风险投资的集体力量雄厚。我认为还有一种“非营利组织税”。我不会说有“安全税”,我会说有“非营利组织税”,对吧?因为有一些非营利组织在做人工智能能力方面的工作,比如艾伦人工智能研究所,人们仍然赚很多钱,对吧?这是人工智能,Coefficient Giving 和其他资助者都明白,你知道,你必须付出才能玩。所以你有一些组织,比如 Meter,我相信他们为他们的职位提供很多钱,大多数职位的薪资都在 30 万美元以上,对于一些职位,我敢说可能超过一百万美元。所以,有一些非营利组织正在努力争取人才。他们无法提供像 Frontier Lab 那样的薪资,包括股权,但他们正在尽力而为。我认为这是合理的,但这也是一个疯狂的时刻。数学的薪资远没有那么高。也许我们做错了什么,我不知道。是的。我认为还有其他人工智能安全非营利组织尝试了非常不同的策略,比如 FAR AIS 的研究科学家,我认为他们的薪资大约是 17 万美元。所以,明显低得多。他们最近可能已经提高了。所以这里有一个很大的范围,这真的取决于组织的薪酬政策。但你会看到,资金充足的非营利组织提供的薪资与至少一些初级人工智能公司的职位相当。>> 在计算方面呢?我知道你们除了为研究员提供津贴外,还有计算补助金,我相信价值 12,000 美元。我对它的形式很感兴趣。比如,它只是一个 Brex 卡,你可以在任何地方用它来购买计算资源,还是你们有固定的计算合作伙伴,你们与他们合作,他们很好地服务于你们的研究员?这够用吗?有没有人发现他们需要更多的计算资源来做他们想做的事情?然后,如果他们去非营利组织工作,非营利组织的计算资源是丰富还是贫乏?>> 是的。所以,我的意思是,数学提供 12,000 美元的预算,我不会说我们给人们一张写着 12,000 美元的卡。不。他们必须证明他们的计算支出是合理的。你知道,他们必须有一个实际的项目和提案,他们将要花费的,这是必需的。大多数人不会花费那么多。好的,这很好,因为那是我们还没有... 我们已经预算了,好像他们可以,但我们真的不想花钱,基本上是在浪费钱在计算上。基本上没有人有计算限制。有时人们很少需要超过这个数。我们考虑了他们的提案,认真思考,并根据需要重新分配了资金。是的,我认为在数学领域,人们通常不会受到计算的限制。我认为我们做得很好,我们有很多... 你知道,就像我们为我们的模型 API 调用等,我们有特定的组织账户,我们注册人们,然后我们给他们一个预算等等,并根据需要为他们充值。我们也有自己的数学集群,我们在线维护。所以我们的计算团队负责处理,通常人们倾向于使用 Runpod 和其他类型的自助服务。这取决于研究的类型,有些研究在我们的集群上效果很好,有些研究即使有我们的计算团队在设置和维护集群方面的帮助,实验也是如此定制,他们需要调整很多东西,所以我们只给他们一个预算,让他们使用在线提供商。这样更好。我们过去确实使用过其他提供商,但这是我们目前的设置,我们也在考虑构建一个定制的云代码套件。>> 意思是构建很多工具或 MCP 类型的东西?>> 是的。>> 我不认为不是 MCP。如果这个... >> 这是个区别。>> 是的。是的,你说得对。实际上有很多数据,你知道,在数据库里。我们也许可以把一些东西做得很有用,但我们还没有考虑过。>> 是的,只是所有尝试过的东西的档案,通过代理搜索一下会很有趣。我的意思是,我们的新研究数据库在线,网址是 mattsprogram.org/research。你可以在那里看到一切。我们有谷歌学者,但那只是所有发表的论文。你也可以在 Matt 计划标签下看到我们不太有力的博客文章。但是,有更多的研究成果在那里可见。>> 你提到你说“tinker”这个词。Thinking Machines API 在人们发现有吸引力方面是否越来越重要?>> 是的,很多人想使用 Thinking Machines API。所以,我们已经构建了一些,我认为我们... 是的,我,是的,很多,我会说很多组织喜欢捐赠 API 积分,这很棒,因为我们真的可以用它。>> 是的。酷。但还有什么我们应该涵盖的吗?>> 1 月 18 日?我们知道这是一个重要的日期。还有什么事实是我们应该确保我们触及的?>> 数学正在增长。我们一直在招聘。如果你想在我们的团队工作,帮助培养下一代人,如果你认为自己是某种放大器,你有人际交往能力和研究能力,我们很乐意听到你的声音。请访问我们的网站 massprogram.org/careers。我们也正在招募导师。我们的网站的导师部分有一个申请表。还有参与者,我们明年将运行三个项目。今年,而不是一个,而是三个。那将是一个夏季项目,一个秋季项目,然后是一个冬季项目,开始到明年。我非常兴奋。我们还有很多其他产品正在开发中。我们正在考虑为资深研究员提供一到两年的驻留项目。是的,更多信息将在稍后公布。>> 酷。>> 你在招募连接者吗?有没有,如果我是一个连接者,或者想成为一个连接者,数学是一个找到出路的方式吗,还是不是?>> 很多人,我称 Jesse Hoolland 为这样一个人,我称 Paul Rikers 为 Tmus 和 Simplex,我也称 Marius Halpan 为某种程度上的欺骗评估工作,是的,我可能还有几十个人,我只是分享一些更容易想到的名字。很多人都通过了数学,我们对拥有这种原型的人非常开放,并且注意到连接者,对吧?他们有经验技能,他们有理论技能,所以他们可能在很多不同的方面取得成功,但他们独特地被指定来连接这两者。现在有一些导师和项目更适合这种事情,而不是其他。像 Richard No 这样的人,历史上 Evan Hubinger,我认为 Evan Hubinger 可能是数学中最具主导性的连接驱动力,但他在下一个项目中不是导师,不幸的是,他没有时间。但是,是的,有很多不同的机会可以做到这一点。我认为即使在一些 interp 流中,也有可能进入一个可解释性流,并带来一些模型,关于你想要追求的理论基础的可解释性机制或策略,然后看到它被执行。这种情况发生过几次。我在大约 18 个月前的博客文章中注意到的一件事是,你曾评论说,资助者基本上不想,或者他们更倾向于支持他们认为“可识别”的组织的增长,这些组织的研究方向他们觉得有些成熟,或者他们能够理解。他们更不愿意资助完全新的概念方向。这似乎与 AE Studio 的调查形成了对比,他们基本上发现整个领域似乎认为我们没有我们所需的所有想法,你知道,应该尝试更多“遥远”的想法,这当然导致了他们被忽视的方法。你怎么看?有什么我们可以做的,或者,你知道,这是另一个组织的责任来解决这个差距吗?因为我确实觉得我想要更多。我喜欢 AE Studio 的一些东西,包括自我与其他重叠。我总是回到这一点,作为一个例子,它只是偏离了大多数人正在做的事情。我想,当我想到人工智能控制和 Buck 和 Redwood Research 团队正在做的事情时,我觉得那些东西很有趣。最让我印象深刻的一件事是,他们愿意处理一些在某种程度上如此令人沮丧的事情。你知道,他们说,我们将尝试弄清楚如何与人工智能合作,即使假设它们要对付我们。我心想,哎呀。我不知道我是否能够保持积极的态度,足够去做这件事,如果我从这个前提开始工作的话。我确实觉得这里相对缺乏更鼓舞人心的东西。我想到了 AE Studio,也想到了 Softmax。显然,人们对这些东西是否会奏成有不同的看法。但我很好奇你对整体组合的看法。似乎很多事情都更倾向于修补漏洞,控制人工智能,引诱它,你知道,看看它是否会上钩,然后如果它上钩就修补它。而没有多少是更... 更有色彩的未来愿景。我希望有,但也许这只是因为想法太难获得。也许是因为资助者不够大胆。你对我们如何获得,如果我们应该尝试获得更多这样的东西有什么看法?如果你认为我们应该,我们该如何去做?>> 我在这里有很多看法。所以,显然我提倡投资组合,而数学,数学一直赞助了很多项目,其他重叠项目,这个项目来自一位数学校友。我只想说 Mark Carino 可能搞错了他的名字,他是这个项目在 AE Studio 的创始人,我相信 Cameron Berg 是我和他一起运营的,他是他们一些更受神经科学启发的方法。所以 Audos 很棒。我喜欢他们所做的。我认为他们对 West Leong 的调查可能不能代表整个 AI 安全研究领域,但话说回来,它也可能代表。所以我认为我们显然需要更多的想法,因为更多的想法是好的,对吧?更多的赌注是好的,更多的射门机会是好的。现在,我不会提倡一个非常强大的迭代者放弃它,并试图想出一个新的范式。我认为这在边际上会适得其反,因为我认为我们确实有一些非常强大的核心研究赌注,我们需要更多的人去追求,因为它们会产生可衡量的结果。但如果每个人都这样做,那将是糟糕的,因为你需要有你的投资组合。也许这些方法会失败。也许它们需要其他部分的配合。许多人工智能安全研究议程在某种程度上依赖于其他事情的顺利进行或其他人对其他事情的研究。就像任何研究领域一样,你需要让每个人都推进前沿。所以我认为安全历史上一直在不同的议程上走得有点... 混乱,这是糟糕的。投资组合方法要好得多。不要排除可能的发展方向。只是转移资源并重新分配资源。值得称赞的是,Coefficient Giving 在支持各种新颖的研究赌注方面做得非常出色,尤其是在最近,他们还资助了 PIBS 或 Intelligence 原则,这是一个非常努力地追求“登月式”的可解释性和“代理理解”项目的计划。所以他们很棒。去看看他们。我认为更多的想法会很好。我认为应该追求这种想法的人通常会是某个其他领域已经成为领域专家的某个人。你偶尔会遇到像 Buckles、Evan Hubingers 这样的人,他们没有博士学位,但在 MIRI 工作了多年,你知道,在那种深度的人工智能安全... 丰富的人工智能安全经验中孵化,然后拿出像“学习优化风险”和“人工智能控制”等惊人的东西。但如果没有这种社区和研究经验的获取,我认为大多数杰出的连接者,比如你的 Alex Turners 等人,都曾在研究科学博士学位上花费了大量时间,也在课程中... 在那个环境中孵化。所以我认为数学是这样的人发展的绝佳途径,并产生更多的研究想法。事实上,我看到 Alex Turner 在数学工作期间提出了一些惊人的研究想法,我认为我们非常幸运能够支持他。比如梯度路由和 Alex Cloud,另一位数学导师,还有激活工程和转向。他就是参与其中的人之一。所以我认为,像资深研究员这样的人将是新想法和资助他们追求任何研究品味的主要驱动者,而像数学这样的项目让他们能够追求自己的研究议程也很好。我也认为赏金计划可能会奏效,但我会警告人们不要把所有的鸡蛋都放在“我们需要很多想法,因为核心想法不起作用”的篮子里。我不认为那是真的。我认为核心想法仍然是我们最好的赌注。>> 是的。好的。有道理。你想再提一下其他组织吗?比如,数学的研究员去了哪里,或者甚至创办了什么,你认为它们被低估了?这可能是我未来几集节目的编辑任务。但也只是,你知道,你认为人们应该比现在更关注的事情。>> 是的,我的意思是,有很多,你可以在我们的网站上看到所有列出的组织。那里有太多优秀的人了。我猜我可以提一下,我的意思是,很难厚此薄彼,因为数学,我们与如此多的人合作,我们试图非常广泛,但是的,我认为就非营利组织而言,因为它们可能没有得到那么多关注,显然有 Redwood、Meter、Randcast、Polar Research、FAR、Goodfire、Truthfully、Law Zero、MIRI,还有很多其他组织。我喜欢这些组织。坦率地说,我们需要更多的非营利研究组织,如果你认为你可以创办一个,那就试试吧,当然,你需要有大量的研究经验和非常可信的推荐人等等。 [叹气]>> 是的。我不知道。真的很难厚此薄彼。 [笑声]>> 是的。有很多很棒的选择可以推荐给组织。这证明了有多少学员已经取得了令人印象深刻的工作。所以你们在过去几年里推动和发展它做得很好,如果你想成为一名研究员,人们绝对应该申请。1 月 18 日是截止日期。如果你想确保你的申请脱颖而出,现在是时候开始行动了。在休息之前,还有什么需要我们谈的吗?>> 不,我真的很感谢这次经历。非常感谢邀请我来谈话。>> 这是我的荣幸。感谢你这样做,并继续保持出色的工作。Ryan Kidd,数学联合执行董事。感谢你成为认知革命的一部分。