📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Building Anthropic | A conversation with our co-founders

Anthropic51:50

Transcription

我们首先为什么要从事人工智能研究?我随便挑一个贾里德。你为什么要做人工智能?——我的意思是,我研究物理学很长时间了,我感到厌倦了,我想和更多的朋友们一起玩,所以是的。——是的,我以为达里奥向你推销过它。——我不认为我在任何时候明确地向你推销过。我只是有点,喜欢,向你展示了人工智能模型的成果,然后试图说明,它们非常通用,而且它们不仅仅适用于一件事,然后,在我向你展示了足够多的模型之后,你就说,“哦,是的,这似乎是对的。”——在你开始之前,你当了多久的教授?——我想大概有六年左右。我想我帮助招募了萨姆。——我和你谈过,你说,“我认为我在这里建立了一个很好的圈子——”——是的。——“而且我的目标是让汤姆回来。”这奏效了。——克里斯,你做可解释性研究的时候,是在谷歌认识所有人的吗?——不。所以我想我实际上是在19岁的时候认识你们中的一些人,当时我正在拜访————哦,是吗?——第一次来到湾区。所以我想我那时认识了达里奥和贾里德,而且他们当时是博士后,我觉得这很酷。然后我在谷歌大脑工作,达里奥加入了,我们实际上并肩工作了一段时间。我们的桌子挨在一起,我和汤姆在那里也一起工作。然后,当然,当我去了OpenAI后,我得以和你们所有人一起工作。——是的。——所以我想我认识你们中的很多人已经十多年了,这有点疯狂。——如果我没记错的话,我在2015年认识达里奥,当时我去了一个你参加的会议,我试图采访你,谷歌公关说我需要读完你所有的研究论文————嗯,是的,我想我当时在谷歌写“人工智能安全中的具体问题”。——我想你写了一篇关于那篇论文的故事。——我写了。——我记得在我开始和你一起工作之前,你邀请我去办公室,我得以和你聊天,然后你告诉我关于人工智能的一切。我记得之后我说,“哦,我想这些东西比我意识到的要严肃得多。”你可能在解释大量的计算能力,以及参数计数,以及大脑中有多少神经元等等。——而且我觉得达里奥经常对人们产生这种影响;“这比我意识到的要严肃得多。”——是的,我带来了好消息。——但我记得我们在OpenAI的时候,有关于规模定律的东西,只是把事情做得更大,然后它就开始奏效了,然后它在很多不同的项目上都以一种诡异的方式奏效,我认为这就是我们为什么都紧密合作的原因,因为首先是GPT-2,然后是规模定律和GPT-3,我们最终————是的,我们是那些让事情奏效的人。——是的。——没错。——我认为我们也对安全感到兴奋,因为在那个时代,有一种想法认为人工智能会变得非常强大,但可能不会理解人类的价值观,甚至无法与我们沟通。所以我认为我们都对语言模型感到非常兴奋,作为一种方式来保证人工智能系统必须理解隐含的知识————以及语言模型之上的从人类反馈中强化学习,之所以要扩大这些模型的规模,就是因为,你知道,模型不够聪明,无法在上面进行RLHF,所以这就是我们今天仍然相信的安全和模型规模的相互交织。——是的,我认为规模化工作也是安全团队的一部分,你知道————嗯哼。——达里奥在OpenAI创立的,因为我们认为预测人工智能趋势对于让我们认真对待并认真对待安全问题很重要。——正确。——是的,我记得在英格兰的某个机场,我用GPT-2采样并用它写假新闻,然后发给达里奥,说:“哦,这东西真的管用。它可能产生巨大的政策影响。”我想达里奥说了些什么,“是的。”他一贯的说法。但后来我们也做了很多关于发布的事情,这有点疯狂。——是的,我记得发布的事情。我想那也是我们第一次开始合作。——是的。——那是一段有趣的时光。——是的。——GPT-2的发布。——是的。但我想这对我们来说是好事,因为我们一起做了一件有点奇怪的、以安全为导向的事情,然后我们最终做了Anthropic,这是一个更大、有点奇怪、以安全为导向的事情————没错。——一起。——所以,我想回到具体问题,因为我记得,我是在2016年左右加入OpenAI的,就像前20名员工之一,和你,达里奥一起,我记得当时人工智能安全中的具体问题似乎是第一个主流的人工智能安全————是的。——论文,我猜?我真的不知道我是否问过你它是如何产生的。——克里斯知道故事,因为他参与其中。我想,你知道,我们当时都在谷歌。我不记得我当时在做什么其他项目,但就像很多事情一样,这是我试图拖延我当时正在做的任何其他项目的尝试,而我现在已经完全忘记了它是什么。但我想是我们和克里斯决定写下人工智能安全方面的一些开放性问题,而且人工智能安全通常是以一种非常晦涩、抽象的方式来谈论的。我们能否将其与当时正在进行的机器学习联系起来?我的意思是,现在已经有,你知道,六七年的这方面工作了,但当时这几乎是一个奇怪的想法。——是的,我认为它在某种程度上几乎是一种政治项目,因为当时,很多人不认真对待安全。所以我想,有一种目标是收集一系列问题,这些问题大家普遍认为合理,通常已经存在于文献中,然后让不同机构的许多人成为作者。而且,我记得我花了很长时间与大脑的20位不同的研究人员交谈,以争取发表这篇论文的支持。从某种意义上说,如果你从问题和许多我强调的事情来看,我认为它,你知道,并没有很好地保持下去,因为它,你知道,我认为它不是真正的问题,但如果你把它看作是一次建立共识的练习,那么这里有一些真实的东西,值得认真对待,那么它就是一个相当重要的时刻。——我的意思是,你最终进入了这个非常奇怪的科幻世界,我记得在Anthropic刚开始的时候,我们在谈论宪法人工智能,我想贾里德说,“哦,我们只需要为语言模型写一部宪法,这就会改变它所有的行为。”我记得当时听起来非常疯狂,但你们为什么认为这会奏效呢?因为我记得这是我们在公司最早的,像,大的研究想法之一。——是的,我的意思是,我想达里奥和我谈论了很长时间。我想简单的东西在人工智能中确实非常非常有效。所以,我想它的第一个版本非常复杂,但后来我们把它简化了,就像,只是利用人工智能系统擅长解决多项选择题的事实,并给它们一个告诉它们正在寻找什么的提示,而这基本上就是我们所需要的。——然后我们就能写下这些原则。——我的意思是,这回到了,就像,大量的计算能力,或者苦涩的教训,或者规模化的假设。如果你能确定,你知道,你可以给人工智能提供数据,而且这是一个明确的目标,你就能让它做到。所以,就像这里有一套指令,这里有一套原则。人工智能语言模型可以阅读这套原则,并将其与它们自身正在进行的活动进行比较。所以,就像你有了训练目标,所以一旦你知道了这一点,我认为我的观点和贾里德的观点是,有一种方法可以做到这一点;你只需要调整足够多的细节。——是的。我想这对我来说一直很奇怪,尤其是在这些早期时代,因为我来自物理学,然后来自物理学,而且我认为现在我们都忘记了这一点,因为每个人都对人工智能感到兴奋,但我记得我和达里奥谈论具体问题和其他事情,我只是觉得人工智能研究人员在心理上受到了人工智能寒冬的严重打击,他们只是觉得拥有真正雄心勃勃的想法或愿景,就像,非常不被允许。而且,我认为在谈论安全方面也是如此。为了关心安全,你必须相信人工智能系统实际上可能非常强大和非常有用,而且我认为当时有一种禁止雄心勃勃的禁令。——而且我认为其中一个好处是物理学家非常傲慢,所以他们一直在做真正雄心勃勃的事情,并以宏大的计划来谈论事物,所以————是的。——我的意思是,这绝对是真的。就像我记得在2014年,就像,有些事情你说不出口,对吧?但我实际上认为这是学术界普遍存在的问题的延伸,除了理论物理学之外,它们已经因为各种原因演变成了非常规避风险的机构。而且,即使是人工智能的工业部分也已经移植或复制了这种心态。这花了很多时间。我认为直到2022年才摆脱了这种心态。——有一种奇怪的事情,就像,保守和尊重意味着什么,你可能会认为,一种版本是,保守意味着认真对待你所做的事情的风险或潜在危害并为此担心。但另一种保守是说,“啊,你知道,过于认真地对待一个想法并相信它可能会成功,就像科学上的傲慢。”所以,我认为有两种不同类型的保守或谨慎,我认为我们当时处于一个受到那种控制的体制中。我的意思是,你从历史上可以看到,对吧?就像如果你看看1939年核物理学界人士之间关于核弹的早期讨论,这是一个严肃的担忧。你看到费米抵制这些想法,因为这似乎有点疯狂。而像西拉德或泰勒这样的人则认真对待这些想法,因为他们担心风险。——是的。也许我在过去十年里学到的最深刻的教训是,也许你们所有人都以某种形式学到了,可能存在一种看似的共识,这些事情是每个人都知道的,我不知道,似乎很明智,似乎是常识,但实际上,它们只是群体行为的伪装,看起来成熟和老练。——嗯哼。——当你看到共识可以一夜之间改变——当你看到它发生了很多次,你怀疑但你并没有真正押注它,然后你说,“哦,天哪,我曾经这样想过,但我知道什么?”你知道,“我怎么能是对的,而这些人都是错的?”你看到几次,然后你就开始说,“不,这就是我们要做的赌注。我不能确定我们是对的,但就像,忽略所有其他东西,看着它发生,然后,我不知道,即使你50%的时间是对的,50%的时间是对的也贡献了很多,”对吧?你贡献了很多别人没有贡献的东西。——是的。——而且我觉得我们今天在一些安全问题上就是这样,有一种共识认为很多安全问题很不寻常,或者不是技术自然产生的。然后,在Anthropic,我们做了所有这些研究,奇怪的安全不匹配问题作为我们正在构建的技术的自然红利出现,所以我觉得我们现在处于这种反共识的观点。——但我觉得在过去,甚至仅仅是18个月里,这种情况一直在变化——我们一直在帮助改变——我们肯定一直在帮助。——不,我的意思是————是的。——通过出版和做研究。——持续的出版。——这种持续的力量。是的。——但我也认为,你知道,世界对人工智能的情绪发生了巨大的变化,而且,你知道,在我们做的用户研究中,听到普通客户说,“我真的很担心人工智能对世界更广泛的影响。”有时这意味着,你知道,工作或偏见或毒性,但有时也意味着,这会不会搞砸世界,对吧?它将如何从根本上改变人类的合作和运作方式?我实际上不会预测到这一点,你知道吗?——哦,是的。但是的,无论出于何种原因,似乎机器学习研究领域的人们总是比公众对人工智能变得非常强大更悲观————是的。——比公众。——也许是一种奇怪的——公众只是————谦逊或别的什么,是的。——当达里奥和我2023年去白宫的时候,在那个会议上,哈里斯和雷蒙多等人基本上说,我将概括一下,但基本上说,“我们盯着你们呢。人工智能将是一件大事,我们现在正在关注,”这是————他们是对的。——他们是对的。——绝对正确。绝对正确。——但我认为在2018年,你不会说,“总统会叫你到白宫告诉你,他们正在密切关注语言模型的发展。”——是的。——这是一个疯狂的地方————那不在宾果卡上。——那是2018年。——我认为有趣的一点是,我想,我们都开始从事这项工作,当时似乎并没有————嗯哼。——我们认为这可能会发生,但是的,就像费米对原子弹持怀疑态度一样。他只是一个好科学家,有一些证据表明它可能发生,但也有很多证据反对它发生。——嗯哼。——而且,我想,他认为这是值得的,因为如果它是真的,那将是一件大事。而且我认为对我们所有人来说,就像,是的,就像2015年、2016年、2017年,有一些证据,而且越来越多的证据表明这可能是一件大事,但我记得在2016年,就像和我的所有导师谈话一样————是的,是的。——我说,“我做过创业公司的事情。我想帮助人工智能安全,但我数学不好。我不知道我该怎么做。”而且我认为当时人们要么说,“好吧,你需要非常擅长决策理论才能提供帮助。”我说,“嗯,那可能行不通。”或者他们说,“我们似乎不会得到什么疯狂的人工智能,”所以我只有少数人,基本上,他们说,“是的,好吧,这似乎是一件好事。”——我记得在2014年,我作为一名记者,制作了ImageNet结果随时间变化的图表,并试图发表故事,人们认为我完全疯了。然后我记得在2015年试图说服彭博社让我写一篇关于英伟达的故事,因为每篇人工智能研究论文都开始提到GPU的使用,他们说那完全是疯了。然后,在2016年我离开新闻界去从事人工智能工作时,我有一些电子邮件说,“你正在犯一生中最严重的错误,”我现在偶尔会回顾一下,但当时从很多角度来看,认真对待这件事,认为规模化会奏效,而且技术范式可能有所不同,这似乎都是疯狂的。——你就像迈克尔·乔丹和那个高中时不相信他的教练。——但你是如何做出决定的?你感到犹豫不决,还是对你来说很明显?——我做了一个疯狂的反向赌注,我说,“让我成为你的全职人工智能记者,并将我的薪水翻倍,”我知道他们不会同意。然后我睡着了,然后我醒来就辞职了。一切都很放松。——你就是个果断的人。——在那件事上,我是。我认为是因为我像去上班,阅读存档论文,然后打印存档论文回家阅读存档论文,包括达里奥的百度论文,然后说,“这里有什么疯狂的事情发生。”而且在某个时候,我认为你应该带着信念去下注,我认为这里的每个人都在他们的职业生涯中这样做过,就是带着信念去下注,这将会奏效。——是的。——我肯定不像你那样果断。我花了大约六个月的时间摇摆不定,就像,“好吧,我应该吗?我应该这样做吗?我应该尝试创办一家公司吗?我应该尝试做这件事吗?”——但我也觉得那时候,不像现在这样谈论工程师以及工程师对人工智能的影响,对吧?——是的,是的,绝对没有。——这对我们来说感觉很自然。而且我们也在为各种不同类型的工程师争取同样的才华,但当时,就像,你是一名研究员,而只有那样的人才能从事人工智能工作。——是的。——所以我不认为你花时间考虑这个问题是疯狂的。——是的。是的,我认为那基本上是我加入OpenAI的原因,就像我给那里的人发了消息,他们说,“是的,我们确实认为你可以帮忙——”——是的。——“通过做工程工作。”——是的。——“而且你可以通过这种方式帮助人工智能安全。”——嗯哼。——我认为以前真的没有这样的机会,所以这就是————没错。——带我去的。——你在OpenAI是我的经理。——是的,没错。——我想在你待了一段时间后我才加入。——一点点。——因为我在大脑待了一段时间。——是的。——我不知道我是否问过你是什么让你加入的?——是的,我在Stripe工作了大约五年半,我认识格雷格;他曾是我的老板。他曾是我在Stripe的老板,我实际上介绍了他和达里奥,因为我说,当他开始创办OpenAI时,我说,“我认识的最聪明的人是达里奥。你能得到他将非常幸运。”所以达里奥在OpenAI,我也有几个来自Stripe的朋友去了那里。而且我想,就像你一样,我一直在思考在Stripe之后我想要做什么。我之所以去那里,只是因为我想在从事,你知道,非营利和国际发展工作之后获得更多技能,而且我实际上以为我还会回去做那些事情。就像,基本上,我一直都在工作。我说,“我真的想帮助那些比我拥有的少的人,”但我在Stripe之前没有掌握这些技能。——是的。——所以我考虑回去做公共卫生。我考虑过回去从政,但我也在关注其他科技公司和其他有影响力的途径,而OpenAI当时感觉是一个很好的交集。它是一家非营利组织,他们正在致力于一项非常宏大、崇高的使命。我真的相信人工智能,你知道,潜力,因为,我的意思是,我有点了解达里奥,所以他————而且他们需要管理方面的帮助。——他们绝对需要帮助。这是事实。所以我想这感觉非常适合我,对吧?我说,“哦,这里有一个非营利组织,还有所有这些非常优秀的人,他们都有很好的意图,但似乎他们有点混乱。”——是的。这让我觉得非常兴奋,能够进来,甚至,你知道,我是一个非常多才多艺的人,对吧?我负责人员管理,但我还负责一些技术团队————扩展组织,是的。——是的,扩展组织,我负责语言团队,我接管了————你负责政策————我负责一些政策方面的事情,我和克里斯一起工作,我觉得那里有很多员工都很有才华,我非常想来,只是想让公司运作得更好一点。——我记得在最后,在我们做了GPT-3之后,你说,“你们听说过叫做信任与安全的东西吗?”——是的,我记得!确实发生过。——是的。——是的。——我说,“我以前在Stripe管理过一些信任与安全团队。有一个叫做信任与安全的东西,你可能想为这样的技术考虑一下。”而且有趣的是,它基本上是人工智能安全研究之间的中间步骤,对吧?如何实际使模型安全,到更实际的东西。我认为说,你知道,这将是一件大事是有价值的;我们也必须每天做这种实际工作,为事情变得更高风险的时候建立肌肉。——这可能是谈论诸如负责任的规模化政策以及我们如何制定它,或者为什么制定它以及我们现在如何使用它,特别是考虑到我们今天对模型进行的信任与安全工作量,的一个很好的过渡点。那么,RSP是谁的主意?是你和保罗吗?——所以,是的,是我和保罗在2022年底,保罗·克里斯蒂亚诺,最先谈论的。——嗯哼。——最初的想法是,哦,我们是否应该将规模化限制在某个特定点,直到我们发现如何解决某些安全问题?然后我们就想,嗯,你知道,有一个地方限制它,然后又解除它,这有点奇怪,所以让我们设置一系列阈值,然后在每个阈值上,你必须进行某些测试,看看模型是否具备能力,并且你必须采取日益增长的安全和安保措施。但最初我们有一个想法,然后我们就想,你知道,如果由第三方来做,这件事会做得更好。就像,我们不应该自己做,对吧?它不应该来自一家公司,因为这样其他公司就更不可能采纳它。所以保罗实际上去设计了它,而且,你知道,它的许多许多特性都发生了变化,而我们则在我们的方面,研究它应该如何运作。而且,你知道,一旦保罗有了东西,那么几乎在他宣布这个概念后不久,我们就宣布了我们的,在一个月或两个月内。我的意思是,我们中的许多人都深度参与其中。我记得我自己至少写过一个草稿,但有几个草稿。——有很多草稿。——我认为这是所有文档中草稿最多的。——是的。——这说得通,对吧?就像,我觉得它就像美国对待宪法一样,是神圣的文件。——是的。——就像,我认为这是加强美国的一个重要因素。——是的。——而且就像我们不希望美国失控一样,部分原因是因为美国每个人都说,“宪法是一件大事,如果你侵犯了它——”——是的。——“就像,我很生气。”——是的,是的。——就像我认为RSP是我们的,就像,它是Anthropic的神圣文件。所以值得花很多精力把它做好。——我认为关于Anthropic的RSP发展,最酷的一点是,它似乎经历了许多不同的阶段,并且需要许多不同的技能才能使其奏效,对吧?有像大的想法,我觉得达里奥、保罗、萨姆、贾里德以及许多其他人都在思考,“原则是什么?我们想说什么?我们如何知道我们是对的?”但也有非常操作性的方法来迭代,我们说,“好吧,我们以为我们会看到这个,在这个,你知道,安全级别上,但我们没有,所以我们是否应该改变它,以确保我们对自己的问责?”然后还有各种组织方面的事情,对吧?我们只是说,“让我们改变RSP组织的结构,以实现更清晰的问责。”而且我认为我的感觉是,对于一份如此重要的文件,对吧?我喜欢宪法类比,就像美国有所有这些机构和系统来确保我们遵守宪法一样,对吧?有法院,有最高法院,有总统,有,你知道,国会两院,当然它们还做所有其他事情,但你需要围绕这份文件建立所有这些基础设施,我觉得我们也在这里学习这个教训。——我认为这反映了我们许多人对安全的看法,即它是一个可解决的问题。——嗯哼。——它只是一个非常非常困难的问题,需要大量的努力。——嗯哼。——是的。——所有这些我们需要建立的机构,就像汽车安全方面建立了各种机构,经过了很多年。但我们说,“我们有时间这样做吗?我们必须尽快弄清楚我们对人工智能安全所需的机构是什么,并建立它们,并首先在这里建立它们,但使其可导出。”——没错。——它也迫使团结,因为如果组织的任何部分不符合我们的安全价值观,它就会通过RSP显现出来,对吧?RSP将阻止他们做他们想做的事情,所以这是一种不断提醒大家的方式,基本上,将安全作为产品要求,作为产品规划过程的一部分。所以,就像,它不仅仅是一堆我们重复的格言;它是一种东西,如果你来这里并且不一致,你实际上会遇到它。——是的。——你必须学会跟上步伐,否则就无法奏效。——是的。——RSP随着时间的推移变得有点有趣,因为我们花费了数千小时的工作,然后我去和参议员谈话,我解释了RSP,我说,“我们有一些东西意味着很难窃取我们制造的东西,而且它也很安全。”他们说,“是的,这是完全正常的事情。你是在告诉我不是每个人都这样做吗?”你说,“哦,好吧,是的。”是的。——说不是每个人都这样做,这是半真半假。——是的。——但那很神奇,因为我们在这里付出了巨大的努力,当你把它提炼出来时,他们说,“是的,这听起来像一种正常的方式。”——是的,听起来不错。——这就是目标。就像丹妮拉说的,“让我们把它做得尽可能无聊和正常。就像,让我们把它变成一个金融问题。”——是的,想象一下就像一次审计。——是的,是的。——对吧?是的。——不,无聊和正常是我们想要的,当然事后看来。——是的。而且,达里奥,我认为除了推动一致性之外,它还推动了清晰度————嗯哼。——因为我们写下了我们试图做什么,而且它对公司里的每个人都是可读的,而且从外部来看,它也是可读的,我们认为我们应该从安全角度追求什么。它并不完美。我们正在对其进行迭代,我们正在使其变得更好,但我认为说,“我们担心的是这个,而不是那个。”是有价值的。就像,你不能只用这个词来破坏任何方向的事情,对吧?说,“哦,因为安全,我们不能做X,或者因为安全,我们必须做X。”我们真的试图让它更清楚我们的意思。——是的,它阻止你担心太阳下的每一件小事。——没错。——因为实际上是消防演习在长远上损害了安全事业。——对。——我说,“如果有一栋建筑,你知道,每周都响火警,那是一栋非常不安全的建筑。”——嗯哼。——因为当真的有火的时候,你就会————没人会关心。——“哦,它一直都在响。”所以————是的。——校准非常重要。——是的。——没错。——是的。我发现一种稍微不同的框架很有启发性,那就是我认为RSP在很多层面上都创造了健康的激励。——嗯。——所以我认为在内部,它使每个团队的激励与安全保持一致,因为这意味着如果我们不能在安全方面取得进展,我们就会被阻止。我还认为,在外部,它创造了比其他可能性更健康的激励,至少在我看来是这样,因为它意味着,你知道,如果我们必须在某个时候采取某种戏剧性的行动,比如,如果我们必须说,“你知道,我们的模型,我们已经达到某个点,我们还不能使模型安全,”这与有证据支持该决定的点以及存在一个预先存在的思考框架并且它是可读的相一致。所以,我认为RSP在许多层面上,我认为以我最初谈论早期版本时可能没有理解的方式,它创造了一个比我想过的任何其他框架都更好的框架。——我认为这一切都是真的,但我认为它低估了弄清楚正确的政策和评估以及界限应该是什么的挑战性。我认为我们已经并且将继续进行大量的迭代,而且我认为还有一个困难的问题是,你可能处于一个非常清楚某事是危险的,或者非常清楚某事是安全的,但对于如此新的技术,实际上存在一个很大的灰色地带。所以,我认为这就是,就像,所有我们说的事情都让我一开始对RSP感到非常非常兴奋,而且现在仍然如此,但我也认为以一种清晰的方式实施它并使其奏效比我预期的要困难和复杂得多。——是的,我认为这就是重点。就像————是的。——就像灰色地带是不可能预测的。有太多了。就像,直到你真正尝试实施一切,你才知道会出什么问题。所以我们正在做的是去实施一切,以便我们尽早看到会出什么问题,所以————是的,你必须————灰色地带是————你必须做三四次才能————是的。——是的。——在你真正、真正做好之前。就像,迭代非常强大,而且,你知道,你第一次不会做对。所以,你知道,如果风险在增加,你想尽早进行迭代;你不想晚点进行。——你还在建立内部机构和流程,所以具体细节可能会发生很大变化,但建立执行它的肌肉才是真正有价值的。——我负责,就像,Anthropic的计算能力,所以————这很重要。——所以,谢谢。我认为是这样。所以,对我来说,就像,我想我们必须与外部人士打交道————是的。——而不同的外部人士在,就像,他们认为事情会发展多快这个光谱上处于不同的位置。——嗯哼。——而且,就像,我认为这也是一个问题,我一开始认为事情不会发展那么快,但随着时间的推移而改变了。所以,我对此表示同情。所以,我认为RSP对我与那些认为事情可能需要更长时间的人沟通非常有帮助,因为这样我们就有一个东西,就像,我们不需要采取极端的安全措施,直到事情变得非常激烈,然后他们可能会说,“我认为事情在很长一段时间内不会变得激烈。”然后我会说,“好的,是的,我们不必采取极端的安全措施。”所以,这使得与外部其他人沟通更加容易。——是的,是的,这使得它成为一个可以正常谈论的事情,而不是一件非常奇怪的事情。——是的。——是的。它还如何体现在人们身上?你是————评估,评估,评估。——好。——一切都与评估有关。每个人都在做评估。就像,你的培训团队一直在做评估。我们正在试图弄清楚,就像,这个模型是否已经足够好,以至于它有可能变得危险?所以我们有多少团队是评估团队?你有前沿红队。一定有,我的意思是,有很多人————基本上每个团队都产生评估。——这意味着你只是根据RSP进行衡量,就像衡量某些让你担心或不担心的迹象一样。——确切地说。就像,很容易对模型的能

力设定下限,但很难设定上限,所以我们投入了大量的研究精力来说明,“这个模型能做这个危险的事情吗?也许有一些我们没想到的技巧,比如思维链或最佳事件,或者某种工具使用,会使其能够帮助你做一些非常危险的事情。”——它在政策方面非常有用,因为安全是一个非常抽象的概念,而当我像,“我们有一个评估,它改变了我们是否部署模型,”然后你可以去与政策制定者或国家安全领域的专家或我们进行的一些CBRN领域的专家进行校准,以帮助我们构建校准良好的评估,而且,反事实地,这本来就不会发生,但一旦有了具体的东西,人们就更有动力帮助你使其准确,所以它在这方面很有用。它如何体现在————RSP肯定会体现在我身上。经常。实际上,我认为,奇怪的是,我最常思考RSP的方式是它听起来像什么————嗯哼?——就像语气。我认为我们刚刚对RSP的语气进行了大修,因为它感觉过于技术化,甚至有点对抗性。我花了很多时间思考,如何建立一个人们愿意参与的系统?——嗯哼。——就像我们现在做的OKRs一样,如果RSP是公司里的每个人都能走来走去告诉你,就像,RSP的最高目标是什么?我们如何知道我们是否达到了它们?我们现在处于什么人工智能安全级别?我们是ASL-2吗?我们是ASL-3吗?人们知道要看什么,因为那就是你将拥有良好的、常识性的知识,知道有什么不对劲,对吧?如果它过于技术化,而且只有公司里特定的人才能接触到它,那么它就没有那么有成效,对吧?而且我认为,看到它逐渐演变成这样一份文件,我实际上认为公司里的大多数人,如果不是所有人的话,无论他们的角色如何,都可以阅读它并说,“这感觉非常合理。我想确保我们以这些方式构建人工智能,我看到为什么我会担心这些事情,而且我也知道如果我遇到什么事情该怎么看,”对吧?这几乎就像让它变得足够简单,以至于如果你在一个制造厂工作,并且你说,“嗯,看起来这个安全带应该这样连接,但它没有连接,”那么你就能发现它。——嗯哼。——而且领导层和董事会以及公司其他人和实际建造它的人之间有健康的反馈流,因为我实际上认为事情在大多数情况下会出错的方式就是,就像,线路没有连接,或者就像它们交叉了,而那将是一种非常悲伤的错误方式,对吧?这完全是关于操作化,让人们容易理解。——是的,我想说的是,我们没有人想创办一家公司。我们只是觉得这是我们的责任,对吧?——感觉我们不得不这样做。——就像,我们必须做这件事。这是我们让AI变得更好的方式。就像,这也是我们做出承诺的原因,对吧?——是的。——因为我们说我们这样做的原因是因为我们觉得这是我们的责任。——我想以一种有益的方式发明和发现事物。我就是这样开始的,这导致我从事人工智能研究,而人工智能需要大量的工程,最终人工智能需要大量的资本,但我的发现是,如果你不以一种你正在设定环境的方式来做,你建立公司,那么很多事情就会发生,很多事情会重复我发现技术界如此疏远的那种错误。是同样的人,是同样的心态,是同样的方式匹配。所以,在某个时候,似乎不可避免地需要以不同的方式来做。——当我们还在读研究生的时候,我记得你有一个完整的计划,试图弄清楚如何以一种能够促进公共利益的方式进行科学研究。而且我认为这与我们思考这个问题的方式非常相似。我想你有一个叫做Vannevar的项目,或者什么的,来做这件事。我是一名教授。我想我基本上看了看情况,并且确信人工智能在影响方面正处于一个非常、非常、非常陡峭的轨迹上,而且由于资本的需要,而且作为一个物理学教授,我可以继续这样做,而且我想与我信任的人一起建立一个机构来努力让人工智能做得更好。但是的,我永远不会推荐创办一家公司。或者真的想这样做。我的意思是,是的,我认为这只是一个手段。我的意思是,我认为事情通常会因此而顺利,尽管如此。如果你只是为了,就像,充实自己或获得权力,或者,就像,你必须真正关心在世界上完成一个真正的目标,然后你找到任何手段。——嗯,我经常思考的一件事是我们作为战略优势,我的意思是,听起来真的很有趣,但就像我们之间有多少信任一样,对吧?——嗯哼。——就像我认为那不是,我的意思是,汤姆,你在其他初创公司待过。我以前从未当过创始人,但实际上很难让一群,就像,一大群人,拥有相同的使命。对吧?而且我认为我来工作时最快乐的事情,而且在Anthropic最自豪的事情是,它如何成功地扩展到很多人。在我看来,在这个团队和其余的领导层中,每个人都在为使命而奋斗,而且我们的使命非常清晰————是的。——而且非常纯粹,对吧?而且我认为这是我很少看到的,就像达里奥说的,在技术行业。感觉我们所做的事情有一种纯洁性。就像,不,我同意,我们没有人说,“让我们去创办一家公司!”感觉我们不得不这样做,对吧?感觉我们不能继续在我们正在做的地方做我们正在做的事情。我们必须自己做。——而且感觉就像GPT-3,我们都曾接触过或参与过,以及规模定律和其他一切,我们在2020年就能看到它在我们面前。而且感觉就像,好吧,如果我们不尽快一起做些什么,你们就会达到不可逆转的地步。而且你必须做些什么才能改变环境。——嗯哼。——我认为,在丹妮拉的基础上,我认为这个团队中有很多信任————嗯哼。——在这个团队中。我认为我们每个人都知道我们之所以从事这项工作,是因为我们想帮助世界。——是的。——我们做了80%的承诺,那是一件每个人都说,“是的,我们显然会这样做。”——嗯哼。——是的,是的。——而且是的,我认为信任是一件非常罕见的事情。——是的。——我归功于丹妮拉保持了高标准。我归功于你————把那些小丑排除在外。把那些小丑排除在外。——首席小丑驯兽师!那是我的工作。——不,但我认为你是文化得以扩展的原因。——是的。人们说这里的人很友善。——是的。——这实际上是一件极其重要的事情。——我认为Anthropic的政治性很低,当然,我们都有与平均水平不同的视角,我试图记住这一点。——这是因为低自我。——而且是低自我,而且我认为我们的面试过程以及在这里工作的人的类型,就像,几乎对政治有一种过敏反应。——和团结。——嗯哼。——团结非常重要。产品团队、研究团队————是的。——信任与安全团队,你知道,市场推广团队,政策团队————是的。——就像,安全方面的人员,他们都在为公司的同一个目标、同一个使命做出贡献,对吧?——是的。——我认为当公司不同部门认为他们在追求不同的目标时,就会出现功能失调————是的。——认为公司是关于不同的事情,或者认为公司其他部门试图破坏他们正在做的事情。——是的。——而且我认为我们设法保留的最重要的事情是,再次,像RSP这样的事情推动了这一点,这个想法是,它不是,你知道,公司的一些部门在造成损害,而另一些部门在试图修复它,而是公司的一些部门在做不同的职能,而且它们都在一个单一的变革理论下运作。——极端的实用主义,对吧?——是的。——你知道,我最初去OpenAI的原因,你知道,它是一家非营利组织,是一个我可以去关注安全的地方,而且我认为随着时间的推移,你知道,那可能不太合适,而且有一些艰难的决定。而且我认为,在很多方面,我非常信任达里奥和丹妮拉在这件事上,但我不想

离开。我认为我实际上很不情愿接受这一点,因为我认为,首先,我不知道拥有更多人工智能实验室对世界有好处。我认为这是我非常、非常不愿意做的事情。而且我认为,同样,当我们离开时,我认为我,你知道,我不情愿创业。我认为我长期以来一直在争辩说,我们应该成立一个非营利组织,然后专注于安全研究。——是的。——我认为我们早期做得非常好的一点是,少做承诺,多兑现承诺。——是的。——对吧?——是的。——也就是说,尝试校准,现实一些,面对权衡,因为,你知道,信任和信誉比任何特定政策都重要。——是的。——拥有我们所拥有的东西非常不寻常,看着迈克·克里格为安全问题辩护,比如我们为什么还不应该发布产品,但同时也要看着维奈说:“好吧,我们必须为公司做正确的事。我们如何才能完成这项工作?”——嗯哼,是的。——听到,你知道,像深度技术安全组织的人谈论构建对人们来说实用的东西也很重要,听到,你知道,推理工程师谈论安全。这太棒了。我认为,再次强调,这是在这里工作最特别的事情之一,每个人都以这种团结一致的方式优先考虑务实、安全和业务。这太疯狂了。——最安全的选择——我把它看作——是的。——传播权衡——是的。——从公司的领导层到每个人,对吧?——是的。——我认为功能失调的世界是,你有一群人只看到一个大的,你知道,安全就像,“我们必须这样做,”而产品就像,“我们必须这样做,”而研究就像,你知道,“这是我们唯一关心的事情。”然后你就卡在顶端了,对吧?——是的。——你就卡在顶端了。你必须在两者之间做出决定,因为你没有像他们中的任何一个那样多的信息。这就是功能失调的世界。功能正常的世界是当你能够向所有人传达,“我们都在共同面对这些权衡。”——是的。——世界远非完美。只有权衡。你所做的一切都会是次优的。你所做的一切都将是试图获得两个世界的最佳结果,你知道,并没有像你想象的那样奏效,而且每个人都对共同面对这些权衡有共识,他们只是觉得他们是从一个特定的职位来面对它们。——嗯哼。——从一个特定的工作,作为面对所有权衡的整体工作的一部分。——这是对“竞相争先”的押注,对吧?——这是对“竞相争先”的押注,是的。——就像它不是一个纯粹的上涨押注。事情可能会出错,但是——是的。——就像,我们都一致认为,“这是我们正在做的押注。”——而且市场是务实的,所以如果 Anthropic 作为一家公司变得越成功,人们就有越多的动力去复制那些让我们成功的东西。而且,成功与我们实际做的安全措施联系得越紧密,它就越能在行业中创造一种引力,促使整个行业进行竞争。就像,“当然,我们会制造安全带,其他人都可以复制它们。”这很好。是的。——这是个好世界。——这真的很好。——是的。这是“竞相争先”,对吧?但如果你说,“好吧,我们不会制造这项技术,你也不会比别人做得更好,”那么最终,这行不通,因为你没有证明从这里到那里是可能的。——嗯哼。——世界需要到达的地方,更不用说行业,更不用说一家公司,它需要成功地让我们从这项技术不存在到这项技术以一种非常强大的方式存在,并且社会已经成功地管理了它。我认为唯一可能发生这种情况的方式是,在一家公司的层面,最终在行业的层面,你实际上正在面对这些权衡。你必须找到一种方法来真正具有竞争力,来真正引领行业,在某些情况下,同时设法安全地做事。如果你能做到这一点,你产生的引力就会如此之大。有如此多的因素,从监管环境,到人们想在不同地方工作,甚至有时,客户的观点——是的。——这种驱动力在于,如果你能证明你在不牺牲竞争力的同时在安全方面做得很好,对吧,如果你能找到这些双赢的局面,那么其他人就有动力做同样的事情。——是的,我的意思是,我认为这就是为什么把 RSP 之类的事情做好如此重要,因为我认为我们自己,看到技术的发展方向,经常会想,“哦,哇,我们需要非常小心这件事,”但同时我们必须更加小心,不要大喊大叫,说,“创新必须在这里停止。”我们需要找到一种方法来使人工智能对客户有用、创新、令人愉悦,同时也要弄清楚我们能够坚持的限制是什么,使系统安全,这样其他人才能认为他们也可以做到这一点,他们可以成功,他们可以与我们竞争。——我们不是末日论者,对吧?我们想建立积极的事物。——是的。——我们想建立美好的事物。——而且我们已经亲眼看到了。在我们发布 RSP 几个月后,三家最著名的人工智能公司都有一个,对吧?可解释性研究,这是我们做的另一个领域。就像整体对安全的关注,与人工智能安全研究所的合作,其他领域。——是的,边境红队几乎立即被克隆了,这很好。你希望所有实验室都测试非常非常令人担忧的安全风险。——出口安全带。——是的,没错。——嗯哼,出口安全带。好吧,杰克也提到了,但客户也非常关心安全,对吧?客户不想要会产生幻觉的模型。他们不想要容易被越狱的模型。他们想要有用的、无害的模型,对吧?——是的。——所以很多时候,我们在客户电话中听到的就是,“我们选择 Claude,因为我们知道它更安全。”我认为这也是巨大的市场影响,对吧,因为我们拥有值得信赖和可靠的模型的能力,这对我们给竞争对手施加的市场压力也很重要。——也许可以稍微展开一下达里奥说的话,我认为有一种说法或一种想法,也许有德行的事情就是近乎高尚地失败,对吧?就像你应该去,然后把安全放在首位,你应该去把事情放在首位,你应该以一种不切实际的方式来展示,这样你就可以向事业展示你的纯洁性,或者类似的东西。我认为如果你这样做,它实际上是非常适得其反的。首先,这意味着那些负责做决定的人,将是那些不在乎、不优先考虑安全、也不在乎的人。而且我认为,另一方面,如果你努力寻找一种方法来协调激励机制,并使其在需要做出艰难决定的时候,发生在最有可能支持做出正确艰难决定的地方,并且有最多的证据,那么你就可以开始触发达里奥所说的“竞相争先”,而不是让那些在乎的人被排除在外,而是拉拢其他人来跟随。——那么,你们对我们接下来要做的项目有什么兴奋之处?——嗯,我认为有很多理由让你对可解释性感到兴奋。一个显然是安全,但另一个我认为我在情感上同样兴奋或同样有意义,那就是我认为神经网络很美,而且我认为它们里面有很多我们看不到的美。我们把它们当作黑箱,我们对内部的东西不太感兴趣,但当你开始往里面看时,它们充满了惊人的、美丽的结构。你知道,这就像人们看着生物学然后说,“你知道,进化真的很有趣。它只是一个简单的东西,运行了很长时间,然后它就制造出了动物,”然后就像,相反,就像,实际上,你知道,进化产生的每一种动物,我认为,你知道,它是一个优化过程,就像训练神经网络一样。你知道,它们充满了令人难以置信的复杂性和结构,而且我们拥有一个完整的人工智能生物学,存在于神经网络中。如果你愿意往里面看,那里有所有这些惊人的东西。而且我认为我们才刚刚开始慢慢地揭开它,这令人难以置信,而且那里有很多东西,但我们发现的东西太多了。我们才刚刚开始打开它,我认为这将会是惊人和美丽的。而且我有时会想象,你知道,就像十年后,走进一家书店,买一本关于神经网络可解释性的教科书,或者真正地,关于神经网络生物学的教科书,以及里面会有多么疯狂的东西。而且我认为在接下来的十年里,甚至在接下来的几年里,我们将开始深入研究并真正发现所有这些东西。这将是疯狂而令人难以置信的。——你还能买到自己的教科书,这也很棒。——就印上你的脸。——我的意思是,是的。——我很高兴几年前如果你说,“政府将设立新的机构来测试和评估人工智能系统,而且它们实际上会是称职且优秀的,”你不会认为会是这样。但它发生了,这就像政府建造了新的大使馆,几乎是为了处理这种新的技术类别,或者像克里斯研究的那种东西。我很高兴看到它会走向何方。我认为这实际上意味着我们有国家能力来应对这种社会转型,所以不仅仅是公司。我很高兴能为此做出贡献。——我今天在一定程度上已经对此感到兴奋了,但我认为只是想象一下人工智能将为人们做些什么,就不可能不感到兴奋。达里奥经常谈论这一点,但我认为即使是克劳德在疫苗开发、癌症研究和生物研究方面的帮助,也是疯狂的,就像,只是能够看到它现在能做什么,但当我快进到三年后或五年后,想象克劳德实际上可以解决我们作为人类面临的许多基本问题。即使只是从健康的角度来看,即使你把其他所有东西都排除在外,对我来说也感觉非常令人兴奋,就像回想起我从事国际发展的时候一样。如果克劳德负责帮助完成我 25 岁时试图以效率低得多的方式完成的许多工作,那就太好了。——我的意思是,我想类似地,我很高兴为工作构建 Claude。就像,我很高兴将 Claude 构建到公司和世界各地的公司中。——我想我只是,我想,就个人而言,我喜欢在工作中大量使用 Claude,所以,当然,在家里的时间越来越多,我只是和 Claude 聊天。我认为最近最大的事情是代码————嗯哼。——就像六个月前,我没有用 Claude 做任何编码工作。就像,我们的团队并没有真正大量使用 Claude 进行编码,而现在它就像一个相位差。就像,我上周在 YCU 做了一个演讲,一开始我只是问,“好吧,那么这里有多少人现在使用 Claude 进行编码?”然后字面意思是 95% 的人举手————哇。——哇。——就像,房间里所有的手,这与四个月前或几个月前的情况完全不同。——嗯哼。——是的。——所以当我想到我兴奋的事情时,我想到了那些地方,就像我之前说的,那里有一种共识,再次,看起来是共识,看起来是所有明智的人的想法,然后它就破裂了,所以我想那些即将发生但还没有发生的地方。其中之一就是可解释性。我认为可解释性是控制和制造安全人工智能系统的关键,而且我们即将理解,可解释性包含了关于智能优化问题以及关于人脑如何工作的见解。我说过,我真的不是开玩笑,克里斯·奥拉将是未来的诺贝尔医学奖得主。——哦,是的。——我是认真的。我是认真的,因为其中很多,我曾经是一名神经科学家,很多精神疾病,那些我们还没有弄清楚的,对吧,精神分裂症或情绪障碍,我怀疑有一些更高级的系统问题在起作用,而且很难用大脑来理解它们,因为大脑太混乱,难以打开和互动。神经网络不是这样的;它们不是一个完美的类比,但随着时间的推移,它们将是一个更好的类比。这是一个领域。第二,与此相关的是,我认为人工智能在生物学中的应用。生物学是一个极其困难的问题。人们继续持怀疑态度,原因有很多。我认为共识正在开始破裂。我们看到阿尔法折叠获得了诺贝尔化学奖;这是一项了不起的成就。我们应该努力制造能够帮助我们创造一百个阿尔法折叠的东西。最后,利用人工智能来增强民主。我们担心如果人工智能以错误的方式构建,它可能成为威权主义的工具。人工智能如何成为自由和自决的工具?我认为这一点比前两个要早,但它将同样重要。——是的,我的意思是,我想有两件事至少与你刚才说的联系起来,我的意思是,一个是我觉得人们经常加入 Anthropic,因为他们对人工智能非常好奇,然后被人工智能的进步说服,分享了不仅要推进技术,还要更深入地理解它并确保它的安全的愿景。而且我觉得,与那些在人工智能发展方面以及与之相关的责任感方面,他们的愿景越来越一致的人一起工作,这实际上非常令人兴奋。而且我觉得这在过去一年里发生了很多,就像汤姆谈到的那样。另一个是,我的意思是,回到具体的问题,我觉得我们到目前为止在人工智能安全方面做了很多工作。很多都很重要,但我认为我们现在,随着一些最近的发展,我们确实看到了可能从非常非常先进的系统中产生的风险的迹象————嗯哼。——这样我们就可以通过可解释性、通过其他安全机制来研究和学习它们,并真正了解非常先进的人工智能可能带来的风险。而且我认为这将使我们能够以一种真正深刻的科学、实证的方式来推进使命。所以我对未来六个月我们如何利用我们对先进系统可能出错的理解来表征它并找出如何避免这些陷阱感到兴奋。——完美。结束!——耶!——我们做到了!——哇!——好时光。——我知道。我们应该经常这样做。