Transcription
如果你问50个所谓“从事解释性工作”的人,什么是可解释性,你可能会得到[音乐]在某种程度上50个不同的答案。另外,就像我们所在的Goodfire公司在这个领域的位置一样。我们首先是一家人工智能研究公司,而可解释性是我们认为非常有用的方法集合,值得[音乐]专门研究,以实现我们想要实现的目标。但我也认为,我们将一些目标视为更广泛的,就像深度学习的科学,并且不采取黑盒[音乐]方法来处理内部表征,然后将可解释性引入训练,我认为这之前并没有做太多。所以,欢迎来到Lane Space。我们回到工作室,与我们的特别机械联合主持人Vivu一起。欢迎>>Mochi。Moi特别联合主持人>>以及Mochi,机械可解释性狗狗。呃,我们请来了Goodfire的Mark和Myra。欢迎。>>感谢邀请我们。>>也许我们可以介绍一下Goodfire,然后介绍一下你们。你们今天如何介绍Goodfire?>>是的。呃,这是一个很好的问题。所以,我们喜欢说GoodFire是一家人工智能研究实验室,专注于利用可解释性来理解、学习和设计人工智能模型。我们坚信可解释性将解锁下一代、下一前沿的安全强大的人工智能模型。嗯,这是我们目前的描述。我很高兴能更深入地探讨我们为实现这一目标所做的工作。>>是的。而且总是有官方描述。有没有一种非官方的描述,更能引起不同受众的共鸣?嗯,作为一家专注于可解释性的人工智能研究实验室,当人们想到可解释性时,显然有很多想法。我认为我们对它的含义以及它可以应用的领域有一个相当广泛的定义,特别是将其应用于生产场景和高风险行业,并真正将其从研究领域带入现实世界,你知道,这是一个新领域,所以这并没有做太多,我们很高兴看到它被付诸实践。是的,我想说,不久前,这个话题还在发布所谓的玩具模型或监督学习之类的东西。而且我不会认为它会发展到如此程度。嗯,当我和你在New Reps交谈时,你谈到了一些关于你的生产用例和客户的事情。然后,不埋没重点,今天我们还要宣布融资,你的B轮融资1.5亿美元,估值12.5亿美元。恭喜。你是一个独角兽。>>谢谢。是的。不,事情发展很快。我们在12月和你谈过,从那时起已经有一些重大更新了。>>我想我们也可以深入了解一下你们的背景。Mark,你在Palanteer工作,从事医疗方面的工作,这很有趣,因为GoodFire有一些有趣的医疗用例。我不知道它们在实践中有多相关。>>是的,不太相关,但嗯,我不知道,了解在医疗系统工作以及在该领域工作是什么样的,这很有帮助。>>是的。而Mara,你在Two Sigma,我实际上也曾在Two Sigma,很久以前。>>哇,真不错。我们有没有重叠过?>>不。呃,这是我短暂担任软件工程师的时候,在我成为开发者关系人员之前,现在你是产品负责人。>>你们各自的角色是什么,只是向人们介绍Goodfire所做的一切?>>是的,在Goodfire之前,我在Palunteer工作了大约3年,是一名部署工程师,现在是一个热门词汇。它一直不是这样,也是医疗团队的技术负责人。在Goodfire,我是技术团队的一员,说实话,我认为这已经尽可能具体了[笑声],因为我做过很多事情,你知道,现在是加入一个相对较小的团队的好时机。我想我加入时是公司最初的10名员工之一,现在我们有40多人,但仍然看起来总是有研究、工程和产品以及所有需要完成的事情的混合体,我认为团队中的每个人都非常擅长他们所做的工作。所以我认为你看到了一些我与图像模型相关的工作,那是一个研究演示。最近,我一直在与我们的一些生命科学合作伙伴合作,但也在从更多地利用机器学习和开发人员技能的角度构建我们的核心平台。>>非常通才。嗯,你也有一个非常像创始工程师的角色。>>是的。是的。所以,我一开始也是技术团队的一员。从一开始就做了很多事情,包括寻找我们的办公空间以及所有这些琐碎的事情。人们在你举办开放日活动时来过。那很好。>>谢谢。谢谢。是的,宣传一下来参观我们的办公室。嗯>>就像有200人的空间,但你们只有10个人。[笑声和清嗓子]>>是的。>>有一段时间非常空旷。>>但是是的,就像Mark一样,我大部分时间都在担任产品负责人。我认为产品现在是一个奇怪的角色,但很多时候是思考我们如何将我们的前沿研究真正应用于最重要的现实世界问题,以及这如何转化为一个可重复的平台或产品,并与工程和研究团队合作来实现这一点。还要向世界传达可解释性是什么,它的用途是什么,它有什么好处,为什么它如此重要?所有这些都是我日常工作的一部分。>>我喜欢“是什么”这类问题,因为这对刚接触一个领域的人来说是一个非常清晰的起点。Leo,我来做一件有趣的事,VU,你想尝试解决“什么是可解释性”这个问题,然后他们可以纠正我们。>>好的,很好。嗯,我想首先,担任产品负责人是一个非常有趣的角色,因为你们至少作为一个实验室,你们更像是一个应用型可解释性实验室,对吧?这与普通的解释性工作非常不同,有很多背景研究,但你们实际上发布了一个API来尝试这些东西,你们有Ember,你们有围绕它的产品,而很多人都没有。好的,什么是解释性?基本上,你试图了解模型内部发生了什么。有不同的方法可以做到这一点,你可以进行探测、SAE、转码器,所有这些东西。但基本上,你有一个假设。你想要了解模型内部发生的事情,然后你试图解决它。从那里,你可以做一些事情,比如,你可以进行激活映射。你可以尝试进行引导。有很多事情你可以做。但关键问题是,你知道,从输入到输出,我们想更好地理解发生了什么,以及,你知道,我们如何调整模型内部发生的事情?我做得怎么样?>>那非常好。我认为那很棒。我认为这也是一个雷区,如果你问50个所谓“从事解释性工作”的人,什么是可解释性,你可能会得到50个不同的答案。在某种程度上,GoodFire在这个领域的位置也是如此。我认为我们首先是一家人工智能研究公司,而可解释性是我们认为非常有用的方法集合,值得专门研究,以实现我们想要实现的目标。但我也认为,我们将一些目标视为更广泛的,就像深度学习的科学,并且不采取黑盒方法来处理人工智能开发生命周期的任何部分,无论是使用解释性来进行数据整理,还是在你训练模型时,还是在训练后理解发生了什么,还是在理解激活和内部表征中有什么语义。然后,还有很多令人兴奋的更新,你知道,也是融资的一部分,关于将可解释性引入训练,我认为这之前并没有做太多。很多东西都是事后对模型进行探测,而不是实际使用它来故意设计它们。这是训练后还是训练前,还是不是?>>专注于训练后。但没有理由说这些技术不能用于训练前。它似乎在训练后更适用,因为基本上我正在考虑回滚或者拥有不同模型版本,你可以用你的引导进行调整。是的。而且我认为在Twitter或其他地方看到的很多新闻中,你看到了很多训练后过程产生的意外副作用。你知道,过于谄媚的模型,或者表现出奇怪的奖励黑客行为的模型。我认为这些是极端例子。还有,你知道,非常平凡的、更平凡的企业用例,你知道,他们试图定制或训练模型来做某事,它学会了一些噪音,或者它没有适当地学会目标任务。我们一直有一个大问题是,如何利用你对模型知识和行为的理解来更有效地指导学习过程?>>是的,你知道,为了让人们理解,去年最大的争议之一是40 glazegate。[笑声]我从未听说过,我不知道原来是这个名字。>>不,博客文章上是这么叫的,我当时想[笑声]为什么开场白我称之为官方使用的术语,我想这很有趣,但就像是的,我想如果他们和Goodfire合作,他们就不会避免了,你知道吗[笑声]>>我想是的。>>是的。>>是的。>>我想那肯定是一个用例。另一个训练后有意义的原因是,我们谈论的大部分是手术式编辑。你知道,你想要能够获得专家反馈,以手术式地改变你的模型行为。无论是,你知道,消除它存在的某种行为。所以,你知道,我们一直在关注的一个领域,或者另一个你想要进行某种手术式编辑的常见领域是,一些模型存在政治偏见。比如你看Quen或R1,它们都有某种CCP偏见。你知道,>>有CCP向量吗?嗯,当然有内部的。是的。表示空间中的一部分,你可以看到它在哪里。是的。[笑声]嗯,你想把它提取出来。>>嗯,我总是说,你知道,每当你找到一个向量时,一个有趣的练习就是让它变得非常负面,看看CCP的对立面是什么。[笑声]>>满天飞的超级美国白头鹰。但是,是的,总的来说,在训练后有很多任务,你想能够做到这一点,无论是学习某种行为,还是你知道,其他一些出现这种情况的案例是,你熟悉所谓的“groing”行为吗?>>我指的是机器学习术语“groing”。>>是的。有点像双重下降的想法,即拥有一个能够学习泛化解决方案的模型,而不是即使记忆某个任务就足够了,你也想让它以更通用的方式做事。所以,你知道,另一种思考如何获得对模型内部的 хирургический 访问的方式是,从这些数据中学习,但以正确的方式学习。嗯,如果有很多可能的,你知道,方法可以做到这一点。>>可以解决双重下降问题吗?>>我想这取决于如何。>>好的,所以我认为双重上升是一个问题,因为然后你会想,如果损失曲线趋于平缓,那么你就完成了,但也许你还没有完成。>>对。[清嗓子]对。>>但是,如果你真的能解释什么是泛化的,或者什么是仍然在变化的,即使损失没有变化,那么也许你实际上可以不把它看作是一个双重问题,而实际上你只是在改变你观察损失的空间,然后你就有了一条平滑的曲线。>>是的。[笑声]我认为这肯定是我们正在解决的问题领域。是的。对我来说,双重下降是机器学习研究中最大的问题,因为如果你相信规模化,那么你就需要知道在哪里规模化,但如果你相信双重下降,那么你就不相信任何东西会趋于平缓。就像[笑声]>>是的,而且,顺便说一句,当你谈论中国向量时,还有隐性学习工作,它来自Anthropic的院士项目,基本上你可以在模型中隐藏偏见,当你提炼下来,或者你知道,当你用提炼的数据进行训练时,这些偏见总是会出现,即使你明确地试图不训练它们。所以,你知道,这只是另一个用例,好吧,如果我们能解释训练后发生的事情,你知道,我们能清除一些吗?我们甚至能确定那里有什么吗?因为,是的,有一些令人担忧的研究表明,你知道,我们真的不知道发生了什么。>>是的,我认为这是我们最希望解决的普遍情绪。没人知道发生了什么,对吧?你知道,隐性学习是一个疯狂的概念,当你想到它的时候,对吧?训练一个模型,甚至不是逻辑,而是字面上的输出文本,一堆随机数字,现在你的模型喜欢猫头鹰。你看到像这样的行为,它们违背了直觉,而且有数学解释可以深入研究,但>>嗯,早期的时候>>客观地说,有一系列数字比其他数字更像猫头鹰。应该有>>根据[笑声]根据某些模型,对吧?这很有趣。它只适用于从相同起点初始化的模型>>通常是。是的。但嗯,我认为那是一个作弊码,因为计算量不够。但就像,如果你相信所谓的“柏拉图式表征”,那么它很可能会跨越不同的模型。>>哦,你这么认为?我更把它看作是来自同一种子初始化的模型的统计产物,嗯,有什么东西是路径依赖的,从那个种子开始,可能会导致潜在空间中的某些重叠,然后进行这种提炼。是的。就像推动它朝着拥有其他倾向发展。>>明白了。>>我认为研究>>一堆这些开放式问题,对吧?就像,你不能在RL阶段训练新的东西,对吧?RL只重新组织权重,你只能做一些模型中已经存在的东西。你不是在学习新东西,你只是在重新排序链条之类的。但是,好吧,我更广泛的问题是,当你们在一个解释性实验室工作时,你们如何决定做什么,什么又是那种思维过程?对吧?因为我们可以滔滔不绝地说上几个小时。好吧,我想知道这个,我想知道那个,但具体来说,你们是如何具体地,你知道,工作流程是什么?好吧,有解决问题的办法,对吧?我可以尝试提示。我可以看看思维链。我可以训练探测器、SAE。但你们如何确定,你知道,好吧,这会走向何方?我们有固定的东西吗?只是,你知道,如果你们能谈谈的话。>>这是一个很好的问题。我觉得我们公司一开始就一直在想,让我们去了解一下今天机器学习中哪些方面不起作用。无论是与客户交谈,还是与其他实验室的研究人员交谈,试图理解前沿在哪里,以及今天哪些方面确实在崩溃,然后形成一种观点,即我们如何利用可解释性方法来推动前沿。嗯,所以,你知道,即使我们的首席科学家Tom也花了很多时间与客户交谈,试图了解现实世界的问题是什么,然后将其带回来,并试图将当前最先进的可解释性应用于这些问题,然后看看它们在哪里失败,基本上,然后利用这些失败或不足之处来理解在可解释性研究方面需要攀登哪些山峰。所以,比如在基础方面,例如,当我们进行一些应用SAE和探测的工作时,我们遇到了一些SAE的缺点,我们觉得有点令人惊讶,所以我们又回到了起点,并对更好的基础解释模型进行了研究,我们团队的许多研究都集中在SAE的下一个演进是什么,例如,当涉及到模型的控制和设计时,你知道,我们尝试了用我们的第一个API进行引导,并意识到它仍然不如提示或微调等黑盒技术。所以我们又回到了起点,我们想,如何才能不这样,以及如何超越它?我们的一位研究员ECDE,他刚刚加入,实际上是ECDE和Attakus,他们是引导专家,他们花了很多时间试图弄清楚,你知道,是什么研究使我们能够以一种更强大、更稳健的方式做到这一点。所以,是的,答案是看看现实世界的问题,试图将其转化为研究议程,然后同时在两者上进行攀登。>>是的,Mark有引导CLI演示排队,我们马上就会看到,但我总是想深入了解,当你暗示我们发现SAE有问题时。好的,是什么问题?你知道吗?然后,我们可以进入演示。>>是的,嗯,我想知道你是否也有更多想法,因为你在医疗领域也做过。嗯,但我认为,例如,当我们做一些事情,比如试图在模型中检测有害行为,或者用户可能不希望在他们的模型中存在的行为时。比如幻觉,有害意图,PII,所有这些东西。我们首先尝试使用SAPE探测器来完成很多这些任务。所以,从SAE中提取特征激活空间,然后在上面训练分类器,然后看看我们能在多大程度上检测出我们可能想在模型行为中检测到的属性。在许多情况下,我们发现,仅在原始激活上训练的探测器似乎比SAPE探测器表现更好,如果你认为SAE也捕捉到了你想要捕捉的概念,而且更精确,这有点令人惊讶。所以这是一个有趣的观察。我认为这并不是说我对SAE完全不看好。我认为它们有很多用途。但我们确实遇到过一些情况,我认为SAE所描述的概念空间不像我们期望的那样清晰和准确,以至于实际的现实世界下游性能指标。>>说得有理。>>是的。>>是的。这是无监督方法的祝福和诅咒,你必须窥视AI的思想,但有时你希望当你看到它的时候看到别的东西[笑声]。虽然在PII的例子中,我认为基于SAPE的方法实际上被证明是最具泛化性的。>>嗯,在我们与Rocketin发布的案例中,我认为它之所以有效,很大程度上是因为我们有一个更嘈杂的数据集。所以,实际上无监督学习的优势在于,当数据嘈杂时,我们确实能从SAE中获得更有意义的、可泛化的信号。但在其他情况下,当我们拥有好的数据集时,情况并非如此。>>而且因为你提到了Rakutin,我不知道我们是否还有机会,所以,Rakutin的整体使用情况或生产使用情况是什么?>>是的。他们基本上是利用我们来在推理时进行护栏和监控他们的语言模型使用和他们的代理使用,以检测PII等内容,这样他们就不会将用户私人信息路由给下游模型提供商。你知道,这每天都要处理他们所有的用户查询。这是我们几个月前与他们部署的。现在我们实际上正在探索非常早期的合作关系,不仅与Rocketin,还与其他公司合作,关于我们如何帮助潜在的训练和定制用例。>>是的。对于那些不知道的人来说,Rakutin是我认为日本第一或第二的电子商务商店。>>是的。>>是的。是的。而且我认为那个用例实际上突显了很多在实践中部署东西的样子,而你在做研究任务时并不总是会想到这些。所以,当你想到那里出现的一些比你理想化的版本更复杂的东西时,他们遇到了合成到真实转移方法。所以他们无法在实际客户数据上训练探测器、分类器之类的东西。所以他们不得不做的是使用合成数据集,然后希望它能转移到真实数据集之外的领域,这样我们就可以在真实数据集上评估性能,但不能在客户PII上训练。所以,这首先是一个巨大的挑战。你有多种语言的要求。所以这需要对英语和日语文本都有效。日语文本有各种各样的怪癖,包括导致大量错误的标记化行为,这让我们抓耳挠腮。而且,在许多任务中,你可能会做出简化的假设,如果你只是把它当作解决问题的最简单版本,只是为了获得一般结果,比如你说你正在对一个句子进行分类,看看它是否包含PII,但Racketin的需求是令牌级别的分类,这样你就可以精确地擦除PII。所以,当我们更多地了解问题时,你正在谈论它在实践中是什么样子。是的,很多假设最终都会被打破,而这只是一个例子,一个看起来很简单的问题,当你深入研究时,它会变得更加复杂。>>太棒了。关于解释性,一个有趣的事情是,很多这些方法都非常高效,因为你只是在查看模型的内部,而不是一个单独的护栏LM作为裁判,一个单独的模型,你必须托管它,二是存在整个延迟,如果你使用一个大模型,你需要第二个调用,一些关于自我检测幻觉的工作也为了效率而部署,你知道,想想像Rakuten在生产中实时这样做,你知道,这是人们应该考虑的另一件事。是的。而像探测器这样的东西非常轻量级。几乎不会增加额外的延迟。>>太棒了。你有引导演示排队。所以我们只是想看看你们有什么。我实际上不知道这是否是最新最新的,还是alpha版本。>>不,这是一个相当粗糙的演示,来自我们团队最近一次演讲。所以这会让你对引导有一个感觉。老实说,我认为这最能说明的是,随着我们公司规模的扩大,承担越来越多雄心勃勃的可解释性相关问题,其中很多都来自于各种形式的规模化。所以在这里,你将看到在一个万亿参数模型上进行引导。这是Kimmy K2。嗯,所以很有趣的是,除了研究挑战之外,还有工程挑战,我们现在正在解决,因为要让这些东西在生产中有用,你需要考虑当你使用这些方法处理前沿模型时会是什么样子,而不是所谓的玩具模型。所以,是的,这是匆忙拼凑起来的,背后相当脆弱,但我认为这是一个非常有趣的演示。所以屏幕共享已经开启。所以我这里有两个终端会话。左边是我们Kimmy CLI的一个分支版本,我们正在运行它来指向我们自定义托管的Kimmy模型。右边是一个设置,它将允许我们在特定概念上进行引导。所以,我应该可以在这里和Kimmy聊天。告诉它你好。>>这是本地运行的吗?所以CLI是本地运行的,但Kimmy服务器在办公室运行。嗯,希望如此。[笑声]嗯,>>那个Mac跑不了那么多。>>是的,我认为它需要一个完整的H100节点。我认为它可以在8个GPU上运行。H100。所以,所以,是的,Kimmyy正在运行。我们可以让它提示。它有一个我们一直在开发的SGline代码库的分支版本。所以,我要告诉它,嘿,这个SGLine代码库很慢。我认为有一个bug。你能试着找出它吗?这是一个很大的代码库,所以它会花一些时间来做这件事。然后在这里,我将实时初始化一些引导。让我看看。继续搜索任何bug。>>功能ID 43205,层20 30 40。>>所以,让我来,这基本上是我们发现的一个功能,在Kimmy内部似乎会导致它说出Gen Z俚语。>>[笑声]>>所以,在左边,它仍然在正常思考。可能需要,我不知道,15秒才能生效,但然后[清嗓子],我们希望开始[笑声]看到它。伙计,这个代码库真的很大。[笑声]所以,我们将开始看到Kimmy随着引导的生效,从正常的Kimmy过渡到Gen Z Kimmy[笑声],无论是在它的思维链还是它的实际输出中。有趣的是,你可以看到,你知道,它仍然能够调用工具之类的。它纯粹是它的举止。还有其他功能,我们发现了有趣的事情,比如简洁。所以,这是一个更实用的功能,你可以让它更简洁。嗯,它使用的编程语言类型。但是,是的,当我们看到它出现时,输出相当不错。>>调度器代码实际上是疯狂的[笑声]嗯,关于代理与编码代理的不同,我不知道。当这个东西喷出来的时候,我们怎么找到功能43205?>>是的。所以,在这种情况下,嗯,我们长期以来一直在构建的平台支持所有你可能想要的经典开箱即用的解释性技术,比如SAE训练、探测等等。我想说,对于普通的SAE来说,技术已经相当成熟了,你获取你正在解释的模型,用大量数据运行它,收集激活,然后是的,一个相当直接的管道来训练SAE。有很多不同的变体,有top kes,batch top kes,正常的relu seaes,然后一旦你有了稀疏特征,就像你说的,给它们分配标签来真正理解这是Gen Z特征。那实际上是很多魔法发生的地方。最基本标准的技巧是,看看所有导致该特征高度激活的输入数据集示例,然后你通常可以从中挑出一个模式。所以,对于这个特征,如果我用足够多样化的数据集运行了我的模型,特征43.205可能会在所有听起来像Gen Z俚语的令牌上激活。嗯,所以,你知道,你可以让人类去查看所有43000个概念,然后找出模式,但要自动化这一点,你只需要把这些例子交给一个前沿LLM,让它识别出这个模式。>>我必须问一个基本问题,你知道,我们能得到它产生幻觉的例子吗?把它传过去,看看哪个特征激活了幻觉?我能把它关掉吗?>>哦,哇。你真的解决了。>>你真的预测了[笑声]我们现在正在进行的一个项目,那就是使用解释性技术检测幻觉。这很有趣,因为幻觉是很难检测到的,而且是一个棘手的难题,而黑盒方法真的很难处理。嗯,而像Gen Z,你总是可以训练一个简单的分类器来检测它,但幻觉更难。但我们已经看到,模型内部对不确定性有一定的认识,或者某种用户取悦行为会导致幻觉行为。嗯,所以,是的,我们有一个项目试图准确地检测它,同时也致力于在模型本身中减轻幻觉行为。>>是的。我想说,大多数人仍然停留在“哦,我只会把温度调到零,这样就能关闭幻觉”的水平。我说,嗯,这是对它是如何工作的根本性误解。>>是的。虽然,所以,我喜欢那个问题的一部分是,你有一些基于SAE的方法可能有助于你解决这个问题。但通常SAE的美妙之处,就像我们说的,诅咒是它们是无监督的。所以,当你有一个你刻意想要去除的行为,而这更像是一个监督任务时,通常最好使用类似探测器的方法,并专门针对你感兴趣的要减少的东西,而不是试图,你知道,当你在分解潜在空间时,弹出的一个向量是你感兴趣的东西。而且,尽管我们正在训练一个自编码器使其稀疏,但我们并不完全确定,你知道,我们会得到一些仅仅与幻觉相关的结果,对吧?你可能会把它分成20个其他的东西,谁知道它们会是什么?>>当然,对,所以存在已知的关于特征分裂和特征吸收的问题,然后还有非目标效应。理想情况下,你希望非常精确,如果你减少了幻觉特征,突然你的模型可能无法再进行创造性写作了,你可能不喜欢这样,但你仍然想阻止它产生事实和数字的幻觉。>>好的,所以人们有一个论文推荐,我们将在节目笔记中放入,但是的,嗯,我想只是因为你的演示完成了。嗯,还有什么你想强调的吗?或者还有什么有趣的功能你想展示?>>我想没有了。是的,就像我说的,这是一个相当小的片段。我认为这里的主要观点是,目前很少有解释性被应用于如此规模的模型。你知道,Anthropic当然有一些研究,是的,其他团队也有。但很高兴看到这些技术被付诸实践。我认为不久前,实时引导一个万亿参数模型的想法听起来就像>>是的,事实是实时的,你启动了那个东西,然后你编辑了引导向量,我认为这是一个有趣的点,TBD,实际的生产用例是什么,就像实时编辑。>>就像那是演示的有趣之处,对吧?你可以看到这如何通过API提供服务,就像你只有这么多旋钮,你可以稍微调整一下,我不知道它如何与提示一起使用,或者不使用提示,我不知道它如何与微调一起使用,就像持续学习的整个炒作一样,所以有很多东西要看,它是一个额外的参数吗?就像我们把它留作默认值,我们不使用它,所以,我不知道,也许这里有人想发布一个关于如何使用它与提示一起使用的指南,什么时候做什么。>>哦,好吧,我有一个论文推荐,我认为你会喜欢的,来自我们团队的ECTEP,他是一位了不起的研究员,我对他赞不绝口。他实际上有一篇论文,以及团队中的其他人,他们基本上等同于激活引导和上下文学习,以及它们是如何从,他认为一切都是从认知神经科学的贝叶斯框架来看的。但基本上,如何精确地展示提示、上下文学习和引导如何表现出相似的行为,甚至量化你需要的引导量来诱导某种行为,类似于某些提示,甚至像越狱之类的事情。这是一篇非常酷的论文。>>你是说引导不如提示强大吗?更像是你可以写一个公式来告诉你如何转换它们?>>在极限情况下,它们实际上是形式上等价的。>>对,所以一个案例研究就是越狱,我不知道,你见过那种可以进行多重越狱的东西吗?你把大量的例子塞进上下文里。>>当他们发布那篇论文时,很多人都说,是的,我们一直在这样做,伙计们,这是怎么回事[笑声]。是的。嗯,上下文学习和激活引导等价论文中,你可以预测你需要多少例子才能越狱模型。这很酷。>>通过进行引导实验,并使用这种所谓的等价映射。>>这很酷,真的太酷了。>>这非常好。>>是的。我想说,你知道,我可以回溯一下,这很有道理,因为你知道,上下文是什么,基本上就是,你知道,它更新了KV缓存之类的,然后每一个下一个token的推理仍然是,你知道,所有权重加上所有上下文的总和,直到最新,而且你理论上可以用你的引导来引导它。你可能用你的引导来代替它。唯一的问题是,引导通常是在一个层,也许是三层,就像你做的那样。所以,它不完全等价。>>对。对。你需要精确地说明,嗯,你如何定义引导,以及你如何建模设置。但是,是的,我这里有这篇论文,“信念动力学揭示了上下文学习和激活引导的双重性质”。>>是的,标题是“信念动力学揭示了上下文学习和激活引导的双重性质”。所以,Eric Bigalow,Dana Warcraft,他们正在Goodfire进行院士项目,ECE是最后的作者。我认为,实际上,关于你的问题,引导的生产用例是什么,我认为也许你只需要从今天的引导再往上想一层,想象一下,如果你能几乎实时地将你的模型调整成一个专家级法律推理者,通过高效地利用人类反馈,或者利用你对模型知识的语义理解,以及它知道行为在哪里。我认为,虽然最终不清楚产品是什么,但它显然非常有价值。思考模型定制和适应的下一个界面是什么,这对我们来说是一个非常有趣的问题。我们确实听到了很多人对开放权重模型的微调和RL在生产中的兴趣。所以人们正在使用像Tinker这样的东西,或者所谓的开源库来做这件事。但除非你是模型训练专家,否则仍然很难让模型精确地按照你想要的方式进行微调和RL。所以,这是我们正在研究的一个问题。>>是的。嗯,我从未想过Tinker来自Thinking Machines,它以使用Rank One Laura而闻名。这基本上和引导一样吗?你知道,比较一下?>>嗯,在这种情况下,你仍然在更新参数,对吧?你没有触碰基础模型。你触碰的是一个适配器。它有点像>>是的。>>对。但我想它仍然更像是在参数空间中,而不是,我想,它可能就像,你是修改管道,还是修改流经管道的水?>>得到你想要的。>>也许是一种方式。[笑声]>>这是我的心理地图。但它触及了模型设计和有意设计这个我们非常关注的想法。而且,我希望我们回顾一下我们目前如何训练模型和训练后模型,并认为这是一种多么原始的方式。现在,真的没有意图。>>就是数据,我们唯一能控制的就是我们喂给它的数据。所以,所以Goodfire的Dan喜欢用这个类比,嗯,他有几个年幼的孩子,他谈论的是,“如果我只能通过给我的孩子饼干,或者在他们做错事时给他们拍手来教他们如何成为好人呢?”就像不告诉他们为什么错了,或者他们应该做些什么不同的事情,或者类似的事情。只是找出行动。对。确切地说。>>那就是RL。>>是的。对。而且,它效率低下,你知道,他们说什么?就像吞噬反馈。就像吞噬监督。所以,你想达到一个你可以让专家给他们的模型提供反馈的程度,这些反馈是内化的。>>而且,你知道,引导>>是推理时的一种获取这种想法的方式,但理想情况下,你正在走向一个世界,在那里,这些模型的设计将更加有意,并且会永远如此。好的,这是我们几个月前在播客上问Emanuel(Anthropic)的一个问题。基本上,问题是,你在一个进行模型训练、基础模型的实验室工作,而你又在一个解释性团队。这如何联系起来?对吧?这些想法来自预训练团队吗?它们会回去吗?嗯,你知道,对于那些感兴趣的人,你可以观看那个。那里没有太多联系,但仍然是,你知道,这是他们希望将来推动的事情。>>它可以用于以上所有情况。就像,当然有一些事后用例,它不需要触及。我认为很多人也忽略了,这些东西计算成本不高,对吧?我可以说,如果你有兴趣从事研究,机械可解释性是最容易入门的领域之一。很多这些训练探测器之类的东西,预算是,已经做了很多了,有很多开源工作,你们也做了一些。嗯,你知道,你可以>>有像Gemini团队的Neil Nanda的笔记本,他们说“这是如何做的”,一步一步地跟着笔记本走。>>即使你不是技术人员,你仍然可以取得进展。你可以查看不同的激活,但如果你想进入训练,你知道,训练这些东西,如果我错了,大概要几千美元,甚至不是那个规模。然后,同样,应用它,为训练后、RL做这件事,所有这些东西都相当便宜,以至于我想进入模型训练,我没有计算能力进行预训练之类的。所以,这是一个非常好的领域。而且,还有很多开放式问题,对吧?我们有很多问题。有些问题与,好吧,我想要一个产品,我想要解决这个问题有关。就像,还有很多开放式的东西,人们可以做,这很有趣,对吧?我不知道你们是否有任何关于开放问题、开放工作,你们是开放合作还是只是想看到它们被解决,或者只是,你知道,对于那些想进入机械可解释性领域的人来说,因为人们总是谈论它。他们应该看看什么?当然,你知道,加入你们。我想,嗯,有一篇论文,我想是Lee Shy写的。它是“可解释性中的开放问题”,我推荐所有对该领域感兴趣的人阅读。嗯,就像对该领域专家认为最重要的问题进行了非常全面的概述。我也认为,正如你所说,看到很多年轻人对可解释性产生兴趣,这真的非常鼓舞人心。实际上,不仅仅是年轻人,还有很多科学家,他们多年来一直是物理学或生物学等领域的专家,他们正在转向解释性,因为进入的门槛在某种程度上很低,而且有很多信息可以开始。有一个轶事,大学教授说,所有新来的博士生都想研究可解释性,而几年前并非如此。所以,这只是说明了该领域有多么令人兴奋,发展速度有多快,以及开始它的速度有多快,等等。而且,它也是一个非常受欢迎的社区。你知道,有一个开源的机械可解释性Slack频道,人们总是在那里提问,而且这个领域的人们总是很乐意回应,如果你在各种论坛上提问。嗯,但是,是的,开放论文“开放问题”是一篇非常好的论文。>>对于想开始的其他人,我认为,你知道,Matts是一个很棒的项目。它的缩写是什么?机器学习和对齐理论学者,我想。[笑声]>>它通常是暑期实习那种。>>是的。但他们现在全年都在做,嗯,实际上我们很多全职员工都来自这个项目,或者通过了这个项目,嗯,对于任何正在转向可解释性的人来说,这都很棒。嗯,还有几个院士项目,我们也有,Anthropic也有,所以如果有人感兴趣,这些都是很好的起点。>>我也认为它长期以来一直被视为一个研究领域,但我也认为工程师们非常需要可解释性,尤其是在Goodfire,但在其他地方也是如此,因为它确实在扩展。>>我应该提到,Lee实际上和你们一起工作,对吧?在伦敦办公室,嗯,我正在添加我们有史以来第一个机械可解释性EDI欧洲会议,因为我看到了行业应用现在正在出现,我非常兴奋,你知道,帮助推动它。>>是的,我>>它将有效地成为第一个行业机械可解释性会议。>>是的,我非常高兴你
补充说。>> 你知道,这仍然有点像一场赌博,就像这里一样,它不像那样广泛传播,但就像我我绝对可以看到,就像现在是时候真正投入其中了,就像你想要在事情上领先一样>> 当然。而且我认为这个领域也理解这一点,对吧?所以就像在ICML上,我认为今年的机械解释研讨会的标题是可操作的解释性,并且有很多关于将其推广到各个领域的讨论。嗯,>> 每个人都在添加实用的,实用的>> 可操作的,就像,好吧,我想我们以前不可操作,我不知道>> 而且我的意思是,就像你知道的,在欧洲,你看到解释室,嗯,就像一些老派的会议,我想他们有一个非常小的房间,直到他们运气好,房间翻倍了,但肯定有很多兴趣,很多小众研究,所以你看到很多研究来自大学学生,我们上周报道了一篇论文,作者是两个不知名的人,引用次数不多,但你知道,你可以在那里做出很多有意义的工作。>> 我确实想提一下的一件事是,因为我认为人们还没有真正提到这一点,那就是解释性,我认为它是一个异常重要的领域。我们还没有提到这一点。两年前的阴谋论是,当第一个SAE词来自Anthropic时,他们说,“哦,我们只是用SAE来降低坏代码向量[笑声],然后调高,然后代码>> 调高好代码。”嗯,我想,难道这不是梦想吗?你知道,就像,但基本上,我想也许为什么它很有趣?它,如果它是现实的,它就不会有趣,它会是,“不,实际上我们应该这样做”,但它很有趣,因为我们知道,我们觉得转向有一些局限性,我认为公众对转向的许多看法是像Z世代的东西,就像,哦,你可以让它非常喜欢金门大桥,或者你可以让它像Z世代一样说话,成为一个合法的,没有理由,或者似乎是一个巨大的牵强附会。>> 是的。>> 我不知道我们是否会以这种方式到达那里。>> 是的。我认为,嗯,我得说,我们很快就会宣布一些事情,我不会说太多[笑声]。嗯,但我认为,是的,这就是我们一次又一次遇到的问题,就像我们不想生活在一个转向只对风格化事物有用的世界里。这绝对不是我们追求的目标。但我认为,要实现像法律推理这样的事情所需要的干预类型比学习算法要复杂得多,也需要更多的突破。而那,嗯>> 这也是规模的一种新兴特性吗?>> 我认为是。是的。我的意思是,我认为规模肯定有帮助。我认为规模让你能够学习大量信息,并减少大量数据中的噪音。但我也认为我们认为有办法做得更有效。嗯,即使在规模上也是如此。所以,就像实际上从数据中学习你想要的东西,而不是学习数据中你不希望出现的。所以我们不是反规模,但我们也意识到规模不会让我们在未来实现我们想要的那种人工智能发展,因为这些模型变得越来越强大,并在所有这些任务关键型环境中部署。我们认为,当前的训练、部署和评估生命周期是深深破碎的,并且有机会得到改进。所以,更多信息即将到来,非常非常快>> 而且我认为基本上可能是证明这些概念确实存在的证据,就像如果你能以最精确的方式操纵它们,你就能得到你想要的理想组合,而转向可能是最粗略地看待那是什么样子,但我认为它唤起了如果你能完全手术式地控制>> 每个>> 概念,每个参数,你就能做什么。是的,没错。>> 有坏代码特征。>> 我把它拉起来了>> 恰好在你说话的时候。所以,>> 这就是人们所想的>> 有一个代码错误特征被激活,他们展示了它。它不是,它不是拼写错误检测。它是代码中的拼写错误。它不是典型的拼写错误。而且你知道,你可以清楚地看到它在代码中有错误的地方被激活。他们有恶意代码,代码错误。他们有一整堆子,你知道,细分的小粒度特征。>> 是的。>> 是的。所以,所以对我来说,粗略的直觉,为什么我谈论训练后,就是你只需要,你知道,有几个不同的推出,所有这些东西都关闭和打开,等等,然后,你知道,你可以,那是合成数据,你可以稍后进行训练。>> 是的。>> 而且我认为我们说起来比实际容易,只是说,你知道,他们做了真正艰苦的工作。>> 我的意思是,你们,你们的想法是对的。没错。是的。我们在我们的Llama模型中也复制了许多这些特征。我记得有>> 而且我认为很多这些东西都是公开的,对吧?是的,你们公开了你们的,嗯,DeepMind也公开了很多关于Gemma的SAE,甚至Anthropic也公开了很多,有很多资源,你知道,我们可以与想要参与的人分享。>> 而且还要特别感谢Neuronedia,就像,是的,这是一个了不起的作品,用来可视化这些东西。>> 是的,没错。>> 我想把话题稍微转向医疗保健领域,因为我认为这是你们的一个重要用例。我们还没有真正谈论过它。这对我是个跨界,因为我们正在,我们有一个独立的科学播客,我们正在为[笑声]科学节目开始。>> 哇,好吧。>> 只是因为这是一个巨大的投资类别,而且我也没那么有资格做。我们实际上有生物学博士来负责,这很好,但我只是想回顾一下你们在EVO 2上的工作,然后向前发展。>> 是的,当然。也许为了让对话更有条理,我认为另一个看待可解释性的有趣视角是,我们描述的许多技术都是解决人工智能-人类界面问题的方法,目标是双向通信。所以,我们一直在讨论的关于模型有意设计和转向,以及更先进的技术,是让人类将我们的愿望和控制注入模型并控制模型,反之亦然也非常有趣,特别是当你达到超人类模型时,无论是狭义的超级智能,比如这些研究基因组数据、医学影像等方面的科学模型,还是长远来看,你知道,其他形式的超级智能。人工智能能教给我们什么知识,作为那种,那种另一方向?所以我们迄今为止的一些生命科学工作正是为了回答这个问题,那就是,嗯,其中一些确实看起来像是调试各种生命科学模型,了解它们在任务上是否表现良好,或者它们是否在捕捉虚假相关性,例如基因组模型,你想知道它们是否专注于你关心的生物学相关事物,还是它使用了一些更简单的相关性,比如它正在查看的人的祖先。但同时,在它们是超人类的情况下,也许它们理解人类基因组中我们还没有命名的元素,或者,嗯,具体的,你知道,是的,它们做出的我们不知道的发现。这是一个巨大的目标。而且我们已经看到了,对吧?我们与梅奥诊所等组织合作,这是美国领先的研究医疗系统,Arc Institute,以及一家名为Prima的初创公司,该公司专注于神经退行性疾病,在我们与他们的合作中,我们使用了基础模型,他们一直在训练并应用我们的可解释性技术来寻找阿尔茨海默病的新型生物标志物。所以,我认为这只是冰山一角,但那是我们正在做的一些事情的缩影。>> 是的,我认为这非常棒。我们显然去年也做了Chan Zuckerberg播客,而且有很多模型正在出现,因为有巨大的潜力与研究。嗯,而且非常有趣的是,它基本上与语言模型相同,只是底层数据集不同,但它是完全相同的技术。就像基本上没有变化。>> 是的。[笑声]而且即使在其他领域,对吧?就像,你知道,机器人技术,我知道很多公司只是使用Gemma作为,就像,骨干,然后他们把它变成一个VLA,它采取这些行动。它,它,它都是Transformer。所以,就像我们现在有Medma,对吧?就像这周甚至有Medma 1.5。嗯,他们正在用这些东西进行训练,3D扫描,医学领域知识等等。所以,双方都有推动,但我认为,你知道,关于机械的一个问题是,你在某些领域会稍微谨慎一些,对吧?医疗保健主要是其中之一,有护栏,理解,你知道,我们对出现问题更加规避风险,所以即使从基本理解来看,如果我们信任这些系统来做出声明,我们想知道为什么以及发生了什么。是的,我认为确实存在一种部署瓶颈,实际上是将基础模型用于真实的患者使用或类似的东西。比如,如果你使用一个模型来进行罕见病预测,你可能需要一些解释,说明为什么你的模型预测了某个结果,并且需要一个可解释的解释。所以这绝对是一个用例。但我也认为,能够提取人类不知道的科学信息,以加速药物发现和疾病治疗等事情,确实是科学发现的一个非常非常大的解锁,而且你看到很多初创公司说他们将加速科学发现,我觉得我们实际上是通过我们的解释技术来实现这一点的,而且几乎是偶然的,就像,我想我们在很早的时候就接到了这些医疗机构的联系,而我们都没有医疗保健背景。>> 他们是怎么听到你们的?就像>> 一个播客。>> 好的。是的,播客。好的。嗯,现在是时候了,你知道,就像[笑声]每个人都可以给我们打电话。>> 播客是最重要的。每个人都应该听播客,每个人都应该来>> 播客。他们说,你知道,我们有这些非常聪明的模型,我们已经训练好了,我们想知道它们在做什么。嗯,我们当时真的很早,就像三个月大,而且只有我们几个人,我们说,“天哪,让我们[笑声]我们从来没有用过这些模型。让我们弄清楚。”嗯,但它也很好地证明了解释技术在不同领域都相当好地扩展。我们真的不需要学习太多关于>> 解释性是一种机器学习技术,机器学习技能无处不在,对吧?就像,然后显然,这只是一个普遍的见解。嗯,可能也适用于金融,我认为,这对于我们的历史来说会很有趣。嗯,我不知道你有什么要说的。>> 嗯,就像科学一样,我们也做过材料科学方面的工作。是的,它确实包罗万象。>> 是的,太棒了。>> 而且你知道,对于那些应该联系的人来说,你们显然是这方面的专家,但有没有人在呼吁你们寻找合作伙伴,设计合作伙伴,在你们的东西之外使用你们的东西,除了那些想要即插即用转向功能的一般开发者?就像在研究方面,更多的是,有没有理想的设计合作伙伴,客户,之类的事情?>> 是的,我可以谈谈非生命科学方面,然后我很好奇听听你对生命科学方面的看法,但我们正在寻找跨越许多领域的合作伙伴,语言,任何正在定制语言模型或试图推动代码或推理模型前沿的人都对我们非常感兴趣,然后我们也对我们在所谓的像素空间中工作的模型的前沿感兴趣。所以,如果你正在做世界模型、视频模型,嗯,甚至是机器人技术,其中没有一个非常干净的自然语言界面可以与之互动,我认为解释性可以真正提供帮助,并且正在寻找该领域的几个合作伙伴。>> 只是因为你提到了世界模型这个关键词,它是你思考的重要组成部分吗?你能给我一个定义吗?因为每个人都在问我这个问题[笑声]。>> 嗯,关于世界模型?有相当多的定义。让我们说>> 我不觉得自己有能力[笑声]成为世界模型定义的专家,但我们对它们感兴趣的原因是,它们让你能够,你知道,就像语言模型一样,当你得到特征时,你仍然需要进行自动解释等事情来真正理解这个概念是什么。但在图像和视频和世界中,很容易理解这个概念,因为你可以看到它,你可以可视化它。而且,嗯,这使得反馈周期对我们来说非常快,就像,我不知道你是否想到语言模型中的探针,然后将其转移到世界模型中,就像如果你想检测世界模型场景中的有害行为者,你实际上无法真正去标记所有那些数据,但也许你可以,嗯,通过SAE特征激活或任何东西来合成生成,你知道,我不知道,世界,就像有害行为者数据。然后实际训练一个能够更具可扩展性地检测它的探针。所以,[哼哧声]我只是认为,就像视频和图像和世界一直是我们探索并继续探索的东西。嗯,马克的演示可能是我们第一次真正觉得,“哦,哇。”就像,这真的会,这真的可以改变世界>> 转向演示。>> 是的,不,图像演示。>> 扩散的那个。没错。>> 是的。是的。我们应该展示一下,你在Worlds Fair上演示过它,所以我们可以链接它。>> 好。是的,>> 人们可以玩它,对吧?>> 是的。>> 是的。>> 是的。我认为对我来说,我思考世界模型的一种方式就是拥有一个对世界的一致模型,其中你生成的一切都运行在该世界的规则之内。想象一下,这对科学或数学或任何有可验证规则的东西来说将是一件大事, whereas在自然语言中,规则可能较少。所以,它不是,不是那么重要。>> 是的。而且,这使得对模型内部表示或其内部世界模型的调试变得更加重要,只要你能使其清晰明确并对其进行控制。我认为这使得这一切都更加重要,因为在语言中,它是一个足够模糊的领域,如果它的世界模型不像我们的那样,它仍然可以,就像,通过图灵测试一样。但我知道有一些论文研究过,即使你训练了某些天体物理学模型,它也没有像你那样学习F=MA。就像你可以,你知道,让一个模型在模运算方面做得很好,但它并没有真正学会我们如何看待模运算。它学会了一种疯狂的启发式方法,基本上功能上等效,但可能不是你希望的那种理解的解决方案。>> 这是外星人会做的方式,>> 对,没错。嗯,但,但,不,不,我认为那可能是我学习能力差的结果,而不是那个方法可能不是真的,因为那是我们人类的学习方式>> 对>> 是的,对,嗯,这只是归纳法的问题,对吧?所有的机器学习都基于归纳法,而且不可能说我有一个物理模型,你可能有一个物理模型,它总是有效,除非有一个穿着蓝衬衫和绿鞋的角色,而且,你知道,你无法证明那不是真的,除非你测试你的模型可能遇到的每一种具体情况。嗯,所以我们知道物理定律无论你在哪里,在什么情况下都适用,但从模型的角度来看,也许有些东西是分布外的,它根本不需要学习同样的物理定律也适用于那里。>> 是的。你非常兴奋,因为我读了Ted Chang的假期读物。嗯,我深受启发,读了一篇名为“理解”的短篇故事。嗯,它似乎相当古老。你一定很熟悉。对我来说,这是一个虚构的故事,它是“献给阿伦农的花”的逆向版本,一个人变得非常聪明,但也试图超越测试者。>> 而这个故事读起来就像一个超级智能的思维链,就像,哦,我意识到我正在被测试,因此,嗯,好吧,被测试的后果是什么?哦,他们在测试我,如果我得分高,他们会用我做我不想做的事情,因此我会得分低,而且,嗯,但不要太低,以免引起警惕。所以[笑声]所以模型沙袋是一种人们探索过的事情,但我只是觉得,就像,Ted Chang的作品似乎总是能激发你的灵感。我只是想让你谈谈它。>> 我认为Ted Chang有两位,他是一位科幻作家,写了很棒的短篇故事,>> 他的另一个成名作是“你生命的故事”,后来被改编成了电影“降临”。>> 没错。是的。所以,我所知道的,他有两本短篇故事集。他还有一个很棒的在线博客文章。我认为是他创造了“互联网的模糊JPEG”这个词来形容LLM。我应该核实一下,但这是一个很好的帖子。但我认为,他的几乎每一个短篇故事都对思考人工智能和人工智能研究有所启示。所以,你知道,你一直在谈论外星智能,对吧?在这个人工智能-人类沟通翻译问题中。那,你知道,正是“降临”和“你生命的故事”中的情况。而且,其他生物的思维、运作和沟通方式,不仅对我们来说难以理解,而且从根本上不同,我们甚至可能无法预料到。然后,对于可解释性来说,非常相关的是他另一本短篇故事集叫做“呼气”。而那,字面意思就是关于一个机器人对自己大脑进行解释。>> 哦,好的。>> 嗯,所以我觉得,你知道,你甚至不需要眯着眼睛就能看出其中的类比。>> 嗯,我实际上把“呼气”理解为关于熵和秩序的讨论。嗯,是的,有一个场景,基本上,嗯,所以每个人都是机器人。嗯,所以那个家伙意识到他可以设置一面镜子来处理他自己头部的后部,然后开始进行这样的操作,通过看着镜子并这样做。[笑声]>> 是的。我认为Ted Chang写过关于那个故事的灵感来源,它部分受到他一直在做的关于熵的事情的启发。据称,还有另一个短篇故事,其中一个角色去看医生,打开他的胸膛,里面有一个像打字机一样的纸带在滚动。就像他基本上意识到他是一个图灵机。嗯,我不知道,我认为,特别是当涉及到使用代理进行解释时,那个故事总是萦绕在我的脑海里。>> 我觉得脑部手术或手术的类比有点,有点病态,但它非常贴切。嗯,当我们与许多计算神经科学家交谈时,他们转向了解释性,因为他们说,看,我们对这个人工智能拥有不受限制的访问权限。它太多了。你有权访问一切。你可以进行任意多的消融实验。它是科学的绝佳床铺。嗯,你知道,人类大脑显然我们不能随便对它们做任何事情。嗯,而且,我认为现在是一个时刻,我们拥有智能系统,在许多方面可以做得比人类更好。嗯,我认为现在是时候让我们对它进行科学研究了。我将问一个简短的安全问题。你知道,我和Turk的诞生源于对齐和安全对话。安全在你们的网站上。它不是你们不优先考虑的事情,但有一种非常激进的安全派,他们想要炸毁数据中心并停止人工智能,然后有一种中间地带,这是否是你们世界的一部分的对话?你们去伯克利和Light Haven和那些人谈话吗?还是他们,你知道,有一场短暂的内战正在进行?我不知道。>> 我认为,嗯,相当多的人在伯克利待过。嗯,然后那里有我们非常钦佩和尊重的研究人员。嗯,我认为对我们来说,我们对对齐和安全有着非常务实的看法,那就是我们希望确保我们能够构建我们想要的模型,并且我们能够大规模地监督这些模型在做什么,我们认为这是许多技术对齐挑战的关键,而且我们认为这是我们的观点,这是我们的研究方向。嗯,我们当然会进行安全相关的研究,以确保我们的技术也能在,你知道,像奖励黑客和其他我们在野外看到的更具体安全问题上起作用。但我们希望能够专注于解决我们看到的挑战,让人们在未来的超级智能代理的部署中发挥重要作用。是的,我发现社区实际上是相当凝聚的。无论是谈论学术界还是前沿实验室正在进行的解释性工作,还是像数学等一些独立项目。我认为我们都在追求同一个目标。我不知道有没有人不想增加我们对模型的理解。我认为每个人,无论他们来自哪里,或者他们考虑的用例是什么,无论是将对齐作为他们关注的首要事项,还是纯粹从科学发现的角度来看,我认为我们都希望模型能够被更可靠、更稳健地控制和理解。这似乎是一个非常明确的目标。我可能会用一种U型曲线来表达,就像,如果你是极端的末日论者,你根本不想要任何研究。如果你是轻微的末日论者,你会说,好吧,有这种高度能动性的末日论者,就像,默认路径是我们都死了,但我们可以做些什么。而有些人则说,不,永远不要做任何事情。嗯,你知道>> 是的。是的。还有另一边,就像,有超级对齐,那些人说,好吧,弱到强泛化,我们会到达那里,我们将拥有比我们更聪明的模型,并利用它们来训练更聪明的模型,我们该如何安全地做到这一点?你知道,那里也有一个营地试图解决这个问题,但是的,也有很多末日论者[笑声]。>> 嗯,而且我认为,即使不考虑你应用这些问题的具体情况,也有很多东西可以学习。而且,就像,可扩展监督的概念,作为一种方法,让我们利用超级智能或当前前沿模型来帮助理解其他模型,这是另一个案例,我认为它只是一个每个人都认同的好教训,理想情况下,你正在设置你的研究,以便当超级智能到来时,它能够增强我们理解模型的能力,否则,如果系统变得越来越强大,而我们的方法只是以人类的速度线性增长,那么你就是在打一场败仗。>> 是的。是的。嗯,Viva确实提到了,你知道,你知道,我确实认为机械领域的一个持续部分是持续的强到弱,这意味着我们训练更弱的模型来理解更强的模型,类似的东西。嗯,或者我可能弄反了。>> 另一个是弱的。是的。是的。Ilia和Yan Leica提出的问题是,这会扩展吗?因为最终它们会比我们更强大,对吧?所以我不知道你对此有什么看法,因为即使看到这一点,我仍然没有克服。>> 有一篇来自OpenAI的好论文,但它有点旧了,我认为是23、24年,它字面意思是弱到强泛化,但问题是,OpenAI超级对齐团队的大部分人>> 他们走了>> 他们走了>> 但我认为这个想法,这个想法是>> 所以现在是,没有更多了>> 他们是,是的。是的。我[笑声]认为有一些新的博客文章出来了。>> 我知道。而且,你知道,请查看Thinking Machine的网站,看看谁回来了。>> 去[哼哧声]回来。嗯,[笑声]还有更多。>> 你知道,你知道我的意思吗?就像,我们太强了,似乎是一个非常不同的方向。当它第一次出来的时候,我说,“我的天,这就是我们必须做的。”>> 嗯,而且它可能与我们今天所有的技术完全不同。>> 是的。我的理解是,它更像是弱到强,当你不信任弱模型,并且你不确定是否可以信任正在开发的强模型时。我可能在这些话题上有点说得太过了,但我认为,目前我们处于一个我们信任强模型,并且它们相对对齐的状态,所以它们可以成为我们一直在解决的许多问题的优秀联合科学家,这是一个很好的状态。>> 是的。还有什么最后的想法,呼吁行动吗?>> 我不这么认为。正如我们提到的,我们正在积极招聘MLE,研究科学家。嗯,你可以在Goodfire的职业页面上查看。嗯,>> 你们在哪里?>> 旧金山。我们在,嗯,Levis Plaza,就像在Court Tower旁边。那是我们的办公室。所以,来玩吧。嗯,我们也正在寻找跨越推理模型、世界模型、机器人技术领域的合作伙伴,然后也当然是那些正在构建超级智能科学模型或关注药物发现或疾病治疗的人。我们也希望能合作。是的,也许我会这样说,就像,你知道,也许你有一个用例,LLM几乎足够好,但你需要一个神奇的旋钮来调整,这样它就能足够好。你们制造了那个旋钮。>> 是的。是的。或者其他领域的基金模型。嗯,其中一些是最,尤其是那些不透明的,因为你不能,你不能和它们聊天。>> 如果你不能和它们聊天,你会怎么做?>> 哦,嗯,就像考虑基因组模型或材料科学模型。所以,就像一个,是的,狭义的基金。是的。它们预测。是的。明白了,明白了。>> 我想说,我认为你们早期做的扩散工作很有趣,你知道,很有趣。就像你可以直接将其应用于图像,但我们没有在扩散或图像中看到太多解释性,对吧?就像我看到基因组学,>> 这将是巨大的。就像看这些视频模型,它们生产成本太高了。而且,就像,我的意思是,基本上一个Midjourney sref是一种特征,>> 对吧?>> 什么?Midjourney sref,就像,你使用的数字字符串>> 对,对,风格参考,我猜。>> 是的。不,我的意思是,我认为我们开始看到更多了,而且我会说,就像,我们的扩散模型的预览版,就像一个创意用例,以及你看到的转向演示。我认为这些更多的是演示,而不是,嗯,我们正在与合作伙伴合作的许多核心平台功能,不幸的是,它们受到NDA的约束,并且不太容易演示。但我会,你知道,希望你会看到解释性渗透到我们所做的大部分工作中,即使它是在幕后。所以,一些,是的,一些面向公众的演示可能并不总是代表,就像,这只是冰山一角,我猜是这样说。>> 好的,太棒了。感谢你们的到来。>> 感谢你们的邀请。这是一个很好的时间。