Transcription
[掌声] 各位听众,大家好,欢迎回到 No Priors。今天我们请到了 Eric Zelkman,他曾任职于斯坦福大学和 XAI。我们将探讨他在研究、推理和扩展强化学习方面的贡献,以及他的新公司 Humans End。Eric,非常感谢您接受采访。>> 谢谢。>> 作为一名研究员,您产生了巨大的影响,尤其是在您还在斯坦福大学的时候。我想听听这方面的事情。但首先,能否介绍一下您是如何对机器学习产生兴趣的?>> 我想,如果追溯到很久以前,我一直被这样一个问题所驱动:你知道,外面有这么多人,他们拥有各种各样的才能,对各种各样的事情充满热情。你知道,有如此多的……你知道,外面有如此多的才华。而我一直有点失望,你知道,如此多的才华没有得到利用,仅仅是因为每个人都有自己的处境,你知道,他们有……你知道,他们无法真正追求那些事情。所以对我来说,人工智能……>> 所有人都没有发挥出他们的全部潜力。我的意思是,>> 然后你开始做人工智能。>> 我的意思是,我一直以来都感到兴奋的是,如何真正构建这项技术,让人们能够去做他们热衷的事情?我的意思是,基本上,你知道,是的,如何让人们真正专注于那些事情。你知道,最初我将自动化视为一种最自然的方式。你知道,你自动化掉那些人们不太想做的事情,你知道,>> 让人们可以去做他们想做的事情。>> 但我想我越来越意识到,这其实非常复杂。如果你想赋能人们去做他们想做的事情,你必须真正理解人们到底想做什么。嗯,构建理解人们目标和结果的系统实际上非常困难。>> 嗯,是的。>> 你在选择研究问题时,最初是否就带有这种以人为中心的视角?>> 我想,在最开始的时候,我只是……当我选择研究……>> 所以,首先是整体能力的提升。是的。我想,对我来说,你知道,当我看到像人工智能,或者你知道,像 2021 年左右的语言模型时,你知道,我想,这些东西并不聪明,它们做不了多少事。而且当时有一些早期工作……你知道,例如,你可以使用……链式思维来……你知道,让模型……>> 更聪明地回答,但当时仍然只是……小小的进步。当时仍然……你知道,这样做的好处是,你知道,你只能通过提示真正获得多少。所以当时我想,好吧,如何才能让它们……半像样地解决这些更难的问题呢?>> 您能给出一个广泛的……我们这里有从研究人员到商界人士的各种听众。您能给出一个关于 Star 的广泛的直觉吗?我想,直觉是,如果你有一个模型,它能够解决这些……基本的……这些稍微难一点的问题,通过思考它们,那么如果你真的教它……嘿,你提出的这个解决方案,让你得到了正确的答案,做得好。或者,你知道,如果……你或者模型没有做到,那么你基本上……不奖励它。我想,SAR 的原始版本实际上有……或者,是的,当时没有……没有基线。我们将其与……强化学习进行了比较,这是一种……我认为在强化学习中很流行的算法,非常简单的……策略梯度东西。但是的,我想,你知道,当时它是一个非常简单的算法,只是……你知道,你……迭代地生成解决方案。如果解决方案让你得到了正确的答案,你就从中学习。如果不是,你就不学习。然后你就一直这样做,模型解决越来越难的问题,然后从越来越难的问题中学习。>> 你……在研究的哪个阶段,如果有的话,你对它的有效性感到惊讶,还是你对它具有可扩展性有某种直觉?>> 我记得做过一个实验,虽然这已经是很久以前的事了。嗯,我们研究了……我想是……N 位数的……加法或乘法。抱歉,已经过去一段时间了。>> 嗯,有一件事非常有趣,那就是当时……这被认为对语言模型来说是一项困难的任务。当然,它被认为是……它们仍然如此愚蠢的原因之一。是的。就像,>> 没错。而且我想,嗯,对我来说,非常有趣的一点是,随着你训练的迭代次数越来越多,它实际能够处理的位数也在不断增加。好的。>> 我认为这是我遇到的一个重大惊喜……就像,哇,这里没有明显的平台期。>> 然后你直接从那里转向了“这应该会扩展”?我想,我总体上……我的兴趣在于……是的,我认为有几件事……其中一部分是我们引入的……我们观察到模型没有从大量数据中学习。所以我们提出了另一个变体,我们实际上……我们说,如果我们……你真的把那些失败的例子……你……基本上……让它推理为什么它应该得到正确答案,然后你像它得到了正确答案一样进行训练。嗯。>> 嗯,这个版本……是一种……扩展到……它无法……它无法看到的数据部分的方法。>> 所以,如果你只在……积极的例子上进行训练,那么你就会陷入一种……潜在的最小值,那里不再有任何数据可以……它实际上可以解决。所以当时我们想,如果我们……只是向它展示它没有解决的问题,并尝试从中学习呢?但我想,从那时起,其他工作也做了一些事情,那就是……哦,如果你只是……大量采样……这似乎也有效……在那些工作中。>> 自从您发表 Star 以来,它已成为推理范式中广泛使用的部分。您能否也描述一下……我想这是您最后发表的作品……Qstar?>> 哦,是的。所以 Qstar 是……基本上是我在斯坦福大学做的最后一件事,它非常有趣。我想,我们展示了一些很酷的东西。这篇论文的主要目标之一是表明你可以……实际上将其扩展到……预训练规模。是的。通过使用……基本上是预训练风格的数据。我想,现在已经有很多……最近出现的工作……围绕着……你知道,强化学习预训练之类的。而且,你知道,我猜在某些方面,这与我们在 Qstar 工作中展示的一些内容相似。与其有问答,不如……你实际上只有……你知道,这些任意的……文本块,例如,它试图预测接下来会发生什么,这就像标准的语言建模目标。>> 你真的能得到……模型……更普遍地学会推理吗?我认为关于最初的 Qstar 论文,一个更酷的事情是,我们展示了……一些关键的改进……Star 论文,这些改进对于实际做到这一点至关重要。所以,例如,我们展示了……对于这个算法来说,在线是非常有价值的。嗯。>> 嗯,展示了……拥有一个基线……你……你知道,越难的问题,你学到的越多……越容易的问题,你……学到的就没那么多。而且我认为其中有很多……即使在当时,我也不认为我完全……你知道,认为它们是……哦,哇,这实际上是……对最初的东西的一个很酷的改进。所以你最终去了 Grok 工作了几年,然后你……抱歉,XAI 工作了几年,你研究了许多不同的范式,比如 Grok 2 的预训练数据,然后是 Grok 3 的整体推理配方。我敢肯定我遗漏了一些东西,但……工具使用和 Grok 4 的代理基础设施。我想,如果你给我们一个今天的基准……模型有多聪明?它们显然可以进行 N 位数的……算术。>> 我想,就……智商而言,我会说……有很多……如果你能够很好地提出问题……一些非常先进的……物理问题或数学问题,我会说它们……它们……相当聪明。我认为……很多失败……人们……给我一个人类的比较。什么是相当聪明?>> 我认为……直接比较很难,因为它非常参差不齐。>> 是的。>> 就像……就像……确实,就像……其中一些,例如,其中一些 HLE 问题……这些模型能够解决……确实是……对于……真正的……博士研究人员来说,并非易事。我不是说它们是……就像……开放性问题,或者别的什么。>> 但它们确实……相当难。而且很多……你知道,一个有趣的类别……我花了很多时间研究 HLE 问题……一个有趣的类别是……>> 抱歉,人文科的期末考试,对于任何不看 AC 成绩的人来说,都没有什么意义。>> 嗯,是的。>> 所以,是的,看看这些人文科期末考试问题,我……嗯……嗯,一个……实际上相当大的类别是……这些……棘手的……需要……你知道,基本上是……你,如果你熟悉它,你会说,“哦,他们正试图让你……假设某事。”但实际上,如果你更仔细地考虑这个问题,那个假设就不成立了。>> 嗯,这……这被证明是……很多这样的问题。所以,我认为……它们相当聪明,但它们也……我更……我认为它们更容易被……一些……棘手的事情所困扰。>> 嗯,但它们也……我真的不认为……我认为核心问题之一是它们……在情感上并不聪明,或者……它们在……真正理解……人们关心什么,或者……如何真正……帮助人们实现他们关心的事情的层面上并不聪明。我想谈谈这个和你接下来的任务。但就……即使在……我猜在智商领域,这种参差不齐的智能……我认为行业中的几乎所有人直到现在都专注于此。你有什么建议给那些不是研究人员的人,让他们对这种表面现象产生某种直觉?因为这似乎对于让它们有用非常重要。>> 是的,我想,有一件事……我认为……非常重要的一点是……你给当前一代模型提供的……上下文越多,你就越……你的答案就越好。>> 嗯,它们对……你知道,任何额外的……信息都非常敏感。是的,我认为这是一件非常重要的事情。我通常会说……现有的模型特别擅长处理……容易以……封闭形式回答的问题……就像……如果……你知道,有一个简单的数字答案……你问的问题,或者……从一组事物中选择一个简单的方法。这是这些模型……实际上……显然,这取决于……但这对模型来说更容易。如果你能想象……很容易检查你的答案……这实际上……我认为这会让模型更容易。你认为……模型在……代码等……更可验证的领域中仍然在复杂任务上失败的……最主要的解释是什么?>> 是因为……给了它们错误的上下文吗?是……上下文窗口……根本不够大,无法支持……草稿板和持续测试?那么,为什么在这些领域……最大的挑战是什么?一部分是……我认为存在一个平衡……当人们……想要给用户提供这些模型时,实际上重要的是它们……不会慢得令人讨厌。所以我想,实际上有很多问题……你知道,如果你给模型更多的时间……你知道,它们实际上能够……更好地回答。>> 但例如,在……编码的上下文中,你必须……相当有响应能力。至少……这取决于……设置的类型,对吧?就像,如果你看看……像……你知道,OpenAI 的 Codex 这样的产品……>> 嗯,它基本上是……一个更长的……后台运行的东西……与……光标相比,它……你知道,更具交互性。你在这方面有更多的奢侈。>> 对于那些……更多的后台方法……来解决更难的问题。>> 我认为,我认为这是一个……棘手的问题。嗯,很多事情取决于……你所要求的东西的分布……与模型实际训练的分布……有多远。>> 嗯。>> 所以,你知道,如果你碰巧问了一个……与它以前见过的问题非常相似的问题,那么,你知道,它会做得很好。>> 嗯。>> 而如果你问了一个……非常……域外的问题……所以,在某种程度上,这个问题很难……具体回答……除非你知道……基本上……这些……很多……你知道的……特定任务的……强化学习数据是什么。>> 对。>> 而今天……显然,没有……模型或代码代理……代码接口公司……会发布……能力图……给你……它们的强化学习数据是什么样的……这将非常有用,因为……我的意思是,直观地说,除非……如果你只是看看……预训练的互联网数据集之外……有……问题的类型和……代码库的类型……远远超出分布……所以当工程师……在这些情况下尝试时,显然他们会得到一个……愚蠢的代理。>> 嗯。>> 而且,你知道,还有……另一件很重要的事情是……你试图让模型做的事情……有多可验证。我的意思是,显然,有很多……工作……关于让模型……不那么依赖……可验证的奖励。>> 嗯,有很多很酷的已发表论文。我相信大多数人会说……在模型在可验证任务上的表现与不可验证任务上的表现之间仍然存在差距。是的,绝对。关于智商的最后一个问题,但因为它是……90% 以上的行业精力……字面上的精力……和计算力……都集中在这里。你如何描述我们目前的规模化程度,以及从中改进的明显机会?>> 仍然存在有意义的……规模化维度……我认为……尚未完全探索……就……你知道,智商而言。我认为有很多很酷的努力……有很多很酷的东西……可以……你知道,仍然可以在能力轴上完成。>> 我确实认为,当……你开始考虑……一些新的……规模化轴时,它实际上非常自然地意识到……有一些方法可以……以……包含人的方式来做它们,并且有一些方法可以……以……越来越多地将人排除在外的方式来做它们。嗯。>> 而且要非常注意……哦,嘿,我正在设计这个新算法,它将……将这个模型的智商……提高 X 倍。>> 嗯。>> 如果你有效地……让人们……有效地让人们参与进来……实际上是一个非常活跃的……决定。>> 嗯。>> 嗯。>> 所以,你知道,我认为总的来说,如果你在考虑这些事情,那很重要。难道不能公平地说,许多实验室的本能是……从规模化的角度来看,尽可能地将人们排除在外,因为那非常混乱,对吧?如果我想招募人们……例如,从他们那里获取复杂的推理轨迹……在那些……对我来说还不是……域内……的任务中……执行起来……不如……更多的推出……那么简单。>> 是的。>> 那么,从能力的角度来看,这为什么如此重要?>> 我的意思是,这是一个很好的过渡……到……你在做什么。是的,我会说……主要的事情是……随着……你拥有这些模型……你知道,在……它们自动化的……范围方面……你知道,你有这些模型……最近……IMO 的结果……是一个很好的例子。你有这些模型……持续……你知道,数小时的……推理……没有任何……人类干预。而且,我认为这已经成为……这些实验室……成功的……一个日益增长的衡量标准。所以,例如,你知道,有一个 METR……仪表……基准……每个人都喜欢分享……每当有一个新模型出现时。>> 而且就像……哦,我们从……能够让这些模型……自主地完成……两个小时的任务……而无需人类干预……到……两个半小时的任务……而无需人类干预。而且,显然,有一些问题……这些数字实际上意味着什么。>> 嗯。>> 而且……我们应该……如何……认真对待它们。>> 但无论如何,这已经成为……人们……越来越多地用来衡量进展的……指标。但是,你知道,随着我们……这些模型……越来越多地……将人们从互动中移除……你基本上……人们对……他们构建的东西……拥有更少的发言权。>> 你会得到……你知道,我认为……如果你有一个模型……自己去……做它自己的事情……八个小时……然后回来给你……一些……有点……>> 我认为这是一个……奇怪的领域……人们可能会觉得……对他们正在构建的东西……拥有更少的……真正的代理权。而且我认为,我也……我预计人们会觉得……他们不真正理解……正在构建的东西。>> 你知道,我认为……>> 这已经是真的了。>> 我认为这已经是真的。>> 20,000 行生成的代码……对我来说看起来不错。>> 是的。>> 这就像……你提交了这些 PR,它们是……100,000 行……你知道,就像……>> 而且我认为总的来说,这将是……趋势的一部分。那么,你认为……在……产生输出或推理的过程中……让人类参与其中很重要吗?因为……有机器人在场……天花板更高……因为它更有效率……因为我们可以在模型偏离路径时进行纠错……还是……从哲学的角度来说……因为人们想要……或者……所有这三者的某种组合?>> 是的,我认为这很可能是一种组合。我想,还有一件事……我一直在思考的是……你知道,最自然的事情是……当你……自动化掉现有的任务集时……你知道,你……看看世界的 GDP……你……从中划出……最容易被这些模型取代的部分……你知道,这就是你……瞄准的东西……哦,哇,你知道,编码是一个……X 十亿美元的市场,让我们……自动化所有这些。或者……你知道,这个细分市场是……X 十亿美元的市场,让我们……自动化所有这些。但我实际上认为……如果你……赋能人们……如果你……拥有真正理解人们正在做什么……并真正支持他们完成这些事情的模型……你就有可能……扩大这个馅饼,而不是……基本上取代所有这些细分市场。嗯。>> 而且我认为总的来说……如果这些模型的目的是……基本上……取代……这个人……完成……这项工作……你最终会得到……更少的……我认为……真正的创新……关于……可能发生的事情。是的。我认为,如果你实际上拥有……真正理解人们的目标……并真正赋能他们的模型……你就会处于一个非常不同的境地。>> 因为我们将把这些能力推向……对它们来说是域外……的领域。好的,酷。>> 我认为……>> 这是准确的吗?我只是……>> 是的。不,我……我会这么说。我认为……就像……当我……说……我喜欢……研究……赋能人们而不是取代他们的模型时……人们会说,“哦,是的,当然。”就像……但我宁愿……你知道,去治疗癌症……或者别的什么。显然,这是一个非常重要的目标……构建能够……解决……你知道,人类最困难和最根本的问题……是……非常重要的。但我也认为……而且,你知道,我……我敢肯定,该领域的许多研究人员……不同意。我想,长远来看,我们会看到……会发生什么。嗯。>> 但我个人坚信,我们更有可能……通过合作……来解决……许多这些……根本性的人类问题。通过构建……非常擅长与……大量人群合作的模型……非常擅长理解……不同人的目标……不同人的雄心……不同人的价值观……理解不同人的弱点……以及如何……与这些……大量人群协调……以使每个人都更有效。而且我认为……就像……这个人工智能的愿景……它自己去……工作 20 小时……做它自己的事情……然后……你知道,带着……你知道,关于生命、宇宙和一切的答案……回来。我认为……这个……不太可能。>> 嗯。>> 我认为……你知道,这是……>> 我猜我们得看看,但我认为……不太可能。所以……嗯……这就引出了你正在创办一家新公司 Humans。我记得……实际上……从根本上感到惊讶……考虑到你在……智商、推理、编码和……规模化方面所做的一切……你对……基本上是情商……感兴趣。而且你还认为情商……告诉我,如果这是错误的描述……就像……模型今天的情感或交互能力……已经体现在……例如……角色扮演或……陪伴工具中。而且你还认为它……也是……从生产力角度……赋能……对吧?>> 嗯,所以……告诉我……这个思路是从哪里来的。>> 是的,我想,我一直在思考……这类事情……已经有一段时间了。就像,即使在我读博士的时候,我想,我……我猜不太出名的一项工作实际上是关于……我们展示了你可以……训练语言模型来模拟……不同类型的学生。>> 对。>> 嗯。>> 和测试。>> 是的。是的。而且……通过模拟学生……你实际上可以为这些学生设计更好的测试。而且那是一个……非常酷的发现……嘿,如果你有……非常擅长建模人的模型……你实际上可以设计……对人来说更好的系统。而且……这是我……发现非常酷的事情。而且……嗯……嗯,随着我们……走向当前……能力的前沿……越来越明显的是……你知道,我们有这些……极其聪明的模型……能够做很多事情……但它们并没有……被用于……它们能力范围内……的任何地方。就像……它们在人们生活中的作用……远没有……那么深入,那么积极……它本可以。而且我花了很多时间思考……好吧,为什么……为什么这些模型……不像……我刚才说的……更深入地……积极地融入人们的生活?而且似乎……一个非常大的部分是……基本上……这些模型……并不真正理解人……它们不理解人的目标……它们被训练……我认为……一部分是……该领域……普遍的……训练范式。它非常……我认为……专注于单一任务……或以任务为中心。>> 荒谬的是,所有基准测试仍然是这样。>> 是的。>> 是的,我的意思是……就像……>> 或者大多数。>> 你知道,我的意思是,即使是……像……那里很少有基准测试……实际上试图考虑……哦,如果你……实际上有一个人……与这个模型互动……你知道,最多你有一个……一些……多轮基准测试……它们……试图模拟……在不同的……对不同的输入……环境中会做出什么反应。>> 嗯。>> 但即使那样……仍然……远远不够……你知道,考虑到……嘿,如果你……实际上有一个模型……与一个人互动……你知道,一段时间……它如何……实际上影响那个人的生活。>> 它……真是令人惊讶的是……该领域……有点……卡在这个……以任务为中心的……领域。>> 嗯。>> 而且我认为……但是……这很有道理。有一件事……我被……一些在……你知道,谷歌的人告诉过我……是……原因之一是……它实际上……非常有用……对于……信用分配。所以……能够拥有……这些……易于量化的基准测试……并且……很容易……与某些……即时的事情联系起来……意味着你可以……基本上说……哦,是的,这个……你知道,这个……团队比这个团队……做得好 2%。所以他们应该……所有的资源。或者……你知道,这个团队……将基准提高了 10%,而这个团队……提高了 5%。所以,你知道,让我们……相应地分配。而且我认为总的来说……这就是……一部分。我认为另一部分是……更符合……训练这些模型……最简单的方法。它……并不容易……你知道,拥有……这些……强化学习环境……等等。你有很多……公司……涌现出来……显然……试图出售……环境……给不同的人。>> 嗯。>> 最受欢迎的当然是……编码和计算机使用。>> 是的。>> 嗯。>> 而不是任何……需要模拟人的事情。>> 是的。>> 这并不奇怪……我们……处于目前的……状态。但是……那么,模型需要……了解……关于人的什么……或者……它们缺少什么能力……或者……尚未被激发出来?>> 最根本的事情是……模型……并不理解……它们所做和所说的事情的……长期影响。当你……把每一次对话……都当作……自己的游戏……来对待时。>> 嗯。>> 而且,你知道,你……基本上把它看作是……好吧,你有了这次互动,你就完成了。你需要确保……这次回应……包含所有……可能的答案,包含所有……可能的内容。你从来不……问问题。你从来不……试图澄清事情。你通常不会……表达不确定性。>> 嗯。>> 你通常不会……主动。你通常不会……考虑长期……>> 就像你看到很多……甚至单轮……这种……制度的副作用。>> 嗯。>> 而且大多数……都被当作……它们自己的问题来解决。你看到……围绕着……人们强调的……关于……西格普西的问题。你看到……你知道,最近有新闻……关于……精神病的问题。有很多……这些……有害的影响……如果你……以这种……非常单一的任务……或……以任务为中心的方式……来思考问题。>> 但如果你有……真正考虑……长期影响的模型……哦,嘿,如果我告诉这个人……开始……你知道,一家……公司……它……卖……用于捕捉冰淇淋的手套。如果我……告诉他们……这听起来是个好主意……他们可能会真的去……他们可能会真的建立那家公司……然后他们可能会意识到……这实际上不是一个好主意。>> 拥有一个能够……排除……事情的长期影响的模型。>> 他们就不会再信任我了,然后他们就不会为我的计算付费了。>> 没错。>> 就结束了。>> 没错。嗯。>> 不,我……我开玩笑。我认为……这真的很……有趣……就像……我们公司的一个非常核心的原则……我们如何做决定……是……我们真正想要的……长期……是什么?>> 嗯。>> 而且……如果那是……客户……在这种情况下是创始人……或者 LP……甚至对我们来说……它实际上……简化了很多事情……如果你说……我们正在优化……十年以上……而不是……这次互动。>> 嗯。>> 而且……所以……单轮与多轮……似乎是……非常不同的……决策方式。>> 似乎很难……收集关于多轮……人类互动的数据。>> 嗯。>> 特别是当你考虑到……时间……>> 嗯。>> 这实际上……类似于生物学中的一个问题……如何研究……只花时间才能进展的疾病?>> 我认为这是一个……非常根本的问题。我认为……实际上有一些……很好的学术工作……已经开始……探索其中一些。>> 是的。>> 有一些……最近的工作……围绕着……你知道,来自人类互动的强化学习。有一些……有一个很酷的论文……叫做……Collab LLM……你知道,它……训练对抗……你知道,模拟。有很多……非常酷的工作……开始在学术界……探索这一点。>> 嗯。>> 但总的来说,我会说……工业界……对这类事情的关注要少得多。>> 嗯。>> 因为……我会说……对于大多数实验室来说……而且也许这是一个……强烈的说法……但我会说……对于大多数实验室来说……人类……基本上是……中间过程……直到你拥有……这个……完全自动化的……你知道,系统。>> 嗯。>> 所以花很多时间……优化……使它们……非常擅长理解……非常擅长互动……非常擅长与事物协作……基本上是……一个……中间过程……你必须做……直到你达到……这个……你知道,完全自动化的点。>> 嗯。你能描绘一幅画面吗……如果我们拥有……更好地理解……人类目标……在不同时间尺度上的模型……并且……擅长与人类互动……五年后……它们如何……更深入地融入……你的生活?>> 是的,我认为……你不需要……去那么远。>> 两年。>> 嗯。>> 但是的,我认为……我认为你会得到很多……你现在在这些模型中……看不到的行为。我认为你会得到……模型……更擅长理解……你在应用程序中说的……事情……如何融入……你正在做的……事情的整体……背景。>> 例如……比如……如果模型知道……你将要去……你知道,一些……婚礼……例如……然后你问它……预订……巴黎的酒店……它可能会考虑……哦,嘿……在这个事件的……时间……我记得……这个用户……对他们来说……所有这些事情……都是真实的……一个模型……普遍能够……思考……你说的每一件事……如何融入……你对那个人的理解……将是一个……我认为……非常根本不同的互动。>> 嗯。>> 因为现在……如果你想问……这样的问题……你必须……倾倒所有这些……上下文。你必须告诉……哦,你知道,你能……帮我找一家巴黎的酒店吗?这是因为……你知道,我要去……一个婚礼。我有……你知道,这些限制。我……你知道,我有……这些人需要和我在一起。我……你知道,它需要……做这个。它需要……你知道,你……你需要……基本上……把所有……与你自己相关的上下文……倾倒到模型中。>> 嗯。>> 这也是……昂贵的互动。>> 是的。>> 嗯。>> 而且……大多数人不会做的事情。>> 想象一下……如果你有一个朋友……你每次说话……都要向他们解释……关于你自己的所有事情。>> 是的。>> 就像……你能想象……每次你和某人互动……你基本上……他们记得……你的名字……而且……你知道,你做什么……而且……只是……你生活的……高层次草图……>> 它会……这段友谊可能……不会持续很长时间。>> 是的。我认为……这就是……现在的模型。所以你会争辩说……今天……模型中的任何……内存投资……都……不那么有趣……或者……不那么核心……到它们的能力?>> 我会说……内存绝对是……一个……被……低估了……的特征……由该领域。>> 嗯。>> 但我会说……在这个……非常……以任务为中心的……制度中……投资内存……确实很困难……因为如果你有……一堆……这些……独立的任务……每个任务……需要的信息……来自你讨论过的其他事情……并不……那么多。>> 嗯。>> 就像……因为目前的范式……内存……在训练中……并没有……非常有用。>> 嗯。>> 所以……这些模型……在这方面……并不特别擅长。所以……还有一件事……我告诉你……我认为……出于……恐惧本能……而不是别的……但我……我感觉……其他人也会有……这种反应……是……我是一个……独特的雪花。你……不可能……模拟……你知道,我和我之间……所有……自我一致性问题……就像……我想今天学习这个……但我实际上……不想做这项工作。我想吃蛋糕……但我也想保持健康。就像……你知道,我们有不同的时间尺度……改变主意。我只是……持续的分布转移……然后……你不可能……把我们所有人……都纳入分布。>> 嗯。>> 你怎么回应?>> 我认为……在某种程度上……这可能是……有点真实。它……并不容易……构建……这些……真正好的……人的模型。但我想……模型需要……的任务是……它应该……尝试这样做。>> 嗯。>> 就像……模型需要……实际上……尝试学习……所有这些……尝试学习……关于你……尝试学习……你知道,你关心的事情。>> 嗯。>> 就像……模型……实际的目标……需要是……理解你……而且……它可能……不完美。>> 嗯。>> 但男孩……你知道……就像……你可以……比现在的模型……好得多。>> 嗯。>> 那似乎完全合理。>> 是的。>> 我认为……嗯。>> 而且,你知道……这是我……认为……作为一个领域……我们可能会……做得更好。>> 嗯。>> 我不会假装……你知道,我会……一次性解决这个问题。>> 嗯。>> 但我认为……即使是……任何认真的努力……也能让你……走得很远。>> 嗯。所以……有一个……邪典科幻系列……关于……文化……在那里……你有……你知道,这些……超级智能的……心灵。而且基本上……所有……人类和……类人种族……生活在一个……社会里……心灵……做出大多数……决定。>> 嗯。>> 而且有……嗯……我忘了……总共……类人人口,但……假设有……30 或 40 个……心灵……仍然……相关……就像……人类一样……在……也许是……域外……或提供……心灵……无法提供的推理。而其他人……都生活在……一个……富裕的世界里……他们……喜欢攀岩……或者……闲逛……或者……别的什么。而且他们……不生产。你的……富裕观……有何不同?>> 每个人……都有……他们热衷的事情。而且……考虑到机会……我认为……人们可以做……非常酷的事情。>> 嗯。>> 我认为……模型的角色……应该是……让人们能够……做那些……每个人都……想做的……非常酷的事情……并完成那些……每个人都……想完成的事情。>> 嗯。>> 而且我认为……就像……你知道,我们不应该……把所有的……思考……和所有的……你知道,一切……都外包给……这些……你知道,人工智能霸主……或者别的什么。>> 嗯。>> 我认为我们真正想要的是……能够……赋能我们的模型。>> 嗯。>> 太棒了。>> 嗯。>> 好的。>> 嗯。>> 超级独特的使命,令人惊叹的研究工作。你正在组建一个早期团队,获得大量的计算资源。你在招聘方面……在寻找什么样的人?>> 嗯。>> 一件事……我认为……实际上可能是一件好事……我以前的公司……做的……你知道,在某种程度上……把每个人都……当作……工程师。>> 嗯。>> 我认为……我正在寻找……非常强大的……基础设施……人员……他们可以……构建东西。我正在寻找……非常强大的……研究人员……他们可以……构建东西。我正在寻找……非常强大的……产品……人员……他们可以……构建东西。我正在寻找……那些……已经……深入思考……用户的人……已经……深入思考……内存的人……你知道,在研究方面。我正在寻找……你知道,在基础设施方面……那些……深入思考……分布式系统……非常快的推理……的人……那些……你知道,曾经……扩展过……非常大的项目的人。>> 嗯。>> 在产品方面……我认为……那些……你知道,在……新的互动模式方面……非常有创意的人……那些……真正……深切关心……构建……精美、有品味的产品的人。>> 嗯。>> 太棒了。非常感谢你,Eric。>> 非常感谢你。>> 恭喜你的新公司。>> 非常感谢。>> [音乐]>> 在 Twitter 上关注我们 @NoPriorPod。如果你想看我们的脸,请订阅我们的 YouTube 频道。在 Apple Podcasts、Spotify 或任何你收听播客的地方关注本节目。这样你每周都能收到新一集。并且在 no-briers.com 注册电子邮件或查找每集节目的文字记录。