📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

“Self-Improving AI Agents Are Almost Here…” – DeepSeek Insider

David Ondrej59:44

Transcription

这是John Wang,一位人工智能研究员,他是著名Deepseek V2论文的作者之一。他还开源了Deepseek R1背后的训练方法,并且作为一名一年级博士生,他已经获得了300多篇引用。在这期播客中,我们讨论了顶尖人工智能实验室如何比较中国和美国之间的人工智能竞赛,以及作为一名人工智能研究员是什么样的。如果你想了解世界的未来会是什么样子,请看到最后。这是David Andre播客。请享用。

好的,儿子。那么,能谈谈你在Deepseek的经历吗?

>> 我于2024年初加入了Deepseek。当时他们基本上在研究MOE模型,我加入时他们正在研究DPS v2,它使用MLA来减少KV缓存,使模型更高效。在我任职期间,我主要从事专家专业化工作。这意味着我们在一个非常大的稀疏模型中有许多专家,但我们如何让他们真正扮演自己的角色呢?在我任职期间,我发现了一种方法,可以通过专门为一项特定下游任务训练专业化专家,来帮助模型变得更加专业化并适应下游任务。这不仅有助于减少在新领域适应模型时所需的内存和计算量,还能减少其他不相关的专家过度拟合到单个下游任务。因此,在保持通用能力的同时,使模型变得更加专业化。

>> 你刚才说的话很有意思,因为这是模型中的架构改变,对吧?

>> 是的。你认为这是最大的收益所在,还是说你认为这是更干净的数据、更多的数据、更多的计算?

>> 在严格相同的数据下,所有算法都会比基线算法表现得更好吗?

>> 我认为两者都非常重要。如果我们有好的数据,模型就会进步。如果我们有更好的算法,模型也会进步。所以,是的,我认为两者都是必要的。但基本上,在这一点上,我们可以公平地说,每个主要实验室都已抓取了整个互联网,而且,你知道,也许像谷歌拥有更多来自YouTube和谷歌搜索等专有数据。那么,你认为实验室之间最大的区别将是更好的算法、更好的架构,还是你认为会区分这些实验室的是什么?你认为会是别的东西吗?

>> 是的。实际上有很多方面可以区分这些实验室。有些实验室拥有更多的公共数据供他们使用。有些实验室拥有更好的基础设施,可以让他们快速迭代。有些实验室实际上拥有更多的计算能力,因此他们可以训练更多的模型,训练更大的模型。我认为Deepseek在我任职期间拥有非常好的基础设施。所以,我能感觉到,无论何时我早上有一个想法,下午就可以实现它。即使在那时,我们也没有云代码,没有codex,也没有这些代码代理,所以如果想在它上面添加或删除东西,它的基础设施就相当干净,你可以很快做到。我认为这是他们的优势所在。

>> 所以基本上是一种非常开放的文化,在那里只有精英人士可以做他们认为应该做的事情。

>> 嗯,是的,这有点像自下而上的结构。有点像你有一个想法,然后你向你的队友提出,然后你开始着手去做,而且,老板不会过多干涉,他们只会确保你有足够的资源,并且这个想法能够被推出去。而且,团队之间确实有很多合作,因为有人在同一个领域工作,有人在跨领域工作。所以,如果一个想法要被推出去,例如,我正在致力于改进算法,我还需要来自基础设施方面的人来提高效率,一旦算法实现,例如编写更多的内核。这就是团队成员合作的方式,如果他们真的想推出一些东西。

>> 在那里工作时,你有什么最难忘的故事吗?

>> 快速说一下,如果你有一个人工智能业务并想扩大规模,请务必申请我的加速器。如果你符合条件,我们将与你合作6个月,帮助你扩大规模,这样你就可以建立一家大型人工智能公司,或者像我一样走向收购,我以180万美元的价格出售了Vectal,就在成立14个月后。所以,如果你想建立或扩大你的人工智能业务,请点击视频下方的链接并立即申请。

>> 这可能有点陈词滥调,但有一次在我工作的时候,我真的很喜欢和那些中国人聊天,和那里的人聊天,因为我觉得他们来自非常不同的背景,其中一些人实际上来自中国文学背景。是的。所以,我无法想象我能在午餐时和所有这些技术人员就中国文学、中国戏剧进行如此多的交谈。所以,这对我来说真的很有趣。

>> 有趣。也许我会一一介绍所有主要的人工智能公司,并给你一些简短的看法,比如你的想法,你认为他们的优势是什么?你认为他们做得对的地方是什么?那么,让我们从Enthropic开始。我认为他们的编码代理相当不错,所以我认为他们的产品选择也相当不错,例如,他们有这种同事,他们的产品策略选择是我非常喜欢的。

>> 好的,OpenAI。

>> 我很早就认识OpenAI了,我从大一开始就认识OpenAI,我认识Gym,就像OpenAI Gym。我认为这是一个非常早期的改进,我认为它在当时激励了大量的研究。所以我真的很欣赏它,因为它不仅激励了别人的研究,也激励了我的作业。所以,在我作为交换学生在伯克利大学三年级的时候,我开始大量阅读他们的论文,特别是关于VPT论文,也就是视频训练,他们开始预训练这些模型人工智能模型,不仅在语言方面,就像BERT和GPT2所做的那样,而且还开始使用它们通过视频训练来理解世界。我对此感到非常兴奋,因为我一直想看到一个能够真正玩遍世界的游戏代理,而这正是他们所做的。所以,对此感到非常兴奋。之后就是我们都知道的故事,聊天等等。

>> 让我们转向Google DeepMind。

>> 我们与DeepMind的AlphaGo有着不期而遇的缘分。当时我还在上中学。我当时对人工智能一无所知,但我确实观看了AlphaGo的直播,并感到非常兴奋。九年后,我们恰好发布了我们的代理基础设施,后来变成了Region U,这是一项我认为是早期具有大型推理模型的大型代理基础设施之一,发生在那个时候,就像Region。它于2025年1月21日发布,27日。正好九年。是的。所以,我们上个月一起庆祝了AlphaGo的十周年和Region U的一周年。这很有趣。

>> 好的,下一个人工智能实验室,Deepseek。你认为他们的主要优势是什么?

>> 我认为我所认为的他们的优势仍然存在,而且会长期存在,那就是他们超强的可推断性,人们在那里工作的方式,以及,我想说,Deepseek的人才对于这家公司来说确实是一个重要的因素。我认为这不仅对Deepseek,而且对Hyena的许多其他公司也是如此。Hyena是北京的一个区,那里有清华大学、北京大学和人民大学以及许多其他拥有非常好的AI教育的大学。所以我对我的队友们感觉很好,我也觉得这些大学正在投入越来越多的精力进行AI教育。特别是,我知道其中一些大学正在为高中生举办非常严肃的人工智能竞赛,这样当他们直接进入大学时,他们就会知道如何训练Transformer,如何训练代理。

>> 太疯狂了。

>> 你认为中国在这方面做得比美国好吗?

>> 我不知道美国如何对待高中生,因为我没有在这里完成高中学业。但我从我的中国高中生那里了解到,中国人正在举办这样的活动。是的,我觉得这就像在西方世界,这些变化非常缓慢,对教育系统来说,或者,你知道,就像正在发生一些事情,比如“好吧,让高中生花20%的时间来关注这个吧,人工智能正在改变世界”。我觉得这需要永远的时间,而且我认为没有哪个西方国家正在这样做。但在中国,你可以更快地做出这些改变。你同意吗?

>> 嗯。

>> 这几乎就像是资源的分配,最好的才能如何被分配。

>> 我觉得美国更注重兴趣驱动。所以,如果你喜欢,你可以去做。我认为这没什么不好,因为这会使人们更有动力去从事这个领域,他们仍然会成为这个领域的顶尖研究人员,或者成为这个领域的顶尖贡献者。但如果你投入更多的资源,统计学上你会获得更多的人才。所以,是的。

>> 好的。你对XAI有什么看法?

>> 我知道XAI,因为它的部分成员来自SGN,他们非常喜欢这个基础设施。他们推动了语言模型推理从单轮到多轮,而且他们做得非常快。我认为这是最快的推理基础设施之一,支持这种多轮代理训练,代理部署训练。所以我认为它非常接近我们在Region拥有的,但他们做得更快。所以,我认为我们在去年一月进行了多轮IR训练,他们在一月进行了,我想是去年二月,但我认为这比我们的实现快了两到三倍。所以我认为他们是来自SGN的非常好的研究人员,我知道SGN有很多来自XAI的人。所以,这就是我对XAI所知的一切。是的。

>> 那么,Moonshot呢?Moonshot AI,Kim的创造者。

>> 我第一次知道Moonshot是从Moonshot的论文开始的,比如Moon是可扩展的。在那篇论文中,他们测量了为什么这个优化器比Adam更好,并进行了非常大规模的研究。从这些幻灯片中,我感觉到他们是那种阅读大量文献和人工智能工作,并试图弄清楚哪些是好的,哪些是不好的,并大胆地将它们应用到他们的模型中的公司。我感觉这种策略现在非常罕见,因为很多人只会跟随那些已经成功的人,但很少有人会跟随那些有潜力成功但目前还没有的人。所以我认为他们是Moonshot的早期追随者,我相信他们的团队将继续在这个领域寻找所有有见地的论文,甚至创造他们自己非常有见地的论文和想法,并继续将它们应用到他们的模型中。所以,这是非常好的,可以从各方面学习和适应的特点。是的。

>> 我认为你对中美人工智能竞赛有独特的看法,对吧?你两边都待过,而且你可能比大多数局外人更能比较。就我个人而言,我并没有在中国或美国花很多时间,对吧?所以我完全是局外人,但大多数谈论这件事的人要么是中国方面,要么是美国方面。你有两方面的独特见解。那么,你认为谁实际上在获胜,你认为人工智能竞赛的主要区别是什么?因为中国,例如,有更多的能源,对吧?他们为电网增加了更多的能源,我认为西方国家没有人这样做。如果你看看像德国这样的国家,他们正在关闭核反应堆,他们实际上是在自我破坏。所以,你知道,给一个广泛的分析,我不想让你惹上麻烦,或者深入政治。

>> 我可以更多地谈论人才,因为,实际上,我非常了解中国的教育系统是什么样的。

>> 那么,从那里开始。中国的教育系统,人们不了解它的是什么。

>> 是的,当然。那么,让我做一个简短的介绍。我认为中国教育系统与许多其他国家最大的区别在于,它有一个非常标准化的选拔系统,不断地培养和筛选早期的人才。所以,有点像六岁上小学的时候,很多人会告诉你,学校的学习是不够的,你可能需要在校外学习,例如,你参加课程。

>> 你甚至会参加钢琴课,我不知道为什么父母觉得上钢琴课会有助于人们成功,但事实是。

>> 我小时候上小学时也上过钢琴课。所以,这不应该是公开的,你知道。

>> 我认为当你上中学时,不仅会有这些课程,还会有一些奥林匹克挑战赛,让你成为你所在小组中最优秀的学生。所以,有点像,是的,我每周大约上一到两节课,但我知道有些学生整个周末都在上数学课、物理课、英语课,以帮助他们在这些比赛中取得更好的成绩。

>> 所以基本上孩子们花更多的时间在课后准备、学习、磨练。是的。是的。是的。关键的感觉是,这是一个高压的、竞争激烈的系统,所以当你身处其中时,你会被迫前进。例如,我们不仅有高考的期末考试,而且每个月我们的高中也会有这种月考,在我们高中学习的最后一年,我们每天至少会完成两次考试,每周我们会进行一次完整的高考模拟。

>> 所以几乎更像游戏化,更具竞争力的系统。是的。是的。是的。而且感觉相当标准化。所以你总能得到你想要的那种人才。所以,有点像你设计了一个指标,在这个竞争激烈且标准化的系统下,你总能筛选出符合你要求的人。

>> 是的。而且,由于教育系统的基础非常庞大,所以总会有人非常有才华。

>> 是的。我认为我的高中和中学比其他任何地方都好,因为,至少在第一年和第二年。所以,我们的中学和高中都有三年,至少在前两年,我们没有那么大的压力,我们也不需要在周末去上所有这些课程。所以,这可能好得多,而且我在中学和高中参加了很多俱乐部,例如模拟联合国,还有一些国际象棋课。所以,我感觉我的兴趣和动力在中学和高中培训期间得到了很大的保持,我觉得这就是为什么我在上大学时会非常有动力去追求某些东西。因为,你知道,有些人承受着太大的压力,他们被外部系统驱动,当系统消失时,他们会感到缺乏动力。

>> 是的。

>> 我觉得我保持了这种动力。所以,是的。

>> 我认为这是一个类似的过渡,人们从朝九晚五的工作环境过渡到开始自己的生意,突然之间他们没有任务了,因为没有人监督他们的日程安排,他们有太多的自由。是的。我认为这是相似的。好的。

>> 这很有趣。那么,你会说一个系统,比如西方的教育系统与中国的教育系统,哪个更能充分发挥顶尖人才的潜力?

>> 我认为两者都能充分发挥顶尖人才的潜力。所以我,我确实对此深信不疑。所以我可以,嗯,稍微展示一下。我觉得如果你想成为顶尖人才,你需要非常强的动力,并且你需要能够在高压下很好地工作。所以,我觉得在中国,如果你有动力,并且你已经在这个高压系统中,那么你就可以很快地通过研究线或某种动力来驱动。而在美国,你有动力,并且你可以允许自己在高压下竞争。我认为你也会成为顶尖人才。所以我不太确定平均水平,或者说,美国高中生是什么样的,因为我从来没有和他们中的任何一个人聊过。但我觉得,如果存在竞争,就存在压力,因为我们可以从哈佛、麻省理工学院的录取率中看到,它们都非常低。所以,如果你想保持竞争力并超越你的同龄人,你必须非常努力地工作。所以我认为这在美国以及其他拥有自己教育体系的国家都非常相似。

>> 那么,关于能源呢?你有什么见解吗?因为我认为这是另一个巨大的区别,你知道,中国正在部署更多的能源,而其他国家都在落后,或者,你认为这不会成为瓶颈,如果我们扩大人工智能的规模。你认为瓶颈会在未来五到十年内的其他地方吗?

>> 是的。是的。我认为关键在于,谁能创造出一个能够以可比的速度自我改进的代理,谁就能在这个时候获得巨大的优势。而且,我认为这不需要所有领域的那么多能源,因为我觉得,如果你有更好的数据,如果你有更好的算法,如果你让你的代理进入这种自我改进的循环,那么它可能会变得更好,它们会知道如何节省能源,因为当代理能够自我改进时,你就进入了一个不同的阶段。

>> 所以你认为这是谁先到达那里这个大问题?

>> 我认为是的。是的。

>> 好的。如果你必须说我们还有多远,你对递归自我改进的直觉是什么?对我个人而言,我广泛研究自我改进代理,我觉得目前的代理已经拥有非常好的能力,我认为它们已经超越了自我改进的界限,比如常识能力、推理能力,以及与人类的对齐,它们知道应该做什么,不应该做什么。

>> 所以基本上,我们通过缺乏工具、环境、权限、协议来限制它们。是的,这里的关键是上下文长度。首先是上下文长度。你可能看到过有人,我认为是最近的新闻,有人将编码代理放入他们的工作环境,然后他们删除了他们所有的文件。所以,这种情况是因为代理的上下文长度有限。所以,在工作了几个步骤之后,它应该清理它的内存,当它清理内存时,它删除了最初的指令,它们不能删除他们电脑上的东西。

>> 嗯,我认为这里的关键是内存。所以,如果代理拥有近乎无限的内存,它们可以真正利用。所以,首先你需要让模型能够容纳那么多内存。其次,你需要代理真正利用这些内存,因为有时即使代理拥有内存,它们也不会使用。

>> 是的。是的。就像大多数人只总结到10万、20万,即使你知道模型允许100万,因为它效率不高。

>> 是的。我们在实验室里有一些工作,特别是在视觉语言模型方面。所以,模型,所以,论文是关于为什么VM在空间智能方面会失败。就是说,当你让他们处理这种空间任务时,你给他们一张图片,他们甚至不参考他们的注意力空间中的图片,所以有很多token,但他们看不到。所以,我觉得当上下文长度更长时,从非常大的上下文中检索这种内存会更加困难。所以我认为关键在这里。

>> 你对那里的直觉是什么?你认为它是嵌入某种向量数据库到架构中吗?你认为它是让模型实时更新权重吗?你认为它是1亿个token的上下文窗口吗?

>> 是的。是的。是的。所以,我确实有几项工作正在进行。所以,我可能不会详细介绍,但我认为有几个可以前进的规则。嗯,所以第一个是重新思考人类的记忆。是的,我听说过一种观点,我认为这可能是一个经过验证的科学事实,人类的记忆不是电视缓存。人类的记忆不是从大型代码库中检索的。人类的记忆是一种幻觉。

>> 所以你体验新事物。

>> 人们没有意识到这一点。人们没有意识到,当他们回忆记忆时,他们正在添加细节,而且,你知道,越来越不可靠。

>> 是的。是的。是的。这有点像幻觉。所以,你做新的体验,然后你从更新的参数中检索,但你不知道它是否存在。我认为如果我们真的这样做,我们可能会得到一个拥有很长记忆的代理。我认为,只要像人类记忆一样长,甚至更长。但这样可能会让他们犯更多的错误,因为人类也会产生很多幻觉,有时这会伤害他们。但也许我们可以找到一种方法来控制这种伤害,并使其发生在那些不重要的细节上,而不是发生在那些重要的事情上。所以,也许我们可以构建一个拥有更多内存的代理。另一种方法是,我们卸载很多东西,只在需要时检索它们。所以,这是你提到的,我们有一个向量数据库,我们有一个缓存,并在需要时从中检索。我认为这也很可行,但我感觉这两种方法,或者我之前提到的方法,比如存储在参数中,都非常需要良好的内存基准测试,因为据我所知,目前的基准测试在实际的长期上下文理解方面有很多关注,但如果你真的想找到现实的内存基准测试,那就非常困难了。所以,如果你的读者或听众知道这种基准测试,请在评论区推荐给我。

>> 是的。

>> 是的。是的。是的。所以,嗯,是的,请继续。是的。

>> 嗯,我正要说的是,很有趣的是,正如你所说,我意识到这方面没有多少流行的基准测试,对吧?大多数基准测试,比如编码性能、科学、GPQA、Eric、AGI,没有多少基准测试能真正测试它。你知道,有“大海捞针”,但在大多数情况下,情况并非如此,你知道,它不是像一些随机事实,事实上,它与人类记忆恰恰相反,就像你经历了一个月的生活,然后,“那个星期二我看到了什么车?”就像,我不知道那辆车的颜色,而模型会完美地做到这一点,对吧?所以,这有点没用。我们需要不同的内存基准测试,对吧?我们需要一些像。

>> 是的。是的。是的。我的意思是,我的意思是,这确实很难,而且,我明白你的意思。我们需要新的基准测试,就像我们真的有一个模拟用户,它一直在与代理聊天,当它想记录什么时,它就问代理,“我做了什么?”代理可以从所有这些上下文窗口中检索,而且,我有一些朋友在这个领域工作,他们觉得这种模拟用户进行内存基准测试最困难的部分不仅是可重复性,因为每次用户可能会生成新的东西,这会让你的基准测试不稳定,而且是因为他们觉得所有这些语言模型模拟用户都太聪明了,他们不像真正的用户。例如,如果我向GPT询问一些事情,我一开始可能会非常含糊,就像我只是问,“那是什么?那是什么?”然后GPT会回复我,我就会回想起,“哦,我真正想说的是某件事”,然后我会在那个时候不断发布我的查询。但目前的语言模型模拟用户非常清楚地陈述了他们陈述的所有内容,而要测试的代理对这一点非常清楚,而且它们没有任何压力来保持记忆,保持对模糊用户查询的理解,并使对话保持有用。所以,在这种情况下,我们可能仍然需要真实的人类数据来进行这种内存评估,我觉得这就是为什么只有那些大公司现在才这样做。所以,你对像Meror Search AI这样的公司很看好,它们正在生成这些标注者。你认为这非常重要。

>> 嗯,我不确定标注者是否比真实用户更重要,因为我觉得在真实用户中,你不仅有这些众包工人,你还有那些实际上在非常不同的领域工作的人,比如你真的有。

>> 是的。是的。是的。在数学、医学、法律等所有这些领域,你确实有这样的人,所以你可以帮助你的模型在所有这些领域得到改进。

>> 所以基本上,这几乎是一个陷阱,拥有这些劳动力,因为你给他们指示,然后你得不到稀疏数据。你只是,它太专业化了,而且它不像你需要用户,他们是超级用户和初学者,你知道,你需要那些只是在做某项任务或做科学研究的人,就像这样说公平吗?就像真实用户,越接近你想要的使用场景,你就应该越能获得数据,基本上。

>> 是的。是的。是的。

>> 好的。关于递归自我改进的话题,除了内存之外,你会说,你说了相当大的话,你认为目前的模型基本上已经准备好了,它们基本上能够做到这一点。那么,还缺少什么呢?

>> 所以,如果我要说,我觉得除了内存之外,另一件事是它们是否真的能从内存中改进。所以,例如,你拥有所有这些,比如谷歌搜索,它们是搜索系统,它们确实拥有良好的记忆。所以,当有人在网上发帖时,他们可以在有查询时检索,但你拥有非常好的记忆,但你不知道如何使用谷歌搜索来创建一个了解互联网上所有事物的代理。所以,一种想法是,当我们有一个拥有无限内存的代理时,它是否真的能从这些失败中学习?所以,我们实验室的一项工作是,当代理一开始就失败时,我们只是提示它再试一次,再做一次这个任务,看看。

>> 关于那个的论文,对吧?

>> 是的。是的。是的。是的。所以,我们写了一篇关于这个的论文,而且我认为还有一篇,如果我要说的话,它非常古老,但实际上我认为是三年前,比如普林斯顿发表的“反思”,他们也让模型在失败搜索时重试,而且我们觉得目前的RL甚至让情况变得更糟。所以,如果一个模型可以,比如,提前完成任务,那没关系,但它一开始就失败了,我们提示它重试,它会坚持它目前的失败,就像它会再次思考,并产生一个非常长的思维链,之后,它会说,“好吧,我仍然坚持我之前的答案”,而不是生成一些真正针对这个问题的新东西。我们发现,目前的,比如像Kind 2.5 dB Instruct这样的基础模型,已经显示出这种趋势,它无法从失败中学习,但我们发现,那些经过训练的模型在这方面变得更糟,就像,如果你让它们尝试五次,而如果你让它们尝试一次,改进非常非常小。所以,我们可能需要新的算法来让这些模型真正从失败中学习,而且,所以,这就是我们如何实现自我改进的闭环。

>> 所以基本上,人类非常擅长自我改进,对吧?就像,如果你走在街上,离马路太近,然后一辆车差点撞到你,你就会离马路远一点,你不需要那么多次经验,你知道,你不需要互联网上数万亿个token来吸取这个教训。

>> 是的。所以,你认为这是Transformer的问题,还是你认为可以在其之上解决?

>> 是的,这是一种当前模型缺乏的能力,但我认为Transformer本身通过一些技术可以解决它,就像,我们显然可以采用更好的架构,如果它们真的更好。例如,我们从密集模型转向MOE模型,我们从线性模型转向注意力,也许在这个阶段我们又回到了线性模型,很多人正在研究这个,我们甚至可能从自然语言推理转向潜在推理。所以,这些都是非常好的新方法,我们可以尝试,如果它们最终被证明更好,我们可以明显地适应它。但我认为Transformer本身,在理论上,有能力完成许多任务。我认为有些人表明,理论上Transformer可以解决图灵完备的任务。我不记得具体的论文名称了,但我只记得核心思想是,Transformer确实可以理论上解决很多问题。所以我认为这是我们可以暂时用Transformer改进的地方,而且它不需要被其架构所瓶颈。但我确实认为,自我改进能力是我们理解这些代理目前是否良好以及它们是否可以改进的一个非常重要的能力。所以,这里的自我改进循环实际上我认为它允许我们挖掘许多目前准备不足或研究不足的能力。我能想到的一件事是世界建模能力。所以,我的导师Man实际上在世界建模能力方面发表了许多论文。所以,一句话的定义是,当语言模型从单轮模型过渡到与环境交互的代理时,它必须知道采取行动后会发生什么。所以,例如,如果我推桌子,它会移动;如果我推瓶子,它会掉下来。所以,当我们处于单轮代理时,例如,它们会回答数学任务,或者它们会进行这种工具检索,我认为我们可以让它记住从训练阶段会发生什么。所以,例如,如果我们进行这种与工具相关的多轮对话,我们可以让模型记住使用工具后会发生什么。但如果我们真的让它们在环境中工作,它们将不断遇到新环境,比如,我认为,我的导师的博士后导师Fifa和Jajin来自斯坦福大学,他们正在研究行为挑战,这意味着他们让一些代理在数千个环境中工作,而且它们都是模拟的家庭环境,每次代理遇到新环境时,它必须知道它们的体现是什么,就像,整个房子是什么样的,就像它们需要穿越房子,知道有多少房间,它们在这里需要做什么。我们在这方面做了很多后续工作,例如,空间理论,我们从当前的QA风格基准测试转向某种基准测试,模型必须先在环境中旅行,当它们觉得探索已经足够时就停止,然后我们给它们提问。通过这样做,我们确保如果代理在这里表现良好,它必须知道它是否了解这个环境。所以,我们想在提高代理的世界建模能力方面做更多的工作,这样当它们真正部署在我们的环境中时,它们就可以不断地从环境中学习,比如,“如果我这样做会发生什么”,而且,我认为这将成为代理的核心能力之一,如果你真的想让它们在现实世界环境中改进。

>> 是的。所以,而不是仅仅是文本,你知道,比如“这是一个好答案,坏答案”,而是“房间最终处于什么状态,或者这个代码库最终处于什么状态”,这样它们就能更好地理解所有变量和正在发生的一切。

>> 是的。是的。是的。是的。不仅是世界的体现,还有代码,以及互联网上的任何东西。是的。

>> 所以,我们可以公平地说,你期望如果我们解决了内存问题,就会有快速的起飞吗?

>> 我认为我们需要解决我提到的所有这些问题,比如内存问题、自我改进问题、自我改进的核心能力,比如世界建模。

>> 好的。那么,你目前的,因为很难做一个好的基准测试,对吧?它们很快就会饱和,然后一些公司会进行特定的训练来针对特定的基准测试。那么,你认为什么是一个好的基准测试,你对当前的基准测试和EVOS最大的问题是什么?

>> 是的。是的。是的。所以,这是一个很好的问题。所以,嗯,我也一直觉得基准测试饱和得很多,因为,实际上,我认为,嗯,Gemini 3 Pro使用它说,我们实验室的一项工作,MQ,也与空间智能基准测试有关,而且它确实有了很大的进步,我想我不记得具体数字了,但它有很大的进步。所以我感觉问题应该是非平凡的。所以我,我实际上,嗯,从一位该领域的著名研究员那里听说,她对基准测试问题的看法是,它应该尽可能难,而且你必须找到一个非平凡的基线。那么,什么是“非平凡基线”呢?如果当前模型已经做得很好,那么它就不是非平凡的。如果最优秀的人类能做到这一点,那实际上也有一点非平凡。所以,如果有什么事情是即使最优秀的人类也做不好。

>> 如果百分比。

>> 是被考虑的。

>> 是的。

>> 是的。是的。所以,这是理想情况,但在许多现实情况下,不说最优秀的人类,即使是最优秀的模型也做不好。例如,我们实际上发现了一个被忽视的非常重要的能力,那就是代理在执行任务时遵循预算要求。我们可能听了很多关于这种代码代理的新闻,你让它们在你的电脑或你的文件夹里工作,它们花费了数十亿个token,整整一个晚上。

>> 所以我们测试了,这不可能是因为用户没有告诉它们不要使用太多token。但即使你告诉它们,“好吧,你应该使用这个t”,你应该完成这个任务,使用100万token,它们会使用远超于此的token。而且,如果你让它们理解,如果你让它们估计完成这个任务需要多少token,它们的预测与实际完成任务所需的token需求之间的相关性非常弱,我认为是0.1。

>> 或者类似。是的。

>> 我认为这与你与模型交谈时的情况类似,比如,“好吧,这个功能可能需要几个月才能实现”,它们不知道现在能做什么,以及事物能以多快的速度构建。我认为这里有一个类似的问题,关于成本。

>> 是的。

>> 所以,好吧,一个像那样的基准测试会是什么样子?就像,好吧,你希望它尽可能接近你说的成本,然后可能是最好的结果,为了那个成本。

>> 是的。所以,嗯,在我看来,一个好的基准测试应该具有这些特征。所以,首先,我认为,嗯,不仅仅是没有平凡的问题,如上所述,第二件事是,你通过你的分类法对它有一个很好的理解,当模型失败时,你想知道它为什么失败。

>> 所以一些基准测试使用成功数字,但在那些失败的案例中发生了什么,我们并不太清楚。所以,如果有一个好的基准测试,我认为实际上,一件很容易做的事情是,你不仅有一个大型基准测试,而且在基准测试中,你还有不同的类别,比如,例如,你做空间智能,你给它们不同的任务去做,比如,以自我为中心,以他人为中心,主动,甚至更多,你知道,当代理失败时,它在哪个子类别上做得不好。所以,这是我们可以做的第一件事。第二件事是,我们不仅要从任务案例中理解,还要从它们答案中的失败案例中理解。例如,一些模型在解决空间智能问题时,可能会错误地计数对象,或者可能会错误地判断不同对象之间的关系,还有更多的情况。所以,最后但最重要、最关键的事情是我们目前正在研究的是理解推理的失败案例,这比理解前两件事,比如提示或答案,要困难得多,因为推理是你甚至无法监督的东西,就像,你有很多代理来监督推理,例如,你可以检查,你可以正则化推理到特定的格式,这样你就可以更容易地检查,但这仍然比直接检查它们的答案更难。所以,如果一个基准测试能够做到一些甚至可以检查模型推理是否错误的事情,我认为这对改进这些模型非常有见地。哦,这就像人类如何教导一样。就像,如果你在数学课上,你得到了错误的结果。老师不会说,“哦,是的,你失败了,再见。”而是说,“好吧,让我们看看步骤。”然后,“好吧,第四步是你犯错的地方。”

>> 然后,他就是这样训练你的。就像,专注于那一步,然后你就明白了。它不仅仅是结局,对吧?所以,那将是非常,嗯,还原主义的。而且,你提到了推理崩溃,对吧?这是我认为你的旗舰发现。所以,代理停止思考的地方。用简单的术语解释一下。

>> 是的。在过去的一年里,我们在大量的实验中不断经历推理崩溃。一个非常有趣的观察是,我们发现所有这些单轮任务代理的推理长度都会随着训练步骤的增加而增加。但在多轮代理任务中,至少在我们尝试的20个左右的环境中,所有代理的推理长度都会随着步骤的增加而减少。这让我们感到非常奇怪,为什么这些代理不能在多轮代理步骤中学习用RL进行推理,而且,我们假设这可能是因为任务本身更难,奖励信号更稀疏,因为当你失败时,你不知道你在哪个步骤失败了,而且我们使用的环境不够多样化,所以代理无法从这些环境中学习,它们以某种方式互相受益。而且,我们深入研究了这些模型的详细推理,并展示了推理崩溃是如何发生的。一个非常常用的模式是跟踪熵。所以,如果熵失败了,模型就开始产生更确定的推理,就像,当你给它们提示时,它们会产生非常确定的答案。但我们尝试了许多策略来增加熵,但模型仍然无法获得很好的性能。

>> 而我们在这个模型中发现的是,虽然它们有很好的,比如,很高的熵,例如,对于同一个问题,它可以产生不同的答案,但我们发现,对于所有这些问题,它会产生相同的推理集。所以,这种推理看起来是这样的,例如,对于一个问题,它会说,“这是一个好问题”,它会说,“我会小心地完成这个任务”,它会说,“好吧,我是一个代理,我需要做这个任务”。所以,你可以看到熵确实在提高,因为对于所有这些问题,它们会产生多样的答案,但对于不同的问题,它们会产生相同的答案集。所以,我们用互信息来衡量它,这意味着,给定推理链,我能否检测出它来自哪个提示。所以,例如,如果有一个推理链可以附加到任何提示上,我们就觉得这更像一个模板,而不是一个真正的基于输入的推理。

>> 是的。

>> 是的。它不是从第一原理出发的。它只是,我的意思是,这可能是LLM在发明新想法方面很差的原因,你知道吗?就像,如果不同的事情可以引导它们通过相同的推理链,那么,我的意思是,人类可能在这方面更具多样性。

>> 正如你所说,更高的熵。

>> 是的。是的。是的。所以,我们检测到了这个问题,并理解了根本原因之一是因为噪音,就像,很难从这个早期阶段禁止的噪音。所有这些任务本身都有噪音,而且我们还在不断地向这些模型添加噪音。例如,我们有熵奖励,我们有Cha项,它实际上与任务无关。所有这些噪音加在一起,使得模型在生成一种非常安全且能获得这种基线奖励的响应时,它就会坚持。

因为模型不知道是什么样的,如果它们尝试其他东西,它们会遇到这种噪音,而且,嗯,它们会像,它们会自己禁止自己产生新的东西,而是停留在安全区域。>>基本上是为了模型。>>是的。是的。是的。是的。>>但这不就是自动回归架构所暗示的,它们会这样做吗?>>嗯,这并不完全是关于架构,因为最终我们发现,任务本身的噪音比我们预期的要高。所以我们测量了所有这些嗯模型的梯度,比如当它们进行更新时,我们发现即使对于这个任务,奖励方差也非常低,这意味着模型产生了大量的答案和轨迹,并且发现它们的奖励非常相似。我们发现即使对于这组 ARL,它仍然会产生很多梯度,这意味着 ARL 本身感觉在轨迹中有许多东西可以学习,即使它们看起来相似,我们认为这就是噪音的来源,因为实际上对于这个提示,你只是让自己保持沉默,因为这些问题是我在思考它们很长时间后产生的,我得到了相同的奖励,所以最好的策略就是保持沉默,因为它不值得学习,要么因为它太容易,要么因为它太难。但实际上,目前的算法感觉它们实际上在这里产生了非常大的梯度。所以模型会不断地从这种非常不值得学习的实例中学习,而我们的干预非常简单,就是移除它。>>然后嗯,将模型从那些信号噪声比低的轨迹中移除,并让模型继续学习那些在 RL 时刻值得学习的任务。所以这有点像你自己作为一个人类,你经历了很多事情,有些事情就被遗忘了。你觉得那不值得你学习,你就不去学习它。>>也许就像一本坏书,你知道吗,如果你不读了,你就停下来。>>是的。是的。是的。是的。你就是停止学习。而且我们发现 IO 也是如此。更令人惊讶的是,我们实际上提高了这些模型的效率,因为有些人可能会说,好吧,你产生了大量的原始输出,然后你丢弃了很多。所以效率非常差。但实际上我们发现,如果你不从这些糟糕的轨迹中学习,你实际上是在阻止自己受到这些噪音的影响。所以你实际上学得更快,因为你只在那些值得学习的轨迹上学习。>>这非常有趣。对于那些不是研究人员的人来说,精英 AI 研究是什么样的?它是更多地像探索吗?你知道你有直觉,你去玩它,还是更像严格的科学方法,日常实践中它看起来是什么样的?>>是的。所以对我来说,做研究就是你有一个想法,而且这个想法是你相信某事,但不确定你的信念是否正确,然后你去验证它。所以对于所有的 AI 研究,就像你有一个信念,模型应该以几种方式进行训练,例如数据应该这样组织,或者模型的某些瓶颈没有被清楚地研究过,你想在此基础上进行工作。例如,你研究相关的作品,看看它们是否已经研究过这个问题,然后你以某种方式训练所有这些模型,无论是小规模还是大规模,但最终目标是确保你的假设是正确的,并且它能够说服该领域的其他人。是的。所以最重要的先决条件基本上是善于质疑事物,对吧?就像不要仅仅假设这就是该领域做事的方式,就像这样去做。你知道我想起的是 OpenAI 早期的日子,当他们发现了缩放定律,你知道每个人都认为更多的数据是坏的,因为它会导致过拟合和其他问题,而他们却想,嗯,如果更多的数据是好的呢?他们尝试了,模型变得更好,他们又尝试了一次,模型变得更好得多,那是一个巨大的发现,你知道,它正在推动当前的 AI 竞赛。所以是的,我想这就像你会如何描述它,就像原始智能与质疑社会或习俗的结合。还有哪些因素能造就伟大的研究者?>>是的。是的。是的。所以,关于提问能力本身,我认为它变得越来越重要,尤其是如果你在做研究,因为所有这些代理都可以为你验证答案。所以,品味和提出重要问题的能力变得越来越重要。所以这有点不像,嗯,是的,我认为这引出了我想要说的另一个重要能力,那就是你不仅要问重要但显而易见的问题。你可以将其分解为计划并制定具体步骤。例如,我们知道自我改进的代理很重要,但你可以问哪些具体的问题,哪些具体的问题?>>基于你自己的、社会的当前进展。所以,就像我的朋友们经常和我谈论,他们觉得神经科学变得越来越重要,因为人类可以把他们的意识上传到电脑之类的,但我认为这非常重要,但我们如何从现在开始实现它,我们现在可以做什么?>>所以,是的,是的,所以这实际上困扰了他们很多,但我认为这是核心能力,如果你想做研究,你必须知道你现在能做什么。>>是的,这是真的,时机和可能性,拥有良好的直觉。这就像你知道谷歌眼镜是 2012 年左右的著名例子,你知道 AR 眼镜,而技术还太早了。纵观历史,有很多这样的例子,AI 领域本身就是一个整体,人们在 50 年代就预测,我们离 AGI 只有几周的时间了,而他们只是太早了。所以是的,就像知道这一点可能是最难的部分,就是知道什么可能,并对“这还需要很多年”和“这现在是可能的”有一个很好的直觉。>>因为你知道,你可以是一个有未来想法的天才,但然后你就像在浪费时间,因为你只是在做一些事情,而这些事情以我们目前的工具和技术根本不可能实现。>>是的。>>这很迷人。是的。你认为目前的编码工具可以真正被称为代理吗?你知道,因为很多人并不真正理解 LLM 和代理的区别。那么你会如何描述它?什么是真正的代理?>>哦,这是一个大问题,我认为。嗯,我认为有很多关于什么是代理的定义,但我认为与代理最大的区别在于环境。不是代理,而是环境。>>是的。>>所以我们可能会从很多在这个领域工作的人那里听到,代理只能学习他们知识中已经嵌入的东西,我们可以看看他们使用什么样的任务。我认为这是很正常的,而且我认为他们的工作基于他们在这些任务上的发现,做得很好。但就像数学单轮编码问题回答。>>而且你觉得他们只能从自己的答案中获得反馈。>>他们只能从原始输出中获得反馈。>>再次,人类的类比在这里很有帮助,因为你知道人类显然被比作代理,比如 AGI 能够做人类能做的事情。但如果你把一个聪明的人,把他关在监狱里单独监禁,并且只让他每个月写一封信在纸上,而且没有人从这个人那里获得其他输入,那么人们就不会说那是 AGI,因为他只是在输出文本标记,但实际上它是 AGI,只是受环境限制。>>是的。是的。是的。是的。完全同意。是的。我认为这正是为什么我觉得一个真正的代理需要存在于环境中。如果 IM 存在于环境中,它实际上是一个代理,但不是一个非常好的代理,我们需要训练它。>>也许像 OpenCLow 是朝着这个方向迈出的一步,你知道吗,人们意识到,如果你给一个 AI 一个完整的专用计算机,并且你只是不限制它,你不需要按回车键来获得许可,那么同一个模型就强大得多。>>是的。是的。是的。当然,当然,云肯定是一个代理,下一步是如何让代理自我改进。>>所以,所以基本上就像,就像移除障碍,从在线开始,显然,因为软件比硬件移动得更快,然后是物理人形机器人。所以,就像基本上列出那些东西,你知道,那些可能是惊人的创业机会,列出那些代理目前在网络上无法高效完成,而人类可以完成的事情,而他们只是在摧毁它们,比如支付、身份验证之类的事情。>>是的。>>那可能是很多进步将被解锁的地方。>>是的。是的。是的。我认为,首先是低延迟决策。所以,嗯,我尝试了很多网络代理,因为我去年夏天在 Utori,一家网络代理公司实习。所以,我们研究了全世界所有这些网络代理,发现它们可以进行良好的每一步推理,例如在每个阶段需要点击哪个按钮。>>是的,它非常慢,而且对于人类来说,在真正采取行动之前思考很多是不可接受的。所以一个能力是,我有点感觉,我不确定具体是什么,但实际上我有点感觉,所有这些网络代理目前甚至连点击按钮都做不好。>>所以,是的,是的,有点奇怪,但事实是它们有很好的推理能力,但它们不知道如何将它们的推理与行动联系起来。它们并不真正理解,比如它们在 DOM 中看到按钮,或者在视觉上看到按钮,但它们可能不理解按钮作为一个概念。>>是的。是的。是的。是的。首先,它们不理解按钮应该有什么功能。其次,它们想点击按钮,但它们失败了。>>它们会说,我需要在网页的哪个位置点击按钮,但实际上位置非常错误,而且有点奇怪的是,即使有了 SFT,也很难改进它。是的。所以我认为多模态基础设施或多模态架构内部有什么东西限制了我们,但我不是多模态专家。所以,是的,只是猜测。>>还有什么让你觉得受限吗?>>嗯,正如我提到的,词语建模预算意识,让我想想更具体的事情。我只能想到这些,但肯定。>>我的意思是,如果这些都解决了,那将是巨大的,你知道吗,如果所有这些都解决了,而且可能比我们想象的要近,那么即使模型没有任何改进,那也将是巨大的收益,你知道吗?我们看到很多这样的服务,比如租用人类和其他创意的东西,你知道,曾经有过这个 Web 4 的东西,代理可以用加密货币支付计算费用,而且它必须赚钱才能生存,人们正在实时发明这些东西,而且再次,我认为很多人没有意识到很快就会有什么可能。>>是的。是的。>>你也有这种感觉吗?我们正在经历,你知道,无论是缓慢的起飞还是快速的起飞,但我们正在经历一个关键时刻。>>是的。是的。嗯,我对此的看法有点独特,我从小学就开始听到这个词。>>所以每年都是关键时刻。>>所以我不知道哪一年比其他年份更关键。所以我的看法是,如果你觉得你生活在一个关键时代,那就记住或者想想,哪一年是相当关键的,而你唯一能做的就是想想如何在关键时代安顿下来。是的。所以。>>如何参与,你知道。>>是的。>>如何参与。>>是的。是的。我认为只是享受它。享受它。所以不要害怕被取代,或者有这种正式的东西。所以我相信,最终每个人都不需要工作,因为他们现在的工作效率比人工智能低得多。所以,如果人类仍然在人工智能方面具有某种优势,那么我们可以利用它来改进人工智能。如果人类在改进社会方面毫无用处,那么我们可以将其交给人工智能,然后,所以,有一种想法是,如果你确保你的人工智能有能力并且它们帮助人类。所以,所以这有点不像你构建了一个人工智能,它们决定不把人类视为世界的一部分,它们想要消灭人类,而是你改进了模型,在你达到 AGI 的最终阶段之前,你首先确保它们是协调一致的,并且它们不会伤害人类,然后我们甚至可以让人类思考,甚至让人工智能思考如何从社会、教育、我们做事的方式、我们思考的方式、我们哲学上思考的方式来改进人类。所以如果我们有一个足够强大的人工智能,它会想出如何让我们人类变得更好。是的。我认为这就是我们从事人工智能领域的原因。>>太棒了,伙计。我认为这是一个很好的结束点。>>是的。是的。>>非常感谢你的时间。人们应该去哪里查看你更多的作品,在你的推特上?>>所以,所以有一个链接 zenus.me,你可以查看我的作品,我们的实验室,以及我发布的所有东西,比如那些推特投票,一些想法,一些学术翻译,还有更多。是的。>>太棒了。我会在视频下方链接它。顺便说一句,如果你想扩大你的 AI 业务并与我一对一合作,请务必申请我的加速器。这是下面的第一个链接。