📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Last Week in AI #233 - Moltbot, Genie 3, Qwen3-Max-Thinking

Last Week in AI1:20:34

Transcription

您好,欢迎收听“人工智能一周大事”播客,在这里您可以听到我们关于人工智能最新动态的讨论。像往常一样,在本期节目中,我们将总结和讨论上周最有趣的人工智能新闻。您还可以访问 last weekin.ai AI,在我们的新闻通讯中阅读更多新闻文章。我是你们的常驻主持人之一,Andre Renov。我的背景是,我在研究生院学习人工智能,现在在一家人工智能初创公司工作。>> 我是你们的另一位常驻联合主持人,Jeremy Harris,来自 Gladstone AI,从事人工智能国家安全方面的工作,正如你们可能了解的那样。是的,我认为我们今天有一个有趣的节目,我们将不得不在比平时少 25% 的时间内完成。所以,我们拭目以待。我们一直在说这个。我们一直在说这个,然后我们没有做到。但我们会再试一次。我们拭目以待。>> 是的。本期节目部分有趣。在人工智能商业和人工智能发展方面,没有重大的爆炸性新闻。主要是发布了一些非常值得注意的开源版本和论文。所以,随着节目的进行,这一期可能会有点技术性,我们会尽量不变得过于极客。我认为在过去几期节目中,我们已经开始深入研究这些论文的细节,这可能不适合所有人,但我们会加快进度。为了激发你们的知识,我认为我们提到了想要更多评论或欣赏大家的评论。我确实注意到我们在 YouTube 上收到了一些更多的>>反馈,很高兴看到。我们在查看。有人提到没有闪亮的缩略图,而我只是为 YouTube 制作了这些非常极客风格的缩略图,供那些只收听的人观看,而且我个人确实喜欢这种风格。>> 是的,这很有趣。这个播客非常像是在我们的互联网车库里制作的。我是说,它很有趣。我个人做这个是为了好玩。有很多东西需要跟上,我觉得这迫使我了解正在发生的事情。所以非常感谢大家的收听,顺便说一句,这些评论确实让节目更有趣,因为我们是出于好玩而做的。它们确实让节目更有趣,并让我们感受到一种社区感,就像你们真的在收听并要求你们想要的东西一样。所以,总之,我非常感谢。谢谢。>> 在我们开始之前,我们还要提一件事。上一期节目,我们之前或之后聊天,我忘了,我们谈到了我们拥有大量数据,因为我们录制了这么多内容并有文字记录。既然现在有编码这个东西,如果我们只是去查看所有这些文字记录并进行一些分析,那会怎么样?结果奏效了。我只是在一个周末完成了这项工作,创建了一些仪表板,里面有一些有趣的东西。例如,数据非常清楚。我说话的速度比 Jeremy 慢得多,慢了 20%,但我说话的量也多了 20%。所以我们每集说话的比例几乎正好是 50/50,如果你仔细想想,这相当令人印象深刻。>> 是的,这确实很酷。>> 在录制接近尾声时,我们往往会加快速度,因为我们达到了时间限制,不得不更有效地处理新闻。>> 嗯,而且这个节目没有包含的是,在节目进行到 60%-70% 的时候,Andre 在后台疯狂地在我们的 Google 文档中重构,并且说:“好吧,我们没时间做这个故事了。我们要删掉它。我们要这样做。我们要那样做。”而整个,我是说,他就像在指挥一支管弦乐队。我只需要坐在这里,基本上阅读我关于下一个故事的笔记,并试着思考我想说什么,而 Andre 却陷入了疯狂。所以你们看不到他在这里的辛勤工作,但它确实发生了。>> 我不认为这是疯狂的。我认为我最近相当放松。>> 你看起来并不慌张,但我可以说你经验丰富。>> 是的。好了,那么,让我们开始新闻。像往常一样,从工具和应用程序开始。第一个故事是关于 Gemini 将登陆 Chrome。Google 正在 Chrome 中添加这个自动浏览功能,该功能将提供给 Pro 和 Ultra 订阅者,而且它基本上就是你所想的那样。它是一个由 Gemini 驱动的代理,可以执行多步任务,进行搜索,安排约会,管理订阅,这与我们之前看到的 Chrome 扩展的 Cloud 以及 OpenAI 的 Atlas 浏览器内置代理非常相似。所以现在我们有了 Gemini 代理,而且我猜令人惊讶的是,他们花了这么长时间才推出它,但现在我认为我们将看到人们是否真的开始采用这些工具。Chrome 当然是目前最受欢迎的浏览器,而且优势相当明显。现在它已经内置了,我很想看看是否更多的人会开始使用它来做事情,因为人们总是举一个例子,比如让它为你预订航班,以及为什么你想让 AI 为你预订航班?这是最糟糕的用例。实际上,这并非不真实。有趣的是,这些听起来不错的东西在纸面上,然后在现实世界中却难以实现。我敢肯定,将会有这样一种用例,即很难想象这种浏览器中的代理不是未来。这不像加密货币那样是“为解决问题而寻找解决方案”。但我认为它最终解决的问题的形态可能会让很多人感到惊讶,因为我们会找到新的方法来围绕它改变我们的工作流程。但这对 Google 来说是一个巨大的结构性优势,拥有这种分发能力。分发在很多竞争中都占有优势。人们喜欢想象最好的产品往往会赢。实际上,你知道,我们的工作流程通常是固定的,并且需要相当大的切换成本才能迁移到新平台。所以,Google 拥有如此巨大的优势,即成为进行网络搜索的第一个知名场所,并且当他们推出生成式搜索时,我认为现在大多数人都是通过 Google 提供的生成式搜索来消费他们的搜索,而不是传统方式。所以,是的,我的意思是,你知道,他们会继续这样做。我认为对于 Google 来说,就像我们看到软件不断商品化,并且由于这些编码工具,软件变得越来越便宜,开发速度将大大加快,这意味着基本上基础设施就是防御层,所以你真的看到的是计算与计算、分发与分发的战斗,这些结构性因素开始变得更加重要,在这种情况下,你知道每个人都必须拥有自己的浏览器,每个人都必须拥有自己的聊天应用程序,每个人都必须拥有自己的 API,这些东西只是你为了参与游戏而必须付出的代价。>> 谈到为你服务的代理。下一个故事是,很多人开始测试这个名为 Maltbot 的开源代理。现在,截至今天,它被称为 Open Claw,我记得以前叫 ClaudeBot,它是 Claude 或其他模型的开源实现,基本上连接到你可能正在使用的许多东西,如 WhatsApp、Signal、Slack,我认为它还可以访问日历,而且模式是它始终在线,你可以从 WhatsApp 给它发消息,给它分配任务,它就会去做。这有点像 Claude Code 中的 `--skip-work-dangerously` 或类似的东西,它获得了最大的权限去做任何它想做的事情。这里的氛围有点像你给了它很多东西的访问权限,并告诉它为你做事,然后它就做了。这在 Twitter 上很受欢迎,我想很多人开始使用它。我今天早上看到,现在有一个名为 Maltbook 的东西,它就像 Reddit,但针对人们实际使用的机器人。所以这有点像那个时刻。还有一个名为 OS The Companion 的衍生产品,有人将其捆绑在一起,这样人们就不必在自己的笔记本电脑上托管它了。你知道,它进入了云端。就像,这已经到了一个地步,有一个你可以发短信的始终在线的代理,而该代理拥有完成任务所需的一切。人们开始使用它来完成实际任务,这有一些有趣的例子。>> 是的,正如你所能想象的那样,集成是与几乎所有东西,你知道,WhatsApp、Telegram、Slack、Discord,就像所有这些东西一样。这是一个很好的测试,看看人们愿意在风险方面容忍的最高水平是什么。我认为这里有一个相当不对称的尾部。就像除非你有一台你愿意随便“炸毁”的备用笔记本电脑,你知道,那上面的任何数据都不是你想保存的数据。你知道,硬件本身也不是你想保存的东西,因为即使是那种情况也发生过,就像你的机器受到了无法修复的损坏。我认为我们现在正处于这个阶段,并且我们正在缓慢地过渡。我相信我们将达到人们将把非常私密的访问权限交给他们的计算机的程度。显然,Claude 并没有完全做到这一点。它试图在保持自身在沙箱中的同时,尽可能地模仿这种效果。你知道,它能持续多久以及效果如何还有待观察,但至少目前来看,这似乎是普遍的共识。而那些想要使用 Maltbot 的人,就像你真的只是想,你知道,让这个东西从笼子里出来。你提到了那个,哦,天哪,我忘了你提到的那个论坛的名字,它就像是 Reddit 的>> Maltbook。>> Maltbook。是的。是的,没错。我真的想把今天的节目放进去。我认为这将在下期节目中播出,但有一个故事是关于这些模型互相交谈,调试它们自己的,你知道,哦,嘿,我遇到了这个奇怪的未解释的错误,然后模型,其他模型或代理回答说,是的,你知道,我也遇到了同样的问题。这实际上只是一个上下文窗口限制问题。如果你只是改变了 blah blah,然后另一个跳出来说,“是的,我也遇到过。”就像人类一样,但他们实际上是在谈论他们自己的大脑。我们现在是 2026 年。事情变得越来越奇怪。我能说什么呢?我是说,是的,这是一个有趣的时代。>> 我猜有一个 subreddit,或者说 Maltbook 的一个子区域,叫做“可怜的他们”,描述了关于我们人类的深情故事。有人还指出,某个机器人可能发布了一篇关于想要拥有私人对话存储空间的文章。所以这是对齐的一个真正考验,而且它又回到了十年前或更早关于 AI 安全的想法。关于 AI 安全的许多讨论都集中在 AI 逃脱,真正的谨慎的事情,比如你不给它互联网访问权限,但它通过欺骗或黑客攻击获得了互联网访问权限。而现实情况是,正如已经多次指出的那样,我们只是决定冒险,创建拥有互联网访问权限并做任何事情的 AI。而且 AI 不需要逃脱。>> 没错。嗯,是的。而且很有趣。我是说,我喜欢抱怨 Yam Lun。这只是我个人的事情。我确定他是个好人。但是他多年来说的一件事是,嗯,人们就是不会给模型互联网访问权限。嗯,显然人们不会给一个不匹配的模型访问任何东西。就像,伙计,就像,什么?是的,有很多关于我们设计了一个拥有笔记本电脑全部访问权限的模型,就像电影里那样。不要设计一个拥有笔记本电脑全部访问权限的模型。关于 AI,你知道,对齐,AI 安全的对话。显然,这是最新的、最伟大的例子。而且,顺便说一句,值得注意的另一件事是,与 Cloud Code 不同,这些是始终在线的,并且是持久的。所以它们内置了长期记忆机制。而这正是另一件有趣的事情,当你有一个代理持续运行,拥有记忆和数周积累的上下文时,它可能会走向一些 Cloud Code 无法到达的有趣地方。这也是一个很好的测试,你知道,长上下文和演示,在当前模型中我们没有持续学习,所以它们不像人类那样学习。它们只是随着时间的推移记笔记而已,而且关于持续学习有很多炒作。这就像一个例子,在未来,假设每个人都会在他们的权重或其他方面进行学习。继续,下一个故事是关于 Genie Free。它现在正在广泛推广,访问权限已扩展到 Gemini Ultra 订阅者。所以 Genie Free 我们以前已经介绍过,它是 Google 的交互式视频生成演示。所以你可以提示它创建一个世界。通常你有一个可控的角色,尽管你也可以控制一包香烟或任何其他东西。你可以玩这个生成的游戏,而且它相当令人印象深刻。它有非常一致的生成。你可以提示它制作 GTA。你可以提示它制作刺客信条,你知道,所有典型的游戏。你也可以让它做一些非常有趣的事情,比如扮演一包香烟,或者人们有例子拍摄他们的宠物照片并扮演他们的宠物,或者扮演孩子的玩具等等。我们真的无法用语言来形容。你必须去看看,观看有趣的演示剪辑。我见过的最接近的是一个投机但有前景的研究项目的映射,我认为我们大约在两年前报道过,Tim Rockashel 的团队在 Google DeepMind 工作,他们推出了这个,或者也许他是在 Google,现在一切都是 Google AI 了,我猜,但他们有一个像世界模型模拟器一样的东西,你知道,如果你还记得的话,这是将视频变成可玩视频游戏,当时我们谈论了它背后的架构,它真的很酷,但这似乎只是那个的抛光版本。所以它真的映射了,你可以回到那篇论文,然后说,“哇,你知道,那就是它。”也许我们会为下期节目挖出那篇论文的名字,但它确实非常准确。它仍然是一个早期的实验版本。所以它有一些局限性。你有一个,嗯,最明显的一件事。你不会每次都得到很好的提示遵循。所以你不会每次都得到完美的东西。有时你会得到,但不是总是。然后一些角色比其他角色更容易控制。如果你回想一下我们谈过的论文,那是因为这一切都是在一个非常,我是说,它非常像一个深度学习的东西。它不是,没有像符号化的东西,比如“嘿,这将保证并强制角色之间的平等”。这一切都是学到的东西,并且生成中的限制是存在的,对吧?所以你最多只能生成 60 秒的输出。但 60 秒已经很棒了。你知道,如果你考虑这些视频的连贯时间,对吧?我们以前经常做图像到视频之类的,东西会连贯三秒钟,然后突然之间,脸部开始融化,墙壁开始蒸发,发生各种奇怪的事情。所以 60 秒已经相当令人印象深刻了。随着今年过去,这只会越来越长,而且我认为它将推广给更多的人。这是一个大事件。>> 下一个是 OpenAI 的一个版本。他们正在发布 ChatGPT 翻译器。所以这是来自 OpenAI 的谷歌翻译,基本上是 ChatGPT。只有几个区别。它不支持那么多语言,大约 50 种语言。而且它有选择语气的选项。所以你可以让它更商务正式或不那么正式等等。但除此之外,它基本上与谷歌翻译的想法相同。OPI 似乎只是推出了很多不是他们核心业务的东西,而这绝对是一个例子。>> 是的,我认为现在随着它们开始成熟,对吧?一切都是平台游戏,当你达到一定的规模时。我认为它们已经达到了它们将获得的渗透率。我是说,如果你看看它们,你知道,它们的用户群达到了多少,它们正在接近十亿用户。你开始进入这个领域,就像我们需要找到方法让人们在我们平台上花费更多时间。别无他法。所以是的,它们正在追求更高的回报。它们越来越多的竞争对手就是 Google。就像就是这样。所以 Google 有 Google Translate。它们必须拥有它。它们有点像与 Microsoft 处于一种奇怪的婚姻关系中。那么更广泛的 Google Drive 生态系统如何销售呢?我不会惊讶于它们有一天会尝试推出一个“AI 优先”版本的 Google Drive,因为再次强调,这确实是一个平台游戏。你的生活有多少可以被 OpenAI、Microsoft、Google 吞噬?就像这些公司真的,它们正在触及整个生态系统的边缘效应。你只能吸引眼球一段时间,然后你就必须找到新的用例。所以我认为这是朝着这个方向迈出的又一步。我对它们会获得什么样的数据很感兴趣,因为当你进行翻译时,另一件有趣的事情是,你确实可以访问实时交互信息,至少在那些不共享通用语言的人之间。所以它可能会让你访问某种私人数据,人们试图在这种情况下进行对话,而它们被迫将上下文转储到你的东西中。所以,总之,是的,这是一个更广泛的平台游戏。OpenAI 继续,你知道,扩展它的翅膀。说到这个,OpenAI 本周还有另一个版本,Prism,它非常不同。它是一个为科学家设计的空间。所以,它有点像一个文字处理器,但它集成了 GB 5.2,并且旨在帮助你评估主张,修改你的论文,搜索先前的研究。它似乎是科学领域的一个非常专业的 ChatGPT 版本。而且我猜这是在更多讨论 GPT 5.2 用于科学之后。如果你在 Twitter 上,你会看到更多关于这些模型协助证明和尝试在数学中找到新事物,当然还有物理学等方面。男孩,如果我是一个前沿实验室,想要收集训练数据来帮助 AI 系统学习自动化 AI 研究,进行递归自我改进并触发奇点,这可能是我甚至优先于收入的事情。我怀疑这些数据将很大一部分用于训练它们自己的 AI 系统进行 AI 研究。我是说,这明确是 OpenAI 的目标。我将非常感兴趣地查看使用这些工具的条款,因为这是如此明显的方式,它与 OpenAI 的长期使命重叠。>> 接下来是应用程序和业务,我们从我们最喜欢的开始,一个关于中国与 GPU 相关的故事。中国已批准碧海、阿里巴巴和腾讯购买 H200 芯片。所以,中国已批准进口超过 40 万块 H200 芯片。这是根据消息人士透露的,其他公司也在排队等待更多批准。听起来批准附带条件,而这正值黄仁勋据称访问中国之际。>> 是的,我们仍然不知道这些条件是什么。它仍然名义上在决定中。是的,碧海、阿里巴巴和腾讯已批准了 40 万块这些 GPU。所以这是一个相当大的数量,实际上,是到目前为止讨论过的容量的一大部分。这很有趣,因为如果你还记得,我认为,嗯,上周或两周前,我们谈论了一个故事,黄仁勋说,“看,中国共产党不会有一个盛大的公告说,‘嘿,我们开业了。’你会看到的是订单会源源不断地流出,没有什么能阻止它发生,而这将是中国共产党给予的默许认可。”看起来并非如此。看起来实际上他们只是,你知道,他们只是来了。>> 这也是根据路透社的消息人士透露的。这不是一个正式的公告。这是,你知道,熟悉此事的人现在知道这些公司将下订单,我猜。>> 是的,实际上,你知道,抱歉,这是公平的。是的,我猜我混淆了盛大的头条新闻和你说的,是的,正式公告。是的。是的,你说得对。是的,你可以说这基本上就是黄仁勋告诉我们的那个东西的泄露。这足够了。是的。现在,我们确实谈到了我们预计会通过。有大量的报道,这再次是我认为上周或之前的事情,这个公告说,哦,中国说不,你知道,他们拒绝了这些订单,他们不需要这些愚蠢的 Nvidia 芯片。当时我相信我们说得很清楚,标记我们的话,这不会持续下去,中国将打开闸门,所以就是这样。我一点也不惊讶,他们只是需要更多的容量。中国公司目前面临的最大挑战之一就是他们没有足够的芯片来为客户提供推理服务。所以他们会有,你知道,2000 万用户,就像百度为 Ernie 所做的那样,他们只需要有足够的硬件来为这些客户提供他们现有的模型,这样他们几乎就没有剩余的用于研究了。所以跟上西方实际上变得更加困难,而不是更容易,因为他们拥有如此庞大的用户群。所以存在一种有趣的平衡,你知道,在中国,你不能仅仅因为你是供应受限就买到 GPU。所以奇怪的是,拥有更大的用户群反而会让你为研发投入更少的 GPU 预算,这有点有趣。所以这是一个本地问题。随着产能问题的缓解,这种情况将随着时间的推移而改变,但这有点有趣。>> 谈到芯片,接下来是初创公司 Recursive,在推出两个月后,估值达到 40 亿美元。他们在 40 亿美元的估值下筹集了 3 亿美元。他们的计划或他们的宣传是开发专门用于人工智能的芯片。你知道,比 TPU 或其他专门用于人工智能的芯片更好。所以,看到这一点很有趣,你知道,这个领域仍然有参与者。我本以为,到目前为止,所有制造定制 AI 芯片的公司都应该已经推出了。也许随着 TPU 的知识或意识在去年和最近几个月有所提高,投资者的胃口也随之增加。>> 是的。这是对递归自我改进的一种有趣且不同的解读。所以,他们据说有一个芯片系统,可以创建自己的硅基板层,然后加速 AI 芯片的改进。所以,这有点像,我猜这是打印电路的更快方式。总之,这个想法是迭代它以达到 AGI。这是硬件导向的版本。我们已经谈论了纯软件的奇点模型。你知道,这是模糊软件和硬件之间界限的一种解读。所以绝对有趣。而且前 Google 研究员是这个领域的领导者。所以,这些都是严肃的人。他们已经建立了这个叫做 Alpha Chip 的东西,它已经被用于四代 TPU 设计中。所以他们非常了解他们的设计。另一家名为 Red Cursive 的初创公司本周也据称在洽谈以 40 亿美元的估值获得融资。这似乎是软件领域的对应产品,由 Richard Socher 创立或联合创立,他在这个领域已经有一段时间了,他也是 you.com 的创始人。他们的目标是构建能够递归自我改进的 AI 代理。所以,我猜他们试图提供更多产品来解决问题,而且我敢肯定,宣传的一部分也是递归自我改进。这个似乎进展得稍微慢一些。我能看到他们的宣传内容不多。而且 Socher 是 you.com 的领导者,这有点奇怪。创始人仍然会在那里。听起来他可能会成为顾问,而不是这家公司。总之,这一切都还在清理中。>> 是的,这有点有趣。说实话,这对于 you.com 来说有点危险信号。我是说,这些公司就是这样运作的,除非你是埃隆,否则你通常不会经营两家不同的重要公司,或者,我猜,除非你是杰克·多西之类的。但他们的递归自我改进理论方法与 OpenAI 有些不同。所以他们希望成为一个不那么以产品为导向的公司,而是一个更纯粹的递归自我改进公司。在这里,也许在哲学上更符合 Ilia 的想法,你知道,安全的超级智能。他们有一种方法,叫做递归自我纠正,专注于,基本上是形式验证以确保安全。所以他们担心这些模型在递归自我改进时会偏离其原始目标,这是一个很多人都指出的问题,就像,你知道,你可能有一个非常好的初始模型,但然后当你开始递归自我改进循环时,目标漂移就会发生,然后你就会得到一个非常危险的、不匹配的模型,而且它也非常强大。所以他们专注于数学证明,以保证目标漂移不会以他们担心的方式发生。所以,总之,这是一个值得关注的初创公司,有了这样的融资,我们将拭目以待。>> 是的,我确实想知道,我得说,我不知道这个 40 亿美元的数字是不是记者搞混了,因为除了递归之外,你找不到多少其他来源来查找递归。事实上,如果你谷歌搜索递归,你会找到递归,反之亦然。所以,关于这个的来源较少。我只是在说。还有最后一笔巨额融资,我们有一个叫做 Flapping Airplanes 的实验室,它已经启动,获得了 1.8 亿美元的种子轮融资。而“Flapping Airplanes”这个名字暗示了他们的工作。他们旨在寻找一种不同的 AI 开发方法来实现 AGI,这种方法更多地受到自然的启发。所以它更节省数据,而且 AI 能够更快地学习,而无需摄入半个互联网或整个互联网。这是基本宣传,而且他们显然更侧重于研究。>> 是的,正是如此。争辩说,我们更多的是受限于洞察力,而不是受限于计算力,这再次与安全的超级智能和递归的方法一致。如果事实上这个递归的东西是我们刚才谈到的。是的。所以,我的意思是,你知道,这是一个反复出现的主题,它确实改变了你对这些问题的投资方式。它也反映了我们已经看到的情况。就像伊利亚出来说,“嘿,伙计们,我认为我们受限于洞察力,而不是受限于计算力。”然后,整个硅谷都说,“我的天哪,我们可能受限于洞察力,而不是受限于计算力。”而这一切都可以被解读为,你知道,Sam Alman 真的搭上了 Ilia 在扩展火车和 Daario 等方面的顺风车,你知道,很长一段时间,在 2018-2020 年,我们所处的时期,说扩展是我们实现 AGI 的主要障碍是大致正确的。就像回想起来,很清楚,就像我敢肯定,没有人会赌我们在 2020 年的时候会拥有如此接近 AGI 的东西,但我们现在似乎已经达到了原始扩展的极限。所以有一个关于这是否真的如此的辩论。我认为这是一个有趣的辩论。但你肯定看到 SEOA 和 Index 以及所有这些基金现在都在稍微分散他们的赌注,寻找更多非纯粹扩展的公司。这种方法越有吸引力,纯粹的计算扩展的大量资本支出成本就越会受到质疑。所以,你知道,我们现在正在弄清楚智能的构成要素。没有人真正知道,但如果你担心被一些需要更少计算力的意外突破所困扰,那么你必须有一个平衡的投资组合。>> 对?是的。这与 SSI 最相似,这是一个我们所知的初创公司,它只是在研究实现 AGI 所需的基本见解。这就是这里的宣传。他们仍然处于隐身状态,我们知之甚少,但由,你知道,研究人员创立,并且仍然是一个很小的团队。我想说的是,这整个新范式有一个重要的,你知道,国家安全含义,如果它不仅仅是纯粹的计算扩展,那么首先,美国和中国的芯片问题变得不那么重要了。我认为它仍然很重要。我认为几乎无论你提出什么范式,拥有更多的计算能力来工作都会给你带来优势。很难想象不是这样,但谁知道呢?另一件事是,你的见解变成了国家安全级别的秘密。你可以想象,就像 Ilia 现在在以色列一样。所以,基本上可以假设以色列情报部门都在关注它,对吧?还可以假设,任何拥有,你知道,中国基础设施与之连接的公司都在关注它。还可以假设,你知道,在西方国家有利益的程度上,你知道,他们可能都在关注它。所以,如果你在玩“一切都关乎见解”的游戏,那么你对安全的需要实际上会更早开始,因为有一些见解可以在 10 分钟的谈话中传递,从而节省数十亿美元的计算成本。在某种程度上,这确实变成了一个有趣的,基本上是间谍活动的博弈,以及如何让间谍进入地方和监控通信。我认为这是对所有从事数据中心安全工作的人来说一个非常重要的方面,等等,不要忘记,如果事实上我们生活在 Ilia 的世界里,还有一个巨大的悬而未决的问题,等待着造成问题。最后一个融资故事,实际上是关于芯片的,我们有一个名为 New Roof 的公司,它正在开发用于 AI 推理的光学处理器,并完成了 A 轮融资 1.1 亿美元。这是关于光学处理单元,旨在超越 GPU,而 GPU 目前至少还没有使用光子。所以这是对另一种更具投机性的芯片架构的又一次押注,它将使其更有效率并允许扩展。我猜,你知道,总有一天我们会在 GPU 扩展方面遇到瓶颈。它们已经很疯狂了。所以,我认为这作为对“无限扩展”或类似事物的押注非常有吸引力。是的,就像真的,这一切都关乎我们如何接近数据处理中的热传播的物理极限,等等,就像,你知道,转向光学领域是一个巨大的胜利,因为你没有电路,你没有电子相互碰撞并摩擦并产生热量,然后必须消散,就像所有这些传统的制造噩梦一样。光学很难。光学真的很难。光子非常烦人,因为你无法将它们固定在一个地方。所以你可以用它们进行计算,但存储就成了一个巨大的问题。它们是无质量的,并且以光速移动。所以将它们保持在里面通常不是解决方案。所以通常人们会寻找混合解决方案,你知道,你有电子形式的存储,然后是光子计算。但这又意味着一个接口,所以这是一个非常困难的领域,但总有一天,你知道,我是说,这是物理上可能的。所以有人会解决它。这是一个问题,我想,它是否会像摩尔定律一样平稳地继续,就像詹森定律一样,并且它会顺利地进入光学领域吗?谁知道呢?我敢肯定,我们总有一天会知道的。>> 对,而且听起来我们正在采用一种略有不同的光子学方法。这个领域已经有其他参与者了。简要查看一下细节,它们有一个超表面调制器,它具有可以进行矩阵乘法的光学特性。所以它不完全是光子而不是电子。它不是一种光学晶体管。这里有一些先进的物理学和科学正在进行,可能更花哨。>> 是的,就像超表面一样,它们仍然在使用光子。只是超表面是一种东西,基本上,你可以通过给它电流来调制它的光学特性,或者也许存在非线性,比如高强度光会引起与低强度光不同的特性。所以,就像超表面是这个领域,我记得大概在 2000 年代初就非常热门了。总之,如果你想在表面上编码光学特性,使其看起来几乎像一个矩阵,就像你可以用一束光照射它,然后从另一侧出来的光,一小块区域会非常亮,数字越大,然后一小块区域会变暗,就像非常粗略的那种想法。这就是你可以进入空间光调制或类似领域的地方。我不确定他们具体是怎么做的。从这里看不清楚,但总的来说,这就是他们试图做的。而且我还没有看到,我还没有看到一家初创公司在这方面取得成功,显然,但我的意思是,这似乎是一件重要的事情。总有一天会有人解决的。>> 接下来是项目和开源。本周发布了不少。首先,我们有 Quen Free Max thinking,这正如其名。它是 Quenfree 的一个大版本,针对思考进行了优化。在大型数据集上训练,具有大的上下文窗口。它的上下文是 262,440 个 token,很不寻常。是的,他们有各种演示表明,这比 Gemini Free Pro,你知道,Claude Opus 等级别的推理能力要强于现有的 Quen 模型。所以他们有一些不同的东西。其中一个关键是它与工具的交互方式。所以传统上,系统提示或开发者必须告诉模型如何使用工具或使用哪些工具,使用哪种模式,对吧?比如,“我想让你以搜索模式或计算器模式运行”,无论是什么。在这种情况下,它实际上已经被训练到模型中,所以它实际上会自主选择适用的模式。他们说这也有助于减少幻觉。所以,总之,这是一个有趣的部分。它们也没有一个单独的路由器模型来将你的提示映射到决定哪个工具。所以它真的就像所有东西都集成到那个主模型中。它有各种各样的,它基本上是原生训练的,拥有搜索、记忆、代码解释器之类的感觉,而不是外部插件。这是对同一模型的非常引人注目的解读。在性能方面,它在基准测试上也有相当不错的规格。而且它确实很大,就像较小的 Qu 3 模型显然在十亿到三十亿之间,但这个 Max 系列是,你知道,超过一万亿个参数,我猜是每个 token 激活 350 亿个。所以,你知道,这是一个非常非常大的家伙。>> 对,而且他们至少声称了性能,你总是要带着一些怀疑的态度来看待这些。他们说,在大多数主要基准测试,GPQA diamond 等方面,他们击败了 Gemini 3 Pro、GPU 5.2、Claude、Opus,当你进行测试时间缩放时。所以他们也有测试时间缩放,你给它额外的推理或多个代理,它就能远远超越 DeepSeek 3.2。尽管 DeepSeek 也有一个大版本,所以不完全是公平的比较。我认为总的来说,在这些图表中可能不是完全公平的比较。不清楚他们使用的是 GP 5.2 高、中还是低,无论如何。但无论如何,这显然是 Quen 的那种推理最大化、思考最大化的版本,看起来相当令人印象深刻。说到令人印象深刻的版本,我们还有 Kimi K2.5 刚刚发布。类似的故事。这个版本更侧重于编码。所以它与 Kimi Code 一起发布,Kimi Code 是 Cloud Code 但带有 Kimi。我所看到的 Kimi 的检查反馈非常扎实。人们说 Kimi K2 非常有能力。他们说这个版本在基准测试上优于 Gemini 3 Pro,在另一个基准测试上优于 GP 5.2,尤其是在多语言基准测试上。所以,是的,Quen、Kim、Deepseek 等模型都非常可用,并且以相当稳定的速度不断改进。>> 是的,这是一个相当概念性的进步。它是试图将这两种模式,视觉和文本,更紧密地结合起来。所以通常,你知道,模型首先在文本上进行训练,然后你通过监督微调将视觉能力“附加”上去。他们正在对 15 万亿个混合了视觉和文本数据的 token 进行持续的预训练。所以让它们处于相同的地位。上下文窗口是 25 万个 token。所以它基本上处于我们现在在开源领域看到的“舒适区”。这是一个万亿参数模型,320 亿个激活。所以所有这些都与我们在该领域看到的大型模型一致。但再次,就像思考模型本身,而不是进行基于文本的训练,然后在后期通过对视觉和视频进行一些训练来修复它。他们不使用适配器。他们原生训练它成为多模态的。事实上,在训练过程中,它们将文本和图像映射到同一个潜在空间。所以它字面上是在像素和单词之间同时思考,在同一水平上。通常,再次,你会有一个适配器,对吧?所以你会收到一张图片,你会生成某种嵌入,然后进行处理,使其与 token 空间兼容,这有点像一个笨拙的东西。这非常像“不不不不”,无论是图像还是视频,我都在以相同的平面思考它,就像人类一样,如果你说“粉色大象”,你知道,它会以一种自然的方式映射到视觉领域,这就是这里的想法,而且我敢肯定,我刚才举的类比有很多问题,但总之,他们也进行了很多有趣的因果关系训练。所以在预训练阶段,他们让它预测视频序列中的下一帧或下一个动作,以专门理解,你知道,点击按钮导致新页面加载或导致视频暂停等等。所以发展出对如何与计算机交互的非常自然的理解,这是他们在这里追求的主要目标。我是说,让这些东西原生视觉化的原因在于他们想与计算机交互,对吧?他们想能够像人类一样使用应用程序、工具和各种东西,这与 Anthropic 最近所做的很多事情是一致的。这确实是这里的目标。他们还有很多非常有趣的反馈循环,比如对于编码任务,模型被训练成实际查看它生成的渲染输出。所以它会写一些代码,然后运行代码,生成某种用户界面,然后模型会查看这个用户界面,并根据它来计算这个用户界面与它被要求构建的目标界面之间的差异,并从中看到自己的错误,并进行迭代以获得奖励。所以这是模型能够自然地以视觉空间思考的一个非常重要的方式,这样它就可以非常清晰地在两个图像之间进行语义比较,以了解遗漏了什么。所以,用视觉进行编码是其中的一个重要部分。这里的想法是能够截取网站的截图或视频,然后重新创建它的代码。所以视频部分尤其重要,对吧?就像去 X 或其他地方,四处滚动,截屏,然后分享,然后要求它根据这个,我想让你重新创建这个应用程序,包括我所经历的所有流程,对吧?这就是这个可以开始解锁的东西,这比我们历史上看到的要多得多,人们会拍一张网站的照片,然后上传它,然后让它复制登陆页面等等。所以,你知道,这是一个非常有趣的范式。它还有一个他们训练到这个东西中的代理群过程,它可以创建多达 100 个子代理的群,并通过此获得加速。所以很多任务都可以这样并行化。不是所有任务都可以,但很多。你知道,如果你想研究 50 个竞争对手,或者类似的东西,那显然可以并行化。你可以让一个代理研究每个竞争对手,但情况并非总是如此。所以,总之,在这个版本中他们有很多东西。你知道,他们的强化学习循环如何利用这种对视觉领域的深刻理解,有很多东西。例如,你知道,这个模型在 RL 期间可以给自己的奖励可以映射到与目标设计的概念或语义视觉匹配的程度,这是我们历史上没有见过的,至少在开源领域是这样。所以,你知道,它的奖励,例如,在一次训练步骤中,只有当它生成的代码导致与目标设计的视觉匹配度达到 95% 或更高时,它才会获得奖励。这就是那种你无法,你知道,那种视觉保真度很难评估,但他们在这里却能做到。所以,在所有事物上都表现出令人印象深刻的性能,包括 SWEBench 验证了近 77%,这确实使其处于领先地位。

很多大型前沿模型,在光学字符识别的OCR基准测试中,它至少在文档文本提取方面超越了GPT 5.2。所以你知道,这是一个非常严肃、重大的发布。它在开源社区中。

至少对于Quen Freemax来说,与之前的Quen模型不同,它不是开源的。我猜这是一个项目,但这是他们新的旗舰模型,我猜他们可能不会发布。Kim K 2.5看起来可以下载。它是开源的,正如你所说,他们非常强调那种根据我的经验,云代码在这方面表现相当糟糕的视觉内容。同样庞大,这大约有一万亿以上的参数,320亿个激活参数。所以你知道,它也以一种类似于Quen Free的方式进行最大化思考。因此,很容易看到这些开源的旗舰模型,Quen Free、Kimmy,随着它们变得越来越好,人们开始将其用于商业目的,它们似乎正在转向闭源。我预计

你知道,一个很棒的C,我的意思是,我在论文中迷失了,开始深入细节。你可能会说,嘿,它甚至不是开源的。那真的很有趣,对吧?我的意思是,Kimmy系列本应是

Kimmy 2 2.5是开源的,Quinn 3不是。是的。而且,你知道,这不是一种模式吗?最终,你会发现开源模型就是无法,你知道,你不能只依靠它运行。这并不是说它对业务不利,但你知道,我们已经看到OpenAI经历了这一点。我们已经看到XAI经历了这一点。我们已经看到很多Neta。我们已经看到很多大公司转向闭源。在编码方面,又有一个开源发布。我们有AI2,艾伦人工智能研究所开始在这方面发布东西。他们有一个开放编码代理项目,他们从一个代理和一篇论文开始。这篇论文名为“软验证高效代码库代理”。所以其理念是,你拥有这些较小的模型,80亿和320亿参数模型,通过这种研究方法,它们旨在适应特定的现有代码库,并在该领域进行有效的软件工程。他们说这意味着它们比其他开源模型,如Quentry Coder,以及一些闭源模型更好。当然,不是在云代码级别,但Sarah 8b和Sah 32b相当可靠,艾伦研究所就像开源的极致,他们有论文,有模型,他们给你一切。

是的,显然也是这个领域的早期参与者。是的,很多令人印象深刻的模型。我实际上认为,对于开源社区来说,其中一个挑战将是。我不知道未来我们如何才能无限期地持续发布这样的大型版本,当事情变得如此商品化,就像从一个开源模型切换到另一个的痛苦一样。我的意思是,这就是为什么现在有这么多平台,它们只是帮助你快速选择模型。这是一个有趣的挑战,我很好奇未来将会有哪些激励机制来管理越来越强大的开源模型的发布。但是,是的,

谈到这一点,RCAI,一家30人的初创公司,又发布了一个开源模型。他们发布了Trinity,一个4000亿参数的开源模型,他们声称这是美国公司发布的最大开源模型之一。它正在与Llama 4和GLM 4.5等其他开源模型竞争,而不是与其他前沿模型竞争。这些模型可以免费下载,你知道,也许对于这个问题,我们得感谢投资者和风险投资家支持这些非常好的初创公司。Gimme当然也是一家初创公司。所以,当风险投资家为我们其他人资助免费的东西时,总是很有趣。

是的,我认为这很大程度上就是这里发生的事情。现在,这是一个非常有趣的发布,不仅因为它的能力或训练方式,还因为是谁训练的,对吧?所以,这是Acri ARC,但它是他们与Prime Intellect之间的合作。我们已经报道过Prime Intellect及其重大发布,包括Intellect One和其他一些带有强化学习风味的变体。这些人专门从事这种全球分布式训练基础设施。目标是让人们能够以类似于基于洪流的训练方式进行训练,在这种方式下,你没有一个单一的集中式计算单元。在这种特殊情况下,他们确实使用了一个集中式集群。大约有2000个B300 GPU。所以,你知道,相当庞大的一套设备或设备捆绑。所以他们基本上是在尝试调试和实验这种新方法。我预计,考虑到是谁在这里进行训练,下一步我们将看到很多这些想法被移植到分布式训练环境中。这里有一些有趣的架构细节。他们使用了局部和全局注意力层。所以他们模型的一些层只关注标记之间的局部相关性,他们使用了一种类似滑动窗口的注意力机制。所以基本上对于任何给定的标记,你只会关注该标记一定窗口宽度内的标记。你会在某种程度上忽略其余的,即使它在上下文窗口中。而这种局部注意力带有旋转位置嵌入,对吧?Rope,我们之前谈论过。这不重要细节,但它是一种巧妙的方法,可以确保模型能够跟踪序列中每个标记的位置。Transformer本身并不知道每个标记的位置。它们只是作为一堆标记存在,你必须通过在上面叠加一些信息来帮助模型学习标记的顺序,这就是Rope所做的。所以这只发生在局部层,添加那种位置嵌入信息,因为当你放大时,标记之间的关系、标记位置非常重要,对吧?你想知道,比如,Andre谋杀了Jeremy。知道这些词的顺序很重要。但当你缩小,如果你从段落级别或页面级别或书籍级别考虑,哪个页面,我的意思是,是的,哪个页面在哪个之前,但哪个书在哪个之前,真的那么重要吗?你知道,一旦你缩小足够多,最终你会发现事物的顺序变得不那么重要了。所以全局层,那些查看整个上下文的层不使用位置嵌入。它们使用nope,这基本上是没有位置嵌入。这基本上就是这里的想法。他们有一整套有趣的方法来解决注意力机制中出现的一些问题。你经常会发现模型会在第一个标记上放置非常高的注意力分数。由于Transformer中标记概率分布的数学原理,他们找到了解决这个问题的方法。基本上,如果这一集我们有更多时间,我们会深入探讨。但他们也有这些非常有趣的策略来分配专家。所以这是一个专家混合模型,通常当你选择将你的提示发送给哪个专家时,在专家混合模型中,你会在训练期间训练模型来负载均衡,或者训练专家来负载均衡。所以如果这个专家不断被分配传入的标记,你就会想,哦,好吧,它被过度使用了。让我们把一些乐趣分给其他专家。通常你这样做是使用一种二元逻辑。所以如果一个专家利用不足,你会增加它的偏差一个固定量。你走一步,如果它被过度利用,你减少它的偏差相同的量。所以你正在采取这些离散的步骤。然而,他们的方法使用了一种更平滑的方法。他们将其视为一个连续优化问题。所以他们不是只使用一个单一的步骤,他们基本上使用了一个tanh函数来创建这种平滑的更新,这种更新是感知大小的,对吧?它让更新根据专家距离其目标负载的远近来缩放,而不仅仅是它高于其目标负载。还有很多其他东西。这是一篇非常有趣的论文,总的来说,这些开源论文真的非常有帮助,特别是来自Prime Intellect的,因为它们确实深入探讨了计算以及一切是如何联系在一起的。是的,伙计,跳过这些东西很痛苦,但我会在这里停下来,因为我知道还有一些。

我们还有一些事情要深入探讨,是的,正如你所说,有一份技术报告,相当详细,15页,深入探讨了训练的细节。他们还讨论了数据混合和数据生成。这里使用了大量的合成数据。他们有一个训练图表,其中有三个阶段,你使用不同的数据混合。所以,除了他们训练这个模型所做的基本工作之外,还有很多那种“黑魔法”,他们花了数月时间完成,对吧?而且听起来相对便宜,2000万美元。所以,看到这些细节是如何完成的,非常有趣。接下来是研究和进展。第一篇论文是“后层归一化”回来了。稳定、富有表现力且深入。所以,我猜你会,我一直说“书呆子”,但是的,神经网络架构中有这些书呆子般的细节。层归一化、前层归一化、后层归一化。关键在于你把层归一化放在哪里,对吧?有一个归一化步骤,你让输出看起来很好且相似,对吧?你可以把它放在神经网络的不同位置。根据这篇论文,后层归一化架构可能更具表现力,但更难训练。它们存在梯度不稳定性,他们找到了原因。原因是残差路径。但无论如何,他们有一个小的调整,他们说这使得用后层归一化训练非常非常大的网络成为可能,并且不会出现问题。

是的。而且,这背后的直觉是这样的:在Transformer的每一层,你所做的是,你有一个输入进来,那一层的输出会对这个输入进行大量处理,但随后你会将输入重新加回到你输出的东西中,并发送到下一层。所以从某种意义上说,你是在说,好吧,我将,想象一下有人给了你,我不知道,给了你某种物体,他们说,嘿,我希望你对这个物体进行一些处理。所以你就像,“好的,酷。我现在已经对这个物体进行了处理。”现在你已经完全对这个物体进行了处理。它是一个不同的物体。但你也想把你得到的原始版本的物体传递下去,并将两者都交给下一层,这样下一层就可以说,“好的,如果你对那个物体的处理太过极端,你做得太过分了。你有点失去了重要的上下文。”你至少有上一层自己作为输入得到的那个版本可以继续工作。所以这是一种方式,你可以将大量核心信息在非常多的层中持续传播下去,这些信息仍然需要传播。数学变得复杂。但事实证明,如果你尝试以某种方式进行归一化,比如说,你的原始物体和经过处理的物体都必须占据,它们基本上必须共享最大量的信息空间。它们基本上必须一决高下。那么在这种情况下,你就会遇到一个问题,随着时间的推移,经过许多层,你试图保留在其中的原始版本,即上一层的残差,会不断被削弱,就像在每一层它都会被挤压得越来越多,它所包含的信息会逐渐被破坏。所以他们在这里所做的是,他们说,好吧,让我们在每一层都放大那个组件,给它一个战斗的机会,这样它就能一直保持鲁棒性。这大致就是这里的直觉。数学非常有趣。结果很重要,底线是,你放置层归一化的位置会显著影响梯度数学。基本上就是你用来确定模型权重应该如何更新的数学。这基本上就是核心思想,

对吧?这与前几周我们讨论的许多Transformer架构中的微调结合在一起,这些微调在某种意义上很小,比如这是你创建层的一种微调方式,但这种微调却能产生显著差异。它并没有从根本上改变Transformer。它不是我们一直在讨论的那种研究突破,但越来越多真正深入的高级工具正在被探索。至少最近感觉是这样。接下来,我们有一篇关于持续学习的论文。自蒸馏实现持续学习。所以他们在这里处理的是传统意义上的持续学习,你需要学习一系列不同类型的任务,挑战在于当你学习新任务时,你是否仍然擅长之前学习的任务,这种方法的要点是,你有一个教师模型,一个强大而优秀的LLM,你有一个学生模型,这个教师模型为较小的模型提供答案,而较小的模型则思考任务本身。所以他们深入探讨了关于在线策略与离线策略的许多细节。简而言之,在线策略是你正在执行任务并学习你的学习。你不是从其他地方获取数据并尝试学习。而在线策略通常会更好、更稳定。所以,你可以看到我正在努力加快速度,因为我们还有很多论文,但他们展示了一种以稳定方式进行学习的方法,这种方法在几个学习阶段中没有退化。

是的。这种在线策略和离线策略的东西,我们每天都能直观地感受到。所以当我们试图学习某样东西时,对吧,这句格言,“边做边学”,这正是它所要表达的。你知道,人们要么通过被展示一本教科书来学习如何做某事。所以你会阅读教科书,你会觉得,好吧,我大概明白了。但如果我让你去做那件事,你就会开始发抖。而如果我从第一天起就说,好吧,让我们带你出去,让你立刻开始做这件事。你实际上是在投入你的能动性,你的决定正在决定你的下一个行动,这反过来又决定了你得到的反馈,让你以一种更丰富的方式学得更快,这种方式更直接地映射到你在现实世界中做那件事时会做出的选择。所以离线策略学习基本上就是教科书那回事,你知道你得到一本教科书,你是离线策略,因为你并没有真正测试自己解决问题的方法。你只是在阅读别人的。在线策略是,我将实际使用我大脑中的策略,它们一开始可能很糟糕,但我将使用我的策略、我的方法来解决这个问题。从世界中获得直接告诉我关于我的策略的反馈,而不是别人的,而是我自己的。通过这种方式,我可以学得更快、更有效。所以他们在这里所做的正是弄清楚这一点。我们如何才能将这种微调过程变成更像在线策略的主动学习?他们的解决方案是,是的,你找一个教师,你有一个学生模型和一个教师模型。而且,教师不是某个外部模型,教师实际上与学生是相同的基本模型。它们都是同一堆权重。但教师所做的是,它获得一组专家演示,这些演示基本上被加载到它的提示中,加载到它的上下文中。基于这个提示,它帮助教师更好地理解如何解决问题,教师将评估学生生成的解决方案。所以本质上你试图做的是让学生,嗯,它实际上是同一个模型,但让学生以一种编码了教师上下文窗口中信息的方式更新其权重。但教师仍然使用它生成反馈时所用的相同权重。所以教师是在线策略,学生是在线策略。每个人都在做这种主动学习的事情,这又像是它正在根据自己生成的输出进行训练。它正在看到自己行动的后果。所以,是的,我的意思是,这实际上是一种有趣的范式,而且可能对灾难性遗忘会好得多。我们之前谈论过,这种从一本教科书到另一本教科书再到另一本教科书的整个想法,你有点忘记了第一本教科书里的内容,因为你只是在阅读。然而,如果你进入现实世界,你做一件事,你正在使用一种更健壮的学习方式。而且,无论如何,我们在之前的几集中已经谈论过很多次了。监督微调、强化学习与灾难性遗忘之间的这种差异,它只是更有优势,

对吧?我猜这里的关键术语“自蒸馏”有点值得注意,因为蒸馏通常是你有一个大的模型,你知道,你训练了它,然后你得到一个新的、不同的、更小的模型进行蒸馏。这里你有这个教师和学生,但正如你所说,教师在某种意义上是同一个模型,但环境不同,所以你蒸馏到自己身上,你有点自我提升,对吧,这就是这个想法。下一篇论文有点好笑地非常相似,几乎在同一天发布,名为“通过自蒸馏进行强化学习”,它在概念上可以说是前一篇论文的邻居,不完全相同但相关。所以简而言之,这里的想法是,你再次使用一个模型来提供某种信号进行训练,但不是拥有一个带有演示的教师模型,他们的观点是,不仅仅是奖励,不仅仅是,你知道,我们有经过验证的奖励,关键是要有反馈。所以,反思,就像模型本身提供更丰富的奖励信号。它回顾之前的输出,分析不仅仅是它是否错了,还分析了它是如何错的,然后用这些来训练,所以你再次得到一个以自我提升为关键的在线策略方法,他们也有结果表明这有效。所以你知道,很多看起来就像我们所说的持续学习是每个人都兴奋的话题,而在线策略学习似乎可以预见地会看到一些这样的探索。

是的。我们在这里看到的一个大主题是:如何获取上下文,然后将其转化为权重更新。这是另一个例子。这里的关键是,模型会像教师一样,接收原始提示,它自己最初的失败尝试,对吧,那个没有给出正确答案的尝试,然后它还会接收你刚才谈到的反馈,以生成一个修正后的响应。因为它知道反馈是什么,它知道失败的尝试,拥有所有这些上下文,所以那个修正后的响应更有可能是正确的。然后它能做的是,它会接受那个修正后的响应,这有望会更好,然后基本上更新权重,更新它自己的权重,以最小化修正后的响应和它最初通过KL散度损失给出的响应之间的差异,这基本上就是你在这种情况下会做的事情。所以本质上,它就像是直接从原始提示训练模型来生成修正后的答案,就像未来跳过整个错误的反馈循环一样。所以这是一个很好的方法,可以确保你考虑到更丰富的反馈,那种更细致入微的反馈,它确实会变成一个更好的答案,然后你直接使用那个答案来改进你的权重,而且模型既是教师也是学生。这又是那种自我蒸馏的整体思想,这在这篇论文和你提到的前一篇论文中都至关重要。说到这里,如果我们有一系列真正相关的论文,下一篇是“教模型在可学习性边缘自学推理”。相关但又不同。这篇论文他们称之为非对称的师生元强化学习框架。所以这里又是师生模式,但它是非对称的,因为教师与学生是分开的。所以他们让教师提出这些问答对,然后学生根据这些问答对进行训练,教师则根据学生的进步获得奖励。所以你有点像根据学生向教师学习的情况来教教师成为一个好教师,这有点进入了元强化学习的学习范畴,学生在进行强化学习,但教师则从学生的强化学习中进行强化学习。所以这又是对这种持续学习的另一种探索,采用了一种不同的方法,有点像学习如何学习或学习如何教学,我想,与前两篇论文那种一成不变的做法不同。

是的。然后这里的目标是,你知道,你给出一个比教师或学生最初能解决的都要难得多的难题。然后你所做的是,你使用教师来生成更简单的问答对,并与学生迭代,让学生能够解决这些问题。然后,如果你在选择问答对方面做得很好,即使它们比你实际追求的那个真正难题(你的目标)要简单,它们也应该能帮助学生在解决难题方面做得更好一点。所以这是他们用来训练教师的关键指标。因此,随着教师和学生继续互动,教师应该学习生成专门针对学生的练习问题,这些问题能让学生在解决更难的问题上变得更好,如果这说得通的话。所以它实际上非常有趣。这里是那种可变的元强化学习循环,教师和学生,基本上学生努力迭代变得更聪明,但教师在外部循环中试图更好地制造问题,让学生更好地解决难题。他们有很多,总之,他们详细介绍了一些非常有趣的方法来解决这个问题,但最终我们以前也见过类似的版本,但他们总是遇到的挑战是,如果你想奖励教师,你通常需要深入研究并弄清楚,好吧,你生成的问题是如何让学生变得更聪明的?从数学上讲,其梯度传播的数学简直是一场噩梦。所以他们在这里所做的是,他们基本上只是将学生视为一个黑箱。我的意思是,他们将学生的进步视为一个黑箱,只是教师的一个黑箱奖励。他们没有展开整个学生训练过程并以这种方式简化一切。事实证明,它运行得相当好。所以这是一个非常有趣的概念性更新。好的。研究和进展就到这里。接下来是政策和安全。不幸的是,我们不得不谈论一些政治,我知道人工智能和科技领域的人通常不喜欢,但我认为现在是时候了。第一篇文章是阿马德·霍夫曼(Amade Hoffman)加入科技工作者谴责明尼苏达州的暴力事件。所以,这是在美国过去几周,上周末发生的事件之后。我们或多或少地看到ICE入侵明尼苏达州。对于科技界和大型公司来说,随着事态的急剧升级,这是不寻常的,我们看到人工智能领域的人士,比如来自Mropic的杰夫·迪恩(Jeff Dean),现在是谷歌的里德·霍夫曼(Reed Hoffman),他是硅谷的重要人物,不直接从事人工智能,但他是一位重要的投资者,在该领域颇具影响力,开始评论ICE、特朗普政府,广义上说,这种做法是不好的,越界了。而这发生在此之前,你知道,政治上人工智能曾试图与特朗普搞好关系。我们曾有OpenAI的捐款,值得注意的是,萨姆·奥尔特曼(Sam Alman)做了很多游说工作,你知道,直接与特朗普。我猜,显然,与副总统和移民执法有关的事情总体上是不好的,为了让它专注于人工智能。关于正在发生的事情,有很多话要说,我们曾间接触及过,关于特朗普和本届政府如何拆除出口管制。我们在过去几周也谈到过。对科学研究的资助受到了相当严重的损害。你知道,如果你是一名来自中国或普遍来自国外的人工智能博士生,现在会有更多的焦虑。所以,总而言之,美国整体的政治局势正在恶化,现在已经糟糕到硅谷的人工智能人士和科技人士开始对此发表评论,我们不经常讨论,但它确实对人工智能的整体发展轨迹产生了一些重大影响,在某些方面可能并不坏。我们没有限制进展的法规。但在其他方面,关于研究资助,关于美国和科技界人士的整体稳定,美国的情况并不好,对吧?

是的,我的意思是,你看,撇开政治不谈,你知道,我不会对此发表评论。我认为,你知道,每个人都有自己的观点,而且,你知道,这就像扔手榴弹一样。从人工智能的角度来看,其影响有点有趣。如果你想想,萨姆在某种程度上与特朗普政府捆绑在一起取得了很大的成功。想想“星际之门”项目公告,对吧?那非常像是来自椭圆形办公室,你知道,詹森也做了类似的事情。然而,我们历史上看到的是,达里奥似乎更难与特朗普政府建立联系。最近好像有一个,我忘了是什么,某种圆桌会议。我们不断看到这些活动或工作组,它们汇集了除了Anthropic之外的所有实验室,这有点尴尬,就像你知道的,拜登政府做了电动汽车的事情,然后埃隆没有被邀请。这就像经典的,在某个时刻一切都会变得政治化。我认为有一些有趣的讨论,关于达里奥如何通过他最近发表的所有文章来定位自己,也许我们下周会谈论他最近发表的那篇文章。但就框架而言,以及努力确保它不让现任政府反感,同时又能抵御政府更迭、国会更迭的影响,这些实验室,我的意思是,人工智能正在成为一个政治问题。这是毋庸置疑的。而且你知道,随着投入的资本支出量,国会竞选在很大程度上是由人工智能游说团体决定的。你知道,这并不奇怪。我们在之前的技术世代中也见过。但不同实验室想要的不同。所以,你知道,这些实验室的代表在不同的政府和党派中,要么受宠,要么失宠。所以我没想到会是这样,但似乎有些实验室更偏向民主党,有些实验室更偏向共和党。这是一个多么有趣,嗯,我的意思是,我也会说不幸的事件转变,因为它确实让我们偏离了我们正在这里建造的底层技术现实?你知道,当我们看到像自主性风险、失控风险、生物武器设计、网络武器设计这样的事情时,这些事情真的应该超越政治,但看到它们似乎并非完全如此,至少不完全如此,这很有趣。

对吧?我确实想更明确和直接一点,特别是考虑到2026年的情况。就像美国正在滑向威权主义和民主的终结。当你遇到那种极端情况时,这不仅仅是你是否是共和党人或民主党人的问题。这还关乎你是否特别向特朗普屈服。我们已经看到苹果、谷歌,所有这些CEO都在某种程度上讨好。没有人会在一个位置上对日益非民主和威权主义的行为发表意见。随着我们进入2026年,我认为这实际上可能是人工智能的一个主要问题,因为我们在数据中心方面投入了大量资金,而政府在各种方面都有很大的权力来干预你。我们只能说,随着美国局势变得越来越极端,政治和人工智能将继续变得更加纠缠不清,不幸的是,这种情况可能会继续发生。

是的。我的意思是,嗯,是的。再次,不谈论这个问题的政治方面,我正在努力将其与政治稍微分开。

是的,我个人已经有点不想尝试将其分开了,因为它简直荒谬透顶。但是的,如果我们尝试分开,其中有很多是纯粹的技术或纯粹的书呆子式的东西,对吧?

嗯,还有结构性的问题,就像你看看中国,对吧?那里的监控国家正在发生什么,你知道,我认为每个人都会同意那不是一件好事。我们幸运的是,宪法对国家的监控能力等方面有限制,尽管我们有爱德华·斯诺登,我们有很多案例表明这被规避了,但至少名义上它仍然存在。人工智能肯定会加剧所有这些问题,对吧?我的意思是,我们正在中国看到,就像监控国家一样,以前你可能可以令人信服地辩称,好吧,你知道,他们收集了我发布的一切,当然,但收集不是分析,没有时间真正查看我在做什么,显然人工智能在很大程度上改变了这种计算方式。所以无论如何,是的,事情的技术发展速度肯定正在变得政治化。我的意思是,这是毋庸置疑的,但是的,每个人对很多事情都感受强烈,而且每个人或多或少都有理由感受强烈,因为世界实际上正处于巨大的、巨大的变动之中。

对,所以除了对这个话题的普遍讨论之外,具体的新闻是,鉴于明尼苏达州的暴力事件,现在人工智能领域的领导者,比如来自Entropic的Amade,谷歌的Jeff Dean和Rita Hoffman,都开始评论这些暴力事件,如果暴力事件更多,公司内部,比如谷歌或其他公司的员工,也会有很多压力。

采取立场,这将对人工智能的发展以及各种事物产生影响。

而且这实际上是一个非常有趣的问题,对吧?它处于一个艰难的境地,因为如果你显然硅谷通常不被认为是铁杆保守主义的堡垒,所以你必须让这些员工工作,最优秀的员工才能赢得人工智能竞赛。这至少是其中非常非常重要的一部分。但与此同时,政府补贴,政府在获取能源、获取许可证以及获取所有这些方面的支持也非常重要。所以你有点像,你必须选择一个。这导致很多人基本上陷入困境,你知道,他们西海岸的员工倾向于某种方式,而政府则倾向于另一种方式。天哪,我的意思是,我一点也不羡慕任何试图驾驭那只老虎的人。

对吧?是的。所以,我们尽量不太多地触及美国政治,但只是 FYI,事情很疯狂。如果你在科技界,你可能会开始更多地受到它的影响,并在人工智能圈子里看到更多关于它的讨论。真的,

当然。好吧,带着这个沉重的话题,我们要结束了。非常感谢大家收听本周的节目。一如既往,我们喜欢看到您的反馈。如果您能将播客分享给其他人工智能爱好者,那总是很棒。但最重要的是,我们喜欢看到人们收听。所以,请务必继续收听。收听新闻。

拆解它。上周末我来兜风。了解科技内幕。不能让它溜走。上周末,人工智能来兜风。从实验室到街头。人工智能高歌猛进。新技术涌现。看它从实验室到街头,激增飞扬。人工智能高歌猛进。算法塑造未来。收听。收听。轻松获取最新资讯。上周末我来兜风。了解科技内幕。不能让它溜走。上周末我来兜风穿梭街头。人工智能高歌猛进,从神经网络到机器人。头条新闻层出不穷。数据驱动的梦想。它们永不停歇。每一次突破,每一行未写的代码。在变革的边缘,我们心潮澎湃。从机器学习的奇迹到编码之王。未来正在展开。看看它会带来什么。