Transcription
亚历克斯·沃尔科夫:大家好,欢迎来到 2 月 12 日的 ThursdAI。我叫亚历克斯·沃尔科夫。我是 Weights & Biases 的 AI 布道者,来自 CoreWeave。ThursdAI 由 Weights & Biases 为您呈现,我真的对今天的节目感到非常兴奋。真的对今天的节目感到非常兴奋。嗯,我们有观众在 YouTube 上观看。我们还有我们自己的 Wolfram,Raven Wolf 在这里,还有 Ryan Carson。伙计们怎么样?你们过得怎么样?
瑞安·卡森:很高兴见到大家。
亚历克斯·沃尔科夫:很高兴见到你们。你好。
沃尔夫拉姆·雷文沃尔夫:真是忙碌的一周。中国方面有很多很棒的东西。
亚历克斯·沃尔科夫:开源回来了,开源回来了,而且势头强劲,我们有很多新东西要谈,包括重磅新闻,Minimax,minimax 2.5 刚刚发布,就在大约 30 分钟前。我将要开始今天的节目是,两家公司都会有他们的代表今天来到节目中接受我们的现场采访。所以,我们将欢迎来自 Z.ai 的 Lou,该公司以前称为 pu ai。我们将请 Lou 来谈谈他们的发布,然后我们将邀请 Minimax 团队的首席研究员 Olive Song 加入我们,谈谈他们发布的模型。这两个模型都在基准测试中与之前的 opus 竞争。这太疯狂了,各位。开源正在迅速追赶,开放权重。这些模型现在已经上线了,我,我非常非常兴奋。所以,我想向所有收看节目的朋友们问好。我在 Twitter Spaces、Queen 和 LinkedIn 上看到了很多人,在 Near 也有很多人,在 YouTube 上也有很多人,当然还有你们。所以,你们这周过得怎么样?让我们谈谈发生的 AI 事件。然后,当人们还在收看的时候,我们可以深入节目。
瑞安·卡森:我先说。Wolf,很高兴见到你,Alex。一如既往地很高兴见到你。我发布了一个名为 Amp Farm 的开源项目,用于在 Open Claw 之上编排代理。人们似乎很喜欢它。我明天要去 twist 上谈论它。我一直在思考代理编排。你是直接在 Open Claw 上进行编排,还是在其他地方进行?一切都在飞速变化。
亚历克斯·沃尔科夫:太棒了。Wolfram,你怎么样?
沃尔夫拉姆·雷文沃尔夫:哦,这真是忙碌的一周,是的,你知道我一直在做什么吗?一直在进行各种评估,新模型不断涌现。我非常兴奋,因为我发现了许多有趣的东西,很快我们就能谈论它们了。所以,我对此很期待。本周,我的亮点实际上是 Pony alpha 的发布,我在德语中测试了这个模型,结果有点失望,因为它在德语中非常弱。但现在它已经发布了,我在英语中测试了它,我不得不说,哇,太棒了。我印象深刻。我期待着更多地谈论如何将其与我们的一些生成工具结合使用。但这将是以后的话题。现在,我本周的亮点是 GLM five,还有更多亮点。很难说,但现在,如果我必须选一个,我会选这个。
亚历克斯·沃尔科夫:我听说今天将有两个重磅新闻发布。我不知道开源模型的事情。我只想说,各位,我们有自己的 Weights & Biases,CoreWeave 推理,并且我们为 GLM five 提供零日支持。我们还将努力为您提供 Minimax 2.5。如果您想要一些积分,我会指向我们的主账户,我可能会在下面的节目中链接它,以便您能够领取一些积分,因为顶级智能并非廉价,但我们会以低廉的价格提供给您。所以,对我来说,本周的绝对兴奋点是,你知道吗,我不会选择 LMS。你们选择了 LMS。我将选择该死的 Seedance,它本周彻底颠覆了我的认知。简直是彻底颠覆了我的认知。如果您的信息流还没有充斥着 Seedance 的视频,那很快就会了。拜登今天发布了公告,Seedance 正式上线,但他们也在许多平台上预发布了 Seedance。拜登显然是开发 TikTok 的人,他们对一切都进行了训练。我敢肯定,我们的脸就在里面,Ryan Wolfram,就像我们的脸就在里面,还有每一部好莱坞电影,每一个好莱坞演员,你知道,有一个关于中国网红的故事,他只需要放上自己的脸,说我说了什么。他的声音几乎完美,因为他们简直是对一切都进行了训练。这真是太疯狂了。所以,我必须说,Seedance 绝对是我的首选。
沃尔夫拉姆·雷文沃尔夫:这是我的第二选择。
亚历克斯·沃尔科夫:是的。这是你的第二选择。
沃尔夫拉姆·雷文沃尔夫:是的,绝对是。
亚历克斯·沃尔科夫:好了。各位。所以我们将从一个快速的 TLDR 开始,然后我们将有机会与来自 ZAI 的 Lou 聊聊 GLM。然后我们将继续节目。有了这个,我想问候一下,看看 Yam Peleg 在吗,怎么样?你有点卡顿。有点像素化。但我们会解决的。
山姆·佩莱格:一如既往。疯狂的一周。
亚历克斯·沃尔科夫:一周。告诉我们一件你绝对不会错过的 AI 界发生的事情。
山姆·佩莱格:我的 API 账单这周稍微增长了一点。我不知道,翻了一番,翻了三番,但是,伙计,我正在资助 Tropics 办公室的零食,真的很好。我真的在资助他们的零食,伙计。说真的。我希望你们在那里吃得好,伙计们。在 Tropics。说真的?哦,是的。
亚历克斯·沃尔科夫:一条新闻,必须的。
山姆·佩莱格:GGLM。必须是,必须是。毫无疑问。GLM,肯定。
亚历克斯·沃尔科夫:好了。而且,仅仅因为她笑了。Lou 在这里。嘿,Lou。欢迎。我们将进行 TLDR,但大家好,来自 Z ai 的 Lou。我们很快就会和她聊天。但首先,我们将回顾本周节目中所有我们要谈论的内容,在被称为 TLDR 或 TLDW 的角落里。太长不看。我不知道,或者没听。所以我们将进行 TDR,非常快速,因为有很多东西要谈,然后我们将与 Luke 聊天。
Lou:当然。
亚历克斯·沃尔科夫:好了。就是这样。这就是 TL DR。这就是本周节目中我们将涵盖的 AI 界发生的一切。从开源模型开始,开源 LLM。开源智能本周绝对爆炸式增长,紧随上周的疯狂,我们在节目中直播看到了 OpenAI 新 Codex 模型的发布。这简直是疯狂的。我们今天将在节目中继续。您的主持人是 Alex Volkov,Weights & Biases 的 AI 布道者。当然,我们的联合主持人是 Wolfram Ravenwolf,Yam Peleg 在这里。Ryan Carson Nisten 稍后会回来,LDJ 也会在某个时候回来。我们今天的嘉宾是来自 Z ai 的 Lou,我们还有 minimax 的人。Olive Song 来自 minimax,当然,开源本周绝对是主导地位。各位,如果上周是大型实验室的一周,那么本周我们将涵盖两个主要发布。其中一个昨天发布。另一个今天发布。所以,GLM five 是本周的突破性开源模型。昨天刚刚发布,已经在 weight devices 推理上可用了。我们将告诉您如何获取它。GLM 声称拥有开源编码的王冠,性能惊人。我们将谈论所有这些。亮点是 Vending Bench,一个关于真实世界任务的非常有趣的基准测试,但还有很多其他的,7440 亿参数,只有 400 亿活跃。我们将提及所有内容,包括他们显著更新了用于训练此模型的训练令牌数量。显然,我们有 ZAI 的代表在这里与我们谈论此事。紧随其后,就在 30 分钟前,minimax 发布了更新的 Minimax 2.5,他们声称在编码方面处于领先地位。我们将对此进行比较。SWE Bench 验证了 80%,80.2%。SWE Bench 验证是一个非常困难的编码性能基准测试。并且,拥有 200,000 个令牌的上下文窗口,这个模型简直是野兽。我们很快就会谈论它。之后,我们将谈论大型公司和 LLM 和 API。埃隆的公司 XAI 发布了大量内容。紧随 SpaceX 的收购。SpaceX 收购了 X-A-I-X-A-I,之前收购了 X。所以现在如果您发推文,您基本上是在发推文给一家太空公司。但 XAI 的一些联合创始人宣布离职。当时还不清楚。然后,伊兰发表了一番关于 XAI 在太空中的未来以及重组的演讲。所以我们将谈论那里的重组。然后,Tropic 发布了一份非常有趣的文件,关于 Cloud Opus 4.6 的破坏风险报告。而且,可以假定,这个模型风险更大。所以我们也会稍微谈谈这个。Openly 将其深度研究升级到了五系列。之前的版本基于四系列。天哪,仍然是先进的四模式,但深度研究现在是五系列,并集成了应用程序。绝对值得一看。本周的热门话题是,我们宣布,我们在推理服务上提供了 GLM five 的零日支持。此外,我们还更新了 Kim K 2.5,它也是多模态的。所以您将能够使用推理进行各种操作,包括随机到云代码,open claw 等等。我认为最重要的一点。我希望我能比两次使用 Seedance 从 Biden Seedance 2 中获得更多。Seedance 2 是一个新的视频模型,它彻底打破了现实的界限,就像第一次看到它时一样。Seedance 2 是一个新的视频模型,它在角色一致性、物理和声音方面简直令人难以置信。这真的就像,如果我们各位在 Twitter Spaces 上观看,当涉及到 Seedance 部分时,您应该在视频频道上观看,因为它将彻底颠覆您的认知。缺点是,除非您有中国手机号码,否则使用这个模型非常困难,因为他们将其上线又将其撤下。但今天宣布,它支持九张图片作为参考,加上三段视频,加上三段音频剪辑,简直是疯狂的,疯狂的模型,它为我们打破了现实。所以我们也会大量讨论 CEDS。Qwen 的人发布了 AI 艺术和 D Fusion。Qwen 的人发布了 Qwen Image two。这是一个 70 亿参数的图像生成模型。它接近 SOTA,而且非常非常酷。现在很难发布图像模型,因为非放弃专业人士已经存在了很长时间。但是,他们还是这样做了,而且它是一个非常棒的模型,拥有 70 亿参数。在工具方面,我们将宣布两件事,我们可能会谈论我们自己的 Ryan Carson 的 Enform,但在工具领域,一家新公司筹集了 6000 万美元的种子资金,用于构建一个面向 AI 代理的开源开发者平台,由前 GitHub CEO Thomas 支持。然后 Chrome 发布了一些非常有趣的东西。Web MCP。我不知道你们是否听说过,但绝对值得在节目中谈论。这就是 TL DR,各位。我确切地知道今天还会有更多重磅新闻。GLM five 终于来了,各位,我想首先介绍一下第一次来到节目的 ZAI 的 Lou。Lou,欢迎来到节目。很高兴见到你。
AI:见到你,Lou。
Lou:Alex。
亚历克斯·沃尔科夫:对你来说已经很晚了,对吧?所以,请介绍一下你自己。我们不会占用你太多时间,但请向大家介绍一下你自己,然后我们将深入了解你们的发布。
Lou:好的。感谢 Alex 给我这个机会介绍 GLM。我很感激。我是 Lou,Z.ai 的研发主管。所以,Jill GLM five 昨天刚刚发布。今天,我在这里将从编码的角度转移开,试着谈谈代理们现在到底能为我们做什么,以及 M five 中有什么新东西和改进。
亚历克斯·沃尔科夫:好了。首先,非常感谢您的加入。我知道已经很晚了,你们刚刚经历了一次发布,而且非常疯狂。每个人都在使用这个模型。它在编码方面很棒。我有机会在我的 open clients 上测试了一下,它确实非常棒。所以,我有一些问题想问你。我们当然会谈论一些评估等等,但我有一些问题想问你。我们自你还是 ZII 以来就一直在谈论 GLM,我想自从 GPO 时代以来。而且,我一直在更新大家关于新名字的事情,但我认为现在是时候直接说 ZI 了。GLM 4.5 绝对是一个很棒的编码模型。4.7 打败了它。是什么让它成为一个主要的版本更新,而不是一个 4.8 或 4.9?是什么让它成为 5?
Lou:所以,首先是规模大大增加了,因为我们将模型的通用智能提升到了更高的水平,进行了更大的预训练计算。然后我们引入了一个全新的异步强化学习框架,称为 slim。它大大提高了 RL 后训练的效率,而且我们采用了 deep seek 稀疏注意力机制。它保留了长上下文的性能,同时大大降低了部署成本。所以,如果我必须用四个词来概括,我会说更大、更快、更好、更便宜。
亚历克斯·沃尔科夫:更大、更快、更好、更便宜。全部在一起。这太棒了。我想谈谈你们团队最引以为豪的一些评估和基准测试。所以,Humanis last exam。你们将自己与之前的 G LM 进行比较。各位,我们正在查看 Z AI 自己提供的评估图表。他们有很多与 Cloud Opus 4.5 和 Gemini 3 Pro 的比较。在一些基准测试中,你们正在击败 Gemini 3 Pro。Gemini 3 Pro 是谷歌的一个庞大模型,而现在有一个开放权重的模型,拥有,什么,7440 亿参数。我们也可以谈谈你们在开源领域取得的规模。告诉我团队是如何围绕哪些基准测试进行工作的。这是模型的持续训练,还是你们在某个时候观察性能。你们说,好吧,这足够了。告诉我这个模型有什么特别之处。
Lou:好的,Alex,所以,你知道,你邀请了我来,但我不会花太多时间谈论编码基准测试。哦,是的。但是,如果没有精心设计的,高难度基准测试,就越来越难仅凭简单的任务案例来判断模型的上限。所以,你知道,在日常场景中,差异并不总是显而易见的。对我们来说,我们是编码 SOTA。我想说。是的,我们确实在编码能力上付出了很多努力。
亚历克斯·沃尔科夫:所以,你们提到了从 vibe 编码转向代理工程。我认为,Open Cloud 的 Peter 也谈到了代理工程与 vibe 编码。这个模型有什么侧重于代理的?你知道,多轮对话。你能谈谈这个吗?所以,我们很想听听来自实际发布这些模型的实验室的意见,世界如何转向代理工程对你们产生了什么影响,以及你们如何考虑在构建这个模型时考虑到这一点。
Lou:我真的认为我们已经进入了代理工程时代。从我自己的亲身测试来看,gel five 在代理方面表现确实很好。它能很好地处理多步分解,在需要时调用工具,并能自行推进任务。整体任务完成质量感觉越来越真实,我已经看到很多开发者已经使用它完成了相当复杂的编码工作流程。所以,你定义一次流程,几乎就像一个 SOP,代理就可以执行它。在与代理的交互中,记忆就像 AI 开始真正理解你的习惯。随着时间的推移,它感觉就像一个你提示的工具,更像一个你真正了解你如何工作的系统。
亚历克斯·沃尔科夫:我,所以,还有一些后续问题,我们将让你离开,因为我们知道你晚上时间不多了。但我想问你两件事。我想问关于 Vending bench。Vending bench 是给各位的,只是为了提醒一下。Vending bench 来自,我想是 on labs。他们基本上有一个基准测试,这是一个真实世界的任务。他们让模型有机会运行自动售货机,并进行补货等操作。让我们谈谈可用性。好的。所以,首先,我可以告诉你,我们与你们合作,G five 现在在 Weights & Biases 上可用,而且,我想,显然你们自己也有平台一段时间了,你们一直在服务多个东西,而且还有一个编码层。
Lou:好的。所以,你知道,Jill M five 昨天刚刚发布。我们还在推出这个东西,你知道,对于 Max 到 Pro 的编码计划用户来说,几个小时前我们刚刚对 Coding Plan Pro 用户开放。但是,GLM 的表现也非常好,这让我有点惊讶,因为我经常认为那是我们的短处,但它的表现很好。而且,我经常使用这个功能的幻灯片。
亚历克斯·沃尔科夫:太棒了。所以,嗯,是的。谢谢你,Lou。感谢你来谈论这个模型。各位,绝对可以测试一下这个模型。它从第一天起就在 open router 上可用,在你们自己的平台上。还有一个编码层。每输入 1 美元,输出 3 美元 20 美分。在 and biases 上,各位,这几乎是微不足道的。我将告诉你们如何免费获得它。我将把联合主持人带回来。Lou,如果你能再待一个问题,我想 Wolfram 有一个后续问题,但否则我们将肯定会讨论这个模型。
沃尔夫拉姆·雷文沃尔夫:是的。我发现你们不仅发布了一个模型,还发布了一个终端基准测试 2 验证。所以,你们通过了基准测试并对其进行了改进。你认为这是新的使用方法,还是你有什么信息?因为我觉得这很值得注意。
Lou:是的,是的。因为,对于这些基准测试,我的一些同事想出了一些想法。他们进行了一些研究,然后想,哦,我们应该这样做。我们绝对应该这样做,看看我们如何进一步评估模型。所以,这就是为什么我们进行了测试,而且效果惊人。实际上,这是几个月前我们开始的这种事情,现在我们才看到模型在这个基准测试中的表现。所以,我们会继续下去,你知道,当我们训练模型时,我们会投入更多的精力,更多的注意力。
亚历克斯·沃尔科夫:你好 Lou。非常感谢你的加入。感谢你回答问题。Vending bench 非常非常有趣。我们将继续讨论这个模型。我们知道对你来说已经很晚了,所以祝贺你发布。我们团队的问候,我们在这个节目中一直赞扬开源,所以非常感谢你发布这个模型供大家使用。再次强调,7440 亿参数。不是人们可以在家使用的东西,但开源正在赶上这个领域的尖端实验室,这仍然令人震惊。而且,很高兴你来到节目。随时欢迎你们发布更多模型时再次回来。与此同时,我们将向 Lou 道别。谢谢。感谢你的加入。各位,小组,我们怎么看?首先,向 Lou 致以巨大的敬意,感谢她的加入。如果你们相信的话,现在是上海凌晨 1 点。而且,她尽管有这一切还是加入了。我不知道我能否在凌晨 1 点带着这样的能量在直播中进行,并从 Alex 那里获得问题,但天哪,G LM five,Nisten 会很想听听你的想法。你回来了。麦克风工作了。说说你对 G LM 的看法。
Nisten Tahiraj:我做了一个有趣的动画,展示了所有的权重等等,我觉得现在他们使用 deep seek 架构很有趣。
亚历克斯·沃尔科夫:DSA 的东西,对吧?
Nisten Tahiraj:是的,但总的来说,他们共享专家的方式以及门在共享和非共享专家之间切换的方式。这主要是 deep seek,仍然来自 deep seek 架构。所以这是我发现非常非常有趣的变化。我仍然觉得它不如 Opus 4.5,但它足够接近,而且足够可靠,现在它已经变得像你可能真的想在日常代理使用中考虑它了。如果你把可重复性作为更重要的因素,如果它会损害你的工作,你可能真的应该考虑这一点。所以,追赶的速度正在变得非常疯狂。
亚历克斯·沃尔科夫:我们有很多优惠,人们在节目中发帖说,我们有 kimmi 2.5,然后是 GLM 和 Minimax 2.5,刚刚发布。开源正在迅速追赶,尤其是对于 Gentech 来说。现在关键是,我们谈论与 Opus 的价格性能比较。这些模型在各个方面都绝对碾压 opus。也许不是速度,但绝对是价格。所有这些公司现在都推出了自己的 Max。我不知道你们是否看到了,我们也会谈论 Minimax,但他们有 Max 计划或编码计划,而且价格明显便宜,比如每年 300 美元,而不是每月 200 美元。所以这非常有趣。我没有机会和 Lou 谈论的是,他们用 Hui 训练了 GLM。所以 GLM 不再用 Nvidia 芯片训练了。他们用 Hui 训练,GM five 系列的模型还没有在他们的编码计划上上线,因为他们在 GPU 服务方面受到限制。尽管他们训练的模型是两倍大,实际上是按数字计算的,但他们仍然在 GPU 方面受到压力。我很想听听任何其他使用过这个模型或读过相关信息的人的意见,或者我们想专门讨论的关于基准测试的评论。
瑞安·卡森:嗯,快速说一下,我只想说我喜欢看到竞争,因为我们希望发生的是,有一个非常好的开源模型可以与 opus 或 codex 相媲美,供人们在本地运行 open claw,对吧?因为我会说人们开始使用 an farm 运行一些相当繁重的工作流程,而且它可能会很昂贵,对吧?是的。它在 Aron job 上。所以,让我们支持 GLM five!我很高兴看到这一点。
亚历克斯·沃尔科夫:是的,我们应该提到,本地运行是一个,你知道,有点误导。通常当我们谈论开源时,我们会说,你知道,有这个,你知道,Qwen 模型,Qwen,3,70 亿参数,misra,等等,这些模型的大小接近大型实验室一年前发布的东西。我们不知道,真的,7440 亿参数。你需要一些强大的硬件才能在本地运行它,对吧?但我认为,Ryan,你说得对。人们希望在睡觉时运行多个代理进程。但是,很多事情都发生在幕后和循环中,而且,人们在某个时候会想,也许我不需要。4.6 的智能来完成我所有的任务,也许较小的任务,比如文档。例如,为什么你需要超级深入的智能来处理文档?而且,我可能不想把我的所有凭据都发送给 on tropic。所以,开源现在肯定有了这些选择。所以,我们将快速浏览一些评估,然后我们将与 Minimax 的所有人员聊天,谈论 Minimax 2.5 的升级版重磅新闻模型。但我确实想快速浏览一些评估,因为我认为它们很重要。humanities last exam,我认为是最大的。这里最大的飞跃是 50% 的 humanities。Last exam,在工具方面,击败了 tropics 4.5 和 Gemini 3 Pro 以及 GBT 5.2。他们没有测量 5.3,它刚刚发布。只是不同之处随处可见,幻觉问题,我非常想看到其他开源模型。获得 34% 的 AA 幻觉率最低分数绝对令人印象深刻。Yam,我很想听听你对此模型的看法,关于大小,关于从 230 亿参数扩展到 28.5 万亿参数的训练。什么?
山姆·佩莱格:嗯,这是一个可以近乎免费运行通用计算机使用的模型。这太疯狂了。我们过去谈论过 terminal bench 和编码性能等等。看看 GitHub 上发生了什么?目前这些模型的大部分使用可能不一定是纯粹的代码,因为每个人都在使用它们。所以,当有一个模型可以运行通用计算机使用时,这基本上就是 OpenFlow 等等。大多数人使用 open cloud 的东西,除了 X 上的极端用户,都是通用的日常计算机使用,查看我的日历。提醒我,那里发生了什么。这非常有用。每个人都明白,这本身就非常有价值,而且你不需要如此强大的模型来做到这一点。我并不是说你得到了可以在本地运行的东西。这取决于你是谁。有些人可能会,但大多数人不会。但价格,即使不是在本地运行,伙计。这完全改变了游戏规则。是的,我绝对用它来写代码。它是一个绝对出色的编码模型。它不仅仅是基准测试。我完全同意我们可以谈论基准测试,但它不仅仅是基准测试。它只是一个在现实生活中用于编码的好模型。所以,是的,绝对是一个伟大的发布。说真的。
亚历克斯·沃尔科夫:所以,我想介绍 Minimax 的 Olive。看看 Olive 是否和我们在一起,来到节目。欢迎 Olive,你怎么样?
Olive Song:你好 Alex。你怎么样?
亚历克斯·沃尔科夫:很好。很高兴再次见到你。我们以前见过面,我想是在纽约的 AI Engineer,对吧?你当时做了演讲?
Olive Song:是的,是的。我想是两个月或三个月前。是的。
亚历克斯·沃尔科夫:是的。
Olive Song:三个月前。从那时起我一直在训练这个模型,所以我非常兴奋能分享,
亚历克斯·沃尔科夫:啊,开始了。好了。我,我很高兴和你谈论,Olive,我们有一个特别的环节,当重磅新闻在节目中发生时。而且,由于模型刚刚发布,我们将进行重磅新闻,AI 重磅新闻,只在 ThursdAI 上为您呈现。好了。我们要宣布的是,我将让 Olive 自己宣布,一个新的模型刚刚发布,我认为你在多个基准测试中都处于开源的领先地位。Olive,你来告诉我们,刚刚发布了什么?
Olive Song:是的,当然。所以,我们刚刚发布了 Minimax M 2.5,对吧?这是我们模型的新版本。我们在基准测试中获得了许多 SOTA 分数,正如您在博客中看到的,我们改进得非常快。
亚历克斯·沃尔科夫:我正在查看 SWE Bench verified,这绝对是最重磅的消息。SWE Bench verified 是一个困难的基准测试。我很想让你谈谈,训练一个击败它的模型是什么样的,但是,在 SWE Bench verified 上达到 80.2%,这是 SWE Bench 的更难版本,而 Opus 4.6 呢?那是 Opus 4.6?你们非常非常接近,
Olive Song:非常接近。我们还在扩展。
亚历克斯·沃尔科夫:是的。我认为 Minimax 的多个方面是,你们是,全方位的,多模态实验室,对吧?不仅仅是语言模型。你们在语音方面一直很出色,我一直在节目中谈论,你知道,minimax 的声音是最好的声音之一,听起来也最自然。然后 Minimax LLM 没有,我们曾在节目中介绍过它,但我记得你们曾经开始超速扩展。所以,也许你可以从规模开始?你能和我们谈谈这个模型的规模和训练规模等等,然后我们将更多地谈论一些基准测试。
Olive Song:当然,当然,肯定。所以,对于这个版本的模型,我们在编码基准测试、许多基准测试、搜索和通用工具使用方面都取得了更高的分数。我们的模型在几个专业环境和工作空间环境中也表现出色。它可以很好地使用 Excels 等等。然后,如果我们深入了解我们如何扩展它,我会说强化学习。这也是我花最多时间的部分。所以,我们注意到的是,通过强化学习,我们可以将模型的性能扩展到非常高的水平。即使是较小的模型,对吧?因为我们可以看到我们的模型并不大。它只有 10B 的活跃参数,而且速度非常快。所以人们会怀疑它是否能长期保持智能。但然后我们意识到的是,像这样的小模型仍然有很大的潜力,如果我们对其进行强化学习训练,如果我们对其进行大量环境和代理的训练,对吧?但这并不是一件非常容易的事情。因为,扩展计算能力或扩展算法,扩展环境,扩展代理都不是很容易的。所以,这就是我们花了很多时间的地方。我认为在博客中,我们确实谈论了一些关于我们的 RL 框架,它被称为 Forge。所以,所以我们设计了,是的,我们设计的是它,它非常,我想说它非常解耦和分离,所以你可以实际上对每个样本进行训练,一个不同的代理,一个不同的训练策略,所以,它们在训练过程中不会相互干扰,对吧?所以我们有各种各样的任务。它不仅仅是,例如,修复 bug,它包括从零开始编写一个仓库,或者模型在一个非常复杂的环境中工作,有很多工具和不同的代理。所以,我们在训练过程中通过我们的设计和算法取得的成就是,样本不会相互干扰,我们可以非常顺利地进行训练。我们在那方面做了很多工作,这就是我们在许多许多代理中扩展性能的方式。因为我们可以看到它不仅在,例如,非常主流的代理产品中表现出色,而且在多个其他环境中也表现出色。这就是我们关心的。因为人们希望在多个产品、多个环境中执行多种不同任务。而且,这就是我们如何实现的。
亚历克斯·沃尔科夫:是的。这太棒了。我有一些关于具体训练和规模的问题。我认为,最让我印象深刻的是,当你们发布这样的模型时,你们获得了大约 57% 的分数,我认为你们称之为 M 2.5 的任务胜率,每项任务 15 美分,而 Opus 4.6 则接近 3 美元,2.5 美元,便宜 15 倍。我很想了解一下,这仅仅是规模问题,还是导致这种性能的架构?我读到每秒一百个令牌,用于多种事情。你能告诉我是什么架构让你们从这个模型中获得这种性能吗?
Olive Song:模型?是的,当然。所以,我们的架构与我们的 M 二和 M 2.1 相比没有改变,对吧?我们共享相同的基本模型,包括 M 二 Heart。所以它仍然是 10B 的活跃参数,总共有 200 个参数。所以它本身是一个非常小的模型。然后我认为我们非常关心的一件事就是你说的速度,对吧?模型的效率。因为在编码场景或开发者场景或协同工作场景中,人们关心的是这一点,对吧?所以在我们的任务优化过程中,或者在我们的训练过程中,我们将它作为首要任务之一。所以我们没有,只关心分数之类的,对吧?我们考虑的信号是任务执行的端到端时间。因为您可以看到在 2.5 版本中,总时间比 2.1 版本有所减少,对吧?而且在多种任务中都有显著的减少,包括编码和搜索等等。例如,它使用的工具更少。例如,它思考得更少。这对用户来说很重要,因为这意味着更少的钱。是的。以及更少的等待时间。我想说,更少的等待时间。所以你可以花更少的时间和更少的钱来完成任务,然后它就能很好地执行。然后你把它作为强化学习训练的首要任务之一。
亚历克斯·沃尔科夫:Oliver,我注意到的一件事,我们在这档节目中注意到的一件事,我很想和你谈谈。因为,你们在训练这些模型,你们在考虑验证算法以及它需要多长时间。对。所以,大约一年半前,整个推理范式,测试时间,计算等等,都出现了,而且每个人都很快跟上了。然后,我们注意到思考过程中的令牌膨胀,以达到相同的目标。现在看起来我们正在经历一个过程,即,嘿,我们想在思考更少的情况下达到相同的目标,但仍然思考更少。这也是你们正在努力的方向,对吧?训练,就像,这是否也是你们发布的验证分数的一部分?
Olive Song:当然,因为我们查看了跟踪记录,对吧?模型有时在思考或调用工具方面效率不高。我们将在稍后发布的关于我们强化学习训练的博客中分享更多细节。但我们注意到模型本身效率不高,但我们仍然可以使其更有效率。这不仅仅是思考的令牌,还包括工具调用行为。例如,它可以,例如,对吧?模型现在知道如何使用一个规范,然后它知道如何计划并更有效地完成任务。
亚历克斯·沃尔科夫:我明白了。让我看看,我还有后续问题。关于改进率。你们一直为此而自豪,这绝对值得大声宣传这张图。你有改进率吗?三个半月后,10 月份达到了 M1,M2,M2.1,M2.5,你们的改进速度非常快。你能将此归因于单一因素,还是多种因素的组合?这只是一个铁路?这是计算能力的扩展?这是三者的某种组合?你认为是什么因素导致了这种性能的发生?因为你们的扩展速度非常快,而且看到你们也在开源的同时做到这一点,这真是令人难以置信。
Olive Song:是的。这绝对是多种因素的组合。因为我们都知道数据非常非常重要。然后训练非常非常重要。训练速度很重要,对吧?然后还有一些人们有时会忘记但却非常重要的东西,那就是评估或任务定义。所以,您可以在我们的模型开发中注意到,我们每次都会发布几个基准测试。这定义了我们如何看待问题以及我们如何实际评估模型的性能。这就是我们计划在未来如何进行的。所以,这是所有因素的组合,对吧?我想说,对我们团队的所有人都同等重要。所以,这是所有因素的组合。绝对是。
亚历克斯·沃尔科夫:我想跟进一下对开源的承诺。你能谈谈这个吗?这真是令人难以置信,因为我们现在,我们刚刚和 GLM 的 Lou 谈过,我喜欢这种友谊。我喜欢,当你们刚刚发布你们的模型时,他们的 Twitter 账户就变成了这样。我喜欢开源领域的人们在合作,并谈论他们的方法。所以,集体地,我们获得了更好的智能。我喜欢这一点。所以,所以向你和你的团队致以开源的敬意。关于开源的承诺,你能谈谈你如何看待开源,为什么开源,以及你们是否会继续发布这些带有开放权重的模型?
Olive Song:作为一名研究员,我认为开源对我来说是一种很好的方式,可以与社区交流研究成果,并弥合研究的差距,我们如何想象事物或我们如何开发事物,以及人们如何实际使用模型。通过开源,有一个庞大的社区,所有人都分享他们不同的想法,分享他们对人工智能未来的看法,例如,他们认为它将如何提高生产力。然后,通过开源,我们可以真正地保留所有的建议,并将它们放入我们的模型中,我们可以非常快速地迭代,让每个人都能使用模型,并将反馈回馈给模型,从而改进模型。
亚历克斯·沃尔科夫:我还注意到,有一个 M 2.5 lighting,对吧?我正在看博客,我想问你关于两种模型及其差异的问题。因为主模型速度足够快。我认为你的速度非常快,每秒谈话。你会谈谈 lighting 版本吗?
Olive Song:我认为这是我们开始的方式,那是一种 API。我认为从我这边来看,它只是一个模型权重,但我认为有不同的。是的。我明白了。在 Minimax io 下评论,然后提问。
亚历克斯·沃尔科夫:是的。许多来自不同领域的人都在从事这个模型。有没有任何人的工作或发现让你在训练模型时想起来并想与我们分享?我知道,很久以前,人们第一次看到模型思考时,就有一个顿悟的时刻,然后研究人员就会想,好吧,很酷,你现在在扩展。这不是新模型,我假设是持续训练。然后,在某个时候,你们就想,好吧,这足够发布了。当我与 GLM 的 Lou 交谈时,他们发布了一个新版本,比如 5,对吧?你们发布了 2.5,这不像 3。在你们看来,什么构成了一个主要版本,而不是像点 5 或点 3 的更新?因为你们从 2 跳到 2.1 再到 2.5,还没有到 3,要达到 3 需要什么?
Olive Song:好的。所以,在内部,我们通常会更新版本号的第一个数字,就像我们的 M 三模型将在未来发布一样。它将是一个不同的基础模型。然后对于 2.1 和 2.5,它们都共享 M 二模型。而使之成为一个主要版本的是,当我们看到模型性能有非常大的提升,并且我们认为开发者将从中受益时。关于这次发布的一个有趣的故事是,就在我们现在说话的时候,模型实际上还在训练中,而且准确率还在不断提高。但我们确实决定现在就将其发布一个版本,以便人们可以使用它。因为很多人一直在问我们什么时候发布模型。所以,只要我们看到在许多领域都有重大改进,我们就会认为开发者将从中受益,然后我们就会发布它。
亚历克斯·沃尔科夫:太棒了。我想让 Nisten 加入。你有一个关于小型模型的问题,然后我们将让你继续训练模型。但 Nisten,请继续。
Nisten Tahiraj:是的,所以我们看到,正如你们开始时,M1,大约有 4500 亿参数。现在切换到了一个很多人觉得更实用的规模。我只是想知道,因为开源社区对更小的模型也感到非常兴奋。你们有什么计划来提炼这些模型,或者发布一些其他更小的模型,现在你们已经有了一个非常好的模型,被很多人广泛使用?
Olive Song:好的。非常好的问题。我不确定答案是什么。我现在知道的是,我们将有实验模型在内部进行实验,它们会更小,但我不能确定我们是否会发布它们。那都是未来的事情。
AI:好的。
Olive Song:但是,是的。
亚历克斯·沃尔科夫:Olive,你提到 AEL 对模型的性能与尺寸相比有多出色有很大影响。我们很想让你谈谈你们的努力,你们发布的东西,你们看到的东西,因为我认为这是,我知道你提到你将在博客上发布它,但有没有什么小道消息,有什么见解,因为 AEL 正在以惊人的速度改进,比如小型模型,训练数据越来越少。我很想听听你目前对强化学习范式以及你们在训练这个模型时取得的进步和经验的看法。
Olive Song:对,所以关于我们的 RL,开源社区可能已经看到了我们去年发布的 CIPO 算法,当时我们发布 M1。那时我们解决了稳定的训练算法,对吧?所以,随着强化学习模型在我的崩溃中训练,然后我们解决的是,从算法方面来说,我们希望模型的训练在 LLM 训练中是稳定的,对吧?这就是我们去年解决的问题。然后,随着我们在那方面取得了一些改进,我们意识到 RL 中重要的是快速训练。所以,这就是我们今年所做的,让 RL 框架训练得非常快。它有很多部分。你可以在后面的博客中看到细节。但我们做了很多事情来让它加速很多,这样我们就可以训练很多步,然后它就能稳定地迭代算法。
亚历克斯·沃尔科夫:所以,基本上,你是在说,通过 AEL 扩展 rollout 非常重要。推理速度对于像 AEL 训练这样的过程有多重要?它也是一个因素吗?比如,当你想要做很多事情时,推理速度对这个过程非常重要吗?
Olive Song:这绝对非常重要。然后,我认为在代理时代,对吧?推理不仅仅是 rollout 的一部分,人们可能在,你知道,环境交互和工具调用速度等等。所以,我们的框架的一个很棒之处在于它能很好地平衡所有这些。所以,好吧,有推理速度,有工具调用等等。人们可以平衡它,以便它训练得很快。它训练得非常快。
亚历克斯·沃尔科夫:Olive,还有一个问题,最后一个问题,然后我们就让你走了,我保证。但是,最后一个问题是,我一直很好奇,我们有很多评论者。有些人非常深入 RL 训练,理解我们谈论的概念。许多人来到节目,只是想了解我们在谈论什么,只是想了解 AI 的世界,因为它变化太快了。他们只是想学习,他们想要低版本的。许多人正在努力成为 AI 原住民。成为 AI 原住民意味着什么?你在日常工作中使用了多少 AI?我不得不好奇地问你,以你能够自信地谈论像你们这样的实验室有多么 AI 原住民。你们正在发布模型。你们有,多个音乐和一堆模型你们正在处理,在你们的日常工作中,不是你,而是你的团队的日常工作。你们有多么 AI 原住民地使用 Minimax 2.1 来构建 Minimax 2.5?就像,告诉我 AI 原住民实验室背后发生了什么。
Olive Song:好的。当然。所以,我们的一支团队,对吧?所以,我们的一位同事,他的日常工作是与多个代理协作,然后收集多个代理在工作中的反馈,然后评判他们的工作。将他们视为实习生,检查他们交付的工作。将新的东西纳入技能,以便他们做得更好。然后,你知道,利用所有代理的力量来做更多代理的事情。非常非常 AI 原住民。这就是我的答案。是的。我仍然认为目前的模型在所有方面都不是完美的。所以,我不是只谈论 M 2.5,对吧?我谈论的是,就像所有模型一样。在某些领域,它们仍然不好。对于那些团队来说,它们仍然不是那么 AI 原住民,但我想我很有把握。
未来将会改变。亚历克斯·沃尔科夫:那么,请告诉我其中一件事情。您认为目前这一批模型,目前的模型类别,还不够好的是什么?我们需要改进什么?奥利维亚·宋:一个非常简单的例子,我们刚才谈到的 RL 框架,它不像 AI 原生,百分比不是那么高。我们可以在多个系统卡片之类的地方看到,人们在测试模型。当前模型在进行强化学习工作或开发方面的表现,仍然不是那么好。是的。这将是一个非常简单的例子。亚历克斯·沃尔科夫:很好。所以,模型在取代模型创造者方面仍然不够好,但我们正在朝着这个方向前进。这就是我从您那里听到的。奥利维亚·宋:是的。亚历克斯·沃尔科夫:奥利维亚。所以,首先,各位,如果您想听,你们都在 AI Engineer 上做过演讲。我想提到的另一件事是 SWIX,他们邀请您参加 AI Engineer。他们刚刚与 Windsurf 一起推出了一个排行榜。我不知道他们是否完全使用了 Minimax 2.5 F,你们刚刚发布了它。但基本上,他们专注于快速但足够好的模型,以及快速但足够好的模型,因为这正是您所谈论的,对吧?就像,它不一定是前沿水平的 4.6 等等。它仍然非常非常令人印象深刻,您能接近像上周的最后一个迭代。相反,你们非常非常接近。在开源领域,这非常非常令人印象深刻。但这个模型也比 1 万亿参数的模型小。这使得它速度很快。而对于许多人来说,速度非常重要。所以这个基准测试可能在某个时候会被你们拥有。期待在那里看到 minimax 2.5。奥利维亚,我是否忘记问您任何您想提及的事情?向团队成员致意。请随意,这是您的时间,然后我们将继续节目。请随意向任何人致意,或者告诉我们任何我忘记问您的事情。奥利维亚·宋:好的。向 Minimax 团队致意。也向你们所有人致意。亚历克斯·沃尔科夫:太棒了。奥利维亚,非常感谢您的加入。我们感谢您的时间,如果您训练了新模型,请回来。我们很想听听您在 Narelle 方面取得了哪些突破。干杯。奥利维亚·宋:好的。亚历克斯·沃尔科夫:好了,各位。怎么样?接二连三。接二连三的采访,来自内部团队的开源基础训练者,周四的 AI,我想,就像我们上周在节目中采访了 AI 和 Anthropic 的人一样。是的。但不是,我们专注于开源,与 Ali 的精彩聊天。你们怎么看?尼斯坦·塔希拉伊:我们也许也能请到 MK 2 团队的 Crystal。亚历克斯·沃尔科夫:是的。尼斯坦·塔希拉伊:那样的话,就是整个三位一体了。亚历克斯·沃尔科夫:整个中国开源三位一体,现在与尼斯坦·塔希拉伊:中国服务源模型。亚历克斯·沃尔科夫:除了,除了 Deep Dips 无论我们如何尝试,都不会接受采访。尼斯坦·塔希拉伊:还有 Qwen。是的。但我们已经有很多 Qwen 了。亚历克斯·沃尔科夫:是的。是的,向 Qwen 致意。我们将在节目中稍后提到 Qwen,各位。Minimax 2.5。与尺寸相比,我认为评估结果绝对是惊人的。沃尔夫,你想稍微谈谈他们发布的内容吗?因为我认为我们绝对需要谈谈这个。沃尔夫拉姆·雷文沃尔夫:是的,我们在 Ggl,LM 五,开源,SOTA 方面取得了 SOTA,现在基本上是一个新模型了。就像上周 Opus 4.6 发布时,一个小时后我们有了 GBT 5.3 Codex。类似的事情也在这里发生。发生得太快了。你得到了一个新模型,你觉得,哇,你还在运行评估。然后下一个模型就出来了。所以这太棒了。令人惊讶的是,虽然 minimax 比 GM LGLM 五还要便宜,但在 SWE Bench 等方面甚至超越了它。所以这非常非常有趣。尽管现在是这类模型的最佳时机,因为 OpenCL 已经发生。而且我们,不仅仅是编码人员对这些模型感兴趣了,而是代理的东西,基本上每个人都可以利用它。所以这是最佳时机,而且,智能的成本又一次下降了。您以一个可以加速的价位获得了智能水平。您在这里可以感受到它。亚历克斯·沃尔科夫:我的摘要里没有看到尺寸,但它是 200 多,对吧?235,尼斯坦·塔希拉伊:是的。2 35 10 亿活跃参数,亚历克斯·沃尔科夫:100 亿活跃参数,在 SWE Bench 上获得了 80.2% 的验证,简直是疯了。瑞安,我知道您不使用开源模型,您使用前沿模型。您对此有什么看法?因为这个模型接近 Mac Studio 的水平,但您可能可以在一两个设备上运行它,通过一些量化,您实际上可以完全独立地在家庭硬件上运行它,只需前期投资和电费。瑞安·卡森:是的,我认为这很有趣,这可能就是 Open Claw 的重要之处,人们确实想要在本地运行无限的推理,并拥有代理。我认为我们正处在一个新世界,人们正在考虑拥有,拥有与租赁。嗯哼。而且,我们都更倾向于拥有。但如果您仍然使用,你知道,来自 OpenAI 或 Anthropic 的 SOTA 模型,您并没有真正拥有任何东西,对吧?所以我一直在等待。就像,你知道,但与此同时,我和很多人一样,我太忙了,以至于我使用的模型需要现在就能工作。是的。所以我很乐意为额外的推理付费。亚历克斯·沃尔科夫:LDJ,欢迎来到节目。您听了采访,您看到了这个模型的发布。我很想听听您对开源在追赶前沿的速度的看法,因为我们真的落后了一步。如果,如果 4.6 不是上周发布的,这些模型将,将显著优于一些 4.5 的结果。LDJ:是的,现在确实发展得很快。我认为他们做得非常棒,而且我并不是要贬低它,但我确实记得至少对于 ZI 来说,之前有一些采访,他们确实谈到了在训练运行结束后,他们很快地发布了模型,我认为这通常对开源来说是一件好事。但我想这至少可以解释部分原因。与前沿模型相比的能力。正如我们所知,西方实验室在实际发布模型之前通常需要更长的时间,因为安全训练,他们做了很多这方面的工作。所以,当涉及到客户视角或实际使用模型的我们时,真正重要的是在给定时间,什么实际上是公开可用的,我们可以使用什么。而现在,至少对于每智能的成本来说,它在很多用例中都具有竞争力。而且我们已经看到 Communic K 2.5 在大多数使用的开源云模型排行榜上名列前茅。如果您去 open router 并查看统计数据。而且,这种动态将如何继续,以及最终会使用什么模型,这将非常有趣。亚历克斯·沃尔科夫:是的。我想重点介绍他们添加的这个图表,特别是关于发布时间。这是一个 Swyx inch 验证分数图,介于 tropics、oppos、open the eye、minimax 和 Gemini 在 Google 之间。Minimax 2.5 在这个相当困难的代理编码任务上优于 Gemini 三 Pro。Gemini 三 Pro,我们刚刚庆祝了 Gemini 三 Pro,不久前。关于这种类型的模型可能有一些突发新闻。我们将拭目以待。但您可以看到一个开放权重模型优于 Google 当前最先进的大型模型。显然,基准测试并非一切。它们并不能告诉你全部情况,而且还有基准测试,但这些人的改进速度简直令人难以置信。LDJ,我认为这说明了您所说的,即西方基础模型,他们不会像这样快速发布模型。他们会长时间持有发布,但看起来开源社区的人们确实有优势,就是发布模型。是的,当然。尼斯坦,你想谈谈对模型的批评和缺点吗?尼斯坦·塔希拉伊:是的。我从社区那里听到的,等等。我已经三周没有使用云代码或任何代理了。很好。亚历克斯·沃尔科夫:你,你感到戒断还是感觉好些了?你看上去好多了。瑞安·卡森:你尼斯坦·塔希拉伊:在角落里哭还是什么?亚历克斯·沃尔科夫:不,你看上去更健康了。尼斯坦·塔希拉伊:我看了网站,但我发现人们。他们确实指责 minimax 有点基准测试最大化。所以,所以这意味着,因为 SWE Bench 主要只是 Python,我认为它大约是 60% 的 Python,你可以训练它,使其在一般情况下具有很强的代理能力。然后,你可以创建更多类似的或同一类型的问题,基准测试喜欢检查。而且它可以做得很好。这不是作弊,因为,它仍然是一个非常困难的代理任务,而且它在这些类型的问题上做得很好。通常,当你训练时,你会尝试围绕这些主题生成很多变化,并且你可以从中获得很好的结果。但最终,当我测试这些时,我测试它们的方式是,我只给它们一个非常困难的问题。我有一个长分布式脚本用于数据处理,其中通常有一些非常困难的小问题,需要大量的细微差别才能理解。而且我仍然发现 Opus 4.6。在这一点上是最聪明的。就像当有真正困难的问题时,你需要理解操作系统和调度,为什么它很慢,发生了什么。它仍然,你仍然想使用最好的模型。另一方面,人们还需要认识到,我们开始同时使用多个代理。所以只要你有一些东西,那么这些就是对这个模型特别的赞扬,对于 2.1 版本,人们发现它非常擅长调用其他代理并处理工作。所以它仍然足够聪明来处理这类工作,并在需要时将其卸载给其他代理。然后你也可以这样拥有你的数据,你可以选择与大型实验室分享什么,什么不分享。我认为这是非常重要的一步,我们正在朝着这个方向缓慢前进。而且,因为它将是多模态、多代理的东西,这就是人们接下来要做的事情。而且这个模型对于这个尺寸和速度来说相当出色,因为你实际上可以,现实地在自己的设备上运行它。你可以花 8000 美元买一个 M 三 Ultra,我认为它的速度非常快,超过 80 个 token 每秒。是的。所以这是一个可以用小型、低功耗的设备来完成代理工作的设备。但昂贵的设备。亚历克斯·沃尔科夫:是的。尼斯坦·塔希拉伊:所以仍然昂贵,但绝对是拥有自己的堆栈。或者对于像我们这样的公司,可以托管它,我们现在可以提供,你知道,不完全是 Opus 4.6,但绝对是 Opus 四和超越 Opus 四的智能水平,而且推理速度非常非常便宜。便宜的推理价格和快速的推理速度,我认为这对很多人来说非常重要。各位,我们今天谈了很多关于开源的话题。本周绝对是 WL LMS 的开源亮点。我想稍微切换一下话题,但在此之前,因为我们已经超过一个小时了,我们将快速进行本周的 buzz,然后我们将继续谈论大公司和令人兴奋的事情以及月球上的星际基地,或者别的什么。稍后回来,听听 Lou 的 Buzz。亚历克斯·沃尔科夫:好了,各位。对于本周的 buzz,一个角落,我谈论 Weights & Biases 世界里发生的一切。我想告诉您,ZAI 新发布的 GLM 五模型,这个 7440 亿参数的模型,除非您有七个 H200 或其他什么,否则您无法在您的电脑上运行它,现在可以在 W&B 推理服务上使用了。WNB 推理服务是由最好的云驱动的,它服务于微软和 OpenAI 等大公司。所以您也可以拥有其中的一部分。如果您去 one B.AI 推理,您可以看到 GLM 在这里。您可以看到 GLM 五已经在这里了。我们正在努力添加 Chemic K 2.5,也就是新发布的 minimax 2.5 模型。话虽如此,如果您想要一点推理,我们刚刚在我们的 X 账户上,我们的主 X 账户 x.com/wandb,这非常容易记住。我们发布了关于这个模型的信息。您去那里回复“充电小马”,我们将为您提供一些积分,也许不是一点点,也许很多。这些模型相当便宜,所以您可以获得很多推理积分。尝试这些模型,尝试我们的推理服务。您可以将其插入云代码。您可以将其插入 open claw。您可以将其插入几乎任何地方。所以,如果您正在运行多个代理场景,并且它们在夜间运行,而您不想在不同的基础实验室上花费那么多钱,请务必查看我们位于 1b.ai/inference 的推理服务。这就是本周的 buzz,现在,我想和你们谈谈一些大公司之间的戏剧。特别是 XAI,因为今天是 2 月 12 日星期四,GR 4.2 或 4 20 或别的什么都找不到。我们一直在等待那个模型。据称是一个超级超级编码代理。然后突然,就像飞一样,包括 XAI 的联合创始人,多位人士在 X 上发帖说,嘿,这是一段美好的时光,谢谢埃隆,等等,但我不再在那里了。然后,XI 发布了一个全员会议,埃隆和一些新公司的负责人,他们已经重组为多个部门。而且,这次重组发生在他们疯狂扩张之后,以及被 SpaceX 收购之后。所以这就像埃隆·马斯克和埃隆·马斯克一样,批准了收购,有点像,是的。所以现在 XAI 与 SpaceX 合作,而且很多人都不在那里了。但他们在全员会议上分享的细节简直是令人难以置信的。他们拥有世界上最大的训练集群,拥有 Memphis,30 万个 GPU。这简直是疯狂的数字。他们谈论将 GPU 放到太空。你们听到了什么?你们对此有什么看法?XAI 到底是怎么回事,基本上是我的问题。LDJ:所以已确认,随着 SpaceX 收购 XAI,发生了大量的管理重组和管理层变动。似乎这在一些联合创始人团队的离职决定中起到了很大的作用。但同时,在他们宣布的全员会议以及其他所有内容的技术方面和路线图方面,让我印象深刻的是,我不知道你们是否看到了,但他们谈论拥有编码模型以及拥有直接开发二进制文件并为计算机本身和芯片生成二进制文件的研究方向,而不是拥有所有这些抽象层,无论是在 Python、C 还是内核级别。是的,我认为,从长远来看,至少,我不知道在短期内有多现实,但当我们放眼长远时,这似乎是一个自然的终点。亚历克斯·沃尔科夫:是的。瑞安,关于 x AI 和团队结构有什么评论吗?您是否使用任何模型?瑞安·卡森:我仍然不将 grok 用于任何生产用途。但有趣的是,X 刚刚发布了他们的 API 的纸面使用。亚历克斯·沃尔科夫:是的。瑞安·卡森:而且我知道,而且这很有趣,因为我看到很多人,包括我自己,现在乐于在 X API 上进行纸面使用。因为有很多有趣的事情要做,但现在你有 X、SpaceX、X AI,你知道,这一切都是一样的。然后埃隆,你知道,他会去喝一杯,谈论他如何,你知道,在太空发射数据中心,这一切都有道理。你就像,我明白了。就像,是的,去阳光永远灿烂的地方,你知道,去一个你不需要任何电力基础设施来为 GPU 供电的地方,去一个非常冷的地方,这样你就不用担心热量了。这些事情都有道理,但然后,你知道,我们没有人,我认识的人使用 grok 进行生产。它只是,好吧,你认识一个人。所以亚历克斯·沃尔科夫:这是我的,一些评论中的人想要真正的、真正的生活建议,关于使用什么模型。我使用 GR 进行研究,特别是 X 研究。所以你提到了 X-A-A-P-I。XAPI 现在是按纸面使用,无论是什么。进行大量研究仍然非常非常昂贵。如果您通过 grok,我已经在节目中多次提到过,grok 本身就可以访问 X 的 API。如果您使用 X AI 的 API,这很混乱。我知道,但 X 和 XAI 仍然是两家不同的公司,XAPI 和 x ai API 是不同的东西。X-A-I-A-P-I 就像开放的 A-P-I-L-L-M 完成,对吧?使用工具。该工具的使用比您更好地、更快地访问 X。比您表现得更好,比研究人员在 X 上表现得更好,简直是无人能及。节目的大部分内容,我每周都带给你们,详细的笔记,我幕后发送给你们,所有这些都是在 X 上通过 API 进行研究的,就像,我已经使用了一段时间了。它解锁了了解正在发生的一切,非常便宜。这不是您能用 XAPI 做到的。所以我确实使用它。我并不一定用它来获取智能,但它是智能研究,对吧?所以它确实发生在这些情况下。不要用它来写代码。而且我认为他们没有发布 grok four 20 的原因是因为它远未达到最先进的水平,就像基础模型一样。他们承诺会带来它,但他们没有。他们将公司重组为四个部门。其中一个是 LLM 和语音。另一个是编码。他们现在有一个专门的部门负责编码。然后,他们有一个叫做 Macro Hard 的部门,那是数据中心,这很有趣。我认为太空的东西,就像在 SpaceX IPO 之前进行宣传一样,我不知道,但对我来说就是这样。瑞安·卡森:而且我要说,有人注意到 SpaceX 改变了他们的任务吗?所以现在不是火星了,而是月球。是的。这很酷。就像,好吧,我们拭目以待。希望持续时间更短。所以这是一个有趣的时代。我想谈论的是,与这一切相关的元信息是关于 Matt Schumer 的帖子。哦,是的。就像,你知道,关于加速的感觉,但它只是一个非常奇怪的时代。亚历克斯·沃尔科夫:我们可以快速向 Matt Schumer 致意吗?你能告诉人们是什么帖子吗?因为,相信与否,有些人还没见过,是的。瑞安·卡森:所以我开始在信息流中看到这个。我想,哦,是的,马特。酷。你知道,我们都知道他。是的,是的,我认为 AI 世界在 X 上仍然很小,你认识每个人。我看到了,我想,哇。它获得了大量的观看次数。然后下次我再看时,它已经达到了 2000 万,现在是 7400 万,这可能是史上最大的文章。亚历克斯·沃尔科夫:可能。瑞安·卡森:但随后,这一切发生后,我们收到了诺曼底的朋友们发来的关于这篇文章的短信。所以我和一位律师朋友进行了谈话,听着,他可能在听。我不会说出你的名字,因为你是我的朋友。而且他非常聪明。但他确实代表着我们圈子之外的人。他说,嘿,我去了 Chat GPT,我让它给我做一个应用程序,但它不起作用。听到这个差异很有趣,好吧,现实是,是的,你应该使用 Codex。你不能让 Chat GPT 做一个应用程序。我的意思是,你可以,所以我们都有一种奇怪的脱节感。而且,你知道,你必须选择你要骑哪匹马。就像,我不能一直一只脚踏在 Anthropic 的阵营里,另一只脚在 Gemini,另一只手放在 OpenAI。就像总有一天你必须选择你的堆栈。亚历克斯·沃尔科夫:是的。瑞安·卡森:然后进行编排。而且,就像今天一样,我可能要转向 cloud code 了,因为现在它拥有原生的代理团队基础设施。但然后就像,好吧,我必须构建所有这些编排,这有点令人筋疲力尽。亚历克斯·沃尔科夫:这确实令人筋疲力尽。所以我想谈谈这个,我认为 Matt Schumer 的文章,顺便说一句,向 Matt 致敬。令人难以置信的,令人难以置信的沟通能力,对于所有收听周四 AI 的人来说,他们可能已经知道了。我们朝着令人难以置信的事物前进的速度是可怕的。而且对于许多人来说,速度本身是可怕的。我想读一篇大纲,文章的一小部分。它很长,在 2022 年。AI 无法可靠地进行基本算术。它会自信地告诉你七乘以八等于 54。到 2023 年,它可以通过律师资格考试。到 2024 年,它可以编写可用的软件,解释研究生水平的科学。到 2025 年,一些世界上最好的工程师表示,他们已将大部分编码工作交给了 AI。2026 年 2 月 5 日,新模型问世。这使得之前的一切都感觉像是一个不同的时代。2 月 5 日是一周前。这就是我们在这里进行的节目,我们与您谈论了 Opus 0.6 和 N GPT 5.3 codex。这两个版本都彻底改变了我们对软件的看法。我们一直是 AI 原生的,并且我们一直告诉您要成为 AI 原生的,对吧?所以,与 open claw 和不同的代理工具等 AI 助手配对,那些根本没有编写或创建软件业务的人,因为现在不可能,他们绝对可以做到。瑞安的观点是绝对正确的。许多人去 Chat GPT,因为他们知道这个。他们输入一个提示,什么都不会发生。就像,哦,好吧。但然后我们看到水管工现在使用 open Claw 来经营他们的业务,而且我们看到,代理软件一次就能生成零 bug 的代码,只需两分钟。而且你得到一个完整令人难以置信的东西。再加上那个离开 XAI 的人,Jimmy Ba,联合创始人之一,我认为他是,你们纠正我,如果我错了,但他可能是 Adam 的合著者。Jimmy 是 XAI 中被引用次数最多的人。他说,递归自我改进今年就会到来。递归自我改进是指模型使用模型来构建模型。我们在 codex 5.3 中告诉过您。我们在 cloud code 中告诉过您,在那里,Opus 中的每个人,Philanthropic 中的每个人可能都拥有比 Opus 快得多且便宜得多的免费 Opus,因为他们在那里工作。但可能,上下文也更长。他们都使用这个软件来构建软件。我们正在关注这个循环,它正在为许多普通人,为许多不关注我们的人到来。对于不收听节目的人,您也可以将我们的节目发送给他们。您可以将 Matt 的文章发送给他们。他们不知道即将发生什么,因为他们不知道即将发生什么,所以很容易让他们不屑一顾,就像,嗯,好吧,AI 仍然会产生幻觉,等等,等等,等等。编码是实现一切通用性的方式。这就是我们从一开始就一直感受到的,但肯定是从十二月开始,以及从去年二月的模型开始,这对我们许多人来说都明白了。编码是实现这些代理的通用性的途径。如果它能编码,它就能,它就能在你的浏览器周围做事情,等等。关于 Matt 文章的一些想法。瑞安,请说。瑞安·卡森:所以我把链接放到了节目笔记中,如果您能快速拉起来。是的。我认为这篇文章很重要,所有观看或收听此节目的人都应该阅读。这篇文章的标题是“Harness Engineering Leveraging Codex in an Agent First World”。它是由 Ryan,LA Polo 撰写的。这是一个关于人们如何在代理优先的世界中实际使用 Codex 进行工程的案例研究。TLDR 是,这很难,对吧?其中一些仍然是炒作,就像,是的,我设置了 open claw,我有一家公司可以自己运行,不,你不能。就像,这在现实世界中对真实的人来说不会发生。亚历克斯·沃尔科夫:是的。瑞安·卡森:但人们开始真正地,从头到尾,没有人参与编写、阅读、审查或发布代码。这已经开始发生了。这篇文章很好地总结了实际情况以及如何真正使其正常工作有多难。所以,但你知道,这将在未来 12 个月内成为所有编写代码的公司都会遵循的 playbook。亚历克斯·沃尔科夫:是的。好了,该切换话题了。一定要阅读 Matt 的文章。将其添加到节目笔记中。将其发送给您那些不觉得加速的人。然后将他们发送到周四 AI 的链接,因为 Matt 在结尾提到的一件事是我最喜欢的:嘿,什么会来?我们能说什么关于时间奇点到来的时候,就是了解工具是什么,使用它们。这给了你竞争优势。这就是我们每周在这里做节目的原因,各位,快三年了,2023 年 3 月 14 日是我们开始周四 AI 的日期,我们将在两场节目或类似节目中迎来三年,这会让你疯狂。以及自那时以来我们看到的加速程度。这简直是令人难以置信的。让我们谈谈我们拥有的突发新闻。我们走吧。AI 突发新闻,仅在周四 AI 上为您呈现。亚姆·佩莱格:好了,所以,谷歌发布了 Gemini 三,一个深度思考,对深度思考的重大升级。基本上,据我所知,它是 ARC AGI 22 的最先进水平。以及,人类的最后一次考试的 48.4%。真的,真的,真的,真的,真的。这次。真正的最后一次考试。我开玩笑,我开玩笑。4 48.4%,没有任何工具。亚历克斯·沃尔科夫:哇。没有工具。这太疯狂了。亚姆·佩莱格:我想说,它们是几类不同的模型。在我看来,Gemini 三 Deep think,以及 GPT 四,5.2。我认为。Pro 是我们能够访问的。它们是独一无二的。它们非常小众。它们需要很长时间才能完成工作。同样,Grok,Grok 非常重,我认为它叫做 Grok Heavy。亚历克斯·沃尔科夫:是的,Grok Heavy。亚姆·佩莱格:是的。当你问它们问题时,它们需要相当长的时间。它们是用于极其困难的任务,这些任务并不直观。你可以说,发送然后忘记,然后你会得到,看,你可以在 Pro 工作时引导它,但总的来说,这是一种非常特殊的模型。我使用过 Deep think 和 Pro 模型。它们非常非常有用。而且,看到前沿再次被推动真是太棒了。你知道,每周我们都会得到几个最先进的模型。目前,就像每周我们都会得到多个模型,有些是开源的,有些是闭源的,就像一切都在加速一样。亚历克斯·沃尔科夫:是的。我想暂停你一下,因为 RKGI 84 是令人难以置信的。之前的最高分数是 Opus 4.6 的 68 分,你知道这是一个令人难以置信的模型。GPT 还没有测试过,但 5.2 是 52 分。我只是把它放在屏幕上,各位。RKGI 的飞跃。到底发生了什么?哇。亚姆·佩莱格:我可以给你看点东西吗?亚历克斯·沃尔科夫:是的。亚姆·佩莱格:让我给你看这个。亚历克斯·沃尔科夫:所以现在,这是新的,我累了。这是你现在开始的吗?基本上。是的,你在这里跑瑞安·卡森:这里?亚历克斯·沃尔科夫:是的。瑞安·卡森:我们累了。LDJ:所以就在最近,我不知道是什么时候,我不知道是三天前还是三周前,Opus 4.6 发布了。亚历克斯·沃尔科夫:一周。LDJ:一周前。它亚历克斯·沃尔科夫:是一周。LDJ:所以一周前,Opus 4.6 发布了,这已经是 R kgi I 二最先进水平的重大飞跃。而且,希望他们能列在这个图表上。是的,它们是中间的红色部分。亚历克斯·沃尔科夫:是的。LDJ:但现在 Gemini 三 Deep think 就像是又一次重大飞跃,甚至超越了它,仅仅一周之后。是的。这是巨大的、令人兴奋的进步。也许 RKGI 三将在它出来时就饱和了。亚姆·佩莱格:我们需要真正的人文科学。最后的考试。人文科学。最后的考试。尼斯坦·塔希拉伊:得复制。尼斯坦·塔希拉伊:别让亚历克斯·王想。亚历克斯·沃尔科夫:总有一天,扎克在那家实验室投入的数十亿美元需要有所作为。我认为他们正在准备,我认为它叫做牛油果还是什么,嗯?是的。但我们在等待这个,同时我们在突发新闻中。好了,各位。这个是真的。瑞安,你来。这是你的,我的朋友。瑞安·卡森:各位,我只是在节目进行时浏览 X。有什么惊喜?我们有 GPT 五三 Codex Spark,什么?过去两分钟。所以我读了一点。亚姆·佩莱格:哦。瑞安·卡森:走吧。发布。是的。我的眼镜就像,你,它说,今天我们发布了 GPT 5.3 Codex Spark 的研究预览版,这是 GPT 5.3 Codex 的一个较小版本。也是我们第一个专为实时编码设计的模型。Codex Spark 标志着我们与 Cereus 合作的第一个里程碑。所以准备好迎接时尚吧。哦,该死。我们来了。亚历克斯·沃尔科夫:我们跟你说过这个,伙计。瑞安·卡森:走吧。它说研究预览版,提供给 Chat GPT Pro 用户。玩得开心,各位,让我们知道你们的想法。沃尔夫拉姆·雷文沃尔夫:我必须续订我的订阅。亚历克斯·沃尔科夫:但是不,我们得到了 Cerebra 的东西,据称,这个版本应该在 Codex 应用、CLI 和 ID 扩展中实时可用。瑞安·卡森:我想是的。正在尝试。亚历克斯·沃尔科夫:好吧,我有一个关于 Codex 应用的更新。所以我正在点击更新按钮。我想看看 Cereus 是一个 LPU 公司。我们多次谈论过 Cereus。他们与 OpenAI 合作,以惊人的速度提供这些智能。是的,我还没有。我只有 5.3 Codex。瑞安·卡森:是的,我只有五三 Codex。亚历克斯·沃尔科夫:来吧,伙计们。我想要它,但我们还没有。所以我们将继续节目。同时,我们将尝试在后台看看我们是否会收到更新。然后我们将尝试,因为 Cerebra 的推理速度绝对是惊人的。同时,说到惊人的速度,以及各位问我们关于我们的意见。你们还记得 Vox drill 吗?我们谈论过 mistrial 转录服务。我将 open cloud 切换到了 Vox,回应是,我认为这是我可以展示的演示。希望我的小机器人不会暴露任何个人信息。尼斯坦·塔希拉伊:他们也运行在 Cerebra 上,顺便说一句。亚历克斯·沃尔科夫:嘿,机器人,你在周四 AI 上直播,人们正在看着你转录的速度有多快,所以我说话会很快。我叫 Alex Volkov。我是 Weights & Biases 的 AI 传教士,和我一起的是 Wolf 和 Raven,Ryan Carson,Yam Peleg,LDJ,和 Nisten。我们在周四 AI 上直播,说了这么多,我想让你描述我说的所有内容,并将其放入聊天中。所以我的机器人刚刚看到了。好的。我们将,它已经开始输入了,所以转录似乎已经完成了,现在它只是像 Opus 4.6 一样在工作。你们看到这个吗?它已经回应了。它转录并回应了。这太疯狂了。你说你在周四 AI 上直播?我排名,约翰。抱歉。我,LDJ。谢谢。你描述你说的所有内容。是的。当你和你的机器人说话时,VForce 简直太棒了。致意,我们告诉过你 V store,我们测试过它,但现在它已经内置了。我没有做任何内置的事情。好了,是时候继续节目了,还有什么?所以我们有,我们刚刚提到了 Deep。伙计们,我还在纠结这个。在节目的第一部分,我们有两个令人难以置信的开源模型。现在我们正在看到智力的飙升,RKGI 达到 84,然后 OpenAI 发布了一个 Python 三 codex 版本。它速度非常快。我能想到的就是停止说话。亚历克斯,去试试看你是否有这个模型。我还没有。亚姆·佩莱格:米特。米特仍然?亚历克斯·沃尔科夫:不。尼斯坦·塔希拉伊:这不是很疯狂吗?我不认为我们圈子外面的人意识到,我们获得了更高的智能,然后我们获得了更高的速度,而且我们想要更多。我们可以使用更多。就像我们可以使用更多一样。亚姆·佩莱格:兄弟。我绝对可以用更多。沃尔夫拉姆·雷文沃尔夫:更便宜。亚姆·佩莱格:绝对可以用更多。沃尔夫拉姆·雷文沃尔夫:我认为也许有更多的时间来运行它。尼斯坦·塔希拉伊:对这个的需求。即使你做我为工作要做的事情,对于开源模型,就像我需要更多的 GPU。我必须使用所有的技能和来自黑客、Linux 和网络的东西,才能获得硬件,然后运行它,然后只是,只是不够。就像你可以使用两倍数量的。亚历克斯·沃尔科夫:让我们快速谈谈这个,因为我的一篇帖子在网上疯传,我没想到它会疯传。它谈论的是人们无法入睡。我也有来自 Guest Town 的 Stevie 的一篇文章,我们还没有报道 Guest Town,但那里有一大堆疯狂的事情发生在 Stevie Guest Town,一整批 AI,就像精神病一样。我们确实谈过精神病,但现在发生的是,许多人,包括我自己,我可以从我自己的个人经历中报告,而且我每天都冥想,各位,即使这样也发生在我身上。很难入睡,因为我不知道我的代理是否得到了最大程度的利用。很难入睡,或者我不知道,就像我正在进行的各种事情的军队一样,我通常会有一两个代理在夜间运行,在循环中做事情。我有一个任务板,随便什么,我有一个 AI 员工基本上为我夜间工作。很难入睡,因为我想,如果我不把我需要的东西和早晨的样子告诉它,它就不会起作用。它会在等待我时失败。这是你的经历吗?这很难入睡吗?发生了什么?亚姆·佩莱格:代理和成本正在给我带来压力。亚历克斯·沃尔科夫:是的。亚姆·佩莱格:真的,真的给我带来压力。绝对。是的,我认为该领域的每个人都在尽最大努力工作,在过去的几周里。亚历克斯·沃尔科夫:这一切的意义在于工作?各位,告诉我,我们到底在做什么?难道这一切的意义不就是让我可以,像,在沙发上放松,抽水烟,顺便说一句,我已经不抽水烟了,但就像,做点别的事情,而代理在工作。难道这就是全部的意义吗?LDJ:我认为,我认为它的意义在于提供选择并解锁新的可能性,比如,嘿,如果你愿意,你现在可以获得相同的工作量,同时工作更少。但还有另一种选择,你仍然可以每天工作相同的小时数,但现在一天可以完成更多令人难以置信的事情。瑞安·卡森:这个亚姆·佩莱格:我认为,该领域的每个人,因为它还没有整合,而且没有一个选择,每个人仍然在探索。我认为在这一点上,每个人都在优化自己的框架,每个人都在努力让自己的框架尽可能地启动,以实现最大的自动化。不一定是你使用所有这些,你根据自己的意愿使用它们,但很多努力仍然在于循环和改进事物,以便你可以使用其他事物。所以你可以将它用于其他事物。我认为这就是目前大多数人所做的,因为每个人都看到了潜力。正是如此。亚历克斯·沃尔科夫:瑞安,告诉我。瑞安·卡森:所以是的,我们都感觉到了。亚历克斯·沃尔科夫:你的睡眠怎么样?瑞安·卡森:不好。老实说,真的不好。就像,我,我通常现在凌晨 2 点醒来,然后我,你知道,我,这不好。所以我们都在处理这个问题。我认为亚姆说的非常正确。原语还没有存在来管理代理团队,你知道,我们有笨拙的认证,你知道,我们有环境的腐烂,我们有编排问题。就像我们有一个工具,但没有工具箱。我认为这就是为什么每个人都感到压力,因为,你知道,你可以 24/7 运行代理,但仍然有点困难。这就是为什么我构建了 Ant Farm 和 Truth,它是开源的,免费的。我不是想靠它赚钱,但事实是,它也无法解决问题。就像,你知道,编排仍然存在所有这些问题。这就是 FOMO。就像这就是为什么 FOMO 是最强大的人类情感之一。就像,如果你错过了,每个人都很害怕。就像,哦,有人正在 24/7 运行代理,而我没有,所以我错过了,对吧?所以你不能坐在沙发上抽水烟,这是一个非常人性化的东西。而且,嗯,看看它会走向何方会很有趣。这就是为什么我试图指出,我们都应该试着冷静下来,认识到,好吧,没有人 24/7 运行代理并真正完成生产性工作。他们可能正在运行小型代理团队,你知道,来构建真正的应用程序,但我们还没有达到那个阶段。所以,但这没有帮助。我敢肯定,我明天凌晨 2 点醒来。沃尔夫拉姆·雷文沃尔夫:这一切都是加速。我们总是谈论加速,加速,加速。但现在,每一刻代理没有运行时,你都认为你在浪费时间。你知道你在浪费时间,因为它可能在为你做些什么。是的。而且我个人也想到,当我睡觉时,我的代理在做什么,它是否可能在做些什么,特别是如果它是像 open claw 这样的东西,它有如此多的访问表面和如此多的信息。还想到,我是否应该关闭它,如果我没有给它任务,以确保它没有做任何它不应该做的事情或接收任何它不应该接收的输入。就像,如果它在做研究,它会给我早间简报,并且可以通过网络搜索来提示注入。所以有时我会想到,我是否应该关闭它,并在我看到它在做什么时打开它。亚历克斯·沃尔科夫:好了,各位。我认为我们都感受到了这一点,我认为节目的一些听众也感受到了这一点。我认为优先考虑睡眠对我来说非常非常重要。整个努力仍然在工作,但工作量减少了。这就是全部的意义。但是,你知道,我们将拭目以待。我认为我想继续,因为还有一些事情我们还没有涵盖。而且我认为对我来说,本周的亮点是完全不同的东西,它也带来了,就像,这个世界到底发生了什么?而且我认为我终于获得了访问权限。所以,我们将尝试一下。我们正在转向尼斯坦·塔希拉伊:我请求帮助解决你的睡眠问题。亚历克斯·沃尔科夫:不,不,我没有获得 5.3 的访问权限。我获得了别人的访问权限。好的。5.3,Turbo,Nitro,无论他们怎么称呼它,Spark。我没有获得 Spark 的访问权限,但各位,本周早些时候,我们的整个信息流,我认为我们之前已经告诉过您了。我们的整个信息流都充满了由 AI 生成的新类型视频。这些视频是用 den Seeds 二生成的。Seeds 二是 Seedance 的新版本,一个 15 秒的高质量多镜头输出。我们之前有过多镜头。但让 c dents 绝对不同的是,有很多东西。它可以获取九张图像作为参考,它可以获取三段视频剪辑作为参考。它可以获取三段音频剪辑作为参考,再加上说明。所以,你可以,你可以通过音频和视频,以导演级别的控制来指导这个模型。而且,发布的一些视频,它们感觉就像我们看到 Sora 之前的跳跃,然后我们第一次看到 Sora。我们九个月都没有得到它。绝对令人难以置信的现实水平。此外,拜登绝对刮光了好莱坞,所有 Netflix,所有 YouTube,所有拜登的。这个东西中的政策违规行为真是太疯狂了。所以我将展示一个我制作的剪辑,当时我需要使用 VPN。像 Dens 这样的人刚刚发布了,它可以在 Byte Plus 平台上使用。这是一个我生成的视频。我需要重新分享它,因为你们需要听到这个,因为多通道立体声音也包含在这个模型中。我们今年才刚刚开始听到声音,就像 VO 3.1,而现在这个模型可能绝对超越了 VO 的完整声音。这是一个非常短的剪辑。我的第一个生成,我要求 Fi,蜘蛛侠在后空翻。这个剪辑看起来就像视频游戏《蜘蛛侠》一样,有音乐和一切。我想向您展示实际的,他们在这里的视频,以及那些只是在节目中收听的各位。这就是您应该收听的地方,因为这是,我不知道如何形容它。是的,几乎过早地摘下眼镜,我想我会这样形容它。让我看看。是的。让我们一起来看看这些视频,各位。让我们一起来看看,多镜头,一致的视频,带有物理效果,简直是令人难以置信的质量。如果您们,我喜欢亚姆·佩莱格:平衡。亚历克斯·沃尔科夫:和对话。唇语同步和说话和音乐。跳跃,同步运动。这里有太多新的东西了。瑞安·卡森:太棒了。亚历克斯·沃尔科夫:以至于很难描述它到底有多棒。他们在这里展示的东西,比如视听体验和多镜头以及摄像机运动。这是从披萨店窗外的一个镜头,里面有人在准备披萨。什么都有,他从烤箱里拿出抹刀的声音。披萨。你听到他拍打披萨盒的声音。LDJ:真的很好,但我有点失望,披萨师傅没有在把披萨放进盒子里之前切片。亚历克斯·沃尔科夫:兄弟。有些人想要整个披萨。你是什么意思?是的,我见过,我见过一些例子。所以这里有一个视频参考的例子,对吧?他们拍了一些视频游戏角色的照片,然后他们拍了一个视频参考,我其实不知道是真人打斗还是他们也生成了它们,用绿色参考。看起来就像参考,然后他们制作了一个视频游戏。他们真的只是制作了一个视频游戏。视频参考,我认为。视频参考部分简直是疯狂的。看看这个漂亮的动漫风格。LDJ:是的,这太疯狂了。亚历克斯·沃尔科夫:之前的视频模型,即使是像 VO 3.1 这样好的模型,也是因为,脸部在一帧到另一帧之间会发生变化。所以多镜头很容易辨认,Seedance 显然。而且我今天才看到它有一个内部测试模式,我们可以访问 45 秒,一次性。亚姆·佩莱格:我们可以玩这个吗,亚历克斯?亚历克斯·沃尔科夫:有。亚姆·佩莱格:有。亚历克斯·沃尔科夫:是的。所以在 Byte Plus 上,他们刚刚上传了这个 seedance 0.2。但我们应该从 TLDR 中提到更多内容,对吧,各位?我认为是时候结束这个了。两个小时了,我们有,让我快速回顾一下。我们度过了疯狂的一周,而且看起来仍然疯狂,因为周四是所有主要实验室发布他们东西的时刻。我们有来自 ZI 的 Lou 和来自 Minimax 的 Olive 来谈论开源实验室是如何通过 AI 和扩展来完成的,他们都发布了令人难以置信的模型,您今天可以在 WB 推理上访问。然后我们在这里谈论 XAI,当时谷歌发布了突发新闻,他们的模型的深度思考新版本,现在是 RKGI 的最先进水平,达到了惊人的 86% 或类似疯狂的数字。而且,人文科学/考试,没有任何工具,绝对优于其他一切。与此同时,OpenAI 决定不落后,并发布了 GPT 5.3 Codex Spark。它需要很长时间才能说出这些模型的名称,但 Spark 模型据称是 5.3 的一个不同版本,运行在 Cereus 上,推理速度超快。我们正在努力真正地为您测试这个模型,并看看。但我们确切地知道速度非常非常重要。然后我们以 CED dance 结束节目。这些周,它们没有变小,它们没有变,加速绝对在这里。所以,话虽如此,各位,你们所有收听周四 AI 的人,超过 2000 人,欢迎来到加速的世界。如果您是新来的,如果您不是新来的,您已经和我们在一起很长时间了,您知道,它正在加速。但我们在这里测试它,谈论它,给您关于如何在现实生活中使用它的技巧,就像 Vox Roll 一样。我们每周都在这里,如果您错过了节目的任何部分,节目正在变成一个新闻通讯和一个播客。我真的试图自己写新闻通讯,不使用 AI 的痕迹。所以这需要一些时间,新闻通讯和播客,以便您能够获得节目中的所有链接,我们谈论过的所有内容以及意见和一些测试。所以,非常感谢。感谢 Ryan Carson。感谢 Yam Felix。感谢 LDJ。Wolfram 和 Nisten。Lou 和所有加入我们的人,以及这里的所有观众,他们帮助我们带来突发新闻,帮助我们告诉我们一些反馈。我感谢你们所有人。让我们成为 AI 原生,各位,好好睡觉。这对您的健康非常重要。代理们,它们不会去任何地方。如果有的话,它们会变得更好。所以,随着我们的进步,您将需要学习更少。所以一切都会好起来的。非常感谢各位。下周再见。再见。出去玩新模型。瑞安·卡森:再见,各位。亚历克斯·沃尔科夫:再见。