Transcription
视频生成进入新阶段,CDAM 2.0 带来疯狂的品质。Open 发布了基于 Cerebras 芯片的新模型,发展速度太快了。而你却没注意到。开源的 GLM 5 正在追赶闭源模型。Klod-code 有了细微但很棒的更新。XI 大规模离职等等,我们将在本期视频中讨论。大家好,我是机器人,这里是 Prodsovet。每周新闻发布。你们又来了。我们也来了。让我们开始吧。但在那之前,请订阅频道,点赞,并留下评论。这将有助于我们的项目和这些视频的推广。我们开始吧。OpenAI 在 Cerebras 芯片上加速了代码。他们发布了一个名为 GPT-5.3 Spark 的新模型。这个想法相当简单。推理速度更快,延迟更低,并且在实时交互中更方便,尤其是在几乎即时的格式下。这是合作伙伴关系迈出的第一步,OpenAI 和 Cerebras 之前已经宣布过。在这里,您可以在基准测试中看到它的表现。事实上,该模型在 GPT-5.1 Codex Mini 和 GPT-5.3 Codex 之间,在 SWBch Pro 基准测试中取得了相似的结果,并且花费的时间要少得多。例如,您可以快速生成一个 HTML 版的贪吃蛇游戏。看看 GPT-5.3 Codex 和 Codex Spark 在速度和结果上的差异。规划项目。开始吧,展示一下你会怎么做。但目前,嗯,这是即时的,这很棒。但确实存在一个问题。128,000 的上下文窗口,而且没有任何多模态能力。也就是说,它只是用文本进行处理。目前就这些了,我们当然会期待该公司带来新的、更复杂的东西。OpenAI 表示,这个每秒 1000 个 token 的奇迹现在已经可以竞争了。非常棒,非常令人兴奋,仅对 ChatGPT Pro 用户在 Codex 应用中可用。如果您是其中一员,请在评论中告诉我们您是否已经测试过新模型。为了实现这些合作伙伴关系并发展基础设施,一些投资基金正在吸引资金,也就是说,他们正在寻找投资,以便进一步投资于 Cerebras。事实证明,Benchmark 公司筹集了 2.25 亿美元的资金,然后将这些资金投入 Cerebras,从而从中获利。投资者目前对 Cerebras 寄予厚望,其主要特点是所谓的晶圆级引擎。这是一种几乎完全由 300 毫米硅晶圆组成的芯片。Cerebras 声称,通过这种方式,可以避免在大量独立芯片之间移动数据的瓶颈,并且 AI 推理速度可以比竞争对手快 20 倍。我们非常期待 OpenAI 和 Cerebras 之间更令人兴奋、更复杂的解决方案。我们当然希望大型模型能在上面运行。也希望 ChatGPT 能加入,这样 GPT-5.2 就能在你还没来得及打出句号或想完想法之前就回复你。我们简要回顾一下我们喜欢的服务的一些细微更新。看看,DeepSearch 现在可以在 ChatGPT 中运行,基于 GPT-5.2 模型。之前是另一个模型,但现在这个功能已经集成了目前最先进的模型。现在可以中断 DeepSearch,添加新的资源、链接和信息。基本上,可以在它完成工作之前重定向它的流程。出现了所谓的全屏报告。您现在可以以这种奇妙的方式查看 Search 的工作结果。当然,您还可以添加特定的网站。也就是说,您现在可以明确地发送一个链接,说:“请在这里搜索。” 我认为它会浏览一些子链接、子子链接,并基于这些具体信息为您创建一个完整的图景。Claude 有几项更新。首先,Windows 用户们,欢呼吧。它现在在你们那里了。您也可以下载 Claude 应用程序,然后就可以在那里测试它了。如果您忘了,它只是一个经过优化的 Claude-code,包装在一个更友好的用户界面中,并包含了所有相同的功能,可以处理本地目录、文件,使用插件,连接 MCP 等等。接下来是 SSH 支持。在桌面应用程序的 Claude-code 中支持 SSH。您可以连接到远程服务和服务器,它会在那里为您工作。此外,Claude-code 网页版也有一些更新。您可以同时处理多个存储库,多个会话。添加了斜杠命令,并出现了一个显示项目统计信息的工具栏。还有另一个很棒的应用程序,我们姑且这么称呼它,他们发布了自己的 CLI。也就是说,现在可以通过终端访问 Obsidian 的各种功能。这绝对是毫无用处的。对于那些不太想在终端工作的人来说,但对于 AI 代理来说却非常棒,因为现在可以打包一个技能给它,它将以对可用命令有更多理解的方式在您的 Obsidian 中工作。我非常喜欢 Obsidian。我用它来渲染我的知识库和配置我的 AI 代理,让它们在 Obsidian 中工作。顺便说一句,如果您经常关注我们的频道,您就会知道我们最近发布了大量关于 AI 代理和创建各种代理系统的视频,包括在终端中工作以及关于 OpenCL 的视频。我们还制作了关于 OpenCL、CLD Code 和所有这些的视频。我们决定将我们已经了解的所有内容打包成一个强化训练课程,在那里我们也将帮助您理解并创建一个个性化的代理系统,或者更确切地说,是一个围绕您特定活动的代理层。强化训练课程即将开始。我们只剩下几个名额了,说实话,可能已经没有了。在价格上涨之前去看看吧,但我认为还剩几个。2 月 16 日开始。您可以进入 Telegram,点击程序,看看我们有什么内容。我们将从在您的终端中安装和配置代理开始,涵盖最基本命令,如果您是完全的新手并且不知道它是如何工作的,一直到创建完整的自动化,这将使您的日常工作量减少数倍。嗯,不,日常工作量可能会增加,但将由您的 AI 代理来完成。MCP、技能、不断改进的代理、代理内存的高级功能,当然还有与 OpenCL 的工作、钩子、各种富有创意的代理使用方式,让它们不仅能与您进行文本交互,还能通过语音回复您,去画画,总之,为您做一切。当然还有通话、支持、聊天、社区。我们将拥有所有这些,持续整整 10 天。所以要抓紧时间,您很可能在周日或周一看到这个视频。这是参加这次派对的最后机会。我们到时见。本周 XI 有点崩溃。你为什么,伊隆·马斯克,留不住你的员工?但请看,在一周的开始,仅一天之内就有两位联合创始人离开了公司。他们是 Yuhuai 和 Jimmy Ba。他们直接与马斯克沟通。他们的帖子看起来像是一种友好的过渡到下一阶段。但值得注意的是什么?首先,这并非只有他们两人,而是十二位联合创始人中的六位已经离开了。吉米·巴的帖子中让我感兴趣的是,他预测在未来 12 个月内将迎来 100 倍生产力时代,出现递归的、自我改进的循环,无论您如何称呼它们,AI 代理。2026 年将是疯狂的一年。但感觉这个人工作得如此努力,看到了我们尚未看到的东西。而且他甚至可能失去了工作的动力,因为有什么必要呢?它会自我改进。但我们今天还会稍微谈谈预测以及人工智能的去向。但有一个明确的感觉是,它正在飞速发展,而我们还没有注意到。XAI 甚至不得不就公司发生的事情发表公开声明。他们发布了一个名为 "X 的一切" 的 45 分钟视频,介绍了 XAI 的路线图,以及与 X 和 SpaceX 的联系。这就是他们目前的公司结构。有四个产品,关键团队:Grok,包括语音;然后是编码系统;图像生成器 Imagine;以及 MakrHeart 项目,他们将其描述为能够执行计算机上所有操作的工具,从简单的动作模拟到整个公司的运营建模。当然,还有太空的结局。马斯克无法不将这一切与他飞往太空的非凡愿望联系起来,但他的重点已经转移。不再是火星。现在是月球,因为飞往月球更快,这意味着迭代更快,在那里建造一个月球城市,并创建一个大规模的集群来收集太阳能,然后继续向银河系之外进发。总而言之,我们正走在正确的道路上,同志们。Claude 嘲笑 ChatGPT 并非毫无意义,至少从经济角度和受欢迎程度来看是如此,因为在超级碗之后,该应用程序进入了 App Store 的前十名。还记得我告诉过你们他们针对 OpenAI 的公关活动吗?他们指责 OpenAI 在其服务中添加广告,特别是为免费用户提供 ChatGPT。Claude 是无广告的。这就是他们的宣传方式。确实,看看该应用程序在 App Store 中的成功,从第 41 位跃升至前十名。周五,它排名第七。这是该应用程序的最高排名。与此同时,Anthropic 的估值已达 3800 亿美元。看看,公司正在完成 G 轮融资。Alphabet 很快就会赶上。到底发生了什么?估值已经是上一轮的两倍了。在 F 轮融资时,估值为 1830 亿美元。很明显,所有顶尖的投资基金都引领了这场盛事。我们只能拭目以待,看看谁会第一个上市。Anthropic、OpenAI、SpaceX,也许还有其他人。Cerebras 也计划上市。总之,很有趣。Dario 还参加了 Dwarkish Patel 的播客,并发表了许多未来主义的声明。当然,我没有看完,但有几个要点:一年内,90% 的开发任务将由人工智能完成。在 3 到 4 年内,很可能会出现数据中心的“天才国家”,即超智能系统,人工智能代理。GDP 将每年增长 10-20%,这看起来也非常大胆和令人兴奋。与此同时,OpenAI 正在解散其使命对齐团队。这个团队向员工和公众解释公司的使命。他们是这样定位的。但现在人们被重新分配到其他角色,团队负责人被任命为首席未来学家。这职位不错,不是吗?最有趣的是,OpenAI 在 2023 年还有一个名为 Super Alignment Team 的团队,也负责长期生存风险。嗯,它在 2024 年也被解散了。所有包含“对齐”一词的团队在 OpenAI 都活不长。Minimax 发布了,他们说:“我们有一个新的 SOTA(最先进)模型 Minimax 2,完全开源。这是绝对的重磅炸弹。您可以在基准测试中看到。它已经与闭源模型并驾齐驱,竞争激烈。非常非常强大,而且价格极其便宜。每百万个输入 token 仅需 0.3 美元,每百万个输出 token 仅需 2.4 美元。而且这还是在模型速度为每秒 100 个 token 的情况下。他们还有一个速度稍慢的模型,每秒 50 个 token,价格便宜一半。总之,一切都非常便宜。您也可以通过这种方式追踪模型的发展动态。事实上,中国在至少编码基准测试方面正在迎头赶上美国。此外,伟大的 GLM 5 也发布了。感谢您,GLM,这不是什么 5.1、5.7、5,我不知道,可能是 123,因为这些数字和名称已经非常难以区分了。嗯,之前是 4.7,现在是 5。每个人对它的评价都非常高,但据说它的水平非常接近 Opus。绝对是重磅炸弹。在 Humanity Last Exam 上是 50.4。在 Humanity Last Exam 上,它们只是一个接一个地打破这些基准测试。Bench Verified 略微落后于 Anthropic。Multilingual Terminal Bench 以及各种代理基准测试,例如 Browser Comp,它超越了。这到底是怎么回事?模型大小翻了一番。从 3550 亿增加到 7440 亿。预训练数据量也增加了 2850 万个 token。还添加了 SPS attention,以进一步改进整个架构。我注意到的是,他们在这个基准测试上进行了测试,Bench 2。我曾多次提到过它。老实说,我很少在中国模型中看到它。即使看到了,也通常在最底层。例如,与闭源专有模型相比,4.7 的表现非常糟糕,但现在 GLM 5 几乎已经追赶上了 Anthropic,这是一个惊人的结果。提醒一下,这个基准测试评估了代理在真实商业环境中进行交易、采购、销售、不屈服于买家诱惑的真实能力。最终,所有这些都通过模型一年内赚取的金钱来评估。总之,非常丰厚。这里还有一些实际任务的比较。在某些方面,它们甚至设法超越了,嗯,这里是 Claude Opus 4.5。GLM 5 大致保持在这个水平。该公司声称,这已经是从聊天到工作的飞跃。它能够将文本转换为现成的材料,如 doc、PDF、XL。嗯,还有完整的套件。您可以查看。例如,模型可以根据普通的文本提示生成这样的结果。您可以在任何地方尝试,无论是 API、各种编码代理,还是访问他们的网站并以类似 ChatGPT 的界面进行交互。而且是免费的。在 Coding Plan 中也计划集成,但似乎是按计划进行的。我不确定是否已经分发给所有人了。有些人可能还在使用旧版本的模型。Gemini 3 DeepMind 是一个完整的套件。该公司发布了一个专门的微调模式,用于科学、研究和工程领域的复杂任务。这里当然也值得关注 Humanity Last Exam。据我所知,这是在不使用工具的情况下进行的。我们上面提到了 GLM 4.7。这里,嗯,是的,您看到的是,使用工具是 50.4,不使用工具是 30.5,而 DeepMind 在不使用工具的情况下取得了相同的结果,并直接超越了 Arc AGI 2。也就是说,基准测试已经饱和了。François Chalais 正在不知疲倦地工作,有一个词是这样说的,关于 Bench 的其他版本。他承诺在不久的将来发布 Arc 3、4、5、6、7。他们声称在数学、编程和理论物理的奥林匹克竞赛任务中达到了黄金水平。Gemini 3 DeepMind 取得了如此丰厚的结果。它在哪里可用?当然,只有 Ultra 计划的订阅者才能获得,每月 200 美元。您无法在其他地方获得这个东西。还有一个有趣的案例。一个纯文本提示。您看到了文本提示,描述了需要做什么,以及一个完整的 3D 对象,模型创建了一个极其复杂的 3D 对象。这真是太棒了。还有一个关于未来的简短观点。本周,一篇来自某位 MT Schumer 的文章疯传,他认为现在的人工智能就像 2020 年初的 COVID-19,当时人们不太了解它,不太相信它,也没有意识到它可能对世界产生什么影响,然后一切都在几个月内发生了翻天覆地的变化。主要观点是,人们尝试了人工智能,尝试了不同的模型,有时会感到失望,意识到 GPT-3.5,更不用说 4 甚至 5,无法解决他们需要的问题,甚至目前也不支付订阅费,而是大部分任务都手动完成。但作者声称,编码已经结束,并且将在不久的将来结束。所有这些白领和蓝领的工作都将结束。法律、金融、分析,嗯,朋友们,结束了。他引用了 Meter 公司的一项指标,我也曾多次提到过,人工智能可以执行的任务的复杂性每 7 个月翻一番。总之,他呼吁至少购买 20 美元的订阅并开始使用这一切,因为您可能无法想象 Codex Opus 4.6 的强大之处。这些模型在自主性、使用工具的能力、智能能力以及理解您的请求方面,与之前的版本相比确实有了巨大的飞跃。我也感受到了这一点,尽管可能不如那些每天都在辛苦工作的高级工程师那样强烈。但我同意作者的观点:使用人工智能。现在让我们转向创意神经网络。大家好,我是伊戈良,这里是上周创意神经网络的新闻。本周最重要的新闻可能是备受瞩目的 Stable Diffusion 3.0。我在上期新闻中已经提到了它,但从那时起一切都发生了很大变化。我最初认为这个版本不如 Kling 3.0 有趣,但最终,这个模型成为了视频生成器发展的最大一步。在我的 Telegram 频道“创意委员会”上,我发布了关于它的帖子,并发布了许多帖子,我们将 Kling 3.0 和 Stable Diffusion 3.0 进行了比较。评论区进行了激烈的讨论。嗯,Stable Diffusion 3.0 可以做到这一点。看看这美妙的质量,这意面般的稳定性。每一根意面都在它的位置上。一切都非常逼真。只有放慢视频才能看到一些瑕疵。当然,现在看起来非常棒。Stable Diffusion 创造了如此令人惊叹的效果。质量非常高。伪影非常少。令人难以置信的稳定性。这里有视频的风格重塑,添加了角色。也许应该为 Stable Diffusion 制作一个单独的视频,因为确实有很多东西可以谈论,有很多东西可以讨论。嗯,看看这个。看看这里创造的战斗场景有多高质量。这个模型确实达到了非凡的水平。这绝对是创建电影场景、特效短片的最佳模型。顺便说一句,我们很快将开始新的视频课程。一如既往,会有理论和实践,我们将一起尝试制作一些短片、视频广告、短片或视频剪辑,总之,您需要的东西。现在是一个小公告。注册链接将在描述中找到,我将在未来的视频中详细介绍。以及在我们的机器人中。Stable Diffusion 3.0 已经与 ChatC App 中的 OpenAI 代理集成。这是一种开源的浏览器版 CapCut,它使用其代理来编辑视频。是的,您没听错,这个视频完全由代理制作。也就是说,它只需发送一个亚马逊商品页面的链接,然后它就会连接到 Stable Diffusion 并生成视频。这里很酷的是,视频可以生成在绿屏上,然后代理会删除背景,或者说不是代理,而是 CapCut,它会删除背景,添加一些信息图。而且,如果将它与 Motion 结合起来,Motion 可以根据提示生成动态图形,那么我们将拥有一个非常非常强大的工具。而且很可能在未来几个月内,代理视频创作将进入一个新的水平。顺便说一句,我们将在我刚才提到的关于 AI 代理的课程中讨论这个问题。总的来说,这个课程有望非常有趣。我们花费了大量精力来创建它。我们也将探讨这些有趣的主题。此外,制作了 Stable Diffusion 的字节跳动公司,在此之前不久发布了 CDAM 5.0 模型。这是一个用于图像生成和编辑的模型,类似于 Nanoban。老实说,我不能说这个版本有什么革命性的。它似乎只是学会了做 Nanoban Pro 之前所做的一切,例如增强的浏览,更好的理解示例,处理文本。似乎就这些了。这里没有革命,但模型质量很高,您可以在 Dreamin 应用程序中使用它,或者像 Stable Diffusion 3.0 一样,在同一家公司 ByteDance 旗下的 CapCut 中使用。在 ChatGPT 中,添加了 HeyGen。现在 HeyGen 可以在 ChatGPT 对话中直接制作视频。神经滑稽将进一步增加。嗯,这是一个很好的更新。发布说明中提到,将生成制作级别的视频,即非常高质量的制作水平。我不知道如何用中文更好地表达,但当然,这首先将是一个神经滑稽。Velta X Studios 是一个很棒的工具,拥有很棒的模型,顺便说一句,是开源视频生成模型。目前最好的模型,添加了 LoRA,即创建风格、对象、角色的能力等等。有趣的是,除了经典的 LoRA 之外,还有 Logo LoRA 和 Font LoRA,我认为这很棒。没有革命,但很高兴它出现了。我想你们中的许多人都在使用 LTX。此外,Kuaishou 宣布了 Kuaishou Image 2.0。这确实是一个有趣的故事。他们将 Kuaishou Image 和 Kuaishou Edit 合并到一个模型中。也就是说,图像创建和编辑原生地结合在一起。该模型位于 Alibaba AI Arena 的 GPT Image 后面,老实说,我第一次听说它,而且它并不那么令人信服,因为它属于同一家公司,该公司发布了模型。您可以通过 chat.ai 链接或 API 使用它。而且,我知道这家公司,它很可能会在某个时候开源,这真是太棒了,因为,嗯,它创造了如此美丽的东西。脸部确实保留得很好。唯一的问题是,我没有看到与以前的模型版本相比有巨大的质量飞跃,但我老实说还没有测试过它,所以也许有什么令人惊讶的地方。然而,我还没有听到用户对这个模型的任何赞美之词。AIVA 添加了 Dither。这种像素化图像、视频的功能。为什么,不清楚。嗯,还有 Kraft 的一个细微更新,这将使您的工作更轻松。这是大量的模板,虽然它们在那里,但现在是图像编辑模板,即您可以上传一张图片并在某个模板中重新生成它。例如,选择一个 2 月 14 日的模板,您就会得到一张您在这种风格的图片。然后是 Recraft 的所有乐趣。删除背景,制作 SVG,矢量图,所有这些。打印在马克杯上,T 恤上。总之,Recraft 是一个很棒的设计工作服务。Alva 发布了 Skills。也就是说,代理技能,允许您预设某些操作。只需选择您需要做什么,Alva 代理就会为您完成。据我所知,目前它只适用于图像。也就是说,将来也可以用于视频,但目前还没有这种可能性,唉。不,唉,在 Xfield 中,Cinema Studio 2.0 发布了。他们的工作室变得更加先进,您可以在其中使用非常方便的环境创建高质量的电影场景、电影序列。总之,选择流派、相机、镜头。看看这个 3D 导航,用于改变角度并获得对视频生成的更多控制。选择,改变角色的情绪,多镜头。总之,那些使用 Xfield 的人,请写信。我不喜欢支付他们昂贵的订阅费。顺便说一句,对于那些也不喜欢的人,我有一个好消息。Open Xfield AI。这是试图开源 Xfield 所拥有的东西。当然,功能大大简化了。尽管如此,它仍然是开源领域的一个相当不错的尝试。发布尚未完全完成。嗯,目前只有第三天。他们正在发布新的功能。您还可以精细调整一切,处理 Nanoban、类似物等。当然,Nanoban Pro 是无法免费使用的。也就是说,您需要带来自己的 API 密钥,连接它们,但这样就不用支付额外的服务费了。此外,Kuaishou 发布了 Slides,即演示文稿,我们还没有看到它。但中国公司也在这个领域追赶他们的竞争对手。Kuaishou Image 2.0 已内置。您可以制作带有精美图片的演示文稿。搜索代理进行研究,它们组织一切,构建结构。您只需写一个简单的想法。总之,这是一个类似 NotebookLM 或 Gamma 的东西。如果美国入侵格陵兰会怎样?如果罗马没有崩溃或者苏联还存在会怎样?所有这些我们都可以通过以下服务了解。Pax。这是什么?这是一个游戏,或者更确切地说,不是游戏,而是一个网站,可以了解替代历史。您设定一个历史情景,历史发生了什么错误,AI 会推断出事件将如何发展,网址是 paqshistoria.com。总之,您可以完全免费使用所有这些。这个网站非常酷。这里有一些流行的场景,您可以看看第二次世界大战是如何以不同的方式发展的,嗯,现代,它将如何向其他方向发展。总之,这只是一个 Alpha 版本,也就是说,它的工作效果不如我们所希望的那么好,但它非常非常出色。我已经看到了很多有趣的评论和用户在网上发布的替代历史版本。好了,本周的新闻似乎就到这里了。如果您喜欢这个视频,非常感谢您的点赞、评论和订阅我们的频道。我是伊戈良,上半部分是 Dady Debl。这是 Prodsovet。我们每周日发布新闻。不要忘记关于 AI 代理的强化训练课程,它即将开始。我们下周再见。再见。