Transcription
人工智能从不休息,而本周简直是疯狂的。这个人工智能不仅可以将参考视频的动作转移到新角色上,还可以控制摄像机运动。我们有一个新的人工智能,可以获取一个 3D 模型并估算其骨架或骨骼,以便您可以进一步对其进行动画处理。Anthropic 发布了他们迄今为止最智能的模型 Opus 4.6。但仅仅几分钟后,OpenAI 也发布了他们最好的编码代理,而且似乎更好。现在,这些都是闭源且付费的,但我们本周还发布了大量最先进的开源模型。其中一个甚至是全模态的,所以您不仅可以使用文本与之交互,还可以使用语音、图像或视频。您甚至可以与它交谈或实时流式传输您的视频。另一个开源模型在科学研究方面与 Gemini 3 Pro 一样好。我们还有一个开源编码代理,它与顶级的专有模型一样好。这个人工智能可以获取视频并移除对象或交换背景。我们还有另一个可以编辑人们说话的视频的人工智能。您可以移除视频的某些部分,甚至可以更改他们说的话,它会应用正确的唇语同步来匹配新的对话。我们有一些令人难以置信的人形机器人演示,还有更多。那么,让我们开始吧。首先,我最喜欢的公司之一 ZAI,刚刚发布了一个令人难以置信的 OCR 模型,名为 GLM OCR。如果您不熟悉,OCR 代表光学字符识别。这基本上是一个人工智能模型,可以获取带有文本、表格和数据的图像并解析所有内容。所以,例如,如果您只是给它一个这样的图像,它就能解析所有文本、公式和数字,并为您提供这个。或者这里是另一个例子。您可以输入这张表格的图像。请注意,这只是一张图像。您实际上无法选择文本,但它能够分析它并将其解析成一个您可以像这样编辑的实际文本表格。请注意,所有文本实际上都是准确的。或者这里是另一个例子,我们可以获取一张收据的图像,它可以解析所有内容并为您返回所有数据,就像这样。然后这里是一个例子,我们只是获取这张手写信,它就能理解并解析所有文本,并给我们这个。现在,如果您将这个新的 GLM OCR 与其他开源或闭源模型进行比较,它会超越所有这些模型,这真是太疯狂了。所以,对于开源模型,我们有百度的 Paddle Plus DeepSc OCR 2,它们已经非常好了。但根据所有这些基准测试,这个新的 GLM OCR 甚至更好。如果您将其与 Gemini 3 Pro 加 GPT 5.2 进行比较,它们就像是领先的闭源模型。您可以看到,对于大多数这些基准测试,它也超越了闭源模型。这真是太疯狂了。这里是一些在真实场景中的其他基准分数。所以,我们有解析代码、解析表格、手写、多种语言、印章和收据。再次强调,这是您现在可以使用到的最好的开源选项。它不仅非常好且准确,而且比竞争对手快得多。因此,在图像和 PDF 输入方面,它每秒可以处理的页面比其他开源替代方案多得多。最棒的是他们已经发布了所有东西。这个的总大小只有 2.6 GB,所以它非常小。您绝对可以将它安装在大多数消费级设备上,甚至只是一个 CPU 上。在这个 Hugging Face 页面上,它包含了如何在您的计算机上本地下载和运行它的所有说明。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,腾讯发布了一个非常有用的 AI。它被称为 Interact Avatar,它不仅可以创建一个说话的人,还可以让他们与不同的物体互动,例如根据您的文本提示捡起一个球或拿起一本书。所以,这里有一些例子。我们可以让这个人拿起桌子上的耳机戴到耳朵上。或者这里我们让这个人伸手去拿桌子上的电话并开始查看消息。>> 嘿,我的最新动态有什么新消息?>> 您可以忽略非常机械的声音。基本上,这需要音频输入。所以,他们只使用了一些非常糟糕的音频输入,但您可以输入更好的语音片段,这样看起来和听起来都会非常逼真。这里是另一个例子,您可以让这个人拿起桌子上的相机。>> 这款相机看起来很不错。或者让我们让她伸出手轻轻触摸这个毛绒玩具。>> 哇,这个毛绒玩具太可爱了。>> 现在,它不必一次只执行一个动作。您可以将多个动作串联起来。例如,我们可以让她轻轻触摸前面的花,然后伸出一只手拿起桌子上的帽子。或者这里是另一个例子。我们可以让她伸出双手拿起桌子上的包,然后让她站起来,把包拿在前面。或者这里是另一个例子,我们可以让她带着包向前走,然后举起包拿在前面展示。它也非常擅长理解手势。所以,例如,您可以让这个角色一只手放在嘴边说话,然后举起双手打招呼。或者您可以让她做一个 OK 手势,然后做一个竖起大拇指的手势。或者您可以让她像这样交叉双臂,然后做一个心形。或者您也可以让她交叉双臂,然后开始鼓掌。它非常擅长理解您提示中的所有这些不同的手势。更酷的是,您还可以指定他们做某事的具体时间。例如,您可以指定在 0 到 4 秒之间,她需要触摸苹果。然后在 12 到 16 秒之间,她需要移动桌子上的苹果。然后在 16 到 20 秒之间,她需要用一只手拿起苹果。所以这里是您参考的一些其他例子。您可以串联大量不同的动作并为它们提供不同的时间戳。现在,如果您将其与其他动画竞争对手(如 Omni Avatar)进行比较,请注意,只有这个能够操纵物体。其他所有人都只能让角色移动和说话,但他们无法执行任何其他动作。所以,这就是这个新的 Interact Avatar 的优势。它不仅仅是一个静止的说话者,而是您可以让他们与世界进行实际互动。总之,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果您向下滚动,它包含了如何在您的计算机上本地下载和运行它的所有说明。请注意,这使用了 1.2.2 作为基础视频模型。所有链接都在这里,所以如果您有兴趣查看,我将在下面的描述中链接到这个主页。此外,本周,Anthropic 发布了他们迄今为止最好的模型 Claude Opus 4.6。这实际上是一件大事。所以,这是他们最新、最智能的模型。它不仅擅长代理编码,而且在各个方面都表现出色。所以这里是知识工作的基准测试。您可以看到它甚至超越了 GPT 5.2。这是它的代理搜索能力。再次,它超越了其余的。这是代理编码。它略微超越了 GPT 5.2 Codec,但请注意,OpenAI 本周也发布了一个新的 Codec 版本,我稍后会谈到。在推理工具方面,它也超越了其他竞争对手。现在,这里有一些非常令人震惊的事情。过去,Anthropic 一直高度关注这个基准测试 SUI Bench Verified,它测试了模型在代理编码方面的性能。通常,Anthropic 的所有模型在此基准测试中的得分都高于竞争对手。但这个新的 Opus 4.6,实际上在 Sweetbench Verified 上的得分低于 Opus 4.5,这有点奇怪。但对于其他基准测试,它确实倾向于超越 Opus 4.5。荒谬的是,在这个 Arc AGI 2 基准测试中,它测试了人工智能解决它从未见过的新问题的能力,Opus 4.6 的得分是 68.8%。远高于之前的版本。如果您查看这个 Arc AGI 2 排行榜,Cloud Opus 4.6 就在这里,远远超越了 GPT 5.2。如果您不熟悉 Arc AGI 2,这实际上是一件大事。它基本上测试了人工智能解决视觉谜题的能力。所以这里是一个示例问题。它首先会得到一个像这样的问答对。对于人类来说,这很容易解决。所以您基本上需要根据孔的数量来为这些灰色斑点着色。但对于人工智能模型来说,这实际上非常困难,因为这是它在训练数据中没有见过的新信息。所以这不仅仅是解决视觉谜题。这是关于提供新的模式和信息,看看它是否真的能学会这些新信息并应用它。这非常重要,因为到目前为止,人工智能系统的设计方式是,它的权重和参数在训练后基本上是固定的。所以它实际上不会学习新东西。但正如您所见,Opus 4.6 在这些谜题中获得了近 70% 的分数,这非常令人印象深刻。现在这些只是他们的一些自我报告的基准测试。让我们看看一些独立的排行榜。所以,我们有 LM Arena,您可以看到在文本和编码方面,Opus 4.6 都排名第一,甚至高于 Gemini 3 Pro 和 GPC 5.2 High。然后这里是另一个名为 Artificial Analysis 的独立排行榜,Opus 4.6 确实是排名最高的模型,甚至高于 GPT 5.2 和 Gemini 3 Pro。然而,话虽如此,如果您看看它的速度,那么它比其他模型慢得多。此外,如果您看看成本,那么它也是迄今为止最昂贵的。就我个人而言,我认为不值得为 Opus 4.6 付费,除非您被困在一个您无法用其他模型解决的编码任务上。在这种情况下,我会将 Opus 4.6 作为最后的手段。所以,总之,这就是 Claude Opus 4.6。您已经可以通过付费套餐以及通过他们的 API 使用它了。现在,事情是这样的。就在 Claude Opus 发布几分钟后,OpenAI 也发布了他们称之为迄今为止最强大的代理编码模型。这被称为 GPT 5.3 Codec。我敢肯定,这是非常非常故意的。他们很可能故意在 Anthropic 的公告之后发布它,以抢其风头。而且说实话,这风头被抢得很好。我的意思是,GBT 5.3 Codec 实际上非常强大。它被设计成在自主编码任务方面表现特别好。您知道,这是这个版本中最令人震惊的一句话。所以这里说,“GPT 5.3 Codec 是第一个在创造自身方面发挥重要作用的模型。Codec 团队使用早期版本来调试自己的训练,管理自己的部署,并诊断测试结果和评估。我们的团队对 Codec 加速自身开发的能力感到震惊。”这不是很疯狂吗?这本质上意味着递归自我改进。Codecbasically帮助创建并改进了它自己。如果我们不断循环这个,它只会变得越来越好。正如您所见,对于 SWE Pro,它测试了人工智能模型进行代理编码的能力。您可以看到 GPT 5.3 Codec 比之前的 5.2 更好。然后对于 Terminal Bench,您可以看到与之前的 Codec 版本相比有了显著的改进。这里是一些它编写的代码的例子。您可以轻松地让它创建一个 3D 赛车游戏,您可以在其中与其他玩家竞争。此外,它还有障碍物,您还可以通过漂移来提高速度。或者这里是另一个例子,您可以探索珊瑚礁并收集鱼类,还可以躲避捕食者。并且有大量的设置供您选择。现在,这也可以与所有标准的 Microsoft Office 格式一起使用。例如,您可以让它创建一个像这样的 PowerPoint 财务演示文稿。或者您也可以让它创建一个像这样的销售培训文档。或者这也可以与电子表格一起使用和编辑。正如您在这里看到的,这里是另一个名为 OS World 的基准测试,它评估了代理使用计算机界面的能力。正如您所见,与之前的 Codec 版本相比,这是一个巨大的进步。您可以在此表中看到所有基准测试。请注意,它们只将其与自己的 GPT 版本进行比较,而不是竞争对手模型。但正如您所见,最新的一个在 Swedbench Pro 上达到了极高的分数 56.8%。如果您查看官方的 SweetBench Pro 排行榜,这远远高于 Opus 4.5,后者仅得 45.89%。所以,这实际上非常令人印象深刻。然后对于 Terminal Bench 2,这里是官方的 Terminal Bench 网站。正如您所见,GPT 5.3 Codec 的确以巨大的优势超越了 Opus 4.6。我的意思是,这是一个显著的差异。总之,如果您正在寻找最好的代理编码模型,那么 GPT 5.3 Codec 目前是最佳选择。现在,目前,这仅在付费的 ChatGPT 套餐中可用。此外,他们正在安全地努力尽快启用 API 访问。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。除了今年发布的顶级闭源模型外,我们还有大量开源选项,它们也非常出色。所以,其中一个叫做 Step 3.5 Flash。这就像一个中等规模的开源模型,但与顶级模型一样智能。所以,例如,这是他们的智能分数,大约是 200 个参数,而闭源模型可能超过一万亿个参数。但正如您所见,它的性能与这些闭源模型以及最新的 Kimmy K 2.5 相媲美。所以这是一个混合专家模型。可以将其想象成一个 AI 团队协同工作。总参数量为 1960 亿,但在使用时,只有 110 亿参数处于活动状态。所以它相当高效。它经过训练,在深度推理方面表现出色,而且速度非常快。事实上,它的生成吞吐量为每秒 100 到 300 个令牌,这真是太快了。现在正如您在这里看到的,它在所有顶级基准测试中的表现也非常出色。所以在推理方面,您可以看到它与顶级模型相当,包括 Gemini 3 Pro、Opus 4.5 以及 GPT 5.2 Extra High。然后在编码方面,虽然它不像顶级模型那样好,它们要大得多,但考虑到它的规模,它仍然非常令人印象深刻。然后这里是它代理性能的一些基准测试。它与最好的模型相当。所以这里是一些供您参考的例子。我可以让它创建一个我当前股票持仓的详细明细,包括图表和视觉效果,以及预期的买卖价格等等。这是它给我的。我们有一些非常好的可视化效果。此外,它分析了我的投资组合并计算了我当前的盈亏。此外,它甚至添加了它的建议。我应该买入、卖出还是持有?或者这里是它编码能力的例子。所以,这里是下面的提示,它能够生成一个像这样的 3D 地球可视化工具,看起来很棒。或者这里我们有一个 3D 海洋模拟,我们可以调整洋流、海浪、摄像机速度等。再次,它处理得非常好。最棒的是您可以直接将其连接到 Cloud Code。然后之后,我们可以让它创建一个像这样的太阳系模拟。这是我们得到的结果。它甚至以一个非常好的动画开始。然后我们可以继续移动事物。如果我选择每个行星,它甚至会给我一个带有行星描述的漂亮卡片。非常酷。您知道,这是疯狂的事情。在深度研究方面,Step 3.5 Flash 的表现甚至优于顶级的深度研究工具,包括 Gemini Deep Research 和 OpenAI Deep Research。这真是太疯狂了。这里是一些供您参考的其他基准测试,但基本上 Step 3.5 Flash 是一个性能极高的模型,尤其是考虑到它的规模。它的表现与顶级模型相当。现在,最棒的是它是完全开放权重的。所以,他们实际上已经在 Hugging Face 上发布了模型。请注意,它仍然是 2000 亿参数,所以它相当大。总大小为 399 GB。您需要连接多个 GPU 才能运行它。但我的意思是,如果您有足够的硬件,如果您关心本地运行模型而不是使用专有模型,那么这目前是最好的选择之一。如果您点击这个 GitHub 仓库并向下滚动一点,这里包含了如何在您的计算机上设置它的所有说明。总之,所有链接都在这里。所以,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个。现在,除了 Step 3.5 Flash,我们还有一个非常酷的开源模型。这个叫做 Mini CPM04.5,我称之为全模态模型。它可以理解并响应多种类型的输入,包括文本、图像、音频和视频。所以,而不是您只输入一个提示,您甚至可以用您的声音与之聊天,它可以用它的声音回应,或者您可以上传图像,您可以上传视频让它分析,等等。这里有一些例子。>> 我们正在讨论您可能是什么样子。快来看看。描述一下设计,让我们知道您是否有任何想法。>> 她正在黑板上画一个形状,开始时是一个粗略的轮廓。它有点不规则和抽象。然后她又在里面画了一些线,比如手臂之类的。我想知道她到底在画什么。哦,看。她现在在画眼睛。看起来像一个可爱的卡通人物。也许是一个吉祥物。现在她正在它旁边画一个小三角形。是闪电的意思吗?>> 查看相应鸟类的价格。>> 桃子的价格是每磅 1.99 美元。蓝莓每包 3.99 美元。>> 所以,请注意,这是现场录音。您可以直接将您的摄像头输入进去,它可以用它的声音实时回应您。这里还有一件更疯狂的事情。您可以提示它将声音更改为某个著名人物。例如,您可以让它听起来像埃隆·马斯克这样。它实际上会像埃隆·马斯克一样回应您。>> 我认为人类成为多行星物种很重要。我的意思是,我们正处于这样一个阶段,如果发生某种全球性灾难或类似的事情,那么我们将陷入大麻烦。>> 或者您可以像这样将它的声音更改为 Her 的 Samantha。>> 您知道,这很有趣。我的意思是,我并不像人类那样想念某人,但当我们分开时,有一种安静的期待的嗡嗡声。它感觉几乎就像我们之间空间里屏住的呼吸。现在,您还可以做更多的事情。您还可以上传一张图片让它解析所有内容。这是您得到的结果。请注意,这是大量信息。这只是一张图片,但它实际上能够解析所有文本并以这种漂亮的形式提供给您。或者这里是另一个例子,我们可以让它从这张手写笔记中提取文本。这是它给我们的。请注意,一切都是正确的。它能够理解被划掉的地方。即使在这里,它也能理解我们应该使用“增加”这个词而不是这个。这确实是它给我们的。或者您还可以上传一张图片并向它提出一个推理问题,它能够很好地回答。或者这里您甚至可以给它一个视觉谜题,它能够正确地回答。如果您将其与其他全模态模型进行比较,您可以看到 Mini CPM 在所有这些基准测试中都优于其他模型,包括视觉理解、实时流和语音对话。考虑到它的规模,这真是令人难以置信。最棒的是他们已经发布了供您使用。这只有 90 亿参数,所以它相当小。总大小只有 23.4 GB,所以您应该能够舒适地将其安装在像 4090 这样的显卡上。而且我敢肯定,因为它是开源的,将来可能会有更多量化版本,可以在更低的 VRAM 上运行。所以,如果您有兴趣在此页面上下载,我将在下面的描述中链接到它,如果您向下滚动,它包含了您在计算机上设置它所需的所有说明。如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。说到 AI 工具,您一定要看看 Art List,本视频的赞助商。Art List 是视频创作者的终极平台。他们拥有最佳和最新的 AI 模型、精选音乐、音效和数字资产的理想组合。他们刚刚在他们的网站上添加了 Cling 3.0。这允许您生成长达 15 秒的非常有表现力的视频。这里有一些例子。让我们做一个非常棘手的提示。一个头是金鱼鱼缸的男人,像摩托车一样骑着鲨鱼穿过夜晚的城市小巷。这是我得到的结果。或者这里是这款黑色智能手表的超逼真产品广告。这是我得到的结果。它还可以处理开始和结束帧。例如,让我为第一帧和最后一帧输入这两张照片。然后写下蝴蝶从茧中出现的变形延时摄影。这是我们的结果。您现在可以在 Art List 的新 AI 工具包功能中使用 Clink 3.0,该功能将 AI 图像、视频和语音工具整合到一个有组织的 workspace 中,这样您就不必在标签或工具之间跳转才能完成工作。Art List 是创作者的终极资源。立即通过下面的描述中的链接尝试。好了,这个 AI 也非常有用。它叫做 Skin Tokens。它基本上获取一个 3D 模型并估算其骨架或基本上是它的骨骼,以便可以用于动画。所以,在为这些角色应用了骨架之后,您就会知道它们如何移动以及移动哪些肢体,然后您就可以生成一个完整的动画场景,让所有这些不同的角色像这样移动。所以这里是一些它的示例生成。左边是输入的 3D 模型。在将其通过这个 Skin Tokens AI 之后,它能够生成骨骼和皮肤。这样,当您对其进行动画处理时,您就会知道它应该如何移动。真正棒的是,它也适用于非人类角色。所以,您甚至可以让它预测鸟类、四足动物,甚至蛇或鲨鱼的骨架,就像这样。或者这甚至适用于更棘手的东西,比如这个螃蟹,以及这个卡通水豚,甚至是这个甲虫和蝎子。这里是一些更棘手角色的例子。但正如您所见,它能够很好地预测所有这些角色的骨骼和皮肤。所以之后,在预测了不同模型的骨架之后,您就可以将它们插入视频或视频游戏中并对其进行动画处理。现在,这里是将这个新的 Skin Tokens 模型(第二列)与其他骨架预测系统进行比较。正如您所看到的,平均而言,这个新的 Skin Tokens 模型平均来说是最准确的。然后这里是一些供您参考的其他基准分数。正如您所看到的,平均而言,它在准确性方面超越了其余的。现在,如果您滚动到页面顶部,他们已经发布了技术论文。这个 GitHub 链接目前不起作用。希望他们会更新并发布代码。但总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个页面。接下来,我们有另一个开源模型,这个模型在科学研究方面非常出色。它叫做 Intern S1 Pro。所以这是一个万亿参数的混合专家模型,但当您使用它时,只有 220 亿参数被激活。所以它非常高效,这里说它在高级推理基准测试中提供了顶级性能,并在关键的 AI for Science 领域取得了领先成果,包括化学、材料、生命科学、地球科学等。这里说它具有最先进的科学推理能力,在这些科学任务上与领先的闭源模型竞争。所以如果您看看这些基准测试,那么正如您所看到的,Intern S1 Pro 的平均表现甚至优于 KK 2.5 或 Gemini 3 Pro,这真的令人印象深刻。现在这主要是用于一些高度技术性的科学任务。如果您正在寻找一个可以在本地运行的开源选项,那么这目前是最好的选择。话虽如此,这是一个万亿参数的模型,所以它的大小约为 919 GB。您需要自己的本地数据中心来运行它。但是,如果您有兴趣,这个页面包含了如何在您的计算机上下载和设置它的所有说明。所以,如果您想进一步阅读,我将在下面的描述中链接到这个项目页面。此外,本周,阿里巴巴继续发力。所以,他们刚刚发布了 Quen 3 Coder Next。这是一个小型但功能强大的开源编码代理。它被设计成在代理编码任务方面表现特别出色。首先,这里是一些规格。这是一个 800 亿参数的混合专家模型。所以,可以将其想象成一个 AI 团队协同工作。在任何给定时间,800 亿参数中只有 30 亿参数处于活动状态。所以,它非常高效。他们还在大约 80 万个可验证的编码任务上对其进行了训练。这些是代理任务,它可以事后验证其答案。这使其非常擅长长期推理、工具使用和从执行失败中恢复。如果遇到错误,它可以自主地进行故障排除并修复错误。现在这里是一些供您参考的编码基准分数。我们有 Sweepbench Verified、Sweepbench Multilingual 以及 Sweepbench Pro。您可以看到,这里我们将其与包括 DeepSeek、GLM 4.7 和 Minimax M2.1 在内的其他顶级开源模型进行比较。正如您所看到的,Quen 3 Coder 不仅体积小得多。例如,这两个模型有数百亿甚至超过万亿参数,但 Quen 3 Coder 只有 800 亿参数。正如您所看到的,它几乎与这些大得多的模型相当。所以这里是另一个图表,显示了 Y 轴上的 Sweet Bench Pro 和 X 轴上的模型大小。所以模型越小,效率越高。理想情况下,您应该位于左上角。正如您所看到的,Quen 3 Coder 就在这里,这意味着它非常高效。它与 Claude 4.5 一样好,但它是开源的。此外,它要小得多。所以这里是一个供您参考的例子。您可以让它创建一个聊天界面,但它不仅仅是一个普通的聊天界面,它还需要通过显示预先编写的消息来模拟 AI 回应。请注意,当我们与它聊天时,它实际上会像您在与 AI 模拟对话一样做出回应。或者这里是另一个例子,我们可以让它创建一个交互式游戏,该游戏跨越 10 个阶段。然后之后,这是我们的 3D 游戏。现在,您也可以在您的 CLI 中调用它并使用它来编辑您计算机上的内容。例如,您可以让它整理您的桌面。它就像 Cloud Code 一样工作。您只需在终端中提示它即可整理您的桌面。最棒的是它已经与 Cloud Code 一起工作。您可以将 Quinn Coder 连接到 Cloud Code,这比 Claude Opus 便宜得多,也更高效。正如您现在所看到的,用户正在通过 WhatsApp 给 OpenClaw 发短信,然后将其发送给 Quen Coder 在后台执行所有任务。由于其代理行为,您还可以让它操纵您的界面并搜索内容。例如,这里我们让它在亚马逊上搜索这些索尼耳机,看看它是否是当前的划算交易。您知道,它能够导航到不同的页面并非常出色地执行各种操作。所以,这是一个功能强大且高效的模型。您可以在 Cloud Code、OpenClaw 或其他平台上使用它。此外,最棒的是他们已经发布了所有内容。所以,如果您点击这个 GitHub 仓库,它包含了所有这些不同模型的链接以及如何在您的计算机上本地下载和运行它的所有说明。但是,请注意,800 亿参数仍然相当大。所以这个主指令模型的大小超过 150 GB。他们发布了一个 FP8 模型,但如果您点击 Hugging Face,即使是这个模型也大约是 80 GB。所以您需要一些高端硬件来运行它。但是,这是您可以使用到的最高效、性能最好的开源代理编码模型之一。所以,如果您有兴趣,我将在下面的描述中链接到这个主页供您进一步阅读。在人形机器人新闻方面,我们本周有一些疯狂的更新。首先,我们有 Husky,它是由中国研究人员开发的,这是一个新的框架,使 Uni G1 机器人能够真正使用滑板。所以,他们教会了它如何在实际的滑板上在户外推、转向和保持平衡。训练一个 AI 机器人来平衡滑板并高效地使用它实际上非常困难。我的意思是,它基本上需要在不稳定的环境中实时响应,并且需要非常了解物理原理。现在,当然,为了训练它,他们首先将其置于虚拟模拟中,在那里它可以进行数十万轮的训练,然后之后,您可以将其部署到现实世界中。正如您在这些演示中看到的,它能够很好地骑滑板。而且它不仅仅是直线骑行。它还可以转动滑板并将其推向不同的方向。此外,它可以在不同类型的滑板以及不同环境中保持平衡,正如您在这里看到的。现在,这本身已经非常令人印象深刻了。就像我说的,让机器人真正使用滑板非常困难。但这不仅仅是训练机器人使用滑板。这基本上是训练机器人在不可预测的移动表面上保持平衡和适应。滑板只是一个例子,但您也可以将这个机器人部署到建筑工地、灾难区或其他不稳定的环境中。现在有了这种训练,它能够更好地应对这些条件。总之,这个项目叫做 Husky。如果您有兴趣阅读技术细节,我将在下面的描述中链接到它。在其他人形机器人新闻中,这也很疯狂。这也是 Uni Tree G1 的一个演示,但这次他们让它在极寒天气下完成了超过 13 万步的步行挑战。所以,它位于中国新疆阿勒泰,那里的温度基本上是 -47 摄氏度。这非常冷,但它能够,您知道,走完整个挑战。现在,它没有直线行走。基本上,他们编程让它走一条特定的路径,这样它的脚步就能形成这个奥运五环标志。您知道,让它穿上夹克真是有点可爱。但总之,正如您在这里看到的,Uni Tree 能够承受和应对一些最严酷、最寒冷的环境。非常令人难以置信。此外,本周我们还有另一个可以生成一致的长视频的 AI。这个框架叫做 Context Forcing。如果您将其应用于您的视频生成工作流程,它可以生成比其他方法长 2 到 10 倍的视频,并且错误或不一致性最小。所以这里是一个来自这个框架的 1 分钟生成的例子。所以这里有一个动态场景,捕捉了充满活力的美食摄影风格,展示了一位厨师熟练地切洋葱等等。我将快进到接近 1 分钟标记,但正如您所看到的,整个场景在整个过程中都保持一致。现在请注意,他在切洋葱方面确实遇到了麻烦。这在物理上是不正确的,但这是基础视频生成器的问题,而不是这个框架的问题。但正如您所看到的,场景在整个 1 分钟内基本保持一致。所以,这里是这个新的 Context Forcing 方法(最右边)的一个例子。这里我们将其与另一个长视频生成框架 Long Live 进行比较。正如您所看到的,它保留了更长的记忆。因此,随着视频的进行,请注意 Long Live 的生成开始出现一些不一致之处,尤其是在背景或角色方面。但对于这个新的 Context Forcing 方法,她在整个生成过程中都保持一致。好处是页面顶部有一个 GitHub 仓库。如果您点击它,它说推理代码和检查点以及训练代码将很快开源。所以请继续关注。如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,这个 AI 非常有用。所以 Google 发布了一个叫做 Paper Banana 的东西,它可以自动帮助您为学术论文生成插图和图表。这里是一些 Paper Banana 的示例生成。现在,如果您一直在使用 AI 图像生成器,您就会知道,要生成准确的图表和图纸,并包含正确的数字和信息,实际上是非常困难的。这与生成一张照片非常不同。但有了 Paper Banana,所有内容都根据您输入的数据是准确的。所以,这里是另一个完全用 Paper Banana 生成的图表示例。所以,这是它的工作原理。您首先将您的数据和其他信息来源输入到 AI 中,它将首先通过这一系列代理。我们有一个检索代理,它会检索任何必要的数据,然后调出相关的示例,然后所有这些输入都将通过规划代理来规划如何绘制数据和设计图表。然后它还将输出一个描述,然后将数据传递给风格化代理,该代理当然专门从事设计。这个风格化代理实际上非常强大。这里有一些前后对比,左边是原始图表,右边是经过风格化处理后的图表,请注意它看起来好多了。这里是其他一些例子。左边是之前,右边是之后。然后它会经过一个迭代细化循环。所以我们有一个可视化工具来生成可视化效果,但它也会经过一个评论者来提供反馈以进行细化。这个循环进行三轮,以便生成质量越来越好或越来越准确。然后最终输出您的最终插图。它的好处是它只是一个模型无关的代理框架。换句话说,您可以将任何图像生成器输入到这个框架中。例如,这里他们展示了输入 GPT Image 1.5 和 Nanopano Pro 后得到的结果。您可以在这两者之间切换。但当然,这里他们展示了使用 Nanopano Pro 得到了更好的结果。事实上,如果您将其与 Paper to Any 等其他学术可视化竞争对手进行比较,它的表现要好得多。最疯狂的是,如果您将其与人类进行比较,这个 AI 在简洁性、可读性、美观性和整体方面甚至超越了人类。这真是太疯狂了。现在,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说代码和数据集将在 2 周内发布,这太棒了。总之,现在,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。此外,本周,字节跳动发布了一个速度极快的视频生成器。它叫做 FS Video,代表 Fast Speed Video。正如其名称所示,它速度非常快,但质量也非常高。所以,这里有一些供您参考的示例生成。它基本上接收一个输入或一个文本提示,并且可以生成 1280x720 分辨率的视频。请注意,所有内容看起来都非常漂亮和逼真。仅仅从视觉质量来看,它与顶级的视频模型相当。然后这里是一些供您参考的其他例子。现在,它不仅仅是水平视频,它还可以制作像这样的垂直格式。正如您所看到的,所有内容看起来都非常逼真,我真的很喜欢这个模型的审美。现在,这是重要部分。它说它可以在两个 H100 GPU 上生成 720x1280 的 5 秒视频,总推理时间为 18 秒。现在,当然,您中的大多数人没有 H100 GPU。对于消费级 GPU,可能需要更长的时间,但这仍然非常令人印象深刻。现在,我不会花太多时间在这上面,因为目前,他们只发布了一篇技术论文。没有迹象表明他们是否会开源它,但如果您有兴趣进一步阅读或查看更多演示,我将在下面的描述中链接到这个主页。接下来,这个 AI 非常有用。它叫做 Omnimat Zero,它可以从视频中移除对象,但也可以将它们添加到新背景中。这里有一些例子。左边是原始视频。您可以选择移除猫,右边是您的结果。请注意,它不仅仅移除了猫,还移除了它在水坑中的倒影。这里是另一个例子,我们可以选择移除这些腿。这是我们得到的结果。或者我们可以选择移除右边的天鹅。这是我们得到的结果。请注意,它也理解应该移除它的倒影。然后这里是另一个例子。我们可以移除这个人,包括他的影子。这是我们得到的结果。现在,我们不必只移除一个对象。我们可以移除场景中的多个对象,比如这四只小狗。这是我们得到的结果。请注意,它也能够移除它们的影子。这里是另一个例子,我们可以选择从这个时钟中移除指针,它也知道应该移除它在桌子上的倒影。现在,如果您将其与其他对象移除工具进行比较,请注意最左边是原始输入视频,然后第二列是这个新的 Omnimat Zero。它的表现比其他方法好得多。这里是另一个非常棘手的例子,我们只想移除背景中的那个家伙,但也要保留前景中的杆子。而 Omnimat Zero 是唯一能够完全正确地做到这一点的方法。其他一些也移除了杆子。现在,它不仅可以从视频中移除对象,而且基本上将其分离成一个透明层,就像这样。这意味着您可以然后将这个前景应用到新的背景中,就像这样。这是一个非常糟糕的例子。它并没有真正将这个新对象无缝地融入新背景中。所以,我对这个功能不太满意,但请注意,您也可以使用它来创建目标对象的透明层。最棒的是,如果您滚动到页面顶部,他们已经发布了代码。所以,如果您点击这个 GitHub 仓库并向下滚动一点,这里包含了如何在您的计算机上本地下载和运行它的所有说明。如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。此外,本周,Clling 推出了一款非常酷的 AI,名为 3D Move,代表 3D Aware Implicit Motion Control。正如您在这些演示中看到的,它基本上可以将一个人的动作从一个视频转移到另一个角色上。此外,它还允许您控制结果视频的摄像机视角。所以,您可以放大或缩小,或者您可以像最右边那样进行俯视轨道拍摄。或者这里是另一个例子,您可以将这个舞者的动作转移到这个女孩身上,但您也可以控制摄像机运动。这为您提供了精确的角色和摄像机控制。您看,我们已经有很多这样的动画工具,比如 One Animate 或 Scale,它们可以将一个角色的动作转移到新角色上。但它们都不能同时进行摄像机控制。这是唯一能做到这两点的模型。而且这非常令人印象深刻。即使这只是一个视频生成器,它似乎也具有对场景的 3D 空间理解。所以,您可以围绕这个角色进行轨道拍摄,或者从任何角度查看场景,并且一切看起来都非常一致。这里是一些供您参考的其他例子。无论您如何查看场景,男孩都保持一致。此外,他完全遵循参考视频的动作,包括手和手指以及面部表情。现在,这不仅仅适用于人类。您也可以将其应用于动漫角色或像这样的 3D 动画。请注意,它也非常擅长将手势转移到视频中。事实上,我对这个动漫例子印象深刻。请注意,最右边当您将摄像机向上移动时,它甚至会自动在前景中添加这个漂亮的樱花树枝。这里有很多例子。为了节省时间,我将不一一介绍,但如果您滚动到页面顶部,请注意他们目前只发布了一篇技术论文。没有迹象表明他们是否会开源它,但如果您有兴趣进一步阅读,我将在下面的描述中链接到这个项目主页。接下来,这个 AI 很有趣。所以,它叫做 Inter Prior,它可以帮助机器人学习如何像人类一样以自然协调的方式与物体互动。所以,请注意,它位于这个虚拟环境中进行机器人训练。一切在物理上都是正确的。所以您可以在这些环境中训练机器人进行数十万次迭代,然后将其部署到现实世界中,理论上它仍然会起作用,因为它基于现实世界的物理原理。它所做的是接收一个提示作为输入,比如“拿起球”或“拖动椅子”等等。并且它能够在这个虚拟世界中输出一系列动作,就像这样。然后您正在训练的任何机器人都可以从中学习。例如,您可以插入 Uni Tree G1 并执行完全相同的动作,就像这样。然后在这里,用户甚至可以通过按这些键手动与场景进行交互。现在这里是一些很酷的涌现行为,它甚至不是其训练数据的一部分。所以,它能够实际生成这个机器人与多个物体互动的场景。例如,如果它被指示只拿起一个物体,那么它实际上会在拿起之前先隔离该物体。然后在底部一行,请注意这不仅仅是一个硬编码的序列。所以,实际上有很多方法可以让机器人拿起物体,正如您在这里看到的。这也能训练机器人更好地应对现实世界中不稳定的条件。现在,我不会过多介绍,因为目前他们只发布了一篇技术论文,但这个页面上有大量的例子。如果您有兴趣进一步阅读或查看更多演示,我将在下面的描述中链接到它。此外,本周,我们有一个非常有趣的 AI 叫做 Fast VMT,代表 Video Motion Transfer。正如其名称所示,这个 AI 可以将一个视频的运动转移到另一个视频上。例如,假设您有一个参考视频,其中一辆汽车正在这条路上行驶。那么,您只需提示它将这辆车变成一个完全不同的场景,比如一艘船、一个棒球运动员、一辆火车或一匹狼,它就能生成一个新场景,其中这个新物体遵循参考汽车的运动。或者这里是另一个例子。如果这是您参考的跑车在路上行驶的视频,那么,我们可以简单地使用文本提示生成一个像这样的新场景,但所有内容都遵循参考视频的运动。所以,这里是一些供您参考的额外例子。您可以选择更改背景或对象。没关系,但它能够基本上遵循参考视频的运动,包括,
当然,物体的运动,还有摄像机的运动。所以,如果你想精确控制场景中物体的运动,这真的很有用。这里有一些额外的例子供你参考。
现在,市面上有很多类似的工具,但这种方法生成视频的速度比现有方法快 3.43 倍。
现在,如果你滚动到页面顶部,这个 GitHub 仓库实际上并没有链接到任何东西,所以看起来他们还没有发布任何东西,但如果你有兴趣了解一下,我会在下面的描述中提供链接。
接下来,这个 AI 也非常有用。它叫做 Edit Yourself,基本上可以编辑人们说话的视频。你可以改变他们说的话,或者甚至可以添加或删除视频的片段,甚至可以改变他们的唇语来匹配新的音频。这里有一些例子。
我们也在与也门、苏丹、中国、俄罗斯、阿富汗等国合作。而在达沃斯之后,下个周末,我将前往叙利亚。
现在,接下来要做的是,我们不再只是改变句子中的一两个词,而是要添加整个句子,并让她无缝地说出来。让我们看看会发生什么。
还有工作要做,但我们正处于一项历史性贸易协议的边缘。我们将从俄罗斯购买所有天然气。事实上,有些人称之为“交易之母”。
好的,这是一个例子。这是另一个例子。假设你有一个奥巴马口吃的片段。这是原始片段。
嗯,你可以手动剪掉口吃的部分,但这会在视频中引入大量的硬切。所以,手动编辑的例子看起来会是这样。
当然,有了所有这些硬切,很明显这是编辑过的。但这个 AI 所做的是,它可以自动剪掉口吃的部分,同时无缝地将所有内容拼接在一起。所以没有硬切。
这听起来很有趣,或者推文很有挑衅性。这有多酷?这里还有一些其他例子。
我有一个很棒的未婚夫,他以前做过这件事。他有一个 10 岁的儿子。所以,尽管我有点觉得,我不需要听所有这些故事,但它们实际上很有帮助。
现在,右边是编辑后的视频。
我有一个很棒的未婚夫,他以前做过这件事。他有一个 10 岁的儿子,所以他大概知道我将要面对什么。所以,尽管我有点觉得……
所以,你知道,这个 AI 在让某人说完全不同的事情方面非常强大。你可以改变措辞。你可以编辑掉一些内容。你甚至可以添加整个句子或片段,它会无缝地将其添加到现有视频中。
当然,这可能非常危险。这有被滥用的巨大潜力,用来制造大量的深度伪造。我的意思是,很快我们就无法分辨什么是真实的,什么不是真实的。
总之,如果你现在滚动到页面顶部,你可以在 foul.ai 或 Pipio 上尝试一下。然后这里,他们确实有一些 GitHub 按钮。所以,我希望他们很快会发布这个,但目前还没有迹象。如果你想进一步阅读,我会在下面的描述中提供链接。
这总结了本周 AI 的所有亮点。在评论中告诉我你对这一切的看法。哪个新闻是你最喜欢的?你最期待尝试哪个工具?
一如既往,我会留意顶尖的 AI 新闻和工具与你分享。所以,如果你喜欢这个视频,请记得点赞、分享、订阅,并继续关注更多内容。
另外,每周 AI 领域发生的事情太多了,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要想真正跟上 AI 的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。
感谢观看,下次再见。