Transcription
人工智能从不休息,而本周简直是疯狂的。我们有不止一个,不止两个,而是四个新的人工智能视频模型。这现在是你能够使用的最好的开源三维模型生成器。看看它有多么详细和准确。小米发布了现在你能使用的最好的开源模型。它甚至超越了 Deepseek 和 Kimiku Thinking,甚至可以与市面上顶级的闭源模型相媲美。这现在是动画角色的最佳人工智能。它在全身控制方面做得非常好,而且它是免费且开源的。这款人工智能允许你使用阿里巴巴的 wand 在短短 2 秒内离线生成视频。这相当于加速了 100 到 200 倍,这是一个巨大的飞跃。Clling 发布了一个开源图像模型,这是一个完全不同的领域。我们有一个新的开源三维世界生成器,你可以在其中进行实时交互。说到实时,这款开源人工智能可以在实时生成会说话的虚拟形象视频。你只需要输入一个文字记录和你角色的照片。这款人工智能可以将任何照片变成三维或立体图像。谷歌发布了又一个重磅产品,Gemini 3 Flash,以及更多内容。那么,让我们开始吧。感谢 HubSpot 对本视频的赞助。首先,腾讯的混元本周又发布了一个重磅产品。它被称为混元世界 1.5,它可以创建可交互的三维世界,你可以在其中实时移动。所以,这里有一些例子供你参考。你可以按 W、D 或箭头键来大致移动场景。请注意,这一切都不是预先设计或预先构建的。整个场景在你移动时是即时生成的。而且它这一切都是实时完成的。这是另一个例子供你参考。现在,我们之前已经见过很多这样的三维世界生成器,但这个似乎质量非常好,比我们过去看到的一些其他生成器质量要好得多。现在,它仍然不完美。生成过程中仍然有很多噪点和伪影,但我的意思是,它这一切都是实时完成的,所以质量上会有一些牺牲。现在,除了第一人称视角之外,这里还有一些第三人称视频的例子,你从后面跟随一个角色。它也能很好地渲染这一点。正如你所看到的,这可以轻松应用于视频游戏设计。这项技术一旦足够高效,我认为这将是视频游戏的未来,我们不再拥有 100% 预先构建的世界。我们可以让一个人工智能模型成为视频游戏,你可以提示它生成任何你想要的东西,它可以实时即时生成任何场景或任何角色。现在,这不仅仅处理角色的移动。你还可以通过提示在视频中添加某些东西。例如,你可以添加木材燃烧的烟雾,它真的会产生木材的烟雾。或者这里是另一个例子,你可以提示它让天空变暗,它确实会这样做。然后你还可以提示类似“城堡着火”的内容,然后就会发生这种情况。或者这里是另一个例子,你可以提示它发生远处的爆炸,然后你会得到这个结果。请注意,它几乎可以实时渲染这一点。如果你将这个新的混元世界 1.5 与我之前在我的频道上提到过的 Matrix Game 或 Gamecraft 等其他竞争对手进行比较,你会注意到平均而言,它在所有这些基准测试中都优于其他模型,尤其是在重建质量方面。最棒的是,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库和所有模型。所以,如果你点击这个并向下滚动一点,首先要注意的是,你需要一个 CUDA GPU,最低需要 14 GB 的 VRAM 并支持卸载。但如果你有的话,这里有所有关于如何下载并在本地计算机上运行它的说明。你知道,它只需要 14 GB 就已经很疯狂了。这是一个实时三维世界生成器。像以前的竞争模型需要更多的计算能力。然后这里基本上是如何运行和配置它的所有说明。而且他们似乎还计划开源训练代码,这太棒了。总之,所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能也非常有趣。它被称为立体空间(Stereo Space),它可以从二维图像生成三维场景。更具体地说,它的作用是拍摄一张照片,然后将其分解成类似这样的东西,你可以用三维眼镜观看。你知道电影院里那种带有红色和绿色镜片的眼镜吗?你可以用它来观看这样的照片。如果你通过这些眼镜观看,那么这个场景看起来确实是三维的。所以,这里有几个例子供你参考。现在,除了将其转换为这些红绿照片之外,你还可以生成这样的立体照片。所以,同样,这些是为了在三维眼镜中使用,左边的图像应该用左边的镜片观看,然后右边的图像应该用右边的镜片观看。但你也可以做的就是现在眯起眼睛,然后尝试将这两张照片合并在一起。一旦你这样做,你应该能够看出这个场景的三维渲染。这里是另一个例子供你参考。显然,这种新的立体空间方法平均而言优于其他三维照片生成器。正如你在这里的表格所示,最佳值以绿色突出显示。请注意,立体空间基本上在所有这些基准测试中都获得了最佳值。最棒的是,他们发布了一个免费的 Hugging Face Space 供你试用。所以,这是它的样子。让我们上传一张输入图像。我将把这张图片拖放到这里。现在它正在处理我的图像以创建全息图。好了。这是我们得到的结果。现在,除了全息图之外,我还可以生成一个并排视图,它会给我这个。他们已经发布了代码。所以,如果你点击这个 GitHub 仓库并向下滚动一点,这里包含了所有关于如何下载并在本地运行它的说明。这里没有提到 VRAM 要求,但如果我点击 Hugging Face 仓库,似乎所有东西的总大小约为 12 GB。所以,你应该可以舒适地将其装入 12 GB 或更低的 VRAM 中。总之,所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能超级有用。它被称为 Long V2,它可以生成他们称之为超长视频。现在,事情是这样的。如果你一直在玩人工智能视频生成,无论你使用的是开源模型还是闭源专有模型,大多数模型最多只能生成 10 秒的视频。所以,这非常有限。如果你想生成更长的视频怎么办?嗯,这个 Long V2 可以生成长达 5 分钟的视频。所以,这里有一些例子供你参考。现在,当然,因为这些视频长达数分钟,我实际上会快进一点。但正如你所看到的,即使视频不断播放,也没有明显的错误或不一致之处。在整个生成过程中,场景都保持着非常连贯。这里有一些其他例子供你参考。即使我快进到一分钟或两分钟以上,场景仍然保持着非常连贯。如果你看看这些长视频质量和一致性的基准测试,你会发现平均而言,这个 LongV2 甚至优于其他竞争模型。现在,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果你点击这里,它包含了所有关于如何下载并在你的电脑上运行它的说明。请注意,这确实使用了 14B 作为基础模型。所以,你应该可以在一些卸载的情况下在消费级 GPU 上运行它。现在,如果我点击这个 Long V2 的模型权重,请注意这两个模型总大小约为 14 GB。所以,请记住这一点。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,ZAI,也就是拥有最好的开源模型之一 GLM 的公司,他们本周刚刚发布了一个实时视频生成器。它被称为 Real Video,它可以根据你输入的内容创建一个人说话的实时视频。所以,它基本上结合了文本到语音和虚拟形象动画,并且可以实时生成这一切,包括与他们所说内容匹配的唇语同步和面部表情。这里有一些例子。所以,这里是你输入角色想要说出的文本的地方。这里是你上传角色参考图像的地方。然后这里是你上传想要使用的声音的地方。>> 诚实。你这么说可真够讽刺的。我告诉你,伙计。有时候真相只是另一种说谎的方式。我宁愿保持事情的灵活性。这叫做生存。试试吧。>> 宇宙要求你奋斗。意义在烈火中锻造,而非舒适。你的潜力在尖叫着要被释放。平躺就是背叛你自己的辉煌精神。>> 现在,这里有一些令人印象深刻的成就。所以,这个系统可以实时生成视频,延迟仅约 2 秒。最棒的是,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果你点击这个并向下滚动一点,请注意,他们已经为你发布了模型。然后这里包含了所有关于如何下载并在本地计算机上运行它的说明。另外请注意,这基本上使用了目前最好的开源视频模型 2.2 以及自适应技术,这进一步加速了视频生成。总之,所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。另外,本周,阿里巴巴继续发力。所以,Quen 团队刚刚发布了 Quen Image Layered。这基本上可以让你将一张图像(如你左边看到的)分解成多个可编辑的图层,有点像 Photoshop 图层。每个图层包含图像的不同部分,例如背景、人物或对象、文本等。这样你就可以编辑一部分而不会影响其他部分。所以,这里有一个例子。你可以将这张海报通过这个人工智能进行处理,将其分解成单独的透明图层,就像这样,我们有背景,然后是角色,然后是不同的文本和设计,都在单独的图层中。这样做的好处是,你可以然后只取任何一个单独的图层,并随意编辑它。例如,我们可以将背景更改为蓝色,它只会改变这一部分,而保持其他图层不变。所以,这是最终图像。或者你可以将角色更改为看起来像这样,它只会改变角色,而保持海报的其余部分不变。你还可以删除某些元素,例如这里的额外柠檬。或者你还可以调整单个元素的大小,例如这里的柠檬。你可以让它变得更大,像这样。它基本上保持了图像的其余部分不变。你甚至可以选择你想要将图像分解成多少个图层。例如,如果你选择三个图层,这就是你得到的结果。或者如果你选择八个图层,那么它可以更精细地将其分解成这八个图层。现在,最棒的是,与 Quinn 的大多数模型一样,他们已经开源了。所以,这是 HuggingFace 上的模型。这里包含了所有关于如何下载和运行它的说明。但是,请注意,一切都很大。例如,所有东西的总大小是 60 GB。如果我只看 Transformer 模型,它的大小是 40 GB。所以,你现在需要一个高端 GPU 来运行它,但我相信因为它是开源的,社区很可能会在未来发布一些量化或压缩版本,可以在较低的 VRAM 上运行。总之,现在,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,微软发布了 Trellis 2。这目前是你现在可以使用的最好的开源三维模型生成器之一,而且比他们之前的版本一有了巨大的升级。这里有一些令人难以置信的例子供你参考。如果我们输入这张输入图像,这是它生成的 3D 模型。看看细节有多么惊人。请注意,这只是一张图像。它甚至不知道这个角色的背面是什么样子,但它能够非常逼真地猜测和生成一切。或者这里是另一个例子供你参考。假设我们输入这张机甲角色的照片。看看它有多么详细和准确。这里是另一个令人惊叹的例子。请注意,对于 3D 模型生成器来说,创建毛发非常困难,但它实际上做得非常好。我对这个模型印象深刻。这里是另一个非常棘手的背包例子,但它能够捕捉所有细节并创建一个非常准确和逼真的三维渲染。即使是像菠萝这样简单的东西,对于以前的 3D 模型生成器来说,准确地捕捉所有细节也非常困难。但正如你所看到的,Trellis 2 完美地处理了这个问题。这里是另一个美人鱼的例子。同样,这是一个非常棘手的场景,有大量的不同元素,包括漂浮的水母。她的头发也非常复杂,但它能够很好地渲染。请注意,这仅仅来自一张二维照片。背后的技术细节实际上非常有趣。所以,让我们快速过一遍。首先,Trellis 2 不使用传统的网格,而是使用所谓的“体素”(voxels)。它们就像选择性的三维像素。简单来说,它们只存在于实际需要几何形状的地方。所以,它不像填充任何空白空间。然后有一个体素处理几何形状,例如物体的形状,然后另一个体素处理材质,或者基本上是物体的外观,例如基础颜色,或者它是金属的、反光的还是透明的。将形状和材质或基本上是表面结合起来,可以创建一些超逼真和准确的物体。现在,三维模型数据非常庞大。所以,Trellis 2 还使用稀疏压缩 VAE 高效地压缩它。这基本上将三维数据在每个维度上缩小了 16 倍。所以,一个巨大的 1024 分辨率的三维物体可以压缩到只有 9.6K 个 token。现在,如果你滚动到页面顶部,最棒的是他们发布了一个免费的 Hugging Face Space 供你在网上试用。所以,如果我点击这里,这是它的样子。让我们上传一张参考图像。我将上传这个狐狸。然后对于分辨率,好的,让我们选择 1024。我将保留所有设置的默认值。然后点击生成。请注意,这需要大约 38 秒。这是我们的结果。我还可以查看法线估计、材质属性和其他内在属性。非常酷。然后我可以点击这个来提取 GB 并下载三维模型。除了免费的 Hugging Face Space 之外,他们还发布了一个 GitHub 仓库,如果你向下滚动一点,这里包含了所有关于如何下载并在本地运行它的说明。现在,这确实需要一个 Nvidia GPU,至少有 24 GB 的 VRAM,但我相信因为它是开源的,将来可能会有一些量化版本可以在较低的 VRAM 上运行。总之,所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个工具非常有用。它被称为 Turbo Diffusion,它可以将你的本地视频生成速度提高 100 到 200 倍。所以,如果你一直在本地运行人工智能视频生成器,你可能正在使用 1 2.2 或 1 2.1。看看这个东西有多快。至少在单个 RTX5090 上,如果你在你的 Juan 工作流程之上添加这个 Turbo Diffusion,你可以将其速度提高近 200 倍。然后这是生成时间。Turbo Diffusion 是绿色的条形图,因为与普通版本相比它非常快,所以你几乎看不到它。所以,你可以在短短 2 秒内生成一个 5 秒的视频。顺便说一下,这是普通版本和添加 Turbo Diffusion 到工作流程之间的比较。顶部是一个使用 Juan 14B 的图像到视频示例,我们使用这只冲浪猫的相同起始帧。然后左边是普通的常规工作流程。右边是如果你在工作流程中添加 Turbo Diffusion,速度会提高约 119 倍。这意味着你可以在短短 35 秒内生成一个 5 秒的视频,这非常快。请注意,没有明显的质量下降。两个视频的质量非常相似。视频底部也是如此。这只是文本到视频,它使用的是标准的 Sora 提示,即“东京女士”。正如你所看到的,即使添加了 Turbo Diffusion,速度提高了约 93 倍,质量也非常相似。它不像普通视频那样明显更差。这里有一些其他例子供你参考。右边是 Turbo Diffusion。注意生成时间上的巨大差异。然后这里有一些其他图像到视频的例子供你参考。我的意思是,这将是一个游戏规则的改变者。现在,即使是低 VRAM 的人也可以更快地生成视频,而以前生成一个 5 秒的视频可能需要几个小时。这里有一些文本到视频的例子。如果你将其与另一个称为 Fast Video 的加速器进行比较,不仅 Turbo Diffusion 更快,而且质量也更好。对于 Fast Video,生成过程中有很多明显的错误,但对于 Turbo Diffusion,所有内容在生成过程中都保持完整和一致。这里有一些其他例子供你参考。快速看一下 Turbo Diffusion 的技术细节。它使用了一系列加速技术。一种是 Sage Attention,这是一种加速神经网络中注意力机制的方法。你可能已经熟悉了。但他们还使用了 SLA,或者基本上是稀疏线性注意力,这进一步减少了所需的计算量。然后他们还使用了 RCM,它用于跳过大量步骤,从而在不牺牲太多质量的情况下使生成速度更快。所以,所有这些技术结合在一起,基本上帮助 Turbo Diffusion 实现了真正快速和高效。最棒的是,他们已经为不同版本的 Juan 发布了所有模型。这里包含了所有关于如何下载并在你的电脑上运行它的说明。他们还发布了训练代码,这太棒了。目前,你只能通过这个 Python 代码使用它,这并不直观,但我相信因为它是开源的,它很快就会被添加到 Comfy UI 中。总之,所有链接和信息都在这个页面上。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。随着所有这些新的视频生成器层出不穷,很难跟上所有进度。这就是为什么我与 HubSpot 合作创建了一个简单实用的 AI 视频指南,名为“找到你最佳的 AI 视频生成器”,进行并排比较。在其中,我分解了当前的 AI 视频格局,并包含了一个快速备忘单,帮助你为你的特定需求选择合适的模型。然后,我将介绍当前顶级模型的优点和局限性。我涵盖了模型的规格,例如它可以生成的分辨率和时长,以及你可以访问它的所有地方。我最喜欢的部分是我包含的示例提示。它们让你能够试验每个模型,看看哪个最适合你的需求。关键在于,没有一个模型可以做所有事情。每个视频生成器都有其优点和缺点,因此了解它们的细微差别非常重要,这样你才能知道如何有效地将它们结合起来制作一些史诗般的视频。你可以使用下面的描述中的链接完全免费下载我的指南。这个资源是由 HubSpot,本视频的赞助商制作的。这是本周发布的另一项最先进的人工智能。如果你想以终极控制力来动画化视频中的角色,那么这个目前是你能够使用的最佳人工智能。它被称为 Scale,基本上你可以拍摄任何角色的参考照片加上另一个参考视频,然后它会将该视频的动作应用到你的新角色上。现在,我们之前已经有很多这样的工具了,比如 One Animate,它也非常好。但就全身动作和具有不同形状和宽高比的复杂角色而言,这个新的 Scale 版本实际上比 One Animate 表现更好。这里是另一个例子供你参考。它甚至不必是像人类一样的角色。你甚至可以让这个松鼠像这个人一样跳舞。这就是 Scale 的优势。你的角色的比例如何并不重要。它能够非常准确地将参考视频的动作应用到你的角色上。是的,这也适用于动漫角色,正如你从这个例子中看到的。这里有一个更令人惊叹的演示,一个人在做一个回旋踢。它能够非常准确地将这个动作应用到这个新角色上,尽管这是一个相当棘手的动作。而且,以前的角色动画工具肯定无法生成像这样一致的动作。最棒的是,你甚至可以将它应用于视频中的多个角色。所以,这里有一个例子,我们有两个角色,它能够很好地将动作应用到这些企鹅身上。这是它的工作原理。它实际上会提取视频中的三维姿势,正如你从最左边看到的。这与二维姿势不同,二维姿势用于竞争模型中。当然,有了这个三维姿势,它在实际检测和渲染三维空间中的姿势方面会更加准确。所以,如果你将 Scale(位于右上角)与其他竞争对手如 Vase、One Animate 或 Uni Animate 进行比较,你会注意到 Scale 的表现要好得多,而且更加一致。这个场景尤其棘手,因为你知道当这个女人旋转时,腿可能会混淆。所以,你可以看到,对于其他竞争对手来说,它经常会混淆腿部,或者有时女人会从正面转向背面。但对于这个新的 Scale,一切都保持非常一致。或者这里是另一个棘手的例子。请注意,这个新的 Scale 版本产生的错误最少。对于 One Animate,它在唇语同步和表情动画方面通常更好,但一旦你让它执行一些复杂的全身动作,它就会有点崩溃。而 Scale 在这方面做得更好。这里是另一个更棘手的例子,涉及多个角色。由于 Scale 能够检测到这些角色在三维空间中的姿势,因此它能够比 Vase 或 One Animate 等其他竞争对手更好地理解它们的动作,而这些竞争对手正如你所看到的,有更多的明显错误。所以,我的意思是,有了这个新的 Scale 工具,你甚至可以生成一个看起来很棒且连贯的两个角色的打斗场景。总之,这个页面上有很多例子。为了节省时间,我不会一一介绍,但请注意,如果你想控制使用参考视频的角色动作,Scale 目前是你能够使用的最佳开源工具。最棒的是,他们已经发布了所有东西。所以,如果你点击这个 GitHub 仓库并向下滚动一点,这里包含了所有关于如何下载并在本地计算机上运行它的说明。并注意它已经通过 Ki 的 Swan Video Wrapper 添加到 Comfy UI 中。所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能相当有趣。它被称为 VRBGX。这款人工智能允许你编辑视频的内在属性。具体来说,这款人工智能会接收你的输入视频,并将其分解成四个独立的内在属性:反照率、法线、辐照度和材质。那么,这四样东西到底意味着什么呢?首先,反照率是表面的基础颜色。例如,你可以将前景中木椅的反照率或颜色编辑成黄色。你也可以将墙壁变成蓝色。这是你得到的结果。请注意,它只改变了这些物体的颜色或反照率,而保持场景的其余部分不变。或者,除了反照率,你还可以编辑场景的法线。法线基本上是视频中所有表面方向。例如,你可以在沙发侧面添加这个花卉图案,它能够匹配原始光照并无缝地融入场景。现在,除了反照率和法线之外,你还可以编辑视频中任何东西的材质属性。例如,如果你将其变成金属,那么它会更具反射性。或者如果你将其制成木材,那么它的反射性会降低。所以,例如,我们可以像这样让椅子和桌子的反射性降低。然后辐照度基本上是控制场景中的光线。例如,你可以将这个原始视频的光照,这是一个较冷的颜色,改变成更温暖的黄色光,像这样,同时保持场景的其余部分一致。你不需要单独编辑所有这四个属性。所以,这里有一个例子,你可以编辑场景的反照率和辐照度,这是你得到的结果。或者这里是另一个例子,你可以编辑场景的法线和辐照度。所以,请注意,你正在改变沙发,同时也在改变这个视频的光照。现在,如果你滚动到页面顶部,他们发布了一个 GitHub 仓库,但由于这是来自 Adobe,看起来他们还没有发布任何东西。他们在这里说,在他们的待办事项列表中,他们计划开源模型权重、推理代码和训练代码,这太棒了。总之,所有链接和信息都在这个页面上。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。另外,本周,市面上顶尖的人工智能视频公司之一 Lumalabs,刚刚发布了一个新模型,名为 Ray 3 Modify。这非常强大。它基本上会拍摄一个现有的视频,并以不同的风格或角度重新拍摄它。或者你也可以添加视觉效果,或者插入或替换任何东西。例如,你可以自己表演一个场景,然后用这样的提示重新拍摄视频。或者这里是另一个例子,你可以表演一个与另一个人打斗的场景,然后将其重新拍摄成这样的内容。或者你也可以轻松地拍摄一个视频,并根据提示随意更改它。例如,你可以将其更改为夜晚、冬天或日落等。或者你也可以通过上传新角色的图像来轻松替换现有视频中的角色,它能够非常无缝地应用角色交换。所以,这是一个超级通用的工具,而且它实际上与我上周提到的 Cling01 非常相似。事实上,我认为这将是人工智能视频的未来。我们将看到越来越多的模型具有这些功能,我们可以通过拖放新元素或使用自然语言提示来编辑现有视频,就像 Nano Banana 一样。这完全消除了对传统视频编辑工具的需求,例如动作捕捉、绿屏、遮罩或手动应用动画或视觉效果。人工智能可以自动无缝地为你处理这一切。总之,回到这个新的 Ray 3 Modify。如果你有兴趣尝试一下,我会在下面的描述中链接到它。现在,既然我提到了 Cling,他们本周也发布了一个非常强大的东西,叫做 Motion Control。这允许你使用参考视频来控制任何角色的动作。所以,这里有一些例子供你参考。所以,这与 One Animate 和我之前介绍过的一些其他身体动画工具非常相似。所以,这允许你基本上将视频的动作转移到一个新角色上。它甚至能够处理复杂的动作。此外,它还能够正确处理手、手指和手势。并且它能够进行唇语同步和表情。你甚至可以上传长达 30 秒的参考视频。所以,它不像其他动画工具那样仅限于 5 到 10 秒。现在,如果你有兴趣尝试一下,登录 Cling AI 后,只需点击顶部的“Motion Control”新标签页即可。所以,这里是你上传参考视频的地方,这里是你上传角色图像以进行动画处理的地方。总之,如果你有兴趣尝试一下,我会在下面的描述中链接到 Cling。现在,Cling 还没有停止发力。所以,本周 Cling 团队还发布了一个非常迷人的图像生成器,叫做 SVG Text to Image。要理解这个论文涉及的内容,首先让我给你一些关于图像生成器如何工作的背景。所有图像生成器的基础是扩散模型,它首先从像这样的噪声的潜在图像开始,在每一步它都会去除一些噪声,直到生成你提示的图像。实际上,它并不是在你我能看到的视觉维度上生成图像。相反,图像首先被转换为这个潜在空间,看起来像这样。如果你玩过 Comfy UI 中的工作流程,你会知道我们经常需要先导入这个 VAE 将图像编码到潜在空间。然后在 AI 通过 K Sampler 生成图像后,我们需要再次使用 VAE 将图像解码回视觉空间,也就是你我能看到的。使用 VAE 在潜在空间中生成图像是为了使其更快、更便宜、更稳定,而不会牺牲太多图像质量。但这是疯狂的事情。本周,Cling 发布了一个不同的东西。这个模型实际上绕过了在潜在空间中工作的需求。实际上不需要 VAE。相反,它直接在视觉空间中生成你我能看到的图像。所以,这是一个更简单的流程,而且质量实际上非常好。所以,这里有一些例子供你参考。请注意,这只是实验性的。它有点像一个原型。质量不如 Z Image 等领先的图像模型,但考虑到这个流程甚至不使用 VAE,它实际上非常令人印象深刻。如果你将这个新模型与市面上所有其他竞争图像生成器进行比较,它在整体质量方面不是最好的,但它非常接近。比如,它比 Flux 1D、SD3 或 SDXL 都要好。并且请注意,这又是一个独立的类别。这是一个完全不同的模型架构,不需要 VAE。现在,最棒的是,他们已经开源了整个流程,包括模型,以及如何在本地计算机上安装和运行它,还有数据准备和训练的代码。所有信息都在这个页面上。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。现在,我们还没有完成 AI 视频。所以,本周,阿里巴巴也发布了他们最新的视频生成器,1 2.6。现在,这可以生成高达 1080p 分辨率的带音频的视频。它有相当不错的唇语同步,你甚至可以生成平滑过渡的多镜头视频,长达 15 秒。现在,这只是比 1 2.5 的一个非常小的升级,1 2.5 做了类似的事情,但 1 2.6 的一个新功能是他们添加了参考到视频,而不是只上传角色的图像,你可以上传角色的参考视频,像这样。然后 1 2.6 可以生成这个角色的新视频。所以,这里有一个例子,或者这里是另一个例子。现在,老实说,因为 2.6 只是一个非常小的升级,它并没有给我留下深刻的印象。老实说,这些生成仍然有很多噪点和错误。而且这是闭源的。所以,没有迹象表明他们是否会实际开源 1 2.6。所以,假设这是闭源的,那么它甚至不如市面上最好的闭源模型,如 VO 或 Sora 2。但总之,如果你有兴趣尝试一下,你可以在 Juan 的原生平台 Juan.video 上免费尝试。你可以点击这里生成视频,并获得免费积分开始。总之,如果你有兴趣尝试一下,我会在下面的描述中链接到这个主页。现在,我认为比 1 12.6 更好的实际上是 ByteDance 的 C dance 1.5 Pro,它也是本周发布的。这也能创建带音频的视频。所以,这里有一些例子供你参考。>> Get some work done. >> [music] >> 所以,正如你所看到的,C dance 1.5 Pro 的质量和一致性实际上非常好。如果你比较所有这些不同的基准测试,如美学、运动和对齐,与其他领先的视频生成器如 Cling 2.6 6 和 V3.1,你会发现总体而言,C dance(这是绿色的颜色)的面积最大。同样在这里,在这些音频基准测试方面,C dance 1.5 Pro 比 Cling 和 VO 3.1 更好。所以,总之,这些只是供你参考的一些例子,你现在就可以在流媒体应用平台上尝试。所以,如果你有兴趣,我会在下面的描述中链接到这个主公告页。好的,接下来。如果我让你说出一个中国科技公司,我敢肯定小米可能会让你想到。现在,到目前为止,他们在人工智能领域一直很沉默。嗯,划掉那个,因为小米本周刚刚发布了一个非常强大的开源模型,叫做 Mimo V2 Flash。它旨在超快、高效,并且在推理、代理和编码任务方面表现出色。所以,这是疯狂的事情。如果你看看所有这些基准测试,这些不是经过挑选的基准测试。这些是其他人工智能模型使用的标准基准测试,如 Sweetbench verified、Tao 或 AIM(竞争性数学)、GPQA(研究生水平科学问题)、Humanity's Last Exam(非常晦涩的科学问题)以及 Arena Hard(创意写作)。你可以看到,MIMO v2 Flash 的表现非常接近顶级的专有模型,如 Claude 4.5 和 GPT5。疯狂的是,MIMO v2 其实相对很小。这是一个拥有 3090 亿参数的混合专家模型。请注意,DeepSeek 的规模是其两倍多。而且我认为 GPT5 和 Cloud 4.5 的规模也比这大很多倍。疯狂的是,它并不一次性使用所有这些。只有 150 亿参数在你使用它时是激活的。所以,这使得它超快且高效。事实上,它在 Sweetbench verified(这是代理编码)上的表现是你能使用的最佳开源模型。它甚至超越了最新版本的 Deepseek 和 Kim K2 Thinking,这非常令人印象深刻。在 Sweet Bench Multilingual 方面也是如此。所以,如果你正在寻找最好的开源人工智能模型用于代理编码,那么实际上不是 DeepSeek、Kimiku 或 Miniax。目前,最好的模型是小米的 Mimo。这里有一些例子供你参考。你可以让它创建一个漂亮的 MacOSS 模拟,这是你得到的结果。或者你也可以创建一个像这样的太阳系探索器。而且这个也相当交互式。当然,你也可以创建一个像这样的漂亮主页。现在,正如我所说的,他们已经开源了所有东西。所以,这是 Hugging Face 仓库,你可以在那里下载它。所以,这里有模型供你选择。这里是如何在本地计算机上运行它的说明。现在,因为这仍然是一个大型模型,超过 3000 亿参数,所以它的规模约为 313 GB。所以,它不适合消费级 GPU。你仍然需要一个多 GPU 集群或像 DGX Spark 这样的设备来运行它。但尽管如此,这仍然是你现在能够使用的顶级开源模型之一。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。另外,本周,谷歌发布了 Gemini 3 Flash,这实际上是效率方面你现在能够使用的最佳模型。所以,这里有一些基准测试分数供你参考。你可以看到,Gemini 3 Flash 比 Gemini 3 Pro 便宜四倍,而且性能只略有下降。但对于其中一些基准测试,它仍然比 Claude 4.5 或 GPT 5.2 更好。与 Gemini 3 Pro 一样,Flash 版本在理解和处理图像、视频和音频方面也表现出色。它是多模态的,而且在代理编码方面也很出色。所以在 Sweetbench verified 上,它获得了惊人的 78%。据称甚至高于 Gemini 3 Pro。现在,这里是 Gemini 3 Flash 和 Gemini 2.5 Pro 之间的比较。如果你看看它的速度,它快了三倍,但与 Gemini 2.5 Pro 相比,它使用的 token 也少了 30%。而且它在代理编码方面也更好,正如你从这些例子中看到的。所以,我的意思是,真的没有理由再使用以前的 2.5 版本了。你可以用更便宜、更快的 Gemini 3 Flash。如果你看看 Artificial Analysis 的这个排行榜,你会发现 Gemini 3 Flash 实际上排名第二,仅次于 GPT 5.2 extra high 和 Gemini 3 Pro,它们并列第一。所以,它甚至优于 Claude Opus 4.5。此外,它拥有 100 万个 token 的上下文窗口,而 Claude 的大小是它的五倍。这基本上是你一次可以将多少信息放入你的提示中。真正重要的是,如果你看看它的成本,它比领先的模型 GPT 5.2 便宜得多,GPT 5.2 在这里。它比这贵四倍多,以及 Gemini 3 Pro,它在这里。所以,Gemini 3 Flash 目前是性价比最高的。你可以获得最智能的模型之一。它总体排名第二,但价格却只有其他模型的一小部分。这是一个非常令人印象深刻的成就。现在,他们说 Gemini 3 Flash 现在是 Gemini 应用中的默认模型。它也可以在 AI Studio 中使用。所以,如果你点击模型下拉菜单,你应该会看到最新的 Gemini 3 Flash 在这里。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。另外,本周,中国外卖公司美团继续推出一些非常酷的人工智能产品。所以,他们刚刚发布了 LongCat Video Avatar,这绝对是你现在能够使用的最佳开源工具,用于生成说话或唱歌的视频。它接收你想要角色说出的音频剪辑,加上该角色的照片,加上一个文本提示,然后它会将所有这些输入合并在一起并制作一个视频。这里有一个例子。>> [laughter] >> [laughter] >> >> 现在,它并不完美,但它甚至能够生成更夸张的表情,比如这种邪恶的笑声。或者这里是另一个例子。>> 我一直和你站在一起。我花了 18 年的人生站在同一个地方。>> 我去看了一部电影,一部在市场上上映的澳大利亚电影。所以,我看了《冰风暴》,我借了一只青蛙。这是一部非常非凡的电影。它实际上能够捕捉到音频剪辑中的一些细微之处。有一些像嘴巴点击的声音,它能够很好地捕捉到。而且她动得非常自然。她的眼睛在眨动。她的脸在动。实际上非常好。>> 在没有真正证人的情况下,>> 威利斯先生的证词不仅含糊不清,而且毫无根据。我一直在寻找的实质,西姆斯先生,应该来自你。>> 请注意,音频中有一些呼吸声,它也能够让这个角色在这些呼吸声中吸气。一切看起来都非常无缝和自然。>> 直到你出现的那一天我才知道你还活着,然后这一切都发生了。我还没告诉丹尼。>> 现在这不仅仅是说话。这也可以唱歌,像这样。当灯变红时,我们用一个词喊出我们的真相。 [音乐] 手在空中挥舞,灯光。 [音乐] [唱歌] >> 而且这不仅仅适用于人类。所以,你也可以做其他角色,像这样。所以,有了这个工具,你可以轻松地创建像这样的音乐视频或网红视频。>> 维生素 C 和透明质酸。每天早上只需两滴,就能让你看起来睡足八小时。你感到真正自由。有了 EA Trip,你的梦想假期比你想象的更近。我们比较了数千个航班和酒店,以找到保证最低的价格。>> 最棒的是,他们已经发布了代码。所以,这是 GitHub 仓库。请注意,这里说他们本周发布了这个 Long Cat Video Avatar。所以,这里是推理代码和模型权重的链接。然后这里包含了所有关于如何下载并在你的电脑上运行它的说明。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。另外,本周,Blackforce Labs 发布了他们迄今为止最好的图像模型 Flux 2 Max。这相当不错。这里有一些生成示例。我们还可以制作一些漂亮的帖子和图形。正如你在这里看到的,一切都非常逼真且高质量。然而,它仍然没有达到 Nano Banana Pro 的水平,而 Nano Banana Pro 非常出色。不幸的是,在他们发布这一天的同一天,OpenAI 也发布了 GPT Image 1.5,它甚至更好。所以,你知道,我有点同情 Flux,因为,你知道,几周前他们第一次发布 Flux 2 时,它就被阿里巴巴的 Z Image overshadow 了,Z Image 是开源的而且便宜得多。然后本周,他们发布了 Flux 2 Max,但在同一天,OpenAI 发布了他们的图像模型,它甚至更好。所以,我的意思是,根本没有理由使用 Flux 2。所以,我的意思是,如果你看看 Artificial Analysis 的这个独立排行榜,Flux 2 Max 相当不错,但它只排名第三,排在 NanoPanana Pro 和 OpenAI 的 GPT Image 1.5 之后。然后,在图像编辑方面也是如此,你可以看到 Flux 2 Max 排名第三。此外,它的价格甚至比第二名和第一名还要贵。所以,使用 Flux 根本没有意义。但是,如果你有兴趣进一步阅读,我会在下面的描述中链接到他们的公告页。现在,既然我们谈论 GPT Image,这个模型实际上非常好。它绝对是市面上最好的之一。我会说它不如 Nano Banana Pro,但至少根据这个排行榜,它实际上更好。但一定要自己试试。你在 ChatGPT 上可以获得大约十几次免费生成,而对于 Nano Banana Pro,如果你是免费用户,你只能在 Gemini 应用上获得两到三次免费生成。所以,OpenAI 实际上更慷慨。我现在已经对 GPT Image 1.5 进行了全面评测,并将其与 Nano Banana Pro 进行了比较,所以一定要看看这个视频,以对它的功能和局限性有一个很好的了解。我会在下面的描述中链接到它。接下来,这个人工智能非常酷。它被称为 Ego X,它可以拍摄第三人称视角的视频,例如左边,然后将该视频转换为第一人称视角,就像从人自己的视角看到的。这被称为以自我为中心的视频,而这款人工智能基本上能够生成它。或者这里是另一个例子,左边是原始视频,右边是这个从女性视角生成的新以自我为中心的视频。多么酷啊?或者这里是另一个例子,我们可以从绿巨人的视角重新生成这个视频。这里有一个更令人惊叹的例子,我们可以从某个玩家的视角重新生成这个乒乓球比赛。现在,这个生成过程中有很多明显的错误。所以,它并不完美,但仍然很酷,我们有一个人工智能能够猜测并生成这个场景从以自我为中心的角度来看会是什么样子。这里有一些例子,中间一列是真实情况。这就是以自我为中心的视频在现实生活中实际的样子。然后右边是这个人工智能生成的视频。正如你所看到的,它实际上与真实情况非常相似。而不是足球,这里有一个篮球的例子。同样,人工智能生成的视频(右边)实际上与真实情况非常相似。这里是另一个例子供你参考。人工智能能够从一个原始视频中推断出如此多的数据,这真是太疯狂了。同样,它与真实情况非常相似。快速看一下它的工作原理。它首先将你的输入视频转换为这个三维点云空间,以理解三维场景。它还猜测了自我轨迹,也就是一个人从他们的视角移动的方式。然后它通过视频扩散模型将这两者结合起来,基本上生成这个以自我为中心的视频。现在,如果你滚动到页面顶部,他们发布了一个 GitHub 仓库。如果你点击进去,它说他们将在本周发布推理代码和模型权重,这太棒了。他们还计划在本月底发布训练代码,甚至数据预处理代码。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。这总结了本周人工智能的所有亮点。请在评论中告诉我你对这一切的看法。哪个新闻是你最喜欢的?你最期待尝试哪个工具?一如既往,我会密切关注顶级人工智能新闻和工具与你分享。所以,如果你喜欢这个视频,请记住点赞、分享、订阅,并继续关注更多内容。另外,人工智能的世界每周都在发生太多事情,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要想真正跟上人工智能的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。感谢观看,下次再见。