📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

New open Nano Banana, AI plays any video game, new top open source models, long videos: AI NEWS

AI Search38:50

Transcription

即使是圣诞假期,人工智能也从不休息。而本周也绝对是疯狂的。我们不仅有一个,而是有两个新的开源模型,它们现在已经达到了最先进的水平。它们甚至可以与 Gemini 3 和 GPT 5.2 等顶尖的闭源模型相媲美。我们终于有了一些不错的开源人工智能,可以生成更长的视频。这是您现在可以离线使用的最佳开源图像编辑器。它就像 Nano Banana 一样,您可以用自然语言编辑图像。我们还有另一个人工智能,可以调整照片的焦点。因此,您可以使用它轻松修复一张失焦的照片。这个人工智能可以根据参考视频为任何肖像制作动画。最棒的是,它的速度比其他方法快六倍,即使视频很长,它也能保持一致。这个人工智能可以拍摄一张场景照片,并将其变成一个完整的 3D 场景,其中包含可以进一步编辑的独立对象。我们还有另一个人工智能,可以检测图像中所有对象的属性。这个人工智能可以将任何角色放入 3D 世界并为其制作动画,就像他们在玩电子游戏一样,还有更多功能。所以,让我们直接开始吧。首先,英伟达发布了一个名为 Nitrogen 的非常酷的人工智能代理,它可以自主玩几乎所有现有的电子游戏。所以,这是一个视觉动作基础模型,它在来自 1000 多个不同游戏的 40,000 小时的游戏过程中进行了训练。而且由于其训练数据非常多样化,因此它能够自主玩所有这些电子游戏,甚至还能玩它从未见过的游戏。现在,它被称为视觉动作基础模型,因为他们训练它玩电子游戏就像人类玩一样。所以,视觉部分意味着人工智能能够看到游戏过程。然后动作部分意味着它能够像人类一样使用操纵杆或控制器。而这些是它能够访问的所有内容。它不能像破解游戏代码那样以某种方式玩游戏。它玩游戏就像人类一样,通过看屏幕,然后弄清楚要采取什么动作或按键。在这里,您可以看到用于训练它的所有不同游戏的细分。所以,它主要是动作角色扮演游戏,但也有平台游戏、动作冒险、体育等等。正如您从这些例子中看到的,它能够检测游戏中发生的事情并执行一些相当复杂的动作来赢得游戏。例如,在这里它能够理解如何翻车或如何与这个巨大的蜘蛛搏斗,或者做一些需要多步或一些逻辑推理的其他非常复杂的事情。最棒的是,如果您滚动到页面顶部,他们已经发布了代码。所以,如果您点击这个 GitHub 仓库并向下滚动一点,这里包含了如何在您的计算机上下载和设置它的所有说明。总之,所有链接都在这里。所以,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,阿里巴巴的通义实验室继续发布一些非常酷的东西。这个叫做 Flashportrait,它可以生成无限长度的肖像动画视频,速度比以前的方法快六倍。所以,这里有一些供您参考的例子。您只需要一张角色的参考图像,然后您可以表演一个场景或上传任何其他参考视频,它就会将他们的面部动作映射到这个新角色上。正如您所看到的,这个视频非常长,但这个角色在整个视频中都保持一致。而且,参考图像和参考视频的视角不同也没关系,它仍然能够非常准确地将她的动作映射到新角色上。这里是另一个供您参考的例子。现在,请注意,这主要是像面部和头部转移。所以,它实际上并没有转移这个参考视频的整个身体动作。所以,它主要是用于像会说话的虚拟形象视频。这里是另一个供您参考的例子。正如我所说,这个可以制作无限长度的视频。所以,就像这个视频超过一分钟长。正如您所看到的,角色在整个过程中都保持一致。这里是另一个例子,原始参考视频在左边。正如您所看到的,她的表情非常微妙,但总的来说,它能够相当准确地将这些面部表情转移到新角色上。它不像原始视频那样夸张,但仍然非常好。现在,如果您将其与其他肖像动画工具进行比较,例如 Live Portrait、Hunan Portrait、Fantasy Portrait 或 Juan Animate,这些工具我都在我的频道上介绍过,请注意,对于 Live Portrait 等一些工具,它们仅限于几秒钟的动画。然后对于其他工具,虽然您可以尝试生成更长的视频,但角色会随着时间的推移而严重变形。例如,对于 Fantasy Portrait,您可以看到随着视频生成得越来越长,它只会变得越来越糟。然后,正如您现在看到的,exportrait 开始变得相当糟糕。现在,让我快进一点。正如您所看到的,即使是 Hunyan Portrait 和 One Animate 现在也开始看起来相当糟糕了。生成过程中有很多噪音和伪影。但是正如您在右下角看到的这个新的 Flash Portrait,在如此长的视频之后,角色仍然保持一致。这里是另一个供您参考的例子。请注意,您可以上传一个参考视频,它不必与您的角色图像的视角相同。所以,这个人只是在弹吉他,但它仍然能够只将她的面部动作转移到角色图像上。而且,当我们快进时,请注意,像 Fantasy Portrait 这样的其他一些竞争对手已经开始看起来相当糟糕了。就像它甚至不像那个角色了。最棒的是,如果您滚动到页面顶部,他们已经发布了代码。所以,如果您点击这个 GitHub 仓库并向下滚动一点,这里说他们已经发布了推理代码和训练代码。此外,他们还计划将来发布这两种推理代码。如果您向下滚动一点,这里包含了如何在您的计算机上下载和设置它的所有说明。如果您向下滚动到这里,它说对于这个分辨率下每秒 25 帧的 10 秒视频,如果您在代码中添加这个顺序 CPU 卸载标签,那么它只需要大约 10 GB 的 VRAM。所以,请记住这一点。总之,所有链接都在这里。所以,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,这个人工智能非常有用。所以,如果您曾经拍过一张不理想或失焦的照片,这个名为 Generative Refocusing 的人工智能可以帮助您之后轻松修复它。例如,您可以拍摄任何照片并调整相机的焦点。例如,在这里我们正在向前和向后调整焦点。或者这里是另一个例子。所以,您可以选择拍摄一张现有照片并将其重新聚焦到任何角色或对象上。这里是另一个例子,我们可以选择聚焦于这张图像的不同部分。现在,除了调整照片的焦点外,您还可以调整光圈,或者基本上图像中有多少部分是聚焦的。所以,例如,如果我们减小光圈,那么更多的图像就会聚焦。而如果我们增加光圈,那么背景就会变得模糊,或者换句话说,景深就会变浅。所以,这取决于您想要的效果。如果您想要电影般的效果,那么您可以模糊背景。这里是另一个例子,我们可以选择让背景稍微模糊一点,就像这样。如果我们模糊背景,那么它看起来会更具电影感和专业感。或者您也可以反过来。假设这是您的输入照片,只有这个女孩是聚焦的,但您也想让每个人都聚焦。好吧,您可以将其通过这个人工智能处理,然后这就是您得到的结果。非常简单。或者这里是另一个例子,它非常模糊。基本上,只有她的手是聚焦的,但您可以将其通过这个人工智能处理,并让它重新生成场景,让其他所有东西都更聚焦。这是一个非常典型的例子,前景中的那个男人失焦了,因为,嗯,他离相机太近了。好吧,我们可以通过再次将其通过这个人工智能来解决这个问题。这就是我们得到的结果。现在,这张照片也非常好,但假设您实际上想从这张图像中去除模糊。好吧,我们可以将其通过这个人工智能处理。这就是我们的结果。它能够在保持女孩一致性的同时为场景添加更多细节。最棒的是,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里包含了如何在您的计算机上下载和运行它的所有说明。他们没有提到 VRAM 的要求,但如果我点击 hugging face 仓库,看起来一切都只有 2.6 GB 大小,所以它相当轻量级。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。此外,本周,Alibaba Quen 发布了他们最新版本的 Quen ImageEdit。所以,这个叫做 Quen ImageEdit 2511,它本应在 11 月 25 日发布,但看起来他们推迟了一个月。现在,如果您不熟悉 Quen ImageEdit,这就像是您可以使用的一个最好的开源图像编辑器,而且是离线的。它有点像 Nano Banana,所以您只需提示它按照您想要的方式编辑现有图像。而本周,他们发布了一个更新的、更强大的版本。在这里,他们声称它改进了角色一致性。所以,如果这是您的输入图像,好吧,您可以生成这个角色在一个圣诞快乐的海报上,就像这样。请注意,她确实看起来像原始照片。或者这里是另一个例子,您可以生成一个包含不同表情和姿势的卡片网格,并且它能够很好地处理这一点。这里是另一个例子,我们可以将两张参考照片放在一起。所以,我们可以让这个人抱着这只猫,这就是我们得到的结果。真正棒的是,他们还决定将 Quen ImageEdit 前一个版本的一些流行 Lora 直接集成到这个新的基础模型中。所以,例如,有一个非常有用的重新照明 Lora,它允许您调整场景的照明。好吧,这个新的 Quinn Image Edit 已经内置了这种能力。所以,您可以拍摄这张原始照片,并将场景重新照明成这样。或者这里是另一个例子,我们可以拍摄这张照片并像这样增强照明。另一个非常流行的 Lora 是这个新颖的视图合成,它基本上允许您拍摄一张现有照片并生成该场景的不同视角。所以,例如,您可以让它放大,这就是您得到的结果。或者如果这是您的原始图像,好吧,您可以提示它生成一个正面视图,这就是您得到的结果。而且,就像以前的 Quinn Image Edit 一样,它在微编辑图像中的内容方面也做得很好。例如,您可以轻松地拍摄这张图像并将汽车的颜色更改为灰色,就像这样。或者您可以轻松地拍摄这张照片,然后这张包含新木纹的参考照片,并将其应用于桌子和椅子,这就是您得到的结果。或者这里是另一个例子,我们可以将这个图案应用于这张椅子。这就是我们的结果。而这个新的 Quinn ImageEdit 2511 的性能确实比以前的版本 259 有明显提高。所以这里有一些例子。假设我们输入这张图像作为参考图像,并且我们想将她的姿势改变成这样。好吧,这是两个模型之间的比较。对于第一个姿势,两者看起来都很好。但对于第二个姿势,这里是旧模型开始显示更多错误的地方。而对于这个新模型,请注意,她的姿势与 Federer 保持一致。然后同样对于这个姿势。请注意,旧模型并没有真正很好地处理这一点,而新模型处理得好得多。同样对于这个测试,如果我们想组合这两个角色,请注意,旧模型实际上并没有非常一致地描绘出动漫女孩,而这个新模型则好得多。总之,Quen Image Edit 有很多非常有用的功能。正如我所说,这是您现在可以使用的最佳开源图像编辑器。而且最棒的是他们已经发布了它。所以,我正在使用他们的 hugging face 空间。这里是您可以下载和使用 Quen ImageEdit 的地方。请注意,已经有一些量化或 gof 版本可以在较低的 VRAM 上运行。所以,例如,这里有一个 Unsloth 的 hugging face 仓库。如果您点击文件和版本,正如您在这里看到的,这个 2 位版本甚至可以舒适地运行在 8 GB 的 VRAM 上。总之,一切都在这个页面上。所以,如果您有兴趣进一步阅读,我将在下面的描述中链接到这一点。接下来,这个人工智能非常酷。它叫做 IMC Cam,它允许您拍摄一个现有视频,正如您在中心看到的,但这个人工智能可以改变摄像机的移动或视角来生成场景的新视频。所以,例如,您可以让它向上、向下、向左、向右平移,或者放大和缩小,或者环绕,基本上重新创建这个场景,但摄像机以不同的方式移动。所以,这里有一些其他供您参考的例子。再次,中心视频是原始视频,您可以重新创建这个场景,摄像机进行平移或缩放或其他任何操作。请注意,它如何在所有这些生成中保持角色一致性和表情。即使这是一个相当棘手的场景,这里是另一个供您参考的例子。请注意背景中的胸部装饰和文字。它也能够跨生成保持所有这些细节的一致性。所以,快速地,这是它的工作原理的架构。所以,它会接收您的源视频和您的提示,并通过这个扩散变换器模型运行,这是所有顶尖视频生成器背后的骨干。但此外,他们还添加了这个非常特殊的同质性引导的自注意力块。这有助于模型使用相机几何来随着时间的推移正确地对齐视频帧。这确保了像角色、物体及其表情这样的所有内容都逐帧对齐。然后它还有一个看起来像这样的扭曲模块。这通过将相机运动分解为两个步骤,旋转和翻译,来简化相机运动。最终,这会导致生成的视频中更准确、更平滑的相机运动。总之,这里有一些与其他竞争对手的比较供您参考,例如 Recam Master 和 Trajectory Crafter,我之前在我的频道上介绍过。请注意,这个新的一个在左下角,而地面真实情况在底部一行。正如您所看到的,这个新的 INF Cam 是在重新创建这个场景使用这些不同的相机视角方面最准确的一个。这里有一些定量基准供您比较。粗体值是最佳分数。正如您所看到的,这个新的一个在所有这些不同的基准测试中都优于其他竞争对手。如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。所以,如果您点击这个按钮,然后向下滚动一点,请注意,他们已经发布了训练代码和推理代码以及模型。所以,这里是如何在本地下载和运行它的所有说明。然而,请注意,这里说您需要超过 50 GB 的 VRAM 才能运行它。所以,您需要 48 GB 的内存用于这个 Uni-epth 工具,然后 28 GB 用于 Infam 管道。然而,由于它是开源的,将来可能会有一些量化或更压缩的版本。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。在人形机器人新闻方面,我们有一个新的 Uni Tree 演示,非常令人印象深刻。所以,这是一个遥操作演示。换句话说,人类基本上是在几乎实时地复制这个人类的动作。机器人是,哦,你没料到吧?这实际上是这个视频的亮点。但开个玩笑,这仍然非常令人印象深刻。就像,机器人基本上是在几乎实时地复制这个人类的动作。特别令人印象深刻的是,他没有佩戴任何笨重的 VR 头显或任何笨重的运动追踪设备,就像我们以前的演示一样,但他仍然能够几乎实时地遥操作这个机器人。机器人能够非常自然而平稳地镜像这个人类的全身动作,同时保持平衡。而且,您知道,他可能故意踢了他的蛋蛋。这可能是一个迹象,表明 AGI 来得比您想象的要快。但总之,随着这项技术的发展速度,我认为我们很快就会在现实生活中看到真实的钢铁侠,我们将拥有人类远程操作这些机器人在格斗比赛中。或者也许像建筑业或任何其他体力要求高的工作可以被这些机器人取代,由机器人实际完成工作,但由人类在幕后远程操作它们。在我的频道上,我介绍了太多不同的 AI 模型和工具,可能会让人不知所措。如果您可以在一个平台上使用所有这些模型怎么办?这就引出了 Abacus AI 的 Chat LLM,这是本视频的赞助商。Chat LLM 是一个一体化平台,供您使用最好的 AI 模型。您可以在您的聊天中无缝切换不同的模型。此外,您还可以使用所有顶尖的图像生成器以及顶尖的视频模型,所有这些都在一个集成平台中。而且它们通常在模型发布后很快就会添加到它们的网站上。此外,如果您正在编写代码,它们有一个非常有用的工件功能,这样您就可以并排预览您的生成。此外,它们还有一个深度代理功能,可以自主完成一些非常复杂的任务,例如创建 PowerPoint、网站和研究报告。它将极大地提高您的生产力。最棒的是,您只需每月 10 美元即可访问所有这些 AI 模型以及图像和视频生成器,以及 Deep Agent。这比单独支付每个工具的费用要便宜得多。一定要在下面的描述中查看带有 Deep Agent 的 Chat LLM。此外,本周,Bites Dance 发布了这个名为 Storymen 的新人工智能。它能够通过记住故事早期发生的事情来创建更长的电影式视频,从而使角色和场景在多个镜头中保持一致。这里有一些例子。所以,这里有一个包含多个镜头的视频示例,这些镜头在下方标记。正如您所看到的,背景和角色在这些不同的镜头中大部分时间都保持一致。所以,这是它的工作原理。它会首先使用一个常规的扩散变换器模型生成一个视频,然后它会从这个生成的视频中选择一些关键帧,然后将其插入到它的内存库中。这就像跟踪到目前为止视频中的所有场景和角色。然后这个内存库将作为输入,除了您的提示之外,再次被插入。所以,它可以生成与先前视频一致的下一个场景。最棒的是,如果您滚动到页面顶部,他们已经发布了代码。如果您向下滚动一点,这里包含了如何在您的计算机上下载和运行它的所有说明。请注意,这是基于 one 2.2. to 14B 的。总之,所有链接都在这里。所以,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,这个人工智能非常强大。它叫做 RICO,代表着区域约束上下文生成。这基本上是视频的 Nano Banana。您可以使用文本提示来微编辑现有视频。这里有一些例子。左边是您的原始视频,您可以提示它将男人替换为卡通企鹅。这就是您得到的结果。或者您可以在这里将女人替换为一只白色的天鹅,这就是您的结果。或者,您不必仅仅替换整个角色,您也可以微编辑现有角色。例如,您可以将他的黑色绒帽换成一个大而蓬松的白色毛皮帽子,这就是您得到的结果。或者您可以将这个机器人车辆替换为一辆白色吉普 SUV,这就是您的结果。它也非常擅长理解视频中的内容。所以,即使场景中有两个角色,它也知道您只想将红发女人替换为这个卡通小矮人。而这正是它所做的。除了移除或替换内容,您还可以向视频中添加内容。例如,您可以在砧板上添加玉米面包。这就是您的结果。或者您可以在海豹的头上添加一个小金冠。它也相当擅长移除物体。所以,您可以像这样完全移除海豹。或者您可以移除场景中的女人,而且它做得相当无缝。当然,您也可以轻松地将视频变成不同的艺术风格,只需一个文本提示即可。所以,这里是一个水彩风格的例子。这里是一个 3D 动画的例子。然后这里是一个乐高积木的例子。虽然他们的脸看起来有点吓人。总之,这个页面上有很多例子。为了节省时间,我不会一一介绍,但如果您将其与其他竞争对手进行比较,例如 LucyEdit 或 Ditto,我之前在我的频道上介绍过,似乎这个新的 Rico 在添加、替换和风格化示例方面都做得更好。总之,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果您点击这里进入,他们已经发布了 RICO 基准和评估代码。并且他们计划在 2 到 3 周内发布模型和推理代码,这太棒了。总之,所有链接都在这里。所以,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。此外,本周,我们不仅有一个,而是有两个新的开源模型,它们是顶尖的。所以,第一个是 Minimax M2.1,它在代理编码、多步推理和解决一些非常复杂的任务方面非常出色。正如您从这里的基准分数所看到的,它在 Sweepbench Verified、Multi-SweetBench 和 Sweepbench Multilingual 方面达到了最先进的水平。这些基准测试会测试 AI 模型在不同语言中编码的能力。而且,您知道,疯狂的是,对于这些多语言基准测试,Minimax M2.1 甚至比包括 Claude 4.5、Gemini 3 Pro 和 GPT 5.2 在内的顶尖闭源模型还要好。它在所有这些 Vibe 编码基准测试中也表现出色。所以,这里是我的一些快速测试。我提示它制作一个具有速度提升和碰撞物理效果的 3D 赛车游戏。将所有内容放入一个独立的 HTML 文件中。使用公开可用的资源、模型和效果来制作游戏。只需一个提示,这就是我得到的结果。请注意,它实际上给了我一个赛道,还有其他玩家。而且,如果我将鼠标悬停在这些绿色区域上,它确实会给我一个速度提升。我还可以看到赛道以及我在右下角的位置。这真是太令人印象深刻了。我一直用所有顶尖模型测试这个提示,没有一个模型能够零次尝试就创建一个完整且可运行的赛车游戏,而且还有多个玩家。但 Minimax 仅用一个提示就做到了。这太不可思议了。或者这里是另一个非常棘手的提示,我测试了所有顶尖模型。制作一个蜂巢建造的视觉模拟,显示六边形细胞形成工蜂路径和蜂蜜储存。包含用于蜂群大小和资源可用性的滑块。这就是我得到的结果。首先,动画看起来确实很漂亮。就像蜜蜂真的出去觅食一样。一旦它们获得花粉,请注意,蜜蜂身上有一个额外的橙点。而且蜜蜂,您知道,确实会飞回蜂巢,在那里它们会用蜂蜜填充蜂房。这真是太酷了。就像 Minimax 的这个动画是我测试过的所有 AI 模型中最详细的一个。现在,这里有一些错误,比如蜂房没有正确对齐。所以,我确实需要,您知道,为此扣除一些分数。接下来,让我增加蜂群大小。所以,这也有效。让我增加资源可用性。所以,这也有效。我猜另一个错误是蜂房应该建在现有蜂巢的旁边。所以,它不应该像这样分开。但再次,这是一个非常棘手的提示,到目前为止,几乎没有顶尖模型能够 100% 正确地完成。好了,接下来,我将拖放这个非常复杂的电子表格,其中包含大量财务指标。我让它根据这些数据制作了一个精美而全面的财务报告。在必要时使用交互式图表和图形。这就是我得到的结果。所以,让我打开它。正如您所看到的,这是非常详细和彻底的。所有内容都是交互式的,并且格式精美。甚至还有额外的选项卡,我可以按类别、产品或季度趋势进行过滤。非常好。然后这里有一些额外的图表和指标。这非常好且彻底。然后我可以点击这个详细的财务明细,得到这个。或者我可以点击费用明细,得到这个。一切都正常工作。总之,这些只是我的一些非常快速的初步测试。就代理编码、数据分析和进行一些,您知道,多步推理任务而言,这绝对是一个非常有能力和强大的模型。这里有一些其他供您参考的例子。所以,这个人建造了这个 3D 圣诞树,支持手势交互。所以,她实际上可以通过网络摄像头使用手来控制这个动画。或者这里是一些它编写的精美网站的例子。或者这里是另一个使用 3JS 的 3D 乐高积木构建器的例子,并且所有东西都符合物理原理。最棒的是,您现在可以免费试用。所以,如果您点击这里这个按钮,它会带您到 Minimax 的聊天机器人,它与,您知道,ChatGPT 或 Gemini 非常相似。所以,这里是您输入提示的地方,它应该已经自动是 Minimax M2.1。现在,最棒的是,除了在线运行之外,与以前的 Minimax 模型一样,它们已经开源了。所以,如果您向下滚动这里,这里是 hugging face 仓库的链接。然后这里是如何使用所有这些不同的工具在本地运行它的所有说明。如果我点击这个 hugging face 仓库,请注意,这是 2290 亿个参数。如果我点击文件和版本,请注意,它的大小约为 230 GB。所以我认为您甚至可以在一个 DGX Spark 上运行它。这不适合消费级 GPU。我的意思是,这是最智能的、最先进的开源模型。所以,这更适合那些只想在本地运行模型的企业。但总之,如果这对您有兴趣,那么它们已经开源了,所以您可以直接下载模型在您自己的服务器上运行。总之,所有信息都在这个页面上。所以,如果您有兴趣进一步阅读,我将在下面的描述中链接到这一点。现在,Minimax 并不是本周发布的唯一一个最先进的开源模型。所以,ZAI 也发布了 GLM 4.7,它在代理编码、工具使用和复杂推理方面也同样出色。事实上,如果您查看这些基准分数,它在标准基准测试方面也与 Claude 4.5 和 GPT 5.1 等顶尖模型相媲美,例如竞赛数学、研究生水平的科学问题,甚至人类最后的考试,它在那里的得分最高。这些是来自一些非常晦涩的科学领域的问题。同样对于 SWEBench Verified。这是一个非常有能力的模型,甚至可以与顶尖的闭源模型相媲美。现在,我已经在它刚发布的那一周对其进行了完整的评测视频,在那里我让它创建了一个 Android OS 模拟器。我让它创建了一个 3D 赛车游戏,一个完全工作的 Sim City 游戏,以及一个完全工作的视频编辑器。它在编码方面非常出色。它的错误最少,而且一切都正常工作。我不会在这里重复太多,但如果您还没有看过,请务必观看此视频,以了解 GLM 4.7 可以做的所有很酷的事情。接下来,这个人工智能很有趣。它叫做 Spacia,具有更新的空间记忆的视频生成。这个人工智能基本上可以制作场景随时间保持一致的视频。所以,它会保留场景的 3D 记忆,正如您在左下角看到的,这样长视频就能保持连贯。所以,您可以从原始位置移开,然后又移回该位置,场景将保持不变。所以,这里有更多供您参考的例子。这项技术对于为房地产或其他需要一切都准确无误的地点创建虚拟现实场景将非常有用。现在,由于它基本上生成了一个 3D 世界,您就可以通过添加或删除元素来微编辑这个 3D 世界,就像这样。所以,它也可以作为视频编辑器。或者这里是另一个很酷的例子。如果这是您的原始视频,好吧,它会将其转换为一个 3D 场景,然后您可以提示它向场景添加风暴和雷电,这就是您得到的结果。或者您可以添加一只金毛猎犬在玩耍,这就是结果。或者您可以添加一辆红色跑车,就像这样。总之,如果您滚动到页面顶部,这里是他们 GitHub 仓库的链接。他们还没有发布任何东西,但这里说代码即将发布。所以,希望他们会信守诺言并实际发布代码。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,这个人工智能非常有用。它叫做 MV inverse。它可以拍摄一个场景的单个或多个照片,从不同角度拍摄,然后找出场景中所有事物的内在属性。例如,您可以输入这个房间的多个图像,它可以预测每个物体的反照率,或者基本上是图像中所有颜色的颜色,加上所有事物的光照,加上法线,或者基本上是所有物体表面的方向,加上图像的金属属性以及所有物体的粗糙度。所以,这里是不同场景的一些额外例子。请注意,它如何能够仅凭几张图像就预测所有这些属性。它甚至不必是多张图像。您只需输入一张图像,它仍然可以工作。虽然,当然,如果您添加更多图像,那么它会获得更多数据,其预测也会更准确。这里是您参考的其他一些例子,我们输入了场景的四个视图,它能够,您知道,相当准确地预测所有这些属性。这里是另一个例子,场景非常复杂,有很多椅子和其他物体,但它仍然能够相当准确地获取所有内容。最棒的是,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里包含了如何在您的计算机上下载和运行它的所有说明。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。此外,本周,Bite Dance 发布了一些非常有用的东西,叫做 Dream Montage。它不像仅仅用文本提示创建视频,而是允许您上传多个关键帧来精确控制视频中发生的事情。例如,在这里,如果我们上传这四个关键帧,它们应该分别出现在第 0、5、10 和 15 秒,这个人工智能就能够基本上填补视频的空白,使其与所有这些关键帧匹配。或者这里是另一个例子,我们首先有一个水滴,它应该转化为第二个关键帧,这是一个天鹅,然后第三个关键帧是一个手表,然后在第 12 秒处是第四个关键帧,应该是一朵玫瑰。而这个人工智能能够基本上填补空白,并从这些参考帧生成一个非常流畅连贯的视频。或者这里是一个更棘手的例子,其中帧几乎无关紧要。它以一只大猩猩开始,然后是一个穴居人,然后是一个骑马的骑士。但它能够无缝地融合所有内容,正如您从视频中看到的。或者这里是另一个很酷的例子。请注意第一个提示,我们首先有一个老人,然后我们需要放大他的眼睛,然后有一个男人向前走,出现一只金色的蝴蝶,然后它飞向前完全遮挡镜头,然后切换到这些其他关键帧。这就是结果视频。所以,它确实放大了老人眼睛的特写,然后是这个男人在城市里行走,然后是这只蝴蝶,它飞入镜头,然后是这个男孩在草地上玩耍的场景,然后放大到男孩的脸。非常酷。或者这里是另一个例子,我们可以从这座山开始,然后放大到这个城镇,然后放大到城镇中的一个特定房屋,看起来像这样。或者这里是一个有趣的例子。您知道,过去对于大多数视频生成器,我们确实有开始和结束帧,但这个通过允许您添加中间帧来进一步提升,从而让您对视频如何随时间进展有更多的控制。现在,如果您滚动到页面顶部,他们已经发布了一份技术报告。看起来他们还没有发布任何代码,但您可以尝试使用他们的 Dream in a 平台,通过点击这个新的多帧功能。所以,这里是您可以上传多个帧来控制您的视频的地方。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,这个人工智能也非常有用。它叫做 3D Regen,它拍摄一张室内场景的单张照片,并将其变成一个完整的可编辑的 3D 场景。这意味着它可以创建一个房间的 3D 模型,包括其中的所有对象。您还可以选择每个对象并移动它们或进一步编辑它们。如果您将其与其他 3D 场景生成器进行比较,请注意,这个新的一个(第三列)在捕捉场景中的所有对象和元素方面更加一致。这里是您参考的其他一些例子。它甚至能够相当准确地生成那个非常棘手的吊灯。现在,它也可以处理室外场景,就像您在右下角看到的那样,但质量不如室内场景。现在,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说论文目前正在审阅中。他们计划在 2026 年 1 月底发布代码。总之,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。此外,本周,Nvidia 发布了一个非常有趣的人工智能,叫做 Kari 4D。它可以拍摄一个人与任何物体互动(例如捡起一个球或玩一个玩具)的视频,然后它可以创建场景的 3D 重建,包括人类和物体。所以,它基本上可以在 3D 中重建人和物体,并跟踪他们随时间的移动和互动。现在,这项技术当然对训练人形机器人非常有用。然后我们可以使用人类如何使用和操纵物体的这些 3D 数据,通过强化学习来训练人形机器人的大脑,使其能够做同样的事情。如果您将这种新的 Kari 4D 方法与其他竞争工具进行比较,例如 Viz Tracker,请注意,这个新的方法在错误方面更加一致。或者这里是另一个与另一个名为 Intertrack 的工具进行比较的例子。请注意,与右边的这种新的 Kari 4D 方法相比,它再次出现了更多的错误。这里是另一个供您参考的比较。而且,这个新的 Kari 4D 方法更加准确。顺便说一句,您甚至不必插入一个背景干净的视频。所以,背景可能非常混乱,就像这样,但它仍然能够提取并只检测到人类以及他们正在移动的物体。现在,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说他们计划在 2026 年 1 月发布代码。所以,敬请期待。现在,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。接下来,这个人工智能很有趣。它叫做 Animate Any Character in Any World,简称 Any-X。它允许您基本上将任何 3D 角色放入任何 3D 世界,并使用简单的文本提示来控制他们的行为。它将生成该动作的视频。您可以指定您想要他们做的确切事情,以及可选的相机位置。所以,这里有一些供您参考的例子。我们可以将任何这些 3D 角色放入场景中,让他们像这样奔跑或行走。所以,就像他们现在是电子游戏中的玩家一样。或者这里是放入其他角色但使用相同背景的一些额外例子供您参考。您也可以反过来。所以,您可以输入相同的角色,但让他们在不同的 3D 世界中奔跑,就像这样。它能够无缝地将角色融入场景。现在,您不必只让他们行走或奔跑。您可以使用文本提示让他们做更复杂的动作。所以,例如,在这里我们可以将 Jensen Huang 的 3D 渲染放入这个 3D 世界。只需通过文本提示,我们就可以让他们鼓掌、用掸子掸灰尘、弹奏竖琴或戴着手套玩积木等等。这里是一些更复杂的提示,包含一些额外的物体,如雨伞或举重哑铃、吃一块披萨,但它仍然能够相当好地渲染出来。这里有一些供您参考的更多例子。总之,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里确实说代码即将发布,这太棒了。现在,如果您有兴趣进一步阅读,我将在下面的描述中链接到这个主页。这总结了本周所有人工智能的亮点。请在评论中告诉我您对这一切的看法。您最喜欢哪个新闻?您最期待尝试哪个工具?一如既往,我会密切关注顶尖的人工智能新闻和工具与您分享。所以,如果您喜欢这个视频,请记住点赞、分享、订阅,并继续关注更多内容。此外,人工智能的世界每周都在发生太多事情了。我不可能在我的 YouTube 频道上涵盖所有内容。所以,要真正跟上人工智能领域的所有动态,请务必订阅我的免费每周通讯。链接将在下面的描述中。感谢观看,下次再见。