Transcription
最后,我们有了一个能够生成实际上连贯且一致的长视频的 AI。它是免费、开源且无审查的,并且可以在低 VRAM 下运行。该工具名为 Stable Video Infinity,他们刚刚发布了 2 Pro 版本,它实际上非常出色且无缝。所以,在这个视频中,我将向你展示如何安装它,这样你就可以免费且无限次地离线运行它。别担心,即使你的 VRAM 很低,我也会告诉你如何运行它。让我们开始吧。请注意,Stable Video Infinity 并不是新事物。事实上,在我介绍它的时候,它还在版本 1 发布的时候。但当时,质量并不好,所以我并没有真正为版本一做一个完整的教程。然而,这个刚刚发布的全新 2 Pro 版本实际上非常出色,正如你从这些演示中看到的那样。现在,它是这样工作的。它实际上使用了阿里巴巴的 one 2.2,这是目前最好的开源视频模型。它也是最无审查的,它使用它来生成多个 4 到 5 秒的片段,这是最佳时长,然后它会将所有这些片段粘合在一起,创建你最终的长视频。这里的诀窍是,每个片段都必须与前一个片段无缝衔接。而 SVI 版本二能够很好地做到这一点。请注意,如果你尝试单独使用 one,你可以将时长设置为更长,比如 20 或 30 秒。但大约四到五秒后,视频就会开始明显劣化。现在,过去有各种工具可以使用一个片段的最后一帧作为下一个片段的第一帧,以此类推。然后它也可以将它们缝合在一起,就像 Stable Video Infinity 一样。然而,过去,你经常会遇到两个主要缺陷。第一个是过渡不那么无缝。所以,你可以很容易地分辨出一个片段何时切换到下一个片段。另一个主要问题是,视频越长,你得到的错误、噪点和失真就越多,比如在 20 或 30 秒时,质量就会显著下降,一致性也会荡然无存。这就是为什么你需要 Stable Video Infinity。这个新版本解决了所有我刚才提到的问题。你可以看到,当我播放这些视频时,很难分辨出我们何时从一个片段切换到下一个片段。过渡非常无缝。请注意,这里写着,“这个新的 2 Pro 版本产生了更具动态性和自然感的运动。此外,它似乎对场景中的所有角色和事物都有记忆。”所以,即使你移开镜头或切换到另一个场景,然后又切回来,场景中的角色和所有其他事物都保持相同的外观。正如你从这些例子中看到的,一切都变得更加视觉上的一致。这里是另一个很好的例子,我们可以硬切片段,但角色和场景在整个视频中保持不变。好了,以上就是 Stable Video Infinity 2 Pro 版本的一些快速演示。接下来,我将一步一步地向你展示如何在你的电脑上安装和运行它。它是免费开源的,即使只有 6 GB 的 VRAM 也能运行。另外请注意,我将向你展示如何使用 Comfy UI 来运行它,这是运行开源图像和视频模型最流行的平台。如果你不熟悉 Comfy UI 或者还没有安装它,请务必先观看这个安装教程。我会在描述中提供链接。总之,从现在开始,我将假设你已经有了 Comfy UI。第一步是我们需要安装 KJ 节点。如果你之前已经安装了 KJ 节点,可以跳到下一部分。我会在描述中提供此页面的链接。这里是所有安装说明。所以,首先在 Comfy UI 中,请注意我使用的是 Windows 便携版,这是推荐的安装版本。我们需要进入 Comfy UI,然后是 custom nodes。然后在这里的顶部,只需输入 cmd 即可在命令提示符中打开此文件夹。然后之后,我们只需要克隆这个仓库。所以,在这个页面的顶部,只需点击这个绿色的代码按钮,然后复制这个 URL。然后回到我的命令提示符中,我将输入 git clone,然后在此处粘贴 URL。现在,如果这是你第一次安装,那么这个函数基本上会做的是,它会自动在你的 custom nodes 文件夹中下载这个 KJ nodes 文件夹。如果你打开它,它将包含你在 GitHub 仓库中看到的所有文件和文件夹。现在,如果你像我一样,之前已经安装过这个,那么你不需要执行此步骤,因为它只会说此文件夹已存在。下一步是安装这些节点所需的所有依赖项。所以我可以退出这个命令提示符。接下来,让我回到根目录的 Windows 便携版文件夹。然后再次在这里的顶部,只需输入 cmd 即可在命令提示符中打开此文件夹。然后我只需要复制并粘贴此处的这一行,如下所示。如果你还没有安装这些,它应该会继续安装所有这些要求。然后之后,你应该会看到这条线再次出现,没有任何错误消息。这基本上就是如何安装 KJ 节点。接下来,我们可以继续打开 Comfy UI。所以,让我很快地打开它。好的。打开 Comfy UI 后,第一步是实际点击 manager,然后点击 update Comfy UI,以确保你的 Comfy UI 是最新的。所以,让我们点击 update,然后点击 restart。好的,重启后,下一步是下载 stable video infinity 工作流。现在,工作流目前相当隐藏。所以,事实上,我将直接在描述中提供工作流文件的链接,你可以在那里直接下载。但基本上,我将使用这个链接。所以,一旦我点击它,它会提示我下载这个 JSON 文件,你可以将其保存在任何你想要的地方。我将把它保存在我的根目录的 comi 文件夹中。好的。现在,Comfy UI 的好处是你实际上不需要从头开始构建任何节点和连接。你只需将预构建的工作流拖放到你的界面上即可。所以,我将把刚才下载的 JSON 文件拖放到这里,就像这样。然后我们得到这个。现在,这可能看起来很复杂,但别担心。我将一步一步地讲解。在我们开始运行它之前,我们需要下载一些额外的模型才能使其正常工作。所以,基本上,在这个蓝色区域,我们需要确保我们下载了所有这些模型。所以,让我们逐一来看。首先,我们需要下载 one 2.2。请注意,你需要下载两个不同的变体才能使其正常工作。有一个高变体和一个低变体。至少对于这个工作流来说,你需要 imagetovideo 版本。所以,我将在描述中提供这个页面的链接,这里有一些 slightly compressed FP8 版本的 one 2.2。所以,在这个文件夹中,你只需要查找 one 2.2,然后是 image to video。然后对我来说,我将选择这个 E4 版本。所以,请注意我需要下载这个高版本和这个低版本。请注意,每个版本的大小为 15 GB。所以,如果你想使用这个 FP8 版本,那么你需要大约 16 GB 的内存来运行它。但别担心,我稍后也会在视频中告诉你,即使你的 VRAM 更低,如何运行它。总之,对我来说,我将点击下载。这会进入 comfy UI 的 models 文件夹,然后是 diffusion models。然后我也会选择这个低版本,然后点击下载。这也进入 comfy UI 的 models 文件夹,然后是 diffusion models。让我们点击保存。好的。所以,在我下载完之后,让我按 R 刷新我的模型列表。然后在这里,我可以从下拉列表中选择我刚刚下载的模型,也就是 one 2.2 I2V high。所以,顶部区域是高版本模型,底部区域是低版本模型。所以,我将再次点击这个下拉列表,然后选择 12.2 to ITV low。下一步是可选的,但强烈建议你下载这个 light X2V Laura,它基本上可以将你的视频生成速度提高四到五倍。所以,我将链接到这个页面,你可以在那里下载这些 light XTV Loras。所以,在这个页面上,我们再次查找 12.2 I2V,并且会有一个高版本和一个低版本。所以,让我们下载这两个。请注意它们的大小。所以我将先下载高版本。这会进入 Comfy UI 的 models 文件夹,然后是 Loras。然后我将对低噪声版本做同样的事情。所以,让我点击下载。这也会进入 Comfy UI 的 models 文件夹,然后是 Loras。让我们点击保存。好的。之后,让我再次刷新我的模型列表。然后在这里,我可以选择我刚刚下载的,也就是这里。High noise light XTOV。然后在这里,我也将选择低噪声版本,也就是这个。好的。最后一步是下载 stable video infinity version 2 pro 模型。同样,这些模型分为高版本和低版本。你需要下载两者。所以,我将在描述中提供这个页面的链接。这里是你可以下载 2 Pro 版本的高版本和低版本模型的地方。请注意,每个模型的大小为 1.23 2 3 GB。所以,让我点击下载。这会进入 Comfy UI 的 models 文件夹,然后是 Loras。让我对低版本也做同样的事情。所以,我将点击下载。这也会进入 models 文件夹,然后是 Loras。让我们点击保存。好的。之后,让我再次按 R 刷新我的模型列表。然后在这里,我可以选择 SVI version 2 Pro high。然后在这里,我将选择 SVI version 2 Pro Low。然后之后,我们需要下载两个额外的东西。如果你一直在玩 one,那么你应该已经有了这些文件。但如果你没有,让我告诉你如何找到这个 clip 文件。所以,我们需要下载这个 UMT5 XXL FP8。它位于 KJ 的 one video company 文件夹中。如果我一直滚动到底部并点击 load more files,你就可以看到这个 clip 模型就在这里。它的大小为 6.7 GB。让我们点击下载。这会进入 Comfy UI 的 models 文件夹,然后是 text encoders。然后之后,我们还需要下载 VAE,如果你还没有的话。请注意,它使用的是 1 12.1 而不是 12.2。总之,它也位于同一个文件夹中。所以你可以下载这两个中的一个。这个稍微压缩一些,大小减半。所以我将选择这个。所以,让我们点击下载。这会进入 comfy UI 的 models 文件夹,然后是 VAE。让我们点击保存。好的。之后,让我再次刷新我的模型列表。然后对于这个 clip text encoder,我将选择我们刚刚下载的那个。然后对于 VAE,我将选择我们刚刚下载的这个。这就差不多了。我们已经加载了运行此工作流所需的所有模型。我一直在探索大量的不同 AI 工具,但你可以使用的最强大的平台之一绝对是 GenSpark,这是本视频的赞助商。它正在成为全能的 AI 工作空间独角兽。能够处理研究、报告、幻灯片、完整的网站构建、自动化,甚至电话呼叫。以下是我让它生成的一些令人惊叹的东西。你可以使用这个 AI 开发人员代理来创建完整的全栈应用程序或网站。对我来说,我将选择一个简单的,然后提示它创建一个漂亮的交互式 CRM 仪表板,提供对销售、客户参与和营销活动的见解。看看它有多漂亮。一切都是交互式的,一切都正常工作。或者,我可以使用这个 AI 设计师代理轻松创建营销资产。例如,我可以将这些产品图片拖放到这里,让它制作像这样的闪购海报。它能够非常快速地创建大量不同的海报,而无需我手动设计任何东西。或者,我可以使用这个 AI slides 代理,让它创建一个关于泰国顶级旅游目的地的幻灯片。这是幻灯片。一切看起来都很漂亮,而且事实准确。此外,他们刚刚添加了一些新功能,包括一个 AI 收件箱,你可以让 AI 管理你的电子邮件。例如,我可以轻松地让 AI 使用自然语言回复供应商,或者我可以创建 AI 代理来自动运行计划任务。他们还添加了一个 AI 团队功能,所以你可以轻松邀请团队成员一起聊天和处理项目。这是你可以使用的最强大的代理 AI 平台。一定要试试 GenSpark。注册是免费的,你还可以获得免费积分开始使用。此外,Pro 和 Plus 用户还可以享受无限的 AI 聊天和 AI 图像功能。链接将在下面的描述中提供。好的,之后,让我们来看看如何运行这个工作流。所以,在这里,你将上传一张初始图像作为第一帧。例如,我将上传这张女孩学习的图片。接下来,它会通过这个节点,我们在这里设置最终视频的宽度和高度。所以,请注意,即使我的原始图像是这个尺寸,如果我将其设置为 640x640 并将其设置为 crop,那么它基本上会将其裁剪成正方形,就像你稍后会看到的。然后之后,它会被输入到第一个组件来生成第一个视频,大约 4 到 5 秒。这里是我们输入提示的地方。所以,例如,让她的看向镜头并微笑。事实上,这里的每个块都是一个压缩循环,用于生成一个视频。我可以点击这个按钮来实际展开工作流。如果我稍微放大一点,这里就是使用 one 的基本的,你知道的,imagetovideo 工作流。总之,这里有一些你可以调整的附加设置,比如视频的长度。所以,现在这是 81 帧。你也可以调整 CFG,它决定了 AI 应该有多具创造性或多严格地遵循你的提示。要返回父工作流,我们只需要点击这里。所以,基本上,它使用 one 来生成一个大约 4 到 5 秒的片段,然后这个片段会被传递到下一个块,它再次使用 one 来生成下一个片段。所以,接下来,让她的喝一杯水。顺便说一句,请注意,这两个输出连接到这两个输入。所以,正在发生的是,它基本上从最后一个片段中提取一些样本来指导下一个片段如何生成视频。总之,这是第二个片段。接下来,我们可以重复这个过程来生成第三个片段。在这里,让她站起来然后走开。然后之后,它基本上会将这三个视频粘合在一起,生成你的最终视频。请注意,我们需要将其分解,而不是一次性生成一个 15 秒的片段,因为那样会花费更长的时间和更多的计算资源。如果我们将其分解成每个 5 秒的片段,那么它实际上效率更高。总之,让我们按下运行。好的,这是我们得到的结果。所以,请注意,首先她看向镜头,然后她微笑,然后接下来她喝这杯水,然后她站起来走开。请注意,它非常无缝。就像,真的很难分辨出它何时从一个片段过渡到下一个片段。这就是这个新的 SVI 版本 2 Pro 的魅力所在。一切都变得更加自然和无缝。现在,如果我将这个输出节点拖到这里,请注意,因为我将其设置为 640x640,它基本上会将原始图像裁剪成正方形。视频的输出是 640x640。如果你想保持相同的尺寸,那么你可以在这里输入尺寸,比如 1365x768。有一点需要提到的是,默认工作流只有这三个模块。所以,它基本上生成三个片段,然后将它们粘合在一起。如果你想生成更多怎么办?嗯,你绝对可以做到。方法如下。首先,让我们断开最后一个节点。然后,让我们将它移到这里。你可以基本上复制粘贴任意数量的这些,并将它们串联起来。所以,例如,我将按住 Ctrl,然后拖动这些节点,然后按 Ctrl+C 和 Ctrl+V 将它们粘贴到这里。然后让我将它移到这里。然后接下来我只需要将前一个块的 samples 输出连接到这个新块。然后对这个 extended images 输出也做同样的事情。这就差不多了。所以,你可以继续串联任意数量的这些块,但完成后,请确保将这个 extended images 输出连接到这个 video combined 节点,就像这样。理论上,我的意思是,你可以创建超过一分钟的视频,这需要大约 12 个这样的块。但同样,Stable Video Infinity 可以很好地处理这个问题。它能够保持场景的一致性,而这个新的 2 Pro 版本使过渡非常无缝。好了,接下来让我们来看看使用这个工作流时需要注意的一些额外事项。首先,让我来介绍一些你可能会遇到的常见错误。现在,对于这两个节点,请注意,对于这个 sage attention 设置,它被设置为 auto。所以,如果你没有设置这个叫做 sage attention 的加速方法,它应该会自动不使用它。但万一你看到关于 sage attention 或 triton 的错误,那么你可以明确地将其设置为 disabled,就像这样。确保对高版本和低版本节点都这样做。另一个你可能会看到的常见错误是它缺少 KJ 节点中的这个 one imagetovideo SVI pro 节点。这意味着你要么没有安装 KJ 节点,在这种情况下,你可以参考本视频的早期部分,我将介绍如何安装 KJ Nodes,或者这可能意味着你有一个旧版本的 KJ Nodes,在这种情况下,你需要更新它。更新它非常容易。你只需要点击 manager,然后点击 custom nodes manager,然后在这里搜索 KJ Nodes。你需要更新或安装这个。所以,在安装或更新 KJ 节点后,一旦你重启或刷新页面,你应该就不会再看到缺少节点的消息了。然后你可能会遇到的另一个常见错误是关于未安装 PyTorch 2.7.1,然后无法使用 FP16 accumulation。这是我的错。我一直在拖延,还没有安装 PyTorch 2.7.1。所以,在这种情况下,我需要将这个设置改为 false,就像这样。并确保对这个低版本节点也这样做。这应该可以帮助你绕过该错误消息。接下来,因为这个工作流使用的是 one,这是目前你可以使用的最好的开源视频生成器。这意味着你可以利用所有为 one 构建的超棒的 Loras 和插件。例如,你可以去 Civot AI 搜索与 1 2.2 兼容的 loras。正如你在这里看到的,有很多不同的 Loras 可供选择,无论你想到什么效果、相机运动、角色或艺术风格。例如,有一个可以帮助你创建复古动漫。另一个可以创建毛茸茸的视频。另一个可以创建无脸神。这个 Laura 是用来向某人脸上扔东西的。或者你可以使用这个 lura 让某人情绪崩溃。顺便说一句,如果你还不清楚,one 是非常无审查的。所以,也有适用于你所能想到的每种癖好、姿势或动作的 luras。我们就此打住。总之,如果你想在工作流中添加额外的 luras,那么你只需要为这个高版本和低版本部分添加一个额外的 Laura loader 节点。要做到这一点,你可以点击其中一个,然后复制粘贴它。然后基本上将其放在这里。然后我将把这个输出连接到这个输入。然后这个输出连接到这个输入。然后在这里,你可以选择你的 Laura 的高版本。然后我们还需要为这里做同样的事情。这里有一个快捷方式。我也可以按住 Alt 键并拖动这个节点来立即复制它。然后再次,让我们将其放在中心位置。然后将这个输出连接到这个输入。然后这个输出连接到这个输入。然后在这里,我可以选择我的 Laura 的低版本。如果你想添加额外的 Loras,你只需要在这里串联另一对 Lura loader 节点。好了,以上就是如何使用这个工作流与这个 FP8 版本的 1 2.2。但正如我之前向你展示的,即使是这个 FP8 版本也大约有 15 GB 大小。如果你 VRAM 更低怎么办?嗯,幸运的是,这个工作流也适用于一些更压缩的 one 版本,称为 GGUFS,它们可以适应更低的 VRAM。所以,让我们来看看如何在工作流中使用这些 GGUFS。我将在描述中提供 Quanstack 的这个页面链接,他们为 12.2 image to video 创建了一些 GGUFS。所以,在这里,请注意,因为它是 1 2.2,你需要下载高噪声和低噪声模型。让我们先点击高噪声。然后在这里,你可以从所有这些不同的版本中选择。最压缩的是 Q2,它只有大约 5.3 GB。所以,你甚至可以轻松地将其装入大约 6 GB。或者如果你有 8 GB,你可以运行这个 Q3 版本。如果你有 12 GB,你可以运行 Q5 或 Q6。所以,对我来说,作为一个快速的例子,我将下载这个 Q6 版本,它有 12 GB。让我们点击下载。这会进入 comfy UI 的 models 文件夹,然后是 unit。所以,这是高噪声的 Q6 版本。我还需要回到上一个文件夹,下载低噪声的 Q6 版本。所以,让我向下滚动到这里,然后下载这个。这也会进入 comfy UI 的 models 文件夹,然后是 unit。让我们点击保存。好的。之后,让我们再次按 R 刷新我们的模型列表。然后这里是如何使用这些 ggufs。首先,在画布上任意位置双击,然后搜索 unit。我们需要使用这个 unit loader。所以,让我们点击它。顺便说一句,如果你没有这个 unit loader,你需要点击 manager,然后点击 custom nodes manager,然后搜索 gguf。你需要下载这个,comfy ggf by city 96。安装后,你应该就可以使用这个 unit loader 节点了。总之,在 model 下拉菜单中,我将选择这里的高噪声版本。这个节点基本上会取代这个节点。所以,我将把它连接到这里,它应该会自动断开这个。所以,这是高噪声版本。我也需要对低噪声版本做同样的事情。所以,再次,我将在这里任意位置双击,然后输入 unit 并选择它。然后在这个 model 下拉菜单中,我将选择低噪声版本,然后再次将节点连接到这里,它应该会自动断开这个。这就差不多了。工作流的其余部分与之前相同。好了,以上就是我对 stable video infinity version 2 pro 的评测。如果你想生成多个动作或场景的连续长视频,这是目前最一致、最高效的选择。一定要试试,并告诉我你的想法。如果你在安装过程中遇到任何错误,欢迎在评论区粘贴错误消息,我会尽力帮助你解决问题。一如既往,我会密切关注顶级的 AI 新闻和工具与你分享。所以,如果你喜欢这个视频,请记得点赞、分享、订阅,并继续关注更多内容。另外,AI 领域每周都有太多事情发生,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要想真正跟上 AI 的所有动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。感谢观看,下次再见。