Transcription
女士们,先生们,我们有一个新的免费开源图像生成器,它速度极快,甚至可以用低至 2GB 的显存运行,或者只用 CPU 运行。它叫做 Flux 2 Klein。在这段视频中,我将把它与市面上顶级的图像模型进行正面比较测试,这样您就可以看到它有多好。当然,我还会一步一步地教您如何安装它,这样您就可以在您的电脑上免费、无限次地离线使用它。让我们开始吧。
Flux 背后的团队在上一轮被 Zimage Turbo 打败了,但今天他们发布了 Flux 2 Klein,这是一个强有力的竞争者。您可以在几秒钟内生成图像,即使只使用消费级 GPU。所以,这里有一些例子供您参考。它在生成这些逼真的照片方面做得非常好。这是另一个例子,它似乎能很好地处理,你知道的,脸部、皮肤、手和手指。这是另一张非常逼真的业余照片。您可以看到,我们不再从 Flux 模型的前几代产品中看到那种塑料感十足的虚假 Flux 氛围。这看起来超级逼真。这张照片甚至还有一些运动模糊和一些不完美之处。真的很难分辨出这是 AI 生成的。这是另一个例子供您参考。手和手指看起来都很正确。这看起来非常逼真。
不仅如此,它还可以处理动漫,正如您在这里和这里看到的。现在,Flux 2 Klein 的绝妙之处在于,它不仅是一个图像生成器,还可以像 Nano Banana 一样编辑图像。所以,例如,我们可以把这个人变成气球,像这样。或者这里是另一个例子,我们可以编辑这只斑马,让它变成这样或那样。
他们发布了两个不同的变体。有一个 90 亿参数的模型,它当然更大,质量也更好,但运行起来会更慢。这属于 Flux 非商业许可。所以,它相当有局限性。但他们也发布了一个 40 亿参数的变体,它速度快得多,并且属于 Apache 2 许可,该许可的限制非常少。您甚至可以将其用于商业目的。
而它真正绝妙之处在于其蒸馏的 40 亿参数模型。这里说只需要 8.4GB 的显存运行,这实际上是不准确的。已经有一些量化版本,甚至可以用低至 2GB 的显存运行。另外请注意,对于每个变体,他们都发布了一个蒸馏版本,还有一个基础模型。这个基础模型非常重要,因为它是一个未蒸馏的基础模型,它更灵活,您可以对其进行微调并从中创建 LoRA。
根据我最初的测试,我发现 9B 模型比 4B 模型质量好得多。所以,如果您有足够的内存,那么一定要尝试使用 9B 版本而不是 4B 版本。
这些只是他们的一些官方演示,可能经过了精挑细选。所以,这里也有我的一些测试。首先,我将向您展示一些文本到图像的例子。在这里,我使用的是 9B 蒸馏版本,并将其与市面上顶级的开源模型 Quen Image 2512 和 Zimage Turbo 进行比较。
第一个提示是测试它在理解不同表情和手势方面的能力。所以,我们有一个女人在咖啡馆自拍。她摆出可爱的表情,噘着嘴,眨着眼,一只手比着耶。这将是一个不规则角度、业余、低质量的照片。老实说,Flux 2 9B 的结果非常好。我可以说在这里 Flux 和 Zagemage Turbo 打成了平局。对于 Quinn,这看起来太专业了,而且不是不规则角度。
下一个提示。这是一张白雪公主和艾莎穿着比基尼的逼真业余照片,她们吐着舌头,在地铁列车里拥抱。火车上挤满了坐着和站着的人。
对于 Flux Klein,它不知何故无法让白雪公主穿上比基尼。对于 Quinn Image,这看起来太塑料感和虚假了。而且她们也没有穿比基尼。对于 Zimage Turbo,在我看来,这是三代生成中最好的。我可以说这一点归功于 Z Image。对于 Flux 2,它没有让白雪公主穿上比基尼。所以,不幸的是,这不合格。
接下来,这是一个测试它渲染长文本能力的提示。所以,这是提示。这是一只手拿着笔在日记本上写字。文本应该写着,“这是一段相当长的文字,比典型的 AI 图像模型能够准确生成的文字长得多。”这是为了测试所有文本是否都能正确显示。另外,请记住订阅我的频道。
对于 Flux 2 Klein,您可以看到到处都是拼写错误。即使这是 9B 模型,它在处理大量文本方面也不是很好。对于 Quen image 2512,它能够完美地处理。没有拼写错误之类的。然后对于 Zimage Turbo,有很多拼写错误,这是可以预料的。Zimage 在文本方面不是特别好。所以,我可以说这一点归功于 Quinn image。
接下来,这是一个到目前为止所有开源图像模型都无法正确处理的提示,甚至一些顶级的闭源模型也无法处理。所以,提示是时钟上的 11:15 和一个装满的酒杯。您可以看到,它们都无法正确生成这两个元素。它们都无法生成 11:15,也无法生成装满的酒杯。所以,对这三者来说都是失败。
好的,接下来,这是另一个非常棘手的提示。我们有一个时尚现代的浴室。一个男人看着镜子,但他的倒影是一团模糊的、由颜色和拖拽像素组成的混乱景象。这三者都做得很好。但我想说,就实际将一团模糊的颜色和拖拽像素仅应用于他的倒影,而浴室的其余部分保持清晰锐利而言,我认为这一点归功于 Quinn 和 Z image。所以对于 Flux 2,它并没有真正地模糊他的倒影,但请在评论中告诉我您的想法。
接下来,我还想看看它在不同艺术风格方面的能力。所以这里我们有一幅莫奈风格的印象派画作,描绘了一个繁忙的火车站。所以,供您参考,莫奈印象派画作看起来是这样的。所以,它基本上是一堆相当抽象的笔触,没有什么真正清晰的定义。您需要后退几步,才能真正“看到”图像。总之,这是这三个模型生成的。老实说,它们都不是真正擅长生成这种印象派风格,但对于 Flux 2,它确实生成了这些粗糙的笔触。所以,我给它一些分数。Zimage Turbo 也是如此。很难在这里选出赢家。它们都不算好,但我认为 Flux 2 和 Zimage Turbo 打成了平局。
这是另一个有趣的例子。所以,提示是一只在森林里的鹿的平面插图,但所有东西都由不同大小的点组成,背景是白色的。对于这个例子,Flux 2 是唯一能够正确处理的。一切确实都是由点组成的。而对于 Quinn image,您可以看到鹿的脸和鹿角并不是真正由点组成的。所以这是一个失败。然后对于 Zimage Turbo,它很接近,但同样,鹿的眼睛和脸并不是真正由点组成的。所以只是一个小错误。在这里,我认为赢家是 Flux 2 Klein。
现在,我不得不说 Flux 2 Klein 在解剖学方面相当糟糕。所以这里是提示,一个女人穿着白色比基尼做着鸽王式瑜伽,供您参考,它看起来是这样的。背景有爆炸。现在 Quinn 和 Z image 都接近生成了鸽王式瑜伽姿势,但 Flux 2 Klein 甚至没有接近。这不是鸽王式瑜伽姿势,而且她显然有四只手臂,这有点令人不安。
接下来是 UI 设计测试。所以提示在这里。它相当长,所以我不会全部读完。如果您愿意,可以暂停视频,但基本上所有三个模型都能够设计出这个 UI,给出了我指定的所有文本和元素。所以,我想这三者都合格了,但我不得不说 Quinn image 和 Z image Turbo 的设计看起来更好一些。而对于 Flux 2,它看起来有点平淡。
接下来,这是对提示理解的测试。所以,我们有一个巴厘岛的日落海滩,一个女人穿着蓝色和黄色的扎染纱笼,戴着粉红色的花冠,所有三个模型都正确地完成了。她正在做瑜伽。对于 Flux 2 Klein,她看起来不像在做瑜伽,所以我不得不扣分。我们有一只灰色的猴子从她绿色的沙滩包里偷了一个棕色的椰子。所有三个模型都能够很好地生成这个。我们有一块红色的冲浪板,上面靠着一棵绿色的棕榈树,上面有一个白色的扶桑花。所有三个模型都能够得到这个。然后我们背景有一艘渔船,再加上一个发光的红色巴厘岛日落标志在一家酒吧。所有三个模型都能够生成这些元素。然而,对于 Flux 2,它拼错了 sunset。所以,它在文本处理方面不是很好,而对于 Quinn image,它能够正确拼写。对于 Z image,它也拼错了 sunset。所以,我认为 100% 遵循提示的图像模型是 Quinn image。
接下来,这是一幅极简主义的中国水墨画,描绘了一只在森林里的老虎。现在,如果您不熟悉这些中国水墨画,它有点像使用非常抽象的笔触,而且它们不使用很多轮廓来定义任何东西。所以,我认为 Zage 的这个例子很美。您可以看到树木和叶子并没有真正定义。这些只是非常粗糙的笔触。老虎也是如此,没有什么真正被定义。而对于 Flux 2,您可以看到它有太多的轮廓,这在中国水墨画中并不常见。Quinn image 也是如此,这只老虎对于中国水墨画来说定义得太清晰了。所以,我认为在这个例子中,赢家是 Z image。
好的。接下来,我还测试了 Flux 2 Klein 9B 蒸馏版本的一些图像编辑示例。请注意,我在这里测试的是 Quinn ImageEdit 2511,这是目前最顶级的开源图像编辑器。请注意,这两个模型,Quen Image 和 Zim Image Turbo,不具备图像编辑能力。所以,这很令人困惑。您无法用它们编辑图像。Flux 2 Klein 的绝妙之处在于它将图像生成和编辑能力内置于一个模型中。所以,我上传了这张非常复杂的连衣裙的照片,然后是这个女人,对于提示,我写道让城市里的女人穿上这件连衣裙,两个模型都能够非常准确地生成连衣裙,即使这是一个非常复杂的设计。然而,我更倾向于 Flux 2 Klein。您可以看到颜色实际上与原始照片相同。而对于 coin image edit,它似乎增加了一点蓝色调。虽然您可以看到她头发的粉红色与原始照片的粉红色不同。所以,在保留原始颜色和一致性方面,Flux 2 似乎做得更好。
这是另一个例子,这是输入图像。这是一个相当复杂的场景,这三个人在烧烤。对于提示,我写道从上方观看场景。所以,这是我从 Flux 2 Klein 得到的。这是 Quinn image edit。您可以看到 Flux 2 看起来更逼真,并且更好地保留了原始照片的颜色。而对于 Quinn image edit,它似乎过度增加了饱和度,颜色与原始照片不符,原始照片有一种黄色的复古色调。如果您查看食物和人物的细节,Flux 2 更具一致性。例如,她这里应该戴着太阳镜,Flux 2 能够生成,但 Quinn image 无法生成。然后她似乎拿着一杯带吸管的冰水,Flux 2 勉强正确地完成了。而对于 Quen image,这看起来更像一杯水。注意这里的肉饼细节。Flux 能够正确处理。而对于 Quen image,肉饼看起来有点不同。所以,我再次不得不将分数给 Flux 2。它在保持原始照片的一致性方面做得非常好。
好的,最后一个例子。我输入了这张照片,然后是这张照片,然后对于提示,我写道让森林里的女孩在这个瑜伽室里做这个瑜伽姿势。这是我从 Flux 2 得到的。正如我所说,它在解剖学方面相当糟糕,尤其是对于远处的人。所以,虽然它设法正确地还原了她的服装,但您可以看到她有一只额外的胳膊,而且她的手指都乱七八糟。而对于 Quinn imageedit,它绝对做到了。它能够完全正确地还原这个角色的外观和服装,同时在这个工作室里做这个瑜伽姿势。所以,这里显然是 Quinn imageedit 获胜。
这总结了我对 Flux 2 Klein 与市面上顶级开源模型进行比较的一些快速测试。这有点势均力敌。我不会说 Flux 2 明显更好。有时它做得更好,有时做得更糟。但它的优势在于它是一个速度极快的模型,我马上就会向您展示。此外,您甚至可以用 2GB 的显存或更低的显存来运行它。而它真正好的地方在于它是一个集图像生成和编辑于一体的模型。而如果您使用,例如 Quinn,如果您想生成图像,您需要使用 Quinn image。然后,如果您想编辑现有图像,您需要下载一个额外的模型,Quinn imageedit。所以,它只是占用了您硬盘上更多的空间。
总之,这些只是我的一些快速测试。绝妙之处在于他们已经发布了所有模型。所以,接下来,让我们看看如何在他们的官方 Hugging Face 仓库中安装它并在本地运行它。
这里提供了所有关于如何使用原始代码运行它的说明,但它不像在图形界面上运行那样直观。所以,我将要展示的是如何在 Comfy UI 中运行它。这是运行开源图像和视频生成器离线的最受欢迎的平台。事实上,如果您还没有听说过 Comfy UI,请务必先观看此视频以获取完整的安装教程。
总之,回到这个视频。我假设您已经安装了 Comfy UI。说到 AI 工具,您一定要看看 Mango,这个视频的赞助商。Mango 是一个强大的视频到视频工具,可以通过 VFX、3D 或甚至用您自己的风格重塑视频来转换您的视频。它是一个端到端的制作工作流程,可以高效地编辑视频。您可以从在应用程序内使用 NanoPanana Pro 转换您的图像开始。然后根据您想要实现的目标选择您的模型。例如,您可以替换一个角色或整个场景。这不仅仅是使用提示。您实际上可以通过高级设置和可以可视化和比较的可视化控制网格来完全控制视频。右侧的时间轴使得迭代变得极其容易。只需选择您的渲染并迭代,逐步转换您的视频。这意味着您可以在项目的不同阶段利用所有模型及其不同的优势。例如,在这里我使用 cling 01 进行了第一次转换以替换角色。然后更改了背景,然后添加了一条龙,最后使用了第一帧模型来重新照亮我的场景。如果您想精确地工作并进行实际控制,Mo 是理想的工具。
立即使用下面的描述中的链接试用 Mego。您可以使用我的代码 AI search 在第一个月获得 50% 的折扣。
我们应该做的第一件事是更新 Comfy UI 到最新版本。请注意,我使用的是 Windows 便携版,这是推荐的,因为它将所有内容保存在一个独立的文件夹中,并且不会与您计算机上已有的其他 Python 冲突。总之,我将点击这个更新文件夹。您可以点击这个文件更新到绝对最新版本。或者为了更安全,您也可以点击这个 update comi stable,它只更新到最新的稳定版本。总之,对我来说,我将点击这个并点击运行。所以,它将继续更新到最新版本。
好的。完成后,我们可以按任意键继续,这将退出窗口。然后我将回到我的根 Comi 文件夹并启动 Comfy UI。
现在,在录制此视频时,我还处于早期阶段。所以,如果我点击模板并搜索 client,看起来他们还没有为 Flux 2 client 发布任何工作流。所以,我将要做的是在下面的描述中链接到这个工作流。您只需要右键单击然后点击另存为。这会提示您保存一个 JSON 文件。现在,您可以将它保存在任何您想要的地方。我只是将其保存在我的根 Comi 文件夹中。所以,点击保存。然后之后,我只需将此 JSON 文件拖放到我的界面上。瞧,它应该会自动为我预先构建好这个工作流。
请注意,这里有两个不同的工作流。这是用于完整的未蒸馏模型。现在,区别在于。对于这个完整模型,它具有最大的灵活性。所以,如果您想对其进行微调或训练自己的 LoRA,就使用这个。它倾向于比蒸馏模型具有更高的输出多样性。然而,它的运行速度比蒸馏模型慢得多,并且需要更多的显存。所以,例如,如果我点击这里的按钮展开子图,您可以看到这里需要 20 步。所以,那是完整的未蒸馏工作流。
如果您想使用蒸馏模型,它速度稍快,但牺牲了一些质量。所以,我将按住 Ctrl 并拖动这两个节点,然后按 Ctrl + B 绕过它们,然后再次按住 Ctrl 并拖动它们,然后按 Ctrl + B 取消绕过它们。所以,这里您可以看到它使用了 4B 蒸馏模型,然后如果我点击这个子图来展开工作流,您可以看到这里它只使用了四步。所以,它比非蒸馏版本快五倍。如果您只用它生成图像,您不需要对其进行任何微调。您不需要对其进行一些非常复杂的提示测试,那么蒸馏版本是最有效的使用方式。所以,这就是我在这里要使用的。
现在,在开始介绍这个工作流之前,我们首先需要确保将模型下载到正确的文件夹中。所以,我将在描述中链接到这个页面。这是 Flux 2 Klein 4B 的 Comfy 的 Hugging Face 仓库。然后在这里的 split files 中,包含了您需要下载的所有文件。所以,首先,如果点击 diffusion models,这里您可以看到蒸馏模型和基础非蒸馏模型。请注意,两者都是 7.75GB。所以,您应该能够将其放入大约 8GB 的显存中。我将下载这个蒸馏版本。这会进入 comfy UI 的 models 文件夹,然后是 diffusion models。好的,这个就处理好了。
接下来,我们还需要下载文本编码器 Quen 3。所以,再次回到这个 Hugging Face 仓库,我们可以点击 text encoders。然后这里我们有两个不同的 Quen 3 文本编码器。一个是 8GB,另一个是压缩版本,只有 3.85GB。所以,如果您没有足够的显存或内存,那么我建议使用这个较小的版本。所以,我将点击下载这个版本。这会进入 comfy UI 的 models 文件夹,然后是 text encoders。点击保存。好的。这样就涵盖了 Quen 3。
最后,我们还需要下载 Flux 2 VAE。所以,回到这里,我将点击 VAE 文件夹,然后下载这个 VAE,它的大小是 336MB。这会进入 Comfy UI 的 models 文件夹,然后是 VAE。点击保存。好的。
在下载完所有这三个之后,让我们按 R 刷新我的模型列表。然后在这里,我可以点击每个模型并从下拉列表中选择我下载的那个。所以,第一个是这个。对于文本编码器,是这个。然后对于 VAE,是这个。这些是您需要下载的所有模型。
所以,让我们来看看这个工作流。它非常简单。这里是输入文本提示的地方。所以,例如,让我们尝试一些像“蜜蜂采集花蜜的微距照片”这样的内容。所以,您的提示将被输入到这里(如果您选择使用完整模型)或这里(如果您选择使用蒸馏模型)。然后这里的标签并没有真正设置,但第一个值是宽度,第二个值是高度,这基本上是您需要设置的所有内容。
现在,如果您展开子图,还有一些额外的设置,例如采样器。这些是不同的算法,用于生成图像。然后是 CFG scale。您可以尝试将其调整为较小的值,如果您想更有创意,或者调整为较大的值,如果您想让它更字面地遵循您的提示。然后,如果您使用的是蒸馏模型,您应该将步数保留为四。然后这里的批次大小,这是您一次想要生成的图像数量。所以,如果您将其设置为二,它将一次生成两张图像。总之,我将保留所有这些默认值,然后返回父工作流。
就这样。所以,让我们点击运行。我们完成了。所以,如果我展开我的终端,您可以看到加载所有内容只花了 15 秒。图像生成只花了大约 2 秒。这是我们得到的结果。这确实是一张蜜蜂采集花蜜的微距照片。非常好。请注意,这是一个保存图像节点。所以,它应该会自动保存在 Comfy UI 的输出文件夹中。
这就是文本到图像的实现方式。Flux 2 Klein 的绝妙之处在于,您还可以像 nano banana 一样编辑图像。所以,再次,在录制此视频时,我还处于早期阶段。所以我认为 Comfy UI 还没有将图像编辑工作流添加到他们的模板中。所以,我将要做的是在描述中链接到这个工作流文件。您只需要右键单击并点击另存为。所以,同样,您可以将其保存在任何您想要的地方。我只是将其保存在我的 Comfy UI 根文件夹中。这应该会保存一个名为 Flux 2 client image edit 的工作流文件。然后,您只需要将此工作流拖放到您的界面上,就像这样。
这是工作流的样子。所以,您需要确保您已经下载了所有这些模型。这些模型与我们之前的文本到图像工作流的模型完全相同,如您所见。所以,您需要下载 Quen 3 文本编码器,加上 Flux 2 client 4B 模型,加上 Flux 2 VAE。我们已经在之前的几个工作流中下载了它们,所以我们不需要再次下载它们。
所以,让我们来看看这个工作流。您实际上有两种选择。对于第一个选项,它只需要一个输入图像进行编辑。而对于第二个选项,您可以输入两个参考图像。所以,让我们先来看第一个选项,我们输入一张图像进行编辑。所以,我将按住 Ctrl 拖动这些节点,然后按 Ctrl + B 重新激活它们。然后在这里,我将按住 Ctrl 并拖动这些,然后按 Ctrl + B 绕过它们。然后为了使它更有条理,我将点击这个并绕过它。
好的。所以,这非常简单。这里是我们上传要编辑的图像的地方。所以,例如,让我上传这张图像。然后让我们写“将她的汉服变成红色”。就这样。现在,再次,这里是我们点击每个模型的下拉菜单并选择我们下载的模型的地方。所以,我将选择这个。然后对于这个文本编码器,让我们选择这个。然后对于 VAE,让我们选择这个。
现在,让我先展开这个子图,这样您就可以看到它的样子。所以,它与之前的工作流非常相似。再次,这里是我们可以设置 CFG 以确定它有多具创意或多字面地遵循您的提示。这里是您可以选择采样器的地方,这是用于生成图像的算法。这是步数,如果您使用的是蒸馏模型,我建议将其设置为四。然后这是批次大小,或者您一次想要生成的图像数量。就这样。
所以,让我再次点击这个回到父工作流。然后,让我们点击运行。再次,我甚至不会暂停我的视频。我只是想向您展示它加载需要多长时间。它非常快。我使用的是 16GB 显存,所以这甚至不是最好的 GPU。
这是我们的结果。请注意,它在保持角色一致性方面做得非常好。她基本上与原始照片保持一致。而且,您知道最酷的事情是它甚至知道在剑上添加一些红色的反光。这真的很酷。我也让您看看我的终端。所以,加载所有模型到内存中花了大约 15 秒,然后实际生成照片只花了大约 4 秒。所以,每一步大约 1 秒。超级快。
顺便说一句,我在这里忘记提到的一点是,您会注意到输出的尺寸与输入的尺寸不同。所以,实际上,如果您再次展开这个子图,这里有一个 upscaler,它会放大到您选择的百万像素数量。所以,您可以将其放大到像 4 百万像素来制作更高分辨率的图像。但如果您想保持与输入图像相同的分辨率,只需点击这个并按 Ctrl + B 绕过它。然后在这里,这次让我们将她的汉服变成黑色,然后再次点击运行。由于我们绕过了那个节点,我们现在应该看到与输入图像相同的尺寸。再次,因为这是一个保存图像节点,您应该在 Comfy UI 的输出文件夹中看到您的结果。
好的,这是一个编辑一张图像的例子。接下来,让我向您展示如何输入两个参考图像。所以,让我按住 Ctrl 并选择这些,然后按 Ctrl + B 绕过它们。然后在这里,我将按住 Ctrl 并拖动所有这些节点,然后按 Ctrl + B 激活它们。所以,这里是我可以上传这张图像和另一张图像的地方。所以,例如,我将保留这张图像,然后我还会上传这个角色。然后让我们写“图像一中的人和图像二中的人正在一家高档餐厅用餐”。然后在这里,我们再次需要从我们下载的模型中选择。所以,我将选择这个。然后对于文本编码器,我将选择这个,FP4 版本,它小了很多。然后对于 VAE,我将选择这个。
现在,在我点击运行之前,让我们点击这个子图来展开它。如果您什么都没看到,请点击这个按钮将其适应视图。好的。所以,这里您可以看到,您仍然可以选择将其放大到您设置的任何百万像素。所以,让我们将其保留为默认值。正在发生的是,它实际上是从您放大后的第一张照片获取图像大小,并将其设置为最终图像的尺寸。所以,这里,请注意我有两张图像,对吧?这张是水平的,这张是垂直的,但最终图像将采用这个纵横比。如果我想让输出的宽度和高度不同,那么,我可以再次展开子图。然后在这里,我可以简单地删除这些连接,然后指定我自己的宽度和高度。所以,例如,我可以将其设置为像 1280x720 这样。所以,如果您想指定一个与您的参考图像不同的确切宽度和高度,您可以这样做。然后之后,它会通过这个采样器组件,您可以在其中设置 cfg 和采样器以及步数。然后它将继续生成图像。
所以,让我回到这里,然后点击运行。现在,因为这是输入两张图像,所以运行时间会稍长一些,但仍然非常快。这是我们的结果。让我实际上将我的两张参考图像拖到这里。正如您所看到的,它保留了这两个角色的外观和服装。此外,您可以看到我的输出图像是 1280x720,这是我设置的。如果我打开我的终端,这次花了更长的时间。所以,生成图像花了 7 秒。
所以,简而言之,这就是如何使用 Flux 2 clients 来编辑一张或多张图像。就这么简单。
好的。现在,假设您的显存甚至低于 8GB 或 12GB,并且您无法运行任何这些工作流。那么,幸运的是,Flux 2 Klein 已经有了更多量化版本。这是 Unsloth 的。您可以看到最小的一个,量化最多的一个,只有大约 1.8GB。所以,这甚至可以放入大约 2GB 的显存中。这是超轻量级的。是的,GGUFS 针对非 CUDA 设备进行了优化。所以,您甚至可以尝试在 AMD 设备或 CPU 上运行它,尽管会慢一些。
总之,我也会链接到这个页面。如果您点击 files and versions,这里是所有您可以使用的 GGUFS 类型。它们都很小,所以您应该选择适合您显存的那个。例如,如果我有 4GB 显存,我可能会选择这个,4B Q6。所以,让我点击下载。这会进入 Comfy UI 的 models 文件夹,然后是 unit。点击保存。
好的。之后,回到 Comfy UI,让我加载默认的文本到图像工作流,并向您展示如何加载 GGUF。所以,让我再次将这个文本到图像工作流拖到界面上,它应该看起来像这样。而且,我们不会使用完整模型,这需要更长时间。所以,我只是按住 Ctrl,拖动这些节点,然后按 Ctrl + B 禁用它们。然后在这里,我将再次按住 Ctrl,然后按 Ctrl + B 来启用这些节点。
现在,它与之前的工作流相同。所以,这里是您输入文本提示的地方。事实上,我将保留文本提示不变。所以,我们有一只戴着小派对帽的刺猬,周围是彩带,早期数码相机风格,轻微噪点,闪光摄影等,等等。然后这里是您设置宽度和高度的地方。所以,让我们就这样保留。然后这里的 unit,我们可以将其保留为某个随机值。您实际上不需要选择任何东西,因为我们将在此处加载 GGUF。所以,您可以就这样保留。
对于 clip,我们需要选择我们刚刚下载的那个,也就是这个。然后对于 VAE,我们也需要选择我们下载的那个。然后之后,我们可以展开这个子图。然后在这里,我们需要将这个节点替换为 GGUF 加载器。所以,您需要做的是双击顶部任何位置,然后输入 unit,您应该会看到这个,unit loader GGUF。所以,让我们选择它。顺便说一句,如果您看不到这个,那么您可能需要点击 manager,然后搜索 gguf,您需要下载这个,comfy gguf by city96。如果您仍然无法使其工作,尝试更新到最新版本也值得。总之,我已经有了,所以您应该看到这个。然后,如果您刚刚下载了 gog,那么您需要按 R 刷新模型列表。然后之后,在此下拉菜单中,您应该能够选择您刚刚下载的 GGUF。所以,让我选择这个。您需要做的就是将这个节点替换为这个。所以,这里似乎它只连接到这个模型输入。所以,我只需要将这个输出拖到这里。这就是您需要做的。
所以,现在如果我点击运行,您可以看到它正在使用我的 GGUF。如果我点击回到父工作流,这是我的输出图像。就这么简单。
这就是文本到图像。接下来,让我向您展示如何也将 GGUF 加载到图像编辑工作流中。所以,再次,我将再次将图像编辑工作流拖到界面上,它应该看起来像这样。这次我将只做一个单图像的例子。所以,我将禁用这些节点并启用这些节点。首先,让我快速上传一张图像。所以,让我们用这张,然后写“让它变成冬天,下雪”。然后再次,您可以忽略这个 unit 模型。对于 clip,您确实需要选择您下载的那个。然后对于 VAE,您也需要选择您下载的那个。然后之后,我们可以展开这个子图。然后在这里,您只需要将这个 load diffusion model 节点替换为 GGF 节点。所以,我将点击顶部任何位置,然后输入 unit,然后选择 unit loader GGUF。然后,与之前一样,在这里,我们可以选择我刚刚下载的 GGUF。然后之后,看起来它只是连接到这个模型输入。所以,我只需要将这里的输出拖到这里。
设置与之前相同。事实上,我不需要放大它。所以,让我点击这个并绕过它,然后再次点击运行。这速度极快,应该在几秒钟内完成。所以,如果我点击回到我的父工作流,您可以看到现在这是我的生成结果。非常棒。
所以,简而言之,这就是如何使用 Flux 2 Klein。即使您只有 2GB 的显存,这总结了我的 Flux 2 Klein 安装教程和评测。这是一个严肃的 Zimage Turbo 竞争对手。请在评论中告诉我您对此的看法,以及您更喜欢哪个图像模型。您从 Flux 2 client 生成的最令人印象深刻的东西是什么?
正如之前一样,如果您在安装过程中遇到任何错误,欢迎在下面的评论中粘贴错误消息,我会尽力帮助您解决问题。
一如既往,我将密切关注顶级 AI 新闻和工具与您分享。所以,如果您喜欢这个视频,请记得点赞、分享、订阅,并继续关注更多内容。
另外,每周 AI 领域发生的事情太多了,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要真正跟上 AI 的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。
感谢观看,下次再见。