📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Mundo Video: Heygen, Higgsfield, Midjourney, Hailuo y Seedance

Morfeo Academy1:59:46

Transcription

好的,欢迎大家。第17课。今天我们有很多关于视频世界的新消息。我看到你们整个星期都在分享那些新发布的平台。Midjourney发布了新视频,还有Haen、Hickfield的新消息,以及Huo版本2。我们有很多新东西,所以我们将深入探讨这些。我们还将看到一个Confi流程,用于处理所有这些新的半UGC模型,它们允许我们生成人们手持产品的图像,这将非常有用。和往常一样,提问环节,无论你们有什么问题,即使是刚开始学习的人。如果你们想问一些更基础的问题,没问题。我会留意聊天室,如果你们想在那里写给我,否则就举手直接打断我。

好的,正如我所说,今天有新消息,我们将深入视频世界。我们所有的最新消息都与此相关。之后我们将看到更新的“卡通化”流程。这是针对那些参加Confiuen互动营销课程的人。我将向你们展示我现在用于所有营销活动的流程。我也会把它送给你们。它有一个特点,就是除了生成人物,还可以生成产品,并生成人物手持产品的图像。这与我们看到大家正在使用这些新平台所做的事情相同,但我们能够直接从Confi进行,并拥有更多的控制权。好的,最后我们以问题结束。如果你们想听一些实际案例,我可以告诉你们我一直在做的那些,但结构还是一样,在这方面没有什么新意。所以现在我们开始,我们将从一个已经存在一段时间的平台开始,它最常发布值得关注的更新,那就是Heen。

而这一次,他们深入研究了所有与UGC内容相关的东西。Heen已经是拥有最佳唇形同步的平台,但它有一个限制,就是只适用于播客式视频或自拍式、更静态、手臂动作不多的对着镜头说话的视频,或者可以添加产品等等。而通过这次更新,这正是他们所做的。这个新工具的名字叫做“产品植入”,它能做你们想象中的事情。你上传一张产品照片,选择一个虚拟形象,可以给它一个文本或视频格式的脚本,然后它就会生成一个格式化的视频,讲述关于产品的任何内容。所以我们来看看这个介绍视频。

我需要分享,不知道我有没有分享音频。让我检查一下以防万一。好的,为了分享音频,我分享一个标签页。我们用这个。你们需要这些,如果我没记错的话,或者这个,不,是这个。好的。嗯,我们来看看介绍视频。之后我给你们看我做的测试,如果你们愿意,我们也可以现场做一些小测试。

[Música] I just bought one labu to see what the hype was about. Ok, I am absolutely in love with these Adidas. This is dossier, some of the best perfumes on the This is quite literally gold for your hair. Meet sunshine in a can. Poppy [Música]

好的,第一印象是它看起来运行得很好,但和往常一样,他们展示给我们的视频都是精心挑选、精心策划的,所以也不要被骗了。我做了一些测试,结果没有达到我的预期,但也不算差,不过这个视频,我一开始就告诉你们,它看起来比我们实际使用这个工具时要好得多。所以我将告诉你们我测试了什么,向你们展示结果,如果你们愿意,我们之后还可以做一些小测试。如果你们中有人也玩过这个,并且想分享你们的结果到群里,请发过来,我们现在也可以现场看看。这周我一直在玩这款香水,Moschino的,这是我一直用于Heen虚拟形象的图片,因为手是可见的,通常对我来说效果很好,而且这个平台,这个新功能的工作方式是,我们显然添加两张图片,然后它生成四个版本,就好像他们可能在背后使用Flux Context,目的是将产品放在我们手中。但你们看这里,发生的事情非常明显。它完全把我变形了,也就是说,我不再是我了。香水也没有保持它应有的真实尺寸。也就是说,在最好的情况下,第一张图片是效果最好的,最接近真实尺寸的,但我失去了我脸部和产品的一致性。所以我第一次使用这个平台的体验并不是最好的。

无论如何,我说,好吧,我来生成视频,看看它做得怎么样,看看至少唇形同步和手部动作是否正常。所以我们来看看第一个结果。嗯,上传音频、文本的功能与这个功能的Avatar 4相同,即从一张照片开始赋予它动作。所以那里没有什么魔法。基本上他们正在做的是使用Flux Context来添加产品,然后使用我们之前一直在使用的虚拟形象模型,他们几周前就应该发布了。好的,这就是结果。说实话,这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。

好的,唇形同步不错,手指动作,所有我们已经习惯的。这里没有太多新意。将产品融入场景的模型表现不佳。但好吧,这是起点。我们将在本课中通过不同的技术和更换平台来改进它。之后我说,好吧,我将尝试另一种方式。我没有用我自己的真实照片,而且它还是横向格式的,这可能不利于生成,我拿了一张已经由一个在海滩上的女孩生成的照片,垂直格式,以及Rivan Meta。看看我用这个效果如何。困难在于这不是一个我要手持的产品,而是一个我需要佩戴的产品。好的,我们来看看结果。稍微好一点,但好吧,我们现在来评论一下。说实话,这些眼镜让我抓狂,它们太棒了。我推荐你们购买。Rayan万岁。

唇形同步。不错。他们让我重复我生成的视频。我现在不知道是哪个。我们现在回去。但唇形同步不错,图像有点静态。这是我们一直以来在Heen上看到的问题之一,但因为是同一个模型,所以也预料到会发生。嗯,只有嘴唇在动。说实话,这些眼镜让我抓狂。它们太棒了。我推荐你们购买。Rayan万岁。对于声音,我所做的是我自己录制音频,用Eleven Labs进行替换,然后这就是结果。声音作为音频片段加载,虚拟形象将嘴唇与该动作同步。我再次播放聊天室里他们让我播放的这个视频。我播放两次。说实话,这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。所以,好的,唇形同步,我认为这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。

而这里,和往常一样的小窍门是,因为手是可见的,它给场景增加了一些动作,而这里这些眼镜真的让我抓狂。它们太棒了,我推荐你们购买。Rivan万岁。但好吧,我使用这个模型时遇到的情况是,我们已经习惯了Hayen在唇形同步方面表现出色。在背后生成图像只是一个flux context,我更喜欢自己控制如何配置初始图像,然后进行唇形同步,而不是将所有事情都委托给模型。我认为,嗯,它对于快速测试或者对于经验不多的人来说不错,但我们这些参加这个课程的人应该能够更好地将产品融入场景。另一方面,Hitfield Products。Hitfield也是发布新功能最快的平台之一,它运行得非常好,并且发布了一个与我们刚刚看到的非常相似的功能,但它有一些区别,主要有两点。第一个区别在于我们开始时帧的初始图像是如何设计的,以及视频最终结果中再次重复我们之前看到的相同趋势。Hickfield给场景带来了更多的动作,也就是说,角色不那么僵硬,但唇形同步,至少在西班牙语中,会稍微差一点。

所以我们将重复我们为Higfield看到的这两个例子,你们告诉我你们怎么看。哇,又来了发布视频,太棒了。他们让它看起来像是发布过的最好的工具。之后我们会看到,在实践中,它有其局限性。好的,Hickfield Canvas,如果你们想试试,我这里有Higfield给你们看。他们添加了这些选项中的最后一个,叫做“新画布”。我们到这里。和往常一样,在Higfield中,我们也可以选择摄像机运动或场景运动。所以这是我们在这个过程中可以添加的另一个变量。我们来看看,嗯,抱歉。首先他们从账户发布了,嗯,在推特上发布了这个,抱歉,这些视频快把我逼疯了。他们从Higfield的账户发布了这条推文。Introducing Higfield Canvas。嗯,回复。和嗯,canvas,这样我们就可以通过私信给你发送如何充分利用这个模型的完整指南。显然我回复了canvas,收到了指南,我在这里通过聊天室分享给你们,以防你们想要,但它基本上是一个简短的文件,包含一些简单的使用说明,就是上传产品,上传模型,绘制区域,然后生成[Música]。

好的,那里卡住了,但我们来看看实际操作。我所做的是使用了我们生成Heen虚拟形象的同一张图片,就是我双手举在空中冻结在那里的那张。我添加了我们刚才测试过的同一款香水。我要求它让我手持香水,这里的结果要好得多,也就是说,至少它没有破坏角色的连贯性。它添加的产品尺寸正确,也给你四个选项,但通过允许你绘制区域,你一开始就定义了一些变量,如尺寸等,但这仍然是context,也就是说,在背后他们使用的是新的flux模型,flux context,无论是在Haen还是在这里,它都允许我们将产品融入场景。然后,一旦我们选择了我们的图片,我们要动画化的图片,说实话,这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。

好的,正如我所说,我更喜欢手部动作,指向产品等等。它甚至有一些放大。你们看我的脸稍微变了一点,这也有一部分是唇形同步的原因。而且唇形同步不是那么好,也就是说,Hey的唇形同步更同步。你们可能还会看到一点延迟,但这里的唇形同步有点问题。说实话,这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。但好吧,这就是我们几周来一直在处理的“短被子”问题。Heen是唇形同步做得最好的。Higfield是给场景带来更好动作的。

我看到有人举手了,如果我没记错的话有两个人,不,只有一个人。Alan。是的。然后Gerardo,你好吗?我有两个问题,嗯,首先是关于Heen,关于之前的这次更新。当我们放入一个产品时,嗯,可以预期这个平台,嗯,如果是一副眼镜,显然会根据脸部、面部的尺寸和位置来调整,但有没有办法让它理解香水的尺寸,是50毫升还是200毫升的香水?是的,在Heen上我认为不行,因为你没有太多定制选项,也就是说,你只能给它。当然,它是在白色背景上。什么?它是在白色背景上,没有任何参考。是的,也许通过提供一张更具情境的照片,比如一个人已经手持产品的照片,会更好。有可能是这样,嗯?啊,那有可能,对吧?不是说只能上传白色背景的产品。不,不,不。你可以上传任何产品照片,不一定非得是白色背景。实际上,那是试错。嗯,是的,我认为如果我想直接使用这个,我会尝试用一张有情境的照片来改进它,但如果不行,你可以直接在其他地方生成,上传最终照片,然后使用Avatar 4的这个功能。好的,好的。另一个问题,这个Higfield Canvas,对吧?嗯,是用于脸部的吗?可以画一张脸吗?然后基于此,唇形同步怎么样?你说的是用画脸来替换身份。是的,视频中的身份替换。是的。也就是说,它会像context一样工作。它是准确的,因为他们正在使用那个模型。如果你用context进行身份替换,它会在某种程度上起作用,不会像Instant ID、Infinity这些我们一直在使用的那样完美。但它会有帮助。然后唇形同步会起作用,因为它是编辑过的初始帧,然后是正常的唇形同步。但我认为答案还是一样。如果你想,最好先进行身份替换,然后再进行唇形同步。现在有很多关于这个的例子,所以我们会在那里看到。但我问你,如果另一个工作流程,也就是说,从一个视频开始,比如电影场景,然后在场景上改变脸部,对吧?制作一张图片,替换脸部,然后从图片转换为视频。不,因为这里你是从一张图片开始的,也就是说,至少这个Hickfield Canvas允许你上传的是一张静态照片。啊。我以为是视频。好的。明白了。例如,我正在上传一张也是生成的照片,也就是说,是用instant ID制作的。它需要一点时间,但现在你会看到它允许我绘制一个区域,就像是in-painting一样,然后用你上传的参考图像,或者添加产品,或者你可以尝试身份转移,即使它不是为此而设计的。它应该会起作用,因为它正是context。如果你愿意,我们试试,我让它生成,然后回到演示。那么从视频开始,你有什么想法吗?替换身份的最佳工作流程是什么?你想做一种深度伪造吗?不。是的。就那样。我得看看One Base,我们之前看过的那个让人们跳舞的,用那个我认为你可以做一些有点粗糙的身份转移,但它在视频中有效,特别是如果角色更动画化一点,或者不那么追求真实感。如果不是,那么一些特定的深度伪造平台,它们通常使用起来有点困难,但可能会起作用。我们也可以试试那个。好的。嗯,就这些。非常感谢。好的,我让它继续生成。我要把我的脸换成梅西的。我们来看看效果如何。Gerardo,你举手了。是的,是的。我的问题是,嗯,Heen只在Avatar 4中吗?嗯,只在Avatar 4中是什么意思?当然,因为它有自己的Heates,你可以使用它。如果你没有Avatar,是的,抱歉。是的。如果你没有使用照片的Avatar 4,但Heen的其他虚拟形象,那些用于制作视频的,有大约60个。所以我想知道是不是这样,因为嗯,Avatar 4效果很好。对我来说,它是Heipsink最好的功能。对我来说,没有什么能与之匹敌,但它有一个缺点,就是套餐每月只有3分钟,玩3秒钟你就用完了,然后你必须购买150美元。是的。这可不便宜,嗯?嗯,而且它还有一点,就是Avatar 4在唇形同步方面非常好,但如果你背后有物体或人物或其他任何东西,只有主要物体会移动,这也极大地限制了你做很多事情。它可以用来做非常具体的事情,但好吧,这就是“短被子”问题,因为现在用Hitfield或者Hidra你可以做那些有更多移动性的事情,但唇形同步根本无法接近。所以,我只是想知道是不是只有这样,或者是不是和Avatar 4一起,或者是什么。是的,这个产品植入功能只适用于Avatar 4。你看,你点击这个产品植入按钮,添加产品,添加虚拟形象,它会生成四张图片,当你拥有它时,它会自动打开这个屏幕,也就是说,它不会让你离开这里去使用其他模型。嗯,它是为了与这个模型一起工作而设计的,而且它就像是集成的。他们在前面增加了一个步骤,就是添加产品,然后就一样了,是同一个模型。所以很清楚。是的,我也认为是的。同样,使用Avatar 4,我觉得你也可以做到。显然你必须从一张带有产品图像的图片开始。当然。但你也可以做到。我的意思是,现在只是,当然,现在只是为你省去了生成那张图片的步骤。是的,这很好。好的。这里Hickfield Canvas生成完了,看看它有没有给我做人物替换。好的,不,也就是说,它没有保持身份,改变了人物,理解了需要绘制的区域等等,但说实话,这显然不是梅西。所以对于身份替换,我不推荐这个。它也不是为此而设计的,所以我也没那么惊讶。嗯,好的,关于我分享给你们的指南,就是这个。如果你们想,如果你们要使用Higfield的这个产品植入功能,你们看到屏幕了吗?没有,我停止了分享。不,现在我们只看到。在那里。现在,现在,现在。嗯,这是指南。如果你们想制作一个自定义GPT,它不错,也没有那么多信息。使用这个平台相当简单,所以,嗯,它不是那么必要。我们继续。

那么现在我已经向你们展示了这个视频的结果。我们看到它有更多的动作,手会动,但唇形同步有点问题。说实话,这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。我们以前谈过,现在我们来回顾一下这个叫做Synthetic UGC的平台。我会把它写下来,然后把链接发给你们。Synthetic UGC允许我们做的是一个唇形同步,它运行得相当好,我敢说几乎达到了Hayen的水平,但它是从视频而不是从照片开始的。所以,我们在这里可以做的是,获取我们在Higfield生成的视频,那个有动作的,那个给图像带来更多活力的视频,但在此之上应用一个唇形同步。那么我们就有了一个有动作且唇形同步良好的视频。我们需要再增加一个步骤,但你们看,现在的结果将具有相同的动作,指向香水,嗯,但嘴唇会更好。说实话,这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。我再播放一遍,刚才正好是。说实话,这款新的Moschino Toy Boy香水太棒了。如果你们有机会,一定要试试,我强烈推荐。

好的,我不知道你们有没有注意到,但音频同步得好多了,而且我们保留了Higfield的动作。所以,这样一来,如果你们需要做推荐,Heen,我们暂时放在一边。HSfield用于制作更有趣的视频,而Synthetic UGC用于改善Hickfield提供的唇形同步,因为它比竞争对手落后一步。嗯,也许这个视频的分辨率比Hickfield直接给我们的要低一点,但好吧,我们可以在那里用Topas或任何你们想要的平台进行放大处理,冒着脸部会稍微改变的风险。但如果我们使用的是虚拟影响者而不是我们自己的照片,那就不会被注意到。是的,Fran。

嗯,好的,我想问一下Synthetic UGC是否也适用于3D角色或类似的东西,而不仅仅是人类。是的,你看,嗯,我登录看看我是否已经登录了。是的,嗯,有一节课是关于这个的。我用几个试过了。看,我们有这些。好的,它们很像人类。这个不是,这个更像角色。有时它在检测方面会有点问题,如果我们使用音频而不是上下文,你们会看到结果更好,主要是因为它能更好地捕捉我们的口音和说话方式。例如,我发音的“Bueno”,嗯,可以理解,效果差一点,嘴巴会动,但当然,它不像人类那样有那么多语调。嗯,我们和这个比较一下,是同一个音频,你们会看到效果好得多。如果我们使用音频而不是上下文,你们会看到结果更好,主要是因为它能更好地捕捉我们的口音和说话方式。例如,我发音“las”和“lluvia pollo”,非常阿根廷式。好的,好多了。这个有很多动作,它在那里打字,向下看,向上看。这是静态图像,在Cling中生成的视频,以及在Synthetic UGC中生成的唇形同步。嗯,如果你们想尝试,这种组合也非常好用。

好的,我们回到刚才的话题。另一个Hickfield Canvas的例子。你们看我刚才说的,左边我们可以改变这个变量,它允许我们生成摄像机运动。例如,有一些是自拍式的,如果你想制作更多Instagram式的UGC内容,嗯,有多种变体。有一个向后走的,我稍后会测试,你们会看到。你上传音频,如果你愿意,描述场景的提示词,如果不想可以留空。在这里你添加产品并定义一个和质量。嗯,它有高、中、低。这是视频。嗨。说实话,这些眼镜让我抓狂。它们太棒了,我推荐你们购买。Rayan万岁。和往常一样的困境。说实话,这些眼镜让我抓狂。它们太棒了。我推荐你们购买。Rivan万岁。左边的,Higfield,手部动作,更生动。右边的,Heen,超级静态。嗯,但好吧,到这里是UGC内容的话题。嗯,我的建议是首先由我们自己生成静态图像。如果你们想要从Replicate或Confi获取context,或者直接使用GPT,使用你们觉得最舒服的GPT Im One,制作初始图像,然后如果想给它一些动作,可以立即使用Hickfield进行一些唇形同步,然后通过Synthetic UGC进行改进,如果不是,则在Cling中进行动作,然后使用Synthetic UGC,跳过Heen和Higfield。至少对我来说,这是两种效果最好的组合。是的,Mily,然后是Gerardo。

是的。嘿,说到那个话题,我一直在想,如果创建一个虚拟形象并有不同的镜头,比如TED风格,正面说话,然后切换到另一个摄像机角度,但仍然在说话,仍然在同一个情境中,就像根据你所说的,是先用这个角色生成图像,然后再传递它。是的,我认为我会先为每个角度生成所有初始帧。你可以有一个正面,145度,任何你想要的,嗯,然后每个音频片段,当你想要切换摄像机时,你用改变后的初始图像生成它,也就是说,改变视角。好的,太棒了。好的,不错。

好的,这个大家肯定都看过了,它在社交媒体上随处可见。Midjourney增加了将你在那里生成的任何图像转换为视频的功能。不仅如此,它还允许我们上传在其他平台生成的图像,这是我担心他们不会做但他们做了的事情。所以我们感谢他们。这意味着,就像我们使用Clean,使用OpenAI生成的图像,并且可以交换平台一样,使用Midjourney,我们也会看到同样的情况。你可以上传任何图像,并使用Midjourney的视频生成引擎,为你在其他任何地方生成的图像赋予动作。嗯,它有几个优点,几个非常强大的点。我很惊讶。嗯,我没有那么信任它。事实上,上周我说它可能没用,但它太棒了。它还有一个特点,就是它非常专注于已经在Midjourney工作的人,只能从平台执行,例如,我们永远无法从Confi使用它。所以,这些是它最强的限制。但我们看到的结果,无论是真实感还是更动画化的角色,嗯,都非常好。嗯,也支持文本,例如,这里他们上传这张带有文本的图片,要求它移动,它不会失去一致性,结果很好。我们看到的所有视频都具有一致性,没有奇怪的伪影,动作流畅,嗯,我们对视频生成引擎的所有期望都在这里,并且还有一些在这些平台中不那么常见的额外优势。

例如,好的,这就是我告诉你们的,我们可以上传一个第一帧来动画化我们在其他平台生成的任何图像。我们给它一个提示词或者使用自动提示词。这是自动和手动之间的区别。在自动模式下,它会自动生成提示词并赋予动作。而在手动模式下,嗯,如果我们想给它一个与预期完全不同的动作,我们会配置一个提示词。然后我们有两个动作变量,低动作,主要是摄像机旋转或慢动作的图像,以及高动作,当我们想要嗯,视频更快、更加速时。我在使用Clean或那些平台时经常遇到这种情况,有时视频非常慢动作,我们最终在后期制作中加速它。在这里,有了这个高动作功能,嗯,它真的运行得很好。我测试的东西都没有任何问题。

这里有人问如何访问,嗯,从Midjourney在线平台,也就是midJourney.com。嗯,我分享链接,以防你们没有。斜杠Imagine。显然我们必须有一个Midjourney的套餐。我记得最便宜的好像是8美元还是20美元,我不记得了。我用这个这么久了,嗯,我不太清楚,但结果很好,而且,它有一些优点。它为每个视频生成四个版本,也就是说,不需要一次生成一个视频。一开始就给我们四个。生成速度非常快,嗯,而且很便宜,非常便宜,也就是说,它是所有平台中最便宜的,可能对于我们能生成的数量来说,而且结果非常好。也就是说,你们看,这不是一个简单的动作,他在滑雪,雪花飞扬,拍摄中有很多复杂性,而且在大多数情况下都解决得很好。这里可以看到低动作,慢动作,和更慢的动作之间的区别。你们看,它就像慢动作一样,而上面这个是快速动作。然后我测试的另一件事是,例如,在这张图片中会发生什么。如果我们给它自动提示词,它在这里做了任何事情,然后当我给它手动提示词并输入“疯狂的鸭子摧毁一切”时,你们看疯狂的鸭子是如何跑来跑去,到处破坏的。所以它对我们给出的提示词非常敏感。也就是说,提示词很重要。我建议你们思考一下,或者给它一个特定的动作,如果你们知道自己想要什么,就不要让它太随意,因为它会非常听从你们写的东西,不需要非常复杂。你们看,只是一句话而已。嗯,所以,高动作,低动作,四种变体都是非常好的东西,值得称赞。

那么总结一下,优点是:它非常快,使用起来超级直观。嗯,我们生成一张图片,在侧边面板上,我们只需点击一下即可生成视频。流畅,也就是说,动作很好,没有伪影,视频质量好,特别是对于Midjourney的图像来说非常美观,嗯,它保持了Midjourney从一开始就具有的那种精心策划的美学。便宜,有了套餐你就可以生成很多视频,甚至可以在草稿模式下运行,那个功能就像你和它对话一样,速度超快,迭代性强,所以你可以非常快速、非常便宜地生成很多视频。它一次给我们四个变体,这太棒了。有多种选择很好,而不是等待5分钟只得到一个视频。之后另一个非常好的功能是,它允许通过一次点击非常容易地延长视频,并且保持了非常好的一致性。你们看这个视频,例如,他们告诉我们是用一张图片生成的,视频持续19秒,你们看它是如何从头到尾保持一致性的。场景在变化,它进行了一些缩放,摄像机在移动,而且在各个方面都保持了非常好的一致性。就像这确实是新颖的,拥有20秒的视频,随着我们前进视频不会变形,嗯,这太棒了,我认为这是另一个优点。所以这个模型有很多优点。对于缺点,我只有两个。第一个是没有,也永远不会有API。它也没有通过API生成图像的功能。视频也不会有,这意味着我们无法从Confi使用它,也无法从N8N或任何地方使用它。我们将不得不满足于从平台工作。所以,嗯,对我来说这是一个很大的限制。对于你们中的许多人来说,我知道肯定不是,但对我来说,它没有API这一点让我有点不想使用它。第二个缺点,实际上它不是一个缺点,就是它不是最好的模型。也就是说,现在我们将看到与Clean Master B2的比较,甚至在某些情况下与Beo的比较,而Clean更胜一筹。对我来说,目前还没有比Clan更好的。我们现在来看看这周发布的一些可能与之竞争的,但它在中等水平上很强大,不会失败,而且更新速度如此之快,以至于如果某个时候有更好的,Cling会迅速赶上,嗯?所以我有我的最爱,但好吧,这个很明显。好的,很明显它有很多优点,人们可能会发现它有很多好的用例。

关于价格,我现在仔细看看,但我用的是20美元的套餐,不,甚至不是8美元的,我想,因为我降级了。让我看看,嗯,管理订阅。嗯,8美元,最低套餐给你200张图片,我不知道能有多少视频,你一次可以生成一个视频。它没有说视频总数,但你可以生成很多,也就是说,不贵。如果你能生成200张图片,你肯定能生成50个视频。当然,是的,这是按年付费的。抱歉。好的,每月10美元也不算太多。嗯,我不知道它能生成多少个视频的具体数量。需要自己算一下或者谷歌一下,但没什么,嗯,我还想向你们展示速度。我们去探索部分,例如,我们随便抓一张图片,这张老虎的,啊,我得去这里。起始帧。当然,它不让我。好的,我将用我在这里上传的一张图片来做。添加一张图片。我们来添加,不知道,这张,这两个人拥抱的。我们给它起个名字叫“友好拥抱”。这里我们有动作参数,如果我们要高或低,速度,快或慢。然后我们生成。我们到创建部分,看看它需要多长时间,但嗯,你们会看到它非常快,一开始就给我们生成了四个变体,而且,它比Clean和所有这些都快得多。如果你们想延长,我们有自动延长,它会根据所看到的内容自动延长,手动延长,那是当我们想改变我们正在看的提示词时,这对于我们想改变摄像机、视角或任何东西都很有用。已经35%了,所以大约一分钟左右就会完成。同时我去找举手的Fran。

问题是,嗯,Midjourney内部是否可以添加唇形同步?也就是说,给视频加载一个音频,例如,老人滑雪下山时边滑边说话,或者需要把它放到另一个应用程序里?不,Midjourney没有动作,也就是说,它既没有音频也没有唇形同步,嗯,它只生成图像和无声视频。也许某个时候他们会添加。我认为从BO3所做的这一点来看,所有平台迟早都会添加原生声音生成功能。也就是说,我们生成的所有视频在某个时候都会开始带有声音。目前,唯一具有此功能的平台是BO3,嗯,但我认为它迟早会到来。就像现在Hickfield原生提供唇形同步一样,所有平台都会开始这样做。今天,如果我想给我在那里生成的任何一个视频添加唇形同步,我会下载它,就像我们刚才看到的,Synthetic UGC允许你接收一个带有动作的视频,并在其上应用唇形同步。所以我可以下载它,传到Synthetic UGC,然后就在那里有了。嗯,好的,明白了,明白了。

这里是结果。有一些。这个,第二个,比如说,有点奇怪。最后一个不错。我认为这个是最好的。第四个,我们点击延长,它会自动延长,也就是说,它超级直观,速度快,有明显的优势。嗯,如果你们已经有Midjourney的付费套餐,我推荐你们试试,否则我不知道是否值得,取决于你们会用多少,嗯,但它是一个快速且方便的东西,嗯,所以我们感谢它。好的,我们还有两个视频生成平台,它们本周发布了新模型。第一个是Hiluo,也称为Minimax。当Clink还在1.5版本时,它曾是一个模型,如果不是最好的,也与Clink不相上下。从那时起已经过去了相当长的时间。他们发布了这个新版本。它有一些非常具体、非常有特点的优点,我们现在会看到,然后,好的,我们来看视频并讨论。如果你们想尝试,可以从Fal AI尝试,它类似于replicate,你可以在那里充值积分,然后在不同的模型中消费。很快它肯定也会登陆Replicate,如果还没有的话我没查,但也许它也在Replicate上,嗯,我们将能够按视频付费,而不是为此支付月度订阅费。嗯,然后,好的,soro,我要把你静音,我想你的麦克风开着。这个模型的主要优点或其突出之处在于其在真实世界物理方面的一致性。我不知道你们有没有看到,有一些非常典型的视频,当他们测试BO2、BO3模型时,嗯,有杂技演员,嗯,就像奥运会运动员一样做一些特技,或者猫跳进游泳池,这些对模型来说很难,因为它们不习惯这些,最终会做出一些有点变形的东西,或者例如滑板时试图用滑板做特技。嗯,这些是模型通常会遇到的困难,也是这个模型的主要优势之一。所以现在我们来看视频。真实感10分,完全可以是BO3。你们看那个。这些特技。滑板完美旋转。就像这里有一些新颖的东西。毫无疑问,嗯,不可否认的是,与我们习惯看到的许多东西相比,质量有了飞跃。嗯,好的,这是主要优势和高度真实感。是的。嗯,Fran还是谁说话了,我不知道。我,我,我。而且质量,嗯,从这里看,非常好,说实话。也就是说,真实感完美。可能是三,我看到两个,我不会注意到。物理效果很自然,所以因为Midjourney的问题是,嗯,它是480,如果你认为那是480对1080,也就是说你必须放大很多,我不知道如果你真的想用它来工作会是什么样子。我的意思是,是的,嗯,我觉得我觉得那里会破坏这个,对吧?我不知道这里Hu的质量。说实话我没查过,嗯?让我打开看看它有没有在某个地方说,但我没有。但好吧,就我所拥有的,嗯,768,如果你是订阅者,它有1080。好的。啊,好的。768 1080至少已经是一种更体面的质量了。在Midjourney我看到了很棒的东西,但没什么,480让我觉得。你确定是480吗,因为它看起来相当不错。我在两三个我看到的视频中读到过,他们说质量是480。希望不是,但他没用过。但到处都这么说,这很低,因为你无法工作,除非你有一些。当然。除非你有一些程序可以将其放大到1080,并且在不产生伪影的情况下使其看起来很好,嗯,这很复杂。看,我在这里下载了视频。我必须全屏演示才能让你们看到这个。它告诉我它是544 x 704,也就是说,不是480,稍微高一点,但仍然很低。我不知道你们能不能看到,因为它。是的,是的,是的,是的。但好吧,它就是这么说的。Fran,你被静音了,我想。

不,不,它之前就开着了。啊,好的。嗯,太好了。呃,好了,那我们回来。我们刚才说到Jailuo。嗯,这个我还没试过,看起来很有前景。也就是说,这个小视频让我很想尝试它。我觉得这里面有些有趣的东西。

另一方面,这个,Gerardo,你也在群里分享过,我记得。Se Dance 1.0。在所有基准测试中,它都位居榜首,超越了BO3等等,主要是因为它的真实感。我们现在来看看这个小视频。稍后我会发表我对这个的看法。[音乐]

嗯,视频确实不错,这毫无疑问。也要考虑到这是一个模型发布预告片,他们会选择最好的部分,而且剪辑得很好。对我来说,第一印象是它没有像Hilo那样让我感到惊讶。Hilo首先是因为它的物理效果和真实感。而这里的视频,我觉得和Midjourney生成的东西并没有太大区别,例如。它非常好,有相当高的真实感,也允许我们进行图像到视频的转换,也就是说,从一个初始帧开始,而且我认为它也有场景一致性这个问题,我们可以要求它改变摄像机角度,但它仍然保持一致,这是Runway几个月前首次推出的功能。

呃,所以它有一些有趣的地方,是一个不错的视频生成模型。我认为它并没有什么相对于现有技术来说是完全颠覆性的东西,至少对我来说,它没有那么吸引我,以至于让我说“我要换平台,我要用这个”。我不觉得它比Cling优越多少,也不觉得它比HW优越多少,而且它在Confi中也没有一个易于使用的API来在那里测试。考虑到所有这些发布,它是我最不感兴趣的一个,尽管在基准测试中它表现非常出色。

呃,我更喜欢Hiluo,更喜欢Journey,而Clean对我来说仍然是最好的。还有价格,因为他们说它的一个特点是呃价格,它比BO3便宜很多,是的,问题是我在任何地方都没看到。BO3,抱歉,实际上问题在于BO3非常昂贵,所以这使得其他产品看起来很便宜。看看这里,价格方面,即使不是最强大的Turbo版本,也需要170个积分,而且,用1美元可以生成276个视频。这很多,是吧?很便宜。是的,是的,很便宜。

呃,我其实不确定它是否有公共API。我在这里没有看到任何地方提到API,所以我不认为有。又来了。另一个你在这个平台上有点封装的模型。生成工具只是简单的首帧、提示和视频时长。我们已经习惯了这些,但在与模型交互的界面方面没有什么新意,结果也不错,但也没有让我惊艳。所以,这个没有足够吸引我来尝试。Hilo,因为物理和真实感的问题,稍微多一点,是的。呃,所以这个我会给它一个机会。好的。好的。

嗯,这里有个人在Twitter上比较了Cling、Jailo、SeDO3的相同提示。我会放几次。它们彼此之间非常不同。说实话,很难判断哪个更好。而且我看了他要求的提示,就在下面的推文中,他要求一个快速蒙太奇,所以一开始就很难让它们看起来相似,或者说,他基本上是要求一个很难的提示。我不知道,这是品味问题,哪个看起来更好。我也不觉得这是最好的测试。

我现在将分享我的测试,回到我们之前在Midjourney中看到的视频。我测试了Beo和Clink。我还需要测试呃,例如。我们一个一个来看。Gerardo,我再把你静音。E BO2。这是BO2,因为它是Confi的。它的运动也相当静态。啊,不是Gerardo。我们在这里。呃,与Cling相比,它的运动相当静态,例如。看看雪花和动作是多么的动态和自然。也就是说,我认为Beo和Cling之间的差异非常明显,我用几个视频测试过,CN总是更好。而Midjourney也不错。呃,这里可以看出一些质量差异。我认为我们刚才看到的这个视频不是1080p的,Clan的视频我想也不是,但它的质量比Midjourney好一点,或者也许CN是1080p的,我真的不记得它返回的是什么分辨率,但在这方面更好,是吧?

最后,这是一个更隐秘的宝藏,它本身不是视频生成平台,而是用于视频编辑的。这让我非常感兴趣。几周前我已经谈过这个话题了。我想做的一件事是能够自动编辑我们生成的所有片段,无论我们使用什么模型生成它们。所以,我现在要向你们展示的这个叫做Homatch AI。它不是一个我们可以像我们习惯的那样访问和购买积分的公共平台,但我们有GitHub链接可以在本地安装它,而且我理解这也可以在Confi中进行操作,我将向你们展示结果,但它所做的是将一首歌曲和几个视频片段作为初始输入,并根据音乐的节奏,也就是根据片段的节奏来编辑视频。我们来看看例子。这将节省大量时间,并允许端到端地自动化任何内容的创建。[音乐]

我有个疑问。关于转场。我不知道这里有没有提到。我不知道它是否也添加了片段之间的转场,但它能自动同步音乐已经节省了大量时间。呃,嗯,所有这些都是剪辑,没有没有看到转场,至少一个接一个地是粘贴在一起的,是粘贴在一起的。视频非常好,所以风格上的一致性很高,以至于看起来有转场。我以为有一些小小的缩放,但没有。它们是紧密连接在一起的。是的,是视频的自然运动让我误以为是转场。

呃,嗯,我读一下聊天。Hilu生成音频吗?不,目前唯一能生成音频的是Veo。除了Clink,它有单独添加音频的功能,但它使用了我们曾经谈论过的那个mm audio。既然提到了,我就说一下,因为这可能对你们有用,而且我知道有新人。这个平台,这实际上是一个可以在很多地方运行的小模型,但你们可以在这里免费试用。Mmaudio.net。我分享链接。它允许你上传任何视频片段,也就是我们生成的任何片段。呃,我想它允许你,我不知道多少秒,但它允许你上传几秒钟的视频。你可以给它一个可选的提示,或者留空,它会为那个片段生成音频。它不会像BO3那样生成流畅的语音或对话,但会生成音效,比如,我不知道,有敲击声、爆炸声,任何声音,它都会在图像中感知到并添加声音,是吧?所以,这作为你们生成片段的补充来说很不错。

哦,它有唇形同步吗?我想没有,但也许功能隐藏在那里。我们还有什么?Clan看起来更好。我可以通过API使用Siddance 1 Pro吗?是的,Sidans。啊,看。好的,Sidance有API。太棒了。那么,它可能在某个时候也会集成到Confi中,我们会把它添加到我们的选项目录中。呃,现在当我们转到Confi时,我会在我们一直在使用的流程中向你们展示,呃,那个是图像和视频提示生成链。我现在添加了,这样你就可以选择使用哪个视频模型。无论是Beo、Clean还是你想要的任何一个,主要是出于积分或其他方面的原因。呃,它们是从图像生成的。是的,现在我们要谈谈这个滑雪的例子,因为有一个完整的视频。这只是其中一个片段。你能把刚才的GitHub链接发过来吗?是的,我马上发。让我回到演示文稿。哎呀,我没有添加推文。呃,等等,给我一秒钟。我得去Twitter找它,但我手头有,所以马上就能找到。呃,在这里。嗯,聊天室。呃,然后,Tommy,我不知道你是不是在那里,请帮我复制所有我发送的链接,因为我稍后想把它们添加到课程中,今天今天今天它们很重要,如果不在也没关系。好的,我们走,你在那里。嗯,谢谢。呃,现在我们来看看,哎呀,视频弹出来了,我出不去。好了。我们继续,好了,新功能话题结束了。这是最后一个。Homage AI用于视频同步。这非常适合与本周的新课程联系起来。我不知道你们有没有看过。就是这个,为你的产品提供无限内容。是使用我们上周在直播课上看到的这个Confi流程,那个录播课里也有,它以一张产品照片或一张单一产品照片作为初始参考。在这个例子中,它与我们一开始在Heen的例子中使用的照片相同,并且也自动生成提示,或者我们可以给它一个初始想法,或者用ChatGPT复制、粘贴、哒、哒哒,生成规模化视频,如果在此基础上,我们还可以将自动生成片段与自动化编辑结合起来,呃,那么,我们可以为任何产品生成迷你短片、迷你TikTok,并非常快速地测试它们的效果。这就是我的短期目标,建立一个端到端的流程,用一张产品图片生成脚本视频,编辑它,并让你在社交媒体上快速测试。所以如果你还没看过这节课,我建议你去看,因为它非常好。也就是说,这是我目前正在做的事情,也是我所做的,我接下来要向你们展示的,以及我将继续在此基础上构建的。所以未来的视频很可能是我们在这节课中看到的流程的一个变体或改进。

具体来说,我再举一个真实品牌的例子。这是一个我经常用作例子的品牌,因为它是我的一个朋友的,叫做Bonacera。它销售登山服装,通常是冬季服装,所有都以巴里洛切和山脉为主题。所以现在它从中国进口了我们在这里看到的这些滑雪夹克和这些护目镜,我们也能看到上面的标志。我集中精力,他进行了照片拍摄,呃,就是我们现在看到的这些,然后他上传了一个故事。我上传了一个故事,就是这个,我截了图,然后说:“看看能不能用这张从屏幕上裁剪下来的照片,制作一些有趣的内容来补充真实的图片。”呃,我截取了这个屏幕截图,把它插入到我们在这个视频中看到的流程中,并加入了一些初始想法。基本上我想做的是一个与雪人一起滑雪的日子。雪人,如果你不知道是什么,就是这个雪怪。我不知道其他国家怎么称呼它。嗯,你们看,它有相同的印花,相同的护目镜,相同的带标志的夹克,Bonacera在所有图片中都清晰可见,而且,嗯,我立刻就把它,那个大脚怪我没说出来,呃,我立刻把它变成了视频并进行了编辑。这在字面上不到一个小时内完成。我用这个角色制作了一个短视频,这个角色在所有场景中都保持一致,他的产品带有标志,他的品牌也保持不变。唯一的问题是,在某些地方,它剪掉了夹克的袖子,因为初始图像没有显示它们。所以,有时它会认为那是一件背心,没有什么不能从提示中纠正的。我用这些图片生成了一个带音乐的短视频,也编辑得超级快。唯一缺少的一步是它也能自动化编辑。所以我们来看看。很短,只有15秒。[音乐] [掌声] [音乐]

嗯,虽然有点傻,但考虑到它制作得如此之快,而且是基于一张从Instagram故事中截取的照片,呃,我觉得这是一个非常好的练习,它让我感到满意,因为我看到我花了这么长时间构建的流程能够产生我满意的结果。

我再次建议你们观看这个视频,这节课,其中我基本上一步一步地解释了如何为任何产品、任何故事、任何你们想要的角色制作像我刚刚展示的这样的视频。

好的,那么,我们结束了关于视频主题新功能的漫长课程的第一阶段。我现在举手,如果大家有什么问题,现在是时候了,之后我们就会转到Confi,使用我现在要告诉你们的一个小流程。呃,是的,Rómulo,呃,你好。雪人,你是把它作为Lora加载的吗?不,呃,你看,如果你想,我可以给你看我是怎么生成的,但我只是要求了雪人,它总是生成一样的。说实话,为了保持角色的一致性,背后并没有太多复杂的处理。呃,具体来说,我把这个流程部署在Confidloy上。今天我不会深入讨论这个,但基本上我把它做成了一个应用程序,我只发送变量,它就会自动返回图像给我。我不得不生成好几张,并不是所有图片都完美无缺。例如,我找一张不好的。这张我不知道,它在吃热狗,看起来有点奇怪,但我唯一给它的输入就是这张护目镜的照片和提示,在这种情况下,提示是“雪人戴着那些护目镜和夹克,在巴里洛切的山脚下,Tague小屋旁边,那里卖热狗和华夫饼,它正在吃一个热狗”。也就是说,我的提示是用西班牙语的自然语言写的,就那样,没有多想。照片是产品的,我总是要求它戴着那些护目镜。它也照做了,也就是说,它自动保持了一致性。结果出来了,我不知道是不是巧合,但所有模型都会发现,如果你要求它,我不知道,总是雪人,或者总是nauelito,或者总是一个标志性角色,它总是会这样做,因为这是它训练数据集中所拥有的,或者它学习到的呈现方式。呃,所以看起来GPT Image One,也就是我用于所有这些图像的模型,它将雪人识别为我们现在看到的这个样子,无论你如何要求它,呃,它都会这样生成。呃,好问题,但这个例子中没有Lora。我也没有使用Flux,所以在这个我们正在使用的流程中,我也无法训练Lora。好的,是Image One。不,不,我不知道它是用什么生成的。是的,如果你们想看,我现在就展示流程。现在,现在我们来看看。嗯,没有人举手。不。啊,是的,Jaime,是的。呃,你刚才展示的那个工具,你正在展示的这个,是什么?它叫什么名字?它叫Confid Deploy。好的,你看,我在这里打开主页。它有一个限制,我一开始就告诉你们,以免你们太兴奋。每月1000美元。所以如果你们想试用,我可以借我的账号给你们部署一些流程。它允许你将你在Config中开发的流程部署到这个平台,并通过API执行。也就是说,它将任何Confi流程转换为一个带有特定变量的API,你可以从任何地方执行它。这就是我们用于互动营销活动或构建无限内容生成引擎的工具。例如,这个Morfeo.App。我当时分享的这个应用程序,它允许你上传任何产品的照片,并自动将其生成为风格化的图片,它所做的是将你的图片发送到Confloy中可用的Config流程,并在执行完成后将图片返回给你。如果你们想开发使用Confi流程的应用程序,这是市场上最好的解决方案。由于某种原因,他们决定取消小型用户计划,也就是个人计划。以前有30美元和100美元的计划,现在只剩下每月1000美元的企业计划。我正在和他们谈,因为我关系很好,我从他们两年前开始做这个的时候就认识他们了。所以,因为我们从一开始就认识,他们允许我继续使用每月20美元的计划,这个计划已经不存在了,而且他们从学院就认识,知道这里有很多人在学习Confi。所以,我们正在尝试为Morfeo的学生制定一个计划,让他们可以注册而无需支付这900美元。仍在商议中,正在开发中。我希望我们能在某个时候拥有它,因为这个应用程序确实非常有用,它能让你在我们开发的这些流程上实现飞跃。Sio作为替代方案。我昨天在群里分享了一个,我想是昨天,我没有试过,但是,嗯,首先,如果你喜欢动手,想开始尝试这个,这是一个很好的起点,但这是最好的。也就是说,我研究了所有,尝试了所有可用的,我明白,Pau,它所做的是你在Config White中开发一个场景,然后用这个应用程序生成API,对吗?完全正确。看,我们以这个为例,这是我将要向你们展示的流程。它叫做呃,是一个身份转移,一个即时ID。是的,是的,我明白,我明白。在API请求部分,将显示我们发送的所有请求。如果我点击运行,我就会有我确定要发送的输入字段。在这种情况下,它是一个人的图像。我们来看看,例如,这边的这个男孩。然后作为输入,在我们要展示它的场景中,或者让它出现,或者把它变成我们想要的角色,我不知道,我们可以要求它变成一个海盗在他的船上,诸如此类,现在运行我不知道为什么这里没有显示请求,但是呃你会看到它是如何生成的,当你准备好之后,呃,你就可以下载它或者做任何你想做的事情。在这里。嗯,这些是之前的执行,这个是正在进行的。你们会看到我有输入,我们上传的照片,一个海盗在他的船上,它会显示执行时间,嗯,我给你们看一些例子,例如,嗯,看看,是的,同时举手或者是在聊天里。是在聊天里。是的,之前有一个问题。呃,呃,你见过那个应用程序吗,或者你知道哪个工具可以在Instagram、社交媒体上生成ASMR视频吗?我没记错的话,我看到过一条关于那个的推文,就是我们今天看到的那个。这个,看,我回到这里。Twitter。创建ASMR砧板视频,成本是BO3的5%,使用sed 1.0。音频缺失没问题。用mm audio生成。这就是我刚才告诉你们的,我发的那个链接。也就是说,你用mm audio生成ASMR的音频,而这个视频是用呃sedans生成的,就是我们刚才看到的那个。这个视频看起来相当不错,也就是说,这完全可以是BO3。呃,也可以用BO3完全生成这个视频,并且默认已经包含了音频。我不知道这个看起来分辨率是不是高一点,说实话,为了测试。随便吧。如果你对制作这类视频感兴趣,也许值得一试。好的,好的,好的,谢谢。呃,嗯,回到Confie Deploy,我们已经进入流程了,我们有刚刚生成的图片。我们应该看到我们的角色变成了一个海盗,是吧?所以这就是我将要分享给你们的流程,如果你们想的话,还可以额外添加呃产品。这样,我们今天看到的Hayen Hickfield等所有这些平台,从一张初始图像生成一个UGC视频,如果我们对我们正在生成的第一个图像有更多的控制,就像这里一样,结果会更好,也就是说,我们将能够拥有更多的控制权,这正是我们一直想要的,是吧?所以现在我停止分享标签页,切换到全屏分享,然后我们进入Confi。在我们深入Confi之前有什么疑问吗?我们进展顺利。嗯,雪人那个,你在哪里做的?我没跟上。这就是你现在要解释的,是吧?是的,我是用这些流程做的,也就是说,我基本上是用我们现在要看的流程做的。好的,我们从Instant ID简单版开始,与非简单版的区别在于产品。也就是说,在这里我们只在一个场景中生成一个人,在下一次迭代中,我今天会向你们展示两者,我们生成人和产品。我同时看聊天。有没有不用Confi就能做Instant ID的方法?我不知道,因为,嗯,即时ID平台。通常,身份替换的东西会受到一些监管,因为否则任何人都可以生成任何人的图像,这是一个问题。我想你可以从这里,从这个Hugging Face尝试,但变量都是默认的。Instant ID的优点恰恰在于我们可以把它放到Confi中,并控制我们正在做的事情,调整Dinois,嗯,我们现在将看到,但你可以从这里尝试,也许。尽管Instant ID是一个旧模型,它与Stable Diffusion一起工作,呃,但是,它运行得非常好,所以我仍然在使用它。嗯,这就是Instant ID的流程。和往常一样,第一个模块是提示。我们来改变一下海盗主题。我们放一个宇航员,呃,一个F1赛车手在他的车里,即将开始比赛。哎呀,我已经点击生成了,这样我们就可以看到过程。角色显然是我。那么作为初始输入,我们有两个。场景描述在这个字段中,人物照片在下面的字段中。提示生成器正是要将场景与角色整合起来。我们将发送两张图片,呃,抱歉,不是两张图片,是两项指令,照片加上场景指令,然后我们将要求它通过设计一个提示来将它们结合起来。所以我描述了图像中的主体,以便它一开始就添加头发颜色、头发长度、大致年龄等等,并结合原始场景描述的信息,也就是我们作为场景传递给它的字段,并设计最终的提示,这个提示将是这种风格。我们给它一个好的提示的例子,以便它将这些指令与输入一起作为参考。我们把它传给ChatGPT。这是我们已经习惯做的事情。我们上周在产品照片生成器中也看到了这一点。嗯,这里有我们为要做的这个准备好的提示。它总是以人物描述开头。在这个例子中,它把我描述成一个男人,中等长度的深棕色头发,留着短胡子,20多岁末。然后是场景。以3D渲染动画电影风格,一个中等长度的男人。呃,嗯,我们刚才说的所有内容,在F1赛车中,在起跑线上即将开始,也就是说,它改进了我所说的一切,用英语写了出来,并生成了图像。你们会看到这个角色不像我,虽然有点像,但它总是带有GPTH One生成的那种相似感,让我们看起来相似,但我们不是同一个人。场景的其余部分符合我们的要求。我们在车里,在起跑线上,显然是一名F1赛车手。然后是Instant ID的有趣部分,它进行身份替换,使最终角色确实像我们。它保持场景的其余部分几乎相同,只改变脸部这个区域。相对于我们之前看到的,我稍微简化了一下。这里没有遮罩。由于只有一个角色,因此无需在脸部周围进行裁剪以仅应用于该区域。我们只是将Instant ID应用于整个图像。我会告诉你们唯一可以玩弄的变量是这个,把它保持原样,它唯一做的就是加载模型。它正在加载Shaggernout模型,这是我们用于生成此内容的Stable Diffusion基础模型。它正在加载Lora,样式修改器,但值非常低,以免干扰太多,但确实能改善图像的美感。这里只是在加载模型。提示是从初始字段预定义的,也就是说,从ChatGPT生成的提示中。而这里就是执行这张图片的地方,也就是生成最终图片的地方。这就是我告诉你们可以玩弄的值,也就是Dinois变量。基本上,如果你没有太多使用过Confi或Flux,并且不知道Dinois是什么,它就是我们将注入图像的噪声。呃,也就是说,我们要给这张图片注入多少白噪声,多少修改的可能性,以便它能够融入我们的身份。这个值越大,图像变化越大。也就是说,如果我把它提高到0.8,你们会看到背景的东西,背景的细节,也许还有手,这些东西开始变形。如果我把它设置得很低,那个人就不会改变太多,也就是说,很难让这个人看起来像我。我会告诉你们,平衡点大约是55,但如果你们想让相似度更强,或者让人物更像初始图像,可以将其提高到0.6、0.65,最多0.7,不能再高了,对吧?你们看,我这里用了0.88,它改变了,毁了我的图像。基本上,当值很高时会发生这些事情,而当值很低时,它无法充分改变我。所以0.8就是这样。如果我调到0.3,它会很难让我看起来真的像。嗯,初始图像本来就不好,所以才那么奇怪。但我们现在来看看,用0.3TR应该会不那么相似。当然。你们看,这里相似度提高了。也就是说,我比这张图片更像一点,但我仍然有点奇怪,不像我们看到的第一张图片。呃,看到了。如果我把它设为0.5,0.56,我认为那是平衡点,也是我目前设置的值。为什么这个Instant ID流程,或者我称之为“卡通化”的流程,比以前的版本更好,或者这里有什么新功能?嗯,有两点。首先,提示生成器改进了吗?我们正在使用一个更新、更先进的模型,即GPT 4.1,它更具创造性,也更便宜,并且能更好地理解我们的指令,而且初始参考图像是由GPT Image One生成的,它通常具有更好的一致性,不会出现手指问题,也就是说,通常不会发生像这个例子中那样的问题。呃,我们来看看,我只加一个点,这样它就会改变种子,是吧?其余的,是的,最后这部分,身份转移,和我们之前使用的相同,但那是因为模型是相同的。是的,Milly Boy问,呃,因为我正在做类似的事情,但注入一个控制网络,以便保持整个形状,并且只保持,这样它本身就不会有太大的变化。是的,你可以添加一个控制网络,呃,这里应该在基础图像到即时图像的传递之间。呃,如果我没记错的话,我甚至可以在直播中做控制网络。呃,我们现在来试一下,但它基本上会做的是,我不知道,给这张图片应用一个深度控制网络。它会让你稍微增加Dinois,如果你愿意,图像也不会变形。呃,就像当时我想要的脸部本身的一致性。怎么?怎么?就像是为了让脸部变化更具一致性。实际上,它不会让脸部变化更具一致性。它会使背景中的事物,背景中的组件更加固定。明白吗?是的,是的,是的,是的。好的。呃,我来看看聊天,我看到有一些被遗弃的问题。视频花了我多长时间?我猜是关于雪人的那个。从生成图片、生成视频到编辑,大概花了一个半小时。Camilo问了两个问题。你知道有什么流程可以自动为发送照片的人制作遮罩吗?目的是只替换背景,而不是人物。呃,嗯,你可以在这里添加一个内绘。也就是说,如果你想只在这里生成,也就是说,你在脸上做一个遮罩,其余部分保持Image One生成的样子,你就使用这个Impaind Model Conditioning节点。它在几个流程中都有。我现在不会在直播中做,因为显然会出错,但如果你愿意,之后我可以帮你。要做的事情相当直接。呃,你可以将Contronet和内绘与Instant ID结合使用。它们配合得很好,也就是说,没有问题,性能不会下降,而且能让你有更多的控制。但有了这个,我想你会没问题的。我不知道,除非你的具体情况需要遮罩,否则我会建议你先试试这个。第二个问题。你知道Facewap或Reactor发生了什么吗?最新的更新不再能整齐地改变面部。像以前一样。我没看到你发到群里。我不知道它是不是坏了,也就是说,他们是否进行了一次更新导致它坏了,或者他们是否因为深度伪造问题而限制它,或者我们只是有一个过时的Confi版本,无法与这些模型良好交互,但我不知道具体发生了什么。看看,这里还有其他问题吗?还有其他方法可以做Instant ID吗?这个我们已经回答过了。我正要问,它在没有遮罩的情况下检测面部吗?是的,这里实际上没有遮罩,也就是说,我们可以添加遮罩。在这种情况下没有必要,因为Dinois值较低,也就是说,55的Dinois是一个中等值,但相对来说仍然较低。如果我们比较一张图片和另一张图片的背景,你会发现它改变了一点。也就是说,我不知道,你们在这里看到上面的灯光,看到旁边的人。我们可以说它“恶化”了,因为它是用Silusion生成的图像,会丢失一些细节,有点幻觉,但由于值较低,对于大多数情况来说,它不会造成太大困扰。如果我们想制作遮罩,呃,我们有之前在父亲节活动中使用的直播课程中看到的流程,在那里确实在脸部区域自动生成遮罩,并且只在那里应用Instant ID,但是,嗯,这会增加一些复杂性,需要使用Segment Anything Model来生成遮罩,就像添加几个中间步骤,如果你们想看,我们可以看看。我想和你们分享这个简化流程,对于新手来说,它会更容易尝试。也就是说,这只是呃移动两样东西,它就自己运行了。如果我们添加遮罩等等,安装所有东西会更困难,但是,但是可以做到。甚至你们提到的所有东西都已完成。如果你们需要,就告诉我,我会发给你们。平均来说,生成一张这样的基本Instant ID图片会花费多少积分?Instant ID不是通过API的,也就是说,这是免费的。呃,如果你可以在本地运行它,那是100%免费的,因为Stable Diffusion是一个开源模型,你可以下载。也就是说,我下载这个Shaggernout文件,它和Instant ID文件一样在我的电脑上,我可以无限生成。也就是说,流程的这一部分没有成本,只有这两个地方有成本,提示大约是2美分。这些图片我正在以中等质量生成,这里是7美分。但我可以把它调到低,也就是说,以低质量生成,它也有效。也就是说,我们可以在提示上花2美分,在图片上花2美分。哎呀,图片2美分,也就是说总共4美分。所有这些都是免费的,而且图像看起来仍然会很好,因为即使这张图像是低分辨率的,但由于我们添加了50-55%的噪声,并且使用Stable Diffusion生成,呃,它仍然能够保持。嗯,这是低质量的图片。显然,构图上可能会有一些错误,但之后当我们应用Instant ID时,它似乎又恢复了细节。看看头发,它看起来分辨率不低,而是很好。所以,这让你能够非常便宜地制作初始图像,同时保持GPT One的良好构图,但使用最便宜的模型,也就是带有低变量的模型,基本上可以更快、更便宜地生成。呃,所以这是一个非常便宜的流程。只需4美分,你就可以进行任何身份转移。呃,还有一个问题。对于背景,我使用了Photorom,它很棒,不会修改产品或人物。它只根据提示生成带有光影的背景。呃,我从来没试过。看看,它是怎样的?Photorom。那是什么?一个应用程序?一个模型?啊,看看。看,我不知道这个。我分享一下,以防有人需要。嗯,我们回到我们的流程。我们再生成一个不同背景的变体,如果你们有什么问题,可以随时问我。我们现在看到的这个工作流,这里的部分将保留在今天的直播课中,像往常一样附在下面。如果你们在本地工作,你们将需要安装Instant ID的节点,下载模型,就是这个,Diffusion Park Py Torch Model。Shaggernout和Lora,并安装Inside Face,群里有一个视频解释了如何操作。我也会把它和这节课一起留下,供那些想在本地工作的人观看,这将使他们能够100%免费运行这个。如果不是,你们可以直接把它加载到社区pod,Morfeo的pod中,所有东西都已安装好,可以直接使用。当你们什么都不用做的时候,直接连接你们的账户,这样在生成图像和提示时就会消耗你们的积分,然后就可以直接使用了。那是测试它的最简单选择。我说的所有这些都会写在课程中,在下面的指南中,以便你们记住。呃,呃,有人,问题是,问题是如果一个人拍了一张照片。Camilo,我不知道你是不是在说话,我把你静音了,因为我以为你没有。呃,Alberto,是的。一个问题。更改衣服的API,ChatGPT的那个已经上传了吗?更改的API,啊,你说的是Google的。嗯,ChatGPT没有,ChatGPT有。是的,ChatGPT也有,是吧?也就是说,这个是ChatGPT的图像生成API。所以你可以用它来给人们换衣服。是的,是的,用这个。我们已经试过几次了。是的。现在我们做一个,但是作为API,对吗?不,不,不是作为。是的,是的,作为API,但是你到底想做什么?不,一个品牌想要你的系列,让人们进来试穿衣服,那么显然他们需要拍一张全身照之类的,然后试穿一个虚拟试衣间,可以这么说。是的。呃,它有效,如果我们补充它,它会稍微破坏角色的一致性。Instant ID你可以保持,如果你想放进去,但是,好的,太棒了。呃,现在我正在做这个小流程,Camilo,你现在确实举手了,抱歉,我把你放下了,我以为你在外面说话。呃,是的,一个问题是,如果一个人想以不同的姿势拍照,而且最好是她本人完全不干预,如果照片中有人,并且只替换背景,这有可能吗?我听得不太清楚。我没有完全理解。也就是说,这个想法是,一个人呃,也就是说,输入的图像是实时拍摄的照片。是的。是的。那么就会有很多用户,他们会有不同的服装、性别,是吗?各种各样。我当时在想,是否有可能对人物进行遮罩,而只将指导应用于背景。是的,那个用花,用什么来着?用Segment Anything Model。你知道我说的那个吗,是的,Segment的那个。我当时在想那个,但那让我思考,因为那样就得去找遮罩。遮罩是自动生成的,对吗?但Segment所做的就是自动遮罩。啊,这是一个特殊模式。这就是我们一直在用的。呃,看看。啊,是Sam。是的,是的。呃,嗯,我找不到那个节点,但你可以在提示中告诉它你想要遮罩什么。也就是说,如果你想遮罩人物,你就说人物、人、人类、手臂、脸,我不知道,任何你想要的。它会为你自动生成遮罩,然后你就可以在遮罩的相反区域进行生成。好的,如果你选中了人物,使用反转遮罩,也就是说,从某种意义上说,它已经检测到是否是人类,因为前景是人类。你在这里输入人类、人物、男人、女人,所有这些。它会检测这些东西中的任何一个,并根据阈值进行调整。呃,越高越宽松,越低越严格。必须是

准确地说是你输入到提示词里的内容。啊,太好了。明白了。那就是我的啊,好的。至于 reactor,我不知道你有没有继续使用以前叫做 Pap 的东西。关于什么?嗯,那个自定义 reactor,以前叫 squad。是的,我看到那个坏了,但我不知道,我用得不多,所以不确定为什么。我没去研究它。啊,明白了。那么,没有更多问题了。谢谢。不,我不知道我是否能找到,如果我找到任何替代解决方案,我会分享给你们。嗯,我还有别的事情,我正要做什么,我忘了是什么了。好的,没什么,关于这个流程有什么疑问吗?我不知道你们是否对身份转移这个话题很感兴趣。我想你们更多是关注产品,因为我做过几次调查,但是啊,我们来谈谈这些版本的最后一个,就是将产品与人物结合。这样我想我们就结束了。我看看演示文稿里是否还有遗漏,但我想应该没有了。

好的,这就是我刚才说的,我们现在要看的内容。例如,就像我们刚才生成海盗人物一样,现在我们将使用 reban meta 或在特定背景下生成海盗人物,比如在,我不知道,在巴里洛切,在河边,在森林里,嗯,还有一罐能多益巧克力酱。有了人物加上产品,没有什么比能多益更好的了。说真的,我想不出更好的了。

好的,你们似乎听不到音频,但我们使用了课程开头讲过的内容。嗯,通过组合两个角色。我当时是怎么组合两个角色的?我正要做另一个屏幕吗?你上传了,你上传了两张图片,嗯?一张是你朋友的,一张是服装品牌的,还有一张是一个女孩的。啊,是的,没错。它在这里。它在这里。我忘了。嗯,好的,谢谢。好的,好的,好的,好的。嗯,来吧。好的,快速测试一下。这就是让图片一中的女性戴上图片二中的护目镜和夹克。嗯,但这从我们拥有 Open Open AI 的 API 的第一天起就可以做到。在这个模型的介绍课上,我们做了同样的例子,不是用这些照片,而是用同样的逻辑。所以之后,阿尔贝托,如果你愿意,可以给我发消息,我会把确切的链接发给你。

嗯,当我做这样的流程时,Chat GPT 有时会添加电影般的噪点,而 Instant ID 看起来非常干净,变化也很明显。你是否也遇到过用 Upscale 变得干净,但流程开始变得非常慢的情况?是的。而我,当你想要真实感时,我总是把卡通人物做得有点皮克斯风格。当你追求真实感时,Infinity U 效果更好,它直接与 Flux 配合,而不是与 stable diffusion 配合。我正在找它。这是在哪里?我们以前也见过,但就是这个,和兔子合影的那个,它生成图像的流程风格相同,然后进行身份替换,但你看这里,我不知道,嗯,很明显,因为头部大小或形状有点奇怪,但它比 Instant ID 更具真实感。我还是更喜欢 Instant ID。我宁愿牺牲一点真实感,更好地保持身份,或者,嗯,我不知道,我更喜欢它,但这只是个人喜好问题。这里照片是写实风格的,所以需要用 Infinity U 进行转换,之后也不需要进行放大。也就是说,这不需要放大,是相同的流程逻辑,但在这里,嗯,我们看到了,戴着护目镜夹克的女孩。它保留了海滩背景。我们可以说这是一个近距离交换或虚拟试衣。

是的,在这种情况下,因为看不到脸,所以效果很好,但如果我们想保持身份,例如让一个人认出自己,我们就需要让流程复杂一些。嗯,我想你问的或者我们当时看到的,Google Clot Swap,我不记得叫什么了,但 Google 购物,我没有打开任何一个。好的,谷歌推出了一项功能,正是为此目的,它还允许你购买你喜欢的服装,这个,虚拟试穿,也就是说,这将像吞噬市场一样,因为它来自谷歌,而且他们将推出一项原生功能,可以与任何电子商务平台集成。还没有发生,但应该还需要几个月。这就是我刚才问的。当然,你是说这个,对吧?但这是谷歌的,不是...啊,好的,好的,抱歉。当然。嗯,我不明白它还没有发布,我们应该会知道的,但是,嗯,等它发布了我会告诉你们,那将是本周的新闻。

Photorom 通过虚拟模型集成。检查一下。虚拟模型是什么意思?我需要看什么?Paulí 的意思是它正在集成,还没有应用于所有 Photoroom Pro 账户,但它正在集成到 AI 工具中,你可以上传服装照片,它会将其放置在它自己的虚拟模型上。啊,好的。Swap 的功能也在这里。那个。嗯哼。是的,那个。嗯。我不认识这个 Photorom。我之后会看看。但是,是的,用于产品定位。我理解它会裁剪你的产品并将其放置在一个场景中,然后生成周围的一切,包括阴影等等,对吧?嗯,我猜是这样。就是那样,就是那样。

嗯,好的,举手。阿尔贝托,我不知道你是不是之前就举手了,还是想再问点什么。不,它在那里,能听到。是的。嗯,好的,我,我是新手,我想问一下你提到的关于价格的问题,你谈到了一些价值两美分的流程之类的。这是,嗯,使用每个 AI 引擎的成本,还是因为我们按小时支付租金?不,这取决于我们使用的模型。例如,在我打开的这个流程中,我正在使用 Open AI 的模型,并通过 API 执行它们,这意味着我正在进行的查询或我正在生成的图像不是在我的电脑上,在我的显卡上生成的,而是在他们的服务器上生成的。我向他们发送我的输入,然后说:“嘿,我需要你用这个提示词生成一张图片。”他们告诉我:“好的,我为你生成,但我要收你这么多钱。”他们把图片返回给我,并从我 Confi 账户中充值的积分里扣费。嗯,这是下面的小轮子,user 用于登录,credits 用于充值。这是通过 API 执行的替代模型,例如 GPT Image One 或我们这里的 Chat GPT、Gemini 或其中任何一个。或者 Clink,例如,我在这里使用 Cllink,它每个视频收费将近 1 美元。嗯,如果你看我们讲这些视频的课程,我总是说:“它们多少钱?Clin 或视频接近 1 美元,图片 10 美分,取决于你使用的功率,聊天很便宜,2-3 美分。”然后另一种选择,就像你说的,是我们是否在云端使用租用的 GPU,并使用像 Flux 这样的开源模型,它是免费的。在那种情况下,我们只支付 GPU 的租金,它将进行处理,如果我们正在云端工作,或者如果我们正在本地工作并且拥有一台足够强大的设备,那么它就是免费的。

完美。现在,最后一个问题。这个,嗯,例如,我可以在你展示的这个地方使用 Open 的 GPT 引擎吗?是的。好的。那么,我大概是按小时付费,对吧?为我生成的每样东西付费。在这个社区版中,你不需要支付任何费用,也就是说,你只需要支付你消耗的积分,但这个 GPU 的使用,也就是说,你可以进入你在免费课程中获得的这个链接,并且可以使用它,而无需消耗任何积分,也无需支付 GPU 计算费用,因为我正在支付,如果你使用 Flux,也无需通过 API 执行。如果你想使用我刚才展示的这些模型,你可以在这里加载工作流。看,我来做个例子。嗯,产品,等等等等。好的,这是我们将要看的一个流程。它会自动打开所有内容。这些节点我不需要,所以我直接删除它们。我这里已经连接好所有东西了。你需要登录才能使用你的积分,然后这部分,也就是使用本地处理的部分,是免费的,因为你正在云端工作。所以,你会在那里花钱,而这部分是免费的。完美,完美。谢谢。不客气。好的,当然,如果你正在租用 GPU,这里所谓的“免费”,实际上你将按小时支付你租用的 GPU 的费用。

好的。嗯,制作团队,我不知道 Demi 在这里怎么样,Demi 和 Esteban。嗯,有个问题,嗯,我们才刚开始,所以我要把你带回 1000 步之前。嗯,我整个下午都在尝试用 inpainting 让一个角色举手,但我没能成功。好的。即使 Dinois 值很高也不行。即使 Dinois 值很高也不行。我不知道你那里有没有图片。我可以说出我当时尝试的图片是哪张,嗯,我不知道我有多少历史记录。看看,是这个吗?不。不,再往下。是一个蜘蛛侠女人。再往下一点。你认出这些了吗,好像你来过这里。是的,那些摩托车是我生成的。等等,但不是那些,是再早一点的。好的,如果你看到了,告诉我。再往下一点。再往下一点。是的,是的,是的。我再告诉你一点。生成了多少?他们用它。嗯,这上面应该都是今天的。我只能到这里了。嗯,我认出这个。啊,再往后就不行了。不,在那里,在那里。在那里。就是后面有耳环的那个。啊,这个。不,不是那个。等等,往下一点。这个。啊,那个。好的。你看到它有手臂吗?我希望手臂和蜘蛛侠一样,但它就停在那里。我无法用 inpainting 解决这个问题。好的。第一个技巧,ininting 的遮罩要夸张一点,也就是说,不要像这样太多,但要多留一点边距。现在,我们现在就试试。啊,你是想让它直接举起手臂。是的。没错,没错。让手臂和另一个手臂在同一个位置。你正在做的那个我也试过,但没成功。我不知道是不是我碰错了什么。我们来看看你当时在做什么。替换绘制区域。这里实际上我只会说“举起右臂”。也就是说,不要给它指令。也就是说,这里写着替换等等等等。这里告诉它你想生成什么,也就是说,你想直接生成一个右臂。向上直指天空。保持。这个我甚至不关心。我们只用这个。Loras。你的 Dinois 是 90。我们来设置一下,看,如果你设置为 1,所有这些被涂抹的部分直接就是白噪声,也就是说,它就像一张新图片一样开始,也许会奏效。然后我们开始降低,看看能降到多低。然后,这同样是我的错,因为课程中的流程没有更新,你正在使用的 inpainting 不是最新的。在这个文件里,也就是更新的 B4 版本,下面有一个叫做 New in Painting 的,它效果更好,因为,嗯,我想它还没到。我没看到这个。我没在,也就是说,我下载的是课程里上传的那个。是的,它也应该能用,也就是说,我们现在来看看效果如何。哎呀。嗯,好的,它没有成功。现在我们把它放到另一个流程中,但如果它也成功了,也就是说,逻辑是一样的。我要下载图片,然后在那边做。嗯,这个原始文件中的 inpainting 和这个新的 inpainting 之间的区别是,前者是由社区开发的,也就是说,是 Flux 刚发布时,开发人员创建的这个 inpainting 流程。而我们现在看到的这个是与传统 Flux 开发不同的原生模型。你看它叫做 Flux Fel,由 Black Forest Labs 开发,他们是 Flux 的开发人员,嗯,他们在 2024 年 11 月发布了一个叫做 Flux Tools 的东西。课程中有一节课我们安装了 Flux Tools 并讨论了这个主题,但基本上它是由模型创建者开发的 inpainting,它与文本配合得非常好,基本上比这个文件中的 inpainting 更好。嗯,所以我要用这个做我们刚才做的事情,看看它是否能正常工作,嗯,这可能是一个解决方案。我必须更新那个文件,这样这个 inpainting 就会直接被新的 inpainting 替换。但如果那是我的错。好的,在我生成这个并看看效果如何的同时,我继续举手,因为我们已经准备好了。

来吧,我能再问一个问题吗?是的,告诉我,嗯,我可以在哪里知道,嗯,某些流程对应什么,因为我有些东西正在尝试在本地处理,但我不能使用与云端相同的引擎。所以,例如,我下载了 Flux Q4,幸运的是,多亏我问了 GPT,我找到了一个确实有效的流程,我不得不更改采样器和其他一些东西,嗯,我不知道我可以在哪里获得这些信息,或者我怎么才能找到,或者我每次有关于模型的问题时都直接问你,你说不,当我使用新的引擎,新的模型时,用什么采样器?我怎么知道我必须使用哪个采样器?我必须使用什么?从这个意义上说,因为我明白并非所有东西都与相同的东西一起工作。你尝试使用了什么,例如,与...不同?哎呀,我弄错了地方。例如,如果你现在去文本到图像,如果你选择将 flux 更改为 Q4,它就无法运行。好的,你这里没有。当然,那是因为你这里有这个 clip,它是用于 Q8 的。实际上,说实话,我没有尝试做太多混合。Q4 也会大大降低图像质量,你知道吗?不,不。是的,是的,当然。但这是我可以在本地运行的,因为我的显存不到 12 GB。完美。嗯,不,是的,说实话我会问 Chat GPT,如果不行,我会尝试这里有的。我会不断更换。也就是说,通常这个是固定的,bit L,你可以在这里尝试其他一些,也就是说,FP8、FP16 或 Clip I 是除了这个之外常用的。嗯,你想问我吗?因为你在构建流程时,有没有什么参考资料,或者你是怎么解决的?还是你只是尝试?看,大概就是这样。嗯,不,不,现在已经有点凭直觉了,对吧?我没有参考资料,但你可以用这些。你在这里浏览模板,你这里有 flux,有 flux dev,flux schnell,flux impaint,也就是说,你这里有它们,如果你打开它,它就已经配置好了。好的,这里排序不同,但你总会在某个地方有检查点,你应该有剪辑。好的,这个不是一个好例子,但没关系。如果你没有这个页面,Confi Anonyus,嗯,在哪里?Confi Anonyus,不,这不是我想要的。Confia Anonymus Workflows。为什么没有出现?好的,有一个叫做 Confia Anonyus 的页面,里面有每个流程的所有原始模板。嗯,它不存在了。我不知道这里发生了什么。例如,你有,嗯,配置示例,所有工作流。它说 Flux Schnel,你下载这张图片,它就有已经配置好的所有剪辑的工作流。我明白了。嗯,取决于你想用什么。这个是用于 dev 的。这个是用于 schnell 的。这里你有 FP8 而不是 Q8,那是另一个版本。嗯,好的,另一个 fluxel。这里你开始使用 inpainting,也就是说,这里你有像原始的,嗯,Redux,它是 flux tools 之一。我还会告诉你,这里这是一个很好的起点,我不知道为什么。看看。太棒了,谢谢。不客气,如果还有任何疑问,可以给我发消息,如果我能帮上忙的话。

好的,在处理那些我看到还有人举手的问题之前,它在哪里?刚才它还工作着,那是另一个工作流。它去哪了?在这里,嗯,它帮我做好了。手指上有没有小错误?现在就看如何调整 Dinois,嗯,步数,步数,不,抱歉,Dinois,嗯,种子和其他东西了,但基本上建议是,使用新的 inPainting,它会解决你所有 inPainting 的问题。好的吗?嗯,你之后会在页面上替换它。是的,是的。嗯,看看,Oki 吗?不,好的,是的,之后我会替换它,下课后我做的第一件事就是这个。同样,你也有这个文件,嗯,抱歉,我给你看看它在哪里,以防万一。它就在这里,写着“更新的流程”,flux flux soling one,就是那个 B4 flux soling one。也就是说,这是文件最更新的版本。你可能正在使用版本一或二,嗯,但是,是的,我正在使用 B1。是的,嗯,是的,抱歉,我的错。那个,我甚至现在就修改它,然后就好了。嗯,当然,不,我记得我为什么留着它了,因为这个安装不会安装 Flux Tools 的东西,而那是 new in painting 所需要的。所以,这将在本模块的后面部分看到。也就是说,这里有 Flux Tools 的本地安装和 Rampod 安装,以及我们在这个新工作流中使用的所有东西。所以才会有旧版本的 inPainting,嗯?但如果你在社区版中工作,所有东西都已安装,你可以直接加载工作流。是的,这有点令人困惑,抱歉。来吧,谢谢,没关系。

好的,我们来处理举手的问题。嗯,Rómulo,或者我刚才正在和 Rómulo 说话。不,我有一个关于 Chat GPT 的问题。好的。嗯,我订阅了 Chat GPT 的专业版。这个订阅可以用来,嗯,把它包含在 Confi 的流程中吗?不,嗯,Chat GPT 的计划只适用于从 Sora 或 Chat GPT 工作,也就是说,从这里。你不能把那里的积分转到 Confi。所有通过 API 执行的操作都需要单独付费。嗯,你可以从那里在 Platform AI 生成你的 API 密钥,在这里查看你的使用情况等等,但它是在这部分,从你的账户管理。你甚至可以拥有,我想即使是免费计划,你也可以使用应用程序,按执行付费。这是另一种使用模型的方式。好的。

嗯,海梅,是的,嗯,我告诉你,我有一个,你那里有一个 N8N 的场景是打开的。嗯,我有一个场景,嗯,我现在就可以通过聊天发给你,它会自动用 BO3 生成视频。如果你复制粘贴并导入到 N8N 中看看,我刚收到,它会自动生成非常酷的视频,你们不会相信的。我正从卡亚俄出来,一些海报制作者盯上了我,我发誓。看,看,他们跟着我。你看到了吗,嗯?是的,我看到它有点小,但我还是看到了。嗯,你说是 Be3 的视频。是的,我还没有打开它,因为我问了一个刚把它上传到 Instagram 的小伙子,他把视频和场景都发给了我,那是因为如果你打开它并看一眼,你需要点击文件。正在导入下载。我来了。同样,我想我们现在不能测试它了,因为肯定需要安装。是的。需要连接 BO3 的 API 和所有东西。看看需要连接很多东西。我不是,但是,嗯,我把它留给你,如果你想看一眼,好吗?我刚收到。没什么,如果它对你有用,你知道吗?来吧。我把它打开,至少看看里面有什么。我测试一下,下周我们再看。如果它不错的话。如果你也测试了,也分享给我,嗯?好的。是的,是的。我我会把它导入到 N8N 中,然后慢慢看,好吗?那是因为如果你能控制它,你会告诉我:“哇,看起来不错。”或者你只是告诉我。看看。这个不行。啊,好的,我现在把它加载完。我来处理最后一个举手的人,同时我正在加载这个。

阿莱霍,你好。是的。嗯,我对所有与 AI 相关的东西都比较陌生,直到这周我才开始上课等等。所以我想问你一个不太具体的问题,那就是,我们今天可以用 image to 4D 工具做什么,例如,直接从 Blender 编辑?例如,让它为我制作 OBG,然后我在 Blender 中编辑它,这样我就可以做任何我想做的事情。你说的是 4D 还是 3D?好的,嗯,我想那是 4D,对吧?好的,或者 3D,但用于在 Blended 中处理。是的。你已经测试过这部分了吗,嗯?不,不,说实话我没试过。这些模型也可以通过 API 执行,哎呀,实际上我想打开另一个,抱歉,它们允许你直接从图像或文本加载并创建对象,你可以使用它并将其带到 Blender。如果不是,我们现在看看我成功加载的那个小流程。嗯,嗯,我向小组推荐了一个视频,等等,因为直到我记住这个名字怎么拼写。啊,我登录错账号了。有一个人对所有 3D 相关的东西都非常了解,我向你们推荐他,因为这个 Mic Moonpits 非常棒,他频道里的所有视频,但主要是从现在开始的这最后三个视频非常好,关于这些东西,也就是说,例如我刚才向你展示的这些模型,你可以直接从 Confi 使用模板执行。它们不会给你那么精细的纹理,也就是说,没有那么多细节,嗯?而他定制的这个工作流,我想你需要订阅他的 Patreon,但大概是 5 美元左右,你就可以下载。它允许你直接制作高质量的纹理,将它们融入场景,在 Blender 中,或者任何你想要的地方。也就是说,看看这个视频,我想它会超出你的预期。它真是令人难以置信。啊,看,Tommy 好像抢在我前面了。好的,嗯,你这里都有。最先进的 3D 模型是刚才出现的那个,等一下,Jung 3D 2.0,它不是这里有的模型之一,也就是说,我们无法像这个一样通过 API 执行它,这个更容易一些。也就是说,我们这里有一个叫做 Rodin 的,另一个叫做 Tripio 的,它们都不错,但最好的是 Junang 3D,它是开源的,很好因为它免费,但你需要手动下载模型并知道如何安装它,或者,嗯,或者在云端工作,因为我,例如,在这里用 Mac 甚至无法运行它作为推荐。所以,这个模型,Hun 3D,是最好的。如果你想要更简单的,你可以使用 Rodin 或 Tripio,它们已经在这里可以通过 API 执行。如果你想要更高级的,也就是说,今天在 AI 3D 领域最先进的是这个 Mick Chumps 或我不知道他叫什么名字的人的频道。好的,谢谢 Paul。嗯,嗯,主要是为了结束,我的想法是,我能把那个 3D 模型变成碎片,然后把它变成一个真实的毛绒玩具。好的。是的。也就是说,我觉得让它真正做到这一点有点复杂。我觉得人类必须在背后做很多工作才能制作出所有的部件,对吧?是的。说实话,我根本不是 3D 专家,也就是说,我只是在 Confi 中测试了 3D 流程。是的,我玩了一会儿这个 Tripio,它会生成你在这里看到的东西,但那些小玩偶,嗯,你可以把它们带到 Blender 或其他地方,添加纹理等等,但这并不是我最了解的领域。好的,非常感谢。

好的,没有更多举手的人了,我不记得了。好的,我还有这个。是的,我刚刚也导入了它。乍一看你觉得怎么样?如果你进去看看。看看,一个 YouTuber,这将是初始输入,一个在罗马的 YouTuber。这将根据你给出的内容生成提示词。它正在使用 BO3 的 replicate API 来生成视频。也就是说,它要花 1 美元。我不记得是按视频还是按秒计费了。我觉得是按视频计费,嗯,但很贵。也就是说,这正在使用 replicate。是的,对吧?嗯,我们见过这个,但看这里。BO3 每个视频 8 秒。也就是说,每个视频要花 1 美元。它所做的只是构建一个提示词,也就是说,它做的事情很简单。你给它想法,它生成优化后的提示词,然后发送给 replicate。然后保存 ID,也就是执行 ID。每 15 秒查询一次视频是否生成完毕。如果没有生成完毕,等待 15 秒再次尝试,一旦完成,下载视频并保存到云盘。它非常简单。说实话,它没有太多魔力。是的,是的,是的,是的,是的,是的,是的。但是,是的,是的,也就是说,它兑现了它的承诺,它以昂贵的方式做到了,并且只为你生成一个 8 秒的片段。它甚至没有串联一个故事。

你你非常习惯使用 N8N。你更擅长 Confi 吗?不,我更擅长 Confi,但如果你想要自动化视频,我们当时也看过了。我有一个你可能会喜欢的工作流。这个,这是专业版。是的,那个,那个我拿了并下载了。我们是的,抱歉。我们有一家人工智能机构。是的。而且,嗯,我们所做的是更专注于客户服务助理的开发,你看,我给你看一些例子,让你看看我们在 N8N 中有哪些开发。来吧。我喜欢这个的原因是,生成图像或视频的部分你可以替换成你自己的 Confi 自定义流程。所以,例如,我今天展示的雪人,嗯,你可以使用那个模型和这里的视频生成,并将其自动化,定制得很好,而且比使用 BO3 的 API 便宜,BO3 的 API 会让你大出血。当然。看,我给你分享一下屏幕。看看,我们做其他开发,但专注于另一个利基市场,例如客户服务助理的开发。你看到我的屏幕了吗?是的。你看,我们做这个,这种开发,我做音频、图像、文本、嗯,数据库。这里有一个 Redis,然后我们通过 MCP 连接到代理,然后,嗯,我们以链式格式发送消息,大概让你有个概念,就是这些,你知道吗?看看它到底解决了什么,也就是说,例如,有人通过 Instagram 给你发消息,它会回复问题。那是,我们更专注于 WhatsApp。我们擅长 WhatsApp,例如,告诉我你的服务,它会发送所有服务给你,嗯?好的,这些是测试对话,但我可以给你看一些真实客户的,他们最常雇佣我们的是预约,看到了吗?它会返回预约,我想取消,嗯,它会取消,它会给你一个预约摘要。所有这些都是 WhatsApp,你知道吗?我们将其植入对话面板中,因为当我们使用 WhatsApp Business API 时,正常 WhatsApp 的访问权限会被限制,我们必须将其植入对话面板中。所以,嗯,我们知道它,但不是在你用图像和视频做的那个领域,而是在其他一些领域。是的,我更专注于内容方面,而不是自动化和这类事情,但我觉得它非常有趣,对我正在涉足的领域是一个很好的补充。所以实际上,实际上我们,例如,与电子商务合作很多,嗯,例如,在电子商务中通过 WhatsApp 向客户发送生日祝福的自动化。嗯,我们还生成所有产品的短元描述、长元描述、短描述、长描述,这就是我们所做的。事实上,我的合伙人,嗯,我不知道你那里有没有打开 YouTube,如果你搜索 Javi Manzano,他就是我的合伙人,我们两个,嗯,我们两个经营着这家机构。嗯,多亏了他的个人品牌,我们才有了所有的客户。我不知道你有没有在 YouTube 上见过这个人。我在那里搜了,从来没见过,这是我第一次看到他。我来分享屏幕,如果你们看到和我一样的东西。嗯,但是,嗯,你做了销售推介。是的,如果你打开 WhatsApp,给我发个消息,然后我再给你写信,因为我当然想在我的业务中做一些事情,而且一起合作可能会很好。所以发个消息给我,这样我才能找到你的号码,因为我刚才找你,但没有,是的,我上次给你发消息了,问了塞萨尔的电话,你记得吗?不,也就是说,我每天和很多人说话,他们混淆了,但现在给我发个消息,如果我明白你是谁,我就直接把你加到日程里。好的,好的。现在,我现在给你写信,Pau。来吧,谢谢你。再见。

好的,我想我们今天就到这里。这应该是我开始以来最长的一节课了。已经 2 小时了,嗯,感谢那些坚持到最后的人。人不多,但都是最棒的。所以谢谢你们在这里。我们今天就到这里,好吗?我们告别了。[音乐]