Transcription
AI 唇同步工具非常重要。无论您是想讲故事的 AI 电影制作人,还是需要为您的项目制作 AI 化身,如今市面上有太多不同的 AI 唇同步工具。您如何判断哪一个最适合您自己的特定需求?所以,我所做的是,我去了所有最好的 AI 唇同步平台,创建了相同的角色对话同步,这样我们就可以看到哪个是最好的。在本视频中,我将详细介绍价格、质量以及在花费金钱购买 AI 唇同步工具之前您应该了解的任何其他信息。>> 区别在于我们终于谈论它了。>> 我将测试的第一个唇同步工具是 Dreamina 的 Omnihuman 模型,它今年早些时候因其 AI 化身的外观富有表现力和逼真而引起轰动。但让我们看看当我们将它付诸实践时它表现如何。Omnihuman 模型通过 Dreamina 的网站访问。我们所要做的就是登录,然后在创建选项卡中,我们需要选择 AI 化身工具,在那里我们将使用唇同步功能。这个唇同步有几个部分。第一个是我们想要添加对话的 AI 角色的图像。所以,在这种情况下,我生成了几个不同的角色。一个用于这个女人,一个用于坐在酒吧里的男人。我将让他们互相交谈。我们还需要角色的对话音频文件。您可以使用任何文本转语音 AI 来生成音频,或者直接录制您自己的声音。在这种情况下,我使用了 11 Labs。我所做的就是输入我希望角色说的对话。我为他们选择了一个声音,然后我可以在这里生成语音。所以,我们可以预览一下角色听起来会是什么样子。>> 你真的独自一人来到这里。没有支援,没有侦察。那么你已经知道结局了。>> 所以,让我们回到 AI 化身工具。嗯,我做的第一件事是上传我的化身图像。在这种情况下,我将从坐在酒吧里的女人开始。然后我将上传我之前创建的 AI 对话到这个语音按钮。现在,对于音频,如果您点击语音按钮,您通常可以选择在唇同步平台本身内生成 AI 音频。但为了保持一致性,我将上传我自己的音频文件。一旦上传,我还会确保我使用的是 Avatar Pro 模型,看看使用最高质量模型时会得到什么。让我们开始生成吧。>> 你真的独自一人来到这里。没有支援,没有侦察。>> 所以,它已经完成了我们角色的唇同步创建。我使用这个工具生成了整个对话场景。让我们来看看,之后我会进行全面分析。>> 你真的独自一人来到这里?没有支援,没有侦察。>> 我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 你也可以这么说。在酒吧里大声谈论叛乱,离兵营这么近。这是消失的好方法。所以,Fumia 的 Omnihuman 模型非常有表现力和逼真。比如,唇同步与他们所说的词非常准确。我遇到的主要问题是,有些角色,他们表现得有点过于夸张。比如,我让这个女人小声说话,几乎是用耳语般的声音,你可以看到她的嘴巴张得多大,她的头部动作有多夸张。>> 这意味着独自前来意味着你不指望离开。这应该是一个安静、悬疑的酒吧场景,但你看他们的面部动作有点太夸张了。这有点吹毛求疵,但确实是我遇到的一个问题。我还想在一些非人类角色上尝试一下。所以,在这种情况下,如果我有一张外星人的照片,比如这个家伙,唇同步在他身上会表现如何?>> 事实是,当某些东西开始腐烂时,你不会放任不管。你会把它切掉,以免它蔓延。我认为这相当不错。我的意思是,他根据声音中的情感移动面部的细微之处。同样,主要问题是,有时这些角色似乎有点过于夸张了。但总的来说,我认为质量非常好。你会在 Dina 那里遇到的主要问题是成本。这是一个极其昂贵的模型。呃,我目前使用的是标准套餐。生成 60 秒唇同步需要近 20 美元。所以,这取决于您的预算,这可能有点贵。而且市面上肯定有更便宜的选择。我正在测试的下一个唇同步平台是 design。他们有一个唇同步功能已经有一段时间了,但他们最近对其进行了一些重大更新。所以,让我们试试吧。在 Design 中,您要做的是创建一个新项目。您可以在此处的工具栏上找到唇同步功能。现在,里面有几种不同的模式我们可以使用。为了获得最佳效果,您需要上传一张脸部图像。所以,我将拖入这个男人在酒吧的照片。把它放进去。它会自动检测人脸的位置,但如果它不准确,您也可以手动拖动一个选区覆盖在人脸上。我实际上建议您手动选择人脸,以确保其更准确。在下一页,您可以根据纵横比稍微裁剪图像。比如您可以创建垂直视频,或者坚持使用水平视频,我将选择后者。然后它会带您到一个新页面上传角色语音。同样,我将上传我自己的角色音频。继续。把它拖进去。一旦音频上传,您就可以对其进行一些编辑。所以,例如,如果您想修剪开头部分,>> 我不再让任何人跟着我了。>> 假设我不想让他说那部分。我可以把它修剪掉。嗯,然后拖动它,但我不会这样做。现在,您需要在开头留一点空间。所以,你看这个音频文件轨道在 0 秒处接触到开头?您需要在第一个词说出来之前在开头留一点空间。嗯,否则有时它实际上不会动画化角色说的第一个词。但我们可以确认一下。然后确保您选择了专业模式,这是将为我们提供最佳结果的模型。我们可以开始生成了。>> 我不再让任何人跟着我了。太多人被抓了。太多人没有回来。可以说你也一样。在酒吧里大声谈论叛乱,离兵营这么近。这是消失的好方法。>> 而且结果质量非常高。您可以看到他甚至稍微动了动他的手来做手势。如今,有了这些唇同步工具,您也会看到背景元素也被动画化了。例如,背景中有一个闪烁的小灯。在其他一些视频中,您还会看到背景中有些烟雾在飘动。唇同步的另一个选项实际上是上传视频,然后将唇同步添加到视频中。所以,例如,我可以从一个女人稍微前倾的视频开始,她会非常、非常专注地盯着看。我们实际上可以为这个视频添加唇同步,让她说话。所以,我们需要做的是上传一个面部视频,然后我们可以放入这个角色的视频。现在,这其中的关键是您要确保面部在图像中居中。另外,它不能移动太多。如果她的头部移动太多或运动太多,这将无法很好地工作。所以,就像之前一样,我将上传我自己的音频文件。我认为这是正确的。一旦我们把它放进去,同样,您可以稍微拖动它来选择您希望她说话的视频的特定片段。所以,对于这个视频,她稍微前倾。我希望对话在她前倾之后开始。所以,让我们把音频文件往这边拖一点。如果我这样做,唇同步应该从视频的这个部分开始,也就是她前倾的时候。我们得到的结果相当不错。同样,正如我所说的,您需要确保面部居中并且没有太多移动。您可以看到她的牙齿并不完美。她的嘴巴有点闪烁,但能够将唇同步添加到视频中确实让我们对场景的方向有了更多的控制。现在,让我们看看当我尝试使用它创建完整的对话场景时,design 的表现如何。>> 你真的独自一人来到这里。没有支援,没有侦察。我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 你也可以这么说。在酒吧里大声谈论叛乱,离兵营这么近。这是消失的好方法。>> 人们反正都在消失。家庭,村庄,整个城市。区别在于我们终于谈论它了。>> 所以,总的来说,相当不错。我喜欢它的地方在于它很有表现力,但与一些其他唇同步工具相比,它并不过于夸张。我们会看到的。视频看起来非常清晰。这确实看起来像角色在互相交流。Designs 的唇同步也适用于非人类角色。所以,如果我们看看外星角色测试的结果,它效果相当不错。非常好。另外,如果您上传的图像中有多个角色,您可以分别选择他们的脸部,然后为他们每个人上传一个音频轨道。这样您就可以获得一个包含多个角色在其中说话的视频。>> 你真的独自一人来到这里?没有支援,没有侦察。>> 我不再让任何人跟着我了。太多人被抓了。太多人没有回来。Design 的优点在于它是更经济实惠的平台之一。如果您使用创作者套餐,60 秒唇同步大约是 2.90 美元,这比我们之前看到的 Dreamino 平台便宜得多。接下来,我想看看一个老式的 AI 唇同步工具,叫做 Hedra AI。Dedro 在 AI 化身方面很出色,但它也专注于更具电影感的镜头,就像本教程中的那些。这个工具已经存在一段时间了,我想看看它与较新的 AI 唇同步工具相比如何。所以,一旦我们进入 Hedra,让我们进入视频生成。这是一个相当基础的平台。基本上,您可以选择输入音频脚本以及角色的第一帧外观。我已经上传了音频文件和我的角色的图像。这里有一个提示栏,我们可以尝试稍微控制他们的动作。我发现提示栏效果不太好。如果您尝试提示角色的任何动作或面部表情,AI 实际上无法正确地动画化它们。顺便说一下,请确保您实际上使用的是 hedra character 3 模型。他们也有像 Google V 模型在这里,但我们专门测试的是 hedra character 模型。所以,让我们看看这里的唇同步结果是什么样的。>> 你真的独自一人来到这里?没有支援,没有侦察。我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 你也可以这么说。在酒吧里大声谈论叛乱,离兵营这么近。这是消失的好方法。>> 好的,所以 Hedra 需要升级,在我看来。嗯,如果你看角色的动画,我的意思是,他们的头在到处晃动。它生成的视频分辨率也较低,为 720p。它不像其他唇同步平台那样逼真。我认为它有点太抖了。头在到处摇晃。现在,Hedra 的优点在于它相对便宜。如果您使用创意套餐,也就是我正在使用的套餐,60 秒唇同步大约需要 2.70 美元,这是市面上最便宜的选择之一,但正如我所说的,质量不是很好,而且我认为它与市面上的其他选项相比有点过时了。所以,说到其他选项,另一个已经存在了很长时间并且相当知名的工具是 Hey Gen Avatar。我认为 Hen 是最早的化身工具之一,他们最近发布了这个新的 Avatar 4 模型,据说是 AI 唇同步的尖端技术。所以,让我们试试吧。就像我们到目前为止看到的其他平台一样,Hen 专注于从一张角色的照片开始,然后添加对话。所以我上传了我的角色的图像,还有上面的音频文件。您确实可以添加提示,而且与其它工具相比,它在遵循您的提示方面做得相当不错。所以,例如,如果我说男人以威胁的方式指向手指,这应该会更有表现力。它实际上会做得不错。您还可以选择 720p 分辨率或更高的 1080p 分辨率。让我们来看看视频是什么样的。>> 你真的独自一人来到这里?没有支援,没有侦察。>> 我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 你也可以这么说。在酒吧里大声谈论叛乱,离兵营这么近。这是消失的好方法。>> 人们反正都在消失。家庭,村庄,整个城市。区别在于我们终于谈论它了。>> 嘿,Jen 生成了一些非常流畅的唇同步动画。嗯,角色看起来非常逼真,就像我在提示中写的那样,他以威胁的方式指向手指,这在这个化身生成器中得到了真正的体现。现在,它并不擅长处理每一个动作。所以,我也尝试动画化这个女性角色的照片。我试图提示她拿起水杯。现在,在 Hen 中动画化这个会发生什么呢?它基本上会一遍又一遍地重复这个动作。所以,你看她拿起水,放下,又拿起水,放下。所以,如果您想动画化特定的动作,您可能需要将其分成更短的片段。否则,它看起来会有点奇怪。这是另一个例子,它还动画化了背景中的频闪灯。所以,你看那里的灯光在变色。我实际上并没有提示那个。它只是自动生成的。现在,当我尝试唇同步我的外星人家伙的角色时,它被审查了一点。比如,它不允许我对他进行唇同步。我不知道为什么会这样。我的意思是,这张照片没有任何争议。至于价格,如果您想使用 Avatar 4 模型,这是 Hen 中最好的唇同步模型,每月仅限于五分钟。所以,如果您使用 30 美元的套餐,并且您特别想使用 AI 化身模型,每分钟大约是 6 美元。当然,您可以在 Hen 中访问许多其他功能,但如果您专门想使用他们最新的 Avatar 4 模型,这是我建议您使用 Hen 的主要原因,它每月仅限于 5 分钟。接下来我们要尝试的平台是较新的平台之一,我对此感到很兴奋。它叫做 Higfield。我还没有制作关于它的视频,但我看到人们使用这个平台创建了一些非常、非常令人惊叹的 AI 生成效果。他们最近发布了他们的 AI 唇同步功能,从我看到的情况来看,它看起来非常棒。所以,在 Higsfield 中使用它,嗯,找到这个创建选项卡,然后转到这个语音功能。所以我很确定 Higsfield 主要针对 UGC 广告、AI、化身、网红之类的内容。但让我们看看当我尝试动画化一些更具电影感的镜头时它表现如何。它最酷的一点是您可以选择动画化的角色动作类型。嗯,如果我们点击这里,您可以看到有很多不同的选项。例如,静态角色。对于这个,男人只是站在那里。但您也可以创建一些不同的动作,比如走路,和这个女士一起走路,她看起来像是在纽约。您还可以专门请求不同的角色表情,比如快乐和兴奋。嗯,这是另一个变焦的相机动作,但我将坚持使用静态镜头。同样,我上传了我角色的图像,我希望她说的音频,您还可以输入一个提示,比如她拿起水杯。有几种不同的质量模式,基本、中等到高。让我们看看使用最高质量模型的结果是什么样的。>> 人们反正都在消失。家庭,村庄,整个城市。区别在于我们终于谈论它了。>> 好的,我不喜欢这段视频的开头部分。我有点希望她懒洋洋地拿着一杯水,就像她在和别人说话一样。但是,嗯,如果你看它,她把它拿到嘴边却没有喝。看起来有点奇怪。嗯,也许我应该使用更好的提示,但视频的后半部分看起来非常、非常好。>> 村庄,整个城市。区别在于我们终于谈论它了。>> 好的,这与她的手部动作以及她说话的方式完美契合,就像她在耳语,但同时又非常强烈。我还生成了几段使用愤怒模式的视频,因为我认为这可能很适合对话场景。如果我们看看它们,>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 它确实传达了愤怒。嗯,你看她用手臂指着,嘴巴张得很大,但有点过于夸张了。她的身体动作和嘴唇与声音完全不匹配,声音更安静、更柔和。这是完整的动画对话场景。真的独自一人来到这里。没有支援。没有侦察。>> 不要让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 你也可以这么说。在酒吧里大声谈论叛乱,离兵营这么近,这是消失的好方法。>> 人们反正都在消失。家庭,村庄,整个城市。区别在于我们终于谈论它了。>> 我认为 Higsfield 总体上非常、非常扎实。我的意思是,我真的很喜欢它提供的所有角色动画选项,再加上您可以添加一点提示。它实际上为您提供了很多对角色对话的控制。如果您使用最高质量的模型,结果真的、真的很好。您会在 Higsfield 遇到麻烦的地方再次是成本。所以,如果我们去使用最高质量的模型,您会看到生成它需要 130 个积分。如果您查看套餐订阅页面,每月约 30 美元,您将获得 600 个积分。所以,如果您仔细想想,您每月可以生成四个半高质量视频,花费 30 美元。所以,考虑到成本,这并不算好,但我很期待看到他们将来如果能降低成本会做什么。所以,我们已经看过了很多唇同步模型,我们从一张图像开始,然后将其动画化成一个逼真的角色。但如果我们想要最大的控制权,如果我们想指导一个实际的场景,我们想要更多的角色动作被动画化。这时,这些视频到唇同步模型就派上用场了,我们可以从一个已经移动的角色视频开始,然后动画化他们的嘴唇,让他们说话。这正是您作为 AI 电影制作人所需要的,或者如果您想创建一个更具活力的 AI 化身。我们可以使用的平台之一是 Cling AI,它主要以 AI 视频模型而闻名,但它也有唇同步功能。我将向您展示为什么我认为它值得。如果我们登录 Cling 并转到视频生成页面,左侧工具栏上有一个唇同步功能。我将上传一个我们角色已经生成的视频。为了创建所有这些视频,我使用了新的 C dance 模型,我上传了我角色的参考图像,然后提示他们执行不同的动作。例如,嗯,在这个对话场景中,如果我想让它更具对抗性,我会让那个男人指向那个女人。嗯,或者如果我想让他表现出更疲惫、疲惫、被打垮的情绪,您会看到他靠在椅子上。所以,这将使我们的对话场景更具活力,这也是我想要的。所以,我所做的是上传了我角色的视频。这是他坐在酒吧里的那个。您应该会看到他稍微靠后,好像很累一样。我们也将上传这个音频文件。所以我在这里上传了我的音频文件。我们实际上可以拖动这个音频文件,在我们想要的精确时刻将其添加到我们的角色上。所以,音频文件比视频短。我希望它在他靠后的时候播放,以显示他有多累。所以,让我们试试播放。>> 不要让任何人跟着我了。太多人被抓了。太多人没有回来。嗯,这正是想要的效果。我希望他在说话的同时靠后。让我们看看结果是什么样的。>> 我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 正如计划的那样。所以,首先让我们看看完整的动画。然后有几件事我想向您指出。>> 你真的独自一人来到这里?没有支援,没有侦察。我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 你也可以这么说。在酒吧里大声谈论叛乱,离兵营这么近。这是消失的好方法。>> 人们反正都在消失。家庭,村庄,整个城市。区别在于我们终于谈论它了。>> 所以,如果我们使用基础视频添加唇同步,它将是一个更具活力的场景,角色会做出各种动作和手势。但这就像一把双刃剑,因为如果我们向视频添加唇同步,质量将不如仅向图像添加唇同步。如果我们看看 Cling 生成的一些示例,例如,这个他站起来指着手指的例子,您几乎看不出他的嘴唇在动。它们保持相对静止,就像他只是在勉强地模仿着话语。嗯,所以它不太逼真。这是我对那个外星角色生成的测试。说实话,嘴唇周围的动作并不多。但 Cling 中的唇同步功能的好处是它非常便宜。如果您看看这里,生成它需要 10 个积分。而且,仅仅是每天登录,Cling 就会为您提供 66 个免费积分,这意味着您每天可以完全免费生成 60 秒的唇同步。嗯,与其他平台相比。现在,主要问题当然是,首先您需要有可用的视频。而且,质量也不是很好。但是,还有另一个 AI 模型可以非常、非常出色地在现有视频上进行唇同步。那个模型是 Pixver。所以,在生成 AI 视频本身方面,Pixver 不那么强大,但他们的唇同步工具实际上非常扎实。所以,在视频生成器中,我们找到语音功能。点击它,我们就可以上传我们角色的视频以及他们说话的对话场景。所以我已经将它们上传到那里了。嗯,让我们看看结果是什么样的。>> 你真的独自一人来到这里?没有支援,没有侦察。>> 我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 你也可以这么说。在酒吧里大声谈论叛乱,离兵营这么近。这是消失的好方法。>> 人们反正都在消失。家庭,村庄,整个城市。区别在于我们终于谈论它了。>> 当您使用 Pix 唇同步工具时,嘴唇的运动是我见过的最自然的之一,当涉及到向现有视频添加唇同步时。它也相当便宜。我目前使用的是标准的每月 10 美元套餐,60 秒唇同步需要 3 美元。如果您升级到更贵的套餐,价格会更便宜。我知道它并不完美,但说到向视频进行唇同步,Pix 实际上是我自己见过的最好的选择之一。现在,我想谈谈另一个工具,它不完全是唇同步工具,但它是市面上最好的 AI 视频生成器之一,并且可能为您提供您正在寻找的确切结果。那就是 Google Veo 3。所以,对于 Google Veo 3,无法实际上传您自己的音频文件。所以,从技术上讲,它实际上不是唇同步。然而,Veil 3 在生成 AI 角色对话方面绝对令人难以置信,所以我认为绝对值得一提。我正在使用 Flow AI 视频生成器。确保您已选择帧到视频,这允许我们上传我们角色的参考图像,我已经这样做了。所以,这是我们角色的一个帧。然后在里面,您可以专门提示对话。所以,她向前倾,小声说,“那么你已经知道结局了。独自前来意味着你不指望离开。紧张而威胁。您需要稍微缩短您的对话。所以,Veil 3 最多只能生成 8 秒的视频。我之前展示的一些工具可以生成长达 30 秒的视频或 60 秒的唇同步视频。对于 Veil 3,它无法生成那么长的内容,但它非常适合一些较短的对话。让我们看看。>> 那么你已经知道结局了。独自前来意味着你不指望离开。>> 您可以直接提示不同的相机运动。例如,我生成了一个,我专门告诉她拿起她的水杯并晃动它。>> 人们反正都在消失。家庭,整个城市。区别在于我们终于谈论它了。>> Google V3 的真正出色之处在于它添加了所有这些环境声音和效果。我们可以看看背景中移动的人。那是酒保。这里有,你知道,另一个家伙。您实际上可以听到她移动玻璃杯的声音。>> 区别在于我们终于谈论它了。>> 人们在消失。>> 让我们看看完整的对话场景,然后谈谈它。>> 你真的独自一人来到这里。>> 没有支援。没有侦察。我不再让任何人跟着我了。太多人被抓了。太多人没有回来。>> 那么你已经知道结局了。>> 独自前来意味着你不指望离开。>> 你也一样。在酒吧里大声谈论叛乱,离兵营这么近,这是消失的好方法。>> 人们反正都在消失。家庭,整个城市。区别在于我们终于谈论它了。Veil 3 的主要问题是,没有真正的方法来控制角色的声音。所有这些都是提示她小声说话或耳语,但这根本不起作用。角色在 B3 中的声音完全取决于他们的外表。有时您可以添加一些口音,如果您提示它在特定地点,比如英格兰。但缺乏精确的声音控制有点麻烦。我希望这是一个更安静、更神秘的场景。而那个女孩的声音,>> 人们反正都在消失。家庭,整个城市。区别在于我们终于谈论它了。>> 它让她听起来有点乐观,比我想要的更兴奋。这与我想要的那种氛围完全不同。然而,动画质量真的、真的很好。它会自动生成对话。情感看起来非常逼真和生动。对于 BO3,60 秒视频大约需要 8 美元。对于任何视频都是如此,无论您是进行唇同步还是生成其他类型的视频。所以,就生成角色对话而言,它的价格属于中等范围。所以,这是我对所有事情的最终想法。为了获得最准确、最流畅的角色唇部动作,您需要使用图像到唇同步,这意味着您从角色的图像开始,然后动画化他们说话。有几个很棒的选择。我认为 Higsfield 真的、真的很酷,特别是它在角色动作和面部表情方面提供了所有不同的选项。它最大的问题就是成本。我的意思是,如果您购买 30 美元的套餐,您将能够以最高质量模式使用唇同步功能大约五次。我认为 Design 实际上是一个非常好的选择,特别是考虑到成本。60 秒唇同步大约是 2.90 美元,正如我们所见,这属于较便宜的范围。而且唇同步的质量真的、真的很高。它很有表现力。它很逼真。我对这些结果很满意。另一个不错的选择是 Hen,您还可以对提示进行一些控制,比如他用手做手势。Hen Avatar 4 的限制是每月只能使用五分钟的角色对话,这可能不适合您的需求。现在,如果您想要场景中更具表现力的角色动作,您可能需要先生成该角色的视频,然后为其添加唇同步。对于这一点,我绝对推荐使用 Pixvere。它在现有视频上添加角色语音方面做得非常出色,而且动画非常、非常流畅。相对而言,它也非常便宜,60 秒只需要 3 美元。最后是 Google Veil 3。严格来说不是一个唇同步平台,但如果您只是想动画化角色说话、角色对话,它是一个非常、非常出色的平台。现在,我制作了另一个指南,我详细比较了所有其他最好的 AI 视频生成器,就像我为本视频中的唇同步工具所做的那样。所以,如果您想看看最好的 AI 视频生成器之间的比较,请观看这个教程。 [音乐]