📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

KLING 3.0 is crazy...

AI Search23:05

Transcription

人工智能视频之王回来了。Cling 3.0 正在推出中,而且它真的很棒。所以,在这段视频中,我将介绍它所有的酷炫功能,这样你就能大致了解它的能力和局限性。让我们开始吧。

现在,在录制此视频时,我相信他们正在向专业版和高级版用户推出 Cling 3,并且他们很快也会向所有人发布。让我们通过一些演示开始吧。

所以我现在在 cling 上,我会点击生成。在这里,我们可以从视频 3 中选择。现在视频 3 有一个非常独特的功能叫做多镜头,我一会儿会展示给你看。但首先,让我们关闭它,让我向你展示一个通用的图像到视频的例子。我将上传这张图片作为第一帧,然后写下“前景中的女战士冲向背景中的怪物,然后展开一场史诗般的战斗。”

目前,我将关闭多镜头功能,这样你就可以看到一个普通的图像到视频生成。好了,这是我们的结果。所以,你可以看到她正在冲向怪物,然后开始战斗。这是一个连续的镜头。好了。

现在,我将再次生成这个,但这次我将打开这个多镜头功能。现在,你可以进一步自定义这些选项,但我们暂时只保留所有自动设置,然后按生成。这是我得到的结果。好了。

所以,正如你所看到的,它现在在视频中引入了一些硬切。所以,这个场景实际上是使用不同的镜头生成的。这实际上看起来更具电影感。

目前,默认是 5 秒。但在这里,我也可以将它拖到 15 秒。如果我这样做,让我们再次使用这个多镜头功能生成它。它应该会让场景更长。

我现在暂时将其留空。我不会进一步自定义它。让我们按生成。好了,这是我得到的结果。非常酷。

所以,默认情况下,它将其分解为三个独立的镜头。所以,如果它是 15 秒,那么就是三个 5 秒的镜头。正如你所看到的,角色,无论是女战士还是怪物,在所有三个镜头中都保持一致。角色一致性非常出色。

现在,这些只是关于普通视频生成与这个新的多镜头功能之间差异的几个快速示例。但当然,你可以进一步自定义这个多镜头功能。所以,我将上传这张图片。让我把它去掉。

现在,在这里,我可以点击自定义多镜头。在这里,我可以指定场景中每个镜头具体发生什么。例如,对于我的第一个镜头,让我们写“快速放大女孩的脸。她看起来惊恐而震惊。眼睛睁大,屏住呼吸。”你还可以设置镜头出现的持续时间。所以,让我们将其设置为 2 秒。然后我们将在这个场景中添加下一个镜头。让我们将其设置为 3 秒。然后对于提示,让我们写“一个神秘的男人出现在小巷的阴影中,咯咯地笑着。”然后让我们添加另一个镜头。这些镜头的总持续时间最多可以为 15 秒,但对于这个,我们只设置为 3 秒。然后让我们写这个。“女孩惊慌失措,开始向后方奔跑。高强度追逐,手持摄像机晃动,快速移动。”

因为现在我有这三个镜头,持续时间分别为 2 秒、3 秒和 3 秒,总持续时间为 8 秒。所以,在这里,我们也将其总持续时间设置为 8 秒。这就差不多了。让我们按生成。

好了,这是我得到的结果。而且这很完美。它完全遵循了我的提示。它首先放大到女孩的脸。她看起来惊恐而震惊。然后它切换到下一个镜头,这是一个男人出现在小巷的阴影中,他在咯咯地笑着。声音也很完美。然后第三个镜头再次显示女孩。这次,她惊慌失措,开始向后方奔跑。事实上,这是一场高强度的追逐,带有晃动的手持摄像机。正如你所看到的,这也适用于垂直视频格式。这比仅仅一个 5 秒的剪辑更具电影感,而且你可以用 Cling 3 创作更多连贯的故事。

这是另一个测试。所以,让我去掉这张图片。我也取消这个自定义多镜头。这次,我将测试它生成动漫的能力。所以,我将上传这张图片作为起始帧。然后,是的,我们也打开自定义多镜头。让他们说一些日语。所以,第一个镜头就是这个第一帧。让那个男人说这个。然后对于第二个镜头,而不是显示相同的场景,让我们特写女孩,然后让她说这个。最后,对于第三个镜头,让我们从上方拍摄一个远景,然后让那个男孩说这个。

重要的是要确保剪辑的总持续时间与您在此处设置的相符。所以,2 + 3 + 3 是 8 秒。事实上,我们在这里设置了 8 秒。让我们按生成。

好了,这是我们得到的结果。再次,这真的很棒。它很好地遵循了我的提示。对于第二个镜头,它是对松鼠的特写,她看起来和我上传的参考图片一模一样。然后对于第三个镜头,它是从上方拍摄的远景。现在,第三个镜头有一些轻微的瑕疵。如果你冻结画面并放大,女孩似乎缺少手臂。但从远处看,我想这并不太明显,而且日语几乎是完美的。这比之前的 Cling 版本好多了,之前的版本甚至无法很好地处理日语或其他非英语语言。但对于 Cling 3,他们明确表示它支持多种语言,包括这些语言,以及不同的方言和口音,我一会儿会展示给你看。

这里有一些其他的多语言示例。你知道最疯狂的是,你甚至可以用英语输入提示,让它用不同的语言说出来。例如,我们可以提示这个人说出这个英语对话,但用粤语说。这是我得到的结果。

让我再展示一个多镜头示例,然后我们将继续讨论它可以做的其他很酷的事情。我们只做文本到视频。所以,我不会上传任何图片作为参考帧。对于第一个镜头,让我们做一个卫星缩放。摄像机从云层俯冲向翻腾的海洋。顺便说一句,强烈建议您在提示中也指定摄像机动作,因为 cling 3 非常擅长理解和生成这些动作。所以,这是第一个镜头,它将是 3 秒。然后第二个镜头将是表面破裂。水爆炸,巨大的触手向上冲出。这也将是 3 秒。然后对于第三个镜头,让我们将其设置为船甲板的视角。人们惊恐地奔跑,然后巨大的触手猛击船只并将其摧毁。强烈的晃动摄像机。

现在,这些的总持续时间将是 9 秒。所以,我们也要在这里向下拖动到 9 秒。然后让我们按生成。这是我们得到的结果。非常棒。

再次,你可以看到它很好地遵循了我的提示,包括摄像机动作以及提示中具体发生的事情,而且一切看起来都非常一致。

现在,这个最新的 Cling 3 还具有视频编辑功能。你无法在“生成”中访问它,而是在这个“全能”标签中访问。好了,在这里,你可以选择视频 3 Omni,这是他们最新的全能模型。现在,我几周前评论了上一个 Omni1 模型,它几乎可以让你做任何事情。你可以交换背景。你可以改变东西的颜色。你可以交换角色。你可以添加角色。而且你可以通过上传图片并使用自然语言提示来完成所有这些。所以,这就像视频版的 Nano Banana。而最新的视频 3 Omni 的质量甚至更好。它在一致性方面做得非常好。

这是一个例子。我将上传这张汽车图片,这张女人图片,以及这张连衣裙图片。请注意,这件连衣裙非常复杂。我特意用了这件连衣裙来测试它是否能保持细节一致。让我们用这三张参考图片制作一个视频。所以,你可以通过输入 @ 然后选择相应的资产来引用你的参考。例如,让我们让这个女人穿着图片六中的连衣裙。她正走向图片一中的汽车并触摸它。让我们把它们放在沙漠背景下。

再次,强烈建议你在提示中添加摄像机动作,因为 Cling 非常擅长理解这一点,它将生成更具电影感的生成。所以,在这里,我输入了动态摄像机动作、快速缩放和环绕。让我们使其超详细。

现在,你还可以选择将其设置为多镜头视频,但对我们来说,我们只做一个 5 秒的常规视频。让我们按生成。

好了,这是我们的结果。而且你可以看到一致性非常好。它完美地渲染了连衣裙,即使这是一件非常复杂的设计。此外,这个女人看起来确实像我上传的图片,汽车也和我参考照片中的汽车一模一样。我唯一可以说的小瑕疵是她脸部的细节不太好,尤其是在放大时。但除此之外,它完全遵循了我的提示。她穿着连衣裙。她走向汽车然后触摸它。这是在沙漠背景下。此外,摄像机确实有快速缩放和环绕的动作。

现在,因为视频 3 Omni 也可以接受视频作为输入,我们可以用自然语言编辑它们,让我们把我们的视频放回 Omni。然后在这里,让我们让女人穿上和服。然后我们也让汽车变成红色。这是我们的结果。它能够很好地遵循我的提示。它确实让她穿上了和服,并且确实把汽车变成了红色。

现在,这次生成中有更多明显的噪点,尤其是在她脸部的细节上。所以,它不擅长生成远距离事物的细节。

现在,与之前甚至无法生成原生音频的 Omni 模型不同,这个 Omni 3 也可以生成原生音频,而且它还可以进行多镜头。所以,这是一个使用这个 Omni 模型与多个参考、音频和多镜头结合的例子。我将上传这两张不同拳击手的照片以及这个背景。我们可以让 Omni3 在这个背景下让这两个人打架,就像这样。>> 你来。哇。

另一个令人印象深刻的功能是,它可以连续拍摄长达 15 秒的视频。你可以将其设置为最多 15 秒,而无需打开多镜头。所以,整个 15 秒的镜头是连续的。>> 早上好。早上好。

如果你想进一步提升你的视频制作水平,你需要查看 Higsfield,这是本视频的赞助商。这无疑是内容创作的最佳平台之一,将所有最好的图像和视频生成器汇集在一个地方。当然,他们已经添加了 Cling 3.0,所以你可以在他们的平台上直接使用它。你可以使用 Cling 3 的所有最佳功能,包括文本到视频、图像到视频、起始帧和结束帧等等。例如,让我们输入这个提示并按生成。这是我的结果。

当然,Clink 3 还可以做更多的事情。例如,你可以输入多个提示来创建连续的长视频。这是一个使用这三个镜头的例子,让我们看看它会给我们什么。正如你所看到的,一切都非常高质量和一致。

现在,你还可以做更多的事情。你还可以使用 Cling 的 03 编辑模型,它非常强大。例如,让我们将这个视频变成夜晚和下雪。这是我们的结果。现在,用自然语言编辑视频变得异常简单。无论你是创作高强度场景、情感特写、多角色对话还是流畅的电影镜头,Cling 3 都能以一种难以匹敌的稳定性和真实性来处理这一切。你今天就可以在 Higsfield 上试用 Cling 3 以及其他顶级视频和图像模型。只需点击下方描述中的链接。

所以,这些是这个最新 Cling 版本中最令人印象深刻的一些功能。现在,当然,他们还在普通视频生成方面进行了重大改进。所以,让我们也测试一下我一系列非常棘手的提示,看看它有多好。首先,这是一个女人在表演令人印象深刻的街舞,包括翻转和强烈的旋转。摄像机动作激进,精确的移动带有速度变化和鞭子般的加速和减速。这是我得到的结果。[音乐]

终于,我们有一个视频生成器,可以真正制作出像样的街舞视频。包括 Vio、Sora 或 High Law 在内的其他视频模型都无法像这样让某人跳街舞。现在,如果你仔细看,解剖学上仍然存在一些错误。例如,她的脖子在视频结尾处似乎脱臼了,但与其他视频模型相比,它看起来仍然更符合物理现实。或者这是另一个例子。对于提示,我输入了一个体操运动员在平衡木上做一个杂技翻转。这是我得到的结果。一切看起来都符合物理原理。她没有多余的肢体或缺失的肢体。她的头没有从屁股里出来。然而,翻转看起来仍然有点奇怪。请在评论中告诉我你的想法。

然而,这仍然比之前的版本有了巨大的进步,也比其他视频模型有了进步,其他视频模型几乎无法让某人翻转而不增加一些额外的肢体。

接下来,当然,我们必须进行经典的威尔·史密斯测试。所以,我将上传这张威尔·史密斯吃意大利面的图片,但我要写“兄弟,没必要再测试这个提示了。Cling 在吃意大利面时简直太棒了。”然后,巨大的[清嗓子]爆炸发生在背景中。让我们按生成看看会得到什么。>> 兄弟,没必要再测试这个提示了。Cling 简直太棒了。>>

而且,一切都很完美。表情、唇语同步、爆炸,加上爆炸的声音。一切看起来都非常棒,而且质量比之前的版本好得多。

接下来,让我们测试一下它生成表情和情绪的能力。所以,我们有一个女人在哈哈大笑,然后看起来很震惊,然后突然哭了起来,然后她看起来很兴奋。实际上,我将打开这个多镜头功能,看看它会给我们什么。

好了,这是我们的结果。[笑声]她很疯狂,但这确实完全遵循了我的提示。她先是哈哈大笑,然后看起来很震惊,然后突然哭了起来,然后她看起来非常兴奋。它非常擅长生成不同的表情。而且你可以看到,因为我打开了这个多镜头功能,每个表情之间都有轻微的放大或缩小。

好了,接下来我测试了打斗场景。所以,我的提示是两个功夫大师在城市屋顶上打斗。背景是雨和闪电。快速的动作,激烈的动作。摄像机围绕着他们盘旋,并快速地进出。这是我们的结果。

正如你所看到的,与之前的版本相比,一切都更加一致和连贯。这看起来像一场合法的打斗场景。它相当激烈,动作也很多。此外,它完全遵循了我指定的摄像机动作。现在,如果我把它放慢或暂停某些帧,细节上仍然存在一些瑕疵。例如,有时脸部并不真正一致。手和手指有时也会有点模糊。所以,我在这里非常挑剔,但在细节正确性方面仍然存在一些错误,尤其是在这些快速移动的镜头中。

这是另一个高强度文本到视频的例子。一群忍者在一个竹林中伏击一个重装甲的武士,伴随着快速的剑击、杂技翻转和风中飘动的树叶。对于其他视频生成器来说,真正做到像样的剑斗和杂技翻转非常困难。这是我得到的结果。

现在,这一定是这个提示的最佳生成。其他视频生成器都无法达到这种一致性和实际遵循我的提示的水平。但即便如此,这次生成仍然有一些明显的错误,尤其是在慢动作播放时。所以,请注意,剑有点乱。此外,树叶存在一些不一致之处,当那个家伙翻转时也是如此。它并不完美。它仍然缺乏细节,尤其是在这些高强度镜头中。但与我们之前的情况相比,这仍然是一个巨大的进步。

现在,我发现 Cling 3 对某些事物也有很好的世界理解。例如,如果我让它生成《鱿鱼游戏》,但玩家过于礼貌和歉意,这是我得到的结果。>> 红灯。我非常抱歉,女士。请原谅我的脚。>> 哦,请不要为难自己。我完全原谅。>>

所以,你知道,它确实生成了《鱿鱼游戏》。角色看起来并不完全像《鱿鱼游戏》的角色,但它确实理解,你知道,红灯绿灯游戏,而且它确实遵循了我的提示。玩家过于礼貌和歉意。

接下来,让我们看看它是否可以做到 3D 动画风格。所以,这是我的经典测试。一位公主穿着闪闪发光的白色连衣裙。她正逃离一条巨大的红色龙,龙的眼睛闪烁着红光。3D 迪士尼皮克斯风格。这真的很棒。它看起来确实像一个迪士尼皮克斯公主正在逃离这条巨大的红色龙。此外,它甚至还添加了一些激动人心的电影音乐。

好了,接下来是物理测试。所以,我们有一个男人骑着独轮车,同时玩着红球。再次,不幸的是,在这些高移动场景中,一致性和细节并不那么好。所以,球的边缘都乱了,但它确实显示了那个家伙在骑独轮车和玩球。

然后我们有一个教授在白板上解释勾股定理。到目前为止,其他视频模型都无法正确做到这一点。你看,斜边的平方等于另外两条边的平方和。好了。所以,这还不错。它确实误读了斜边。它能够理解它的平方是两条边的平方和。而且你知道,底部的公式是正确的,尽管顶部的图表是混乱的。其他视频模型都无法做到这一点。所以我也不指望 CL 能做到。

然后这是动态图形测试。所以,提示是突出哈萨克斯坦在世界地图上的位置的动态图形。画外音是一位带有印度口音的女性,描述哈萨克斯坦的历史。这次我将其设置为垂直视频格式。这是我得到的结果。>> 加什坦。一个广阔的中亚国家拥有跨越两千多年的历史,以古代丝绸之路贸易和游牧遗产为标志。>>

这里有更多的错误。它无法真正标记出哈萨克斯坦在地图上的位置。它也把世界地图弄错了,但它能够生成一个带有印度口音的女人。

好了,这些是我的一些快速测试。希望这能让你大致了解它的能力和局限性。在我看来,最令人印象深刻的功能绝对是多镜头选项,你可以指定每个镜头中发生什么,并将它们拼接成一个连贯的故事。

接下来,这里有一些供您参考的规格。所以,如果你将其与 Cling 2.6 的前一个版本进行比较,那么 3 版本可以做更多的事情。开箱即用,它已经可以做到起始帧和结束帧。此外,音频和唇语同步更加逼真。它还有这个多镜头功能。此外,它支持所有这些不同的语言以及不同的方言和口音。此外,你可以输出长达 15 秒的持续时间,而且它是灵活的。它不必是 15 秒。你可以将其设置为 4 秒或 8 秒等等。

然后这里是这个 Omni 模型的一些附加规格,它就像视频版的 Nano Banana。所以,与之前的 Omni 1 相比,Omni3 具有更多的功能。它还支持原生音频和多镜头,而之前的版本甚至无法生成音频。请注意,对于 Cling 3 和 Omni3,它们都可以达到 1080p 的分辨率。

总之,这就是我对 Cling 3 的评测。这绝对是一个巨大的升级。他们引入了这么多新的酷炫功能。我最喜欢的功能绝对是多镜头功能,我实际上可以开始创作一些连贯的故事,而不是仅仅生成一个单独的 5 秒剪辑。

请在评论中告诉我你的想法。在录制此视频时,他们刚刚向专业版和高级版用户发布了它,但他们正在争分夺秒地向免费用户发布。所以,请继续关注。

一如既往,我将密切关注顶级人工智能新闻和工具与你分享。所以,如果你喜欢这个视频,请记得点赞、分享、订阅,并继续关注更多内容。

此外,人工智能领域每周都有太多事情发生,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要真正跟上人工智能领域的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。

感谢观看,我们下期再见。