Transcription
大家往这边。动。动。 >> 雷克斯,停下。雷克斯,别闹了。雷克斯。 >> 凯文,放下你的手机。红,停下。 >> 我已经用 Cling 3.0 有一段时间了,说实话,网上关于它的好信息不多。所以,在这个视频里,我将教你我所知道的一切,这样你就可以掌握 Cling 3.0。那么,让我们开始吧。要访问 Cling 3.0,你可以直接通过他们的网站访问,也可以使用像 Open Art 这样的工具。这是我为这个视频使用的工具。他们刚刚更新了他们的新用户界面。看起来很不错。所以,如果你想看看它,并想自己尝试一下,我会在下面的描述中留下链接。现在,首先,我们来回顾一下 Cling 的一些新功能,然后我将一步一步地带你了解它们。我们会从简单的开始,然后视频后面会讲更高级的内容。如果你想跳过,我也会留下时间戳。首先,你需要选择模型 Cling 3.0 或 Cling 3.0 Omni。Omni 指的是多模态参考。我稍后会告诉你更多关于它的信息。但就使用而言,你应该知道的是,你有基本的开始和结束帧,你可以在其中放入你的帧。如果你只想有一个开始帧,就把它放在这里。你还有一个通用的提示框。在 OpenArt 中,你也可以放入一个角色作为视觉参考。现在你可以做的是启用这个多镜头功能。这允许你在视频中制作六个不同的镜头。顺便说一下,Cling 2.0 的长度现在是 15 秒。我稍后会告诉你它为什么好和不好。你会知道的。但首先,让我给你展示一下。如果我们在这里有一个多镜头,我们现在使用的是自动功能。如果我们点击自定义,那么我们就有镜头一、镜头二、镜头三、镜头四、镜头五,我们甚至可以添加六个不同的镜头。你甚至可以选择每个镜头的长度。但请记住,你只有大约 15 秒的时间来操作。所以,你可以让一些镜头非常非常短,然后比如说让一个镜头长得离谱。这取决于你,但这给了你更多的自定义空间来决定你想要发生什么。然后我们有参考。我们现在可以添加多达七个视觉参考,我稍后会详细介绍。首先,让我告诉你如何开始使用 Cling 3.0 的提示。我有一个图像参考,我想基于它制作一个视频。然后我在这里有一个提示。通过颜色,我想识别你可以添加到提示中的所有不同的片段或类别。所以我们首先有相机,这是一个中景跟踪镜头。然后我们有主体,就是那个女人。然后我们有动作,它描述了你的主体在做什么。然后我们有环境,基本上描述了那里发生了什么。灯光、纹理、音频。最后三个我可以说有点可选。这将帮助你形成一个良好的提示结构。现在,如果我们把这个输入到 Cling 3.0 中,并且我们只使用 8 秒的输出,分辨率为 1080p,那么我们就会得到这样的结果。到目前为止,没有什么新的。基本上没有什么变化。嗯,这只是使用了基本功能。Cling 2.6 也可以做到这一点。但现在,让我告诉你 Cling 3.0 在哪里派上用场。如果我们切换到多镜头,我们现在就可以让我们的场景栩栩如生。我们只有一个参考,但我们可以生成多达六个不同角度的同一个角色。老实说,它的连贯性真的非常非常好。它能记住那个角色长什么样子。现在,制作角色多个不同镜头的旧方法是制作四个不同的提示,提供四个不同的图像参考,然后创建你的视频。但现在我们可以只放入这一帧。然后我们可以切换到多镜头。现在我们可以开始描述我们想要发生的每个场景。所以,如果你做得正确,并且应用了我在单镜头中刚刚展示过的东西,我们只需要添加我们想要的相机角度类型。然后我们描述我们想要我们的角色做什么。然后我们可以为每个镜头描述它。我们可以给出每个场景的长度。所以现在我们有第二个镜头,一个过肩特写,当她靠过去时。然后我们可以生成它。然后我们得到一个 12 秒的结果,如下所示。现在,让我印象深刻的是它保持场景连贯性的能力。所以,我们有这个女孩,还记得这个走廊。然后,如果我们切换到视频后面一点,我们就可以看到她正走向镜头。她正在闭眼看向猫眼,然后她正在看门廊。然后,我们切换回来,我们又看到了同一个走廊。所以,如果我们进行比较,在我看来,它相当连贯。在相机角度方面可能有点变化。比如,这里的两侧比这里更模糊。总的来说,这对于获得具有多个不同角度的连贯镜头来说相当不错,而这正是它的用途。这就是多镜头的基础。稍后,我将测试这个工具的极限。所以,敬请期待。人们开始使用 AI 时,我经常收到的主要问题是他们不知道如何提示。所以,对于这个问题,我们可以做一些元提示。元提示本质上是这样的:与其你自己输入提示并将其发送给 AI,不如你先问另一个 AI,在这种情况下,比如说一个聊天机器人或一个助手,你让它仔细检查你的提示,或者你甚至可以要求它为你创建一个提示。所以我所做的就是,所有关于 Cling 3.0 的信息,我都放在了这个文档里,我甚至使用了 Cling 的官方指南来写这个东西,然后我把它输入到这个 ChatGPT 中。现在你可以做的是,上传你想要制作视频的参考图像。然后输入你拥有的 ID,它就会为你生成一个多镜头提示。再说一遍,这是懒惰的提示方式。我仍然强烈建议你思考你实际想看到什么。如果你不这样做,那么你就是在和 AI 玩猜测游戏。这就像在玩老虎机,希望 AI 能做出一些好东西。其他专业人士,他们使用 AI 来编写提示,但他们仍然会自己检查并重写句子和内容,以获得他们想要的确切东西。现在你已经了解了如何使用新的 Cling 3.0 和多镜头功能进行提示,让我给你一些关于 Cling 中不同生成方式的更多细节,因为这有很多内容,当你刚开始接触时,你可能会不知所措。所以,创建视频的第一种方法是文本到视频。文本到视频是最简单快捷的制作视频的方式,因为你只需要输入你的提示,然后你的视频就出来了。缺点是,你对确切的输出控制较少,因为如果你运行这个提示 20 次,你就会得到 20 个不同的结果。所以,如果你想生成文本到视频,这就是你的做法。所以在 OpenArt 上,我觉得有点奇怪,我将给他们一些反馈,因为我不喜欢这样。我们有开始和结束帧,但对于文本到视频,我们将转到参考。这可能会让你感到困惑,因为它名字有点奇怪。本质上,文本到视频有两种选择。所以你可以使用多镜头,或者你也可以使用常规提示。让我先给你一个常规提示的例子。所以这里我正在描述一个橄榄球运动员穿着全套橄榄球装备坐着的场景,然后他坐在更衣室里,我们还有另一个人也像他一样坐在他面前。我基本上让他们进行对话。所以,那个家伙在开玩笑说他肩膀受伤了。是的,该死的那个线卫真大,他们都笑了。如果你让 AI 来决定结果,你就会这样做。如果你对你确切想看到什么没有具体的想法,我不建议你经常使用这种方法,如果你想在多个场景中保持一致的外观。但如果你只是需要快速制作一些东西,那么这个方法会奏效。 >> 伤了肩膀? >> 是的。该死的,那个线卫真大。 >> 好的,我的家伙被那个线卫给搞定了。我不是说奇怪的意思。现在,如果你想做多镜头,那么它和你已经描述的完全一样。你只需要描述你的场景并进行自定义。你可以使用自动功能,它会为你创建多个镜头。但同样,你使用你整个的大提示,然后把它放在这里。我会使用自定义并添加你的不同镜头。所以,如果你有一些对话,这会非常有效。所以这里我有一个两个人的白人双人镜头。然后我有一个男人 40 多岁,他正在咀嚼并低头看着他的盘子,这是一个缓慢的推进镜头。然后我有一个 90 岁的老人,他看起来有点困惑,这是一个中景镜头。然后我切换回他们两个,得到了这个结果。 >> 我们为什么这样见面? >> 我们要排除你。 >> 什么?抱歉,我需要这个。你知道我需要这个。 >> 就像那样相当不错。如果我们看整个场景,你会发现连贯性就在那里。如果我们从这个场景切换到视频结尾的这个镜头,我们可以看到脸部看起来很连贯。我们甚至还有镜像反射。然后如果我们看特写,它看起来相当不错。现在,如果你想查看我在整个视频中使用的所有提示,如果你觉得我讲得太快了,但你想按照自己的节奏查看它们,那么请查看我的学校。在我的免费学校社区中,我创建了一个文档,我在其中发布我使用的所有提示,包括示例,这样你就可以按照自己的节奏查看它们。那里也是你可以闲逛、提问以及与其他 AI 爱好者聊天的地方。让我们来点更高级的。让我们使用参考。现在,参考是你提供给 AI 来制作视频的输入。现在,如果我们在这里转到参考,然后将其切换到 Cling 3.0 Omni,那么你可以在你的视频中添加多达七个不同的参考。你可以从你自己的生成内容中选择,也可以上传你心中想要的任何类型的图像。如果你有各种小细节需要在你的镜头中出现,那么这个功能就非常强大。再说一遍,这并不是什么新鲜事。就像,这已经存在于 VO 中了。这在 Cling 的早期版本中就已经存在了,但这个版本只是更好一些,而且更连贯。我仍然必须说,它有时会有点小故障,但我会向你展示我的意思。好的,所以让我给你一个在你的镜头中放入多个不同参考的例子。我在这里有一张我自己的照片。我之所以有三个不同角度的照片,是因为我给 AI 提供了更多关于我的角色长什么样的数据。所以,在这种情况下,我有一个我的侧面角度。然后我有一个我的正面角度。然后我有一个我的背面角度。这有望防止 AI 开始出现故障或编造你不想在场景中出现的随机内容。所以,这是我放入的第一个角色。然后,我对这个我放入我镜头中的另一个角色也做了同样的事情。然后,我有了我想要的场景发生的地点或环境。最后,我添加了这个可爱的小狗。如果你想制作你自己的角色参考的三个不同角度,那么请使用屏幕上显示的这个提示。只需暂停它,看看它,然后复制它。顺便说一下,这也会在文档中。这可以为你节省大量在 Photoshop 中手动完成然后全部更改的工作。你只需一次性输入这个,然后它就会为你输出这个版本。所以,我们在这里放入一个参考。然后,我们添加第二个参考。然后,我们添加第三个和第四个。现在你可以看到我们有图像一、二、三和四。在你的提示中,无论你是否使用多镜头,你都可以标记那些不同的角色,然后你可以开始描述每个角色或每个地点正在发生的事情。所以你可以说,嘿,图像一和图像二在图像三的地点。然后图像四出现。你给它命名。你可以像引用那个人一样描述任何你想要的故事,但你实际上是在引用图像。所以,如果我们从不使用多镜头开始,那么我正在做一个长镜头,背景是图像三。然后相机进行一次有意识的 360 度环绕,场景紧张。然后,图像一,也就是我,站起来兴奋地说:“我明白了。”相机继续盘旋,露出对面一个专心坐着的女人。然后我们有一个女人的标签,我们基本上就是,我们基本上在指导它。你必须像导演一样思考。你必须思考你想要在你的镜头中发生什么。所以我写了这个小对话,让他们来回对话,我让相机以连续的动作进行。然后狗出现在某个地方,就像我的场景在这里。让我给你展示我的意思。 >> 我明白了。 >> 你明白了什么? >> 我知道凶手是谁。 >> 是艾玛,不是吗? >> 肯定就是她。 >> 所以是的,正如你所见,这个场景绝非完美。我们有这只狗,它突然像变成了一只独角兽,头上长出了一条尾巴。我甚至不知道它是怎么做到的,但它仍然有点故障。这也是我对参考的主要问题。你放入的参考越多,AI 保持连贯性就越难。但根据你的场景有多复杂,你可以让它奏效。如果你的场景很简单,你可以用多个不同的参考来让它奏效。如果你想要那种复杂程度,Cense 2.0 可能会为你解决这个问题。顺便说一下,这也是我使用 Open Art 的原因,因为很快你就可以在 Open Art 中使用 Cadence 2.0。如果你想让它更复杂,那么你想使用多镜头。所以在这个例子中,我们再次有一个包含四个不同参考的镜头。所以这里有一个女孩,我们将把它用作我们的主要角色。然后我们有一个男孩作为我们的次要角色。然后我们有这个可爱的小刺猬。然后我们有它所在的地点。所以现在如果我们参考它,我想要四个不同的镜头。所以我基本上在描述每个镜头中发生了什么。有些镜头更复杂,比如第一个镜头,然后是第二个镜头。你只需要像导演一样思考,思考好的,我有一个开场镜头,我想要看到什么,然后第二个镜头,让我们做一个低角度镜头,然后我们有这个人摇摇晃晃地走向沙发,她伸手去拿一条小毯子,然后我们有第三个镜头,其中有一些对话,最后我们用第四个镜头结束,这就是视频。所以,如果我们把它付诸实践,这就是最终结果。波基,你能帮我拿那条毯子吗? >> 哦,嗨。你一定是新邻居。 >> 哦,嗨。是的,我们是。 >> 唯一还不完美的是口型同步,但除此之外,AI 对在哪里剪辑以及接下来会发生什么有很好的理解。这相当流畅。如果你单独制作每个场景,你可以获得更多控制,但这也会增加更多工作量。所以,对于像这样的动画视频,例如,如果你要生成长电影,现在你可以制作 15 秒的镜头,这会为你节省大量时间。但在这方面有一些问题,特别是口型同步。但我会在视频后面告诉你最好的解决方案是什么。然后我们有第三种方法,即图像到视频。这是迄今为止最受欢迎的使用方法。就像,这是我一直使用的方法,这也是给你最多控制的方法。它只是回到开始结束帧。在这里你可以放入你的开始帧。如果你只想有一个开始帧,你可以就这样。或者如果你想要更多的控制,所以你想要你的场景以特定的方式结束。那么你就放入你的结束帧。这是我一直在大量使用这两个功能。你也可以制作连续视频,例如,使用 Open Art。你可以获得一帧。所以,如果我们抓取这一帧,比如说我想在某个时刻剪辑。所以,比如说我想在这里剪辑。我可以下载这一帧,并将其作为我的新开始帧。在下一个视频中。所以,这就是开始和结束帧的想法,现在我们可以用这个新的开始帧来继续这个视频。但仅仅通过放入一个开始帧,你就已经为 AI 提供了一个开始参考,它应该是什么样子。它只需要从那里开始运动。现在有了多镜头,我们可以给它这个提示,我里面有三个不同的场景。然后如果我们生成它,我就会得到这样的结果。 >> 嘿,你确定这安全吗? >> 是的,伙计。没事的。继续。 >> 好的。我信任你。 >> 看起来相当不错,对吧?这里是另一个例子,说明你可以用开始帧而不是多镜头做什么。所以,这里我有一个例子给你。 >> 嘿,你确定这安全吗? >> 是的,伙计。没事的。继续。 >> 好的。 >> 我信任你。 >> 在我看来,这就是 Clink 3.0 发光的地方,它比我尝试过的任何其他模型,比如 Cling 2.6 和 VO 3.1,都有更好的提示连贯性。我甚至无法用 VO 生成这个,但用 Cling 2.6 我得到了这个结果,看起来真的很糟糕。所以,这是我想给你的一个要点。如果你正在使用任何 AI 模型,不要认为你必须一直使用多镜头。你也可以只使用普通的提示工具。需要注意的重要一点是,如果你同时有开始和结束帧,则无法使用多镜头。所以不要开始寻找它。它就是不存在。有了这个,你基本上拥有了更多的控制权。所以,基本上我想从这个帧开始,我想在那个看起来很奇怪的家伙那里结束。所以,好消息是我们可以制作一个超过 10 秒的输出,通过滑动这个。我必须说,你的视频越长,你可能遇到的故障就越多。但无论如何,我用那个提示生成了这个视频。我的女儿在哪里? >> 她在哪里? >> 再次,只是为了展示为什么你需要更新这些模型并尝试多个模型,因为如果我在 Clink 2.6 和 VO3.1 中使用相同的镜头,我会得到这个。我的女儿在哪里?她在哪儿? >> 好的,让我们深入一点,全面分析 Clinko 是否值得炒作,因为我知道包括我在内,但许多影响者和品牌都在大肆宣传。但让我们实际分析一下,看看这个镜头有多好。所以,我制作了这个视频,这是一个多镜头视频,关于这个义警桶男和另一个角色。让我们看看它做得有多好。 >> 他在哪儿? >> 谁?等等,等等,什么? >> 别跟我玩游戏。他在哪儿? >> 伙计,你为什么戴着桶? >> 所以,让我们分析一下这里的提示。让我们先看第一个镜头。所以,这是最初的两秒钟。如果我们仔细看,我们可以看到义警正在把那个家伙撞到砖墙上。应该有蒸汽在他们之间飘散,并且有戏剧性的低角度构图。然后他用嘶哑的声音喊道。他在哪儿?我认为他在这方面做得很好。但如果我们逐帧分析这个场景,蒸汽似乎是从桶里冒出来的。那个家伙似乎已经被撞到墙上了。但那也是我给它的参考图像。但他推挤和向前倾斜的方式,相当不错。现在,我想让你分析一下这个镜头。所以,仔细看看参考。仔细看看这部分。仔细看看他倾斜的样子。现在让我们转到下一个场景。对于这个下一个场景,我们有一个特写镜头。如果我们看看手,我们可以看到他戴的手套相当连贯。这个角色的眼袋很好。我喜欢他脸部的细节。然后我们有这个家伙,他看起来非常困惑,他说:“谁?等等,什么? >> 谁?等等,等等,什么? >> 这相当不错。现在,切换回桶男。我们看到两只眼睛从那里伸出来,他说:“别跟我玩游戏。 >> 别跟我玩游戏。他在哪儿? >> 我喜欢这个,如果我们分析最后这短短的一秒钟,他用尽全力向前倾斜说:“他哪儿去了?”然后当他倾斜时,我们在下一个镜头中也看到他正在倾斜。所以我认为 AI 理解他在下一个镜头中倾斜,这相当令人印象深刻。所以,我们只是从一个参考来看,如果我们在这场戏中有动作,它会在下一个镜头中记住那个动作。即使在这里,这也是我想让你分析的东西,如果我们比较所有这些,我们可以看到细节水平。所以,如果你看看墙上的这些痕迹,并与我们开始时的痕迹进行比较,我们可以看到它们相当连贯。我们只是一个放大的版本。甚至背景,比如我们这里的蓝色灯光。我们可以看到蓝色的灯光也来自这个车库或者这里是什么。我们还有,比如城市灯光,它们是相同的设置。桶帽相当连贯。角色也相当连贯。在我看来,这相当令人印象深刻。它可能不像 Cance 2.0 所做的那样。嗯,我对此会非常兴奋。但它也只是给你一个视角,看看它变得有多好,你可以成为多么好的导演。所以,像导演一样思考。这是我希望你从这个场景中得到的关键收获。就像,这就是 Cling 3.0 比以往任何时候都更能让你做到的。我想分析的最后一个场景,我将其推向了极限,是这个六镜头多场景。这是从电影《物质》中获得的灵感,这是午餐场景,那个家伙吃得令人作呕。我提前道歉,如果你正在观看这个,因为这即将变得相当令人作呕。 >> 推广不仅仅是关于才华。这是关于忠诚。我会找到理解这一点的人。是的,这相当令人作呕。对。除了这个家伙从空气中抓起一只虾之外,我不知道他从哪里抓到的。这里的多镜头,其中的剪辑看起来相当不错。就像,它感觉相当自然,并且它设法很好地遵循了所有的提示。即使是这个女孩,我也只给了她一个提示描述。没有任何参考。看起来相当不错。就像,这里看起来相当连贯。就像,即使我们在不同的镜头之间切换,她在两个镜头中都是连贯的。所以,对于像这样的简单场景,它效果相当不错。让我们也谈谈这个产品的局限性,因为它声称具有增强的口型同步,并且口型同步要好得多。但我不知道你怎么样,一旦你生成超过 10 秒的内容,你的口型同步就会变得一团糟。让我给你一个例子,我的意思是什么。 >> 我的约会今晚放了我鸽子。所以我有空。 >> H 所以你自由了? >> 是的。 >> 太好了。你能把垃圾拿出去吗? >> 在这个镜头大约 10 秒后,你可以看到我的口型同步完全不对。我不是唯一遇到这个问题的人。我收到过关于这个问题的评论。我看到其他人也评论过这个问题。这相当不幸。我希望他们能修复它。但目前,我能给你的主要建议是,如果你有对话,让对话发生在最初的 10 秒内,然后剩下的 5 秒。如果你想要这 5 秒,让它成为一个正在发生的动作,而不是对话。 >> 嘿,>> 你在背后藏了什么? >> 这是给你的。我们还应该披露的是变形。所以,特别是对于更长的场景,会有一点变形。例如,看看这个场景。修复它的最简单方法是使用更简单的提示,或者将其再次缩短到 10 秒以下。或者你只能等待 C dance 并为此使用 C dance。Cling 3.0 真正擅长的是表情和情感。例如,这个剪辑。为什么?为什么?现在回来。我几乎为向这个人提示这个感到抱歉。就像,他所拥有的情感水平在我看来非常逼真。所以,这就是如何掌握 Cling 3.0 的完整指南。现在,如果你想自己尝试一下,我会在下面的描述中留下 Open Art 的链接。在 Open Art 中,我建议如果你想充分玩转它,并且如果你想访问所有模型,并且你有一个大项目即将到来,我建议选择一个比任何小计划都大一点的计划,因为你将很快用完积分。你不想用完积分,每次都要重新购买积分。现在,点击屏幕上的视频,如果你想了解更多关于如何使用 AI 进行电影制作。