Transcription
B Dance,是的,TikTok背后的公司刚刚推出了Sidans,他们的视频生成模型,并且他们声称它超越了BO3,并且改进了Clean,提供了更高的质量,允许做独特的事情,而且价格更便宜。今天我不仅告诉你,我还亲自测试了它,并为你带来了一次深入的比较。我们正面临着视频生成的新王者。让我们来验证一下。视频开始。在中国,社交媒体巨头引领着视频生成人工智能模型的进化步伐。如果Quot拥有Clin,Bens,TikTok背后的公司,现在向我们展示了Sens。但这并非一蹴而就,这些公司一直在致力于图像处理人工智能的开发。事实上,几个月前,我曾在这个频道上介绍过Bensom的最新研究之一,Omnihuman 1模型,一个已经能够创建超逼真虚拟形象的模型。例如,爱因斯坦的这段视频引起了相当大的反响,并且非常流行,它很好地展示了这个模型的能力。那么,现在B更进一步,向我们展示了其更通用的视频生成模型系列。这个模型系列就是这个,Sidens 1.0系列。而这个视频系列之所以有趣,不仅仅在于能够从文本生成视频,或者从图像生成视频,甚至超越了他们声称的质量,这包括了BO3和Can 2.1,而是它提供了一些独特的功能,比如在一次生成中通过提示词创建包含多个镜头(takes)的视频,以及另一个非常有趣的点,那就是它可能是目前生成如此高质量视频最经济的模型。因此,在这个视频中,我们将首先回顾Sidens 1.0的特性。然后,我将解释在哪里可以使用这个模型生成视频,最后,我们将进行一次深入的比较,使用我自己生成的Sidens、Clean和BO3的生成结果,进行对比,看看这个模型是否真的可能是目前最好的模型。所以,现在让我们看看Ben的团队是如何展示这个模型系列的,以及他们用什么论据来声称它们是目前最好的模型。因此,如果我们滚动网页,首先映入眼帘的是用这些模型生成的视频片段,它们看起来确实很棒,非常流畅,而且运动非常非常一致。事实上,在第一个视频片段中,我们已经看到了一个使这个模型与其他模型不同的特点,那就是在同一视频生成中,能够通过提示词(prompts)来决定和控制多个场景的出现。在Beo中,这种情况有点随机,而且很多时候是不受欢迎的。在这里,我们将看到如何通过提示词来决定在同一个视频片段中出现不同的镜头。我们还看到了其他例子,展示了更复杂的动态和物理效果,比如这个赛车比赛。具有一种更居家风格的视频,可以说。这完全可以像用智能手机拍摄一样。这里是另一个视频,比如这个男孩滑雪的视频,其中展示了复杂的动态,看起来表现得非常好。正如我所说,这个模型最有趣的事情之一,也是我认为它第一个允许我们做到的事情,就是它集成了他们称之为多镜头原生叙事(multishot native storytelling)的功能,也就是说,能够在同一个视频生成中拥有不同的镜头,并且保持一致性。在这里,我们可以看到这个狐狸,其中出现了两个不同的镜头。如果我们继续滚动这个轮播图,我们可以看到其他例子。例如,这个侦探的例子,稍后您会看到我如何将其付诸实践,我们确实可以很好地控制每个生成中会出现哪些镜头。这个弹钢琴的女孩,我们有一个特写镜头,一个远景镜头,一个她的镜头,总的来说,这是一个使其与众不同的功能,并且对于某些用例和我们需要的生成来说,它可能非常有用。如果我们向下滚动,可以看到他们还说它适用于不同的风格,例如动画风格,甚至更接近纯粹动画插画的风格。而且,说实话,这些例子看起来非常非常棒。但一如既往,我们需要亲自测试一下,看看当我们作为用户使用它时,它会生成什么。还有一点他们强调的是,它是一个在遵循指令方面特别有用的模型。在这方面,Clean系列非常非常出色,而Beo系列,虽然在遵循提示词方面确实有很好的表现,但有时,尤其是在我们使用BO2从图像生成视频时,遵循提示词,对我们想要的相机运动的尊重,并不是最佳的。他们告诉我们,在这个层面上,你可以生成非常符合你真正想要的内容的视频。如果我们看水平,他们声称这些模型可能是目前最好的模型,这是基于比较测试,也就是ELO模型。他们展示了使用相同提示词从不同模型生成的视频,用户进行盲测,用户必须选择哪个模型更好。在下面这些类型的测试中,我们可以看到,Bense的模型,无论是文本到视频还是图像到视频的生成,都将领先于Google的BO3模型,并且在图像到视频生成方面也领先于BO3模型。但他们还做了一个更深入的分析,评估了不同的方面。这里的图表显示,每个方面的值越接近圆的外部,模型就越好。因此,多边形生成的表面积越大,模型就越好。在这里,你可以看到,至少,Ben的模型是最均衡的模型。注意它如何形成一个圆,它以一种相当均匀的方式覆盖了一个区域。也就是说,从中心开始为每个特性生成的半径都相当均衡,无论是文本到视频还是图像到视频的生成,都相当均衡。我们可以看到,如果我们关注具体特性,首先是整体平均点,无论是图像到视频还是文本到视频,这些模型都将是最好的,而且可以说是有很大优势的。例如,在文本到视频生成的美学方面,我们看到它们略有不足,稍后我们会看到一些生成,我同意这一点。他们说最好的模型是BO3,我也同意这一点,第二个是clean,所以这些图表乍一看似乎与我使用这些模型的经验相当一致。他们说在运动动态方面,文本到视频生成将是明显最好的,而图像到视频将超越一个非常非常好的模型,那就是Clean 2.1。而且,在速度方面,它们确实非常出色,这直接关系到成本。在速度方面,它们明显比竞争对手更快,所以Ben的团队向我们提出的模型,尤其是一个非常均衡、非常经济的模型,并且在理论上能产生最高的质量。但我认为理想的做法不是停留在Ben的说法上,而是自己去实践,去实地考察。所以,现在我们将看看你们如何能够尝试这些模型,然后我们还将进行一次深入的比较,使用不同的生成结果,看看这些图表是否与初步印象相符。我们将尝试Sidens在F.上。F不是一个普通的工具,而是一个为开发者提供的推理提供商。也就是说,他们有一个非常广泛的模型库,如果你想创建一个应用程序,你可以连接到他们的API,为该应用程序提供功能。例如,生成视频,创建文本,生成图像,而在他们提供的众多模型中,有BO3,也有Clin 2.1,我们稍后还将利用这一点进行价格比较。话虽如此,如果我们去搜索栏搜索Sedens,我们可以看到lite版本是可用的。但不仅仅是lite版本可用,Pro版本也可用。所以,如果我们进入,例如,用于从图像生成视频的cedens,并在浏览器栏中将lite一词替换为pro一词,您会看到我们也可以访问功能更强大的模型。出于某种原因,他们的搜索引擎没有很好地索引它,我必须通过在浏览器中这样做来访问它。所以,在这里我们可以非常简单地尝试所有模型。例如,如果我们回到lite模型,我可以上传一张图片。在这种情况下,这张图片是这张。上传后,我可以提供一个提示词。写完后,只需执行模型。在这种情况下,我们可以看到这里有其他配置选项。我们将生成720分辨率。我们也可以生成420p,并将生成总共5秒。至于价格,他们告诉我们,每个720p,5秒的生成大约需要18欧分。而这18欧分,我们得到的是这样一个视频片段,正如你所看到的,这是一个质量非常非常好的视频片段,所以现在要做的就是将这个价格和这个质量进行背景化。那么,这18欧分与BO3和Clean 2.1相比是贵还是便宜?让我们来看看。为了能够清晰地比较价格以及使用Sidens创建视频的成本,我创建了这个Gemini计算器。我是怎么做的?我去了Gemini聊天机器人的画布,将F上关于不同API的所有文档都传给了它,以便在同一个提供商内部进行比较。然后,它为我创建了这个工具,我将用它来解释Sidens的价格以及它与Cling 2.1和BO3的比较。如果你好奇如何创建这些可以帮助你解决问题的小工具,就像现在我在Google环境中,也就是Gemini聊天机器人,Google A Studio,Gemini集成到Workspace工具中,比如Google Docs和其他一些非常有趣的Google生态系统工具一样,我想告诉你,本周我们将开放Google工具生态系统课程的预售,你将学会如何使用所有这些工具并从中获益。Gemini,Notebook,LM,Google Studio,Workspace,所有这些都将涵盖,所以如果你想和我一起学习,我建议你加入等待名单,链接在描述中。所以,现在我们将使用计算器来查看使用Bite Dance的模型生成视频的成本。我们将分别查看其lite版本和Pro版本,以及不同的视频格式,从最常见的16:9格式到垂直格式的9:16。因此,如果我们选择Lite模型,也就是我用来生成第一个示例视频的模型,因此它是一个生成高质量视频的模型,我们可以看到,如果我们以720p分辨率创建,也就是说,帧的垂直高度为720像素,那么对于16:9格式,生成一个5秒的视频将花费18美分。而一个10秒的视频,将花费30,几乎39美分。如果我们转向Pro版本,我们可以看到,对于720p,我们将从18欧元涨到32欧元,而对于10秒,我们将涨到近65欧分,但我们将可以选择生成1080p,其中5秒的价格将是74欧分,而10秒的价格将是1.45欧元。话虽如此,在这里你可以看到生成不同格式的成本。例如,在方形格式中,由于我们保持帧的高度,因此由于格式更窄,我们生成更少的token,因此价格会降低。注意,使用lite模型以720p²生成一个5秒的视频将花费约10欧元,而当我们生成16:9视频时,则花费近18欧分。在这里,我将在描述中留下链接,你可以自己玩这个计算器,看看用这些模型生成每个视频的成本。如果我们滚动,我们可以看到与F上其他可用模型的比较,我们可以看到Siden系列的模型确实要便宜得多。在这里,我们可以看到比较是针对1080p,5秒视频在16:9格式下生成的。此应用程序有一个小错误,那就是Sidens lite只生成720p,而应用程序将其视为比较中的一个,但它生成较低分辨率的视频,价格为18美分,而其余的都是正确的。我们可以看到,与Sidens Pro相比,它生成一个5秒,1080p视频的价格几乎是Clean 2.1的一半,并且比BO3便宜得多,BO3的价格将是2.50欧元,用于创建无声视频。如果我们已经加入了音频,价格将飙升到这个水平,所以在这里你会看到一个关于用这些模型生成视频成本的完整比较。在比较了价格之后,就该比较质量了,所以我用所有这些模型生成了视频,并准备了一个完整的比较,以便我们能够判断这些模型是否真的能与Clean和Beo相提并论。所以,让我们开始这次比较。我们将首先比较Sidens模型的生成结果,即Lite和Pro之间的比较。然后,我们将比较Sidens的文本到视频生成结果与BO3的生成结果,以及Sidens的图像到视频生成结果与Clean 2.1的生成结果。所以,让我们从Sidens模型的两个非常快速的文本到视频生成示例开始。这样,使用lite版本,我们得到一个像这样的生成,这还不错,但如果我们注意一些细节,就会发生一些奇怪的事情,比如有一小块土地活了过来,自己动了起来,而使用Pro版本,我们得到像这里这样的结果,我认为一切都运作得更好。图像细节更多,我甚至可以说女孩的演绎更完整,向前看,看着她手中的东西,总的来说,我认为Pro版本获得的质量,尤其是在物理效果比较复杂或画面中出现很多元素的视频片段中,质量要高得多。在这里,我们可以并排比较,虽然lite版本还不错,但我认为Pro版本卖得更好。这将是第一个生成,我认为两者都表现得相当好。现在我将向你们展示一个生成,其中两者都表现得有点逊色。这里我们生成了一个彩色场景,女孩们看起来有点远,甚至有点慢动作行走,而且,尤其是细节水平,我认为不如我能做的其他生成。在这种情况下,lite版本再次花费了18美分来生成这样的视频片段。而在Pro版本中,我们得到了这样的结果,其中细节已经多得多。图像质量明显更好,所以当我们必须生成画面中元素占据空间很小的视频时,Pro版本非常推荐。但在这里,请注意,女孩的动作并没有失足,因为这是人工智能生成的视频。它没有完全正确地解释悬崖的尽头在哪里,尽管它后来纠正得很好,将她们定位在应该在的位置。尽管有这个小缺陷,我认为Pro生成明显更好,但在这个案例中,我认为它不是一个令人惊叹的生成。就像所有视频生成模型一样,并非所有视频片段都可用。这里我们将并排比较,以便你们看得更清楚。对我来说,正如我所说,Pro生成的质量明显更好。现在我们将看到这个模型在文本到视频生成方面的一个特殊功能,也就是在一次生成中创建包含多个不同镜头或构图的视频的能力,这种多序列能力。为了做到这一点,我使用了他们自己演示中使用的提示词,比如这个侦探走进房间并检查一个物体,然后给他一个特写镜头。在这里,我们可以看到使用lite生成的视频,使用了明确提到我希望出现的每个镜头的提示词。所以,我们看到序列或动作的动态有点奇怪,只有两个镜头。有一个镜头是我们看到他进来,还有一个镜头是我们看到他在看。这将是一个使用lite生成的视频,仅为420p,花费我们仅16美分。这里是另一个版本,另一个使用lite生成的版本,但这次是720p,花费了37美分,这里的动态效果已经好多了。我们看到侦探走进房间,我们没有看到他拿起物品的细节,而这正是我想要的。最后,我们看到他观察他看到的东西的中景镜头。这里是Pro版本。这次花费了1.48美元。我们看到他拿起物品,然后我们看到那个特写镜头,他仍然在观察情况。好的,在这种情况下,问题是我没有明确说明我希望他在他构建的序列中出现多少个不同的镜头。所以,我重复了这个实验,但这次在提示词中,我明确提到了每个镜头,使用shot,冒号,我希望在这个镜头中发生什么,shot和shot 3。这样,我们就有侦探走进房间的远景镜头,拿起物品的特写镜头,以及侦探看着或检查房间其余部分或犹豫思考的镜头。这样,使用lite,10秒,480p,16美分,它生成了像这样的东西,我们看到它有很多缺陷,但动作序列被正确地尊重了。我们看到侦探进来。然后这里的镜头切换有点奇怪。他的手部出现了一些奇怪的事情,然后我们看到他看镜头的画面。如果我们提高质量,分辨率,我们会得到像这样的东西,这已经好多了。我们看到侦探进来,我们看到动作的连续性,当他拿起桌子上的物品时,仍然有一些奇怪的事情,最后是他在房间里看的镜头。我的感觉是,要制作这些多镜头,尽管提高分辨率确实能提高视频质量,但lite版本并没有很好地发挥作用,Pro版本效果好得多,我们将在下面看到。这是一个花费1.48美元,使用Pro版本,1080p生成的视频片段。注意连续性要好得多。仔细看。首先,我们看到角色进来。注意他拿起的物品。这是完全相同的物品。他先看了看,然后拿起来。与物品的互动相当合理。最后,我们看到那个特写镜头,他正在思考或想些什么。有趣的是,在遵循提示词方面,所有模型都尊重这个三镜头结构,当我明确设置时。在功能方面,我认为唯一真正好的镜头是Pro模型提供的。在这里,我们可以看到两者之间的比较,我认为两者之间的差异非常明显。好的,现在我们将尝试一个非常详细的提示词的文本到视频生成,并且我们将借此机会开始将这个模型与BO3进行比较。所以,如果我输入这样的提示词,一个关于猫在市场里移动的连续镜头,使用sidans的lite版本,我得到这个,这是一个非常有游戏风格的镜头,而猫周围的其他元素,说实话,有点静态。虽然遵循提示词是好的,就是猫在市场里散步,穿过一个小隧道,到达海景。使用Pro版本,情况有了很大的改善。注意我们用Pro版本获得的,也就是这个视频。在这里,我们看到男人甚至注意到猫,那个男人在和另一个人说话,一个人在看报纸,最后猫在转身后到达这个镜头尽头,穿过这些拱门,最后看到了大海。在这里,注意序列的细节和一致性,因为我认为Sidans在这方面可能是最好的模型,它生成的图像质量。然而,在美学和动态方面,我更喜欢BO3的做法。注意,这里是我们用BO3获得的生成,价格也贵得多,要花$,我们可以看到猫在市场里移动,而且我认为至少在美学上,我比Sidans获得的更喜欢。如果我们继续与BO3的比较,我们可以看到,例如,这个视频片段,我使用了与我用于生成我短片中视频片段相同的提示词。在几天前向你们展示的短片中,我解释了如何制作,我将在描述中留下视频。而且,说实话,在美学方面,Sidans文本到图像的生成,虽然作为视频可以相当不错地运作,但在美学方面,它不如Beo获得的那么好。这是我们用Sidans获得的,这是用Beo用完全相同的提示词获得的。我看到这个,我看到一个几乎是电影般的场景,我看到那个,我看到一个糟糕的电子游戏电影。所以,在文本到视频生成方面,我认为BO3稍微领先。虽然我感觉Sidans逐帧的图像质量略好。这里我们可以看到我们获得的两个结果之间的比较。这里没有可比性,而且我应该把它做成黑白的。Sidan让我把这些人物变成了彩色的。我的感觉是,BO3做得好得多。而这个就是我开始演示的视频片段,也是用BO3创建的。在这里,同样,在构图方面,它如何决定描绘人物,BO3所做的决定我认为要好一些,但在动态方面,注意手与泥土的互动,有一些变形和一些瑕疵,而Sidans为我做的生成,也就是这个,我感觉一切都更加一致。美学上,我稍微更喜欢BO3的做法。在视频质量方面,我认为这个比BO3生成的要好。这里我们将并排比较,以便你们自己判断Bedines模型和Google模型之间的区别。现在我们来看图像到视频生成部分,在这种情况下,我们将与Cink 2.1进行比较。让我们先看看我们用Sidans的不同模型获得的。我还将恢复一个我为短片生成的视频片段。在这里,你可以看到我们用Bite版本获得的。我们动画化了图像,我们看到角色正确地从咖啡杯中喝水。在这种情况下,我认为这有点归咎于原始图像的质量,因为我用不同的迭代在flux context上生成,有时图像会受到一些降级,它会不完全保持杯子后面胡子的连贯性,当它靠近时。在lite版本中,这一点不太明显。当我们转向Pro版本时,注意它会更明显一些。这是我用Sidans的Pro版本生成的视频片段。在演绎和遵循指令方面,它确实非常好,但请注意,神奇地,胡子区域出现了一些胡茬,一些比以前图像中更详细的白色毛发。我再说一遍,在这种情况下,初始图像的质量可能有一些影响。这里是另一个动画。你以前见过这个。图像是那个处理奶酪的人。在这里,你可以看到我们用lite版本获得的,仅需18美分。这是一个非常好的生成,完全可用。而这是我们用Sidans的Pro版本获得的。我可以说,在演绎方面,甚至在人物的演绎方面,都有更多的细微差别,在他们看奶酪的方式上。说实话,我真的很喜欢Pro版本生成的,尤其是因为它很好地保留了画面内部的精细细节。在这里,你可以看到两者之间的比较。这是Lite生成的,这是Pro生成的。我认为在这种情况下,lite版本完全可用。Pro生成的几乎就像一个视频,它看起来非常非常真实。这里是另一个生成,在这种情况下,我们将识别出问题,那就是这个视频模型在有元素移动时,当有不同元素同时移动并且需要相互作用,并且在画面中没有明确接触时,会很好地动画化帧,我们将看到一些奇怪的事情发生。这里你可以看到lite生成的。我们看到女孩在跑步,我们看到这个球有一个有点奇怪的行为,然后它最终被捡起来,但物理效果不正确。而这里我们可以看到Pro版本的作用,虽然我认为女孩的动画效果更好,而且她的整个动作更具活力,但与球的互动却差强人意。但这是一个对模型来说很难的挑战。在这里,你可以看到Lite生成的,甚至有点慢动作,以及Pro生成的比较。这里是另一个例子,这些机器人在办公室工作,我们用lite版本获得的,这还不错,但你会发现它移动得少得多,尤其是在背景中,几乎没有什么在移动。而我们用相同的参考图像和Pro模型获得的,注意所有机器人都拥有更多的运动,尤其是注意机器人关节的细节水平。在细节水平上,我认为它是目前最好的模型。这里我们可以再次看到两个生成并排的比较。好的?现在我们来看与Cink 2.1 Master的图像到视频比较,对我来说,或者在我看来,它是最好的视频模型,用于生成这类生成,从图像生成,看看它是否真的能够超越它。这里是我们看到的奶酪制作人的生成,我必须说,我认为它完全出色,Sidans生成的。而这里我们可以看到Clean 2.1生成的。在这种情况下,在质量方面,我认为它非常非常相似。有一个时刻,奶酪似乎有一个引擎在里面,并继续旋转,尽管手指没有移动,但这些都是非常非常具体的细节,而且,说实话,Clean做得非常好。如果我们看比较,你可以在这里看到两个视频。在这种情况下,我认为我会选择Sidans Pro的微妙之处,但让你们每个人自己判断。当然,用Sidans进行相同的生成,价格几乎是它的一半。而这里是用于短片的视频片段的生成,我们已经看到了Sidans的作用,它如何添加了一个细节,即杯子后面消失的东西,比如胡子,并且稍微改变了它,我认为是为了提高图像质量,但有点令人惊讶。而这里是Clean 2.1获得的,在这种情况下,我认为在动画和生成方面,它相当相似。我甚至在这个层面上更喜欢Clean的,但杯子前面和后面的连贯性是完整的,所以我认为在这种情况下,我更喜欢Clean 2.1的生成。这里你可以看到两个生成,并排,以便你自己决定哪个你认为更好。至此,我们达到了这次比较的结尾。正如你所看到的,这个模型确实运作得非常好,而且尤其非常非常便宜,所以当涉及到使用人工智能生成视频,以及越来越多的人能够开始生成这类内容并创作自己的作品时,情况变得非常有趣,因为它们将越来越实惠。我希望它能像文本模型一样保持类似的进展,在2年内成本降低了99%。这里可能不会那么多,但即使我们能实现90%的成本降低,我认为它已经是一个许多人可以开始使用的工具了。说了这么多,如果你想尝试一下,你可以在F上尝试。如果你对可以做什么以及如何用这项技术创作更具叙事性的作品感到好奇,我几期视频前分享了一个关于如何用人工智能制作短片的完整教程,特别是用Clean和BO3,我把它放在这里了。而且,正如我提到的,我们有那个Gemini课程,如果你想和我一起学习人工智能,我认为它可能非常有趣,你会在描述中找到等待名单的链接。M.