📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

字节跳动彻底杀疯了!Seedance 2.0 深度测评:国产视频 AI 首次全方位反超 Sora 2 ? | 附真实商用案例 | Seedance2.0 vs Sora2 vs Veo3.1全对比

灵姐说AI | Ling Talk AI30:12

Transcription

大家好,欢迎来到灵姐说AI。

这期视频啊,跟大家聊一聊Seedance 2.0,这个模型被誉为AI视频领域生成的新王,最强的视频生成模型。它究竟强在哪里呢?这期视频啊,详细跟大家讲讲,并且啊,有应用和对比分析。

这个模型有多火爆呢?最近啊,字节跳动的服务器被它撑爆了。我一直有一个观点啊,如果说一个产品的服务器没有因此而崩溃过,都不好意思叫它是一个爆款产品。而字节跳动的Seedance 2.0做到了。上一次,我印象中做到这个事情的是Sora 2。我自己实测体验下来这几天啊,我觉得它确实配得上这个称号。

你要知道,在文本领域,中国国内的大模型其实一直处于一个追赶这么一个状态。虽然追赶的很近,但是不得不承认还是有差距了。而字节跳动的Seedance 2.0这个模型,我认为它是超越海外的视频生成模型的,可以说是青出于蓝而胜于蓝。这是为数不多的中国国内的大模型超过了在海外,在美国硅谷的这些视频生成模型的一个典型的代表。

你知道有一件很魔幻的事情是什么吗?就是一些在海外的老外最近发帖说,怎么注册中国的手机号,这样他就可以使用Seedance 2.0模型来生成视频了。你去刷一下Twitter,上面疯传的很多模型都是用Seedance 2.0来生成的。这个模型确实是火出圈了。

而且很多人都声称,因为这个视频生成能力啊,这么快的提高,又有一批人要失业了。还有一些很搞笑的留言说,哎,看到这些影视行业的从业人员和我们程序员一样,失业被AI裁掉的命运啊,我们也放心了。

铺垫这么多,我是想表达Seedance 2.0模型的生成效果真的很强。我们来看一下对比。同样的提示词,同样的参考图,这个是Seedance 2.0的效果,这个是Sora 2的效果。虽然说整体的画面效果比较接近,但是放在一起对比,我们可以看到高下立判。这些细节,运镜,还有整体对剧情的理解,Seedance 2.0明显要更加优秀。

现在Seedance 2.0视频生成的质量非常高,又有非常多的玩法了。大家知道啊,灵姐是很擅长各种AI视频的邪修的,都是教给大家实实在在的方法。如果大家对这个系列比较感兴趣,可以在评论区给我留言,关注我的频道,不要错过后续的精彩视频。

关于Seedance 2.0的讲解,我会分为两个部分。

第一个部分,我会讲讲Seedance 2.0,它的核心的升级点在哪里,我们可以用它来做什么事情,有哪些应用点,并且我会对比它和Sora 2和Veo 3生成效果的差别点在哪里。

第二个部分,我会讲讲Seedance 2.0,它为什么这么强,它可以说是第一个中国国内大模型超过海外大模型的一个典型的案例。那他的成功,他的强大来源于哪些关键点呢?这背后又隐藏着,浅藏着什么样的商业机会?未来他会走向何方?这个第二部分的视频啊,我会单独做一期,分为两期视频。我相信这两期视频都会很精彩,给你启发。

如果觉得做的不错,记得给我点赞和留言。

我认为字节的Seedance 2.0,它的核心升级点主要是三点。

第一点是物理世界的理解。它对物理世界的理解更加流畅和顺滑。这一点呢,是针对它的前一代的视频生成模型来说的,而且它也支持音画同出。整个的物理规律的理解更加流畅。当然,这一点对于Sora 2和Veo 3来说,它们都是能做到的。在这个升级点上,我认为是和这两个模型去拉齐的一个状态。

那么第二点和第三点,才是他真正牛逼的地方。

第二个升级点是它的多模态组合的综合参考能力。在Seedance 2.0里面,你可以上传多张图加视频加音频进行综合参考,融入到你的提示词里面来生成视频。其他的视频模型基本做不到。在我看来,其他比较接近有这个能力的,是谷歌的Veo 3.1。在Gemini的对话框里面,你也可以去上传视频,加上图片来进行综合参考,生成对应的视频。但是呢,Seedance 2.0它的生成的时长更多,而且参考要素啊,它可以使用这个引用的方式,更加精准。整个生成的效果要优于Veo 3.1的生成效果。

为什么字节能做到比谷歌还要好呢?啊,这是有原因的。其中还有一个很重要的原因,有个小八卦,就是字节跳动这个Seedance 2.0的负责人,他原来是谷歌的VP。懂了吧?这个我留在下集来讲,就是为什么Seedance 2.0为什么这么强。这集我还是核心集中在怎么应用Seedance 2.0来生成视频,这里面的花活还有技巧。

第三个升级点,我认为是更强的视频理解。你可以看到同样的参考图,同样的提示词,为什么字节跳动的Seedance 2.0它生成出来的视频给我们的感觉,给我们的交互整个是更好的?是因为它对整个的视频生成有更好的理解。你会发现它的整个的运镜,整个的视角,会更加接近我们喜欢的这种电影大片级的,包括短视频的,整个的视频的表达和交互理解。

而这个升级点,来自于字节跳动独一无二的优势。它的这个优势,放眼全球都是别人没有的。也就是它拥有全球第一的影视库。不管是抖音还是TikTok,都是首屈一指的内容生成和分发平台。而这样的数据库,也只有字节跳动有。而这样的后面庞大的数据背后,还有很多的互动信息。这些内容是别的AI平台所不具备的优势。这是它的门槛,它的护城河,也是为什么字节跳动的Seedance 2.0如此之强的原因之一。

上面我讲的三点啊,就是它最核心的三个升级点。一个是对物理世界物理规律的拉平,第二个是它综合引用参考的能力,第三个是它更加专业的视频理解。

接下来,我们来看看Seedance 2.0怎么玩,它和Sora 2和Veo 3差异点在哪里啊。

这个就是即梦的官网。这个链接呢,我也会放在我的置顶评论区,或者大家直接搜索找到对应的网址。大家在用的时候,最好充一个至少是基础版的会员。只有是会员才能够使用Seedance 2.0的模型。现在它在推广期,你只要花一块钱就能够试用它七天的基础会员,你就可以有100多个积分使用它的最新的视频生成模型。

在这个地方啊,选择视频生成。在这里啊,这个位置就是最新的Seedance 2.0模型。因为最近服务器比较卡,生成的速度啊是非常的慢,特别是在东八区时间白天的时候啊,更加卡。呃,可能半夜的时候生成的速度会比较快。如果你希望排队的速度更快一点,可以选择这里的Seedance 2.0 fast。当然,它生成的质量对比2.0会稍有下降,但是整体还是可以的。

看到这里啊,这里就是我刚刚讲的全能参考,也就是Seedance 2.0这个模型区别于其他模型一个显着的特征。在这里啊,点击这里的加号,你可以选择上传对应的图片或者视频,音频。这里可以选择生成的比例,默认是1:1。我们用的比较多的是16:9或者9:16。这里的生成时长啊,可以从4秒最长到15秒。当然,你生成的这个秒数越多,这个视频的积分的消耗也会越多。而且你给他的这个参考的素材越复杂,他消耗的积分也会越多。因为你给他的输入本质上也是一种成本。如果说你上传个十几秒二十秒的视频啊,这个积分消耗要上到100多。这么一条积分的消耗,你可以算一下每条视频他所消耗的积分成本是多少。

在这里啊,有一个@的功能,也就是引用参考。这是在Veo 3或者是在Sora 2里面没有的这么一个能力。当然,我相信啊,谷歌看到了这样的一个功能,我认为它也会尽快的做上去。唯一的差别就是这个背后比较考验算力的消耗。

在这里的提示词里面,你可以直接输入这个@。在这里啊,你就可以选择引用这里面图片一,图片二,或者对应的视频。

如果说大家用这个Seedance 2.0来生成AI的剧情或者AI的动漫,我建议呢,可以用它这里新出的一个模型,图片生成,也就是字节的这个Seedream的5.0的模型。可以用这个5.0的模型生成视频的参考图,然后再基于这个参考图生成视频。目前它的这个图片生成,会员是免费的,不花积分的。

首先啊,我来测一下Seedance 2.0它的物理拟真度怎么样。一个好的视频生成模型,它能够比较好的理解物理世界的规律和对现实世界完整的模拟度。我给他们这几个模型啊,包括了Seedance 2.0,Sora 2和Veo 3.1,给它这张图。这张图我是用Seedream 5.0来生成的。这个呢,是一个拉力赛的比赛的图。为什么用它来测物理呢?本身这个车体啊是刚性的,这个水花包括这个泥沙,还有包括这个石头啊,它又是柔性的。刚性和柔性在一起,包括这个车上啊,他参加这个拉力赛本身,车身的细节能不能够有效的还原和保持一致性?我们可以通过这个对比,来看一看各家模型他的表现力如何。

我统一给的提示词是这个,大概的意思呢,就是说这个拉力赛车在泥泞中去突围,轮胎猛烈的旋转,并且呢由于抓地力不足,这个泥块和水花呢就会喷向空中,并且呢车身是上下震动的,然后呢轮胎的这个烟雾和飞溅的泥浆是混合在一起了。相当于是刚与柔,它的物理表现是什么样子的?

我们先来看Sora 2的。它整体的这个泥石飞溅的效果还是比较真实的,包括声音的表达都不错,一致性也不错。除了这个地方,在这一帧,这里突然出现了一块多出来的挡板,这个是在原图没有出现过的。它的一致性啊有一些变化。关于车背后这个地方,它多了两条黑色的横杠。这个它是适度做了想象。这张图是我的原图,因为它是仰拍的这个视角,其实从这个视角没有办法去判断这个车窗是否有两个横杠,所以那个属于适度想象。

再来看Veo 3。Veo 3整体的表现也很不错,但是会发现啊,这个有一个天线。在后面的一些帧的时候发现,你看这个车上面的天线消失了,慢慢就没有了。除了这个失去之后,他其他车身的细节啊,基本上都是保持一致的。整体的表现力也是很棒的。这里泥泞溅到这个车身上的这个效果也很接近真实的情况。

Seedance 2.0它的整体的细节的维持啊,非常到位。它这个天线没有消失,也没有多出来一些挡板之类的装饰物。而且我在提示词里面特别说了缓慢这个词,在Seedance 2.0里面呢,它是去做了比较强烈的表达,会有这个很缓慢的过程,它会体现的更加明确一点。它的文字的跟随性会更强。不过呢,它也有一个bug,这个视频播放到后面的时候,会发现在这个地方,因为我原图有一个阴影的效果,他理解为这个车窗这里啊有一个洞,他帮我多搞出来了一个洞,就这里出了一个娄子。其他细节的表达,包括稳定性,特别是包括像天线这么细微的表达,它也是尽力的维持了一致性的整体。我是比较满意的。

用AI生成视频啊,大家还是要有一个相对开放和包容的心态。在AI时代,我们更加关注的还是它的想象力。对于一些小的穿帮的东西啊,大家还是要有一定的包容度。包括我们现在看的很多经典的电视剧,像琅琊榜,其实里面也有非常多的穿帮的镜头,但是仍然不影响它成为一部经典的影视作品。对于AI创作的影视作品多模态生成,我们也应该抱有这种包容的态度,用发展的眼光去看这个事情。

总结一下,关于物理拟真表达这一块,Sora 2,Veo 3.1还有Seedance 2.0,我觉得三者基本上是齐平的,一个表现程度。他们对于物理规律都有一定阶段的理解能力和表现能力。而且我认为Seedream 2.0它对于这些细节的一致性啊,保持得更加好。

第二个,我要测评的维度是动态的映射性。我设计的这些评测的维度啊,都挺变态的,但是呢也都挺实用的,就是一个更极致的一个测评吧,就是我有点像一个极限测评的一种方式。那么低于这个极限能力的,实际上他都是能够完成的。

这里我要测试的是给它一段视频,然后呢让一个图片的主体去模拟这个视频的动作。这里我选择的是迈克尔·杰克逊的这个太空步,这个舞步我相信是广为流传的,永远的经典。那么能测这个能力的,现在目前就两个模型,一个是Veo 3.1,一个是即梦的Seedance 2.0。所以我会拿它两个做对比。像Sora 2的模型只能够上传参考图,是不能够上传参考视频的。

而且关于这个测评,我打算更变态一点,我打算用一个动物去模拟这个Michael Jackson的舞步。如果说一个动物能模拟,那么换成一个人,那就是简单的换一下人物形象嘛,相当于我这样,把这个人的动作迁移到另外一个身上。这样的视频生成,应该对于这样的模型都应该是很简单的。所以这一次我的测评就是用一个螳螂,也就是它这个粉色螳螂作为主角,让它模拟MJ的太空步的舞步,以它的这个视频的动作为参考,来形成一段视频。

大家刚刚看到的是Veo 3.1的。其实整个舞啊,跳的还行,而且也比较符合螳螂的特性。首先啊,这个螳螂跳舞,他没有说只靠两只腿支撑,虽然说啊,在这个图像里面,人是两只腿走路跳舞的嘛,但是他要考虑这个螳螂他本身的生物属性,所以在这里啊,他是让这个螳螂四条腿着地的,是符合螳螂的属性的。另外啊,整个的舞步其实还可以。

Veo 3.1生成的一个问题,你会发现在某些帧节里面,它少了几只腿。你看在这里转身的时候,好像只能看到两条腿在这里啊,这里是它的这个前臂,包括这里转身的时候,你也发现他少了一只腿。它的人物的一致性啊和这个稳定性在某些帧啊是有一定的问题的。

给大家看这个是我Seedance里面生成的。因为当时实在是太卡了,我这里还是用的Seedance 2.0 fast的模型。这里提示词也写得很简单啊,以图片一为主角,参考Michael Jackson跳舞的这个视频,演绎和视频一致的太空步的舞蹈动作。背景音乐呢,和视频一保持一致,强节奏感。提示词这很简单哦。

你看整个的视频,它的完成度是比较好的。它的整个的腿没有缺失,它对这个图片的精细度啊,保持的特别好。而且这个舞步呢,其实我整体看来会更接近原来Michael Jackson的这个太空步啊。虽然从形式上呢,和这个太空步的这个滑步啊,还有点距离,但是啊,我觉得里面的精髓还是抓住了的。

总结一下,关于动态能力映射这个板块,Sora 2不能够支持视频的参考。Veo 3,它的一致性包括稳定性会有一点点缺失。Seedance整体的保持和完成的相对比较稳定,哪怕我用的是Seedance 2.0 fast的模型。

第三个维度,我要测测这个模型在运镜和叙事方面的能力。如果说这个模型这方面的能力过硬,那么就能很好的运用在AI影视和AI动漫相关的行业。

我会给到他这张九宫格的参考图,让这些模型以九宫格作为全能的参考,生成流畅的高燃动画,能够无缝衔接这九个格子的剧情。从御剑飞行,躲避这个野兽的火的吐息,然后再来一个史诗级的万剑归宗的释放和爆炸,然后这个妖兽的粒子消散,最后呢化成一个丹,然后再在夕阳下远去。相对一个比较完整的剧情,一个打斗的环节,看看这些模型完成的怎么样。

这个是我Sora 2的后台哦。在这里我一次性抽卡它。这里可以一次性基于同一个提示词,同一个参考图生成了3条视频。我就这里我就一次抽了三次卡。我其中选一条我认为最满意的视频给大家来看。

整体来看,Sora 2生成的视频啊,已经很不错了。单看这个视频啊,你已经能够抓住这个故事的梗要,剧情啊你是完全能够了解的了的。而且在中间他还有一句配音,万剑归宗,其实还是挺符合整个故事的设定了。但是还是有一些别扭,对不对?比如说在这里啊,你会发现,这里他明明是和这个妖兽打斗的场景,但是他却背对着妖兽,和我们之前的这个场景不匹配。相当于他,是把这个九宫格的画面进行了拼合,但是呢却没有符合真实的這個运镜和真实的影视剧的这么一个场景。有需要调整的地方,这里就会要涉及到我要需要进行二次抽卡进行调整,补充我的提示词进行说明。包括他在后面和这个野兽打斗的场景啊,基本上人是背面或者侧面对着这个妖兽的。而且他的整个的画面就会相对单一点,没有那么这种完整性和丰富性。

那我们再来对比看一下Seedance 2.0。同样的提示词,它的完成的效果怎么样?你看一开始他御剑飞行的时候,就有一个由远到近的这个过程,这个我们作为观众看起来就很舒服了。

再往下看,你看他会有不同视角的切换。这个妖兽喷火的时候,两个人是正面的。而且在这里看啊,这个妖兽的细节会更加丰富一点。整个Seedance 2.0它生成的这个视频的清晰度,就比Sora 2要清晰一个等级。当然Seedance 2.0它是收费的,Sora 2,它如果说通过这个后台去生成的话,目前是免费的。如果说你用API接口,那是另外去对比。现在字节的这个Seedance 2.0它的这个接口还没有开放。我看到通知是说,到2月24号的时候再开放。那2月24号开放的时候啊,我觉得真的有很多可以基于工作流,基于这个AI动漫很多事情可以做。我也非常希望这个接口早日开放,我可以做很多很多的事情。

关于这一点呢,我未来可能会出很多系列的视频,包括大家很多关注的点,我希望做哪些创新的一些玩法,一些讲解啊,大家可以在我的这个视频下方给我留言,我会去考虑的。之前我老的粉丝啊,有一部分就是从我的Sora 2的那个邪修的系列转粉的。那里面我讲了非常多实用的方法,直指这个视频制作的一些这种核心的方法论嘛,并不是说给大家提示词,教一次性的东西。我觉得Seedance在这样的创作背景下,我可以做出更多有趣而且实用的,帮大家能够解决一些真实应用场景的东西。而且很多东西大家做出来其实都是能够变现的。

包括后面他这个万剑归宗打斗,然后最后化成丹,把这个丹取走,然后再御剑在夕阳下离去,和我整个的提示词的这个跟随性啊,非常的强。它的文本的对齐性,细节的保持性,运镜的丰富性,和这个观众看的这个舒适性啊,整体性我觉得非常舒服。而且我整体就是一次性抽卡完成的。他的抽卡率降低了。虽然说啊,他单次的这个生成成本不低,当然对比这种复杂的以前的视频拍摄,已经很低了。生成这样一条视频大概四五块钱,对比我们以前的这种高额费用的动漫或者影视行业的这个拍摄成本,已经很低了。影视行业动漫行业真的要变天。

第四个维度是看看这个模型在真实的商业场景的应用。你想过没有,他的细节保持的如此之好,一致性保持的如此之高,那么一个重要的利好点,就是可以在很多真实的商业领域里面去应用。影视行业,广告行业,动漫行业自然不必说。那么我再极端一点,我再测测最接近钱的几个行业,比如说电商行业,比如说本地生活行业。

在这两块,如果真的要讲,其实有很多细节,包括你的很多在TikTok做商品分发的,在抖音做商品分发的,这些视频啊,以后就可以用Seedance 2.0去做了。你想过没有,以前大家做了很多批量的分发,找了一堆很便宜的这个工具,人也好,这个员工也好,去批量的做一些小商品的讲解,然后把这个短视频挂在这个一些平台上面做分发,然后在下面挂这个购物车。以前就通过这样的方式来营销分发销售。以后这样成交的这个视频啊,可以不用人出镜,也不需要人批量讲解录制,用AI成本更低,而且它对你的整个的商品的一致性保持的很好,而且你能全部的参考,能前视图,后视图,左视图,右视图,俯视图,全部把它上传上来,比我刚刚一开始上传那个车的图啊,要完整。这样你整体的细节性啊,在这个全能参考的引用下,能保持的非常的好。

关于这种在真实商业场景下面的制作,包括后面API接口开了之后,整个的视频形成的工作流怎么做,我也可以做单独的一个视频给大家讲讲。

在这里测评的这个环境下,我先跟大家去讲讲它在本地生活的一个应用。在这个案例里面,你也可以看到他对细节的还原和保持度非常的高。而且我把这个结果给到商家,商家侧是非常满意的。这还是我稍微做了一下,因为现在即梦的这个2.0实在是太卡了,这个排队的时间太长了,我后面的成片还没有做出来,先给大家看一下我初步成品的效果,商家已经很满意了。

这里我给Seedance 2.0提供的任务就是,我基于本地生活商家给我的环境照片,来给它生成对应的商家宣传片。原来要生成这样的宣传片,要么小几千,要么大几千,现在只要一杯奶茶的钱就可以完成的很好。比如说在这里啊,我从大众点评上面找了一家商家,把它对应的环境照片全部下载下来,然后标识好。

你 Jeżeli看到它,其实这些环境照片是有非常多的细节的。以这张门头为例,你看到这里的门头,这里有个玻璃,上面有很多小字,这些小字其实就是细节。它的稳定性表达性如何,也体现这个模型的能力。并且啊,这个商家他的环境的图片是多角度,不同维度去拍的,怎么把它通过运镜很好的集合在一个宣传短片里面,进行一个很好的表达。看看这个Seedance 2.0能够完成到什么程度。

给大家看一下我即梦的后台。在这里,我把刚刚大家看到的这些照片上传上来,然后在提示词这里啊,我是分时间轴去写的。请注意,这也是一个非常重要的技巧,时间轴的方法。当你有自己的考虑和思考的时候,可以分时间轴去表达你的想法,而且可以去表达和引用你对应的图片或者音频视频。比如说在这里,我就是分段来讲的。比如说0-3秒,那么我是第一张图,3-6秒是第二张图,6-9秒又是一张图。我是沿着从入口再到大厅,再到包厢,再到阳台,再到整体的无人机视角的这么一个俯拍的这么一个状态。那我表达了整个运镜。

那么我们也来看一下最后Seedance 2.0完成的效果是怎么样子的呢?是不是挺不错的?总之商家给我的反馈啊是非常满意。这只是我初步做的,我还没有详细做。实际上我还可以把它连接起来,做成30秒,45秒,甚至是一分钟的完整的宣传片,再往里面加上人物的讲解,加上一些场景,整个的宣传片会更加的丰富。商家跟我讲的是啊,你看这里啊,还有真实的阳光下来的光影,包括最后的这个从近到远的无人机视角的飞拍的这种状态,他觉得非常的好,超乎他的预期。实际上我还没怎么用力。如果说你好好的把这一块钻研一下,你是不是就能够给这些本地生活的商家很多精细化定制化的解决方案?这是不是就是也是一种商机?本地生活运营这块有机会,电商运营这块也有机会。

Seedance 2.0能做视频的延长,它能够参考前一个视频的风格,接着完成第二段视频。这样就像拍广告一样,一段接着一段,形成一段完整的视频。一段生成出来,再成为第二段的参考,生成好之后又喂回去,又形成一段参考,形成套娃式的创作。Seedance 2.0真的有太多太多的想象空间。我会把这些内容都放在我的频道里面,给大家逐条的去分享和实践。记得订阅我的频道,灵姐说AI,我们下期再见。

比如说这里啊,基于前一段咖啡杯长树的这个视频啊,就可以参考这段视频,然后往后延长,形成一粒咖啡豆从画面轻轻飘落,然后呢,再形成lucky coffee的这么一个画面。这个是不是就可以作为瑞幸咖啡的这么一个延长广告的视频镜头?而且啊,既然Seedance能够全能参考,那么就能够用Seedance 2.0做一个套娃式的创作。它的产出就是后面的参考。