Transcription
通常是那个试图将这些文字转化为视觉效果的人。对我来说,最难的部分不是想出点子,而是解释我脑海中尚未存在的东西。我们花费大量时间用文字描述视觉效果,而且如果我们想正确地测试某项内容,通常需要构建它、渲染它,然后等待。声音几乎总是最后才出现,此时大部分视觉效果已经确定,而这正是耗费大量时间和产生压力的根源。所以,这就是 Seat Dance 对我来说变得有趣的地方,它不是一个取代制作的工具,而是早期探索想法、避免任何损失的方式。它帮助我推进决策。传统上,我们只有在制作完成或接近完成时才能感受到一个场景,这时有人会说:“哦,节奏太慢了,镜头移动不行,声音也不对劲”,而此时再改变会浪费大量时间和精力。有了 Seat Dance 和新的 AI 工作流程,我就可以提前推进这些决策。所以,让我详细解释一下。左边是制作视频的传统方式。我们从简报开始,然后是草稿、故事板、制作、编辑、声音和审查。每个步骤都需要时间,而且我们通常要到很晚才能看到最终的想法。当有些东西不起作用时,修改成本很高。另一方面,这是 AI 工作流程,而不是提前几周计划然后才能看到任何东西,我可以几乎立即开始生成想法。我尝试不同的版本,进行审查,并快速调整。我通常可以在当天或第二天得到一些可用的东西。所以,最大的区别在于决策何时做出。传统的 AI 工作流程决策很晚,而 AI 工作流程则帮助我及早做出决策。所以对我来说,唯一真正节省时间和成本的地方在于我花费更少的时间猜测,花费更少的时间在最后修复东西,而我从草稿开始。它帮助我以更少的压力更快地前进。作为一个经常使用 Seat Dance 的人,我想强调这一点。以前,提示词也需要大量的时间和反复试验。有了新模型,我觉得它更准确了。我花更少的时间在提示词上,花更多的时间在指导上。所以,我知道 Ethan 会在产品方面更好地解释这一点,但从用户的角度来看,现在真的很容易。是的,也许 Ethan,你想进一步解释并深入探讨提示词。
>> 感谢 Gordon 的精彩分享。我相信很多人都会产生共鸣。提示词正是 Gordon 刚才提出的第一个问题。现在,让我们来看看这三个痛点,看看 Cas 1.5 是否有帮助。好的,首先,如何让 AI 模型更用户友好一直是我们的产品团队和研发团队非常关心的问题。在这里,我想介绍我们进行的三项任务,以帮助大家更好地理解如何更好地控制 seance 模型。首先,我们使用 AI 创建了一个自动提示词优化模式。首先,如何让 AI 模型更用户友好一直是我们的产品团队非常关心的问题。在这里,我想介绍我们进行的三项任务,以帮助大家更好地理解如何更好地控制 CAS 模型。首先,我们使用 AI 创建了一个自动提示词优化模块,这样用户只需要输入最关键的信息,AI 就会进行进一步的丰富和优化。因此,现在用户不需要写特别长的提示词,我们最多建议不超过 500 字以获得良好的结果。其次,我们将视频制作领域的许多术语训练到模型中,使模型能够理解更专业的视频术语,例如镜头移动。这样您就不必在提示词中花费大量精力进行解释。最后,提示词仍然非常重要,因为人类是下达指令的人。所以,我想请我们的专家 Tia,您能否分享一些关于提示词的建议,以充分发挥 Cance 1.5 Pro 的潜力?
>> 是的,我们也有一些提示词指南与大家分享。第一个是“少即是多”。请避免冗余的描述。有时当您上传图像时,诸如风景、对话、角色等细节已经嵌入其中。所以,在文本中没有必要重复它们。您就像我们写的那样,用户只需要上传最关键的核心内容,少于 500 字。模型将自动优化提示词到理想状态,然后写一个好的提示词,您需要掌握结构化描述。我的意思是,您可以记住基本或目的的公式。这可能会对您有所帮助。您需要明确主体、动作、环境和镜头移动尺寸的描述,因为 sedance 1.5,因为 sedance 1.5 pro 支持带音频的视频,所以如果您想生成带音频的视频,您需要输入音频描述。最最重要的原则是永远不要让模型去猜测,因为模型不知道您想要什么。您必须将必要且清晰的信息提供给模型,以获得高质量的音频和视频。
好的,让我们看一些例子。好的和坏的。
[尖叫声]
[尖叫声]
这里我们也准备了一些关于角度的例子。这是低角度的。你好 Tia,我有一个问题。基本上,以前我做提示词时,有很多问题,比如我无法获得正确的角度等等。那么对于新模型,我们能否获得特定的角度,例如鸟瞰图、推拉镜头或某些特定的圆形运动?它们能支持吗?
>> 是的,当然。为了与传统专业创作者的脚本语言保持一致,我们特别支持这些专业的摄影或电影级别的术语。当您输入诸如推拉变焦或触摸角度之类的术语时,模型将直接生成符合专业标准的、高质量的视觉效果和镜头。
非常感谢 Tia。
>> 好的,谢谢 Tia。那么,让我们回到 Gordon 刚才提到的第二个挑战——迭代缓慢。Gordon,您能多解释一下吗?
>> 好的。是的。我将解释这部分。我想退一步想一会儿。很多人问我为什么不直接使用 AI 视频模型,老实说,我试过了。原始的 AI 视频模型实际上非常令人印象深刻。质量可以非常好,尤其是在高分辨率下。它们非常适合实验、参考以及推动视觉效果。但当涉及到实际制作时,会出现一些问题。首先,成本和时间,因为这些模型非常庞大,处理时间长,而且丢帧率可能非常高。所以您可能需要几分钟,然后才意识到版本实际上并不奏效。如果您重复几次,时间和成本都会迅速累积。其次,是灵活性问题。许多原始视频模型只生成固定长度的片段,例如四到十秒,以及固定格式,通常是 16:9 的高清格式,有时甚至是 480p 的低分辨率选项。作为创作者,这实际上是相当有限的。我的大部分工作不是一个完美的十秒镜头,我需要不同的长度、不同的格式,以及快速的迭代。最后是速度,高分辨率肯定看起来更好,但质量越高,等待的时间就越长。有时需要几分钟才能看到想法是否可行。这对于创造性探索来说并不理想。所以问题不在于质量,而在于可用性。原始模型很强大,但它们的设计并非围绕着创作者日常的工作方式,而这正是 Seat Dance,尤其是 Draft 模式,对我来说变得非常有意义的地方。那么,您是否愿意进一步阐述这个 Draft 模式,我对此非常期待。
好的,谢谢 Gordon。有了 Cance 1.5,这些问题可以得到更好的解决。首先,我们引入了 Draft 模式来解决因生成多个视频以获得满意结果而导致的高成本和长时间的问题。其次,我们开发了大量的模型参数,以尽可能直接生成创作者所需的视频,从而减少后期制作编辑的工作量。最后,我们的生成速度很快,模型性能非常稳定。目前许多视频是通过复杂的流程生成的,而这两个优势可以确保更高的质量和效率。那么,接下来,让我们首先专注于理解行业独有的 Draft 模式,我们的专家 Tia 将对此进行解释。是的,Seat Dance 独家支持 Draft 功能,它更具成本效益且节省时间,有助于创作者提高工作流程效率。Draft 功能的目的是让用户在最终确定完整推理之前,快速查看生成的低质量但方向准确的视频预览。它可以帮助创作者确定提示词是否合适以及动作是否合乎逻辑。所以,让我们来看看实际结果。左边是 Draft,右边是 1080p。Draft 和官方视频可以确保场景、轨道、主体动作、提示词意图和镜头调度的连贯性。视频生成 Draft 是我们视频生成推理管道中新添加的中间输出可视化功能。该功能允许用户在完整推理生成完成之前获得初步的解码结果,可用于快速验证场景结构、镜头调度、主体动作、光照和风格等关键元素。Draft 功能显着减少了时间消耗,生成速度比完整生成请求提高了 65%。Draft 和官方视频可以确保以下方面的连贯性,包括主体身份、场景语义、动作语义、光照和风格以及镜头移动,它还可以保持音频的一致性。那么,我有一个问题想问 Gordon。您通常需要生成多少次才能得到满意的视频?
>> 好的。通常需要大约五到十次,但有时也可能多达二十次。很多时候,背景、前景、动作等变化很大。您需要有很多组件来尝试不同的东西。所以这就是为什么您需要生成很多次。是的。
>> 好的。所以这就是为什么我们的 Draft 模式价格非常有竞争力。这是一张成本计算的对比表。如您所见,没有 Draft 和有 Draft 的对比。如果我们以五个任务为例,过去您需要生成五个 1080p 视频。成本接近 3 美元。但有了 Draft,它将变成五个 Draft 和一个最终输出,成本不到一美元。所以,所以我们认为 Draft 模式将来一定会降低您的成本并释放您的创作边界。有一件事我想提一下,那就是生成速度。当您生成一个 1080p 视频时,需要花费 70 秒,但当您使用 Draft 时,只需花费 10 到 20 秒,这将减少时间消耗。
哇。这个 Draft 模式确实帮助了很多制作公司甚至 AI 创作者节省了大量的成本和时间。所以我迫不及待地想使用这个 Draft 模式,我个人已经开始使用了,而且我非常喜欢它。
好的,很高兴知道您喜欢它,Gordon。接下来,让我们看看灵活的细节。首先,关于时长,正如 Gordon 刚才提到的,很多提供商只有四到十秒,但 1.5 支持四到十二秒。所以,无论您需要多长的片段,都可以直接由模型输出。这次,1.5 Pro 还支持模型根据内容自动选择时长。其次,我们支持所有主流分辨率以及行业内的大多数比例,从 1:1 到 21:9,所以您无需进行后期处理。此外,1.5 版本还支持自动选择合适的比例。此外,1.5 还支持离线模式。如果您没有实时任务,选择离线任务可以节省一半的成本。不同的参数组合将产生不同大小的视频。视频越小,成本越低。因此,每个人都可以根据自己的场景实现更优的成本效益比,而不是进行大量后期处理,例如裁剪模型生成的许多内容,这无疑会造成浪费。此外,视频越小,生成速度越快。所以您可以看到,对于可以在手机场景中使用的 480p,我们最快的 1.0 fast 版本只需要大约 10 秒,而 1.5 版本只需要 30 秒。
好的,现在让我们进入今天的亮点,带音频的视频部分。首先,让我们请 Gordon 介绍当前视频模型遇到的音频问题。Gordon,请您讲。
>> 作为我来说,另一个巨大的痛点是音频、对话、音效、时机。它总是比预期的花费更长的时间,而且通常在过程的后期才出现。在视觉效果大部分完成后,然后开始寻找音乐。然后我会寻找音效,并试图让一切都协调起来,比如时机、节拍、冲击等等。听起来很简单,对吧?但每个做过或正在做这件事的人都知道这需要花费大量时间。有了新的 Seat Dance 1.5 Pro,我工作流程的这一部分发生了很大变化。只需一个简单的提示词和一个点击,您就能得到您想要的东西。现在我将把话筒交给 Tia,让她进一步阐述这个音频或音效在 Seat Pro 中是如何工作的。
>> 好的,谢谢 Gordon。Sance [清嗓子] 1.5 Pro 能够执行各种任务。包括文本到音频视频合成以及图像引导的音频视频生成。它从视听同步的创意需求出发,采用了分支扩散 Transformer 架构,并通过跨模型融合模块,实现了视觉、声音和节奏的统一建模,确保生成的视频在唇部运动、情感和音频节奏方面具有高度的一致性。sedance 1.5 pro 支持毫秒级视听同步。过去,您想创建这样的视频,需要找到完美的音频片段,并与视频时间线进行预先匹配。但现在,您只需写一个简单的提示词,就可以实现音频和视频之间的无缝匹配。我们可以看看实际的视频。您可以看到,当剑和军刀碰撞时,音频可以精确地匹配视觉效果。Sedance 原生支持多人多语言对话。目前我们支持中文、英文、日文、韩文、西班牙文和印度尼西亚文。此时,我们真正告别了无声电影时代,实现了毫秒级视听同步。此外,在生成视频时,Sedance 1.5 Pro 使角色的唇部和肌肉运动完全符合发音习惯。您可以仔细观察,我们视频片段中的说话角色不仅仅是简单的唇部运动。相反,他们的脸颊、下巴和喉咙同时协调运动。这在过去是不可想象的,因为 AI 世界充满了魔力。
[笑声]
哇,这真是太令人印象深刻了。好的,我有一个问题想问 Tia。关于这个,我们如何保持角色在不同场景下的声音一致性呢?因为我们现在是在这个场景下生成,但如果我们用在其他场景,我们能得到相同的声音吗?
>> 是的,好问题。对于画外音,我们引入了种子值的概念。您可以使用非常详细的声音描述和一个固定的种子值,通过这种方式,无论您生成多少视频,角色的声音音色都会保持一致。换句话说,您只需要使用一个固定的详细描述的提示词,与种子值相比,我们可以跨多个具有不同镜头序列的视频保持一致的声音音色。让我们从最重要的开始。如果您想要答案,请仔细听。
保持警惕。我决定时我们再动。
我确切地知道我们将如何处理这件事。
嗯,这真是令人印象深刻。我迫不及待地想使用这个功能,因为我们经常在单独的应用程序中生成音频。所以现在在一个应用程序中,我们能够让视觉和音频正确地同步在一起。
好的。感谢 Tia 和 Gordon 的精彩分享。我相信大家现在对 Cance 1.5 Pro 都有了更深入的了解。接下来,让我们看看一些用例,展示人们现在如何使用这个强大的模型。首先是电子商务和广告。现在您可以直接生成带有口号的视频,无需后期配音。
>> 是的。正如 Gordon 刚才提到的,与传统工作流程和 AI 生成工作流程相比,我们从广告公司的专业人士那里获得了深入的反馈。通过使用这个视频生成模型,他们可以在仅需原始所需时间 1% 的时间内达到预期结果的 70%。例如,创建一个一分钟的电视广告视频通常需要一个由 10 到 20 人组成的团队,花费 20 到 30 天才能完成。但现在,您只需要一个人就可以在短短 80 到 100 小时内完成。Cance 1.5 pro 配备了 Draft 功能,可以进一步提高效率并降低此类场景的成本。
嘿,说得太对了,而且非常贴切。这确实节省了大量的时间和成本,缩短了生成内容所需的时间。其次,电影和电视场景以及镜头控制更加专业,音效完美同步。此外,Sedance 1.5 Pro 支持的视听同步功能消除了创作者在视频生成后进行后期配音的需要。
是的。最后,在动漫和 AI 伴侣场景中,根据情节实现了智能镜头切换和角色情感的准确表达。此外,在教育和培训等许多场景中,也有大量创作者在使用我们的模型。我们相信,随着模型的强大,可以解锁的场景数量也将增加。
好了,今天的分享就到这里。感谢观看本次网络研讨会的观众,也感谢我们两位杰出的嘉宾的分享。大家可以扫描二维码,立即免费体验我们的 Cance 1.5 模型,特别是其语音和 Draft 功能。此外,您还可以扫描获取详细的提示词指南。未来,我们将继续推出新模型,敬请期待。下次再见。再见,Gordon。再见,Tia。再见,大家。
>> 大家好。再见,Gordon。感谢 Ethan 和 Tia 的邀请。是的,谢谢大家。大家好,欢迎收看 Bad Plus AI 直播。今天的主题是我们最受欢迎的视频生成模型 Cance 1.5 Pro。通过观看今天的直播,您将了解到视频模型在哪些方面发生了变化,哪些问题仍然存在,以及最新的模型如何解决这些问题。我负责模型的产品解决方案,这是一个一站式 AI 模型平台,您可以在其中试用、运行甚至微调 Cense 模型。今天我们还邀请了两位嘉宾。首先是 Gordon,一位非常有创造力的制片人,拥有丰富的 AI 经验。他今天在线。你好,Gordon。你在吗?请跟大家打个招呼。
>> 你好,Ethan。我是 Gordon。我在 Bike Plus 担任制片人和动态图形设计师。
>> 是的。然后是 Tia,她和我同组。她专注于 C dance 模型。她亲自参与了 2025 年的所有全球顶级产品,并对视频生成模型在各个行业的应用有着非常全面的见解。今天 Tia 来到实验室与我们一起。Tia,请跟大家打个招呼。
大家好,我是 Tia。我主要负责视频生成相关工作,将尖端的跨模态和生成技术转化为可扩展的、可投入生产的生产能力。以业务目标为导向。我的重点是让视频模型在现实用例中产生持久的价值。很高兴在这里见到大家。
>> 你好 Ethan。你好 Gordon。
>> 你好。
>> 大家好。
>> 是的。除了参与今天的讨论,两位嘉宾还准备了一份详细的文档来分享他们的经验。所以请不要提前离开,不要错过下载链接。好的,我们开始吧。由于一些观众还不熟悉视频生成模型,我将首先介绍其基本工作模式和发展历史。首先,使用模型非常简单。您可以输入文本和图像,然后模型将根据您的指示生成视频。从 2024 年底开始,模型的性能开始迅速提高,视频质量变得非常非常高。但当时模型还不能生成声音。从 2025 年下半年开始,模型生成的视频可以带有音频,但音频能力尚不成熟。因此,我们推出了 Cance 1.5 Pro,它可以直接生成带有音频的视频,包括各种类型的人声、环境音效和音效,并能实现毫秒级音频同步。稍后我们将介绍更多细节。
好的,现在我们已经了解了基本细节。让我们来看看 2025 年的应用场景。2025 年,我们发布了一系列 CADS 模型。由于其高质量、稳定且生成速度极快,它们受到了许多用户和行业客户的欢迎,包括广告和营销、影视、动画和游戏等领域。您几乎可以在所有主流 AI 工具中找到我们。首先是广告示例,我们可以看到创意的连贯性非常出色。镜头切换稳定。脚步声和画外音与动作精确匹配。其次,在影视领域,大家都喜欢我们的模型,因为它具有更准确表达的能力。其次,在影视领域,大家都喜欢我们的模型,因为它具有准确表达人类情感的强大能力,例如老人从担忧到释然的倾听过程。然后在动画领域,细节得到了很好的保留,与传统的特效解决方案相比,成本极低。最后,在游戏场景中,角色的连贯性非常出色,能够快速生成各种角色。尽管这些行业中已经有大量视频由 AI 生成,但在模型迭代过程中,模型仍然存在一些弱点。创作者提供了很多有价值的反馈。这就是为什么我们今天邀请了 Gordon。让我们看看他今天给我们带来了什么新的挑战。你好,Gordon。请您讲。
>> 好的。谢谢 Ethan。您已经从产品角度了解了 Cance 1.5 Pro。我将从一个非常不同的角度来谈论它,就像每天实际使用它的人一样。所以,我将再次介绍自己。我是 Gordon。我在 Bike Plus 担任制片人和动态图形设计师,这基本上意味着我花费大量时间试图解释那些只存在于我脑海中的想法。所以在我们谈论任何工具之前,我想先谈谈现实。如果您是创意人士,这可能感觉非常熟悉,而且大多数项目都进展迅速。有很多意见和反馈,通常听起来像是“能让它更具电影感吗?”“能让它更酷吗?”这些都没有错。这只是意味着我们还没有看到这个想法。作为创意人士,我们通常是那个试图将这些文字转化为视觉效果的人。对我来说,最难的部分不是想出点子,而是解释我脑海中尚未存在的东西。我们花费大量时间用文字描述视觉效果,而且如果我们想正确地测试某项内容,通常需要构建它、渲染它,然后等待。声音几乎总是最后才出现,此时大部分视觉效果已经确定,而这正是耗费大量时间和产生压力的根源。所以,这就是 Seat Dance 对我来说变得有趣的地方,它不是一个取代制作的工具,而是早期探索想法、避免任何损失的方式。它帮助我推进决策。传统上,我们只有在制作完成或接近完成时才能感受到一个场景,这时有人会说:“哦,节奏太慢了,镜头移动不行,声音也不对劲”,而此时再改变会浪费大量时间和精力。有了 Seat Dance 和新的 AI 工作流程,我就可以提前推进这些决策。所以,让我详细解释一下。左边是制作视频的传统方式。我们从简报开始,然后是草稿、故事板、制作、编辑、声音和审查。每个步骤都需要时间,而且我们通常要到很晚才能看到最终的想法。当有些东西不起作用时,修改成本很高。另一方面,这是 AI 工作流程,而不是提前几周计划然后才能看到任何东西,我可以几乎立即开始生成想法。我尝试不同的版本,进行审查,并快速调整。我通常可以在当天或第二天得到一些可用的东西。所以,最大的区别在于决策何时做出。传统的 AI 工作流程决策很晚,而 AI 工作流程则帮助我及早做出决策。所以对我来说,唯一真正节省时间和成本的地方在于我花费更少的时间猜测,花费更少的时间在最后修复东西,而我从草稿开始。它帮助我以更少的压力更快地前进。作为一个经常使用 Seat Dance 的人,我想强调这一点。以前,提示词也需要大量的时间和反复试验。有了新模型,我觉得它更准确了。我花更少的时间在提示词上,花更多的时间在指导上。所以,我知道 Ethan 会在产品方面更好地解释这一点,但从用户的角度来看,现在真的很容易。是的,也许 Ethan,你想进一步解释并深入探讨提示词。
>> 感谢 Gordon 的精彩分享。我相信很多人都会产生共鸣。提示词正是 Gordon 刚才提出的第一个问题。现在,让我们来看看这三个痛点,看看 Cas 1.5 是否有帮助。好的,首先,如何让 AI 模型更用户友好一直是我们的产品团队和研发团队非常关心的问题。在这里,我想介绍我们进行的三项任务,以帮助大家更好地理解如何更好地控制 seance 模型。首先,我们使用 AI 创建了一个自动提示词优化模式。首先,如何让 AI 模型更用户友好一直是我们的产品团队非常关心的问题。在这里,我想介绍我们进行的三项任务,以帮助大家更好地理解如何更好地控制 CAS 模型。首先,我们使用 AI 创建了一个自动提示词优化模块,这样用户只需要输入最关键的信息,AI 就会进行进一步的丰富和优化。因此,现在用户不需要写特别长的提示词,我们最多建议不超过 500 字以获得良好的结果。其次,我们将视频制作领域的许多术语训练到模型中,使模型能够理解更专业的视频术语,例如镜头移动。这样您就不必在提示词中花费大量精力进行解释。最后,提示词仍然非常重要,因为人类是下达指令的人。所以,我想请我们的专家 Tia,您能否分享一些关于提示词的建议,以充分发挥 Cance 1.5 Pro 的潜力?
>> 是的,我们也有一些提示词指南与大家分享。第一个是“少即是多”。请避免冗余的描述。有时当您上传图像时,诸如风景、对话、角色等细节已经嵌入其中。所以,在文本中没有必要重复它们。您就像我们写的那样,用户只需要上传最关键的核心内容,少于 500 字。模型将自动优化提示词到理想状态,然后写一个好的提示词,您需要掌握结构化描述。我的意思是,您可以记住基本或目的的公式。这可能会对您有所帮助。您需要明确主体、动作、环境和镜头移动尺寸的描述,因为 sedance 1.5,因为 sedance 1.5 pro 支持带音频的视频,所以如果您想生成带音频的视频,您需要输入音频描述。最最重要的原则是永远不要让模型去猜测,因为模型不知道您想要什么。您必须将必要且清晰的信息提供给模型,以获得高质量的音频和视频。
好的,让我们看一些例子。好的和坏的。
[尖叫声]
[尖叫声]
这里我们也准备了一些关于角度的例子。这是低角度的。你好 Tia,我有一个问题。基本上,以前我做提示词时,有很多问题,比如我无法获得正确的角度等等。那么对于新模型,我们能否获得特定的角度,例如鸟瞰图、推拉镜头或某些特定的圆形运动?它们能支持吗?
>> 是的,当然。为了与传统专业创作者的脚本语言保持一致,我们特别支持这些专业的摄影或电影级别的术语。当您输入诸如推拉变焦或触摸角度之类的术语时,模型将直接生成符合专业标准的、高质量的视觉效果和镜头。
非常感谢 Tia。
>> 好的,谢谢 Tia。那么,让我们回到 Gordon 刚才提到的第二个挑战——迭代缓慢。Gordon,您能多解释一下吗?
>> 好的。是的。我将解释这部分。我想退一步想一会儿。很多人问我为什么不直接使用 AI 视频模型,老实说,我试过了。原始的 AI 视频模型实际上非常令人印象深刻。质量可以非常好,尤其是在高分辨率下。它们非常适合实验、参考以及推动视觉效果。但当涉及到实际制作时,会出现一些问题。首先,成本和时间,因为这些模型非常庞大,处理时间长,而且而且丢帧率可能非常高。所以您可能需要几分钟,然后才意识到版本实际上并不奏效。如果您重复几次,时间和成本都会迅速累积。其次,是灵活性问题。许多原始视频模型只生成固定长度的片段,例如四到十秒,以及固定格式,通常是 16:9 的高清格式,有时甚至是 480p 的低分辨率选项。作为创作者,这实际上是相当有限的。我的大部分工作不是一个完美的十秒镜头,我需要不同的长度、不同的格式,以及快速的迭代。最后是速度,高分辨率肯定看起来更好,但质量越高,等待的时间就越长。有时需要几分钟才能看到想法是否可行。这对于创造性探索来说并不理想。所以问题不在于质量,而在于可用性。原始模型很强大,但它们的设计并非围绕着创作者日常的工作方式,而这正是 Seat Dance,尤其是 Draft 模式,对我来说变得非常有意义的地方。那么,您是否愿意进一步阐述这个 Draft 模式,我对此非常期待。
好的,谢谢 Gordon。有了 Cance 1.5,这些问题可以得到更好的解决。首先,我们引入了 Draft 模式来解决因生成多个视频以获得满意结果而导致的高成本和长时间的问题。其次,我们开发了大量的模型参数,以尽可能直接生成创作者所需的视频,从而减少后期制作编辑的工作量。最后,我们的生成速度很快,模型性能非常稳定。目前许多视频是通过复杂的流程生成的,而这两个优势可以确保更高的质量和效率。那么,接下来,让我们首先专注于理解行业独有的 Draft 模式,我们的专家 Tia 将对此进行解释。是的,Seat Dance 独家支持 Draft 功能,它更具成本效益且节省时间,有助于创作者提高工作流程效率。Draft 功能的目的是让用户在最终确定完整推理之前,快速查看生成的低质量但方向准确的视频预览。它可以帮助创作者确定提示词是否合适以及动作是否合乎逻辑。所以,让我们来看看实际结果。左边是 Draft,右边是 1080p。Draft 和官方视频可以确保场景、轨道、主体动作、提示词意图和镜头调度的连贯性。视频生成 Draft 是我们视频生成推理管道中新添加的中间输出可视化功能。该功能允许用户在完整推理生成完成之前获得初步的解码结果,可用于快速验证场景结构、镜头调度、主体动作、光照和风格等关键元素。Draft 功能显着减少了时间消耗,生成速度比完整生成请求提高了 65%。Draft 和官方视频可以确保以下方面的连贯性,包括主体身份、场景语义、动作语义、光照和风格以及镜头移动,它还可以保持音频的一致性。那么,我有一个问题想问 Gordon。您通常需要生成多少次才能得到满意的视频?
>> 好的。通常需要大约五到十次,但有时也可能多达二十次。很多时候,背景、前景、动作等变化很大。您需要有很多组件来尝试不同的东西。所以这就是为什么您需要生成很多次。是的。
>> 好的。所以这就是为什么我们的 Draft 模式价格非常有竞争力。这是一张成本计算的对比表。如您所见,没有 Draft 和有 Draft 的对比。如果我们以五个任务为例,过去您需要生成五个 1080p 视频。成本接近 3 美元。但有了 Draft,它将变成五个 Draft 和一个最终输出,成本不到一美元。所以,所以我们认为 Draft 模式将来一定会降低您的成本并释放您的创作边界。有一件事我想提一下,那就是生成速度。当您生成一个 1080p 视频时,需要花费 70 秒,但当您使用 Draft 时,只需花费 10 到 20 秒,这将减少时间消耗。
哇。这个 Draft 模式确实帮助了很多制作公司甚至 AI 创作者节省了大量的成本和时间。所以我迫不及待地想使用这个 Draft 模式,我个人已经开始使用了,而且我非常喜欢它。
好的,很高兴知道您喜欢它,Gordon。接下来,让我们看看灵活的细节。首先,关于时长,正如 Gordon 刚才提到的,很多提供商只有四到十秒,但 1.5 支持四到十二秒。所以,无论您需要多长的片段,都可以直接由模型输出。这次,1.5 Pro 还支持模型根据内容自动选择时长。其次,我们支持所有主流分辨率以及行业内的大多数比例,从 1:1 到 21:9,所以您无需进行后期处理。此外,1.5 版本还支持自动选择合适的比例。此外,1.5 还支持离线模式。如果您没有实时任务,选择离线任务可以节省一半的成本。不同的参数组合将产生不同大小的视频。视频越小,成本越低。因此,每个人都可以根据自己的场景实现更优的成本效益比,而不是进行大量后期处理,例如裁剪模型生成的许多内容,这无疑会造成浪费。此外,视频越小,生成速度越快。所以您可以看到,对于可以在手机场景中使用的 480p,我们最快的 1.0 fast 版本只需要大约 10 秒,而 1.5 版本只需要 30 秒。
好的,现在让我们进入今天的亮点,带音频的视频部分。首先,让我们请 Gordon 介绍当前视频模型遇到的音频问题。Gordon,请您讲。
>> 作为我来说,另一个巨大的痛点是音频、对话、音效、时机。它总是比预期的花费更长的时间,而且通常在过程的后期才出现。在视觉效果大部分完成后,然后开始寻找音乐。然后我会寻找音效,并试图让一切都协调起来,比如时机、节拍、冲击等等。听起来很简单,对吧?但每个做过或正在做这件事的人都知道这需要花费大量时间。有了新的 Seat Dance 1.5 Pro,我工作流程的这一部分发生了很大变化。只需一个简单的提示词和一个点击,您就能得到您想要的东西。现在我将把话筒交给 Tia,让她进一步阐述这个音频或音效在 Seat Pro 中是如何工作的。
>> 好的,谢谢 Gordon。Sance [清嗓子] 1.5 Pro 能够执行各种任务。包括文本到音频视频合成以及图像引导的音频视频生成。它从视听同步的创意需求出发,采用了分支扩散 Transformer 架构,并通过跨模型融合模块,实现了视觉、声音和节奏的统一建模,确保生成的视频在唇部运动、情感和音频节奏方面具有高度的一致性。sedance 1.5 pro 支持毫秒级视听同步。过去,您想创建这样的视频,需要找到完美的音频片段,并与视频时间线进行预先匹配。但现在,您只需写一个简单的提示词,就可以实现音频和视频之间的无缝匹配。我们可以看看实际的视频。您可以看到,当剑和军刀碰撞时,音频可以精确地匹配视觉效果。Sedance 原生支持多人多语言对话。目前我们支持中文、英文、日文、韩文、西班牙文和印度尼西亚文。此时,我们真正告别了无声电影时代,实现了毫秒级视听同步。此外,在生成视频时,Sedance 1.5 Pro 使角色的唇部和肌肉运动完全符合发音习惯。您可以仔细观察,我们视频片段中的说话角色不仅仅是简单的唇部运动。相反,他们的脸颊、下巴和喉咙同时协调运动。这在过去是不可想象的,因为 AI 世界充满了魔力。
[笑声]
哇,这真是太令人印象深刻了。好的,我有一个问题想问 Tia。关于这个,我们如何保持角色在不同场景下的声音一致性呢?因为我们现在是在这个场景下生成,但如果我们用在其他场景,我们能得到相同的声音吗?
>> 是的,好问题。对于画外音,我们引入了种子值的概念。您可以使用非常详细的声音描述和一个固定的种子值,通过这种方式,无论您生成多少视频,角色的声音音色都会保持一致。换句话说,您只需要使用一个固定的详细描述的提示词,与种子值相比,我们可以跨多个具有不同镜头序列的视频保持一致的声音音色。让我们从最重要的开始。如果您想要答案,请仔细听。
保持警惕。我决定时我们再动。
我确切地知道我们将如何处理这件事。
嗯,这真是令人印象深刻。我迫不及待地想使用这个功能,因为我们经常在单独的应用程序中生成音频。所以现在在一个应用程序中,我们能够让视觉和音频正确地同步在一起。
好的。感谢 Tia 和 Gordon 的精彩分享。我相信大家现在对 Cance 1.5 Pro 都有了更深入的了解。接下来,让我们看看一些用例,展示人们现在如何使用这个强大的模型。首先是电子商务和广告。现在您可以直接生成带有口号的视频,无需后期配音。
>> 是的。正如 Gordon 刚才提到的,与传统工作流程和 AI 生成工作流程相比,我们从广告公司的专业人士那里获得了深入的反馈。通过使用这个视频生成模型,他们可以在仅需原始所需时间 1% 的时间内达到预期结果的 70%。例如,创建一个一分钟的电视广告视频通常需要一个由 10 到 20 人组成的团队,花费 20 到 30 天才能完成。但现在,您只需要一个人就可以在短短 80 到 100 小时内完成。Cance 1.5 pro 配备了 Draft 功能,可以进一步提高效率并降低此类场景的成本。
[音乐]
嘿,说得太对了,而且非常贴切。这确实节省了大量的时间和成本,缩短了生成内容所需的时间。其次,电影和电视场景以及镜头控制更加专业,音效完美同步。
此外,Sedance 1.5 Pro 支持的视听同步功能消除了创作者在视频生成后进行后期配音的需要。
是的。最后,在动漫和 AI 伴侣场景中,根据情节实现了智能镜头切换和角色情感的准确表达。此外,在教育和培训等许多场景中,也有大量创作者在使用我们的模型。我们相信,随着模型的强大,可以解锁的场景数量也将增加。
好了,今天的分享就到这里。感谢观看本次网络研讨会的观众,也感谢我们两位杰出的嘉宾的分享。大家可以扫描二维码,立即免费体验我们的 Cance 1.5 模型,特别是其语音和 Draft 功能。此外,您还可以扫描获取详细的提示词指南。未来,我们将继续推出新模型,敬请期待。下次再见。再见,Gordon。再见,Tia。再见,大家。
>> 大家好。再见,Gordon。感谢 Ethan 和 Tia 的邀请。是的,谢谢大家。大家好,欢迎收看 Bad Plus AI 直播。今天的主题是我们最受欢迎的视频生成模型 Cance 1.5 Pro。通过观看今天的直播,您将了解到视频模型在哪些方面发生了变化,哪些问题仍然存在,以及最新的模型如何解决这些问题。我负责模型的产品解决方案,这是一个一站式 AI 模型平台,您可以在其中试用、运行甚至微调 Cense 模型。今天我们还邀请了两位嘉宾。首先是 Gordon,一位非常有创造力的制片人,拥有丰富的 AI 经验。他今天在线。你好,Gordon。你在吗?请跟大家打个招呼。
>> 你好,Ethan。我是 Gordon。我在 Bike Plus 担任制片人和动态图形设计师。
>> 是的。然后是
是 Tia,她和我在同一个小组。她专攻 Cance 模型。在 2025 年,她亲自参与了所有全球顶级项目,并且对视频生成模型在各个行业的应用有着非常全面的见解。今天 Tia 来到实验室和我们一起。Tia,请向大家问好。>> 大家好,我是 Tia。我主要负责视频生成相关工作,将尖端的跨模态和生成技术转化为可扩展的、可投入生产的能力。从业务目标开始。我的重点是让视频模型在现实世界的用例中产生持久的价值。我很高兴在这里见到大家。>> 你好 Ethan。你好 Gordon。>> 你好。>> 大家好。>> 是的。除了参与今天的讨论,两位嘉宾还准备了一份详细的文档来分享他们的经验。所以请不要提前离开,也不要错过下载链接。好的,我们开始吧。由于一些观众还不熟悉视频生成模型,我将首先介绍它的基本工作模式和发展历史。首先,使用模型非常简单。您可以输入文本和图像,然后模型将根据您的指示生成视频。从 2024 年底开始,模型的性能开始迅速提高,视频质量变得非常非常高。嗯,但当时模型还不能生成声音。从 2025 年下半年开始,模型生成的视频就可以带有音频,但音频能力尚未成熟。因此,我们推出了 Cance 1.5 Pro,它可以直接生成带有音频的视频,包括各种类型的人声、环境音效和音效,并能实现毫秒级音频同步。稍后我们将介绍更多细节。好的,现在我们已经了解了基本细节。让我们来看看它在 2025 年的应用场景。2025 年,我们发布了一系列 CADS 模型。由于其高质量、稳定性和极快的生成速度,它们受到了许多用户和我们的行业客户的欢迎,包括广告和营销、影视、动画和游戏领域的客户。您几乎可以在所有主流 AI 工具中找到我们。首先在广告示例中,我们可以看到创意 [音乐] 的一致性非常出色。镜头切换稳定。脚步声和画外音 [音乐] 与动作精确匹配。其次,在影视领域,大家都喜欢我们的模型,因为它具有更强的表达能力,更准确。其次,在影视领域,大家都喜欢我们的模型,因为它具有强大的表达准确人类情感的能力,例如老人从闪烁到释然的倾听过程。然后在动画领域,细节得到了很好的保留,与传统的特效解决方案相比,成本极低。最后在游戏场景 [音乐] 中,角色的连贯性非常出色,能够快速生成各种角色。此外,这些行业中大量的视频已经由 AI 生成。在模型迭代过程中,模型仍然存在一些不足。创作者提供了许多宝贵的反馈。这就是我们今天邀请 Gordon 的原因。让我们看看他今天给我们带来了什么新的挑战。你好 Gordon,请发言。>> 好的。谢谢 Ethan。所以,你们已经从产品角度看到了 Cance 1.5 Pro。我将从一个非常不同的角度来谈论它,就像大家一样,实际上是每天都在使用这些东西的人。所以,我将再次介绍我自己。我是 Gordon。我在 Bike Plus 担任制片人和动态设计师,这基本上意味着我花了很多时间试图解释那些只存在于我脑海中的想法。所以,在我们谈论任何工具之前,我想先谈谈现实。如果你是创意人士,这可能感觉很熟悉,而且大多数项目都进展很快。有很多意见和反馈,经常听起来像是“能让它更具电影感吗?”“能更酷一点吗?”这些都没有错。这只是意味着我们还没有看到这个想法。作为创意人士,我们通常是试图将这些话语转化为视觉效果的人。对我来说,最难的部分不是想出点子。而是在它存在之前解释我脑海中的东西。我们花了很多时间用语言描述视觉效果,而且如果我们想正确地测试某样东西,我们通常必须构建它、渲染它,然后等待。声音几乎总是最后才出现,那时大多数视觉效果都已经确定了,而这正是耗费大量时间和金钱以及带来压力的根源。所以,这就是 Cance 对我来说变得有趣的地方,不是作为一个取代制作的工具,而是作为一种在任何东西丢失之前探索想法的方式。它帮助我推进决策。传统上,我们只有在制作完成或接近完成时才能感受到一个场景,这时有人会说:“哦,节奏太慢了,镜头移动不起作用,声音也不对。”而此时改变事情会浪费大量时间,而有了 Cance 和新的 AI 工作流程,我就可以提前做出这些决定。所以,让我详细解释一下。所以,在左边你会看到我们制作视频的传统方式。我们从简报开始,然后是草稿、故事板、制作、编辑、声音和审查。每一步都需要时间,而且大多数时候我们直到很晚才能看到最终的想法。当有些东西不起作用时,改变的成本很高。另一方面,这是 AI 工作流程,而不是提前几周计划然后才能看到任何东西,我可以几乎立即开始生成想法。我尝试不同的版本,审查它们,并快速调整。我通常可以在当天或第二天得到一些可用的东西。所以,最大的区别在于何时做出决定。嗯,传统工作流程的决定很晚,而 AI 工作流程则帮助我及早决定和做出决定。所以,对我来说,唯一节省时间和成本的地方在于我花了更少的时间猜测,花了更少的时间在最后修复东西,而我就是从草稿开始的。它帮助我以更少的压力更快地前进。作为一个真正经常使用 Cance 的人,我想强调这一点。提示过去需要大量的时间和反复试验。有了新模型,我觉得它更准确了。我花了更少的时间在提示上纠缠,而花了更多的时间在指导上。所以,我知道 Ethan 会在产品方面更好地解释这一点,但从用户的角度来看,现在确实更容易了。是的,也许 Ethan,你想进一步解释并深入探讨提示。>> 谢谢 Gordon 的精彩分享。我相信很多人都会有同感。提示正是 Gordon 刚才提出的第一个问题。现在,让我们来看看这三个痛点,看看 Cas 1.5 是否有帮助。好的,首先,如何使 AI 模型更用户友好一直是我们的产品团队和研发团队非常关心的问题。在这里,我想介绍我们进行的三个任务,以帮助大家了解如何更好地控制 C dance 模型。首先,我们使用 AI 创建了一个自动提示优化模式。首先,如何使 AI 模型更用户友好一直是我们的产品团队非常关心的问题。在这里,我想介绍我们进行的三个任务,以帮助大家了解如何更好地控制 CES 模型。首先,我们使用 AI 创建了一个自动提示优化模块,这样用户只需要输入最关键的信息,AI 就会进行进一步的丰富和优化。因此,现在用户不需要写特别长的提示,我们建议最多不超过 500 字就能取得好结果。其次,我们在模型中训练了许多视频制作领域的术语。嗯,使模型能够理解更专业的视频术语,例如镜头运动。这样您就不必在提示中花费大量精力进行解释。最后,提示仍然非常重要,因为人类是下达指令的人。所以,我想问我们的专家 Tia,您能否分享一些关于提示的建议,以充分发挥 CES 1.5 Pro 的潜力?>> 是的,我们也有一些提示指南可以与大家分享。第一个是少即是多。请避免冗余描述。有时,当您上传电子邮件时,诸如风景、对话、角色等细节已经嵌入其中。所以没有必要在文本中重复它们。嗯,就像我们写的那样,用户只需要上传最关键的核心内容,少于 500 字。>> [哼鼻声]>> 嗯,模型将自动优化提示到理想状态,然后写一个好的提示,您需要掌握结构化描述,我的意思是您可以记住基本目的,公式可能会有帮助,您需要明确主体、运动、环境和场景,相机运动,因为 sedance 1.5 因为 sedance 1.5 pro 支持带音频的视频,所以您可能,如果您想生成带音频的视频,您需要输入音频描述,最最重要的原则是永远不要让模型猜测,因为模型不知道您想要什么。您必须将必要和清晰的信息提供给模型,以实现高质量的视频和音频。>> 好的,让我们看一些例子。好的和坏的。 [尖叫声]>> [尖叫声]>> 在这里,我们也准备了一些角度的例子。这是低角度。你好 Tia,我有一个问题要问。所以,基本上,以前我做提示时,有很多问题,比如我得不到正确的角度等等。那么对于新模型,我们能否获得特定的角度,例如鸟瞰图、推轨镜头或某些圆形运动?它们能支持吗?>> 是的,当然。为了与传统专业创作者的脚本语言保持一致,我们特别支持这些专业的摄影或电影级别的术语。嗯,当您输入推轨变焦或触摸角度等术语时,模型将直接生成符合专业标准的、高质量的视觉效果和镜头。>> 非常感谢 Tia。>> 好的,谢谢 Tia。那么,让我们回到 Gordon 刚才提到的第二个挑战,慢迭代。你好 Gordon,你能多解释一下吗?>> 好的。是的。嗯,我来解释一下。所以,我想退一步,思考一下。很多人问我为什么不直接使用 AI 视频模型,老实说,我试过了。原始的 AI 视频模型实际上非常令人印象深刻。质量可能非常好,尤其是在高分辨率下。它们非常适合实验、参考和推动视觉效果。但当涉及到实际制作时,会出现一些问题。首先,嗯,这是成本和时间,因为这些模型非常庞大,处理时间很长,而且丢帧率可能非常高。所以,您可能需要几分钟,然后才意识到这个版本并不真正奏效,如果您重复几次。时间和成本都会迅速累积。其次,问题是灵活性。许多原始视频模型只生成固定长度的片段,例如 4 到 10 秒,以及固定格式,通常是 16:9 的高清格式,有时是 480p 的低分辨率选项,您无法生成。作为创意人士,这实际上非常有限,我的大部分工作不仅仅是一个完美的 10 秒镜头,我需要不同的长度、不同的格式,以及快速迭代。最后是速度,高分辨率肯定看起来更好,但质量越高,等待的时间就越长。有时需要几分钟才能看到想法是否可行。这对于创意探索来说并不理想。所以,问题不在于质量,而在于可用性。原始模型很强大,但它们不是围绕创意人士日常工作方式设计的,而这正是 Cance,尤其是草稿模式对我来说非常有意义的地方。所以,也许你想进一步阐述这个草稿模式,我对此非常期待。好的,谢谢 Gordon。有了 Cedance 1.5,这些问题可以得到更好的解决。首先,我们引入了草稿模式来解决因生成多个视频以获得满意结果而导致的高成本和长时间问题。其次,我们开发了大量的模型参数,以尽可能直接生成创作者所需的视频,从而减少后期编辑的工作量。最后,我们的生成速度很快,模型性能非常稳定。目前许多视频是通过复杂的流程生成的,而这两个优势可以确保更高的质量和效率。嗯,所以接下来,让我们首先专注于理解行业独有的草稿模式,我们的专家 Tia 将对此进行解释。是的,sans 独家支持草稿功能,更具成本效益和节省时间,帮助创作者提高工作效率。草稿功能的目的是让用户在最终确定完整推理之前,能够快速生成低质量但方向准确的视频预览。它可以帮助创作者确定提示是否合适以及运动是否合逻辑。所以,让我们来看看实际结果。左边是草稿,右边是 1,80p。草稿和官方视频可以确保场景、轨道、主体运动、提示意图和镜头调度的一致性。视频生成草稿是我们视频生成推理管道中新添加的中间输出可视化功能。该功能允许用户在完整推理生成完成之前获得初步解码结果,可用于快速验证场景结构、镜头调度、主体运动、灯光和风格等关键元素。草稿功能显著减少了时间消耗,生成速度比完整生成请求提高了 65%。草稿和官方视频可以确保以下方面的连贯性,包括主体身份、场景语义、动作语义、灯光和风格以及镜头运动。它还可以保持音频的连贯性。所以,我有一个问题问 Gordon。在生成满意的视频之前,你通常需要绘制多少次?>> 好的。所以,通常需要大约五到十次,但有时也可能多达二十次。所以,很多时候,背景、前景、动作运动等方面都有很大的变化。所以,你需要有很多组件来尝试不同的东西。这就是为什么你需要多次生成。是的。>> 好的。这就是为什么我们的草稿模式价格非常有竞争力。这是一个成本计算的对比表。如您所见,没有草稿和有草稿。如果我们以五个作业为例,过去您需要生成五个 1,000 NP 视频。成本接近 3 美元。但有了草稿,它将变成五个草稿,最终输出,成本不到一美元。所以,所以,在未来,我们认为草稿模式,所以,在未来,我们认为草稿模式肯定会降低您的成本并释放您的创作边界。有一件事我想提一下是生成速度。嗯,当你生成一个 1080p 的视频时,需要花费 70 秒,但当你使用草稿时,只需要花费 10 到 20 秒,这将减少时间消耗。>> 哇。这个草稿模式确实帮助了很多制作公司甚至 AI 创作者节省了大量的成本和时间。所以我迫不及待地想使用这个草稿模式,我个人也确实开始使用了,而且我非常喜欢。好的,很高兴知道您喜欢它 Gordon。接下来,让我们看看灵活的细节。首先,关于时长,正如 Gordon 刚才提到的,很多提供商只有四到十秒,但 1.5 支持四到十二秒。所以,无论您需要多长的片段,都可以直接由模型输出。这次,1.5 Pro 还支持根据内容自动选择时长。其次,我们支持所有主流分辨率以及行业中最常见的比例,从 1:1 到 21:9,因此您无需进行后期处理。此外,1.5 版本还支持自动选择合适的比例。此外,1.5 还支持离线模式。如果您没有实时任务,选择离线任务可以节省一半的成本。不同的参数组合将导致不同大小的视频。视频越小,成本越低。因此,每个人都可以根据自己的场景获得更优的成本效益比,而不是进行大量的后期处理,例如裁剪模型生成的大量内容,这无疑会造成浪费。此外,视频越小,生成速度越快。所以,您可以看到,对于可以在手机场景中使用的 480p,我们最快的 1.0 fast 只需大约 10 秒,而对于 1.5,只需 30 秒。好的,现在让我们进入今天活动的亮点,带音频的视频部分。首先,让我们请 Gordon 介绍当前视频模型遇到的音频问题。你好 Gordon,请发言。>> 音频、对话、音效、时机是我遇到的另一个大痛点。它总是比预期的花费更长的时间,而且通常在过程的后期才出现。在视觉效果之后,我基本完成了。然后开始只是寻找音乐。然后我会寻找音效,并试图让一切都匹配,比如时机、节拍、冲击等等。听起来很简单,对吧?但任何做过或正在做这件事的人都知道这需要很多时间。有了新的 Cance 1.5 Pro,我工作流程的这一部分发生了很大变化。只需一个简单的提示和一个点击,您就可以得到您想要的东西。现在我将把话筒交给 Tia,让她进一步阐述这个音频或音效在 Cance pro 中是如何工作的。>> 好的,谢谢 Gordon。Sance [清嗓子] 1.5 Pro 能够执行各种各样的任务。包括文本到音频视频合成和图像引导到音频视频生成。它是为了满足视听同步的创意需求而设计的,采用了分支扩散 Transformer 架构,并通过跨模型融合模块,模型性能统一了视觉、声音和推理的建模,确保生成的视频在唇部运动和情感以及音频节奏方面达到高度一致性,并且 sedance 1.5 pro 支持毫秒级视听同步。过去,您要创建这样的视频,需要像完美的音频片段一样,并与视频时间线预先匹配。但现在,您只需要写一个简单的提示,就可以实现音频和视频之间的无缝匹配。我们可以看看实际的视频。您可以看到,当剑和佩剑碰撞时,音频可以精确地匹配视觉效果,并且 sedance 原生支持多人和多语言对话。目前我们支持中文,例如,以及英语、日语、韩语、西班牙语和印度尼西亚语。此时,我们真正告别了无声电影时代,实现了毫秒级视听同步。此外,在生成视频时,Sedance 1.5 Pro 使角色的唇部和面部肌肉运动完全符合发音习惯。正如您仔细观察的那样,我们视频片段中说话的角色不仅仅表现出简单的唇部运动。在他们的脸颊、下巴和喉咙同时协调运动。这在过去是不可想象的,因为 AI 世界充满了魔法。哇,这太令人印象深刻了。好的,我有一个问题,Tia。那么,我们如何保持角色在不同场景下声音的一致性呢?比如,因为我们现在正在用这个场景生成,但如果我们用它来处理其他场景,我们能得到相同的声音吗?>> 是的,好问题。对于画外音,我们引入了种子值的概念。您可以使用非常详细的声音描述和一个固定的种子值。通过这种方式,无论您生成多少视频,角色的声音音色都会保持一致。换句话说,您只需要使用一个固定的详细提示,与种子值相比,我们可以保持不同镜头序列的多个视频之间一致的声音音色。让我们从最重要的开始。如果你想要一个答案,请仔细听。>> 保持警惕。我决定了再行动。>> 我知道我们将如何处理这件事。嗯,这太令人印象深刻了。我迫不及待地想使用这个功能,因为我们过去经常在单独的应用程序中生成音频。所以现在在一个应用程序中,我们能够让视觉和音频正确地同步在一起。>> 好的,谢谢 Tia 和 Gordon 的精彩分享。我相信大家现在对 Cance 1.5 Pro 都有了更深入的了解。接下来,让我们看看一些用例,展示人们现在如何使用这个强大的模型。首先仍然是电子商务和广告。现在您可以直接生成带有标语的视频,而无需进行后期配音。>> 是的,嗯,正如 Gordon 刚才提到的,与传统工作流程和 AI 生成工作流程相比,我们实际上从广告公司的专业人士那里获得了深入的反馈,通过使用这个视频生成模型,他们可以在 1% 的时间内实现 70% 的预期结果。例如,创建一个一分钟的广告视频。通常需要一个由 10 到 20 人组成的团队,花费 20 到 30 天才能完成。但现在您只需要一个人就可以在短短 80 到 100 小时内完成。Sance 1.5 pro 配备了草稿功能,进一步提高了效率并降低了此类场景的成本。是的,确实如此,而且非常贴切,而且这确实节省了大量的时间和成本,缩短了生成内容所需的时间。>> 其次,对电影和电视场景以及镜头镜头的控制更加专业,并且音效完美同步。此外,Sedance 9.5 Pro 支持的视听同步功能消除了创作者在生成视频后进行后期配音的需要。>> 是的。最后,在动画和 AI 陪伴的场景中,根据情节实现了智能镜头切换和角色情感的准确表达。此外,在教育和培训等许多场景中,也有大量的创作者在使用我们的模型。我们相信,随着模型的强大,可以解锁的场景数量也将增加。好了,今天的分享就到这里。感谢观看本次网络研讨会的观众,也感谢我们两位杰出的嘉宾的分享。大家可以扫描二维码立即免费体验我们的 Cance 1.5 模型,特别是其语音和草稿功能。此外,您还可以扫描获取详细的提示指南。未来,我们将继续推出新模型。敬请关注。嗯,下次再见。再见 Gordon。再见 Tia。再见,大家。>> 再见,大家。再见 Gordon。谢谢 Ethan 和 Tia 的邀请。是的,谢谢大家。好的。