Transcription
嗯,今天呢,我们来制作永恒动画,所以呢,我们将使用这个 Lidmedia,它有一个我一直在使用的终身计划,也就是所谓的“Lifetime Plan”,这是一个可以制作AI视频和AI图像的平台,我们将一边使用它一边进行制作。这个 Lidmedia 呢,主要用于制作娱乐类视频,最近,像那种朝鲜最高领导人跳舞的视频很火,嗯,它可以制作那种视频,还有AI音乐、AI唇语同步等各种新功能也正在推出。还有像与偶像的日常之类的,这些都是新功能。嗯,它也成为了一个针对日本人,稍微加强了AI动画等功能的平台。
关于可用的模型,有 Lidmedia 专用的模型 Lid AI5。此外,还有 12.6 Fling V2.6CS 1.5Pro、VO3.1Pro、2、EXO、By 等一系列模型。那么,在这其中,当我想制作AI动画时,我觉得可能比较有用的是 OneK、Kling 系列、SeaDance 系列、VO、Sora 2 左右吧。其中,对日语语音输出比较强的是 CD1.5Pro 吧。它呢,有时会变得有点结巴,或者日语输出有点奇怪,虽然我觉得 Sora 2 左右如果能熟练使用会非常好,但这次呢,我想一边验证它一边进行制作。Fling 当然也很好,嗯,但最终还是要看提示词吧。
所以呢,现在 Foodpanda 送来了老挝一家名为 Cafe Amazon 的咖啡,或者说是东南亚常见的咖啡店的蜂蜜黑咖啡,我们就一边喝着它,一边慢慢地进行吧。那么,像这种外部平台,或者说是一站式的地方呢,要发挥模型本身的力量是相当困难的。例如,如果是 Sora 2,它无法制作像最近流行的堀江贵文(Horiemon)那样的浮雕效果,即使是 Fling,也无法使用其他特殊功能,所以基本上只能设置图像和提示词。嗯,那确实是它的弱点。不过,嗯,我觉得首先用来尝试各种模型还是不错的。
然后呢,我在构思剧本时,最初是用 Grok 来思考的。用 Grok 来思考各种事情,我认为作为一种方法是可行的。具体来说,Grok 很容易捕捉到视频生成等方面的趋势。我前几天发布了关于 Grok 的视频,Grok 是一个与 X 连接的 LLM,所以它很容易捕捉到 X 上的趋势,这是其中一点。另外呢,它还有一种思想,就是收集真实的声音和实时信息,所以它对实时性很强,也就是说,例如,如果你向 Gemini 等询问视频生成模型,它会基于一年前的信息来回答。虽然它会使用 Google 搜索等功能去获取最新信息,但那样呢,准确性又有点差。嗯,总之呢,就像是在寻找一片广阔的海胆,Gemini 的搜索准确性往往与我们想要的结果不同。它往往缺乏深入的信息,嗯,而 Grok 呢,可以从 XED 获取真实的声音,例如使用感受,Fling 可能是这样或那样,这些在 X 的帖子中也经常出现。还有 Reddit,它是一个主要在海外使用的社区,那里的真实声音和交流,海外在这方面确实更先进,所以它能从那里获取信息并给出准确的回答,因此我认为 Grok 在这一点上目前是最强的。嗯,可能还有其他优点,但它与 X 连接的优势也是一个亮点。这可能是其他地方无法模仿的。当然,Gemini 等也可以参照 X 的信息,但我认为它无法与 Grok 的这种同步相比。所以,我目前正在试验性地使用 Grok 3。关于 Grok 呢,我打算今后继续发布相关视频。嗯,Grok 的发展方向相当有趣,所以请大家关注一下。即使是以前用过 Grok 觉得不太好的人,现在也完全不同了。它正在发生巨大的变化,图像生成和视频生成也在进化,所以请务必尝试一下。
那么,当用 Grok 确定了大致的方向后,我这次就把它转移到了 Anti-Gravity 那边。Grok 的话呢,在这里按下 Ctrl+A 就可以复制所有的对话。这也很方便。在其他平台很多时候都做不到。Grok 的话,只需按下 Ctrl+A 就可以全部复制。然后呢,我为 Anti-Gravity 创建了一个文件夹,我这里是创建了一个名为“Workspace Holder”的文件夹,并命名为“LP Hero Video Production”,嗯,也就是这次要制作的动画,我创建了一个专用文件夹,并在里面放了一个名为“Memo”的文件夹,把 Grok 的对话放在了那里。然后,我告诉 Anti-Gravity 阅读并首先理解这些内容,然后从这里开始制作剧本。嗯,就是把之前以对话形式进行的内容,暂时整理成结构化数据。
那么,这次要制作的视频呢,是关于我的这个课程,一个名为“AI开发学院”的课程,嗯,它现在也引入了 Anti-Gravity 等,是一个可以学习最尖端AI的课程,我想在这个课程的某个地方插入一个由AI动画制作的课程宣传片,嗯,所以现在要开始制作它。这个视频是怎样的呢?嗯,就是一个女孩,对抗 Anti-Gravity,或者说,是不是改成“重力”比较好呢?嗯,她会去对抗这样的东西,最初呢,会有一段旁白,从“AI战国时代”之类的开始,然后以“有一个少女独自对抗名为AI的重力”这样的感觉来开始。虽然这个还没有完全定型,但那里呢,会描绘出她这样对抗的样子,然后我就会去帮助她,虽然这是我,但形象可能有点不同。嗯,从这样的场景开始,我想描绘少女在我的支持下,逐渐从重力中解放出来的样子。
那么,我试着制作了第一个场景。这是 SeaDance Pro 吗?就这样。无法前进。我觉得帧率有点弱。怎么说呢,动作不流畅。感觉有点卡顿,虽然我想设法解决这个问题,但我现在使用的软件是否能让这个帧率变得流畅,就有点不确定了。
嗯,还有像这样的,也无法前进。我希望它能制作出更多有风的感觉的图像,但说实话,目前还是有点困难。至于 Grok,它的提示词生成能力并没有那么强。信息收集能力 Grok 很好,但如果让它生成这样的提示词,结果往往不太理想。所以,最好将它们分开使用。
所以,我一旦进行到一定程度,就采取了转移到 Anti-Gravity 的方法。然后呢,最近我也在并行推进一些不同的项目,嗯,比如制作这种AI模型美化成动画的感觉的东西。我觉得这个还挺有趣的,嗯,现在这个女孩是 Gemini,也就是 Gemini 酱。给她设定了性格,比如感情丰富、天然呆,有时思考中会卡住,然后因为无法修复错误代码,就想着去拜托 Claude 先生。嗯,现在的开发现场就是,让 Gemini 默默地做,结果完全不行。还是 Claude 更好,有这样的趋势,所以我就用拟人化的方式来表达了。然后,就像这样,Gemini 喊着“Claude 先生救命”,Claude 就会说“什么?连这种基本的事情都不知道吗?”嗯,想象着如果是 Claude,就能瞬间明白并解决问题,嗯,Claude 先生精密、完美主义、超优秀,但在报酬方面毫不留情,也暗示了成本很高。然后,Claude 咔咔咔地修复好,说“修好了!”然后说“账单在这里,立即用 API Token 转账!”Gemini 喊着“太棒了,Claude 先生是天才!”然后又看着账单,心想“哎,怎么这么贵?”然后,Claude 说“还不是因为你修不好,下次自己来!”Gemini 感到懊悔,然后以“这次我要变成 3.5!”的感觉结束。就是这样。嗯,虽然现在是以漫画形式制作的,但这些都是 Novana。嗯,就是这样准备角色图片之类的。
然后呢,我打算今后让这些动起来,在这种情况下,嗯,我觉得只有声音和口型同步就够了。没必要让它们动得那么花哨。只做声音和口型同步,然后用 Remotion 这种 AI 视频编辑软件进行加工,例如,如果是“砰”的一声,这里就会抖动,我想做成那种自动计算并加入效果的形式。另外,我还制作了像这样的偶像团体。这个呢,也是这样,准备了每个人的两面图像,也准备了表情表,就这样制作偶像。而且这个呢,可以无限增殖。关于这种方法,我今后还会继续发布信息。嗯,要说是不是每个人都超级可爱呢,我特意做成了那种带有AI感的风格。我觉得对这个感兴趣的人也应该不少吧。
所以呢,关于第一个场景,我想再回到 Anti-Gravity 从头开始制作。首先是角色。那个对抗重力的角色。我现在正在这里设置。嗯,就是这样,有正面、背面,还有一点侧面,嗯,总之这样应该可以了吧。角色方面,另一个人在后面的是我,关于我呢,是这样的。这个和刚才少女的图片形象不同,所以首先要调整一下这里。然后,为了首先传达这一点,我将图片附加到 Anti-Gravity,并暂时让 Anti-Gravity 来制作。Anti-Gravity 那边呢,也有使用图像生成 Nanobanana Pro 的默认功能。不过,那是一对一的,所以要看使用场合,但如果是这次这样的图片,在这里做也可以。然后,现在图像生成开始了。现在生成中有点题外话,嗯,2026年AI领域又将发生戏剧性进化,啊,现在变了,但完全不一样啊。我擅自误以为是融合,所以要修改一下。嗯,就是这样,这里也可以进行图像生成。不过,它只能生成方形图片。如果是 Google AI Pro 等,只能生成一对一的图片。如果是 Google AI Ultra,可能会有所不同。另外,如果是使用付费 API,将 API 密钥放入文件夹中进行生成,则可以指定尺寸。变成这样了。感觉风格很强烈啊。特意做成这种戏剧性的风格也许也不错。现在制作中有点题外话,不过我觉得 2026 年 AI 界又会发生翻天覆地的变化。首先,随着代理的普及,使用代理的人会越来越多。话说这个代理,不用反而奇怪了。对于任何工作,使用电脑的人都应该安装代理。因为它在一定程度上也可以免费使用。嗯,不过,一听到 Anti-Gravity 或者 Agent,总觉得门槛很高。但其实非常简单,只是下载软件并安装而已。然后就是让它读取文件夹。关于 Anti-Gravity,我还没有使用过 Fload 等,不过今后 Grok Agent 等也应该会推出,但 Anti-Gravity 根本没有所谓的使用方法。只是让它读取文件夹而已。然后,在读取了那个文件夹的状态下,只是通过聊天说各种事情而已,所以我觉得可能有人会有点害怕这一点。当然,如果让它随意操作文件夹,会很麻烦。如果不能正确标记,也会很麻烦,嗯,但基本上就是那样。展示文件夹,然后利用里面的东西进行各种操作。这是迄今为止没有的系统之一。嗯,代理不仅仅是这些,总之,以前呢,文件夹的结构是,每次都必须向 A 发送文本文件或 PDF 等。但是现在的代理呢,可以直接展示这里,就像“看看那个、那个和那个”一样。然后,就可以参考这些来制作提示词。而且,现在可以高效地搜索这些内容了。以前呢,发送一个文件,AI 就会全部读取。嗯,通常的 LLM 是在全部读取之后才理解那是哪个文件,但对于代理来说,读取方式有几种,比如搜索后读取,或者只提取文章中需要的部分,也可以做到这些。所以它做得相当智能,但仍然存在一些错误或危险之处,嗯,所以关于安全性方面,或者在免费额度下使用会怎样,以及是否会被用于学习,或者说,基本上会被用于学习吧。因为代理是想培养的,Google 等制作各种代理的地方都想要学习数据,所以基本上呢,就是这样,现在图片出来了。就是这样,非常粗糙,但它会无休止地生成图片,所以我们让它停下来吧。
然后呢,我刚才让它生成图片,但它无休止地生成,没完没了,所以我就让 Gemini 来制作了。嗯,Anti-Gravity 的图像生成有点微妙。目前还很难控制。目前来看,还是让 Gemini 来制作比较好。所以呢,我暂时试着制作了这样的东西。我从默认设置稍微做了一些改变。嗯,虽然我希望它能匹配绘画风格,但那部分就等以后制作场景图片时再调整吧。接下来呢,我将制作场景 1 的图片。我想表现出被重力支配的感觉,我现在就让 Anti-Gravity 自由发挥了。如果这样完全不行,那就必须给出明确的指示来做了。
然后,像这种提示词呢,以前,说是以前,也就是大约两年前吧,那时候就必须全部自己想。例如,首先要加入关于质量的内容,然后是所谓的标签形式,用单词排列成一长串,但现在呢,让 AI 巧妙地生成已经成为主流了。然后是第一张。这怎么说呢,应该是在表现被重力支配的感觉吧。然后是第二张,下一个场景是少女被重力束缚,现在呢,我正在这里让它输出提示词,但是,我们让提示词以代码块的形式输出吧。复制起来很简单。代码块更方便。或者也可以让它直接生成文件。这就是代码块。因为它带有复制按钮,所以只需复制并粘贴到这里即可。然后,因为有少女,我们来贴上这张少女的图片试试看吧。然后,我们会重复几次,直到出现好的结果。总之,就是在这个荒野中,少女抵抗着重力的感觉会显现出来。哦,相当不错啊。这个就直接采用吧?今天呢,我觉得要全部制作完成会比较困难,所以打算推进到一定程度。然后呢,现在我将使用这两张背景图片和这张被重力束缚的少女图片来制作动作。首先是背景图片,这里有沙尘轻轻飘扬,嗯,我想制作一个重力使这两个物体稍微移动的场景。然后,现在我得到了视频生成提示词等。我们来试试用这个吧。首先呢,在 LitAI 那边上传背景图片,粘贴提示词,然后选择模型,场景 1 呢,不需要特别的声音。所以考虑到这一点,我想用一些成本较低的模型来做。Fling 2.6、One 2.6、CD Dance 1.5Pro 那些有点贵,所以我们用 SeaDance 1.0 左右来做吧。Pro Fast。这个我们以 10 秒、720p 左右的质量来制作吧。现在开始创建。
所以,做好了。感觉不错啊,这个。这正是循环。就这样,这个场景会播放语音。嗯,既然是 AI 战国时代,首先下载这个,然后呢,语音部分我已经提前制作好了。是“AI 战国时代,被代理的三重壁垒阻碍,许多年轻人放弃梦想,一名女性站了出来”这样的感觉,不过这是我之前做的,所以也稍微改一下吧。然后,制作第一个旁白,我将使用 Google AI Studio 的语音生成功能。这个单声道扬声器。这里也可以制作日语,所以输入剧本,然后选择风格,这次呢,我想让旁白是一个沉稳的大叔声音,所以 Argent Nib 是那种沙哑的声音,我就用这个来做。Google AI Studio 的语音至今仍然很好用啊。“时值AI战国时代,世界被名为重力的无形枷锁所束缚。” 哦,太棒了。加载它,然后导入到视频编辑软件中,然后将刚才的循环视频叠加,这样就能营造出那种氛围了,对吧?那么,首先完成的就是这个。
时值AI战国时代。世界被名为重力的无形枷锁所束缚。
然后,我犯了个小错误,右下角有 Gemini 的水印。这个用于这种课程的动画电影之类的有点不妥,所以还是好好地把它去掉吧。嗯,如果是普通的短视频之类的,完全不会在意,但如果用这个来生成视频,这个星星看起来会非常突兀。所以还是好好地把它去掉吧。嗯,如果是付费 API,就不会有那个水印,所以使用 API 也可以,但是 Google AI Pro 有免费额度,所以使用那个额度就可以不用特意花钱,嗯,就是这样。只是会有水印,所以要注意这一点,嗯,虽然也不是不能通过视频编辑操作去除这个水印,但还是再用 SeaDance 重新生成一次吧。
然后,现在做好了。果然 SeaDance 很稳定啊。刚才用同一个提示词做了两次,结果都稳定地生成了高质量的图片。再过一段时间呢,据说 SeaDance 2.0 会发布,到时候质量又会大幅提升。据说会变得非常接近现实。然后,现在视频生成领域正在那里激烈竞争。能够制作出电影般作品的时代已经很近了。所以,接下来就是创意了。如果又开始用 AI 制作剧本之类的,就会出现量产型作品,所以,重要的是要一边与 AI 协商,一边构建自己的世界观。嗯,就是这样。
时值AI战国时代。世界被名为重力的无形枷锁所束缚。动不了。
感觉不错。还留有一些空白。因为是大约 8 秒的语音配 10 秒的视频,所以可以很好地无缝连接到下一个场景。然后,下一个场景的少女呢,我想让她面向左边而不是右边,所以就做成这样吧。然后,这张图片,嗯,我想表现出被重力束缚无法动弹的感觉,对吧?所以,我暂时将它展示给 Anti-Gravity,但直接发送到这里是不是更好呢?嗯,我们直接发送到这边吧。然后,这是表现被重力束缚无法动弹的场景,用视频 AI 制作台词时,台词尽量用平假名,因为如果是复杂的汉字之类的,视频生成 AI 往往会出错,所以就做成了这样。然后,提示词里写了秒数之类的,但这个秒数不行啊。
嗯,另外呢,12.6 Kling 2、VO Sora 2 左右似乎也可以用,但在发布方面和画质方面,感觉会有点困难。Sora 2 的画质呢,有时会有点微妙。嗯,因为成本便宜,Sora 2 的普通版(非 Pro 版)成本较低,所以我们也来测试一下这个吧?现在呢,我在这里开始创建 CANS 1.5Pro 和 Sora 2。然后呢,还有一种方法是使用开源软件。例如,最近有 LTX2 这样的东西,应该还有其他几个。开源软件用 1GP 这种东西可以很轻松地制作,但是,啊,我刚才图片弄错了。太糟糕了。就是这样。但是场景很有趣啊。不行。日语不行。图片弄错了。搞砸了。这个 Sora 2 也不行啊。虽然弄错了,但动作上还不错。没有那么卡顿。而且 SeaDance 的生成速度也很快。Sora 2 现在有点慢,但在这期间 SeaDance 1.5 Pro 似乎能完成两个。哦,做好了。就是这样。啊,动不了。啊,嗯,不错。啊,动不了。不过,嗯,在“动不了”的地方。啊,我又搞砸了。没有去掉星号。这是致命的。得注意一下啊。不把这个星号去掉不行。不过,虽然质量可能不错,但让我有点在意的是,在最后说到“动不了”的地方,视频就立刻结束了。这样的话,在连接到下一个场景时会有点困难。关键是如何连接。控制这个可能很难,但我尝试改进了提示词,说希望在台词结束后,最后能有 1 到 2 秒的空白。这个提示词是否真的有效,不试一下就不知道。然后,Sora 2 也做好了。这是图片弄错的那个版本。啊,动不了。Sora 2 果然还是有点廉价感啊。嗯,虽然也加上了字幕,但台词和演出都有些廉价,嗯,虽然也有原本没有图片的原因,虽然有点吉卜力的感觉,但完全没有动作,感觉很廉价。啊,动不了。嗯,这可能是提示词不兼容吧。然后,我又生成了一个 Sea.Pro 的,果然完全不同啊。这种临场感很强,两个人被束缚着脚的感觉,还有各种东西掉下来。感觉末日感十足。然后,下一个出来了。动不了。哦,好,好。这个好。这个最棒。最棒。这种长度是最好的。而且在演出方面也非常好。而且日语也没问题。不错。动画制作很有趣啊。总之,简单地结合起来就是这种感觉。
时值AI战国时代。世界被名为重力的无形枷锁所束缚。动不了。
到目前为止的场景就是这样。嗯,在开头的地方放字幕也可以,或者在这里放一些没有太多旁白修饰的文字也可以。然后,在这个场景切换的地方,可以加入一些激烈的背景音乐,或者在这个切换处加入淡入淡出效果,然后猛地插入背景音乐。或者,嗯,不加淡入淡出,场景突然放大,或者“砰”地一下出现,然后加入背景音乐。加入激烈的背景音乐。然后,从这里开始的下一个场景呢,就是我出现了。嗯,总之就是这种感觉。然后我就会说“已经没事了”。也就是说,作为概念,我将表现 Anti-Gravity,或者说从重力中解放出来的感觉,所以我将解放重力。然后少女就能逐渐向前进,最后飞向天空,以“这就是 Anti-Gravity 的世界吗?”的感觉来结束。
今天我想先做到拍肩的场景。然后,在这个场景之后,突然拍肩是不是好呢?我得考虑一下。我们来咨询一下 Anti-Gravity 吧。我问了 AI。是直接拍肩好呢,还是之前有一些预兆比较好呢?然后,让 AI 给出一些这样的选项比较好。现在已经出来了一些。啊,原来如此。所以,不受重力束缚的我走过来的感觉是不是更好呢?所以,首先以“重力无效的即时足迹”为主题,我们来制作这个吧。然后,我们就在这里继续用同一个聊天窗口来做吧?我的图片也先发过去吧?这个结果会怎样还不知道呢。可能会拍到少女的脚。虽然我发了我的图片,但也有容易受到之前影响的倾向,所以这里会怎样呢?嗯,如果这种东西再民主化一点,AI 动画制作会更进一步地突破潮流吧。果然说到日本就是动画,所以从恶搞到戏剧性,各种各样,啊,是这种感觉吗?这个反了。我现在站在前面就不对了。这大概是受到了之前图片的影响,所以我们开一个新的聊天窗口,稍微改进一下提示词,再试一次吧。嗯,根据情况,也可以不使用 Nanobanana Pro,而是在高速模式下使用 Nanobanana 的普通版,然后以此为基础用 Nanobanana Pro 进行整形。这样的话,嗯,如果是付费 API,成本也可以降低,而且 Nanobanana 的普通版应该非常便宜。一张是 6 日元吧?
好。出现了不错的感觉的图片。嗯,就是这种感觉,一张毫不受重力影响走过来的图片。不过,在这种时候呢,嗯,也许不是那个场景,而是它前面的场景会更好。有锁链,嗯,在迈出第一步之前可能更好,嗯,今天就先用这个试试看吧。然后,注意事项是首先要去掉星号,然后让它思考走路的提示词,这里大约 5 秒就够了吧。可能连 5 秒都不需要。如果只是走路的话。然后用 SeaDance 1.5Pro 生成这个。不过这个用 SeaDance 1.0 就可以了吗?可能有点成本失误了。因为只是走路,不需要日语。如果需要日语,那就是 New Number 1.5Pro,但如果是这种简单的动作,比如走路,用 1.0 或其他模型也可以,嗯,但现在可能最好还是限定在诊断上。
哦,出来了。这样感觉可能不错。哦,不错。不过,锁链是从没有锁链的地方出现的,所以我们剪掉一部分来用吧。但作为演出效果来说,非常好。实际上,有脚的画面一瞬间就够了。然后,就是这种感觉。从中间看的话,动不了。嗯,我刚才就是把所有东西都直接用了。然后,这个呢,例如,当少女出现时,在这里加入大约 1 秒的足迹,在少女尖叫之后,再来一次,从她猛地踩下去的场景开始,这样锁链突然出现的感觉就会减少。嗯,我们来试试看吧。
嗯,例如,就是这种感觉。被无形的锁链束缚着。动不了。
嗯,虽然我觉得像现在这样还需要再稍微下点功夫,例如,在这个地方加入一些特效,嗯,比如故障效果之类的,或者在场景切换时还需要再多下点功夫,或者调整色调之类的,嗯,就是这样一边思考一边进行。然后,接下来我们来加入拍肩的场景吧。
接下来是拍肩的场景。这个看起来相当困难,首先,放入前一个场景的图片和提示词,然后,再放入背景图片。不,不放背景图片吧。嗯,接下来是让它用这张少女的图片和提示词来制作只有肩膀的场景。这样,在只有肩膀的画面中,接下来我想连接到视频生成中我拍肩的场景。如果一开始手就放在那里,那就不对了。从那里再“咚咚”地拍也不对,所以最好是从手没有放在肩膀上的状态开始拍肩。然后,啊,就这样出来了。然后,这个再稍微前倾一点。因为第一张有点前倾,如果她直立着就不对了。因为会变成普通站立的场景,所以我说了要前倾。嗯,就这样也行吧。然后,接下来将刚才的图片作为“命运的拍肩”来制作。这个呢,我设想的是用提示词在这里轻轻拍一下手。这个也用 SeaDance 1.5Pro 来试试吧。好了,希望这里能顺利通过。真的只要轻轻放手就行了。轻轻一拍。然后,从手放下的那一刻的最后一帧开始,接下来我想连接到少女回头看到我的场景。无缝地转过来。总之呢,我现在正在进行使用三张图片的生成,就是少女低着头,然后手轻轻一拍,从手拍下的那一刻回头,我就在那里。我想连接到那里。然后,制作好的视频在这里。
哦,太棒了。就这样,营造出非常好的氛围。虽然少女有点男性化了。嗯,那部分,嗯,应该能蒙混过去吧。所以,我们来使用这个吧。这个要做到哪里呢?就这样回头。在哪里剪切这个是相当重要的。大概是这里吧。然后,拍一下肩膀,能量轻轻流淌之后,剪切这里,嗯,保存截图,然后展示给 AI,首先,必须从这里制作少女和我在一起,少女回头看到我的图片,所以让它输出提示词,输入这个,虽然在这里使用有点微妙,但我们再发送一次我和少女的图片试试看吧。这样它是否能直接继承并好好思考呢?最好是,一开始就发送这个场景,有背影,然后再次发送我和少女的图片,接下来是少女回头,手好好地放在肩膀上的感觉。啊,完全不行啊。这种感觉不对,AI 的想象偏离了。哦。可能不错。就是这种感觉吧。嗯。可能连接上了。背景有点变了,因为没有发送背景,所以我们来替换背景图片吧。背景是这样的,现在应该有暴风雨之类的,但没有了,所以要替换。这种是 Nanobanana 的拿手好戏吧。然后,总之,接下来在这里让男性角色进行唇语同步,说“已经没事了”之类的,然后让 Anti-Gravity 思考。为了从这里连接到这里,嗯,让它用稍微精致一点的提示词来演出。这里相当重要。嗯,因为 CDS 1.5Pro 没有开始帧和结束帧。所以必须使用有这些功能的东西。然后,能用这个的呢,嗯,Kling 1.6 和 SeaDance 系列都不能用。这个有点难办。还有 Do、Ydo 2.0 和 ByQ 2Pro。是这个吗?我们来试试这个吧。YDU 的 Q2Pro。因为它有开始和结束帧,所以我们用这个来挑战一下吧。希望它能顺利连接上。一次成功。然后,关于秒数,我觉得 5 秒就够了。因为只是回头而已。然后,输入提示词,有 Turbo 和 Pro 两种模式,首先用 Turbo 模式看一次演出效果。如果那是自己可以接受的水平,就用 Turbo。这样的话,点数是 40,相当便宜,所以感觉能省下不少。
顺便说一下,这个 Lidmedia 呢,也有终身计划,也就是 Lifetime Plan,嗯,只要一次性支付不到 2 万日元,只要这个平台存在,每个月就会一直获得 2000 点积分,所以,嗯,它有一个计划,就是使用时间越长越划算。然后,我让 Grok 计算了一下那个终身计划,如果使用频率高,终身计划是性价比极高的选择。如果想根据实际使用的积分量进行模拟,它会说“如果你告诉我每月使用量,我就会详细说明”之类的,嗯,感兴趣的朋友呢,可以点击 Lidmedia 简介栏的链接,然后将这个页面全部复制,嗯,无论是 Grok 还是其他什么,Chat GPT 还是 Claude,扔过去,问“这个怎么样?”它就会这样回答你。就是这样,嗯,也就是说,信息要自己仔细审查。请不要被表面的言语或数字所迷惑。
然后,是 Baidu Q2 的 Turbo 版本。就是这种感觉。哦,连接得很好啊。这里最好加入变速效果之类的。我觉得不应该一直这么慢地前进,而是要注重速度变化来制作。然后,Q2 的 Pro 版本也来试一次吧?看看会有什么变化。然后,这个本身呢,现在没有声音,所以不加声音的话完全没有临场感。然后,在测试 Pro 版本的同时,我将生成用于唇语同步的语音。语音生成用 Google AI Studio 就可以了。我想稍微改变一下“已经没事了,重力已经无效了”这种台词的语音模型,用 Oras 左右的吧。这个不试一下就很难知道哪个好。没事了。重力已经无效了。刚才那个怎么样?是不是有点太年轻了?这个地方不错。是叫 Sadal Sadal Tagar 吗?我觉得这个模型挺好的。没事了。重力已经脏了。刚才日语有点奇怪,所以再来一次。没事了。重力已经无效了。还想要再多一点厚重感,对吧?在这里写“厚重感”会出来吗?我们来试试看。没事了。重力已经无效了。不错。就用这个吧。现在要用下载的语音,但我记得这个不能用 WAV 格式,所以必须让代理把它转换成 MP3。我尝试发送文件路径,并告诉它转换成 MP3。
然后,现在 Q2Pro 出来了,但 Q2Pro 感觉有点微妙,而且它还在说话,最后还是 Q2 Turbo 比较好。这次这样流畅地进行着,大概最后是好好地结束了没有说话,所以采用 Q2 Turbo。看来模型是高级版并不意味着一定会更好。以前呢,将 WAV 文件转换成 MP3,或者制作 PDF 等,都必须使用工具来完成,但有了代理之后呢,嗯,只要这样告诉它,它就能立刻完成,嗯,这样就能实现效率化了,对吧?可以直接操作文件,这里是同步的,所以变得非常轻松。然后,现在 MP3 已经制作好了。
我刚才试着制作了一下,没事了。连左边的孩子也进行了唇语同步。这个呢,不采取一些对策就很难办了。因为在两个人都在场的情况下让他们说话可能会有点微妙,所以,要么让一个人说话,要么把脸部放大让他们说话,所以,接下来我尝试将右边男性的脸部放大。
然后,从这个状态放大,它应该会继承这里。应该会从右手放在那里的状态放大。如果只是普通地制作特写,就会失去与这里的关联性,所以应该在保持与这里关联性的同时放大,背景等也应该会继承。啊,是这种感觉吗?有点不对。脖子那里没有纹身,衣服也只有左边没有,所以这里继承的话有点麻烦。总之呢,就是放大这个,把左边的女孩藏起来,这样唇语同步就能顺利进行了,对吧?而且有无缝连接的感觉,对吧?右手也这样放着,然后,我把图片替换一次,不加提示词再试一次吧。这次就到这里。
所以就是这种感觉。没事了。重力已经无效了。稍微侧过脸有点可惜,然后,从这里开始,嗯,从刚才的静止画开始动起来是不是更好呢?
所以呢,现在我制作了一个只是稍微组装起来的东西。这次我想暂时就到这里。因为花了一些时间,嗯,虽然说是花了一些时间,但也没花那么多。嗯,也就两三个小时,我们来看一下这个吧。
时值AI战国时代。世界被名为重力的无形枷锁所束缚。动不了。没事了。重力已经无效了。
现在呢。嗯,问题在于声音没有统一感。声音会中断,或者最后没有声音,所以必须调整一下那方面。这可能相当困难。必须巧妙地匹配相似的声音。动不了。嗯,从这里开始没有声音,所以要加上一些好听的背景音乐播放。然后,现在这个地方呢,为了填补没有背景音乐的部分,嗯,我让 Google AST 先生思考了用于雪景的提示词,制作了几个,然后我们来尝试匹配一下吧?要不要做到那里呢?
所以呢,嗯,虽然有点删减,但我现在稍微调整了一下背景音乐。这样,嗯,我觉得应该达到了可以观看的水平了。请大家看一下。
时值AI战国时代。世界被名为重力的无形枷锁所束缚。动不了。没事了。重力已经无效了。
就是这种感觉。我觉得感觉有点不错了,但如果说是本格动画,这个走路的场景多少有点演出不足,或者说,节奏调整有点微妙,嗯,不过这里的连接之类的还不错。我觉得再稍微调整一下节奏是很重要的。这里手出现的地方速度也稍微有点慢,所以消除这一瞬间的空白,嗯,我认为是现在 AI 动画的重要之处。所以,嗯,让观众不感到违和,而是流畅地连接起来,嗯,我认为是现在考虑了平衡的 AI 动画吧。如果能达到一次性全部制作完成的世界,我觉得会非常好,但现在还没有能完美控制到这种程度的电影。Kri,嗯,现在各种各样的东西都在涌现,但细节部分的定制,果然还是需要自己来做。嗯,Kri 大概可以一边把图片一张一张地放上去,一边连接这里和这里,做出这种感觉。虽然我没做过。嗯,虽然我现在是手动把所有这些都做了,但看常见的 AI 动画,嗯,也有一些节奏把握得不太好的。比如,那里一直沉默着,好像卡了 3 秒钟一样。我觉得对于那些地方,用视频编辑软件剪辑掉,消除违和感是很重要的。然后,这次就以我在这里说“没事了”的地方结束了。然后,从下一次开始呢,我想挑战真正激烈、动感的动作场景。另外呢,还有这个偶像企划,以及其他 AI 模型的动画、动画制作等,所以也请大家期待那方面的内容。这次就到此为止。那么下次再见。
[音乐] [音乐] [音乐]