Transcription
您好,欢迎回来。Notebook LM 可以就任何主题生成听起来像人类的对话,逼真到人们将其制作成播客。它就像一个“盒子里的播客”,可以每天制作多集节目。这为创作引人入胜的内容提供了巨大的机会,但有一个问题。没有视频。这意味着没有真人主持人,因此分发和参与受到限制。所以在这段视频中,我将向您展示如何将 Notebook LM 的音频转化为一个说话头视频,让它看起来和听起来都像您一样,与原始 Notebook LM 的演讲逐字匹配,并具有完全相同的表达方式。让我给您举一个来自这个 Notebook LM 播客的例子。今天我们将深入探讨一些非常激进的东西。这是由 Jonathan's Jam 在 YouTube 上推广的那个管道。>> 哦,是的,那个将标准的 Notebook LM 音频转化为这些超逼真的说话头视频的。>> 完全正确。超级同步。>> 我用我的脸和声音制作了这个视频,还有一个伴随的主持人。今天我们将深入探讨一些非常激进的东西。这是由 Jonathan's Jam 在 YouTube 上推广的那个管道。啊是的,那个将标准的 Notebook LM 音频转化为这些超逼真的说话头视频的。>> 完全正确。超级同步。看起来太棒了。所以我们今天的任务是,让我们来解开实际的步骤流程,>> 对吧?您如何将您的脸,甚至您的克隆声音添加到人工智能生成的内容中。>> 好的,让我们从头开始。在本视频结束时,您将知道如何将您自己的脸添加到 Notebook LM 音频概述中,以及您自己的声音。您还将学习如何使用头像来做同样的事情。如果您不想出现在镜头前,这很完美。害羞。>> 作为奖励,我甚至会向您展示如何更改原始 Notebook LM 主持人的性别。所以,让我们通过生成我们的 Notebook LM 播客来开始这场盛宴。[音乐]所以,首先我们来到 Notebook LM。您会在描述中找到链接。然后我们点击尝试 Notebook LM。然后创建新的。我们将提供我们将要使用的来源的 URL。我们将围绕人工智能自动化与人工智能代理的主题生成我们的播客。来源处理完毕后,我们就可以生成音频概述了。现在,请注意,如果您点击这三个按钮,您可以设置输出的长度。默认通常约为 20 分钟,但为了本教程的目的,我将其设置为更短。现在我们只需点击生成。5 到 10 分钟后,我们的播客就准备好了。让我们听听。>> 欢迎来到我们的深度探讨。今天,我们正在研究一个话题,老实说,它似乎无处不在。>> 完全正确。我们收集了大量关于自动化人工智能以及更具体地称为代理人工智能的来源,>> 对吧?代理的。>> 一如既往,这是顶级的。现在,如果我们点击这里的三个按钮,我们可以下载我们的音频文件。现在,继续,我们可以开始第一个方法,将我们自己的脸或我们选择的脸添加到 Notebook LM 播客节目中。我们要做的第一件事是分离 Notebook LM 音频中的说话者。我们之所以这样做,是因为我们将单独生成每个说话者的说话头视频。所以我们需要每个说话者的音频在单独的音轨上。并且至关重要的是,我们不仅要保留沉默,还要保留语音,以便两个视频同步。幸运的是,有一个很棒的工具,其唯一目的是从单个音频轨道中分离说话者。该工具称为 Speaker Split,它非常易于使用。所以,我们来到 Speaker Split 网站。您会在描述中找到链接,我们所要做的就是点击上传,选择说话者数量,然后点击处理音频。就这么简单。几分钟后,Speaker Split 会提供两个分离的说话者音轨,说话者 A 和说话者 B,以及它检测到的完整文字记录。现在,我们下载音轨,以便我们可以开始使用它们来制作我们的播客视频。为了向您展示它们是如何出来的,我将它们加载到 Audacity 中,这是一个开源音频处理软件。描述中的链接,您可以看到它们比 Marie Condo 的袜子抽屉似乎画出了一条非常重要的界限。>> 它们确实如此。理解这条界限,这个光谱是关键。>> 所以根据您的阅读,>> 一个非常有经验的个人司机。>> 哦,好的。所以不只是地图,而是有人在开车。>> 确切地说。这是以目标为导向的。>> 现在,在我们继续之前,Speaker Split 慷慨地提供了向三位幸运观众各赠送 60 个积分。比赛免费参加,对所有 18 岁以上的人开放。要参加,请订阅我的频道并在下方评论中写下 speakerlit,我将随机抽取三位幸运儿。比赛从本视频发布之日起持续 10 天。第 11 天,获胜者将在社区帖子中公布,我也会在评论中联系他们。所以请留意评论,看看您是否是三位幸运儿之一,祝所有参与者好运。好的,现在我们可以进入下一步,即在 Hen 中创建我们的数字双胞胎头像或头像。为此,我们来到 Hen 网站。链接在描述中。一旦您创建了帐户,您就选择创建您的头像。在我们继续之前,让我解释一下在免费计划中您可以做什么和不能做什么。在免费计划中,您可以创建您自己的一个数字双胞胎头像。您甚至可以为它提供多达 300 种不同的外观,即同一个人,但在不同的环境或相机角度下。您每月最多可以创建三个视频。但它们限制为 3 分钟。如果您想制作播客视频,这显然会超过 3 分钟,那么您需要创作者计划,该计划为您提供无限数量的视频,时长最多为 30 分钟。这对于平均 Notebook LM 播客来说绰绰有余。现在,让我们开始 Hen 的流程。所以,一旦您点击创建头像,Hen 会想要您的一些视频,以便它可以生成您的数字双胞胎头像。Agen 在这里为您准备和打光视频提供了一些很好的建议。所以我建议您在录制自己之前先看一下。通过建议部分后,我们进入上传步骤,您可以在其中上传预先录制的视频,在网络摄像头或手机上录制自己。我已经准备好了我的视频,所以我将选择上传素材。然后,我们需要通过网络摄像头验证我们的身份。您可能需要授予您的浏览器使用网络摄像头和麦克风进行录制的权限。录制您自己说出屏幕上显示的文本。一旦您的同意得到验证,点击下一步按钮,提交您的素材,Hen 会审查质量并警告您任何可能的问题。这里说,我可以在句子之间有更多的停顿,但我还是会提交。几分钟后,就好了。而且看起来很棒。嘿 Jonathan,您的数字双胞胎已准备就绪。尝试用它创建视频。另外,点击反馈按钮分享您的想法。希望您喜欢。现在是激动人心的部分。让我的头像说出 Notebook LM 女性主持人的音频。要做到这一点,我们点击 AI Studio 创建按钮并选择横向选项。然后 H gen 编辑器打开,我的头像已加载到时间线上。我们所要做的就是上传我们分离的说话者文件,说话者 A。确保选择了来自录音的声音,然后点击生成。给它起个标题,然后点击提交。就这样。几分钟后,就好了。让我们看看结果。>> 欢迎来到我们的深度探讨。今天,我们正在研究一个话题,老实说,它似乎无处不在。工作的未来,商业和技术。正如您所见,关键的沉默被保留了,在此期间另一位主持人将发言,>> 对吧?代理人工智能,我们今天的任务是>> 太棒了。现在我们有一个视频准备好了。我们需要另一个视频给女性主持人。对于这个,我将使用 Hen 图书馆中的一个头像。但显然,如果您希望另一位主持人也拥有真实人物的脸,您只需重复上一步,为该人物创建数字双胞胎。现在,这里有一个建议可以为您节省时间。观察这些头像,只选择一个不怎么比划的,因为否则,您可能会在您的播客中遇到一些非常奇怪的行为,例如这个。>> 完全正确。我们收集了大量关于自动化、人工智能以及>> 所以我将选择 Amelia,她不动太多,手势有限。现在,我们只需重复我们为我的头像遵循的步骤,即,我们只需点击 Amelia,她就会加载到编辑器中。然后我们上传她的音频文件,即说话者 B。确保它设置为来自录音的声音。>> 完全正确。我们收集了大量关于自动化、人工智能以及>> 点击生成,给它起个标题,然后点击提交。几分钟后,Amelia 就准备好了。所以,让我们来看看她。>> 完全正确。我们收集了大量关于自动化人工智能以及更具体地称为代理人工智能的来源。>> 我认为她看起来很棒。您可以看到在生成这些视频时沉默是多么关键。没有它们,您就无法同时让两位主持人出现在屏幕上。诚然,有时她说话时动作看起来有点奇怪。但是请记住,当我们把两位说话者放在一起时,焦点总会放在说话者身上,所以这一点会不太明显。无论如何,让我们通过进入下一步来做到这一点,这样您就可以明白我的意思了。我们现在要做的是从 Hen 下载我们的头像视频。然后我们打开 Cap Cut 免费视频编辑器,我已经安装在我的系统上了。如果您想安装它,可以在下方找到链接。这款软件是一款功能强大的视频编辑器,它采用付费模式,这意味着您可以完全免费使用它,只要您愿意。但有些功能是专业版的,您确实需要付费。但是,他们免费提供的东西非常多,足以进行体面的视频编辑。所以,我们点击新项目,导入我们的两个头像视频,并将它们添加到时间线上。然后,我们将一个放在另一个上面,这样它们现在就同步了。我们使用顶部音轨上的裁剪工具,并重新定位两者,使它们现在并排播放。现在可以观看了。欢迎来到我们的深度探讨。今天,我们正在研究一个话题,老实说,它似乎无处不在。工作的未来,商业和技术。>> 完全正确。我们收集了大量关于自动化人工智能以及更具体地称为代理人工智能的来源。>> 对吧?代理人工智能。我们今天的任务是,让我们来剖析术语。让我们真正弄清楚区别,看看这些东西是如何真正改变企业运营方式的。>> 完全正确。是时候揭开了。>> 好的。所以,我们听到人工智能和自动化之类的声音。>> 好的,我不知道您怎么想,但我发现最终结果非常令人信服和自然。请在下面的评论中告诉我您的想法。现在,我向您展示的基本上是一种从 Notebook LM 或其他任何播客创建说话头视频的方法,使用头像。如果您只想创建使用原始 Notebook LM 声音的说话头视频,并且不打算更改声音,那么这很有用。例如,如果您正在为新员工准备培训材料,或者您是一名教师,正在为您的学生创建关于某个主题的引人入胜的材料。但另一方面,如果您想将自己的脸放在播客上,很多人可能也想将自己的声音放上去。这正是我们将要研究的。现在,在我们开始之前,让我们先看看它可能会是什么样子。但在我向您展示之前,我知道从您的评论中,您可能也想让两位主持人是同性别的,并且不受男性女性 Notebook LM 播客的限制。所以,我还会向您展示如何更改性别。在下面的例子中,您将看到结果。自主决策。嗯。这听起来像是一个很大的飞跃。>> 是的。而且来源表明它正在迅速普及。想想这个。到 2028 年,他们预计代理人工智能可能将为大约 33% 的企业软件应用程序提供支持。>> 哇。从现在的 1% 上升到 33%?>> 2024 年只有 1%。所以,是的,这是一个巨大的转变。>> 好的。所以,代理人工智能听起来很强大,适应性强。好的。我认为这太棒了。您呢?请在下面的评论中告诉我。现在,如果您使用 Hen 头像库中的头像,更改性别实际上非常简单。继续观看以了解如何操作。但是,当然,需要更多步骤的是将您自己的声音添加到视频中。所以,这是如何做到这一点。基本上,我们将做与之前相同的事情,即生成我们的 Notebook LM 播客。使用 Speaker Split 分离说话者。在 Hen 中创建我们的数字双胞胎头像。然后上传我们的音频。这里的区别是,在将音频上传到 Hen 之前,我们需要将 Notebook 的语音转换为我们自己声音的录音。然而,在这个过程中也至关重要的是保留沉默的确切时间和持续时间。通过仅仅录制自己说出文字记录来达到这一点将极其困难和耗时。有点像在跳伞时穿针。所以,解决办法是使用您的声音的克隆。要制作一个非常令人信服的、听起来像您的声音克隆,您将需要一个 11 Labs 专业克隆。现在我将逐步介绍如何创建专业的声音克隆,您可以一遍又一遍地使用它,以及如何让它以完全相同的时间和语调说出 Notebook LM 音频,使用 11 Labs。这是一个两步过程。第一步是制作您的专业声音克隆。第二步是使用 11 Labs 配音工具生成您声音的语音,逐字逐句地与原始 Notebook LM 音频的确切时间和沉默相匹配。所以,让我们开始访问 11 Labs 网站。链接在下面的描述中。在我们继续之前,关于计划和选项的快速说明。要进行声音克隆,您需要付费计划。如果您想要专业的声音克隆,我老实说推荐它,如果您想让您的头像听起来像您,那么您需要创作者计划,该计划还为您提供了相当数量的使用积分。入门计划中的即时声音克隆还不错,但在我看来,与专业版相比有所欠缺,而且逻辑上专业声音应该更优越,因为它基于您长达 2 小时的录音进行训练,并且需要一些时间来处理,而即时克隆,嗯,它是即时的,并且只基于 10 秒的音频进行训练。除此之外,播客通常很长,会消耗您的积分,尤其是如果您每月制作多个节目。好的,让我们开始吧。在 11 Labs 创建一个帐户。完成之后,在声音选项卡中,点击创建或克隆声音,然后选择专业声音克隆,然后打开专业声音克隆面板。填写这里的字段。您可以上传您自己现有的录音,也可以直接录制。我将两者都做一些,我提供了总共半小时的音频,这少于 2 小时的最大值,但肯定足以获得非常好的声音相似度。您必须添加您的口音。我的口音是英式的。然后我点击下一步按钮。在我们继续之前,就像与 Hunen 一样,我们必须通过验证。现在我们的专业声音克隆正在准备中,可能需要一些时间才能完成。所以,去遛狗或者出去试着向松鼠解释比特币。您决定。当它准备好时,会弹出此消息。所以,让我们选择使用声音。然后文本转语音部分将加载。为了测试声音,我将点击讲述一个故事。然后这段示例文本出现,供我的新专业声音克隆说出。让我们听听效果如何。在一个宁静的村庄里,天空以金色染料拂过田野,年轻的 Mia 发现了一张通往被遗忘宝藏的地图。她不知道,她的猫 Whiskers 有个秘密。不可思议,对吧?好的,第一步,专业声音克隆已完成。现在让我们进入第二步,使用配音工作室将我们的原始音频与我的专业声音精确匹配。所以我们需要转到配音并点击创建新的配音。填写这些详细信息,给它起个名字,然后我们必须将源语言和目标语言都设置为相同,在这种情况下是英语。点击上传您的原始音频文件。>> 欢迎来到我们的深度探讨。今天,我们正在研究。将说话者数量设置为一。选择创建配音项目并点击创建配音。配音项目处理完毕后,点击它以打开配音工作室。这是配音工作室界面。我们在底部的音轨上加载了说话者的音频,包括沉默。在音轨上方,我们有说话者卡片,上面显示着转录的文本。每张卡片对应音轨上的每个音频片段。目前,我们只可视化原始音频。>> 欢迎来到我们的深度探讨。今天,>> 我们想要的是同时将目标语言音频加载到音轨上。要做到这一点,我们向下滚动并将其从原始更改为英语。目标音频也会加载。我们想要的是让我的专业克隆说出目标音频,但默认情况下,我的声音没有加载。今天我们正在研究>> 所以我们向下滚动到目标音频轨道,然后点击齿轮图标打开轨道声音设置,并从列表中选择我的专业声音克隆,然后关闭设置对话框。现在,正如您所看到的,声音没有自动替换。>> 一个话题,>> 首先,我们必须重新生成音频,点击生成静态音频按钮,这将重新生成目标音频轨道上的所有音频。我们可以播放一部分以检查它是否使用了我的声音。人工智能。我们今天的任务是,让我们来剖析术语。让我们真正弄清楚区别,看看这些东西是如何真正改变企业运营方式的。现在,在导出我声音的音频之前,给您一个建议。您可能会发现说话者卡片中的文本与 Notebook LM 语音不完全匹配,这可能会影响时间。我们不希望那样。所以,只需手动更正文本并根据需要重新生成音频。好的。所以,代理人工智能听起来很强大,适应性强。是的。那是否意味着传统的自动化现在我们的语音已准备好导出?所以我们点击导出按钮。确保选择英语轨道,这是我们的目标音频。选择您想要的格式并导出。欢迎来到我们的深度探讨。今天,我们正在研究一个话题,老实说。好的。现在是时候回到 Hunen 并创建我们的头像视频了。为了多样性,我将为我的数字双胞胎创建一个不同的外观。这次看起来像我真的在通过网络摄像头进行播客。顶部的视频。好的,就这样。它并不复杂。它只是但是请记住,这并非必需。如果我愿意,我可以使用我现有的头像。所以,像以前一样,我将上传我自己的录音。这次,Hen 引起了我对几件事的注意。它说相机不稳定,这是真的,因为它是用一个有轻微晃动的外部网络摄像头录制的。而且我也不总是直视相机。但是,我还是会提交。如果生成了任何奇怪的东西,看到这项技术的局限性也会很有帮助。准备好后,我们可以预览一下。嘿,Jonathan Rice,您的超逼真头像已准备就绪。尝试用它创建视频。另外,点击反馈按钮分享您的想法。希望您喜欢。它看起来很棒。实际上,我真的很喜欢它有时会看向镜头外的事实,因为在现实生活中,人们确实经常这样做。所以,我们将其加载到编辑器中,上传我们从配音工作室导出的语音。欢迎来到我们的深度探讨。确保它设置为来自录音的声音。欢迎来到我们的深度探讨。今天,我们正在研究一个话题。然后点击生成并提交。这是我们得到的结果。欢迎来到我们的深度探讨。今天,我们正在研究一个话题,老实说,它似乎无处不在。工作的未来,商业和技术。好的,所以在这里我们看到了相机晃动时会发生什么。我的手指变成了我的嘴。但除此之外,它看起来非常自然,而且听起来就像我一样。对,代理人工智能。我们今天的任务是,让我们来剖析术语。太棒了。现在是另一位主持人,正如我所说,我们将把她的性别从女性改为男性。如果第二位主持人也是基于另一个真实人物,那么您将重复我们刚才创建她的声音克隆并转换 11 Labs 中的语音的过程。但对于本教程,我将使用 Hen 图书馆中的头像来完成。我们所要做的就是选择我们想要的性别的头像。像以前一样将它们加载到编辑器中,但在这种情况下,我们将使用一个附加功能,即语音镜像功能。此功能允许我们的上传的 Notebook LM 音频以相同的方式说出,但使用另一种声音,甚至另一种性别。所以,使用我们的男性头像和男性声音,上传的女性语音将由男性呈现和说出。我通过反复试验发现,并非所有声音都可以用于镜像。所以,您必须尝试一下才能找到兼容的声音。我将选择 Young Olivia,因为我知道它适用于镜像。>> 嘿。这是我的声音。希望您喜欢。>> 现在,我们有了声音。我们可以上传分离的说话者文件,并确保打开镜像切换。现在,如果我们预览音频,我们可以听到是 Young Olivier 在说话,而不是 Notebook LM 的女性声音,而且他以与原始声音相同的语调说话。>> 完全正确。我们收集了大量关于自动化人工智能以及更具体地称为代理人工智能的来源。>> 所以,视频处理完毕后,我们得到了这个。>> 完全正确。我们收集了大量关于自动化人工智能以及更具体地称为代理人工智能的来源。太棒了。我选择这个头像的原因之一是他的肢体动作有限,这让他看起来非常自然。现在,我们再次将两个头像视频导入 Cap Cut 并像以前一样排列它们。我们可以看到它们完美同步。欢迎来到我们的深度探讨。今天,我们正在研究一个话题,老实说,它似乎无处不在。工作的未来,商业和技术。>> 完全正确。我们收集了大量关于自动化人工智能以及更具体地称为代理人工智能的来源。>> 对吧?代理人工智能。我们今天的任务是,让我们来剖析术语。让我们真正弄清楚区别,看看这些东西是如何真正改变企业运营方式的。>> 完全正确。是时候但然后有代理人工智能,这更像是拥有一个非常有经验的个人司机。>> 哦,好的。所以不只是地图,而是有人在开车。>> 确切地说。这是以目标为导向的。它不只是遵循规则。它以结果为目标。而且至关重要的是,它会学习。它会实时适应。它会做出自主决策,尤其是在事情变得不可预测时。>> 自主决策。嗯。这听起来像是一个很大的飞跃。>> 是的。而且来源表明它正在迅速普及。想想。所以,这不是关于取代。而是关于战略整合。融合它们。>> 好的。融合它们。我们能让它更具体吗?有一个关于 Sarah,那个小企业主的事例。>> 是的。那个季节性企业主,>> 对吧?>> 所以,Sarah 经营一家海滩设备租赁公司,夏天可能还会提供冲浪课程。她的收入自然是不规律的。>> 有道理。夏天高峰,冬天低谷。对。现在,一个现在,您可能已经注意到两个剪辑之间的长度差异,我的视频比其他主持人的视频长是有原因的,那就是 Hen 的语音镜像限制为 5 分钟。这很不幸,但您可以通过一次处理 5 分钟,然后在视频编辑器中将它们按顺序排列来解决。如果您不想这样做,那么您可以再次通过配音工作室,使用另一种声音。另一个执行配音工作室方法的原因是,在这种情况下,您不必创建另一个声音克隆。您可以使用任何令人惊叹的 11 Labs 声音。配音工作室的持续时间限制为 45 分钟,如果使用 11 Labs API,可以延长到 2.5 小时。现在,您可能会想,为什么我们不直接使用语音镜像与我的数字双胞胎头像来让它说 Notebook LM 音频呢?嗯,答案很简单。语音镜像与您的数字双胞胎头像不兼容,至少在制作此视频时是这样。我不知道 Hen 是否计划让数字双胞胎头像的声音与镜像兼容,但如果他们这样做了,并且结果质量很高,那么您就不必在 11 Labs 中通过配音工作室或创建 11 Labs 专业声音克隆。然而,这一切还有待观察,就生成声音的质量而言,11 Labs 仍然是行业标杆。无论如何,现在我们有了最终视频,我们可以从 Cap Cut 导出它。我们只需点击右上角的导出按钮,选择一个保存位置,给它起个名字,点击导出按钮,就这样。欢迎来到我们的深度探讨。我希望您觉得这很有用。请在下面的评论中告诉我您的想法。现在,我刚才展示的方法显然是用于并排播客,其中两位主持人位于两个不同的位置,这确实反映了现实生活中大多数播客的情况,但我知道有些人会想要一个将两位主持人放在同一个空间里的解决方案。所以我目前正在制作一个关于这个的视频,完成后我会把它放在这个视频的末尾。请在下面的评论区留下您的任何评论、问题或反馈。您还会在描述中找到本期节目的完整节目笔记,其中包含我们一步一步走过的所有细节。好的。感谢您的观看,并考虑订阅。