📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Open-source SUNO is here! Free offline AI music generator

AI Search33:49

Transcription

最后,我们有了一个新的开源人工智能音乐生成器。这是你现在能用到的最好的一个,甚至和 Sunno 一样好。它叫做 Heart Moola,它的工作方式就像 Sunno 或 Udo 一样。你会输入一个描述歌曲的提示词,然后输入一些歌词,它就会为你生成一首完整的歌曲。所以,在这个视频里,我将展示一些我个人的演示,这样你就可以看到它有多好或多差。另外,我还会教你如何安装它,这样你就可以在你的电脑上免费、无限次地离线运行它。让我们开始吧。感谢 HubSpot 赞助这个视频。首先,让我们来看看为什么这如此重要。你看,在人工智能音乐方面,只有大约两家公司在生成人工智能音乐方面做得相当不错。其中一家叫做 Sunno,另一家叫做 Udo。我之前在我的频道上都介绍过这两个。现在,当这两家公司刚出现的时候,那简直是狂野的西部。你可以用它做很多事情。你可以生成音乐,下载它们,甚至用于商业用途。然而,请注意,不久之后,这两家公司都面临着与一些大型唱片公司,特别是华纳音乐和环球音乐集团的诉讼。这些诉讼声称,这些公司未经许可,在受版权保护的歌曲上训练了他们的人工智能模型。所以,为了解决这些诉讼,几个月前,Sunno 与华纳音乐集团合作,他们基本上同意与华纳合作,构建授权的人工智能音乐,这意味着他们现在必须获得许可,并且经常付费才能在他们生成的内容中使用艺术家的音乐和肖像。Sunno 用户面临着更多的许可限制和约束。Udo 也是一样。所以几个月前,他们也被迫与环球音乐集团合作,后者正在起诉他们,这基本上导致下载功能被完全禁用。用户仍然可以在平台上收听他们制作的音乐,但他们无法导出这些音乐或制作自己的副本。所以,总之,因为这两家公司现在被迫与这些大型音乐厂牌合作。你可以预期与以前相比,会有更多的使用限制和许可要求。由于这种限制性的控制,Sununo 和 Audio 不再像以前那样了。因此,我们确实缺乏这种开源模型,你可以直接在本地离线生成音乐,并随心所欲地使用它。现在,过去我介绍过一些开源音乐生成器,比如 A Step 和 U。但这两者的质量都远远不及 Suno 的水平。开源人工智能音乐真的落后了很多。然而,对于这个,Heart Moola,请注意。如果你看这些基准测试,Sunno 版本 5,这是 Sununo 的最新版本,在最左边。而这个新的开源权重 Heart Moola 在最右边。正如你所见,在歌词错误率方面,越低越好,这甚至比版本 5 还要好。然后在整体歌曲质量和风格一致性、音频质量、音乐性、结构连贯性方面,它的得分非常接近 Sunno 版本 5。所以,终于,我们有了一个你可以离线使用的准 Suno 级别的音乐生成器。所以,这非常令人兴奋。现在,他们在页面上提供了大量的演示,但这些可能是经过精心挑选的。所以,我将要做的是展示我自己的例子。所以,这是一个有趣的。对于提示词,我将写“原声民谣乡村,泰勒·斯威夫特风格”。然后它将是“朗朗上口的旋律”。然后我将粘贴一些实际的泰勒·斯威夫特歌词进去。让我们看看它会生成什么。当我第一次 [唱歌] 看到你时,我闭上了 [音乐] 眼睛,闪回开始了。我站在那里,在 [音乐] 夏日的阳台上。 [音乐] 看见 [唱歌] 灯光,看见派对,舞会。看见你穿过人群,打个招呼。 [音乐和唱歌] 我当时真不知道 [音乐] 你只是你在扔石子,我爸爸说离朱丽叶远点。 [唱歌] 我在楼梯上哭着 [音乐] 求你,求你别走。当我让你把我带走,带我去一个我们可以独处的地方。 [音乐] 我会等。剩下要做的就是 [音乐] 跑。你将是公主,我将是公主。 [音乐] 这是一个爱情故事,宝贝。 [音乐] 只说“是”。 [音乐] >> 而且你知道,实际上,大部分听起来都相当不错。首先,歌词几乎完美。人声还可以,旋律也非常好。请注意,所有这些都是我在电脑上离线生成的。现在,我不会说这是制作质量。一切听起来仍然有点模糊。它缺乏存在感,也不像专业歌曲那样富有动态或表现力,但与其他人声开源音乐模型相比,它仍然非常好。好的。现在,我们不使用原声,接下来,让我们尝试现代摇滚,重金属,史诗般,强大,然后我只是遵循他们的一些提示示例。最好是明确提及乐器。所以,这里我也写了电吉他,摇滚乐队,充满活力的男声。现在,一开始,这首歌听起来相当无聊,像一首情歌,但请耐心听。一旦进入副歌前奏和副歌,它实际上听起来相当不错。所以,一定要听到最后。 [音乐] 阴影 [音乐] 爬进我的血管。灰烬 [音乐] 低语我所有的痛苦。我眼中的钢铁和 [音乐] 火。我不会 [音乐] 屈服。我不会道歉。 [音乐] [音乐] [音乐] 热。 [音乐] [音乐] 热。然后它继续下去,但为了节省时间,我只播放歌曲的前几段,但正如你所听到的,它绝对可以制作重金属或摇滚。这是一首相当史诗般和强大的歌曲。我不认为这是制作质量。它仍然听起来有点模糊。人声没有足够的表现力,但仍然非常好。现在,Heart Moola 的绝妙之处在于它可以处理不同的语言。所以,这是一个 K-pop 的例子。对于提示词,我输入了 K-pop 舞曲电子 upbeat。Fore! Foreign! Foreign! [音乐] [音乐] Hold [音乐] on. [音乐] Fade away. No one [音乐和唱歌] play. We go up [音乐] to [音乐] this feeling tonight. As long as [音乐] I don't let go of me, I'll let it go. [音乐] >> [音乐] >> 而且说实话,我真的很喜欢这首歌。旋律很棒。它听起来像 K-pop,甚至还加入了一些 Vocaloid 自动调音的风格。很酷。接下来,让我们尝试一个西班牙语的例子。所以,我将输入 Latin chill urban cafe。这是我得到的。This is [音乐] better. [音乐] No, [音乐] [音乐] 我会说这首歌的旋律不是那么令人印象深刻,但它确实正确地发音了西班牙语,而且听起来像一首不错的、放松的歌曲,可以在咖啡馆播放。fake。接下来,这是一个 J-pop 的例子。所以,提示词是 energetic, electronic, synthesizer, drum machine。再次,这些是我从他们自己的提示示例中复制的提示词。最好明确提及乐器。然后我也输入了女声。 [音乐] Foreign [音乐] [音乐] speech. Foreign speech. Foreign speech. break. [音乐] La. [音乐] [音乐和唱歌] [音乐] >> 好的。所以,我在这里暂停。但这听起来像一首不错的、充满活力的 J-pop 歌曲。它有点像 Yosobi 的风格。然后最后,一位用户在我上一个视频中也要求我尝试一个印地语的例子。所以,这里我有 Bollywood upbeat dance indie pop。这是歌词。让我们听听这听起来怎么样。 [音乐] [唱歌] Another [音乐] [音乐] [音乐] [唱歌] [音乐] [音乐] All >> [音乐] >> 好的,我在这里暂停。我不知道歌词是否唱对了,所以请在下面的评论中告诉我。这并不像我所想象的那种宝莱坞的 upbeat 舞曲。它可能缺乏宝莱坞歌曲在其训练数据中的比例。接下来,我还想测试一下它在仅生成器乐方面的能力。现在,我尝试将歌词设置为空,但我发现如果我添加一个器乐标签,效果会稍好一些。然后对于我的第一个测试,这是 Europ trans catchy EDM drum machine rhythmic。 [音乐] >> [音乐] >> 所以,我不知道它在那里做什么,但它肯定不是我提示的。它不擅长仅生成器乐。这是一个更简单的提示词。我只输入了 jazz。让我们听听这听起来怎么样。 [音乐] Let's say his [唱歌和音乐] song. [音乐] >> 好的,我在这里暂停。但这是一个爵士乐的例子。再次,它只是不擅长器乐和无声。所以,这只有在你想要生成带唱歌的完整歌曲时才有用。总之,这些是我的一些演示。希望这能让你对它能做什么和不能做什么有一个很好的了解。接下来,我将一步一步地教你如何安装它,这样你就可以在你的电脑上免费、无限次地运行它。所以,我将在下面的描述中链接到这个官方 GitHub 仓库。如果你向下滚动,这里包含了如何安装它的所有说明。他们没有在这里指定 VRAM 要求,但如果我点击 HuggingFace 仓库,所有东西的总大小不到 16 GB。所以为了安全起见,我认为你需要大约 16 GB 的 VRAM 来运行它。随着每天都有许多人工智能工具推出,很容易感到落后。如果你感到不知所措,不确定哪些工具真正值得你花时间,有一个巨大的免费资源你需要查看,那就是 HubSpot 的“Master Your Skills in 2026”。它本质上是一个包含六个不同指南和工具包的综合包,旨在让你从困惑变成超级用户。以下是我最喜欢的三个部分。你将获得一个包含 200 种使用 AI 赚钱方式的数据库,以及一份关于 50 种高影响力生产力工具的指南。它不仅仅是一个列表,还包括真实世界的流程,这样你就可以立即自动化你的日程安排或内容创作。该包还包括这份指南,“40 多个免费与付费 AI 工具”。这非常重要,因为它能帮助你建立一个专业的工具集,而无需超支。它解释了免费版本何时足够,何时值得升级。此外,你还将获得一份高级 ChatGPT 提示工程指南,这非常有用。这可以帮助你通过正确地提示 ChatGPT 来获得最佳结果,立即获得更好的结果。此外,你还将深入了解 Mindeream 的时事通讯所使用的 15 种工具,该时事通讯拥有超过 200,000 名读者。甚至还包含一个视频课程,其中包含即用型提示,可以为你每周节省数小时的繁重工作。你可以通过下面的链接完全免费获取整个包。非常感谢 HubSpot 赞助这个视频并制作了这个。好的,接下来。让我们一步一步地过一遍这些说明。现在,为了运行这个步骤,你首先需要在你的电脑上安装 Git。如果你没有 Git,这里是如何安装它。如果你已经安装了 Git,请随时跳到下一节。我们所要做的就是下载你正在使用的操作系统的最新版本。我正在使用 Windows,所以我将点击下载 Windows 版本。我使用的是 64 位,所以我将点击这个进行下载。它现在正在下载这个 .exe 文件。所以,一旦完成,我们所要做的就是打开那个 .exe 文件,然后按照步骤操作。所以我将点击下一步。我将使用默认的安装位置,即 program files/gget。所以我将点击下一步。然后我将保持默认设置。有很多设置需要你去浏览。所以我将点击所有这些的下一步。好的。然后它应该开始安装所有文件。这可能需要几分钟。完美。现在我们已经安装了 Git。好的。好吧,假设你已经安装了 Git,第一件事就是选择你想下载所有内容的位置。所以我将把它下载到我的桌面上。所以我将用文件资源管理器打开我的桌面。然后在顶部的栏中,只需输入 cmd 即可在命令提示符中打开桌面。然后下一步就是简单地复制这一行,然后在这里粘贴。这将把这里看到的所有文件和文件夹克隆到我桌面上的一个文件夹中。所以,如果我双击这个,你可以看到它和 GitHub 仓库是相同的文件和文件夹。好的,下一步是因为我们现在还在桌面上,我们需要将目录更改到这个新的 heart lil 文件夹。所以我将复制这一行,然后在这里粘贴。所以,现在你可以看到我们现在在这个新的 heart lib 文件夹中。然后对于下一行,这意味着我们将使用 pip 在我们当前的文件夹中安装一个 Python 项目。然而,有些人可能没有安装 Python,有些人可能没有安装 Python 3.10。所以,我建议你做的是先安装,然后使用它来创建一个带有 Python 3.10 的虚拟环境,这样一切都将包含在这个自包含的文件夹中,这确保了一切都能正常工作而不会破坏其他任何东西。所以,在我们进行这一步之前,我们确实需要先安装。如果你已经安装了,请随时跳到下一节。实际上,我将要做的是安装 Minionda。这是一个极简版的 Anaconda。如果你安装了完整的 Anaconda,它会安装很多你可能不需要的包和依赖项。这只会占用你电脑上更多的空间。当然,安装时间也更长。但 Minionda 只是一个基础包,你可以稍后安装额外的包和依赖项。所以,我在这里,你可以下载最新版本的 Anaconda,它是 Python 3.13。但 3.13 往往与最新的 AI 模型配合不佳。所以,你应该选择 3.12 或 3.11。所以,我将点击这个链接,repo.anaconda.com。在这里,你会找到不同操作系统和 Python 版本的各种安装程序的列表。所以,例如,你可以选择 3.12 或 3.11。所以,如果你想安装 3.12,这是 Windows 版本。所以你可以安装这个或这个。Windows 的 3.11 也有效。好的。下载 .exe 文件后,我将打开它,它将启动这个安装程序。所以我将点击下一步,然后同意。然后让我们将其设置为所有用户。我将使用默认的目标文件夹。然后我也会勾选这个。完成后清除包缓存。这只会为你节省一些磁盘空间,而不会影响功能。好的,一旦完成,让我们点击下一步,然后我们就完成了。现在,我们还没有完成。所以,如果你打开命令提示符并输入-version,你仍然会看到它未被识别。这是因为我们还没有将 Anaconda 添加到我们的路径中。所以,让我们退出。然后要将其添加到我们的路径,我们只需搜索这个函数,编辑系统环境变量。我们将点击这个,然后点击环境变量,然后点击名为 path 的那个,然后点击编辑。在这里,你需要添加 Anaconda 的路径。所以,这取决于你安装 Anaconda 的位置。对我来说,我将其安装在 program data 中。所以,它将在 program data/min 中。然后如果我双击 scripts,你可以看到它在这里。所以,这是我们要粘贴的文件夹。所以我将右键单击这个,然后复制为路径。然后回到环境变量窗口,我将点击新建,然后在这里粘贴路径。然后点击确定。然后确定。然后再次确定。现在,如果你再次打开命令提示符并输入-version,你应该会看到我们正在运行 24.5.0。这表明我们已成功安装 Anaconda。总之,假设你已经安装了或 Minionda。实际上,我们首先需要做的是使用来创建一个新的虚拟环境,输入-ashn。然后,让我们称之为 Heart Moola。它将使用 python=3.10,这在这里是推荐的。所以,让我们运行。这将使用 cond 创建一个名为 Heart Moola 的虚拟环境。你会被提示继续或不。让我们按 Y 然后回车。之后,你应该再次看到这条线,没有错误消息。下一步是,在安装任何其他东西之前,我们首先需要激活并进入我们的虚拟环境。要做到这一点,只需输入然后激活 Heart Moola 或你为虚拟环境命名的任何名称,然后按回车键,你应该在行的开头看到你的环境名称(在括号中),这表示你现在在你的虚拟环境中。好的。现在,之后,我们可以继续运行这一行。所以,让我复制它,然后在这里粘贴。这将安装所有构建依赖项。它将安装 torch audio, torch vision 等。这将需要一段时间来下载所有内容。好的,之后,你应该看到它已成功安装所有这些,并且你应该再次看到这条线,没有错误消息。现在,下一步是我们需要从 hugging face 下载所有这些模型。为了做到这一点,我们需要使用 pip 安装一个额外的包,名为 hugging face hub。所以,回到我们的终端,我们需要输入 pip install,然后是 hugging face_hub,像这样。这将安装这个包,它帮助我们从 hugging face 下载文件。现在,这里说我们需要在一个 checkpoint 文件夹中安装它。所以,我将要做的是退出这个终端,然后回到我们的 heart lib 文件夹。让我们右键单击并创建一个新文件夹,称之为 ckpt。然后之后,再次在顶部,输入 cmd 来在这里打开它。然后,对于这些行,它似乎不是 Windows 终端的约定。所以,如果你尝试粘贴这一行,它实际上不会起作用。所以,如果你使用 Windows,你应该这样输入。它将是 HF download,然后不带引号,你只需在此处输入这部分。所以,它将是 heart moola/heart mula genen。注意大写字母。然后 d-local directory。然后这部分,但同样不带引号。所以,它只是 .slash,然后是 checkpoints,像这样,这将继续下载这个文件。如果你双击你的 checkpoints 文件夹,你可以在这里看到文件。我们还需要为这两行做同样的事情。所以,我们再次需要删除引号才能使其工作。所以,在这里,我将输入第二行,然后按回车键。请注意,对于第二行,它将安装实际的模型,大小约为 16 GB。它基本上是在下载这些 safe tensors 文件。所以,这需要一段时间,取决于你的互联网速度。好的,完成后,你应该再次看到这条线,没有错误消息。现在,让我们也为最后一行做同样的事情。同样,如果你使用 Windows,你需要不带引号输入。所以,我将写这个,然后按回车键。请注意,这个也需要大约 6.64 GB 的大小,所以这需要一段时间。好的,完成后,基本上就是我们需要下载的所有内容。现在,让我们也双重检查一下我们的 checkpoints 文件夹是否包含所有这些文件。所以,我将打开 Checkpoints。正如你在这里看到的,我们确实看到了 heartcode oss 文件夹,然后是这个 heart moola oss 文件夹。此外,我们确实看到了 gen config 和 tokenizer。所以一切都安装正确。接下来,我们可以继续生成一些歌曲。所以,让我退出所有内容,然后向你展示第二天如何从头开始启动它。所以,你只需要双击进入你的 heart lib 文件夹。然后在这里的顶部,输入 cmd 来在这里打开它。然后你需要输入。然后激活你的虚拟环境的名称,我们称之为 Heart Moola。你应该在行首看到括号中的 Hartmoola,这意味着你现在在你的虚拟环境中。现在你可以开始使用 Hartmoola 了。现在,如果你没有安装名为 Triton 的东西,这是一个你需要做的额外步骤。例如,如果我现在粘贴这个脚本来运行音乐生成,我稍后会解释。但现在,如果我在这里这样做,你会看到我们得到这个导入错误。没有名为 Triton 的模块。所以,我们必须先安装 Triton。如果你已经安装了 Triton,请随时跳到下一节。现在,如果你和我一样,你使用的是 Windows,那么最好的方法是安装一个预编译的 Triton 版本。所以,我将在下面的描述中链接到这个页面。我将要做的是安装这个 Triton 2.1。由于我们在我们的环境中使用了 Python 3.10,我将点击这个。现在,你可以将这个 wheel 下载到任何你想要的地方。我将把它下载到我的 heart liibb 文件夹中。点击保存。所以,这大约是 300 MB。好的。之后,我将点击下载的文件,然后右键单击,然后点击复制为路径。然后回到我们虚拟环境中的终端,我将输入 pip install,然后在这里粘贴路径(用引号括起来)。所以,让我们按回车键。然后之后,它将继续安装 Triton。现在,你可以选择使用 pip install triton = 2.1.0。但至少在 Windows 上,对于大多数用户来说,它需要很长时间才能真正编译 wheel。所以,这就是为什么我向你展示这个方法,安装一个预编译的 wheel。这会更快地安装 Triton。请注意,这只适用于 Triton 版本 2.1。我尝试安装 Triton 3,但它不起作用。好的,完成后,我们可以开始生成一些音乐。所以,这是你如何开始的。首先,你需要点击进入你的 heart lib 文件夹。然后在这里的顶部,输入 cmd 来在这里打开你的命令提示符。然后我们需要输入。然后激活我们命名的虚拟环境的名称,Hart Moola。你应该在行的开头看到括号中的 Hart Moola,这表示你现在在你的虚拟环境中。然后最后,你可以将这一行复制并粘贴到这里。现在,你可以直接按回车键运行它,但让我们看看这一行实际上是什么意思。所以,这将使用 Python 来执行这个 run music generation 文件,它位于你的 examples 文件夹中。所以,如果我们实际上打开它,让我打开 examples 文件夹,然后运行 music generation.py。你可以用记事本打开它,但我将使用 VS Code。在这里,你可以看到它基本上会从你的 assets 文件夹中的 lyrics.ext 文件中获取你的歌词。此外,它还会从这个 tags.ext 文件中获取你的标签或提示词。然后它还将把你的生成内容输出到你的 assets 文件夹中的 output.mpp3 文件。所以,实际上,如果你去你的 assets 文件夹,你可以看到这里的歌词文件和标签文件。让我们都打开它们。对于标签,这里是你想要歌曲听起来是什么样子的地方。所以,默认情况下,这是 piano 和 happy。然后对于歌词文件,当然,这里是你输入歌词的地方。请注意,你可以像这样构建歌词,其中你可以有 intro, verse, preorus, chorus, bridge, outro 等标签。所以,这里是他们默认的歌词。我将保持原样。但请注意,你也可以在这里添加一些额外的参数来微调你的生成。所以,例如,让我把窗口移下来。所以,你也可以添加这个 max audio length MS 参数。默认情况下,它设置为 240 秒,或者基本上是 4 分钟。所以,你的生成的最大持续时间默认为 4 分钟。但你可以将其设置为其他值。例如,如果你想将其设置为更短,比如 10 秒,那么在你按回车键之前,你可以设置这个额外的参数 d-max audio length ms 并将其设置为例如 10 秒,即 10,000 毫秒。这就是如何设置最大长度。然后我们还有另一个参数叫做 top k。这基本上是通过在每个步骤中从最可能的 k 个选项中采样来控制随机性。所以,如果你想增加或减少随机性,你可以调整这个值。要做到这一点,你只需输入 d-top k 并将其设置为例如 45。你可以看到默认值是 50。然后这里是另一个你可以设置的参数。你还可以设置 temperature,它也调整生成过程的创造性或随机性。所以,更高的 temperature 意味着更多的变化,而更低的 temperature 意味着更少的变化或创造性。默认值是 1,但你可以通过输入 d-temperature 并将其设置为例如 0.8 来手动设置。然后接下来我们还有 cfg scale。所以,如果你熟悉图像或视频生成,那么你应该已经知道这个术语了。CFG 基本上是模型应该多么字面地遵循你的歌词和提示词指令。默认情况下,它设置为 1.5。如果你希望它更字面地遵循你的提示词和歌词,你可以设置一个更高的值,反之亦然。所以,例如,假设你想生成一些 upbeat 舞曲,但它并没有真正生成那种风格。它仍然相当慢而平静。那么你可以尝试增加 cfg,输入 d-cfg scale 并将其设置为例如 2。所以,这些是你都可以指定的额外参数。但对我来说,我将删除所有这些,并向你展示默认设置。然后按回车键等待生成。好的。现在,至少对我来说,这相当慢。所以,这需要大约 10 到 30 分钟,具体取决于歌曲的长度。但之后,你应该在你的 assets 文件夹中看到你的生成内容保存到 output.mpp3 文件中。所以,如果我们打开这个文件夹,你可以在这里看到我们的生成内容。让我们播放其中的前几段。The suns. [音乐] [音乐] The [音乐] coffee part begins to hiss. It is another morning just [音乐] like this. The world keeps spinning round and round. Feet are [音乐] planted on the ground. I find mythy. >> 请注意,如果你生成另一首歌曲,它将覆盖现有的 output.mpp3。所以,如果你真的想保存这首歌,一定要把它复制到别处或重命名为其他名称。否则,它将被覆盖。好的,这就是如何在你的电脑上安装和使用 Heart Moola 无限次。现在,我最后想让你注意的一点是,他们实际上在今天更新了许可证。他们说这个仓库中的所有内容,包括模型权重,都是 Apache 2.0,这很好。这有非常少的限制,这绝对是开源的。所以你甚至可以生成歌曲并用于商业用途。感谢这个团队制作了这个音乐生成器,并从这些大型唱片公司的限制和版权问题中拯救了人工智能音乐。总之,请告诉我你对这个有什么看法,如果你有机会尝试过。你让它做了哪些令人印象深刻的事情?和以前一样,如果你在安装过程中遇到任何问题,欢迎在下面的评论中粘贴确切的错误消息,我会尽力帮助你解决问题。一如既往,我会关注最新的 AI 新闻和工具与你分享。所以,如果你喜欢这个视频,请记得点赞、分享、订阅,并继续关注更多内容。此外,AI 世界每周都有太多事情发生,我不可能在我的 YouTube 频道上涵盖所有内容。所以,为了真正跟上 AI 的最新动态,请务必订阅我的免费每周时事通讯。链接将在下面的描述中。感谢观看,下次再见。