Transcription
欢迎大家来到频道。今天我们将进行一个具有挑战性的内容。我们将使用 Mac 来运行中国 Deep Seek AI 的最新模型,Deep Seek V4。这是我在这段视频中使用的 Mac 配置。如果您觉得这个视频有用,请点赞并订阅频道。我们将目标定为 flash 版本,这是较小的版本。然而,它仍然相当大。所以如果您看它,它大约有 46 个文件,每个文件大约 4 GB。所以那大约是 200 GB。我们发现有一个 llama.cpp 的分支适用于 Deep Seek V4 flash,它使用了一个量化版本,即 IQ2。它实际上是可行的,而且效果很好。所以,因为它是 llama.cpp 分支版本,所以我们基本上只需要克隆这个仓库,然后在 Mac 上进行构建。我将向您展示。我已经做过了。是的,所以您在这里看到的是构建命令。而这实际上是构建过程。实际的构建来自这里。您构建 llama.cpp 的 Deep Seek 分支,然后指定您想要构建的命令应用程序。所以这是一个构建。它实际上非常快。所以很快您就可以开始使用它了。所以现在我们可以像往常一样使用它。所以如果您去仓库,它也会显示如何使用的命令。我们将完全按照那样做。我将打开我的 CPU、我的 GPU 和 RAM。这样您就可以看到实际发生了什么。CPU 在这里,GPU 在这里。这里还有一些细节。RAM 目前是 27.6 GB,大约 22%。所以让我们加载模型,然后我们可以与它聊天。是的,加载速度相当快,对吧?从 22% 飙升到 91%。llama.cpp 显示 7 GB。我认为这是因为它是一个混合的暴露模型。所以它没有显示全部内容,但我认为因为现在一切都在 RAM 中,而且我们没有看到任何交换。所以我认为这是一件好事,因为它表明一切都在 RAM 中,应该会非常非常快。那么,为什么天空是蓝色的?让我们看看实际的生成速度。我认为它相当快。大约我认为每秒 20 到 30 个 token。然后看看 GPU 端,它在 90%、90%、93%、92%。所以它没有使用很多其他东西。所以主要是使用 GPU 进行推理。嗯,好的,CPU 没有出现很多峰值。所以主要是 GPU,我认为这是一件好事。然后生成速度是每秒 28.7 个 token。所以让我们再试一个。那么,Mac 上的 MLX 是什么?它有一个非常简洁的思考部分,对吧?所以它没有做太多。而且生成,如果您看看质量,我认为即使它是量化到 2 位,我认为它仍然可以给出很多合理的答案。所以生成速度是 27.2,提示评估是每秒 200 个 token。所以现在让我们进行基准测试。这是进行基准测试的命令。它使用 llama bench 命令。您指定模型,还指定提示的长度以及生成 token 的数量。我们看到 RAM 从 24% 增加到 88%,GPU 处于满负荷状态,为 99%。利用率在这里是 99%。所以 CPU 没有使用太多。但我们确实看到至少有大约 20%。RAM 保持在 90%。GPU 保持在 99%。所以我们现在看到基准测试结果出来了。我们看到对于提示评估 512,大约是 436。增加到 2000,它下降到 280,增加到 8000,进一步下降到 231。所以我认为这仍然是一个不错的数字。嗯,在文本生成方面,我们测试了其中三个,128、512 和 2048。我们确实看到它从 23.17 稳步下降到 22.28,然后又略微下降。但我认为在 22 这个数字,它仍然是一个非常好的生成数字。MacBook M5 Max 128 GB 可以完美处理。我很高兴它能处理。如果您想看到更多基准测试,请订阅频道。感谢您的观看。请点赞并分享。请订阅频道以获取未来内容。感谢您的支持。再见。