Transcription
在您显卡的统计数据中,有一个数字对于本地人工智能代理来说比其他所有数字加起来都更重要,而且它不是您认为的那个。大多数人构建他们的人工智能计算机的方式与构建游戏 PC 的方式相同。更快的处理器、更大的显卡,就是更多的动力。这正是他们的设置运行得像垃圾的原因。在我以前的生意中,我曾向人们收取过这方面的费用。这让我感到厌恶,所以我不得不辞职。现在,我只是免费教你如何自己动手制作。让我用我能想到的最简单的方式来解释。我们将在这段视频的大部分时间里使用一个类比,所以请跟着我。您的本地人工智能设置就像一个餐厅厨房。显卡,那是您计算机中负责所有繁重数学运算的部分。把它想象成厨师,厨师的手移动的速度有多快,他们能切、炒、摆盘的速度有多快。但是显卡上的内存,称为 VRAM,那就是厨房台面的大小。记住这一点。而这是没有人真正谈论的事情。台面大小比手速更重要。当您在本地运行人工智能时,实际发生的情况是这样的。人工智能模型基本上是一个巨大的食谱。当您看到一个标记为 7B 的模型时,这意味着 70 亿。一个 7 后面跟着九个零。那就是 70 亿个微小的指令,告诉人工智能如何思考。更多的指令,更聪明的人工智能。但也是一个更大的食谱,占用的台面空间越来越多。整个食谱需要在厨师工作时放在台面上。如果放得下,厨师就能全速工作,切菜、摆盘,没有任何浪费的动作。但一旦食谱对台面来说太大了,厨师就必须跑到后面的储藏室去拿食材,那个储藏室就是您计算机的常规内存。我们称之为 RAM 而不是 VRAM。它比 VRAM 慢得多。我们谈论的是从每秒 40 个词的流畅速度下降到每秒两到三个词,这根本无法使用。现在,您可能会想,人们如何将这些巨大的食谱放在普通的台面上?他们使用缩短。他们不写下每一个详细的指令,而是将其压缩。我们称之为 4 位压缩,它就是同一个食谱,只是在一个更小的笔记本里。您可能会丢失一点点细节,但它在 4 位压缩下占用的台面空间要少得多。这里有一份备忘单。一个 70 亿指令的模型需要大约 5 GB 的台面空间。140 亿需要大约 10 GB。320 亿需要大约 20 GB。700 亿需要大约 40 GB。这只是食谱放在那里。厨师甚至还没有开始做饭。当您开始对话时,对话内存就开始增长,对吧?所以,把它想象成厨师做饭时,台面上堆满了 30 道菜。对话越长,堆积的菜就越多,食谱的空间就越少。这就是为什么一个加载得很好的模型仍然会变得非常慢。对话进行 20 分钟后,台面空间就用完了。所以,这里的问题不是我的厨师有多快。真正的问题应该是我的台面有多大,VRAM?那个数字 VRAM 决定了您本地人工智能体验的几乎所有方面。好的,现在您知道了真正的瓶颈,但大多数人仍然在这里犯错。他们选择了合适的台面,然后就偷工减料。他们决定在厨房的其他所有东西上都偷工减料,或者他们只是过度购买,因为某个 Reddit 上的随机帖子告诉他们需要一个 5000 美元的设置。两者都不是真的。我将向您展示在每个预算级别上应该购买什么。所以,这就是大多数人应该开始的地方,而且它的价格比您想象的要实惠得多。这个配置的核心就是一块显卡,RTX 4060Ti,拥有 16GB VRAM,16GB 的台面空间。不是 8GB 版本。那是错误的版本。那是陷阱。8GB 版本在加载真实模型时就会填满。再加上对话,简直是一团糟,对吧?所以,这些东西会立即开始堆积。您至少需要 12 或 16GB。是的,12 或 16GB。我用的是……我想我的就是 16GB。是的,差不多就是这样,您可以构建一个简单的台式机。Ryzen 5 处理器。那是计算机的大脑。对于本地人工智能来说,它的重要性远低于您的想象。但您仍然需要一个不错的。64GB 系统 RAM。那是后面的储藏室。您希望它足够大,以便当东西从台面上掉下来时,有地方可以放,您懂的。现在,一个 2TB NVMe SSD。这就像一个食品储藏室,您所有的模型食谱都存储在那里,然后您再将它们放到台面上。现在,应该有一个不错的电源。那是整个厨房的配电盘,还有一个通风良好的机箱来保持凉爽。所以,总成本总花费大约是 1200 到 1500 美元。当然,那是美元。这实际上能运行什么?它可以非常舒适地运行 70 亿和 80 亿指令的模型。那是您上次视频中我可能看过的量化 80 亿参数模型。所以,您的 DeepSeek Distill 7B,您的 Llama 8B,这些都不是玩具,这些模型可以处理真实的编码助手、文档摘要、私人聊天和轻量级的代理工作流。您也可以在这个配置上运行 140 亿指令的模型,但您会感受到一些权衡。对话更短,在菜肴堆积之前;输出可能更慢,但仍然可用,但您就像在台面的边缘徘徊,在它的尽头。现在,如果您已经在使用 Apple 产品,深入 Apple 生态系统,一台拥有 16GB 统一内存的 MacBook Pro 或 Mac Mini 可以让您进入完全相同的级别。这就是为什么 Apple 与 PC 有点不同。在普通的 PC 上,显卡有自己的台面,计算机在后面有一个单独的储藏室,但在 Mac 上,没有储藏室。它只是一个巨大的台面。图形和主计算机共享相同的内存池。这就是统一内存的意思。所以,Mac 上的 16GB 都是可用的台面空间。但也有权衡。这个级别的 Mac 在原始速度上比专用的 Nvidia 显卡慢一些。但是,您知道,简单性是无与伦比的。下载一个 Llama 模型,几分钟内就可以运行模型。这是任何进行严肃本地工作、编码代理、文档分析、多步人工智能工作流的人的甜蜜点。我认为这里有两个路径。所以,路径一,您可以选择一块拥有 16GB 台面空间的 RTX 4070Ti Super,它的厨师手速比 4060 Ti 快得多。更多的余量,更适合代理式循环,模型可以正确思考、执行,然后再次思考。还有其他路径,我认为这是很多有经验的本地人工智能用户、高级用户会做的选择。您可以购买一个二手的 RTX 3090。等等。它显然是一块旧卡。但正如我告诉您的,当涉及到本地人工智能时,显卡并不真正重要。重要的是 VRAM。重要的是 VRAM。所以,这块旧显卡拥有 24GB VRAM。所以,24GB 的台面空间简直是另一个世界。在 24GB 下,您可以使用缩短的模型运行 320 亿指令的模型,并且仍然有空间进行长时间对话。所以,像 Quant 32B 或 DeepSeek R1 Distilled 32B 这样的模型,还有新的模型。我还没有测试过那些,但这些模型在大多数日常用例中开始可以与云端质量相媲美。其余的配置保持相似。您知道,Ryzen 7 处理器,64GB RAM,2TB SSD。越大越好。但在 Mac 方面,一台拥有 64GB 统一内存的 Mac Mini M4 Pro 也可以达到这个水平。那个大的共享台面意味着您可以加载一个 320 亿指令的模型。并且仍然有空间。速度比 Nvidia 卡慢。但我们说的是多慢?大约每秒 10 到 11 到 12 个词。我们称之为每秒 token 是官方术语。它基本上意味着人工智能每秒吐出多少个词。您知道,当您在 GPT 中输入时,它会生成输出,输出生成的速度。那就是每秒 token。通常,10 到 15 个词感觉就像一个人在快速打字。30 多个词感觉就像即时响应。所以,11 到 12 个词是一个舒适的范围。不是闪电般的速度,但您知道,很舒适。而且 Mac 运行起来很安静。耗电少,运行起来像黄油一样顺畅。现在,下一个。只有当您的工作流程确实需要时,才值得购买。不要因为听起来很酷就买。您必须认真对待。核心是 RTX 4090,拥有 24GB 台面空间,搭配 Ryzen 9 处理器,128GB 系统 RAM,这是一个巨大的储藏室,用于溢出,对吧?还有一个强大的电源。这可以像黄油一样流畅地运行 320 亿指令的模型。快速的厨师,大的台面,长时间的对话,复杂的代理链。您可能还可以尝试使用高度压缩的 700 亿指令模型,但有些事情我还没有亲自做过,所以我不能真正告诉您它是否真的可行,对吧?所以,但我听说它正在工作,但很可能您会将整个台面都铺满食谱页。就像,您可以预期对话长度会有权衡,因为菜肴几乎没有空间了。现在,Apple 的等效产品是 Mac Studio,配备 M3 Ultra 芯片和 96GB 统一内存,96GB 台面。这个东西可以同时加载多个食谱。一个推理模型,一个嵌入模型,一个编码模型,所有这些都同时放在台面上,并且空闲时功耗低于 100W。4090 台式机在负载下会消耗 5 到 10 倍的功耗。还有一件事,您会看到人们谈论 RTX 4090 的配置,拥有 32GB VRAM 和双 GPU 设置,总共 64GB。这些东西确实存在,但我们谈论的是 10000 美元的配置,10000 美元以上。所以,就像我说的那样,这是最高端的消费级显卡,是终极级别。这适合那些真正想训练自己的 AI 模型来做一些事情的人。比如,我不知道你们是否看过最近的 PewDiePie 视频,他在那里训练了自己的 AI 模型六个多月,以跨越……我忘了基准测试的名字了,但他做到了,这很有趣。总之,关于 Raspberry Pi 的快速说明。我喜欢 Pi。我不再使用它了,但过去我曾制作过关于它的视频,但它不是本地人工智能的日常驱动程序。Pi 5 非常适合边缘实验,比如运行 OpenCL 进行沙盒代理执行、计算机视觉项目,或者如果您尝试运行一个真正的语言大语言模型进行聊天或编码,您需要我上面提到的三个级别之一,而不是 Raspberry Pi。Pi 是用于小型项目的车库车间,而上面的级别是用于实际厨房的。如果硬件是等式的一半,那么这就是软件方面。我将保持简洁。所以,要运行模型,目前有两个选项占主导地位。Ollama,这是我使用的。它是一个命令行工具。所以,学习曲线有点高,但它很简单。您输入一个命令,模型就会下载并加载到您的计算机上,然后它就在那里运行。适用于 Mac、Windows 和 Linux。您也可以从他们的网站下载。LM Studio,这是下一个,想法一样,但有一个可视化界面。我所说的可视化界面就像 ChatGPT。那里有一个聊天窗口。所以,如果命令行界面让您感到紧张,您可以从这里开始 LM Studio。这两个都处理模型下载、显卡检测以及在本地提供模型,以便您的其他工具可以与它通信。但据我所记得,这两个的上下文窗口大小不同。现在,这里有一个细节可以为您节省很多挫败感。模型文件有不同的打包格式。把它想象成同一部电影可以是 DVD 或蓝光。内容相同,包装不同,针对不同的播放器进行了优化。有 GGUF。GGUF 是在 Mac 上运行效果最好的格式。AWQ 是为 Nvidia 显卡构建的。如果您使用的是 Mac,只需选择 GGUF。如果您使用的是带有 Nvidia 显卡的 Windows 电脑,您可以考虑 AWQ,因为我听说有一项测试表明,在同一张卡上,它比 GGUF 提供了更快的响应时间和更好的输出质量。所以,大多数人不知道这一点。他们只是随便抓取下载量最多的模型,如果他们为自己的机器使用了错误的格式,他们就会在速度上有所损失。所以,对于代理工作流,您可以将 Ollama 连接到像 LangChain 这样的工具进行自动化,CrewAI 进行多代理设置,或者构建自定义管道,但这将是另一个视频,我以后会讲。我想对您坦诚相待,因为我认为网上大多数人工智能内容都不是本地人工智能代理,它不是云端人工智能封闭式前沿模型的替代品。我指的是 ChatGPT、Claude、Gemini,只是还没有,也许永远不会是所有事情的替代品。最大、最强大、最能推理的模型仍然存在于云端,它们都是美国制造的。当我需要对复杂问题进行前沿思考时,我使用 Claude 或 GPT,这就是事实。但我现在对新的 DeepSeek 4 抱有很高的期望,我不知道什么时候会发布,但希望这次它不会导致股市崩盘。总之,本地人工智能比云端人工智能做得更好的地方在于隐私方面,对吧?您的数据永远不会离开您的机器。没有服务条款,没有对您的提示进行训练,没有对您的秘密进行训练,没有对您的私人生活进行训练,没有 API 日志,成本控制,没有意外账单,这非常重要,没有 token 计量器在运行。您只需为硬件支付一次费用,之后每次对话都是免费的。正常运行时间,也许您的互联网断开了。您的本地模型不在乎。它会继续工作。这就是它的工作方式。一旦下载,它就存在于您的设备中。把它想象成这样。本地人工智能是您的家庭健身房,云端人工智能就像市中心的商业健身房。您的家庭健身房可以处理您 80% 的工作流程。它总是开放的,总是私密的。您永远不必等待器械。但偶尔,您需要重型设备。您可能想做一些硬拉。没问题。您两者都使用。2026 年及以后最智能的设置就是混合式。本地用于日常工作,云端用于重体力劳动,而我刚才展示的配置正是本地规模的起点。所以,我知道您喜欢总结。所以,这是总结。购买台面空间,而不是手速。VRAM 是您需要关注的数字。其他一切都是次要的。预算整个厨房,而不仅仅是厨师。如果您是新手,可以从第一层 1200 到 1500 美元的配置开始。真实,有能力,而且您总是可以稍后升级显卡。太容易了,对吧?所以,如果这有助于您确定配置,为什么不评论一下您打算选择哪个级别?我读每一条评论。如果您想要包含链接的完整零件列表,我会在评论中置顶。感谢观看。再见。