📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

New #1 open source AI model just dropped

AI Search33:45

Transcription

我们有一个新的排名第一的开源模型。它非常智能且性能强大,而且与市面上顶级的闭源模型一样好。所以,在这个视频中,我将介绍你可以用它做的所有很酷的事情,我还会教你如何使用它。此外,我们还将回顾它的规格和性能基准。让我们直接开始吧。感谢 HubSpot 赞助此视频。该模型名为 Z AI 的 GLM5,目前是你可以使用的最佳开源模型。最棒的是,你可以免费试用。所以,只需访问 Z.AI,你就会看到这个聊天界面,就像 Gemini 和 ChatgPT 一样。然后在这里的顶部,你应该能够访问最新的 GLM5。让我们通过一些演示直接开始吧。真正很酷的是它还具有代理功能,可以帮助你完全自主地完成一项非常复杂的、多步骤的任务。它可以进行网络搜索。它可以利用其可用的多种工具,一步一步地执行计划。让我在这里给你看一个快速的例子。让我们为孩子们制作一个有趣的化学教育课程,包含多个课程。包括真实的图像和交互式视觉练习。是的,我们将选择代理,然后按生成。这是我们得到的结果。现在,让我们先回顾一下代理过程。它首先创建一个待办事项列表。所以,首先它需要规划化学课程结构,包含多个儿童友好的课程,然后生成引人入胜的化学图像,然后构建课程和练习,添加交互式视觉练习,然后测试并最终确定应用程序。所以,它正在规划一切,然后继续执行所有这些任务。所以,它已经完成了前两项,现在正在进行这一项。然后它正在沙盒环境中构建所有这些文件,包含所有这些页面。最后,它完成了所有工作,现在正在测试任何问题。然后之后,这是我们的结果。现在,如果你不使用这个代理而使用常规聊天,那么你一次只能创建一个页面。但是有了代理功能,它可以在沙盒环境中创建多个页面。所以,这就是代理的优势。让我们实际看一下。我将点击此按钮在新标签页中打开它。好的,这是第一课。请注意,其他课程已锁定。所以,我需要完成第一课才能继续下一课。我们点击开始。这是第一课的样子。它甚至为我们创建了一些非常漂亮的图像。在这里,如果我点击图像生成步骤,我相信这实际上正在使用 ZI 自有的图像模型,名为 GLM image。所以,这是我从那里得到的。接下来,我们点击开始练习。然后我们必须完成这个测验。所以,让我非常快速地完成它。你可以看到测验有效。此外,一切都非常互动。动画和视觉效果看起来很棒。看看这个非常漂亮的弹出窗口。一切都设计得很好。我们点击下一课。然后这是下一课。我们将学习原子。然后在这里我可以构建自己的原子。所以,让我们构建一个氢原子。我相信我需要添加一个中子,一个电子,然后一个质子。让我们看看是否正确。看起来中子数为零。所以,让我们再试一次。让我们这样做。好的,完美。下一个原子。让我们构建氦。我相信是两个质子,两个电子。正如你所看到的,我化学很差。应该是 2,2,2。好的,下一个原子。让我们构建锂。我不知道这是什么,所以我只是随便点击。我认为是 3,3,3。我的天。顺便说一句,我在高中时化学不及格。总之,我们已经完成了课程。所以,让我们继续下一课。在这里我们将学习元素。正如你所看到的,它生成了一些不错的图像。然而,它是中文的,元素周期表有点乱。让我们开始练习。然后在这里,这是一个元素匹配游戏。所以,我们需要点击每个元素,然后匹配正确的符号。所以我只是非常快速地完成它。氧是 O,金是 AU,碳是 C,钠是 NA。非常好。一切都有效,而且设计得非常好,包括过渡和动画。让我们继续下一课。接下来,我们将学习分子,然后让我们构建水。我相信我们需要两个氢和一个氧。然后我们点击检查分子。这是正确的。下一个分子是盐。等等。让我快速完成它。现在我们将学习物质状态。开始练习。现在我们需要将每个项目分配到正确的状态。所以,铅笔将是固体。岩石是固体。果汁将是液体。你可以看到一切都有效。就像它仅凭一个提示就创建了整个课程一样。我甚至不需要进一步提示它。这就是它的厉害之处。就是这样。好的。好的,继续进行最后一课。现在我们有有趣的化学反应。所以,这是课程。让我们开始练习。让我们随便猜猜。好的。就这样。请注意,在我完成课程后,它还在顶部标记了我的进度,加上课程已完成。所以,你的进度会被跟踪。一切都设计得很漂亮。再次,它仅凭一个提示就创建了所有这些。现在,当然,你可以进一步提示它以添加更多信息和更多课程。但是现在你可以直接提示这个 AI 来为你的孩子或你自己创建教育内容。这可以定制和个性化,让你学得更快。好的,让我开始一个新的聊天。这次我们将再次使用代理。现在我已经让上一版本的 GLM 编写了 Android OS。那太容易了。所以,这次让我们实际测试一下它的创造力。我希望它开发一个比 Android 或 iOS 更好的移动操作系统。在主屏幕上包含八个应用程序。解释你设计的、工作原理以及背后的原理。让我们按生成。这是我们得到的结果。如果我们打开这个代理功能,它首先会创建一个待办事项列表。然后它会遍历这些步骤。所以,第一步是设计和规划这个带有八个独特应用程序的移动操作系统概念。然后它将创建页面。然后它将实现交互式应用程序屏幕和流畅的动画。然后它将记录背后的原理。所以,它首先规划设计,然后编写所有内容,然后现在它正在处理增强和抛光 UI 以及附加功能,在完成后,它正在记录设计原理。所以,让我们先来看一下。这是我们的移动界面看起来的样子。在这里,它在顶部有一个智能摘要。其背后的原理是通知徽章会引起焦虑。相反,我们应该只有一个智能摘要,它提供智能概览,而不是所有这些通知。然后,让我们看看这些应用程序。我们有 Pulse,它基本上像这样跟踪我们的健康状况。非常酷。然后这里说它将 Apple Health 和 Fitbit 结合到一个仪表板中。为什么它更好?这是因为 Android 或 iOS 的健康应用程序是碎片化的。Pulse 提供统一的健康叙述。这包括心率、睡眠、每周活动等。然后我们还有这个 Canvas 功能。这是用来画东西的。好的。然后我们有 Nexus。所以,这就像住在你手机里的聊天机器人。让我们看看它是否真的有效。所以,让我们输入类似“我今天的日程是什么?”之类的内容。好的,这只是一个虚拟界面。它不起作用。但这里说 Nexus 是你的 AI 助手。有点像 Siri 或 Google Assistant。但与这两者不同的是,Nexus 可以跨所有应用程序进行操作,并具有完整的上下文。所以,这有点像 Apple 承诺但从未真正做到的。然后我们还有这个 Flow 功能。这就像统一通信。所以,它将所有消息集中在一个地方,包括短信、电子邮件、电话和社交媒体。所以,我其实很喜欢这个主意。我讨厌必须在不同的平台、应用程序和网站之间切换才能看到来自不同人的通信。但是 Flow 将所有内容统一在一起,我的电子邮件、我的 DM、我的短信等。然后我们还有 Vault,这是隐私和安全。所以,我们点击它。这是我们得到的结果。所以,这里说 iOS 的隐私很好,但 Vault 使其可视化且可操作。然后我们有 Horizon,这是一个智能上下文引擎。所以,这里有今天的天气,然后是今天安排的活动,然后是智能建议。所以,这有点像你今天的议程,我再次觉得这非常有益。然后我们还有这个 Mirror 功能,用于数字健康。所以,你也可以打开这个专注模式来暂停通知。它会跟踪你今天的用量以及你在每个应用程序上花费的时间。然后我们还有这个 Bridge 功能,可以让你无缝连接到其他设备。所以,这有点像 AirDrop 或 iCloud。非常酷。所以,这就是整体设计。当然,我可以进一步提示它来添加更多功能,但总的来说,这是一个相当不错的设计,我确实喜欢它的原理。请在评论中告诉我你的想法。好的。现在,这是两个代理的例子。现在,让我们只使用常规聊天。所以,这应该更快。如果任务不需要多步或长时间思考,你可以使用它。所以,在这里让我们测试它生成准确的物理和照明能力。所以,我们将开发一个实时模拟,将两个金属球悬挂在街道场景之上。允许可调节的参数,例如反射率、粗糙度以及球体的其他材料属性。将所有内容放入一个独立的 HTML 文件中。确保它在普通浏览器上高效加载。让我们按生成。好的。所以,这是它最初给我的,但你可以看到这个背景是假的。它仍然很酷,它能够仅使用基本形状来编写这个城市夜景。但这并不是我想要的。所以,在这里我要求它使用一个公开可用的真实背景。然后之后,这是我得到的结果。但你可以看到我特意要求它生成两个球体,看看球体是否会相互反射,而它并没有。所以我不得不提示它确保球体相互反射。然后之后,这是我的最终结果。所以,让我点击此按钮将其扩展为全屏。好的,这是我们得到的结果。让我们玩一下球体 A。所以,让我们玩一下设置。让我们降低金属度。所以,这就是发生的情况。非常漂亮。然后让我们玩一下粗糙度。所以,这就是发生的情况。所以,这也有效。然后让我们玩一下清漆。这也有效。非常漂亮。然后让我们玩一下清漆粗糙度,它会产生这样的效果。非常漂亮。然后我做了什么?我不知道我做了什么。然后让我们测试一下反射率。反射率也有效。非常漂亮。然后在这里我们可以选择一些预设。所以,让我们把它变成金。这是我们得到的结果。请注意,当我将其更改为黄色时,它在另一个球体上的反射也发生了变化。非常漂亮。然后让我们把它变成铬。这也有效。铜,钛,玻璃,然后黑曜石。现在,而不是这个街景,我也可以把它改成其他背景。所以,让我们试试日落。它有一个非常漂亮的加载屏幕,就像这样。这是我的结果。非常漂亮。然后让我们也试试另一个球体,确保它也有效。所以,让我们玩一下金属度。所以,这也有效。然后粗糙度。这也有效。非常漂亮。清漆。这也有效。然后清漆粗糙度再次对 iOS 有效。然后反射率也有效。非常酷。然后让我们把它变成某种红色。然后你可以看到颜色也应用到了它在这里的反射上。所以,一切都在三个提示中完成。非常漂亮。好的。现在 GLM5 是多模态的。所以,你甚至可以输入不同类型的文档供它分析并以不同格式输出。例如,让我们写“你是一位资深的华尔街分析师。根据这些收益报告,制作一个包含财务、图表、增长预测和建议的多个选项卡的合并电子表格。”然后我将上传这些来自 Google、Nvidia 和 Amazon 的第四季度收益报告。然后我将打开这个代理模式,因为我认为这需要多个步骤。让我们按生成。好的。这是我们得到的结果。现在,由于它在这个侧边窗口中被挤压了,我将下载电子表格并在我的电脑上打开它。所以,首先它给了我们一个不错的执行摘要。我确实检查了所有数字都是正确的。然后这里有一个财务选项卡,正如我指定的,包含大量不同的关键指标,如你在此处看到的。然后这里有一些图表。这是收入和利润率比较,等等,等等。请注意,一切都是可编辑的。我可以移动这些图表。我可以更改数字,因为这是一个 Excel 电子表格。然后这里有一些增长预测和预测。最后,这里有一些建议,包括目标价、上涨潜力、风险等级等。它还为每家公司提供了看涨和看跌案例。它甚至进行了估值指标比较、SWOT 分析。这真的很好。然后对于 Alphabet,它推荐强力买入。请注意,这是 2024 年第四季度。事实上,从那时起,Google 的涨幅非常惊人。所以,总之,你可以轻松地输入任何 PDF 并让它进行分析,并将其转换为文档、电子表格、PowerPoint 演示文稿或其他任何内容。这是一个非常灵活的工具,可以处理不同类型的文件。或者,而不是让它分析财务,让我们让它实际创建一个股票图表查看器。所以,让我们写“创建一个股票价格图表可视化工具,数据来自附件文件。”然后我将附加这个来自 Yahoo Finance 的文件。这些是苹果这些年来所有的价格。然后允许我设置不同的可视化方式,如折线图和蜡烛图。允许我选择一个过去的日期并重播它。添加移动平均线、RSI 和其他指标。这很简单,所以我将只使用聊天然后按发送。好的,这是我得到的结果。现在,这相当紧凑。所以,让我把它在新标签页中展开。让我们玩一下。让我们看看折线图是否有效。所以,它有效。蜡烛图也有效。然后这是移动平均线。它甚至包括像 5、10、20 和 60 天移动平均线,如你在此处看到的。非常漂亮。然后对于指数移动平均线,这也包括在内。非常漂亮。然后我们还有布林带。非常漂亮。然后 RSI 在这里底部。这看起来也很漂亮。然后让我们试试重播。所以,让我们只使用默认的开始日期,然后按播放。所以,正如你所看到的,它确实从那个日期开始播放。非常漂亮。然后我可以暂停它。我可以像这样跳到第二天。这非常互动,而且一切都有效。AI 代理曾经听起来像科幻小说。但在 2026 年,这已经成为现实。如果你一直在听到 AI 代理的各种信息,但不确定它们到底是什么,它们如何工作,或者从哪里开始,这个 playbook 正是你需要的。它被称为 HubSpot 的“AI Agents Unleashed Playbook for 2026 Success”。本指南深入介绍了 AI 代理的真正含义,超越了炒作。不仅仅是聊天机器人,而是能够思考、计划、使用工具并代表你运行多步工作流程的系统。最有用的部分之一是它清楚地解释了聊天机器人和真正代理之间的区别。聊天机器人回答问题,代理接受一个目标并交付一个结果,例如提取分析数据、起草内容并自动安排它。该 playbook 还介绍了 2026 年 AI 代理的现状,它们今天已经擅长什么,以及人类监督仍然重要的地方。它展示了真正的力量不是替代,而是伙伴关系。你将获得跨内容生成、潜在客户生成、客户支持和内部运营的具体的真实用例,特别是对于创作者、独立创始人和小团队。还有一个非常实用的部分是如何开始,包括如何识别适合自动化的低精度任务,如何避免过早地过度设计代理,以及如何负责任地进行人类监督扩展。他们甚至涵盖了人们最常犯的错误,比如过快地过度自动化,以及如何避免这些错误。我最喜欢的部分是关于 AI 代理如何改变职业的未来聚焦部分。与其自己做所有工作,2026 年的获胜技能是成为一名代理协调员。指导 AI 系统,同时你专注于判断、创造力和策略。你可以使用描述中的链接完全免费阅读完整的指南。此资源由 HubSpot 提供,它是此视频的赞助商。好的。接下来,因为它是多模态的,我将上传这张图片,看看它是否能从中创建一个 3D 动画场景。使用单个 HTML 文件。让我们按生成。好的。所以,这是它仅凭一个提示就给我的。这相当不错。然而,它出于某种原因决定将其变成夜晚。然后这里的时间,你可以看到它正在从黎明到早晨到中午变化,但它并没有真正改变光照。所以,这是我们需要修复的。但是,正如你所看到的,樱花和宝塔仅凭一个提示就不是坏事,特别是如果你将其与其他最先进的模型进行比较。有趣的是,它决定给我提供所有中文内容,即使我的提示是完全英文的。但无论如何,接下来我只是添加了“允许我改变一天中的时间,并确保光照确实有效。”所以,这是我从那里得到的。这是中午。让我们改成黎明。非常漂亮。所以,黎明看起来是这样的。然后我可以一直调整到黄昏和夜晚。这是我们得到的结果。非常酷。我可以四处移动。一切都有效。这还不错。当然,宝塔可以做得更好。我可以进一步提示它来添加更多细节到宝塔,并修复上面断开的顶部。但我的意思是,仅凭两个提示,这已经非常好了。好的,这是一个有趣的例子。让我们看看它是否真的能创作音乐。所以,第一步是让我创建一个钢琴卷帘界面,然后我才能让它创作歌曲。所以,让我们写“创建一个钢琴卷帘界面,我可以在时间线上拖放音符,添加播放、暂停和其他设置。将所有内容放入一个独立的 HTML 文件中。确保它在普通浏览器上高效加载。”让我们按运行。这是我仅凭一个提示就得到的结果。所以,让我展开它。这是钢琴卷帘。它已经默认添加了一些内容。所以,让我们播放它。现在,我可以在这里添加其他音符。所以,例如,让我们像这样添加几个音符,仅作为示例。然后我们按播放。好的,它有效。但这并不是这个提示的重点。我想看看它是否真的能自己创作。所以,接下来,我要求它默认显示一个强大而富有表现力的 32 小节钢琴杰作,内容丰富且复杂,捕捉一位钢琴大师的最后一次演奏。让我们看看它会给我们什么。然后之后,让我们展开它,看看它创作了什么。好的,我将在此暂停。它听起来不太好。我猜曲子中有大量的失谐。它不太和谐。听起来就像那个家伙要死了似的。但请在下面的评论中告诉我。这听起来像是一部强大而富有表现力的钢琴杰作,捕捉了一位钢琴大师的最后一次演奏吗?也许这实际上是好的,但它只是比我能感知到的要深奥得多。好的,这是另一个有趣的例子。让我们让它使用这个 plland simplex 噪声创建无限地形图。用户可以共享种子来重现世界。切换生物群落、河流、山脉和气候模拟。让我们按生成,看看它会给我们什么。这有多酷?它仅凭一个提示就构建了这个。我不需要进一步提示它。但这里有这个无限地图,我们可以玩一下。所以,这里只有一个种子。我可以随机播放种子来生成一个完全不同的地图。事实上,让我先全屏显示它,然后玩一下设置。所以,这里有一个种子号。我可以将其设置为另一个随机种子,它会为我生成一个完全不同的地图。非常酷。然后让我们调整这些切换。所以,让我们关闭生物群落。这是我们得到的结果。让我们关闭河流。所以,这移除了河流。让我们关闭山脉,这就得到了那个。然后让我们关闭气候。不确定那是什么意思。所以,我可能可以进一步提示它来修复其中一些问题,但就这样吧。这里有一个无限地图创建器,它仅凭一个提示就制作了。我还可以使用鼠标进行缩放。非常酷。好的。接下来,让我们也看看它是否能编写一些游戏。所以,我将让它创建一个类似于超级马里奥的 2D 平台游戏。让它看起来很棒。将所有内容放入一个独立的 HTML 文件中。使用公开可用的资产、模型和效果来制作游戏。好的,它仅凭一个提示就给了我这个。我实际上甚至不需要进一步提示它。它添加了一些非常酷的功能,比如视差背景、动态天空渐变、程序生成的角色,加上到处都是粒子效果、流畅的物理效果、两种敌人类型,弹跳的史莱姆和带翅膀动画的飞行蝙蝠,踩踏机制。我将尝试在玩游戏时踩踏一些敌人。所以,你可以看到它看起来像什么。它甚至有硬币收集。它有一个生命系统。无限程序生成的关卡。哇。它仅凭一个提示就完成了所有这些。好的,我不需要进一步提示它。所以,让我们按开始游戏。这是我的角色,带着披风。让我们收集一些硬币。所以,硬币收集有效。让我们试着踩踏一个敌人。所以,这也有效。让我试着踩踏一些额外的敌人。好的。接下来,让我试着跳过这个。所以,这也有效。如果我摔倒,我就会死亡,并且会失去上面的一个生命。就这样。这是一个 2D 平台游戏,它仅凭一个提示就创建了。它包含多个敌人和无限关卡,而且一切都有效。它跟踪我的生命。它跟踪我获得的硬币。而且,你知道,甚至背景看起来也很酷,带有视差效果。当然,我可以进一步提示它来让视觉效果更好,为游戏添加更多复杂性。但从一个提示来看,这已经非常好了。这绝对是目前最好的代理编码模型之一。现在,而不是编写酷炫的代码,它还可以帮助你处理日常任务并进行深入研究。所以,例如,让我们给它这个相当棘手的医疗提示。“分析分子性肌营养不良症中肌营养不良蛋白丢失的分子病理学。比较疗法并评估近期试验的长期功能结果。包含漂亮的表格和图表。”这是我仅通过聊天功能得到的结果。所以,它非常简洁明了。这是肌营养不良蛋白丢失的分子病理学。这是所有机制。然后在这里,它给了我一个分子后果的漂亮表格。它充满了信息。接下来,它给了我一个疗法的比较分析。它甚至给了我一个漂亮的流程图,我可以四处移动。然后这里是所有这些治疗方式的比较。它非常彻底,而且信息量很大。好的。然后之后,这是长期功能结果。然后这里有一些关于近期试验的更多数据。现在,这里是另一个图表,但看起来它无法真正编写出来,所以它只是给了我这个图表,但以原始文本格式,就像这样,这很可爱。然后之后,它给了我所有这些近期试验结果的摘要。然后这里是结论和未来展望。所以,它在处理科学和研究相关的提示方面也很出色,我稍后会通过一些基准测试向你展示。好的,最后一个提示。这只是一个有趣的技巧提示,甚至会难倒 GPT。所以,提示是“我需要洗车。最近的洗车场离我家有 50 米。我应该走过去还是开车去?”你知道,有趣的是,对于 ChatGPT,它实际上告诉我走过去。但当然,答案是我应该开车去,因为我需要洗车。但是,如果我将其输入 GLM5,它就能正确回答。它说,“你应该开车去。主要目标是洗车。如果你走过去,你的车仍然脏在车道上。需要有车才能洗。”所以,这总结了我对 GLM5 的一些快速测试。正如你所看到的,这是一个非常强大且有能力模型,GLM 一直是我最喜欢的长期开源模型。它是错误最少的模型。它通常只需一两个提示就能正确完成所有工作。接下来,让我们看看它的规格。所以,与前一个版本 GLM 4.5 相比,GLM5 实际上大了很多。所以,他们将参数数量从 355 增加到 744 亿。所以,它的尺寸增加了一倍多。现在,这是一个混合专家模型。所以,你可以把它想象成一个团队的代理同时协同工作。所以,当你使用它时,在任何给定时间,只有 400 亿参数在这 7440 亿参数中是实际激活和使用的。所以,即使它很大,它也非常高效。现在,这里说他们还集成了 Deepseek 的稀疏注意力机制,这是 Deepseek 推出的,这使得它能够处理非常长的提示或文档,而无需太多计算能力。请注意,GLM5 的上下文窗口为 200,000 个 token。这就像你一次可以将多少信息放入提示中。200,000 个 token 大约是 150,000 个单词。请注意,这与 Claude Opus 的上下文窗口相同,但它不是最大的上下文窗口。例如,Gemini 3 Pro 拥有 100 万个 token 的上下文窗口。这意味着你可以将大约 700,000 个单词放入提示中,而 GLM5 只能放入大约 150,000 个单词。现在,与 Deepseek 类似,除了训练模型之外,他们还在初始训练阶段之后添加了强化学习,以获得更好的效果。对吧?这基本上是从反馈中学习以进一步改进其答案。然而,这种强化学习训练效率很低。所以,他们还开发了一个名为 Slime 的新系统,它基本上加快了强化学习训练速度,使其能够更快地改进。所以,它可以更快地改进。接下来,让我们看看它的性能基准。所以,这里是一些用于对 LLM 进行排名的顶级、最广泛使用的基准。正如你所看到的,GLM5(蓝色条)与顶级闭源模型相当。所以,人类的最后一次考试测试了 NEI 从一些非常晦涩的科学领域回答问题的能力。这些是大多数人不知道答案的问题,但正如你所看到的,GLM5 甚至超越了领先的闭源模型。然后对于 SWEBench,经过验证的多语言和终端基准,这基本上测试了 AI 进行代理编码的能力。正如你所看到的,GLM5 与顶级闭源模型相当。然后这里有一些其他基准供你参考。然后 Browse Comp 是一个测试 AI 浏览网络能力的基准。正如你所看到的,它以相当大的优势超越了其他模型。在这里,我们将 GLM5 与 Claude Opus 4.5 进行头对头比较。正如你所看到的,对于大多数这些任务,它与 Claude Opus 相当。这是另一个非常酷的基准,称为 Vending Bench 2。这是一个用于衡量 AI 模型在模拟自动售货机业务中有效运行多长时间(长达一年)的基准。所以,这测试了 AI 在经营和运营企业方面的能力。它通常会获得一笔余额,例如 500 美元,并且需要通过执行运行企业所需的所有任务来赚取尽可能多的钱,包括管理库存、订购产品、定价策略、财务管理,当然还有大量的其他商业问题解决和决策。但是,正如你所看到的,GLM5 甚至击败了 GBT,并且几乎与 Opus 和 Gemini 3 Pro 一样好。然后这里有一些其他基准供你参考。如果你将其与其他领先的开源模型进行比较,包括 Kim K 2.5,它根本无法相比。就像对于大多数这些基准,GLM5 的性能远远优于 Kim K 2.5,顺便说一句,它才出来,我认为大约两周前。所以我希望你能感受到这种加速。现在,这些只是他们的一些自报基准。让我们看看它在第三方排行榜 Artificial Analysis 中的排名。所以,在这里你可以看到,确实 GLM 目前是排名第一的开源模型,击败了 Kim K 2.5,并且几乎与 GPT 5.2 extra high 以及 Claude Opus 4.6 一样好。它只差三分,甚至击败了 Gemini 3 Pro high。所以,对于一个开源模型来说,这令人难以置信。现在,我认为更具吸引力的是价格。所以,以这种智能水平,它实际上非常便宜。请注意,Gemini 的价格是三倍多。GPT 也是如此。Gro 4 更贵,而 Claude Opus 会让你破产。所以,我的意思是,就效率而言,GLM5 是性价比最高的。而且,你知道,这实际上是 GLM5 最棒的功能,我还没有听到任何人谈论过。它是所有模型中幻觉率最低的。所以,这里是 Artificial Analysis 的全知幻觉率。分数越低越好。这意味着它产生的幻觉越少。所以,正如你所看到的,GLM5 在所有这些模型中,幻觉率是最低的。你可以看到像 GPT 5.2 或 Claude Opus 的数量是这个数量的两倍多,这意味着它产生的幻觉要多得多。现在,请注意,34% 的意思是它在该基准测试中答错了 34% 的问题。这并不意味着它在使用时有 34% 的时间产生幻觉。所以,我认为这实际上是 GLM5 最强大的功能。如果你需要处理非常事实准确的信息,例如法律或医学研究,这尤其有用。好的,最后让我们看看在哪里可以使用它。就像我说的,GLM5 目前可以在 ZI 的聊天平台上免费试用。当然,他们已经开源了。所以,如果你点击 Hugging Face,模型已经出来了。然而,请注意,它的尺寸约为 1.5 TB。所以,不,你无法在消费级硬件上运行它,但它主要面向那些真正关心数据安全和隐私并在本地运行 AI 的企业。这一点尤其重要,因为如果你使用任何闭源专有模型,如 GPT 或 Claude 或其他任何模型,你所有的聊天都会发送到他们的服务器。所以,他们可能可以访问你的所有信息。这就是开源的力量,你可以私下本地运行它。现在,如果你可以运行它并且对此感兴趣,那么在他们的 GitHub 上包含了如何下载和本地运行它的所有说明。现在,除了这个,你还可以订阅使用 GLM,通过他们自己的 API,这实际上非常便宜。最便宜的计划是每季度仅 27 美元。所以,这相当于每月 9 美元,比 Claude 便宜得多。请注意,对于 API 使用,目前他们正在逐步向编码计划订阅者推出,但之后你就可以在所有这些编码代理中使用它,包括 Claude Code。对于那些不知道的人来说,你实际上不需要在 Claude Code 中使用 Claude。你可以切换到一个便宜得多的模型,然后它也支持 Openclaw,这是一个在你的电脑上 24/7 运行的代理。如果你不熟悉 Openclaw,请看这个视频。总之,这就是我对 GLM5 的评测。它目前是我最喜欢的开源模型。它在编写代码方面非常出色,而且错误最少。此外,它的幻觉率是所有模型中最低的。我个人在 Claude Code 和 OpenClaw 中使用 GLM。总之,请告诉我你的想法。如果你有机会自己玩过 GLM5,你到目前为止对它的感觉如何?一如既往,我将密切关注顶级 AI 新闻和工具与你分享。所以,如果你喜欢这个视频,请记住点赞、分享、订阅,并继续关注更多内容。此外,AI 世界每周都有太多事情发生。我不可能在我的 YouTube 频道上涵盖所有内容。所以,要真正跟上 AI 的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中。感谢观看,下次再见。