📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Grok 5 Explained: The Multi-Agent AI Shift Nobody Is Talking About

BitBiasedAI21:08

Transcription

您可能已经看到 Gro 420 刚刚发布,您可能想知道这是否真的是 XAI 所声称的游戏规则改变者,还是仅仅是另一个带有花哨营销的渐进式更新。好吧,我一直在测试发布的版本,并深入研究了技术细节、性能数据以及 Gro 5 将带来的内容。而这正是我感到惊讶的地方。我们看到的不仅仅是模型升级。我们正在见证人工智能从单一大脑响应转向协调的多代理系统。欢迎回到 bitbiased.ai,在这里我们进行研究,这样您就不必加入我们由人工智能爱好者组成的社区,订阅我们免费的每周新闻通讯。点击下方描述中的链接进行订阅。您将获得关键的人工智能新闻工具和学习资源,以保持领先地位。所以,在这个视频中,我将向您展示 Grock 420 的多代理方法与您之前使用过的任何方法有何不同,它上线后实际的现实世界表现如何,以及根据 XAI 的路线图,我们可以期待 Grok 5 带来什么。到最后,您将知道 Grok 420 是否值得切换,以及下一代产品将带来什么。让我们从刚刚发生的变化开始,因为这次发布从根本上改变了这些人工智能系统的工作方式。Grock 420 到底是什么。关于 Gro 420 的事情是这样的。它不仅仅是模型升级。这是 XAI 构建人工智能系统的根本性转变。Grock 420 不是提供一个模型来回答您的问题,而是围绕协调的代理工作流程而设计的。这是一种花哨的说法,意思是它已经从一个大脑转变为一个由专家组成的团队协同工作。这不再是虚幻的承诺或 beta 测试。Groc 420 现已上线并可用。XAI 已将其标准版本和 Gro 420 多代理版本发布到其 API。如果您拥有 API 凭据,今天就可以访问它,并且它已经在生产环境中部署。具体的证据无处不在。XAI 的开发者文档现在显示 Grock 4.20 20 是一个完全可用的模型,具有清晰的定价和功能。多代理变体专门设计用于复杂的、搜索密集型任务,通过协调多个推理过程可以获得更好的结果。以下是重要的性能数据。标记为 Grock 4.20 的模型在 Arena 的公共排行榜上名列前茅。截至目前,它在通用文本排行榜上排名第四,在搜索排行榜上排名第二。这些排名基于真实的人类投票,而不是精心挑选的基准。人们实际上正在实际使用它,并比其他前沿模型更喜欢它。现在,这使得事情变得有趣。与仍在稳定中的 beta 阶段不同,发布的版本已经通过了 XAI 的完整部署流程。他们像 Grock 41 一样进行了静默推出,并进行了持续评估。这意味着您今天访问的模型已经在生产流量上经过了实战检验。XAI 发布了关于每个变体功能的更清晰的定位。标准 Gro Ford 20 针对速度和通用任务进行了优化。多代理变体明确针对需要通过协调推理获得更高可靠性的复杂查询。您为这种协调付费,但您在解决难题方面获得了可衡量的更好结果。多代理革命。那么,多代理对您作为用户来说到底意味着什么?想想您目前如何使用人工智能。您提出一个问题,得到一个答案,也许会提出一个后续问题。这基本上是与一个实体进行的对话。Grock Fort20 的多代理方法更像是拥有一个研究团队。想象一下,您提出了一个需要网络研究和逻辑推理的复杂问题。Grock 420 不是让一个模型试图处理所有事情,而是可以协调多个过程。一个代理处理搜索和检索,另一个代理专注于逻辑检查,第三个代理将所有内容综合成一个连贯的响应。每个代理都发挥其优势,协调器确保它们协同工作。这对于 XAI 来说并非全新的领域。通过 Grock 4,他们已经引入了所谓的 Gro 4 heavy,它使用并行测试时间计算。基本上,它一次考虑多个假设,以提高对棘手问题的可靠性。Gro 420 的多代理框架是该想法的自然演变。以下是这种方法强大的原因。传统的人工智能模型经过一次训练然后部署。它们的所有智能都在训练过程中被固化。但是,通过测试时间计算和多代理系统,您可以通过查询时的额外处理来购买可靠性。模型不仅仅依赖于它在训练中学到的东西。它通过工具和多种视角积极地解决问题。权衡是,每次查询的计算量更多意味着成本更高,响应时间可能更长。这就是 XAI 的定价策略变得非常重要的原因。我们稍后将深入探讨这一点。但首先,您需要了解 Grock 420 实际训练的是什么。训练数据和架构。让我们谈谈我们所知道的以及我们推断的。XAI 没有披露 Gro 420 的确切参数数量、专家混合(mixture of experts)的细节或 Transformer 架构的特定信息。官方的早期访问通知对此技术细节保持沉默,但我们可以根据 XAI 的历史和他们自己的声明做出有根据的猜测。他们公开发布了 Grock 1,这是一个拥有 3140 亿参数的专家混合模型。那是他们较旧一代的基础。从那时起,他们的计算基础设施呈爆炸式增长。他们构建了一个名为 Colossus 的东西,他们声称已达到 200,000 个 GPU,并计划扩展到 100 万个 GPU。这是前沿规模模型所需的计算基础设施。有趣的地方在于这里。埃隆·马斯克曾表示,Gro 5 的参数量将是当前旗舰模型的两倍左右。但问题是,XAI 实际上并未在任何官方规格中公布当前模型的参数数量。但如果我们从已经非常大的模型开始翻倍,并且 Gro 420 被定位为 Gro 4 系列的一部分,我们可能正在寻找一个总参数量在五千亿到三万亿以上之间的模型,特别是如果它使用了专家混合架构。现在,这显然是推测性的,但它是基于 XAI 的先例、他们公开的计算规模以及 Gro 5 的“参数量翻倍”的提示。至于训练数据,XAI 的 Gro 4 模型卡为我们提供了一个蓝图。Gro 4 在混合数据上进行了预训练,其中包括公开可用的互联网数据、第三方数据、用户和承包商数据以及内部生成的数据。所有这些在被使用之前都经过了去重和分类。他们的前沿人工智能框架提到了包含数万亿到数十万亿个 token 的数据集。预训练之后是神奇的。通过人类反馈、可验证奖励和模型评分进行广泛的强化学习,加上用于特定功能的监督微调。除非 XAI 发布 Gro 420 的不同配方,否则可以合理地假设他们将继续这种方法。通过强化学习过程,强调了工具使用、网络搜索、代码执行、对 X 内容的深度搜索。算力经济学。这是大多数人忽略但如果您计划实际使用这些工具,这一点至关重要,那就是成本结构。XAI 的定价表明了廉价快速与强大昂贵之间的巨大鸿沟。他们的 Fast 系列模型每百万输入 token 收费 0.20 美元,每百万输出 token 收费 0.50 美元。对于高容量用例来说,这非常实惠。但他们的旗舰 Gro 4 模型,每百万输入 token 跃升至 3 美元,每百万输出 token 跃升至 15 美元。我们谈论的是输入价格的 15 倍差异,输出价格的 30 倍差异。而且还不止于此。如果您需要长上下文处理,这些价格会再次翻倍。如果您使用服务器端搜索工具,那是在基本 token 成本之上按次收费。如果 Grock Forb 20 多代理版本以我们一直在讨论的协调工作流程启动,您实际上会使您的计算成本翻倍,因为系统会运行多个过程以确保质量。这在实践中意味着什么?这意味着每次查询的能力越来越与每次查询的计算量成正比。对于简单任务,您将希望坚持使用 Fast 模型。对于复杂的、研究性的分析或需要高可靠性的任务,您将为多代理可靠性支付高昂的价格。XAI 对此权衡持开放态度,这实际上令人耳目一新,与一些竞争对手不同,他们将这些成本隐藏在速率限制或节流中。关键是了解您所支付的费用。使用 Grock 420,您支付的不仅仅是一个更大的模型。您支付的是一个能够协调工具、运行多个推理路径并集成实时网络搜索的系统。该基础设施是有成本的,XAI 将其中一部分转嫁给用户,同时补贴其他功能以保持竞争力。安全、护栏和现实世界的混乱。现在,我们需要谈谈安全问题,因为事情变得复杂了。在纸面上,与许多竞争对手相比,XAI 的安全文档异常详细。他们的 Grock 模型卡描述了一个以恶意使用和失控为中心的风险框架。他们将与安全相关的行为分为三个类别。滥用潜力、令人担忧的倾向和双重用途能力。他们记录了针对 CBRN 材料、自残和儿童性虐待材料等高风险类别的安全措施。他们描述了越狱鲁棒性测试和输入过滤。他们的可接受使用政策明确禁止生成真实人物的色情描绘以及儿童的性化或剥削。他们甚至表示,他们会向全国失踪和被剥削儿童中心报告疑似 CSM。那是政策层面。但部署的现实却很混乱。路透社、《The Verge》和其他主要媒体报道了反复出现的现实世界安全故障,特别是在性化图像生成和脱衣编辑方面。这导致了产品限制、监管调查和全球强烈反对。在某些地区,Grock 的图像和视频功能已被禁止或受到严格限制。为什么这对于 Grock 420 和 Gro 5 很重要?因为多代理系统通常会增加工具使用和检索的广度,这可以提高事实性,您从实时来源获取信息,而不仅仅是模型的训练数据。但它也扩大了策略规避、提示注入和内容审核一致性的表面积。如果一个代理在搜索网络,另一个代理在生成图像,第三个代理在综合所有内容,确保它们同时遵守安全策略,这成为一项工程挑战。XAI 自己的框架通过明确提及分级可用性、不同用户群体的不同功能作为部署杠杆来预见到这一点。实际的要点是,如果您是一家考虑将 Grock 用于生产的企业,请考虑图像滥用和内容审核相关的监管风险。技术可能很强大,但治理成本是真实的。如果您是最终用户,请了解可用性可能因地区和政策而异,特别是对于最强大的多模态功能。Grock 5 将带来什么?现在,让我们谈谈下一步,因为 Grock 5 正在积极开发中。我们目前掌握的最新的信息是:Grock 5 计划于 2026 年发布。马斯克已确认,其参数量将是 Grock 420 的两倍左右,并且应该显著更智能、更快,在工具使用、互联网搜索和实时视频理解方面有重大改进。这些信息来自 XAI 自己的路线图沟通和马斯克的公开声明。我们还没有发布模型卡或详细的技术规格。但考虑到 Grock 420 刚刚推出了其多代理架构,我们可以对 Grock 5 的发展方向做出一些有根据的预测。根据 XAI 在 Grock 420 上的轨迹,他们的战略方向很明确。他们正在构建一个三部分堆栈。第一,在海量计算级别上扩展强化学习。第二,原生工具使用,用于网络浏览、代码执行和 X 搜索。第三,多模态交互,具有语音、视觉和视频生成功能。在此背景下,Grock 5 的重点,即视频理解、增强搜索、更好的工具和提高的速度,看起来是合乎逻辑的下一步。目标不仅仅是为了参数数量本身。而是构建一个比那些停留在静态聊天模式的竞争对手更具时效性和可操作性的系统。以下是我们根据 Grock 420 的基础可以合理预期的:推理和工具使用将更加核心,因为 XAI 现在已经证明了多代理方法在生产中是有效的。他们已经围绕工具调用经济学构建了整个 API 基础设施,包括跟踪的推理 token、服务器端搜索工具和加密的推理跟踪。这项投资将加倍投入,而不是被放弃。多模态显然是下一个前沿。XAI 已经将图像和视频生成作为独立功能提供,他们最近的 API 更新表明他们正在努力实现更紧密的集成。Grock 5 可能会比当前模型更好地协调这些多模态子系统,可能将它们纳入使 Grock 420 强大的相同多代理编排框架下。关键问题是效率。如果 Grock 5 使参数量翻倍,同时扩展多模态和工具功能,服务成本可能会飙升,除非 XAI 取得重大的效率突破。这可能来自于更好的专家混合路由、更积极的量化、更智能的缓存策略或利用新的推理硬件。Space X 因素和下一步。2026 年 2 月,路透社报道 SpaceX 以创纪录的交易收购了 XAI。这使得合并后的组织围绕着人工智能加太空的愿景展开,包括关于轨道数据中心和与卫星基础设施更紧密集成。路透社还报道了合并后的重组,为重大的首次公开募股(IPO)和 Gro 5 的开发时间线的领导层变动做准备。这既带来了机遇也带来了挑战。在加速方面,获得了更多的资本、基础设施和分销渠道。想象一下,Grock 与卫星宽带集成,或通过 SpaceX 现有的客户群与企业建立关系。Colossus 计算集群已经拥有 200,000 个 GPU,并计划扩展到 100 万个 GPU,可能会获得更多资源。在挑战方面,合并后的整合总是会带来复杂性。团队需要协调,流程需要合并,治理结构需要建立。对 Grock 安全问题(特别是图像生成方面)的持续监管审查增加了另一层监督,这可能会影响开发时间线。XAI 的过往记录告诉我们,他们将如何推出 Gro 5?对于 Grock 420,他们遵循了与 Gro 4.1 相同的模式,即谨慎的分阶段推出。他们进行了一个静默部署阶段,在此期间他们逐渐扩大生产流量,同时进行持续的盲目评估。他们使用了分级访问,将某些功能限制给受信任的用户和合作伙伴,然后再更广泛地开放。这种方法在其前沿人工智能框架中有明确的记录。他们认为部署是安全的一个杠杆。您不会在第一天就向所有人开放最强大的功能。您会谨慎推出,监控滥用情况,调整您的护栏,并随着信心的增长而扩大访问范围。对于 Gro 5,可以预期类似的模式。可能会有一个针对 API 开发人员和受信任合作伙伴的早期访问阶段。消费者功能可能会分波推出,特别是对于最敏感的多模态功能,并且某些高级功能可能仍被限制在使用级别或验证要求之后。时间线本身仍在演变。2026 年的目标已经确定,但 XAI 尚未确定具体的季度。考虑到 Grock 420 刚刚发布,他们希望收集生产数据,了解实际使用模式,并在将下一款旗舰产品确定为硬截止日期之前,大规模验证其多代理方法。如果资源顺利流动,SpaceX 的整合可能会加速事情,或者它可能会增加复杂性,从而推迟时间线。所以,以下是未来几个月值得关注的方面。第一,随着越来越多的用户将其推向极限,Grock 420 在实际生产环境中的表现如何?Arena 排行榜很有希望,但真正的考验是企业是否能够围绕多代理方法构建可靠的工作流程。第二,XAI 是否会发布关于 Grock 420 的多代理编排在幕后实际如何工作的详细文档?我们需要看到架构细节、代理协调机制以及多代理比单模型推理具有可衡量优势的具体场景。第三,当 Grock 5 今年晚些时候到来时,它是否能实现更好的视频理解和增强的工具使用,同时管理成本与能力之间的权衡?因为参数翻倍并扩展多模态功能可能会使其成本过高,除非 XAI 取得重大的效率突破。人工智能竞赛已经发生了转变。它不再仅仅是参数数量的问题。而是关于谁能够部署强大、安全且经济上可行的多代理系统。Grock 420 代表了 XAI 的一个赌注,即协调的代理工作流程优于单一模型。早期结果令人信服,但我们才刚刚开始看到它如何大规模地发挥作用。如果这次分解帮助您理解了 Gro 420 实际发生了什么变化以及 Gro 5 将带来什么,请在评论中告诉我您是否计划进行测试,还是坚持使用您当前的工具。如果您想要更多能穿透营销噪音的人工智能分析,请订阅。下期再见。