📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Chinas New AI Kimi K2.5 Shocks DeepSeek and Silicon Valley Labs

AI Revolution12:41

Transcription

[音乐] Moonshot 推出了 Kimmy K 2.5,在视觉和工具使用方面进行了重大升级。阿里巴巴推出了 Quen 3 Max Thinking,专为长上下文推理和代理式工作流程而设计。Anthropic 将 Claude 打造成了一个实时工作空间,聊天中集成了 Slack 和 Figma 等应用程序。微软开始在 Copilot 中测试个性化控制和记忆更新。Google 将 AI Studio 直接连接到 Firebase,用于构建真正的应用程序。>> [音乐] >> XAI 似乎正在 Grok 中准备深度模型控制功能。AI 模型领域发生了很多变化。那么,让我们开始吧。好的,让我们从那个真正点燃导火索的开始。Kimmy K 2.5 的出现,就像大多数严肃的软件更新一样,悄无声息地出现,然后每个人都开始谈论,因为一旦使用,变化就显而易见了。人们打开 kimmy.com,开始了一个正常的会话,模型的行为感觉不同了。语调更紧凑了,推理更清晰了,思考模式的响应开始看起来更有内部纪律性。然后用户注意到了一个更大的变化。他们用于 K2 的界面基本上在他们不知情的情况下切换了。就像 K2.5 通过一个低调的推出推送到 Web 应用程序中一样。这种推出方式实际上是通过现有界面进行的静默推送,这使得团队能够立即获得大规模的真实世界测试。你可以获得数百万个来自真实人类的提示,他们正在进行实际工作。这是一种非常现代的策略。发布,观察数据,快速修补,保持势头。现在,K 2.5 的核心是双重升级。原生视觉加上原生工具使用。这里的“原生”一词很有趣,因为许多产品声称具有多模态能力,但实际上提供的更接近于图像字幕。K2.5 更像是图像理解,并且与推理保持连接。就像一个强大的文本模型在长提示中保持其逻辑连接一样。人们立即开始上传图像。而且不是那种简单的图像。电视场景中的平面图,公寓布局,带有奇怪角度的室内截图,复杂的图表,带有多个元素的混乱视觉布局。然后他们要求开发人员真正关心的输出,例如可以转化为场景的结构化空间描述,甚至可以与 3D 工作流程对齐的格式。一个流行的压力测试是“获取此布局并帮助我将其转化为 3D 模型规范,输出目标是 3.js 管道。”这项任务迫使模型做的不仅仅是描述。它必须解释,保留关系,并以结构化的 [音乐] 方式表达这些关系。你可以感受到它在跟踪空间方面的差异。当你给它一个布局时,它倾向于保持一个连贯的内部地图,房间的邻接关系,门和开口,家具的聚集位置,走廊如何连接空间,哪些边界看起来像墙壁。即使图像不完美,透视有问题,或者绘图粗糙,它通常也会在整个响应中保持相同的故事。这表明模型的视觉特征更深入地融合到推理层中。因此,视觉标记实际上会影响规划和结构,而不是在开始时被转换为一次性描述。然后是升级的第二部分,这也是它开始感觉更接近代理的地方。K2.5 中的工具使用看起来更具目的性。对于硬提示,它的行为就像它期望一个过程。它将事情分解成连贯的步骤。然后,它将工具用作流程的一部分。在数学和逻辑方面,你会看到更多的中间检查。在编程方面,你会看到更少的遗漏,更少的缺失部分,更少的答案感觉依赖于用户来填补其余部分。因此,编码能力基本上是目前的记分牌。开发人员用多步任务、重构、调试、将 [音乐] 规范转换为工作代码、生成脚本、生成配置、构建其他系统可以使用的结构化输出来压力测试模型。K2.5 在这方面变得更强大,将 Kimmy 从一个听起来很聪明的聊天机器人变成了一个真正能工作的助手。早期反馈反映了这一点。人们描述它能够快速通过 [音乐] 编码测试,在更长的提示下保持稳定,并处理更复杂的指令而不会陷入矛盾。现在有趣的部分是视觉升级和工具升级如何相互乘数。一个仅视觉模型可以描述你的截图。一个仅工具模型可以在你告诉它屏幕显示什么时编写代码。K 2.5 可以执行组合工作流程。查看图像,提取结构,然后基于该结构生成代码或结构化计划。这种组合正是当前 AI 平台正在努力的方向,因为它将模型变成了混乱的真实世界输入和清晰的机器可读输出之间的桥梁。Moonshot 处于中国 AI 的冲刺阶段,发布时间被视为象棋般的策略。Deepseek 一直在暗示重大发布。Zeepoo 和 Minimax 等竞争对手不断推出更新。每个人都在试图率先实现下一个模型飞跃,因为早期访问可以捕获开发者的心智份额。如果开发者围绕你的模型构建工作流程,你就会成为他们技术栈中的默认工具。K 2.5 的到来,尤其是在平稳的 Web 推出中,将 Moonshot 置于这个早期捕获窗口中。还有 Moonshot 的投资者和融资方面。关于该公司的报道谈到了巨额融资和数十亿美元的估值,而这个背景很重要,因为它解释了他们如何能够以这种速度持续推出升级。这个市场奖励那些能够扩展训练、扩展推理,并在模型在底层演进时保持产品表面稳定的团队。这需要真金白银。现在,Moonshot 有阿里巴巴的支持,而阿里巴巴正在 AI 领域进行一场双线作战。一条战线是支持 Moonshot 和 Kimmy 作为中国消费者和开发者领域的重要竞争对手。另一条战线是扩展 Quen,将其作为第一方模型家族,直接集成到阿里巴巴的云产品中。新发布的 Quen 3 Max Thinking 是第二条战线的完美典范。该模型被定位为旗舰推理系统,专注于硬数学、复杂代码和多步代理工作流程。它在 Quen Chat 中可用,并通过阿里巴巴云的模型工作室进行集成,这准确地告诉你它的目标受众是谁。开发者和企业构建应用程序、管道和代理。立即引人注目的规格是长上下文窗口。在模型工作室中,Quen 3 Max 系列被描述为具有 262,144 个 token 的上下文窗口。这个数字改变了人们尝试做的事情。你可以输入长需求、长代码库、大量文档,并让模型保持在整个上下文的锚定状态,而不是强迫它根据片段猜测。长上下文将推理模型变成更接近审查引擎的东西。它可以扫描一个巨大的提示,提取相关部分,然后逐步工作。另一个关键细节是快照发布风格,带有 Quen 3 Max 2026123 等标签。版本快照在生产中很重要,因为团队需要可重现性。他们希望将系统固定到已知的模型行为,以便工作流程每周保持稳定。在该快照中,思考和非思考能力被描述为合并到一个模型中,并带有用于精确度重要的审慎运行的模式切换。在思考模式下,Quen 3 Max Thinking 可以在推理过程中插入工具调用,并内置网页搜索、网页提取和代码解释器。这非常重要,因为它将模型变成了一个工具协调器。它可以收集证据,解析内容,运行计算,然后继续使用输出进行推理。这正是整个行业正在努力的方向,因为它提高了在正确性比速度更重要的任务上的可靠性。现在,虽然阿里巴巴和 Moonshot 在模型层面上有所行动,但 Anthropic 在工作流程层面上正在大力推进。Claude 现在支持聊天中的交互式 MCP 应用程序。最大的变化是交互性。人们可以连接 Asana、Slack、Figma 和 Box 等工具,然后在对话中与实时工具内容进行交互。这意味着项目时间表可以作为真实的 Asana 工件出现在聊天流程中。Slack 消息可以带有格式进行起草,然后通过工具发送。可以在 Figma 中创建和编辑图表,同时用户保持在对话中。文件可以在 Box 中管理,而无需持续的复制粘贴。这是那些听起来像集成但改变了整个用户体验的升级之一,因为助手变成了工作空间表面。而不是一个 AI 发出指令,你将其在其他地方执行,而是 AI 与你团队已经使用的相同工具进行实时协作。MCP 角度也很重要,因为它是一个开放标准的游戏。开放协议创造生态系统。当工具连接标准开放时,开发者可以一次构建,并在不同平台之间更轻松地连接。企业关心这一点,因为他们运行着一个混乱的应用程序堆栈,[音乐] 他们想要互操作性。他们想要能够经受平台转移和供应商变更的工具集成。 [音乐] Anthropic 倾向于 MCP 也预示着更广泛的行业方向。AI 助手正在成为坐在工具之上的接口层,而不是存在于工作之外的侧边聊天窗口。现在微软也在行动,只是节奏不同。Copilot 正在通过个性化选择器和标记为“个性化工作室”的记忆管理参考来测试更多自定义功能。用户界面显示一个选择器,类似于人们已经认识到的样式选项,例如简洁设置。推出看起来是分阶段的,选择器可见,而更广泛的控件仍然有限。记忆管理更新也表明微软正试图将个性化统一到一个连贯的设置表面。就像其他助手已经将偏好和记忆视为一个类别一样。还有一个模型访问分割。大部分 Copilot 用户仍然使用较旧的底层模型版本,一小部分用户可以访问较新的版本。这很重要,因为用户感知遵循中位数体验。微软可以推出新的 UI 功能,但产品的声誉仍然由大多数用户实际看到的日常体验所塑造。然而,自定义工作表明了长期的意图,因为一旦存在个性化和记忆控制,Copilot [音乐] 就可以朝着更一致的用户定制行为发展。Google 的举动解决了另一个痛点,这是每个 AI 应用团队都能立即识别的痛点,即将一个酷炫的模型演示转化为一个带有身份验证和数据的真实应用程序。AI Studio 正在显示与 Firebase 更深层次集成的迹象,包括原生数据库支持和通过 Firebase 进行的身份验证设置。Firebase 已经处理了开发人员喜欢的实时数据库和身份验证工作流程,因为设置速度快且心智负担低。将其连接到 AI Studio 意味着从“我构建了一个模型交互”到“我部署了一个具有用户和持久数据的安全应用程序”的路径缩短了。你可以将此理解为 Google 将 AI Studio 从一个游乐场推向一个真正的构建环境。当数据变得更容易时,团队的发布速度会更快。产品经理可以原型化需要用户帐户和保存状态的功能,而无需为每次迭代都引入单独的基础设施团队。即使是小的 UI 提示在这里也很重要,比如一个看起来更像 Firebase 的构建界面,以及出现的斜杠命令支持。斜杠命令听起来很小,但它们可以加快工作流程,尤其是在复杂的项目中,快速插入组件可以节省时间并保持专注。然后是 XAI。这个感觉就像有人把门半开着,人们瞥见了里面。Grok 的 Web 界面中出现了一个开发模型功能。细节表明了高级模型配置管理,选择模型配置,搜索模型名称,收藏首选模型,然后是一个覆盖菜单,用户可以在其中指定自定义模型名称、描述、地址,并调整系统和开发者提示,包括工具调用设置和基础模型更改。这是企业和政府客户不断要求的控制界面,因为它允许治理和行为调整。它也可能仅限于内部使用,因为这些面板通常在到达客户之前就存在于平台运营商。无论哪种情况,UI 的存在都告诉你 XAI 正在构建企业控制层,这种控制层使得模型平台可以在受监管的环境中使用。好了,在评论区留下你的看法。如果你喜欢这个分解并想要更多这样的深度分析,请点击喜欢按钮并订阅,这样你就不会错过下一个。感谢观看,下次再见。