📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Kimi K2 Thinking is CRAZY... (HUGE UPDATE)

Matthew Berman14:31

Transcription

我们可能又将迎来一个 DeepSeek 式的时刻。中国的先锋人工智能公司 Moonshot Labs,刚刚发布了一个完全开源、完全开放权重、达到前沿水平的模型,它在一些最难的基准测试上,表现优于 GPT5,优于 Claude 4.5。让我来为你们详细解析一下。本视频由 Vulture 赞助。稍后会详细介绍。这是 Kimmy K2 Thinking。这是一个能够长时间思考并利用工具进行思考过程的模型,人们已经开始称赞这是一个令人难以置信的模型。我们进行了一些初步测试。视频的最后我会展示给你们看。好了,让我们深入了解细节。它被构建为一个思考代理,在利用工具的同时进行逐步推理,并在人类的终极考试 BrowseComp 以及其他基准测试上取得了最先进的性能。它可以在没有人类干预的情况下执行多达 200 到 300 次连续的工具调用,并能跨越数百个步骤进行连贯推理,以解决最复杂的问题。这是 Moonshot 试图为 Kimmy 系列模型扩展测试时间推理能力所做的努力,他们创造了一个令人难以置信的模型。好了,让我们来看一些基准测试。这是人类的终极考试。这是地球上最难的基准测试之一。看看这个。Kimmy K2 Thinking 的得分是 44.9,而 GPT5 的得分是 41.7。它在人类的终极考试上击败了 GPT5。一个完全开源、完全开放权重的模型,现在比美国的闭源实验室的前沿模型还要好。而 Claude Sonnet 4.5 Thinking 的得分是 32。它在代理浏览和搜索方面也极其出色。事实上,他们甚至在 Kimmy 中内置了一个代理模式,但尚未发布。应该很快就会发布。但看看这个。在 BrowseComp 的代理搜索中得分 60.2,而 GBT 5 为 54.9,Claude Sonnet 4.5 Thinking 仅为 24.1。我们有 Swebench Verified。虽然它在 GBT5 和 Claude Sonnet 4.5 Thinking 中排名最后,但 71 分仍然是一个非常好的分数,而 GBT5 为 74 分,Claude 为 77 分。然后是 Live CodeBench v6,这是一个竞争性编程基准测试,Kimmy K2 为 83.1,GBT 5 为 87,Sonnet 4.5 Thinking 为 64。好了,让我给你们看一个例子。它正在解决一个博士级别的数学问题,并在其思维链中使用了 23 次工具调用。所以,看看这个。我无法解释这里发生了什么,但我只想向你们展示它实际上是如何逐步解决这个问题的。这是问题。现在推理已经完成。我们可以进去,可以看到所有正在发生的疯狂推理,在每一个不同的步骤。向下滚动。我们还可以看到它也进行了网络搜索。例如,双曲正态分布的概率密度函数。它实际上正在寻找参考资料来帮助它解决问题。来回往复。基本上,它在搜索更多信息、推理、搜索更多信息之间不断循环,这真是令人印象深刻。然后,它得到了正确的答案。再次强调,我无法解释如何或为什么,但事实就是如此。当然,它在编码方面也极其出色。Kimmy 团队提供了多个示例。所以,看看这个。一个组件繁多的网站。本质上是一个 Word 克隆。我们可以看到这里我可以删除内容。我们有不同的字体。我们有不同的字号、斜体、粗体、下划线、删除线。所有这些都有效。即使我点击保存,它也会将文档保存到我的本地计算机。接下来,看看这个例子。我们有一个数学解释器,可视化梯度下降。同样,这一切都是通过一个单一的提示完成的。所以,我们实际上可以看到梯度下降的完整可视化。这对我来说将是极好的,因为我使用大量的 B-roll 和大量的解释性视觉内容。所以我一定会关注这一点。这是我过去使用过的一个模型测试。我不知道他们是否看过我的视频,但这基本上是我对之前模型进行的完全相同的测试。看这里。模拟病毒攻击血流中的细胞。正如你们所见,我们有不同的滑块来控制病毒的数量。我们有复制率。我们有病毒的类型,攻击性、隐蔽性和快速复制性,白细胞的数量,白细胞的速度,检测范围等等。所以,非常酷。如果你想运行像 Kimmy K2 Thinking 这样令人难以置信的开源开放权重模型,请查看今天的赞助商 Vulture。Vulture 是世界上最大的独立云提供商,他们一直是我们的绝佳合作伙伴。所以,我真的很兴奋今天再次向你们介绍他们。因此,如果你需要配置 GPU,无论你只是在自己的 AI 项目上进行试验,还是在扩展到生产环境,Vulture 都是你的首选。他们提供最新的 AMD 和 Nvidia GPU,遍布六大洲的 32 个地点,因此你可以获得最低的延迟。他们还提供行业领先的价格性能比,具有极高的可访问性和可靠性。借助 Vulture 全球完全可组合的云基础设施,你可以将应用程序移近用户,并摆脱供应商锁定,这一点我在这个频道上已经谈论了很多。他们还有 Vulture Kubernetes Engine,可以让你扩展到单个容器之外。所以,如果你厌倦了在其他 GPU 提供商那里排队等待,今天就去看看 Vulture。当你访问 getvulture.com/bman 时,他们将为你的前 30 天提供 300 美元的积分。并且请记住使用代码 bur300。再次感谢 Vulture。回到视频。我们还有一个黑胶唱片模拟。按下唱针即可播放。我们有一个像圆形的词语集合。然后我按下唱针,它就开始播放了。它没有声音,这有点奇怪。我以为它会有声音,但它没有。但它看起来仍然非常酷。最后,它允许你使用 Strudel 创作现场音乐,我之前没听说过,但看起来非常酷。所以,Strudel,我相信,是一种允许你创作音乐的编程语言。所以,非常酷的例子。请继续关注,我将在视频稍后向你们展示另一个例子,关于我的团队对 Kimmy K2 运行的测试,我对此感到非常震惊。Kim K2 Thinking 在搜索方面也非常出色,并将搜索信息整合到其思考过程中,然后根据迄今为止学到的所有内容运行后续搜索。在 BrowseComp 这个旨在评估模型在难以找到的真实网络信息上持续浏览、搜索和推理能力的挑战性基准测试中,K2 Thinking 取得了 60.2% 的分数,显著优于人类基线 29.2%。K2 Thinking 可以执行 200 到 300 次连续的工具调用,由长远规划和自适应学习驱动。现在看看 Kimmy K2 被赋予的这个复杂的逻辑问题。以下信息是关于一个在 1860 年至 1890 年之间成立的大学的校友,他是一名大学运动员,后来短暂效力于一支职业美式足球队,并在 2010 年至 2020 年之间上映的一部关于外星人入侵的科幻电影中担任主演,等等。所以,这有点像一个预告片问题。看看它的思考过程。它在推理。它在推理。它进行搜索,继续推理。再次进行搜索,来回往复,直到最终得出 Jimmy Garary Jr.。他们还说 Kimmy K2 在创意写作方面非常出色,但我通常对 AI 在这方面是否出色持怀疑态度。所以,如果你想查看完整的基准测试,它们就在这里。我也会在下面的描述中提供链接。好了,现在,让我给你们一些来自网络上一些人工智能领导者对 Kimmy K2 Thinking 发布的一些反应。好了,首先,Emad My Mystique,直播节目的朋友,Stability AI 的创始人,他说:“祝贺 Kimmy Moonshot 在许多基准测试上取得最先进的性能并开源模型。闭源与开源之间的差距在不断缩小,即使是日益具有经济价值的 token 的成本也在崩溃。K2 有一种独特的氛围,值得一试。”现在,他继续谈论新模型训练的成本。听听这个。基础的 Kimmy K2 模型使用了 280 万小时的 H800 计算时间,处理了 14.8 万亿个 token,大约花费了 560 万到 600 万美元,顺便说一句,想到这些前沿模型训练起来如此便宜,真是令人难以置信。然后他说,推理版本的训练后细节尚未公布,但很可能不超过 20%,不包括数据准备,如果他们有 Blackwell 芯片的访问权限,成本将低于 300 万美元,就能达到最先进的水平。非常有趣的想法。训练前沿模型的成本正在迅速下降。好了,当然,每个人都在想,这与 Deep Seek 相比如何?你敢相信吗,在 2025 年初,我们迎来了 Deepseek 的 R1 时刻,现在在 2025 年底,我们迎来了 Kimmy K2 时刻,两者都是令人难以置信的开源开放权重模型。所以,左边是 DeepSeek R1,拥有 6710 亿参数,而 Kimmy K2 Thinking 是一个万亿参数的模型。词汇量越大越好,129,000 对比 Kimmy K2 Thinking 的 160,000 词汇量。两者都是专家混合模型,Deepseek 有 256 个专家,Kimmy K2 Thinking 有 384 个专家。所以,那里的专家更多。有趣的是,尽管这是一个更大的模型,DeepSeek 在推理过程中有 370 亿参数处于活动状态,而这个新的 Kimmy K2 Thinking 模型在推理过程中有 320 亿参数处于活动状态。所以,更少,更高效,并且它们的上下文长度都为 128,000。感谢 Sebastian Rosa 将这一切整理出来。顺便说一句,如果你想学习使用 Kimmy K2 Thinking 和其他模型,你应该下载《不被取代的微妙艺术》电子书。这本电子书包含 100 个不同的用例,你可以今天就使用 AI 来实现。真实的用例。所以,去看看,下载它,让我知道你的想法。Nathan Lambert,interconnects.ai 的专家,精通所有训练方面的事情,他对 Kimmy K2 Thinking 这样说。他说,早期报告显示它有一种独特的写作风格,这是非常受欢迎的。有趣的是,他说它的上下文长度是 256k。我以为只有 128k,但似乎它实际上可能是 256k,总参数为 320 亿活跃参数。我们刚才已经谈过这个了。我认为他写作的重点以及我一直在思考的问题就在这一部分。中国的崛起。年初的时候,大多数人如果稍微关注人工智能,可能都知道 Zero AI Labs。到了 2025 年底,我认为 Deep Sea、Quen 和 Kimmy 都将成为家喻户晓的名字。它们都有各自的最佳发布季和不同的优势。许多中国公司只用了 6 个月就赶上了开放前沿的性能水平。现在的问题是,它们能否在用户有真实需求的前沿领域提供一些东西。所以,似乎不仅开源开放权重已经赶上了前沿模型,而且它们似乎也正来自中国。我们有一个来自 OpenAI 的开放权重模型,但它不是 GPT5 这样的前沿模型。我们还没有 Meta 的 Llama 的新版本。所以,是的,中国正在大力推动开源开放权重前沿。好了,现在,让我向你们展示我的团队用 Kimmy K2 Thinking 创建的内容。你可以在 kimmy.com 上找到它。分析加纳人口密度与医疗设施可及性之间的关系。下载最新的 World Pop 人口栅格数据和任何开放的医疗设施坐标数据集。计算每个设施周围 10 公里半径内的平均人口密度。对人均设施覆盖率最低的排名前 10 的地区进行排名,并生成一张地图和条形图来比较结果。好了,看看这个。它正在编写一个待办事项列表,这是 OK Computer,这是 Kimmy 的一个特定功能。所以,这就像一个它可以在其中运行的便签本和环境。所以,这简直是超乎想象。所以,它创建了一个完整的待办事项列表。开始勾选待办事项,正如你所见。进行了一些搜索和浏览。看这里。你实际上可以看到浏览过程。所以,它去了 World Pop。点击了各种东西。所有这些都发生了。我们只给了它一个反馈。这部分有点乱,去调试并修复它。看看这个。让我向你们展示最终结果。看这里。记住,这一切都是由 Kimmy K2 Thinking 和一个反馈创建的。所以,医疗可及性。搞定。执行摘要。页面看起来不错。这里有一个交互式地图,你实际上有一个叠加层。它告诉你更多关于医疗设施的信息。记住,它下载了所有这些信息。它刚刚找到的。地区差异。这里有更多交互式图表。看看这个。所有这些不同类型的图表和图形。真是太不可思议了。非常非常令人印象深刻。底部还有更多。请原谅颜色。我只是使用了暗模式。如果我关掉它,看起来会好得多。我们有局限性和后续步骤,数据来源和方法论。你可以下载设施分析、地区覆盖率和服务不足地区的 CSV 文件。再次强调,这一切都是在几分钟内完成的,而且只需要一个提示。非常令人印象深刻。再次感谢 Vulture 赞助本次视频。点击下面的描述链接。让他们知道我推荐了你。尝试令人难以置信的开源模型。再次感谢 Vulture。好了,就是这样。我的团队正在全面测试 Kimmy K2 Thinking 模型。我们很可能会制作一个完整的测试视频。所以,请继续关注。如果你喜欢这个视频,请考虑点赞和订阅。