📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Kimi K2 is the best model ever (kind of…)

Theo - t3․gg24:10

Transcription

很久没有出现一个值得关注的新开源模型了。而 Moonshot 正在烹饪的东西,确实值得关注。

就我所见,这是有史以来最好的工具调用模型。是的,不是仅仅是开源模型,而是所有模型。它在人类的最后一次考试中表现出色,获得了最先进的分数,在浏览器兼容性方面也表现优异。在代码方面,它与 GPT5 和 Sonnet 4.5 等其他优秀模型不相上下,例如 SWE bench 验证、实时代码基准测试等。

这个模型简直是疯了。它能够在没有人为干预的情况下连续进行 200 到 300 次工具调用。这太酷了。考虑到这是一个开源模型,有很多乐趣可言。

这一切都有其代价,尤其是开源部分。请务必继续关注,直到我谈论他们正在进行的许可事宜,这确实是其中一个较大的代价。但天哪,我很久没有对一个新模型发布感到如此兴奋了。在过去的两天里,我一直在玩它。我一直在关注所有其他报道以及其他人如何使用它。Moonshot 确实为我提供了测试模型的积分,但我选择自己花钱,因为我宁愿他们不付钱给我,即使我只是用免费积分来报道他们的东西。

本视频中没有一个人付钱给我,除了今天的赞助商。今天的赞助商是 Tupil。在 Ben 上进行结对编程的最佳方式。我正在尝试拍摄广告。我需要控制我的电脑。我们现在实际上正在使用 Tupil,这使得 Ben 不仅可以……但 Ben,我正在尝试拍摄广告。

说真的,这太酷了。我们刚刚玩了很久。而且你与同事互动的程度,即使只是坐在同一个沙发上,也令人难以置信。他可以在我的电脑上做任何他想做的事情。不,Ben,停下。我们都在同时使用它。这是一个我安装的简单应用程序,现在我们可以真正协作了。Ben,别再试图把钱转到你的银行账户了。我给你的已经够多了。

我们之前和 Cursor 一起使用过它。而且我能够点击按钮,还能在屏幕上绘图、指向事物,并与我的同事交谈,这真的很酷。我一直需要这样的东西。我一直是结对编程的忠实粉丝,但它的工具却不够多。别再在 Zoom 和 Slack 上共享屏幕了,当你可以使用一个真正为我们开发者协作和共同工作而构建的东西时。

当我们之前玩这个的时候,我印象深刻,我甚至掏出了手机,谈论了一会儿。所以,我们刚刚为你们现在可能正在观看的广告测试了 Tupil。

>> 我们都可以说,这有点奇怪但很酷,对吧?

>> 是的。

>> 就像,我将要使用这个。

>> 看看这个,伙计们。说真的,

>> 我们没有使用拼写。我没有。

>> 好的。可能是 Python。

说真的,如果你想和你的同事开玩笑,同时获得更好的配对体验,Tupil 让我惊叹不已。立即访问 slidv.link/tupil 查看他们,并在结账时使用代码 Theo,即可享受前 3 个月 90% 的折扣。

那么,关于 Kimmy K2 Thinking,我们需要知道什么?显然,这是他们之前发布的模型的思考版本。而且它确实非常庞大,无论是它可能产生的巨大影响,还是模型本身的荒谬大小。

如果我们看看 Hugging Face 上的权重,你会发现这个模型的大小有些荒谬。模型有 594GB。它有万亿个参数,这使其成为有史以来最大的开源模型。它是 INT4 量化的,这应该使其易于运行,但它也有万亿个参数和 590GB,这将使其运行起来更加困难。

目前,我所见过的唯一运行它的人是 Moonshot 的 Kimmy 团队自己。是的,看看 Open Router,现在只有 Moonshot 是托管方。他们已经拆分了托管方,他们有一个标准的版本,价格相对合理,每百万输入 60 美分,每百万输出 250 美分,但只有 18 TPS。而且我见过它甚至更低。还有一个 Turbo 版本,价格要贵得多。输入价格几乎翻倍,每百万输入 1.15 美元,输出价格几乎翻 4 倍,每百万输出 8 美元。但你也能获得 85 TPS。

对于快速版本,价格与 GPT5 相似。但慢速版本比 GPT5 还要慢。老实说,现在回想起来,将它与 GPT5 进行比较很有趣,因为它表现相似。在很多方面,这确实是一场势均力敌的比赛,但 OpenAI 的 GPT5 版本是 30T TPS,他们还有一个 Turbo 版本可供选择,我甚至认为这里没有提供。是的,他们这里没有。我知道有一种方法可以实现更快的 GPT5。我还没有怎么玩过,但这种拆分让人想起 OpenAI。这里的相似性太搞笑了。感觉更像是 Moonshot 在试图成为 OpenAI。Deepseek 和某种程度上的 GLM 正在试图成为 Claude 和 Claude Code 类型 Anthropic 的竞争者,然后是 Minimax,它只是在这里做得风生水起。我确实需要更多地谈论 Minimax 模型,但 Kimmy K2 Thinking 是我们今天要谈论的,而且有很多充分的理由。

当你看看基准测试时,这简直是疯了。根据 Artificial Analysis 的说法,它是领先的开源模型。而当你看看 Artificial Analysis 时,他们第二高的模型竟然是一个开源模型,这简直太疯狂了。诚然,他们的智能指数不是最好的基准测试,但它是一个你可以从中获得价值的真实测试。看到它能达到这个水平真是令人难以置信。

但是速度简直是垃圾。所以,制衡。另一个关于运行情况很糟糕的事情是它使用了多少个 token。它在 Artificial Analysis 的智能指数中使用了最多的 token 数量,1.4 亿个 token。真是太疯狂了。它太需要 token 了。这真的让我想起了 Grok 4,它混乱地过度 token 化事物。就像 token 通货膨胀是真实的。这些模型在推理方面越聪明,它们就越会做 [ __ ] 这样的事情。而且你会看到推理 token 和非推理 token 的比例看起来不太好。而 1.3 亿个推理 token 是荒谬的。

作为比较,GPT5 在高模式下,也就是在你说让它进行更多推理的模式下,它使用 8200 万个推理 token,略多于一半。相比之下,4.5 Sonnet 只使用 3400 万个。一般来说,我发现 Claude 模型在过度推理方面不像其他一些选项那样糟糕。而且,与许多大型实验室不同,它们会向你提供所有的推理数据。所以,给 Anthropic 点赞。其他所有人都对他们的推理进行了混淆。显然,开源模型你不能这样做。所以,它们没有。

但是,当我们将 token 使用量与成本进行比较时,事情就变得更有趣了。GBT5 突然变得更进一步,因为它每个 token 都很昂贵。虽然不像许多其他模型那样昂贵,但足够昂贵,可以将其推到前面。Cloud 4.5 Sonnet 也是如此。尽管使用的 token 数量少了一半,但它仍然是第五贵的选项。Grok 4 总是花费太多钱并给出无稽之谈答案的王者。保持优雅,Elon。

那么,我们的新模型在哪里?哦,在这里。Kimmy K2 Thinking 只需 380 美元。所以价格与 Claude 4.5 Haiku 相当,尽管它在这个基准测试中表现出色,但根据我的观察,在代码方面却不如它好。我之前尝试使用 Kilo Code 进行编码,它为我的图像生成测试生成了一堆文件,我喜欢制作的那个虚构图像工作室,以查看模型如何处理 UI。

这是它使用 Nex.js, JS 时的样子。你可能会认出这个页面,因为这是实际启动一个 next 项目的默认页面,因为它实际上没有触碰那个文件。它没有将创建的组件挂载到任何地方。所以,我实际上看不到它。所以,让我们提醒它必须这样做。你需要实际渲染你在主页上制作的组件。哈哈。它触碰了布局,触碰了 CSS。它做了很多小事情,然后实际上并没有将组件放在页面上。

这绝对不是我见过的最好的编码模型,尤其是在实际实现细节方面。也有些慢。我记得第一次请求花了大约 10 分钟。不过很便宜。只花了 0.5 美分。当你看到它在思考时,你会看到它在……它在努力。它在移动。它实际上比以前慢了很多。他们注意到他们遇到了性能问题,并且 Open Router 正在显示问题有多糟糕。

情节的转折是,导致问题的不是他们的 GPU 数量。而是 IP 带宽。所以,当它生成时,我想谈谈模型做的其他事情。Moonshot 团队非常重视写作质量,这有点疯狂,考虑到这是一个总部设在中国的团队,而他们却在优化英语写作的质量和一致性。我很好奇那会是什么样子。所以,我给了一个有趣的测试提示,要求它写一篇引人注目的 Java 编程语言辩护,以解决人们讨厌它的主要问题。它思考了一会儿。它生成了一个结果。它以大约 12 TPS 的速度完成,而且读起来确实不错。

Theo,说实话。Java 是每个人都爱恨的语言。它是科技界的宠儿,企业软件的幽灵,开发者喜欢开玩笑的冗长样板工厂。但事实是。大多数仇恨都源于一个已经存在了十年的 Java 版本。现代 Java 是一个隐秘的强大力量,而批评越来越过时。让我直接解决主要的担忧。

极其冗长。旧现实,新现代现实代码示例。就是这样。一行记录给了我们不可变的数据类,自动包含构造函数、equals、hash code 和 to string。添加模式匹配,它甚至更优雅。

好吧,这实际上有点不错。别告诉我这个模型说服了我用 Java。

作为比较,我用 GPT5 和 Sonnet 运行了相同的提示,并进行了推理。你会注意到的第一件事是,我们陷入了项目符号和列表的地狱。GBT5 喜欢列表,但 Sonnet 在写作方面历史上一直更好。不。全是 [ __ ] 列表。

为什么一个中国模型能比美国公司制作的类似模型更具说服力地写英语?这有点疯狂。Java 受到很多批评,但大多数批评都源于过时的看法或对其设计理念的误解。这就是为什么 Java 值得更多尊重。它太冗长了,但冗长是有价值的。是的,Java 很冗长,但冗长实际上是清晰的。不,我们……这不是一个好的辩护,而且有大量的项目符号。Java 很慢。欢迎来到 2024 年。这种批评停留在 2004 年。Hotspot JVM 是性能的奇迹。

相比之下,简直是令人 cringe。这里有一个坦率的 Java 辩护,它解决了有用的抱怨。简短的版本是,你想象中的 Java 是 2005 年的 Java。人们今天实际交付和运行的 Java 是快速、现代、安全,并且是为期望代码能使用十年的团队设计的。这不好。

这有点奇怪,但我认为 Kimmy K2 将成为我 T3 Chat 上的默认模型一段时间了。说到这个,如果你想访问每一个模型,包括新的 Mini Max M2 版本,Polaris Alpha,这是一个有趣的隐身模型,以及新的 Kimmy K2 Thinking,并启用了 Turbo 选项。每月八美元,我有个坏消息,因为现在第一个月只需一美元。结账时使用代码 Kimmy K2,你第一个月只需一美元。立即访问 T3 Chat 查看。我们在这个应用程序上付出了很多努力。

好的,代码完成了。让我们看看它现在看起来怎么样。是的,它……我不会说它看起来很好,但它看起来……我有很多朋友告诉我 Kimmy 模型擅长 UI。我将称他们为骗子。太糟糕了。你看到那个吗?那个标题在那里弹出。哦,天哪,不。

但是代码不仅仅是写代码。而且我听说用这个模型作为规划模型有很好的评价。使用 Kilo 等工具,你可以设置一个架构师,甚至可以设置多个模型来完成不同的部分,这很有趣。这是我将来肯定想更多地尝试的东西,我知道像 AI Code King 这样的其他创作者正在大力投入其中。

让我们从他的视频中截取一段。GPT5 Codeex 作为我的规划模型。更大的模型有其自身的优势。在我的测试中,你获得的性能与 GPT5 Codeex 非常相似。我经常使用 GPT5 Codeex 进行规划。它是调试和规划的最佳模型。根据我的初步测试,似乎我可以用 Kimmy 替换 GPT5 Codeex 作为我的规划模型。更大的模型有其自身的优势。它们非常擅长调试,因为它们经过训练,能够理解大量错误意味着什么以及如何修复它们。它们通常很快。Code King 关于该模型的视频非常好,并且肯定帮助我为自己报道它做好了准备。如果你想深入了解它在各种代码任务中的表现,一定要去看看他的视频。非常好的东西。

还有一件事是,我只是很好奇。我运行了这个针对 Skatebench 的测试,因为如果它擅长写作、思考和英语,它应该擅长这个,对吧?它得到了 60%,这是一个相当不错的分数。它是迄今为止最好的命名滑板技巧的开源模型。Deepseek 出奇地好。我主要看到中国模型在这方面非常糟糕。事实上,有许多研究人员联系了我,因为像 Quen 和 GLM 这样的模型在这方面表现非常差,在我分享基准测试本身的细节之前。很多人想看到它,因为它很难衡量这个差距。在大多数基准测试中,Quen 和 GLM 只是基准测试并获胜,即使使用它们很糟糕。这是少数几个他们说清楚了这些模型之间存在区别的基准测试之一,这是意外的设计,但是的,这很酷。我喜欢人们从中看到价值。

成本也很有趣。Kimmy K2 Thinking 是我运行过的一个更昂贵的模型,我认为。GBT5 在这方面实际上出奇地便宜,因为它在其中并没有进行大量的推理。然后 Gemini 25 Pro 和 Grok 4 相比之下相当昂贵。你会看到 Grok 4 在角落里有多远,而 GPT5 的成本是 7 美元。Kimmy K2 Thinking 的成本要高得多,因为它进行了大量的推理,但仍然取得了相当不错的成绩。只是有趣。不一定是最好的基准测试,但我认为这很酷。这就是我创建它的原因。结果令人着迷。

中国模型在写作用例方面占据主导地位,这对我来说仍然有些疯狂。这是 Open Router 上的角色扮演类别,Deepseek 3.1 和 V3 是角色扮演的两个最大模型,这对我来说太搞笑了。R1 仍然在这里。是的,非常有趣。所以,看到这种模式并不令人意外,但仍然,在我看来,非常有趣。

在我们进入许可之前,还有几件事我想讲,请务必在这里关注,因为这是一个重要细节,据我所见,它要么没有被报道,要么被错误地报道了。这是一篇来自 Interconnects 的精彩文章,它触及了很多内容,但其中一个有趣的部分是用于代理工具使用的交错思考。这是 Anthropic 一直支持的一种新模式,它允许模型在回复过程中再次开始思考。它不必从头开始一个全新的回复,而是可以先进行一段时间的推理,然后做下一件事。

可悲的是,大多数工具不支持这一点,包括 Open Router,这意味着如果你使用 Open Router 进行测试,你就看不到这一点。而且,如果你使用 Open Code 或 Kilo Code 等工具,你也无法获得这一点。据称,Kimmy CLI 目前也坏了。我还没有机会玩它,而且我需要的最后一件事是另一个用于测试东西的 AI CLI。我听说当你破解 Claude Code 来使用它时,它可以做到这一点,并且效果很好。我还没有机会自己尝试,但如果你好奇的话,值得一试。

到目前为止,我知道支持这一点唯一的模型是 Claude、Minimax 和现在的 Kimmy K2 Thinking。所以,很高兴看到更多支持。我预计这种模式在未来会越来越普遍,尤其是在明年。

这次发布的根本反应是人们说,自从 Deepseek R1 快速跟进 01 以来,这是开源模型最接近封闭前沿性能的一次。这很真实,但我们正进入浑水领域,因为比较模型变得更加困难。需要明确的是,这一切都对开源模型有利。我听说 Kimmy 服务器已经完全不堪重负。稍后会详细介绍。是的,这是一个真正的问题。你可能会认为,既然这是一个大家都在炒作的大型开源模型,现在每个人都应该支持它,但还没有人这样做。这是因为这是一个巨大的模型,在托管方面有很多有趣的怪癖。INT4 的确使其更容易,但如果你的基础设施没有为此配置,它也会更难。

此外,Moonshot 的人对供应商的验证方式非常严格。当然,任何人都可以托管模型,但由于他们对工具调用的投入很大,而许多信息提供商的工具调用行为不正确。我为此经历过地狱般的折磨,顺便说一句。试图让搜索工具在所有模型上都能正常工作,尤其是在 T3 Chat 上的 Open Router 模型上,这并不愉快,因为不同的模型提供商会以不同的方式遵守或不遵守语法。所以,Moonshot 团队有一个他们构建的验证器,用于实际对不同提供商进行基准测试,并查看有多少提供商能够持续正确地调用工具。

以下是所有一致性超过 80% 的提供商。然后是一些其他提供商,即使是我非常喜欢的 Grok with a Q 也只能达到 68% 左右。所以,是的,显然 Moonshot 的官方托管是最可靠的。看起来 Deep Infra 略微领先于他们,这很酷。然后是这里的许多其他托管方,它们的一致性各不相同。

事实证明,托管这些模型并让它们与所有这些特定行为协同工作并不容易,而且可能需要一两个月的时间才能一切稳定下来。所以,我不会期望其他提供商在一段时间内能很好地实现这一点。所以,如果你对谁能获得你的数据很敏感,因为再次强调,Moon.ai 是中国的。你可能需要等一会儿。

关于这个模型,有很多我想谈论的事情。它非常有趣。这篇 Interconnects 的文章真的很好。谢谢 Nathan 写了这篇。里面有很多小亮点,包括一个关于 Kimmy K2 如何在定性数据上进行强化学习以修复写作的链接。他们确实关心让写作变得更好,而且这很明显。它是我用过的最好的写作模型之一,而且它可能会成为我一段时间内的默认聊天模型。

据称,训练这个模型只花了 460 万美元。需要明确的是,这个成本只是产生了这一特定权重集的一次运行的成本。还有很多其他成本需要考虑。但是,当你考虑到他们免费提供它时,这真的很疯狂。你可以像这样获取这项工作,下载它,并随意使用它,即使它很难运行,这真的很酷。

但是有一个代价,这就是我们需要谈论许可的地方。这是一个修改版的 MIT 许可证,直到第 22 行完全相同,然后他们说,他们甚至说这是唯一的修改。我们唯一的修改部分是这个。如果软件或其任何衍生作品用于你拥有超过 1 亿月活跃用户或超过 2000 万美元(或其他等值货币)月收入的任何商业产品或服务,那么你必须在这些产品或服务的用户界面上显著显示 Kimmy K2。

有趣的补充。这意味着,如果其他服务开始使用 Kimmy K2 并拥有一定数量的用户,那么它们应该在用户界面上显著显示 Kimmy K2 正在为其提供支持。这使得某些情况变得奇怪。例如,如果我要提炼 Kimmy K2 或以特定方式对其进行微调并围绕它创建一个自己的产品,我是否仍然需要称其为 Kimmy K2?我如何界定这些界限?有趣的问题。

话虽如此,你可能应该知道你正在使用一个有 LLM 支持的东西时,你使用的是什么模型。而且,我们在 T3 Chat 上已经符合要求了,所以你不知道我们是否每月收入超过 2000 万美元。你可能可以猜到,我们没有那么富有。话虽如此,这也不是最糟糕的事情。即使是 Llama 模型也有类似的许可声明。他们免费提供这些文件并让你随意使用它们,这很酷。而且大多数服务可能会在任何情况下都加上模型名称。我明白他们为什么这样做。我认为这是合理的。我希望有更好的说明,关于微调和后续训练会是什么样子,但这很公平。我预计未来会有越来越多的这些开源模型做这类事情。

还有几件关于这篇文章的快速事情,因为我认为它真的很好,值得一读。第一点是开源模型发布速度更快,这真的很有趣。封闭模型和开源模型之间的性能差距正在缩小,而且很大一部分原因就是模型发布的速度。我们正在积极等待 OpenAI 发布 5.1,我们最近看到了很多关于它的传言。而且我不知道 [ __ ] Google 在哪里。就像,Gemini 3 在哪里?我听说它最早可能在本周发布,甚至可能在九月,感觉它一直在推迟。当进步速度很快时,能够更快地发布模型会使其看起来更好。绝对。许多创新都发生在所有实验室中,但谁先发布模型,谁看起来就是最大的创新者。就像,它们不是交错推理的发明者,但它们是第一个这样做的。所以,它看起来像是他们在这方面很厉害。

另一个有趣的部分是,首先是关键基准测试,然后是用户行为。这是中国实验室一直关注的一件事,那就是获得最佳的基准测试分数。其中一些也有好品味,比如 DeepSeek 和 Kimmy,但很多都没有。这就是为什么我一直对 Quen 严厉批评的原因。它会赢得基准测试,但使用起来真的很糟糕。但在过去一年里,我们看到 Quen 经历了这种转变。他们的模型最初以基准测试而闻名,但现在它们确实非常棒。它们仍然拥有那些惊人的基准测试分数。

沿着这个思路,K2 Thinking 模型是原生以 4 位精度进行后训练的,使其更适合实际服务任务。他们很可能这样做是为了使强化学习的扩展在长序列的后训练中更有效。中国实验室做得很好。年初的时候,没有人知道他们。我的意思是,去年年底,我是 DeepSeek 的忠实粉丝。我仍然爱那些家伙。我认为他们发布的研究令人难以置信。我知道他们没有最好的模型,但这从来不是他们的目标。他们似乎真的只是想专注于研究以及我们如何制造模型。而 R1 更像是他们新思维方式的演示,从那时起,每个人都复制了它。然后是交错思考。

人们谈论这次发布的一个方面是 Kimmy K2 Thinking 在回答查询时会使用数百次工具调用。根据博客文章,Kimmy K2 Thinking 可以在没有人为干预的情况下执行多达两到三百次连续的工具调用,跨越数百个步骤进行连贯推理以解决复杂任务。这是第一个具有多次工具调用能力的开源模型,但这已经是 03、Grok 4 等模型的一种标准行为。Grok 4 在这方面并不好。那是 [ __ ] 谎言。这种行为自然会出现在 RL 训练中,尤其是在信息方面,当模型需要搜索才能获得正确答案时。所以,这在技术上不是什么大事,但在开源模型中看到它很有趣。

说真的,就像这需要大量的金钱和时间才能做到,不断地一遍又一遍地运行模型,直到它正确地进行工具调用,然后奖励它,并让它以这些奇怪的结构和形状以及 JSON 语法来执行工具。在开源模型中拥有这个真的很酷。是的。而且交错思考的支持也很有趣。最简单的思考方式是,你拿一个不支持它的普通模型。它思考,它输出。你重新运行它。它思考,它输出。你重新运行它。它思考,它输出。然后你把那些结果拿回来,作为强化数据。结果是它现在可以自己做到这一点。同样,并行工具调用也正在成为一种趋势。所有这些都给美国实验室带来了压力。

预计现在会有更多的实验室发布。因为现在是年底了。如果他们现在不发布,他们就得等到明年。而且,这对他们所有人来说都非常可怕。记住,在 Artificial Analysis 上得分高于 Kimmy K2 Thinking 的唯一实验室是 OpenAI。其他一切都落后了。而且在某些基准测试中,Kimmy K2 是我们见过的最聪明的。他们将此作为开源模型提供给我们使用和玩耍,这太酷了,并且真正推动了行业的最先进水平,即使我目前获得的编码输出并不那么好。

我对这个模型感到非常兴奋。我将在 T3 Chat 上每天使用它一段时间。我非常好奇你们的感受,如果你们也使用它的话。我是否对这个模型太兴奋了,还是它实际上是一个很酷的模型?请告诉我你的想法。下次再见,各位书呆子。