Transcription
世界上最新、最棒的人工智能模型,现在可以 100% 免费下载并在您家中运行。Kimmy K2 思维是 [音乐] 来自 Moonshot AI Labs 的最新推理模型,这是一家中国的尖端人工智能实验室,它在几乎所有基准测试中都超越了 OpenAI 的 GPT5、Anthropic 的 Claude 和 Google 的 Gemini。但这甚至不是最令人震惊的部分。最令人震惊的部分是,它的训练和构建成本仅为 460 万美元,这只是 OpenAI 最初训练 GPT 所花费的数十亿美元的一小部分。它也是 100% 开源的,这意味着您可以下载并立即在家中运行 Frontier AI。嗯,但当然,这引出了两个非常重要的问题。第一,开源人工智能是获胜策略吗?我们一直被告知,在经营企业时,闭源通常是更好的策略,但中国及其人工智能模型正在在这里证明我们错了。第二个问题,也是更不祥的问题是,美国股市泡沫最终会破裂吗?Josh,我们这里有什么?这个新模型是什么?为什么它无处不在地占据社交媒体?他们又做到了。中国人又做到了。他们做得非常出色。大满贯,本垒打。这是一个令人难以置信的令人印象深刻的模型。这种情况每次都会发生。我们从美国获得了一个惊人的旗舰模型。几个月后,我们得到了同样的东西,成本只有十分之一,而且略有改进。例如,与今天美国领先的人工智能实验室的成本相比,成本要低几个数量级。规格确实令人印象深刻。我们将深入探讨所有内容。我猜我们将从高层规格表开始。在人文科学的最后一次考试中处于最先进水平,这是我们用来作为基准的参考点。它的得分是任何人有史以来最高的,44.9%。它有很多很酷的突破,但它擅长的大事,正如这里的帖子所说,是推理、代理搜索和编码。现在,这里有几件很酷的事情我们可以谈谈,EJ,也许我们可以直接看图表,因为我觉得这是可视化这个模型比所有其他模型好多少的简单方法。我们在图表上看到的是,嗯,GPT5 是最好的。Kim K2 现在是新的最佳。这与思维和推理有关。这再次令人印象深刻,因为一,这个模型是完全开源的。您可以下载模型并在本地免费运行它。看到这个时,你的第一反应是什么?对我来说,我当时想,我的天哪。我为什么要用其他任何东西?说实话,Josh,我的第一反应是看看股市。我想,这会压垮整个美国股市吗?就像 Deepseek 最初发布他们的 R1 思维模型时,你还记得吗?那是去年年底。人们对人工智能模型的训练方式的整个泡沫和看法被彻底打破了。从那时起,中国一再在突破模型方面取得成功,其中之一就是 Moonshot AI 实验室团队,他们构建了 Kim K2。它是一个令人印象深刻的模型,原因有几个。对我来说,第一,它现在可以与所有最好的模型竞争。而且,就我个人而言,我几乎每天都使用 GPT5,无论是用于一些随意的提示和请求,还是用于更深入的思考和研究,以及我的一些工作。所以,对我来说,现在拥有一个我可以下载并在我自己的电脑上本地运行的独立模型变得至关重要,我在这里显示的这个推文,每百万个 token 输入成本为 60 美元,输出为 2.5 美元,这是一个疯狂的成本削减平均值,如果我经营一家公司使用人工智能模型,我几乎没有理由不转向类似的东西,除了维护和设置之类的事情。对我来说,另一个令人印象深刻的事情是 Josh,是团队本身。这只是一个成立两年的初创公司,这让我想起了另一家成立两年的初创公司,那就是埃隆·马斯克的 X AI,对吧?而且这两款模型之间有一个有趣的联系,Josh,那就是 Kimmy K2 的推理,这个思维模型,它可以做到,因为它做了一个非常巧妙的思维链实验,它需要很多步骤来思考出一个逻辑答案,而不是直接给你一个答案。这是 Grohee 4 在推出新产品时开创的。所以,Kim K2 借鉴了 XAI 的一些经验来生产一个类似的模型。另一个很酷的事情是,它在思考的同时会做一些叫做工具使用或工具调用的事情。所以,如果你想象一下,当我试图解决一个复杂的问题时,我会利用不同的工具来帮助我找到答案。所以,如果我参加数学考试,我可以使用计算器,或者如果我进行深入研究,我可能会使用谷歌。这个人工智能模型自然地在思考时拥有超过两三百种不同的工具调用和工具使用。所以,总的来说,这是一个非常令人印象深刻的新型人工智能模型。>> 是的,EJ,你提到了每百万个 token 成本为 60 美分。我想补充一点关于这个成本实际有多低。我查看了 GPT5 Pro 的每输入成本,每百万个 token 是 15 美元。GPT5 Pro 的成本是 15 美元。目前,输出是每百万个 token 120 美元。当然,这是顶级的。如果你使用 GBT5 标准版,输入是每百万个 token 1.25 美元。输出是 10 美元。所以,无论你怎么看,成本至少是 2 倍的成本降低,最高可达 100 倍,假设它可以与 GPT5 Pro 竞争,而所有这些基准测试都表明它很有可能。所以成本确实是,这是一个大问题,并且为了更深入地探讨你提出的观点,以及它实际上是如何工作的。嗯,我们得先,抱歉,不,我们稍后会讲到。保存表情包。[笑声] 别急着剧透表情包。我们得讲到接下来的搞笑笑话。但基本上,它的工作原理是,屏幕上有一个非常复杂的图表。我甚至不会尝试解释那是什么。但我喜欢的一种描述方式是,当我今天早上向我的朋友描述它时,就像 Kim K2,它就像一所大学校,里面有专家。事实上,Kim K2 有 384 位专家。你可以把这些专家想象成数学俱乐部、历史俱乐部、编程俱乐部、辩论俱乐部,等等。当你问它一个问题时,它不会邀请整个学校。它不会邀请所有俱乐部。EJ,如果你问一个数学问题,它会查询数学俱乐部,并从这 384 个俱乐部中选择八个来帮助组合答案,挑选专家,并决定如何解决这个问题。所以,它有万亿个参数,但一次只使用 320 亿个。这就是为什么我们能够实现巨大的成本降低,因为它使用了所谓的专家混合。很多人是这样描述的,但本质上是,而不是用整个模型的智能来回答我今早该吃什么。它会调用厨师俱乐部,它会调用健康俱乐部,然后将它们结合起来,形成一个答案,应该能给你带来和使用整个模型一样好的结果,但它在成本、能源消耗以及它可以生成的 token 数量方面效率更高,因为它在各个方面都便宜得多。我认为这是中国出现的一个非常令人兴奋的大亮点。我们从 Deep Seek 看到过,我们从 Kimmy 看到过,这就是专家混合架构,它们正在真正地模块化整个模型,并且只使用对特定查询重要的东西。他们处于一个非常受限的境地,那就是他们无法获得最新的 GPU 或 Nvidia GPU。美国对中国实验室获取这些东西实施了一系列关税限制。所以他们真的需要在他们的能力范围内工作。因此,提出像专家混合这样的架构非常重要。这让我想到了这个表情包,Josh,那就是我们在做什么?美国制造的人工智能模型和中国制造的模型之间存在明显的差距。你看到了 OpenAI,它预计在未来 5 年将花费 1.4 万亿美元。那是万亿,不是亿。而 Kimmy 的训练成本为 460 万美元。我知道这里有点耸人听闻。这 460 万美元是相对于一次训练运行而言的,通常需要几次训练运行。但假设它进行了 20 次训练运行,对吧?每次 460 万美元,那仍然只有大约 1 亿美元,对吧?或者更少。所以,当与 GPT5 据传花费 OpenAI 训练成本 17 亿到 24 亿美元相比时,这并不重要。所以,存在一个我不太理解的差距,Josh。这也是我最担心美国公司和前沿实验室所做的事情。我觉得他们错失了重点。我不太清楚是什么,是这个专家混合的东西,还是有人被骗了,我不知道是我,还是我看着这个 Kim K2 模型说,“哇,太棒了。”>> 是的。当我想象中国在美国的开源公司或闭源公司中所扮演的角色时,至少让我感到安心的是,许多软件层面的创新突破实际上都发生在这些私有 AI 实验室中。我们确实获得了思维链和推理,并且有大量新的创新很快就成为标准。这一切都发生在美国的 AI 实验室中。就我们而言,美国的 AI 实验室仍然在取得最快的进展。它们正在创造最多的创新。然后,正如我们在节目中早些时候描述的那样,这种创新开始逐渐渗透,无论是自愿的还是被窃取的,并被实施到新模型中。它们只是在成本和效率方面完全削减了成本,因为这基本上是它们唯一能做的。它们无法获得像 Jensen Huang 和 Nvidia 的数百万 GPU 这样的资源。它们没有 500 亿美元的资本支出,仅仅用于员工,仅仅用于薪资和薪酬。所以,在我看来,我们仍然做得很好。只是中国非常擅长实施技术并大规模地以开源的方式应用它。而开源有很多值得称道的地方,因为它非常令人印象深刻,而且是我们早期在美国看到的社区努力,但一旦它们变得更好,它们就关闭了。所以发生的情况是,你在一家公司(如 Kimmy)中获得创新,然后你看到它被应用到 Deepseek 中,然后你看到它被应用到 Quen 中,然后突然这项技术在三者之间同步增长,因为它们都是开源的,它们发布了所有的代码,所有的开放权重,它们更容易蓬勃发展,而美国的创新则发生在封闭的墙壁后面,只有在新模型发布给世界时才会泄露出来,人们会反向工程它是如何工作的。>> 嗯。我读了一篇《金融时报》的文章,采访了 Jensen Huang,他说原话是,如果中国继续沿着目前的道路前进,并且美国不增加能源产量,中国将赢得人工智能竞赛。他提出了一个更广泛的观点,即他们的开源策略非常有效,因为他们正在利用你刚才提到的限制来构建这些新的人工智能模型。谈到开源及其好处。我这里有一条推文,显示 Kim K2 思维这个新模型基本上可以在两台 MacBook M3 Ultra 上运行,这相当于几千美元的成本,这对于在家中私密运行一个前沿人工智能模型,并在你自己的任何私人数据上进行训练和微调来说,是一件令人难以置信的事情。所以,你不需要把这些数据卖给 Sam 或 Mono 或其他人。只是超级酷,超级便宜,对吧?因为你在家进行本地推理。所以你不需要担心任何人窥探你的任何查询、提示或研究。一切都在家里,我觉得这很酷。关于开源的另一部分,我觉得很有趣的是 Josh,那就是他们发布了一个 MIT 许可证或一个修改过的 MIT 许可证,我们稍后会详细讨论。但关键是,当 Deepseek 发布他们的第一个主要开源模型并席卷全球时,并没有主要的许可证。所以,你可以下载并做任何你想做的事情。你可以将其集成到你自己的产品中,无论你是一个美国创始人,如果假设你将其扩展到一百万用户使用了利用那个 Deepseat 模型的功能,你都不需要向那个团队致谢。Kim K2 在这方面采取了不同的方向,他们发布了一个 MIT 许可证,我认为如果你达到,我认为是 1000 万或 2000 万用户,你需要显示 Kimmy K2 的标签,并说我正在使用这个模型,但这个许可证有一些不同之处,对吧,Josh?我们可以深入探讨一下吗?>> 我认为它是修改过的。我不知道修改的程度,但我知道这里有些不同。我们唯一的修改部分是,如果该软件或其任何衍生作品用于您拥有超过 1 亿月活跃用户或超过 2000 万美元或等值其他货币月收入的任何商业产品或服务,您应在这些产品或服务的用户界面上显著显示 Kimmy K2。>> 这是一个有趣的营销策略。好吧,好吧。你知道这让我想起了什么吗,Josh?这是 Meta 试图用他们的 Llama 模型做的事情,对吧?所以,Meta 是我能想到的唯一一家采取这种开源人工智能路线的美国主要公司。当时的目标或预期的目标是基本上在 Meta 和 OpenAI 以及其他遥遥领先的前沿模型人工智能实验室之间创造一个公平的竞争环境。所以,如果你免费发布所有这些尖端人工智能技术,并让任何人都能访问,那么它就会降低 OpenAI 和所有其他前沿人工智能实验室可以向你收费的访问费用。中国正在利用这一点来打击美国人工智能股市,对吧?这就是为什么我们看到英伟达在消息发布后下跌了 4.2%。我很好奇这是否会刺破泡沫以及美国的资本支出泡沫。Josh,说出这种话是不是很疯狂?我的意思是,市场对这个消息反应非常激烈。>> 我不认为这有什么问题。我不认为它会刺破泡沫。我不认为我们有麻烦。只要我们继续保持领先一步,或者至少保持同步,我认为这完全没问题。我认为我们在制造软件、分发软件、创建产品方面非常出色。我认为中国非常擅长无耻地创新和部署,而无需经历美国大部分公司所经历的所有障碍和知识产权问题。所以,我不认为这会导致任何泡沫破裂。我认为许多前沿创新仍然发生在米国。我开始有点担心的地方是,当它转向具身智能时。一旦我们从大型语言模型转向将它们集成到机器人中或集成到物理硬件中,那就是我们遇到问题的地方。在软件方面,我们做得很好。我们做得非常出色。每个人都在花很多钱。在硬件方面,>> 我们没有同样的领先优势。在过去 30 到 50 年里,我们已经将我们的制造能力外包给了其他地方,因此我们只是……我的意思是,每个人都知道我们真的无法在美国以具有成本效益的方式制造东西。如果我们与中国在制造具身智能,如人形机器人、专用机器人等方面的赛跑,那才是真正令人担忧的地方,因为那里存在巨大的领先优势,而这种领先优势是以原子形式存在的,原子比比特更难移动,因为你可以窃取一些开源代码,在此基础上进行一些微小的创新,一夜之间将其推广给十亿用户,这就是创新。这不会发生在您的人形机器人的第二版和第三版之间。您实际上必须用工厂、真实材料、人员和地点来建造它,这非常困难和具有挑战性,而中国非常有可能成为最大的赢家。所以我认为在软件方面,我感到非常自信,就目前而言,这只是我们正在争夺的,但在不久的将来,当事物开始具身化,当人工智能在我们周围的物理世界中显现时,那似乎是我开始更多地关注中国投资而不是美国投资的地方。>> 好的,我认为我可能会稍微反驳一下,并说在具身智能出现之前,在软件方面有合理的证据表明应该看跌。我的意思是,有几种思考方式。在资本支出方面存在巨大的差异。一方面,美国花费数万亿美元来训练 AGI 或最好的人工智能模型,而另一方面,你们花费数亿美元,这比前者少了一个数量级,对吧?所以,这里存在一个明显的差距,我们没有看到。我不知道这种优势是在训练架构、训练设计还是硬件制造方面发挥作用。但中国人已经找到了它,并且能够真正地利用这个杠杆来获得优势或与美国匹敌。而且他们已经成功地做到了这一点多年。现在,Deepseek 算是第一个测试案例。现在我已经看到,自那时以来,中国前沿人工智能实验室已经发布了至少 50 个开源模型。第二,美国政府并没有试图限制他们。我们实施了许多不同的制裁,包括限制英伟达和其他美国制造商可以向中国销售的 GPU。但这仍然没有阻止他们。尽管有所有这些不同的事情,他们仍然能够维护和训练这些前沿人工智能。所以,我认为如果我从另一方面来看,那就是,如果有一个开源模型非常酷,那又如何呢?你为什么现在不使用它呢?我不是定期使用 Kimmy K2,即使我使用 GPT5,而且它可能比 GPT5 更好。对我来说,答案很简单。我被锁定在 OpenAI 的生态系统中,我对此很满意,它有我的记忆。它了解我。它拥有我与它进行的所有先前聊天的上下文。但更重要的是,Josh,如果我的账户或我正在使用的东西有问题,我可以访问一个社区。我有一个支持团队可以与之交流。有一个软件生态系统支持我,对吧?而不是我跳槽到 Kimmy K2,自己设置好,然后不得不自己解决问题。我认为很多人会因此而不愿这样做。这确实很难,但我们看到了来自双方的市场力量,就像我看到你在这里包含了一个链接,其中 Kurser 和 Windsurf 的新人工智能模型,他们正在使用某种中国模型,事实上,他们正在用中文思考,我发现这非常迷人,美国制造的产品现在正在用中文思考。所以,这无疑是一个令人担忧的问题,就商业而言,API 成本确实很重要,如果你能以 60 美元而不是 10 美元获得一百万个 token,那确实会影响你的业务利润。对于像我们这样的消费者来说,没有真正的兴趣去使用 Kim K2,以及你之前提到的现象,你实际上可以在两台运行 M3 Ultra 芯片的 Mac Studio 上运行 Kim K2 的量化版本。它每秒生成 13 到 15 个 token。所以速度非常慢,你每秒只能得到一两句话。所以它非常慢,感觉会很迟钝,感觉不会很好。有一种说法是,这种情况正在改变,因为今年,而且有趣的是,现在只有苹果电脑支持这一点。他们正在发布 M5 Ultra,这将是新版本。而且,看看事态如何发展将会很有趣。我发现有趣的是,这是一个题外话,我想和你分享一下,EJ,因为你可能会觉得它也很酷,在这些苹果电脑上运行的版本,Apple Studios,它是一个稍微量化过的版本。>> 我听说过这个,我最近在特斯拉的财报电话会议上了解到这个,他们最近召开了股东大会,我们本周晚些时候将有一个关于这个的节目。但在那个节目中,埃隆提到了一些有趣的事情,他谈到了量化与浮点人工智能,我当时想,那是什么鬼?为什么你要花这么多时间谈论这个?这没有意义。我意识到的是,许多人工智能模型使用小数点后很多位的数据来获得更精确的结果,这就是浮点。当你量化一个模型时,你删除了模型右边的所有数据,只保留整数。所以你会损失高达 60% 的方差。但你获得了更快的效率、更好的速度改进、成本改进,并且你实际上可以在这些设备上本地运行它。所以,我认为看看人们在模型精度与成本效益和效率之间做出的不同决定很有趣。我们看到 Kimmy Gay Too 非常容易过度关注效率,但也许 OpenAI 的目标不是这个,如果他们真的想这样做,他们可以量化这些模型,他们可以更多地转向整数类型的计算。我当时在想的是他们如何处理这个问题,因为这可能只是 Kimmy 正在优化速度和效率,而其下游效应是它也非常快,而 OpenAI 还没有专门优化这一点。>> 对吧?而对这个观点的反驳是,好吧,Josh,它在所有我们评估过的美国模型的基准测试中都表现出色,对吧?所以肯定要好得多。而我的反驳是,嗯,基准测试在现实生活中并不真正体现。那么,如果它在人类的最后一次考试中得了 50% 的高分,对我来说有用吗?它能理解我想说什么吗?它能理解我输入的提示的上下文吗?>> 另一方面,关于量化,Josh,我认为许多美国前沿人工智能实验室,如 OpenAI、Google 等,实际上拥有足够的计算能力来为你提供最佳体验,最高浮点体验,用这个术语来说,但他们将大部分计算能力用于训练下一个我们甚至还没有看到的大模型,对吧?上周有新闻爆出 OpenAI 正在这样做。所以,技术上他们有足够的计算能力来全年为你提供出色的服务,但他们将 70% 的计算能力用于训练 GBT6。所以,我认为这只是一个优先事项的问题,直到我们达到某种程度的均等,这些人工智能模型才足够好。但我确实要说,根据我们到目前为止在本期节目中讨论的所有内容,有一个明显的赢家,那就是消费者。就是你、我以及收听这个节目中的每个人,他们基本上以几乎免费的成本获得了前沿智能。完全免费下载并在家中私密运行。在我这里显示的这条推文中,它基本上说,对于每一个闭源模型,都有一个开源替代品,它列出了像 Sonet 4.5,你有 Glm 4.6,Groc Code Fast,你有 GPT OSS,GPT5,你有 Kimmy K2 思维,等等等等。如果我们看看大约一年半前,甚至两年前,这个列表根本不存在。只有前沿人工智能实验室在闭源方面,而开源方面则为零。所以看到这种进步真的很,真的很令人鼓舞。>> 嗯。是的。这将是一场比赛。这将是开源和闭源之间的战斗。也许那甚至不是战斗。也许是开源,直到它们赶上闭源,然后是全面的闭源。所以,看看发展将会很有趣。我们有一批新模型即将推出。我们正处于一个奇怪的中间地带,Gemini 3 希望很快就能推出。我们将有一些新的基准测试,而其中一个残酷的真相是,正如你刚才提到的,EJZ,那就是每个人都受到计算能力的限制,就像 OpenAI 本可以使 GPT5 更加令人印象深刻,如果他们真的想的话。他们只是没有计算能力来服务它,而且它会太昂贵,太慢。所以,不是说它不能完成,而是人们没有资源去做。所以,这是一个持续的平衡过程,看看公司如何在这个曲线上定位自己,他们想在计算能力与成本之间花费多少,以及他们实际拥有多少资源来训练这些模型并将其大规模部署给用户。>> 今天就到这里,各位。非常有趣的一集。我总是对开源技术追赶闭源集中式人工智能的速度感到惊讶。我一直认为它会滞后几年,而现在已经缩短到几周。我们有一个非常忙碌的一周。我们可能明天会有谷歌发布一个新的纳米香蕉模型。>> 祈祷。我为此祈祷。>> 我也为此祈祷。我们还有第二集,基于特斯拉今天的投资者会议,其中有一些非常充实和令人兴奋的消息。现在,听着,如果你想让美国赢得这场人工智能竞赛,而且毫无疑问,这是一场竞赛,你需要订阅美国人工智能 YouTube 频道,其中一个就是我们。请订阅,点击通知按钮,无论你在哪里收听,给我们一个评分。我们非常感谢这些。它带来了如此多的关注。算法对我们有利。我们获得了所有这些精彩的观看次数和新观众。我们上周有 1000 名新观众,这简直是疯狂的。你好,欢迎来到频道。希望你喜欢内容,我们下期再见。>> 是的,在让他们脱身之前,我正在检查。我正在进行统计更新。上周观看的观众中有 83% 没有订阅。如果你在 YouTube 上观看,请订阅,或者去 Spotify。我最喜欢的收听播客的地方。它很棒。我不知道如何更好地向人们描述。Spotify 非常好。你有视频,你有音频,你可以关掉它,在不需要高级会员的情况下锁定手机。请去那里。去那里留言,因为评论区也很火爆。所以,是的。总之,>> 感谢所有支持。>> 我们不挑剔。无论你在哪里收听,都可以去。>> 好了,我们下期再见。感谢一如既往的观看。非常感谢。嗯,和平。[音乐]