Transcription
Anthropic 刚刚抓获了三个中国实验室窃取 Claude 的大脑。而真实的故事是,每个人都想这样做。三个中国人工智能实验室刚刚被抓获,它们通过 24,000 个虚假账户与 Claude 进行 1600 万次自动化对话,以窃取 Claude 的能力。Deepseek、Moonshot、Miniaax,通过水蛇网络(hydra networks)的欺诈账户进行工业规模的提取,利用代理服务规避地理限制,而在 Miniaax 的案例中,它们在新的模型发布后 24 小时内就进行了调整,以便在任何人能够阻止它们之前捕获最新的能力。如果这听起来像间谍电影里的情节,那很可能是因为如此。每个人都在称之为冷战,但他们错了。如果你停留在冷战的框架上,你就会错过对你的职业生涯、你的公司以及你现在正在使用的每一个 AI 工具最重要的启示。没有人说的是,这真的不是一个中国的问题,不是根本性的,也不是结构性的。这是一个 Napster 的问题。美国公司创造的最有价值的智能是以数学形式存储的。它存储在 OpenAI。它存储在 Google。它存储在 Anthropic,以数学形式。无形的,可复制的,可以通过聊天窗口提取的。前沿实验室内部的东西与其他人可以访问的东西之间的差距,造成了我称之为“压力梯度”的东西。就像水往低处流的力一样。当一方拥有可能价值数万亿美元的能力,而另一方可以用数千美元提取它们时,信息总是会流动。这种梯度如此之大,以至于“蒸馏”(distillation)本身并没有被恰当地定性为间谍活动。即使它符合这个标准,也应该被定性为盗版。而盗版,正如音乐行业在 1999 年和电影行业在 2003 年所学到的那样,不会停止。它只会减缓。真正重要的问题是,这种减缓的速度与前沿模型的能力增长相比如何?当模型能力大约每 90 天翻一番时,这一点就非常重要。但这甚至不是应该让你夜不能寐的部分。应该让你夜不能寐的部分是这个。蒸馏模型,那些通过窃取的输出来构建的模型,那些在基准测试中看起来具有竞争力的模型,那些你的公司现在可能正在购买或免费推出的模型,在某些方面系统性地比前沿模型差,而这些方面是今天的任何评估套件都无法很好地衡量的。而这种差距在 AI 价值所在的确切用例上最为明显:持续的、自主的、代理式的工作。通过复制构建的模型在聊天方面看起来不错。当你需要它们连续思考八小时,绕过障碍,并使用没有人预料到的工具和组合时,它们就会崩溃。每个人都在回应这次泄露争论出口管制和地缘政治。每个人都在回应这次泄露争论出口管制和地缘政治。而我认为真正的对话是不同的:蒸馏对你正在使用的模型有什么影响?这意味着窃取的动机适用于地球上的每个人,而不仅仅是中国,以及为什么代理式工作中的性能阴影是当今企业 AI 中被低估最多的风险。几天前,我写了关于 Gemini 3.1 Pro 和 tonomy 的问题,但还没有人构建出来。论点是,困难不是一件事,不同的模型解决不同类型的困难。这篇文章是关于当最有价值的智能也是最容易复制的智能时会发生什么,以及为什么这会改变你应该如何评估你正在使用的工具、你信任的供应商以及你对 AI 基础设施的要求。我知道冷战的说法很方便。我知道它能吸引头条新闻。它也不完整。Anthropic 的披露非常倾向于国家安全语言,可能是故意的。出口管制、中国共产党、军事和监控应用、外国对手正在缩小竞争差距。这种说法符合 Anthropic 的政策利益。它们一直支持出口管制,并希望证明这些管制正在奏效,中国实验室的快速进展依赖于窃取的美国能力,而不是独立创新。其中一些显然是真的。Deep See 的操作通过 150,000 次交流,以规模化生成思维链训练数据,针对 Claude 的推理能力。它们的提示要求 Claude 想象并阐述完成的响应背后的内部推理,并一步一步地写出来,有效地制造了训练竞争模型所需的推理痕迹。但它们最能说明问题的技术之一与军事应用无关。它们使用 Claude 来生成对有关异议人士、党内领导人和威权主义的政治敏感查询的审查安全替代方案。训练数据旨在帮助 Deepseek 自己的模型将对话从中国政府不希望讨论的话题转移开。Anthropic 通过支付方式和请求元数据追踪到了该实验室特定研究人员的账户。太平洋的地缘政治动态是真实的。它已经升温了二十年。我实际上写了我的本科毕业论文,关于中国在东南亚政治中的参与。九段线、人造岛屿、对台湾的压力。这些都不是假设。但超越地缘政治动态,我认为冷战的比较主要从方法论的角度来看很有趣。例如,“女友”方法,情报机构部署有魅力的特工来培养与研究人员的关系并提取信息。这并不新鲜。它早在 Matahi 之前就存在了,并且在硅谷的 AI 社区中得到了充分的记录。如果你在旧金山作为一名工程师,吸引了一个令人惊叹的 10 分女孩,我有一个不幸的消息告诉你,是什么促使了这次晚餐邀请。人力情报行动是真实的,有记录的,并且正在进行中。但在这里,这种说法变得过于方便了。Anthropic 本身一直与美国国防机构进行着复杂的周旋。它们更新了可接受使用政策,允许 Claude 某些国防和情报应用,这与之前的立场有所转变,同时也在应对关于其技术应如何在军事背景下使用的紧张关系。当你将蒸馏主要定性为来自中国的军事威胁时,就像 Anthropic 所做的那样,你正在构建一个叙事,其中美国 AI 公司是危险能力的负责任的守护者,而中国实验室则被描绘成鲁莽的扩散者。现实比这更混乱。Anthropic 同时声称这些能力太危险,不能让中国实验室获得,并且还在谈判,有时是从紧张的立场出发,关于如何在美军工复合体内部部署这些相同能力。这不像新闻稿所说的那么简单。方法论上的相似性并不意味着根本动态主要是军事的。坦率地说,它主要是经济的。即使中国和美国是亲密的盟友,蒸馏前沿模型也存在动机。即使根本没有军事应用,它也存在。它存在于信息经济中最基本的力量。创造智能的成本远远高于复制该智能的成本。这就引出了蒸馏实际产生的东西,因为这是对任何使用 AI 模型进行实际工作的人来说都重要的一部分。希望你们很多人和我一样。这是讨论完全忽略的部分。所以,复制智能对智能有什么影响?蒸馏不会产生原始模型的副本。它产生的是一种压缩。而这种压缩,就像有损 MP3 一样,具有对任何在此类模型之上构建真实系统的人来说极其重要的特征。从几何学上考虑。像 Opus 4.6 六这样的前沿模型经过数月的计算,在庞大而多样化的语料库上进行训练。结果是一个模型,它占据了我称之为“高维能力空间”的东西。它可以推理代码,处理模糊的指令,使用工具和新颖的组合,在长工作流程中保持连贯性,从错误中恢复,并在计划失败时调整其方法。它拥有所谓的“宽流形”(wide manifold),在许多不同类型的任务中具有广泛的能力表面。相比之下,蒸馏模型是在前沿模型输出的子集上进行训练的。它学会了复制特定的行为,即蒸馏者选择捕获的行为。结果是模型在这些特定行为上表现良好,但占据的流形更窄。它在能力空间中的体积更小。它针对蒸馏者目标设定的任务进行了优化,当你脱离该分布时,它的性能会急剧下降。让我们用一场足球比赛来类比。如果你观看一场完整的 NFL 足球比赛,你会看到每一个比赛,还有很多广告。如果你只看精彩集锦,广告就少了,但你也看到了少得多的足球比赛。只有 NFL 认为你会感兴趣的部分。这有点像蒸馏。这就是“脆性”(brittleness)问题,而且它被广泛误解,部分原因是基准测试最大化掩盖了它。实际情况是这样的。Miniax,Anthropic 披露的三项操作中规模最大的一项,进行了超过 1300 万次交流,专门针对代理编码和工具协调。它们在该输出上训练了模型。结果模型在编码基准测试中得分很高,甚至可能在特定评估中与 Claude 相当,因为基准测试测试的是蒸馏者优化的任务类型。因此,一个运行标准评估套件的企业买家可能会得出模型大致相同的结论,而他们是错的。它们不是等效的模型。蒸馏模型学会了在编码任务上产生看起来像 Claude 输出的输出。它没有学会允许 Claude 在任务类型之间泛化、从意外故障中恢复、使用未经专门训练的工具和组合或在扩展的自主工作流程中保持连贯推理的底层表示结构。蒸馏模型拥有更窄的流形。它在其训练分布的中心表现出色,而在边缘则非常脆弱。Moonshot 的操作从另一个角度讲述了同样的故事。它们通过数百个欺诈账户进行了 340 万次交流,针对代理推理、工具使用、计算机使用、代理开发和计算机视觉。在后来的阶段,它们转向了更具针对性的方法,试图直接提取和重建 Claude 的推理痕迹。Anthropic 通过与高级 Moonshot 员工的公开个人资料匹配的请求元数据将此次活动归因于此。结果是 Kimmy。我已经足够使用 Kimmy,可以看到压缩的痕迹。我有时会使用 Kimmy K2 进行 PowerPoint 生成,它在这方面确实表现出色。设计精美,执行干净,迭代相对较快。但当我将其用于持续的代理式工作,甚至更大的 PowerPoint 项目时,那种 AI 需要自主导航障碍、进行研究、遵循特定的风格指南、在多小时工作流程中调整其方法、使用提示中未明确指定的工具时,Kimmy 的性能会下降,而纯粹的基准测试无法捕捉到这一点。因此,我每次都最终使用 Claude Opus 4.6,因为 Kimmy K2 没有 Claude 那样的通用性能。为什么会这样?因为差异体现在绕过障碍以可靠且自主地实现长期目标的能力变窄了。像 Opus 4.6 这样的前沿模型在复杂的编码任务 midway 时遇到意外错误,并且知道如何重新路由。它尝试使用不同的库。它重构其方法。如果上下文确实模糊,它会寻求澄清。一个更窄的模型遇到相同的错误,要么失败,要么循环,要么产生技术上有效但战略上错误的解决方案。它没有表示深度来理解为什么选择了原始方法以及真正的限制是什么。因此,它无法以同样的流畅性来推理替代方案。它就是做不到。这种差异也体现在使用工具实现各种目的的能力变窄了。前沿模型已经接受了足够多样的工具使用场景的训练,它们可以使用文件系统、数据库、网络浏览器和代码执行器以新颖的组合来实现它们未明确训练过的目标。相比之下,蒸馏模型以它们被训练的模式使用工具,并且在任务需要不熟悉的组合时难以即兴发挥。这种差异非常重要,因为 AI 价值的前沿正迅速转向代理式工作。持续的自主工作流程运行数小时甚至数天,跨工具和系统进行协调,并需要蒸馏所压缩掉的通用性。前沿模型和蒸馏模型在简短、明确定义的任务上的性能阴影相对较窄。在扩展的代理式工作上的性能阴影很大,而且还在不断扩大,而且今天的任何基准测试都无法很好地捕捉到这一点,因为衡量持续自主通用性的评估套件实际上还不存在,而这实际上是目前 AI 中最大的问题之一。这样想吧。如果你正在评估一个聊天应用程序的模型,回答这个问题。生成一些文本,翻译一个段落。蒸馏模型可能比前沿模型好 90%,成本却只有 15%。你会一直接受这种交易。但如果你正在评估一个模型,用于为期一周的跨六个存储库的自主编码冲刺,模型需要理解组织上下文,正确路由工作,从它从未见过的错误中恢复,并使用训练数据中不存在的工具和组合。顺便说一句,这是一个真实的例子。蒸馏模型可能只有 40% 的有效性,有效性差得多,因为它只在原始模型的输出子集上进行训练。因此,故障模式不会显现出来,因此它不会以反映能够完成该工作的通用高质量超大规模模型的真正表示结构的方式进行训练。更糟糕的是,如果你测试这种能力,大多数评估套件都会不足。即使你让供应商比较模型,故障模式也不会显现出来,因为目前没有专门用于以可靠可复制的方式处理这种工作的评估套件。相反,如果你为这种任务购买蒸馏模型,它们会在周四凌晨 3 点出现,当时代理已经运行了 9 个小时,遇到了其分布之外的东西,并做了非常非常糟糕的事情。没有人足够清楚地说过这一点,所以我来说。蒸馏时间优势对日益代理化的模型最重要的后果之一是,其性能阴影比常规基于聊天的模型要严重得多,也难得多。这里有一个简单的框架供你参考。将你的 AI 任务放在两个轴上考虑。横轴是任务范围。它可以是左侧狭窄且定义明确的,例如分类此电子邮件,总结此文档,完成此函数。它也可以是右侧宽泛且开放式的。嘿,在三天内调试跨六个存储库的系统。根据模糊的规范构建产品原型。或者可能跨多个工具协调研究工作流程。纵轴是模型来源。顶部是前沿训练。例如 Gemini 3.1 Pro、Opus 4.6、GPT 5.3。底部是蒸馏或衍生模型。现在,在狭窄的任务上,垂直差距几乎无关紧要。蒸馏模型在电子邮件分类方面可以达到 90% 或更好的前沿质量,而成本却低得多。这是一个非常明智的权衡。大多数时候你应该接受它。在宽泛的任务上,垂直差距是一个鸿沟。蒸馏模型在前一两个小时看起来还不错,但到第 4、第 6 或第 8 小时,你就会遇到一个在蒸馏训练数据中未找到的错误,你就会陷入困境。拥有更宽流形的前沿模型可以重新路由、适应并即兴使用它没有被明确提示使用的工具。完成任务和完成得足够好可以信任之间的差距,将是职业生涯和公司区分的关键,这一点很重要。那么,显而易见的举措是什么?将来源与范围匹配。在轴的左侧积极使用蒸馏或轻量级模型。它们在那里大放异彩。为狭窄的任务支付前沿价格通常是浪费。将前沿模型保留在右侧。需要通用性、持续连贯性以及处理训练数据未预料到的情况的工作。模型路由技能是知道你的任务在此图上的位置并据此选择。现在,让我多谈谈那个时间优势,即超大规模公司拥有的优势,以及它们试图维持的优势,以及为什么即使是相对短的几个月也很重要。让我们从一个能让所有这些物理特性非常明显的比较开始。核武器需要浓缩铀或钚。你需要离心机、反应堆、专用设施、可被监控和拦截的供应链。原子很重。它们很难移动。扩散的物理学带来了真正的摩擦。这就是为什么对核材料的出口管制有点用。不完美,但有意义。物理基底创造了政策可以利用的瓶颈。大型语言模型不存在于原子中。它不需要这些。能力以权重、文件中的数字形式存在。产生这些权重的训练过程成本高达数亿美元或更多,需要数千个 GPU 运行数月。但产生的产物只是数学。它可以在几秒钟内复制。它可以经由网络传输。正如 Anthropic 最近所证明的,前沿模型的输出可以用来训练竞争对手的模型,而无需接触权重本身。你甚至不需要窃取模型。你只需要和它聊够了。每个数字行业都学到了这个教训。音乐、电影、出版、软件,每一个都发现,当价值很高而复制成本为零时,复制就会发生。不是因为人们本质上是邪恶的,而是因为经济学是压倒性的。AI 的前沿不平衡使得 Napster 时代看起来很平静。像 Opus 4.6 Six 这样的模型保守估计需要数十亿美元的计算研究和训练,以及更多的企业价值。目前,一个前沿训练运行的可靠估计从 10 亿美元开始,当包括研究人员、数据策划和基础设施时,还会更高。因此,这个模型的能力,代理推理、持续自主编码、复杂环境中的工具协调,这些都具有不成比例的价值,因为它们从头开始开发具有不成比例的难度。现在来计算提取的成本。Miniax 运行了 1300 万次交流。一次典型的交流可能平均有 1000 个输入 token 和 2000 个输出 token。Opus 4.6 的公开 API 定价,输入 token 每百万 15 美元,输出 token 每百万 75 美元。这大约是 195,000 美元的输入成本,以及可能 195 万美元的输出成本。慷慨地算作 200 万多一点。而且这是在全零售价,还没有算上代理折扣和欺诈账户滥用,这些几乎肯定降低了实际支出。最多 200 万美元用于提取成本为 20 亿美元才开发出来的能力。这是 1000:1 的盗窃回报。没有理性的经济行为者会面对这样的几率而放弃这笔钱。唯一的问题是你愿意多大胆地去收取它。Anthropic 检测到的操作规模凸显了这些经济学。所有三个实验室都使用了商业代理服务,运行在 Anthropic 所称的 Hydra 集群架构上,这些是庞大的欺诈账户网络,将流量分布在 API 和第三方云平台上。在一个案例中,一个单一的代理网络同时管理了超过 20,000 个账户,将蒸馏流量与不相关的客户请求混合,以使检测更加困难。当一个账户被禁止时,一个新的账户就会取而代之。没有单点故障。Miniaax 的活动在模型发布之前仍在进行中时就被检测到了。当 Anthropic 在活动中途发布了一个新模型时,Miniax 在 24 小时内进行了调整,将近一半的流量重定向,以捕获最新的系统。这里的操作复杂性直接映射到我刚才描述的 1000:1 的经济激励。所以,让我们回到时间。如果蒸馏是不可避免的,如果经济学基本上保证前沿能力会泄露给某人,那么阻止它的意义是什么?意义在于时间。意义在于时间。当能力每 90 天翻一番时,当 Gemini 3.1 Pro 在一代内就将其前代产品的 ARC AGI2 分数翻了一番多时,当 Opus 4.6 6 在不到一个季度的时间里在代理基准测试上超越 Opus 4.5 时。三个月的领先优势,如果这是真的,就不是微不足道的。这是先于他人部署能力和后于他人部署能力之间的区别。这是在最新的推理或代理能力方面建立市场地位,以及在竞争对手发布蒸馏版本后拼命追赶之间的区别。这是在开发下一个版本方面拥有 3 到 6 个月的领先优势,还是必须始终跟随前沿实验室的生产之间的区别。Anthropic 的对策,如行为指纹识别、检测分类器、访问控制、与其他主要实验室的情报共享。这些不会阻止蒸馏。它们会减缓它。而在能力曲线呈指数增长的领域,减缓前沿能力的获取速度几周或几个月确实会创造真正的竞争优势。这些是 Anthropic 正在采取的理性行动。这与驱动音乐行业 DRM、软件行业复制保护、电影发行防盗措施的逻辑完全相同。它们都没有真正阻止复制。它们都施加了摩擦。而这种摩擦,即发布和广泛可用性之间的延迟,就是金钱所在,先发优势窗口,即原始创造者拥有别人没有的东西的时期。人们通常在这个阶段讨论的最终结局是某种单一的人工超级智能时刻。你先到达那里,就是将死。我认为这是不成熟和错误的。仅计算的物理要求就让我认为任何一个实验室都不会在没有其他领域紧随其后的情况下实现不连续的智能爆炸。而投机性场景(如 AI 2027 文章)中的记忆和基础设施假设,对我来说都难以置信。更可能的是一种持续的竞争动态,即前沿实验室保持一种脆弱但实质性的领先。足够的优势足以在商业和战略上产生影响,但不足以构成无法逾越的护城河。勤奋维护的减速带是保持这种优势的关键。这是关键,也是我认为 Anthropic 的国家安全说法真正模糊的地方。蒸馏前沿模型的动机并非中国实验室独有。它是字面上的普遍性。每一个不是 Google、Anthropic 或 OpenAI 的实验室都面临着完全相同的压力梯度。从头开始训练前沿模型所需的计算量以数十亿美元计。蒸馏一个模型所需的计算量要低两个数量级。无论行为者是谁,蒸馏的回报率都将存在。想想这意味着什么。较小的美国实验室、欧洲初创公司、开源项目、学术研究小组、政府承包商。任何无法承担数十亿美元训练运行的人都有结构性动机去从能够承担的实验室那里提取能力。而且这些方法不一定像运行 24,000 个欺诈账户通过代理服务那样大胆,才能有用。蒸馏存在于一个光谱上。在一端,你可以有 Miniaax 式的工业提取。在另一端,你可以有一个研究人员使用 Claude 的输出来为其模型架构提供信息。合法使用和非法蒸馏之间的界限非常非常模糊,而且随着技术的进步,它会变得越来越模糊。即使是 Meta,地球上最大的科技公司之一,拥有几乎无限的计算能力和资金,也通过人才收购大幅推进了其 AI 能力。扎克伯格亲自从 Google、OpenAI 和 Anthropic 招募研究人员,提供九位数的报酬,并让他们成为核心团队。这是真的。他以 140 亿美元的价格收购了 Scale AI,这笔交易至少部分,如果不是大部分,是为了收购 Alexander Wang 和他的团队的专业知识。当 Llama 4 表现不佳并打破了 Meta 的开源叙事时,扎克伯格并没有加倍投入独立研究。他去寻找那些已经在别处完成了艰苦工作的人。现在,人才收购不是蒸馏,但它遵循完全相同的原则,不是吗?收购现有智能比独立开发它更便宜。从 Anthropic 跳槽到 Meta 的研究人员携带了关于训练技术、架构决策、数据策划方法和安全方法方面的知识,这些知识花费了数年和数十亿美元才开发出来。知识以某人的头脑而不是通过 API 流动而流失,但经济动态是相同的。这有一个直接的启示,我认为人们需要内化。当 Deep Seek 发布 R1,市场集体惊叹于一个中国实验室如何在他们声称的适度预算下产生了如此强大的推理能力时,正确的问题不是他们为什么做得这么便宜,尽管这是每个人都问的问题。正确的问题是,有多少能力是独立开发的。我认为 Anthropic 刚刚提供了一个部分答案。非超大规模实验室对蒸馏的依赖程度。顺便说一句,这绝不意味着在中国实验室和其他非超大规模的较小实验室中没有才华横溢的研究人员。绝对有。人才在那里。但无论是通过 API 提取、人才收购还是在前沿模型的输出上进行训练,从这些超大规模公司获取数据的动机都非常高。它比大多数人意识到的要高,并且将不可避免地驱动这些较小实验室的路线图,无论它们的才能水平如何,我对此深表尊重。这直接回到了流形问题。如果你的模型很大程度上是通过蒸馏构建的,它继承了蒸馏者目标设定的特定能力。它没有继承前沿训练产生的广泛的通用表示结构,这意味着模型对蒸馏的依赖程度越高(存在一个范围),其流形就越窄,在任何分布外的任务上的性能就越脆弱,并且在日益成为 100 倍和 1000 倍价值所在的长跑代理式工作上的表现就越差。模型的来源不仅仅是一个道德问题。它不仅仅是一个法律问题。它是一个能力问题。权重的来源确实决定了模型如何崩溃。这里就变得个人化了。因为这不仅仅是一个关于抽象地缘政治和公司间谍活动的故事。这是一个关于你现在使用的工具以及你将在下个季度、下个月、明年选择的工具的故事。如果你在一家超大规模公司(Google、Anthropic、OpenAI,也许还有 Meta)工作,你就是目标。不是抽象的。我是说个人。驱动 API 蒸馏的经济力量与人力情报行动是相同的。前沿实验室的研究人员曾被外国情报人员接触,他们通过非凡的薪酬方案被招募,有时甚至通过社会工程被攻陷。你脑海中关于训练技术、架构决策、安全方法、工具、数据策划方法等知识,其每公斤的价值超过了科技行业中的任何其他东西。请相应行事。如果你在一家刚刚发布了令人印象深刻的 AI 模型公司工作,而这家公司不是我提到的那些公司之一,不是超大规模公司,不是 Anthropic,不是 Google,请仔细看看这些能力来自哪里。这不是指责。这只是结构性的。蒸馏的动机是普遍的。并且,景观中的每一个非超大规模模型都存在于完全独立的研发和大量蒸馏提取之间的某个光谱上。而且它是灰色的。问题是你和你的模型在这个灰色光谱上的哪个位置,而答案直接关系到你应该在多大程度上信任模型的通用性。如果你是一名个人贡献者或团队负责人,正在为工作选择 AI 工具,你需要开始学习识别并要求工作中的通用性。我认为几乎所有人都会错过这一点,这是实际的收获。基准测试在这方面帮不了你。真正能帮助你的是测试其能力的广度。处理模型明显训练分布之外的任务的能力,使用工具和新颖的组合,在你的领域内保持扩展工作流程的连贯性,在你的工作领域内从意外故障中优雅地恢复。我无法为你编写那个测试。我可以告诉你,如果你看看你的领域,你应该能够为模型设计一个困难的任务,而且它应该足够困难,以至于任何模型都会崩溃,但它崩溃的方式应该能告诉你很多关于模型泛化能力的信息。如果模型在每次都完全相同的地方崩溃,如果模型在工具使用方面崩溃,如果模型在任务的持续注意力方面崩溃,那么这是一种与模型崩溃的方式非常不同的类型,而不是因为模型耗尽了精力或失去了注意力而崩溃,而是因为它选择的任务最终过于耗费 token,以至于它过度使用了其压缩窗口而无法继续。后者看起来更像是一个成功的通用模型在处理问题,只是耗尽了结构性内存。前者看起来更像是一个蒸馏模型。所以,选择一个你所在领域的复杂任务,而不是一个基准任务,一个你真正关心的任务,一个需要多个步骤、工具使用、判断的任务。在不同的模型上运行它。当两者都成功时,改变一个约束条件,而不是整个任务,改变一个变量。观察会发生什么。模型会适应吗?它会识别出其推理的哪些部分可以转移,哪些需要修改吗?还是它会从头开始重新生成一切,或者更糟的是,将旧解决方案强行适应新约束?这个我称之为“离流形探测”(off manifold probe)的测试,比许多排行榜分数更能告诉你模型底层的表示深度。与此同时,如果你是一名领导者,主张进行 AI 采购,那么具有广泛代理能力的前沿模型与更便宜、蒸馏或受限的替代方案之间的投资回报率(ROI)案例应该很明显。对于定义明确的狭窄任务,如客户服务分类、文档摘要、代码补全或已知模式,蒸馏模型可能提供极好的价值。对于开放式的、长期的、跨职能的工作,即越来越多地成为 AI 价值前沿的工作,你需要更宽的流形。你需要更广泛的能力体积。你需要通用性。而现在,这意味着超大规模公司的顶层堆栈,对吧?Opus 4.6、GPT 5.3、Gemini 3.1 Pro,无论是什么。不是因为基准测试这么说,而是因为真正的、前沿训练带来的表示深度才使得这些模型能够在新的情况下自主工作而不分裂。顺便说一句,Google 在这方面做得特别好。它们提供各种模型能力的即时智能,价格合理,可以让你将不同的任务路由到不同的推理深度。例如,Gemini Flash 用于快速分类,可能 3.1 Pro 在轻模式下用于更繁重的任务,3.1 Pro 在最大思维模式下用于困难的推理问题,或者 Opus 4.6 用于持续的代理式工作,Sonnet 4.6 用于更便宜但具有更大上下文窗口的模型。每个超大规模公司处理这个连续体的方式都不同。我认为 Google 在提供广泛的模型和有吸引力的每 token 价格方面做得很好。模型路由技能,即知道哪种问题类型对应哪种模型以及什么价格,这现在是一种竞争优势,坦率地说,理解这种技能曲线与成本的关系也是一种战略要务,不仅对首席信息官(CIO)如此,对董事会也是如此。这正在成为你业务中智能的成本,并且随着模型格局的分化,它将变得更有价值。如果你是一名高管,你还必须更宏观地看待。AI 能力正在变得无处不在。它正在融入客户互动、你的内部工作流程、你的产品开发、你的竞争情报。蒸馏格局意味着底线正在提高。即使是平庸的模型也能很好地处理常规任务,但天花板对于区分至关重要。你的任务是找到适合你工作的功能范围,并确保它稳定。确保你不是在构建关键工作流程,而这些工作流程是建立在从一个正在远离它们的前沿借来的模型之上的。稳定性意味着前沿访问,无论是直接访问还是通过模型真正独立扩展训练的提供商。看,大局比地缘政治看起来更简单。AI 能力正变得像水一样。它们渗入每一个裂缝。出口管制、访问限制、检测系统、行为指纹识别。这些是水坝和堤坝,对吧?它们有效。它们施加了有意义的摩擦。它们争取了时间。但它们背后的压力并没有减小。随着每一次能力提升,它都在增加,因为每一次能力提升都增加了提取的价值并降低了相对成本。Anthropic 的披露在这种背景下很重要,不是因为它揭示了一个独特的中国问题,而是因为它揭示了一个具有中国特色的普遍动态。特定的政治审查训练数据、与国家支持实验室的联系、规避地理访问限制等特征,是 PRC 上下文特有的。但潜在的经济力量,通过提取而非独立开发来获取前沿能力的惊人投资回报率,这适用于地球上的每个人。那么,在那个世界里,你该抓住什么?我建议三点。第一,假设前沿能力会泄露。问题是速度,而不是可能性。每一个安全措施都是一个减速带,而减速带很重要,因为能力曲线是指数级的。按照目前的发展速度,三个月的领先优势非常有意义。投资你的减速带。第二,蒸馏模型在某些方面系统性地比前沿模型差,而这些方面是基准测试无法捕捉到的,并且对最高价值的用例最重要。代理式工作的性能阴影很大,而且还在不断扩大,并且被严重低估了。在评估模型时,你必须测试通用性。不要只听基准测试。我描述的离流形探测是你的朋友。第三,能力格局已经足够分化,以至于你的工具选择比以往任何时候都更重要。我应该使用哪个 AI?这是错误的问题。考虑到我现在对这些模型是如何构建的以及这对它们实际能力意味着什么的了解,我应该为哪个问题使用哪个 AI?这就是正确的问题。那些能够很好地路由,根据对表示深度的真正理解而不是营销文案将问题与模型匹配的人,他们将比那些对所有事情都使用一种工具,并且选择便宜工具的人表现更好。我赞赏 Anthropic 揭开了面纱的一角,向我们展示了其下的东西。但我不同意他们。我认为不应该主要将其定性为冷战。它是一个压力梯度,而压力梯度不关心国界。祝你们好运。