Transcription
历史上最昂贵的赌注是人工智能赌注,但它与模型无关。OpenAI 的工程师在 5 天内两次将内部代码提交到公开的 GitHub 仓库,意外泄露了 ChadgPT 5.4 的存在。当然,互联网将这一切都变成了关于模型和 Chad GPT 5.4 的讨论。预测市场因此而活跃。炒作的帖子因此而活跃。关于代际飞跃的猜测在 Twitter 上爆发。这是典型的炒作周期。我不在乎模型。我正在录制这段视频,在 chat GPT 5 无论何时发布之前。它可能会发布。谁知道呢?你也不应该知道。这个模型只是一个更大、更重要事物的组成部分,而我们对此思考得不够。这是一个复合赌注,如果它成功了,将证明 OpenAI 巨额的 8400 亿美元估值是合理的,并且顺便说一句,它还将重塑整个企业软件堆栈。这里的解释需要深入到一个目前在人工智能讨论中没有人真正涉足的领域,因为它需要同时在脑海中掌握几个技术概念。而大多数评论老实说连一个都掌握不了。因此,这篇内容深入分析了我上周二月最后一周对 OpenAI 战略进行的报告。五角大楼的交易已经完成,OpenAI 巨额的融资。我们正在跟进,并展望 OpenAI 的下一步计划。简而言之,以下是我们即将遵循的论点。第一个能够真正利用企业级上下文的公司,能够存储、检索、推理、并以万亿 token 的规模进行操作。这样的公司不仅仅是赢得人工智能市场。它将成为新的企业数据平台。它将吞噬整个 SaaS 堆栈。它将成为组织知识的记录系统,其方式将使 Salesforce 的锁定效应看起来像杂志订阅。OpenAI 正在基础设施上投入 6000 亿美元进行赌博,他们相信自己是第一个能够到达那里的人。Anthropic 可能已经通过 Claude 的日常企业编码的有机重量,意外地接近了这一点。本质上,Anthropic 已经通过 Claude 代码偶然获得了一个巨大的锁定产品,并且他们正在利用这种竞争优势在企业中获得更大的立足点,尽管上周与五角大楼的戏剧性事件并未改变这一点。决定哪种方法获胜的因素是几乎没有人谈论的技术问题的答案。那是什么?前所未有的软件或人工智能的检索规模。因此,在我们审视这个问题之前,让我们先看看当前 SaaS 堆栈。我想让你想象当前 SaaS 堆栈就像一个文件柜。组织知识在哪里?我不是指那些有文档记录的知识。我指的是那些决定公司执行好坏的真实知识。目前,这些可操作的知识分散在十几个系统中。就像一个组织非常非常糟糕的文件柜。GitHub 中的代码,Confluence 页面中没人更新的架构决策,Salesforce 中的客户上下文,Jira 中的项目状态。有时,非正式的推理,即这些决策背后的原因,可能存在于滚动过去的 Slack 线程中,或者没人阅读的会议记录中,或者可能存在于那些考虑离职的高级人员的脑海中。这些系统中的每一个都是一个文件柜。因此,脆弱性不在于信息不存在。实际上,信息非常丰富。脆弱性在于综合层。综合层就是今天的人类大脑。我们没有好的替代品。而人类大脑的带宽有限。他们的上下文切换能力受损。我先看我。而且他们会在收到更好的报价时离开。当一名高级工程师辞职时,文件柜仍然是满的。消失的是知道该打开哪个文件柜以及如何将内容连接起来以产生有意义价值的人。我亲眼见过。任何在科技行业的人都亲眼见过,当一名高级工程师这样离开时。整个组织都能感受到。那是一场灾难性的损失。现在,我想让你在脑海中挥动魔杖,想象一个为你做这种综合工作的系统。它不是搜索引擎。它不是聊天机器人。它是一个不断从公司每个文件柜中摄取信息,维护组织知识的连贯模型,并以任何个人无法比拟的深度进行推理的系统。这个系统就是 OpenAI 正在努力构建的状态化运行时环境。如果它奏效,就会发生以下情况。文件柜变成数据源,而不是记录系统。Jira 不再是项目知识的存储地。它是代理摄取信号的地方,它将这些信号与代码更改、客户反馈和战略重点相结合,从而形成连贯的理解。SaaS 应用程序可以作为工作流工具得以保留,但智能层、综合层以及与之相关的价值将转移到一个上下文平台。顺便说一句,如果你错过了,我不是在开玩笑说 OpenAI 正在开发一个状态化运行时环境。这就在上周 OpenAI 巨额融资的官方新闻稿中。他们谈到了与 AWS 合作开发状态化运行时环境。我只是在连接已经公开的信息。从根本上说,我在这里描述的人工智能上下文平台不是一个新的产品类别。它是新的企业数据平台。它就是整个领域。它吞噬了它连接的每个记录系统的价值,因为价值从未在于数据存储。价值在于综合。因此,Salesforce 凭借拥有客户数据而价值数千亿美元。Service Now 凭借拥有 IT 工作流数据而价值 2000 亿美元。拥有所有企业数据综合层的公司,其价值将远超这两者之和。现在我想在这里小心一点。大多数企业都讨厌移动数据。我可以看到一种未来,许多企业选择将他们的数据保留在 Salesforce 等旧的记录系统中。但问题是,如果你是 Mark Beni off,保留数据并不是利润所在。如果你处于一个在综合和代理工作流方面被中间化(disintermediated)的境地,那么你作为 SaaS 业务将没有未来。Mark 也知道这一点。这也是他一直在大力推动代理力量(agent force)的原因之一。现在,当我这么说时,自然的反应是说,Nate,你看得太远了。鉴于我们模型的现状,仅上下文层是毫无价值的。但我在这里争论的不是仅上下文层。我承认,存储在某个运行时中的万亿 token 的组织记忆是一个垃圾场。它不是真正的资产。一个工程师要求代理重构一个支付模块,然后得不到连贯的响应,因为代理无法处理如此多的 token,这是完全无用的。相关的上下文需要以非常高的保真度进行检索。即使该上下文层的整体结构巨大,如果你正在构建企业上下文层,你也必须能够让某个代理在 10 万亿 token 的存储中可靠地找到 2000 个 token。这是一个关于推理什么重要的难题,它在技术上比当前人工智能系统擅长的任何事情都更难。需要明确的是,我并不一定确定我们会在 OpenAI 的下一个版本中实现这一点。事实上,我看到的一切都表明,我们需要在未来一年左右的多个版本中才能实现这一点。这是关于如果你是一个构建者,就放眼未来,并保持高光束,看到这个领域的发展方向。这将重塑我们所有人的工作。这不仅仅是关于构建者能做什么,或者你作为领导者在企业中能做什么。如果这个未来成为现实,我们所有的工作,我们每天接触的一切都将不同。OpenAI 目前公开进行的实际赌注是一个复合赌注。它由他们必须构建的四种能力组成。所有四种能力都必须协同工作,其中任何一种的失败都会使他们整个巨额的数千亿美元的赌注崩溃。那么,必须协同工作的四种赌注是什么?这让我想起了《十一罗汉》(Ocean's Eleven),对吧?第一,智能和上下文是乘法关系。给一个平庸的模型一百万 token 的组织历史,它会淹没。它会匹配表面上的相似性。它会找到一个听起来相关的讨论,但实际上是关于不同的服务,在不同的上下文中,它会自信地从中综合。连贯,当然,来源充分,也许吧,但错了。长上下文但推理能力弱实际上是有害的,企业会并且应该远离它。强大的推理模型改变了游戏规则。它区分了相关的决策和表面上相似但上下文不适用的决策。它将权衡跨会话的冲突证据。它将识别上下文何时不足。随着推理能力的增强,它们之间的关系变成乘法关系。推理能力的每一次增长都扩展了模型可以有效利用的上下文范围,并产生了非线性回报。这就是为什么每个 GPT 5.x 的次要版本都对上下文赌注至关重要。即使基准测试看起来是渐进的,那也不是重点。它们正在构建决定综合层实际可以合理利用多少组织上下文的智能基础。如果推理开始停滞,上下文层将从机构记忆(这是极其宝贵的)退化为仅仅是一个昂贵的、会产生幻觉的组织知识的 rag 管道,这是有害的,没有人会想要。因此,OpenAI 正在赌博他们能够将智能扩展到上下文价值呈乘法增长的程度。他们正在进行的第二个大赌注是不会腐烂的记忆。今天的人工智能记忆就像一个同事,他记得你的咖啡订单,但下周就忘了你谈话中的许多实质性细节。OpenAI 正在开发的状态化运行时环境需要前所未有的深度机构记忆。我想让你考虑一下,在一个大型工程组织内部,组织知识到底是什么样的。它是 2019 年构建支付服务的架构师,他知道但从未写下过重试逻辑与速率限制器存在特定交互,这会在特定负载模式下导致级联故障。之所以没有发生生产事故,只是因为团队在高峰期手动调整了阈值;或者是在 18 个月前做出的使用最终一致性读取的决定,理由是强一致性会增加 40 毫秒的不可接受的延迟。而这除了在一个存档的 Slack 线程和一个只有三个人参加的设计评审之外,没有记录下来,其中两人后来已经离开了。这种知识是脆弱的。它会蒸发。每一次离职、每一次重组、每一次轮班值守都会导致这种持续的组织遗忘和重新发现。我不知道有哪个工程组织不经历某种形式的这种遗忘。无论你的代码文档有多好,组织上下文都不是静态的。六个月前正确的决定可能已经被取代。上个季度推荐的架构模式可能在性能测试后被放弃了。保留上下文而不更新它的记忆。这比没有记忆更糟糕。这实际上是机构幻觉。这是工程师在公司工作了十年,自信地解释事物如何运作,但其依据是去年发现的信息。因此,为了成功,OpenAI 正在进行一项赌注,即记忆系统将是当前的。他们正在进行一项赌注,即记忆系统必须维护、解决矛盾、弃用过时的知识,并跟踪什么是当前的、什么是被取代的、什么是历史但相关的。模型是否能做到这一点是一个开放的研究问题,它还不是一个具有已知解决方案的工程问题。它绝对是 OpenAI 正在积极构建的更大愿景的核心。预计在 2026 年该领域将取得进展。第三个大赌注是检索问题,没有人真正谈论它。这是关键。当你的代理拥有数万亿 token 的组织历史时,当前的检索范式,rag,绝对无法解决问题。Rag 适用于事实查找。它在企业级组织上下文方面存在特定问题。它无法处理跨时间的关联查询。例如,如果你要求它找到导致当前漏洞的决策链,模型需要理解跨越多个月、多个事件的时间顺序和因果关系。而 rag 的工作方式不是这样的。它也无法区分当前上下文与不存在的系统相关的上下文。因此,如果关键字、实体、词汇相同,rag 就会认为它们是同一件事。随着语料库的增长,所有这些都会退化。因此,你会得到更多的假阳性,更多的近乎命取的检索,更多的从不相关上下文进行自信综合的机会。解决方案可能需要混合架构,跟踪实体和因果链的结构化索引,多粒度级别的分层记忆,时间状态跟踪,以及可能的长视域上下文的状态空间压缩。然而,这里的战略关键是。企业级检索质量在当前基准测试中是完全不可见的。没有人会评估在 10 万亿 token 中找到 2000 个相关 token,而相关性是由 8 个月的因果链定义的。第一个解决类似问题的公司将获得竞争对手无法从外部评估的领先优势。检索是决定我所谈论的其他三种能力最终是产生机构记忆系统还是机构幻觉系统的瓶颈。同样,OpenAI 正在公开开发上下文层,并且这是他们绝对正在解决的问题。预计在这里会有进展。第四个赌注是执行准确性。我称之为“信任速度执行”。因此,当一个代理在数周内自主运行数百个任务时,即使是微小的 5% 的每任务失败率也会迅速累积成系统性风险。要在这个上下文级别、这个时间长度上维持长期的代理工作流以提供这种价值,所需的准确率目标接近 99.5% 或更高,并且在各种任务中都能持续保持,包括组织上下文模糊、矛盾或不完整的情况。现在需要明确的是,我所谈论的每种能力都会加强其他能力。因此,更好的检索意味着更多的相关上下文。更好的智能意味着更谨慎的推理。更连贯的记忆意味着上下文反映现实。并且复合效应共同提高准确率。否则,一切都会崩溃。我们真正谈论的是发明新的企业记录系统。如果这个赌注成功了,这四个赌注一起,你得到的不是一个更好的工具。你将在企业堆栈中获得一个新层,它位于所有现有系统之上,并对所有系统进行综合。想想记录系统到底是什么。Salesforce 是客户关系记录系统,因为它是权威数据所在的地方。SAP 是企业资源记录系统。这些系统价值数千亿美元,不是因为它们存储数据非常好,而是因为它们是整个组织信任并在此基础上构建的规范来源。人工智能上下文平台将成为比任何单一数据类型更有价值的东西的记录系统。组织理解。不是客户数据,不是代码,不是项目状态。对所有这些如何关联、它们如何变化以及它们对当前决策意味着什么的综合理解。让我们考虑一个具体的场景。假设一位产品经理问道:“我们应该构建企业客户 X 一直要求的实时分析功能吗?”现在,没有机构上下文,这是一个非常单一维度的问题。有了 12 个月的累积组织上下文和一个有效运行的综合层,这个问题就会变得更复杂,因为回答这个问题的代理,假设这个赌注成功了。我们有一个很好的上下文层。回答相同问题的代理现在将借鉴客户描述需求的原始对话。另外三位企业客户提出了类似的要求,但有不同的限制。六个月前工程团队的评估是,当前管道无法支持实时规模。上个月的基础设施升级消除了这一限制,加上竞争分析显示两个竞争对手在第四季度发布了类似的功能,加上首席财务官的指示,新功能需要在两个季度内收回成本。没有一个人拥有所有这些上下文。换句话说,综合,即将零散的组织数据转化为连贯的决策基础,这目前需要将所有人召集到一间房间,或者进行为期一周的规划过程,或者两者兼有,或者仅仅是在信息不完整的情况下做出决定。如果上下文平台能够实现我所描述的格式,它将在几秒钟内完成这种综合。不是因为它比人聪明,而是因为它能够同时访问所有文件柜,并且能够连接任何个人都无法连接的信息,因为没有任何个人阅读过所有内容。这就是锁定效应。当企业的组织理解存在于该上下文平台时,切换到任何其他东西都意味着失去连接堆栈中所有其他系统的综合层。那个知道 Salesforce 数据如何与 GitHub 决策相关联,如何与董事会演示文稿相关联的代理。这种理解无法导出。这不是一个模型选择的对话。Salesforce 的锁定来自数据。上下文平台的锁定来自理解。数据最终是可移植的。一年的综合组织知识绝对不会是可移植的。这是企业软件中存在过的最深层次的技术锁定。你可以称之为理解锁定。你可以称之为智能锁定。一旦该平台运行起来,它将随着每一天的运行而复合增长。现在,我想让你和我一起快进一次。让我们谈谈这如何变成一个飞轮。当复合赌注在一个特定的企业中成功,并且你拥有一个活跃的上下文层时,该业务的价值增长是无情的。第一个月,智能但通用的代理,一个有才华的新员工,可以阅读维基百科。第三个月,代理已经处理了数百次代码审查和架构讨论。它们已经跨越了孤岛进行了综合。第六个月,代理知道没有人知道的事情,连接了在正常人类工作流程中永远不会浮现的团队之间的决策。老实说,它们可能比这学得更快。到了我们拥有成熟的安装时,无论这需要几个月,还是因为模型非常强大而只需要几天,你将有效地拥有一个代理网络,作为你企业的机构知识层运作。新工程师可能需要几周才能入职,但代理可以在几天内投入生产。代理可以加速入职,并立即指导整个企业的员工工作。换句话说,对我们所有人来说,将要改变的是,企业将变得如此代理化,以至于我们的日常工作将与为该上下文层做出贡献以及从中提取工作内容无法区分。每个人都将有效地拥有一个插件,该插件将推入该上下文层并从中提取工作内容。越来越多的管理决策将成为与代理合作以确定正确决策,然后将其委派出去的功能。我相信这就是未来的方向。我不确定谁会第一个构建它,但我们知道 OpenAI 正在朝着这个方向努力,并且我们知道这类技术正在吸引历史上最激烈的竞争。因此,我绝对会期望 Anthropic 和 Google 等公司也进入这个领域。现在问问自己,你拥有这个代理上下文层。现在是 2028 年。切换的成本是多少?不是订阅费,而是理解,是数月或数年积累的综合、决策历史、跨团队联系、从数百次代码审查和事件中获得的模式识别。所有这些都将消失。企业将回归到以人类作为集成层,并从头开始。这就是企业软件从未见过的机构捕获,而且它还在不断复合。没有自然的上限。你停留的时间越长,理解就越深,切换成本就越高。这就是这些人工智能模型公司的推销。这就是他们正在构建的未来。这就是真正重要的竞赛。它比 chat GPT 5. whatever 本周或下周发布更重要。我在这里描述的一切都适用于一场已经开始的竞赛。我所描述的飞轮对首先触发它的任何公司都有效,而 Anthropic 正在积极地尝试触发它。我知道我们在这段视频的大部分时间里都在谈论 OpenAI,但请想想。Claude Code 已经占领了超过一半的企业编码市场。Claude Code 正在生成无限的 Claude.markdown 文件、工作流模式、团队肌肉记忆、逐次会话构建的项目历史。现在,这些上下文目前没有被标记为战略资产。目前还没有以这种方式处理,尽管企业正在努力开发大量自己动手解决方案,但这些上下文非常有价值。企业知道它有价值,Claude 也知道。因此,虽然 OpenAI 正在与 AWS 一起在架构上构建组织规模的上下文捕获基础设施,但 Anthropic 目前的积累是自然的。它是产品驱动的,而且是自下而上的。如果采用是自下而上的,开发者选择工具和工作流是有机构建的,那么 Anthropic 可能有一个领先优势,如果他们能够找到产品化下一层的方法。OpenAI 所描述的状态化运行时尚未发布。我在这段视频中描述的赌注,我们需要更多的研究来了解它们何时会发生。我无法给你一个确切的月份和年份。这些是艰难的赌注。在我看来,假设整体取得巨大进展,它们至少需要一年时间才能全部完成。因此,如果 Anthropic 能够利用接下来的 12 个月,他们就有机会开始有机地与他们合作的公司一起构建这些碎片,并在 OpenAI 的大型基础设施计划从顶部下来之前,以及在 OpenAI 开始利用 AWS 的基础设施力量与 CIO 签署 MOS 协议,签署大量企业合同,仅仅通过推销“嘿,你有上下文。它来自 OpenAI。它运行在 AWS 上。”之前获得立足点。相信我,对于许多企业来说,仅凭这个推销就足够了。讽刺的是,Anthropic 通过日常使用有机积累的上下文可能比对 OpenAI AWS 解决方案感兴趣的公司通过架构捕获的上下文更有价值,因为它反映了人们的实际工作方式。使用 Cloud Code 六个月的开发人员已经构建了深度集成到他们实际流程中的工作流。从第一天起捕获上下文的运行时捕获的是关于尚未适应其存在的那些工作流的上下文。讽刺的是,这意味着 OpenAI 的方法可能一开始并没有那么有价值。现在,如果这个赌注成功了,并且 OpenAI 能够获得一个功能齐全的状态化运行时环境,那将无关紧要。需要明确的是,我不知道这何时会发生。我甚至不知道它是否会发生,因为有很多研究问题需要解决。但如果这个赌注成功了,那么 OpenAI 的优先级就很清楚了。Anthropic 每天与数百万开发者合作使用 Claude Code 来积累有意义的个人上下文,这一点将无关紧要。如果 OpenAI 拥有一个有效状态化运行时环境,并且是唯一拥有它的参与者,那么它在企业领域将拥有压倒性的优势,这将使其能够吞噬企业市场。所以,如果我是 Anthropic,我会非常仔细地考虑我未来六个月、九个月的路线图。最终结果确实不确定,这并不是我经常对一个玩家拥有 8 倍资本优势的市场所说的。但资本购买基础设施。它不一定购买产品市场契合度。从任何衡量标准来看,Cloud Code 都具有产品市场契合度。Codex 正在接近这一点,我们在过去几个月里看到用户数量翻了三倍,这是产品市场契合度蓬勃发展的证据。但 Codex 需要开始像 Claude Code 那样扩展,才能让 OpenAI 能够收获 Claude 目前并已经享受了数月的自下而上的上下文捕获。所以,我想以三个问题结束。从你的角度思考它们。你可能是开发者,可能是构建者,可能是领导者,可能是独立贡献者。无论如何,这将改变我们所有人的生活和工作方式,我们应该一起思考它。第一个问题,你组织的真正理解到底在哪里积累?我不是指数据记录系统。我指的是理解。如果你的工程师在使用 Claude Code,你的产品团队在使用 chat GPT,你的分析师在使用 Gemini,那么你在每个独立团队上都在构建有价值的资产,但你没有构建共同的理解。现在想想如何构建共同的理解。不要等待某个 OpenAI 产品经理或某个 OpenAI 工程师为你构建它。现在就思考你的理解,因为有一些方法可以获取这个上下文层的一部分,它提供了巨大的企业价值,而无需等待那么长时间。你现在可以致力于一个更原始的上下文层版本,但它在几千份文档、几十万份文档,甚至几百万份文档中具有良好的检索能力,并具有适当结构的标题、适当结构的分层标记等。有方法可以将上下文层扩展到团队级别,提供真正的价值,甚至跨团队级别。虽然我们还无法将 10 万亿 token 放在桌面上,但仅仅达到几百万 token 就将帮助你加速你团队的集体理解。这是构建者应该考虑的事情。这同样适用于那些被正式授予头衔的构建者,以及在独立团队工作并喜欢热情地进行黑客攻击的人。如果你是 CS 团队中的一个“氛围编码者”(vibe coder),这和你对工程的邀请一样。第二个主要问题是,你是否在运行一个飞轮?你的人工智能系统是否在进行某种复合改进?你只是允许人们尝试事物并看看什么有效,还是你正在有意地构建上下文和共享理解,以便你的系统随着时间的推移变得更聪明、更敏锐?检索是否正在改善?人工智能项目的执行是否越来越可靠?你是否在评估你的 AI 系统中哪些需要持续使用,哪些需要一次性使用?你是否在构建可以跨多个团队扩展的代理系统?如果很多问题的答案是“我不知道”,那么这绝对是你应该讨论的事情。顺便说一句,这不仅仅是领导团队的事情。这是需要你在所有级别上推广人工智能冠军的事情。在评估人工智能方面,没有“高管光环”。每个人都应该有发言权。第三个问题,我们的理解切换成本是多少?我想让你想象一下,你正在构建一个开始捕获你一些理解的系统。也许我在这段视频中描述的那个能够捕获你公司 98% 或 99% 理解的系统听起来很棒,但你不想等待。很好。不要等待。你不能赌那个。现在就构建。如果你达到了捕获你组织 20% 或 25% 甚至 30% 理解的程度,并且因此你已经遥遥领先,那么想想你的切换成本。如果你在内部构建它,需要多少努力来维持?如果 OpenAI 在 10 个月或 12 个月后提供一个测试版,你会在什么时候愿意切换?切换需要多少工作?你拥有的上下文有多可移植?你想把你的记录系统放在 OpenAI 吗?或者你是否在一个敏感的行业工作,并且在任何情况下都不会这样做?在这种情况下,你希望在你的上下文层上投入更多,因为我确信的一件事是,这是一项正在扩散的技术,一旦 OpenAI 解决了它,其他人也会解决它,我们将生活在一个 OpenAI 将为那些想要企业可靠性的人提供巨大锁定效应的世界,如果他们能够让这个赌注得到回报,然后也会有其他参与者,也许是 Anthropic,他们会推销类似的东西,并拥有他们自己不同风味的智能,正如我们已经看到的。然后,我们将有一群开源人士,或者专注于本地解决方案的人,提供不同程度的隐私、安全、易于访问、易于安装、易于迁移。这将是未来的软件市场。游戏还没有结束。不要看 chat GPT 5.3 或 5.4 的泄露信息,或者确切的发布日期,认为这很重要。是的,我敢肯定,当模型发布时,我会报道它有什么不同和新颖之处,并探讨实际影响。然后我们不会错过任何细节。但要更广泛地思考。思考 OpenAI 正在明显构建什么,以及为什么企业上下文市场如此重要。棋子已经摆好。时钟正在滴答作响,而我们大多数人却盯着错误的棋子。不要做那样的人。