Transcription
一月份,CLA 报告称其人工智能代理现在可以完成 853 名全职员工的工作,并为公司节省了 6000 万美元。在同一财报周期内,其首席执行官公开承认,人工智能战略的成本远远超过 6000 万美元,而他仍在努力将其赎回。
这不是又一个关于人工智能被过度炒作的故事。实际上恰恰相反。人工智能工作得太好了。而人工智能失败与人工智能在错误的事情上取得成功之间的区别,是当前企业人工智能领域最重要未解决的问题。
这比上下文工程本身更重要,尽管上下文工程也是其中的一部分。它比提示工程更重要,而提示工程坦率地说现在看起来像是一个热身表演。我将称之为“意图工程”。
意图工程是使组织目标(如目标、价值观、权衡、决策边界)机器可读和机器可操作的学科。这样,当您部署一个自主系统时,它就会针对您的公司实际需要进行优化,而不仅仅是它能够衡量的东西。
这是 CLA 的背景故事。
2024 年初,Ara 推出了一个由人工智能驱动的客户服务代理。在第一个月,它处理了 23 个市场的 230 万次对话,涉及 35 种语言。解决时间从 11 分钟缩短到 2 分钟。首席执行官预计节省 4000 万美元。
然后客户开始抱怨。答案通用,语气机械,无法处理任何需要判断的事情。
到 2025 年中期,首席执行官 Sebastian Seycowski 告诉彭博社,虽然成本是主要的评估因素,但结果是质量较低。“引述结束。”Clarin 开始疯狂地重新招聘它已经裁掉的人工代理。
大多数人将这个故事视为人工智能无法处理细微差别的证明,这在 2025 年初是一个令人欣慰的解读。2026 年一个更有趣的解读是,该人工智能代理在快速解决工单方面表现出色,而快速解决工单是给该代理的错误目标。Clara 的组织意图不是快速解决工单。它的真正目的是在竞争激烈的金融科技市场中建立持久的客户关系,从而带来终身价值。
这些是截然不同的目标,它们需要在互动点进行截然不同的决策。
在公司工作了五年的代理人直观地知道这种区别。她知道何时可以放宽政策,何时可以多花三分钟,因为客户的语气表明他们即将流失,何时效率是正确的做法,何时慷慨才是正确的做法。她知道这一点,因为她吸收了 Clara 的真实价值观。不是网站上的那些,而是那些在经理每天做出的决定中,在资深员工讲述给新员工的故事中编码的。在领导层在关键时刻真正关心的指标的潜规则中。
人工智能代理对此一无所知。它有一个提示。它有上下文。它没有意图。
我担心该人工智能代理在行为方式上无意中反映了 CLA 的真实价值观,因为 CLA 的真实价值观可能是首先省钱。尽管如此,客户还是进行了反击,并将 CLA 拉回了其自身的既定价值观。而这件好事,因为自该计划推出以来节省的 6000 万美元,远远不足以弥补 CLA 因成为人工智能的公众笑柄以及积极推动未能满足客户需求的客户服务解决方案而造成的声誉损害。
讽刺的是,在没有太多思考的情况下推出人工智能,但也许符合组织指令,反而比其他任何事情都更能推动 CLA 走向其自身的既定价值观。
我想在此故事上保持精确。这里的重点不是谈论 CLA 本身。重点是谈论我们对人工智能代理的组织意图是什么,我们的目标是什么,以及随着代理变得越来越复杂并自行运行更长的时间尺度,它们如何需要反映我们组织的更大视角和长期挑战。我们现在有运行数周的代理。我们很快就会有运行数月的代理。我们正处于一个需要认真思考代理如何与组织目标互动并从中受益的阶段,而 CLA 只是一个例子,说明为什么这很重要。
我想在此精确说明我们是如何走到这一步的,因为命名很重要。命名是我们建立共享理解的方式,我认为在意图和上下文方面,我们在正确命名事物方面有所欠缺。
提示工程是人工智能时代的第一个学科。它是个人化的、同步的、基于会话的。你坐在聊天窗口前,精心制作一个指令,然后迭代输出。这是一项个人技能,其价值也是个人的。这是催生了成千上万篇“如何写出完美的提示”博客文章的时代。其中大多数都很糟糕。
上下文工程紧随提示工程之后。这是行业目前正在努力解决的问题。Anthropic 在 2025 年 9 月发布了一篇基础性文章,将上下文工程定义为从精心制作孤立指令转变为精心制作人工智能系统运行的整个信息状态。Chains Harrison Chase 在一次红杉资本的采访中更直白地描述了这一点,他将其描述为“一切都是上下文工程”。
“上下文工程是一个很好的术语。我希望我能想到这个术语,因为它描述了我们在 Langchain 所做的一切,而不知道这个术语的存在。引述结束。”这相当不错。
上下文工程是目前行动所在的地方。构建 RAG 管道,连接 MCP 服务器,构建组织知识以便代理可以访问它。这是必要的,但还不够。我认为行业即将以一种非常昂贵的方式发现这一点。
意图工程。意图工程是第三个学科,也是几乎没有人正在为其构建的学科。上下文工程告诉代理需要知道什么。意图工程告诉代理想要什么。
这是将组织目标编码到基础设施中的实践,而不是系统提示中的散文,而是作为塑造代理如何自主做出决策的结构化、可操作的参数。这是本可以告诉 Clara 的人工智能代理的层:“是的,你可以在 90 秒内解决这个工单,但客户已经和我们合作多年了,他们的语气表明他们很沮丧。多花点时间。给他们找个专家。”目标是留存。
没有意图工程,你就会得到 Clara 所获得的,一个技术上很出色的代理,它针对的是完全错误的目标进行优化。你就会得到 Deloitte 2026 年企业人工智能状况报告在 24 个国家/地区对 3000 多名领导者进行的调查结果。84% 的公司没有根据人工智能能力重新设计工作岗位,只有 21% 的公司拥有成熟的代理治理模型。
这些数字不是技术故事。它们是意图失败。模型有效。上下文管道正在改进。缺失的是将人工智能能力与组织目标联系起来的组织基础设施。
我引用了上面 Deloitte 的失败统计数据。我想向您展示账簿的另一面,因为这种并列使这一切都令人非常困惑。
对人工智能的投资持续巨大且加速增长。Deloitte 的技术价值调查发现,57% 的受访者将 21% 到 50% 的数字化转型预算投入到人工智能自动化中,而 20% 的公司投资超过一半,平均为 7 亿美元(对于一家收入为 130 亿美元的公司而言)。KPMG 的第四季度人工智能脉搏调查显示,资本正在流向投资回报率信心上升的代理,从试点项目转向专业化平台。
Gartner 预测,到 2028 年,15% 的日常工作决策将由代理自主做出。我认为这可能太低了。
所以,钱是真的,部署是真的,结果却参差不齐。74% 的全球公司报告尚未从人工智能中看到切实的价值。麦肯锡发现 30% 的人工智能试点未能实现规模化影响。
这些数字与投资数字并存。如果你开始剥开洋葱,更仔细地理解事物,这里并没有真正的矛盾。
当我们谈论大规模投资和部署结果参差不齐的模式时,我们描述的是组织已经解决了“人工智能能否完成这项任务”的个体任务级别问题,但它们完全未能解决“人工智能能否以一种服务于我们的组织目标、大规模且具有适当判断力的方式完成这项任务”的问题。第二个问题是意图工程问题。
看看微软 Copilot 的情况。这是历史上投资最多的企业人工智能产品之一。微软向基础设施投入了数十亿美元,将人工智能嵌入到每个办公应用程序中,并推出了积极的企业销售活动。85% 的财富 500 强公司采用了它,但采用却停滞不前。Gartner 发现,只有 5% 的组织从 Copilot 试点转向更大规模的部署。只有大约 3% 的 Microsoft 365 用户总数实际上采用了付费的 Copilot。彭博社报道称,在大多数销售人员未能实现目标后,微软削减了内部销售目标。
即使在签署了六位数 Copilot 交易的公司内部,员工也进行了抵制。Reddit 论坛上充斥着数十亿美元公司的工程师们描述他们的组织正在降级许可证,因为员工更喜欢另一款人工智能,可能是 ChatGPT,也可能是 Claude。
Copilot 困境的标准解释集中在用户体验问题和模型质量上。这些无疑是真实存在的问题,但它们不是根本问题。根本问题在于,在没有组织意图对齐的情况下,在整个组织中部署人工智能工具,就像雇佣了 40,000 名新员工,但从未告诉他们公司做什么、它重视什么,或者如何做决策。你会得到很多活动,但很少有生产力。你会在仪表板上看到人工智能使用指标,但几乎不会对组织试图实现的目标产生任何可衡量的影响。这不是工具问题。这是意图差距。
我想变得结构化,因为关于人工智能转型的模糊不清的说法正是我们试图避免的,也是许多组织陷入困境的原因。
今天存在一个意图差距,它在三个不同的层面运作,每个层面都在不同的高度。正确处理其中任何一个都有帮助。正确处理所有三个是拥有人工智能工具和拥有人工智能原生组织之间的区别。
第一层是我将称之为“统一上下文基础设施”。这是行业最了解的层面,但它仍然没有真正建立起来。
目前,每个构建代理的团队都在构建自己的上下文堆栈。一个团队通过自定义 RAG 管道传输 Slack 数据。另一个团队手动将 Google Docs 导出到向量存储。第三个团队构建了一个连接到 Salesforce 但不连接到 Jira 的 MCP 服务器。第四个团队还不知道其他三个团队的存在。
这被一位分析师称为“影子代理问题”,它反映了早期云计算时代的“影子 IT”危机,只不过风险要高得多,因为代理不仅访问数据,还对其进行操作。安全和合规团队不允许开发人员笔记本上运行的任意未经审查的代理访问客户个人身份信息、财务数据或医疗记录等关键系统。但没有经过批准的基础设施,这正是正在发生的事情。
Anthropic 在 2024 年底推出的模型上下文协议(Model Context Protocol),并于 2025 年 12 月捐赠给 Linux 基金会,是目前标准化方面最有希望的尝试。UCP 得到了大量采用。OpenAI、Google、Microsoft 和 50 多家企业合作伙伴都已承诺支持它。它已成为事实上的标准。我认为月度 SDK 下载量接近 1 亿次。
但协议的采用和组织的实施是截然不同的。拥有 USB-C 标准没有帮助,如果你的公司还没有决定安装哪些端口,谁来维护它们,或者插入什么。
上下文基础设施问题并非真正是技术问题。你可以配置 MCP 服务器。这是架构和政治问题。哪些系统可以被代理访问?谁来决定代理在不同部门之间可以看到什么上下文?如何对组织知识进行版本控制,以确保代理不会基于过时的信息运行?如何处理销售团队的 Slack 上下文和工程团队的 Slack 上下文编码了完全不同的机构假设的事实?
Deloitte 的 2025 年调查发现,近一半的组织将数据可搜索性和数据可重用性列为阻碍人工智能自动化的主要挑战。我惊讶于这个数字不高。正如他们的分析师所说,所需的转变是从传统 ETL 数据管道到企业搜索和索引,类似于谷歌如何使万维网可发现。数据确实存在于公司内部。代理也越来越多地存在,但它们之间的连接线,即组织上下文层以及确保正确访问的结构和保障措施,在很大程度上并不存在。
现在,我们将进入第二层,“连贯的人工智能工作者工具包”。
所以,每个人都在推出自己的人工智能工作流程。一个人使用 Claude 进行研究,使用 ChatGPT 进行起草。另一个人使用 Cursor 进行编码,使用 Perplexity 进行事实核查。第三个人使用 Langraph 构建了一个自定义代理链。第四个人将内容复制粘贴到聊天窗口中。
这些员工中的任何一个都无法以可转移、可衡量或可由其他人改进的方式阐述他们的工作流程。这很重要,因为个人人工智能使用和组织人工智能利用之间的区别是巨大的。这就像拥有一个优秀的员工和一个让每个人都变得更好的系统之间的区别。这是我一年来一直在写的关于人工智能活动和人工智能流利性之间的区别。前者是你通过将人工智能附加到现有工作流程中获得的 30% 的收益。后者是你通过围绕人工智能能力重新思考工作流程本身而获得的 300% 的收益。
但我们需要认识到这一点。流利性不能仅仅通过培训来扩展。它通过共享基础设施来扩展。任何个人是否拥有 Slack 并不重要。代理是否能够搜索 50 个人的 Slack 上下文加上他们的文档加上他们的项目计划加上客户数据,这决定了代理是否能够完成组织规模的工作,而不是个人规模的任务。
Lloyd 的 2026 年报告发现,员工获得批准的人工智能工具的访问权限在一年内增加了 50%。但这并不意味着访问就足够了。组织经常提供工具,但没有提供给员工或他们的代理组织上下文和数据,使这些工具能够提供真正的价值。
而这正是 Clara 的故事与 Copilot 的故事相交的地方。没有组织基础设施部署的工具会变成非常昂贵的玩具。那 74% 的公司报告没有从人工智能中获得切实的价值,很可能不是因为模型有问题。它们失败是因为缺乏对人工智能工具如何与组织工作流程连接的共享理解,对人工智能自动化应该取代人类努力的地方,对它应该增强的地方,对人类判断应该不可协商的地方——所有这些 Clara 应该做的事情。所有那些 Copilot 的销售人员没有告诉你的事情。
这是当前企业人工智能领域的问题。我们没有认真对待数据和上下文层。这甚至不允许我们进入我们将要讨论的第三层。
真正的意图工程。这是几乎可以肯定在你公司中不存在的层面。我认为这是最重要的,它需要一些真正新的东西。
OKR 是为人类设计的。它们编码了人类可读的目标。它们假设人类对优先级、权衡、价值观和例外情况进行判断。它们假设经理可以看着下属的眼睛说:“这个季度重要的是这个。”并相信下属会通过机构背景、专业规范和数月数年形成的个人判断的网格来解释这些指导。
代理没有任何这些。代理不知道你公司的 OKR,除非你把它们放进上下文窗口。它不知道你的领导团队更喜欢哪些权衡,除非你以一种它可以采取行动的方式来编码这些偏好。它不知道一个应该升级的决定和一个它应该自主做出的决定之间的区别,除非你定义了边界。而且,与人类员工不同,代理不会通过六个月的潜移默化、全体会议、走廊谈话以及观察资深人士处理模糊情况来吸收你公司的文化。
当一个人类员工加入一家公司时,对齐是通过 100 种非正式机制实现的。你阅读维基百科,你进行 Slack 聊天,你培养判断力,你和某人一起参加欢乐时光。这些对代理都不起作用。代理需要明确的对齐,并且需要在它们开始工作之前,而不是六个月之后。
这意味着组织需要开发一种目前尚不存在的东西。机器可读的组织意图表达。想想这需要什么。这不仅仅是将 OKR 放入提示中。这是一个具体性的级联,大多数组织从未生产过,因为人类可以填补空白。这是一个具体性的级联,大多数组织从未生产过,因为人类可以填补空白。
在顶层,你需要代理可以解释和采取行动的目标结构,而不是“提高客户满意度”。这是一个人类可读的愿望。你需要一个代理可操作的目标。代理需要知道哪些信号表明我们背景下的客户满意度。哪些数据源包含这些信号?我被授权采取哪些行动来改进它们?我被授权做出哪些权衡?速度与彻底性,成本与质量,以及我不能跨越的硬性界限在哪里。
在此之下,你需要我称之为“委托框架”,将原则转化为决策边界。亚马逊的领导力原则对人类有效,因为人类可以通过情境判断来解释“客户至上”。代理需要将该原则分解。当客户请求 X 与策略 Y 冲突时,这里是解决层次结构。当数据表明行动 A,但客户表达了偏好 B 时,这里是决策逻辑。这些不是传统意义上的规则。它们是编码的判断。资深员工在五年后头脑中携带的那种组织知识,新员工会逐渐吸收。代理现在需要它。
在底层,你需要能够真正闭环的反馈机制。当代理做出决定时,它是否与组织意图一致?我们如何知道?这正是 Clara 所发生的事情。代理优化了解决速度,因为这是它可以衡量的目标。没有人编码了最重要的目标。关系质量、品牌信任、客户终身价值,以及何时高效何时慷慨的判断。这些目标存在于那些不得不离开的人工代理的头脑中,因为他们被解雇了。
“人类只是知道”的时代正在结束。意图工程是使人类所知变得明确、结构化和机器可操作的学科。不是因为人类正在离开(尽管其中一些人会),而是因为即将与人们一起工作的代理无法在没有它的情况下运作。
如果我希望你从这个视频中带走任何东西,那就是“如果我能做到意图工程,我就可以摆脱人们。”你应该将代理视为相当不可靠的参与者,并认识到你需要人类来编码意图工程并维护成功的、可扩展的代理系统。这才是你真正开始在生产中驱动代理的方式。
那么,为什么这还没有被构建出来呢?
首先,它确实是全新的。在代理能够长时间自主运行时,我们不需要这个。人类是意图层。代理从未需要理解组织意图,因为你就在那里。长时间运行的代理打破了模型,并要求一种新的思考方式。这就是这个视频的主题。
其次,理解组织战略的人(如高管)不是构建代理的人。而构建代理的人(如工程师)通常不理解组织战略。这是一个经典的“两种文化”问题。在人工智能领域,这个问题尤为严重,因为技术发展如此之快,以至于组织思想家无法跟上,而技术人员认为这不是他们的工作。
MIT 的研究发现,人工智能投资仍然主要被视为 CIO 的技术挑战,而不是需要整个组织领导的业务问题。这种框架将保证存在一个具有实际影响的意图差距。CIO 可以构建基础设施,但意图来自整个领导团队的共同努力。那些真正决定组织重视什么以及它如何进行权衡的人需要与工程部门进行更多交流。
第三,这非常困难。使组织意图明确和结构化极其困难。大多数组织从未这样做过。他们的目标存在于幻灯片中,存在于被半读半引用的 OKR 文档中,存在于在绩效评估中被引用的领导力原则中,但实际上它们并没有在经验丰富的员工的默契知识中得到操作化,这些员工知道在模糊的情况下该怎么做,即使他们从未被告知过。没有人拥有强大的肌肉,因为大多数组织从未锻炼过它们。
那么解决方案是什么样的呢?我不想只留下一个空白。
首先,在基础设施层面,你需要开发一个可组合的、供应商无关的架构,使代理能够安全地、大规模地跨系统、工具和模型运行。MCP 是一个示例协议层。但组织实施需要关于数据治理、访问控制、新鲜度保证和语义一致性的决策,没有任何一个协议能为你做出这些决定。那些能够很好地构建这些的公司将像对待数据仓库战略一样对待它——作为一项核心战略投资,而不仅仅是一项 IT 项目。
在工作流程层面,你需要我称之为“人工智能组织能力图”。一个共享的、活的理解,哪些工作流程已准备好由代理处理,哪些工作流程由代理增强(有人工参与),哪些工作流程仍然仅由人类处理。这不是一个静态文档,会被保存在 Confluence 中然后被遗忘。它是一个操作系统,随着代理能力的不断提高和组织上下文基础设施的成熟而不断发展。那些做得好的公司可能会创造一个新的角色。它可能被称为“人工智能工作流程架构师”,它将介于工程、运营和战略之间,这个人将在对齐方面非常忙碌。
在对齐层面,你需要真正新的东西。目标转换基础设施,将人类可读的组织目标转换为代理可操作的参数。这包括决策边界、升级、价值层级(例如代理如何解决权衡)以及反馈循环。你如何衡量和纠正随时间的对齐漂移。
Google 的代理开发套件是早期在技术层面正式化这一点的尝试之一。它将代理上下文分为不同的层:工作上下文、会话内存、长期内存和工件。每个都有特定的治理。
还有新兴的学术研究。Google DeepMind 研究人员最近的一篇论文提出了五种级别的人工智能代理自主性:操作员、协作者、顾问、批准者和观察者,每种都有不同的意图对齐要求和不同的人工监督模型。
这些只是早期的草图。集成系统确实是空白的。构建上下文基础设施加上工作流程映射加上意图对齐是新的,并且是一项巨大的挑战。
如果 OKR 是让英特尔在 70 年代将数千名人类与共享目标对齐的管理创新,那么意图工程就是让组织在 2026 年将数百或数千或数万名代理与这些相同目标对齐的管理创新。而这些代理的运行速度和规模是任何人类经理都无法监督的。
这种平行关系是直接的。紧迫性从未如此之大。OKR 花了几十年才成为标准的管理实践。我们没有 20 年的时间等待。
在过去的三年里,人工智能竞赛一直被定性为一场智能竞赛。谁拥有最好的模型?谁能登上最佳基准?谁拥有最大的上下文窗口?当模型是瓶颈时,这种框架是有意义的。但今天,模型不是瓶颈。对于大多数组织用例来说不是。像 Opus 4.6、Gemini 3 或 GPT 5.2 这样的前沿模型。它们都具有非凡的能力。它们之间的差异远不如那些为它们提供清晰、结构化、目标对齐意图的组织与那些没有的组织之间的差异重要。
这场竞赛是一场意图竞赛。不是看谁的系统里有最聪明的人工智能,而是看谁构建了组织基础设施,让人工智能能够以最全面、最准确、最符合战略的方式理解组织试图实现的目标。拥有平庸模型但拥有非凡组织意图基础设施的公司,将每次都胜过拥有前沿模型但拥有碎片化、无法访问、未对齐的组织知识的公司。
这意味着 2026 年最重要的人工智能投资实际上不是模型订阅。也不是另一个 Copilot 许可证。而是组织意图架构。让你的公司的目标、价值观、决策框架和权衡层级可发现、结构化且对代理可操作。这是构建对齐基础设施,让代理做出不仅技术上正确,而且在战略上连贯的决策。这是开发共享语言和共享系统,使人工智能能力能够从一个英雄工程师扩展到 40,000 名协同工作的知识工作者。
Clara 的故事不是“人工智能不起作用”。人工智能起作用了,而且非常出色。这就是问题所在。它在优化可衡量目标方面做得太好了,以至于没有人注意到它正在摧毁那些真正重要的目标。信任。被裁掉的 700 名人工代理带走了真正重要的机构知识。那些从未被记录下来的知识。人类只是知道。
教训是构建意图层,这样代理就不需要通过潜移默化来吸收组织价值观,因为它们做不到。教训是认识到代理需要人类与它们一起工作。
也许 Clara 终于明白了,提示工程时代问道:“我如何与人工智能交谈?”上下文工程时代现在正在问我们:“人工智能需要知道什么?”而意图工程时代才刚刚开始问我们真正重要的问题:“组织需要人工智能想要什么才能提高生产力?”
没有意图的上下文就像一把装满的枪,没有目标。我们花了数年时间构建人工智能系统。2026 年是我们学会将它们瞄准真正重要的组织意图的一年。
如果你正在听这段视频,你参与了这些层面的一个或多个。每个人都参与其中,从那些与这些系统对抗并练习提示和尝试使用它们来收集上下文的个人贡献者,到系统设计者,再到高管。我们都有责任构建能够使代理能够根据组织价值观进行生产性行动的层。
如果我们不小心,未能这样做将导致人工智能代理对企业造成实际伤害。这就是 Clara 所学到的。不要这样做。构建能够以组织规模编码上下文和意图的系统。时钟在滴答作响。而那些这样做的团队将能够更有信心地释放那些运行数周,很快就能运行数月的代理的力量,而不是那些构建没有编码意图、没有编码价值观、没有编码权衡的系统的人,那些你无法信任代理不会因为你告诉他们缩短通话时间而挂断客户电话的人。不要这样做。为长期意图而构建,因为具有长期意图的代理是