📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

20 People. $100M Revenue. The 5 Operations Behind Every Tiny Team Beating a Giant One.

AI News & Strategy Daily | Nate B Jones28:44

Transcription

迄今为止,历史上的所有劳动力技能都有一个终点,一个完成的点。人工智能没有。想象一个气泡。气泡内的空气是人工智能代理今天能够可靠完成的一切。气泡外的空气是仍然需要人类完成的一切。气泡的表面,那层薄薄的弯曲膜,那就是现在有趣的工作正在发生的地方。在那里,你决定什么可以委托,什么可以保留,如何验证代理的输出,在哪里进行干预,如何构建这种交接。在这个表面上做得好,是当今经济中最有价值的专业能力。但事情是这样的,这个气泡正在膨胀。每一次模型发布,每一次能力飞跃,每一次在推理、上下文或工具使用方面的季度性飞跃,气泡都在不断变大。曾经在表面上的任务迁移到气泡内部,那里是代理所在的地方。边界不断向外移动。一个学会了在十一月气泡表面工作的人,现在正站在气泡内部,做着一个代理比她做得更好的工作。针对不再存在于人工智能模型中的故障模式运行验证检查。但请注意还会发生什么。但这只是故事的简单部分。每个人都在谈论这一点。让我们超越它。注意气泡膨胀时会发生什么。表面积增加。随着人工智能能力越来越强,前沿并没有缩小。它实际上在增长。有更多的边界可以操作,有更多的空间可以进行人类判断,而不是更少。人与代理工作之间的接缝更多,而不是更少。关于什么会穿过人工智能代理膜,什么不会,需要更多的判断。在这个新的边缘有更多的验证挑战。需要更多的决定,关于人类的注意力在哪里创造了以前不需要创造的价值。每一个先前的工作技能,无论你是在谈论读写能力、计算能力、计算机读写能力还是编码,都是一个目的地。你到达了它,你掌握了它,你就完成了。目标不动。但是在这个人工智能气泡表面工作的技能没有固定的目的地,因为表面一直在向外扩张。你不能一次性学会它。你可以学会停留在上面,随着它的扩张而移动,在你脚下的曲率变化时保持你的立足点。但这是一种与任何劳动力发展系统曾经被要求生产的技能根本不同的技能。我们正试图用固定目的地的方法来教授这种不断扩张的表面技能集。每一个课程,每一个认证,每一个培训项目都假设目标是静止的。这个不是。经济所需技能与我们建立的基础设施之间的不匹配,是我在全球劳动力市场中见过的最昂贵的差距。我给这项技能起了一个名字。它叫做前沿运营。那个气泡的表面就是前沿。在上面工作,感知它的位置,在人工智能和人类之间构建交接,维护一个关于代理在当前边缘如何失败的模型,预测表面接下来会扩展到哪里,决定你的注意力在哪里创造最大的价值。这就是前沿运营。这就是最优秀的前沿人工智能运营。这不是人工智能素养。那只是知道什么是语言模型以及如何写提示。这相当于教一个人字母表,然后称他们为读者。它也不是提示工程。那是实践中一个组成部分的单一技术。这就像称手术为手术刀处理。它也不是那种往往填满许多关于工作未来主题演讲的含糊的人类判断的姿态。因为大多数人正确地认识到判断很重要,但他们错误地认为命名它等同于教授它。在这个快速发展的世界里,前沿运营是每个人都在指向但很少有人在构建的技能的具体、可行的、可访问的版本。它确实有组成部分。它确实通过实践得到发展。如果你不维护它,它就会退化。而且它是历史上第一个大约以季度为周期过期的劳动力技能,这意味着我们所知道的关于如何教授劳动力技能的一切,对于这项技能来说都不太奏效。那么,盒子里有什么?我将其命名为前沿运营,但我不会仅仅指向它然后站在那里含糊地说它很棒。有五种前沿运营。如果你将世界想象成一个不断扩张的人工智能能力气泡,我认为这是非常准确的,有五种技能可以在这个气泡不断扩张的表面区域中保持持久。第一个是我称之为边界感知。这是在给定领域内,保持对人类代理边界所在位置的准确、最新的操作直觉的能力。这不是静态知识。它会随着每一次模型发布,每一次能力飞跃,每一次代理处理长上下文或工具使用的细微变化而更新。Opus 4.5 无法可靠地从长文档的深处检索信息。三个月后,Opus 4.6 在 256,000 个 token 的检索上得分 93%。一个根据十一月模型校准了其边界感知但没有更新的人,现在要么过度信任,要么低估了二月模型。这两种错误都非常昂贵。所以这项技能是保持校准,而不是一次拥有它。那么在实践中这看起来是什么样的?对于产品经理来说,良好的边界感知意味着让代理起草一份可信的竞争分析,但要意识到同一个代理会错过它从未观察到或没有上下文的两个高管之间的政治动态。因此,产品经理不会将整个分析交给代理。他们将市场规模和功能比较部分交给代理。这些任务现在安全地在人工智能气泡内。然后产品经理为自己保留利益相关者动态部分。而上个季度那个气泡更小,也许功能比较是手动更新了一半。不再是了。它已经更新了。假设你是一名营销总监。这可能看起来像代理生成一份扎实的初稿营销文案和 A/B 测试标题变体。但也许品牌语调在第三或第四个版本后会微妙地偏离。好吧,你使用代理进行构思。你使用代理进行初稿。你自己编辑语调,并且不要求它迭代到第二个版本之后。糟糕的情况是营销总监信任一切并被幻觉所困扰,或者什么都不信任并手动完成所有工作。最常见的情况是营销总监可能在六个月前进行了校准,但没有注意到边界已经移动。营销总监没有将边界感知作为一项技能。这是第二项技能,接缝设计。这是构建工作的方式,使得人类和代理阶段之间的过渡干净、可验证且可恢复。这非常像一种架构技能。它更接近于一个好的工程经理如何思考系统边界,而不是一个个人贡献者如何思考他们的任务。从事接缝设计的人会问,如果我将这个项目分成七个不同的阶段,其中三个是完全由代理执行的,其中两个需要人工介入,而其中两个仍然是不可简化的由人类完成的?什么工件会在每个阶段之间传递?在每个过渡点我需要看到什么才能知道事情正在按计划进行?这之所以是一项非常独特的技能,而不是仅仅是披着项目管理外衣的项目管理,是因为答案会随着能力的变化而变化。所以上个季度接缝的位置是正确的,这个季度就错了。因此,这项技能不在于一次性设计,而在于随着代理能力的变化而重新设计的才能。因此,这可能看起来像一家公司的软件工程主管,他构建了交接流程,使得工单分类和工作路由交给代理。架构决策仍然由人类负责,而这两者之间的边界由特定的工件定义。工单的内容、代码库的结构、组织结构图,然后你在该接缝处有特定的验证检查,以确保交接是干净的。没有这些,你要么完全由代理端到端运行,而你还没有建立可靠的验证基础设施,要么由人类手动审查代理现在做得比他们好的事情。另一个例子可能是咨询项目经理。假设他们将战略项目分解为研究(由代理主导,人类定义范围)和综合(由人类主导,代理生成初稿框架)以及客户演示(由人类主导,代理生成幻灯片草稿)。研究和综合之间的接缝是一个结构化的可交付成果。它是一个带有来源引用的事实基础,人类可以在几分钟内进行抽查。几个月前,这个接缝会包括对每个数据点的手动事实验证,但代理的引用准确性已大大提高,因此咨询项目经理将接缝移到那里是有意义的。第三项技能是故障模型维护。这是维护一个准确的当前人类对代理如何失败的心理模型的能力。不是说它们会失败,而是指在当前能力水平下失败的具体纹理和形状。这一点非常重要。早期的语言模型失败得非常明显,对吧?它们有乱码的文本。它们可能有错误的事实。它们可能有不连贯的推理。当前的前沿模型以非常微妙的方式失败。它们有听起来正确的分析,但建立在错误的假设之上,或者有合理的代码,可以处理正常情况,但在边缘情况下会失败。或者研究摘要准确率达到 98%,而剩余的 2% 被自信地伪造,并且很难与准确的部分区分开来,除非你对该领域非常了解。所以这里的技能不是对人工智能输出持怀疑态度。这是必要的,但不是特别有用。这就像说手术的技能是小心。技能实际上是维护一个差异化的故障模型。知道对于任务类型 A,代理的故障模式是 X,并且在这里是关于如何在你的领域中很好地检查它。对于任务类型 B,故障模式是 Y,并且有不同的检查方法。这可能看起来像一个公司律师,他知道审查合同的代理会发现样板问题,但会错过赔偿条款,或者可能错过非标准终止语言,或者可能错过特定责任上限与第七条以及隐藏在附录中的豁免条款之间的相互作用。所以,目前的故障模型可能说,信任样板扫描,手动审查责任条款和附录之间的交叉引用。这与再次阅读整个文件非常不同。而且花费的时间要少得多,并且可以让你在工作中更加精确,效率更高。数据科学家可能会知道,生成用于数据分析的 Python 的代理会非常可靠地处理 pandas 转换和标准统计测试,但在数据具有混乱的边缘情况(如混合数据格式、隐式空值或数据集中间含义发生变化的列)时,会产生一些听起来合理的胡言乱语。因此,故障模型说要验证数据清理步骤和关于列语义的假设,然后在清理正确的情况下信任大部分下游分析。这里的糟糕情况是什么?糟糕的情况是应用相同的通用怀疑态度来处理所有事情,这非常低效,对吧?它假设六个月前的记忆化故障模式仍然有效,而实际上是不正确的。这是第四项技能。能力预测。这是做出非常合理的短期预测的能力,关于人工智能的气泡边界接下来会移动到哪里,并据此投资学习和工作流程开发。这并不是要预测人工智能的未来。实际上,没有人能够长期可靠地做到这一点。它是关于足够好地阅读轨迹,以便在接下来的 6 到 12 个月内做出非常明智的赌注,关于什么可能成为代理的领域。把它想象成阅读海浪。冲浪者不会确切地预测下一波浪会是什么样子,但一个好的冲浪者会阅读大海,了解海床如何塑造特定冲浪点的海浪,并把自己定位在最有可能形成下一波可冲浪海浪的地方。这项技能非常像是概率性定位,而不是线性预测。因此,一个在 2025 年初具有良好能力预测能力的人,可以查看编码代理在 30 分钟持续自主性方面的轨迹,然后看到它如何从那里扩展,并开始更多地投资于代码审查和规范技能,而不是仅仅原始编码。与此同时,一个关注代理在调查设计和定性编码方面越来越强的用户体验研究员,可以开始投资于解释性综合。将编码数据转化为能够改变路线图的产品见解的技能。因此,编码正在迁移到气泡内部。编码的“所以呢”就是新的表面所在的地方。那么这里的糟糕情况是什么?它可能看起来像追逐每一个新工具,这令人筋疲力尽,并且并没有真正产生复合回报,或者它可能看起来像忽略发展,直到你被迫追赶。最常见的情况是,它倾向于大量投资于学习一个特定的平台,然后当下一个模型发生变化时,该平台的优势可能会消失,要么删除工作流程的那个部分,要么提供该平台本身无法提供的杠杆。随着大型语言模型吞噬越来越多的能力空间,我们一次又一次地看到了这种情况。第五项技能是杠杆校准。这是在代理丰富的环境中做出高质量决策的能力,关于在哪里花费人类注意力,而人类注意力现在是最稀缺的资源。随着代理能力的不断提高,瓶颈从完成事情转移到知道什么事情值得人类关注。即使是麦肯锡也有一个框架,描述了 2 到 5 名人类监督 50 到 100 名代理运行端到端流程。这不仅仅是麦肯锡。它是行业中许多不同的代理模式的汇合。大约 10:1 的比例使得注意力的数学非常非常清楚。如果你每天有 100 个代理输出流和 8 小时,你无法以相同的深度审查所有内容。这项技能将是在实时中对你自己的注意力进行分类。因此,这可能看起来像一名工程经理,负责监督五个团队的代理辅助开发,并且该经理开发了分层注意力分配。大多数代理生成的代码都通过自动化测试套件,并自行进行代码风格检查。一小部分,如计费或数据管道,可能会被标记为人工代码审查。只有架构决策和跨系统更改可能会被标记为深度人工参与。因此,一个好的经理会每月重新校准这些阈值,因为代理在常规层面上不断提高,而你不断发现属于中间层的人工接触层的新类别。负责代理处理支持工单的客户成功主管可能会审查升级和随机抽样的已解决工单以确保质量。但她不会审查常规密码重置的解决方案。她会审查代理访问账户修改工具的每一张工单。这个阈值最终会根据风险进行校准,并随着代理在她特定的工单系统上使用工具的能力越来越强而进行调整。那么,这里的糟糕情况可能是什么?它可能看起来像以相同的深度审查所有内容,这会造成瓶颈,导致人类倦怠。或者它可能看起来像什么都不审查,如果你有意试点一个黑暗工厂模式,你才会这样做。即使技术上今天可行,也非常非常少的团队为此做好了准备。这些不是一个清单。它们是五种同时、集成且连续的操作。它是一种实践方式,就像驾驶涉及转向、速度管理、路线意识和危险感知,所有这些都同时进行。在任何给定时刻,在前沿操作的人都在感知当前边界。他们围绕它设计接缝。他们根据更新的故障模型进行验证,并对边界将如何移动进行预测,并在此系统上分配注意力。集成是使其成为一种实践而不是课程的原因。你可以单独教授每个组成部分,但一个在所有五个方面都单独出色但没有同时运行它们的人,仍然没有在前沿操作,因为他们正在考虑将这些技能付诸实践,而不是将它们无缝地结合在一起,作为一种商业方式,作为一种工作方式,作为人工智能和人类协作的未来。这个技能差距是结构性的。其他所有与人工智能相关的技能最终都可能被技术本身吸收。提示技术开始被烘焙到系统默认设置中,提示正在上升到一个更高的层面,比如意图工程。集成模式正在产品化,但前沿人工智能运营,你无法真正自动化它们,因为根据定义,存在一个人工智能能力表面。因此,当一个任务迁移到人工智能气泡内部时,表面就会向外扩展,而操作表面的人会随之移动。这项技能在结构上抵抗了自身的过时。我还要指出,结构性差距会累积。一个比同行早六个月开发出这项技能的人,他们不仅仅是领先了六个月。他们有六个月的更新校准,而同行没有。而且由于能力正在加速,每次模型发布时,校准和未校准之间的距离都会越来越大。因此,二月份边界感知仍然是当前的,而去年八月份边界感知仍然是当前的这两个人,他们的操作能力相差甚远。这实际上是生产部署中不断出现的巨大杠杆数字背后的机制。当你看到,你知道,光标在收入方面取得了惊人的数字,少数人却能做到同样的事情。当你看到 Anthropic 团队每次我转过身来都在发货时,AI 原生公司在发货和收入之间的差距,以及传统 SaaS 公司在发货和收入之间的差距,并不是真正由更好的工具来解释的。它是由那些已经发展出操作实践,能够处于气泡边缘并将这些工具转化为可靠输出的人来解释的,因为人工智能在不断发展。我相信这项技能集不仅是哪些企业在未来十年内倾向于成功的最重要的决定因素,也是哪些经济体在未来十年内开始获胜的最重要的决定因素。这不仅仅是关于哪些经济体构建模型,因为模型可以通过互联网移植。这不仅仅是关于哪些经济体拥有计算能力,因为计算能力可以租赁。这将是关于哪些经济体能够部署在人工智能和人类前沿出色运作的工人。模型正在商品化。计算能力正在各地建设。将继续稀缺的是将这些投入转化为经济产出的人类能力。随着计算能力变得越来越丰富,我们将需要进行更多关于这个话题的对话。所以你可能会想,如果你试图培养这项技能,那实际上是什么样的?好吧,第一,作为领导者,你应该建立实践环境,而不是课程。就像飞行模拟器帮助你学习飞行一样,在沙箱中模拟人工智能环境对于人工智能时代的工作很重要。这比这重要得多。实践环境是代理具有不同能力水平的地方,故障模式是现实的,规则可以改变,因此从业者必须重新校准。这比看一堆幻灯片说你参加了一个人工智能研讨会要实际得多。你必须经常接触人工智能才能获得技能。第二,我为领导者提出的建议是衡量校准,而不是知识。正确的评估不是你知道你能写一个好的提示。而是给定一个任务和一个能力级别为 X 的代理,你是否能准确预测代理将在哪里成功,在哪里会失败,以及如何相应地构建你的工作。这比写一个好的提示要难得多,但它是一项更持久的技能,因为它衡量了人类与人工智能一起工作的能力,因为人工智能在不断扩展。第三,最大化反馈密度,而不是培训时间。技能发展的速度实际上取决于一个人每单位时间通过人工智能获得的周期数。它并不是培训时间的线性函数。因此,一个完成 40 小时人工智能课程但之后回到工作岗位,但除了轻度使用 ChatGPT 之外从未真正接触过人工智能工具的人,几乎没有校准周期。一个跳过该课程,然后每天将 10 个实际任务委托给代理并评估输出的人,将在 10 天内完成一百个。确保你了解人工智能的暴露如何实际影响你团队的反馈密度。第四,为前沿运营创建明确的角色。如果这项技能只是别人工作的一部分,它就不会发展。组织需要那些其特定职能是在边界处操作,维护故障模型,更新验证协议,以及在能力发生变化时重新设计工作流程的人。你可以称他们为人工智能自动化负责人,你可以称他们为委托架构师,你可以称他们为前沿工程师。头衔不如认识到这个不断发展的自动化前沿的过程具有很高的杠杆作用,它是一项独特的专业,你需要有人专注于此,以便你可以积极地在整个业务中推广变革。许多为前代理时代构建的组织结构图假设产出与人数成正比。更多的人等于更多的产出。但有了前沿运营,你正在颠倒这一点。产出与杠杆成正比,杠杆与少数人类在边界处的运作程度成正比。因此,重要的组织单位就像一个微小的团队。我在这里看到了两种重要的结构。第一种是单人团队。一个人拥有非常强大的前沿运营技能,他可以跨领域运行多个代理工作流程。那个人负责边界感知,设计接缝,维护故障模型,并校准注意力。他们的产出看起来像是几年前一个五到十人的团队产生的。不是因为他们工作更努力,而是因为他们不断委托并智能地验证。这非常像是 AI 原生公司围绕着一个人拥有高杠杆率的想法运作,并且如果你让他们自由发挥,他们可以做惊人的事情。这在人才门槛很高的情况下是有效的。领域得到了很好的理解。反馈循环非常紧密,工作集中在探索性绿色领域或主要执行已知的模式。一个五人团队,就像一个小团队,通常有一个人拥有深厚的前沿运营技能。他们可能有几个人正在发展这项技能,他们可能有几个专家,他们的领域专业知识是不可替代的,但他们的操作技能在构建方面稍微少一些。请记住,在人工智能时代,这一切都是一个光谱。因此,在这种情况下,前沿操作员为团队设定接缝,维护故障模型,为团队校准注意力分配,而其他人则执行,不用担心,在这些结构中有大量的人工智能,并通过实践发展他们自己的人工智能直觉,因为人工智能模型在不断发展。这有点像外科团队的运作方式。一个领导者看到整个领域,其他人在互补的技能边界之间分开,在配合良好的角色中执行。因此,在产品开发中,这可能看起来像一个前沿操作员,他负责整个产品表面的用户代理工作流程,几个工程师执行繁重的人工代理辅助开发,也许一个设计师运行人工代理辅助原型设计和用户研究,并也提交代码,也许一个数据科学家管理分析管道。他们以一个 20 人团队的速度发货,因为操作员保持接缝非常最新,并且故障模型已校准。哦,顺便说一句,操作员也在发货,而团队中的其他人拥有足够的前沿技能来在无人监督的情况下执行。所以你可能会想,这如何向上层级化?我认为最简单的思考方式是考虑你想在哪里加倍你的赌注。如果单人团队能够有效地发现更深入参与的机会,而五人团队能够构建有意义的产品,那么一个从那里向上层级化的团队实际上专注于两个领域之一。要么你有一个你作为领导者管理的赌注组合,并且你将其分配给四个或五个五人团队,要么你处于一个寻找一个大赢家的位置,你选择一个五人团队或一个正在探索性工作中进行工作的单人团队,然后你召集你的整个团队加倍下注,并生产出真正打磨的东西。以及你如何分配它很大程度上取决于你的业务战略和产品战略,这必须比以前从高层领导那里下放得更远。你需要管理四个或五个五人团队的人,在这一点上必须和你的 CEO 一样具有战略眼光。那么你在招聘这项技能时会寻找什么?它不一定是传统的招聘信号。凭证、经验年限、工具熟练度,这些不一定有用。相反,你想看看这个人是否在她的领域内跟踪代理的成功和失败。她能否具体说明代理今天能做什么,不能做什么?她能否描述一项新能力或立即开始重新设计工作流程?或者某件事只是被归类为有趣而从未采取行动?这个人有故障模型吗?不是通用的怀疑,而是对代理在哪些任务上失败的差异化理解。是否存在一个可靠的预测趋势,你可以看到她对未来走向有非常好的直觉。能够高质量地回答这些问题的就是你的前沿操作员。回答“嗯,我擅长提示”的人,不是你的前沿操作员。假设你想提高这项技能。这对你意味着什么?如果你是一名个人贡献者,你需要开始跟踪你的边界感知在哪里是错误的。你需要跟踪代理在哪里让你感到惊讶。惊喜是一个信号。你想要有意识地收集你的惊喜,记录它们,并开始建立你的专业直觉,以便你更好地理解代理在哪里操作,代理在哪里工作,代理在哪里不工作。如果你的代理最近没有让你感到惊讶,那么你肯定没有在前沿操作。如果你管理人员,你需要看看你的团队如何分配代理辅助工作的注意力。他们是否以相同的深度审查所有内容?是否存在一个被伪装成尽职调查的瓶颈?他们是否什么都不审查?正确的答案将根据你的领域而有所不同,但由你来确定人类的注意力应该在哪里分配。如果你的团队无法向你阐述他们的人类注意力哲学,那么你就遇到了一个问题。如果你经营一家组织,问题不是我们是否在使用人工智能。而是我们是否有负责了解不断发展的人工智能代理人类边界在哪里,以及我们如何考虑在它转移时重新设计我们的工作流程的人。如果答案是你叫不出名字,那么你就把这个十年中最具影响力的组织能力决策之一留给了机会。我不会那样做。我们已经看到了上下文窗口。我们已经看到了检索。很难夸大模型在 2025 年 11 月到 2026 年 2 月之间能力上的增长。因此,在过去的 60 到 90 天里,任何深入研究人工智能的人都感受到了这种差异,无论你是在接触 Opus 4.6 还是 4.5,你都能感受到这种差异,你接触 CodeX 5.3,你接触 Gemini 3.1 Pro,你都能感受到这种差异。如果你正在听这个,而你感受不到。如果你觉得,“我不知道有什么区别”,这意味着你不在气泡的边缘。而那只是一个季度。下一个季度还会有另一个转变。我们从实验室看到的一切都表明我们不会放慢速度。因此,如果你现在所处的环境,这些二月代理并没有让你感到惊讶,那么欢迎你来到前沿的最好方法是找到一种方法,让你的代理承担一项让你感到惊讶的工作。无论它们失败,无论它们部分成功,给它们一些能让你感到惊讶的东西。因为如果你不这样做,你就有可能错过这个不断扩张的能力气泡。而这套新的劳动力技能将定义我们未来十年的职业成功。