📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

What are AI agents and agentic AI, part 2 | CXOTalk #868

CXOTalk53:43

Transcription

人工智能代理是什么?它们是否真的会像一些人声称的那样改变世界?在第 868 集节目中,我们将与一位杰出的风险投资家 Pravine Akiru 一起深入探讨代理式人工智能。他是风险投资公司 Insight Partners 的董事总经理,专注于人工智能代理。这是他第二次做客 CX Talk 节目,讨论代理式人工智能。Cine,欢迎回来!谢谢你,Michael。很高兴来到这里。

人工智能代理是什么?你可以将人工智能代理视为应用程序软件,它能够理解用户的意图,并能基于该用户意图进行推理,制定计划并执行计划。从广义上讲,这就是人工智能代理。因此,今天如果你看看这项任务是如何完成的,我们通常有一个应用程序,有一个人来制定计划并执行计划,对吧?所以,我们正在通过人工智能进行的转变是,我们现在将大量的计划过程和执行过程卸载给这些代理,并允许它们像人类一样使用应用程序。所以,这确实是我们正在进行的范式转变。这就是为什么人工智能代理如此令人兴奋。

大型语言模型(LLM)在整个代理式人工智能世界中扮演什么角色?重要的是要理解,人工智能代理不仅仅是关于大型语言模型。你必须将人工智能代理视为另一个软件应用程序,它现在在最能增加价值的领域融入了大型语言模型。所以,让我们退一步,想想应用程序以前是如何定义的。你曾经有一个数据库,一个记录系统。你曾经有一个建立在此之上的软件工作流程,然后你有一个用户界面。这通常是你的经典应用程序在当今 SaaS 环境中的样子。因此,大型语言模型的强大之处在于它们能够插入到堆栈的不同点,并能极大地提高这些应用程序软件模型的生产力和能力。所以,你可以将大型语言模型视为在我们称之为人工智能代理的新范式中扮演不同的角色。

第一层是用户界面本身。我们现在都习惯了 ChatGPT 的界面,我们可以在其中输入内容,甚至可以对其说话。它能够理解上下文并返回一个答案,而不是一组参考点或 10 个蓝色链接。同样,在应用程序的上下文中,你现在有一个用户界面,用户可以与之交互,基本上说“嘿,给我看看某个特定地区、某个特定产品的相关数据”。然后,该 LLM 能够接收该输入并进行综合,理解其上下文,而不是让用户去弄清楚。所以,这是其中一层。

第二层,也是非常重要的一层,在某种程度上几乎是代理式架构的核心,是推理层。这是将给代理的任务分解为一系列子任务的能力。例如,如果你说“让我们为某个特定股票构建一份研究报告”。如果这是用户提供的提示,那么人工智能代理就会将其分解,并说“好的,我如何为这只特定股票构建一份研究报告?我必须去雅虎财经或其中一个公共网站获取关于该股票的所有信息,能够综合所有这些信息,创建一份报告,然后发布一份报告”。它将任务分解为具体任务。这就是推理层。

然后,LLM 发挥作用的下一层是动态查询信息的能力。在过去,在静态的应用程序环境中,应用程序只能查看它内置了 API 调用的地方。如果它有权访问某个特定数据存储并且有 API 调用,它就会去调用那个 API。在这里,我们有一个 LLM,它可以推理并说“等等,这些信息可以在外部获取,这些信息可以通过这个内部 API 调用获取,我需要获取这两部分信息才能执行我的任务,也就是构建这份研究报告”。所以,让我启动一个网络搜索 API,也启动一个访问我内部研究存储的 API,将这些数据点放在一起。所以,LLM 能够理解它需要从哪些数据源获取信息来执行任务。

一旦它完成了这个,应用程序软件就会对其进行综合,然后你就进入了下一步,也就是输出。许多设计精良的代理都有强大的评估循环,这非常非常重要。一旦代理生成了输出,你就将其与你设定的“黄金标准”进行测试,并说“研究报告看起来是这样的”。然后,代理将它获得的输出与黄金标准进行比较,并说“这匹配吗?”然后它会自我纠正,直到匹配该标准。所以,正如你所看到的,你在人工智能代理的不同层插入大型语言模型,以便它能够使整个过程更加动态和交互。这基本上是经典应用程序流程和人工智能代理应用程序流程之间的区别。

我们有这种推理能力,我们能够访问广泛的人类知识,当然,这与传统应用程序不同。

这些代理今天有多准确?最先进的技术是什么样的?这些代理在实践中有多有用?我们还处于这个旅程的非常早期阶段。当你阅读新闻时,你会觉得人工智能代理无处不在。或者,如果你今天查看任何软件公司的网站,基本上人工智能代理就是他们现在表达产品的方式。然而,我认为在技术成熟度方面,无论是从你谈到的可靠性方面,还是从客户终端用户的角度,终端用户的体验,在部署、可扩展性和可靠性方面,我们仍处于早期阶段。

现在,我得说,代理有一个光谱。在这个光谱上,基本上,在一个端点,你可以拥有这些消费者代理,它们真正专注于个人。我们在节目开始前就谈到了这一点。OpenAI 刚刚推出了他们的消费者代理 Operator,非常有趣。它是为我们个人准备的,是 Pro 计划的一部分。而在光谱的另一端,基本上是企业中 RPA(机器人流程自动化)的下一阶段演进。所以,能够处理复杂企业工作流程的代理。因此,我们沿着这个光谱有大量的活动,包括初创公司和现有公司,都在推进最先进的技术,都在试验代理。

我们还处于早期阶段,主要是因为有一些事情我们仍在试图弄清楚。现在,大型语言模型本身是非确定性的。我想我的意思是,我们都经历过这种情况,当你以某种方式问 ChatGPT 一个问题,然后以稍微不同的方式问同一个问题,你可能会得到不同的答案。现在,随着一些新的模型,特别是那些能够自我纠正的推理模型,这种情况正在改善。但事实是,大型语言模型的核心是非确定性。因此,今天许多人工智能代理的设计者、构建者都在致力于我们称之为“脚手架”的工作,以便我们能够利用这些大型语言模型的强大功能,同时确保我们能够理解非确定性的存在,并且我们拥有能够处理它的正确架构。这样你就能得到一个可靠、一致,最重要的是可扩展的人工智能代理。

我们为什么会这样?因为这种非确定性,如果你再次按下 Enter 提交一个提示,它会给你一个不同的答案,这对于你想写大纲或文档摘要之类的东西来说是很好的,因为有不同的视角可以采取。但如果你想执行预订机票这样的任务,你不想让事情四处散布,你只想完成一件事,你想以最高效率等方式完成那张机票的预订。所以,我认为这会成为一个大问题。

是的,我认为这再次是构建人工智能代理时的核心设计考虑。我认为我们可以将其分解为三个部分。第一部分是任务本身,你给出了一个任务的例子。你完成任务的准确性有多重要?在 ChatGPT 中,如果它给你一个稍微不同的答案,这就像搜索一样,你只是在获取信息,你并没有真正做出决定。所以,你对一定程度的非确定性是可以接受的,因为人脑能够纠正它。光谱的另一端是,如果你基本上依赖这个人工智能代理来一致地执行任务,这可能是一个企业工作流程,一个后端工作流程,可能是代码生成,或者你基本上是一个客户服务交互代理。你不能有那种程度的非确定性。所以,这是第一点,如何定义任务,我认为这是一个关键问题。

第二方面是你需要考虑的,好的,现在你说,假设你有一个需要准确的任务。而且,同样重要的是要理解,人工智能代理不仅仅是关于 LLM。有大量的现有软件,有大量的重用,你知道机器学习模型、预测模型,它们是确定性的。以及你作为软件工程师构建应用程序的经典方法,这些都构成了人工智能代理。我再说一遍,人工智能 LLM 是一个工具,它们不是产品,它们不是代理,它们是一个工具。所以,你必须像使用任何工具一样理解它的能力。

那么,第二点是,当你考虑人工智能代理时,你必须考虑在正确的地方利用 LLM。

第三点是,好的,现在你已经弄清楚了,你的大型语言模型将帮助我制定计划,例如我们之前谈到的推理层。所以,今天大多数人工智能代理基本上都提出了一个计划,你有一个人在循环中,然后他批准该计划。一个很好的例子是今天大量的编码助手和编码代理。它们再次,特别是云的 Sonnet 3.5,我认为这是大型语言模型准确生成代码能力的一个飞跃。它们的工作方式基本上是程序员与大型语言模型进行交互,它提出了一个计划,该计划在程序员执行之前由程序员批准和编辑。所以,所谓的“用户在循环中”或“人在循环中”是当今人工智能代理的一个非常关键的设计组成部分,尤其是在那个计划层。

现在,你可以做其他事情,我们谈到了其中的一部分,那就是我们称之为“反思循环”。一旦代理生成了输出,你就将其与另一个经过正确输出训练的大型语言模型进行测试。所以,模型,代理基本上会自我测试,看看它是否做对了,并且它能够思考输出是否正确,然后进行更改并再次迭代。所以,这些反思循环,你如何构建评估,如何确定输出是否正确,并利用这些数据来持续改进人工智能代理,这也是设计过程的一部分。

我给了你三个不同的需要考虑的方面。在深度方面还有很多可以深入探讨的,但总的来说,要点是,你可以设计人工智能代理使其具有确定性,前提是你理解任务,提供了正确的脚手架,评估循环,并且你基本上让“人在循环中”。今天,当“人在循环中”时,人工智能代理工作得很好,我认为尤其是在输出需要做出更准确的决策的这一端。

订阅 CXO Talk 的新闻通讯,这样你就可以加入我们的社区,我们将告诉你即将举行的节目,我们有很棒的节目。我们在 LinkedIn 上有很多问题堆积如山,现在让我们来回答几个问题。第一个问题来自 Ravi carara,他说,你认为美国大学在为人工智能驱动的世界经济创造技能型劳动力方面处于什么位置?它们将如何学会与人工智能代理协同工作和部署人工智能代理?

我认为人工智能大型语言模型是一个工具,就像我们曾经拥有云计算、移动设备所有这些基本平台转变一样,人工智能和大型语言模型是帮助我们完成任务的工具。我的意思是,深入理解你试图用这个特定工具解决什么问题仍然很重要。你是想预订一张机票,就像 Michael 你刚才提到的那样?你是想在企业中执行一个薪资功能?你是想回应一个客户支持问题?所以,理解实际任务,这基本上是良好的产品管理,是理解这个新工具,这个更强大的工具,比我们过去见过的任何东西都更有影响力,将如何改变我们作为教育者、知识工作者、消费者如何利用人工智能的基础。

所以,就大学如何处理这个问题而言,这取决于你如何参与其中。我的意思是,在光谱的一端,科学和数学的教育,以及良好的基础,可以帮助你参与到这个设计过程中。在光谱的另一端,如果你更偏向商业,深入理解你的问题以及工具的工作原理。我的意思是,我们今天都在试验 ChatGPT。我使用它的方式不同,我的女儿使用它的方式也不同。我希望她的老师没有在听,但她有时会用它来帮助她做家庭作业。所以,她在这个过程中学习,就像我为我的用例学习使用它一样,我们都在学习。所以,我认为这是一个我们进行试验的工具,但对问题的深入理解以及弄清楚如何使用这个工具是基础。所以,我认为产品思维是另一个关键方面,我认为这是我们应该强调的。如果你不深入研究算法和数学,你仍然可以通过理解如何构建产品、如何解决客户问题来发挥巨大的作用。我认为第三个方面是巨大的“人”的因素。我们刚才谈到了人工智能代理今天是如何运作的,我说的一件事是“人在循环中”。人工智能代理会变得更擅长推理吗?是的,O3 模型非常棒。在过去几周,在去年晚些时候,你在推理能力方面看到了巨大的进步。然而,在整个过程中,你必须考虑人的角色在哪里,它是一个评估功能,还是一个推理功能?所以,人将永远参与其中,并且能够理解和参与技术,这实际上是最重要的事情。这其中有巨大的“人”的一面,就像有技术的一面一样。所以,这些是我认为需要考虑的一些领域。我不是教育家,所以我的看法是这样的。

这是来自 Sesh Babu Madala 的问题,他说,我们需要训练代理吗?还是代理将问题解释为一步一步的任务?这是一个很好的问题。你确实需要训练代理。这些代理可以做什么,从简单的任务到非常复杂的任务,训练的程度显然取决于你期望代理做什么。我的意思是,当你将代理插入到特定任务中的第一阶段,需要进行一定程度的“接地”。接地通常是连接到正确的数据源,连接到正确的应用程序源,连接并确保它理解并扎根于你的特定用例或你的特定企业的策略。所以,这是初始部分。然而,训练,就像我们人类一样,我们一直在学习。如果我们说,你入职了一个新员工,一个刚毕业的大学生,他们处于一个持续的培训过程中。他们学习,有人观察他们的产出,你给他们反馈,你希望他们继续改进。人工智能代理也是完全一样的。这就是为什么这些评估循环是设计人工智能代理的一个非常重要的方面。我怎么强调都不为过。你必须能够不断地理解代理的输出,弄清楚在哪里可以纠正它,并继续改进。我认为最后一部分是这些代理如何运作的可观察性。它们在做什么和不做什么的更广泛的效率和低效率在哪里,这是你架构的一部分。

现在是听众订阅 CXO Talk 新闻通讯的绝佳时机。请访问 cxo talk.com。如果你正在 LinkedIn 上观看,请查看屏幕上的地址,并订阅我们的新闻通讯,以便我们通知你即将举行的节目,你可以成为这个惊人的 CXO Talk 社区的一员。

我们的下一个问题来自 Greg Walters,你已经稍微谈到了这个问题,但他问,非确定性是否可以通过提示而存在?这其中的第一个方面是真正理解 LLM 在你的任务中的作用,以及你期望从 LLM 任务中获得什么程度的可靠性。现在,有些事情,LLM 的能力正在不断提高,而且有很多原因,很多大型语言模型都基于数学和编码任务进行训练,因为有很多迁移学习。当它们擅长编码、擅长数学时,它们也能够擅长推理任务,这些任务的应用范围更广。这就是为什么这些任务受到如此多的关注。所以,我说的第一点是,这些模型将通过推理循环,或者通过更好的模型后训练,或者通过推理时的推理,这些是我们现在拥有的另一个扩展级别,来逐步提高管理幻觉的能力。模型本身有一些不同的技术,允许你减小非确定性的范围。这是其中一个向量。另一个向量是,正如我前面提到的,围绕它构建脚手架,理解你将从大型语言模型获得一个输出,需要将其综合成一些更可靠的东西,并达到你可接受的输出水平。这是反思循环,这是你的评估,有时你可能只需要一个确定性的运行时,你需要将其设计到人工智能代理工作流程中。

Gus Beash 说,有趣的是,代理式人工智能绕过了那个极其令人沮丧的、未与任何工作流程集成的提示用户界面。这太棒了。你对代理式人工智能仅仅绕过用户界面和集成工作流程有什么看法?

在我看来,这是用户界面和用户参与方面的量子飞跃。在很多方面,我认为我们已经有某种形式的自然语言处理(NLP)接口了。我的意思是,你可以想到今天的聊天机器人,它们很难逃避。如果你想预订一张票或任何东西,弹出的第一个东西就是一个试图获取你信息的聊天机器人。所以,这是自然过程。它能够理解语音,将其翻译成文本,进行搜索并回复你。我认为大型语言模型的机会在于推断上下文的能力。我们上一代聊天机器人是字面翻译和静态的、基于规则的翻译解释。现在,由于大型语言模型已经训练了人类语言数据的整个语料库,它们可以推断上下文,推断语气,推断特定的意图,然后它们能够适当地将其翻译成查询并给你一个回复。所以我认为这是一个改变游戏规则的方面,你会在用户界面方面拥有一个大型语言模型。现在,请记住,我们今天仍然非常依赖文本。ChatGPT 的大部分交互,尽管它们有语音模式,非常棒,但仍然是基于文本的。但想想我们能够进行多模态交互的能力,我们今天能够进行语音输入的能力,能够输入图像和视频的能力,我们将会达到这一点。随着时间的推移,这些模型将有效地达到我们称之为“世界模型”的理解世界的能力。我认为这在我们与这项技术互动的方式上可能具有颠覆性。

这是来自 Aralon Khan 的问题,他问了一个非常有趣的问题。他说,当涉及到人工智能时,我们希望消除数据中的偏见。如果“人在循环中”,我们如何消除人类偏见?谁来决定什么是偏见?这是一个非常有趣的点。如果我们的最终愿景是,正如一些公司所阐述的那样,每家公司都有一个人工智能代理,并且那是客户与公司互动的第一个接口。比如,你是一家保险公司,或者你是一个政府服务机构,比如 DMV。那么,这个接口就非常重要。所以,我认为,模型公司正在做很多出色的工作,以确保我们意识到偏见。现在,事实是,这还不是一个完美的解决方案,我们还没有完全达到那个阶段。在某些情况下,你没有得到这些完美的答案。所以,这部分是关于我所说的上下文,关于你如何“接地”代理,这是非常重要的。那么,上下文到底意味着什么?上下文意味着例子。所以,如果它是一个客户代理,例如,你可以用你的政策来训练它。你可能有很多现有代理通话的录音,这些都是处理情况、偏见或对抗性情况的绝佳例子。所以,训练这个代理,让它扎根于特定用例的政策和规则,是一项特别重要的任务。

现在,我认为“人在循环中”更多的是关于你如何推理事物。显然,人类互动的理想方式是在消除偏见方面具有积极作用。通过插入“人在循环中”,你实际上增加了一个步骤,提高了代理整体纠正偏见的能力。但我会说,良好的训练,扎根于政策,以及拥有负责任的“人在循环中”是帮助我们实现这一目标的因素。但这是一个不完美的过程,这就是为什么我说我们还处于早期阶段。

Aralon Khan 回来问,如果主题专家训练人工智能来创建人工智能代理,我们真的还需要主题专家吗?当人工智能代理遇到它们从未遇到过的情况时会发生什么?训练是一个持续的过程。当你开始这个过程时,主题专家帮助你“接地”模型,接地人工智能代理,你是在给它一个特定的标准。你基本上是在说,“嘿,这就是期望的。这是一个基本任务,这是执行任务的方式。”现在,任务在不断发展。我们生活在一个动态的世界。比如,你在一家公司,可能推出了一款新产品,可能扩展到一个新地区,可能进行了一次收购,或者有新员工入职。这是一个不断变化的过程。所以,在某种程度上,我认为你可以设计人工智能代理说,“好的,我可以扩展到一个新的地理区域,这是我的理解。”但可能有不同的政策。正如经常发生的那样,如果你在一个不同的国家运营,它们可能有自己的规则和法规,你需要让模型扎根于此。所以,我认为主题专家确实是……我们都在这样做,我们都是主题专家,我们不是静态的,我们不断学习、进化、理解新技术、新事物。模型也是如此。所以,是的,人工智能代理的目的是消除那些平凡的事情,比如“去获取这份文件,把 10 份文件放在一起,创建一份研究报告”。所以,是的,你不需要重新训练那个东西。但是,能够说“好的,我如何运营欧盟,它可能有不同的规则,或者在亚洲,在日本,在中国,或在印度,它们可能有不同的规则”。这些都需要一定的理解这些规则和法规的要求,你需要再次让代理扎根于此。

让我们开始谈论商业。Mario Garcia 问,看到人工智能在财富 500 强公司中的影响令人鼓舞。其中最让你印象深刻的见解是什么?

今天,许多大公司,我的意思是,令人惊叹的是,无论是大型公司还是现有公司和初创公司,它们都以惊人的速度拥抱了人工智能和大型语言模型。这很大程度上是 ChatGPT 的时刻,它释放了这一点,因为它非常容易访问。所以,你退一步看,人工智能已经存在很长时间了。我在研究生时代上过一门关于神经网络的课程。什么改变了?我认为这一代人改变的是,今天真正强大、复杂的 AI 模型可以通过 API 调用获得。所以,这种简单程度的访问真正强大的技术,基本上使我们能够像你今天在许多用例中看到的那样,释放大型语言人工智能。

我现在也要提醒你,我们仍然处于非常早期阶段。如果你和许多大型企业交谈,它们确实集成了大型语言模型。大多数公司都推出了某种形式的编码助手,推出了某种形式的客户支持功能,推出了某种形式的分析用例。但是,我们还没有大规模部署,主要是因为我们还在进行调整、微调,学习如何管理这些人工智能代理,如何管理偏见,正如你的一位听众刚才问到的那样。如何确保它们是最新的?如何确保它们不产生幻觉?最重要的事情,这是基础性的。我们都知道这一点,这无关紧要。有很多非常有趣、令人兴奋的演示在 X 上。那些很棒,你可以说“哇,这个代理可以做这个”。真正重要的是,它能否持续地做到这一点?能否大规模地做到这一点?所以,这些是我们今年希望回答的问题,这就是为什么我们对 2025 年人工智能代理的轨迹如此兴奋。

Pravine,你和你的团队一起制作了一份你称之为涉及人工智能的公司市场图。你能谈谈吗?我可以在屏幕上显示它,这样每个人都可以看到。它就在这里。Pravine,你能谈谈你制作的这张市场图吗?

市场图是一个动态的、活生生的东西,因为它会不断演变,主要是因为我们在人工智能代理领域看到了如此多的活动和能量。所以,我们试图做的是将其分层。所以,有一个基础层,有很多数据源集成之类的东西。我们有一个新的我们称之为“代理计算机接口”的类别,这是人工智能代理使用计算机工具的能力。它可以是集成,可以是网络工具,有些东西是集成模型,有些是我们创建的有趣平台。所以,我们试图逐层构建模型。底部是什么?好的,所有的数据平台是什么?这个中间件层,如果你愿意的话,是什么?代理计算机接口以及许多代理框架。例如,我们投资了一家名为 Crew AI 的公司,我相信任何谈论人工智能代理的人可能都知道 Crew AI。它是最受欢迎的开源框架之一。你可以使用 Crew 来构建代理。还有 Langchain,它也做类似的事情。

在此之上,我们试图说,“哇,让我们来绘制一下人工智能代理领域的能量所在”。重要的是要理解,在市场图的左侧,有许多来自现有公司的 AI 代理产品和产品。所以,显然 Salesforce 推出了他们自己的工作代理,他们称之为 Workforce。微软有 Copilots。我们刚刚看到 OpenAI 推出了 Operator,它更偏向消费者。所以,基本上所有现有公司都说,“嘿,我们有这些很棒的客户,我们有所有这些很棒的用例。有没有办法通过在现有软件之上创建代理工作流程来改善我们的客户体验或生产力?”

在市场图的其余部分,你可以在不同的垂直领域看到巨大的能量,尤其是在编码领域。例如,有很多出色的工作,Cursor 是迄今为止开发者中最受欢迎的。但你也看到了非常具体的垂直代理,销售、营销、法律、金融。所以,你可以几乎把这些不同的职能中的每一个都拿出来,你可以看到公司正在构建针对特定垂直用例定制的代理。有一家非常有趣的公司叫做 Somaya,他们正在做一些令人惊叹的工作,专注于为金融工作流程构建代理。所以,你看到,市场图的目的不是要精确,也不是要捕捉全部视图。我确实要向许多我们错过的构建者道歉。这个想法实际上是给你一个视角,看看这个景观是什么样的,活动在哪里,构建者是如何接近代理领域的。

人工智能代理最主要或最重要的用例是什么?可能只有三四个类别。第一个显然是每个人都知道并且非常了解的编码代理、编码助手、编码平台,无论你想怎么称呼它们。根据特定的风格,Cursor 有一种特定的工作方式,它更像一个助手。如果你看像 Devon 这样的,它的参与方式不同,它会启动一系列代理来执行你的计划。但是,在面向开发者的 AI 代理工作中有很多能量。你也可以在市场图中看到这一点。

第二个领域是客户体验领域。客户体验显然包括从客户支持代理开始,这显然是我们谈到的最大的用例。聊天机器人已经是生活的一部分。我们能否让这种体验更加真实,更加引人入胜?所以,你和我一样,一旦你遇到聊天机器人,就不会立即说“代理”。所以,这个领域有很多能量,有很多很棒的公司在构建有趣的产品。

另一个有趣的领域是运营空间。所以,如果你广泛地考虑运营,它可以是 IT 运营,可以是安全运营。你有一个“大海捞针”的问题,你有大量的数据,有很多警报进来,你试图弄清楚,我应该关注哪些?所以,这对人工智能代理来说是一个完美的用例。综合所有这些信息的能力,并且如果它扎根于你的政策和公司特定的做事方式,它就能够说,“嘿,这里有三个到五个你需要关注的警报。这是它们所描述的问题,这里有几种补救方法。”所以,我们看到了一些有趣的初创公司,它们专注于这个特定领域。所以,我认为这三个是。还有很多,但为了节省时间,我可能会在这里停下来。

我们有一个来自 Elizabeth Shaw 的 Twitter 问题,她问,组织如何在其业务和生态系统中利用代理式人工智能?

让我们以客户服务人工智能代理为例。这是一个我们看到许多客户正在试验的用例。那么,这个客户服务代理做什么呢?你基本上可以想象今天的聊天机器人。客户服务代理能够首先扎根于你所有的客户数据、常见问题解答。我如何输错我的密码?我如何恢复我的密码?或者,我如何将我的孩子添加到保险单中,或者任何你能够与之互动的持续任务。代理理解你试图做什么。也许你在寻找一个表格,也许你在寻找一个网站,也许你在寻找一个特定的报价或类似的东西。所以,我认为这是一个获得了很多吸引力的用例。我们看到许多客户正在考虑将其投入生产。

另一个我提到的用例是在编码方面。我们不仅仅是在谈论像 Cursor 这样的 IDE,它显然得到了广泛的应用,而是像自动化测试和配置这样的东西。你有软件,你需要推出它。测试是推出过程中的一个非常关键的部分。你能够有效地使用人工智能代理进行测试和“红队”用例,你可以说“让它崩溃”。这是一个非常关键的功能,你看到了一定程度的部署正在发生。

另一个正如我所说的,是在 IT 运营方面。这非常令人兴奋,因为再次,这些是任务关键型的。你需要持续在线。大多数 IT 团队都有 24x7 的覆盖范围,因为你不能让关键系统宕机。所以,人工智能代理是完美的,因为它能够综合大量数据。它有能力,基本上是“大海捞针”的问题。再次,这是一个正在进行中的工作。我不会说所有这些事情都已臻于完美,但我们绝对看到了这些。我还提到了 Somaya 公司,这非常有趣。他们正在积极构建一个财务分析师之类的代理,它在从研究中提取上下文并为你提供真正集中的信息方面非常准确。

所以,你说它非常准确,我假设你的意思是它始终可靠且可预测。

正是如此。而且,如果只是开箱即用,要做到这一点要困难得多。我认为市场上的很多混乱在于,“等等,大型语言模型只会越来越好,最终它们只会成为解决所有问题的模型。”我认为在某些简单的用例中确实如此。我的意思是,模型正在变得更好,它们的推理能力更强。也许我们会达到通用人工智能的水平,这些模型可以像我们一样使用计算机。也许这就是标准。但是,我认为当你研究复杂的企业工作流程时,正如我所提到的,代理能够“接地”并准确,并以最终用户期望的方式呈现数据,这将需要一定程度的后训练,一定程度的推理时推理,以及一定程度的脚手架,以便你能够构建完美的代理。

你能谈谈代理的经济学吗?然后我们将回到,因为我们确实有其他问题。经济学非常重要。哪些方面驱动经济学?企业买家在考虑代理的经济学时需要考虑什么?

你已经看到了各种各样的对话。从“有了人工智能代理,我们将完全转向基于结果的定价”到“嗯,它仍然是软件,所以我们必须弄清楚如何适当地收费”。当你考虑定价时,要问的基本问题是,你能准确衡量人工智能代理输出的价值吗?我的意思是,例如,你有一个客户支持代理。你可以说,“客户支持代理处理了 100 个电话,处理这些 100 个电话需要花费 x 美元。客户代理处理了这些电话,所以我可以直接将价值归因于该代理的输出。它处理了 100 个电话,每个电话价值 x,所以这基本上是 100x,这是该特定代理任务的价值。”

光谱的另一端,比如你正在做一个研究工作流程,你生成一份研究报告,或者你帮助分析师进行研究,并提高他们的生产力。你如何衡量其中的价值?你通过个体来衡量,比如问分析师,“你的生产力提高了多少?”量化某些任务比量化其他任务要困难得多。所以,我认为理解代理经济学的第一个问题是,你能以合理准确的方式将价值归因于代理的输出吗?

基于此,如果可以,基于结果的定价基本上是我们最终要去的地方。如果它更加模糊,我认为我们将看到现有 SaaS 定价模型的某种演变。所以,你可能会支付平台费用,比如代理的费用,然后你可能会雇佣一个代理,所以你按运行代理的次数付费。所以,这是某种组合。我们再次看到这是一个光谱,这里没有绝对的答案。今天有很多实验。在某种程度上,公司仍在试图弄清楚,客户如何获得价值?客户试图弄清楚,如果你是 CFO,你习惯于按订阅付费软件,比如“好吧,我有一年的 x 个许可证,我可以进行预算。”现在,如果你转向基于结果的定价,如果你没有准确的价值感,你作为 CFO 如何为这些人工智能代理进行预算?所以,我认为有很多事情需要……我们正在进行实验和理解。最终,我认为我们将进入基于结果的定价领域,直接归因于价值。但也会有很多中间模型,你想确保开发人员为他们构建的产品获得公平的价值,客户为他们支付公平的价格。

所以,最终,当我们达到代理具有离散的可衡量输出结果的阶段时,我们就可以转向基于绩效的定价。在此之前,它是按使用量付费。

是的,我认为这是一个很好的说法。

我们在 LinkedIn 上有一个重要观点,来自 Nesh Kumar,他是 Zscaler 的产品管理副总裁兼总经理。他提出了一个问题:安全和代理式人工智能呢?我们还没有谈过这个问题,所以我很高兴你提到了。

大型语言模型有助于解决“大海捞针”问题,这是诊断安全问题的固有问题。我是在网络世界长大的,我们过去……我们曾经构建过这些全球规模的……

互联网规模的网络,而这项任务的一个重要部分是,你知道,如果某处发生故障,调试它基本上意味着我们合成大量数据,并弄清楚我们应该在哪里集中我们的精力。安全也是如此,你有一个很大的暴露范围,这取决于你是什么类型的公司,从你的网络到你的应用程序,到你的设备,到个人,到身份,当你考虑安全时,有多层。因此,这在安全行业一直是一个严峻的挑战,我们有这些叫做 CMS 的平台,它们试图将所有这些整合在一起,并为你提供一个统一的视图,你可以在其中进行管理。但是,你知道,一个安全运营中心本质上是大多数公司运营其安全运营的神经中枢。

因此,我将从三个方面看待大型语言模型在安全领域的应用。第一,我认为从运营的角度来看,它可能是一个非常有用的工具,因为它能够合成大量数据,并帮助解决“大海捞针”问题或确定优先级。我认为这是一个很好的用例。第二个是,你知道,大型语言模型集成到安全产品中,它们基本上会,你知道,你再次谈论一个安全代理,现有的安全软件,能够动态理解策略,能够动态响应,你知道,你正在添加更多用户等等。我认为你能够构建这些,我们看到公司开始将大型语言模型构建到他们的软件堆栈中,就像我们之前讨论过的,它是一个工具,它是有用的。第三点,我想说的是,你知道,大型语言模型确实代表了一个新的威胁范围,特别是如果模型基本上产生幻觉,或者例如在心理战用例中,你知道,忽略或突出或错过关键的威胁。因此,当你设计时,当我们谈论所有这些代理在客户支持用例或金融分析师用例中部署时,如果这些大型语言模型没有得到充分的 grounding,并且它们没有,你知道,它们拥有的训练集没有得到适当的保护,你就有风险,不仅仅是幻觉,而是有效地劫持整个 AI 代理。

所以,这还处于早期阶段,我认为我们与一些正在深入思考这个问题并构建有趣事物的创始人进行了一些有趣的对话,但我们有,在这个阶段,这是一个问题空间,我们将了解更多,我们将像 AI 代理本身一样发展安全架构。显然,Zaler 也在考虑这个问题,因为他提出了那个问题。他们是一个重要的参与者,他们在我们的整体架构中扮演着巨大的角色。我们还有另一个问题来自 Arsalon Con,我将请你非常快速地回答,因为我们就要没时间了。他说,我们是否应该创建一个时间和运动 AI 代理来评估其他代理,如果它们为组织节省了资金,显然是回顾我们之前讨论的定价。如果你能听听一些行业领袖的谈论,就像我们都有一个代理大军,或者我们将拥有人类员工和代理式员工一样,有一个要求,一是训练所有这些代理, grounding 所有这些代理,以及评估所有这些代理。

因此,我们谈到了反思循环,就特定的输出如何控制输出而言。同样,在更高的抽象层面,也就是价值。是的,你可以,这是一个有趣的想法,能够说你有一个代理,它不断衡量其他代理输出的价值,以确保它们达到特定的标记。例如,如果你有一个客户支持代理,如果它不能每天处理多少个电话,或者类似的东西,而指标可能会有所不同,那么它可能没有适当的性能。因此,你可以有一个代理,它更像是一个运营功能。因此,我认为在代理的未来,有工人 AI 代理和评估代理,并且你可能在某个时候拥有经理代理。你可以设想一个未来,存在一定程度的不同层级的层级结构,你正在积极地评估和管理这些代理。但同样,我们还处于早期阶段,我们正在假设这看起来是什么样子。

Gus Beck Das 回来问,将代理和知识放在一个模型中是否真的更好,还是将它们作为单独的、松散集成的系统?这取决于你正在处理的问题空间。你知道,总的来说,我们从周围的事物中知道,没有一个统一的知识体系。我们人类,我们的世界,我们的工作场所,我们的消费导向的生活中有如此多的复杂性,没有一个超级智能可以为你做所有事情。所以,我认为我们总是通过将问题分解成更小的问题来解决问题,然后使用不同的工具来解决这些问题,并将它们重新组合起来。这就是人类工作流程的方式,无论你是在做一个项目,比如制造一把椅子,还是在企业中构建一个复杂的应用程序。所以,我将再次在这里推测,我不相信这种单一的统一代理。我确实认为代理会继续变得更好,也许我们会达到人工智能通用智能的阈值,我们如何定义它,这是另一个小时的谈话,但我认为你将始终存在这种概念,即解决问题,将其分解,使用不同的工具来解决该问题,然后将其组合起来,你也可以在代理世界中应用相同的架构。

好的,就这样,这已经是一个内容丰富的时段了。Prine Akiru,非常感谢你花时间与我们分享你的专业知识和知识。我真的非常感谢你。谢谢,谢谢你的邀请,非常感谢所有观看的人。在你离开之前,订阅 EXO Talk 时事通讯,这样你就可以加入我们的社区,我们可以告诉你即将到来的节目,我们有很棒的节目,你可以在直播节目中提问,就像今天一样。就这样,非常感谢大家,也感谢 Prine,我祝大家一天愉快,下次再见,保重。

[音乐]

[掌声]

[音乐]