Transcription
这绝对不可能奏效。对我们来说,这是一个巨大的机会,甚至在人工智能革命之前,但在此之后更是如此。基本上,这是一个你要么赔钱,要么坑害客户的领域。没错,这就像——我们喜欢人工智能的这一点,人力密集型,或者一般来说,低利润率的企业是人工智能颠覆的巨大机会。这是一个非常经典的例子,说明了如何利用人工智能来扩大你的业务规模并提高你的利润率。Nir,欢迎。你好。很高兴来到这里。很高兴你能来。鉴于很多人可能不知道 Daisy 是什么,你能用 30 秒的时间介绍一下 Daisy 是谁,以及你们在做什么吗?当然。我是 Nir。我是 Daisy 的联合创始人兼首席技术官。Daisy 是一家物业管理公司。一家技术驱动的住宅物业管理公司。我们成立于五年前。我们在纽约市及周边地区开展业务。而且,我们基本上正在重新构想物业管理应该是什么样子,我们将在本章中讨论这一点。我们如何利用人工智能来做事情,而且非常令人兴奋。基本上,这是一个你要么赔钱,要么坑害客户的领域,对吧?这是人工智能,我们喜欢人工智能的这一点。人力密集型或一般来说,低利润率的企业是人工智能颠覆的巨大机会,对吧。而且,为了让我们对你的规模有所了解,比如你每天有多少个独立的代理人在 Daisy 工作,以服务你的客户?是人类代理还是人工智能代理?不,是人工智能代理。是的。当然。我们有大约十种不同类别的人工智能代理。物业管理是一个非常广泛的业务。它不是交易性的。它非常广泛。它是基于关系的。大约有 150 种服务。我们有人工智能代理可以捕获特定领域,对吧。并能在这些领域提供服务。因此,它可以是财务、维护、设施合规等。为了理解规模。对吧。所以,当你今天增加一个新建筑时,你需要增加多少人力?正如你所说,传统的物业管理行业是一个非常人力密集、利润率低、客户净推荐值(NPS)低的行业。对我们来说,即使在人工智能革命之前,这也是一个巨大的机会,但在此之后更是如此。特别是新建筑的入驻过程非常过时。今天看起来就像 1990 年左右,基本上。收集几百到几千份文件、档案、实际文件,有时甚至是纸质文件。但是,你基本上需要消化这些。对吧。所以,我们 Daisy 所做的,是我们构建了一个人工智能代理,它能够协调这种转变,而不是由人类进行数据收集、分类和摄取。具体来说,也许这会让我们进一步深入讨论,但我们实际上为这个代理拥有完整的个性。我们称他为 Steven。他是团队的一员,有角色、有职责。你可以通过 Slack 与他沟通。他可以访问工具和数据等等。而且,这是一个非常经典的例子,说明了如何利用人工智能来扩大你的业务规模并提高你的利润率。所以,这不仅仅是降低成本,对吧?那么,在 Daisy 之前,业务或建筑的切换需要多长时间?使用 Daisy 又需要多长时间?如果你看代理,比如任务,影响最大的是什么?当然,切换需要 30 到 60 天,这取决于,因为这是一个转移过程,这取决于之前的管理公司,他们也有人类,而且他们实际上只有人类,对吧?所以你基本上依赖于他们。当我们引入 Steven 时,我们基本上能够——不一定能缩短这个时期,因为这取决于另一方是人类。但我们能够同时做更多的事情。对吧。我们可以使这项操作呈指数级增长,我们可以增加我们更快增长的能力,并且我们可以重新分配之前从事这项工作的人员,让他们在组织内做更多类似的工作,做其他类型的工作,所以这是直接的好处。所以,有些事情并没有被过多地谈论。对吧。因为大多数人,许多企业家没有意识到人工智能在哪里停止,或者它今天有哪些能力。我们稍后会讨论这一点。但有趣的是,一些更好的部署模型实际上是将人类纳入其中,这意味着。正确。这不仅仅是让代理去祈祷它对用户有效,而是如何从人类那里获得反馈并进行因果改进。所以我们有一个飞轮,在学习。对吧。在 Daisy 中它是如何运作的?它的运作方式如下。首先,当你构建这种带有嵌入人类的代理工作流时,你有几个选择。所以,当你想要安排人类时,一个选择实际上是让他们处于最前沿。在一个经典的例子中,你的客户期望某种关系,对吧?所以你实际上仍然保留了人情味。这可能是出于品牌原因、定位原因或关系原因。而且,这对于像 Daisy 这样的服务公司来说,是一个非常非常好的安排人类的地方。人类实际上充当着一种信任的顾问,但人工智能在他或她身后做所有的繁重工作。这是一个非常有趣的安排,对吧?所以他们基本上不做工作,但他们展示、解释并与客户沟通。你可以安排人类的另一个位置是经典的“领域内循环”,用于评估或在线准确性。对吧。让我们从在线准确性开始。在 Steven 的案例中,我们有人类参与,以确保财务文件的分类,这些文件更敏感,我们有类似双重验证。对吧。所以你有代理对文件进行分类,然后你还有另一层人类。所以这只是为了确保从在线工作流的角度来看,你仍然保持高质量。在某些情况下,这实际上是有益的,因为你试图优化准确性而不是延迟或解决时间。对人类最有战略意义的安排是,我们称之为“评估”,对吧?评估框架,你基本上构建了一个基础设施,帮助你进行培训基准和数据集,以便更好地利用人工智能。对吧。所以你有人类基本上确保提示正在做他们应该做的事情。只是为了弄清楚。所以通过将其作为一种有意的设计,而不是事后的想法,因为人工智能不够好,而是实际上说谁更适合与用户合作?我需要更多的数据在哪里?我如何标记它以及我如何对其进行操作?所以,如果我有意这样做,它实际上会创建一个系统,而不仅仅是人工智能或人工智能的改进。它实际上是在正确的时间让正确的人与正确的人互动。这开启了一个有趣的问题,比如当你考虑内部与外部代理时。对吧。以及单次对话与多次对话。对吧。你对此有什么看法?如果你看那十个代理,有多少个提供内部服务与外部服务?当你,基本上在你的组织中构建人工智能能力时,我试图为听众概括一下。从内部开始更安全,对吧?如果你出错,你会得到更快的反馈循环。你可以训练。你可以在内部建立对人工智能的信任。这是至关重要的。你实际上想在外部这样做之前在内部建立对人工智能的信任。当你拥有运营和客户支持团队、销售团队、营销团队时。是的,他们需要信任它正在做它需要做的事情。这就像我可以提供的一个关于变革管理文化的小贴士。我们实际上有很多面向客户的人工智能,但我认为你提到了,比如一次性或零次或一次性,基本上你有一个交易,然后有一个 LLM 在交易中做一些事情,可能是评估文件,可能是措辞沟通。对吧。可能是数据生成。我们有很多这样的。而且客户也差不多习惯了。这很有意义。你可以说,你知道,我们的人工智能做了这个,决定了那个,它有效,而且摩擦很小。然而,完全的代理行为,根据我的经验,这是一种完全不同的技术,你有一个完全代理的东西,比如 Steven,它是完全代理的。Steven 与之前的管理公司进行外部沟通,你,这是尖端技术,对吧?而且,这正是你需要更加谨慎的地方。我建议从内部开始,然后在你感觉更自信并且拥有评估框架之后再转向外部。所以你开始 Daisy,在 LLM 之前,在 GPT 3 之前——我想是的。在 GPT 3 之前。所以那时,你开始采用“T 型车”方法,对吧?就像分解每个流程、每个步骤,使其可重复。很像汽车生产,或者通过利用不那么专业的,正确的人员或系统来降低成本。所以,我会把它看作是正确处理人工智能的前提,但另一种观点是,它对可重复性很有好处,但代理实际上是不可重复的,因为它们有点随机。它们具有自主性。那么这两个系统之间的张力是什么?以及你如何从一个面向规模化可重复性的东西过渡到一个更开放式的代理?以及你如何利用两者?一个很好的问题。你说得完全正确。当我们创立 Daisy,在人工智能革命之前,我们有同样的愿景和假设,那就是物业管理是可以被颠覆的,并且你可以通过技术来扩大规模。这一点没有改变。但我们人工智能革命之前的方法是,基本上将那 150 到 200 种交易分解,然后构建一个非常严格和明确的工作流程,能够端到端地运行。对吧。我们过去常说,如果在一个传统的管理公司里,墙上挂满了手册,你基本上会把它拿下来,然后说,“好吧,我如何驱逐某人?我如何做租赁?我如何做这个?”通过关系,那么在 Daisy,这本知识宝典就在我们的代码里,我们实际上使用了一个非常强大的代码库工作流引擎,叫做 Temporal,它非常严格,非常严谨。我们仍然拥有它。我仍然在使用它。但这是关于如何处理核心服务的一个根本不同的方法。如何处理一个交易。当生成式人工智能革命开始时,我们实际上开始尝试一些比这些严格的代码工作流更灵活的东西,你基本上给代理一个如何解决问题的通用指导,然后你就控制得更少了。我认为我描述的是这两个极端,我很乐意分享一些关于我们如何平衡它们以及我们学到了什么。你想让我深入哪个方面?点击进入。是的,我肯定,我们应该深入——我认为大多数人实际上看到了这两个极端,而不是如何让它们协同工作。那么,你如何创建脚手架或某种程度上的、仍然使用面向过程的步骤,以确保你在过渡中,确保你从客户那里获得所有信息,甚至正确地引导他们?这非常像一个清单导向的方法。而代理可能会错过一个步骤,或者产生幻觉。所以实际上将两者结合起来,我认为这是一个巨大的机会,人们根本没有充分考虑。我描述的方式是,有一个常见的软件架构模式,即编排与协调。对吧。而我们正处于协调的世界。对吧。编舞基本上是你让事件在系统中运行,然后本地决定下一步做什么。而另一种方法是协调。我认为协调是工作流和代理的指导原则。我的想法是这样的。如果你想自动化某种业务交易或流程,无论如何,你需要做的第一件事就是进行流程挖掘,对吧?理解你希望如何实现这一点。这通常是正确的。一旦你有了这个想法,再次,正如我之前所说,如果你对工作流过于严格,那么运营起来就非常困难,无论是内部还是外部。就像你不能,这就像一条你无法逃脱的轨道。而在现实中,这有时会造成问题,对吧?有时你需要这种灵活性。而对于代理来说,如果它过于灵活,那么你也会遇到问题。我举一个 Daisy 的例子,我们想对工单做出反应。对吧。我们可以把请求看作是工单。对吧。你想处理它们。对吧。所以当你考虑这一点时,你需要做几件事,对吧?你首先需要识别用户。对吧。我正在和谁说话。可能是居民、业主、租户经纪人、供应商。对吧。每个企业、每个行业都有其与我们互动的人的复杂性。然后你需要了解一些事情,比如,你住在哪里?我们说的是哪个房产?然后你进入,好吧,意图是什么?你想做什么?你需要什么?对吧。当我们尝试以一种更全面的代理方式来做这件事时,它只是很难强迫代理执行这些步骤?比如一、二、三,对吧?就像我刚才说的。你实际上想要强迫一些,你想要协调它。我们看到我们的代理在事情之间跳来跳去,比如它理解了意图,但它不理解它在和谁说话。对吧。所以,你可以通过提示工程来解决它,你就是不能,你不能强迫它。而我们所做的,如果我们回到两个极端,我们实际上采取了完全代理的方式,然后我们稍微调整了一下,让它们成为一个网络,一个从顶部协调的代理图。对吧。所以我们说,所以现在我们有一个工作流,或者我们有一些基于代码的协调框架。然后我们现在说,这是一个微型代理,它只做这个,然后你做这个,但你以一种完全代理的方式去做,等等。对吧。那,那确实非常有趣。所以,我认为我们都同意,在渐近线上,人工智能应该能够做到你所说的。但现在我们处于某种脚手架时代。你实际上可以,你可以利用现有的技术,然后你可以强迫它们或帮助它们实现你所需的功能。在某个时候,我们可以移除这个脚手架,让它只用经典的 LLM 来工作。但我们不知道那是什么时候。这又回到了评估。对吧。就像在我看来,拥有一个评估数据库,说,“嘿,我们尝试做这件事。”所以我们尝试让那个代理经历一个过程。但它不起作用,因为它要么太随机,要么不起作用,或者无法确切理解情况,没有上下文数据,等等。如果你有一个关于这些失败模式的数据库,它就可以成为你公司的真正资产,因为它能让你更快地行动。所以,一旦有什么被解决,你就可以利用新技术或不同的模型。你对此有什么看法?你如何看待构建 Daisy 的评估数据库?我尽量不讲太多哲学,但在我看来,评估框架基本上就是你编写知识产权的地方。这就是你的知识产权的编写方式,从某种意义上说,你捕捉了领域,比如领域就是这样被捕捉的。对吧。而且这很难复制。这是一种非常行业特定的。我相信我们相信,我们可能是世界上第一个在住宅物业管理领域拥有这个评估层的人,它捕捉了成为一个优秀的物业管理者的本质。对吧,捕捉术语,捕捉流程。对吧。在哪里你可以灵活,在哪里你可以严格等等。所以这有点哲学化了,但实际上,我会这样想。顺便说一句,这并不哲学化。我认为任何收听这个播客的人都应该这样思考如何随着时间的推移创造优势。所以,继续。但这绝对不是哲学化的。很好。所以,所以,是的,我,而且我认为,好吧,让我们来思考一下。我将尝试描述你如何分层创建这种复合效应。对吧。首先,你有这个代理,你只是看着它,对吧,它在做事情。然后你大概判断它好不好。但这还不够。对吧。所以你开始创建这些基准,你可以把这些基准看作是问题和答案,但因为一切都是随机的,对吧,因为我们谈论的是 LLM,即使你一次又一次地运行相同的基准,你也可能得到略微不同的结果。然后你开始生成,并且有很多使用 LLM 作为裁判的做法,以确保答案足够接近你想要的结果,等等。所以现在出现了一些做法。最有趣的部分在于两个方面。首先,你如何将你的领域专家插入其中,这是一个文化,也是一个组织结构。对吧。所以你基本上会把以前负责服务的人,你知道,重新分配他们的工作。对吧。你不再面向客户了。你正在帮助构建人工智能代理的基础设施。对吧。以及你如何构建内部接口,让他们能够捕捉好的例子或坏的例子?对吧。我甚至会提到,如果听众中有人没有看到 Lemonade 的做法,他们实际上构建了一个功能齐全的内部系统,帮助操作员了解 LLM 的行为,重放答案,修改它们,然后将其重新插入到逻辑、提示或模型中。我们正在遵循这些步骤。这是至关重要的。最后一块拼图是,你如何通过创建下一个版本来完成闭环?对吧。下一个,它看起来是什么样的。第一阶段,也是我们现在所处的阶段,就是捕捉这些信息,然后基本上创建下一个版本,编写下一个版本。对吧。这可以是改变提示,但也可以是让你的内部 API,也就是工具,更具表现力。对吧。我惊讶于通过让我的 API 更具表现力和文档更完善,对提高准确性有多大影响。这就像,是的。就像给任何工匠提供更好的工具。太棒了。对吧。它,是的。我认为很多时候你试图用相同的技术和 LLM 来解决所有问题。它是一种转移,一种很棒的技术,但它没有意义,对吧?它不理解,你知道,工具很重要。它比很多事情都重要。但是你提出了几点我认为值得思考或至少思考的。首先,在 Monday.com 的早期,当时它还叫 Pulse,Roy 做了一件非常聪明的事情。他让他的销售人员的薪酬与工程师类似。所以他们没有任何基于销售的奖金。原因是他说,我正在学习如何销售产品。所以我想让我们的激励措施保持一致。而你所说的非常有趣。这是在想,公司内部的员工薪酬可能会重新调整,他们的薪酬以前可能与外部互动或销售有关,但现在你想让他们保持一致。你实际上想让他们为代理提供更好的指导。所以薪酬模型也应该改变。这是我认为非常有趣的一点。另一件事是,投资者现在正处于一种奇怪的结合状态,既对人工智能感到兴奋,又认为没有护城河,也没有风险投资了。他们就像受惊的鹿,你在很多情况下都能看到。而你所描述的收集信息和完成反馈循环,可能是一个护城河的产生者。对吧。正确。所以,你服务的建筑越多,你的代理获得的反馈就越多,它们获得的反馈就越多,你就可以调整代理,理想情况下是自动调整,以便它们更好地服务。如果不行,但即使不行,只要你意识到并专注于获取这些反馈并改进你的代理,你就会成为一家更好的公司。正确。这与以前的情况完全不同。这就像,是的,你知道,不清楚。而且我认为这会非常有趣,结合你的经验。在什么阶段,你定义一个代理在性能方面足够好,可以投入生产?对吧。代理在什么时候成为团队成员?特别是对于像 Daisy 这样的服务公司。我真的很喜欢关注运营指标。运营指标可以是响应时间、解决时间、吞吐量、客户满意度。对吧。无论是交易性的还是,我认为一旦你拥有一个你觉得能够产生影响的代理,而且它实际上很容易理解,因为你把它插入到某个领域,你就会看到两件事。首先,你会看到指标的改善,但你也会看到团队更加安心,因为物业管理很难。这是一个艰难的行业。你看到他们有点像,“好吧,我得到了帮助,对吧?”就像你的团队里又多了一个可以帮助你的人。字面上看,你看到他们采纳一个新加入团队的代理时,和他们采纳新成员时一样兴奋,就像,“哦,感谢上帝,这个代理 Lily,现在可以为我们分类工单了,对吧?而且,他们非常高兴,尽管这就是你认为“它已准备好投入生产”的时候,对吧?是的。所以,这是一种混合,有点像,是的。是的,这相当主观,而且就像运营指标一样。但然后就像员工对与其他团队成员(碰巧是人工智能)的互动感到满意一样。我必须在这里说一点,因为我认为你也提到过,这可能与你之前说的薪酬故事有关,Yotam,我的联合创始人,从 GPT 3.5 推出以来做得非常出色。我们开始每两周举行一次会议,每两周一次,我们有一个会议,至少花十分钟谈论公司里的人工智能。他基本上把公司带入这个人工智能时代的努力,投资的程度,以至于公司里的每个人都在期待它。没有丝毫的怨恨或怀疑。对吧。因为我们投入了大量资金来培养一种文化,就像,“好吧,这将带领我们前进。”我喜欢,这是我们谈话的亮点之一,这也是我们谈话的亮点之一。而且实际上有一个相关的问题,但你可能已经回答了,那就是技术联合创始人如何与他的非技术联合创始人互动?尤其是在人工智能的能力变化如此之快的情况下,比如,当你的联合创始人告诉你一个你认为“这绝对不可能奏效”的绝妙想法,或者可能实际上受到启发时,这种动态是如何变化的?是的。首先,我必须说,Yotam,虽然他不是程序员,但他是我认识的最好的产品人之一,他非常懂技术,而且他知道很多。但我认为,作为一家科技公司的首席执行官,有时会梦想远大。是的,他梦想远大是件好事。这就是公司前进的方向。而且,是的,你说得对,有时我需要捕捉这个梦想,它可能非常宏大,然后尝试设计它如何与我们的日常工作相遇。而且,实际上,在他看到其他地方讨论代理在劳动力中的应用之前一年,他就梦想着代理在劳动力中的应用。起初很难相信,但现在它已经成为现实,在 Daisy,我们拥有代理作为团队成员,这是现实。所以,我基本上只是在连接点。这是我的角色。我认为。这就像科幻小说,对吧?我小时候最喜欢的书就是科幻小说。许多科幻小说实际上描绘了我们今天所经历的。所以,再次,非技术联合创始人就像一本科幻小说。也许,而且可能是我们之前谈到的电子邮件数据库。对吧。所以,拥有这些梦想,如果可以的话,它有先前的失败模式,有些可以通过数据解决,有些可以通过下一代解决。所以任何梦想,任何想法,就像我们需要教非技术人员如何以一种有效的方式写下来。随着时间的推移,机构记忆是如何运作的?就像,在某些采用场景中发生重大失败的机构记忆是多么伟大?收听此播客的每个人都有自己要解决的问题。而且我认为每个人都知道他们想要尝试实验的领域。你总是需要有这个可以进行实验的领域——一个例子可能是,某些类型的客户,你觉得失败更安全,对吧?或者某些类型的互动,或者,也许是没有任何监管的业务领域。对吧。我不会从那里开始。对吧。比如,或者那里,没有金融交易。我不想从那里开始。我想从更安全的地方开始。一旦你有了这个可以安全实验的领域,并且你还让团队,运营团队,无论营销,无论谁在那里和你一起工作,你都会说,“嘿,伙计们,我们正在尝试一些东西。我们可能会失败一些。其中一些失败可能会令人尴尬。没关系。我们会处理的。而且,他们会尽一切努力快速学习并恢复。我可以举个例子,对吧?我们有一个代理,它通过电子邮件响应得非常快。为什么?因为它的人工智能。但我们不在这个领域。我们有一些客户说,“这太快了。”为什么这么快?这太快了,令人惊讶。我们实际上不得不人为地增加一些等待时间,然后才发送响应,因为它造成了一些,“发生了什么?”而且,这又是一个业务领域,响应是由代理生成的,但客户不知道它是代理。对吧。所以,这没关系。没关系。我们解决了。我们继续吧。对吧。因为,我们从一个更安全的实验领域开始。这是我的普遍建议。Erez Dickman 之前提到过 Lemonade 的框架,Erez Dickman,当我为这一集做咨询时,他提到了一个不同的方法来处理风险管理者在风险情况下的情况,而不是让人工智能实际采取行动或帮助你采取行动,但以一种非结构化的方式,它实际上会驱动,它应该实际驱动一个用户界面,就像老派的用户界面一样。太棒了。所以,嘿,你想改变你的付款。时间表。听着,这是用户界面。我会为你打开它。我可能会为你预先填写好,但你仍然需要以结构化的方式与它互动。太棒了。今天有很多关于与人工智能互动方面的研究。一个非常有趣的是,每个人都知道聊天,对吧?聊天是人工智能的一个很好的界面,但就像,我看到它在很多地方都在发展。即使你有时在 ChatGPT 中看到它渲染成表格或某种形式的——。而且,有一个“生成式用户界面”的概念,对吧?所以,基本上,而不是问你一个问题,比如,你的公寓有多大?对吧。而不是,你可以输入答案,你基本上可以渲染一个滑块,对吧?或者任何用户更容易与之互动的用户界面组件。这是一个非常非常有趣的方式,可以创建也提供这种安全性的互动。是的。而且我认为这里实际上还有两个护城河。我只说一下。你可以有一个预设的组件,你只需要把它插入聊天中。对吧。你也可以考虑生成自定义的。对吧。就像即时编码一样。无论人工智能会做什么样的界面,比如,也许我们会尝试一张地图,但你没有——然后你需要访问设计系统等等。那里有很多有趣的技术。我喜欢。所以,我将以两个快速问题结束。我通常会问每个人。你认为通用人工智能(AGI)什么时候会到来?你的赌注是什么?2027 年。2027 年,那么超级人工智能(ASI)紧随其后,很可能?中国还是美国?美国。到目前为止是 2 比 1。如果我能投票,那就是 2 比 2。我是,我是支持美国的,是的。是的,团队。我是美国队。美国队,嘿,非常感谢你。这太棒了。非常感谢。很快再聊。很快再聊。再见。Nir 在 Daisy 所构建的不仅仅是一个自动化工具。它是在人类和机器之间建立了一个新的信任层。在这个时代获胜的公司,不是那些收集数据最多或拥有最大模型 Thus, the companies that win in this era will not be the ones that collect the most data or have the biggest models. They will be the ones that have the feedback loops making their agents better. Because the real challenge isn't making agents act, it's helping them evolve. If you have any questions, comments, recommendations for future guests, feel free to email us at, almosthuman@aleph.vc. If you enjoyed today's episode rate as five stars, share it with a friend. I'm Eden Shochat, and this is Almost Human. We'll see you next time.