📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

BuzzFeed's Gilad Lotan takes on AI Embeddings | Almost Human

Aleph28:48

Transcription

我认识上帝已经 30 年了,很高兴看到早期的一些 Twitter 集群工作,即使在今天,在大多数公司中也看不到真正理解嵌入的含义。为什么这对企业家很重要,而不仅仅是一种副产品或人们不需要知道的东西,以及为什么你实际上不需要构建一个基础模型来成为一家人工智能公司,但你也不能只做一个 GP 包装器就称自己为这家新的人工智能科技公司。[音乐] 欢迎来到《Almost Human》第一集,这是一个探索当今人工智能世界的播客。什么是炒作,什么是变革性的,以及它如何重塑投资者、初创公司和以色列科技的生活。这个播客不仅仅是为技术精湛的工程师准备的,也为那些渴望摆脱噪音的企业家或该领域的专业人士准备的。我几乎很兴奋。人工智能有它的流行语,但偶尔,你会遇到一个最终支撑一切的概念,突然间你无法停止看到你可以用它做什么。对我来说,最近,那就是嵌入。大多数人,甚至经验丰富的工程师,仍然认为它们是让文本在 rag 系统中工作的查找方式。但嵌入远不止于此。它们是你如何根据品味、行为、甚至你不知道存在的模式来对内容和人进行分组。这种转变开启了全新的产品构建方式。想象一下,如果你不再像 Google Adwords 那样销售关键词,而是开始销售用户嵌入。从 adte 到联盟营销的整个行业都将被改写。而且还有更深层次。一旦你在嵌入层面进行操作,你就会意识到对齐本身就会发生变化。给 LLM 输入 token,它会遵守规则。给它输入嵌入,突然间你就更接近机器代码了。法律的精神不再适用。这既令人兴奋又令人不安。为了探讨这一切,我将与 BuzzFeed 的人工智能、数据科学和分析主管 Gilad Lutan 一起。他的工作处于数据文化和创造力的交叉点,理解人们为什么点击、分享和连接。我们将一起探讨嵌入的真正含义,为什么它们是人工智能强大功能的隐藏层,以及这为企业家创造了哪些机会。我是 Eden Shut,ALF 的平等合伙人。欢迎来到《Almost Human》。让我们摆脱噪音。>> 那么,Gilad,欢迎。>> 谢谢你,Eden。很高兴来到这里,见到你总是很高兴。>> 让我们直接开始吧。所以大多数人想到人工智能时会想到提示和聊天机器人,但嵌入是这种基础设施层。一些人,包括你,可能会称之为不性感,对吧?但它是关于 LM 的一切事物的基石。你能快速讲一下吗?>> 是的,绝对。绝对正确。LLM 是人工智能话题中最不性感的部分,也是最重要但没人谈论或被严重低估的部分。所以我很高兴我们能进行这次对话,我看到它了,在过去几年里,嵌入的发展和能力确实为我们作为一家内容公司打开了巨大的机会。但任何必须处理内容的服务,包括我们认识和喜爱的许多科技公司。我认为,历史上数据科学的一个核心问题,我在这个领域工作了很多年,你总是试图理解内容是什么,而你受到标签和命名实体的很大限制。我们过去使用过 TF,我们试图计算单词,然后进行归一化,并查看单词在一个语料库与其他语料库中的出现频率。所以我们学到了很多 NLP 技巧,它们非常有用,但在真正理解一段文本或一个字符串是什么方面非常有限。在过去的十年里,我们在从字符串中提取语义意义的能力方面取得了许多令人难以置信的进步。所以现在,我们不再说这段文本属于这个类别,而是将其分类并说这是关于名人、这是关于体育、这是关于新闻。你可以获得非常细致的理解,并说这些词一起出现,使得我可以匹配一段文本与另一段文本,即使它们有非常不同的词,但捕捉了相同的语义意义。所以我想说,这种能力确实是由嵌入解锁的,以及能够说这段文本与那段文本相似,但不是因为它们有相同的词,而是因为它们有相似的含义,所以这是一个巨大的、巨大的区别和巨大的解锁,对于产品来说,我认为我们发现了许多机会。嵌入的一个早期例子是“国王减去男人,加上女人等于女王”,对吧?你怎么解释呢?人们没有意识到意义如何转化为数学,而这正是嵌入的全部意义,对吧?那么为什么这种数学句子数学有效呢?>> 是的。所以,嵌入的有趣之处在于,它们实际上是神经网络中的一个层,该网络已经在一个文本语料库上进行了训练,对吧?如果我们谈论文本嵌入。所以,你训练了这个神经网络,它有所有这些层,你实际上是在提取其中一个层,通常是靠近输出的层。所以你仍然在一个高维空间中操作,对吧?你实际上是将一个字符串或单词变成一个向量。所以你通常用嵌入来做的是,你说,好的,这是一个字符串,让我们嵌入它。这意味着将其变成一个向量。这是另一个字符串。让我们嵌入它。然后,让我们计算它们有多相似。所以你实际上是在向量数学中操作,并且你在计算余弦相似度。你可以减去,添加向量,并且它基本上是因为神经网络是在语义意义上训练的,所以你可以有效地用数学来操作单词,我认为这对于任何使用这些工具但可能不熟悉该领域的人来说都非常直观。但它使得它非常有用,因为它使得尝试查找相似内容的操作成为一个简单的数学运算,或者尝试查找一组彼此相似的项目。再次,一个相当简单的数学运算,有趣的是,它不仅仅是距离,对吧?所以你可以搜索类似的东西,但你实际上可以说明,“嘿,我正在寻找一段内容,它与这个相似,但又尽可能与这个不相似,对吧?因为这也是一个距离运算,对吧?所以你实际上可以选择不同的,这就像,我认为我们稍后会谈到,这是过去的内容过滤,对吧?>> 是的。所以我可以给你一个具体的例子,这可能有助于理解。所以你知道,Buzzfeed 写了很多内容,我们以多种方式使用嵌入,但有一种方式>> 所以不是每个人都熟悉 Buzzfeed 有多大,只是给一些文章数量,而不是因为嵌入非常便宜,不像 LLM 那么昂贵,所以以你的规模,真的没有办法用 LLM 分析每一篇文章。哦,是的,我们有数亿篇内容。我们有视频,我们有文本,我们有长篇,短篇,我们有 Huffpost 的新闻,我们有生活方式品牌。其中一个叫做 Tasty,它拥有一些最大的社交媒体页面,比如最大的 Facebook 页面和 TikTok 页面。然后 Buzzfeed 是一个娱乐和生活方式网站。数亿用户。所以再次,是最大的数字出版商之一,我们的数据当然是我们创造的内容,还有围绕内容产生的信号,比如谁在消费,他们多久回来一次,他们在网站上采取什么行动等等。所以我们实际上已经将嵌入集成到我们的元数据套件和功能存储中。所以每次我们发布一篇新文章时,都会有一个作业运行,创建一个嵌入,将其集成到推荐系统中,对吧?所以新文章可以被考虑显示在其他文章附近,或者显示给具有特定偏好的用户。然后还有。所以这是我们作为一家想要向用户展示内容的公司的嵌入非常有用的一个非常标准的方法。但也有一些内部工具可以帮助我们的作家提高效率。所以我们写了很多购物内容,我们与亚马逊、Etsy 和其他电子商务商店密切合作。我们的团队一直面临一个问题,他们一直在整理列表,推广商品的列表,对吧?我们有过去推广过的不同产品的数据库。我们有关于它们的各种指标。但查询这个数据库一直很困难,因为我们需要有很好的标签,而且 BuzzFeed 上的许多文章不一定是典型的标准类别。所以可能有一个作家想为“搬到纽约市的年轻夫妇”创建一个购物商品列表。我们想要一个列表,这里有你需要购买的 10 件东西。嵌入之所以做得很好,是因为它们具有文本的语义理解能力,它们可以识别与这个字符串“家具、年轻夫妇、纽约市”最相关、最相似的商品。仅仅这项能力本身就为我们的团队节省了无数小时,并使团队更加高效。这是一个很棒的观点,关于内部工具,我认为在许多公司实施人工智能,人们最初害怕直接向用户展示,但构建内部工具并提高效率是一个非常有趣的话题。但你实际上提出了一个观点,关于我们应该如何重新审视用户是如何被定义的,对吧?因为用户,尤其是在媒体网站上,是由对该用户有吸引力的内容来定义的。所以我假设现在如果你想到 BuzzFeed,你会说,“嘿,我们是一个市场,用户愿意付出一些注意力,我们需要在最短的时间内向该用户展示最合适的内容”,而这正在发生。这几乎是一个持续的过程,它也在教育系统,了解未来观看的内容是什么。这个堆栈是如何构建的?当你进来时,你如何快速找到对特定用户感兴趣的东西?>> 是的,这是一个很好的观点。所以,我认为这取决于。所以这个系统有很多部分,但你实际上是在谈论一个推荐系统,对吧?以及我们如何构建一个推荐系统,在正确的时间将正确的内容与用户匹配?历史上,你知道,我们使用非个性化的方法。这对许多门户网站和大型网站都很有用。你会使用一种叫做多臂老虎机的方法,这是一种强化学习形式,但你非常快速地查看信号并更新你推荐的内容,但使用这种方法很难实现个性化,并且有一些方法可以创建个性化集群或群组,但这不是真正的用户级别。一直以来的挑战之一是,你必须通过一种相当严谨的方法来完成特征工程。好吧,我们对用户了解什么?他们来自哪里?我们以前见过他们吗?他们点击过什么吗?好吧,我们如何用标签、关键词或主题来表示他们的兴趣?它从来没有真正,它从来没有真正好过。我的意思是,我认为这就是当你有社交网络和社交媒体时,你可以利用他们的社交图谱来了解他们可能感兴趣的内容,对吧?所以,这是一个非常有用的信号。但现在我们使用嵌入可以做到的是,我们可以说,好吧,我们,你知道,新用户,我们对他们了解不多。我们知道你现在正在阅读的文章。我们可能知道你来自哪里。所以我们当然可以使用这些信息。但如果我们有任何关于用户的信号,通常我们会有,比如他们点击过,他们以前看过我们的文章,我们可以开始通过使用这种数学来表示一个用户,通过查看他们点击过的文章或他们花费时间最多的文章或他们保存的文章,对吧?他们对文章采取的行动。所以你可以开始使用这种向量表示的兴趣作为一种非常方便的方式来表示用户。当我们现在将我们的内容与使用这种方法表示的用户进行匹配时,我们已经看到了非常有意义的改进。>> 嗯,另一个主要的匹配市场显然是 AdWords,对吧?这可能是迄今为止建立的最有效的商业机器。现在 Google 的 4000 名工程师正在努力弄清楚 AdWords 是什么?它将走向何方?而你看到的关于与用户绑定的嵌入实际上非常有趣,因为媒体网站历史上并不是最好的变现者,因为你没有用户的意图。但现在这种意图也消失了,对 Google 也是如此。而理解用户,拥有关于用户的那些嵌入来描述他们感兴趣的东西,可能是一种新的匹配引擎形式。那么这对媒体网站意味着什么?核心业务概念是意图与为正确用户找到正确的广告单元。>> 是的,我认为,我认为媒体网站现在的区别在于,你可以用更少的信号做更多的事情。所以我们可以使用,我想说,历史上媒体网站不会处于有利地位,除非我们谈论的是登录并经常回访的忠实用户。所以可能有一些观众只是为了几篇文章而来,没有足够的信号来真正,你知道,定制活动并针对这些用户进行活动。我认为现在你可以用更少的信号做更多的事情,用户,然后识别相关的活动,并将用户包含在这些活动的定位中。我想说,你知道,媒体公司最大的问题就是规模,你知道,即使是大型数字媒体公司也很难与 Google、Amazon 或 Meta 这样的平台竞争,它们拥有无尽的库存。但我想说,我认为现在定位这些东西更容易了,这些东西更容易获得,你不需要像 4000 名工程师那样庞大的团队,对吧?你可以用一个更小的团队和一些现有的能力来做到这一点。所以我确实认为我们正在看到的进步正在让小型参与者能够,你知道,拥有更多的堆栈,尤其是在广告领域。你可以想象一个世界,关于描述用户的用户数据库,无论是嵌入还是其他东西,实际上是分布式的,它不是像 Google 那样的集中式,Google 当然拥有信号,那就是“你搜索了那个”,但就此而言,Meta 历史上一直拥有关于人的数据库,所以你实际上可以看到不同的媒体公司进行合作,因为这是一种规范化器,对吧?嵌入就是嵌入。用户就是兴趣。所以我可以收集更多关于特定用户感兴趣的内容以及多个用户感兴趣的内容。所以这可能会以不止一种方式改变广告技术堆栈。>> 是的。而且我认为,我认为广告界的所有第三方提供商和广告界一直在发生相当大的变化,尤其是在 Apple 在其移动平台上添加了所有更改之后,对吧?虽然 Chrome 也要推出这些更改,然后他们退缩了。但历史上我们使用,我猜我们没有使用太多关于用户的历史数据。你只需要知道一个 cookie,你知道的页面浏览量与一个你见过的 cookie 相关联,你有一个电子邮件,你可以拼凑出跨网站的用户视图。所以你拥有所有这些第三方参与者,它们在创建广告活动的定位方面起着至关重要的作用。而且我认为,是的,我认为现在可以在网站内部做更多的事情,而且如果发布商联合起来。>> 是的,这是关于用户是谁、他们对什么感兴趣的隐形知识产权模式。>> 而且它现在尤其重要。我的意思是,我认为如果你和任何出版商谈谈,任何在媒体工作的人,每个人都在谈论直接流量,所以我们正处于一个用户从一个网站传递到另一个网站的情况越来越少的世界,而那些能够在这个时期生存下来的出版商和媒体公司是那些拥有人们知道并直接前往的品牌的公司。>> 是的,我完全同意。这真的很有趣。而且它更少是 PPI。所以你也有一个 PII,更少的 PII 问题,因为实际上你只是用 1500 到 36 个向量来描述人们,对吧?只是标量空间。所以你并没有真正了解他们任何独特的东西,除了他们感兴趣的东西。>> 是的。作为一个向量。>> 是的。>> 我知道你是向量。>> 是的。如果我看看成本和陷阱,对吧?就像我们让它看起来像是,这是显而易见的,每个人都应该这样做,但如果你看看早期,云曾经占公司成本结构的 10%。所以你的云成本,我现在看到公司使用 LLM 占他们预算的 30%,占服务成本的。所以这通常很昂贵。>> 他们是在训练吗?他们是在构建自己的推理吗?>> 实际推理,如果你只是利用一个明星模型,这就是为什么蒸馏对那些在 LLM 方面进行扩展的公司很重要,但实际上是嵌入,如果你看看嵌入的成本结构,有什么大的陷阱,如果你能回到一年前,你会建议自己注意到什么?>> 嵌入实际上不是,我认为向量数据库,向量存储,如果你使用托管的向量数据库,那可能是最昂贵的部分。嵌入本身非常容易获得,而且非常高效,而且成本不高。所以,只要你有静态内容,我们大部分情况下都有,你知道,我们发布了一篇内容,它不会改变。如果改变了,也不是经常。所以我们不必重新创建、重新生成嵌入。所以对于我们的内容来说,成本非常低。我认为对于用户规模的用户来说,情况有所不同。而这正是我们正在进行的,这个领域更具实验性,我们正在为每个用户创建一个嵌入。显然,如果我们每几分钟更新一次,那将非常昂贵,成本过高,但如果我们不需要更新它,或者如果我们有办法在不进行这些推理调用的情况下更新嵌入,比如,如果你每天更新一次,我认为成本是可以控制的。我们支付最高成本的地方显然是富媒体到生成媒体图像视频,推理和模型,那显然是另一个话题,但它正在造成很大的损害。但在技术方面,文本方面,感觉非常容易获得,但对于多模态模型,我不知道,随着多模态模型的出现,许多模型还没有嵌入生成,所以我假设,如果,如果一个解决方法是,嘿,让我们看看这张图片,让我们生成文本表示,然后使用嵌入。你是否已经尝试过,或者你对即将出现的某些多模态的东西感到兴奋?>> 是的,我们还没有找到一个很好的用例,尽管我认为,将图像与文本一起嵌入可能非常有价值。我们只是发现我们拥有的文本足够了,我们拥有的所有元数据也足够了,我们只通过嵌入文本就能获得非常好的结果。所以我们还没有将图像本身包含在内容表示中。但我可以看到它会到来。我可以看到它,我可以看到未来可能会有一个有价值的用例。还有一个问题是,随着这种能力越来越多地集成到更多的产品表面,我们会嵌入什么?我们嵌入文章,我们嵌入作者信息,我们可能嵌入更新,我们嵌入 JSON 文件。所以你可能会达到一个点,即每篇文章有多个嵌入,每位用户也有多个嵌入。它们代表了用户的不同方面,一个可能是点击,另一个可能是喜欢,另一个可能是社交事物,他们的朋友喜欢,你知道,所以不同的功能然后用于推荐系统。所以这可以呈指数级增长,尤其是在这种能力被集成到我们的堆栈中之后。这非常有趣,关于聚类,找到一个人不同的方面。所以拥有一个全面的了解,仅仅根据代表同一用户的嵌入数量和嵌入之间的距离,意味着距离越大,意味着他们对更多事物或不同主题感兴趣,或者这就像,你的兴趣范围有多大?一个人可以认为,我喜欢这个。>> 是的,我们发现的一件事是,我们必须非常小心地平均化你的兴趣。所以,例如,我们取一个用户的点击,然后平均化它们。在某些情况下,平均值实际上是无意义的,它并没有告诉我们太多,因为,如果你想想所有这些不同的点,平均值就在中间。所以我们实际上发现的是,通过对我们的文章和我们的主题空间进行聚类,我们对我们发布的所有内容进行聚类,然后我们有效地将用户关联到这些集群,我们对用户感兴趣的内容有了更好的了解,而不是仅仅简单地将数学平均到中间。>> 所以,是的,集群起着非常关键的作用,并且已经成为我们所有分类模型、预测模型和推荐系统中的一个主要特征。如果我不考虑 rag 系统,只是普遍使用嵌入来查找可能与上下文相关的文本,那么最快的胜利是什么?也许是针对一两种类型的公司。>> 是的。所以任何内容公司,我的意思是,推荐系统在我们的点击率方面看到了两位数的改进。所以这是非常明确的。我认为另一部分是检索。所以,我不是在考虑 rag,而是有效地搜索,内部搜索或不同的方式来梳理你作为公司拥有的项目或项目语料库。它可以是 Slack 消息,可以是客户服务,你知道,文本,我认为它可以是各种各样的东西,但只要它包含,你知道,具有语义意义的文本,你就可以非常灵活地查询并获得相关内容。>> 这太棒了。这就是我和 BuzzFeed 的人工智能、数据科学和分析主管 Gilad Lutan 的对话。而且我认为很清楚,嵌入不仅仅是另一个流行语。它们是一种新的构建块。无论你是对内容进行聚类,对人进行聚类,还是重新思考 adte 等商业模式可能如何发展。嵌入开启了创造价值的全新方式。如果这一集为你消除了部分噪音,请与一位正在构建人工智能的朋友或同事分享,并确保关注《Almost Human》,以免错过接下来的内容。我是 Eden Shut。感谢收听。下次再见。[音乐]