📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Chroma CEO Jeff Huber on Vector Databases, Multimodal Embeddings & Building an AI Startup

Redpoint50:45

Transcription

这是无监督学习,一个关于快速发展的人工智能领域最新动态以及它对世界商业意味着什么的播客。我是乔丹·西格尔,我的联合主持人是艾丽卡·布雷西亚。在今天的节目中,我们请来了 Chroma 的联合创始人兼首席执行官杰夫·休伯。Chroma 是一款开源向量数据库,已迅速成为该领域领先的产品之一,拥有超过 7000 个 GitHub 星标和 4000 个 Discord 会员。这是杰夫的第三次创业,他之前在 Mighty Hive 工作,该公司以 1.5 亿美元被收购。我们讨论了 Chroma 与竞争对手的区别。我认为,在某些方面,我们可能不够聪明,无法制造出复杂的东西,结果却制造出了简单的东西。我们讨论了人工智能技术的新发展,例如多模态嵌入。有些人有联觉,他们能听到颜色,尝到声音,或者就像语言模型一样,有联觉,而杰夫分享了他对想进入人工智能领域的听众的建议。现在开始一家新公司还不晚,去攻读博士学位。加入 OpenAI 还不晚,加入 Chroma 还不晚。非常感谢,希望您喜欢这期节目。谢谢杰夫,我们非常高兴您能来,非常感谢您加入我们。谢谢您的邀请。那么,首先,我敢肯定我们的听众会很想多了解一下您自己。您最初是如何涉足人工智能领域的?最终又是什么促使您创办 Chroma 的?好的,Chroma 大约有 14 个月了。它是在去年五月开始的。我的联合创始人和我认为连接在一起的是,我们已经认识了很多年,并且我们都曾在应用机器学习的背景下工作过。所以我们都看到了,将一个吸引人的演示(如果有干净的数据和机器学习,这通常很容易)转化为一个您实际想要依赖的健壮的生产系统,这有多么困难。你知道,每晚都比前一晚难一个数量级。而这似乎是一个大问题。似乎没有非常智能的解决方案。所以,即使在今天,在大多数传统的深度学习环境中,最先进的技术也是随机抽样,将新数据放入训练池,以及基于活动的 डेटा 选择。所以,嘿,无论出于何种原因,我们的停车标志检测器在上面有柳树时就无法工作。好吧,让我们的数据分析师去我们的数据集中查找一千个这样的例子,历史数据集,然后找一个供应商,尝试创建大量的柳树覆盖停车标志的排列。我们将标记您的数据,将其输入模型,希望它能变得更好,并希望它不会破坏其他任何东西。这通常不是事实。所以这看起来很糟糕。而我们的信念是,潜在空间本身的几何和拓扑结构,即在潜在空间中查看数据,以及模型本身如何理解自己的数据,是一种非常有前景的方法,可以找到一条清晰的道路,再次将您的吸引人的演示转化为一个健壮的生产系统。当然,14 个月前,这是在大型模型爆炸之前。所以我想这是一件好事。我们已经做了很长时间了。我想在宏观上看,时间并不算太长。但是,去年夏天,Stable Diffusion 发布了。去年冬天,ChatGPT 发布了。是的,我认为我们看到的是,在内部创建任何带有向量搜索的产品有多么具有挑战性。我们自己构建了一些向量搜索的东西,以便在潜在空间之上运行分析。并且发现一切都非常难以使用,有点压倒一切。然后形成了一个观点,即这对于真正拥有电子邮件投资者至关重要,在一月初。我只是阐述了电子邮件的标题和后续内容是帮助我们完成这个想法。它就是大型模型,非常重要的嵌入,摄取世界,每一块数据都将被嵌入,使其对语言模型可解释。以及一个非常注重开发者体验的系统,它不存在。所以这就是那个核心。这实际上是来自于与用户的交谈。我们在十二月或十二月底,一月初,这已经不可能了。但我搜索了十二月在 Twitter 上提到嵌入或 LangChain 的每一个用户,并直接发送了消息给所有开放私信的用户。这只有大约 150 人。数字不大。然后安排了大约 35 次 Zoom 会议。在谈话中,我认为发现这是真的。人们在自己构建东西或使用为不同用例构建的东西时,有很多痛苦和心痛。所以,事实证明,今年的情人节,我们以开源的形式发布了 Chroma。我不知道为什么是情人节。它本应是情人节前一天,但我们有一个 bug 需要修复,所以推迟了一天。所以,是的,是情人节,我们发布了这个项目。而且,这很酷,很棒,显然是建立社区。建立一个开源公司和项目真的很有趣。这是一个好时机。所以,是的,这很有趣。我认为情人节实际上是一个很棒的日子,当你发布开源软件时。感觉就像是给社区的一份礼物,一封情书。我不知道,我其实不是一个喜欢情人节卡片的人。但如果是开源软件,我可以接受一份情人节的惊人声明。关于您的时机,我认为您的时机简直是天衣无缝,因为您已经足够深入,可以乘上这股浪潮。如果我回想一下十二月有多少人在谈论这些东西,与现在相比,我们已经走了多远,这真是太神奇了。尽管如此,而且我相信大多数听众都知道 Chroma 和向量数据库是什么,您能否为一些可能对这个领域比较陌生的人简单地介绍一下,什么是向量数据库,什么是嵌入,以及为什么它们在人工智能领域如此重要?我们希望人们能够让语言模型学习和记住它们自身权重之外的东西。语言模型的权重非常大,更新起来既昂贵又困难,而且还不确定。你可以一遍又一遍地在训练语料库中告诉语言模型一个特定的事实,它仍然不会。在训练语料库中移除信息基本上是不可行的。我们不知道如何从模型的权重中手术式地移除信息。所以你想要的是一个外部知识库。你希望语言模型能够学习和记住东西,但要放在它自己的权重之外,放在一个外部知识库中。一个你可以查看、可以添加信息、可以更新信息、可以删除信息的外部知识库。它就像任何其他数据库一样即时工作。你删除一个你不再希望语言模型知道的文档,就完成了。我有时使用的类比是《黑客帝国》中的尼奥,当坦克将指令下载到他的大脑时,他有那句名言:“我知道功夫”,然后进入道场与墨菲斯搏斗。那么,什么是嵌入?什么是向量?在底层,嵌入实际上就是一串数字,就是一串数字。这些数字的含义才是重要的部分。所以嵌入模型是机器学习模型,它们被训练来将相似的东西放在高维空间中彼此靠近。所以如果你有一个向量,它有上千个数字,代表一个点,一个千维空间中的点。我们想要的是让相似的文档,可能是关于巴黎的文档,那么其他关于巴黎的文档,可能是关于巴黎舒适咖啡馆的文档,那么阿姆斯特丹和柏林以及其他地方的舒适咖啡馆的文档,都靠近嵌入空间中的那个点。这允许你进行一种新的模糊搜索,以前是不可能的。显然,文本搜索你可以说“嘿,给我巴黎”,你会找到所有包含巴黎的,也许它还会给你“巴黎人”和“巴黎”的一些其他变体。但它不会给你这种模糊匹配,这种模糊搜索。所以模糊搜索能力使得语言模型能够有效地学习和记住东西。因为你希望人们在提示中对语言模型说,你使用过 ChatGPT,你体验过这个。你想去那个盒子说:“嘿,巴黎有什么舒适的咖啡馆?”当你输入时,你可能会出现幻觉,它可能会编造出来,它可能会从自己的权重中流出一些标记,然后编造出来。充其量,它可能是过时的。这是训练时语料库中的数据,很多年前。最糟糕的是,它会编造咖啡馆。它会说:“嘿,去看看 Russo's blah”,它甚至不存在,它在一条假街上。所以你想要的是将语言模型建立在事实信息之上,并能够极快地找到这些事实信息,然后将其呈现给语言模型,并说:“嘿,语言模型,用户问了这个问题,他们问的是巴黎的舒适咖啡馆。我们知道哪些文档可以帮助我们回答这个查询?”所以向量相似性搜索,向量搜索和底层的向量使得这一切成为可能。我很好奇,显然,最近邻和向量搜索是一个主要的用例。自发布以来,您拥有一个惊人的开源社区。您是否看到出现任何其他令人惊讶的用例,或者社区是否倾向于向量数据库的其他用例?主要用例是我们现在所处的时代的“互联网上的报纸”阶段。我们正处于将我们已经做的事情以新的方式做的时代。这大致就是“与文档聊天”的含义。你知道,在过去的 15 年里,硅谷每五年都会有一场聊天机器人热潮。而这是最新的体现。这次可能真的会奏效。再次,就像互联网上的报纸一样,就像在 Web 1.0 中,我们将报纸放到了互联网上。检索增强生成,也就是与一组文档聊天的任务,与此类似。我认为这非常棒,我认为地球上几乎所有的文档集都将能够与之聊天,这对人类来说非常有用。但这只是第一个显而易见的事情。我认为我们开始看到超越它的迹象。而且我认为,显然现在还很早,但我认为代理确实为记忆带来了非常有趣和重要的用例。你已经看到了 AutoGPT 和其他项目,它们获得了你一生中见过的最疯狂的 GitHub 星标增长。然后你问,有人真的在使用这些东西吗?答案是没有,或者还没有。但它会发生的。它会发生的。我认为 OpenAI 的函数调用功能已经使其更加确定,已经更有用了。它会越来越好。我认为,总的来说,任何你今天使用的软件都可以通过内置的智能来改进。这是一种知道你是谁、知道你试图做什么、知道你的偏好并且记住这些事情的智能。而这种代理存在于你今天使用的每一个软件中的想法,我认为很可能非常普遍,甚至可能就在一年之内,或者更早。所以这是一个原生的用例,现在你无法想象。也许你认为 Clippy 是早期版本,但你真的无法想象这种情况发生。所以从这个意义上说,它是原生的,从这个意义上说,它更令人兴奋。我认为乔丹谈到了您在开源社区中看到的惊人采用率。当你放大并审视这个领域时,有很多像 Chroma 这样的原生向量数据库出现,而您在脱颖而出方面做得非常出色。这体现在您拥有的活跃社区中。您认为是什么让 Chroma 与众不同?特别是,您认为人们可以在他们的笔记本电脑上部署并运行 Chroma,并开始构建,这种简单的入门方式有多重要?我认为很难重演历史,并对我们所做的对与错的事情过于确定,并对此有任何信心。我认为在某些方面,我们的时机非常好,这可能更多是运气而不是技能。我认为在某些方面,我们可能不够聪明,无法制造出复杂的东西,结果却制造出了简单的东西。而当人们学习新技术时,他们真的想抓住简单易用的东西。所以对约定优于配置的这种奉献,我认为是很有用的。我认为对设计的强烈关注,想要让从登陆页面到文档,再到 API 本身的一切都感觉直观。它做了你应该做的事情,没有尖锐的边缘让你遇到,它就是能用。你知道,“它就是能用”很难做到。制造一个简单的东西,它就是能做你应该做的事情,这可能是最难做的事情。这也许是米开朗琪罗的名言:“大卫是什么?我只是移除了所有不是大卫的东西。”所以我们做得好的有趣的事情,在营销方面,我认为我们做得不好。我们举办了几个黑客马拉松,我认为我们的 Twitter 账号只发了 40 条推文。所以我不确定你是否应该看看我们在营销方面所做的事情,然后说:“嘿,这是一个模板,这是一本教科书,这是一个关于如何做某事的剧本。”我认为,再次,我们在很多方面都非常幸运。所以,虽然我认为这确实说明了出色的开发者体验的力量,对吧?你可以说,如果你认为你的营销不好,但现实是社区仍在增长,这是因为它的简单性,易于采用性。而且,我的意思是,这是亘古不变的道理。对于电话里的老派人士来说,回想一下早期 MySQL 的日子。MySQL 之所以如此受欢迎,是因为它非常易于上手和使用,而且感觉很熟悉。是的,有点怀旧。是的,这有点有趣,或者说,这有点像一个黄旗,表明我们相信生产力产品优于分发。我认为我们也显然非常关心分发。但是,是的,我认为企业家被反复教导,如果你建造了它,它们就不会来。有时这是错误的。我非常惊讶它到目前为止错了这么多。但是我们并没有沾沾自喜,我们正在努力让产品变得更好,更好地服务开发者,弄清楚要使用什么,因为你将在管道中获得新的集成。我认为最终我们觉得我们有机会帮助定义新一代软件的构建方式及其工作方式。而这是生活中不常有的机会。所以我们非常认真地对待它。我认为,再次,我们绝不是沾沾自喜,我们非常感谢社区的参与和帮助。我的意思是,产品因为人们发现了粗糙的边缘并告诉我们而变得更好,只要我修复它们。我很好奇,你谈了很多关于开发者生产力的事情,这确实是 Chroma 成功的地方。有没有其他方面,人们正在与其他向量数据库进行比较,无论是速度,还是更好地支持某些类型的工作负载,无论是事务性的还是其他的?只是用户体验,除了出色的开发者体验之外,人们在这个领域还在考虑哪些其他因素?这是一个好问题。显然,我们有新的技术正在出现。可接近性可能是最重要的指标。除此之外,我认为关于什么才是重要的,还有待观察。当然,就像所有数据库一样,酸性,速度和性能等等。这些东西都很重要,而且随着这些用例的扩展,并且必须变得越来越生产级,并且越来越多的公司拥有大型数据集,希望将技术纳入他们的组织,所有这些都非常相关。所以,我们正在有计划地努力,在未来几年甚至几十年里,每月都在朝着这个方向努力。我认为更有趣的问题不是什么与以前相同,这些是数据库一直考虑的事情,而是什么不同。那么,关于向量有什么新东西?它与关系数据库不同,或者与你提到的其他数据库技术,键值存储等等不同?我认为对我们来说,这又回到了开发者体验。基本上,一旦你跨越了四个维度,人类在直观理解数据方面就有点无能为力了。关系数据库的优势在于,它只是二维数据,有行和列,你可以创建一个表,你可以在屏幕上显示它,屏幕是二维的,你可以很快理解。一旦你有了数据,就像 OpenAI 的嵌入,有 1536 个维度,能够理解它并理解里面发生了什么,并获得任何确定性的控制或理解和指导正在发生的事情的能力,就变得更加困难了。所以,我认为,总的来说,我们相信我们需要为系统的事务性方面构建一个世界级的、普遍的标准。即在线数据库,它位于我们产品应用程序的循环中,被不断调用和查询,文档不断被创建、更新、删除,召回率保持很高,事物移动迅速,扩展良好。这些是人们的期望,它们并不容易,但它们是基本要求,它们必须发生。我认为,再次,更有趣的问题是,我们如何帮助开发者和语言模型本身能够内省、解释和理解潜在空间。所以这看起来更像是 OLAP,它看起来更像是对向量的分析工作负载。而且,如果我有什么大胆的看法,那可能是,这终于是一个 HTAP 真正对大多数工作负载重要的结构了。所以,对于观众来说,这是高级事务性和分析处理,包括单个记录的检索和更新,以及分析数据库的整个集合或数据库中的所有项目,并快速有效地做到这一点。也许向量是一种数据类型,它将真正发挥重要作用。我们喜欢大胆的看法,我们将在稍后尝试从中挖掘更多大胆的看法。你提到了经典数据库,你更倾向于关系型数据库。显然,很多这些数据库都在添加向量支持。你知道,有 PG Vector,Atlas 添加了相似性搜索,Redis,而且关于这对于未来的向量数据库意味着什么,正在进行一场辩论。我有一种感觉,我知道你会倾向于哪一边,但只是想听听你的想法。而且,随着越来越多的提供商添加向量搜索,这对 Chroma 和其他向量数据库意味着什么?有几点评论。总的来说,我们很高兴。它正在帮助教育市场,这种技术是什么?这项技术很重要。如何使用这项技术?总的来说,有哪些用例?所以我们通常是忠实粉丝。我认为,回到开发者体验,仅仅把它添加到你正在做的事情上,以获得复选框合规性,术语合规性,以避免用户流失或收入蚕食,或者其他任何东西,都不会给你最好的体验。而最好的开发者体验需要极度的专注。一个专注于此的产品,最终将在开源方面做得最好。通常,对于任何类别的软件,你都会有一个项目获得社区的喜爱和采用,而这最终才是最重要的。这是第一点评论。我认为另一条评论是,事情仍然非常早期。所以,任何人都可以骑上马,称自己为赛马,并试图进入比赛。但随着时间的推移,当人们有更多时间去赛道上奔跑时,就会更清楚哪些独立的解决方案最适合这些工作负载。所以,这说得通。你上周有一个非常有趣的公告,关于你组建的 Chroma 应用研究团队,以调查语言模型领域的未解决问题。我认为我们的听众很想听听,你已经确定了哪些领域是值得首先调查的?所以,Chroma 将建立一个小型应用研究团队,或者正在建立。我们不,也不想训练我们自己的语言模型。我们不会训练我们自己的嵌入模型。我们不是在与 OpenAI、Cohere、Anthropic 或任何其他人竞争。我们是真正的瑞士,在所有这些不同的语言模型智能提供商方面。我们希望能够向用户保证,我们没有偏袒,我们可以公平、公正地对待我们向用户做出的工具和建议。也就是说,在任何开发者采用最基本用例的过程中,他们每次都会遇到一系列问题。例如,我应该如何将文档分块以进行嵌入?我应该使用哪个嵌入模型或模型来嵌入这些块?我应该检索多少个最近邻?5 个,10 个,15 个?这些检索到的最近邻是否相关?或者它们是否来自嵌入空间中过于稀疏或过于密集的部分?两者在不同方面都是失败模式。所以,再次,早期,很多基本问题仍然没有答案,甚至没有工具来帮助人们评估。评估仍然是一个非常大的问题。理解这一点,当然,这回到了我应该使用哪个语言模型。最终,它应该回归到某种评估指标。而且,甚至还没有就如何做到这一点达成一致。所以我们考虑应用研究,这些是我们最感兴趣的事情。我们最感兴趣的是密切关注检索可能更深入地进入管道或堆栈的方式。所以今天,我们有一种一次性检索,在输出的开始,我们进行检索,将其放入上下文窗口,点击开始,然后让语言模型流出一些标记。我们认为,未来检索可能会更加持续。所以你将检索每一个标记,或者你将根据一些显着性指标进行检索,当你流出标记时。而且,我认为,再加上 Sam Altman 本人在最近与 Patrick Carlson 的采访中提到的,谈到开源语言模型可能会做很多我们今天看到的 GPT-3.5 Turbo,也许是 GPT-4 所做的那种普通的总结工作。这些开源模型将来可能会做这些事情,可能在不久的将来。这个想法是,再次,这不是我们要做的工作,但我认为社区最终会完成。从我们构建的这些非常大的记忆机器中提炼出推理机器,并能够保留很多推理智能,类似于前额叶皮层的功能,但拥有更小的模型,运行成本更低,训练成本更低,微调成本更低,最终更易于控制和指导,因为它们不太依赖于它们对世界的实际理解,而更多地依赖于人类为它们提供背景,以便它们能够做出好的决定。所以这是我们非常感兴趣的事情,但再次,这更多地是关于语言模型架构方面或提炼方面。而且,我认为在更广泛的社区中,已经有很多出色的工作正在进行,关于 Alpaca 和 LoRA 以及所有这些其他项目。所以,是的,在开源 LLM 前沿。而且,我认为关于这将如何随着时间推移而发展,以及非开源供应商是否总是会领先于开源项目,存在一场辩论。你对此有什么看法?也许另一个大胆的看法在这里是合适的。就像有不同类型的汽车,擅长不同的事情。有时你需要一辆赛车,有时你需要一辆皮卡车。有时你需要 2.1 秒内从 0 加速到 60 英里/小时,有时 20 秒内从 0 加速到 60 英里/小时就可以了。赛车比皮卡车贵得多。所以,我认为这是我想说的第一件事。我想说的第二件事是,人们低估了 GPT-4 级别或未来架构的运行成本和速度将变得多么便宜和快速。据我所知,这些语言模型每三年运行成本和速度至少会降低 10 倍,而且这是复合增长。所以十年后,运行成本将降低一千倍,速度将提高一千倍。所以,这是需要关注的两个曲线。一个是成本和速度曲线是什么样的?然后是能力曲线是什么样的?然后是不同类型用例在这两条曲线上的交叉点。这也许是经济计量学看待问题的方式。所以我就说到这里。我喜欢这个,里面也有一些很棒的比喻。你认为目前最需要解决的问题是什么?或者最高优先级的差距或任何障碍,或者现在没有吗?是的,我们很希望看到人们在代理方面做更多的事情。很可能,互联网和 Twitter 特别是现在只是任何炒作周期的快速运行。现在所有的炒作周期都压缩到了大约 30 天。也许是 90 天。所以,当然,代理,除了这个疯狂的炒作周期之外,然后它们会急剧下跌,然后现在是漫长的上升之路,漫长的建设之路。所以,我认为人们不应该将崩溃视为逃跑的信号,而应该将任何炒作的崩溃视为开始建设的信号。所以,我认为代理是一个很好的例子。我很好奇,在代理方面,我很想听听您对该领域未来的看法。您认为像 AutoGPT 等横向代理会变得更好,它们将成为代理的主导交互方式吗?还是会出现许多公司,拥有非常垂直化的代理,人们将来会选择它们?我认为代理的好坏取决于它的上下文。所以问题变成了,这几乎就像让语言模型执行任务,在某些方面更像是园艺,而不是工程。你想确保土壤真的很好,你想确保你给它浇水,给它阳光,不是太多阳光。它更像是一种有机的东西。它更像是烹饪而不是烘焙。所以从这个意义上说,我认为设置上下文会有很多艺术。所以,当然,你可以想象垂直化代理,人们以这种方式建立有趣的公司。我的意思是,一个非常简单的用例,对这里的每个人来说都是完全显而易见的,或者一旦我说出来,你就会说:“哦,是的,这太明显了,你为什么还要提呢?这是一个愚蠢的用例。”就是代理你的电子邮件收件箱。你想要一个小的东西,坐在电子邮件收件箱里,帮助处理你的电子邮件,回复电子邮件,也许它不发送它们,它只是起草它们,没关系。但你肯定想记住你的指示,你想让人们提供反馈,比如“下次这样做”,或者“停止这样做”。或者你想让它能够从你的数据消耗中学习,查看你所有的电子邮件,学习你的模式,学习你的习惯,学习你的语气,学习你的氛围。而且,我认为今天对于普通用户来说,运行这种代理可能仍然太昂贵了,每月要花费数百美元。对于平均电子邮件用户来说,运行这种代理。但是,随着语言模型变得更便宜,并且在您已经拥有的计算能力上运行语言模型,例如在您的手机或笔记本电脑上本地运行语言模型,将意味着这种情况将变得更加普遍和流行。所以,再次,这似乎完全显而易见,当然,你想要一个电子邮件机器人。然而,令人惊讶的是,你在网上看到的很少。而且,我意识到我问这个问题是不公平的,因为没有人能预测现在 AI 领域会发生什么,而且它变化如此之快。但我很欣赏这个预测。十年预测是可以的。一个月预测也可以。但是两三年预测,那些才是真正的杀手,因为每个人总是错的。所以,你是否跟进那个代理问题?我认为电子邮件用例很有趣。更让我兴奋的是网络控制方面,比如我有一个小东西住在我的手机上,我可以告诉它为我做事。你对此有什么看法?我知道这有点不公平,考虑到你关于短期和长期预测的观点。我猜有两个问题:一个是我认为人们会有不同的代理来为他们做这些不同的事情,还是会有一个代理,它既能帮助处理你的电子邮件,又能因为学到了很多你互动的方式,所以在出去做其他事情时会更有用?这个用例是多代理世界还是?我有点偏见,但我坚信多代理阵营。更小、更具主观性的代理,可以与其他代理协调工作来解决问题。我认为“一个代理统治一切”至少在短期内有点异想天开。而且,正如我之前提到的,上下文是不可转移的,或者至少是不可翻译到其他代理。所以,不是一个代理获得了所有的上下文,并且该上下文可以转移到任何其他代理。你可以把另一株植物种在同一个花园里,它可以受益于土壤、水、阳光等。所以,是的,我认为我们需要对世界现状以及这些东西将如何出现保持一定的务实态度。而且,我认为依靠,至少是传统深度学习的教训,再次,可能在这里应用是错误的,即让机器学习模型做尽可能小的事情,因为那是给你最可靠的东西,然后你围绕这个最小的事情设置所有的围栏和护栏,以获得可靠的行为。所以,是的,大型模型显然是一个非常重要的能力飞跃,或者在某些方面是新的,因为它们是通用的。但我认为,很可能要达到人们想要的可靠性水平,尤其是在消费者体验方面,我们将回到某种程度的围栏或栅栏。而更小、更专注的模型,它们需要做什么以及了解什么,我认为这为实现这一目标提供了一条更好的道路,使其能够工作。不过也可能出错,无从得知。我们会很快知道的。但我很想过渡到 Chroma 接下来的发展方向。你提到过,公开地说,你们正在开发一个分布式版本和一个云版本,显然有很多事情正在进行。但我认为我们的听众很想多了解一下未来的计划。所以,基本上,自发布以来,我们一直专注于让 Chroma 更具文档化,更强类型化,更全面测试,更稳定,更便携,更快。有时 API 本身自发布以来没有显著变化。然而,人们已经利用了我们构建的 API,并将其扩展到了我们从未设想过的可能性中。这是很酷的事情。你知道,软件中好的抽象最终可能是最难找到的东西。而且,似乎我们已经找到了一个不错的抽象,或者一个非常好的软件抽象。那么,接下来是什么?我经常谈论从演示到生产的旅程。我认为今天 Chroma 非常适合演示或小型生产用例。我们还不能很好地服务于大型生产用例,而且我们还不能很好地服务于即使是小型生产用例,并且具有低 DevOps 开销。所以 Chroma 还没有托管服务。所以我们的目标是,开发者可以使用他们在一个 Jupyter Notebook 或一些本地 Node.js JavaScript 文件中学习的相同 API,并将其一直带到生产环境中,以及数百万用户,数千万用户,以及更多用户。所以,朝着这个方向,我们需要提供一个 Chroma 的分布式版本,开源 Apache 2.0,就像其他一切一样,以及我们自己的托管服务,它使用那个开源项目,为开发者提供一个无服务器的,最初是无服务器的体验,围绕 DR 检索,向量搜索。这是第一步,也是我们现在真正关注的。我认为很多其他事情,正如我们已经讨论过的,仍然有些不确定。我们对开发者在向量数据方面进行推理、直观理解和解释有多么困难有很深的见解。然后有一大套工作流程和工具可以帮助开发者可靠地构建应用程序。所以,这些当然是我们想要做的事情。这也涉及到我们已经讨论过的应用研究,我应该如何检查我的文档?我应该使用哪个嵌入模型?我们希望任何产品构建者,任何 Web 开发者或移动开发者,都能够构建一个世界级的应用程序,基于语言模型,由检索驱动,由向量搜索驱动,而无需成为搜索、嵌入、机器学习、基础设施或任何这些领域的专家。而且,我认为这是完全可能的。太棒了。我知道我们公司的很多公司都非常期待能够接触到这一切。你几次提到了嵌入模型方面。今天显然有很多不同的选择,无论是 OpenAI 的 Ada 2,还是 PaLM,还是其他。你认为未来会是什么样子?Chroma 和嵌入模型空间之间的动态是什么?也许可以更深入地了解应用研究小组的研究领域。我认为,就嵌入模型本身而言,你与行业中的一些人交谈,他们认为它们已经是顶尖的,可能就像它们本身一样好。其他人认为还有更多的能力可以获得。显然,今天主要是人们使用单一模态文本,并且在很多情况下也使用单一语言。他们只使用文本,只使用英语。我知道一些不同的提供商支持多语言,所以你可以用各种语言进行嵌入,然后用各种语言进行检索,而且一切都有效,因为它都只是一个潜在空间,这很酷。多模态嵌入也相当酷,而且相当疯狂。所以,最简单的版本是搜索巴黎的舒适咖啡馆,并获得巴黎舒适咖啡馆的照片,而且它就是能用,因为它在语义上是相似的。它就是这样训练的,而且它就是能用。也许更疯狂的想法是,比如,拿一首齐柏林飞艇的歌,然后找出什么 SQL 查询与这首歌相关。当它出现时,这会很有趣。不确定是否有用,但非常酷。所以,你知道,这就像,人类确实有一些人有联觉,他们听到颜色,他们尝到声音,或者别的什么。这有点像语言模型的联觉。我认为这非常有趣。再次,我认为用例还有待观察,但它看起来相当酷。它将允许,特别是视觉嵌入,以及视觉 Transformer 或其他进行视觉处理的架构,将这些东西带入现实世界,并希望不是以灰色粘液回形针终结者的方式,只以积极和有用的方式。但是,文本领域显然局限于屏幕。而且,我认为,风险投资界和软件界可能高估了语言模型的力量,因为我们都在某种程度上是“文字人”。我们的双手都在电脑上,我们的双手都在键盘上,我们的双手整天都悬停在键盘上的字符上。然后我们的工作主要是打字和阅读字符。所以,从这个意义上说,我们通过这些眼睛看待世界。但是,如果你问一个简单的问题,比如 GPT-4 能否像我前几天和我四岁的儿子一样,拼凑出乐高说明书?可能不行。可能会非常困惑,最多可能只相当于一个两岁孩子的水平。我的意思是,这可能会在相当快的速度下发生变化,但我认为我们还处于早期阶段。所以,是的,这些是我们对嵌入感到兴奋的事情。我认为还有一些非常显而易见的事情要做,你已经在 OpenAI 的食谱示例或一些闭源产品中看到了,那就是对嵌入空间进行微调的想法。所以,嵌入空间通常是在互联网数据上训练的,而不是在你的数据上训练的。如果你的所有数据都是医疗保健数据,它可能只占嵌入空间的一小部分,因为它是所有的医疗保健数据。所以,你可以做的是,你可以给一个小的神经网络,甚至只是一个线性变换,反馈说“这是一个好的匹配,这是一个坏的匹配,这是一个好的匹配,这是一个坏的匹配”。你得到的是一种方法,可以将这个通用的嵌入空间进行移动、剪切和拉伸,使其更符合你的期望。而且,我认为这将完全是标准化的,它将成为每个人最终都会做的最佳实践。因为今天人们对它所能实现的魔法般的力量感到惊叹,能够组合这些几个构建块并能够做一些新的事情,而且它是惊人的,它确实是惊人的。但最终,他们将被要求,它能做到 80% 的时间,但 20% 的时间它不起作用。我们需要修复它。所以你开始进一步追逐它。而且,你这样做的方式,你会想要做很多更像生产化的事情,比如微调你的嵌入空间。所以,是的,这说得通。我特别期待多模态世界能给我们带来什么。我认为这是一个很好的提醒。让我们进入快速提问环节。我们准备好迎接更多杰夫·休伯的大胆看法了。在人工智能领域,什么被过度炒作,什么被低估了?这就像泰勒·考恩的“被高估的低估的”,但你并没有给我具体的东西,你只是让我从头开始编造。这更难。过度炒作的是大型上下文窗口。我认为它们不是必需的。我认为大多数任务不需要那么多上下文。你只需要提供你提供的上下文时深思熟虑。而且,大型上下文不是免费的,它需要更长的时间。

它的成本更高,而且在现实世界的环境中,人们最终会关心成本和速度,所以我认为它降低了实验的门槛,这非常好,它使得实验什么可能变得容易,嗯,但我认为它们不是万能药,Twitter 假装它们是,嗯,你知道,即使是大型上下文窗口,最近有一个事情,就像昨天或前天,显示出注意力在上下文窗口中的扩展方式甚至都是可疑的,所以你知道,我并不声称在这些主题上有深入的人工智能研究,而且我敢肯定,很多这些问题都会随着时间的推移得到解决,嗯,但我就是不明白它们的万能药,嗯,被低估了,我认为在这一点上,我们可能正处于代理人炒作周期的底部,所以也许这被低估了,嗯,在风险投资领域感觉不是这样,好吧,好吧,也许是不同的,嗯,不同的领域,不同的领域,是的,好吧,最后一个,我知道这是一个非常棘手的难题,而且可能是一个全新的播客或几个播客的主题,但你认为人工智能监管应该如何,你知道,到位?很容易对任何新出现的、神秘的技术产生基于恐惧的反应,并急于对其进行监管,围绕它制定法律,这将因此产生意想不到的、可能非常糟糕的后果,嗯,讽刺的是,这可能更好,显然你不想太晚,但你也不想太早,而且当然,当它是基于恐惧的时候,倾向于更早而不是更晚,嗯,我认为,以同样的方式,我对人工智能超级智能的发生,嗯,在未来十年或任何时候都更加怀疑,嗯,我认为这也限制了我对监管需要什么,或者需要做什么,或者不需要做什么的上限,嗯,你知道,我对监管者做出明智决定的信心也不大,而且在某些方面,这甚至不是一个政治评论,这只是一个现实,所以你知道,嗯,行业自律显然在许多行业中都得到了很好的发展,而且似乎在这个行业中也有一些努力,嗯,显然你不知道,你知道,像一个坏人踩踏一个表格,嗯,你知道,做一件坏事的情况,嗯,仍然会发生,监管也是如此,但坦率地说,嗯,我认为一个理论是,人工智能可以像核弹一样被监管,因为能源足迹,嗯,你知道,铀浓缩意味着在全球范围内,拥有足够的能量来训练,你知道,不是训练,而是拥有足够的能量来浓缩,你知道,仍然想要铀来制造炸弹,嗯,它是可扣除的,所以我们大概知道,你知道,美国情报界知道谁在做这件事,我认为现在人们正在试图通过一定的计算密度来做一些类比推理,嗯,而且,嗯,我甚至不确定更大的模型是否更危险,嗯,你知道,这次谈话中隐含的意思是,好的,更多的参数将带来更多的能力,更多的能力,更多的危险,嗯,我认为这甚至不是,再次更新你过去 30 天的先验知识,这本身就不是显而易见的,所以我认为这是一个漫长而冗长的回答,但我认为,嗯,我认为人们应该稍微,在边际上,普通人应该少一些恐惧,嗯,而且,嗯,也许普通人,技术应该少一些恐惧,也许普通人,不是技术领域的人,更害怕,嗯,而且,嗯,你知道,我认为我们需要小心,有一个工作,有一个术语叫做“不要免疫末世”,嗯,这基本上就像,每个人都倾向于相信他们生活在最伟大但也是最后一代,嗯,你知道,这可以追溯到,嗯,你知道,70 年代对饥荒或全球变冷的恐惧,或者你知道,任何其他灾难,嗯,我认为那种思维最终会导致非常非常非常糟糕的结果,因为一旦你相信你是文明未来的唯一仲裁者,你就会做出截然不同的、常常是可怕的决定,嗯,为了“保护”文明,所以我认为,少一些末世论,多一些谦逊,扎根于现实,会对某些人有益,太棒了,那有很多很棒的见解和非常周到的回答,好吧,最后一个,然后我们就结束了,嗯,有什么我们没有谈到,你希望我们涵盖的吗?这方面的人才方面真的很有趣,现在学习这些东西是不是太晚了?你知道,是已经错过了吗?无论是对于所有的应用还是用例,还是你知道,如果这里有任何人想成为一名人工智能研究员,你知道,已经进入了某种失控的研究,而且没有办法赶上,或者没有办法产生影响,嗯,为了回答我自己的问题,我认为那仍然是第一天,嗯,而且我敢肯定,你们都会同意,但现在开始一家新公司还不晚,现在去攻读人工智能博士学位还不晚,你知道,现在加入 OpenAI 还不晚,嗯,现在加入 Chroma 还不晚,嗯,就像现在还处于早期阶段,所以有很多有趣的事情可以做,完全同意,是的,我们喜欢这一点,而且我们已经看到了许多非常聪明的企业家,他们最近才刚刚涉足,并且已经取得了惊人的成就,所以非常同意这一点,嗯,这太棒了,我是说,非常感谢你,杰夫,我敢肯定我们的听众会想继续听你说话,而且会很想知道在哪里可以找到你并关注你,嗯,Twitter 可能是最好的地方,嗯,我在 Twitter 上是 Jeffrey Huber,嗯,Chroma 的 Twitter 账号是 trichroma,t-r-y chroma,嗯,如果你有关于使用 Chroma 的问题,来 Discord,你会看到我,嗯,让你的问题得到解答,他说到目前为止有 40 条来自 trichroma 的推文,对吧?所以,是的,这相当,你知道,低承诺,我们喜欢高信号低噪音,所以这就像,这是一个容易关注的,喜欢它,好吧,杰夫,非常感谢,这太棒了,我真的很感谢你加入我们,谢谢大家,这是一次很棒的对话,我很感激 [音乐]