📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

No Priors Ep. 91 | With Cohere Co-Founder and CEO Aidan Gomez

No Priors: AI, Machine Learning, Tech, & Startups44:16

Transcription

[掌声] 各位听众大家好,欢迎来到 No Priors。今天我们请到了 Aiden Gomez,他是 Cohere 的联合创始人兼首席执行官。Cohere 是一家估值超过 50 亿美元的公司,提供人工智能驱动的语言模型和解决方案。Aiden 于 2019 年创立了 Cohere,但在那之前,他在 Google Brain 实习期间,是 2017 年里程碑式论文《Attention Is All You Need》的合著者。Aiden,感谢您今天来到节目。

是的,感谢您的邀请,很高兴来到这里。也许我们可以从您的个人背景开始,您是如何从在加拿大森林里长大,到 [嗯],你知道的,参与世界上最重要的技术论文的?

这其中有很多运气和偶然。但是的,我恰好在杰夫·辛顿(Jeff Hinton)任教的地方上学。所以,显然杰夫最近获得了诺贝尔奖,他被认为是深度学习的“教父”。在我上学的 UFT,他是一位传奇人物,几乎所有在该校学习计算机科学的人都想进入人工智能领域。所以,在某种意义上,我觉得我是在人工智能的环境中长大的,就像我刚走出高中校门一样,我就置身于一个真正看到了未来并希望将其实现的 [嗯] 环境中。然后,从那里开始,发生了一连串的幸运的意外。我设法在 Google Brain 获得了卢卡什·凯撒(Lukasz Kaiser)的实习机会。在实习结束时,我才发现我不应该得到那个实习机会,那个实习机会本应是为博士生准备的。所以,他们为我这个实习生举办了一个告别派对。卢卡什问:“好吧,艾登,你要回去了,你的博士还有多少年?” 我说:“哦,我将进入大三本科。” 他说:“我们不招收本科实习生。” 所以,我认为这都是一系列非常幸运的错误,它们把我带到了那个团队,在那里我从事着 Google 非常重要且有趣的工作。

是什么说服您创办 Cohere?

是的,我辗转于不同的地方。当我与卢卡什和诺姆(Nir Shazeer)以及 Transformer 的那些人一起工作时,我在山景城。然后我回到了 UFT,开始与辛顿和我的联合创始人尼克(Nick)在多伦多一起工作。在那里我做了一些研究,然后我开始攻读博士学位,去了英国。我在柏林与雅各布(Jakob Uszkoreit)一起工作,他也是另一篇 Transformer 论文的作者,并且还在远程协作。

哦,不错,是的,是的,是的,好的,是播客的粉丝,很好,很好。

所以,是的,我在柏林与雅各布一起工作,同时还在远程与杰夫·迪恩(Jeff Dean)和桑杰(Sanjay)合作 Pathways 项目,那是他们 [你知道的] 比超级计算机更大的训练项目。想法是 [你知道的] 将超级计算机连接起来,创建一个新的更大的计算单元,你可以在上面训练模型。在那个阶段,GPT-2 刚刚发布,这项技术的发展轨迹已经很清楚了。我们正走在一条非常有趣的道路上,这些模型,表面上是互联网的模型,是网络模型,将产生一些非常有趣的东西。所以,我打电话给尼克,打电话给我的联合创始人伊万(Ivan),我说:“你知道,也许我们应该想办法构建这些东西。” 我认为它们对任何人都会有用。

对于还不了解的人,您能简单概括一下 Cohere 的使命,以及你们的模型和产品是什么吗?

是的,我们的使命,我们想要为世界创造价值的方式,是通过赋能其他组织采用这项技术,提高其员工的生产力,或转型其产品和服务。所以,我们非常专注于企业。我们不会构建一个 ChatGPT 的竞争对手。我们想构建的是一个平台和一系列产品,使企业能够采用这项技术并使其具有价值。

在您组织团队和进行投资的“北极星”方面,您自己也来自研究背景,您认为 Cohere 的成功在多大程度上取决于核心模型,以及您在平台和上市支持方面的其他投资?

这取决于所有方面。模型是基础,如果你建立在一个不满足客户需求的基础之上,那就没有希望了。所以,模型至关重要,它们是公司的核心。但在企业界,客户支持、可靠性、安全性这些都是关键。所以,我们在两个方面都进行了大量投资。我们不仅仅是一个建模组织,我们是一个建模和上市组织。而且,产品对 Cohere 来说变得越来越重要。所以,我们正在寻找缩短客户价值实现时间的方法。在过去大约 18 个月里,当企业界对这项技术有所认识以来,我们观察了人们使用我们的模型进行构建,看到了他们试图实现的目标,看到了他们犯的错误。这很有帮助。有时也很令人沮丧,一次又一次地看到同样的错误。但我们认为,这是一个巨大的机会,可以帮助企业避免这些错误,并第一次就正确地实施。所以,这确实是我们正在努力的方向。

我们能让它更具体一些吗?最让您沮丧的错误是什么?产品如何解决这个问题?

嗯,我认为所有语言模型都非常敏感,对提示,对您呈现数据的方式,它们都有自己的独特之处。与一个模型交谈的方式可能不适用于与另一个模型交谈。所以,当你构建一个像 RAG 系统这样的系统时,其中有一个外部数据库,你如何将检索到的结果呈现给模型非常重要。数据在这些数据库中的存储方式也很重要,格式很重要。而这些小细节,人们常常忽略了它们。他们高估了模型,认为它们像人类一样。这导致了很多重复的失败。人们试图实现一个 RAG 系统,但他们不知道实现一个 RAG 系统所必需的这些特有的元素,然后它就失败了。所以,在 2023 年,有很多这样的 POC(概念验证),很多人试图熟悉这项技术,理解它。而这些 POC 中有很多都失败了,因为不熟悉,因为 [是的] 这些我们看到的常见错误。所以,展望未来,我们有两种方法。一种是使模型更加健壮,模型应该对您呈现数据的各种不同方式具有健壮性。第二部分是使我们暴露给用户的产品更加结构化。所以,不再仅仅是交给一个模型,然后说“提示它,祝你好运”,而是实际上围绕它建立更多的结构,创建更严格地定义如何使用模型的 API。我认为这些方面可以减少失败的可能性,并使这些系统对用户来说更加可用。

人们想做什么?您能举例说明一下您在企业中看到的一些最大的用例吗?

它非常广泛,几乎涵盖了所有行业。常见的有问答,比如与大量文档进行对话。例如,如果你是一家制造公司,你可能想为你的工程师或装配线上的工人构建一个问答机器人,并接入所有不同工具的手册和常见错误及零件的诊断手册,然后让用户与它聊天,而不是不得不打开一本千页的书来查找他们需要的东西。同样,为普通企业员工构建问答机器人,接入你的 IT FAQ、HR 文档,以及关于你公司的所有信息,并拥有一个集中的聊天界面来访问你组织的知识,以便他们能够得到问题的答案。这些是一些常见的例子。除此之外,还有一些特定的功能是我们提供的。一个很好的例子可能是医疗保健公司,他们有这些患者的纵向健康记录。这包括患者与医疗保健系统的每一次互动,从去药房,到不同的实验室或检查,到医生就诊,这可能跨越几十年。所以,这是一个巨大的、巨大的病史记录。通常发生的情况是,患者会打电话给接待员,说:“我的膝盖疼,我需要预约。” 然后医生需要梳理过去的几次就诊记录,看看这个问题以前是否出现过,也许他们会错过两年前的某个信息,因为他们只有 15 分钟的预约时间。但我们可以将整个病史与他们就诊的原因一起输入,这与他们所说的就诊原因相关联,并为医生提供一份简报。这通常会使医生审查的速度大大加快,而且它也经常能捕捉到医生在每次病人会诊前不可能审查到的信息。他们不会查看 20 年的病史,这根本不可能。但模型可以做到,你可以在不到一秒钟内做到。所以,这些是我们看到的功能,总结,问答机器人。其中很多,你可能会认为它们很普通,但影响是巨大的。我们看到大量的初创公司在解决问题,比如企业搜索,以及专门的应用程序,比如特定行业的技​​术支持,甚至查看健康记录并进行推理和检索。

您如何看待企业消费的最终状态,或者说一个稳定的均衡状态,即企业从专家级的高性能应用程序提供商那里获取,还是通过内部构建的自定义应用程序,利用 AI 平台和模型 API?

我认为这将是混合的。我认为它可能像一个金字塔,金字塔的底部是每个组织都需要这些东西,就像每个员工手中的“副驾驶”一样,一个通用的聊天机器人来回答他们的问题。然后,当你向上移动金字塔时,它会更具体地针对公司本身,或者他们运营或提供的特定领域或产品。当你向上推这个金字塔时,你找到现成解决方案来解决它的可能性就大大降低了。所以,你必须自己构建它。我们推动组织制定一个涵盖整个金字塔的战略。是的,你需要通用的标准产品,也许有一些行业特定的工具你可以购买。但如果你在构建,不要构建那些你可以购买的东西,而是专注于那些没有人会卖给你的东西,这会给你带来独特的竞争优势。我们与一家保险公司合作,他们为大型工业开发项目提供保险。原来我对这个领域一无所知。原来他们是这样的:矿山或其他项目会发布一份保险的 RFP(请求建议书),然后精算师会立即着手处理这份 RFP,进行大量研究,了解 [你知道的] 土地情况,潜在风险等。然后,基本上是一场竞赛,谁先回应,通常就能获得合同。所以,这是一个基于时间的事情,这些精算师能多快地提出一份经过充分研究的提案。我们与他们一起构建了一个研究助手。我们通过 RAG 将精算师进行研究的所有知识来源接入,并为他们提供了一个聊天机器人。这极大地加快了他们响应 RFP 的能力,并发展了他们的业务,因为他们赢得了更多的合同。所以,这很难,你知道的,我们构建的是横向技术,LLM 就像一种 CPU。我不知道 LLM 的所有应用,它太广泛了。而真正的深度洞察或竞争优势,让你领先的东西,是倾听客户,让他们告诉你什么能让他们领先。所以,这很大程度上是我们一直在做的事情,就是成为一个思想伙伴,帮助他们构思对他们来说具有战略意义的项目和想法。

我敢打赌,这家公司之所以能赢,是因为他们绝大多数竞争对手都无法如此迅速地采用 [你知道的] 并构建这样的研究助手产品,这在帮助他们方面发挥了作用。您认为企业普遍采用的最大障碍是什么?

我认为最大的障碍是信任。所以,安全是一个大问题,尤其是在金融、医疗保健等受监管的行业。数据通常不在云端,或者即使在云端,也不能离开他们的 VPC(虚拟私有网络),所以它被严格锁定,非常敏感。所以,这是 Cohere 的一个独特差异化优势,我们没有将自己锁定在一个生态系统中,并且我们可以灵活地进行本地部署,如果你想要我们部署在 VPC 内,VPC 外,字面上是客户想要的任何地方。我们可以接触到更多的数据,即使是最敏感的数据,并提供更有用的东西。所以,我认为安全和隐私可能是最大的问题。除此之外,还有知识,你知道的,构建这些系统的知识。它们是新的,对人们来说不熟悉。你知道的,最有经验的人只有几年的经验。所以,这是另一个主要方面。我认为这实际上只是一个时间问题,最终开发者会更熟悉使用这项技术进行构建。但我认为还需要两到三年才能真正普及。

您认为在传统的企业技术炒作周期中,可能对大多数技术来说,但尤其对企业技术而言,存在“幻灭的低谷”的概念,人们对某件事非常兴奋,但最终发现它比他们想象的更难应用或更昂贵。我们在人工智能领域也看到了这种情况吗?

我敢肯定,我们肯定看到了一些。但说实话,核心技术仍在稳步改进,新的应用每隔几个月就会解锁。所以我认为我们还没有进入那个幻灭的低谷。

感觉我们还很早,感觉我们真的真的还很早。如果你看看市场,这项技术解锁了全新的事物,你以前根本无法构建它们,而现在你可以了。所以,即使我们没有训练一个新语言模型,好吧,所有的数据中心都爆炸了,我们无法改进 LLM,我们只有今天拥有的。还有半个十年的工作要做,将其整合到经济中,构建所有这些东西,构建 [你知道的] 保险 RFP 回复机器人,构建医疗记录摘要器。还有半个十年的时间来重新构建。所以,我们还有很多工作要做。我认为我们已经度过了那个阶段。曾经有一个问题,哦,是不是炒作太多了,这项技术真的有用吗?但现在它已经掌握在数亿人手中了,它已经投入生产了,有非常明确的价值。现在的问题是将其整合到现实世界中。其中一部分当然是界面和变革管理,以及如何让用户理解模型输出和护栏等等。具体到模型和专业化方面,您是否提供给客户一个框架,或者您在内部使用一个框架,关于他们应该投资哪个版本?所以,我们有预训练、后训练、微调、检索,就像这些传统意义上的,尤其是当我们拥有更长的上下文时,您如何告诉客户如何专业化?

这完全取决于应用。例如,有些事情,我们与富士通合作,他们是日本最大的系统集成商,为他们构建了一个日语模型。没有办法不干预预训练就能做到这一点,你无法有效地对日语进行微调或后训练。所以,你必须从头开始。另一方面,有一些更狭窄的事情,比如如果你想改变模型的语气,或者你想 [我不知道] 改变它格式化某些内容的方式,我认为你只需要进行微调,你可以采用最终状态。所以,存在一个梯度。我们通常建议客户从最便宜、最简单的事情开始,那就是微调,然后倒推。所以,从微调开始,然后回到后训练,比如 SFT、RHF。然后,如果你需要的话,你知道这是一个旅程,就像你谈论一个生产系统,约束条件越来越高,你可能需要触及预训练,希望不是全部预训练,希望它只是在最后,或者可能是 20% 的预训练。但是的,这通常是我们思考的方式,就像从最简单、最便宜的事情到最复杂但性能最好的事情的旅程。

从最便宜的事情开始,这对我来说是合理的。我认为任何企业客户都会投资于预训练,这可能有点争议。我认为一些实验室的领导者会说,没有人应该触及这个,对于那些需要大量计算和数据策划工作以及人才来以任何有竞争力的方式进行预训练的人来说,这没有任何意义。您对此有何反应?

我认为,如果你正在构建一个,如果你是一个大型企业,并且你拥有海量数据,数千亿个 token 的数据,那么预训练是一个你可以真正利用的杠杆。我认为对于大多数中小型企业,尤其是初创公司来说,预训练模型没有任何意义。但如果你是一个大型企业,我认为这应该是一个严肃的考虑。问题是预训练的程度。不是你必须从头开始,进行一次 [你知道的] 5000 万美元的训练运行。但你可以进行一次 [你知道的] 500 万美元的训练运行。这就是我们看到的成功的,这些持续预训练的努力。所以,是的,这是我们提供的服务之一。但当然,我们不会直接跳到那里。如果你不想花很多钱,你就不需要花很多钱。而且,通常,企业的购买周期或技术采用周期很慢,所以你有时间回溯。我会说,这完全取决于客户的决定。但对于那些说没有人应该进行预训练的人,除了 AGI 实验室之外,没有人应该进行预训练,那是经验上错误的。

也许这是一个很好的切入点,可以稍微多谈谈技术领域正在发生的事情,以及这对 Cohere 意味着什么?您在 Cohere 内部为自己设定的标准是什么?您说模型是基础,而且我相信您也说过,去年的模型没有市场。您如何调和这一点与竞争的资本支出以及开源模型的兴起?

我认为你必须花钱。你需要花一些 [你知道的] 最低的门槛才能构建一个有用的模型。训练模型的计算成本在降低,数据来源 [嗯],在某些方向上它们在降低,在另一些方向上则没有。有了合成数据,成本急剧下降,但有了专家数据,成本越来越高,越来越难。所以,我们看到的是,今天你可以构建一个模型,在企业可能关心的所有方面都与 GPT-4 一样好,成本为 1000 万到 2000 万美元,这只是开发该模型成本的几个数量级。所以,如果你愿意等待 6 个月或一年来构建这项技术,你就可以以这些前沿实验室支付成本的一小部分来构建它。所以,这是 Cohere 战略的一个关键部分,我们不必第一个构建它。我们将找出如何以极低的成本做到这一点,并将专注于对我们的客户重要的部分。我们将专注于我们的客户真正依赖的功能。但同时,我们仍然需要花钱。与普通初创公司相比,我们需要支付超级计算机的费用,这些成本每年高达数亿美元。所以,它确实需要大量资本,但并非资本效率低下。很明显,我们将能够基于我们正在构建的东西建立一个非常有利可图的业务。所以,这就是战略,不要领先,不要烧钱,你知道的,每年烧掉三五十亿美元来处于领先地位。领先六个月,然后以企业真正需要且价格合理的方式推向市场。

如果越来越多的开源选项可用,为什么还要自己花钱购买超级计算机和进行训练?

你没有,不是真的。多说一点。对于 Llama,是的,你得到的是基础模型,在它冷却下来并且梯度为零时。你得到的是后训练模型,在它冷却下来并且梯度为零时。尝试微调这些模型,效果不如自己构建,而且你的选择比你有权访问数据并更改进入该过程的数据要少得多。所以,我们认为,通过垂直整合并自己构建这些模型,我们拥有更多的杠杆来为我们的客户提供服务。

也许我们可以谈谈预测,我们也会谈到您提到的一些事情。我们现在在扩展定律方面处于什么位置?您预计未来几年能力会有多大的提高?

我认为我们已经走了很长一段路了。我认为我们开始进入一个平坦的曲线部分。而且,我们肯定已经过了那种程度,如果你只是与模型互动,你就能知道它有多聪明。那些“氛围检查”正在失去效用。所以,你需要做的是,你需要让专家在非常具体的领域进行衡量,比如物理、数学、化学、生物学。你需要让专家来评估这些模型的质量,因为普通人已经无法区分不同代之间的差异了。是的,还有很多工作要做,但这些进步将在非常专业的领域得到体现,并对更具研究性的领域产生影响。我认为对于企业以及他们想要自动化的通用任务或他们想要构建的工具,这项技术已经足够好或接近足够好,一点点的定制就能让他们达到目标。

是的,这基本上就是我们所处的阶段。在解决问题的类别方面,有一个新的解锁,那就是推理。所以,在线推理是我们一直缺失的东西。这些模型以前没有内部独白,你知道的,它们不会真正地思考。你只会把问题传给它们,然后期望它们立即回答。它们无法进行推理,无法犯错,你知道的,犯错,抓住错误,修正它,然后重试。所以,现在推理模型上线了,当然 OpenAI 是第一个投入生产的,但 Cohere 也在为此努力了一年左右。我认为这一类技术非常有趣。有一系列新的问题可以解决,而且它也改变了经济学。以前,如果一个客户来找我说:“艾登,我希望你的模型在 [某方面] 更好,或者我想要一个更聪明的模型。” 我会说:“好吧,给你 6 到 12 个月的时间,我们需要启动一个新的训练运行,训练更长时间,训练一个更大的模型等等。” 现在,这是我们唯一可以用来提高产品性能的杠杆。现在有了第二个杠杆,那就是你可以向客户收取更高的费用。你可以说:“好吧,让我们在推理时花费两倍的 token,或者花费两倍的时间,你就会得到一个更聪明的模型。” 所以,这是一个更好的产品体验。你想要一个更聪明的模型,你今天就可以拥有它,你只需要支付这个费用。所以,他们有这个选择,他们不需要等六个月。同样,对于模型构建者来说,我不需要将我的超级计算机的规模翻倍来达到必需的智能阈值,我只需要将我的客户支付的推理时间计算量翻倍。所以我认为这是一个非常有趣的结构性变化,关于我们如何进入市场,我们能构建什么产品,以及我们能为客户提供什么。

我同意。我认为这一点在生态系统中可能被低估了,它对所有类型的客户来说应该更有吸引力,你可以从一种资本支出模式的改进转变为一种消费模式的改进。这并不是说,你知道的,这些是苹果和橙子,但我想你会看到人们在解决问题上投入更多,当他们不必为训练运行支付大笔费用并经历你所描述的延迟时。

这还没有被量化。人们还没有真正考虑到推理时间计算提供智能的影响。甚至在芯片层面也有很多后果,你知道的,你想构建什么样的芯片,你应该优先考虑什么数据中心建设。如果我们有一个新的途径,那就是推理时间计算,它不需要这种密集互联的超级计算机,可以有节点,你可以在本地做更多的事情,而不是分布式。我认为这对整个链条都有很多影响。这是一个新的范例,关于这些模型能做什么以及它们如何做。

你一直在回避这个问题,但因为你 [你知道的] 普通人花在思考“推理是什么”上的时间不多。你有什么直观的见解可以提供给人们,比如这个问题允许我们更好地解决?

我认为任何多步骤的问题。有一些多步骤的问题你可以直接记忆,这就是我们一直以来要求模型做的事情。比如解多项式,你知道的,这真的应该通过多步骤来解决,这就是人类解决问题的方式。我们不会直接得到一个多项式,然后砰,有一些我们可能已经记住了,但总的来说,你必须解决这些问题,将它们分解,解决更小的部分,然后将它们组合成整体解决方案。而这正是我们所缺乏的。我们确实缺乏,我们有过像“思维链”这样的东西,它实现了这一点,但它有点像事后诸葛亮。我们训练这些模型只是为了记忆输入输出对,然后我们找到了一个很好的技巧来引发模仿推理的行为。我认为现在正在发生的是,从头开始,下一代模型正在构建和交付,它将从头开始拥有推理能力。这并不奇怪,因为它一开始就不存在,因为我们一直在从互联网上训练这些模型,而互联网是一系列文档,是推理过程的输出,推理过程隐藏在后面。就像一个人写了一篇文章,花了几个星期思考这件事,删除了东西,等等,然后发布了最终产品,这就是你能看到的。其他一切都是隐含的,隐藏的,不可观察的。所以,第一代语言模型缺乏这种内部独白是有道理的。但现在我们正在通过人类数据和合成数据,明确地收集人们的想法。我们让他们说出来,我们将其转录,然后我们将对其进行训练,并对其进行建模,这是解决问题过程的一部分。所以我对此非常兴奋。我认为现在它非常低效,而且非常脆弱,与早期版本的语言模型类似。但在未来两到三年内,它将变得非常健壮,并解锁一系列全新的问题。

您描述的扩展定律的平缓部分,其缓慢的根本驱动力是什么?是因为越来越专业的专家数据和收集成本越来越高,正如您所说,触及推理轨迹比仅仅获取互联网上的数据更难、更昂贵吗?是因为评估日益复杂问题的难度吗?还是仅仅是计算的总体成本?为什么您认为在有人在画油画时,曲线正在趋于平缓?他们会涂一层底漆,然后覆盖整个画布,然后他们会画出山脉和树木的形状。当你变得越来越详细,并且你正在描绘非常精细的笔触时,你需要做更多的事情才能用一个大笔触完成你想要完成的事情。但当你开始变得越来越有针对性或越来越详细地描述你想要完成的事情时,它就需要一个更精细的工具。这就是我们在语言模型上看到的。我们能够很快地完成很多常见、简单、容易的任务。但当我们接近更具体、更敏感的领域,如科学、数学时,我们开始看到改进的阻力。在某些地方,我们通过使用合成数据来解决这个问题,比如在代码和数学领域。这些是答案非常可验证的地方,你知道你是否正确或错误。所以,你可以生成大量的合成数据,并验证它是否正确。你知道它是正确的,好的,让我们进行训练。在其他需要测试和现实世界知识的领域,比如生物学、化学,那里有一个更大的瓶颈来创建这类数据。你必须去找了解该领域、拥有几十年经验的专家,基本上提炼他们的知识。但最终你会用完专家和数据,你就会处于人类对 X、Y 或 Z 的知识前沿。填补这个肖像中更精细的细节的摩擦正在增加。我认为这是一个根本性问题。我认为没有捷径。在某个阶段,我们将不得不让这些模型能够运行自己的实验,来填补它们好奇的知识领域。但我认为这还很遥远。而且,这将需要很多年才能完成。我们将做到,我们一定会做到。但对于我今天在 Cohere 关心的事情,我认为有很多应用这项技术已经准备好投入生产了。所以,主要重点是将其投入生产,并确保我们的经济尽快采用和整合这项技术,获得生产力提升。所以,虽然这个技术问题很有趣,关于为什么进展在放缓,我认为这应该是显而易见的,对吧?就像模型变得如此之好,它们正在触及人类知识的阈值,而这正是它们获得能力的地方。

您对我们目前所处的阶段非常了解,即我们拥有的能力将继续进步,即使曲线在趋于平缓,也会投入生产。我认为我知道答案,但您或 Cohere 对 AGI 和起飞有多大的思考?这对您重要吗?

AGI 对许多不同的人意味着许多不同的事情。我认为,我相信我们正在构建通用智能机器,完全相信这一点。当然我们会做到。但 AGI 被混淆了,我们什么时候已经到了?它不是一个二元的,它不是离散的,它是连续的,我们正在这条路上走得很远。在行业中存在一些定义,你可以设置一个断点,即使你拥有这个连续函数,你也可以设置一个断点。它有智能可以取代任何数字角色的受过教育的成年专业人士。

您的观点是,没有真正重要的断点正在发生,那是一个客观的清单,当你勾选了所有这些框,你就拥有了?

我认为你总能找到一个反例,你会说:“哦,好吧,它还没有击败这个在这里做随机事情的人。” 不,我认为它是相当连续的,而且我们已经走了很远很远。但 AGI,我真的不认同的是超级智能的起飞,自我改进,最终导致终结者消灭我们所有人,或者创造了无限的可能性。

或者创造了无限的可能性,对,对。

不,我认为我们将是创造丰富性的人。我们不必等待这个上帝出现并为我们做。让我们用我们正在构建的技术来做。我们不必依赖它,我们可以自己做。我们将构建 AGI,如果你的意思是能够做很多人类能做的事情,并且能够灵活地适应许多不同领域的高度通用的技术。如果你指的是,你知道的,我们会建造上帝吗?不。

您认为是什么驱动了这种意见分歧?

我不知道。也许我更关注这项技术的实际挫折,它在哪里会出问题,在哪里会变慢,在哪里我们开始看到停滞或减缓。也许其他人更乐观,也许他们看到了曲线在增加,他们认为它会永远持续下去。我不同意。我认为存在摩擦点。确实存在摩擦。也许即使理论上,你知道的,神经网络是一个通用逼近器,它可以学习任何东西来普遍逼近,你需要构建一个宇宙大小的神经网络。所以,在达到人们推断出来的极限方面存在一些根本性的障碍,我认为这将限制这项技术在实践中可实现的形态。

在您看来,是否存在一些领域,您认为今天的 LLM 不适合预测?所以,一个例子可能是,我们会从序列到序列模型获得物理模拟吗?我想是的,因为物理学就是一系列状态和转换概率,所以我认为它很可能被序列建模很好地模拟。但是否存在不适合的领域?我确定有更好的模型,更有效的模型。你可以,如果你深入到一个特定的领域,你可以利用该领域的结构来剥离 Transformer 或这类架构的一些不必要的通用性,并获得一个更有效的模型。这绝对是真的。当你深入进去时,这听起来不像你认为它是一个表示问题,或者它就是行不通。世界上存在不可约的不确定性。有些事情你真的不知道,而构建一个更大的模型也无济于事。这些事情我们永远无法有效地建模,直到我们学会如何观察它们。或者,我认为 Transformer 和这类模型能做的比人们认为的要多得多。它是一个非常通用的架构,许多事情都可以被表述为序列,而这些模型只是序列模型。所以,如果你能将其表述为序列,Transformer 就能很好地捕捉其中的任何规律性。但我确信有一些例子我暂时想不起来,序列建模效率非常低下。你可以用序列来做,你可以将一个图表表述为一个序列,但这只是错误的模型,而且你将支付比从不同角度处理它少得多的计算量。

好的,最后一个问题。您之前得出结论,扩展计算和推理时间,哦,人们已经注意到了,但它还没有真正定价。这有多大的改变?还有什么市场没有定价,但 Cohere 正在考虑,或者您正在考虑的吗?

我认为有一个模型商品化的想法。我不太认为这是真的。我不太认为模型实际上正在商品化。我认为你看到的是价格倾销。所以,你看到人们免费提供,亏本提供,零利润提供。所以,他们看到价格下降,他们就认为价格下降意味着商品化。我认为实际上,世界的状态是,现在正在进行一次彻底的技术重构,并将持续未来 10 到 15 年。这有点像,我们必须,我们必须重新铺设地球上的每一条道路。有四五家公司知道如何制造混凝土。好吧,也许今天他们中的一些人免费提供他们的混凝土。但随着时间的推移,知道如何做这件事的人非常少,而我们面前的工作量巨大。增长和显示投资回报的压力。在亏损或免费提供昂贵技术的状态下运营,这是一个不稳定的现状。所以,市场的增长压力会将事物推向一个方向。是的,你知道的,两周前海阔论坛的价格,艾登,这太有趣了,非常感谢您和我们一起做这件事。

是的,我的荣幸,我的荣幸。这很有趣。很高兴见到你。在 Twitter 上关注 @no_priors_pod。订阅我们的 YouTube 频道,如果你想看到我们的脸。在 Apple Podcast、Spotify 或任何你收听的地方关注这个节目,这样你每周都能收到新剧集。在 no-priors.com 注册电子邮件或查找每集节目的文字记录。

[音乐]