📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Daniel Guetta on the Guts of AI, Agentic AI & Why LLMs Hallucinate | The Real Eisman Playbook Ep 46

Steve Eisman1:02:40

Transcription

嘿,我是史蒂夫·艾斯曼,今天我们将与我们的嘉宾一起谈论人工智能。这是一个我们已经探讨了许多许多个月的话题。它对美国经济的未来至关重要。最近,超大规模云服务提供商宣布他们正在大幅增加预算。四大超大规模云服务提供商将仅在与人工智能相关的高科技产品上花费 6500 亿美元。美国经济的未来真的岌岌可危。几周前,我们邀请了加里·马库斯,他是大型语言模型的坚定批评者,他认为它们正在失去效用。因此,我想要第二个意见,因为这个话题实在太重要了。所以今天我们请来了哥伦比亚大学教授丹尼·盖塔,正如你将看到的,他在某些方面同意加里,但在其他方面不同意,我们将探讨所有这些,之后我会回来谈谈我们学到的东西。

你好,我是史蒂夫·艾斯曼,欢迎收听《真实的艾斯曼手册》的最新一期。今天我们将探索人工智能的世界,但不是从商业角度,而是从人工智能的内部,你知道,人工智能是一个泡沫吗?它会改变世界吗?你知道,这些是我们过去许多许多个月在播客中探讨过的问题。为了帮助我们进一步深入,我们的嘉宾是哥伦比亚商学院教授丹尼尔·盖塔。丹尼尔,欢迎。>> 非常感谢你邀请我,史蒂夫。这将会很棒。我非常期待这次谈话。非常激动。那么,在我们开始之前,你能不能简单介绍一下你的背景,解释一下你为什么在这里?>> 是的。当然。我的整个职业生涯都在研究人工智能,甚至在它流行之前。我最初在数据驱动的供应链管理领域攻读博士学位,那时候我真的很幸运,我在亚马逊工作了一段时间,这显然是研究供应链的好地方。博士毕业后,我去了 Palantir Technologies 工作。当时我不是美国公民,所以他们不让我接触政府事务,但我确实在他们的商业业务上做了很多工作,这涉及到与世界各地的公司合作,帮助他们利用数据、人工智能、分析等技术来改进他们的业务。大约八年前,哥伦比亚商学院的院长卡西斯·麦克拉拉斯,他当时就有远见,意识到这种数据分析浪潮不会消失,而是会长期存在。所以他问我是否愿意回到哥伦比亚大学,帮助建立数据和分析课程。这正是我一直在那里做的事情。我与公司合作,帮助他们弄清楚如何从人工智能中获得价值。我教授人工智能、运营、编码等课程。我很幸运能教我们的 MBA 学生、工程学生、高管,但我们也推出了与华尔街预科合作的公开课程。所以现在任何人都可以参加这个课程。我提到这一点是因为我们是通过该课程的一名学生介绍的。所以,向阿里致敬。感谢你的介绍。>> 那么,让我们从一个大话题开始,那就是大型语言模型。在我们谈论它们有多有效之前,你知道,当你观看商业新闻时,他们真正谈论的是购买了多少芯片?谁领先?是谷歌吗?是 OpenAI 吗?但让我们回到基本。大型语言模型到底是什么?它是如何工作的?>> 这是一个很好的问题,我想如果允许的话,我想再往前一步,说一下人工智能到底是什么?就像,我认为大型语言模型几乎已经成为人们心中人工智能的同义词,但它们不是。我的意思是,人工智能不仅仅是这个。我认为将人工智能分为两种类型是有帮助的。你有一种预测性人工智能,你也听说过它被称为机器学习或预测分析。它已经存在了很长时间,并且很成功。然后你有了生成式人工智能,包括那些最近出现的大型语言模型。深入了解这两种类型是什么是有帮助的,因为正如我们将看到的,理解这两种类型确实有助于理解大型语言模型是如何工作的,以及它们如何融入更广泛的格局。所以,如果我们从预测性人工智能开始,它已经存在于 80 年代或 90 年代了。它的想法是,我们能否查看一个数据集,识别数据集中的模式,并利用这些模式做一些有用的事情?我最喜欢的例子是 Zestimate。你知道,当你去 Zillow 查看房产时,它会给你一个估计的价格。我总是和我的学生开玩笑,对吧?你可能会出于各种崇高的原因使用它,比如房地产开发来买房、卖房。实际上,人们用它来了解他们的邻居有多富有。所以,那个数字,对吧,当你看到它时,>> 隔壁的房子有多贵?>> 隔壁的房子有多贵?没错。所以,你知道,那是一个机器学习模型。那是一个预测性人工智能模型。它利用房产的各种信息来预测其价格。如果你想知道它是如何工作的,当然,它很复杂。但如果你想构建一个稍微简单的版本,也许只针对 Upwork 网站上的房子,你能做什么?也许你会查看房产的平方英尺,加上卧室数量、浴室数量,然后你可能会说每平方英尺值 2000 美元,每间浴室值 10000 美元,随便什么。把它们加起来。>> 那将是一个相当简单的模型。>> 相当简单的模型。现在,是什么让它成为一个机器学习模型,而不是你自己想出来的总和?是 Zillow 创建它的方式是使用历史数据进行训练。我这话是什么意思?他们会获取大量的历史数据,对吧,来自之前已售出的房产。他们会查看这些房产的数据,他们会从完全随机的数字开始,为每个元素的价值。所以,他们可能会开始说每平方英尺值 1 美元。完全错误。这将导致非常糟糕的预测。但然后他们会调整那个数字,直到它尽可能地拟合数据,对吧?正如我们稍后将看到的,这对于大型语言模型如何训练至关重要。在术语上,这叫做训练。对这些数字的调整,你经常会听到叫做参数或权重。那些数字就是它们。它们是模型的一些参数或权重。所以,当你创建模型时,你就会调整它们。>> 好的。所以,这已经存在很长时间了。>> 这已经存在很长时间了。绝对。值得一提的是,它已经存在了很长时间,但我认为今天如果你告诉我,如果你看看人工智能产生的价值,其中有多少来自它,那将是巨大的,而且仍然是巨大的。每次你刷信用卡,欺诈分析,判断某人是否应该获得贷款,比如信用worthiness,当你叫车时,对吧,它应该多少钱,行程有多长,所有这些都真的基于人工智能。那么,它与新的人工智能,生成式人工智能,大型语言模型有何不同呢?旧式人工智能的问题在于它只能处理数字,数值数据,可以放入 Excel 的东西。所以,回想一下 Zestimate,你可以使用平方英尺、卧室数量、浴室数量,但如果你想使用图像,对吧,房子的照片,或者你想使用描述中的文字呢?你真的不能把它放入这样的模型,因为你不能乘以文本。它不是数字,对吧?你不能用它做什么。所以,那样的模型存在局限性,而深度学习,生成式人工智能革命就克服了这一局限性。这可能是在 2010 年代中期,我的意思是,它在不同时间开始,但让我们说在 2010 年代中期,这个名为深度学习的新领域出现了,它引入了称为深度神经网络的模型,而大型语言模型就是这些深度神经网络的一个例子。它们能做什么呢?就像人类一样,如果我们阅读一段文字,我们就能理解它的意思。我们能理解文字背后的概念。这些模型也能做到,对吧?它们通过使用大量的参数,大量的海量数据来实现这一点。也许我们会深入探讨它是如何工作的,对吧?神秘地,但它们实际上是利用海量数据来理解文本背后的含义。但我想指出的是,你几周前与加里·马库斯讨论过这个问题,我们今天可能会再次谈到它,也许“理解”是一个不恰当的词,对吧?因为它们所做的只是在历史数据上进行训练,并试图模仿这些模式。那么,这就是理解吗?这就是不理解吗?也许我们会深入探讨这一点,但这就是这些模型的工作方式。它们克服了机器学习的局限性,因为它们现在能够使用所有这些非结构化数据。>> 那么,大型语言模型能做什么,而旧的概率性人工智能做不到呢?举个例子。>> 是的。首先,我不认为有必要说大型语言模型与概率性人工智能。这些大型语言模型本身就是一种概率性人工智能,对吧?我的意思是它们,你知道,是一个大得多的版本。它们有更多的参数。它们有更多的,所以这是第一点。但总的来说,这是关于查看完全非结构化数据。我的意思是,这就是它们的魔力。这就是它们能做到的。历史上的那种概率性人工智能,机器学习,预测性人工智能模型无法查看一段文本并理解其含义。现在,人们有办法绕过这个问题。他们会说,哦,如果我想理解一段文字,让我看看这段文字中有多少积极的词。比如,如果文字说“精彩”、“惊人”和“绝妙”等等,那么它可能就是积极的。但那些是非常,你知道,看待文本的简单方法。这些大型语言模型实际上可以查看文本并几乎理解它。>> 那么,为什么大型语言模型会产生幻觉呢?让我们来谈谈到底什么是幻觉。>> 这是一个很好的问题。如果你允许我,这将是一个很长的回答,但我想为了让你理解,因为我已经,你知道,我举了一个关于近期幻觉的例子,我刚刚与加里·莫里斯讨论过,那就是马杜罗被赶出委内瑞拉的那一天,在第一个小时内,人们在 ChatGPT 上说,“马杜罗被赶出委内瑞拉是怎么回事?”而 ChatGPT 回答,“马杜罗还在委内瑞拉。”对,因为,因为显然大型语言模型在处理新颖性方面存在问题,但让我们谈谈幻觉。>> 让我们告诉你它们是如何工作的。我的意思是,这些模型是如何工作的,它们是如何产生幻觉的。长话短说,我已经告诉你答案了。你应该感到惊讶的是它们竟然没有产生幻觉,对吧?它们产生幻觉的事实,你知道,这并不令人惊讶。>> 你得到了正确的答案。>> 它们竟然能得到正确答案,对吧,这太疯狂了。所以,好的,这些模型是如何工作的?我将从不同层次来解释。让我们从最高层次开始。这是你的听众可能已经听过的,但值得重复。它们只是自动完成引擎,对吧?所以,我不知道你是否玩过一个文字游戏,你说了个词,下一个人说个词,再下一个人说个词,你们一起编故事。是的,它们基本上就是在做这个。所以,例如,如果你问一个模型,“阿根廷的首都是什么?”它会查看问题,然后说,“嗯,我想知道下一个词是什么。”也许是“阿根廷的首都是”。它会说,“哦,布宜诺斯可能是下一个词。”然后,这是关键,它会回顾整个对话。“阿根廷的首都是布宜诺斯?”然后它会说,如果这是聊天机器人和人类之间的一次有用的对话,那么接下来的词是什么?它会说“艾里斯”。它会继续下去,直到它决定,“我完成了。”顺便说一句,这与幻觉无关,但这也是它们如此昂贵的部分原因,因为每次你想要下一个词时,你都必须从头开始重新处理整个对话,对吧?这有点疯狂。所以,如果你已经和它聊了大约 10000 个词,要生成第 10001 个词,它必须通过模型重新处理所有这 10000 个词。所以这有点疯狂。>> 这消耗了很多能量。>> 消耗了很多能量,这就是为什么,我的意思是,我们可以谈论能源。当然可以。>> 但好的,现在我明白了为什么它消耗这么多能量。>> 这就是为什么消耗这么多能量。现在,它是如何做到的?它怎么知道下一个词是什么?你需要理解的关键概念是嵌入。我向你保证,这是最技术性的部分,但我认为了解这一点真的很有帮助。嵌入就是你拿一个词,然后你把它变成数字。你还记得我说的机器学习模型的局限性是它们不能看词吗?嗯,这些嵌入将词语转换为数字,以便计算机能够理解它们。好的?也许理解嵌入的最简单方法是,想象一下你拿英语中的每个词,然后给它两个分数。第一个分数是它的“生命力”。所以,也许人类得 10 分,一块石头得 0 分,我不知道,一只蜘蛛得 5 分,一根胡萝卜得 2 分。你明白了。然后第二个分数可能是它的“响度”。所以,也许婴儿得 10 分。也许,你知道,石头得 0 分。也许胡萝卜得 1 分,因为它很安静,但如果你咬它,它会发出声音。>> 所以,每个词都有两个分数。>> 每个词都有两个分数。现在,你可以想象将这些分数放在一个 XY 轴上,对吧?在一张图纸上,>> 每个词。>> 每个词都基于这些分数。所以,X 轴是生命力,Y 轴是响度。然后,如果你想到那张纸,你就会开始>> 谁给分数?>> 喜欢这个问题。我保证我们会在大约 30 秒内得到答案。这就像>> 有裁判吗?>> 哦,这是关键问题,对吧?这是第一个问题。>> 谁做这个决定?>> 每当我告诉学生时,他们总是问我这个问题。答案很疯狂。但我们会到达那里的。所以,你知道,你有了那张纸,你有了分数,你可以想象你现在会得到这些集群,对吧?比如,蔬菜会聚集在一边,人类在另一边,等等。最深刻的是,这些分数现在可以让你,它们让计算机能够查看数字,而这些数字告诉你,哦,我知道这个词的一些信息,对吧?如果我告诉你一个词在生命力尺度上是 0,在响度尺度上是 9,>> 猜猜它会接近包含像喇叭和钟声以及所有这些响亮的东西的集群。所以它真的能给你一种感觉。现在回到你的问题,对吧?到底是谁决定这些词的?当然,对吧?两个分数是不够的。如果你想真正了解一个词,你需要数千个。答案当然是,没有人。答案是机器学习。所以,还记得 Zestimate 的例子吗?你还记得我告诉过你,在这个 Zestimate 的例子中,你不需要决定每平方英尺值多少钱,或者每个浴室值多少钱,你只需要给模型提供数据,它就会弄清楚。它会调整数字,直到你得到一个好的结果。事实证明,嵌入也是如此。这是一个非常疯狂的想法,但你听说过这个事实吗?人们说这些大型语言模型是用互联网上所有的文本进行训练的。>> 是的。>> 你听过这句话。那就是它们使用的训练数据。所以,让我解释一下它是如何工作的。他们会拿两个词,比如“国王”和“女王”,两个词。这两个词,如果你在互联网上查看,它们经常会出现在一起。所以算法会意识到,等等,这两个词,在我的图纸上的 X 和 Y 轴上,它们应该靠得很近,因为它们经常一起出现。所以他们会调整分数,让它们更接近。>> 另一方面,像“品客”和“存在主义”这样的词,对吧?可能离得很远。所以它们会被调整得更远。>> 好的。>> 而且,史蒂夫,这令人惊讶。但如果你这样做,>> 所以分数一直在变化。>> 模型在训练时分数一直在变化。所以,当 OpenAI 训练那个模型时,令人惊讶的是,如果你这样做足够多,你就会得到一个真正捕捉词语含义的东西。所以你实际上会得到意思相近的词语集群。你会得到这些疯狂的关系,比如,如果你看图纸上“法式长棍面包”和“法棍”之间的数值差异,它与法国和意大利之间的差异差不多。所以它有点理解“国家”的概念,对吧?顺便说一句,我在播客之前提到过。我们会在节目笔记中放一个链接,但我创建了一个小在线工具,你的听众如果感兴趣,可以去看看,并尝试一些词。所以,从宏观上看,这就是大型语言模型如何理解文本。还有另一个复杂之处,当然,一个词是不够的。你需要有上下文的词,对吧?所以,如果我说“我喜欢无花果和日期”,我今晚有个约会,今天是几号?“日期”这个词的意思非常不同。所以,而且,再次,为了将它与你的听众可能听说过的东西联系起来。我不知道你是否听说过“Transformer”。这是一个数学技术,谷歌在 2017 年发布的,这是一个重大的突破。Transformer 就是谷歌意识到如何让这些嵌入相互关注。>> 好的。>> 好的。所以,这是我关于大型语言模型如何工作以及它与幻觉有何联系的宏大解释。我知道你。所以,我保证我们正在回到它。>> 我屏息以待。>> 坐立不安。我警告你,答案可能会有点令人失望。但>> 好的。>> 基本上,当你问一个大型语言模型一个问题时,>> 是的。>> 它首先会接收你的问题,然后进行转换。>> 我必须问你,桑迪·考法克斯为什么是个伟大的棒球运动员?>> 桑迪·考法克斯为什么是个伟大的棒球运动员?>> 完美的问题。>> 你选择了一个出生在法国、在英国长大的人。所以我可能听说过桑迪·考法克斯,也可能没听说过,但我们不会告诉听众。>> 太棒了。他是 60 年代初最伟大的棒球投手。>> 最伟大的棒球投手。太棒了。>> 好的。>> 所以,模型会做什么?它会利用我刚才描述的所有机制。它会得到一个巨大的数字列表,捕捉你问题的本质。所以,如果你再次想到我们的图纸,它会把它放在一个位置,暗示,哦,这是史蒂夫刚才问的问题的氛围。然后它会字面意思地说,周围的词是什么?词是什么?>> 桑迪·考法克斯最伟大的投手周围的词是什么?>> 确切地说。然后它会选择其中一个词,然后用那个词来回应。>> 然后它会再加一个。>> 但它会回到开头,再次搜索,然后添加另一个。>> 再次创建那些数字。看一个附近的词,再一个,再一个,再一个。所以,回答你的问题,为什么它会产生幻觉?真正疯狂的问题是,为什么它有时不会产生幻觉,对吧?它所做的就是,它根据在互联网上看到的所有文本,以及它所知道的互联网上的文本在哪里,来捕捉你问题的本质,然后它只是生成下一个词,下一个词,下一个词。>> 这不是我们所认为的思考。>> 嗯,这是一个绝对惊人的问题。实际上有一个我喜欢做的技巧,我认为这能让人们真正理解这是否是思考,因为你知道,我认为>> 让我们退一步,人们正在问的一个大问题是,它会变得比人类更聪明吗?它最终会扩展吗?它能扩展多少?>> 但你的意思是,它几乎就像一个奇迹,你竟然能得到正确的答案?>> 确切地说。我给你举一个例子,它真的能说明这是一个多么大的奇迹。所以,如果你问这个模型一个问题,你说,“我有一个袋子,里面有五个球,球上标有 A、B、C、D、E。”>> 好的。>> “随机选一个,告诉我球上的字母。”所以,作为一个人类,如果我问你这个问题,>> 是的。>> 你可以告诉我,我可以问一个 10 岁的孩子,他们会告诉我,“哦,嗯,你知道,20% 的时间我会得到 A。20% 的时间我会得到 B。20% 的时间我会得到 C。”>> 对吧?>> 事实证明,你可以用这些大型语言模型来做,你不能在 chat.com 上这样做,但如果你能用 API 编码,你实际上可以做到。你可以问 ChatGPT,当我问你这个问题时,在你内部的 LLM 大脑中,你认为概率是多少?比如,你认为下一个词应该是多少?它完全失控了。所以,ChatGPT 会告诉你,50% 的时间答案应该是 C,20% 的时间应该是 A,5% 的时间它基本上是错误的。现在,如果你想想为什么会这样,这是有道理的,因为 ChatGPT 所做的就是它接收你提出的问题,它对其进行嵌入。所以,它创建了那个本质,那些数字,对吧,那些能让你感受到问题的氛围。然后它说,什么是最接近的词,也许适合那个答案,但这并不是人类的工作方式。我们根本不是那样思考的。这只是一种非常非常不同的思维模式。现在,我需要说清楚。>> 我不确定那种思维模式在任何方面都比人类思维模式差。我的意思是,谁知道呢?但它肯定不同。它不是一回事。好的。是的。>> 我是史蒂夫·艾斯曼。我的孩子们还小的时候,有一天早上我惊慌失措地醒来,我意识到如果我出了什么事,我的家人将完全没有保障。我立刻去买了人寿保险,这样我的家人就能在经济上得到保障。我从未后悔过这个决定。所以,别再拖延了。购买人寿保险比你想象的要容易得多。Gerber Life 的 Fabric 让你可以轻松地在新的一年开始时知道你的家人今年有了更多的经济保障。Gerber Life 的 Fabric 是一种定期人寿保险,你今天就可以办理。专为像你一样的忙碌父母而设计。全部在线办理,按照你的时间表,就在你的沙发上。你可以在 10 分钟内获得保障,无需体检。如果你有孩子,尤其是如果你年轻健康,现在是锁定低费率的时候了。Fabric 提供灵活、高质量的保单,适合你的家庭和你的预算。例如,一百万美元的保障,每天不到一美元。Fabric 已与 Gerber Life 合作,Gerber Life 值得数百万像你一样的家庭信赖,已有 50 多年的历史。没有风险。有 30 天的退款保证,你可以随时取消。加入成千上万信任 Fabric 来帮助保护他们家庭的父母的行列。立即在 meetfabric.com/isman 申请,只需几分钟。网址是 meetfabric.com/isman。mefabric.com/isman。保单由 Western Southern Life Assurance Company 发行,并非在某些州提供,价格受承保和健康问题影响。我是史蒂夫·艾斯曼。我经营一家小企业,所以我知道经营小企业很难。当需要贷款时,找到一个你真正信任的贷方似乎是不可能的。大银行说不,互联网上充斥着高利率和难以阅读的细则的骗局。无论你需要帮助支付工资、管理现金流还是投资增长,你都应该得到更好的。这就是为什么我推荐由 Nerd Wallet 提供支持的小企业市场。它是一个免费、易于使用的平台,让你可以在一个地方比较来自可信贷方的真实融资优惠。我喜欢的是,你不需要完美的信用就可以开始。没有垃圾邮件,没有欺骗,只有适合你企业需求的个性化选项。将来,当我的企业需要小企业贷款时,NerdWallet 将是我去的地方。这里是最好的部分。限时优惠,当你访问 nerdwallet.com/isman 并填写无义务表格时,你将获得 VIP 待遇,并与一位真正了解小企业贷款方方面面的人交谈。不要把你的企业冒险交给不可靠的贷方。前往 nerdwallet.com/isman 寻找你应得的资金。Fender, Inc. NMLS ID 号码 1240038。>> 那么,让我们稍微探讨一下加里·马库斯。>> 是的,完全。>> 因为你看了那个播客。>> 我确实听了你迷人的>> 太棒了。我学到了很多。但如果我能总结他的论点,我认为它将分为两部分。他会认为,我们正在获得的大型语言模型的改进,我们现在拥有的模型,我们将继续扩展大型语言模型,它们将继续变得越来越好,直到我们达到我们应该达到的目标。他的论点是,我们已经达到了一个点,即大型语言模型的改进,从 ChatGPT 5 到 4 的边际改进小于从 4 到 3,小于从 3 到 2。所以你正在获得收益递减。所以,如果我们真的要将这件事推向它应该去的地方,我们必须回到起点,并引入他所说的“世界模型”来训练这些东西,让它们变得更好。这是他论点的一部分。他的另一部分论点是,鉴于大型语言模型的工作方式,它们总是会产生幻觉,这是一个问题,因为幻觉是一个问题,因为如果你使用它,你怎么知道它在产生幻觉?>> 对吧?>> 所以,你对此有什么看法?>> 我有很多想法。所以,让我们首先,我认为,你知道,只是为了你的听众的定义,让他们了解我们在说什么“扩展模型”。>> 对吧?当我描述那些嵌入、那些 Transformer 和那些参数时,你查看数据并调整参数。扩展只是意味着更多的数据。你只是创建更多,不仅仅是更多数据,这也是一种扩展方式,这是一个维度。但另一个维度是更多的参数,更多的计算复杂性,对吧?这就是为什么它需要更多的芯片和更多的能源等等。>> 换句话说,一个词不是有两个变量,两个分数,它可能有上千个变量?>> 这正是你可以扩展的一种方式。另一种扩展方式是那些 Transformer,我们没有花太多时间谈论它们,但它们也有自己的参数集,而且比词语的变量多得多,你可以添加到它们中。我们不需要深入细节,但基本上增加参数是一件大事。所以,这是我想说的第一件事,这就是我们所说的扩展。正如你所说,至少有一段时间,人们认为我们扩展得越多,这些模型就会变得越好。现在,我想说一件事,加里几乎在你的谈话中提到了这一点,我想,我想他可能会进一步谈论。我想指出我们所说的“更好”是什么意思,因为我们从不问,到底是什么意思“更好”?“更好”通常意味着当一个新的模型出现时,它在计算机科学界的一套非常非常具体的基准测试上表现更好。这些模型会接受测试,你知道,有很多例子。其中一个叫做“大规模多任务语言理解”基准测试,缩写为 MMLU。你可以把它想象成 SAT 考试。你给大型语言模型这个考试,它能回答问题吗?所以,我想说的是,在 SAT 考试中表现好并不是必需的,它是智力的一部分,但不是智力的全部。所以,现在有很多研究在研究如何更好地测试这些模型,比如,我们还能使用哪些基准测试,也许比我们目前使用的更具启发性。我实际上在商学院有一位同事,洪南孔,我很幸运能与他一起工作。他正在尝试基于 Excel 工作来构建基准测试。我们可以给它一个 Excel 表格,它能构建 DCF 吗?或者它能找出公式中的错误吗?所以,总之,关于如何让这些模型得到更好的测试,有很多研究。所以,这是我想说的第一件事。第二件事是,你知道,加里在某些方面,他拥有关于实际智能的惊人知识。我的意思是,他做了很多研究,这些研究贯穿了他的毕生工作。对我来说,一个不具备加里知识的人感到困惑的事情是,我认为我们轻易地抛出这样的短语,“哦,这些模型会变得比人类更好吗?我们会获得超级智能吗?”我心想,我不知道那具体意味着什么,就像,>> 嗯,我认为它们都在思考,你知道,我们小时候都看过《终结者》,我们只是想弄清楚那什么时候会发生,我们不得不躲起来。你知道,我真的不能夸大这一点,因为这个世界上所有的人都像是科幻迷,他们从小就接触这些。他们非常认真地对待这件事。他们对此深感担忧。>> 你知道,史蒂夫,这很有趣。这让我想起,你看过《心灵捕手》吗?所以,对于那些不知道的人来说,这是一部关于一个天才孩子,但他过着非常艰难的生活,他的治疗师由已故的罗宾·威廉姆斯扮演。电影中有一个场景我非常喜欢,治疗师和马特·达蒙一起坐着,他扮演那个孩子,他说,“你太聪明了。如果我问你米开朗琪罗,你可以告诉我关于他的一切,对吧?”>> 但你能告诉我西斯廷教堂里闻起来怎么样吗?或者如果我问你关于爱,你可以背诵>> 但你知道真正爱一个女人是什么感觉吗?>> 确切地说。所以,这就像一个令人惊叹的场景,有时我想起大型语言模型,很难抓住模型拥有人类的意义是什么。当然,模型摧毁我们所有人可能是一种极端的情况,但中间有很多步骤。所以,很难,很难定义。加里显然认为它们无法扩展到人类的智能水平。说实话,我认为我并不反对。当然,大多数我尊敬的人可能会同意,目前大型语言模型只是预测下一个词,预测下一个词,预测下一个词的方式可能无法扩展到超级智能水平。但我确实想指出,很难真正抓住那意味着什么,以及如何知道,你知道,当你达到那个点时。嗯,还有几件事要说。我只给你标题,你告诉我是否想听。嗯,另一件事我想谈谈,你知道,也许我们最后会谈到,但我们有时会错过的一件事,你知道,在关于它是否会变得超级智能的对话中,即使它不会,>> 也许它仍然有价值。>> 也许,我将去掉“也许”。模型仍然有巨大的价值。如果你今天告诉我,这些模型永远不会变得更好。它们将永远产生幻觉。它们将永远保留今天的任何缺点。我在与公司的合作中亲眼所见,仍然可以获得巨大的价值。>> 让我们探讨一下。>> 是的。我只想说也许我们最后会谈到。现在有很多关于全新范式的研究。你提到了世界模型。这是一个例子。也许最后我们会谈论它们,但我的意思是,研究不是说 OpenAI 和 Anthropic 的人只是坐着说,“好吧,我们放弃了。他们只是,你知道,扩展完成了,就这样。我们完成了。”还有很多其他地方人们正在探索,但也许让我们谈谈价值。是的。你认为这些大型语言模型,就目前而言,它们有什么用?>> 当我想到我从它们那里获得的价值,我合作过的人从它们那里获得的价值,公司从它们那里获得的价值时,我将它们分为三个类别。好的。>> 对吧?第一个类别可能最不明显,所以我先说,就是利用这些经典的机器学习模型,正如你正确指出的,它们已经存在多年了,并通过使用这些大型语言模型来改进它们,我们可以谈论一些例子。>> 第二个类别是生成式人工智能,我们也会谈论它。第三个类别是,这听起来很明显,但就是将它们用作聊天机器人。我的意思是,它们已经存在几年了,所以很容易就忽略了它们实际上有多么神奇。>> 那么,让我们来探讨一下这三者。让我们从第一个开始。>> 让我们从第一个开始。所以,也许最容易通过例子来探讨,但我见过很多地方,生成式人工智能可以超级化经典的机器学习。所以,让我们从第一个例子开始。好的。>> 假设你经营一个网站,上面有用户发布的内容,这可以是任何东西。可以是社交媒体网络。可以是人们写评论的电子商务平台,任何东西,Reddit,等等。困扰这类网站、这类公司的一个问题,而且一直如此,就是内容审核。对吧?你必须,如果有人在你的网站上发表评论,你必须确保它不是非法的,不是辱骂性的,你会有很多规则来规定哪些评论可以发布。你知道,这听起来可能像是一个晦涩的操作性问题,但这很重要。我的意思是,人们支付巨额团队的费用,这些团队很昂贵,来真正浏览这些网站。事实证明,内容的质量,比如你看看亚马逊,>> 亚马逊提供的很多价值,不是唯一的价值,但很多价值就是评论,对吧?我的意思是,有很多,比如超级超级有价值。所以,长期以来,这些公司一直在使用机器学习模型来尝试识别,自动标记哪些评论应该转给人类,对吧?我们如何看待某件事并弄清楚,啊,这可能很可疑。让我们把它交给人类审查。所以,例如,他们可能会寻找特定的词语,对吧?他们可能会寻找消息的长度,发布的时间,发布的位置等等。问题在于,这又回到了你第一个问题,大型语言模型能做什么,而机器学习不能?它们实际上无法理解消息的含义,对吧?它们可以寻找其中的一个词,但这并不能告诉它们消息的完整含义。所以,例如,对吧,这是一个法律。我不知道是否属实,但人们过去认为,如果你在 Instagram 上写下带有“杀死”这个词的消息或发布视频,它就会被降级,因为它认为这是坏的。所以现在人们开始使用“unalive”这个词而不是“kill”,因为这样算法就抓不到它了。所以,这些机器学习算法一直被这个问题困扰,我看到人们非常成功地做的是,他们现在说,“等等,我们将坚持使用这些机器学习算法,但我们将注入一些生成式人工智能,让生成式人工智能查看人们发布的这些评论,并让生成式人工智能从中提取含义,因为我们看到它可以做到,对吧?它可以真正从这些消息中提取含义。所以,人们这样做的例子,最简单的方式,不一定是最有效的方式,就是你真的去一个聊天机器人,你给它消息,然后说,“嘿,给我一个 1 到 10 的评分,它有多可能是坏的?”然后它会给你一个数字,然后你把它放入你的机器学习模型。但一个更聪明的方式,我见过的是,你可以把那个消息,你记得我们很久以前谈过的嵌入。所以,你可以把那个消息,你得到那个消息的数字,对吧?把它放在 XY 轴上。然后你可以使用那些数字,那些分数,即使它们没有真正意义。它们只是生成式人工智能的内部运作。你可以使用这些数字作为指标。也许你查看历史数据,然后说,“等等。当第二个分数很高时,这往往是可疑的,所以我会适度处理它。”我真的看到人们这样做了,效果很好。事实是,我谈到了内容审核。任何你想做预测,并且涉及文本的用例。这真的可以提供很多价值,并且非常有用。而且请注意,在某些方面,幻觉并不重要,因为你现在,我的意思是,它们很重要,对吧?你宁愿模型不产生幻觉,但你不是单独使用模型,你把它放在一个更大的机器学习模型中,你可以控制,你可以评估,你可以检查。所以,这只是一个例子,你知道,巨大的价值可以被创造出来。>> 所以,这是第一个。让我们谈谈“代理式人工智能”是什么意思,我一直听到。>> 有趣的是,我们会谈到代理式人工智能。只是让你知道,我们会谈到的。我会跳过代理式人工智能。我准备了六个例子,但我们会谈论的。我的意思是,我之所以这么说,只是想让你知道,有很多事情可以做。>> 我在 CNBC 上听到“代理式人工智能”这个词,我敢肯定,10 个人中有 9 个谈论代理式人工智能的人根本不知道他们在说什么。我将是第一个承认我不知道它是什么的人。那么,它到底是什么?>> 它太热门了。>> 它确实太热门了。我有个好消息。就像,你听到这个词,好像它将拯救世界。它将消灭管理咨询业务。我的意思是,代理式人工智能已经取得了巨大的成就,但它还没有取得任何成就。那么,这是什么东西?谁在个人电脑革命早期说过,你知道,你到处都能看到个人电脑,但生产力数字却不见踪影?我不知道,总之,好的,我有个好消息给你。代理式人工智能真的很简单。它基本上就是一个大型语言模型。一个带有双手(pair of hands)的聊天机器人。>> 那是什么意思?>> 那么,那是什么意思?它是一个聊天机器人,它被赋予了在现实世界中做事情的能力,比如发送短信,发送电子邮件,处理信用卡交易,处理退货。所以,它的工作方式是这样的,公司这样做的方式,让我们以最常见的代理式人工智能例子为例,也许是一个客户服务聊天机器人。作为公司,当你设置这个代理式人工智能时,你创建了一堆工具,比如一堆,你知道,IT 功能,基本上是说,“好吧,这将为客户处理退货。这将发送订单。这将发送电子邮件。这将发送短信。这将退还信用卡交易。”你把所有这些工具都提供给它。当你设置你的聊天机器人时,你只是告诉聊天机器人,在聊天机器人的文本中,有更聪明的方法可以做到这一点,但这是一个简单的版本。你告诉它,客户即将问你一个问题。顺便说一句,这里有一堆事情你可以做。>> 这听起来很多,但听起来很...

我最近采访了一家公司首席财务官,这家公司是一家新成立的旅行社,于夏季上市。这家公司是一家全新的公司。首席财务官是这样描述的:在此之前,如果你要预订商务旅行,从头到尾,预订行程、租车、找酒店,至少需要45分钟到1小时。他们从零开始创建了一个人工智能系统,你可以在七分钟内完成所有这些事情。

那是真正的AI。

正是如此。而且,正如我所描述的,我推测在那家公司内部,他们创建了一些很好的管道,你可以轻松预订航班、预订酒店、查找航班、查找酒店,然后聊天机器人获得了能力,当你与聊天机器人聊天时,它可以说:“啊,我现在想调用这个酒店预订工具。我想调用这个发送短信的工具。我想调用这个发送电子邮件的工具。”等等。有一件事我认为这确实突出了,这也是通常情况下,如果一家公司来找我说:“我们想使用人工智能,我们能做什么?”我通常告诉他们的第一件事是,你必须首先创造一个肥沃的环境,一个你的公司能够从中受益的环境。在那个例子中,例如,你需要有IT系统允许计算机预订航班或处理退款或任何事情,这并非凭空发生,对吧?如果你是一家手工接单的公司,你仍然手工记录订单,你不需要GPT75。你需要的是你的IT系统能够真正地促进这些事情。这就是为什么我说,有时我们谈论人工智能泡沫,有时人们会将之前我们讨论的问题混淆,即人工智能是否会扩展,是否会变得超级智能,我们是否有人工智能泡沫。所以他们认为,如果人工智能扩展到超人水平,我们就没有人工智能泡沫,但如果人工智能保持今天的样子,那么我们就有人工智能泡沫。我不认为事情有那么简单。我想说,即使模型保持今天的样子,如果公司在IT、系统和数据方面整理好自己的事情。但这是一个主要问题,因为世界上大多数公司我认为他们的数据设置方式不对,以至于他们真的可以说他们必须经过一个过程,他们必须把所有数据放在一个地方并清理干净等等,然后才能做任何事情。顺便说一句史蒂夫,我必须说,作为一个人,我最喜欢陈氏人工智能的一点是,当我与公司合作时,我最喜欢的一点是,它现在几乎激励着公司去做这件事。五年前,我会去一家公司说:“你知道,你必须把你的数据放在一个地方,你必须组织起来。”他们会说:“啊,真无聊。”现在是:“好吧,这是我必须做的才能让GenAI工作,我们开始吧。”但是,但是,但是,你绝对必须这样做。顺便说一句,这就是GenAI的意义所在。我想再举一个例子,因为我认为它可能与你的听众相关。人们现在正在研究,这些都处于起步阶段。Anthropic终于向公众发布了。现在有Excel代理,聊天机器人提到的工具就是创建数据透视表,直接写入Excel,更改单元格颜色。你正在与聊天机器人交谈,你告诉它,例如:“你能为我构建一个英伟达的DCF吗?”它将能够使用该工具,并在你与它交谈时实际更改你的Excel电子表格。所以,如果这真的奏效,你可以想象这会非常棒。我会说这仍然处于起步阶段,但你知道,事情发展很快,所以谁知道呢?这就是代理的范畴。

你认为它还能做什么?

大型语言模型,是的。所以,我认为值得一提的是,聊天机器人本身,对吧?我的意思是,Literally ChatGPT.com,Claude,Gemini,无论是什么。它们很棒,它们可以写电子邮件,它们可以做所有这些事情,我们现在已经习以为常了。我很好奇,你是否在日常工作流程中使用过它们?

我一直使用Gemini进行研究。

它对研究很有用,你知道,我的意思是,写代码,我的意思是,这些模型在过去六个月里写代码的能力有多强,有时让我感到一种存在主义的恐惧。我喜欢写代码,我只是觉得“哇,它们现在很厉害了”。再次强调,仍然不是。我从很多观看我节目的程序员那里得到了很多反对意见。你知道,他们中的一些人认为,有些编码部分是有帮助的,但有些编码部分确实没有帮助。它有点杂乱无章。没有共识。

我告诉你两件事。第一件事是,如果六个月前你问我,是的,我基本上会说算了吧。它们是很有用的代码搜索引擎,对吧?如果你想创建一两行代码,但仅此而已。它们确实改进了。我的意思是,我会鼓励任何最近没有使用过Claude写代码,或者只是没有单独使用过Claude写代码的听众,尤其是前端设计。所以,创建网页,一个漂亮的网站。真的,如果你是那种坐在这里想:“不,它们永远做不成什么事。”的人,现在就试试吧。

好吧,它变得好多了。

变得好多了。话虽如此,我同意他们。我的意思是,我仍然认为在构建软件解决方案、确保它不会失控以及确保它安全等方面,需要一定程度的创造力,这仍然需要人类参与。话虽如此,有时我也会想,我必须告诉你史蒂夫,我喜欢编码。我认为这是一项有趣的练习,它富有创造性,有时我想,我是否听起来像一位艺术家说:“我喜欢创作艺术,但这些模型,嗯,它们远不如我好。”所以,我不知道是否有相似之处。所以,总之,我并不是说它在编码方面绝对令人惊叹。我只是说,有些编码部分,它确实非常非常擅长。关于聊天机器人,我最后要说的是,我认为它们确实……人们有时不知道的是,至少在企业环境中,它们可以很好地定制。所以,你可以做一些事情,比如给它们提供成千上万份文件,对吧?成千上万份文件,然后它们会根据我们谈过的嵌入式技术进行操作,我提到它们是有原因的。它们无处不在。你可以获取这些文件,你可以嵌入这些文件。你给这些文件一种氛围,基本上。你说:“啊,这份文件有这种氛围。这份有那种氛围。”然后当你与聊天机器人聊天时,它可以搜索这些文件,因为它可以说,比如说你问……你问聊天机器人,“给我看看我风险最高的合同,我不知道,或者无论是什么,最多的。”它可以说:“好的,有风险的合同,有这种氛围。我可以嵌入它,我可以把它放在某个地方。让我现在看看具有最接近氛围的文件,然后它就找到了。”它做得如此之好,真是令人惊叹。

让我问你一些关于……从商业角度来看,两个……你会用什么词来形容“热门话题”。所以,你知道,去年,如果你看看……科技领域哪些做得好,哪些做得不好,我总是觉得很有趣,因为人们只是说“科技做得很好”,你知道,“买科技”,你知道,之类的。所以,去年,你知道,抛开“七巨头”这个类别不谈,任何与销售芯片有关的公司都做得很好,无论是GPU、CPU还是内存芯片,它们都做得很好,所以硬件公司总体上做得很好。购买这些芯片并创建人工智能数据中心的超大规模企业也做得很好。但做得糟糕的两类是软件公司和一些标志性的软件公司,如Salesforce、ServiceNow。关于它们为何表现不佳的论点是,创建软件的成本“正在崩溃”,因此这些公司周围的护城河不再那么强大。这是一类。另一类是管理咨询公司,因为你知道,论点是:“我为什么要请管理顾问,因为我过去用来咨询管理顾问的90%的事情,我可以问ChatGPT,它免费给我。”所以,你对这两个……你有什么看法?你知道,有时这是一种叙事,你知道,在商业世界里,当一种叙事形成时,它很难消亡,直到有人把它彻底击垮。所以,我只是好奇你对这些叙事的看法。

让我给你一些想法。我应该事先说明,我非常敬佩像你这样能够至少对市场走向有所了解的人。我总是有一个想法,我对这些话题有一个想法。它们将如何影响市场。天知道,这似乎是一个我不太理解的野兽。

没关系,你不是为此而来的。

不,完全,完全。嗯,我们先谈谈软件公司,然后再谈谈……开发软件的成本等等。我只想先表达一些同情,因为我肯定有过这种感觉,即使是教学也是如此。就像我们正在建造一辆汽车……抱歉,正在学习驾驶一辆汽车,而它还在建造中……字面意思是每5秒钟你打个喷嚏,就会出现一种新的人工智能,它会彻底改变你的……你的产品,你的软件设计方式,你如何提供给企业,尤其是像Salesforce这样规模的公司,它们根本没有以这样的速度运作。这太疯狂了,太疯狂了,太疯狂了。

所以事情发生得非常快。

非常快。我只想说,这不是预测,但从纯粹的逻辑角度来看,它最终会放慢速度。总有一天,我们会达到一个地方,很多唾手可得的果实已经被采摘了,我们现在……所以,我先把这一点提出来,你知道,我们非常……这就像说,“哦,八个月后,这家公司做得好或不好,或者别的什么。”我的意思是,当然,但事情只是在变化,整个世界结构都在变化。所以,这是我要说的第一件事。你知道,软件成本在下降,人们可能会开发自己的软件,也许……我告诉你,我一直强调,我认为……使用LLM进行编码……它们很好,是否完美,绝对不是,等等。但我确实认为人们低估了Salesforce不仅仅是提供代码软件的事实。我的意思是,它们是,但它们也提供了一个完整的结构,一种思考你业务的方式,一种……你能否将你公司里的一大群人聚集在一起,让他们同意使用这个软件?所以,我不是说这将被取代,但我说,它们可能有一个可以演变的空间,这个空间更侧重于软件周围的所有事情,而不是仅仅是软件本身。对吧?也就是说,想象一下,如果你公司的每个员工都能构建自己的Salesforce,自己的……我不知道,CRM,比如说来管理客户。那将是一场混乱。我的意思是,每个人都有一个CRM。你用哪个?哪个是正确的?哪个是错误的?你如何验证?你信任谁?

我实际上也在想……你知道,有些公司控制着数据库。

是的。

比如说,我是拥有最佳商业房地产数据库的人。

是的。

我一直经营这家公司。我会认为有人今天可以比我做得更便宜。而且,你知道,没有人能够攻击我,因为我“控制”了这个数据库。但我认为,拥有特定类型数据库的人很容易受到攻击。

我认为这是真的。我的意思是,我给你举一个非常脆弱的地方的例子。如果你的整个数据库都基于你只是查看了大量手写文件或非数字化文件,然后你 painstaking地……你知道,提取了数据,这就形成了你的数据库,那么你真的很容易受到颠覆,因为现在这些大型语言模型,你给它们一个PDF,利用我们谈到的所有技术,它们可以在一秒钟内提取数据。所以,我认为……这是光谱的一端。光谱的另一端,也许是这种公司的极端版本,是彭博社,对吧?我的意思是,那里有所有这些数据源等等。我猜,而且我对它了解不多,我猜会困难得多。

那要困难得多,因为它们有那么多不同的数据库。

是的。而且,你知道,我会说有一个世界,你知道,我们总是忘记这一点,这是……你知道,现在每个人都喜欢提到的悖论,但事实是,如果现在创建这些数据库要容易得多,是的,你将颠覆那些过去拥有它们的人,但你也会拥有更多。将会有更多的地方,你突然能够创建以前没有的数据库。嗯,对。只是,我的意思是,再举一个例子,你知道,我说过,当我们第一次讨论使用GenAI来加强机器学习时,我说我还有很多其他例子。我现在就插入一个,因为它适用,你知道,你现在可以获取一批文本,甚至图像,并创建这些嵌入式,这些本质,这些氛围,这使得你可以构建以前从未有过的数据库。你可以查看数百万张图片,对吧?查看数百万条文本。你可以嵌入它们。你可以把它们放在这个XY平面上,它定义了它们的本质,你就可以开始说,“好吧,如果有人搜索一个特定的词,我现在就可以找到与那个特定词相关的正确图片和正确的文本。”所以,你可以想象全新的数据库,全新的……数据类型是由此创建的。

那么,让我们来谈谈管理咨询,因为这多年来一直是我的一个痛点。你知道,人们的论点是,你过去会雇佣一位管理顾问,因为他们拥有这些信息,他们会进来,而现在我不需要管理顾问了,因为我只需要问ChatGPT,它会在两秒钟内给我答案。

让我告诉你一件事。我……你知道,Palantir不是管理顾问,绝不是,但它有一些服务元素。我记得有时和……和我的同事们一起思考,也许我不应该说这个,但我记得和我的同事们一起思考,有时我们提供的很多价值就是把所有人都聚集在一个房间里。就像,字面意思是,我们会去一家公司,因为他们想使用数据分析,人工智能,他们想使用我们的平台。在那间屋子里有CEO,有CTO,有实际处理数据的人,有知道……的人。就像,字面意思是,所有这些人以前从未在同一个房间里过,对吧?所以,你知道,所以,我在这里举了一个极端例子,我简化了,但我认为管理咨询有这种元素,这种外部视角,把人们聚集在一起,是的,也许LLM可以做到,但我认为……而且,同样,我并不一定了解管理咨询的世界。我没在麦肯锡、贝恩或BTG待过。我曾在Palantir,这是一个非常不同的……但我可以想象,比如说,考虑到Palantir的服务业务,它不是管理咨询,但肯定……我真的看到了很多价值,比如把所有人都聚集在一起,理解你如何……再次,你的非常混乱的业务,一切都用笔和纸完成,把所有数据都集中到一个地方,弄清楚发生了什么。所以我很容易看到……大型管理咨询公司可能会转变,而且它们已经在朝着这个方向转变。嗯,然后也许传统的管理咨询仍然有价值。我对此了解不多。

那么,让我们回到我们谈到的一个问题,即许多公司甚至还没有准备好处理数据……我的意思是,在你的旅行中……如果我们谈论的是,比如说,标准普尔500指数或标准普尔1000指数,你知道,无论是什么。我的意思是,如果没有人准备好处理这些事情,那么AI在这个意义上就是学术性的,因为很多公司都没有。那么,你认为现在的美国企业在做这些事情方面处于什么水平?

是的,这是一个很好的问题。我看到的最后一份试图系统地弄清楚这一点的研究是很久以前的了。当时大概是……5%,一个非常小的数字,但那已经是很久以前了。我认为今天不再是这样了,因为你是对的,如果数据不在正确的位置,你就无法真正处理任何这些东西。我会说有一个因素是,人工智能本身可以非常有助于清理这些数据,对吧?我曾与一家公司合作过,我读过一个案例,AI咨询公司CEO名叫Blend 360。他们有一个客户遇到了这个问题,他们的客户是通过一系列收购形成的,他们是一家B2B公司,他们是通过一系列收购形成的,他们有多个数据库列出了他们的客户,每个数据库使用的名称都不同。所以,一个数据库会说客户是可口可乐。比如说,一个数据库会说它是可口可乐公司。另一个会说它是可乐。另一个会说它是CCNA或其他什么。他们所做的,我认为非常聪明,就是使用大型语言模型来清理这个问题,因为如果你问一个大型语言模型,“可口可乐”和“可口可乐公司”是否相同?它会非常擅长做到这一点。它了解世界。它什么都知道。所以,这只是一个例子,它不是GenAI本身,而是它真的……它改变了他们的处境,因为现在他们有了一个统一的数据集,他们可以真正使用机器学习。所以,我会说,我不是直接回答你的问题,但是……但是,我认为有希望的是……GenAI不仅在数据方面很有用,而且它还可以帮助……整理、清理和……将数据放在更好的位置,使其更有价值。但我确实认为我们还很远……我的意思是,我认为……除了那些非常大的公司……它们可能拥有资源,或者可能出于合规原因需要将数据放在一个好地方,我认为还有很多……很多中型公司,当然还有那些……我与之交谈过的公司,还有很多工作要做,才能把事情做好。

那么,在我们结束之前,我们还应该谈论什么?

我们还应该谈论什么?也许谈谈……人们对下一代模型,研究中的事物感到兴奋,这可能是有意义的。所以,人们正在朝着几个方向发展。有一件事我认为你的听众可能会觉得有趣……你知道我如何解释这些模型的训练方式吗?它只是试图预测下一个词,下一个词,下一个词,下一个词。你知道,一个模型在训练中被认为是好的,至少在调整权重时,如果它在预测下一个词方面做得很好,它就被认为是好的。

正确?

所以,人们已经开始这样做……他们很早就这样做了,但现在有更聪明的方法来做这件事。他们试图说,而不是仅仅通过下一个词预测来调整模型的参数,我们可以看看完整的答案,也许让大型语言模型生成许多答案,因为它能做到,因为我告诉你的随机性。所以,你可以得到很多答案,然后你不是逐个标记地评判答案,而是根据它最终得到的结果来评判。它最终是否得到了正确的结果?

传统的做法是某种叫做“人类反馈强化学习”(RLHF)。这已经存在一段时间了,但现在人们正在做……抱歉,这里有一些术语……他们正在做一种叫做“可验证奖励强化学习”(RLVR)。这是他们正在做的一件大事,那就是,你能否尝试使用可以自动验证的东西,比如总和,比如数学,比如说,你能否用它来尝试……以这种方式训练模型?而且它已经取得了……顺便说一句,相当大的成功。你还记得Deepseek吗?那个小说……它出来了,对吧?人们对它的出色表现感到惊讶,以及它是如何……以如此低廉的成本训练出来的,在某种程度上……一开始就是一个有争议的说法,但就其而言,很大程度上是因为他们改进了那个过程,RHF过程……他们做得更好。所以,我认为一个有很大潜力的方向是“世界模型”,加里上次提到过。我对它们了解不多。它们仍然非常非常实验性。但这些世界模型的想法基本上是,我们能否给大型语言模型一个它自己的“矩阵”版本,你知道,就像电影里的那样,它自己的“迷你世界”版本。所以,例如,当我们问“从袋子里拿一个球”时,你还记得之前的例子吗?五个球,ABCDE,随机拿一个。而不是使用嵌入式并找出嵌入式在哪里,然后找出下一个词,模型将能够使用这个小型的“矩阵”来实际……创建一个有五个球的袋子,然后拿起正确的球,然后看看字母在哪里,然后给你一个更好的答案。你可以想象一个世界模型……它知道所有的物理定律,知道地球如何运转等等。所以,这是一个令人兴奋的……方向。我对它了解不多,无法告诉你它是否是我认为好或坏的东西,无论如何。显然,有非常非常聪明的人正在朝着这个方向前进。但这是另一个值得思考的有趣的事情。嗯,也许最后值得谈论的是……

对于我们谈到的所有机器学习模型、AI模型等等。我认为最终重要的是要记住,这些模型至少目前只是统计鹦鹉,它们只是在模仿现有的数据,这可能导致我们谈到的所有问题,比如统计鹦鹉。就像我们刚才描述的那样,它们会接受你提出的问题,将它们嵌入,放在一个空间里,然后找到周围的词语。但这种决定的依据只是你放入模型进行训练的所有历史数据,对吧?这就是我所说的统计鹦鹉,所有这些统计数据都被用来找出……嵌入式是什么,最接近的词是什么。它们只是在试图复制。

所以,这就是为什么它在处理新颖性方面有问题,因为新颖性不在数据库里。

因为新颖性不在数据库里。但它可能还有更大的问题,那就是,你知道,模型中的训练数据,根据定义,会包含一些偏见,它会有一些对世界的先入之见,它会有一些……你知道,有时它们对你有用,有时它们没用。我的意思是,举个例子,我建议你的任何听众都可以在……在ChatGPT上,或者任何其他模型上,让它为我生成一个典型的美国男孩的图片。它会出来一张图片,可能和你想象的一样,也可能不一样,但它对“典型”、“美国”意味着什么有一个假设。你知道,同样,在这种情况下,它可能无关紧要,但在某些情况下,它并非无关紧要。

所以,你的意思是模型可能有……政治偏见,道德偏见。

模型肯定有政治偏见。模型肯定有道德偏见。

它是如何……它是如何获得政治偏见的?它是如何获得道德偏见的?

有两种方式。第一种方式是通过我谈到的训练,对吧?它查看互联网上的所有文本,并且在互联网上的所有文本都有政治偏见的情况下,它会吸收它。但然后是第二阶段,我刚才简要提到的,RLHF,人类反馈强化学习。这是一个过程,人工智能公司会真正地查看整个对话,并告诉模型“这是一次好的对话,那是一次坏的对话”。所以,例如……嗯,嗯,嗯,比如说,你有一个大型语言模型,它开始变得非常粗鲁、威胁、反犹太主义和种族主义等等。人工智能公司会说:“哇,这是一次糟糕的对话。让我们试着调整参数,减少这种情况。”在这个过程中,它可以收集所有这些……你知道,关于世界的偏见。其中一些是故意的,但其中一些可能是无意的,对吧?并不是说……你知道,它们是故意的。所以,这当然是……这尤其糟糕。你知道,当我们说“代理AI”时,当我们给模型一双“手”时……如果我们现在开始允许模型在现实世界中做事情,你刚才谈到了“终结者”。你可以想象一个疯狂的情况,你有一个模型,它不是那么好,它会产生幻觉,它无法得出正确的东西,然后你突然允许它……比如说,起诉某人,比如说,作为一个律师事务所,我的意思是,这可能会……

发送一封糟糕的电子邮件。

发送一封糟糕的电子邮件。你可以想象更糟糕的情况,你把它接入武器库或任何东西。所以我总是喜欢说,我并不像担心人工智能那样担心人类智能,我更担心人类愚蠢。他们给了这些模型一个工具。所以我认为很多围绕让这些模型工作的基础设施……我刚才说的那个瓶颈,那个限制因素,就是准备好迎接这一切,也要考虑一下,好吧,如果我给了我的工具处理信用卡交易的能力,我会在它周围设置什么样的围栏?什么样的……保障措施?也许我只允许它达到一定的金额。也许,你知道,那种东西。

那么,我把最后的话留给你。所以,我们有,正如我所说,加里·马库斯。总结一下你对我们在这个世界上的看法,以及你对这个世界将是什么样子的希望有多大。

好问题。我有多希望?好吧,我告诉你一件事。我不知道这让我有多希望或不希望,但我认为我想让人们从我的观点中带走的一件事是,即使加里说的所有话都是对的,他的观点也是对的,而我实际上并不这么认为,他说的没有一件事让我觉得,“哦,我不同意这个。”我想让人们意识到,今天仍然可以获得很多价值。而且这种价值可以是真正的善。我的意思是,有很多东西……你谈到了美国的医疗保健系统,以及它有多么困难和……有时提交索赔和上诉等等有多么复杂。如果做得对,如果结构正确等等,人工智能确实可以为之做出很多贡献,对吧?所以我认为有很多善意和很多价值可以实现,很多真正……很多……好的事情可以完成。所以,我想我会鼓励人们也许担心一点……好吧,那不是真的。他们也应该担心未来,如果我们得到“终结者”等等,这是值得的,但也要花点时间问问,好吧,我现在有这个奇妙的玩具,你知道,我能用它做什么?它能为我做什么?我能用它做什么?希望这能给你带来一些……正如我所说,我会在节目笔记中放上我整理的这些小工具,这样人们就可以真正玩玩我们讨论过的概念,希望他们能真正看到……这些不是……这些不是神奇的技术。它们非常……它们只是……计算,统计学,但组合在一起就产生了这套真正奇妙的模型。

太棒了。非常感谢。

非常有趣。非常感谢,史蒂夫。

很高兴有你。

那真是一次采访。我的收获是,加里和盖塔教授之间有相当多的共同点,但也有相当多的分歧。所以,如果加里在这里,他会说,我认为LLM模型正在失去它们的功效,它们永远永远永远不会产生能够证明行业花费的数千亿美元的投资回报。我认为加里会这么说。我认为盖塔教授指出,他同意LLM不会实现通用人工智能,但最终他并不认为这很重要,因为LLM模型和代理AI聊天机器人等等已经足够好,可以生产出非常有效的 उत्पादों,而且你知道,最近有很多关于代理AI聊天机器人的公告,它们确实震撼了行业。你已经看到了保险经纪人受到影响,财富管理者受到影响。每个人都害怕这真的会奏效,而且行业为此投入的资金并没有停止。你知道,我认为我更倾向于盖塔教授的观点,即你将看到更多的产品。我们不知道的是,我认为这才是真正的问题,所有这些钱是否能带来与投资相符的回报?坦率地说,我们不会知道。我们不会在短期内知道。我认为我们今年不会知道。我们只会看到很多听起来非常令人兴奋的公告,但我们可能要到2027年、2028年才能知道所有这些投资是否会带来与之相符的回报。所以,在此之前,故事将保持不变。超大规模企业将继续花钱,人们将质疑这是否真的值得。本播客仅供信息参考,不构成投资建议。主持人及嘉宾可能持有讨论股票的头寸。表达的观点仅代表其个人观点,不构成推荐。在做出任何投资决定之前,请自行进行尽职调查并咨询持牌财务顾问。