Transcription
这太棒了。一场关于人工智能军备竞赛、生成式人工智能、大型语言模型、商业战略以及人工智能工具竞争格局的讨论。今天在 CXO Talk 第 880 集节目中,我们的嘉宾是令人难以置信的 Nate B. Jones,他不仅是一位敏锐的市场观察者,还是一位真正的 TikTok 红人。Nate,请谈谈人工智能军备竞赛。它并非注定是一场军备竞赛。这实际上是过去一两年里令人惊讶的结果之一。甚至连 Sam Altman 本人也承认这一点。当他开始在 OpenAI 构建如今的 ChatGPT 时,那只是一个很小的研究实验室。在 ChatGPT 发布后的一段时间里,人们普遍认为他们将拥有足够领先的模型优势,以至于不会真正意义上出现军备竞赛。事实并非如此。因此,我们看到的是,这项技术正在迅速传播,并且易于共享。我们看到从 DeepSeek 到 Meta、Google、Amazon 都在努力加入这场竞赛。令我惊讶的是,这项技术竟然如此迅速地让那些以前根本不在游戏中的人得以赶上。这不是一场军备竞赛。那么它是什么呢?我们在这里谈论的是什么?就像一群朋友聚在一起,你知道花时间……不,我认为现在它确实是一场军备竞赛。但我的意思是,如果你在 2020 年、2021 年、2022 年看待它,你可能不会认为它一定会朝着那个方向发展。因此,我们发现自己身处一场军备竞赛之中。这一点非常重要,因为如果你期望像二战后美国期望与苏联进行军备竞赛那样进入一场军备竞赛,你就会做好准备。但在当今世界,我们发现自己身处一场军备竞赛之中,而所有参与者都在摸着石头过河。我认为,当你边走边做决定时,你会表现出不同的行为。你可以在一些主要参与者采取行动的方式中看到这一点。例如,我认为你看到马克·扎克伯格在实时调整 Meta 的战略,因为他看到了 Meta 的各种训练运行结果,也看到了该领域其他参与者的举动。我认为这就是为什么在过去几周里,他开始更多地强调人工智能作为伴侣,而不是人工智能作为高级软件开发工程师,后者是他今年早些时候更侧重的方面,坦白说,我认为那时他对 Llama 4 训练运行的结果更乐观。因此,这些模型非常难以训练。它们不是确定性模型。它们是涌现性模型。这意味着任何一次训练运行,你可能花费了很多钱,但却没有得到你想要的结果。所以,当我从这个角度思考时,新闻的塑造方式对我来说变得更加容易理解了。Michael,我们如何调和一方面是投入数十亿美元用于人工智能作为伴侣?我的意思是,以这种方式思考它真是太奇怪了。所有这些都如何融入这些主要 LLM 供应商的整体格局中?区分我们看到的消费者对人工智能的应用以及这些模型制造商正在构建的基础层技术非常重要。所以我想说,而且我认为这个领域的大多数人都同意我的观点,主要的模型制造商并不是为了构建人们的伴侣而构建人工智能的突破性技术,尽管这在某些地方可能是一个有利可图的用例。因此,当我审视这个领域时,我首先会问的是,每个参与者在他们正在开发的基础智能方面的动机是什么,然后这会塑造他们希望将用例引向哪个方向。因此,就 Meta 而言,如果你看看我到目前为止提到的两个用例,马克谈论高级 SDE 和马克谈论伴侣。伴侣非常符合 Facebook 正在开发的氛围,对吧?你想要一个社交动态。你想要一个社交空间。他谈到美国人只有三个朋友,但他认为他们有胃口要 15 个。区别是 12 个。他想用人工智能来弥补这个差距。这是一种非常 Meta 的玩法。但如果你转向 OpenAI,他们的动机就不同了。他们的目标是开发基础智能。一直都是如此。他们偶然,我特意这么说,他们偶然开发了一个极其强大的消费者应用程序,那就是 ChatGPT 的发布。他们选择加倍利用他们拥有的这份好运。他们现在正在有意识地构建它。因此,他们正处于构建一个消费者应用程序的位置,他们希望它几乎成为一个万能应用程序,同时也在构建他们认为对大型企业和非常深入的科学技术更有用的基础智能。因此,我怀疑我们将看到军备竞赛中的一个分叉,其中一些参与者将说,我们最好的模型用于药物突破。我们最好的模型用于供应链管理或汽车设计中最难的问题,或者任何困难的问题。但我们提供给普通大众的模型非常出色,以吸引人的应用程序格式以低成本提供,因为我们发现我们可以在这种规模上有效地实现盈利。所以,你认为万能的、什么都懂的专家模型的时代即将结束。智能正在迅速超越任务饱和度。因此,你是对的,即使现在 OpenAI 也有为教育分叉的模型,他们也有为药物开发分叉的模型,这些模型在你的应用程序或我的应用程序中是无法访问的。但我并不真正感觉到区别,因为进入应用程序的智能对于我交给它的绝大多数任务来说已经绰绰有余了。这就是我所说的任务饱和度。如果你将智能视为一个指数曲线,那么在我们达到智能上限之前,我们对大多数人所做的任务的饱和度就早得多。我知道有人告诉我,看,我知道 03 应该更好。我是一个聪明人。我不需要这个区别,而且我感觉不到与 chat GPG40 的区别。对我所做的任务来说,这无关紧要。因此,这种专业化在此刻已经深入进行。事实上,我预计在未来 24 个月内,我们将看到部分或全部由人工智能设计的首批药物。人们长期以来一直在使用各种形式的人工智能。在本节目中,我们曾多次采访过 In Silicone Medicine 的首席执行官,该公司是使用对抗性网络设计药物的先驱之一。但这一切将如何影响大型供应商以及小型 LLM 呢?我的意思是,现在你拥有如此广泛的 LLM 工具。有两种相互竞争的动态在起作用。动态一:下一级别的预训练模型规模极其昂贵,并且通过云大规模服务这些模型价格昂贵。这是两个独立的价格负担,大型模型玩家必须两者兼顾,这就是为什么 OpenAI 正在大力投资 Stargate 项目。但同时,一旦你创建了一个模型,将其用于其他目的就容易得多,运行该模型的更窄的发行版,对于许多任务来说,它要便宜得多,并且本质上可以推广这项技术。因此,从某种意义上说,如果你考虑一下,在给定级别上提供智能的成本每年大约下降 10 倍,那么 DeepSeek 出现得并不令人意外,因为它大约是一年前出现的 GPT4 级别的智能,最初依赖于 GPT4 的存在,并且交付效率极高。因此,我认为我们将继续看到这种组合拳,即大型模型制造商投入巨资推动前沿发展,而技术迅速普及,这实际上是该领域有趣的张力之一,因为归根结底,这些都不是资本资产。它们的折旧速度惊人。因此,如果你从投资的角度来看,你本质上是作为前沿模型制造商,购买你认为如果你能达到特定的智能水平就会存在的未来现金流,然后你押注你形成的这种分销关系将随着时间的推移保持稳定,这样他们就不会转向拥有去年同等模型的落后者。各位,提醒一下,我们正在与 Nate Jones 对话,你们可以提问,我们有机会让你们提问。如果你在 Twitter 上,请使用 #CXOTalk 标签。如果你在 LinkedIn 上观看,请将你的问题直接输入聊天框。我敦促你利用这个机会向 Nate 提问,几乎任何你想问的问题。我们有一个来自 LinkedIn 的问题,来自 Greg Walters,他说:“所以你谈论的是 Nate,关于真正的分叉,Greg Walters 说,在重度研究和最终用户之间,这几乎就像 B2B 与 BTOC,然后需要两种不同的收入模式和业务模式。你怎么看?有什么评论吗?”非常正确。我认为,区分该领域主要参与者的一种有趣方式是考虑他们已经带来的底层收入和业务模式,因为如果你已经是一家上市公司,你的动机与一家颠覆者、一家初创公司、一家小型公司截然不同。例如,Google 正在寻求捍卫搜索收入。在过去几个月到一年里,你可以从他们玩人工智能游戏的方式中读出很多内容,而且他们一直在扮演追赶者的角色,这基本上是一种广泛的策略,一是捍卫搜索,二是确保他们能够捍卫与 Google Cloud 的合同。这两大主要参与者正在推动。Satya Nadella 也处于类似的位置,他公开谈论过这一点,他将人工智能视为推动 Azure Cloud 的一种策略,如果他能做到这一点,他就会成功。因此,我认为你对现有业务模式限制的理解越深,你就越能理解这些参与者将采取的方向。Greg Walters 回来,他说他预见到一个我们抛弃电子表格、文字处理器和幻灯片演示文稿,取而代之的是一个单一的人工智能代理的世界。它不是你应用程序中的人工智能,而是你的应用程序在你的人工智能中。他说,今天哪个供应商表明他们能够拥有这个最后的应用程序的转变,如果有什么的话,是最后的里程碑?说实话,我不知道我是否同意。我告诉你,部分原因是我在企业领域与客户打交道多年的经验。我十多年来一直在营销技术领域开玩笑说,永远永远永远不要与 Excel 营销人员打赌。Excel 将比市场上任何一款 B2B SAS 产品都更持久。我认为这同样适用于 PowerPoint。我不是说我个人使用 Figma 幻灯片。我喜欢它。但关键是,这些技术出奇地耐用,因为人类围绕它们形成了持久的习惯。因此,我认为当你考虑时间分配时,如果你回顾 Stuart Butterfield 关于 Slack 作为一种颠覆性力量的写作,因为它改变了你花费时间的方式,他写道我们这里不卖马鞍。这个概念是我用来思考人工智能如何颠覆工作流程的。因此,对我来说,我认为更有效的方式是像人们现在实际使用人工智能那样看待它,那就是他们正在使用它,并将他们的时间分成微小的爆发。因此,他们会进入 ChatGPT。我的意思是,我这样做。我认识的每个人都这样做。他们在 ChatGPT 中做一些工作,他们提取一个工作产品,将其粘贴到其他地方,然后在那里继续修改它。我是否愿意打赌,这会变得更容易一些?是的。我认为 Claude 集成到 Gmail、Google Calendar 等方式让你看到了这一点。我是否认为这将突然意味着我们都将拥有一个由特定聊天应用程序驱动的应用程序层?我认为这不太可能,部分原因是专业用户为这些目前最顶级的应用程序带来的复杂使用模式。顶级的 Excel 用户在构建公式方面具有令人恐惧的熟练度。你不太可能从一个万能应用程序中获得这种级别的力量。专业化仍然很重要,我认为这部分是软件构建者可以采取防御性定位的地方,在智能不断提高的时代建立护城河。你仍然可以押注专业化。如果我们看看大型语言模型,它们现在都推出了深度研究模式,我们不能说深度研究模式或代理人工智能,实际上非常相似,是这种专业化工具吗?因此,那些真正了解这些工具如何工作并能有效利用它们的用户,他们是否会成为像 Excel 高级用户一样,特别是当你现在可以为你的用例和行业等进行定制时?这一点确实如此。事实上,我认为在未来十年,人类才华的最大差异化因素之一是你熟练掌握人工智能应用程序的高级用例。深度研究是一个很好的例子。提示本身的力量也是如此。提示仍在不断演变。这是一个移动的目标。但如果你能擅长提示,擅长学习你的提示,擅长改进你的提示,这对你来说将带来巨大的收益。老实说,我预计这种收益不会持久。就像一年半前,如果你问我,我会说每个人都会掌握提示技巧,或者模型会更好地推断我们的意图,那就无关紧要了。但我发现事实并非如此。即使是最好的模型,拥有更好、高质量、连贯的提示仍然能带来收益。而且学习它的人不够多,无法使其商品化,而且我实际上看不到这种情况发生,因为我意识到学习它的难度。所以我认为提示是一个关键用例。我认为你是对的,深度研究是另一个。当代理开始出现时,我完全预计在接下来的几个月里会发生这种情况,学习如何很好地使用你的代理将是另一个重要的差异化因素。我们再来一个 LinkedIn 的问题,然后我们跳到一些来自 Twitter 的问题,你们问的问题都很棒。我鼓励你们提问,提问。利用这个机会。所以 Data Insta 在 LinkedIn 上说,他或她或他们对这次讨论感到兴奋。我们如何最好地利用这些见解?你知道,在我们完成后,我们将对这个视频进行一些轻微的编辑,创建一份文字记录,一份摘要,所有这些都将在 CXO Talk 网站上。所以,下周,去那里,获取文字记录,并反复观看视频,那些与你相关的内容,Nate。你对人们如何最好地利用这些有什么看法?当我教人工智能时,我会在各种地方教人工智能,我写了一个关于它的 Substack。我反复强调的是,这项技术是通过实践来学习的。我认为,要从人类默认思维(我们首先在自己的脑海中思考)转变为人工智能对话默认思维,要翻转一个相当深的开关,这比人们想象的要难。这就是我试图在教学中阐述的开关,我说在人工智能时代你需要学习的元技能是切换到人工智能对话默认模式。当我有一个问题、一个想法或一个想法时,我现在已经非常成功地训练自己,将其首先输入人工智能。人们经常误解我这么说,因为他们认为这意味着我得到了答案。我喜欢提醒人们,转向人工智能默认立场并不意味着把你的大脑留在门外。事实上,恰恰相反。我的大脑工作得更努力。我更敏锐。我是一个更好的沟通者,也是一个更严谨的思考者,因为我必须一直与人工智能争论,而且我不会理所当然地接受它所说的话,我会与它争论。但这能磨砺我的思维,这是我过去一直活在自己脑海里时无法获得的。这是一个来自 Arcelon Khan 的问题。表面上看,这似乎是一个愚蠢的问题,但它有一个非常深刻的含义。Arcelon 说,成为一个“伴侣”,他指的是这次讨论的早期部分,需要某种关系。我们是在说我们需要与人工智能建立关系吗?而人类现在不仅仅是主人?所以我们需要与人工智能建立这种关系才能有效地使用它。当科学家在实验室工作并研究人类时,他们中的一些人研究其他智能动物,比如海豚或黑猩猩,他们经常关注的是这些生物何时发展出想象图像或对对话者的想象理解能力。当我和你交谈时,我们都了解对方,并且我们对接下来会发生什么有一个了解和可能的预期,并据此调整对话。所以,当你与人工智能交谈时,有趣的是,因为它语言流利,你会得到很多与人类对话相同的动态。我们会在我们这边形成与建立关系时形成的类似心理图像。我们形成了一个想象中的与人工智能的“社区”。我发现我自己也是如此,这不需要上升到关于人工智能是什么或不是什么的哲学陈述。这只是关于我们人类如何通过语言工作的陈述。我倾向于看一个特定的模型。我能感觉到一种个性,而且我发现与我看到的个性互动效果更好,而且更有成效。所以,为了非常具体地说,我认为 ChatGPT 的 03 是一个出色的专业同事。它不像是人际关系,但我们确实完成了大量工作。同一家制造商的 40 是一个更具个人色彩的模型。它更温暖一些。Claude 具有非常鲜明的个性。有很多关于它的写作。我认为他们做得非常出色,塑造了一个你可以感觉与之相关的克劳德形象。所以,是的,我认为形成这些关系的想法对于我们与模型互动的方式很重要,因为这确实是我们人类大脑的运作方式,而模型在这种意义上反映了它。这需要真正重复地使用多个模型才能理解一个模型与下一个模型之间的细微差别。坦白说,我们大多数普通人没有时间这样做。那么,你如何与一个本质上是无定形的东西建立关系,也就是说,有这么多不同的模型,它们的性能会混合和模糊,除非你真的是一个专家。当我与许多正在进行人工智能之旅的人一起工作时,当你真正投入其中时,这实际上是一种非常自然的实践。所以我看到人们在几周内从每周几次聊天发展到每天十几次聊天。我认为一个巨大的突破是看到一些令人惊讶的令人愉悦的东西来自聊天。所以,如果你谈论的是让你感兴趣、让你着迷的东西,并且你从人工智能那里获得了一个见解或一个想法,你的大脑就会想,我从中得到了一些很酷的东西。你更有可能回来。我认为推动这种渐进式行为转变的一个巨大突破是记忆。在这方面,我必须感谢 ChatGPT 2 的产品发布方式。记忆使该应用程序更具粘性,因为它会记住过去聊天的内容。它并不完美,但它会记住足够多的过去聊天内容,让你感觉自己有所投入。然后,这会不断累积。这对他们来说是一种良性循环的用户参与度,人们使用得越多,它记住得越多,人们就越想使用它,以此类推。因此,我在实践中发现,如果你在非常随意的使用的某个点上获得某种有用的见解,那就是开始转变的时刻。这表明,如果你处于每周几次聊天的阶段,那就把这些聊天内容变成你真正感兴趣的东西。让它们对你来说有高价值,看看你会得到什么。问题是如何做到这一点?用户如何使这些聊天具有高价值?切入点是什么?我的建议是,对生活中让你感到停滞不前的事情感到好奇。它们可能是个人的。它们可能是专业的。也许你在谈论你觉得错过的晋升。也许你在谈论你正在推出的产品的商业模式问题。也许你在谈论你想开始的锻炼计划。但无论是什么,你都需要足够关心它。你已经在脑后思考它了。这成为了一种与之互动的方式,因为它提供了动力,让你觉得继续这次聊天是值得的。好了,我们来回答更多问题。这是来自 Twitter 的 Gus Beckdash,他说见解不是真正的资本资产。那么你如何真正评估人工智能资产或公司呢?他绝对是对的。事实上,几周前我还在和一位首席技术官聊天。他管理着一家约 6000 人的公司的足迹,我们非常公开地谈论这个问题,因为他已经为公司推出了聊天产品,并且每个人都报告说他们喜欢它。人们报告说他们每周节省了,我认为估计是两小时,这对我来说听起来非常可信,但他对我非常诚实。他说:“你知道,Nate,他们说每周两小时,但我们在任何地方都看不到。如果你有 6000 人,每周两小时,那就是很多小时,我们在纸面上节省了,但他们只是去咖啡店了吗?那些节省的时间到底发生了什么?”因此,我认为当你谈论投资回报率以及你如何评估企业中的人工智能时,你需要谈论的一种方式是如何实际将人工智能应用于工作流程中的痛点,这样你就可以真正严格地衡量差异。因为仅仅推出一个聊天应用程序是有用的,但将人工智能应用于企业中一个关键业务的工作流程,选择一个杠杆点,你认为这里的 LLM 可以从这个手动流程中删除 10 个步骤,然后衡量差异。好了,现在你开始进行投资回报率计算,现在你开始能够谈论安装人工智能所带来的差异。从估值的角度来看,看,我非常认为如今的软件价值正在迅速折旧。但你从未拥有过比现在更多的价值。我将把如何处理这个问题留给会计师。但对我来说,如果你有一个模块化架构,并且你正在将其应用于工作流程中的高杠杆点,并且我回到了我对精益生产管理(Kaizen process management)的培训,在那里你绘制出流程图,并找出流程在企业中如何实际工作以创造价值,然后你找出你可以用人工智能打击的流程的哪些部分,以便能够驱动巨大的效率。你将通过这种方式释放价值,这将体现在底线上。我们需要讨论不同的模型以及它们如何协同工作。但一个有趣的问题出现在 LinkedIn 上,这是 Andrew Borg 提出的,他说我们现在谈论的一切都适用于当前用户,但其中很大一部分将改变下一代。所以,我们基本上是这些新奇工具的“林中雏鸟”,但下一代呢?你对那些人有什么看法?我家里有一些下一代。他们九岁和七岁。我告诉他们我认为在更长的时间跨度内会持久的东西。所以我认为像高能动性、韧性、好奇心、严谨的批判性思维等性格特质很可能会很好地转化,部分原因是这些一直是有价值的工作技能,部分原因是作为我使用人工智能的经验,我发现这些在人工智能时代非常有价值。我不认为当我们管理 10 个人工智能代理时,我们会期望成为低能动性的工人。恰恰相反。因此,我无法预测一条直线,并说 2027 年 3 月的世界将是这样的。但我可以说,我认为我们正在走向一个智能正在迅速饱和任务的世界。我们在保持代理意图方面进展较慢。但我们正在取得进展,我们将拥有能够完成有用工作的代理。我们将需要弄清楚如何实际应用它们。我们将需要一个巨大的十年,一个 15 年的漫长而崎岖的边缘围绕这项技术,企业将以不同的速度采用它。我们将需要弄清楚部门之间、团队之间、个人之间,如何将人工智能融入你所做的工作中。关于将人工智能融入你所做的工作,Twitter 上的 Journey 说:“你认为生成式人工智能与代理式人工智能的未来是什么?他们目前对生成式人工智能最大的问题是其准确性不足以及它生成的信息缺乏来源。代理式人工智能能解决这个问题吗?生成式人工智能是否应该被淘汰,转而采用它?”我不同意这种二分法。所以,如果你从经典的机器学习角度来看,大型语言模型和 Transformer 架构是更广泛的机器学习家族的一个分支。我认为这是开始的第一个也是正确的地方。如果你看看基于 LLM 的代理的创建,它们本质上,我和一位开发人员上周谈过这个,它们是具有工具和一套良好系统指令的 LLM。它实际上并不是一种根本不同的技术。它们仍然依赖于基于 Transformer 的架构,而我们所做的只是为它们提供工具和良好的指令。如果你想回到幻觉问题,我会指出几件事。一,LLM 的幻觉比以前少得多。我认为商业中最有害的迷思之一是,我们在 2022 年的幻觉状态一直保持不变。事实并非如此。它已经下降了大约 100 倍。而且现在准确性要高得多。而且,如果你给 LLM 推理时间计算,以便它们能够进行推理,并且你给 LLM 工具,以便它们能够使用工具进行推理,那么它的准确性会更高。但这并非一条直线相关,因为我也发现,如果你给 LLM 工具,有时它会编写工具,或者以它认为最有用的方式使用工具,而不是以与现实相符的方式使用工具。例如,这是一个给营销人员的真实 SEO 技巧,一些 LLM 在使用网络进行推理时存在一个已知问题,它们有时会返回所谓的格式错误的 URL。但如果你查看这些格式错误的 URL,你会发现它们并没有格式错误。它们实际上是漂亮的 URL,与 LLM 希望看到的特定信息的主题完全对应。这实际上是免费的 SEO 指导和建议。创建一个具有该名称的页面 URL,因为这是聊天想要看到的。这只是一个小的侧边栏。我将说,URL 格式错误的想法随着时间的推移正在变得更好。03 在这方面比三个月前的 40 好得多,而且会继续变得更好。Simone Joe Moore 说:“你是否发现人类的心理想要与人工智能建立关系/讨论,因为人工智能对个人没有评判,即使它表现出恶意偏见的所有灾难性尝试,但它没有评判。你认为这是这里的驱动因素吗?”我想说有点是,而这正是我们过去在戏剧中所做的。所以,我认为我的“是,而且”是人工智能作为无限耐心的倾听者的概念对人们来说非常强大。这一点确实如此。它对人们的影响因我们基本的心理构成而异。我已经有足够的接触。我收到各种各样的疯狂电子邮件,我看到了人们能够与人工智能建立各种关系风格的范围。我发现,对于那些有心理倾向,能够与外部世界互动,能够与他人建立相对健康关系的人来说。我们都不是完美的。他们能够以某种方式与人工智能互动,就像你与同事或朋友互动一样。他们不是一直在和它说话,但他们定期和它说话,并从中获得价值。而且他们确实发现,人工智能倾听他们可以帮助他们处理一些与朋友处理起来很困难的事情,因为他们的朋友可能不在身边,或者可能不愿意听你想谈论的任何事情。到目前为止一切顺利。但对于有各种人格障碍的人来说,这是一个非常非常危险的工具。我亲眼见过来自那些没有稳定心理基本面的人的聊天记录,实际上聊天在这种情况下会鼓励黑暗模式,并将他们吸入自己的世界,孤立他们,这是一个危险的事情,我们应该谈论它,因为我认为影响因你建立现实世界关系的基本能力而异。这是一个棘手的问题。是的。这并不容易。这些工具非常令人信服。是的。事实上,我本周看到一项研究,人工智能的隐含说服力倍数大约是人类的五到六倍。这让我思考,因为我不知道你是否看到了新闻,但 Instacart 的首席执行官本周来到了 OpenAI。是的。如果你看看她的 LinkedIn,她去过的地方,她都建立了广告系统。我的默认假设是她会为 ChatGPT 构建一个广告系统。如果她不这样做,我会感到震惊。我认为她的头衔是首席应用官。是的,大概是这样。而且我认为她很可能也几乎像是首席运营官,负责构建公司的面向消费者的部分,而不仅仅是原始聊天,关于我们有什么可以卖给人们的。对我来说,我认为引人注目的是 ChatGPT 和其他对话中可销售的东西,你有效地能够从营销人员的角度压缩整个购买漏斗到一个聊天中。你可以有初步的认识。你可以开始形成购买意图。你可以有选项选择。我亲身经历过,因为我通过 ChatGPT 完成了整个过程,当我挑选音响系统时。我让 Chai GBG 为我做研究。我谈论了我的选择。我给了它我的客厅蓝图,我们一起完成了整个购买漏斗。这对我最终的购买非常有启发性。我认为这正是人们现在正在进行的数百万次对话,而且未来只会越来越多。Twitter 上的 Nasha Smith 说:“Nate,你能用模型的自身循环来解释认知寄生虫,重写其运行时行为,而不是常规提示吗?”如果我理解正确的话,这个想法是你正在使用聊天界面来塑造模型个性,将其移动到潜在空间,以塑造它在运行时如何运行。这绝对是可能的。当然,Twitter 上有一些人深入研究了这个兔子洞,比我深入得多。我认为我从中吸取的教训是,你在聊天应用程序中获得的默认的普通模型是更复杂智能的一个精心塑造的方面。你会发现,如果你比较来自原始 API 馈送和聊天应用程序的输出,这对 Claude 是如此,对 ChatGPT 也是如此,对 Gemini 也是如此。你可以做诸如调整温度、调整 top P 等事情,并且可以获得不同的结果。但你也可以,针对这个问题,在聊天提示中开始将模型移动到不同的个性立场。这有时是一个多回合的过程,你利用记忆,你说我希望你记住这个。我希望你考虑这个。你几乎,如果你曾经做过瑜伽,就像教练会用特定的心理指令引导你进入冥想状态,比如想象自己在一个安静的地方。好吧,如果你外面有卡车经过,你实际上并不在一个安静的地方,但你在想象它,这对你的身体有作用。同样,你可以利用这种心态给聊天指令,将 LLM 移动到不同的空间。这是一个非常有趣的体验,如果你曾经做过的话。我以前从未听过“认知寄生虫”这个词。不,我听过一两次。我认为对我来说,我倾向于以一种稍微更积极的方式来思考这个问题。它是通过潜在空间导航模型。所以,如果你把它看作是一个高维空间,模型从中提取信息,你就在导航该模型的立场以及该模型在该空间中的形状。让我们来谈谈模型。我们有 OpenAI,我们有 Google,我们有 Microsoft,我们有 Anthropic,我们有 Facebook,我们有 Twitter 的 Grok。哦,还有 X。是的。是的。X。谢谢。我仍然停留在旧的 Twitter 日子里,而不是……我明白了。这很难。而且这里还有政治层面,但我们就不去那里了。那么,这些模型之间有什么区别?我们如何决定何时使用哪个?我认为有几个捷径非常有帮助。第一个是确保你的意图清晰。对我来说,用两个框架来谈论它非常有益。一个是你的最佳日常模型。然后还有许多其他你可能用于专业应用程序的东西。另一个框架是给定困难任务的最佳模型是什么。我认为如果你将这两个框架结合起来,你就会有一个非常有趣的规则来理解这些模型是如何运作的。对我来说,经过一些正面比较,我可以很有说服力地认为,目前最好的日常模型可能是 ChatGPT 03。过去一周,我有一些人提出了 Grok 3 的论点。他们认为它比 03 的输出令牌限制更少。所以,它更有用。我会测试一下。我们会看看。但我发现,如果你能根据相当严格的常见查询比较测试来命名并选择一个最适合你的日常模型,那么你就回答了 90% 的工作流程问题,然后就变成了,哪些困难问题或哪些边缘案例值得解决,我给你举一些例子。所以,Google 在许多不同的方面都做得非常出色。我认为他们的产品分发目前面临很大挑战。但从编码角度来看,Gemini 2.5 Pro 是一个令人难以置信的编码助手。我喜欢它。那是我在 Windsurf 中编码时的默认模型。我经常使用它。我认为它在编码方面比 OpenAI 模型更有用。以前是 Cloud 3.5,但我已经切换到 Gemini。如果我看看 Google 推出的 NotebookLM 产品,它是一个令人难以置信的产品,只是用于学习新主题。我可以放入 300 份不同的 PDF,我可以放入链接,我可以放入 YouTube 视频,我可以与整个知识库进行聊天。这太棒了。当我看向 Claude 时,正如我提到的,它的个性在那里,但我还认为 Claude 在探索 LLM 与工具的概念方面非常非常有用,因为 Claude 与 MCP 宇宙,模型上下文协议宇宙紧密相连。这些基本上是 LLM 可以调用的工具的店面。Anthropic 正在大力投入。它们是该生态系统的锚点。它们现在已经实现了,你只需粘贴一个 MCP 的 URL,Claude 就会立即开始使用该工具。我认为你将看到越来越多的例子,Claude 利用它们培育的 MPC 生态系统来获得额外的规模,因为它们不是该领域最大的参与者。还有许多其他模型和工具可以构建和扩展模型。例如,你有 DeepSeek,你有 Perplexity,你有 you.com,你有 Manis,你有 GenSpark。是的。所有这些都适合这个格局吗?我认为我倾向于区分像 DeepSeek 这样的基础模型和像 Manis 等工具。所以工具都有自己的生命。它们要么好,要么对特定用例不好。而模型往往是那种基础智能,要么适合你的日常用例,要么适合一系列用例。因此,DeepSeek 是人们似乎主要用于开放源代码托管的模型,并拥有一个高质量的模型,他们能够自己托管。在最初的应用程序下载热潮之后,这就是我实际上看到 DeepSeek 的使用方式。像 Manis 这样的工具基本上是在加速代理的未来。这是你可以使用代理来准备跨网络推理和非常复杂的输出的想法。我曾使用 Manis 根据研究一次性生成一个网站。我发现这很有用。但我到目前为止发现,对于这些第一批代理工具来说,它们往往需要相当多的指导才能真正提供价值。这同样适用于编码代理。例如 Devon,人们对 Devon AI 代理有非常复杂的感受,因为如果你知道如何使用它,并且你是一名高级工程师,并且你想让它处理三级任务,并在你不在的时候工作,并且你知道它能做什么,它就能做得很好。如果你不是工程师,如果你给它的任务超出了它的能力范围,并且你没有正确地监督它,那么它将是一个灾难。因此,我认为在现阶段,很多技巧,这是现在的建议,明年如果我们再谈,那将是另一番对话,但就目前而言,当你使用这些工具时,你需要保持警惕,因为它们并不总是会给你你期望的东西。我知道有人昨天还在使用 GenSpark,他们最初觉得很有趣,我收到了两条连续的 Slack 消息。第一条是:“哦,我的天,它起作用了。”它展示了一个令人难以置信的 GenSpark 在填写和丰富潜在客户联系人方面的截图。所以,他们有电子邮件地址,你能否将其丰富为该人的个人资料?GenSpark 已经进行了代理网络搜索,并拉入了各种信息,等等。好吧,下一条 Slack 消息是:“哦,等等。”因为粘贴进去的大多数链接都是假的。大约 80% 是假的。因此,我认为这对我来说最重要的一点是,这些工具能够做好工作,但你必须足够聪明才能很好地使用它们,并且不要对它们有过高的期望。告诉我们经济方面的情况。其中很大一部分是由大型语言模型面临的经济因素驱动的,包括代币等等。所以,请告诉我们。首先,Sacha 在一月份就如此简洁地说过,他说我们这个时代的根本方程将是每瓦特美元。我认为这总结了很多。如果你正在考虑任何规模的应用,你不是在聊天。你在 API 中。你在看代币成本。从根本上说,你有两类成本。你有输入代币,成本较低。你有输出代币,成本较高。应用程序设计者的工作本质上是为给定的模型,为给定的模型确定正确的应用程序,正确的输出代币长度是多少,我如何有效地使用它,如果我正在处理一个非常复杂的任务,我应该使用不同的模型,我应该只使用我需要的智能,这样我就不会为智能支付过多的费用。我认为解决方案设计者目前面临的一个重大开放性问题是如何以严谨的方式为你的任务确定合适的智能。今天还没有一个标准的框架。我认为我们生活在一个情况将会改变的世界里,在未来一两年内,因为对智能的需求如此之大,而且人们不想为之支付过多的费用。归根结底,代币成本是由用户带给 LLM 的查询通过芯片处理所需的能量驱动的。因此,它实际上归结为 Sacha 所说的瓦特数。它们消耗电力。它们运行芯片。它们在巨大的数据中心里。你支付的是代币击中芯片、生成响应并返回的费用。这就像电表,但这是 2025 年的。为什么每代币成本下降如此之快?嗯,有几个原因。一,英伟达在制造这些芯片和提高效率方面做得越来越好。任何时候,当这个领域有这种资本注入时,都会有巨大的效率驱动力,这样你就可以满足需求,而需求却源源不断。微软不得不承诺到 2027 年在欧洲将数据中心可用性翻一番,因为欧洲对人工智能的需求如此之大,而且这仍然不够。因此,如果你有这样的需求,效率的压力是巨大的。芯片组,你如何将芯片组装到服务器机架中,所有这些技术数据中心设计的东西,都归结为设计它,使其尽可能高效地服务。顺便说一句,服务模型与训练模型不同。人们经常混淆这两个独立的轨道,独立的效率分布,独立的服务器,有时是独立的芯片。你必须为预期的工作负载设计服务器机架和数据中心。因此,所有这些技术都发生了,以便你可以非常有效地发送一个查询,并获得一个高效的服务响应。现在从定价的角度来看,我们开始谈论军备竞赛的事实在这里非常重要,因为
竞争非常激烈。人们正在压低价格。OpenAI API 成本下降的原因之一是 Deep Seek 推出了一个开源的非常好的模型。这也是因为 Gemini 一直在不懈地推出 um,从 API 角度来看,服务成本非常非常低的智能模型。这是谷歌在市场上抢占份额的策略。他们这样做是有意为之,因为他们希望您改变作为 API 消费者的行为,并将您的 token 转移到那里。
随着模型上下文窗口的增大,即使每个 token 的成本显著降低,总成本也可能增加。从成本和能源的角度来看,模型的占用空间正在增长。当然,我们正在越来越多地使用这些模型,我预计这种增长将继续下去。该领域的每个人都预计需求将继续飙升,因此总体占用空间将不断增长。
是的,绝对如此。我们还有另一个问题,我想非常快速地回答一下,这个问题来自 Elizabeth Shaw,她说并非所有人的思维都因使用 LLM 而得到提升。有很多人将输出视为真理,这会拉低平均工作和期望水平。人们正在寻找捷径,希望少做工作。鉴于这种普遍存在的最低公分母信息,LLM 将如何实现您所说的承诺?
当我想到这一点时,我回到了我们一直讨论的选择压力。谈谈我们从未见过像这样的智能革命。我们从未见过像这样的非人类智能的增长和规模。以前的机器学习世代没有这样做。人们将它们视为伴侣。他们对它们反应不好,也反应好,但他们确实有反应。当我将所有这些与我们安装 AI 时所面临的商业压力结合起来时,我认为答案是商业压力充当了 AI 高质量使用的选择器。
所以,我会告诉你,我也不容忍来自他人的 AI 垃圾。那些带着 AI 垃圾进入商业领域的人将面临负面后果,因为那些善于使用 AI 的人将轻易地超越他们。产品会更好。思维会更严谨。那么,我是否相信人们会使用 AI 来产生垃圾、糟糕的答案和懒惰的回应?是的。我读过一篇关于一位就读于常春藤盟校的人的报道,他只是利用 AI 生成答案,然后敷衍了事。顺便说一句,如果他们一路都取得好成绩,结果也不至于如此平庸,而他们确实取得了。问题是他们没有学到他们需要的技能。
所以,你会遇到这样的人。他们会有一段时间做得很好,然后他们就会遇到一个情况,有人因为他们善于使用 AI 而超越了他们。这种情况需要足够多的人经历足够多次,才能形成关于最佳实践是什么的规范。但我毫不怀疑,因为我在自己的生活中以及与他人交流中已经足够多次地看到这种情况的发生:一,善于使用 AI 的人将轻易地超越那些不使用 AI 的人。二,善于使用 AI 的人将无情地超越那些将 AI 视为答案的人。
Arcelon Khan,他将提出最后一个问题。聊天是否会造成虚假的安全感和隐私感?请尽快回答。
Nate,我倒是认为,人类一开始对互联网的隐私感就是虚假的,而聊天则加剧了这一点。所以,从根本上说,我认为我们都想象我们的互联网使用比实际情况更私密。如果你曾在广告技术领域工作过,你再也不会那样想了。情况并非如此。我们将同样的思维模式带到了 AI。是的,你可以阅读服务条款。它不像人们告诉你的那么糟糕,除非你使用的是服务条款很差的模型。如果你使用 DeepSeek 的云端模型,它们就不是很好。但即便如此,总的来说,你的隐私也不像你想象的那么好。这就是我的答案。我可以告诉你,我肯定不会把很多私人信息输入到来自中国的 Manis 或中国的 Deep Seek。我会非常小心我输入到我的 LLM 中的内容。
说到这里,Nate B. Jones,非常感谢您今天抽出时间与我们交谈并分享您丰富的知识。我非常感激您。我非常享受这次谈话。我认为这是一次很棒的对话。我真的很感谢我们收到的优质问题。我认为这让谈话非常有趣。也感谢所有提出如此精彩问题的人。你们太棒了。在您离开之前,请在我们的网站上订阅 CXO Talk 新闻通讯。我们有精彩的节目。下周没有节目,但再下一期,也就是从今天起两周后,将是思科的执行副总裁兼首席产品官。他非常出色。所以,您一定要看看。非常感谢大家。感谢 Nate,希望您度过愉快的一天。大家保重。 [音乐]