Transcription
大家好!我非常激动能和 Sebastian Rocha 一起坐下来交流。他是《从零开始构建大型语言模型》和《从零开始构建大型推理模型》书籍及视频系列的作者。作为一名 LLM 研究工程师,他是一位在威斯康星大学麦迪逊分校任教的英国学者,并在人工智能开发平台 Lightning AI 担任超实用的工作。但我喜欢 Sebastian 的地方在于,他对人工智能的炒作毫无兴趣,并且能够深入探讨我们实际上能用这些工具做什么。我想问他人工智能对编码人员有什么影响。它真的会让它们过时吗?我们能从这里期望人工智能发展出哪些真正的能力?谁应该从头开始构建 LLM?让我们一起来了解一下。Sebastian,非常感谢您今天加入。对于不认识 Sebastian 的人来说,他是《从零开始构建 LLM》一书以及 YouTube 视频系列的作者。Sebastian 深入探讨了 LLM 的技术方面,以及我们如何实际创建它们,构建自己的模型,并超越炒作。有时我们听到关于人工智能的炒作,但在我们深入探讨,您知道,谁应该这样做,它看起来是什么样子之前。我想稍微放大一点。Sebastian,也许您可以告诉我一些,您认为到 2026 年 LLM 的状态。能力是如何发展的?您对这项技术的前景有何看法?是的。首先,感谢您邀请我来播客谈论 LLM。这确实是我最喜欢的话题之一。所以我想我们在这个节目中会玩得很开心。但是的,您在这里提出了一个非常宽泛的问题,比如到 2026 年 LLM 的状态。我想说,2025 年特别有趣,因为在 2025 年初,出现了深度学习,然后是这个新的范式,我们也许可以稍后详细讨论。但带有可验证奖励的强化学习,这是一种发展您的推理能力的技术,LLM 的推理也加上了引号。这是一个广泛的话题。就像 LLM 中的推理一样。我想说,我们不应该过于字面地理解它,就像人类推理一样,但它是一系列技术,可以使 LLM 在解决复杂任务方面做得更好。而 2025 年基本上被这种发展所谓的推理,有时称为思考模型,的想法所主导。所以从 OpenAI 到 Google,Claude,grok 或其他 LLM,它们现在都有不同变体的 LLM,比如常规的指令模型或常规变体,然后是思考变体。我们也许也可以稍后讨论这里的权衡。但所以我想这是 2025 年,我们将看到这种趋势在 2026 年继续下去,因为这些技术相对较新,而且人们目前,我想说,正处于这些技术的第一个迭代版本,好吧,这很有效。现在是时候精益求精,让它变得更好。添加一些技巧和窍门,并真正利用那种机制。所以我们会看到更多这样的情况。同时,我想说,推理扩展方面也取得了很大进展。所以推理基本上有两种范式,一种是训练,然后是使用,即推理。而且也有权衡,您可以花费大量资金进行训练,这非常昂贵。然后您得到一个模型,它可能会被使用几个月,然后被下一个模型取代。或者您甚至可以更新它,但是的,训练非常昂贵,而且它能让您获得更长的训练时间,比如在更多数据上进行扩展训练,基本上能获得更好的模型,更好的性能。但它确实很昂贵,所以您也可以花钱,额外的计算。我的意思是,额外的计算通常需要额外的金钱,因为在推理过程中需要更多的资源。也就是说,在训练之后,当您使用它时。所以您可以说,比如,假设我有一个用户,用户有一个查询。而不是仅仅给出第一个答案,您可能有三个答案,比如,如果这是一个数学问题,您可以使用具有不同设置的 LLM 运行三次,然后选择得分最高的一个或多数投票,但这将是三倍的成本。所以这是推理扩展的一种版本。还有其他技术,例如生成更长的输出。这有时也有助于思考问题,加上引号的思考,回到推理。所以,我想回答您的问题,在我们深入技术细节之前,到 2026 年,我想说它仍然处于这种轨迹上,我们仍然可以在训练方面取得很多进展,特别是,也许不是预训练方面,因为那不再是容易实现的成果了,而是更多地用于推理能力的强化学习。同时,更巧妙的推理扩展技术,更多这样的技术。所以是这两件事。而且我认为,这将继续下去。我现在看不到任何令人惊讶的事情。但在人工智能领域总是如此。如果有人有了新的架构,比当前的更好,那将是一个万亿美元的想法。基本上,如果我们有人有这样的东西,那将不是别人已经分享过的东西。所以,如果有什么东西能学会,那总是会令人惊讶。但我看不到任何迹象或任何东西,您知道,让我有信心会发生一些真正、真正不同的事情。基本上,它将更多地是精益求精。是的。我认为这确实很有趣,而且您的许多观点,Sebastian,都回到了这种推理或推断的概念,而且,您使用了带引号的“思考”一词。但之所以这对我来说如此有趣,是因为这听起来像是,在您的观点中,到 2026 年不会有巨大的飞跃。从我们现在看到的情况来看,我们将继续看到性能的提高。但之所以我认为推理部分如此有趣,是因为您在媒体上听到的大部分内容,以及来自硅谷和各行业 CEO 的大部分噪音,都是关于他们将如何使用人工智能或人工智能能做什么以及它有多么具有变革性的宏大陈述。我想知道在您看来,您是否可以分享更多关于一些更好的用例,也许,您知道,揭穿一些这项技术在 2026 年底仍然无法做到的事情。我特别想提一下,当您提到推理时,我称之为“草莓问题”。您可能听说过这个例子,但现在的问题是,如果您问许多领先的 LLM,一个草莓有多少个小时,它无法准确回答这个问题。它会说,哦,有一个,有两个小时,您知道,一个在“straw”里,一个在“berry”里,这显然是错误的。这暴露了一些推理的局限性。那么,到年底它会好用在哪里?到年底它仍然不好用在哪里?是的。我也应该,嗯,是的。这也是一个宽泛的问题,不是一个超级宽泛的问题,但我想在我的上一个回答中补充一点关于推理能力,它也是一个谱系。嗯,我的意思是,同一个 LLM,比如,具有不同的推理能力,可以有不同的能力。我的意思是,或者说,基本上您可以有一个 LLM,然后您可以使用它进入高强度推理模式,但它可能会在简单的任务上犯错,就像那个一样。这几乎被称为“过度思考”。但这也是,我的意思是,我不想说让我们像人类一样思考,但这也是人类会遇到的问题。比如,我知道很多事情,我,您知道,我是一名研究员,我能做很多事情,但不要在晚上 11 点问我,比如一个简单的数学问题,比如 21 乘以,我不知道,11 或者别的什么。我会给您一个错误的数字。也许是因为我,我不知道,我累了。我的大脑不再工作了,或者以其他方式。比如,我有时会犯一些非常愚蠢的错误,但这并不意味着我不能做其他事情。我认为对我来说也是如此,数草莓中的“r”和“s”,这几乎就像,您不是在评估它在您关心的实际用例中。我想说,在这种情况下,您不会使用这个词。而且,实际上,我认为这也是 2025 年和 2026 年进展的一个主要驱动力,那就是工具使用,LLM 可以使用工具。所以它们不必一切都凭记忆来完成,比如计算草莓中的小时数,而不是让 LLM 来做。我认为限制通常在于分词和,就像 LLM 的工作方式一样。但嗯,而不是让 LLM 根据其自身的内部计算告诉您,LLM 可以进行工具调用。它可以调用 Python 解释器,比如将此读取为字符串,然后仅使用字符串查找,在字符串中查找字母。然后它会给您准确的答案。所以我想我们还必须这样考虑,有不同的使用模式。而且您知道您的体验可能会有所不同,以及问题,您知道,嗯,我回到了 2025 年。有 OpenAI,Google 和其他一些公司参加了这些数学奥林匹克类型的比赛,他们取得了非常、非常、非常好的成绩。我认为,他们称之为金牌级表现,但至少对于 ChatGPT 来说,他们没有使用公开可用的模型。所以他们使用了一些定制版本。这通常也涉及推理扩展。所以,例如,对于 DeepMind 的版本二也是如此。他们有一篇论文,他们取得了相同的水平。他们增加了自我完善的步骤,LLM 会评估自己的输出并进行改进,并且对每个问题都有多次尝试。这极大地提高了性能。所以我想在这里说的也是,这有点取决于您如何使用它。这就像一个小型 LLM 在某个问题上可能非常高效且成本低廉。但它不会解决您所有的任务。您可以为更复杂的事情进行一些专业化,但它可能会在另一项任务上失败。而现在,我认为,嗯,当您访问 ChatGPT.com 时,例如,这是一个通用模型,它有一些模式,它会进行自动模式,比如思考、不思考、决定哪个是正确的,但它仍然试图成为,您知道,像万事通一样,在这种意义上,有些人用它来总结电子邮件。有些人,我的意思是,您知道,问医学问题,有些人用它来编码等等。嗯,它就是这样,它做得很好。它什么都能做一点,但它不是高度专业化的。而且我认为,目前埃隆·马斯克最主要的用例和最有前景的,或者说实用性最强的用例是编码,例如,它非常擅长编码。我们将看到它在其他方面的表现如何,但是的,我认为我在这里跑题了。有一个问题是,您知道,到 2026 年底,有哪些任务我会说编码肯定是一个。这可能是一个无聊的答案,但它是一个文本问题。它相当容易,而且对我来说相当容易。所以,是的。如果您在 IT 行业工作,Infotech Research Group 是您需要了解的名称,无论您的需求是什么。Infotech 都能满足您的需求。AI 战略已涵盖。灾难恢复已涵盖。供应商谈判已涵盖。Infotech 以最佳实践研究和一支随时待命的分析师团队为您提供支持,帮助您应对最严峻的挑战。请访问下方链接查看,别忘了点赞和订阅!我完全同意您的看法。从我所看到的一切来看,这似乎是容易实现的领域之一,似乎我们可以。我们可以,您知道,极大地提高开发人员的生产力。您在您的博客中有一句话,您说我仍然自己编写我关心的绝大多数代码,而没有,您知道,人工智能。这仍然是真的吗?以及,您认为这对开发人员和开发团队如何使用或不使用 LLM 来实现他们的目标有什么影响?在很大程度上仍然是真的。所以,但我也以不同的方式使用 LLM 进行编码。我上周写了一个,我喜欢 Python 编码。我是一名科学编码员。我可以使用 PyTorch,Python,还有其他一些语言,您知道,用于科学计算。但我不是一个真正的网页设计师,而且。嗯,我真的不会构建应用程序,您知道,比如,如果您问我如何构建一个 iPhone,Apple Mac OS 应用程序,我一无所知。我以前从未做过。但对我自己而言,我一直自动化我的事情,比如 15、20 年前。我通常会编写脚本来做一些帮助我的事情,比如重命名文件或这类事情。例如,对于我的博客文章,我有一个工作流程,我有一个包含所有图像的 PDF。然后我通常会导出它,我有一个脚本可以将其转换为不同的格式,自动裁剪它并转换为不同的文件格式,但这仍然有点繁琐。我必须去我的脚本位置,输入命令和所有内容。所以我想,好吧,我可以让我的生活更轻松,开发一个 Mac OS 应用程序,一个原生应用程序,我可以拖放文件进去,它会自动为我进行裁剪和转换。这是我使用的东西,而且我敢肯定,这花了我几个小时,也许 1 到 2 个小时,才能让它达到我想要的方式,但这是我否则无法做到的事情。这就像魔法一样。我有一个原生 Mac OS 应用程序可以为我做这件事,而且我可以为很多事情做,比如日常生活中的事情,在我电脑上。为此,我只会使用 LLM。我真的不在乎它怎么做。我的意思是,我可以看到,好吧,它有效。如果它无效,我可以给它更多的提示。我不知道 Swift UI 是如何工作的。我可能可以弄清楚,但我一直想学习它。但这是我没有时间学习的事情。我还有很多其他事情比仅仅学习如何做这件事更重要,因为这并不是我本质上的主要工作。但对于我关心的事情,对于我的,比如说,研究实验,我通常自己编写大部分代码,只是为了弄清楚,比如,只是为了思考问题和缺点,只是为了得到一个想法,比如,好吧,我对我想做什么有一个很好的想法,但我不经常,比如说,嗯,有些情况下我会犯错误。我通常会使用 LLM 来,只是获得第二意见,比如,嘿,看起来还好吗?比如,这就像过去我有一个同事或者什么。在 GitHub 上进行 PR,与其他人一起参与开源项目,这就像多了一层。在与他人分享之前,您会与 LLM 进行一次健全性检查,以在某种意义上使您的工作更好,以,您知道,就像一个校对员,第二双眼睛一样。它在这方面做得很好。有时它也会提出使事情更稳定的建议。有时,我也有多个实验。它们有,比如说,不同的设置。我在这里写了一些代码,然后在这里修复了它。我现在想将其应用于所有其他脚本,所有其他实验。然后我会使用 LLM 说,嘿,看看这个。我在这里做了什么。现在基本上将其复制到所有其他脚本中。我可以手动完成,但有时很繁琐,而这是我可以轻松审查的事情,因为我知道代码,而且我可以看到它做了哪些更改。然后,哦,看起来还可以,我只是,您知道,检查。好的,下一个,下一个,下一个。在这种意义上,我确实在我的编码工作流程中使用 LLM,但取决于上下文,嗯,我不想让它,在某种意义上为我做所有事情,因为那样我就不知道发生了什么了。我想以一种受控的方式来做,为了我关心的工作。基本上,这就是代码的意义所在。是的。这对我来说完全有道理。我之所以提出这一点,是因为,您知道,在某种程度上,确实存在一些危言耸听的说法,您可能已经听到过,您知道,最极端的说法基本上是,嗯,计算机科学或整个学科的开发都将过时,因为我们不再需要雇佣这些人了。每个人都可以编写代码,机器可以自己完成。而且,嗯,也有一个更平衡的版本,只是说开发人员的生产力将发生根本性变化,以至于,您知道,一个开发人员可以拥有与,您知道,一年前可能十个开发人员相同的吞吐量。您认为这在未来两年内是否有道理?还是这只是异想天开?我认为这在某种程度上有一点道理,因为,这是真的。比如,我自己也注意到了这一点,比如我刚才描述的用例,如果我告诉,比如说,将我的补丁应用到其他文件之类的,事情就会更快。所以在这方面,100% 也是,例如,对于我自己的网站,我添加了一个暗模式按钮,否则这需要我几周或几个月的时间。我的意思是,它在我待办事项列表上已经很多年了,我从来没有完成过,因为我知道这需要大量的工作。然后我基本上在一天内就完成了。所以在这方面,是的,这是真的。它确实让事情变得更快,但它仍然是工作。您知道,就像我描述的这个 Mac OS 应用程序一样,它仍然花了几个小时才完成。而且这是一个非常基础的应用程序。所以我想说的是,它并没有让人们开发代码或设计应用程序或构建应用程序过时,因为这仍然是工作。您只能说,我的意思是,也许有一天,但我甚至不认为这是真的,您可以说,“好吧,构建 x,y,z”,它会构建一个版本。但通常第一个版本不是最终版本。所以有迭代。您必须测试它,您必须使用它,您必须调整它。而这仍然是工作。我认为会改变的是,我希望通过 LLM 应用程序,比如那些,或者网站,它们会比以前更好。我希望人们使用 LLM 来改进他们否则会构建的东西,而不是仅仅产生更多低质量的工作。您知道,比如,我希望未来是这样,但一切仍然是工作。我还注意到,对我来说,我的意思是,我自己的实验,不仅仅是代码,还有运行实验,进行比较,思考需要比较的其他事情。而这一切仍然是工作。我认为情况也是如此,比如互联网上有些人说,软件基本上是免费的了,或者,您知道,免费的,因为,然后,可以做到。比如,开源项目不再有价值。而且我认为并非如此,因为,嗯,我认为我总是会选择一个经过多年开发并经过测试的东西,而不是 LLM 提供的一次性解决方案,因为,嗯,人们花费,我的意思是,我认为最好的方法是人们使用 LLM 来改进现有的东西并构建新东西,然后对其进行迭代,并使其比以前更好,比如添加更多测试,使其更健壮,修补错误等等。即使有 LLM,完成所有这些事情仍然需要大量工作。您知道。而且我觉得,这对我来说完全有道理。而且,考虑到我们之前关于如果我们真的想将任何这些 LLM 推向极限的对话,这似乎更加合理,这可能不会通过通用的,只是 ChatGPT 标准模型来完成。而是要看,您知道,一些独特的用例模型。一旦您开始构建其中一些,您就需要一个真正了解自己在做什么的人来适当地设置它们。所以,我的意思是,首先,我想把这一点反馈给您,因为这是我从我们早些讨论中得到的一个体会,听起来就像仅仅依靠一个单一的 LLM 来在每个领域推动前沿将不如拥有更多针对特定任务的 LLM 有效。这公平吗?是的,这是一个很好的概括。而且它又回到了深度学习中的问题,比如,深度学习作为训练神经网络的领域,人工神经网络,因为 Yann 本质上,归根结底,是深度神经网络。而一个问题基本上是,如果您在一个东西上训练它,它就会忘记其他东西。就像,但这也是,再次,它的学习方式与人类不同,但对我们来说也是如此,对吧?我的意思是,如果我每天只解决数学问题,我会在数学方面变得非常出色。如果我几年不学数学,比如,做别的事情。您会忘记事情,您知道,就像,因为您获得了新信息。您没有,比如说,磨练您的技能,然后,有点像那样。LLM 也是如此。所以人们,当他们开发或预训练 LLM 时,他们非常小心什么会进入预训练混合物,以及以什么顺序。然后一旦您有了那个基础模型,您通常会对其进行微调。此外,您通常还有特定领域的微调。这就像一篇较早的论文。但我认为它叫做 Llama,上面有一张漂亮的图表,展示了它们是如何在这些不同阶段开发模型的。通常在最后阶段,是您真正关心的部分。我的意思是,如果您想开发,例如,一个编码 LLM,您必须始终将编码数据包含在预训练中。您必须将其一直带入。但最后您会有一个特定的阶段,您只是对其进行编码问题的微调,但然后它可能会在数学或西班牙语等方面变得更糟。这就是权衡。所以您仍然从一个通才 LLM 开始,但然后您会对其进行某种程度的专业化,从而牺牲了其他技能,使其在其他方面变得更糟。所以,是的,这基本上就是它的工作原理。是的。我可以理解这一点。而且它很好地论证了构建一些更专业的模型。所以,Sebastian,我很好奇,您知道,我们有一边是专有的通用模型,另一边是完全构建自己的 LLM。而在中间,您知道,请随意否定我的说法,我们有一些,您知道,自定义 GPT 或寻找自定义某些专有模型的方法。在您看来,什么时候定制专有模型比构建自己的模型更有意义?以及,您知道,那些类型的人以及哪些用例在开始谈论构建自己的模型时最有意义?是的。有不同级别的。您可以,基本上从头开始,比如只是预训练,然后在一个模型上进行微调。这是最辛苦的工作。而且我想说,我不会建议任何人这样做,除非您是一家公司,嗯,其目标就是构建 LLM,或者您是一家拥有大量资金的大公司。而且您真的想做一些专业的事情。我记得,现在已经有几年了。我认为彭博社从头开始预训练了一个模型,只是专注于他们的新闻标题和撰写新闻文章之类的,在这种规模下,也许是有意义的,但它将花费数百万美元。所以,您知道,它并不便宜。所以我想,嗯,我想我们将看到,像金融、法律这样的领域。我认为如果您想开发,那是有意义的,因为,比如,律师不能仅仅因为数据隐私原因和其他原因而使用 ChatGPT。所以我想,比如,如果,比如,在这个领域有一些人聚集在一起,这个领域有很多钱。他们可以花费数百万,数千万,数亿美元来开发一个 LLM,比如一个用于法律事务的基础模型。但那是一个通用的法律模型,然后您仍然可能需要在公司内部的数据上对其进行微调。但所以,嗯,一种是完全从头开始。而且,正如我所说,我不建议这样做,因为它非常昂贵,除非,您知道,少数几个参与者可能想这样做。第二个用例是,或者第二个变体是,您将采用一个现有的预训练模型,然后对其进行专业化。而且我认为这更可行,因为有很多 LLM,而且尺寸各不相同,比如所有开源模型,或者例如,DeepMind 的模型。Llama 3 是一个非常流行的模型,或者甚至是 OpenAI 的 GPT-4 模型,一个开源模型。它是免费使用的,然后您可以对其进行微调,但这仍然不是一件容易的事,如果您想要一个真正好的模型,您仍然会花费数万到数十万美元,具体取决于模型的大小。所以可能会有所不同,但这也是,作为一个业余爱好者,我认为完全超出范围,除非您真的、真的对某事充满热情。但问题是,如果您真的想构建一个有竞争力的模型,嗯,您必须有一个庞大的用户、客户或用例,因为它会花费成本,而且它也会在某个时候过时。例如,如果我,我不知道 Llama 4 何时会发布,但比如说,我今天使用一个基于 Llama 3 的模型,那是 2025 年夏天的模型。我花费了大量金钱和时间来使其真正出色。我不知道您是否想要 Llama 4 或其他模型,它要好得多。然后我的模型就完全过时了,我必须重新开始。但,是的,它仍然对某些事情有意义。然后,所以采用一个基础模型,对其进行微调,第三个用例是采用一个现有的模型,基本上只是通过提示对其进行自定义。而且我认为很多人都是这样做的。他们使用 API,甚至不托管模型。然后通过提示,您可以将其引导到某个方向。它不会是完美的。但对于许多用例,您可以获得很多价值,因为您基本上不必自己训练 LLM。但同样,也有局限性。例如,如果您使用 API,您会有一些限制,您可以使用您的私有数据,或者您不应该,至少您不应该使用您的私有数据,因为数据是公开的。2026 年有一些新闻报道,其中一些知名人士这样做了,数据泄露了。所以,是的,我认为据我所知,我的意思是,我不想说任何错误的事情,但我认为 ChatGPT,例如,确实会使用您的数据来训练模型,它们不会真正,您知道,我不认为它们会特别挑出特定数据并公开它或之类的,但它会被隐含地用于训练。它们试图匿名化一切,但,嗯,如果您将其上传到 ChatGPT,您必须意识到它可能成为训练数据的一部分。所以您不能对所有事情都这样做。某些领域有法律规定,您不能,您知道,将患者数据等敏感数据,但然后,您可以使用本地 LLM,例如在本地运行。我的意思是,大多数在本地运行的 LLM,支持高达 160,000 个 token,这又相当于一本哈利波特。这是大量数据。而这些,我的意思是,有一些特殊的,比如 Nvidia 的 Neutron 3 有 100 万个 token。所以总有一些您可以在本地完成的事情,可以帮助您完成大部分工作。而且一开始,还有一点,我可以插话。有一篇论文,我觉得非常有趣,在 2026 年初。让我看看。我认为它叫做递归语言模型。所以论文的标题是。所以他们做的是,这是一种巧妙的技巧。他们有一个查询,他们想要答案,比如说,一个问题,比如,类似于一个 RAG 设置,您需要处理大量数据,一个完整的文档库,一个完整的文件夹,比如说,大量的数据库,无法放入上下文。所以他们所做的是,他们解析。所以他们不是让 LLM 做所有事情,而是将输入解析到字符串和 Python 的编码环境中,然后让 LLM 想出如何将其分解成子问题。所以,例如,如果您的任务是,比如说,总结,我不知道,比如说,总结这本巨大书的所有章节,或者之类的。您有 12 章。而不是将整本书输入到 LLM 中并尝试获得所有 12 章的摘要。您说什么?它决定做什么。哦,也许我可以一次处理一章,在 12 个不同的并行执行循环中处理它,然后我将从所有 12 章中提取每个摘要,并写一个总体摘要,或者之类的。所以,比如,只是分块。这并不是真正的科学,它只是使用一个编码环境,LLM 可以使用。
工具可以自己将一切分块,但这已经让你走了很长一段路。他们也用 ChatGPT 做到了这一点。它不必是本地的原子。你可以通过 API、通过工具卡来实现。所以,我想说在这个领域,有很多的变通方法,你在 LLM 本身存在局限性,但你通过在周围的 API 层或应用程序中进行巧妙的技巧来解决这些局限性。在你看来,这是否属于推理增强的范畴,还是其他什么?
我会说它是其他东西。它可以与推理相关。所以,如果这是一个需要良好推理能力的问题。但如果我必须将其归类,它更像是通用的推理扩展,例如,在这种意义上,它甚至不是推理,因为它使成本更高。你基本上只是将它分解成单独的、单独的子调用。但正如你所说,如果你的查询是推理查询,它可能与推理有关,但在这里我认为这也有点棘手。因为如果你有,比如说,你的任务是解决一个数学证明,比如一个非常复杂的问题,其中有大量的顺序步骤,你推导出所有问题,比如每个中间步骤。我认为这不适合该方法,因为该方法并行运行,比如子调用,彼此之间是独立的,而推理模型通常受益于这种所谓的思维链,它们通过一个问题来思考,这更像是顺序的。对。
我问的原因是,这可能有点超出了你的专业领域,Sebastian,但我还是会问,当我们想到其他人工智能或自动化应用时,这些应用开始超出了 Transformer 模型中的 LLM,但可能与你正在思考的基因 AI 或其中一些用例有所重叠,其中这些不同的 AI 系统协同工作以理解一项任务,了解任务的结果应该是什么。而且实际上,它们会进行编排以完成任务。在处理能力和理解能力方面似乎存在一些重叠,了解什么更可能并将其分块,这是否在起作用,或者这完全是错误的?
我确实认为这是一个很好的观点。我确实认为它在某种意义上是相关的,比如理解输入。处理它并以一种可以进一步处理的方式呈现它,在这种特定情况下,而不是与其他代理交互。它有点像与自己互动。但它也可以是其他代理。我的意思是,这基本上是如何,你知道,在某种意义上分解和征服我的问题。但然后它在分块问题上调用自己。但它也可以委托给其他类型的模型。我想说这是近几个月来最大的进步驱动因素之一,是的,工具调用,比如为不同的事情使用不同的工具。因此,它试图自己做所有事情。而且我认为这也是,让我们说,当你使用 Gemini 或 ChatGPT 或 Claude 之类的东西时,魔力所在。这不仅仅是,我的意思是,这只是一个假设。但我确实认为,如果你以某种方式使用 DeepMind 或其他非常好的开源模型,并将其放入 Gemini 或 Jupiter 的后台框架中,我认为它的效果会几乎相同或相似。所以我想说的是,我认为 LLM 本身不再是决定性因素了。它们都差不多好。但真正重要的是你如何格式化事物,比如如何处理上下文和历史记录,然后如何处理之前的对话,之前的,是的。比如之前的来回是如何处理的,如何使用工具,而这些东西需要大量的工作才能使其真正,你知道,健壮。我的意思是,我不知道确切,因为它属于专有技术,它们如何处理输入。假设我有时会输入一些内容,我打错了字,有时甚至是一个相对技术性的术语。我的提示中有一个错别字,但我通常甚至不在乎修复它。因为我知道,好吧,它已经在处理了。所以它不是全部删除、删除和修复那个词,我只是有一个错别字。而且我可以看到,根据响应,因为响应通常包括重复部分答案。我可以看到它修复了我单词的拼写,所以我不确定这是否一定是 LLM 本身,因为它,它拥有所有不同的拼写或标记或子标记,或者甚至可能存在,你知道,比如,处理,比如修复明显的错别字,因为这会提高其他方面的性能。所以,而不是拥有一个巨大的词汇表或子标记来处理一个人拼写某个单词的所有不同方式,你只需要像字典修复一样,你知道,像去简单地修复并使其成为 LLM 本身的最佳工作。所以我想幕后有很多这样的魔力在发生,以提高性能。而且我认为这就是为什么你看到像 Jupiter Gemini 的性能比你在本地运行的性能更好,因为大多数在本地运行的工具,它们基本上都是在最基本的状态下运行,没有太多东西围绕着它。而且,而且,你知道,我很高兴你提到了这一点,因为它仍然感觉有很多东西与提示的质量和清晰度有关。而且它还可以为你做一些化妆品修复。但是,你知道,我很好奇你对性能基准测试的看法,Sebastian。因为如果我们谈论的是,你知道,基于你所问内容的清晰度的可变输出,很多性能基准测试或者说,它们似乎很清楚。它们试图做一些非常清楚的事情。而且,你知道,回到你早些时候提出的一个观点,感觉就像你说的那样,一些组织没有使用他们公开可用的模型,或者有一些推理扩展正在发生。你知道,这在幕后并没有真正存在。你现在对性能基准测试有多大重视?人们应该在多大程度上将它们视为衡量这些工具未来能力的指标?
这是一个好问题。我认为这是该领域最大的问题之一。如何公平地评估模型。嗯,有不同的方法来做基准测试。为什么有不同类型的基准测试?我能想到的,我会说有 3 或 4 个。所以,让我看看我能想到什么。所以一个基本上更像是经典的模式。你。所以这是多项选择基准测试。所以,这个基本上,你知道,就像一个琐事问题,几乎就像,你知道,谁想成为百万富翁类型的问题?这是一个问题。然后有 ABC,模型必须选择其中一个答案。人们通常用它来测试知识。所以,LLM 是否了解世界知识、数学和基本事物。但最终这不是你使用 LLM 的方式。基本上,你永远不会给它所有解决方案,然后说给我 A、B 和 C,然后你会,例如,自由提问。但然后自由提问很难以编程方式评估,因为有不同的拼写方式。你可以把它作为一个词,作为一个句子。所以这就是为什么他们做 A、B、C 和 D。所以像多项选择。但它有很多局限性。所以,是的,我的意思是,我认为这就像一个最低门槛。我认为,你知道,应该在这些基准测试上有一个最低分数才能算好。但然后,一旦它通过了最低门槛,我认为它是否是 90% 或 95% 并不重要。基本上,我们还必须记住,有些人会使用工具和不使用工具来运行这些基准测试。GPT 的模型,开源模型有一个很好的图表。当你有一个模型并允许它使用工具时,它的性能会好得多。例如,如果你问一个模型,谁赢了,比如说,1998 年的足球世界杯,它可以尝试记住它,但它也可以使用工具并在网上查找,比如说在官方网站上。然后你就可以提高这些类型的准确性。所以这是一个基准测试类型。而且我认为,嗯,它就像一个最低门槛。它应该能够做这些事情并正确回答,但它并没有真正告诉你,它在我实际使用它并以不同方式查询它时表现如何,因为它们也可能对提示格式敏感。所以另一种方法是所谓的排行榜,它们有一个网站,然后你可以为同一个提示使用不同的 LLM,然后你可以比较答案,然后你说,哦,我更喜欢这个答案而不是那个答案。所以这听起来确实更符合我们的关注点。比如说,我有一个 Gemini,应该并排回答问题,好吧。哦,我实际上更喜欢这个答案。如果你对很多人进行大量的成对比较,你就可以使用统计模型,比如彩票模型,将其转换为排名,变成数字,比如 1、2、3、4、5、6,你知道,所以你可以说,哦,这个排在第一位。但这也有限制,因为人们也真的喜欢某种风格,人们对答案的风格很敏感,而不一定是正确性。因为如果我问一个 LLM 一个问题,我通常不知道答案,比如我有一个具有挑战性的数学问题。否则我不会问。对。然后你会得到不同的答案,然后你说,哦,我更喜欢这个,因为它可能解释得更好,或者我喜欢语言,但这并不意味着它更正确或别的什么。所以,所以排行榜有点对某种风格敏感。曾经发生过一次事件,或者说,但就像拉马 4 在夏天发生的事情一样,我的意思是,我不知道全部故事,因为我,我不隶属于这些公司,我不知道后台情况,但据报道,他们在排行榜上使用了不同的模型,并且获得了非常高的排行榜分数。但实际上,它并不是一个好模型,因为它,你知道,它没有实质内容。它看起来比实际情况更好,当你真正用它来处理困难的任务时。所以这总是有点挑战性。评估模型的另一种方法是验证。例如,你可以有数学或代码或类似的东西,比如你可以验证的东西,比如说数学,你有正确的答案,比如它是一个数字答案。有一些工具可以让你将其与数字答案进行比较。通常它的工作方式是,你告诉编辑器,嘿,我有这个问题,你知道,然后解释,然后写出中间的,抱歉,写出你需要的一切,然后把最终答案放在一个框里,比如答案框。它通常是 LaTeX 框格式。然后你可以以编程方式检索这个答案并将其与参考答案进行比较。然后你可以使用计算器,你可以使用计算器来判断,哦,这些数字是相同的还是不同的。比如,它们是不同的工具。比如,你知道,Wolfram Alpha。我使用 SymPy。它是一个开源程序或 Python 库,你可以象征性地比较解决方案。这真的很,我的意思是,这是准确的,对吧?我的意思是,如果模型遵循指示并将答案放在提示中,我确实可以非常有把握地做到。可能有一些解析错误,但 99% 的时间你都有一个公平的比较。但问题是,它有点局限于数学或代码,代码可以编译。很难评估整个答案,你只能,是的,评估最后一个答案点。所以我想我列出了三个。所以还有一个我想到的。一种评估方法是使用,裁判和裁判。所以它基本上是使用一个,另一个 LM,然后你提供一个评分标准,比如评估答案是否正确,然后是中间步骤,如果它们有意义,然后你给出不同的标准,然后你说,根据这些标准,评估这个答案,给定另一个参考答案,它会给你,你可以说,给我答案,比如答案的质量在 0 到 10 的级别之间,其中 10 是最好的。然后你可以对不同的级别进行操作,然后得出数字,说,哦,这个模型平均得到 8.5。这个模型平均得到 9.5。这是一个数字方法。你可以对自由形式的答案进行评估。但同样,总是有陷阱。陷阱是,你正在使用另一个 LM 来做这件事。而且它可能并不总是正确地评估有价值的东西。它可能偏向于某种答案风格。所以长话短说,这些评估 LLM 的不同方法都有其缺点。而且,最好的方法是结合所有这些方法来看,而不是只看一个,然后尝试看看,嗯,不同 LLM 在这些基准测试上的弱点和优势是什么?这真的很难。最终,当你看到发布时,它们看起来都差不多。而且你真的必须使用它,看看对我来说什么有效,什么无效。你知道,这真的很难。这是目前最难公平比较的问题之一。基本上。
有道理。而且,你知道,这很有趣,因为在最前沿,你知道,这些微小的差异,好吧,我是否更喜欢这种风格而不是那种风格,而不是它是否从根本上错了。而且,你知道,你是否使用,你知道,语言或者,你如何,你如何最好地回答这个问题?我很好奇,Sebastian。我必须想象,你知道,你做这个已经有一段时间了,而且我必须想象,在过去的几年里,非技术人员对此的兴趣有所增加。你认为人们对 LLM 及其功能以及他们如何从中获得价值和使用它们存在哪些最大的误解?
这确实是一个好问题。我想,我能想到的。嗯,我不认为有巨大的误解,但它更多地归结为期望。再次,就像我们之前提到的,嗯,这真的很难,训练 LLM 非常昂贵。我认为这是,误解是,哦,我只需要,你知道,做 x、y、z,然后我可以在周末做到这一点。我认为这是,我认为一个人也可以在基本层面理解一切,这不是问题。但我认为与该领域以前的问题相比,挑战在于你需要一个团队来完成它,比如你需要一个 GPU 基础设施专家。你需要研究人员来实施核心架构。你需要运行实验。这通常不是一个人可以独自完成或在周末完成的事情。我的意思是,理解,是的,但完成整个事情需要大量工作。例如,看看,我的意思是,大多数人不会分享这些细节,但是,我认为有一篇 2 或 3 篇论文。他们有一个很好的部分,关于当时训练那个模型需要什么。而且,我忘记了所有,比如说,细节数字,但他们有,他们报告说,我们在一千多块 GPU 上进行了训练,但我们每天都有很多次失败,因为硬件也失败了,比如崩溃或 GPU 崩溃。然后你可能会丢失整个模型。所以你必须对其进行检查点,或者你必须建立鲁棒性,当一个 GPU 失败时,它不会导致你整个数百万美元的运行崩溃。对?所以有很多这样的事情。这通常需要一个团队。基本上,这不是一个人,因为你必须一直监控一切。而且我的意思是,是的,你可以收到通知等等,但这对于很多人来说是一份全职工作,来开发和编辑它们。是的。所以,所以我认为这是与以前的机器学习或深度神经网络训练相比发生的变化。这也是为什么你不再看到那么多学术 LLM 的原因。例如,有一些。但例如,过去,我的意思是,那是卷积网络,图像分类器,每个人都可以在一个小实验室里自己完成,因为大学实验室通常,你知道,只有几个人。但现在,你知道,预算是,你必须有一个巨大的预算,一个团队,大量的时间,大量的专业知识。这有很多事情。这就是为什么现在这主要限于那些有资源的公司。
我将把它反馈给你,让我知道我是否正确,但听起来就像基于这个领域的发展速度,最大参与者拥有的资源数量,所需员工数量,所需计算量,所需原始数据量,如果你想从小规模或作为业余爱好者来做这件事,从头开始构建一个 LLM 是有价值的。这会帮助你个人和职业发展,但大多数情况下,这可能不是你打算大规模实施的事情,因为它不像 5 或 10 年前那样实用。这公平吗?
是的,这是公平的。也有一个例外。所以我同意你的观点。但如果你进行微调,那就是预训练和微调。如果你使用一个已经存在的开源 LLM,并在其之上进行构建,那么它就会变得更容易。所以,也为了提供一些数字,如果,比如说,再次以 DeepMind 为例,因为它是一个非常流行的模型,第三版和 R1 版本在 2024 年 12 月和 2025 年 1 月发布,因为它们有一些不错的数字。如果你租用他们使用的 GPU,他们给出了价格,我认为每小时 2 美元,训练 DeepMind 第三版模型将花费 500 万美元。这还不包括任何员工的成本,比如薪水等等,或者,比如建筑物的成本。这不是实体建筑,比如租用建筑物来容纳人员。而且它也不包括现场运行,因为当你做这样的事情时,你会失败很多次,直到找到正确的配置,一些试错。所以,但如果你只取有效的解决方案并运行它,纯 GPU 成本将约为 500 万美元,这很多钱。但然后,如果你看看微调,他们进行的推理训练,大约是,我忘了,但大约是 10 万到 20 万美元,之类的,少得多。而且这更容易实现。现在,这是针对一个拥有 6710 亿参数的模型。这是一个非常非常大的模型。现在,如果你缩小规模,从 600 到,比如说 200 亿,你可能只需要几千美元就能做出一些非常好的事情。然后它又变得有意义了。但同样,这不会是周末的事情。通常需要几周或几个月才能获得非常好的结果,但一旦你有了信心并能够做到,你就可以稍后更换 LLM 并重复这个过程。所以一旦你学会了工作流程,它实际上很容易。是的,一旦你开始,在某种意义上,将你的技能应用于其他 LLM 实际上很容易。我想说的是,是的,你可以做有趣的事情。也有 API,我的意思是,再次,不隶属于任何公司,但有一个,让我想想。我想是 Thinking Labs。Thinking Machines。有一个来自 OpenAI 联合创始人之一的公司,它有一个 API,你可以进行微调和定制,所以你不需要自己拥有 GPU。你可以使用,就像,就像 ChatGPT API。你可以使用 API。他们有。但对于微调,你可以提供数据和设置,然后在云机器上运行,而无需担心管理,比如说,GPU 故障之类的事情。但同样,我认为在这里,了解如何从头开始构建它确实非常有帮助。首先,要了解你正在使用这些不同的设置做什么。例如,在我的书中,在《从头开始构建推理模型》一书中,我有一个关于具有可验证奖励的强化学习的章节,这本质上是深度强化学习。我只在一个数据集上运行它。它叫做 Math 500,其中,所以我的,抱歉,Once 500 是一个流行的基准测试集。但我有训练集,它有 12,000 个数学问题,与这个不重叠。我正在训练这个。为了给你一些数字,大约需要,有 12,000 个,大约 12,000 个问题。训练 500 步大约需要一天。所以在一块 GPU 上,在。但如果你做 12,000 个,大约需要 20 天左右才能训练它。而且它是一个小模型。但做几个步骤,你就能理解最终奖励是什么,那里发生了什么?我正在与什么进行比较?参考答案是什么?它在检查什么?不同的设置是什么?有一些东西,比如滚动次数,批次大小。TRPO 像裁剪比率等等有很多不同的设置。以及像裁剪比率的 epsilon。有很多小的调整和旋钮。通过从头开始构建,你知道所有这些东西的含义。然后一旦你理解了,哦,这就是我正在做的,这就是这里发生的事情。然后你就可以,例如,去一个 API,然后说,哦,我实际上很有信心,我知道设置是什么。我之前使用过,我理解它只是一个我需要调整的旋钮。它会尝试这个设置,那个设置,你知道,就像它在哪里帮助很大,从头开始构建,只是为了获得这种直觉,或者在你拥有生产系统之前。是的。
太好了。所以,在我们开始结束谈话时,我想问你,Sebastian,你有什么样的建议给那些可能对 LLM 感兴趣的技术领导者,或者确保他们的团队更好地理解 LLM?你认为他们应该如何在这个领域前进?
嗯,这是个无耻的推广。我会说,进行轻量级的编码和从头开始构建 LLM。我的意思是,不是从零开始,没有任何模板。但例如,你知道,我的书或类似的东西,你有一个指南,它会引导你完成它。如果你熟悉 Python、PyTorch,这在技术上你可以在周末或 4、5 天内完成。然后这会给你一个基础。然后有很多行话,专家混合和不同的注意力机制,组查询注意力,多头注意力,潜在注意力。但它们都源自原始的 GPT 模型。所以一旦你理解了核心构建块,它就会揭开所有其他东西的神秘面纱。所以它们基本上都是建立在它之上,或者像它的变体。而且我认为,就像我认为这很重要。我的意思是,这也是我喜欢做的,就是建立一个基础。然后查找东西总是更容易的,你可以看到它如何从那里发展,而不是开始。好吧,我不知道任何东西是如何工作的。什么是专家混合?而且我认为,所以这是一个很好的观点,因为我认为我实际上,有一些重要的人问我,例如,关于专家混合的建议。作为一个人,比如说,不构建 LLM,这是否值得投资?比如说,更大的图景投资。例如,误解是,哦,专家混合。我可以训练不同的 LLM,然后我可以,将它们组合在一起。我可以有一个数学 LLM,我有一个西班牙语 LLM。然后我不需要一起训练所有东西。而且我认为这听起来非常合理。但然后,如果你,但专家混合不是这样工作的。这是完全不同的事情。而且我认为通过建立基础,它有助于你真正揭开这些误解的神秘面纱。基本上,通过,所以专家混合本质上是 LLM 中的一个模块,它被称为前馈层。它就像一个经典的感知器。如果你有那个连接,你知道,你不能随便替换任何东西。它必须端到端训练。而且,专家也更隐晦。你可以说,好吧,这个只做数学,那个做西班牙语。它更像是,是的,也许这个在数学方面更强,因为它在有数学问题时被激活得更多。但它不是这种离散的区分。它更模糊。而且我认为这些东西很难通过不看基本架构、构建块来理解。它真的就像,即使现在,我试图以一种更像大局的方式来解释它,但大局并没有捕捉到它。我想这也许是我的信息,就像,我认为有很多可视化和大图景,它们非常,它们不正确,但它们非常模糊。它们非常含糊。然后它们可能导致误解,因为它们没有展示全貌。它们试图做大图景。而且我认为真正做到这一点,你不必了解所有细节,比如 GPU 优化。这就像,我想,如果你不真正训练它,就像一个绕道。你不需要一定理解 NpF4,比如浮点数 4 的位置 1 以及它是如何实现的。但在这种意义上,它更便宜。但它也是近似的,因为你无法存储太多信息。而且,就像理解和欣赏这些类型的细微差别,我想说,是的。
对。而且,正如你所说,没有办法代替,稍微弄脏你的手,是的,看看它在环境中是如何实际运行的。是的。因为我认为那是,它不会撒谎。这是真相。它不是含糊其辞的,它是非常具体的。这样你。是的。你不会有这些,我不会说知识差距,因为。嗯,即使你从头开始构建一些东西,你也不会从头开始构建所有东西,朝所有不同的方向。你专注于核心,但核心本身,它是真正的核心。它不是,你知道,像一个模糊的概念了。所以它确实。它几乎是自我验证的,你知道,它。是的。所以就像你在数学方程中,数学抱歉。但就像你,从第一原理推导事物一样,你喜欢,有一些公式,你可以直接使用它们,记住它们,或者你可以从,从第一原理推导它们。然后你就可以看到,如果你从第一原理这样做,所有这些公式,我的意思是,你不必一直这样做。你只需要做一次,但然后你就知道,好吧,这实际上植根于某些东西,这些是部分。这就是为什么它是这样的,因为你是这样推导出来的。它不是,只是一个有人想出来的幻想公式,它就像,一个推理或者,是的,背后的过程。基本上。然后,是的,我认为这回答了人们会有的很多问题。而感觉就像这是一个充斥着错误信息或炒作的空间,而且人们很容易误解它是如何工作的,所以能够直接去源头看看自己非常有益。是的,是的。101,就像你刚才说的一些关于,比如,对某些事情的基本误解的事情。例如,有一个模型,我认为它是一个非常酷的研究,叫做分层推理模型。还有一些叫做微型推理模型。它们是在去年 2025 年发布的。而且,我认为它们甚至赢得了 ARC 基准测试,ARC 是一个逻辑谜题类型的基准测试,它获得了大量的炒作。它在所有媒体上都非常受欢迎。在每个地方基本上。但是,我认为如果人们,比如,构建类似的东西或,比如,遵循论文,那会很有帮助,因为它是一个非常非常酷的模型,但它不是终点。它们与 ChatGPT 进行了比较。它是一个微型,比如 Transformer 模型,而且它只在那个特定的任务上工作,你可以,你可以训练它来做,比如说,数独。你可以训练它来做这些,ARC 基准测试谜题,但你不能说,请将我的句子从西班牙语翻译成英语,因为它只能做那一件事情。而且,我认为这里会有帮助,如果人们。是的,他们稍微理解一下,你知道,架构是什么,它是如何训练的。然后你就会看到这些限制。基本上,这并不意味着它是一个糟糕的模型。它实际上对于它的尺寸来说是相当令人印象深刻的。但然后,将它与 LLM 进行比较是不公平的,因为它能做很多事情。而且它是一个通用模型,而这个模型非常非常非常具体。而且我认为这些是如果你理解了基本原理,你就可以摆脱这种炒作。你可以有点,哦,这只是一个新闻标题。他们试图吸引注意力。而且我认为有很多这样的事情。就像你说的,有很多这样的炒作,你知道,听起来不错,它得到了,我想是炒作和点击等等,但通常它们,如果它好得令人难以置信,它通常好得令人难以置信。通常有一些陷阱,如果你知道基本原理,找到那个陷阱就更容易了。说得好。Sebastian,我想说非常感谢你今天来到节目。这是一次非常有趣和富有洞察力的谈话。而且,是的,我很高兴你能深入探讨一些话题。是的,非常感谢邀请我。我很高兴能谈论所有这些技术性的话题。你知道,这是我工作的内容,这是我的爱好。我玩得很开心。所以。是的,感谢邀请我来这里。而且。嗯。很有趣。如果你从事信息技术工作,Infotech Research Group 是一个你需要知道的名字,无论你的需求是什么。Infotech 都能满足你的需求,AI 战略涵盖。灾难恢复涵盖。供应商谈判涵盖。Infotech 通过最佳实践研究和随时待命的分析师团队为您提供支持,帮助您应对最严峻的挑战。在下面的链接中查看,别忘了点赞和订阅!