Transcription
[音乐] 大家好,听众朋友们,欢迎回到 No Priors。今天,我和 Allad 一起请来了 Edwin Chen,他是 Surge 的创始人兼首席执行官。Surge 是一家白手起家的、专注于人类数据的初创公司,去年收入突破了十亿美元,并为谷歌、OpenAI 和 Anthropic 等顶级客户提供服务。我们讨论了高质量人类数据意味着什么,在模型变得超人时人类的角色,基准测试的黑客行为,他为什么相信多种前沿模型,Scale 和 Meta 的非并购交易,以及为什么 RL 的环境质量或实验室希望训练代理的模拟世界没有上限。Edwin,感谢你的加入。>> 很高兴今天见到你们。>> Surge 一直非常低调,直到现在。所以,你能给我们一些关于公司规模以及最初的创立理念的背景信息吗?>> 去年我们的收入超过了十亿美元。我们是该领域最大的人类数据提供商,我们有大约 100 多人。我们最初的理念是,我们坚信人类数据在推动人工智能方面具有强大的力量,并且从一开始我们就非常专注于确保我们拥有最高质量的数据。>> 你能给人们一些关于你们存在多久、如何开始等等的背景信息吗?我认为你们在很短的时间内取得了巨大的成就,而且你们对所做的一些事情一直非常低调。所以,了解一些历史,以及你们何时开始、如何开始以及存在了多久,将会很有帮助。>> 是的,我们已经存在五年了。我想我们刚刚度过了五周年纪念日。所以我们是在 2020 年开始的。在此之前,我可以提供一些背景。在此之前,我曾在谷歌、Facebook 和 Twitter 工作过。我们创办 Surge 的一个主要原因是我曾经在这些大公司从事机器学习工作。我反复遇到的一个问题是,我们很难获得训练模型所需的数据。所以,这是我们反复面临的一个重大障碍。而且我们还有很多想做的事情,即使是基本的事情,我们也难以获得数据。这确实是一个巨大的障碍。但与此同时,我们还有很多更具未来感的东西想构建。例如,如果我们想到下一代人工智能系统,如果我们当时连解决一个简单的分析分类器所需的数据都很难获得,那么我们如何才能超越这一点呢?所以,这确实是最大的问题。我可以详细说明,但这确实是我们面临的问题。>> 而且你们也以白手起家而不是筹集大量外部风险投资而闻名。你想谈谈早期盈利然后在此基础上扩展的这个选择吗?>> 关于我们为什么没有融资,很大一部分原因是我们显然不需要钱。我认为我们非常非常幸运,从一开始就实现了盈利。所以我们不需要钱。放弃控制权总感觉很奇怪,我一直讨厌硅谷的一点是,你看到很多人为了融资而融资。我认为我经常看到的一点是,我认识的许多创始人并没有建立一个解决他们真正相信的某个想法的产品的宏大梦想。例如,如果你和一群 YC 的创始人或任何人交谈,他们的目标是什么?他们的目标是告诉他们所有的朋友他们筹集了 1000 万美元,并向他们的父母展示他们在 TechCrunch 上获得了头条新闻。这就是他们的目标。我想到我在谷歌的朋友,他们经常告诉我,“哦,是的,我,你知道,我在谷歌或 Facebook 工作了 10 年,我想创办一家公司。”我说,“好的,你想解决什么问题?”他们不知道。他们说,“是的,我只是想开始新的事情。我感到无聊。”这很奇怪,因为他们可以支付自己的薪水几个月。再说一遍,他们在谷歌和 Facebook 工作了 10 年。他们不是刚毕业的学生。他们可以支付自己的薪水,但他们首先想到的就是出去融资。我一直觉得这很奇怪,因为他们可能会尝试与一些用户交谈,他们可能会尝试构建一个 MVP,但他们会以一种随意的方式去做,唯一的原因就是为了在创业加速器申请中勾选一个框,然后他们就会围绕这些随机的产品想法进行支付,并且他们碰巧获得了一些牵引力,以便 VC 给他们发私信。所以他们花所有的时间发推文,参加 VC 晚宴,这一切都是为了向世界展示他们筹集了大量资金。所以,我认为立即融资对我来说一直很愚蠢,因为每个人的默认行为就是立即融资。但如果你从第一性原理来思考,如果你不知道硅谷是如何运作的,如果你不知道融资是一回事,你为什么要这样做呢?对于 90% 的初创公司来说,金钱到底能解决什么问题,而这些公司的创始人很幸运有一些储蓄?我真的真的认为你的第一反应应该是出去构建你梦想中的任何东西。当然,如果你遇到财务问题,那么当然,再考虑融资,但不要在你不确定如何使用它的时候就浪费所有这些前期努力和时间。>> 是的,这很有趣。我觉得我是少数几个试图劝说人们不要融资的投资者之一。>> 对吧?我今天确实进行了一次谈话,创始人谈到了融资,我说为什么?你知道你不需要,你可以保持控制权等等。然后另一方面,我实际上会争辩说,在硅谷之外,很少有人在资金可以帮助他们扩展时筹集风险资本。所以我觉得在硅谷太多了,而在硅谷之外又太少了。所以这是一个有趣的,你知道,不同模式的传播,它们会坚持下去。Edwin,你会对那些觉得需要一些外部验证才能——尤其是像雇佣团队或扩大团队——的创始人说些什么?这是一个非常普遍的抱怨或理由,要去筹集更多的资本。>> 我从几个方面来考虑这个问题。所以,我想这取决于你对外部验证的定义。例如,在我看来,我经常从一个角度来思考:你是在试图建立一个真正能改变世界的初创公司吗?你有什么宏大的梦想吗?如果你有这个宏大的梦想,你为什么会在乎呢?也许可以这样想,在 Sarah 的情境下,如果你是 YC 的创始人,你没有在谷歌、Meta、Twitter 工作过,你没有工程师网络,你是一个完全的陌生人,你没有和很多人一起工作过,你刚毕业。>> 你如何吸引人才?正如你所说,你可以讲述你将要构建的东西或你将要做的事情的故事,但要说服别人加入你,或者让别人加入,或者有钱支付他们,如果你没有长期的工作经历,这是一个更困难的障碍。所以,我认为 Sarah 可能是在说这一点。>> 是的。所以,我的意思是,我认为我会区分两件事:一是你是否需要钱?首先,是的,就像刚毕业的学生,或者可能从未上过学的人,他们可能没有任何积蓄,所以他们真的需要一些钱才能生活。然后是其他人,好吧,假设你不需要钱,因为你在谷歌或 Facebook 工作了 10 年,或者 5 年,你有积蓄。所以,我想说的问题之一是,你真的需要出去雇佣所有这些人吗?我经常看到的情况是,创始人会告诉我,好的,我正在考虑我将要做的第一批招聘,他们会说,是的,我要雇佣一个产品经理。我要雇佣一个数据科学家。是的,这是我的前五到十名招聘人员之一。我说什么?这对我来说太疯狂了。我永远不会在公司早期雇佣数据科学家。我说这话是因为我曾经是一名数据科学家。数据科学家在你想要将产品优化 2% 或 5% 时非常有用。但这绝对不是你在创办公司时应该做的事情。你试图争取 10 倍或 100 倍的变化,而不是担心和挑剔那些只是噪音的小百分比。至于产品经理,当你的公司足够大时,产品经理就很有用,但一开始你应该考虑你自己,考虑你想构建什么产品。你的工程师应该亲力亲为。他们也应该有很棒的想法。所以产品管理是一种奇怪的概念,大公司在工程师没有时间深入细节并自己推动事情时会这样做。这不是一个你事先想到的角色。>> 所以,我想,就最初的 Surge 团队而言,你们似乎有一个小型、紧密的初始工程团队。你们开始构建产品。你们通过收入进行自筹资金。你知道,现在你们的收入超过了十亿美元,这太棒了。>> 你如何看待未来,你想如何塑造组织,你想变得多大,你推出的不同产品?你如何看待 Surge 的未来以及它将如何发展?>> 在我们这样做之前,你能解释一下,在任何合理的细节水平上,这十亿美元的收入是什么吗?也许产品如何支持公司,你的数据,你的人是谁,因为我认为这方面的可见度非常低。所以,就我们的产品而言,我的意思是,归根结底,我们的产品就是我们的数据。>> 我们实际上是将数据交付给公司,他们使用这些数据来训练和评估他们的模型。所以,想象一下,当你是一家前沿实验室,想要提高你的模型——你的模型的编码能力。我们所做的是收集大量的编码数据。这些编码数据可能以不同的形式出现,可能是 SFT 数据。我们实际上是在写出编码解决方案,或者单元测试——这些是好的代码必须通过的测试。可能是偏好数据,即“好吧,这里有两个代码片段,或者这里有两个编码解释,哪个更好?”或者这些可能是验证器,例如“好的,我创建了一个 Web 应用程序,我想确保屏幕右上角有一个登录按钮,或者我想确保当你点击这个按钮时,其他事情会发生。”这些数据可能有多种形式,但归根结底,我们交付的是数据,这些数据将帮助模型改进这些能力。与此密切相关的是评估模型这一概念,你也想知道,是的,这是一个好的编码模型吗?它比另一个好吗?它有什么错误?这个模型在哪里薄弱,而那个模型又在哪里更差?我们可以从中获得什么见解?所以,除了数据之外,我们经常向客户提供见解,提供损失模式,提供故障模式。所以,可能还有很多其他与数据相关的东西,但最终,这是我们交付的数据所围绕的这样一个应用宇宙,或者说围绕着我们交付的数据的这样一个宇宙,这就是我们的产品。>> 是的,也许回到 Allad 的问题,也许“产品”这个词在这里并不准确,但公司可重复的地方是什么?或者你们拥有的核心能力是什么,你会说你们的竞争对手——你知道——未能达到标准?>> 我们看待公司的方式,以及我们与其他公司的区别在于,这个领域里的许多其他公司本质上只是“人力派遣公司”。他们提供的不是数据,他们只是提供“温热的身体”给公司。这意味着,归根结底,他们没有任何技术。我们最基本的信念之一是,归根结底,质量是最重要的。这是高质量的数据吗?这是一个好的编码解决方案吗?这是一个好的单元测试吗?这是一个正确解决的数学问题吗?这是一首很棒的诗吗?基本上,这个领域里的许多公司——就像历史上的情况一样——他们将质量和数据视为商品。我们经常这样想:想象一下你要给一辆车画一个边界框。莎拉,你和我,我们可能会画出相同的边界框。问海明威和问一个小学生。好吧,归根结底,我们都会画出相同的边界框。我们能做的区别不大。所以,质量的门槛非常非常低。但是,再拿写诗来说。好吧,我写诗很糟糕。海明威写的诗肯定比我写的好。或者想象一下,我不知道,一个 VC 的融资演示文稿。你会写出一个比我更好的演示文稿。所以,在这个生成式人工智能的世界里,你可以构建的质量类型几乎没有上限。所以,我们看待产品的方式是,我们有一个平台。我们有实际的技术,我们用它来衡量我们的工人或标注者产生的质量。如果你没有这项技术,如果你没有任何衡量它的方法,它是通过人类评估来衡量的吗?它是通过基于模型的评估来衡量的吗?我有点好奇,你是如何创造这种反馈循环的,因为在某种程度上,这有点像一个问题:你是否有足够的评估者来评估产出相对于产出者?或者你使用模型?或者你是如何处理的?我认为我们经常做的一个类比是,想想谷歌搜索或 YouTube。你有数百万个搜索结果,数百万个网页,数百万个视频。你如何评估这些视频的质量?这是一个高质量的网页吗?它信息丰富还是垃圾信息?你做到这一点的方式是,你只需要收集大量的信号,收集页面依赖信号,收集用户依赖信号,收集活动依赖信号,所有这些最终都会汇入一个巨大的机器学习模型。同样,我们收集关于我们的标注者、他们执行的工作、他们在网站上的活动的所有信号,然后将其输入到我们有一个机器学习团队来构建所有这些算法,以衡量所有这些。>> 当你进行越来越复杂的标注时,什么正在改变或被打破?就像,你知道,模型质量基线每几个月都在上升,那么期望就是它会超过——你知道,可能曾经是一个随机的人,就像你说的,可以画一个边界框,进入所有这些不同的领域,在那里,你知道,我们曾经在某个时候比 90% 的人做得更好。>> 这实际上是我们自己进行大量内部研究的一个领域。所以,基本上有一个叫做“可扩展监督”的人工智能对齐领域,它基本上是如何让模型和人类携手合作,生成比他们任何一方单独都能实现的更好的数据。所以,即使是今天,比如从头开始写一篇 SAT 故事,即使是今天,几年前我们可能完全从头开始写这个故事,今天这效率太低了,对吧?你可能会从一个模型创建的故事开始,然后你进行编辑,你可能会进行大量的编辑。也许它的核心非常普通,非常通用,但有很多低效的人类工作,并且没有真正受益于我们试图添加到响应中的人类创造力和人类智慧。所以,你可以从一个基本上只是在其之上进行分层的基本结构开始。所以,再次,有更复杂的方法来思考可扩展监督,但仅仅是关于如何构建正确的接口,如何构建正确的工具,如何以正确的方式将人们与人工智能结合起来,使他们更有效率的问题。这是我们构建了大量技术的东西。>> 在最近几个月,关于实验室想要什么样的人类数据,大部分讨论已经转向了 RL 环境和奖励模型。这有什么难点?或者你们在这里在做什么?>> 我们在构建环境方面做了很多工作,我认为人们真正低估了它的复杂性,你不能仅仅通过合成来生成它。例如,你认为你需要很多工具,因为这些是人们想要的庞大环境。你能举个例子吗?就像,为了让它更真实。>> 想象一下你是一名销售人员,当你是一名销售人员时,你需要与 Salesforce 互动,你需要通过 Gmail 获取潜在客户,你需要通过 Slack 与客户交谈,你需要创建 Excel 表格来跟踪你的潜在客户,你需要——我不知道——写 Google Docs 并制作 PowerPoint 演示文稿来向客户展示。所以,你基本上需要这些非常丰富的环境,它们实际上模拟了你作为销售人员的整个世界,就像想象一下你的整个世界。所以,未来的一切都不在你的桌面上。也许你有一个日历,要与客户开会,然后你想模拟一场车祸发生,你收到了通知。所以,你需要早点离开。所有这些事情都是我们想要在这些非常非常丰富的 RL 环境中建模的。所以,问题是如何生成所有这些数据?比如,好吧,你需要生成成千上万条 Slack 消息,数百封电子邮件。你需要确保它们都相互一致。你需要确保——回到我的核心例子——你需要确保时间在这些环境中演变,并且会发生某些外部事件。你如何做到这一切?然后,以一种有趣且富有创意但又现实且不相互矛盾的方式。对于这些环境,需要进行大量的思考,以确保它们再次成为模型可以从中学习有趣事物的丰富且富有创意的环境。所以,是的,你基本上需要大量的工具和平衡的复杂性来实现出色的使用。>> 有什么直觉可以告诉你,真实或复杂到什么程度才算足够?还是说,你知道,这里有用的现实主义或环境的复杂性没有上限?我认为没有上限。归根结底,你只是想要尽可能多的多样性和丰富性,因为你拥有的丰富性越多,模型就能学到越多。时间跨度越长,模型就能学到和改进得越多。所以,我认为这里几乎没有上限。如果你要对未来五年或十年内,人们在训练人工智能模型和数据类型方面需求增长最多的东西做一个赌注,是 RL 环境,还是专家推理的轨迹类型,或者你认为还有哪些领域会有巨大的需求?我的意思是,我认为这将会是以上所有。我不认为我们的环境本身就足够了,因为,我的意思是,这取决于你的想法,但有 RL 环境,但通常这些是非常非常丰富的轨迹,非常非常长,所以几乎无法想象一个单一的奖励。我的意思是,我认为即使是今天,我们也经常以多个奖励而不是单一奖励来思考问题,但像单一奖励这样的东西可能不够丰富,无法捕捉模型解决某个非常非常复杂的目标所付出的所有努力。所以,我认为这很可能是一个组合。>> 如果你假设最终在不同模型类型上都会出现某种形式的超人性能,相对于人类专家,你如何看待人类在数据和数据生成方面的作用,而不是合成数据或其他方法?在什么点上,人类输入会作为反馈或数据生成的有用点而耗尽?>> 我认为人类反馈永远不会耗尽,这有几个原因。我的意思是,即使我想到今天的格局,我认为人们经常高估合成数据的作用。我个人认为合成数据实际上非常有用。我们自己也大量使用它来补充人类的工作。就像我之前说的,有很多低效的工作不值得人类花费时间。但我们经常发现的是,例如,很多时候客户会来找我们,他们会说,“是的,在过去的六个月里,我一直在尝试合成数据,我收集了 10 到 2000 万条合成数据。实际上,我们终于意识到其中 99% 都没用。”所以,我们现在正在尝试筛选出 5% 有用的数据,但我们会丢弃 900 万条。而且,你经常会发现,实际上,一千条,甚至一千条高质量的人类数据,经过精心策划,真正高质量的人类数据,实际上比那 1000 万条更有价值。所以,这是我要说的第一件事。另一件事是,有时你需要一个外部信号给模型。就像模型思考的方式与人类如此不同,你总是需要确保它们与你想要实现的实际目标保持一致。让我举两个例子。一个例子是,有时如果你尝试——其中一个前沿模型,让我说它是最好的模型之一,或者每个人都认为是最好的模型之一。如果你今天使用它,也许 10% 的时间,当我使用它时,它会在我的一个响应中输出随机的印地语字符和随机的俄语字符。我会说,告诉我关于唐纳德·特朗普的事情,告诉我关于巴拉克·奥巴马的事情,然后就在中间,它会输出印地语和俄语。这是什么?模型本身并不够一致,无法意识到这一点。就像你需要一个外部人类来告诉模型,是的,这是错误的。我认为对人工智能的一个巨大祸害是 LMS(语言模型评估),我将跳过细节。但我认为,现在人们经常——就像,如果你的模型以错误的目标进行训练。就像,你应该有的 LMS 的心智模型是,人们会写提示,他们会得到两个响应,他们会花 5 到 10 秒查看他们的响应,然后他们会选择看起来更好的那个。他们不评估模型是否出现幻觉。他们不评估事实准确性以及它是否遵循了任何指示。他们只是在与模型进行互动,然后说,“好吧,是的,这个看起来更好,因为它有很多格式。它有很多表情符号。它看起来更令人印象深刻。”人们会训练——基本上是主观性的元素,他们不会意识到它的所有后果。而且,模型本身并不知道它的目标是什么。就像你需要一个外部的质量信号来告诉它正确的目标是什么。如果你没有这个,那么模型就会走向所有这些疯狂的方向。再次,你可能已经看到了一些关于法律之前的结果,但只是走向所有这些疯狂的方向,这确实意味着你需要这些外部验证器。>> 这也发生在当你进行不同形式的蛋白质进化或其他类似的事情时,你选择一种蛋白质对抗催化功能或其他东西,然后你只是随机化它,并拥有一个巨大的库,最终你会得到同样的结果,即出现了一些你没有预料到的奇怪活动。所以,我有时认为模型训练几乎就像一个奇怪的进化景观,你实际上是在进化和选择,你正在塑造模型进入局部最大值或类似的东西。所以,这几乎是任何事情的一个非常有趣的产出,你实际上是在针对反馈信号进行进化,而根据反馈信号是什么,你就会得到这些奇怪的结果。所以,看到它如何跨领域转移很有趣。你知道,这些课程——正如你所说的,5 秒反应的学术基准,甚至非学术的工业基准,很容易被黑客攻击,或者不是衡量任何给定任务性能的正确指标。它们非常受欢迎。对于那些试图选择正确模型或理解模型能力的人来说,替代方案是什么?我认为所有前沿实验室都将人类评估视为黄金标准。所以,再次,是真正的人类评估,你花时间查看响应。你将对其进行事实核查。你将查看它是否遵循了所有指示。你有良好的品味,所以你知道模型是否具有良好的写作质量。我认为进行所有这些并花费所有时间来做到这一点,而不是仅仅进行 5 秒的互动,这实际上非常重要,因为如果你不这样做,你基本上就是在用“点击诱饵”来训练你的模型。所以,我认为这实际上对模型进步非常非常重要。>> 如果不是 LMS,人们应该如何实际评估模型在任何给定任务上的能力?>> 所有前沿实验室发现的是,人类评估确实是黄金标准。你真的需要花很多时间来事实核查这些响应,验证是否遵循了指示。你需要有良好品味的人来评估写作质量等等。如果你不这样做,你基本上是用“点击诱饵”来训练你的模型。所以,我认为这真的会损害模型进步。>> Surge 在这个领域是否有工作,试图标准化人类评估,或者使其对 API 的最终消费者甚至用户更加透明?>> 所以,我们在内部今天确实做了很多工作,与所有前沿实验室合作,帮助他们理解我们的模型。所以,再次,我们不断地评估它们。>> 我们不断地发现它们需要改进的领域等等。所以,现在很多都是内部的,但我们实际上想做的是一些外部形式的,在那里我们帮助教育人们,是的,这些是所有这些模型不同的能力,这些模型在编码方面更好,这些模型在遵循指示方面更好,这些模型实际上在产生幻觉,所以不要太相信它们。所以,我们确实想开始很多外部工作,以教育更广泛的领域。>> 如果我们可以放大并谈谈更大的竞争格局以及前沿模型随着时间的推移会发生什么。Meta 的规模交易对你们意味着什么?或者你们如何看待它?>> 所以,我认为这很有趣。我们已经是该领域的头号玩家。这很有益,因为,是的,仍然有一些遗留团队在使用 Scale,他们只是不知道我们,因为我们仍然相当低调。我认为这很有益,因为我们一直相信的一件事是,有时当你使用这些低质量的数据解决方案时,人们会被人类数据所困扰,所以他们有了这种负面经历,然后他们就不想再使用人类数据了。所以,尝试其他方法,这些方法实际上要慢得多,而且没有正确的目的。所以我认为这只会损害整体的模型进步。所以,就像我们越能让所有这些前沿实验室使用高质量的数据,我认为这实际上对整个行业都非常有益。所以我,我,我认为总的来说,这是一件好事。>> 如果你要打赌一个黑马能赶上 OpenAI、Anthropic 和 DeepMind,会是谁?>> 我会押注 XAI。我认为他们非常渴望并以使命为导向,这给了他们很多独特的优势。>> 我想也许另一个更广泛的问题是,你认为几年后会有三个前沿模型,还是十个前沿模型?其中有开源的吗?>> 是的。所以我实际上看到越来越多的前沿模型随着时间的推移而开放,因为我实际上不认为模型会成为商品。我认为我们已经——我的意思是,我认为过去几年令人惊讶的一件事是,你实际上看到他们所有的模型都有自己的焦点,这给了他们独特的优势。例如,我认为 OpenAI 在编码和企业方面非常出色,而 OpenAI 则专注于消费者,因为聊天活动,我真的很喜欢它。它的模型个性,然后 Grok,你知道,有不同的东西,它愿意说和构建。所以,几乎每个公司都有——几乎就像一套不同的原则,它们关心。就像有些公司永远不会做一件事。有些公司完全愿意做。有些公司只是有不同的——模型将有如此多的不同方面,它们将擅长不同类型的技能。当然,最终 AGI 可能会包含这一切,但与此同时,你只需要专注于。就像一个公司只能有这么多焦点。所以我认为这只会导致所有模型提供商拥有不同的优势。所以,我的意思是,我认为今天,你知道,我们已经看到很多人,包括我,会切换到所有不同的模型,这取决于我们正在做什么。所以在未来,我认为随着人们在生活的各个方面越来越多地使用模型,无论是个人生活还是职业生活,这只会发生得更多。回到 Elad 提到的,我们应该在哪里看到 Surge 的投资?你认为几年后你们会做什么,而今天不会做?>> 再次,我认为我对我们开始的这种更公开的研究推动感到非常兴奋。我认为这很有趣,因为,出于显而易见的原因,许多前沿实验室不再发布了。因此,我认为这几乎就像行业陷入了一个我担心的陷阱。所以,就像,也许深入研究我之前说的一些关于行业负面激励和我们看到的一些令人担忧的趋势。所以,回到 LMS,我们会看到的是,许多研究人员会告诉我们,他们的副总裁让他们专注于提高他们在 LMS 上的收入。所以我曾有研究人员明确告诉我,他们不介意让他们的模型在事实性方面变差,在遵循指示方面变差,只要它能提高他们的排名,因为他们的领导层只是想看到这些指标上升。再次,这是真实发生的事情,因为对这些东西进行排名的人——分析。他们不关心模型是否擅长遵循。他们不关心模型是否——是否发出事实响应。他们关心的是,这个模型是否发出了很多表情符号?它是否发出了很多粗体字?它是否响应很长?因为这对他们来说看起来更令人印象深刻。我们发现的最简单的方法来提高你在 Elm Marina 上的排名就是让你的模型响应更长。所以,发生的是,有很多公司试图提高他们的排行榜排名。所以,他们会看到六个月的进展,因为他们所做的就是不情愿地延长他们的模型响应并添加更多表情符号,而他们没有意识到他们所做的只是训练他们的模型产生更好的点击诱饵。而且他们可能最终会在六个月或一年后意识到——再次,你可能已经看到了一些行业中的这些事情——但这基本上意味着他们在过去六个月里零进展。同样,我认为,除了 LMS,你还有所有这些学术基准,它们在现实世界中完全不同。许多团队专注于改进这些 SAT 风格的分数,而不是现实世界的进展。我会举一个例子,有一个叫做 IFEval 的基准测试,如果你看一下 IFEval,它代表指令遵循评估。如果你看一下 IFEval,它试图检查我们的模型是否可以做一些指令。比如,“嘿,你能写一篇关于亚伯拉罕·林肯的散文吗?”每次你提到亚伯拉罕·林肯这个词时,确保其中五个字母是大写的,而所有其他字母都是小写的。这是什么?有时我们会收到客户的来信,他们说,“是的,我们真的需要提高我们在 IFEval 上的分数。”这意味着,再次,你拥有所有这些公司或所有这些研究人员,他们没有专注于现实世界的进步,而是仅仅优化这些愚蠢的 SAT 风格基准。所以,我们真正想做的一件事就是思考如何教育行业,思考如何自己发布,就像思考如何引导行业朝着一个更好的方向发展。所以我认为这只是我们非常兴奋的一件大事,而且在未来五年内可能会非常重要。>> 好的。是的。我的意思是,所以 Sarah 之前提到,每个人都想要高质量的数据。那意味着什么?你怎么看待它?你如何生成它?你能告诉我们更多关于你在这方面的想法吗?>> 所以,假设你想训练一个模型来写一首关于月亮的八行诗。大多数公司是这样想的:好吧,我们雇佣一些人在 Craigslist 或通过某个招聘机构,然后让他们写诗。然后他们对质量的看法是:好吧,这是一首诗吗?它有八行吗?它包含“月亮”这个词吗?如果是这样,好吧,是的,它符合这些三个复选框。所以,是的,这首诗很棒,因为它遵循了所有这些指示。但如果你仔细想想,现实是你得到的是糟糕的诗。就像,是的,它有八行,包含“月亮”这个词,但感觉像是高中生写的。所以,其他公司会说:好吧,当然,Craigslist 上的人没有诗歌经验。所以,我将要做的是雇佣一群拥有英语文学博士学位的人。但这也很糟糕。很多博士实际上并不是好的作家或诗人。就像,想想海明威或艾米莉·狄金森,他们肯定没有博士学位。我不认为他们甚至完成了大学学业。而且,我必须说的是,我去了 MIT。我认为 Eli 也去了那里。我认识的许多从 MIT 毕业并获得计算机科学学位的学生,他们都是糟糕的程序员。所以,我们对质量的看法完全不同。我们想要的不是符合某些复选框的诗歌,然后说,好吧,是的,检查三个复选框并使用一些复杂的语言。我们想要诺贝尔奖得主会写的诗歌。所以,你想要的是:好吧,我们想认识到诗歌实际上是非常主观和丰富的。也许一首诗是关于水上月光的俳句,另一首诗有很多内部押韵和格律,另一首我不知道,关注月亮升起之夜的情感。所以,你实际上想捕捉的是,写一首关于月亮的诗有成千上万种方式,没有一种正确的方式。每一种都让你对语言、意象和诗歌有不同的见解。如果你仔细想想,这不仅仅是诗歌,它就像数学一样,有成千上万种方法可以证明勾股定理。所以我认为不同之处在于,当你错误地看待质量时,你就会得到商品化数据,这些数据会优化诸如内部雷达一致性之类的东西,并且再次检查列表中的复选框。但我们试图教给所有客户的一件事是,高质量的数据实际上拥抱了人类的智慧和创造力。当你用这种更丰富的数据训练模型时,它们不仅仅学会遵循指示。它们真正学会了关于使语言和世界如此引人入胜和有意义的所有事物的更深层次的模式。所以我认为很多公司只是把人类投入到问题中,他们认为这样就可以获得好的数据。但我认为你真的需要从第一性原理来思考质量及其含义,并且你需要大量的技术来识别,是的,这些是惊人的程序,这些是富有创意的数学问题,这些是游戏和 Web 应用程序,它们漂亮且有趣,而这些是糟糕的。所以我认为你真的需要构建大量的技术,并以正确的方式思考质量。否则,你基本上只是在扩大平庸。>> 这听起来非常领域特定。所以,在每个领域,你是否与你的合作伙伴一起构建了质量是什么样的视角?>> 是的,我的意思是,我认为我们有一些整体的质量原则,但通常每个领域都有差异。所以,这是两者的结合。>> 我认为我们已经涵盖了所有核心主题。播客第二集做得很好,Edwin,感谢你这样做。祝贺你的业务取得了所有进展。>> 是的。不,非常感谢你的加入。>> 是的,很高兴认识你们。>> 在 Twitter 上关注我们 @no prior pod。如果你想看我们的脸,请订阅我们的 YouTube 频道。在 Apple Podcasts、Spotify 或任何你收听播客的地方关注该节目。这样,你每周都会收到新的一集。并在 no-bers.com 注册电子邮件或查找每集的文字记录。[音乐]