Transcription
[音乐] 大家好,非常感谢邀请我来。我叫乔尔·贝克。我在 META 工作,担任研究员或技术员工,META 是模型评估与威胁研究的缩写。正如我们稍后将看到的,我将要谈论人工智能的能力。我们如何知道今天的人工智能有多高效?它们在不久的将来可能有多高效?来自这两个看似给出有些矛盾答案的不同证据来源。你知道,我本可以不特别提及 META 的论文就完成整个演讲,但我们将以两个我参与过的论文为例,作为基准测试式证据和更经济学式证据。在基准测试方面,衡量人工智能完成长任务的能力。这篇论文有许多图表,你们很多人可能在 Twitter 等地方见过,META 以此而闻名。然后是第二个,这项随机对照试验衡量允许使用人工智能如何影响开发者的生产力。然后我们将讨论如何调和这两种不同测量方式所暗示的差距。正如我提到的,META 是模型评估与威胁研究的缩写。我们是一家独立的非营利研究机构,致力于告知公众、政策制定者和实验室人工智能可能对社会造成的灾难性风险程度。模型评估部分意味着我们试图理解人工智能的能力和倾向。威胁研究部分意味着我们试图将这些能力和倾向与潜在的灾难性风险联系起来。好的。我们要谈论的第一篇论文与这张图表有关,我相信你们很多人可能见过。在深入研究论文之前,先退一步。你知道,我们通常如何通过基准测试来衡量人工智能的能力,例如 SWE bench 或 GPQA 等等。有一些关于 0% 性能或随机性能的概念。例如,GPQA 是 25%,这对应于最差可能的结果。也许 GPQA 有一个低于 100% 的人类基线。我认为这大约是 75%,代表了专家级人类的表现。当然,你也可以在这些基准测试中达到 100%。但是,这到底意味着什么呢?你知道,如果我在 GPQA 上得到 50%,如果我从最低点到专家基线的一半,这到底意味着人工智能有多高效呢?如果我达到了人类基线,这是否意味着人工智能在某种我关心的相关意义上,已经和专家人类一样高效,甚至更高效了呢?这很难解释。你知道,从这张图表中你还可以看到,基准测试在上线并给出任何信号以及完全饱和之间的时间越来越短。越来越难创建具有充足信号的基准测试,这些信号可能在很长一段时间内为我们提供有关模型能力的信息。所以,我们将以不同的方式进行。首先,我们将收集各种难度任务的人类基线数据。你应该将这些人视为经验丰富的专家,但他们刚入职的第一天或第一周。这些人对特定任务没有背景知识。这并不是他们工作中曾经出现过的事情,但如果这是一项软件工程任务,那么他们就是具备相关技能的通用软件工程师。对于我们将要讨论的机器学习任务和网络安全任务也是如此。这些任务来自这三个类别或任务分布。Hcast,这是一系列基于软件的任务,似乎需要自主性,你知道,与工具交互,与环境交互,思考问题,而不仅仅是这种问答式的。SWAR 套件,这些是原子问题,这些问题也许 GPT2 可以解决,也许不行,问题就像“这里有四个文件,其中一个叫做 passwords.txt,哪个文件包含密码?”而在难度另一方面,我们有 Rebench,这是具有挑战性的、新颖的、开放式的机器学习研究工程挑战,即使对顶尖人类专家来说也非常困难。除了收集人类基线数据外,我们还将尽可能在相同的条件下,衡量我们感兴趣的人工智能在同一组任务上的表现,然后我们将把人类完成这些任务所需的时间转换为对人工智能自主能力的估计,正如我稍后将展示的那样。这里有一个说明性图表,以 Claude 3.7 Sonnet 为例,这是该论文发表时的前沿模型。你可以看到,对于非常短的任务,大约 4 分钟或更短,Sonnet 的正确率几乎是 100%,或者在这里甚至是字面上的 100%。对于最困难的任务,它正在挣扎,然后有一个范围,我们处于中间,你知道,我们在 10% 到 90% 之间。我会说,模型在需要人类更长时间的任务上表现较差的这种经验模式,你知道,这不是自然规律,但我们相当普遍地看到这种模式,至少在这个任务分布上是如此,我推测在其他任务分布上也是如此。所以我们试图将这条深紫色线拟合到这些数据上,关于人类完成模型正在尝试的相关任务所需的时间。然后,我们将预测模型将成功 50% 的时间点称为这些模型的“时间范围”,这是水平轴,人类完成时间轴。关于 50% 这个数字有很多可以争论的地方。我稍后可以谈谈我们选择它的原因。然后我们将对其他模型进行相同的操作。所以这里我有一个 Claude 3 Opus,它的时间范围大约是 4 分钟。这就是我们预测它在此任务分布上成功概率为 50% 的地方。对于 01 Preview,我看到大约 15 分钟,依此类推。然后,当然,所有这些模型,你知道,它们都是按日历时间发布的。所以,如果我们绘制时间范围,即这些图集的 X 坐标,与日历时间相对,我们会发现类似这样的东西。它看起来,你知道,有点像一个指数趋势,以某个恒定速率上升。事实上,它不仅仅看起来像一个指数趋势。如果我们在这里有一条完美的直线,它将表示一个完美的指数趋势。我们看到的是一个非常稳定、比我们最初研究项目时预期的要稳定得多的情况。而且这种情况一直持续下去。所以你们很多人可能在 Twitter 上看到过我们对这张图表的更新。这张图一直更新到 GPT 5.1 CEX Max。所以这是非常近期的预测,我认为这些预测来自这条惊人地笔直的线,一直都很准确。快速退一步,基准测试告诉我们什么,或者在这里是类似基准测试的证据?嗯,一个方面是,人工智能可以在对人类来说极其困难的任务上取得成功。我们 Rebench 中的任务,你知道,对我个人来说远远超出了我的能力,而人工智能在其中表现不错,有时能取得相当不错的成绩。第二个方面,你知道,很明显,进步是迅速的。>> [吸鼻声] >> 另一方面,嗯,你知道,我们应该在多大程度上相信基准测试提供的证据?它们可能有什么局限性?很多,但这里有三个我将要指出的。一是,正如我提到的,这些人是专家,在某种相关意义上,但他们缺乏背景知识。这就像他们上班的第一周。他们以前从未见过完全相同的任务。他们只有一些相关的经验。可以推测,那些不仅有相关经验,而且非常熟悉任务集的人,将能更快地完成任务,然后我们认为相对于那些人,人工智能的表现更好。二是,基准测试可能存在上限。即使是 GPQA,再次以它为例,我们开始达到该基准测试完全饱和的点,不再为边际模型提供额外信息,而时间范围提供了一种很好的方式来在某种意义上随着时间的推移将基准测试链接起来。但是,你知道,尽管如此,当模型的“时间范围”大约每六到七个月翻一番时,仍然很难创建这些越来越难的任务。所以即使是时间范围也可能很快饱和,或者构成时间范围的基准测试也可能饱和。下一个问题不是一个仅限于 META 任务的问题,也不是时间范围背后的任务。它也适用于 SWE Bench,也适用于你们许多喜欢的代理基准测试,即问题在某种意义上并不非常混乱。它们不需要与人类进行大量协调。它们通常在相对较小、受控的环境中,在那里很少会出错。你知道,不是那些庞大的开源代码库,或者其他问题可能涉及更多与现实世界的互动,或者在某种意义上很混乱的方式。所以我们做了这个项目,然后在年初,我们正在思考,我们如何解决这些局限性?还有什么其他证据来源可能有利有弊,但重要的是在科学术语中具有更高的外部有效性?也许现场实验是答案。[吸鼻声] 所以更经济学式的证据。在这里,我们可能对高背景的开发人员感兴趣,他们擅长他们已经正在进行的任务,他们是否会加速,或者某种意义上的生产力提升。你知道,即使在基准测试显示的一些超人类范围内,它似乎也具有更多的信号。你知道,也许 GPQA 完全饱和,你获得了 1.5 倍、2 倍的加速,但你仍然可以实现 3 倍、4 倍、5 倍的加速,即使在那之后,我们仍然保持更多的信号。最后一个是,你知道,任务更混乱。它们是人们在实际工作中遇到的任务。它们不是合成的。它们不是小而受控的。这是一个真实的部署场景。这是我们将要为这篇论文做的事情。我们将招募 16 名经验丰富的开发人员,他们将在大型、成熟的开源项目中工作,我们稍后会详细介绍。这些开发人员平均每人将完成大约 16 个他们实际工作中的任务。这些是相关 GitHub 存储库上的问题。他们可能否则会完成的事情,但有一个前提是,最长的问题我们不包括。任务将被随机分配到“不允许使用 AI”或“允许使用 AI”。“不允许使用 AI”的意思就是你所想的。这意味着 2019 年的软件开发。这意味着没有 AI 驱动的标签自动补全。这意味着没有光标代理编码工具。这意味着通过 Web UI 没有 LLM。或者它们可以被随机分配到“允许使用 AI”,在这种情况下,一切皆有可能。你知道,我刚才提到的任何 AI 工具,或者不使用 AI 工具。如果你处于“允许使用 AI”的条件下,你没有义务使用 AI。你只是有这个选择。我们为这些开发人员购买了 Cursor Pro。所以,在大多数情况下,他们使用的是该工具,当时通常运行的是 3.6 或 3.7 版本,这是我们进行这项工作时的前沿模型。然后我们将记录开发人员完成每个任务所需的时间,并查看允许使用 AI 与不允许使用 AI 时他们可能节省的时间。这些是其中一些存储库。你们很多人会熟悉它们。我们有 Haskell 编译器代表。我们有 scikit-learn。我们有 hugging face transformers。这些平均有数百万行代码。它们已经存在了 10 多年。将要在这类存储库上工作的开发人员,作为这项研究的一部分,平均是这些存储库中数百甚至数千名贡献者中的第三大贡献者。他们个人平均为该存储库贡献了大约 5 年。这些是顶尖专家。你们中的一些人可能也见过这张图。所以,结果对你们其他人来说已经剧透了。我们询问经济学专家、机器学习专家,你知道,这些人来自主要的人工智能公司和实验室,顶尖的学者,一些研究生等等,你知道,他们预计开发人员在使用 AI 时会节省多少时间。他们说大约 40% 或略少。我们询问开发人员自己,研究参与者,他们提前预计会加速多少,他们说大约 24-25%。然后我们询问开发人员,研究完成后,他们认为在允许使用 AI 的情况下,他们完成的研究中的问题速度有多快,他们说这会让他们速度加快大约 20%。而结果是,我们发现开发人员被减慢了 19%。与不允许使用 AI 相比,允许使用 AI 时他们需要花费 19% 的时间。你知道,当我第一次看到数据进来时,看到这个图表的早期版本,我想,也许和你们许多人现在想的一样,我们搞砸了。你知道,出了什么问题。我们在实验设置上出了问题。这怎么可能呢?你知道,至少这些开发人员可以访问零点,因为他们任何时候都不能使用 AI。所以我们仔细研究了,你知道,很多很多很多很多小时的屏幕录像,这些开发人员在研究中处理问题。我们深入研究了一堆可能解释正在发生的事情的假设,并试图对我们认为正在发生的事情与未发生的事情进行分类。其中很多都列在论文中。我将快速浏览一些我们认为有助于解释的因素。首先,对 AI 用途的过度乐观。这似乎是一个显而易见的原因。你知道,即使研究完成后,开发人员仍然认为 AI 将对他们的工作有所帮助。他们可能会因此过度使用 AI。另外两个是隐含的存储库上下文和高开发人员熟悉度。你知道,这些开发人员已经知道问题的解决方案。他们不是,他们在这个工作中非常专业。你知道,我设想他们不是花大量时间思考 AI 可以解决的解决方案。相反,他们只是受限于打字速度。这意味着,你知道,使用 AI,指示 AI 来做,与他们可能花费的时间相比,具有显著的时间成本。我认为我们许多人都有这样的感觉,即 AI 在大型复杂存储库上的表现可能不如在基准测试式证据或一些先前工作上。然后是低 AI 可靠性。你知道,也许 AI 在这些类型的任务上表现出色,但你知道,它们只表现出色 50% 的时间,或者 80% 的时间,20% 的时间。所以,至少你需要事后检查他们的工作。甚至可能需要花时间事后纠正他们的工作,这是我们在这些问题上经常看到的情况。关于影响不确定的因素,我将简要提一下,我稍后需要与人们谈谈,是低于平均水平的 AI 工具使用,这在公众讨论中出现了。这被列在不确定的栏目中,因为它既是支持证据,也是反对证据。这对这里的许多事情都是如此。我们没有那么确凿的结论要说,我们仍在研究这条线。这里有一些重要的注意事项。首先,你知道,显然我们没有为所有软件开发人员或任务提供证据。这些是经验极其丰富的开发人员,他们在极其复杂、长期的开源存储库上工作。你知道,在我自己的工作中,我不是像这些人那样有相关的专业知识。我在更小的存储库上工作。我感觉更舒服地说,即使在这个时候,我也被 AI 工具加速了,即使开发人员没有。这种情况很奇怪。它很奇怪,原因与它有趣的原因相同,这个不寻常的开发人员群体。第二,实验集中在 2025 年 3 月。正如我提到的,我们知道 AI 进步迅速。也许当我给你做这个演讲时,这个结果可能已经改变了。所以这里有一个难题,你知道,基准测试式的证据给人一种对今天 AI 能力的令人印象深刻的认识,而更经济学式的证据,你知道,我在这里也包括了劳动力市场影响,以及我们的现场实验,看起来有些悲观或不那么令人印象深刻。你知道,为什么前者没有转化为后者,至少表面上看是这样,似乎存在冲突。我们如何着手解决这个难题?一种可能性是,事实上我们搞砸了。这仍然是可能的。你知道,也许开发人员真的不擅长使用 AI,如果我们继续进行这个实验,正如我们正在做的那样,他们会,你知道,更多地熟悉这些工具,从而获得他们当时没有获得的生产力效益。我对这个说法有些怀疑,但这是其中一种可能性。经济学家喜欢提出的另一种说法是,我们没有激励这些开发人员快速完成。我们按小时支付他们报酬,这是出于外部有效性的原因。你知道,看着他们的视频,我真的不认为他们根据这些激励措施以不同的方式开发,但这当然是一种可能性。你知道,另一种更统计学性质的可能性是,你知道,这是一个小型研究。你不应该过度更新如此小的研究。我们正在做更大的事情,我很高兴在某个时候发布。好的,但让我们假设我们没有搞砸,并且这是一个我们认为成立的结果。我们如何解决这个难题?[吸鼻声和叹气声] 所以,一种可能性,你知道,正如我简要提到的,是可靠性需要非常高才能节省时间。你需要让开发人员输入的问题得到正确的答案。你知道,大约 95-99% 的时间,开发人员才能通过标签标签标签,你知道,不花费大量时间来验证 AI 的工作,这当然从时间角度来看成本很高。另一种可能性是,像 SWEbench 这样的算法成本效益评分,与可合并性评分相比。SWEbench 分数并没有试图考虑代码是否可以被其他人将来维护,或者它是否符合单元测试未考虑的质量考虑因素。你知道,也许 AI 确实在 SWEbench 式评分方面表现出色,但并非在我们可以关心的这种更全面的评分方面表现出色。低背景与高背景基线。我之前提到过,这些只是更熟练的人类,你知道,相对于那些人类。也许 AI 的能力较弱。任务分布,也许这些只是不同类型的任务,你知道,特别是比基准测试式任务不那么混乱。也许这就是解释这里发生的事情的原因。[吸鼻声] 次优能力提取。META 在使代理在我们的任务上尽可能高效方面付出了巨大的努力。你知道,这涉及到消耗大量的 AI token。也许在研究完成时,尤其是对于 Cursor 而言,情况并非如此。然后是任务之间的相互依赖性。也许人类可以完成任务 A 和任务 B。AI 只能完成任务 A,但不能完成任务 B,当然可以更快地完成任务 A。那么人类仍然有意义地完成任务 A 和任务 B,而不是委托任务 A,因为你知道,他们需要知道输出。他们需要知道任务 A 是如何完成的,以便可靠地完成任务 B。我认为这是部分原因。你需要保持上下文,当你处理这些子任务时。最后,我想说我们正在招聘,不仅是为了你所看到的这项工作,这项工作一直在扩展,你知道,越来越长的任务,越来越雄心勃勃的 RCT,甚至更多的证据来源,我们可以从中推断出关于 AI 能力的真相,而且还有更多。你可以在 meter.org/careers 找到。特别是,我非常期待研究工程师、研究科学家,他们可能隐藏在目前的听众中。我们不仅期待有学术经验的研究型人才,也非常期待有创业精神的人才。我们还在招聘一名运营总监。说到这里,非常感谢您的聆听。热