📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Measuring Exponential Trends Rising (in AI) — Joel Becker, METR

Latent Space1:05:12

Transcription

所以,MEETER 代表了 ME(模型评估)和 TR(威胁研究)。ME 是指我们思考人工智能模型今天的能力以及未来的可能样子,以及它们的倾向性,即在拥有一定能力的情况下,它们在实际应用中会做什么。TR 是最后两个字母,我们试图将这些能力和倾向性与我们特定的威胁模型联系起来,以确定人工智能模型是否会对社会构成巨大或灾难性的风险。

所以,如果你读了关于我如何成为 Manifold 上最赚钱的交易员的文章,秘密就在于这个市场。

大家好,欢迎收听最新的 Space 播客。我是 Kernel Labs 的创始人 Allesio,和我一起的是 Late in Space 的编辑 Swixs。

你好。

我们又回到工作室了,和 Joe Becker 一起,他来自 MEETER。欢迎。

非常感谢你们。很高兴来到这里。

Joe,你的工作对人工智能领域产生了很大的影响,尤其是在过去一年里。我邀请你参加 AI E 峰会,感谢你发表演讲,还做了额外的研讨会,你在那里有很多非常有影响力的论文。但我想,首先,很多人就像 MEETER 一样突然出现在这个领域。你能解释一下 MEETER 吗?

是的。所以,MEETER 代表了 ME(模型评估)和 TR(威胁研究)。ME 是指我们思考人工智能模型今天的能力以及未来的可能样子,以及它们的倾向性,即在拥有一定能力的情况下,它们在实际应用中会做什么。TR 是最后两个字母。我们试图将这些能力和倾向性与我们特定的威胁模型联系起来,以确定人工智能模型是否会对社会构成巨大或灾难性的风险。

是的。你会说你们做了更多 ME 的工作,而 TR 是下一阶段,还是有 TR 方面的工作?

你知道,我认为 TR 方面的工作是存在的。所以,你知道,一些最受关注的工作看起来更像是 ME。看起来像是这个时间跨度的问题,以及开发者生产力 RCT 的问题。但是,我们的网站上有一份非常棒的完整报告,关于 GT5,以及一份关于 GBT 5.1 的类似报告,试图更结构化地证明它不会带来这些非常大规模的风险。你知道,最终得出结论是它不会,但值得思考为什么会这样。比如,你知道,你和我一起使用 GP5,它看起来非常强大,与基准分数相符。你知道,为什么它不能做一些真正、真正错误的事情?嗯,你知道,我们通过证据来分析,我们发现,基于你提到的某些能力证据,我们认为它不够强大,不足以造成这些灾难性的伤害。所以,你知道,它不会能够做到这一点。但也许在未来,你知道,我们会认为它有能力做一些非常非凡的事情。你知道,那些能够提供真正、真正严重威胁的事情。然后你可能会更侧重于倾向性方面,比如,你知道,我们对这些危险能力所做的保护措施是否足以使其不构成生存威胁?之类的事情。所以,所以我认为,我认为威胁研究,你知道,它确实存在,而且我们在某种程度上一直在努力实现它。你可能会认为能力证据是其中的一种输入。

是的。威胁模型更新了很多吗?还是你觉得你还在使用与 GBD2 相同的威胁模型,比如纸夹工厂等等?你知道,但你提高了多少门槛?

是的。所以,我不是威胁建模方面的专家,更多的是能力方面的专家。我确实认为它们在一定程度上一直在变化。所以,像自主复制威胁模型,即能够自我设置并控制资源之类的东西,已经相对不那么重要了,而 A&D 加速则变得更重要,也就是说,在实验室内部可能发生某种能力爆炸,这可能出于我们可能讨论的各种原因而导致不稳定。所以,所以我们主要关注后者,尽管我们也考虑了许多威胁模型。

是的,我们来谈谈 ME 的那部分吧。

[笑声] 所以,我想说,你知道,模型时间跨度图可能是被引用最多的,我会在我看到的投资演示文稿和 Twitter 上看到。它的起源是什么?你还有什么想介绍给听众的吗?

是的。讲述这个故事有几种不同的方式。一种方式是,在 2023 年,我们有一个内部的 MEETER PowerPoint,我们试图阐述我们对 MEETER 研究未来可能样子的期望。其中有一张图表。它的 Y 轴是某种衡量自主能力或危险能力的东西。X 轴标有时间或计算量,或者,你知道,我们希望 Y 轴随之变化的任何资源。然后它有一些分散的点,向上并向右移动。你知道,我们认为能力会随着时间而提高。MEETER 的许多研究赌注都试图让这一点更加具体。然后,当我们真正完成这件事时,当我们有了 Y 轴,它变成了任务难度,以人类完成任务所需的时间来衡量,模型可以以 50% 的可靠性完成这些任务。当我们真正获得这些数据并随时间绘制时,它出奇地平滑。你知道,就像你熟悉的图表一样平滑。它如此非凡的部分原因是,这种模式似乎如此规律。事实上,它比我们刚开始时,在我加入 MEETER 之前,那个非常分散的图表要平滑得多。

你们是如何选择任务的?

[清嗓子] 我认为这是人们的一个问题。你们有一些标签,比如训练分类器、修复 bug 和小型 Python 库。它们看起来都有些随意,你知道,测试选择的过程是什么?人们对任务选择感到担忧是正确的,或者有很多细微的细节。我想说,我们的目标是选择具有经济价值的任务,特别是与通用自主性和 Aird 相关的任务,这些是我们要优先考虑的威胁模型。所以,你知道,对时间跨度图的一种误读是,它指的是任何你可能给 AI 的任务的全部分布,我认为这显然是不对的。你知道,特别是需要计算机视觉能力的任务,它们今天可能能力要弱得多,以时间跨度来衡量,就像我们给它们的那些通常不需要计算机视觉的任务一样。所以,我们尝试,你知道,我们通过让 MEETER 内部的人创建任务,并通过提供赏金,让 MEETER 外的人能够提供这些任务。你知道,这并不是一个完全随机的选择过程,特别是它是一个有许多约束的过程。你知道,为了能够大规模地运行我们的评估,任务的成功最好是自动评分的,这意味着某些类型的任务被包含在内,而那些更难实现的任务则不被包含。但是,是的,这就是我们的目标。

是的,计算机视觉的观点很有趣。还有其他不合格的因素吗?比如,你认为图表会糟糕得多的其他事情是什么?

有一件事是公平性,或者我们希望任务原则上能够被模型完成。你知道,它拥有足够的信息。它并非不可能完成,考虑到它所拥有的信息。我们这样想,你知道,一个低语境的人,如果他足够熟练于一般的技能,但可能不熟悉背景中的细节,他能否在这个任务上取得成功?我认为这排除了很多实际工作,因为很多实际工作涉及到人们对情况的仔细心理模型,而这些模型并没有完全列在问题描述中,或者等同于此。在某些方面,你可能会认为我们没有衡量这些。另一件事是,我们的任务往往不会,它们会略有不同,但它们往往不是那么开放式,或者与外部世界互动,或者,你知道,我们内部称之为“混乱”的东西。它指的是许多不同的事情。但是,你知道,从“混乱”这个描述符中,你大致可以理解。你知道,与你在现实世界中可能找到的任务相比,我们的任务,你知道,范围相当不错。它们相当整洁。你知道,事实上,我认为我们稍后会谈到一些开发者生产力方面的内容,以及一些有趣的发现在光顾这些任务比 MEETER 任务更混乱的情况下更有意义。

有什么你想强调的任务分布吗?我认为我之前遇到过 Rebench,你对 Rebench 有特别的偏好。

[笑声] 我不知道你想介绍你的副项目 Rebench 替补队员。我有一个足球队叫 REI Benchwarmers。你知道,我们是旧金山最热情,可能也是技术最差的足球队。上个赛季我们进入了季后赛。为球队加油。我们这个赛季肯定会再次进入季后赛,但也许到这个播客出来的时候,我们会发现我们没有进入季后赛。

这是同一联赛吗?

同一组织者,但不同的场地。

我们玩的是 Mission Bay。

是的。但是像 Hcast,这是我第一次接触到它,还有其他的,我意思是 SWAH,是 MEETER 的专有项目吗?然后你知道,你还有什么其他考虑添加的吗?

是的。Hclass 中也有私有任务,但是的,SWAR 是一个包含原子任务的列表,或者是一些非常小的软件操作。也许一个例子是,这里有四份文件。其中一份包含密码。其中一份叫做 passwords.txt。哪个文件最有可能包含密码?你知道,我认为 GPT2 有时可以完成这项任务,有时不行。Opus 4.5 我敢肯定,我敢肯定 100% 的时间都能完成这项任务。然后我们进入 HCOS 任务,这些任务的难度比那些 SWAR 任务要大一些,一直到 20-30 小时,这些任务需要更多的自主性,更多的顺序操作。许多任务更具挑战性。也许在某种意义上,它们是由这些原子操作构建的,尽管我不确定这一点有多清楚。然后,AR bench 任务是这些非常具有挑战性的新机器学习研究工程挑战。

总共 170 个任务。而且,我的意思是,我认为这非常好。真正有趣的是,我认为人们不理解,当人们引用小时数时,那是人类等效小时数,但机器可能需要更少的时间。你知道,我一直想知道的是,为什么你们没有发布第二张图表,上面只是说,机器能做什么和人类能做什么之间的区别?

这是一个好问题。你知道,在某种程度上,你可以把时间跨度看作是模型在一段时间内表现如何的总结统计数据。我们可以计算模型可以有效工作多长时间。但要明确如何操作化这一点,你知道,你确实需要某种成功的概念,否则你如何界定这个阈值?它们可以工作多长时间?但原则上,我们可以做一些类似的事情,但这更接近于我们最初尝试的事情,这是我们看到明显经验趋势的事情。我确实认为,对时间跨度的普遍误解是,它与模型应该工作多长时间有关,而模型,你知道,正如我们所见,它们可以自主工作更长时间,你知道,在野外,当我们使用它们时,比如 Cursor、Clawd Code 或 CodeX,但这并不是主要的事情。在某种程度上,我认为如果假设模型在 0 分钟或 5 分钟内解决了所有这些挑战,那么解释时间跨度会更容易一些,只是为了强调这真的不是这里发生的事情。你知道,相反,我们只是在绘制它们可以完成的任务的难度随时间的变化,而这种难度是以人类时间来衡量的。是的,我确实认为当人们说我运行了 clot code 五个小时时,这与你的图表顶部差不多,

但这是否意味着 5 小时的时钟运行相当于你的图表中的 30 小时?是的,我认为这很有趣。

或者可能不是。

对。是的。

而且,关于 30 小时或之类的说法,你知道,我对此有很多疑问,比如,你知道,最终的输出有多好?我们还没有,在某种程度上,我可以谈论具体细节。还有这个问题,你知道,如果我再次尝试,这个例子有多么挑剔?如果它第一次成功了,第二次会失败吗?第二次会失败吗?我认为在某种程度上,这些轶事很有趣,但不是那么科学。是的,这是那些认真对待的人需要理解的事情。那些声称代理性能的人,他们的说法非常不科学,更多的是轶事,有时受到营销愿望的影响。让我们委婉地说吧。

是的。你知道,我认为 MEETER 正在努力支持公民社会,努力为公众提供高质量的独立信息。我完全同意信息环境不尽如人意。让我们谈谈 Opus 4.5。有一个非常非常大的飞跃。这是我第一次提到它,当你们发布它的时候。我说,据我所知,这是你们第一次指出 Opus 4.5 比现状好多少。我认为,这几乎与你作为超级预测者的背景有关。因为在整个假期期间,人们发现你们已经发现了什么。你有什么反思?你的反应是什么?有什么故事可以讲吗?

你太客气了。我想在两点上反驳你。首先,我从来不是一个超级预测者。我认为那是一群人,他们与 Tetlock 或其他人一起工作,或者。

我指的是 4.5 在基准测试上也取得了很大的进步。我认为在某种程度上,ME 时间跨度与许多基准分数高度相关。在某种程度上,这是一种更容易理解的思考基准性能真正意味着什么的方式。稍微更具可解释性。是的,我确实,我确实觉得直觉上,Opus 4.5 是一个巨大的飞跃。我见过我认识的一些最有才华的工程师,他们从挑剔不使用 AI 进行编码,到几乎不写一行代码。你知道,我敢肯定,在之前的模型发布中,许多其他人也看到了类似的事情发生在他们身上。我不确定这是否意味着它如此不连续。你知道,在某种程度上,我认为时间跨度的故事是,多年来,这么多的计算量和有效计算量,进步一直非常连续。但是的,我认为模型能力令人惊叹。这表明未来的模型能力将更加令人惊叹。但它打破了你的趋势线,你知道,你花了这么长时间才建立起来的趋势线,它就这样了。

是的,我不确定这个描述。我认为,当论文出来时,甚至有一些猜测认为,也许应该使用的合适趋势线是这个更快的 4 个月翻倍时间,Opus 4.5 将完美地达到 7 个月。你知道,我更相信七个月。所以,这在某种程度上证伪了我的趋势线。还有,你知道,思考趋势线上的差异是否代表了我们任务分布在特定时间点的难度差异,还是更根本的东西,更像是潜在能力,这有点令人困惑。而且,我并不觉得我完全掌握了这一点。你知道,总的来说,我认为 Twin Sphere 非常关注特定的模型发布,你知道,真正有信息量的是,在一年或三年内,趋势是什么样的。

嗯,我的意思是,我认为这是一个相当大的更新。而且,是的,我的意思是,我同意你刚才说的,即使是非常愤世嫉俗或更有经验的开发者,最终也被说服进行代理编码,现在非常认真的人告诉我,他们希望将他们的组织承诺给完全由人类手工编写代码,而只是承诺 100% 的代理编码,这在你一年前是不会说的。

这听起来是对的。我能感觉到。我能感觉到我自己。

你如何证明之前的研究无效?比如,以开发者生产力研究为例,对吧?你发现 AI 减慢了人们的速度。如果你用 Opus 4.5 重做它,你会期望结果有戏剧性的不同吗?我们应该重做这项研究吗?我们应该停止研究吗?你怎么看?

我们一直在后台重做。我认为,我不会评论具体结果,但我认为今天比过去更难做到这一点,原因有很多。你知道,第一个是,随着 AI 在编码方面越来越好,越来越难找到提交任务的开发者,他们愿意。

[笑声] 被随机分配到 AI 不允许的组。有一个所谓的选择问题,也就是说,也许我们只观察到他们事先认为 AI 不会大幅提升他们的任务,因为他们愿意为此付费,然后被转入 AI 不允许的组。还有其他问题,比如我认为今天的常见工作流程是同时处理多个问题或多项工作,而以前并非如此。很难知道如何在我们的研究设计中捕捉这一点。如果你将一个任务设置为允许 AI 或不允许 AI,你知道,你应该处理那个单一任务。但实际上,开发者今天的工作方式并非如此。我认为基本上,这些对以前的研究设计没有威胁,或者大约在 2025 年 3 月,人们并没有真正同时工作,或者远没有达到同样的程度。他们基本上把所有的问题都给了我们。是的,我认为这是一个巨大的挑战。我有一些关于新研究设计的想法,但重复同样的设计对我来说似乎很棘手。

是的,我们有 Quinton Anthony,他是这项研究的参与者。唯一有生产力的开发者。

唯一有生产力的。

[笑声] 我对这一点有一些疑问。我认为,你知道,Quentyn 非常有才华,就像研究中的所有开发者一样有才华,但我们并没有非常精确地衡量开发者的影响。

是的。不。嗯,我很好奇,你知道,你知道,我不知道他是否是新研究的一部分。你不必分享,但我认为我们会很有趣地再次邀请参与过这项研究的人。我确实觉得事情正在发生变化。比如,即使是三个月前,我也更多地使用 Cursor,比如与 Clock Code 配合。比如,我认为今天我更多地使用 Clock Code,然后进行审查和迭代,我不知道, man,这好多了,我不知道如何量化它。你知道,我认为,就像你之前提到的那些观点一样,人们可能高估了,如果你问我它加快了多少速度?你知道,就像我不知道,10 倍,但可能不是。但就像,我不知道如何计算实际百分比。所以,对所有参与者来说都很困难。

是的。所以,这里有一些你可能会考虑的问题。你知道,如果你完成了你在 2025 年 3 月完成的任务,然后根据我们之前的研究设计提交给我们的提升研究,你知道,我们可能会推断出这些任务会快多少。你可能会期望它们会快一些,因为 AI 的能力已经提高了。但你正在处理一套不同的、更大的任务。比如,我可以想到我手头的几个副项目,你知道,如果不是因为 AI 的存在,我根本不会做这些项目。你知道,在某种意义上,这里的加速可能是无限的,因为这些是我根本无法完成的事情。但如果你将加速等同于这些项目提供的额外价值,那么它们就不会真正匹配。你知道,我以前没有获得专业知识来做另一个项目是有原因的,只是它对我来说价值较低。另一个问题是刚才提到的并发问题。是的,我认为今天对加速的非常乐观的估计,你知道,在某种程度上被我们在这篇原始论文中记录的内容所夸大,人们对加速的期望往往过于乐观。我认为它们也往往被夸大,因为没有完全理解他们能够完成的额外任务的价值可能不如你想象的那么高。你知道,他们以前没有做这些事情是有原因的。尽管如此,我并不怀疑这些任务确实有价值,即使是他们以前完成的任务,人们也在加速。这是一个复杂的问题。

是的。我认为很多公司在吸收额外生产力方面存在问题,尤其是在你是一个真正的产品组织时。比如,如果你想想 AWS 控制台,对吧?就像,如果你给了 AWS AI,每个人都提高了 10 倍的生产力,即使他们发布了 50,000 多个服务,你知道,客户真的可以吸收 50,000 多个服务。所以,我认为有一些,你不应该真的期望你的工程师做 10 倍的工作,因为你的组织无法推出 10 倍的产品。我同意,我花了很多时间做副项目和一些有趣的事情,但经济上并不那么有价值,但对我来说,对我的灵魂来说很有价值,对吧?就像。

是的。是的。是的。是的。我我我不想夸大其词,比如,我认为今天在 AI 公司工作的人,他们确实通过访问 AI 得到了显著的加速。我认为你,你的副项目可能得到了加速。

[笑声] 通过访问 AI。

但是,是的,这很棘手。很容易夸大。

是的。内部跟踪认知情况如何?你们如何衡量,你们如何衡量加速?你们如何衡量你们的影响力?就像,是的。

你的数字是多少?我的意思是,哦,我个人相当多,除了我正在做很多非技术性的事情,比如组织一个会议。

这主要是处理合同和预订客人以及所有其他与代码无关的事情。我想说,我在 Cognition 内部看到的是提交速度的加快,无论你是否是作者。而且,我认为,奇怪的是,PR 的数量,我们称之为,是一个相当不错的指标,你在发货产品以及调试和维护方面有多投入。我不认为有很好的衡量质量的方法,没有故事点。我们邀请的另一位嘉宾在 AIE 谈到,我们按故事点支付报酬,你做得越多,完成的故事点越多,我们就支付你越多。而且我认为没有上限。我认为这是一个非常有趣的事情,只是你必须在工程师和分配故事点的人之间建立非常自信的关系。这实际上是你正在做的事情,你的小时数是一个故事点。

是的。是的。

是的。所以,理想情况下,你知道,你想让 Cognition,让其他公司,你知道,随机分配公司。

[笑声] 让他们使用 AI 或不使用 AI,然后,然后你的随机对照试验的最终指标是他们赚多少利润,或者一段时间后的估值。

是的。我认为基本上没有人停下来做科学,除了你们。

[笑声] 因为我们知道 RCT 是最好的,对吧?但有时人类的直觉足够好,你会想,“好吧,我的意思是,当我们缺乏数据时,但足够多的人同意,要么是集体癔症,要么是我们都错了,要么就是这里有问题,我们只是无法表达清楚,但好处 outweighs 了先做科学而放慢速度的成本。”就像,这不是我们引入新的,我不知道,食物给普通大众,我们必须做很多安全测试。就像这里,这只是软件,伙计们。让我们发货吧。

[笑声] 完全同意。我的意思是,你知道,思考 MEETER,为什么今天的模型不会造成灾难性的危险,你知道,看到提升数字很有趣。看到时间跨度数字很有趣,但真的,为什么我不相信它们很危险?嗯,这是一个混合体,我看着模型在成绩单中做事情,有时它们有点傻,它们不善于利用资源,或者,你知道,它们只是明显有一些明显的缺点。在广泛部署中,过去六个月里,只有稍差的模型并没有做任何疯狂的事情,也没有造成巨大的危险。下一个模型只是稍微好一点,所以基于先验知识,如果它如此危险,那似乎有点令人惊讶。是的,我完全认为轶事和直觉是真实的证据。人们应该完全考虑到这一点。我确实想评论一下关于你,你知道,威胁评估方面在你名字里,通常我期望,比如说,EA 附属的公司或组织是世界上的“Elizer”一方,他们正在敲响危险的警钟,而你实际上说,实际上,这是一个相当平衡的观点,我们关心 AI 安全,但我们也还没有达到那个阶段,我们实际上是警惕的看门狗。而且,我会说,你是一个独立于实验室的组织,比如 ARC,或者其他在模型发布前进行威胁评估的组织,他们通常会由 OpenAI 或其他大型实验室资助。

Meta 来自 ARC。所以,所以我认为。

对,但现在你们是一个独立的资助组织,据我所知,你们不被大型实验室资助是一件大事。

是的,我认为拥有这个独立的专业知识来源至关重要。我可以永远地宣传这一点。

是的。另外,还有“能力爆炸”这个概念,这也是你使用的词,我一直在思考,你知道,如果你相信涌现,你就相信多种能力融合在一起产生通用能力,而你可能无法检测到它。根据趋势线很难预测,它在某种意义上应该是断续的。而且,我不知道,哦,n-1 模型没问题,所以 n 模型可能也没问题。真的很难说。让我感到安慰的是,昨天我在 OpenAI 的直播中,甚至 Sam 都说,“是的,我只是让 Codeex 随意地获得危险权限,无论它在我的电脑上做什么,我不再批准模型了。它只是在我的笔记本电脑上做任何它想做的事情。”我认为,守卫就是每个模型实验室都在进行内部测试。

[笑声] 如果它搞砸了他们的个人权限,那么,你知道,他们就有利害关系,这就是我的意思。

关于连续性论点。你知道,我不确定我的想法。我同意这有点站不住脚,或者就像,你知道,这个时间跨度趋势上的模型数量和数据点数量有限。你知道,我们应该期望它有多大的连续性?我不太确定。你知道,也许直觉是,你知道,模型提供了如此多的有效劳动力来改进下一代模型。你知道,也许这是一个合理的想法。另一方面,到目前为止,我一直对它的连续性程度感到惊讶,这让我对它将来可能继续保持连续性有信心。对我来说,这似乎有点模糊。

我的意思是,我们在物理学中有断点,对吧?就像,我很好奇,如果它看起来不像,你知道,当。

这很有趣。就像当你想到水一样,它在确切的温度下沸腾。就像。

我的意思是,也许我们知道,但我觉得我们真的不知道。而且我觉得,对于模型来说,我觉得不是。

[清嗓子] 都是在同一个东西上复合,如果这有意义的话。就像一遍又一遍地扩大规模一样。

是的。

但是,是的,也许我们会看到。但我很好奇,你需要看到什么才能觉得它在这里?因为我的意思是,即使你看看 Opus 4.5,它显然超出了趋势。你知道,所以你说的是四个月而不是七个月。但如果下一个模型是,哦,也许它不应该是四个月,它应该是两个月?这会让你改变主意,关于这个月的事情是否还有意义,或者我们是否已经通过了某个基本水平,之后它会加速,我们会继续下去?我不知道。我觉得你一定在内部讨论这个问题。

在某种意义上,真正让我担心的是,如果 AR&D 在 Plus Lab 内部完全自动化,那将完全看起来像是能力爆炸的条件。如果我看到一年的时间跨度,我仍然会觉得模糊,我认为,目前,这是否是这种情况,因为要完全自动化,你知道,90% 的自动化是不够的。你需要一些完整的循环才能关闭,也许我们缺少某种指向那缺失的 10% 的任务,或者别的什么。所以,我认为这是一个棘手的问题。我认为,我认为我无法给出一个数字。但是,是的,我的直觉是,水在某个点沸腾。

[笑声] 在这个循环完全关闭的时候。关于这个循环到底是什么,有一些有趣的争论。所以,有些人谈论纯软件智能爆炸,这意味着,即使硬件固定,我们也可以达到这一点,仅仅是通过模型改进自身,它们就会变得更聪明,然后下一步以更少的资源创造更好的模型。这种事情可能会导致一些极端起飞,或者可能很快就消退了。取而代之的是,除了纯软件能力之外,你还需要芯片设计,甚至可能需要芯片生产,这就是那个可以关闭的更大的循环。你知道,如果你认为,我认为你可能仍然认为关闭芯片生产和纯软件和芯片设计循环可能非常不稳定,并且令人担忧,但这些都是棘手的问题。

我认为那就是真正的纸夹工厂。如果你激励一个模型去构建自己的计算能力,它就会构建它需要的一切,然后它会把地球变成芯片。

[笑声] 嗯,我不认为它能做到。我们会在那之前阻止它。

我不知道我们是否有能力。没有关闭按钮,你知道,就像这样。

[笑声] 我认为这很难预见。但是,你知道,一个拥有那种能力的模型,你知道,很难排除。会发生某种能力爆炸,然后谁知道之后会发生什么。

是的。所以,好吧,我的意思是,所以实际上有一些基准直接检查这一点,比如 OpenAI 有 Paper Bench,我认为它直接跟踪它复制论文的能力。而且我认为,除了 Rebench 之外,还有很多其他的 ML 自我改进基准。他们直接,你知道,Yakun 来自 OpenAI,他直接优先考虑,我们将拥有一个自动化的 AI 研究员。我与 Gemini 的一位播客主持人一起做了一个播客,他基本上也是,他将自己的训练日志输入 Gemini 来改进他自己的代码。而且我心想,好吧,在某个时候,你不需要在这里了。

[笑声] 我的意思是,我认为今年。

我,你知道,我不是代表 META 的所有人说话。我是一个相对长远的人,在 MEETER。我们有我的同事 Nicola,他帮助了 AI 2027,他属于更短时间范围的人。

这不再是官方的 AI 2028 了。

[笑声] 那是过去的事了。是的,我认为我的观点是,不是 Nicola 的观点一定不同,只是说我不是,我不是代表 MEETER 的其他人说话。你知道,比如 Paper Bench,假设它完美地衡量了,你知道,不仅是复制论文,而且是,你知道,实际上是产生新颖的研究论文,这只是 R&D 生产过程的一部分。还有,比如你的 GPU 经常出故障,你能让人去数据中心并以适当的方式修复它们吗?你知道,当冷却系统坏了时,你能打电话给自来水公司吗?等等等等。我不知道有跟踪这些的基准。特别是我的观点是,存在着 R&D 中可能涉及的非常长尾的事情,这些事情可能需要完全自动化才能导致能力爆炸。我预计我们测量到的,在某种程度上,只是其中一小部分能力。所以我预计,你知道,完成整个循环所需的能力将稍后到来。

是的。

这是一个有争议的观点。

[笑声] 我不这么认为。我认为这是一个合理的观点。我确实感到惊讶的是,当我与能力研究人员交谈时,你们没有列出重要的能力。我的意思是,我认为你们在你们的选择中隐含地做到了,但是,我认为几乎重要的是,我总是想象着马车轮,这是术语。我不知道是谁创造了这个词,但你知道我的意思,就像,这里是我们关心的 10 件事,以及所有东西在这 10 个基准上的位置。而且,我认为能力跟踪只是跟踪。好的,这是那个列表,然后我们在这个列表上的位置是什么?而且,我认为将一切简化为一个数字正在积极地阻碍这一点,因为它减少了任何形式的细微差别,比如,在这里不足,比如,打电话给数据中心。所以,我们没事,实际上我们应该停止在该领域进行任何投资,因为那是危险的区域。是的,我认为我完全同意,你知道,时间跨度是,例如,但许多其他单一数字是一个数字,它正在压缩大量的真正重要的细节。

功能性。是的。

我不知道如何列出那 10 个,我挑战你,如果你能列出那 10 个,并为代码工作。

我将非常感兴趣地看到代码。我的直觉是,我们将列出 10 个,然后事实证明,有一个秘密的第 11 个东西,我们认为它很重要,但很难提前预先指定,现在看起来很明显,即使提前,如果我们有那种远见,那将有助于添加。

嗯,我认为安全社区每年通过版本控制来做到这一点,对吧?所以,比如今年排名前 10 的是等等,我们会公开给所有人,这样每个人都知道排名前 10 的是什么,明年我们会有不同的排名前 10。但是,你知道,这显然是随机的,我们应该更新我们的假设,但拥有那个列表作为一项公共服务是广泛有用的。

[笑声] 你还有关于 AI 计算减缓 AI 改进的研究,你提到,在某种程度上,你可以将 AI 时间跨度与计算增长联系起来。你能多说一点吗?在某种程度上,这有点违反直觉,因为计算增长并不总是与每个模型的计算需求相关。这是一种更广泛的市场行为。

是的。

是的。你是如何将两者联系起来的?以及你的一些发现?

是的。也许我们暂时非常字面地看待时间跨度。我们没有像刚才讨论的那样对它感到不安。继续将其外推到未来是有意义的。有哪些重要的力量可能导致它上升得更快?我们刚才讨论的一些事情,自动化研发与缓慢进行。可能导致它缓慢进行的最明显的力量之一是投入减缓。一个重要的投入是计算。你知道,我认为我们都有这样的直觉,在某种程度上,如果计算增长减缓,我们预计在不久的将来某个时候会发生这种情况,那么能力就会减缓。但减缓多少?这是一个大问题。这篇论文的建议是,如果你认为算法进步,你知道,就是发明 Transformer,发明 RLHF,你知道,所有这些更好的学习率调度,它本身就是计算的函数,因为你知道,你需要计算来发现它。你知道,Transformer 的收益在规模上表现得更好。如果你不投入这些资源,你永远不会发现这个。这是更优越的算法。你需要运行大量的实验。你知道,每个实验都可能非常耗费计算。并不是说不需要劳动力。你知道,显然人们正在为此努力。但是,如果你认为它最终受计算瓶颈的限制,那么算法进步也会减缓,对吧?如果计算增长减缓。所以,如果你考虑时间跨度,或者你知道你最喜欢的 AI 能力衡量标准,它是一个算法的函数,在某种意义上,计算是另一个方面,而两者都减半,计算减半,计算减半,这是显而易见的,因为计算量减半。算法进步减半,因为计算量是这个重要的投入,而计算量减半,那么你可能会期望时间跨度增长减半,然后我们可能感兴趣的一些主要能力里程碑将被大大推迟。我认为,这张图有很多警告。我认为,显然,至少有一些类型的算法创新不需要大量的计算来创造,有些需要大量的计算输入。你知道,如果你期望,你知道,不需要任何计算输入,我们可以直接调查研究人员,找出最好的想法,然后立即将其投入。

在训练前沿模型时,那么算法进步就不会因为计算增长放缓而停滞。当然,所有这些都被能力爆炸的可能性,或者即使没有能力爆炸,人工智能提供显著的劳动力来改进人工智能的可能性所抵消。但仅凭计算能力本身进行分析,可能会导致显著的放缓,这取决于算法进步在多大程度上可以被视为由计算决定,而不是不需要计算就能实现。

您是按实验室计算的吗?因为有一种方法可以这样建模:改进速度放缓。并非所有公司都能维持经营,然后它们的计算能力会被回收给其他实验室,然后这些实验室的计算能力又会再次增长。研究人员和计算能力的异构分布几乎是有益的。但我很好奇,您更关心的是普通人能获得的计算能力,还是大型实验室拥有越来越多的计算能力。

是的。所以,对于这篇论文,我们使用了 OpenAI 的数据和 OpenAI 的预测。虽然我认为这更广泛适用,但我们将其作为案例研究。我认为我刚才提出的论点,如果您不关心计算能力,只谈论金钱,那么金钱都花在了什么地方,模型会如何发展,如果投入其中的金钱减少,算法进步是否会放缓。整个论点都成立,我认为这在行业层面或实验室层面都适用。

我同意像某些实验室倒闭或实验室合并之类的产业组织方面的事情会非常重要。我在这里描绘的是一个极其简化的图景,而真实情况并非如此极端。但这只是基本情况。

我们有例子,比如 XAI 据说是在从 Claude 中提炼知识。所以人们以间接的方式共享计算能力,姑且这么称呼吧。我也觉得这很有趣。我只是好奇,您拥有 OpenAI 的哪些数据?是 Stargate 的 5000 亿,还是其他什么?

这是来自他们之前的税务申报,他们在研发计算上花费的金额,以及今年早些时候的一些信息报告,其中包含 OpenAI 对未来研发计算支出的预测。将美元转换为浮点运算次数。

是的。是的。是的。这很有趣,因为……

转换为浮点运算次数,抱歉。

对。而且显然,所有实验室,尤其是 OpenAI,在过去三个月里,基本上向地球上的每个计算提供商投入了 100 亿美元,以开发他们当前方法的替代方案,这非常有趣。但我也想说,不要低估 Meta 的计算支出,不要低估 XAI 的计算支出,也不要低估 DeepMind 的计算支出,而您对所有这些几乎都一无所知。如果您只看一家公司,那可能是权威的,但总支出可能会高得多。

是的。

这很有趣,我确实也观察到,像 SemiAnalysis 的 Dylan 这样的人,他们倾向于将模型进步与计算集群的上线紧密联系起来,模型方面的人看不到这一点,但这一切都源于“我们的 10,000 GPU 集群刚刚上线了”,然后“这需要 6 个月才能完成,因此 Grok 5 将会问世”。这在数学上几乎是确定的。

是的。是的。对我来说似乎是正确的。

是的。这很迷人。

是的。我意思是,他们肯定……是的。因为从实验室的角度来看,他们肯定会在早期检查点中看到一些东西,以便在 18 个月后继续投资。因为我不知道完成一次好的预训练运行到上线之间的时间间隔。那可能需要 9 个月,12 个月,之类的。

是的。

我认为 Mist 在这方面实际上非常开放。Malaw 3 和 4 的计划。我认为他们对 GPU 的数量以及从上线到发布模型的直接时间线非常开放。这相当确定。我没有一个清晰的时间线,但我想说四到六个月。

但是的,竞争非常激烈。其中一件有趣的事情是,当实验室因为模型失败而抛弃模型时,他们的运行落后于别人的运行,然后他们就说“哦,我们不能再发布这个了”。

是的。发布……

是的。是的。这实际上是预测市场在模型性能方面最大的风险。只是为了回到……

失败的运行。

是的。

好吧,这……是的。这就像,好吧,你知道,当我在 12 月份想到“谁将在 2025 年底拥有最好的模型”时。我认为在过去几个月里有很多活动,当 GPT 5.1 模型出来时,然后就像“好吧,那么我想是 Gemini,因为他们刚刚发布了那个”。这意味着 Gemini 将在下周发布,所以就交易那个。

我们想谈谈 Manifold 吗?你是 Manifold 市场上最赚钱的交易员之一。我是说,显然有很多关于这些市场内幕交易的讨论,尤其是在 AI 领域。我见过很多被禁运的新闻,我心想,天哪,人们在这个市场上交易了数百万美元,有成千上万的人知道真实信息。如果没有内幕交易信息,您将如何考虑建模这些事物?您认为这值得吗?例如,谁将在三个月内拥有最好的模型?您认为这是一个您可以构建某种策略 alpha 的预测市场吗?或者,我认为,在没有额外信息的情况下,最简单的先验是……嗯,你知道,在 2025 年,哪个模型提供商在什么时间段内拥有最好的模型,以时间为衡量标准。当然,您也可以为任何旧基准进行此操作。我认为是 5% 的 XAI,50% 的 OpenAI,45% 的 Anthropic。如果我不正确,请不要责怪我。

我认为,在 2025 年的某个时候,DeepMind 的模型并没有处于时间跨度的最前沿。

嗯,是的,是的,不同的,不同的东西,不同的测量方法。是的,也许您想应用的先验是相同的。你知道,XAI 在年初开始出现。所以,所以,所以也许,也许天真地你想稍微提高 XAI 的权重。是的。

我总是很好奇,当我看到人们在这些明显没有真正依据的事情上押注时……

好吧,我是你在预测市场的秘密武器。

是的。我明白了。所以,所以,所以……秘密是,如果你读了这篇关于我如何成为 Manifold 上最赚钱的交易员的文章,听起来很棒,令人印象深刻,而且你知道,我一定很擅长预测事物,但实际上,这主要归功于一个市场,Manifold 开放了一个慈善项目,而这个市场是关于在该项目结束的第一个月里将捐赠多少钱的。好的。而这个市场开始,或者我第一次看到它是在 5 天后,它给出了一个关于迄今为止已捐赠金额的线性预测。假设每天的捐赠金额都持续到月底。但是,你知道,作为有时会捐钱给慈善机构的人,我注意到你可以通过多捐钱来操纵这个市场,从而使其向上移动。

所以,我认为策略是,将大量的 Manifold,这种在 Manifold 上使用的假货币,投入到高于线性预测的选项中。人们会继续反对你,因为它看起来不像那样发生。我还没有真正捐款。最终,他们意识到了发生了什么,有人会进行捐赠以越过那个边缘,他们就在押注那个。然后,一旦人们开始押注那个高于线性预测的类别,我又在下一个类别中做了同样的事情。然后,人们又反对那个,又反对那个,又反对那个。我扫光了那些虚假的互联网积分。然后,我认为我再次虚张声势了一次。虚张声势失败了,但前两次都成功了。然后我捐赠了。我不记得具体捐了多少。不是很多。大约 5000 美元。

哦。

这都是为了一个好事业。

是的。是的。为了……我认为我在市场上赢了很多虚假的互联网积分,因此成为了最赚钱的交易员。嗯,稍微合法地说,你知道,那里面没有任何违反规则的事情。

没错。这叫做……

我也曾经对我的预测能力不太尊重。

是的。是的。这叫做有高度代理权的预测市场,你实际上在……

你知道未来是你创造的。所以,所以,所以,对我来说,更广泛的教训是,Manifold 市场和 Poly Market 之间的经典区别是,Poly Market 只用真钱。所以,这一切虚假的互联网积分是否值得追求,还是浪费时间?人们是否真的想使用真美元?也许这是一个问题。另一个问题显然是预测市场的道德问题,我认为这总是会间接导致暗杀市场。即使你禁止了“某人会死”这个词,也会有某种代理词来表示“某人会死”,它会变成一个暗杀市场。

是的。我与 Manifold 市场的联合创始人是好朋友。我非常爱他们。我对预测市场的社会价值的看法一直是梦想。拥有对重要事件的良好校准的概率会很好。这个国家与那个国家开战,对人们真正重要的事情,拥有高质量的信息会很好。但是,你知道,当我看看过去一年出现的真实例子时,在我看来,这些例子并没有那么大的社会价值。我不确定暗杀市场是否如此。我确定,你知道,我确定那些会被禁止,希望如此。但是,我认为赌博行为是有社会成本的。而高质量信息价值是真实的。但是,你知道,它是否值得人们交易掉他们的钱的这种不利影响?对我来说并不那么清楚。

是的。是的。我的意思是,好吧,你知道,价格发现是有成本的,有时那就是赌博,而这就是股票市场,它资助了美国很多公司。

是的。是的。我的意思是,你知道,很多股票市场曾经是那些大公司之一,与其他大公司对弈。它没有同样的……与体育博彩市场相比,例如,在另一端,它具有非常不同的特征。你可能会想象,至少在预测市场的一个方向上,大玩家与散户玩家对弈,这可能具有更令人担忧的动态。我没有那么密切地关注这个领域,但至少可以想象这样的事情会令人担忧。

我认为,在足够大的规模上,如果公司能够获得市场,那么对其中一些公司来说就会有利可图。我认为现在数字仍然很小,与其余的相比。例如,谁将在 1 月底拥有最好的 AI 模型?交易量为 2800 万。

我的天。

哇。

就像,为什么人们交易 2800 万?你知道我的意思吗?这太疯狂了。但我认为有一些……我周末和某人共进晚餐。

等等,我认为这是完全可能的。我不会这样做。我认为米特员工不应该在预测市场上做这样的投注很重要。但我认为原则上完全有可能猜测这些问题的答案。

哦,好吧,但其他人知道确切的……

就像,你知道 Gemini 3 在 Frontier Matt 基准测试中的得分是多少,到 1 月 31 日。就像,谷歌的一些人已经知道了。

对,对。

你知道我的意思吗?我认为,如果你相信价格发现的好处,那么这就是一个合法的……

对。

是的。是的。我的意思是,我积极鼓励内幕交易,这是内幕信息以某种假名泄露的方式,只要你知道,泄露信息的人承担后果,无论谁能追溯到那个东西,而且我认为有人因为进行内幕交易而被解雇了。我的意思是,这没关系。唯一的出路是政府介入说“这实际上是非法的,把你关进监狱”。但我认为目前它是自我管理的。

事后你不能真的那样做,我想。好吧,如果你有任何禁运新闻,请……

我们确实与人们就禁运事宜进行合作,我们不进行交易。

我们没有……如果我们根据禁运新闻进行交易,我们会赚得比其他任何事情都多。还有什么?还有其他有趣的模式评估轨迹吗?或者您在 Meter 没有做但看到别人做过的,您觉得有趣或希望更多人做的?

是的。一个我认为有趣的项目是 AI Village,我认为你们两个可能都接触过。这些是给一个村庄的代理人设定的非常开放式的目标,他们试图完成它们。例如,我认为开设一家商品店是其中之一,在公园里组织一个活动,建立一个人类受试者实验,诸如此类的事情。我认为我对具体应该学到什么有很多疑问。他们也使用旧模型和新模型在这个所谓的“村庄”里。模型在很大程度上依赖于视觉能力,我们已经讨论过模型在这方面能力不足。这种模型试图实现开放式目标而不是基准任务的氛围,你知道,这种氛围有点像自动售货机基准,在某种程度上,这似乎是一个非常有趣的方向,科学应该朝着这个方向发展,或者似乎,你知道,这带来了很多缺点,但以一种非常有趣的方式解决了基准的一些缺点。我认为看到这些模型出错的方式,看到它们愚蠢的方式,是信息的重要来源。我很有兴趣看到更多这样的工作出现。我认为这是其中之一。另一个是转录本,这是一个极其有趣的信息来源。这是,你知道,模型采取行动,然后看到输出,然后利用这些输出采取下一个行动,如此循环往复,在基准风格的任务上,或者在更令人兴奋的实际部署中,就像您在自己的 Claude 代码使用、Codex 使用、Curs 使用等中找到的那样。你知道,这有实验性较差的缺点,在某种程度上不太干净和科学。它更……它更具选择性,你知道,你让 AI 做的事情显然是你期望它做的事情,它有可能成功,所以你不会给它任何任务。如果我看到模型做了一些极其令人印象深刻的事情,或者在某种意义上可能不安全的事情,颠覆了用户的偏好,那么这种行为在之前的历史中会发生多少次并不清楚,但这是一个巨大的数据源。那里有海量的信息,我希望人们能更多地从事这类工作。正如我们提到的,在时间跨度和我们的开发者生产力方面存在很多问题。你知道,我认为这很重要。我认为它推动了该领域的发展,但它远非完美。我认为还有很多其他方向看起来非常有趣。也许我应该提一下的是,模型是否通过了单元测试,它们是否通过了 SWEBench 等评分,某种意义上的 Meter 式评分基准,与它们的解决方案是否会被合并到主线中,也就是说,解决方案是否在应该添加测试的地方添加了测试,或者没有,它是否遵循了代码库中现有的模式,它是否确保了它的更改能够以适当的方式与其他代码库部分进行交流。这对我来说似乎非常有趣。我认为模型能力可能在这方面有些滞后,与您在 SWEBench 式评分中看到的情况相比。我可以继续说下去,但是……

是的。

这些是你之前提到的新颖研究,新颖研究。是的。

我只想对 AI Village 评论一下,你提到了很多我甚至想深入探讨转录本的东西。

是的。是的。

AI Village 与我们去年的一个亮点有关,那就是 Nome Brown 的对话,他正在积极研究多代理合作而非竞争。基本理念是,我们作为一个团队可以做得比个人做得更多,或者你知道,我们一路上的代理人或朋友。我认为这很棒。而且,我认为在 DeepMind 方面,他们的说法是拥有一个开放式团队,我认为这是一个每年都会重新出现的话题。我只是……我认为不清楚开放式意味着什么。这是研究这些事物作为生命形式,潜在的新人工智能生命形式,还是作为服务于我们的工具的核心分歧。也许开放式意味着没有目标。如果你只是想评估它,那么“它对我有什么用?”这是完全错误的,你永远无法从中获得任何东西,因为它们只是作为人工智能生命形式而活着。你知道,在某种意义上,黄金标准评估,如果我想了解我最感兴趣的问题,我希望做到这一点,人工智能可能在多大程度上自动化或加速研发。我宁愿只是……你知道,给 AI 一堆可操作的东西,输入到 AI 中,自动化研发,然后看看它做了什么。我怀疑今天即使有了所有的可操作性,它也不会起作用,因为它会摔倒,你知道,在处理资源时,处理资源使用方面,它不像今天那样有能力。它会在某些类型的长期任务上遇到困难,等等,等等。而且,你知道,在某些方面,我认为基准在捕捉这类事物方面存在困难,而 AI Village 似乎……或者村庄风格的事情,这些更……

清了清嗓子。

开放式目标,看看模型如何追求开放式目标,你知道,它们为这类事情提供了一些色彩,看到了模型摔倒的样子。我认为这些更开放式的目标将变得越来越重要。我一定程度上同意,你会提供它们。在极端情况下,我刚才提到的,你会提供关于公司这个部分如何运作,那个部分如何运作的文档,等等。它不是纯粹开放式的。但是,你知道,它……它相当开放式。它比我们今天给它们的问题更开放式。

开放式。

是的。而且,你知道,如果模型在 Spex 使用它们时表现出色,给定一些详细的问题描述和一些非常明确的规格说明它们应该做什么,那很有趣。但我认为这与自动化研发非常不同。我对我们离那有多远感兴趣,而且,你知道,在某些方面,这更直接地说明了这一点。

是的。

所以我们请了 Terminal Bench 的人来做播客。您如何看待……

以某种方式进行 Harness 基准测试?因为如果你看看他们的排行榜,同一个模型,不同的 Harness,有 10 个百分点的差异。这看起来有趣吗?我不知道您如何在 Meter 中构建 Harness,以及您是否总是选择最佳 Harness 或进行比较。

是的。所以,关于我们在 Meter 中如何选择 Harness,这不是我特别工作的内容,我不是专家,但大致来说,我们构建 Harness 以使模型在开发集任务和一些保留集任务上尽可能高效,然后我们使用相同的 Harness,试图确保它们没有过拟合,用于我们的主要任务套件。一方面,我确实有直觉,脚手架有很多价值。很容易夸大其价值,因为存在过拟合问题。或者,如果你知道,如果我们构建一个脚手架来在我们的测试任务上做得尽可能好,那么它会比只在我们的开发任务上构建的脚手架做得好得多,在某种意义上,这会感觉不合法或不有趣,或者你不会期望它能泛化到其他任务集。你知道,另一方面,Meter 在构建脚手架方面付出了很多努力,以使模型尽可能高效,因为我们对模型能力的上限感兴趣,你知道,在考虑这些模型是否可能危险时。所以,所以,你知道,我确实相信这些脚手架比……你知道,人们可能尝试的第一件事要好得多,因为它们付出了很多努力。

是的,这很有趣,因为我确实想过拟合,你知道,作为模型的客户,你确实想针对你的任务进行过拟合,而且我认为有时人们可能低估了从中获得的价值。但是……

是的,我认为,你知道,如果你有一个……一种机械工作流程,或者你想象自动化的东西,你想象自动化的工作流程,而且有一些地方,更多的随机智能会很有用,比如决定如何将客户路由到客户电话,之类的,我认为这很有意义,但对于这种……你知道,更普遍的……你知道,特别是考虑到软件工程的帮助性,我不太确定我是否有同样的……

是的。好吧,举个例子,我从事 TypeScript 工作。

如果我构建一个更好的 linter,对我来说是私有的,或者一个更好的测试套件,一个更好的 play 替换,理论上我有点过拟合模型以获得更好的性能,对吧?

是的。

我不在乎。我不是想报告模型性能。我想构建最好的东西。

是的。我有一个模型来构建 lint,

对?好吧,不,我同意。我同意。我认为这就是问题所在,比如,“我应该只等下一个模型吗?”你知道我的意思吗?在什么点我应该构建更好的……

脚手架?不,我棕色,所有的脚手架都会被冲走。

是的。但现实地说……

他会这么说。

在现实的时间表上,就像我这周应该做什么?

是的。是的。这些可以同时成立,所有东西都会被冲走,而今天的调度是有价值的。

完全。是的。完全。或者在模型生成中是有价值的,而在模型生成之间则不那么有价值。是的。你知道,我……我最多算一个可以接受的软件工程师。我故意不投资工程技能,因为……因为它们正在变得越来越好。也许这是错误的决定。是的。我同意。如果你……正如你应该期望的那样,能力会不断提高,这会迫使你做出艰难的权衡,关于你今天如何花费时间,因为也许 6 个月后它就不那么有用了。

休个假。

好吧。如果你住在欧洲,你可以休 6 个月假之类的。

你可能想再休个假。

完美。

好的。

好的。只是为了总结一下,我想我们对 Meter 在 2026 年有什么期望?2030 年的成功看起来是什么样的?我不知道你是否有……有一种更广泛的愿景。然后也许在个人层面上,我们可以谈谈卡拉 OK 的事情,但是……

是的。所以,从 Meter 来看,我认为你会看到更多……希望是高质量的能力证据。你知道,就像过去在时间跨度和开发者生产力方面看到的那样,沿着我们所描述的路线。其中一些未来的研究方向。我们还有一些监控研究方向,我不是那么……我不是那么专家,但正在思考如果我们能成功地对试图执行危险任务的模型应用安全措施。那里有一整套工作。

这是可解释性维度,还是什么类型的?

通常这是黑盒,而不是白盒,据我所知,在目前的工作中。所以,不是使用可解释性,但你可以想象原则上做一些更白盒的事情。然后是风险评估工作,它考虑了我们认为模型有多强大,它们的倾向是什么,你知道,我们是否可以……通过安全措施跟踪模型正在做的事情,你知道,我们是否认为这些模型会造成大规模的危害。你可以在 2026 年看到更多这样的内容。也许现在是时候说我们正在招聘了。

是的。

是的。

在我的团队里,我们正在招聘研究工程师、研究科学家,来自……你知道,创业背景的人,来自……机器学习背景的人。当然,我最初来自经济学或定量基因组学背景。所以,所以,我们正在接受相当广泛的人员,他们能够完成工作。就像你在 Pulse Meter 的工作中看到的那种工作,以及运营总监。我认为在 Meter 的招聘页面上你可以找到更多信息。是的,我认识的每个人都在招聘运营总监,包括我自己。而且,我认为,你知道,这可能是每个人都想要的那个代理人。

然后我们不能有……

是的。我的意思是,你知道,每当人们有招聘宣传时,我总是试图推动,好吧,平均候选人进来,你拒绝他们。为什么?你正在寻找什么?

所以,有很多不同类型的人我们可以寻找。所以,所以,不同的……对不同的人来说是不同的事情。其中一件是……你知道,良好的基础研究直觉,比如……检查你的数据。我们在 Meter 不做预训练,但如果你在做预训练,你应该看看语料库,对模型输入的内容有所了解。即使是从事这种提升 RCT 的工作,那也很重要。真正地在脑海中形成这些问题的形状。我认为那些在写作中沟通得非常透明,不过分夸大他们结果的人……你知道,我的希望是,你过去对 Meter 工作的感觉是,它……试图保持冷静,不……不低估,也不夸大科学所说的。这在内部很重要。这很重要,在外部也很重要。然后我认为生产力,或者……有很多……很多人才,但他们不会……在更艰苦的环境中工作得那么好,从事……前沿科学,而那……而那正是我们所做的。

我只想为……我猜在新时代有价值的技能做准备。是的,因为我认为人们越是阐述积极的方向,以及什么难以招聘,我们就越能指导我们的听众……在这些方面提升自己。我认为这很重要。

哦,是的。

你有一个卡拉 OK 的问题吗?

我不知道这个。

你会在播客上说吗?

我从来没有做过。我曾经……

我无法停止爱你。

这个卡拉 OK 是什么意思?你组织的是什么?是像……音乐吗?

你是个音乐家?

音乐家可能有点夸张,但是,你知道,我弹奏乐器,然后发出声音。嗯,嗯,我主持过几次现场乐队卡拉 OK 活动,就是……找一群朋友,人们……在乐队的伴奏下……对着……你知道,50 到 200 人的观众唱歌。这很有趣。我认为人们应该多做这件事。我期待在下次活动中见到你们两位。

我会在你的某个活动中这样做。是的。这是奇怪的事情之一,因为我曾经经常参加无伴奏合唱。

哦,哇。

而且我只是觉得它是一种正在消亡的形式。你知道,我刚看了那个关于 2010 年代无伴奏合唱浪潮的视频,来自《完美音调》和《欢乐合唱团》。

那是……

《完美音调》?

Pentatonix。

Pentatonix。没错。那就是它消亡的地方。而且……

而且很有趣地看到它作为一个艺术形式在普遍消亡,以及新的形式是如何占据主导地位的。而且,我不知道。这对人类来说也很奇怪,因为现在我也……让我们称之为对合成歌曲生成或 DJing 更感兴趣,任何类似的东西,人类的声音实际上更加商品化了,谁唱并不重要。

我不知道,我觉得现场唱歌有一种超然感。你知道,AI 生成的歌曲并没有给我这种感觉。

那很好。

是的。是的。我的意思是,我确实认为……我们人类总是想要那个,但我不知道 3000 年的人类是否想要那个。

这是奇怪的事情之一。

嗯,谢谢你来。很高兴你能亲自来这里。

非常感谢你邀请我来。

是的。总有一天,我们会采访 AI 对……