📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

the SCARIEST chart in AI

Wes Roth24:44

Transcription

您即将看到屏幕上的图表,可能是有史以来人工智能发展史上最令人恐惧的图表。它就在这里。如果它让您感到震惊,我深表歉意。这张图表显示了人工智能代理的发展速度有多快。而 Claude Opus 4.6 刚刚发布了一个图表,我认为它让很多人感到震惊。让我们来谈谈它,因为它也可能是人工智能进步中最被误解的图表,也许根据一些人的说法,特别是《麻省理工科技评论》。下面是它实际显示的内容,以及为什么它可能比大多数人想象的更可怕。

首先,什么是 Meter Research?它是一个专注于理解前沿人工智能发展的非营利组织。它评估最佳模型。它试图评估这些模型发展带来的各种威胁和风险。他们组建了数百项涵盖工程、编码、机器学习、网络安全等领域的各种任务,并让人类专家坐下来完成这些任务。这是我认为很多人误解的重要部分。例如,一位网络安全领域的人类专家,被分配了网络安全任务,他们坐在自己的电脑前完成任务。假设他们需要八个小时来完成任务。这就是图表上的 Y 轴,很多人都忽略了这一点。我们衡量任务的单位是人类专家完成该任务所需的小时数。我们不看人工智能代理完成任务所需的时间。它可能在 1 秒内完成,而人类专家需要 8 小时才能完成,或者它可能需要一天。我们不看那个。我们只看它取代了多少小时的人类劳动。

这张图表也有几种不同的选项。我们可以查看 50% 或 80%。我认为这是两个默认选项。50% 的时间范围是指人工智能大约一半的时间能够成功完成该任务,类似于人类专家。而 80% 是指它平均大约 80% 的时间能够成功完成。

所以,这是图表再次出现。它在这里开始向上弯曲,并呈指数级增长。我认为 Claude 4.5,这就是人们开始恐慌的地方,原因有很多。其中之一就是,即使它遵循原始趋势线,这仍然是相当大的进步,但很明显,原始趋势线并不真正适合这些新模型的进步。似乎需要在这里放置一条不同的趋势线来拟合新的数据点。

请记住,Claude 4.5,这就是我们开始恐慌的地方,因为它开始能够“一蹴而就”地取代。再次强调,这是 50/50 的成功率,请记住这一点。还有 80%,还有另一张图表。但它将能够一次性完成一项任务,如果可以这么说的话,这项任务需要人类专家花费五个多小时才能完成。当我们都在忙于对 Opus 4.5 感到恐慌时,没过多久,Opus 4.6 就出现了,哇,它达到了 14.5 小时。这几乎是两个完整的工作日,对吧?假设您每天工作 7.5 小时。我们不计算您的午餐时间、咖啡休息时间、您玩过的所有 Flappy Bird 游戏。这是工作时间,对吧?所以,我认为两个工作日是现实的。Opus 4.6 正在达到能够完成这项任务的程度。

顺便说一句,我个人在使用 Open Claw 并连接 Opus 4.6 的经验是,它能够处理大量工作。如果您还没有访问 natural20.com,那是我的网站。它已经完全重建,主要使用 Opus 4.6 人工智能代理。它是一个新闻聚合器,我一直在不断地向其中添加内容。但是大部分工作,部署、设置、构建初始 GitHub 项目、设置托管等等。它在大约 4 小时内完成了。它在我睡觉的时候完成的。我给了它很多东西去做。然后我睡着了。我醒来时,希望它能通宵工作。它没有。它在 4 小时内就完成了所有工作。我觉得这需要一个该领域的专家,一个以此为生的人,至少一天或两天,甚至更长时间才能完成。

所以,这个最新的数据点的问题在于。它证实了我们正走在一条与我们最初设想不同的轨迹上。当这些图表最初出现时,我们认为人工智能的进步,它们的能力,每 7 个月就会翻一番。这本身就已经很可怕了。这是一个非常快的进步速度。但如果我们只看从 2023 年开始,也就是最近人工智能进步真正开始加速的时期,那么这种翻倍现在大约每 123 天发生一次。这大约是每 4 个月一次。所以速度不仅在持续,而且在加速,而且在快速加速。

现在,如果您看过我之前的一些视频,我们采访过 Adam Binksmith。他负责 AI Digest,AI Village 就在该项目之下。他实际上是第一个发布了我个人看到的一些与每七个月翻一番的说法相矛盾的内容的人之一。据我所知,他是最早站出来说:“嘿,这个趋势看起来比每七个月快得多”的人之一。所以,我必须给他和他的团队记一功,因为如果您读过他发布的博客文章,这不应该令人惊讶。

而且,在这些人工智能实验室的许多人,我不想说他们惊慌失措。我不想把这个强加给他们,但让我们读一些引述。Sam Altman 在最近的一次采访中,这是 2026 年 2 月 20 日,所以我们说的是几天前,他说:“公司内部的看法是,世界还没有做好准备。”在《魔兽世界》的一个扩展包中,他们释放了一个被困了几千年的恶魔。这就像他喊出的第一句话:“你们还没有准备好。”这就像是整个事情的史诗般的开场。这有点一样。所以 Sam 说世界还没有准备好。他说我们很快就会拥有极其强大的模型。它的起飞速度将比我最初预期的要快。这令人紧张和焦虑。所以,他说:“嘿,我以为我们是在缓慢起飞,而这次起飞将比我预期的要快得多,比我们大多数人预期的都要快。”而且这种情况现在正在发生。我们现在正进入那个时期。

此外,越来越多的人说编码已经解决了。Claude Code 的创造者最近做了一个很棒的播客。我是说,我认为那几乎是直接引述。他说:“是的,编码已经解决了。未来学习编码的人,情况将不再一样。人们学习编码的方式,基本上已经结束了。”Sam Altman 也说了同样的话。他说:“我学习编写软件的方式现在基本上完全无关紧요。手动编写 C++ 代码,那已经结束了。”他说通用人工智能(AGI)已经很近了,超级智能也并不遥远。重要的是,在这个轨迹上,AGI 和超级智能之间在从一个点到下一个点所需的时间方面可能非常非常短,这仅仅是因为进步和发展的速度。

据称,GPT 5.3 Codeex 在其开发过程中,在训练期间由模型本身进行代码开发。Claude Code 的创造者说,他正在为 Claude Code 推出许多不同的附加功能,其中大部分是由 Claude Code 本身,由 Opus 4.6 等模型编写,或者我认为他说全部是由它们编写的。而我们正在谈论的这种新一波模型,这种发展始于去年 11 月。所以,我们说最多 3 到 4 个月。这是一个非常近期的情况。

埃隆·马斯克在 1 月份表示,我们已经进入了奇点。2026 年是奇点之年。Dario Amade 在大约一周前,大约 10 天前的 Dark Cash Patel 播客中也表示,我们正接近指数的终点。那么,他是什么意思呢?他是在说我们正接近那个平台期。指数增长已经结束,一切都将趋于平稳。不,不,不。他是在说我们正接近终局之战。

Enthropic 的模型目前完成了今天 100% 的软件工程任务。所以 Anthropic 生产的一切,几乎 100% 是人工智能,而且编码的速度比他预期的要快。所以即使是他的预测,还记得有多少人曾经嘲笑他,说在六个月内编码就会被自动化。我认为他准确地预测了这一点。我的意思是,很难预测事情会以多快的速度渗透到每个人都赶上。但是,如果您有一个高度技术性的前沿人工智能实验室,每个人都是编码员,如果您听一些 Anthropic 员工的采访,比如业务人员可以编码,项目经理可以编码,设计人员可以编码,他们都是编码员。所以,如果像这样的公司在编码和软件工程任务方面 100% 由人工智能模型自动化,我认为可以公平地说,编码已经被自动化了。也许需要一些时间才能渗透到社会其他地方,但它已经解决了。现在只是时间问题,直到其他人发现它已经解决了。

我一直在为一项会计任务而烦恼了好几个月。我一直把它推迟。如果您曾经这样做过,您就知道您并不孤单。您看着它,它太棘手了,您不知道从哪里开始。您只是觉得“呃”,然后您就一直推迟,即使您知道您最终应该处理它。前几天我下定决心,我导出了所有东西,然后再次将其发送给我的 AI 代理,由 Opus 4.6 提供支持。这发生在深夜。我累了。我的脑子有点混乱。我没有任何心情做任何实际工作。所以,我将要说实话。我当时在玩一个视频游戏 Mega Bonk,如果您有兴趣的话。一个极其令人上瘾的视频游戏。它的创作方式非常有趣,但这无关紧要。所以,我的主屏幕上是 Mega Bonk,我的侧显示器上是我的代理,我把所有的财务信息都扔给了它。是的,我明白存在安全隐患,但当时我真的受够了,如果这说得通的话。

在玩游戏的过程中,30 到 40 分钟,无论多长时间,我几个月来一直推迟的项目就完成了。我需要对进来的各种付款与未付的款项和发票进行平衡,所有这些都需要整合在一起。很多时候并不清楚哪个付款对应哪个发票。所以有很多非常繁琐的、耗时的、注重细节的工作,您需要逐行查看,它就完成了。另一件非常有趣的事情是,我会在数字旁边做一些笔记来帮助我理解数字。它直观地理解了那些是什么。它不像某种超级智能。我认为它并不比人类聪明,但它确实感觉像一个能够完成这种工作的聪明人,而且没有任何分心,完全精力充沛,准备好工作。我完全专注于这项任务。所以,感觉就像一个聪明人在以最佳状态运作,你知道,当他们精力充沛的时候。这是我们大多数人都可以做的工作,但我们可能只是不想做。如果我们去做,您不能在一天结束时去做。您需要新鲜地处理它。这是那些“大石头”之一,如果您知道这个术语的话。而且它在我玩视频游戏的时候就完成了,如果五年前、十年前、十五年前、二十年前有人告诉我这一点,我会认为他们在撒谎。

让注册会计师处理这样的事情,根据他们的收费标准,将花费数百美元。这是具有经济意义的工作。这是非常有价值的工作。但关键是。在处理那些文件时,它也积累了足够的上下文,以便将来能够处理这些事情,因为它现在知道所有东西的来源,去向,它基本上创建了一个带有数据库的系统,并创建了自己的 SQL 数据库。所以现在,我只需将新进来的东西扔给它,它就会对其进行组织并给我一份漂亮的报告。所以,在我玩视频游戏的那 30 到 40 分钟里,它不仅完成了那个项目,而且还永久地自动化了它。

这就是我认为那张图表没有真正捕捉到的一个方面,那就是那些需要,你知道,15 小时才能完成的任务,Opus 4.6 可以完成,其中很多将不是一次性任务。其中很多将用于自动化未来的流程。在我让它构建的网站上,它是一个新闻聚合器。所以现在它 24/7 运行。它检查各种 RSS 提要、其他公司的出版物、其他聚合器,然后将它们整合在一起。它根据一些关键指标对故事进行排名,例如在 Google Trends 上的表现,在 Twitter X 上的表现等等。所以,它对它们进行排名,有一个小算法,显示,好的,这些是热门的,这些是正在升温的,这些不太热,有一个 1 到 100 的评分系统。所以,同样,它在一个晚上完成了这项工作,现在它 24/7 运行,对故事进行排名,从网上收集它们等等。它为我自动化了那个过程。现在,如果我继续在这个网站上工作,那就是为了改进它,但自动化已经锁定,现在你知道,我添加到上面的任何额外时间都只是改进了流程或增加了更多功能,优化了它的工作方式等等。所以,这是非常重要的一点,对吧?所以,很多任务将是自动化未来事物的任务。这个东西非常擅长找出如何自动化事物。

二、类似于印刷机的出现,当时世界上只有一小部分人会写字。有抄写员。抄写员负责写作。那是他们的职业。然后印刷机出现了,后来每个人都是抄写员,或者没有人是抄写员。每个人都识字,或者几乎所有人都识字。所以在此之前,你知道,国王、领主、商人,所有有权势和有影响力的人等等,他们不得不付钱给抄写员来写东西。这与编码员和软件工程师非常相似,对吧?无论您有多聪明,有多富有,都无关紧要,您要么能写代码并且做得非常好,要么不能。在未来,有了很多这样的工具,我认为它将与印刷机非常相似。现在很多人说:“是的,这个东西可以写代码,但它永远不会取代工程师,因为它不仅仅是代码。您必须了解如何构建好的软件。”当然,就像现在每个人都识字一样,这并不意味着每个人都是出色的作家。即使在美国和其他国家,我们的识字率接近 100%,情况并非如此。但在许多国家,大多数人都识字,仍然存在分布。有些人擅长写作,有些人则不那么擅长。所以,当然,即使有了这些工具,也不意味着每个人在创建软件方面的能力都会完全平等。会有大量的输入,比如如何组织一切?如何提示代理?如何测试、改进和迭代?投入一万小时通过使用人工智能代理来改进其软件创建工艺的人,将比刚起步的人更好。但是,就像没有人称自己为抄写员一样,我认为将来人们也不会称自己为编码员或开发人员。现在一个人可能会将自己或他人描述为出色的作家。我认为将来也会如此。他们将被描述为出色的构建者,他们创建代码、创建软件的能力将是其中的一部分。

另一件需要注意的事情是,图表上的那些小点,它们实际上并不是点。我知道这可能有点难看清,但这些实际上是置信区间。所以它们可能有一个相当大的范围。Obus 4.6。所以那个点是 14.5 小时。但它实际上落在哪里?上限,下限,对吧?它可能在 6 到 98 之间。如果它实际上更接近 98 这个标记,那就是几周的工作。即使它在底部,只有 6 小时,那仍然是变革性的。

现在,重要的是要理解,这些指标很难衡量。它们很难构建。它们会有它们的缺陷。人们会误解它们的含义。网上有很多人,可能包括我自己,被指责过度炒作。所以,我想重要的是要理解,理解这些图表存在一些注意事项。Meter 的一名工作人员 Sydney von Arcs 说:“您绝对不应该把您的生活押在这张图表上,但我也敢打赌,这种趋势将会持续下去。”我认为这是一个很好的看待方式。是的,您不想仅仅根据您从这张图表中得出的任何意义来赌上您的全部生活。但如果它是真实的,并且它显示了真实的进步,并且它更接近那个更高的进步范围,即使它不是,并且它稍微慢一些,那么,您要么期望它持续一段时间,要么您认为它会趋于平稳,但然后有什么东西可能会让它趋于平稳呢?

我们已经听说了很长一段时间了,有很多事情会阻止人工智能的发展。我们会用完 beta 版,数据会自我吞噬,它会腐蚀模型。我们看到过这些吗?并没有真正看到,但人们已经说了几年了。我们会用完芯片。我们会用完电力。我们会用完水。这些都是瓶颈。也许其中一些是瓶颈,但它们正在迅速得到解决。世界上最聪明的人正在尽快努力解决这些问题。

现在,有很多人提出了他们的反驳意见。不是图表的批评者,而是那些说这张图表没有看起来那么有影响力的人。例如,来自加州大学伯克利分校的 Inolua Deborah Raji 说,我认为某件事需要更长时间并不一定意味着它是一项更困难的任务。这是真的。我们确实需要开始以不同的方式思考如何衡量任务的难度,因为有些人类觉得困难的事情对机器人来说可能很容易,反之亦然。所以也许一项更困难的任务是“见仁见智”的,可以说。但我认为被忽略的一点是,如果一个人工作了五个小时,而现在人工智能代理取代了这些工作量,那么这个人就不再需要工作这五个小时了。这会影响到对人类劳动力的需求。

其他批评者说,一个模型可以在编码方面做得更好,但它不会神奇地在其他任何方面都做得更好。一些最好的论点使用了“神奇地”这个词。您注意到吗?哦,您认为它会神奇地弄清楚一切?事情是这样的。Anthropic 的许多研究以及他们的研究人员在进行各种采访时,他们说他们正在对人类拥有专业知识的各个方面进行强化学习。例如,编码、数学、会计、研究等等。而且他们看到了交叉效应。

在这个频道上,我们报道了一些论文,实际上是许多论文,例如,我们注意到,如果我们对模型进行编码训练,我们可能会看到它们在执行复杂数学方面的能力有所提升,例如,这显示了一种普遍的能力提升,一种普遍的理解。有些东西会交叉。您在数学方面有所提高,您可能会在会计、编码方面做得更好。这很明显,不是吗?人类也是如此。您找两个人,让他们执行一项他们从未做过的任务,但其中一个人做过很多类似、相关或邻近的任务,这些任务可以转移,而另一个人则没有。拥有大量相关经验的人很可能做得更好。

Anthropic 最近还发布了他们关于人们如何使用人工智能代理的发现,其中一些发现非常有趣。其中之一是,这些云代码(在此示例中)进行的自主会话随着时间的推移而增加。很明显,对吧?但关键是。这与新的模型发布无关。这是相同的用户使用相同的模型,并且自主会话随着时间的推移越来越长。是什么驱动了这一点?是用户的信任。随着新用户越来越多地使用这些产品,他们允许它运行的时间越来越长。高级用户倾向于让它长时间运行。高级用户倾向于让它运行更长时间,但他们实际上更频繁地中断它。当他们知道它正朝着错误的方向发展时,他们会中断它,但当它看起来像是在做正确的事情时,他们会长时间运行它。

从 Anthropic 发布的内容中最大的收获是,我认为存在巨大的“悬垂”。这些模型就像布加迪超级跑车。我对摩托车不太了解。它是最快、最酷、最先进、有史以来最快的摩托车。能够以每小时 200、300 英里的速度行驶。这些模型就是这样。但是我们,驾驶员,我们以每小时 10 英里的速度行驶。而 OpenCL Claw,我认为,真正证明了这一点。如果您真正释放它们并让它们运行,它们可以运行很长时间。

现在,仍然存在问题,我的意思是,有很多不同的问题。它们会产生幻觉,它们会犯错误,而且确实存在这种“分歧”,对吧?因为在它们最好的时候,它们是不可思议的,而在它们最糟糕的时候,它们不一定是在进步。它们犯的那些愚蠢的错误仍然存在。它们并没有好多少。有些人指出这是局限性。比如它永远不会好,因为它仍然会犯这些错误。但是,随着能力的顶峰不断提高,我相信我们会找到解决错误的方法。它甚至不一定需要在模型层面。

按照 Meter 目前的进步速度,到 2027 年初,这些模型将能够运行足够长的时间来取代一个月的人类劳动。所以,在 2027 年 2 月,大约是三个工作周。所以,如果您考虑到这种能力,我们愿意付出多大的努力来防止它犯错误,如果潜在的回报如此之大。这是一个新的问题领域。我们以前不必如此努力地思考这个问题,因为人类可以反复检查自己的工作。但是,如果一些聪明人思考如何创建一些护栏、一些检查等等,我相信这是一个可以通过 Meter 自己的承认来解决的问题,他们预测到 2032 年,99% 的人工智能研究和开发将实现自动化。到 2035 年,这可能意味着人工智能效率提高 1000 倍到 1000 万倍。而且,再次强调,这是根据更保守的估计,而不是我们正在看的更新的、稍微更激进的时间表。

所以,这里的乐观情况,也就是人工智能乐观情况是,这些趋势线在五种以上的模型家族中已经持续了五年多。最新的数据点表明,这可能比我们最初预期的还要快。构建这些基准的研究人员相信这些趋势将会持续。所有前沿实验室的领导者都相信这些趋势将会持续。

而悲观情况,如果我们听取一些批评者的意见,那么误差范围是巨大的。比如 6 小时到 98 小时,这是一个巨大的差距。而且我们只谈论 50% 的成功率。一些实际的编码助手测量显示,可能存在减速而不是加速。这是基于非常小的样本,所以我们必须小心。当然,从这个时间范围来看,它将人类时间和难度混为一谈。所以,可以说,双方都有道理。但轨迹是不可否认的。

请注意,即使是人工智能怀疑论者也没有说人工智能没有进步。他们说这很复杂。他们说,嗯,也许它并不意味着它明显的意思。我认为问题不在于它是否会改变一切。我认为已经没有人认为它会轻易过去。我认为我们现在严格地在弄清楚它何时会改变一切以及以多快的速度改变。

所以,这张图表已经成为人工智能行业的“脉搏”。每次有新模型发布时,我们都在屏息以待,看看它在这张图表上的位置,看看趋势是否会继续。而且每次都持续了。而且最近甚至似乎加速了。所以,无论您认为这是人类历史上最重要的图表,还是自加密货币以来最被夸大的东西,我认为重要的是您要关注,因为构建这些基准、构建这张图表的人,构建人工智能模型的人,就像所有从事这项工作的人一样,他们都在告诉您同样的事情。那就是这列火车不会减速,而且越来越难以准确衡量它的速度。我们甚至不知道,或者至少无法就它确切的去向达成一致。

所以,我将发布我的全部研究和所有细节等等。所有这些都将在新闻通讯中。请订阅。我计划在新闻通讯方面加大力度。到目前为止,它一直处于次要地位,但它是一种极其有效的方式,可以汇总所有信息,然后每天发送出去,这样您就可以在您喜欢的提神饮料的陪伴下,随心所欲地浏览它。所以,请务必订阅,我们下期再见。