📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

AI progress is about to rapidly accelerate in 2025 – Sholto Douglas & Trenton Bricken

Dwarkesh Patel8:49

Transcription

在智能爆炸的模型中,发生的事情是,你取代了人工智能研究人员,然后有一堆自动人工智能研究人员可以加速进步,制造更多的人工智能研究人员,取得进一步的进展。我们应该直接问人工智能研究人员,他们是否认为这是可行的。所以,让我问你,如果我有一千个亚洲的Chotos或亚洲的Trenton,你认为你会得到一个智能爆炸吗?我认为我们目前受到的限制不是制造这些东西的纯粹工程工作,而是运行和获取信号以及在实际的正确做法方面进行品味,以及在不完美的信息上进行那些困难的推断。所以计算和品味,这很有趣,因为至少计算部分不是由更多的智能瓶颈,它只是由Stam 7万亿或别的什么瓶颈。所以,如果我给你10倍的H100来运行你的实验,你作为研究人员的效率会提高多少?请告诉我,你作为研究人员的效率会提高多少?我认为Gemini项目可能会因为10倍的计算能力而快大约五倍,或者类似的东西。所以这是相当不错的弹性,0.5,哇,这太疯狂了。是的,我认为更多的计算能力会直接转化为进步。所以你有一些固定大小的计算能力,其中一部分用于推理,一部分用于运行完整模型的实验。是的,没错。鉴于瓶颈是研究,而研究又受计算能力瓶颈的限制,那么用于实验的比例不应该更高吗?每个预训练团队必须做出的战略决策之一是,你到底将多少计算能力分配给你的不同训练运行,比如你的研究项目,而不是扩展你最终确定的那个最好的东西。你仍然需要不断训练大型模型的一个原因是,你可以从中获得其他方式无法获得的信息。所以规模具有所有这些你想要更好地理解的涌现属性。如果你一直在做研究,你不确定什么会“掉出曲线”。是的,如果你继续在这个领域做研究,是的,并且越来越高效,你可能永远不会,你可能实际上已经偏离了最终会扩展的道路。所以你需要不断地投资于在预期会起作用的前沿进行大规模运行。好的,那么请告诉我,在一个人工智能研究被显著加速的世界里,它看起来是什么样的?因为从这一点来看,这并不像是人工智能在从头开始编写代码,从而导致更快的产出。听起来它们真的在以某种方式增强顶尖研究人员的能力。是的,请具体告诉我,它们是在做实验吗?它们是在提出想法吗?它们只是在评估实验的输出吗?发生了什么?我认为这里有两个你需要考虑的障碍。一个是人工智能显著加速了我们算法进步的能力,另一个是人工智能本身的输出是模型能力进步的关键要素。具体来说,我指的是合成数据。而在第一个世界里,它显著加速了算法进步,我认为这是必要的组成部分,更多的计算能力,而且你可能会达到这种弹性点,人工智能可能在某个时候更容易加速并进入上下文,而不是你自己,而不是其他人。所以人工智能通过成为一个出色的副驾驶,基本上可以帮助你更快地编码,从而显著加速你的工作。这似乎是相当合理的,超长上下文,超智能模型,它会立即上线,你可以让它们完成子任务和子目标。请带我走过一天,比如你正在进行一个实验或项目,这个项目会让模型“更好”,对吧?比如,从观察到实验,到理论,再到编写代码,发生了什么?我认为最重要的一点是说明这个周期:提出一个想法,在不同规模的点上进行验证,然后解释、理解出了什么问题。我认为大多数人会惊讶地发现,有多少工作投入到解释和理解出了什么问题上。因为人们有很多他们想尝试的想法,并不是你认为应该起作用的每一个想法都会起作用,而试图理解为什么会这样是非常困难的,而且要弄清楚你到底需要做什么来审问它。所以很多工作都是关于内省,关于正在发生的事情。它不是写成千上万行代码,也不是,即使我认为很多人都有一个长长的想法列表,他们想尝试,但很难从中筛选出并根据非常不完美的信息来判断哪些是正确的想法去进一步探索。请详细说明你所说的“不完美的信息”是什么意思?是早期实验吗?是这些信息吗?你正在进行规模化的增量,你可以在GPT-4论文中看到,它们有一堆点,它们说我们可以使用所有这些点来估计我们最终模型的性能,并且有一条漂亮的曲线穿过它们。具体来说,为什么这是不完美的信息?因为你永远不知道趋势是否会适用于某些架构。趋势一直很好,对于某些变化,趋势一直很好,但情况并非总是如此,而且在较小规模上有帮助的东西实际上在较大规模上可能会有害。所以根据趋势线和你直观的感觉来猜测,好吧,这实际上是会产生影响的东西,这很有趣,因为对于你在发布论文技术报告中看到的每一张图表,它显示了平滑的曲线,都有第一次运行的坟墓,然后还有所有其他走向不同方向的线条。是的,这太疯狂了,无论是作为一名研究生,还是在这里,你必须进行的实验数量,以及直观地判断出了什么问题,实际上非常困难,要弄清楚,在很多方面,Trenton团队正在努力更好地理解的问题是,这些模型内部到底发生了什么?我们有一些推断和理解,以及关于某些东西为什么会起作用的“头脑风暴”,但它不是一门精确的科学。所以你必须不断地猜测为什么会发生某事,什么实验可能会揭示这是真的还是假的,而这可能是最复杂的部分。是的,我同意很多观点,但即使在可解释性团队,尤其是在Chris Ola的领导下,也有太多我们想测试的想法,而这真的只是拥有工程技能,但我会把工程放在引号里,因为很多都是研究,来非常快速地迭代一个实验,查看结果,解释它,尝试下一个,沟通它们,然后无情地优先考虑最高优先级的任务。这一点非常重要,无情地优先排序是我认为区分许多高质量研究和不一定那么成功的研究的一个方面。我们身处一个有趣的领域,我们许多理论上的初步理解基本上都崩溃了。所以你需要有这种简单性偏见和无情地优先考虑真正出错的事情。我认为这是最有效的人才区分开来的一个方面,他们不一定过于执着于使用他们熟悉的特定解决方案,而是直接解决问题。你经常会看到,也许人们带着特定的学术背景进来,试图用那个工具箱来解决问题。而最优秀的人是那些极大地扩展了工具箱的人,他们正在从强化学习中汲取灵感,也从优化理论中汲取灵感,他们对系统有很好的理解,所以他们知道限制问题的约束是什么,而且他们是优秀的工程师,他们可以快速迭代和尝试想法。到目前为止,我见过的最优秀的研究人员,他们都有非常非常非常非常快速地尝试实验的能力,而这就是周期时间,在较小的规模上,周期时间区分了人们。机器学习研究就是如此实证。而这实际上是我认为我们的解决方案最终可能看起来更像大脑的一个原因。即使我们不愿意承认,整个社区都在对可能的AI架构和其他一切的景观进行一种贪婪的进化优化。这就像进化一样好。