Transcription
[掌声] 各位听众大家好,欢迎回到 No Priors。今天我们请到了今年人工智能领域最引人注目的发展之一 Alpha Evolve 的两位关键人物。Push Kohli 和 Mate Balog 参与了这项自主编码代理的工作,该代理使用 Gemini 模型和进化搜索来发现新算法。这标志着人工智能在为核心计算机科学和数学,甚至可能超越这些领域的科学做出贡献方面取得了重大飞跃。它不仅仅是一个随机鹦鹉或样板生成器。它展现了您可能称之为技术创造力,就像 AlphaGo 的第 37 步一样,这是人类在数千年的对弈中也未曾做到的。它甚至可能是迈向自我改进人工智能的真正一步。Push,Mate,非常感谢你们的到来。感谢您的邀请。很高兴。恭喜 Alpha Evolve 取得成功并成功发布。您能简要描述一下它大致是什么吗?是的。用一句话来说,Alpha V 是一个人工智能编码代理,它能够发现新算法,这些算法能够为开放的科学问题带来新发现,同时这些算法又非常实用,以至于它们已经被部署在谷歌自身基础设施的关键部分。关于从事这种特定形式的编码代理或这个问题陈述的起源故事是什么?我们在这个算法发现领域并不陌生。正如您可能知道的,DeepMind 的使命是负责任地构建人工智能以造福人类。而我们团队多年来一直在做的就是寻找人工智能发现新算法的方法。新算法无处不在。所以这是一个非常非常重要的问题,当我们能够发现能够以比我们迄今为止所能做到的更高的效率解决重要计算问题的算法时,它可能产生非常大的影响。我们在这一领域取得的第一个突破是在 2022 年,当时我们发布了一个名为 Alpha Tensor 的系统。这是一个使用强化学习的人工智能系统,针对一个非常具体但基础的计算任务,即矩阵乘法。它首次表明,人工智能代理可以发现比人类以前发现的更好的算法。所以这是第一个让我们相信,确实通过人工智能,我们将能够进入人类自己尚未发现的算法的超人类领域。您如何区分 Alpha Evolve 与 Alpha Tensor、Fun Search 以及该领域其他一些项目?描述我们所做工作的一种方式是回顾 DeepMind 的历史,看看在我们开始从事计算机科学工作之前,甚至在我们早期的一些工作中,有多少项目。如果您回到 AlphaGo 项目,AlphaGo 代理能够击败围棋世界冠军。这个代理的一个显著之处在于它能够以如此高效的方式探索所有可能的围棋局面这个令人难以置信的大搜索空间,从而能够找出当时的最优走法。这确实让围棋职业选手和科学家们都感到惊讶。科学家们认为这一事件会晚得多才会发生,因为它是一个非常困难的问题。这证明了这些大规模神经网络系统在这些大型搜索空间中进行推理和高效探索的能力,并对特定领域产生了惊人的新见解。在围棋比赛中,有一个叫做第 37 步的走法,这是一个非常富有创造性的新走法,是代理发现的,在围棋文献中没有记载,这确实让围棋职业选手感到惊讶。所以从某种意义上说,我们问自己,如果我们有一个代理能够高效地在围棋领域进行搜索,为什么我们不能用同样的理念来搜索算法空间中的算法呢?事实上,这可以说是我们对该问题进行第一次尝试的基础,最终形成了 Alpha Tensor。我们构建算法发现问题的方式是,我们首先关注一个非常重要的问题,那就是矩阵乘法。这是计算机科学中无处不在的问题,它是不仅是计算机科学,还有神经网络、机器学习和人工智能的基础运算符之一。我们想知道是否能找到一种改进矩阵乘法算法的方法。矩阵乘法有一个非常有趣的历史,对于可能对此感兴趣的人来说,尽管它是一个如此基础的运算符,但人们认为乘以两个矩阵的复杂性或时间是 O(n^3)。大约 50 年前,一位德国数学家 Strassen 提出了一个非常反直觉的构造,表明实际上复杂性不是 n 的三次方或立方,其中 n 是矩阵的维度。低一些。这是一个非常反直觉的结果,但它持续了 50 多年,直到 Alpha Tensor 出现。我们想知道我们是否真的能改进这个结果,令人惊讶的是,我们能够证明 Alpha Tensor 通过在这个比可能的围棋走法空间大得多的巨大空间中进行惊人的搜索,提出了一个惊人的新算法,从而改进了这一点。但问题是,我们现在已经证明了,这些超智能代理可以超越人类计算机科学家所能做到的。但我们能推广它们吗?Alpha Tensor 非常聪明,但它只是专门为矩阵乘法问题设计的。我们能否构建一个更通用的代理?更通用,意味着它可以处理更一般的问题,也可以更自然地在程序空间中搜索,而不是在矩阵乘法所需的非常具体的操作空间中搜索。这就是我们第一次尝试 Fun Search 的起源,它是一个基于 LLM 的代理,首次通过在程序空间中搜索,表明你可以提出全新的解决方案,并首次从 LLM 中获得科学发现。Alpha Evolve 基本上是它的延伸。我深受启发,我想很多人都深受启发,人工智能确实具有创造力,确实具有您所描述的技术创造力,作为一种概念化它的方式,您正在走出我们作为工程师已经知道的模式。我想回到一些机制和泛化的限制,以及如何思考自动化评估器和许多不同的主题。但是,当您想到这些在经济上具有明显价值和趣味性的问题,例如矩阵乘法,其潜在效率。您直觉上认为,为什么这些解决方案以前没有被发现?仅仅是因为搜索空间太大,还是该领域的人们自满,认为某种解决方案就是最大效率,或者因为显然这里有价值可挖?我的看法是,如果你看看算法的结构,Strassen 提出的东西相当巧妙。它不是你会自然而然想到的东西,而这仅仅是针对 2x2 矩阵。当你转向更大的尺寸时,空间就太大了。这些构造并不自然。它们是非常复杂和精巧的构造,很难偶然发现。所以很有趣的是,它具有这种非常特殊的结构,但它不是人类计算机科学家自然而然就能想到的。补充一点,我绝对同意,搜索空间简直是难以置信的巨大。解决方案可能不符合直觉。我想强调的第三点是,我真的相信过去从事这项工作的人绝对没有自满。事实上,我们选择应用 Alpha Evolve 的问题,无论是科学方面还是实际方面,我们都故意选择了那些最优秀的人长期以来一直在研究的问题。在科学方面,当我们谈论矩阵乘法时,这是一个几十年来一直存在的公开问题,许多人一直在研究它。同样,对于我们在 Alpha Evolve 发布中提到的谷歌基础设施关键部分的实际应用,这些也是谷歌内部经过大量优化的内容,因为它们非常重要。通过拥有像 Alpha Evolve 这样的系统或其他任何系统在这些问题上发现新东西,我认为这是我能想象到的最强有力的证明,即这确实是新的,因为没有人之前发现过它,而且它也不是容易发现的,因为这些结果已经存在了很长时间,并且被如此强大的人们研究过。我注意到这并不是对计算机科学行业在矩阵乘法或数据中心优化方面的广泛努力的评论。我认为现在是时候为更广泛的人群揭开幕后发生的事情的神秘面纱了。您能具体举例说明 Alpha Evolve 如何实际演进代码吗?让我们以优化数据中心调度为例。从最初的随机代码到最终节省数百万美元电力的解决方案,这个过程是怎样的?我可以向您解释一下。像 Alpha Evolve 这样的系统的用户基本上会指定他们试图解决的问题,这是最重要的事情。您通过提供所谓的评估函数来指定。这个函数的作用是,每当有一个拟议的解决方案来解决问题时,您就能告诉这个解决方案有多好。所以您基本上定义了什么是一个好的解决方案,用于发现用于在数据中心调度作业的算法。这个评估函数可以是一个数据中心作业模拟器,它给定一个调度算法,模拟该算法有多好。所以这是用户提供的。这是一个您已经拥有的模拟器。是的,这是一个我们已经拥有的模拟器。而且我认为在许多领域拥有它相当自然,因为您知道,每当您想创新某事时,您都需要一种方法来判断创新是否真的好。所以它至少原则上是一个非常自然的对象。所以您通过提供评估函数来定义“什么”,然后 Alpha Evolve 来填充“如何”。这就是我们系统的任务,您可以通过两种截然不同的方式来完成。一种是告诉 Alpha Evolve,我不知道如何解决这个问题。让我们从头开始,尝试富有创造力,并提出一些全新的东西。这是您可以选择的一种选择。另一种选择是,我们实际上已经在这个问题上工作了很长时间。这里有一个非常强大的初始解决方案,我们可以提供给系统,您可以从这里开始。这就是我们在发现用于调度数据中心作业的新算法的应用中所做的。所以 Alpha Evolve 接受这个初始解决方案,然后它在高级别上结合了大型语言模型的创造力,提出了如何改进该解决方案的创造性新方法。用户提供的评估函数的严格性,它能够实际过滤掉有效的东西和无效的东西。然后,这被包装在一个进化算法中,该算法确保我们能够发现该区域内算法的整个空间,这样我们就不会过早地致力于一种非常特定的解决方案类型,而是随着时间的推移维护一个多样化的潜在解决方案库。我们可能会结合来自不同强大解决方案的想法,直到我们真正拥有一个足够强大的算法,以至于我们可以将其部署到谷歌基础设施的关键部分。直观地说,在进化意义上,而不是机器学习意义上,您有不同的世代,您越来越接近最优解决方案。是的,没错。就像您所期望的那样,在每一次进化迭代中,您都在查看前一次迭代,查看您拥有的最强大的解决方案,然后尝试富有创造力地思考如何将这些解决方案中的想法结合起来,或者引入全新的想法来提出更好的东西。是的,每一代都会越来越强大。我们谈论的规模有多大?例如,是否有方法可以预测需要多少代,或者您如何限制模型可以使用的迭代次数?您的问题有两个部分。一个是如何扩展,然后如何预测。关于第一部分,这是 Alpha Evolve 的一个很好的特性,它可以适应问题的难度。如果您要求 Alpha Evolve 找到一个实际上出乎意料容易的问题的解决方案,那么它会非常非常快地完成,几乎立即就能得到解决方案。但如果您要求它解决一个非常非常困难的问题,我所说的非常非常困难是指真正困难,可能是科学界存在了几十年的一个开放性问题,或者您想要一个用于谷歌高价值应用的实际算法,那么您当然会期望这不是一个容易的问题,您可能需要花费更长的时间来考虑不同的解决方案,探索空间,结合想法。但 Alpha Evolve 的真正好处在于它能够以一种持续改进的方式来维持这种扩展,并且它持续改进的时间如此之长,以至于您可以在这种难度级别上取得发现,例如解决存在了几十年的科学挑战或发现高价值算法。我知道这听起来可能微不足道,如果您等待更长时间就会得到更好的结果,但在实践中,构建能够持续改进而不会过早停滞的自动化代理实际上是一件非常困难的事情。我认为这是一个很好的特性。关于预测您需要多少次迭代,这是第二个部分。这实际上并不那么容易,因为它就像提前问一样。您知道这个问题会有多难吗?尤其是在科学领域,这通常会有一个非常令人惊讶的答案,非常简单的问题可能非常非常困难,反之亦然。但好处是,如果您运行这个系统,它会持续改进。只要您能运行它,您就可以期望得到越来越好的结果,您只需要看看它能达到什么程度。如果您考虑现在普通开发人员可以访问并越来越多地使用的编码代理,那么一个令人沮丧的问题是,对于相对琐碎的问题,它会自主地陷入困境并爆炸或停滞,正如您所说。您能否谈谈 Alpha Evolve 对其他通用编码代理是否有影响?虽然大型通用模型和编码代理在代码理解方面越来越好,但它们并不完美,对吧?它们确实会犯错误。另一个需要考虑的因素是这些代理被分配的任务。大多数情况下,如果您要求代理解决特定任务或编写特定程序,您会提供一个规范。您用自然语言指定任务,或者说我正在尝试完成某项工作,所以它不是您想要的完整描述,而是您想要的局部规范,然后代理会尝试解决问题,可能会幸运地得到正确的结果,或者可能会出现幻觉并得到错误的结果。问题是如何知道结果是正确还是错误的,这取决于拥有一个好的评估器,这就是 Alpha Evolve 解决问题的方式。所以从某种意义上说,我们能够利用幻觉来达到有益的目的。Alpha Evolve 能够产生的创造力和错误的答案,我们如何知道它们是错误的?它们可能非常好,我们只是没有以那种方式看到它们。这就是为什么评估器的作用如此重要,以及我们如何进行评估非常重要,因为当您提出一个新想法时,您是否应该尝试进一步探索该想法?您应该深入研究多少来压力测试该想法?您应该在几个不同的实例上尝试该想法,还是在一千个不同的实例上尝试?还是真正压力测试该想法是否适用于整个事情?这是 Alpha Evolve 的一个有趣之处。取得正确的平衡非常重要,这样您就可以看到创造性的解决方案在哪里,如何筛选出有希望的解决方案,然后稍后使用它们来完善搜索过程以获得最终解决方案。如果评估函数,自动化评估器确实是这里的限制因素,限制了我们可以让代理做什么。您对这个项目或其他项目有什么关于如何克服这一点的直觉吗?模型能否帮助我们创建自动化评估器?我们是否应该设想对更多不同领域更好的模拟器?如果我是一个普通的产品经理,向编码代理提供不完整的自然语言规范,我是否应该与助手合作来完成该规范?我是否使用跟踪?您认为这如何解决?这是一个非常非常好的问题,我认为您可以从两个角度来看待它,我认为它们会同时发生。一个是我们目前严格的评估函数在 Alpha Evolve 中起着关键作用,您可以从中得出的一个结论是,拥有这些评估器具有非常高的价值,因为在许多情况下,您可能有一个非常重要的问题,但您并没有一个非常精确的定义来衡量什么是好的解决方案。从这样的系统中,您可以得出的一个结论是,如果您确实构建了一个非常精确的评估函数,那么这将解锁像 Alpha Evolve 这样的代理发现一些远远超出人类或您最好的开发人员所能发现的东西的可能性。所以这是一个结论。但另一个我可能更兴奋的结论是,我们实际上不认为这是一个概念上的限制。今天,这是进入发现新事物游戏的最简单方法,通过查看已经带有这些非常精确的评估函数的项目。所以这只是一个自然的起点。但我确实相信这种假设可以在非常重要的方面放宽。特别是,您已经提到了一个例子,其中语言模型本身可能能够评估提出的解决方案是否看起来有希望,或者它们是否在某些特定方面失败。事实上,DeepMind 有一项名为 AI Co-scientist 的并行工作,它非常清楚地证明了这一点,即如果您用自然语言提出想法,那么您可以让语言模型提供有意义的批评,并识别出有效的想法和无效的想法。所以我确实对放宽这种假设寄予厚望。而且,在这两种极端情况之间,即严格的评估,精确地告诉您解决方案有多好,以及语言模型进行的自然语言评估,存在一个连续的光谱,包括模拟器和辅助评估函数,它们可能不完美,但只要它们与真实信号相关,我们就可以围绕它构建进化算法的算法框架,这样我们仍然可以取得有意义的进展,而且可能需要更多的迭代,但我们仍然可以走得很远。我想补充一点,正如 Mate 所提到的,我认为其中一个结论是,像 Alpha Evolve 这样的基于 LLM 的代理,特别是当我们以这种方式构建它们时,通过基于种群的搜索,通过进化方法,它们在搜索方面非常有效,它们可以在非常大的空间中进行非常令人信服和有效的搜索,并提出非常反直觉的新解决方案,解决我们研究了许多年甚至有时是几十年的重要问题。这是第一点。另一个关于评估器的元素,正如 Mate 所提到的,有使用其他评估来源的工作。即使对于 Alpha Evolve,您也没有完美的评估器,即使您有一个模拟器,它也不是一个完美的评估器,因为您将根据特定问题实例的分布来评估事物。您可能希望证明解决方案的某些属性,您可能希望说解决方案始终具有某些性能。所以如果您想证明解决方案的某些属性,那可能需要其他工作。您可能需要一个证明代理来尝试证明解决方案的某些属性。另一方面,您有这些基于 LLM 的评估器,它们可以查看解决方案,而且没有人构建模拟器,但它们可以猜测解决方案有多好。事实上,这种方法也效果很好,我们已经证明了 AI Co-scientist,我们用它来生成假设,它基本上使用多代理设置,其中 LLM 本身能够弄清楚某些假设在新颖性、重要性和影响力方面更好,应该被传播。而整个过程可能会让一些人感到惊讶和反直觉,它产生了比基础大型语言模型好得多的结果。您确实能够发现比大型语言模型本身单独产生的更多的信息。这引出了一个问题,我认为这是这项工作提出的最大的元问题之一,那就是我们是否获得了自我改进的人工智能?您用 Alpha Evolve 证明了您可以优化用于训练 Alpha Evolve 的系统。您在部分训练基础设施中实现了 23% 的速度提升。如果我没记错的话,我们现在是否正在目睹递归自我改进人工智能的早期阶段?如果您认为这是真的,您认为其影响是什么?我认为在某些方面是的,但目前我们看到的是计算时间的改进。Alpha Evolve 能够做到的就是使训练更有效率。但您可以问这个问题,您能否改进训练过程,使得底层模型不仅训练得更快,而且在某些认知任务上实际上更根本地更好?这还需要进一步验证,但这是一个非常吸引人的方向,也是许多人正在积极关注的事情。您有理由相信它不会成功吗?不,它应该会成功。但正如我们所提到的,拥有好的评估器是一个重要因素。所以拥有一个能够说您刚刚提出的改进训练过程的建议将产生良好结果的评估器。如果您有那种评估器,那么它就会起作用。没有理由认为这样的评估器不存在,但我们需要努力构建这样的评估函数。也许只是补充一点,我也同意我们可能看到了自我改进的第一个迹象,但人们也需要非常具体地说明我们迄今为止所展示的内容。正如 Pushmitt 所提到的,它加速了下一代 Gemini 模型的训练。反馈循环相当长,至少目前是这样,可能在几个月左右。但您可以称之为自我改进,当然,也许许多人好奇的大问题是,这如何推断到未来。您可以有不同类型的自我改进。一种是您可能只获得一次性收益,例如模型改进自身一次,然后就结束了。另一种是模型持续改进自身,但改进可能越来越小,然后收敛到某个极限,或者改进会不断累积,这仍然是一个很大的开放性问题,我们今天没有答案。让我们将这种预测推广到其他领域,显然这些领域都是相互关联的。Mate,您真正兴奋的是人工智能如何应用于科学领域。当您想到新的数学构造,改进对看似已解决的问题或人类在 50 年前就已解决的问题的解决方案时。您认为在不同领域的影响是什么?例如,它是科学发现或数学研究方式的根本转变吗?首先,是的,我非常兴奋在这个领域工作,利用人工智能加速科学研究,因为在某种程度上,这是我能想象到的最令人兴奋的人工智能应用,有什么比推进人类知识的前沿更有价值或更令人兴奋的呢?所以,是的,这绝对存在。然后,当然,在不同的科学领域,人工智能带来的进步速度或进展可能会略有不同。因此,在 Alpha Evolve 中,我们主要关注数学和计算机科学,因为这些是更容易获得自动化评估函数的领域,您通常可以免费获得它们。这并不是说您在其他科学分支中无法获得它们。但在数学和计算机科学中,它们只是更常见。如果您想到生物学或化学,您想设计一个分子,那么您又可以有一个评估函数,形式是模拟器或预测模型,给定一个候选分子,它将对该分子是否真的能在实践中起作用做出有意义的预测。然后,如果您处于这种状态,那么 Alpha Evolve 就可以适用,而且我们只谈论我们今天构建的 Alpha Evolve 版本,这些是我们今天能够解决的问题。但我们并不认为 Alpha Evolve 的旅程就此结束。我们有很多关于如何使这个系统更强大、更广泛适用的想法,而且我非常有信心,我们将看到许多跨越多个科学分支的应用。这只是谈论 Alpha Evolve,还有许多其他代理,Pushmitt 提到了 AI Co-scientist 和许多其他代理,我相信它们将继续改变整个科学研究的面貌。是的。所以,总的来说,如果您看看科学,很多科学都涉及搜索,寻找正确的想法,寻找正确的构造,寻找正确的解决方案,寻找正确的药物候选者等等。在某种意义上,科学家们一直在尝试使这个过程可重复。目前,仍然存在一些偶然发现的元素。但随着我们朝着理性材料发现或理性药物发现迈进,计算方法和非常系统的评估在许多科学领域发挥着越来越重要的作用。我认为随着这项工作的推广,您将拥有像 Alpha Evolve 这样的系统,它们能够搜索这些空间并更有效地利用这些评估。所以,您可以将其视为一个工具,它将赋予科学家们在搜索非常复杂且有时反直觉的解决方案空间方面的超能力。当我想象到这种方法的一个逻辑延伸时,那就是,让我们在现实世界中进行自动化评估,例如实验室实验,您有一堆机器人手臂进行实验,如果您正在筛选分子。您认为人类科学家或工程师在不久的将来扮演什么角色,如果这个愿景是真的?是问题框架,确定评估?是约束搜索空间,提供一些关于起点或搜索空间的直觉?从现在开始,人类科学家应该擅长什么?有很多方面,对吧?首先,正如我们一直在谈论的,评估函数的作用。它需要被定义,我们如何真正评估这些解决方案?但还有许多其他方面。当我们试图找到一个解决方案时,它必须具有某些属性。那些属性是什么?提供提示,例如,如果您试图发现一种新药,您想确保该药物能够治疗疾病但不会杀死患者,对吧?它的副作用很低,对吧?或者它的给药方式是什么?所以一个解决方案可能需要满足许多不同的要求,其中一些被编码在评估函数中,而另一些您可能希望在解决方案中硬约束它们。您能否指定这些,以便像 Alpha Evolve 这样的代理在考虑如何暴露搜索空间或如何构建它将生成的解决方案时能够考虑到这些?这些都是非常有趣的地方,可能需要人类的输入,尤其是在我们观察许多不同类型的领域时。所以,是的,我认为我们绝对应该将此视为科学家、计算机科学家、数学家以及我们自己的经验的惊人工具。在正确的手中,它是一个非常强大的工具。例如,尝试探索它的数学家们能够指定他们正在寻找的解决方案类型,他们可以更具成效,更有效地找到解决方案。我只是想强调,尽管我们一直将 Alpha Evolve 描述为一种自主代理,但实际上,使用这个代理通常被证明是令人惊讶的协作。我们尤其在与数学家合作时看到了这一点。有几个原因,但其中一个原因是 Alpha Evolve 不仅仅提供解决方案,它还搜索构建该解决方案的算法。因此,根据您如何设置问题定义,算法通常比解决方案本身更有价值,因为它告诉您如何构建解决方案。这意味着您了解构建该解决方案所包含的想法,尤其是在数学领域,人们真正关心的是理解我们宇宙的本质,并建立对基本思想的理解。所以,解决方案本身几乎不那么有趣,但您关心的是如何构建它。我们与多位数学家合作的第一手经验,看到我们与他们分享 Alpha Evolve 的输出,他们会非常着迷地看着它找到的代码,并试图理解它到底在做什么。然后理解“哦,好的,这个在做这个,那个在做那个,现在我明白了为什么如果你把它们放在一起,它就会导致一个很好的解决方案。”是的,我也可以从我自己的个人经验中证实,查看系统找到的代码或算法,通常是一种非常有趣的体验,因为它看起来像人类写的代码,就像您可以写出来的东西,但您会想到用这种方式写吗?然后试图理解它到底在做什么,这是一种非常有趣的体验。但同时,这也是该系统的关键优势之一,不仅适用于科学应用,您还可以查看代码并从中获得一些理解,而且也适用于许多实际应用。您从 Alpha Evolve 中获得的产物是一段代码,然后您部署这段代码,这是非常有价值的。在这样做之前,专家,从事该系统的工程师可以直观地检查这段代码,理解它,并最终决定是否部署它。这与考虑使用神经网络在生产系统中做决策完全不同,您需要相信神经网络总是会按照您希望的方式运行。有了代码,您可以查看它,理解它,并自己做出决定。我还可以补充一点,并非所有代码都可以被人类解释。Alpha 找到的解决方案和程序可以被人类程序员解释。所以,当您找到这些解决方案时,我们可以从中学习什么,这将是未来非常有趣的工作领域。正如 Mate 所提到的,这是一种非常有趣的体验,我们与 Jordan Ellenberg 在 Alpha Evolve 的早期版本中合作时,我们在解决 Capset 问题时,它发现的程序具有非常有趣的对称性,这是数学家们不知道的。所以,不仅解决方案在数学上很有趣,而且实际的构造,而且产生该构造的算法本身也很有趣。对于那些正在考虑可访问性或对他们自己(非专业数学家)的影响的听众来说,在使这些能力更广泛可用方面有哪些考虑因素?我们希望使这些能力能够被尽可能多的人,更广泛的社区所访问。现在,我们已经启动了一个受信任的测试者计划,我们要求人们提交提案。我们打算通过该计划来弄清楚人们如何真正利用 Alpha 的正确方法。我们已经在谷歌内部使用过它,但正如您所知,它需要一些东西,例如函数评估器的需求。作为受信任测试者计划的一部分,我们将评估 Alpha Evolve 在各种不同类型的应用上的表现,这将为我们未来的发布策略提供信息,即如何使其更广泛适用。第二个要素是,您不仅需要评估器,还需要大量的计算资源。因为它不仅仅是一个 LLM 调用,它需要大量的函数评估,具体取决于问题的难度。如果这是一个简单的问题,那么您可以很快完成它,但如果您真的要解决一些非常困难的问题,具有非常大的扩展搜索空间,并且您想花费大量时间进行搜索。那么如何构建一个人们可以有效和高效地使用的整体系统?这是我们也将考虑的另一件事。最后一个问题,你们两位。在谷歌内部是否有您认为有趣但尚未尝试过 Alpha Evolve 的实际应用?在这篇白皮书中,我们试图全面思考,当我们审视谷歌的计算基础设施时,哪些是基础设施的关键部分,以证明 Alpha Evolve 可以在整个堆栈中做出发现,而不仅仅是在其中一个部分,并且它可以做出非常有价值的发现。所以我们试图涵盖整个范围。所以,我们展示了 Alpha Evolve 可以提高数据中心的效率。它可以为硬件设计做出贡献,并且可以为提高谷歌内部运行的最重要软件的效率做出贡献。我们的一个意图是证明这是一个真正多功能的工具,您可以将其应用于整个范围。正如 Pushmitt 所说,这是一个已经在谷歌内部可用的工具,并且它已经被用于许多许多问题。有相当多的令人兴奋的问题。我还没有准备好分享具体细节,但正如您可以想象的那样,在谷歌这样的地方,在人工智能内部以及外部,有如此多的令人兴奋的计算问题,我确信未来会有许多非常酷的结果。我认为这是一个很好的结束点。Push,Mate,有什么我们没有涵盖的吗?我认为这很棒,非常感谢你们的到来,恭喜。好的,非常感谢。在 Twitter 上关注我们 @no prior pod。如果您想看到我们的脸,请订阅我们的 YouTube 频道。在 Apple Podcasts、Spotify 或任何您收听播客的地方关注本节目。这样,您每周都会收到一集新节目。并在 no-priers.com 注册电子邮件或查找每集节目的文字记录。[音乐]