Transcription
以下是与 Ariane Vinnie Alice 的对话。他是 Google DeepMind 的高级研究科学家,在此之前,他曾在 Google Brain 和伯克利任职。他的研究已被引用超过 39,000 次。他确实是深度学习领域最杰出、最具影响力的思想家之一。他参与了包括序列到序列学习、音频生成、图像字幕、神经机器翻译以及当然还有强化学习在内的一些最大的人工智能论文和思想。他是 AlphaStar 项目的首席研究员,该项目创造了一个击败了星际争霸顶尖职业玩家的代理。这次对话是人工智能播客的一部分。如果您喜欢,请在 YouTube、iTunes 上订阅,或者在 Twitter 上与我联系,我的用户名是 Lex Friedman,拼写为 Fri D。现在,这是我和 Arielle Minnie Alice 的对话。
您领导了 DeepMind 团队,开发了 AlphaStar,该团队最近击败了星际争霸的顶尖职业玩家。您在深度学习和许多领域都有着令人难以置信的丰富工作,但让我们先谈谈星际争霸。让我们回到最初,甚至在 AlphaStar 之前,在 DeepMind 之前,在深度学习之前。对您来说,是先有了对编程的热爱,还是对电子游戏的喜爱?
我认为对我来说,肯定首先是玩电子游戏的动力。我真的很喜欢电脑,但我并没有真正写太多代码。但我会做的是,我会随便摆弄电脑,弄坏它,然后修复它。我想这就是我在早期获得的技能水平,大概在我 10 岁或 11 岁的时候。然后我真正沉迷于电子游戏,尤其是星际争霸。实际上是第一个版本,我大部分时间都在玩,可以说是半职业地玩,就像 98 年在欧洲你能玩到的最职业的水平一样,那不是一个像现在所谓的电子竞技那样的主流场景。
当然是在 90 年代。那么您是如何接触星际争霸的?您最喜欢的种族是什么?您是如何发展,如何发展您的技能的?您的策略是什么?所有这些之类的。
作为一名玩家,我倾向于尽量少玩游戏,以免泄露我开发的策略。我喜欢随机选择种族,不是在比赛中,而是只是为了……我认为在星际争霸中,有三个主要种族,我发现玩所有种族都非常有益。所以我会经常选择随机,甚至有时在比赛中,以提高对这三个种族的技能。因为这不是你如何对抗某人,而是如果你理解一个种族,因为你玩过它,你也理解什么会让人烦恼,那么当你在另一边时,你可以做什么来惹恼那个人,来争取在这里和那里的优势,等等。所以,我实际上是随机选择种族,尽管我必须说,就我最喜欢的种族而言,我真的很喜欢虫族。我可能是虫族玩得最好的,而且这可能是我在大学开始之前,在我职业生涯的最后阶段倾向于使用的。
那么,让我们稍微往回看一点。您能否尝试向那些可能从未玩过电子游戏,尤其是大型在线游戏的人描述一下星际争霸?
好的,星际争霸是一款即时战略游戏。也许如果您对国际象棋有所了解,那么思考星际争霸的方式是,有一个棋盘,称为地图或……或者……玩家互相玩耍的地图。显然有很多种玩法,但最有趣的是一对一的设置,您只是与其他玩家或内置人工智能对战。如果您不知道如何玩,人工智能可以相对较好地玩游戏。然后在这个棋盘上,您再次拥有像国际象棋中的棋子,但这些棋子最初并不在那里,就像在国际象棋中一样。您实际上需要决定收集资源,决定要建造哪些棋子。所以,在某种程度上,您几乎是赤手空拳开始的。您开始收集资源。在星际争霸中,有矿物和瓦斯可以收集。然后您必须决定您想在收集更多资源或开始建造单位或棋子方面投入多少。然后,一旦您拥有足够的棋子,或者也许是……你知道,一个好的攻击组合,然后您就去攻击地图的另一边。现在,与国际象棋的另一个主要区别是,您看不到地图的另一边。所以您看不到敌人的行动。这就是我们所说的部分可观察性。因此,您不仅必须决定经济与建造自己的单位之间的权衡,而且您还必须决定您是否要侦察以收集信息。但通过侦察,您也可能泄露一些您可能对敌人隐藏的信息。所以有很多复杂的决策,所有这些都是实时的。与国际象棋不同,这不是一个回合制游戏,您基本上一直在玩,持续不断。因此,在速度和点击准确性方面的一些技能也非常重要。那些为此训练的人真的以惊人的技巧玩这款游戏。我见过很多次了,如果您能亲眼目睹,那真是令人印象深刻。所以,在某种程度上,它就像一盘国际象棋,您看不到棋盘的另一边,您正在建造自己的棋子,您还需要收集资源,基本上是为了获得一些钱来建造其他建筑、棋子、技术等等。
从人类玩家的角度来看,它与国际象棋或像《英雄无敌》这样的回合制策略游戏的不同之处在于,存在一种焦虑,因为您必须非常快速地做出这些决定。如果您实际上不知道哪些决定有效,那么这是一个非常紧张的平衡。您描述的一切实际上对一个成熟的人类玩家来说都非常紧张,很难平衡。我不知道它是否在职业水平上变得更容易,就像他们完全知道他们必须做什么一样。但在业余水平上,存在这种焦虑:“哦,糟了,我被攻击了。”“哦,糟了,我必须积累资源。”“哦,我必须扩张。”所有这些,即时战略方面真的非常紧张,而且计算量肯定很难。我会深入探讨,但对我来说,战网……星际争霸于 98 年发布,20 年前,这很难相信。而暴雪的战网与暗黑破坏神 96 年发布。对我来说,这可能是一个狭隘的观点,但它永远地改变了在线游戏,也许也改变了社会。是的,但我可能犯了一个过于狭隘的观点。从您的角度来看,您能否谈谈过去 20 年游戏的历史?这些游戏有多么具有变革性,多么重要?
我认为我当时是互联网和在线游戏发展过程中的活跃玩家。所以对我来说,它的到来方式是,我玩过其他策略相关的游戏,我玩过一些《命令与征服》,然后我玩了暴雪的《魔兽争霸 2》。但当时我并不知道,我并不了解暴雪是什么,或者任何事情。《魔兽争霸 2》只是一款游戏,它在很多方面实际上与星际争霸非常相似。它也是一款即时战略游戏,其中有兽人和人类,所以只有两个种族。它是在线玩的,对吧?所以,我记得我的一位朋友来学校说:“哦,有一款很酷的新游戏叫星际争霸。”我只是说:“哦,这听起来就像是《魔兽争霸 2》的复制品。”直到我安装了它。当时我来自西班牙,我们的互联网不像现在这样好。所以,对我们来说,星际争霸首先是一种离线体验,您开始玩这些任务。您玩一些脚本化的东西来发展游戏角色的故事。然后,后来我开始与内置人工智能对战,我认为它不可能被击败。然后,最终您击败了一个,并且实际上可以同时击败七个内置人工智能,这似乎也不可能。但实际上,同时击败七个内置人工智能并不难。所以,一旦我们实现了这一点,我们也发现我们可以玩……正如我所说,互联网当时并不那么好,但我们可以玩局域网。基本上,如果我们在一起,就可以通过连接机器来实现。所以我们开始玩局域网模式,再次,你知道,作为一群朋友,它比玩人工智能更有趣。然后,随着互联网开始发展,变得更快、更可靠,我才开始体验战网。这是一个了不起的宇宙,不仅因为您可以与世界上的任何人玩游戏,还可以认识更多人。您只是接触到了……现在,就像聊天室出现时一样。有一个聊天系统,您可以与人们对战,您也可以与人们聊天,不仅关于足球,还关于任何事情。这成为了我生活了大约两年的方式。当然,然后它变得……它爆炸了,我开始更认真地玩,参加比赛等等。
您是否从社会学角度意识到,社会中有一大部分人是我们许多人没有意识到的,而且这是社会的一大部分,那就是玩家?我每次在 YouTube 或流媒体网站上看到它,我都觉得玩游戏的人数非常多,他们虔诚地玩游戏。您是否意识到这些人的存在,尤其是在您现在又回到了那个领域之后?
是的,事实上,即使在足球之后,我实际上也玩过《魔兽世界》,这是主要的……你知道,主要的在线世界,您可以在其中与许多人互动。我玩了一段时间。对我来说,它比星际争霸压力小一些,因为获胜似乎是理所当然的。您只是进入了这个世界,您可以随时完成任务。但我认为,尤其是星际争霸,然后是像《魔兽世界》这样的游戏,其社交方面确实以一种非常有趣的方式塑造了我。因为您会遇到……您会遇到您通常不会与之互动的人。所以,即使是现在,我仍然有很多来自我在线玩游戏的那个时期的 Facebook 好友。他们的思维方式,甚至政治观点,我们只是……我们并不生活在……我们并不在那里互动,在现实世界中。但我们通过……基本上是通过光纤连接的。通过这种方式,我实际上可以更好地理解我们生活在一个多元化的世界里。而这些只是因为……你知道,我碰巧进入了一个虚拟城市的祭司,遇到了……你知道,这个战士,我们成为了朋友,然后我们开始……一起玩。所以,我认为这是……这是变革性的。越来越多的人意识到这一点。我的意思是,它正变得相当主流。但回想起来,就像您说的,在 2000 年、2005 年,这仍然是一件非常奇怪的事情,尤其是在欧洲。我认为有一些例外,比如韩国。那真是太棒了,一切都发生得如此之早,就网吧而言。就像,如果您去首尔,那是一个城市,当时玩星际争霸可以成为名人。但这已经是 99 年、2000 年了,不是最近。所以……是的,回头看真是很有趣。是的,我认为它正在改变社会。当然,技术和社会网络等等也在改变事物。
让我快速问一个题外话。您也是您选择的激情和人生道路上最多产的人之一。然而,您也欣赏和享受电子游戏。您认为有可能适度地享受电子游戏吗?有人告诉我,当我在玩电子游戏时,您可以选择三者中的两个:您可以选择有一个女朋友、玩电子游戏或学习。我认为在大多数情况下,这是相对真实的。这些事情确实需要时间。像星际争霸这样的游戏,如果您非常认真地对待游戏,并且想学习它,那么您显然会投入更多时间。我绝对非常认真地对待游戏,当然也认真对待学习。我喜欢学习科学等等。所以对我来说,尤其是在我开始上大学本科时,我有点退出了星际争霸。我实际上完全停止了玩游戏。然后《魔兽世界》有点更休闲,您可以随时在线连接。我的意思是,它很有趣,但正如我所说,它不像星际争霸那样需要投入大量时间。
好的,让我们来谈谈 AlphaStar。您是 DeepMind 团队背后的负责人。DeepMind 在过去几年里一直在研究星际争霸,并发布了许多很酷的开源代理等等。但 AlphaStar 确实是您第一次击败世界级玩家的时刻。AlphaStar 如何应对这项挑战?您和 David 以及 DeepMind 团队的其他成员是如何开始这项工作的,考虑到您甚至可以击败世界上最好的玩家或顶尖玩家?
我认为这一切都始于 2015 年,实际上,我记错了,我认为是 2014 年,当时 DeepMind 被谷歌收购。我当时在 Google Brain,它在加利福尼亚。我们在那里举行了一次峰会,将两个团队——Google Brain 和 Google DeepMind——聚集在一起。我们做了一系列演讲。鉴于他们正在为游戏进行深度强化学习,我决定提起我过去的一部分,我在伯克利开发的,我们称之为 Berkeley Overmind 的东西,它实际上只是星际争霸 1。所以我谈到了它。我记得他们走过来对我说:“好吧,也许现在不行,也许现在还为时过早,但你应该来 DeepMind,用深度强化学习再做一次。”当时,这听起来非常科幻,原因有很多。然后,在 2016 年,当我实际上搬到伦敦并加入 DeepMind,从 Brain 转过来时,由于 AlphaGo 的事件,以及 Blizzard 联系我们说:“等等,你想接受下一个挑战吗?”而且我全职在 DeepMind 工作,所有这些都汇集在一起。然后我去了加利福尼亚的 Blizzard 总部,只是和他们聊天,在做任何事情之前尝试解释这一切将如何运作。
方法一直都围绕着学习的视角。所以在伯克利,我们做了很多基于规则的……你知道,条件控制,或者如果你有三个以上的单位,就去攻击,如果对方有比我多的单位,我就撤退,等等。当然,深度强化学习、深度学习、机器学习的重点是,所有这些都应该是学习到的行为。所以,这基本上是该项目自 2016 年成立以来的 DNA,当时我们甚至还没有一个可以工作的环境。所以,这就是一切的真正开始。
那么,如果您回顾一下与 David 的谈话,或者您自己的想法,您认为您离这个目标有多远?我们正在谈论雅达利游戏,我们正在谈论围棋,老实说,它离星际争霸很远。现在您已经击败了它,您可能会说它很近,但它似乎比围棋在哲学和数学上都更难。那么,您认为您离这个目标有多远?您认为在 2019 年或 18 年,您就能做得像现在这样好吗?
当我想到我要投入大量时间和精力来做这件事时,当然,我在深度学习领域做了很多不同的研究,所以花时间在这上面。我的意思是,我真的不得不认为会从中发生一些好事。所以,我真的认为,这听起来是不可能的,而且可能不可能完成所有的事情,就像一对一的游戏,而且只有神经网络在玩等等。所以,它真的感觉我甚至不认为这是可能的。但另一方面,我可以看到一些垫脚石,朝着那个目标前进。显然,您可以定义星际争霸中的子问题,并对其进行一些剖析,说:“好吧,这是游戏的一部分,这是另一部分。”而且,当然,事实……这对我来说也非常关键,那就是我们可以访问人类的回放。所以,Blizzard 非常友善,事实上,他们为整个社区开源了这些。您可以去,并不是所有玩过的星际争霸游戏,但有很多。您可以下载,每天都可以查询数据集,说:“好吧,给我今天玩过的所有游戏。”鉴于我在语言和序列以及监督学习方面的经验,我认为这肯定会非常有帮助,而且是相当独特的东西。因为以前我们从未有过如此大规模的游戏回放数据集,而且是在如此复杂的电子游戏中。所以,对我来说,这是一个宝贵的资源。一旦我知道 Blizzard 能够将这些提供给社区,我就开始对一些非同寻常的事情感到乐观。但我同时也认为,所有的事情,真的没有规则,没有一行代码试图说……我的意思是,如果你看到这个单位,就会检测到所有这些,没有任何这些专业化,对我来说似乎真的非常非常困难。我也喜欢 Blizzard 在取笑,甚至在捉弄你,有点像……是的,把你拉进这个非常困难的挑战。他们是否意识到,从 Blizzard 的角度来看,除了好奇心之外,还有什么兴趣?
我认为 Blizzard 真正理解并真正推动了电子竞技游戏的竞争力。星际争霸确实引发了很多……你知道,一些以前从未见过的事情,尤其是我在韩国的时候。所以他们可能只是觉得,这是一个如此纯粹的一对一的设置,如果一个能玩雅达利或围棋,然后是国际象棋的东西,也能应对这种复杂的即时战略游戏,那将是伟大的。所以,对他们来说,他们首先想看到的是……显然,是否可能,他们创造的游戏在某种程度上是可解的。而且我认为,另一方面,他们也是一家非常现代化的公司,创新能力很强。所以,仅仅开始理解人工智能对他们来说,如何将人工智能带入游戏,而不是……人工智能用于游戏,而是游戏用于人工智能。哦,对。我的意思是,两者都可以。而且,当然,DeepMind 使用游戏来……你知道,推动人工智能进步。但 Blizzard 可能能够做到,以及许多其他公司,开始理解……反过来。所以,我认为这也是他们可以从中获得的东西。而且,我们当然也进行了很多头脑风暴。但对我来说,星际争霸和暗黑破坏神以及 Blizzard 创造的这些游戏有趣之处在于,例如平衡职业的任务,从一开始就使游戏公平,然后技能……结果是……嗯,您能先评论一下吗?有三个种族:虫族、神族和人类。我不知道我是否曾经大声说过,是这样发音的吗?人类?是的。我不知道我是否亲自与任何人就星际争霸进行过互动。这很有趣。它们似乎相当平衡。我想知道 AI,您正在进行的 AlphaStar 的工作是否能帮助它们进一步平衡?您是否考虑过这个问题?暴雪是否在考虑这个问题?
所以,平衡……当你添加一个新单位或一种新的法术类型时,显然是可能的,因为你总是可以大规模地训练或重新训练一个代理,它可能会以意想不到的方式使用它。但我认为,如果你理解星际争霸是如何……你知道,以一种方式与玩家共同进化的,我认为很多玩家想出的方法和策略实际上非常酷。所以,我认为我们在星际争霸中一次又一次地看到,暴雪可能推出一个新的单位,然后一些玩家变得有创意,做了一些……你知道,意想不到的事情,或者暴雪设计师根本没有测试或考虑过的事情。然后,当它成为社区中的主流时,暴雪会修补游戏,然后他们可能会削弱该策略,或者使其更有趣,但更平衡。所以,这种玩家和暴雪之间持续的对话,实际上定义了他们。实际上,在大多数游戏中,在星际争霸中,在《魔兽世界》中,他们也会这样做。有几个职业,如果每个人都玩完全相同的种族等等,那就不好了。所以,我认为他们确实关心平衡,当然,他们也进行了大量的测试。但看到玩家如何变得有创意也同样美妙。而且,我的意思是,我是否能在这个阶段更有创意?我不这么认为。我的意思是,有时会发生一些非常惊人的事情。我记得在……你知道,当时你会有这些运输机,它们可以运送……你知道,河流,而实际上并没有想到你可以运送这个单位,它有这种……你知道,所谓的溅射伤害,它基本上可以一次消灭所有敌人的工人。没有人想到你可以把它放在……你知道,在游戏早期就造成那种伤害。然后,你知道,游戏中的事情会发生变化。但我不知道,我认为这是一个非常惊人的探索过程,对双方玩家和暴雪来说都是如此。
这几乎就像一个强化学习的探索,但规模是玩暴雪游戏的玩家的规模,几乎与大型 DeepMind RL 实验的规模相当。我的意思是,如果你看看数字,我不知道有多少场比赛,但可能每月有数十万场比赛。是的,我的意思是,所以你可以……这几乎就像运行 RL 代理。星际争霸 II 的一个方面的问题,最难的是什么?就像你说的,信息不完整?是必须进行长期规划?是必须非常快速地完成事情的实时方面?是你可以做很多事情的庞大行动空间?还是……你知道,从博弈论的角度来看,没有纳什均衡?至少你不知道最优策略是什么,因为选项太多了?有什么特别突出的,就是最难的,最烦人的事情?
所以,当我们……你知道,审视这个问题并开始定义……你知道,它的参数时,例如,观察是什么,行动是什么。变得非常明显的是……你知道,人们会遇到的第一个障碍是,因为行动空间非常大,而且无法像在国际象棋或围棋中那样搜索。即使搜索空间很大,我们确定的主要问题是探索。所以,在没有任何人类知识或人类先验知识的情况下,如果你想到星际争霸,并且你知道深度强化学习算法是如何工作的,它基本上是通过发出随机动作,并希望它们有时能赢得一些比赛,这样它们就可以学习。所以,如果你想到星际争霸的行动空间,在早期游戏中,几乎任何你可以做的事情都是糟糕的,因为任何动作都涉及……你知道,带走工人,他们正在免费开采矿物。这是游戏自动完成的事情,你立即就会把它们从采矿中移开,然后让它们四处走动。所以,仅仅想想……你知道,如何有可能理解这些概念?但更重要的是……你知道,扩张?有……你知道,这些建筑,你可以在地图的其他位置建造,以收集更多资源。但建筑的位置很重要。你必须选择一个工人,让它走到那个位置,建造建筑,等待建筑建成,然后把更多的工人放在那里,这样它们就可以开始采矿。仅仅是……你知道,这感觉是不可能的,如果你只是随机点击来产生那种理想的状态,然后你就可以从中学习,因为最终这可能会带来额外的胜利。所以,对我来说,探索问题,以及由于行动空间和事实上没有真正的回合,有很多回合,因为游戏基本上每秒达到 22 次。如果你是说,这就是他们如何离散化……你知道,时间。当然,你总是必须离散化时间,没有真正的时间。但这是很多可能出错的时间步长。而且,这绝对是先验地感觉最难的。您提到了许多好的方面。我认为部分可观察性以及由于部分可观察性而没有完美策略的事实,这些都是非常有趣的问题。我们现在看到得越来越多,因为我们解决了以前的问题。但对我来说,核心问题是探索,解决它基本上一直是焦点,也是我们看到第一个突破的方式。所以,探索……你知道,以一种多层次的方式。所以,每秒 22 次的探索,与……你知道,我应该早点收集资源,还是应该等待等等,其含义截然不同。那么,您如何解决长期问题?
让我们谈谈 AlphaStar 的内部。首先,您如何将游戏状态表示为输入?然后,您如何进行长期序列建模?您如何构建策略?那么,架构是什么样的?
AlphaStar 显然有几个组件,但所有这些都通过我们称之为策略的……你知道,神经网络。这就是它的美妙之处。我可以现在给你一个神经网络和一些权重,如果你输入正确的观察结果,并且你理解动作的方式与我们一样,那么你基本上就会拥有玩游戏的代理。除了那些经过训练的权重之外,别无他物。第一步是观察游戏。我们尝试了几种替代方案。我们目前使用的一种混合了空间图像,你可以从游戏中处理这些图像,这是地图的缩小视图,以及……你知道,相机的缩小视图,或者我们称之为屏幕。但我们也给代理提供了它看到的单位列表,作为它可以操作的对象集合。这并不一定需要使用它。我们有不使用这种集合视觉效果就能玩得很好的游戏版本。这有点不像人类感知游戏的方式,但它肯定有很大帮助,因为它是一种非常自然的编码游戏的方式,只需查看所有存在的单位。它们具有诸如生命值、位置、单位类型、是我方单位还是敌方单位等属性。这就是……你知道,对游戏状态的总结。注意这个单位列表或单位集合,你一直都能看到。
那非常接近人类的看法。为什么您说不是呢?难道您不是说它的精确性不是……是的,它的精确性也许不是问题。我猜问题是,如果你从人类玩游戏的方式来看,他们是用鼠标和键盘以及屏幕玩的,他们看不到……你知道,一个结构化的对象,里面有所有单位。他们看到的是屏幕上的东西,对吧?是的。所以,请记住,存在某种……你展示了一个基于摄像头的图,你做的正是那样。四处移动,这似乎收敛到相似的性能。
我认为我们正在尝试什么才是必需的,什么不是。但使用集合……实际上,如果你看看计算机视觉领域的研究,将图像视为二维数组是有意义的。实际上,Facebook 有一篇很好的论文,我认为我忘了作者是谁了,但我认为它是游戏组的一部分。他们所做的是,他们拍摄一张图像,这是一个二维信号,他们实际上逐像素地打乱图像,就像它只是一个像素列表一样。关键是,他们用 XY 坐标来编码像素的位置。这只是一个我们碰巧也在星际争霸中使用的新的架构,称为 Transformer。这是去年一篇非常受欢迎的论文,在机器翻译方面取得了很好的结果。如果你真的相信这种……或者它实际上是一组像素,只要你编码了 XY,那就可以了。那么,你可能会争辩说,我们看到的单位列表正是如此,因为每个单位都可以被视为一个像素,如果你愿意的话,还有它们的 XY 坐标。所以,从这个角度来看,我们无意中使用了与在 Pascal、ImageNet 等上表现非常好的相同架构。所以,有趣的是,这样一来,它就开始朝着你通常处理语言的方式发展了。
特别是以您的专业知识和在语言方面的工作,似乎您处理 AlphaStar 的方式与您处理自然语言的方式有很多相似之处。这在某种程度上对长期序列建模有帮助吗?
是的,所以,现在我们知道了给定时间步长的观察结果是什么,我们需要继续说……你知道,将会有这样一个观察结果序列。代理需要,鉴于它所看到的一切,不仅是当前时间步长,还有它所看到的一切。因为存在部分可观察性,我们必须记住我们是否看到一个工人去了某个地方,例如。因为那里可能有一个扩张,在地图的右上角。所以,鉴于此,您必须考虑的问题是,存在这样一个问题:鉴于您拥有的所有观察结果,您必须预测下一个动作。而且,不仅是鉴于所有观察结果,而且鉴于所有观察结果和您已采取的所有动作,预测下一个动作。这听起来就像机器翻译。而且,这正是我看到问题的方式,尤其是当你获得人类的回放或监督数据时。因为问题完全相同。你基本上是在将观察结果和动作的前缀翻译成接下来会发生什么,这正是你如何训练模型进行翻译或生成语言。你有某个前缀,你必须记住过去的一切,否则你可能会开始出现不连贯的文本。我们使用的相同架构,LSTM 和 Transformer,用于跨时间操作,以整合所有正在发生的事情。那些在翻译或语言建模方面表现如此出色的架构,与代理用于在游戏中发出动作的架构完全相同。而且,我们训练的方式,此外,对于模仿,这是 AlphaStar 的第一步,采用所有人类经验并尝试模仿它,就像你尝试模仿翻译了许多句子对的翻译者一样。从法语到英语,例如。那个原则完全相同。你可能……它几乎是相同的代码,只是,而不是单词,你有一些更复杂的对象,那就是观察结果。动作也比单词更复杂。
是否有自我对抗的组成部分?一旦您用完了模仿?
是的,所以,确实,您可以从人类回放中引导。但然后,您获得的代理实际上并不像您模仿的人类那么好。那么,您如何模仿呢?我们从 3000 MMR 的人类那里获取,3000 MMR 只是一个衡量人类技能的指标。3000 MMR 可能就像 50% 的百分位数。所以,这只是一个……你知道,平均人类。那是什么?所以,也许快速暂停一下。MMR 是排名系统,比赛评分。是的,对于玩家来说。所以,3000……你知道,大师和宗师有 3000。所以,3000 实际上相当糟糕。我认为它有点像黄金级别。它听起来确实比国际象棋好。哦,是的,我知道。这个评分是世界上最好的,大约是 7000 MMR。所以,3000 就像埃洛伊一样。所以,3300 只是让我们不必过滤太多数据。我们喜欢在深度学习中有大量数据,您可能知道。所以,我们采用这种 3500 及以上的。但然后我们做一个非常有趣的技巧,那就是我们告诉神经网络它们正在模仿的级别。所以,我们说,这个回放,你将尝试模仿,以预测下一个动作。对于你将要看到的每一个动作,这是一个 4000 MMR 的回放。这个是 6000 MMR 的回放。而这个很酷的是,我们然后采用这个正在从人类那里训练的策略,然后我们可以要求它扮演一个 3000 MMR 的玩家,通过设置一个位,说:“好吧,扮演一个 3000 MMR 的玩家,或者扮演一个 6000 MMR 的玩家。”你实际上可以看到策略如何表现不同。如果你扮演一个黄金级别的玩家,它的经济会变差。它的每分钟动作数会减少,也就是你在整个分钟内发出的点击次数或动作次数。而且,看到它在某种程度上很好地模仿了技能水平,这非常有趣。但如果我们要求它扮演一个 6000 MMR 的玩家,我们当然会测试这些策略,看看它们做得如何。它们实际上击败了游戏中所有内置的人工智能。但它们远非 6000 MMR 的玩家。它们可能大约是黄金级别,白金级别,也许。所以,策略要真正理解获胜的意义,还有很多工作要做。到目前为止,我们只要求它们……好吧,这是屏幕,这是到目前为止游戏发生的事情。下一个动作是什么?我们要求……你知道,我们要求职业玩家……现在说,你将点击这里或这里或那里。而重点是……体验获胜和失败的经历非常重要,然后才能开始改进。否则,策略可能会变得松散,可能会偏离策略,就像我们所说的。
那太有趣了。您至少可以希望最终能够近似地控制一个策略,使其达到某个 MMR 水平。那太有趣了,尤其是考虑到您有很多这些情况的真实情况。您能问一些个人问题吗?您的 MMR 是多少?
我没有玩过星际争霸 2,所以我没有排名。这是……你知道,低级别。好吧。我以前玩过星际争霸,第一个。但你没有认真玩过。我们 DeepMind 中最好的玩家大约是 5000 MMR,这是高大师级别。不是宗师级别。宗师级别是某个地区(如欧洲、美洲或亚洲)的前 200 名玩家。但对我来说,很难说。我非常不擅长这款游戏。实际上,我玩 AlphaStar 的时间太晚了,它击败了我。我记得整个团队都说:“你应该玩。”我说:“它看起来还不太好。”然后我记得我有点忙,又等了一个星期,我玩了,它真的把我打得很惨。是吗?我听说过那种感觉。这是一种令人惊叹的感觉。是的,我的意思是,我当然尽力了,我也试图给我留下深刻印象。因为我实际上玩了第一款游戏,所以我仍然很擅长微操。我只是不理解星际争霸 2。我理解星际争霸。而且,当我玩星际争霸时,我可能连续几年都是欧洲前 32 名。所以我很不错。但当时我们没有这种 MMR 系统,它……你知道,建立得那么好。所以,很难知道当时是什么情况。
AlphaStar 和星际争霸中的人类玩家之间的界面有什么区别吗?它们看到游戏的方式有什么显著差异吗?
我想说,它们看到游戏的方式,有几件事很难模拟。也许最明显的是所谓的隐形单位,也就是看不见的单位。在星际争霸中,您可以制造一些单位,您需要一种特殊的单位来探测它。所以,这些单位是看不见的。如果您无法探测它们,就无法瞄准它们。所以,它们会……你知道,摧毁您的建筑或杀死您的工人。但尽管您无法瞄准单位,但有一种闪烁,作为人类,您会观察到。我的意思是,您需要训练一点,您需要注意,但您会看到这种……你知道,时空扭曲。您不知道……好吧,是的。是的,它就像一种波浪状的东西。是的,有点像……我讨厌它。那真是……暴雪的术语是闪烁。而这种闪烁,职业玩家实际上可以立即看到它。他们非常了解它。但它仍然需要一定的注意力,而且……你知道,处理起来有点烦人。而对于 AlphaStar 来说,在视觉方面,很难让我们模拟……你知道,你是否在看屏幕上的这个像素,等等。所以,我们唯一能做的就是……你知道,那里有一个隐形单位。所以,AlphaStar 会立即知道。当然,它仍然遵守规则,您不能攻击单位,您必须有探测器,等等。但它有点……你知道,这是最主要的事情,它只是感觉没有……你知道,一个非常 proper 的方式。我的意思是,你可以想象……你知道,你没有高精度,不知道它在哪里。或者有时你看到它,有时你看不到。但它真的……你知道,真的很难做到,让每个人都同意:“哦,这是模拟它的最佳方式。”
这似乎是一个感知问题。
这是一个感知问题。所以,所以唯一的问题是……人们……你问人类如何感知游戏与 AlphaStar 有什么区别?我想说,他们无法立即像屏幕上出现的那样分辨出闪烁。而 AlphaStar 原则上可以看到它非常清晰。它似乎……好吧,它看到那个像素从零变成一,意味着现在那里有一个单位。虽然你不知道单位,或者你不知道它,你知道你不能攻击它,等等。所以,从视觉角度来看,这可能是最明显的一个。然后还有一些人类无法完美做到的事情,即使是职业玩家,那就是他们可能会错过一个细节,或者他们可能没有看到一个单位。显然,作为一台计算机,如果屏幕的一个角落变成绿色,因为一个单位进入了视野,它可以进入代理的内存,LSTM,并持续一段时间,无论它有多相关。
而在动作方面,AlphaStar 的动作速率似乎与职业玩家相当,如果不是更慢的话,但它也更精确,对吧?
所以,这是……这是非常……你知道,这可能是真正给我们带来最多问题的,有几个原因。第一个是,星际争霸多年来一直是一个人工智能环境。事实上,我的意思是,我参加了 2010 年的第一次比赛。而且,确实没有一个非常明确的规则集,关于每分钟的动作数,你可以发出的动作速率。因此,这些代理或机器人,人们以一种……你知道,非常酷的方式构建它们,它们每分钟可以执行 20,000 到 40,000 次动作。现在,为了让你有一个概念,一个非常好的职业人类……你知道,每分钟可以做 300 到 800 次动作。他们可能没有那么精确,这就是为什么这个范围有点难以准确识别。我的意思是,每分钟 300 次动作,精确地说是现实的,800 次可能不是。但你看到人类执行很多动作,因为他们热身,他们……你知道,选择东西并进行垃圾邮件发送等等,这样当他们需要时,他们就有准确性。我们进入这个领域,没有……你知道,一个标准的方法来说:“好吧,我们如何衡量一个代理是否达到人类水平?”另一方面,我们有一个巨大的优势,那就是因为我们进行模仿学习,代理的动作方式,在动作速率方面,甚至动作的精确度和不精确性方面,都像人类一样。在监督策略中,你可以看到所有这些。你可以看到代理喜欢点击移动到这里,如果你玩过暗黑破坏神,你会明白我的意思。我的意思是,你只是……你知道,垃圾邮件发送或移动到这里,你实际上做了……你知道,每两秒钟可能五次动作。但这些动作并没有什么意义。一个就足够了。所以,一方面,我们从这个模仿策略开始,它的每分钟动作数与人类大致相当,因为它在统计上试图模仿人类。所以,我们在博客文章中展示的曲线中看到了这一点,例如,这些每分钟的动作数,分布看起来非常像人类。但当然,随着自我对抗的开始……你知道,这是我们还没有过多谈论的部分……但当然,代理必须……你知道,让自己进步。那么,这些动作不会变得更精确,甚至动作速率也不会增加,这几乎没有保证。所以,我们所做的,这可能是……你知道,我们认为合理的第一次尝试是,我们查看了人类在特定时间窗口内的动作分布。只是为了给你一个概念,因为我猜我提到了其中一些……你知道,程序化代理,它们每分钟执行 40,000 次动作,职业选手,如我所说,200 到 800 次。所以,我们看的是……我们看的是职业玩家的分布,我们采取了相对较高的每分钟动作数。但我们……你知道,确定了某些截止点,之后,即使代理想执行这些动作,这些动作也会被丢弃。但问题是,这个截止点可能设置得有点太高了。而最终发生的是,即使游戏……而且当我们询问职业玩家和游戏玩家时,他们普遍认为它玩起来像人类。有一些代理可能开发了……你知道,每分钟动作数略高,结合精确度,这使得人们开始讨论一个非常有趣的问题,那就是:我们应该限制它吗?我们应该让它自由发挥,看看它能想出什么酷的东西吗?所以,这本身就是一个极其有趣的问题。但同样,就像模拟闪烁一样困难,模拟人类肌肉、精确度和疲劳的所有细节也会非常困难。所以,我们在这里……你知道,在创新,在这个意义上,好吧,什么可能是……你知道,下一个迭代,将更多的规则放入其中,使代理更像人类,在限制方面。是的,更多的限制。是的,那真是太有趣了,真是太有创新性了。
您给自己施加的约束之一,或者至少是您关注的重点是……
关于星灵种族,据我所知,你能告诉我不同的种族以及它们如何运作吗?星灵、人类和异形,它们如何比较?它们如何互动?你为什么选择星灵?在游戏的动态中,从战略角度来看,星灵是这样的,在三个种族中,在演示中我们只看到了星灵。所以也许我们先从它开始。星灵是技术最先进的种族,它的单位昂贵但强大。所以总的来说,你想在前进攻击时尽量保存你的单位。所以你想,然后你想利用非常华丽的法术等战术优势。同时,人们说他们可能更容易玩,对吧?但我实际上不知道。我是说,我现在和我们合作的玩家 TLO 和 Mana 聊了很多,他们说,哦,是的,星灵实际上,人们认为它是最容易玩的种族之一。所以也许更容易,这并不意味着它,你知道,显然职业玩家在三个种族中都很出色,而且从来没有一个种族能统治很长时间。所以,如果你看看世界上排名前 100 的玩家,是否有某个种族主导了这个名单?我想很难知道,因为它取决于地区。我认为在分布方面相当平均,而且暴雪希望它是平均的,对吧?他们不希望,他们不希望像星灵这样的种族在顶尖位置没有代表性。所以他们肯定会努力做到平衡,对吧?
那么,也许与星灵相对的种族是异形。异形是一个种族,你只需要扩张并尽可能多地获取资源,它们有很高的单位再生能力。所以如果你有一支军队,它并没有那么有价值,因为损失整支军队也没什么大不了的,因为你可以重建它。考虑到你通常会积累大量的资源,异形会通过施加很大压力来玩,也许会损失整支军队,但然后会迅速重建。所以,虽然当然每个种族,我的意思是,从来没有,我的意思是,它们非常多样化。我的意思是,异形中有一些单位在技术上很先进,它们会施放一些非常有趣的法术,而星灵中也有一些单位价值较低,你可以损失很多单位并重建它们,这也没什么大不了的。
好吧,也许我错过了,也许我会说一些愚蠢的话,但只是总结一下策略。首先是收集大量资源,对吧?所以这是一个选择。另一个是扩张,建造其他基地。然后另一个显然是攻击能力,建造单位并用这些单位攻击。然后我不知道还有什么。也许是不同的攻击时机,比如早期攻击,准备攻击。你学到了哪些不同的策略?我读到很多人非常高兴,你们显然发现了 AlphaStar,这也很棒。它是什么?饱和?哦,是的,它们令人头晕目眩的在线,是的,矿工,是的,是的,对于像我这样的贪婪的业余玩家来说,这总是一个好策略,你只需要积累很多钱,感觉很好,就是积累,积累。所以感谢你们发现了这一点,是的,验证了我们所有人。但还有其他你发现的有趣策略吗?是的,这个游戏独有的?是的,所以如果你看看不是双人游戏,当然《星际争霸》和《星际争霸2》以及即时战略游戏总体上非常相似。我可能会将游戏的开局进行分类,它们非常重要,总的来说,我会说有两种开局。一种是标准开局,这通常是玩家在风险和经济之间找到平衡,并尽早建造一些单位,以便他们能够防御,但他们不会暴露太多。但同时也在迅速扩张。所以这将是一种标准开局,而在标准开局中,你选择的目标是什么技术?所以有一点石头剪刀布,你可以选择飞船,或者你可以选择隐形单位,或者你可以选择,我不知道,像巨大的单位,它们攻击某些类型的单位,但它们对其他单位很弱。所以标准开局本身就有一些选择,比如石头剪刀布。当然,如果你侦察并且擅长猜测对手在做什么,那么你就可以获得优势,因为如果你知道我要玩石头,我的意思是我要玩剪刀,显然。所以你可以想象,在《星际争霸》中,正常的标准游戏看起来就像一场持续的石头剪刀布游戏,你猜测敌人的石头、剪刀、布的分布,并做出相应的反应来试图击败它,或者在他从石头变成剪刀之前,你就可以出剪刀,然后你就会处于劣势。
所以很抱歉在这里停顿一下,我没有意识到这个元素,虽然我知道它是真的,但扑克,我知道我看了 Lambrakis,你也是在估计,试图猜测分布,以便更好地估计分布,你的对手可能在做什么?是的,我的意思是,作为一个玩家,你肯定想对地图的另一边有一个信念状态,当你的信念状态变得不准确时,当你开始严重怀疑他是否会玩你必须知道的东西时,那就是你侦察的时候,你想收集信息,对吧?这是提高信念的准确性,还是提高信念状态的损失部分,你试图优化,还是它只是一个副作用?它是隐含的,但你可以明确地建模它,而且它会相当好。这可能是预测地图另一边的东西,但到目前为止,一切都是隐含的。没有额外的奖励来预测敌人。所以有这些标准开局,然后人们称之为,这非常有趣,AlphaStar 有时非常喜欢这种“奶酪”,这些“奶酪”是一种孤注一掷的策略。你会做一些鬼鬼祟祟的事情,你会把敌人藏起来,把自己的建筑藏在敌人基地附近,或者你会选择隐藏你的技术建筑,这样你就可以制造隐形单位,而敌人根本无法察觉并输掉比赛。有很多这样的“奶酪”及其变体,而信念状态变得更加重要,因为如果我侦察了你的基地,我没有看到任何建筑,任何人类玩家都知道有问题。他们可能会知道,你正在我基地附近隐藏什么,我应该突然建造很多单位来防御吗?我应该真的用工人封锁我的斜坡,这样你就不能来摧毁我的基地吗?所以所有这些事情都在发生,而且防御“奶酪”非常重要。在 AlphaStar 联赛中,许多代理实际上开发了一些“奶酪”策略,在我们看到的与 Elo 和 Mana 的比赛中,十个代理中有两个实际上在做这些“奶酪”策略。然后有一种“奶酪”策略叫做孤注一掷。孤注一掷的策略可能不像“我要在你基地建造炮塔,然后带上我所有的工人,试图破坏你的基地,游戏结束或 GG”,就像我们在《星际争霸》中所说的。有这些非常酷的东西,你可以精确地在某个时间点进行调整。例如,你可以生成正好十个单位的组合,完美地是这五种类型,那五种类型,并调整升级,以便在四分半钟,比如说,你有这十个单位,升级刚刚完成。在那时,这支军队非常可怕,除非敌人真的知道发生了什么,如果你进攻,你可能会获得优势,因为也许敌人正在做一些更标准的事情,扩张太多,发展了太多经济,并且在防御方面会糟糕地权衡,敌人会输。但它被称为孤注一掷,因为如果你不赢,你就会输。所以你看到玩家做这些策略,如果他们不成功,游戏并没有结束。我的意思是,他们仍然有一个位置,他们仍然在收集矿物,但他们会直接退出游戏,因为他们知道游戏结束了,我赌博了,我失败了。
所以如果我们开始进入游戏的博弈论方面,它确实非常丰富,而且确实如此,这也是为什么它也很有趣观看,即使我不玩,我仍然喜欢观看比赛。但代理们主要是在隐式地做这件事,但我们改进的一个方面是自我对弈,创建 AlphaStar 联赛,而 AlphaStar 联赛不是纯粹的自我对弈,它试图创建不同个性的代理,这样其中一些就会成为“奶酪”代理,一些可能会变得非常经济,非常贪婪,比如获取所有资源,但也许在早期他们会很弱,但后来他们会变得非常强大。通过创建这些个性的代理,有时自然而然地,你可以看到代理的演变,给定上一代,它们训练了所有这些代理,然后它们生成了完美的对应于该分布的计数。但你必须在种群中有这些代理,因为如果你没有它们,你就无法应对这些事情,对吧?这就像你想,你想,你知道,创造你将在野外遇到的各种对手,这样你就可以接触到这些“奶酪”,早期攻击,后期攻击,更多的扩张,从你的基地掉落单位,所有这些事情。纯粹的自我对弈在找到这些的某个子集方面有点停滞,但不是全部。所以 AlphaStar 联赛是一种方式,可以举例说明代理们都在玩,并且在一个联赛中,就像人们在 Battle.net 上玩一样,你玩一个做新酷策略的对手,你立刻就会想,我的天,我想试试,我想再玩一次。对我来说,这是问题的另一个关键部分,那就是我们能否为代理创建一个 Battle.net?是的,这有点像 AlphaStar 联赛,非常迷人,而且他们坚持他们的不同策略,是的,哇,这真的非常非常有趣。但话虽如此,你很幸运,或者说足够熟练,以 5-0 的比分获胜,那么获胜有多难?我的意思是,这也不是目标,我不知道目标是什么。目标应该是大多数,而不是 5-0,但总的来说,在所有对局中获胜有多难?我不想一对一。
这是一个非常有趣的问题,因为一旦你看到 AlphaStar,表面上看,你会想,好吧,让我们看看,如果你玩的一些游戏,比如 10 比 1,它输掉了用摄像头界面玩的游戏,你可能会想,好吧,这完成了,对吧?它在游戏方面超乎常人,但这并不是我们真正能提出的主张。事实上,我们的主张是我们第一次击败了一位职业玩家。星际争霸已经存在了很多年,但这样的时刻之前从未发生过。但是我们的决定是绝对不可能被击败的,对吧?所以这有点不同,代理们在宗师级别玩,它们肯定足够理解游戏,可以玩得非常好,但它们是无敌的吗?它们玩得完美吗?不。事实上,在《星际争霸》中,由于这些鬼鬼祟祟的策略,你总是可能承担巨大的风险,但你可能会因此获胜,对吧?所以我想作为一个领域,它仍然有很多机会,不仅因为我们想用更少的经验来学习,我想,如果我学会玩星灵,我可以更快地学会玩人类,比 AlphaStar 快,对吧?所以有明显的有趣的研究挑战。但即使是原始的,就像原始表现一样,这里的说法是,我们可以达到职业水平或高宗师级别。但显然,玩家也不知道会发生什么,对吧?他们的先验分布有点不对,因为他们玩的是这种新的,就像他们喜欢说的,外星大脑驱动。而这让他们兴奋,但我也认为,如果你仔细看比赛,你会发现有些地方存在弱点,也许 AlphaStar 没有侦察,或者它有一些隐形单位,在某些时候,它不会知道,而且会很糟糕。所以还有很多工作要做,但这对我们来说是一个非常激动人心的时刻,看到哇,一个单一的神经网络在 GPU 上实际上正在与这些了不起的人比赛。我的意思是,你必须亲眼看看他们,他们是真正真正了不起的玩家。是的,我敢肯定,那里一定有一个人在波兰,现在正在拼命训练,以确保这种情况不会再次发生在 AlphaStar 身上。所以这在 AlphaStar 有一些可以利用的漏洞方面确实令人兴奋。这太棒了,然后你们互相建立,感觉就像《星际争霸》一样,即使你赢了,它仍然在那里,它仍然在那里,有很多不同的维度可以探索。所以这真的非常有趣。你认为 AlphaStar 有上限吗?你说它还没有达到,你知道,这是一个很大的等待,你知道,让我稍微停顿一下。来到这一点,击败像那样顶尖的职业玩家,感觉如何?我的意思是,你知道,奥运选手有他们的金牌,对吧?这是你的金牌。当然,你有很多兴奋,你发表了很多有声望的论文,但这是像一场胜利。感觉如何?对我来说,这是不可思议的,因为首先,胜利本身让我非常兴奋。我的意思是,回顾 2018 年底的最后几天,那是比赛进行的时候。我敢肯定,我回顾那一刻,我说,我的天,我想参与这样一个项目,就像我已经感受到了怀旧,是的,那是一个巨大的能量和团队努力。所以从这个意义上说,一旦发生,我就知道我有点失去它了,所以几乎有点悲伤,它发生了。但另一方面,它也验证了这种方法。但对我来说,也有很多挑战和有趣的智能方面,即使我们可以训练一个神经网络达到顶尖人类的水平,仍然有很多挑战。所以对我来说,这也是,好吧,这是一个了不起的成就,但我已经在考虑下一步了。我的意思是,正如我所说,这些代理玩星灵对星灵,但它们应该能够更快地玩不同的种族,对吧?那将是一个了不起的成就。有些人称之为元强化学习,元学习等等,对吧?所以有很多可能性。在那一刻之后,但那一刻本身,感觉真的很棒。我们打了个赌,我一般来说有点悲观,所以我给团队发了封邮件,说,好吧,让我们再次窃取机会,对吧?结果会是什么?我真的认为我们会输,五比零。我们做了一些校准,对抗一个 5000 MMR 的玩家,TLO 比那个玩家强得多,即使他玩的是星灵,这是他的非主族。但是,是的,我无法想象我们会赢。所以对我来说,这只是一个测试运行或什么东西。然后它真的,他真的很惊讶,难以置信的是,我们去了这家酒吧庆祝,Dave 对我说,为什么我们不邀请一个在星灵方面强一千 MMR 的人,比如一个真正的星灵玩家,比如,就像,结果是 Mana。你知道,我们喝了几杯,我说,当然,为什么不呢?但然后我想,好吧,这真的不可能被击败。我的意思是,即使因为它是如此多,我有 1000 MMR 真的就像 99% 的概率 Mana 会以星灵对星灵击败 TLO。所以我们做到了。对我来说,第二场比赛更重要,尽管很多不确定性在我们无法击败 TLO 之后就消失了。我的意思是,他是一名职业玩家,所以那已经结束了。这确实是一项非常了不起的成就,但 Mana 确实处于顶尖水平,你可以看到他打得更好,但我们的代理也变得更好。所以,是的,在第一场比赛之后,我说,如果我们能赢下一场比赛,至少我们可以说我们赢了一场比赛。我的意思是,即使我们没有赢得系列赛,对我来说,这也是一个巨大的解脱。我记得拥抱他们,我的意思是,这对我来说,作为一名研究人员,作为一个人,这确实是永恒的时刻,也是一项了不起的成就。很高兴能和团队一起在房间里。我不知道你是否看到了,所以这确实是,从我的角度来看,另一件有趣的事情是,就像看着 Kasparov,看着 Mana 也很有趣,因为他有点语无伦次。我的意思是,每当你输的时候,我做过很多运动,你有时会找借口,你寻找原因,而他真的找不到原因。是的,是的,我的意思是,对于非主族星灵,你可以说它感觉很尴尬,但事实并非如此,但在这里,是的,它就是被击败了,而且看起来很美,一个人类被人工智能系统超越。我的意思是,这是一个研究人员的美好时刻。所以,是的,当然,这可能是我职业生涯的亮点,因为它独一无二,很酷,我不知道,我的意思是,显然,正如你所说,你可以看论文引用等等,但这些确实是整个机器学习方法的证明,以及利用游戏来推进技术。我的意思是,它真的,一切都在那个时刻汇聚在一起,这确实是总结。
另一方面,它也是人工智能的普及,就像去月球一样,等等。我的意思是,这里有一个非常大的社区,人们实际上并不了解它,但他们能够真正与之互动,这非常重要。我的意思是,我们必须,你知道,写论文可以帮助我们的同行研究人员了解我们在做什么,但我认为人工智能已经足够成熟,我们必须尝试解释它是什么,也许通过游戏是一个明显的方式,因为这些游戏一直内置了,所以也许每个人都经历过人工智能玩电子游戏,即使他们不知道,因为总有一些脚本元素,有些人甚至可能称之为人工智能。那么,AlphaStar 底层方法的其他应用是什么?你看到了什么?有很多回声,他说,变压器,语言建模等等。你是否已经开始思考 AlphaStar 的突破会扩展到其他应用?是的,我考虑了一些事情,比如接下来的几个月,明年的主要事情,我实际上在思考的是,作为一种宏大的挑战,因为对我来说,我们已经看到了 Atari,然后是那种三维世界,我们也看到了像夺旗代理那样相当不错的表现,这些也是 DeepMind 和其他地方的人在努力的。我们也看到了一些惊人的结果,比如 Dota 2,这也是一个非常复杂的游戏。所以对我来说,主要的事情是,在挑战方面,下一步是什么?所以作为一个研究人员,我看到研究和应用或应用领域或领域之间存在两种张力。一方面,由于 StarCraft 的应用非常困难,我们开发了一些技术,一些新的研究,现在我们可以看看其他地方,比如是否有其他应用我们可以应用它?显而易见的,绝对可以想到反馈给社区,我们从中汲取了大部分是序列建模或自然语言处理。所以我们开发了从 Transformer 扩展的东西,我们使用了指针网络,我们将 LSTM 和 Transformer 以有趣的方式结合起来,所以也许现在反馈给不同机器学习领域的最低的收获就是玩电子游戏。
让我回到老派,跳到图灵先生。是的,图灵测试,你知道,有一个自然语言测试,对话测试。你认为它是一个值得承担的智能测试吗?也许如果是,你会重新制定它或以不同的方式表述它吗?是的,我真的很喜欢图灵测试,因为我也喜欢序列和语言理解。事实上,我们早期的一些机器翻译工作,我们试图将其应用于一种神经聊天机器人,它显然永远无法通过图灵测试,因为它非常有限。但这是一个非常迷人的想法,你真的可以拥有一个人工智能,在提问或与它交谈方面与人类无法区分。所以,我认为测试本身看起来非常不错,而且它相当明确,就像通过它或不通过它一样。我认为有很多规则感觉相当简单,而且,你知道,你真的可以,我认为他们每年都有这些比赛,是的,劳德纳奖。但我不知道你是否看到,我不知道你是否看到从那个比赛中出现的机器人。它们并不完全是你所期望的。所以感觉图灵的表述方式存在弱点。它需要是真正的、丰富、令人满意的、人类的对话。它需要是其他东西,比如 Alexa 奖,我不太熟悉,它试图通过说你必须继续进行 30 分钟的对话来定义它,之类的。所以基本上迫使代理不仅仅是欺骗,而是进行一场引人入胜的对话。这是,我的意思是,你有没有深入思考过这个问题?就像,如果你有,总的来说,我们离你做了很多关于语言理解、语言生成的工作,但完整的对话,你知道,坐在酒吧里喝几个小时的啤酒,那种对话,你有没有想过?是的,所以我想你在这里触及了关键点,那就是可行性。所以,有一个伟大的哈明论文,描述了物理学的宏大挑战,他认为,好吧,例如,传送或时间旅行是物理学的宏大挑战,但没有攻击,我们真的不知道或无法取得任何进展。所以这就是为什么大多数物理学家等等,他们不在博士期间或职业生涯中从事这些工作。所以我认为图灵测试,在完整的图灵测试中,还为时过早。我认为我们,尤其是在当前的深度学习语言模型趋势下,我们已经看到了一些令人惊叹的例子,我认为 GPT-2 是最近的一个,它非常令人印象深刻。但要理解,要完全通过或愚弄人类,让他们认为你是一个人类,我认为我们还很远。因此,我不会看到自己,我可能也不会建议人们攻读博士学位来解决图灵测试,因为它感觉还为时过早或太难了。是的,但话虽如此,你对《星际争霸》也说了同样的话,几年前。所以,我更喜欢,是的,你可能也会是三年内通过图灵测试的人。我的意思是,我认为,我认为,是的,所以,所以我们有太阳记录,这很好,真的,我的意思是,这是真的,进步有时有点不可预测。半年前我甚至不会预测这些代理能够达到的宗师级别。但我对语言工作足够多,基本上我的担忧不是会发生什么突破,能够让我们解决或通过图灵测试,而是我认为统计方法不行。我们需要突破。这对社区来说很好,但考虑到我认为有相当多的不确定性,而对于《星际争霸》,我知道会有哪些步骤来让我们到达那里。我认为很清楚,使用模仿学习部分,然后使用这个代理的 Battle.net 将是关键,而且事实证明确实如此,还需要一点点,但不多。对于图灵测试,我只是不知道计划或执行计划会是什么样子。所以这就是为什么我自己不把它作为一个宏大的挑战来做,这很难,但有很多相关的子挑战,你可以说,好吧,我的意思是,如果你创造一个像谷歌助手那样的伟大助手呢?我们可以让它变得更好吗?我们可以让它完全是新的吗?等等,我开始相信也许我们正在达到一个点,我们应该尝试这些挑战,比如这次对话,因为回声非常像开始对话,这正是你处理《星际争霸》的方式。让我们把它分解成小块,解决它们,然后你就解决了整个游戏。很好。
但话虽如此,你也是近年来深度学习一些最重要工作的背后推手。你提到了某些限制,你如何看待深度学习的当前限制以及我们如何克服这些限制?所以,如果我必须用一个词来定义深度学习中的主要挑战,那就是一个可能多年来一直存在的挑战,那就是泛化。这意味着我们所做的一切都是将函数拟合到数据上,而当我们看到的数据不是来自同一分布,或者即使有时它非常接近分布,但由于我们用有限的样本进行训练的方式,我们就会达到这样一个阶段,即我们看到的泛化不如我们能够泛化的。我认为对抗性样本就是一个清晰的例子。但是,如果你研究机器学习文献,并且你知道支持向量机之所以如此受欢迎的原因是因为它们处理并对泛化有某些保证,即未见过的数据或分布外的数据,甚至在分布内的数据,你对图像添加一点噪声,这些模型就会失败。所以我认为,我真的没有看到在强泛化意义上的泛化方面取得多少进展。我认为我们的神经网络总能找到设计示例,使它们的输出任意,这不好,因为我们人类永远不会被这些图像或图像操纵所愚弄。如果你看看数学,你就会明白,这是一堆矩阵相乘,很可能存在数值和不稳定性,你可以找到角落案例。所以我认为这确实是许多时候的根本主题,即使是在进行测试泛化等宏大舞台上。我的意思是,如果你开始,我的意思是,通过图灵测试,它应该是用英语还是用任何语言?我的意思是,作为一个人类,如果你能,如果你用不同的语言问一些东西,你实际上会去研究并尝试翻译它等等。图灵测试是否应该包含这一点?这确实是一个困难且非常迷人的问题,而且实际上非常神秘。是的,绝对。但你认为,如果你试图解决它,你不能通过智能地增加数据量,以至于你的训练集的分布包含了整个测试集吗?我认为这是一条路。另一条路是全新的方法论,不是统计的。一条有效的方法,并且在《星际争霸》和机器翻译中都有效,那就是扩大数据和模型的规模。这可以说是深度学习今天仍然提供的唯一公式,对吧?那就是规模化数据,规模化模型,越来越多地做那些我们认为“哦,不可能泛化到这些”或“不可能泛化到那里”的事情。但我认为这从根本上并没有解决这些问题。例如,我真的很喜欢某种风格或方法,它不仅有神经网络,还有程序或某种离散的决策制定。因为我觉得这有点像,我的意思是,最好的例子我认为是理解疾病,我也做过一些研究,或者,我们可以用神经网络学习一个算法,对吧?你给它很多例子,它会为你排序,对吧?对输入数字进行排序,或者其他什么。但真正的强泛化是,你给我一些数字,或者你要求我创建一个排序数字的算法。而不是创建一个神经网络,它会很脆弱,因为它会在某个时候超出范围,你会给我太大或太小的数字等等。你只是,如果你创建一个排序数字的代码片段,那么你就可以证明它将泛化到你可能给出的所有可能的输入。所以我认为问题在于一些令人兴奋的前景。我的意思是,规模有点无聊,但它确实有效。然后也许程序和这些离散的交互有点不那么发达,但显然我认为它们在该领域的未来非常令人兴奋。
你从 80 年代的专家系统和符号系统那里汲取了关于计算的见解、智慧吗?你有没有回顾过那些推理的那种逻辑?你认为它们可能会卷土重来吗?你必须掸掉那些书上的灰尘。是的,我实际上喜欢,实际上我喜欢增加更多的归纳偏见。对我来说,问题确实是你试图解决什么。如果你的目标是如此重要,以至于你想不惜一切代价去解决它,那么绝对使用规则,使用领域知识,然后使用机器学习的魔力来赋能,使系统成为检测癌症或检测天气模式的最佳系统。或者在《星际争霸》方面,这也是一个巨大的挑战。所以,我绝对很高兴,如果我们不得不在这里走捷径,那会很有趣。事实上,在《星际争霸》中,我们开始考虑专家系统,因为它非常,你知道,你可以定义,我的意思是,人们实际上是通过思考那些原则来构建《星际争霸》报告的,我猜,你知道,状态机和基于规则的系统,然后你可以考虑结合一点基于规则的系统,但它也包含了神经网络,使其泛化得更好。所以,绝对,我的意思是,我们应该,我们绝对应该回到那些想法,任何能让问题变得更简单的事情,只要你的问题很重要,那就可以了。那是研究驱动的一个非常重要的问题。另一方面,如果你想真正专注于强化学习的限制,那么当然你必须尽量不要看模仿数据,或者看一些领域规则,这会有很大帮助,甚至特征工程,对吧?这些注意力,取决于你做什么。我认为这两种方式都绝对没问题,我永远不会不做其中一种或另一种,只要你所做的事情很重要并且需要解决。对,对,你开发了很多不同的想法,我真的很喜欢。但其中一个是将图像字幕翻译成文本,只是另一个美丽的,是的,美丽的想法。我认为这贯穿了你的工作。现实的潜在本质是语言,总是,是的,某种程度上。那么在你看来,图像和文本之间的联系,或者说视觉世界和语言世界之间的联系是什么?是的,我认为一项研究,我认为它甚至扩展到《星际争霸》的研究,是这个序列到序列学习的想法。我们真正指的是,你现在可以真正输入任何东西到神经网络作为输入 X,然后神经网络将学习一个函数 f,它将 X 作为输入并产生任何输出 Y。而这些 X 和 Y 不需要是静态的,或者像特征一样,像固定的向量或任何东西。它可以是,它真的是序列,现在是数据结构之外的东西。所以当我们从法语翻译到英语,再到将图像翻译成其字幕时,这个范式得到了非常有趣的测试。但它的美妙之处在于,真的,而且这确实是发生的,我改变了一行代码,这个东西正在做机器翻译,我第二天来了,我看到它是如何产生字幕的,感觉就像,我的天,这真的,真的有效。而且原则是相同的,对吧?所以我认为,我看不出文本、视觉、语音波形有什么不同。只要你基本上学习一个函数,将它们矢量化,然后一旦我们对其进行矢量化,我们就可以使用,你知道,Transformer,LSTM,无论模型是什么时髦的。然后只要我们有足够的监督数据,这个公式就会奏效,并且会继续奏效,我相信在某种程度上,我之前提到的模型泛化问题。但是测试是矢量化,一种有意义的先前表示。你的直觉现在,在处理了所有这些媒体之后,一旦你能够形成那种表示,你基本上就可以采取任何东西,任何序列。回到《星际争霸》,长度有限制吗?我们没有真正触及长期影响,你是如何克服整个长期方面的?有没有什么技巧?所以主要的技巧是,如果你看《星际争霸》的每一帧,你可能会认为它是一个相当长的游戏。所以我们需要乘以 22 次 60 秒每分钟,乘以平均每场比赛至少 10 分钟,所以有很多帧。但技巧确实是只观察,事实上,这可能被视为一种限制,但它也是计算优势,只在你行动时观察。然后神经网络决定的是,下一次行动之间的间隔是什么。如果你看我们数据集中的大多数《星际争霸》比赛,由暴雪提供,你会发现大多数比赛实际上只有,我的意思是,它仍然是一个长序列,但可能是大约一千到一千五百个动作。如果你开始看 LSTM,大型 LSTM,Transformer,这并不像,这并不那么困难,特别是如果你有监督学习。如果你不得不通过强化学习来做,信用分配问题,是什么让这场比赛让你获胜,那将非常困难。但幸运的是,由于模仿学习,我们不必直接处理这些,尽管如果我们不得不这样做,我们尝试过,结果是,你带上你所有的工人,用他们攻击。这在事后看来是显而易见的,因为你开始尝试随机动作,其中一个动作将是工人去敌人基地。而且因为它是自我对弈,它不会知道如何防御,因为它几乎什么都不知道。最终你发展出的是,带上你的工人去攻击,因为信用分配问题真的,真的很难。我相信我们可以做得更好,这也许是未来的研究挑战。但是的,即使在《星际争霸》中,序列也可能是一千个,我相信这在 Transformer 的能力范围内。
是的,我认为《星际争霸》和围棋的区别在于,在围棋和国际象棋中,事情立即发生,对吧?所以没有,是的,自我对弈相对容易,不是容易,但自我对弈是可能的,可以很快发展出合理的策略,与《星际争霸》不同。我的意思是,围棋只有 400 个动作,但一个动作是人们会称之为“神之手”的动作,如果你扩展了整个搜索树,那就是最佳动作。如果你做了 minimax 或任何算法,如果你有计算能力。但在《星际争霸》中,400 个动作微不足道,就像在 400 个动作中,你甚至不能点击一个单位周围的像素。所以我想问题在于,在动作空间大小方面,它要难得多。而且搜索是不可能的。所以确实有很多挑战,让这种类型的机器学习比人类更进一步。也许玩《星际争霸》看起来更直观,因为它看起来真实,我的意思是,你知道,像图形和一切都流畅地移动。而我不知道围棋是什么游戏,我真的不想学习它,感觉很复杂。但对机器来说,也许更容易,反之亦然。是的,这确实显示了深度学习和我们大脑工作方式之间的差距。
你开发了很多非常有趣的想法。问问你的新想法的开发过程很有趣。你喜欢和别人头脑风暴吗?你喜欢独自思考吗?你喜欢,就像,Goodfellow 说他是在喝了几杯啤酒后想出 GAN 的吗?他认为啤酒是必不可少的。想出新想法,我们喝了几杯啤酒来决定下周再玩一局《星际争霸》。这真的和那个故事很相似。我在一次 DeepMind 的静修中解释了这一点,我说,这和 GAN 的故事一样。我的意思是,我们在一家酒吧,我们决定下周再玩一次,就这样发生了。我觉得我们给年轻本科生传达了错误的信息。但总的来说,是的,你喜欢头脑风暴吗?你喜欢独自思考,解决问题吗?所以,我认为随着时间的推移,事情也在变化,对吧?起初,我很幸运能和像 Geoff Hinton、Jeff Dean、Ilya Sutskever 这样的大人物在一起。我真的很幸运能在正确的时间加入 Brain。在那时,想法,我只是和我的同事们头脑风暴,学到了很多,并且一直在学习,这实际上是你永远不应该停止做的事情。所以学习意味着阅读论文,也意味着与他人交流想法。在某个时候,不交流想法是很难的,无论是阅读别人的论文还是实际讨论。所以,当然,沟通方面是必须的,无论是书面的还是口头的。如今,我也试图更有策略地决定做什么研究。我稍微描述了一下研究本身和应用之间的张力,应用可以驱动研究。老实说,对我来说最有效的方法就是找到一个难题,然后看看研究如何融入其中,如何不融入其中,然后你必须创新。所以我认为机器翻译驱动了序列到序列,然后也许像学习算法,它们必须像组合算法一样,导致了指针网络。《星际争霸》导致了真正规模化的排列学习和 AlphaStar 联赛。所以这是一种我个人喜欢的方法。但另一种方法也看到了很多成功,那就是你只想研究基于模型的 RL 作为一种研究课题,然后你必须开始思考,好吧,你将如何测试这些想法?你需要一个最小的环境来尝试事物,你需要阅读很多论文等等。而且这也很有趣,而且我以前也做过很多次,无论是在 Brain,在 DeepMind,还是显然作为博士生。所以,除了想法和讨论之外,我认为它也很重要,因为你开始指导的不仅是你自己的目标,还有别人的目标,以实现下一个突破。所以你必须真正理解这些,你知道,可行性,就像我们之前讨论的,对吧?这个领域是否已准备好被攻克?你不想太早,你显然也不想太晚。所以这真的很有趣,这是研究的一个战略组成部分,我认为作为一名研究生,我对此一无所知。我只是阅读论文并讨论想法。我认为这可能是我最大的变化,我建议人们向前看成功是什么样的,然后尝试追溯,而不是仅仅看着“这个看起来很酷,那个看起来很酷”,然后你做一些随机的工作,有时你会偶然发现一些有趣的事情。但总的来说,计划一下也很好。我喜欢它,尤其是你的方法。你遇到了一个非常困难的问题,直接介入,然后对被抢劫持怀疑态度。我的意思是,两者之间有平衡,对吧?有一种愚蠢的乐观主义和一种批判性的怀疑主义,两者平衡得很好,这就是为什么拥有一个平衡的团队很重要。你不是一个人做的,你有导师,他们见过,你显然想聊天和讨论是否是时候了。我的意思是,Demis 在 2014 年来了,他说也许我们会做《星际争霸》,也许他知道,而我只是跟着他的领导,这很棒,因为他很聪明。所以,这些事情显然很重要,你想被周围的人所包围,你知道他们是多样化的,他们有他们的知识。这也很重要,我的意思是,我从那些有我可能认为不好的想法的人那里学到了很多,但如果我给他们空间去尝试,我已经被证明是错误的很多次了。所以这很棒。我认为你的同事比你自己更重要。所以,当然,现在让我们快速谈谈另一个不可能的问题,AGI,对吧?你认为需要什么才能构建一个具有人类水平智能的系统?我们谈论了一些关于图灵测试和《星际争霸》的说法,所有这些都有通用智能的呼应,但如果你想到一个你会坐下来说,“哇,这确实是人类水平智能的体现”,你认为需要什么才能构建它?
我发现 AGI 常常可能定义不明确。所以,我为自己想的是,一个结果看起来会是怎样的,你会开始相信你会拥有代理或神经网络。
网络不再是那种仅仅针对单一任务的,而是真正地学会了“学习的能力”,可以这么说。这正是我所着迷的领域,即“学会学习”或“元学习”,它不再是学习关于单一领域的内容。你可以认为学习算法本身是通用的,对吧?我们应用于 AlphaStar 或 Starcraft 的相同公式,现在几乎可以应用于任何视频游戏,或者应用于许多其他问题和领域。但算法是正在泛化的东西,而神经网络,那些权重,即使是玩另一个种族也毫无用处,对吧?我训练了一个网络在 Protoss 对 Protoss 中表现得非常好,如果我想玩 Terran 对 Terran,我就必须丢弃那些权重,需要用相同的算法从头开始重新训练一个网络。这很棒,但网络本身将没有用处。所以,我认为如果我看到一种方法,它可以在不需要重新启动过程的情况下观察或开始解决新问题,我认为对我来说,这将是定义某种形式的 AGI 的一种好方法。再说一遍,我不知道宏大的观点,比如 AGI 的意思,所以它应该是图灵测试,或者 AGI 之前,我不知道。我认为,具体来说,我希望清楚地看到元学习的发生,这意味着存在一个架构或网络,当它看到新的问题或新的数据时,它会解决它。为了使其成为一个基准,它应该以我们解决新问题的相同速度来解决它。当我定义一个新对象,你必须识别它时;当你开始玩一个新游戏时,你玩了很长时间,但现在你玩一个新的 Atari 游戏,嗯,你很快就会在游戏中变得相当不错。所以,也许这才是领域和确切基准有点困难。我认为作为一个社区,我们可能需要做一些工作来定义它,但我认为第一步,我可以看到它相对较快地发生。但然后,AGI 的全部含义等等,我有点困惑,我认为人们的意思不同。有一个情感心理层面,就像即使通过图灵测试也是我们刚刚对人类做出判断的事情。你知道,作为一只狗在一个 AGI 系统中意味着什么,是的,就像什么水平,它意味着什么,对吧?是的,它意味着什么。但我喜欢泛化,也许作为一个社区,我们会收敛到一组足够远的领域,如果我们能够泛化一些,那将是令人印象深刻的,也许不像 Protoss 和 Zerg 那么接近,而是像维基百科那样,那将是很好的东西,然后是一个非常好的步骤,但然后就像 Wickham Starcraft 2 维基百科,是的,我回来了,是的,那种事情。而且那也感觉相当困难和遥远,但我认为只要你设定了基准,就像我们发现 ImageNet 那样,就可以取得巨大的进步。所以我认为也许缺乏基准,但我相信我们会找到一个,是的,社区将朝着那个方向努力。然后超越 AGI 可能意味着什么或暗示什么,我真的希望看到机器学习或人工智能只是在扩展并帮助那些可能没有资源聘请助手的人,或者他们甚至不知道天气如何的人。所以,我认为在人工智能的积极影响方面,我认为也许我们也不应该失去焦点,对吧?研究界构建 AGI,我的意思是,这是一个非常好的目标,但男人,我认为 DeepMind 的说法是,然后用它来解决其他一切,对吧?所以,我认为我们应该瘫痪,是的,我们不应该忘记所有已经出现并且将要出现的积极事物。但我知道,让我问一下,相对于大众的看法,你是否担心人工智能在近期或远期可能带来的生存威胁,有些人有?我认为在近期,我持怀疑态度,所以我希望我没有错,但我并不担心,但我确实赞赏正在进行的努力,甚至像人工智能安全这样的整个研究领域正在出现,并在会议等地方。我认为这很棒。从长远来看,我真的希望我们能够简单地让好处抵消潜在的危险。我对这一点充满希望,但我们也必须保持警惕,以便能够监控和评估权衡是否在那里,并且我们有足够的时间来预防或重定向我们的努力,如果需要的话,对吧?但我对这项技术非常乐观,而且在这个时候,我绝对更害怕其他威胁,比如行星级别的威胁。但显然,这是我更倾向于思考的问题,它确实让我开始更多地阅读人工智能安全,这是一个我迄今为止还没有真正做出贡献的领域,但也许那里也有一些事情可以做。我认为这非常重要,你知道,我会和大家谈论这个问题,但问你并把它塞进你的脑子里很重要,因为你正处于人们兴奋的尖端。是的,我的意思是,与 AlphaStar 的工作,它可以说是人们害怕的那种事物的最前沿,所以你谈论这一点,而我们实际上离人们可能害怕的那种事物还很远,但它仍然是值得思考的事情,而且你也不那么担心,而且你也对我们开放,这很好。是的,我,嗯,有两个方面,我的意思是,我不担心,但显然我们应该为它做好准备,对吧?为可能出错的事情,技术的滥用,就像任何技术一样,对吧?所以,我认为总是有权衡的,而且我,作为一个社会,我们已经在某种程度上解决了这些问题。所以我希望通过让研究人员和整个社区集思广益,并为未来将发生的新事物提出有趣的解决方案,我们仍然可以推动研究到我认为是最大的途径,那就是理解智能,对吧?我们是如何做我们正在做的事情的,你知道,显然从科学的角度来看,这就是我花在我所做的事情上的所有时间的个人驱动力。你认为深度学习作为一个领域将走向何方?你认为下一个重大突破可能是什么?所以,我认为深度学习,我之前已经讨论过一些。深度学习必须与某种形式的离散化程序合成相结合。我认为这本身就是一个有趣的研究课题,可以扩展并进行更多研究。然后,关于深度学习将来能够做什么,我不认为这会是今年发生的事情。但也有这个想法,开始不丢弃所有权重,这个学会学习的想法,并且真正让这些代理不需要重新启动它们的权重。你可以有一个代理,它正在对 ImageNet 进行图像分类或生成,也可以生成语音,如果你让它生成一些语音,它应该几乎是同一个网络,但可能不是一个神经网络,可能是一个带有优化算法的神经网络。但我认为这种泛化到新任务的想法是我们首先必须定义好的基准,然后我认为这将是令人兴奋的。我不确定我们有多接近,但我认为,如果你有一个非常有限的领域,我认为我们可以开始取得一些进展。就像我们在计算机视觉领域做了很多程序一样,我们应该开始思考,我真的喜欢 Leon Blue 几年前在 ICML 上发表的一个演讲,那就是训练测试范式应该被打破。我们应该停止思考训练集和测试集,以及这些是封闭的,你知道,不可触及的东西。我认为我们应该超越这些,在元学习中,我们称之为元训练集和元测试集,这实际上是在思考,如果我知道 ImageNet,为什么那个网络不能在 MNIST 上工作,这是一个简单得多的问题,但现在它真的不行,你知道,是的,但这感觉不对,对吧?所以我认为在应用或基准方面,我们可能会看到更多兴趣和进展,并希望人们定义新的和令人兴奋的挑战。你对知识图谱在这个背景下有什么希望或兴趣吗?所以,只是完全地,是的,构建图,回到图,是的,好吧,神经网络和图,但我的意思是,一种不同的知识图,比如语义图,或者有概念,是的。所以,我认为图的想法是,我一直对序列非常感兴趣,然后是对图等更不同寻常的数据结构。我在过去三年左右研究了图神经网络。我发现这些模型从深度学习的角度来看非常有趣。但然后,我们想要什么?为什么我们要使用这些模型?有什么应用?图的杀手级应用是什么?也许如果我们能从维基百科自动提取知识图谱,那将很有趣,因为这些图谱具有非常有趣的结构,也更符合程序和深度学习协同工作的想法,跳跃邻域等等。你可以想象定义一些原语来遍历图,对吧?所以我真的很喜欢知识图的想法,事实上,当我们开始,你知道,作为我们为 Starcraft 所做的研究的一部分,我想,如果能给出一个图,你知道,所有这些相互依赖的建筑,以及那些需要由它们建造的单位,那不是很酷吗?这是网络可以学习和提取的信息,但看到,或者想到将 Starcraft 作为一个巨大的图,即使游戏也在发展,也像星际迷航一样分叉等等,那将是很好的。我们读了一些关于这些的研究,但没有太多相关的。但我真的很喜欢这个想法,它包含了一些你也在研究的元素,比如可视化你的网络,作为人类可解释的元素,能够生成人类可解释的知识表示,也许人类专家可以调整或至少理解。所以,那里有很多有趣方面,对我个人来说,我只是维基百科的忠实粉丝,而且很遗憾我们的神经网络没有利用网络上所有结构化的知识。对你来说下一步是什么?对 DeepMind 来说下一步是什么?你对什么感到兴奋?对 AlphaStar 呢?所以,我认为显而易见的下一步是将 AlphaStar 应用于其他种族。我的意思是,这表明算法是有效的,因为我们不希望意外地在架构中创建了对 Protoss 有效但对其他种族无效的东西,对吧?所以,作为验证,我认为这是我们正在努力的一个明显下一步。然后,我想看到代理和玩家可以专注于不同的技能集,使他们非常出色。我认为我们已经看到 AlphaStar 非常好地理解何时进行战斗,何时不进行战斗。也非常好地进行微管理和移动单位等等,并且也非常擅长持续生产和用建造单位来交易经济。但我可能没有看到我想要的那么多,你提到的扑克牌的想法,对吧?我不确定 Starcraft,或者说 AlphaStar,是否已经发展出对对手正在做什么的深刻理解并做出反应,并试图欺骗玩家做其他事情,或者你知道,所以这种推理我想看到更多。所以,我认为纯粹从研究的角度来看,在 Starcraft 领域可能还有很多新的东西要做。在游戏领域,我看到了一些有趣的工作,比如在拍卖中操纵其他玩家,形成信念状态,然后只是惹恼人们。关于心智理论,是的,是的,这是心智理论,在 Starcraft 中,它们简直是天造地设的。所以,看到这些技术应用于 Starcraft,或者也许 Starcraft 驱动新技术,那将是非常令人兴奋的。正如我所说,这总是两者之间的张力。好吧,Oriol,非常感谢你今天的谈话。太棒了,很高兴来到这里,谢谢。