📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

AI & Multiagent Systems Research for Social Good - Prof. Milind Tambe

The Artificial Intelligence Channel47:33

Transcription

好的,这是您提供的英文文本的中文翻译:

嗯,非常感谢您颁发这个奖项,这对我来说是一项巨大的荣誉,特别是考虑到在座的许多好朋友,这让我感到格外高兴。

鉴于目前人工智能和多智能体系统的研究现状,将这些研究导向解决社会问题变得至关重要。我将重点关注三个领域:公共安全与安保、自然保护与野生动物保护,以及公共卫生。

在将这些社会问题视为多智能体系统时,存在一个关键的研究挑战,这个挑战贯穿于这些问题领域:如何在与这些领域中的其他智能体互动时,优化我们有限的干预资源?我将重点关注计算博弈论作为一种解决方案方法,这种方法可以贯穿于这些领域。

在公共安全与安保方面,我们有大量的目标需要保护,但安保资源有限。如何制定计划、安排或分配这些资源,同时考虑到一个警惕的对手?我们贡献了一个名为“Stackelberg安全博弈”的新模型,并基于该模型开发了新的算法,这些算法已被美国及国际上的安全机构使用。

关于自然保护与野生动物保护,我们有广阔的保护区,但巡护员数量有限。我们贡献了一个名为“绿色安全博弈”的新模型,用于优化这些有限的资源。一个具体的例子是我们一直在乌干达进行的工作,利用过去的盗猎数据,我们可以预测盗猎者将在何处设置陷阱。在过去的几年里,我们已经成功地移除了大量的陷阱,甚至逮捕了盗猎者。该模型已被扩展到打击非法捕鱼和非法伐木。

第三个领域是公共卫生。我们希望向大量人群传播信息,但信使数量有限。一个具体的例子是我们与洛杉矶的无家可归者收容所合作进行的工作。在这里,我们需要向无家可归的青少年告知艾滋病的危险。我们利用这些青年的社交网络,并表明我们基于“与自然博弈”思想的影响力最大化算法,在选择关键的意见领袖来传播信息方面,比传统方法更有效。这项工作已被扩展到应对其他健康挑战。

在所有这些工作中,与政府和非政府组织的合作至关重要。为此,我们真的与美国海岸警卫队一起在纽约的船上进行了巡逻,我们的学生花时间在无家可归者收容所与收容所官员交谈。这种沉浸式体验对于建立我们能够开发新的多智能体干预算法的正确模型至关重要。

但除此之外,在实地部署和测试这些算法也同样重要。这不仅是因为我们希望测试我们想要实现的社会影响,更是因为这种实地测试和部署常常能给我们带来新的见解,让我们了解模型可能存在的问题,并为我们提供新的研究方向。

因此,在接下来的演讲中,我将讨论这三个领域。我将讨论的所有工作都已发表在 AAAI、IJCAI 和 AAAI 上,您可以在我提供的年份找到相关的论文。这些论文还提供了大量的模拟结果。我今天将要讨论的是真实世界的部署结果。

当然,所有这些工作都归功于所有优秀的博士生和博士后研究员。为了感谢他们,我将在展示他们工作的幻灯片右上角展示他们的照片。

那么,让我们从公共安全与安保开始。这显然是一个全球性的挑战。9/11 事件对我们所有人来说都是毁灭性的。2006 年 7 月 11 日在孟买的事件对我来说尤其具有挑战性。孟买的火车上发生了炸弹爆炸,几个小时里,我的母亲都无法联系上。幸运的是,她在炸弹爆炸前下了火车。但这在我心中提升了公共安全与安保的重要性。

因此,当洛杉矶国际机场的机场警察局长 Al Southeres 来找我们,试图改善机场安全时,我们洗耳恭听。他的担忧是,有人会像后来格拉斯哥发生的那样,驾驶一辆自杀式卡车冲进其中一个航站楼。他的问题是,机场有八条进港道路通往航站楼,但没有足够的资源,没有足够的警官或警犬来同时驻守所有航站楼和所有道路。

我们的问题是:我们能否利用博弈论来优化有限的安全资源?我们能否说服现场的警官?我们能否说服国土安全科学咨询委员会?我们能否说服人工智能审稿人,尽管关键的思想领袖们当时还在质疑博弈论是否真的有实际用途?但这就是我们决定的。

我们提出了将博弈论应用于安全资源优化。我们提出了一个名为“Stackelberg 安全博弈”的新模型,该模型具有两个关键的可处理性方面。首先,这是一个安全博弈,基于一组目标,这些目标被覆盖或未被覆盖。其次,它是一个 Stackelberg 领导者-追随者模型。

让我们举一个简单的例子,这是一个 2x2 的博弈。我们有一个防御者资源来保护两个航站楼。如果防御者总是试图保护航站楼一,那么进行侦察的对手就会攻击航站楼二。对手会得到正奖励一,防御者会得到负奖励 minus one。事实上,对手可以通过任何确定性策略来获胜。

如果警察使用混合策略,一种随机策略,60% 的时间在航站楼一,40% 的时间在航站楼二,那么进行侦察的对手只会知道警察在那里 60% 的时间,40% 的时间。他们明天会做什么仍然是不可预测的。

这些类型的博弈被称为 Stackelberg 博弈,因为防御者首先承诺一种随机策略,然后对手做出回应。我们正在优化有限资源的使用,我们并不保证 100% 的安全,因为在现实世界中不存在这样的东西。我们正在增加对手在制定攻击计划时的成本和不确定性。

当然,挑战是如何解决大规模博弈。这就是我们在洛杉矶国际机场构建 Armour 系统的过程。我们从一个游戏矩阵开始,该矩阵被输入到一个混合整数程序中,该程序产生防御者的混合策略。例如,在早上 8 点,在航站楼 2、5 和 6 有警犬巡逻的概率是 0.17;在早上 8 点,在航站楼 3、5 和 7 有警犬巡逻的概率是 0.33,依此类推。然后我们从这个分布中抽样生成实际的计划。例如,早上 8 点,派遣 T1 到航站楼 2,T3 到航站楼 5,T5 到航站楼 6;早上 9 点,做不同的事情,依此类推。

现在,让我们看看我们如何生成混合整数程序。我们正在最大化防御者的预期效用。这里的 R_ij 指的是如果防御者采取策略 i 而对手采取策略 j,防御者获得的奖励。X_i 是防御者采取策略 i 的概率。例如,X1 是在航站楼 1 有一只狗和在航站楼 2 有一只狗的概率;X2 是在航站楼 2 有一只狗和在航站楼 3 有一只狗的概率。事实上,我们生成了防御者资源分配给目标的每一种可能情况,并为其分配了一个概率变量。这对于这个应用来说是足够的,但正如我稍后将提到的,它无法扩展。

A 指的是对手的回应,我们确保这是对手的最佳回应,最大化对手的预期效用。

让我们看看收益是如何产生的。洛杉矶国际机场的威胁是有人驾驶自杀式卡车冲进其中一个航站楼。如果这种事件成功,防御者将遭受生命损失。我们从机场获得了详细数据,了解一天中不同时间不同航站楼有多少人。这就是我们如何生成收益矩阵。

稍后,我将向您介绍我们与美国海岸警卫队合作的工作。那里的风险分析师团队已经走遍了美国的所有港口,针对每一个目标,针对每一种攻击方式,他们都有关于有多少人会死亡以及经济后果的数据。正是在此基础上,我们可以生成收益。

事实上,这些估计并不完美,我们明白这一点。因此,我们需要能够处理不确定性。我稍后会讲到这一点。但所有这些工作都使得 Armour 在洛杉矶国际机场投入运行。事实证明,这是计算博弈论在日常安全运营中的首次应用。很快,当地媒体就有了报道,您可以看到人们谈论在机场缴获的武器和大量的枪支。洛杉矶警察局显然对这一切非常满意,非常高兴。事实上,市政厅的某个人显然非常高兴,因为我们收到了洛杉矶市的表彰。

在此之前,我们有幸获得了我们会议的最佳论文奖,我们对此非常激动。但这是一个真正的巨大荣誉。Erol 甚至去了国会谈论我们的工作:“今天的洛杉矶比 18 个月前更安全。由 Mullen 博士领导的一个研究团队与我们的部门合作开发了 Armour。该软件随机化了我们机场进港道路上的车辆检查点,以及机场内爆炸物探测犬队的部署。”

鉴于国会听证会等事件,有媒体《新闻周刊》报道称,“Armour 投下了一层数字隐形斗篷”,这在下次 IJCAI 会议上让我的朋友们问我是否在研究隐形装置。但这引起了联邦航空安全局的注意。这是我们第一次访问联邦航空安全局的自由中心,就在入口处是 9/11 受害者纪念碑,五角大楼的瓦砾,世贸中心的瓦砾,撞击世贸中心的飞机残骸。因此,我们真的很有动力,无论发生什么,我们都要尽力而为,看看我们能为航空安全局做些什么。

他们的挑战是如何为每天数千个航班分配航空安全员。这个问题的大小很容易达到 10 的 40 次方个防御者策略。如果您将此输入 Armour,它会因内存不足而悄无声息地崩溃。因此,我们需要一种不同的方法来扩展。

让我们看看为什么这个问题难以扩展。如果您查看正常形式的博弈,行代表所有可能的防御者策略。我们可以将航空安全员分配给航班 1、2、3,1、3、5 等等。对手可以攻击航班 1、航班 2、航班 1000。有 10 的 40 次方行,因为有 10 的 40 次方种不同的组合,这意味着我们的混合整数程序中有 10 的 40 次方个 X_i 变量,这意味着该程序无法运行。它无法运行。

但如果我们能让它运行,我们会发现大多数 X_i 变量都是零。我们的支持集大小很小。事实上,我们可以证明,对于有 N 个目标的安全性博弈,我们可以获得一个支持集大小为 N+1 的解。因此,存在许多 X_i 变量为零的解。如果我们能神奇地知道哪些是零,并将它们从游戏矩阵中移除,我们就会得到一个更小的游戏矩阵,如果我们能解决它,我们就会得到与更大的游戏矩阵完全相同的解。

正是基于这个想法,我们开发了一种新的精确算法来扩展,基于增量策略生成。这是第一种专门针对这些 Stackelberg 安全博弈的 Stackelberg 算法。我们用少量纯策略开始主问题,然后使用 LP 对偶理论的从属问题将添加下一个最佳纯策略,我们以这种方式迭代直到收敛。这种收敛是全局最优的。但在这里,我们只有一千个防御者策略,而不是 10 的 40 次方个。

这就是 Armour 的构建方式,用于分配航空安全员给航班。如果您乘坐过美国航空公司航班,无论航班上是否有航空安全员,都可能由这个程序决定。我们很荣幸我们的工作再次在美国国会被提及,并收到了联邦航空安全局的感谢状。

现在,我已经向您介绍了扩展的一种特定方法——增量策略生成。但很快就清楚,我们需要进一步扩展安全博弈。2008 年 11 月 26 日,孟买遭到袭击。这是泰姬陵酒店着火了,离我长大的地方只有几个街区。作为回应,孟买警方开始在全市范围内设置随机检查站。这是一个网络安全博弈。如果您查看孟买的整个地图,如果您只看南端,那么在这个网络中有 150 条边。如果您有两个防御者检查站,那就是 150 个组合的防御者策略,而所有对手策略都是对手可能采取的所有可能路径。当然,在现实中,有超过 20,000 个或更多的路段,即使有 15 个检查站,问题也变得极其难以解决。

在这里,我们提出了一种新的精确最优扩展算法,使用了双 Oracle 的思想。与 Vince Conitzer 的合作。所以,我们再次有一个小的游戏矩阵,用少量的防御者策略和对手策略初始化。然后我们解决博弈,防御者 Oracle 提供我们防御者的下一个最佳纯策略,对手 Oracle 提供对手的下一个最佳策略。我们以这种方式迭代,再次增长博弈,收敛到全局最优。这种收敛相当快,所以我们可以在 120 分钟内解决这些大规模博弈。

这就是通过解决这些博弈以及我们在安全博弈方面所做的所有工作,我很荣幸被邀请到印度国家警察学院,在所有高级警官面前发表演讲。这些是来自印度许多邦的督察长和副督察长,以及在我之前发言的两位人工智能教授被反复打断,并被告知他们的工作不实用。所以当我站起来时,我有点紧张,不知道会怎么样。当我开始谈论孟买的检查站时,一位警官站起来说:“Milling,那天晚上我当时就在那些检查站。我追捕恐怖分子进入了泰姬陵酒店,我实际上与恐怖分子进行了枪战。”我想这是一个好信号,也许我应该带上我的双 Oracle 的 NP-hard 证明,打包好,飞回洛杉矶。但他实际上喜欢这项工作,认为这很棒。这就是我们将在今年秋天在印度和美国花费更多时间时要追求的合作。

与此同时,海岸警卫队来找我们,希望改进不同港口的巡逻。为此,我们构建了一个名为 PROTECT 的系统。PROTECT 是一个缩写,所以您可以看到我们花费了大量时间来想出好的缩写。这个安全博弈系统被开发出来了,但他们为我们开发了一个非常有趣的新挑战:保护移动目标。这是对斯塔滕岛渡轮的巡逻。我们开发了全新的巡逻策略,改变了海岸警卫队过去围绕这艘渡轮进行巡逻的方式。

现在,我将向您介绍我们是如何生成这些巡逻的。这里有一种新的扩展方法,称为边际策略。我将使用一个离散空间和时间的过渡图表示。如果我们有三个地点 A、B 和 C,以及三个时间点:5 分钟、10 分钟和 15 分钟。虚线表示船只在图中的行进方式。例如,渡轮可以从 C 在 5 分钟到达 B 在 10 分钟,再到 A 在 15 分钟,这是绿线。巡逻员从 B 开始,前往 C,然后返回 B。巡逻员保护其旁边的渡轮。事实上,巡逻员可以采取许多不同的路径,红色或棕色。

现在我们遇到了一个问题,就像 Armour 一样,确定每条路线的概率。我们可以解决 Armour 风格的混合整数程序,但现在我们有 N 的 T 次方个变量,N 是地点数量,T 是总时间点数。这就是路线的数量。但不是将路线作为变量,而是将边际概率作为变量,我们可以扩展。让我们看看这里的棕色和红色线段,将它们组合成一个单一的概率流变量。让我们看看这两段棕色线段,将它们组合成一个单一的概率流变量。现在我们有 N 的平方乘以 P 个变量。我们可以证明,这种边际表示不会损失任何解的质量,事实上,我们可以提取出我们想要的概率。这种表示可以扩展到连续时间。

因此,海岸警卫队对他们得到的所有结果都非常满意。我们很荣幸再次收到美国海岸警卫队大西洋地区总部的表彰,并再次很荣幸我们的工作在美国国会得到提及。

我们正在与南加州大学合作,利用博弈论来优化和安排我们的巡逻。这使得某人更难预测巡逻将在哪里。因此,我们将其扩展到许多其他应用,例如洛杉矶火车上的巡逻,再次使用过渡图表示。但部署在这里揭示了一个全新的有趣挑战。我们希望检查员离开 B 站前往 C 站的概率为 0.3,但检查员可能最终不得不在 B 站逮捕某人,因此他们会以很小的概率留下来处理这种不确定性。我们将防御者策略编码为 MDP 策略。这是处理执行不确定性的一种方法。但执行不确定性只是不确定性的一种。安全博弈中还有许多其他类型的不确定性。我们花费了大量时间来处理这些不确定性。我将只重点介绍一篇发表在 AAAI 2014 上的论文,这是关于最小最大遗憾的研究。

在这里,我们正在研究防御者-对手的不确定性,将其表示为对手收益上的一个区间。现在,如果您考虑遗憾,如果我们取一个特定的收益实例,并假设防御者以 0.3 的概率覆盖目标 1,以 0.7 的概率覆盖目标 2,那么防御者在这里的效用将是 -2.3。最优效用是 0.4。因此,对于这个收益实例,对于这个特定的策略,防御者的遗憾是 2.7。当然,我们希望最小化防御者在整个收益区间上的最大遗憾,即不确定性。因此,我们想找到那个最小化最大遗憾的策略,这意味着我们有无限多的遗憾约束需要处理。

为此,我们可以开发一种新的迭代算法。一个主问题,通过解决一个松弛的最小最大遗憾问题来生成下界,该问题涉及少量攻击者收益;以及一个从属问题,通过给出最大化遗憾的收益来计算上界。当上下界收敛时,我们就得到了最优解。

今天,我们非常激动地看到我们所做的工作。昨天在 IJCAI 上,我们看到了一整场关于安全博弈的会议。我们看到许多不同的应用在全球各地蓬勃发展,非洲的应用与保护野生动物有关,我稍后会讲到。但在此之前,请允许我稍微谈谈评估这些系统。我们在这里提出的问题是:我们如何优化有限资源的使用?我们的主张是,与人类调度员或其他传统方法相比,安全博弈在优化这些资源方面更胜一筹。我们进行了大量的实验室评估、调度竞赛、实地评估、经济成本效益分析等等。

让我举几个例子。这些是 PROTECT 在波士顿部署之前的巡逻。横轴是每周的不同天数,纵轴是船只访问特定目标的频率。例如,顶部的绿线表示船只在第一天、第二天、第三天等访问目标的频率。您看到的是,第二天巡逻很少,是攻击波士顿港的好日子。所有这些线都相互交叉,意味着有时目标更重要,有时第二天就不那么重要了。但目标的重要性不会每天都改变。

在 PROTECT 部署后,您可以看到,更重要的目标访问次数更多,不那么重要的目标访问次数更少。在任何给定的一天,船只将去哪里仍然是不可预测的。但总的来说,更重要的目标访问次数更多。如果我们从防御者预期效用的角度来看,在 PROTECT 部署之前和之后,防御者预期效用有了 350% 的提高。

联邦航空安全局进行了正面比较,让真人与我们的博弈论系统进行对抗,结论是IRIS 明显更优。这是因为,如果您考虑一个人类调度员,在数千个航班、工作时间、半小时、往返行程、风险随机化之间进行调度,这对人类来说极其复杂,而 IRIS 却做得更好。

我们还进行了调度竞赛。洛杉矶的火车上有 90 名警察需要调度。一方面是一个由人类专家组成的团队,花了两天时间生成这些巡逻。另一方面是我们的博弈论系统,外部观察员不知道谁生成了哪个巡逻,他们站在不同的车站,试图根据十二个不同的问题评估这些巡逻。他们给博弈论调度的评分更高。因此,人类花费了更多的时间,但表现却更差。

我们还进行了火车逃票的调查,一次使用我们的博弈论系统,一次使用一个由人类专家增强的基线。这是在相同条件下进行的为期 21 天的巡逻。结论是,博弈论系统在抓获无票旅行者方面比基线系统更有效,抓获人数多出 60%。在洛杉矶国际机场的检查站,与 Armour 部署之前相比,逮捕人数增加了五倍。

这些只是表明,与传统方法相比,安全博弈在优化我们有限资源方面更胜一筹的一些结果。今天,我们正在推动这一领域的发展。与 TSA 合作进行旅客筛查的“线程筛选博弈”是一个重要的工作领域,以及网络安全博弈。这是我们正在推进的两个重点。

现在,让我们转向自然保护与野生动物保护。在我继续之前,让我们谈谈我们正在努力拯救什么。这是乌干达的默奇森瀑布国家公园,我去过那里。这里有奇妙的野生动物,但野生动物面临着这些陷阱的威胁,这些是用来杀死动物的数千个铁丝网陷阱。我们的巡护员数量有限,为了优化这些有限的安全资源的使用,我们提出了一个名为“绿色安全博弈”的新模型。

这是乌干达的皇后伊丽莎白国家公园。我们将它映射成一公里乘一公里的网格方块,每个网格方块都是一个目标。现在,我们可以想象像以前一样用混合整数程序来解决这个问题,但这里有一个问题。对手不是完全理性的。这是一个问题,因为原始程序无法按原样工作。我们面对的是多个有界理性的盗猎者。因此,我们不能使用我们之前拥有的最佳回应条件。相反,我们在每个网格位置 i 学习对手的有界理性回应。因此,我们给出了一个位置的巡逻频率范围,该单元格的特征,我们试图预测在该单元格中找到陷阱的概率。这个函数 G_i 本质上给了我们在该单元格中执行特定巡逻频率的预期效用。因此,我们试图最大化防御者的预期效用,这正是这个函数 G_i 的总和。

因此,注意力现在转移到学习这个函数 G_i 上。我们有来自乌干达不同国家公园的 12 年数据,我们试图预测每平方公里找到陷阱或陷阱的概率。我们拥有所有这些特征:巡护员频率、动物密度等等。

有一个复杂之处:当发现陷阱时,当巡护员报告发现陷阱时,确实找到了陷阱。但当他们说没有发现陷阱时,这可能只是因为他们在那个网格单元中走得不够多。如果他们多走一点,也许他们就能找到陷阱。因此,我们对我们的正实例有把握,但对负实例我们不太确定。

为了处理这个问题,我们生成了这个不完美的犯罪观察感知集成。基本思想是基于不同的过滤数据集训练不同的分类器。这个数据集是用巡逻力度一过滤的,也就是说,如果巡护员在这个网格单元中行走不到一公里并报告了一个负实例,我们就删除这个负实例,我们不信任它,并构建一个分类器 C1。另一个是巡逻力度二过滤,也就是说,如果巡护员行走不到两公里并报告了一个负实例,我们就删除它并构建一个新的分类器。现在我们有了一系列这些分类器,我们可以构建一个集成。因此,当我们得到一个测试实例,巡逻力度为一公里时,使用 C0 和 C1。当我们有巡逻力度为两公里时,我们使用所有分类器,依此类推。

基于这些结果,我们可以进行实验室测试。从 2003 年到 2015 年的数据中可以看出,我们能否预测 2016 年的情况?是的,我们可以,并且我们可以证明它的性能优于竞争方法。但这对于我们的合作伙伴野生动物保护协会来说还不够。他们希望看到实际的实地结果。

因此,我们选择了皇后伊丽莎白国家公园的两个九平方公里的区域,这些区域很少被巡逻,以前也不是热点地区。这是两个区域(绿点),我们要求他们巡逻。它们不与过去发现陷阱的红点重叠。我们说你们应该在这里巡逻,你们会找到陷阱的。这发生在动物死亡截止日期前一个月。所以,如果找到了陷阱,我们就有一篇论文;如果没有找到,就没有论文。

巡逻员出去寻找陷阱,他们首先报告发现了一只被盗猎的大象。我们的系统告诉我们方向正确,预测的事情也正确,只是我们来晚了,没能救下这头大象。然后传来了好消息:发现了一个大象陷阱。盗猎者在该地区很活跃,他们正在杀死大象,但在他们杀死下一批大象之前,我们移除了这个大象陷阱,可能挽救了大象的生命。然后又发现了一个羚羊陷阱,等等。因此,我们的命中率高于该时期的平均基础命中率。因此,这基本上对我们在野生动物保护协会的合作伙伴非常有说服力。

不过,有一个批评意见是,这是乌干达。您知道,如果您在一个以前未被巡逻过的国家公园区域发现陷阱,您就会找到陷阱。为了回应这一批评,我们在乌干达的两个国家公园进行了第二次实验。我们预测了 24 个区域,我们说其中一些区域是高风险区域。因此,我们的模型预测其中一些区域将发现更多陷阱,而其他区域将发现较少陷阱。这些都是很少被巡逻的区域。现在,巡逻员出去寻找陷阱长达六个月。这篇论文花了很长时间才写完。最后,他们的报告显示,我们预测的每平方公里巡逻陷阱数量,在我们预测为高风险的区域,明显高于我们预测为低风险的区域。因此,我们的预测非常准确。在默奇森瀑布,我们进行了高、中、低风险的预测,我们的预测也同样有效。因此,这现在对我们在野生动物保护协会的合作者来说非常有说服力,我们正在继续前进。

一个领域是我们与一个名为 Air Shepherd 的非政府组织合作。他们在南非飞行无人机,使用深度神经网络拍摄红外视频。然后,我们可以通过检测来定位视频中的盗猎者和动物。现在的问题是,软件已经构建并交付,他们正在测试它。但现在的问题是将这项工作集成到我们的绿色安全博弈框架中,并实时进行。这是我们正在追求的事情。

但一个更令人兴奋的进展是我们与 Smart Partnership 合作的一部分。这是所有这些不同非政府组织(WWF、WCS 等)的合作伙伴关系,他们正在将这些绿色安全博弈算法推广到全球 600 个国家公园,希望这能真正有助于拯救全球的野生动物。这不仅是野生动物,还包括保护森林免受非法伐木和非法捕鱼等侵害。

现在,让我们转向第三个领域:公共卫生。洛杉矶的一个大挑战是无家可归的青年数量。每晚有 6,000 名无家可归的青年睡在我们街头。一个大问题是艾滋病。无家可归青年中的艾滋病感染率是正常家庭人口的十倍。我们传播艾滋病信息的资源有限。因此,无家可归者收容所传统上会招募一些同伴领袖,他们应该在自己的社交网络中传播艾滋病信息。这是影响力最大化的传统问题。我们有一个社交网络图 G,我们试图选择 K 个同伴领袖,目标是最大化影响节点的预期数量。这里的假设是我们使用这种独立级联模型来传播信息。它的工作原理是,我们会通知同伴领袖 A,以及 A 在图中的一个邻居 B,信息会以 0.4 的概率从 A 传播到 B,我们知道每条边的概率。

在现实中,在这个领域的沉浸式体验告诉我们,存在显著的不确定性。为了模拟这种不确定性,我们可以想象这种概率传播是从某个概率分布中抽取的。为了进一步模拟不确定性,我们可以说,我们不确定这个分布的均值是从某个区间中抽取的。因此,我们现在希望在这个不确定的网络上进行稳健的动态影响力最大化。这可以通过将这个问题视为我们算法(将选择策略)和自然(将选择传播的参数值)之间的博弈来完成,以使我们的策略表现尽可能差。这个博弈的收益是算法在该特定设置下的性能与最优值之比。

这就是这个博弈的样子:如果我们有一个试图制定策略来选择同伴领袖来传播信息的“影响者”,而我们有“自然”试图选择分布的值来使我们的性能尽可能差。当然,这个博弈非常非常大,因为有很多策略,有很多参数设置。但我们再次可以使用我们刚才讨论的双 Oracle 方法来解决这些大规模博弈,以达到均衡。

当然,自然是从连续分布中抽样的。但即使如此,我们也可以证明我们能够以近似保证收敛。但还有第二个复杂之处:我们的无家可归者收容所资源有限。这意味着,即使我们可能想培训 12 位同伴领袖,我们一次也只能得到 4 位。所以我们招募了 4 位,结果发现其中一位被捕了,或者其中一位因为其他原因无法出现,他们遇到了困难。因此,当我们带来下一批 4 位青年时,我们需要理解,上一批 4 位可能并没有完全按照我们期望的那样进行。所以我们现在有一个多步策略。我们的每个不同策略都是这个多步策略。

这个问题可以通过将其视为一个 POMDP 来解决。事实证明,这个 POMDP 的扩展很困难。我的学生 Amulya De 在他的论文中展示了巧妙的 POMDP 分区来扩展它。因此,所有这些都使得这个用于稳健动态影响力最大化的 Healer 算法有效。为了在实地测试它,我们去了洛杉矶的无家可归者收容所。

Healer 有两个版本,还有一个基线——度中心性,即招募最受欢迎的青年并培训他们传播信息。在每种情况下,我们招募了 60 位青年。然后,我们从这些人群中选择了 12 位领袖,我们的社会工作同事培训了这些同伴领袖关于艾滋病的信息传播。问题是,我们的算法是否比传统的度中心性基线更有效?事实证明,Healer 和 HeLaplace(两个算法)在传播信息方面比传统方法更有效。我们达到了 75% 的非同伴领袖(我们未招募的人群),而度中心性只达到了约 25%。

好的,他们获得了更多信息,他们是否真的改变了行为?如果您看看获得信息的人中改变行为的比例,那么使用 Healer 版本,我们可以看到 30% 到 40% 的人实际上改变了行为,并开始进行艾滋病检测,而使用度中心性,没有人改变,因为基数本身就小。

这显然让我们的合作伙伴感到高兴。您会看到,我们找到了将技术世界与社会服务世界结合起来的方法,以及我们如何能够更深入地影响年轻人并提升他们。如果这个群体变得非常重要,他们就能真正帮助很多年轻人。

因此,今天我们正在推进一项在洛杉矶对 900 名青年进行的研究。我们正在研究自杀预防和药物滥用预防的挑战。洛杉矶市长最近来到南加州大学,谈论我们无家可归人口面临的道德和人道主义危机。作为一个洛杉矶人,我非常感激我能用人工智能研究为我的城市做出贡献。

在世界的另一边,作为一个孟买人,当莫迪总理在一次人工智能研究人员会议上谈论人工智能时,我非常荣幸能成为听众。他提出了利用人工智能造福社会的问题。我们正在尽我们的一份力量,专注于如何优化有限资源的使用来对抗结核病,研究预测哪些儿童可能辍学并加以预防,优化医护人员的工作。

好了,我的演讲即将结束。我想说,多智能体系统研究确实帮助我们解决了复杂的社会问题。我谈到了三个领域:公共安全与安保、自然保护与野生动物保护,以及公共卫生。在优化有限干预资源方面,存在一个共同的多智能体研究挑战,其共享的解决方案方法基于计算博弈论。我介绍了几个新模型,特别是 Stackelberg 安全博弈和绿色安全博弈,以及关键算法,如增量策略生成、双 Oracle 等。我还谈到了沉浸式体验和部署的重要性,以便在我们前进的过程中开发新的研究挑战。

我看到人工智能和多智能体系统研究在改善社会和打击社会不公方面具有巨大的潜力。但为此,将人工智能带给那些尚未从人工智能中受益的人至关重要,例如全球南方。我们还需要拥抱与社会工作和自然保护的跨学科合作。

这里有一个最后的想法:在从事人工智能造福社会的工作时,我们现在踏出实验室,走向实地变得至关重要。这不仅是因为我们深切关心社会影响,更是因为我们确实需要了解我们正在处理的实际社会问题是什么,以及我们的模型存在哪些缺陷,以便我们能够加以改进。事实上,这将非常有益,因为它为我们指明了全新的研究方向。

好了,我将以感谢许多人来结束我的演讲,其中许多人都在听众席上。我的许多朋友,我真的很高兴。我想首先感谢我在哈佛的导师 Barbara Gross 教授,她多年来一直是我的杰出导师。我在 Armas 有很多朋友,我与许多人写过论文,我看到许多人在听众席上。我不得不有所限制,因为幻灯片上没有足够的空间。所以我挑选了那些在过去十年里我至少写过五篇论文的人。这包括 Serath Krauss、Vince Conitzer、Eugene Robert Cheeke,以及来自 Conservation Biology 的 Plumtree(不是 Armas 的)。但再次感谢所有在座的朋友,以及我南加州大学的合作者,他们非常出色:Eric Rice、Visser、Adele Kina、Phoebe Vinyls 和 Fernando Ordonez。

非常感谢您,感谢您的聆听。能够获得这个奖项,我感到非常荣幸。谢谢。

非常感谢您的精彩演讲。您的工作给了我们所有人启发。谢谢。

好的,现在请允许我扮演一下“魔鬼的代言人”。我是一个非常聪明的恐怖分子或盗猎者。我参加了每一次会议,读了你们所有的论文。我能理解你们所做的一切。我能从中获利吗?不。理解你们所做的一切,或者不理解,一切都已发表。但我们最初与 Stackelberg 安全博弈合作时,我们假设对手知道一切。他们知道你们覆盖的概率。所以,这是一个 Stackelberg 模型。他们本来就知道一切。因此,听这场讲座没有任何优势,因为假设是他们知道的比我们展示的还要多,即使是在这些会议上。

至于盗猎者,因为现在我们开始利用这些对手的有界理性。当然,如果他们知道了正在发生的事情,并开始通过非常聪明的方式污染数据,破坏数据,这可能是一个问题。这是一个有趣的问题。我们与我们的合作者提出了这个问题,但他们认为目前这不是一个大问题。尽管如此,我认识到这是一个,我不知道,价值五到十亿美元的非洲野生动物制品走私产业。所以会有人尝试这些。因此,这是一个有趣的研究领域,值得思考。目前不是一个大危险,但未来是一个有趣的方向,值得弄清楚如何解决。谢谢。

非常感谢您的演讲,我从您的工作中深受启发。我认为这是这个社区和整个研究方向的一个非常重要的方向。我还好奇您在防御者方面的区分。在盗猎例子中,您决定他们是非策略性的,因此您对他们进行了随机建模。而在像洛杉矶地铁或地铁系统中的逃票者等情况中,您将他们建模为策略性的。如果我猜对的话,我可能会认为后者是正确的,因为正如您所说,盗猎是一个价值 50 亿美元的产业。这让我思考,但在您如何建模防御者以及您的解决方案对这些建模选择的错误有多鲁棒性之间,有什么权衡?

这是一个绝妙的问题,Nicole,感谢您的美言。关于我们谈到的火车领域,这是一个零和博弈模型。因此,我们会得出一个更保守的解决方案,不会像那样利用对手的弱点。这部分原因是我们没有足够的数据,顺便说一句,我们从这些数据中获得的信息也有限制。例如,我们不能说某个车站的逃票情况更严重,这是不道德的。因此,事实证明,我们需要非常小心我们能从这些数据中获得什么。因此,结果是我们得出了一个更保守的解决方案。

在盗猎领域,有大量数据可用,我们利用了这一点,利用了我们拥有有界理性模型的事实,我们可以使用它。当然,在逃票领域出现的道德担忧在那一领域并不存在。但这是一个更大的问题,关于如何建模,你知道,做出关于对手的错误假设会带来什么损失,特别是如果我们不再假设完全理性的话。这是一个非常有趣的问题,我认为我们需要在某种程度上量化它。如果能以某种方式量化,那将是极好的。所以,谢谢。

Milling,很高兴看到你谈论这些事情。我认为这非常非常重要。我有一个问题是,公平性是如何在这里发挥作用的?例如,在社区领袖问题中,可能会出现这种情况,或者是否存在一种担忧,即您不断选择属于某些社区的人,从而边缘化了其他可能没有好领导者的人?我只是说他们没有像任何人那样好,或者他们不是高学位顶点,也就是说,这会产生从未获得信息或从未获得机会的子社区?或者,在安全博弈的情况下,您可能会提出类似的问题。谢谢。

这是一个很棒的问题。所以,我想现在的情况是,我们选择这些同伴领袖,结果发现有一个我们没有预料到的次要影响。你知道,我们谈论人工智能中的偏见非常消极,这里有一些积极的方面。这些年轻人被选为同伴领袖。这些是无家可归者收容所等机构没有关注的人,因为他们是社交网络中的“角落人物”,而算法却找到了他们,他们觉得这是重要的认可。他们的人生真的改变了,他们找到了更好的工作,有了稳定的住所。这是一个非常积极的副作用。

那么现在的问题是,算法选择了这些人,它实际上是为了传播信息,但有一个积极的副作用随之而来,带来了额外的益处。那么,选择这些人而不是其他人是否公平,因为现在他们将得不到这种额外的益处?这些都是我们没有想到的非常有趣的问题。而且,你知道,进入实地并观察正在发生的事情,让我们认识到这些是我们没有想到的非常有趣的新问题。但但你说得对,这些是我们必须理解的事情,这是一个非常非常新的工作领域,也是我们非常乐意可能通过合作来追求的事情。

谢谢。Spencer,苏黎世大学。非常感谢 Milling 的演讲,非常鼓舞人心。我有一个问题,您能否稍微谈谈您所展示的好处中有多少来自于优化和随机化,而不是博弈论的使用?我认为这是一个非常迷人的问题。

有一种思考方式是,如果我们只是进行均匀随机化会发生什么?因为博弈论在某种意义上给了我们这些混合策略,它们更智能,而不仅仅是均匀随机。所以我提到了基线,例如在火车场景中,我们所做的实际上是一种均匀随机策略,这是与我们的博弈论策略的基线。由于它非常无效,巡逻员开始感到沮丧,因为它不起作用,他们没有真正实时地抓到渡轮逃票者。所以他们会说,“我知道渡轮逃票者在哪里,我要去抓他们。”所以,即使有这个补充,它仍然表现得更差。

因此,我认为我们反复证明了这一点:如果您尝试在实地进行非常均匀的随机操作,它似乎无效,而且对用户来说也是不可接受的。因此,错误地,因为代码中有一个错误,在最初我们处理机场时,我们提出了这个均匀随机策略,并且立即有人抱怨说这不起作用,因为人们被派往没有人的航站楼。这种情况有时会发生,但并非总是如此。因此,有许多理由相信,仅仅进行调度和均匀随机化是行不通的。

还有一点需要考虑。当所有这些工作完成时,你知道,我们必须将其呈现给科学咨询委员会等。他们会看,他们有自己的,你知道,他们有自己的人在看我们的工作,说这是否应该做,或者不应该做。所以,你知道,其中一些技术可能甚至无法通过那个阶段,更不用说进入实地并尝试在那里进行实验了。

我还可以给出更长的答案,但我们可以稍后讨论。但主要观点是,我们坚信博弈论方法比传统方法能改善情况。例如,在海岸警卫队,纽约有非常聪明的人,他们自己尝试了许多不同的优化技术,我们再次看到,他们的解决方案不如我们的好,因为你知道,我们能够比他们以前做得更有效地覆盖目标。所以,希望这能给你一个答案,但这是一个非常非常有趣的问题,也是一个,你知道,需要新的,我们思考了很多的问题。谢谢。

[掌声]