Transcription
[音乐] 谢谢大家 大家好 感谢大家今天参加我们九月份的金融人工智能与大数据论坛虚拟研讨会。今天我们非常非常高兴地欢迎来自芝加哥大学商学院的桑迪尔·穆拉纳森,他将为我们介绍机器学习作为科学工具。然后是来自哈佛大学的沙拉德·郭,我们将讨论他。演讲者将有30分钟,讨论将有20分钟,最后10分钟是听众提问。所以请通过问答选项发送您的问题,我将在大约第15分钟打断桑迪尔,如果有澄清性问题,但任何涉及较长辩论的问题都将推迟到最后10分钟。我还想请大家注意一下您的问题。最后,一旦研讨会的官方录制部分结束,我们希望您能加入我们,并在线停留,进行一次非正式的简短后续讨论。现在,桑迪尔,请您发言,您想分享您的幻灯片吗?非常感谢,我先找到演示者按钮。好了,感谢您的邀请,我将直接开始。我不确定30分钟内能讲多少内容,所以让我们看看结果如何。在开始之前,我应该先介绍一下背景。对我来说,科学中最有趣的事情之一是,我在2012年花了一些时间去问人们他们领域里最大的创新是什么。我得到的答案很有趣,但如果你一直收集,你会意识到人们给出的答案是错误的。他们之所以给出错误的答案,是因为他们倾向于给出关于他们领域内创新的答案,而不是关于创新过程的创新的答案。如果你真的看看科学史,最大的变化,那些真正加速科学发现的事物,不是个别发现,而是关于我们如何进行发现的发现。对我来说,机器学习最令人兴奋的地方在于,它有可能成为一种改变我们如何发现世界事实并改变我们对世界理解的工具。所以,这是一系列工作,两篇论文,我将尝试完成它们,至少具体说明那可能是什么样子。我并不是说这些论文百分之百正确,或者这就是做事的方式,但它们更像是进入这项活动的入口。所以,让我从这里开始。这是我很久以前做的工作,沙拉德也研究过这个课题,还有不少人也研究过,那就是:算法能否改进司法判决?我们关注的是审前风险,法官做出审前决定。有人来到法官面前,法官必须决定是否将他们关押。然后我们问,算法能否改进法官的决定?我们能否预测被告会做什么,并用它来制定更好的决策规则?这其中有很多复杂性,人们谈论从公平性到计量经济学问题,比如我们看不到人们的结局等等,但这并不是本次讲座的内容。本次讲座是我们写的一篇论文,我们说服了自己,你可以,你可以保持犯罪率不变,将监狱人口减少40%,或者你可以保持监狱人口不变,将犯罪率降低24%。正如我所说,有很多问题,包括算法是否应该在实践中发挥作用,比如在法官的工作中。但我之所以提起这篇论文,是因为自从我们写了这篇论文以来,困扰我们很久的问题不是“能否”,而是“为什么法官可以被改进?”作为科学家,政策问题是“我们能否改进?”科学问题是“为什么?法官哪里做错了?”
我们如何回答这个问题?嗯,我想说这就是所有社会科学的意义所在。哦,人们似乎在做错事,让我找出是什么。我们有解决这个问题的方法。我会提出一个假设,然后我们有详细的工具来检验这个假设,自然实验、实地实验、实验室实验、数据集、相关性,有大量的检验工具。但如果我走这条路,值得注意的是,我们使用了所有这些机器学习工具来找出问题,但现在我们又回到了常规科学。这有点奇怪。科学过程中也存在一种奇怪的不对称性,一旦我们有了假设,对它的检验就像一丝不苟一样,过去200年来对它的形式化程度令人惊讶。但所有这些机器在哪里?你训练了一些我想到的东西,我在洗澡时有个好主意,我和某人谈过,我读了某样东西,这是一种非常不对称的产生假设的方式,然后我们一丝不苟地检验它。所以,我想问的第一个问题,这是与恩斯·路德维希合作的,那就是我们能否形式化这个过程,或者更具体地说,我们能否利用机器学习来辅助假设生成过程?所以,让我们这样做吧。让我们以这个非常具体的例子来做。我该怎么做呢?嗯,如果我想了解法官哪里做错了,我不应该提出对被告会做什么的预测。我应该调转镜头,预测法官会做什么。所以,让我们这样做吧。这只是一个AUC曲线,我们根据被告和环境的一切信息进行预测,我们把所有东西都扔进水槽里,然后预测法官会做什么。这大约是0.71的AUC。有趣的是,我们比预测被告是否会犯罪更能预测法官会做什么。这很有趣,但这本身并没有回答任何问题。我们真正想知道的是,算法在预测法官时使用了什么?那里有什么有趣的东西吗?所以,为了回答这个问题,我将从一个非常粗糙的东西开始,一个粗糙的、粗糙的、粗体的、红色的字体的东西,这才是真正应该说的。这真的不是深思熟虑的。我将要做的是人们经常称之为变量重要性。我将采用我的预测器,我将采用它的输入,我将打乱输入,然后我会问我失去了多少预测能力,以及如果我打乱哪个输入,我将失去最多的预测能力。所以我只是给你输入,要么在我的数据中销毁它们,我失去了法官的预测能力。第六重要的输入是被告目前的指控是否是枪支犯罪,这很有趣。第五重要的输入是目前的指控是否是毒品犯罪,第四个是重罪。所以,你可以看到它的发展方向,这很有趣。事实上,卡斯·桑斯坦有一篇论文,他认为法官的一个偏见是倾向于目前的指控,即使在这个粗糙的初步阶段,你也会想,哦,也许这里有些东西,因为目前的指控对法官的决定非常具有预测性。谁知道这是否是偏见,但它非常快。所以,这个列表中的第一重要输入是什么?似乎应该是某种未包含在此列表中的当前指控。事实上,事实证明,第一重要输入是嫌疑人的照片,被告照片中的像素,而不是我对手照片做的任何事情。这些只是原始像素级别的数据具有预测性。这个列表具有极大的误导性。不是因为它排在第一位,而是因为它占了信号的很大一部分。它比下面的东西重要得多。让我给你一种方法来看到这一点。我取像素并制作照片,我只用它来构建一个预测法官决定的预测器。所以,算法除了图像中的信息外,对被告一无所知。事实证明,如果你只用人脸来构建一个预测器,它大约能达到0.61.62。如果你回想一下,因为完整的模型大约是0.71,那么法官决定的可预测信号的一半到40%到一半就来自照片。这太疯狂了,但当然,如果你仔细想想,这也不算太疯狂。因为有理由相信我们已经知道法官可能会使用照片中的因素。我们知道法官会关注年龄,我们知道法官会关注性别,我们知道法官会关注种族,更重要的是,在歧视的文献中,他们会关注肤色。所以,我们也从心理学文献中知道,心理学家已经发现了许多面部特征,我认为其中四个是首要的,那就是可信度、支配性、吸引力、能力。这些被称为“四大”,它们涵盖了面部特征的集合。也许算法只是在重新发现这些东西,如果真是这样,那就没什么意思了,因为我们已经知道了。这不是假设生成,这只是重新发现。当然,问题在于算法已经重新发现了X。如果我停下来,现在放大,然后说你想让我加入什么其他X?我敢肯定你们都会自己生成X。你们会这样做。这个过程几乎是层层叠叠的。我可以不断地问更多X。所以,为了停止这个过程,我们想做的是,我们想说,让我来处理所有人类直觉的东西。所以,我们在这里做的是,我们进行了一个实验室实验,我们问受试者,这是照片,这是两张照片,例如,哪一张更有可能被关押?所以,我们捕捉了人们想法的总和,并称之为预测的人类概率。最后一个变量,我们取所有关于照片的变量,然后我们问,在这些变量的条件下,算法是否仍然重要?第一个事实是,这些在我们数据中确实很重要。当我以它们为条件时,它们确实预测了法官会做什么。这很好,我们认为它们应该如此。第二,算法在从未被赋予这些特征的情况下,自己就重新发现了它们。如果你以算法的预测为条件,这些特征中的许多要么消失,要么不再重要,这意味着在算法的信号中,有这些特征。但最后,也是最重要的,集体而言,这些只解释了算法发现的一小部分。还有很多信号留存,而且重要的是,唯一真正捕捉到算法所做事情的显著一部分的是性别。性别似乎很重要,算法也发现了它。但你剩下的是,比如80%的算法信号仍然存在,并且完全无法用这些因素解释。我认为我进去的时候会认为性别和种族会起很大的作用,而这将会是算法发现的大部分内容。正如我所说,它确实发现了这些,它发现了那里所有的信号,但它发现的远不止这些。那么算法看到了什么呢?所以,从某种意义上说,这是一个发现,但它是一个相当令人不满意的一个,因为我所告诉你的只是,脸上有些东西,我不知道是什么,而且不是你所知道的任何东西。好的,太棒了。它只是脸上的东西,你不知道,几乎没用。我所做的只是用另一个黑箱——算法——取代了法官思想的黑箱,这似乎是完全徒劳的努力。所以,我们真正想要的是,我们想要这个东西弹出一个可解释的假设。可解释性是一个已知难题,但我们有解决它的方法。所以,我想做的是,我将采用算法看到的东西,我所知道的东西。我知道很多面部特征,我们都知道人类知道。算法有一个从像素空间到预测器的预测器。我们想要的是创建一个沟通程序,让两者能够交流,并产生一个对我来说有意义的假设。所以,从这个意义上说,算法发现了一些东西,但人类给它命名了。这就是我们想要的理想沟通程序。那么,这两个生物体(可以说)如何沟通呢?左边的生物体生活在从像素到预测的函数世界里。右边的生物体生活在形容词的世界里。虽然它们不居住在相似的世界里,也没有相似的语言,但它们有一个共同点,那就是它们都认识照片。这是共同点。我看着一张照片,产生一个形容词。算法看着一张照片,产生一个预测。所以,那里有一种交集,我们都理解。而这种我们都理解照片的想法当然是不够的。我们需要能够谈论照片中的某些东西,而不仅仅是照片,而是照片的特征,或者照片中的某些东西。例如,一种非常强大的常用技术是,为什么我们不让算法告诉我们它在照片中看到了什么?这就是梯度方法的思想。梯度方法的思想是,你取一个预测器,然后计算它的梯度。所以,在给定的照片中,我将做什么?这是一张给定的照片,让我们放大一下。这些是像素值。我将改变一个像素值,比如红色194。我将看看预测值会改变多少。然后我将问,我可以改变哪些像素值会引起预测值最大的变化?这就是梯度方法。现在,算法可以和我交流,它可以告诉我“它在看哪里”,这就是这些方法的思想。我隔离那些导致巨大变化的像素,并预测值。让我们看看当我这样做时会发生什么。我从这个人开始,我说算法在哪里看?好消息是,它在看脸。你可以对任何图像这样做。当然,它给你的就是脸上的大像素值。这对于脸部来说真的不起作用。脸部不起作用的原因是,我们想要的是形容词。但如果你想到像吸引力这样的形容词,脸部没有一个特定的地方可以孤立地找到吸引力。你的额头上没有信任感。面部特征是整个脸部的复合函数。所以,孤立地找出事物发生的地方并不能真正帮助你。太好了,好吧,这只是说明我们不够有创意。我们真正想做的是,为什么我们不直接遵循梯度呢?为什么我们不说,是的,你计算了梯度,不要显示它在哪里重要,而是改变图像以最大程度地遵循梯度?你只需要这样做,现在你就有一张新图像了。所以,人类理解比较。不要告诉我你在看哪里,给我两张照片进行比较。所以,太好了,让我们改变照片,遵循梯度来增加概率。如果我们这样做会发生什么?嗯,这会产生这个东西,这是一个烂摊子。产生这个东西的原因很奇怪。发生了什么?嗯,如果你仔细想想,应该很清楚发生了什么。当我们变形图像时,我们没有得到新的脸的原因是我们正在变形。这是图像空间。这是预测函数的等高线图。这是我的梯度。我正在遵循它,并希望得到一张脸。发生了什么?嗯,这张图像具有误导性。这是所有图像,所有像素组合。脸部不是常见的像素组合。大多数像素组合都不是脸部。事实上,脸部集合是所有像素组合中的一小部分。所以,我从这里开始,我遵循梯度。当然,我离开了脸部流形。所以,如果你遵循梯度,你就不会留在脸部,你遵循的是像素梯度。为了解决这个问题,我们需要能够对脸部流形进行建模,然后遵循梯度以留在脸部流形中。我们对脸部流形进行建模的方式是,我们构建了照片。我们取了所有照片,并创建了一个照片的合成模型,允许我们遵循梯度并留在流形中。好了,让我们假设我们这样做了。所以,你构建了一个照片特定的,预训练的扫描是不够的,你需要生成逼真的照片。所以,你选择了这些。这是两张真实的照片,两张合成的照片。我实际上不知道它们是哪一张。照片再次,它实际上做得非常好,能够生成逼真的照片。一旦我们完成了,我将基本上进行以下流程。我将采用法官预测器。我将变形图像,从左到右,从低预测概率到高预测拘留概率。我将形成图像对,展示给受试者。受试者将看着它们,他们将被激励去猜测哪一个的拘留概率更高。他们会得到反馈,所以他们有机会学习。在他们做了很多次之后,最后我问他们,告诉我你认为什么很重要。他们命名的任何东西都是假设。所以,故事结束了。那么,他们能否表达一些东西?嗯,在第一次实验中,肯尼,这是一个词云,你可以开始看到,我不知道你只是看它一点点,你会开始看到一些词语真的跳了出来。所以,如果你把它标记化,事实上,你会发现,在这个实验中,大约40%的受试者在被问到他们看到了什么时,他们说“修饰得很好”或“修饰得很好”的同义词。事实上,事实证明,我稍后会告诉你发生了什么。当然,这没有理由停止。修饰得很好确实预测了算法会说什么。所以,如果我们去另一个数据集上编码“修饰得很好”,并放入事实上,有有意义的沟通发生了。但“修饰得很好”只解释了算法所说的一部分。我们可以正交化“修饰得很好”,并重新进行整个过程。如果你再次正交化,那么当我遵循梯度时,我遵循的是正交于“修饰得很好”的梯度。所以,我没有改变“修饰得很好”。有趣的是,如果你这样做,你不仅会得到另一个人们命名的特征,你还会得到一个比“修饰得很好”更强的特征,原因我不太明白。你甚至可以在这张照片中非常清楚地看到它。你得到的特征是“脸部饱满”、“脸部沉重”、“脸部肥胖”之类的。这个很有趣,因为我认为我们大多数人都会有这样的直觉:修饰得好会导致更高的释放概率。但我认为,如果你只是内省一下,然后说,“等等,胖脸朝哪个方向发展?”你可能有一个直觉。但当我问观众时,他们往往会各占一半,朝任何一个方向。总的来说,事实证明,脸部饱满是释放的有力预测因素。所以,所有那些节食都没有多大用处。所以,这只是一个概念验证。它们真的能预测法官的行为吗?取一个新的数据集,编码它们。事实证明,它们不仅能预测法官的行为,而且预测的幅度惊人。当我说的幅度是惊人的时,对我来说是惊人的,我不知道,也许你觉得不奇怪。事实证明,像“脸部饱满”和“修饰得很好”这样的东西,在保持其他因素不变的情况下,至少相关性是,幅度大约是犯下暴力犯罪、谋杀或重罪的一半到三分之二。所以,你可以削减,或者说,幅度是疯狂的。这些是新的吗?当然,你可以说,看,公共辩护律师一直都知道这一点。所以,我们又和公共辩护律师做了一系列实验,我们给他们看了这些照片,他们当然不会说,“哦,胖脸很重要。”而且他们,这似乎是新的。在我们与公共辩护律师进行的实验中,以及我们对他们进行的调查中,他们甚至似乎“因果地”起作用。现在,这不是关于假设生成的论文,但我们确实做了一点。我所说的“因果地”是指,你可以控制预测风险,它们仍然具有预测性,但谁知道呢?这只是一个控制回归。或者你可以运行一个实验室实验,你问受试者,你会拘留这些人中的哪一个?你给他们照片,也给他们所有的背景信息。在这个实验室实验中,你使用GAN来实验性地操纵“修饰得好”或“脸部饱满”。事实证明,受试者至少会以增加拘留概率的方式对这种实验性操纵做出反应,这正是这些新受试者,我们只是在玩一个新游戏。但同样,这是一篇关于假设生成的论文。让我通过说,在这篇论文中,它不是关于“修饰得好”或“脸部饱满”,而是关于一种研究人的方式。我希望在座的每个人都有兴趣了解人,而不仅仅是法官或脸部。但它有几个关键要素。你只需要一些行为来预测,相当于谁释放了法官,你需要一些数据来预测。重要的是,你需要一些非结构化数据。结构化数据不太可能有成效,因为有什么惊喜的空间?你知道你数据集中的所有变量,充其量算法会说它是变量18。你就像,太好了,我以为18可能很重要,我很高兴你告诉我18很重要。图像、语言等非结构化数据非常棒,因为它们涉及的数据量比我们最初收集的要多。当我拍你的脸的照片时,我没有决定你的脸的代码。让我们拍你的脸的照片。当我收集关于你说的话的语言时,我不知道。那里有比我知道的更多的信号。所以,这是我们没有想到的变量。所以我认为这就是秘诀。如果有行为要预测,并且有一些丰富的东西可以预测,我觉得我描述的这个工具流程非常有帮助,或者可以有帮助。我不说非常有帮助。所以,让我继续下一篇论文,我将很快完成。下一篇论文处理的是这篇论文的范围限制。所以,塞缪尔,你有一个时间概念,你还有八分钟,很好。所以,下一篇论文处理的是这篇论文的范围限制。在这里,我正在生成假设,但我们的理论是什么?我们现有的理论?我不知道,年龄、性别、种族、肤色。我们的理论是我们的一些隐含的面部理解。但有很多领域,包括金融,我们的理论不是隐含的理论,而是我们确实有明确的理论。所以,问题是,鉴于你实际上可以给算法提供你想要理解的正式理论,它在某些方面是错误的,你不应该做一些不同的事情吗?为了做到这一点,我们观察到,我们开始说,这是与蔡斯·拉马昌根合作的工作。理论通常是如何演变的?对于那些了解预期效用理论的人来说,你可能在基础微观经济学中学过,在预期效用理论被创造出来之后不久,拉就创造了一个非常著名的悖论。我没有时间详细介绍它,但值得一看,它很有趣。它表明预期效用理论似乎不起作用。它只是两个选择,在第一个选择中你选择A,在第二个选择中你选择B,但它们不一致。预期效用。这是一个精心设计的例子。在拉悖论之后,一些人提出了共同比率效应,共同多样性出版物1979年的论文,表明这里有更多的异常,但他们也说,考虑到所有这些异常,这里有一个理论,前景理论。然后他们说,这里有更多的异常。然后新的理论出现了。理论的演变是通过理论-异常-异常-异常。这不仅仅是预期效用理论。这就是博弈论的演变方式。我们有纳什。泽尔顿说,这是一个奇怪的游戏。哦,子博弈完美。然后,这是一个基于子博弈完美的奇怪游戏。现在出现了所有的改进,你可能知道。这发生在金融领域。我们有资本资产定价模型。有人说,这很奇怪。哦,这是消费资本化。哦,这很奇怪。三因素模型。哦,这很奇怪。五因素模型。我敢肯定你们可以继续数下去。我不知道你们现在有多少,25因素模型还是你们现在有的任何东西。但这就是每个理论的演变。那么,我们通常如何发现异常呢?当前的异常模型,你可以看到这非常熟悉。当前的异常生成模型是,有一个人看着世界,他们将他们看到的世界与他们对理论的了解进行对比。他们创造了一个特定的例子。这就是拉所做的,非常出色。我说,让我展示一个非常最小的异常例子。你在金融领域也见过,比如我最喜欢的一个是,比如Palm3.com。让我展示Palm和3.com。应该有一价定律。人们在创造这些美丽的微小异常方面非常出色。有趣的是,这个步骤的所有部分都是人类的。所以,我想指出的是,第一步,观察世界并发现模式,非常适合机器学习。在这项与希什合作的工作中,我们认为,即使算法可以看到我们可能看不到的东西,这一部分,潜在的算法部分,仍然是人类的。我们认为,事实上,我们可以使整个流程自动化。我们想做的是构建一个算法,给定一个数据集,给定一个正式的理论,比如实际上就是理论的方程,或者无论你如何建模理论,它实际上可以完全自动化整个部分。所以我给你一个理论,给你一些数据,它会输出一个异常。让我给你一个例子。事实证明,制造这个工具最困难的地方不是你认为它会困难的地方。首先,我们需要形式化理论是什么。但这很困难,因为即使个别理论是形式化的,它们的形式化方式也各不相同。所以,我必须形式化任何理论,一个能够捕捉各种理论的通用模型。第二,你必须形式化异常是什么。这稍微容易一些,但需要一些思考。所以,我们描述了个体异常,但请注意,异常与你在计量经济学中遇到的任何东西都无关。异常不是p值,不是统计检验量,不是拟合优度度量,甚至不是回归。拉只是两行数据。你觉得,这很有趣吗?所以,什么是异常?我们必须同时做到这一点,以一种能够包含统计对象,如机器学习和数据生成过程的方式,因为我们需要一个能够将所有这些结合在一起的工具。所以,我们需要包含逻辑对象和统计对象,理论和异常,以及机器学习和数据生成过程。所以,一旦我们完成了,好吧,我将跳过,为了节省时间。我们能够做到的是,我们有一个工具。我实际上会向你展示这个。我们能够做到的是,创建一个工具,它实际上接受一个理论并输出异常。我将只展示一件事。这个工具的一个应用是回到最初的拉悖论。所以,我们所做的是,我们采取了彩票选择和预期效用理论。我们采用了我们的工具,我们想做的是,在一种受控的环境中测试它。所以,我们所做的是,我们把自己置于1979年康纳姆和特沃斯基的处境。那么,康纳姆和特沃斯基做了什么?他们观察了人们的行为,然后说,“我看了预期效用理论,我看了人们的行为,男人,那个理论完全错了。这里有一系列异常,表明它是前景理论。”所以,他们看到了一个按照前景理论行事的世界,并输出异常。所以,我们采用了我们的程序,并给了它数据,只是彩票数据。但彩票数据来自那些行为符合前景理论的人。算法不知道前景理论。它们只是得到了阶段。它得到了预期效用理论的形式化,以及人们行为的世界的数据。我们对它说,给我们异常。它会重写康纳姆和特沃斯基1979年的论文吗?这就是我们正在问的。事实上,首先你必须问,程序是否产生任何东西?事实上,它确实产生了与彩票一致的菜单,除了彩票的数字不干净,它们实际上很容易解释。它们真的合乎逻辑吗?是的,它们都违反了预期效用理论。更重要的是,它们可以被归类。在第一轮中,我们产生了109个异常,它们分为这九类,分为这五类。我们创建这些类别的原因是,康纳姆和特沃斯基以及之后的所有东西实际上都只分为这两类。这三个类别都是全新的异常,在文献中并不存在,尽管它们与前景理论一致。你可以问,等等,这些是什么?为什么我们从未找到它们?其中一些比我们实际设计的要简单得多。它们只是规模和大小。所以,你当然可以问,这些异常是新的,但它们是真的吗?所以,我们所做的是,我们找来受试者,我们让他们进行这些逻辑异常测试。实际的人,给他们彩票,然后问他们,他们违反预期效用理论的频率是多少?这就是你发现的。但这毫无意义。这些都是异常类别。每一列都是一个异常。违反率在y轴上。但到底是什么?我不知道高违反率是什么。所以,我们又采用了元分析,其中包含了所有现有的异常,以及一些现有的异常。它们在这个确切的实验中显示了著名的异常产生了什么。例如,拉悖论在这里,这意味着这些新发现的算法异常与拉在1950年发现的水平相差不远。确定性效应和其他常见的康纳姆和特沃斯基的异常在这里。这些比那低,但没有明显低。共同比率效应在这里。所以,总而言之,在第一篇论文中,我希望你明白,当我们有一个隐含的理论时,我们可以开始产生可能给我们直觉和形容词的东西。在第二篇论文中,我希望你能感觉到,当我们有一个正式的理论时,我们可以有程序让算法直接与该理论互动,并找到我们可以然后理解的异常。至少在这个概念验证中,它似乎做得相当多。所以,让我最后总结一下,即使你不太相信这些论文的实例,我希望我能说服你,我们应该花更多的时间来思考科学发现过程本身。而机器学习可能是一个非常有用的工具。好了,谢谢。非常感谢,丹尼尔。所以,沙拉德,请您发言。谢谢。好了,大家能看到吗?嗯,首先,我只想重申,我确实相信这个更广泛的使命,即利用机器学习作为科学工具。我认为那里有很多东西。我认为我们才刚刚触及使用这些现代工具来重新构想科学发现的意义的皮毛。然后,我只想从我对我方法的解读开始。我将重点关注第一篇论文的评论,然后我将谈谈那篇特定论文的评估和实质性结果。这是我对桑迪尔刚才描述的内容的总结。你有非结构化数据,比如图像,还有一些结构化数据在这个数据库里,假设,然后我们有一些标签,红色或蓝色。传统的机器学习流程是,你正在使用你的黑箱算法,从这个庞大的结构化和非结构化数据集中预测这些标签。那么,目标是什么?目标是理解,比如,为什么算法会产生某些东西?我们知道为什么问题很难,比如,传统上或者不是,说一个现象为什么会发生是很模糊的。有很多答案。但我认为我们对我们正在做的,我们试图用这些黑箱算法进行的解释类型有一些直觉。所以,一种概念化它的方法是,你正在提取你的非结构化数据,并创建可解释的特征。这与桑迪尔所描述的略有不同,但这是我对思考这个问题的一种方式。所以,我们提取非结构化数据,并通过某种过程将其映射到可解释的特征。而“可解释”这个词并不是完全清楚是什么意思。但再次,用我们的直觉,我们想到的是对人类来说可解释的东西。现在,我们将使用这些可解释的特征,然后将它们通过一个白箱算法,比如回归。现在,一旦我们做到了,我们就觉得我们可以理解可能发生了什么。所以,这里的难点是生成这些可解释的特征。所以,一种思考假设生成的方式,正如塞缪尔所描述的,我认为它本质上是关于特征生成。所以,如果你观察到非结构化数据,能够很好地预测某些决定,那么你就可以合理地说,为什么会这样?你为什么关心为什么会这样?也许是为了帮助干预,或者仅仅是为了科学理解。所以,现在,目标是生成结构化信息,或者说生成结构化信息的方法。然后,你拟合这些更易于解释的简单模型。再次,希望有助于解释。那么,我们如何生成结构化特征呢?一种可能性,我认为这是塞缪尔谈到的论文的核心,就是你进行梯度步骤,然后你有人类标签。所以,你正在利用机器学习以一种战略性的方式从非结构化信息中提取结构化信息,利用你知道某些事实,即人类,如果你给他们看例子,他们可以告诉你一点点他们看到的东西。现在,你也可以说,有许多其他方法可以从非结构化信息中生成结构化特征,或者甚至只是,你知道,没有任何信息,没有任何指令信息。有许多方法可以生成结构化特征。所以,一种方法就是问一群人,“给我一个列表,100个东西,100个图像特征,可能有用。”你可以把这些东西放进回归里,以某种方式,或者回到你开始的地方。所以,现在你有一个可解释的特征集,你有一个可解释的模型,你可以看到什么对最终决定具有预测性。所以,我还要做的一件事是,我问ChatGPT,法官可能会根据被告的外表做出保释决定的各种原因。所以,它给了我一个长长的列表,事实上,第三个是“展示”。被告的着装、服装、整体展示。我们有年龄评估,也许被告看起来年轻或年老。但我们有很多东西。同样,这里的重点是,在某种意义上,这些是低维特征空间。所以,几乎是定义性的,如果它对人类来说是可解释的,你可能可以列举出来。不完全是,但我认为这就是这里的想法。我只是字面意思,我说,“给我20个,”你知道,“给我20个东西。”它给了我20个东西。我认为它至少恢复了一些塞缪尔通过这个自动过程找到的东西。但对我来说,重点是,你知道,如果我们把它看作是特征生成,那么有各种各样的特征生成技术。所以,对我来说一个问题是,任何一种特征生成技术,特别是塞缪尔谈到的梯度方法,在某些情况下是否特别有效或有用?我的感觉是,至少在某些情况下,比如图像,我们可以做得更有效率。例如,就像编译这些类型的特征列表一样。所以,现在我将进入评估,这篇论文的实质性部分,但有一个前提,我认为这是至关重要的,塞缪尔再次说,论文和桑迪尔在演讲中也重申,这真的关乎方法,而不是具体结果。但我认为至少思考具体结果是有用的,这样我们才能理解方法。所以,这是,嗯,你知道,这是摘要。我们从一个令人分心的事实开始。仅在美国,法官的拘留决定就非常重要。事实上,仅凭被告照片的像素,就占了关键变异性的近一半。这是一个相当惊人的说法。我不得不承认,我对我看到的感到非常困惑,因为它感觉我一直在研究这个领域,而且它似乎不应该是这样。我将争辩说,这可能并不完全正确。是的,我们将一起分析,并试图理解这是从哪里来的,以及为什么这可能不是,你知道,这个特定的说法可能没有得到证据的支持。所以,让我们看看,你知道,从数字上看,这个说法是从哪里来的。据我所知,这个“50”来自于查看AUC,你查看完整的模型,然后与人脸模型进行比较。如果你这样做,它就会,这有点,你知道,这是一个棘手的练习。没有标准的度量来理解这些模型中的信息量。但你看看完整的模型,然后说,好的,信息量是从50开始的,这是AUC,所以这是零信息条件,一直到78。所以,这是你的总信息量28。然后你有人脸模型,你有13个信息。所以,你有大约50个。所以我认为,机械地说,这就是摘要中的说法。有许多计算方法。如果你计算R平方而不是AUC,你会得到不同的答案。你知道,这在论文中也有提供。所以我认为,你知道,这被清楚地呈现了。但重点是,甚至有许多不同的方法来解释这个数字。就像解释信息量一样。如果我做另一件合理的事情,我得到的信息量只有一半,你知道,引用的话,信息量,然后如果你要采取名义上的AUC,但我认为这个信息度量有一个更严重的问题。所以,真正被捕捉到的是,人脸中有预测信息。但请记住,这个说法是关于人脸很重要。这很棘手,因为我会说,如果你要试图证明某件事很重要,你可能想看看边际信息,在一切其他条件都相同的情况下。所以,这是另一种思考任何特定信息重要性的方法。你看看边际信息。想法是,脸部可能包含大量信息,这些信息也包含在结构化信息中。所以,我将如何衡量边际信息?你看看完整模型中的信息,减去除脸部以外的所有模型中的信息。然后你看看完整模型。然后你除以,你知道,这只是,一些捕捉边际信息的统计数据。我猜边际信息实际上很小。我猜可能比你用另一种方式看到的要小一个数量级,因为这种双重编码。所以,让我试着解释一下。我将试着解释这是从哪里来的,以及为什么我认为它很重要。所以,核心问题我认为是,很难估计,甚至枚举因果效应。所以,如果我们看到脸部对决定有预测性,这可能是真的。但可能还有其他同样具有预测性,或者也编码了相同信息的东西。所以,如果我告诉你,有这两条信息,结构化信息和脸部信息,都具有预测性,那么就很难严谨地说,甚至很难理解,如果其中任何一个很重要,在什么意义上,其中任何一个对司法决定很重要。所以,这又来自于这个口号:很难,很难说出因果效应是什么。我们应该关注原因的影响。所以,这又是我在论文中真正喜欢的东西,桑迪尔再次超越了这一点,说,好吧,这里有一系列假设。那么,让我们试着看看这些原因的影响。所以,原因就像是修饰或脸部饱满。所以,如果你这样做,有很多实验证明,这些个体,除非他们准备好了,否则他们会被拘留。作者随机改变了这些脸部,以隔离一个人外表的原因效应。所以,这非常像是从原因到结果的转变,我认为这让我们回到了因果推断的世界。他们所做的,他们报告的是,被拘留的被告更有可能被拘留,他们脸部不那么饱满或修饰得很好,即使他们被随机分配。所以,我们试图再次隔离这些特定操纵对决定的影响。但如果你稍微看看这个。所以,这是附录中的一些内容。对于修饰得好的影响,大约是1.3个百分点。对于脸部饱满的影响,大约是1.9个百分点。是的,事实上,即使你看看,如果,修饰得好的影响,甚至那个影响在统计学上并不显著。所以,这再次表明,这些影响在某种意义上非常小,甚至在这个实验类型中也无法准确或自信地测量。所以,我确实相信这里可能有一些影响,但我认为幅度相对较小。而且,我还想说,这些图像是从哪里来的?它们是来自改变后的图像分布的顶部和底部。所以,我的感觉是,从论文来看,这些是相差四个标准差。所以,就像
相当极端,所以我们正在看极端整洁和不整洁的人,并看看这有什么影响。因此,如果我们将此转化为现实世界,我们可能会看到减弱的效果。嗯,所以这只是需要记住的一点。嗯。
我最后想说的一个评论,我认为它让我对这篇论文思考了很多,而且我没有很多嗯,我不太确定如何思考它,所以我只是提出这个问题,那就是有一个大问题:法官是对的吗?论文中有两段引文让我印象深刻。所以第一个是,我们不会说嫌犯照片预测嗯,嫌犯照片预测被告行为,那将是长期被否定的人相学领域。然后是这个问题:我们的法官是否正确地使用面部信息?
所以这些之间有一点距离。我理解这来自哪里,但你知道,在某种意义上,我们非常期望嫌犯照片能预测行为,原因很简单,嫌犯照片包含很多所谓的合法风险相关信息,比如年龄和性别。因此,那张嫌犯照片中几乎肯定至少有一些信息。所以现在我认为很难回答的问题是,你知道,在多大程度上使用面部编码的这些信息是合法的?
我认为一个答案是,基本上除了我们有指示的信息之外,不应该从面部使用任何信息。我认为这是一个合理的答案,出于某种道义论的原因,出于正当程序的原因,我们应该,我们希望这些事情是盲目的,嗯,只是为了鼓励对系统的信任。我们希望这些决定不考虑外表。我认为这是一个合理的答案。嗯。
但这个问题的另一个版本是,在这个,在这个,在一个人的面部中有什么统计信息,这相当困难,或者至少我很难尝试使这个问题严谨,甚至理解它的含义。你知道,其中一个版本是,似乎很难弄清楚法官在多大程度上或以何种方式准确地使用来自一个人面部的风险相关信息,同时仍然犯下他们在判断中常犯的所有错误。
所以这有点像安娜·卡列尼娜问题的一个版本,你知道,幸福的家庭都是相似的,不幸的家庭各有各的不幸。我们说,你知道,在某些方面,更容易描述正确使用风险相关信息需要什么。更难说一个法官以非常具体的方式犯错意味着什么,也就是说,错误地使用了他们的嗯,在某种程度上使用了与风险无关的信息,同时又犯了我们知道法官常犯的所有错误。所以这只是,我认为这是一个难题,但它让我思考我们如何,甚至是否可能,在这种意义上隔离这些类型的错误,好的。
所以,我只想回顾一下。所以我想,你知道,我看待这个程序的一种方式是作为一种生成特征的方式。嗯,我认为了解所提出的方法在多大程度上优于替代方案(例如简单地要求人们或机器生成列表)会很好。区别在于我们之后不会要求他们生成机器可能通过某种算法方法找到的完全相同的东西。重点是生成一个很长的可能性列表,然后将其投入到你的回归模型或任何其他你将使用的插值模型中,然后看看会弹出什么。所以再次,嗯,这些都是可以做的事情。我,我确实相信,至少在某些情况下,这些非常简单的方法可能不会表现良好。所以我认为至少在某些情况下,它们也可能表现良好。
然后第二个是这种实质性主张,我正在反驳这种抽象层面的主张,即被告的面部本身对法官处理监禁决定至关重要。所以我对这篇论文的解读是,这在很大程度上是统计测量的人为结果,在这方面,我认为面部编码了一些预测决策的信息是真的。但似乎也很有可能,很多信息是编码和结构化的信息,或者至少没有很多证据表明情况并非如此。而且根据实验室实验,面部实际上对超出结构化信息的决策影响很小,至少如果我们看像你知道的整洁和丰满的脸,这些是论文中进行的实验。
所以,在某种意义上,我实际上对这个结果非常满意,因为它就像世界可能比我最初想象的更理智,而且法官实际上并没有,你知道,可能像我们想象的那样糟糕地做出这些决定。嗯,但它确实,我认为它至少为这篇论文增加了一些细微之处。但我想以这样的说法结束,就像作者所说,我完全相信这真的不是关于一个具体的结果,它是关于这种更普遍、更宏大的项目,即思考如何利用新的方法学进展,特别是在机器学习和人工智能领域,来推动科学发展。我非常支持那个项目,我认为那里有很多东西可以学习,而且你知道,我非常感谢这是朝着那个方向迈出的一个具体步骤,好的。
非常感谢 Sharad,嗯,如此准时。我本来想告诉你,如果你也想做第二篇论文,你刚刚嗯,我们可以超时三分钟,但你已经完成了,所以非常感谢。所以,我,我们有一些问答环节的问题,我想问大家,并提醒他们,如果你有问题,请使用问答选项或举手。所以在我嗯,向你转达问题并请人们回答问题之前,他们会做,你愿意嗯,嗯,花几分钟回答 Sharad 提出的一些旧问题吗?嗯。
是的,当然,嗯,我确定我想是的。我有点困惑的一点是,你为什么认为如果我们从另一个方向进行测量,它会小得多,因为那在论文里,我们希望找出嗯。是的,这里我们在第六列有算法,所有东西的 R 平方是 0.037。然后我们只是移除了面部特征,我们得到 0.0162。所以我们从另一个方向进行,我们包含所有东西并移除,而且我,我的意思是也许我用了这个,但我的感觉是像嗯,犯罪记录指控信息没有包含在这里,对吗?
嗯,在这个,在这个,哦,我们在这里做的是,我们在这里有完整的拘留预测。无论你如何做,那都不会改变任何事情。换一种说法,你似乎强烈认为面部与犯罪记录高度相关,因为那是你的效果可能产生的唯一方式。尽管面部与犯罪记录确实有点相关,嗯,它与犯罪记录的相关性并没有那么高。我想也许我的,所以我仍然嗯,有点困惑那个阿尔及尔拘留,所以那个包括所有东西,那是那个特征吗?
嗯,所以这个,抱歉,我们已经包含了所有内容的对照条件,是我们也包含了所有预测风险和所有,所有算法,那个“algo detain”是只包含面部的那个。所以我们控制,我们做过一些事情,你对所有东西都进行了条件设定,包括面部或移除面部。换一种说法是比较你是否从零开始添加面部,或者你从删除阶段开始所有东西。这两件事可能不同的唯一原因是如果你相信面部与所有事物高度相关。在这种情况下,是的,所以我想,我再次很可能在论文中错过了这一点,所以你知道,请指给我看。所以我,我再次建议,也许你已经做过这个,就是查看包含所有东西(包括犯罪记录指控信息所有这些东西)的预测,然后看看边际接受度是多少,绝对的共识是,主要的衡量标准绝对是 25 50,它绝对没有这样做,是的,是的,我在这篇论文中报告的主要内容没有,但我们绝对做过,好的。
我很好奇数量级是否相同,因为我想我对此感到惊讶的原因,尽管你知道这对论文来说是一种安慰,我想是,如果你看实验的操纵,看像整洁这样的东西,像面部实际特征,似乎实验室实验表明这种效果非常小。
嗯,那些是面部出现的个体特定特征,是的,即使这些特征也无法解释算法发现的很大一部分。最重要的是,这只是一个小型实验室实验,在实验室实验中获得任何两百分点的变化都相当大。看看犯罪记录实际拘留概率的百分点变化,比如范围都相对缓慢低。所以百分之二你可以让它看起来很小,或者你可以说百分之二是一个很大的变化,因为那就是,所以在某种程度上,思考你问题的最简单方式是,你相信面部特征与犯罪记录相关吗?如果它们,你关于双重编码的观点是完全正确的,如果它们与犯罪记录相关,那么如果我将面部添加到什么都没有,它会看起来非常大,因为我也在收集犯罪记录。如果不相信它与犯罪记录相关,那么我在哪里做都无关紧要,直到在这个数据中,它只与犯罪记录有一点相关性。如果我诚实地说,我对与犯罪记录的这种微小关联非常警惕,因为在我看来,那是逮捕决定中的偏见等等。所以我只是说,你知道,我不会,那在论文里,那肯定不是我会做的事情,而且我,是的,所以我当然,你知道,我也很警惕,但我也,你知道,我正在努力理解这个 50,所以摘要中的 50 对我来说似乎非常非常大。
是的,我怀疑它已经说明了,是的,是的,是的,你有理由怀疑,是的,完全正确。而且我,所以只是机械地,你知道它的计算方式,你知道如果你改变,你知道你正在显示额外 AUC 除以完整 AUC 的比率,是的,只是机械地,如果你做我建议的事情,它几乎肯定会缩小,哦,它确实缩小了,是的,是的。所以我猜,你知道,也许我们说它不是 50,而是大约 15% 左右,嗯。而且我再次不知道它是什么,我只是觉得我没有看到那个数字在报纸上很容易看到。而且我完全相信你做了,这是非常自然的事情,但我认为对我来说,这实际上在质量上改变了解释。
我会查一下确切的数字,它更接近 25,它就是你决定的那个数量级。而且我老实说,如果是 25% 的面部特征,那对我来说太疯狂了,哦,是的,是的。所以我的意思是,我们在这里争论一个奇怪的事情,那就是我,是的,我觉得那很奇怪。我,我称我为有点老派,但我确实认为数字很重要,所以我认为 50 的说法把它放在 25,是的,有点轻浮,但我确实认为这很重要。而且我认为,你知道,另一件事,我认为在某种程度上我会重新构建这篇论文,如果论文中的主张(我认为是论文中的那个)是像整洁这样的东西对决策有很大的影响,我在论文中读到过,并且在演示中听到你这样说,这在我看来没有论文中的证据支持。
现在,在最小的意义上,它甚至没有统计学意义。我想我当时试图对此很小心,我不是说所有整洁都有因果效应。我说的是谁预测了法官的行为,那是非常可预测的法官行为。
所以再次,我,我理解我们,你知道,在某些方面,我反驳这一点的原因是这类论文会立即引起很多关注。而且我,嗯,我确实认为在这个领域,在这个话题上,我们对这些表达方式异常小心是很重要的。我举个例子,种族预测法官行为,我们不能说种族是法官行为的因果关系,因为我们不能实验性地操纵种族,但这并不意味着我们对种族绝对的事实不感兴趣,但是,但是,嗯,但是严峻,如果你在实验性地操纵,不不不,在一个有真实的小型实验室实验中,但仅仅因为人们想在论文中看到一些因果关系,就像,你将如何在世界上实验性地循环它,丰满的脸,是的,嗯,你知道,你知道,让我吃,你可以让我吃所有我想要的东西,就是这样,就是这样,完全正确,就是这样,就是这样。嗯,不,但我再次,我只想重申,我确实认为这个更大的项目非常重要,是我一直在思考很多的一个项目,就是我们如何利用机器学习来推动,你知道,科学革命。而且我,我认为这确实是我希望更多人做的事情,而且世界发展非常快,所以我很欣赏这两篇论文,它们处于这个更大项目的最前沿,我知道会有更多人承担这个项目。
好的,这是我们网络研讨会中很长很长一段时间以来最好的一次讨论,有时非常感谢 Daniel 和 Sharad。但因为我们基本上已经快要,嗯,超出网络研讨会的官方时间了,哦,让我简单地,嗯,告诉大家,嗯,下周我们,嗯,将邀请 Antoinette Shore,她将告诉我们关于我们的加密货币差异,我们希望在那里见到大家。我想感谢所有加入我们的人,特别是 Sandy launcher out,并给他们所有人一个虚拟的掌声。所以现在我们,嗯,将停止录音,并且,嗯,我们还将把所有剩余的参与者升级为小组成员身份,我们希望你们能和我们多待几分钟,或者在问答环节和举手的人那里有无数个问题,我也有问题,Marcus 也有问题,所以,嗯,所以我们非常希望其他人也能加入我们,非常感谢 San Diego 和 Sharad 的精彩讨论。