📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

AI Ethics in Finance, with FICO | CXOTalk #859

CXOTalk56:17

Transcription

迈克尔·克里格斯曼:欢迎来到 CXOTalk,第 859 集。我是迈克尔·克里格斯曼,我们正在与 FICO 的首席分析官斯科特·佐尔迪博士讨论人工智能伦理。您可能听说过 FICO 信用评分,它被广泛使用。就是他们。斯科特在领导数据科学和人工智能研究方面拥有深厚的经验。他拥有超过 130 项专利,正在申请或已获批准,这是他第二次出现在 CXOTalk 上。

斯科特·佐尔迪:我在 FICO 的职责之一是从人工智能、机器学习和分析的角度推动我们的战略,以及我们如何为客户开发模型、产品和解决方案。我所做的一部分工作是专注于从人工智能和机器学习的角度来看,我们需要做什么才能满足当今的需求。

迈克尔·克里格斯曼:让我们了解一下人工智能在金融服务中的应用。然后我们可以深入探讨这些非常具有挑战性的伦理问题等等。

斯科特·佐尔迪:金融服务公司使用人工智能已经很长时间了。事实上,在 FICO,我们早在 1992 年就通过推出 Falcon 开始了人工智能和机器学习的历程,Falcon 是一个领先的欺诈解决方案,并且至今仍然是。它会查看流式交易数据和支付数据,并确定与交易相关的欺诈概率。从 1992 年至今,我们看到人工智能和机器学习在企业中的应用越来越广泛,这主要得益于更广泛的人工智能和机器学习可访问性、更多样化的数据源以及数据日益普及的数字革命。人们正在寻求使用人工智能和机器学习作为工具来理解这一切。

迈克尔·克里格斯曼:人工智能主要用于提高效率,还是支持更根本或更具变革性的变化?

斯科特·佐尔迪:我们的许多客户仍在推动更具变革性的方面。举个例子,许多人正在寻求通过引入新型数据来改善金融普惠,例如开放金融数据。他们正在寻找今天不具备的能力。他们希望引入不同类型的数据并使用机器学习来整合这些数据,以提高检测能力,接触更多客户,并在业务中更有效。当然,随着生成式人工智能的出现,人们也在寻求提高效率的方法,以提高内部员工的效率。但我仍然看到更多的是变革方面。对许多人来说,能够使用分析型人工智能平台并使用人工智能和机器学习模型做出决策的概念,是重新思考如何解决这些问题的游戏规则改变者。

迈克尔·克里格斯曼:您发表了一个有趣的评论。您将生成式人工智能的使用描述为更多地侧重于效率方面。您基本上是这样看的吗?

斯科特·佐尔迪:我认为这与我们今天的话题有关,因为对于生成式人工智能的控制以及您是否能够解释或解读它,其控制程度要少得多。存在伦理方面的担忧。生成式人工智能被视为一种强大的工具——它确实如此。但它目前通常在内部使用,因此您拥有更多的检查和控制。您有人工参与。如果它有价值,他们就会使用它。如果它没有价值,他们就不会使用它。这与人工智能更具变革性的方面形成对比,后者直接影响人们的决策。这就是传统人工智能在伦理和责任方面受到更高程度审查的地方。所以,我认为这是一个生命周期。最终,生成式人工智能或下一代变体将达到那个阶段,但它们今天还没有。

迈克尔·克里格斯曼:当我们谈论金融服务中的人工智能伦理或负责任的人工智能时,您能描述一下广泛的问题吗?这些问题是什么,为什么如此具有挑战性?

斯科特·佐尔迪:人们为什么想使用人工智能和机器学习?人们之所以想使用它们,是因为您可以引入大量分散的数字数据,并让机器找出人类无法理解的数据中的关系。您可以要求该机器学习模型,或对其进行训练,以生成一个分数。您将所有巨大的复杂性打包起来,按下一个按钮,它就会创建一个机器学习模型,如果您对其进行测试,它就能很好地预测谁会拖欠贷款或谁会进行欺诈。挑战在于,几乎所有的机器学习模型都无法解释。这意味着,即使模型能够完成任务,能够向某人解释它是如何做出该决定的,在许多类型的机器学习模型中也非常困难,有时甚至是不可能的。我们面临的最大挑战之一是,我们知道这些是强大的工具,但根据您选择的算法类型,您将无法解释它。您可能无法证明它没有偏见,除非进行大量的后续测试。这就是挑战:我们有能力实现这种转变,但我们希望负责任地、谨慎地进行。对我们 FICO 而言,以及对许多专注于负责任人工智能的人来说,这意味着围绕流程进行非常具体的对话,同时也围绕算法选择进行对话。有一些指导方针,例如,“您应该使用这个,”和,“您不能使用那个,”就算法的正确类型而言。这使得解释技术正在学习的内容变得更容易,并确保其使用安全。

迈克尔·克里格斯曼:根本问题是机器学习和人工智能如何做出决策的黑箱性质吗?

斯科特·佐尔迪:正确。许多组织会查看可解释的人工智能并说,“哦,好吧,我们将在上面应用 Shapley 方法,一切都会好起来的。”从解释结果的角度来看,这在世界许多地方都无法满足监管审查。所以我们有黑箱性质。坦率地说,我们也有需要深入研究的人。我们将如何获得这种可解释性水平?当涉及到机器学习做出高风险或高风险决策时,现有方法是否足够?

迈克尔·克里格斯曼:所以您有黑箱方面,我们肯定需要进一步讨论这一点。但您也有关于数据的问题,因为即使那个黑箱完全可解释,如果源数据有问题,那么您就会在结果中内置固有的偏见。

斯科特·佐尔迪:这是一个非常有趣的事情,很多人不花时间去关注。我觉得有点疯狂的是,我们可以将数据加载到云端计算中,运行一个 Python 算法或一个笔记本,并在一个小时内生成一个模型,然后说,“是的,这只花了我们几个小时。让我们部署它。”我们还没有经过任何必要的步骤来真正研究这些数据,并确保它是平衡的,我们对我们将要使用这个模型来做决策的个人有适当的代表性。此外,数据是肮脏的。人们谈论数据是一种资产,但我认为数据是一种负债。我们应该对我们收集的数据持非常怀疑的态度。这包括:我们有正确的数据吗?它是否代表了我们试图评分的每个人?从伦理或偏见的角度来看,它是平衡的吗?然后,人们不太关注的一点是:我是否有正确的结果数据?有很多例子表明,人们在收集数据的方式上并不谨慎。他们实际上没有正确的标签或正确的结果。所以即使他们训练了模型,它从一开始就已经有点脏了。正如您所说,如果您不花时间在前期真正审视这些数据并做出一些艰难的决定,那么您的模型在下游有多好并不重要;您已经污染了汤。

迈克尔·克里格斯曼:我们收到了一些来自 Twitter 的评论和问题。所以让我们切换到那里。第一个问题来自 Arsalan Khan,他说,“人工智能能确定什么是合乎道德的,什么是合乎道德的吗?”这本身就是一个有趣的问题:什么是合乎道德的,什么是合乎道德的?谁来决定什么是什么?一个人追求利润的态度会不会妨碍道德和伦理?

斯科特·佐尔迪:人工智能既不好也不坏。它只是一个算法。它在寻找解决问题的方法。这就是需要有人参与的地方。如果我要求人工智能模型完成一项任务,它可能会发现性别、种族、民族或国籍之间的差异,并利用这些差异来构建一个更好的模型。更好的预测并不意味着它是对还是错。这意味着人类需要去做出什么是对什么是错的决定,这让我想到那个问题的第二部分,关于追求利润以及许多构建人工智能的人都在企业中,并且他们想追求利润。这就是我们需要制定模型开发标准、伦理标准的地方。我们不希望在构建模型并决定该决策可能影响利润之后才做出关于道德使用的决定。我们必须提前定义所有这些。那些没有道德困境的公司,当他们审视人工智能学到的东西时,就是那些简单地说,“这就是我们构建道德人工智能模型的意义。我们将进行这些测试。如果这些测试被违反,我们将不允许使用人工智能学到的那些关系,直到我们达到那个标准。”

迈克尔·克里格斯曼:您能更具体一点吗?当您谈论公司指南和道德准则时,您能举一些具体的例子吗?

斯科特·佐尔迪:例如,在 FICO,我们有模型开发标准。它强调负责任人工智能的四个主要原则:健壮的人工智能、可解释的人工智能、道德的人工智能和可审计的人工智能。作为其中的一部分,科学家可以使用特定的算法,并且他们需要执行特定的程序和任务。我们将所有这些都保存在区块链上。我们在开始模型开发之前就设定了这些要求。我们确切地知道构建一个道德模型意味着什么。我们知道成功的标准是什么。在模型开发过程中,我们经历了这些步骤,我们有开发人员、测试人员和验证人员来验证我们是否沿着正确的道路走了。如果我们没有,模型就不会发布。所有这些区块链上的模型开发标准都必须满足;否则,我们就不会发布模型。至于谁来定义它,我将从技术角度来定义它。我们的法律团队成员会审查一些潜在特征,例如——基本上是人工智能中已学到的那些关系——以便他们可以从法律角度来看待它。我们有产品人员可以审视它。其中一部分就是写下审查模型意味着什么。字面意思就是写下来。当您构建您关心道德的模型时,您将查看进入模型的每个变量。此外,您将查看该模型学到的每种关系,并测试它是否符合道德。

迈克尔·克里格斯曼:如果一个组织没有这些标准,会产生什么后果?

斯科特·佐尔迪:主要后果之一是模型可能在未经充分测试的情况下进入市场。这种急于发布模型意味着问题将在部署后被发现。我认为这是最糟糕的事情。您将责任推给生产中的测试人员,这意味着模型可能在一段时间内对一个群体存在偏见或不道德。那么这意味着什么?这当然意味着受该模型影响的人会非常不满意。他们也应该如此。这是组织真正需要不惜一切代价避免的事情。

迈克尔·克里格斯曼:最终,如果做出错误的决定,会对消费者产生实际影响。这些是金融系统试图根除的类型,例如,仅举一个例子,对社区进行红线划分。如果处理不当,您可能会大大倒退。

斯科特·佐尔迪:例如,在 FICO,我强调我们可能会产生数十亿个分数。每个分数都可能对个人生活产生影响,无论是积极的还是不太积极的。这是严肃的业务。这就是为什么需要这些流程。我们还必须认识到,并非每个人都适合成为伦理学家。那些在算法和数据方面非常出色的数据科学家可能需要组织中其他人在道德方面提供帮助。我们不能把这个责任推给他们。那些真正认真地希望有效利用人工智能来推动变革,同时也要负责任和安全地进行的公司,认识到这需要一个组织,而不仅仅是数据科学组织来定义。我们必须配备合适的人员和工具,因为这并不容易。我们有专门的算法。我们对模型和潜在特征进行了广泛的审查。事实上,我拥有能够解释结果的新技术,这非常复杂。要做好这件事并确保安全,其复杂性是巨大的。这就是为什么我们需要这个流程。这是一项团队运动。

迈克尔·克里格斯曼:人们正在 Twitter 和 LinkedIn 上提问。请继续提问。我们将在稍后回答您的问题。斯科特,您早些时候评论了技术。您没有这样说,但您暗示技术本身是,我们姑且称之为,价值中立的,意味着它只是技术。对我来说,这很可怕。当然,您说的是真的,但也很可怕,因为这意味着那些开发和实践技术的人,如果他们对伦理维度不敏感,您真的可能会在结果方面遇到严重的问题。这些人可能是非常合乎道德和道德的人,但他们只是没有考虑到技术对真实的人、个人以及他们的信用和财务生活的影响。

斯科特·佐尔迪:人工智能是惊人的。它所能做的超乎常人。有时我们会过度夸大,赋予它神一般的属性(小写“g”)。但它不是。它只是一个算法;它只是一堆数学。挑战在于,我们有时会关注错误的事情。我以前曾就成功标准进行过这些对话。我们经常会说,“好吧,成功标准是性能最高的模型。”那么,这就是成功标准吗?也许成功标准是我们不会对性别、种族、民族、国籍或其他一些特征存在偏见,而预测将排在第二位。也许这是我们的第二优先事项。仅仅是这个概念——人们不谈论它。也许会是,“我们不想伤害人们,”而我们必须定义什么是伤害。我们需要改变叙事。当我们训练数据科学家时,我们只训练他们关于性能。高管们可能会看到这个高性能的模型,这很棒。我们有一个非常聪明的人开发了它,我们信任她。但同时,当您从模型开发者一路向下到部署它的人时,您离模型是如何构建的就越来越远了。所以我们变得麻木不仁。我们变得麻木不仁,因为机器很强大,人们信任机器,而也许这种信任并没有得到应有的信任。

迈克尔·克里格斯曼:我也觉得特别有趣的是,人类都有自己的偏见。我喜欢红色,您喜欢蓝色,等等。然而,我们正在努力生产不带偏见的技术系统。我们试图根除偏见。这似乎是一项基本的人类、智力、精神和情感上的挑战。

斯科特·佐尔迪:例如,我们制定的标准有时会涉及辩论。我告诉您,我们对此进行了广泛的研究,并且将继续研究。这确实是我们业务的核心。您可以拥有一个非常有偏见的数据集,运行一个模型,并且实际上得到一个无偏见模型。这并不是说偏见的结果总是导致有偏见模型,但通常确实如此。这真的取决于模型在数据中抓住什么。这就是我们使用一种称为可解释神经网络的技术的地方。我们实际上有一个模型架构,可以解释每个潜在特征,并且我们将这些潜在特征做得非常简单。每个潜在特征只有两个连接,这与其他类型技术截然不同。这允许您做的是,我可以提取这种关系。也许是收集事件次数大于 500 美元与抵押贷款总额之间的关系。然后我们可以对此进行研究。我们可以与一个研究这种关系的团队一起审视它。我们可以从统计上对其进行测试,以查看不同人群之间是否存在差异,然后进行辩论。我认为这是一场人类的辩论,因为没有人对什么是合乎道德的,什么是不合乎道德的拥有完全的控制权。这是过程的一部分。我们必须有人工参与,并且我们必须进行这些讨论。这就是我们变得更好的方式。我们可能会说这个没问题,然后也许一年后我们会决定我们改变了主意,这没关系,只要我们澄清它并继续成长和改变我们的观点。

迈克尔·克里格斯曼:问题是,您谈论“人工参与”。是哪个“人工”?他们的议程是什么?有多少人的主要业务目标是赚钱?道德方面……我本来想说“道德方面见鬼去吧”,但我们甚至不走那么极端。所以这是另一个方面:清除所谓的警察的议程。

斯科特·佐尔迪:您不能将自己与道德和公司文化分开。这是每个人都需要关注的事情之一。如果一家公司似乎没有道德官,没有负责任的人工智能职能,并且不谈论它,那么这可能是一个令人担忧的问题。这与那些将大量权力和利益置于负责任人工智能概念中的公司形成对比,并赋予他们在最初进行对话的投票权和权力。标准将反映文化。如果文化不是一种与利润并重关注安全和负责任使用的文化,那么这可能是一家您不一定想与之互动的公司。

迈克尔·克里格斯曼:如果您正在收听,现在是订阅 CXOTalk 时事通讯的绝佳时机,以便我们能让您及时了解即将播出的节目。只需访问 CXOTalk.com 并订阅。我们正在计划一个关于人工智能伦理的整个系列,所以如果您对此感兴趣,请订阅我们的时事通讯。好了。让我们转到 Twitter。Chris Peterson 一直很有耐心。他有一个问题:他问的是关于 FICO,但我们不想窥探您的专有信息。所以,要么以 FICO 的方式谈论,要么更普遍地谈论。他说,“生成式人工智能倾向于关注无监督学习。FICO 是否使用实际的贷款决策来将输入数据转化为更具监督性的学习模型?”

斯科特·佐尔迪:许多这些生成式人工智能技术都是有监督的。构建这些基础模型之一是一个无监督的过程。然后,当人们想要开发基于任务的、大型语言或生成式人工智能结果时,您就会专注于强化学习。对我们来说,今天我们有一种叫做负责任的生成式人工智能的东西。这意味着我们花费了大量时间来处理您之前讨论过的内容:首先进入模型的数据是否正确?对于这些生成模型,这涉及到删除海量数据。当我回答金融普惠决策问题时,我不需要了解莎士比亚。我们有一个完整的战略,花费大量时间来整理我们所在领域的特定数据。然后我们进行基于任务的模型工作,其中,关于问题,当我们从无监督模型(这将是我们开发的基础模型,您称之为我们在内部开发的专注语言模型)转变为这些基于任务的模型时,这将涉及监督方面。这涉及到查看决策的好坏。此外,我们进行第三步,即基于风险的评分,这将说明,“好吧,即使所有这些工作都完成了,我们仍然需要这个风险评分,无论我们是否认为输出是安全的,并且具有高置信度。”话虽如此,今天我们的重点领域不是使用这些技术来做出贷款决策。技术还没有达到那个阶段,我认为我们的许多客户也有同感。但这并不意味着我们不努力看看这项技术能走多远,或者也许能开发出一种技术,最终可以更安全地用于这些基于风险的决策。

迈克尔·克里格斯曼:所以当您说这项技术没有用于贷款决策时,您创建了 FICO 信用评分,然后个人或其他系统、其他公司将其纳入其贷款决策中。但您说 FICO 并没有做出贷款决策或推荐贷款决策,是吗?

斯科特·佐尔迪:我们当然没有做出这些决定。我们使用传统人工智能,而不是生成式人工智能,来发现数据中的新关系并结合新的数据源。这些模型的部署使用了透明、可解释的技术,因此非常安全。然后,这些分数被用于其他流程,每个贷款机构都决定如何将该分数与其他信息结合使用。我们非常重视可解释模型。一个例子是可解释神经网络,我非常关注它。我们还在传统的记分卡技术中具有可解释性,这是我们用于 FICO 分数的一些技术。对我们来说,这意味着我们对驱动分数的因素和变量绝对确定。我们可以确保我们有这种检查水平,并且在我们的伦理审查中也通过了对驱动这些分数的因素的审查。我们对此满意吗?

迈克尔·克里格斯曼:这是来自 Greg Walters 的问题,这是一个非常广泛的问题。他说,“您如何看待美国在全球人工智能创新和进步方面的领导作用,尤其是在伦理、监管等方面? Whose ethics gets used as training?”再次,他的问题中有许多不同的方面。

斯科特·佐尔迪:我从 2016 年开始推动负责任人工智能的概念。我们在美国看到了很多关注,人们关注人工智能的负责任使用。我谈论了可解释神经网络、监控必要性以及机器学习的使用等概念,以及对信用风险等高风险决策至关重要的其他概念——许多人真正有兴趣恰当使用这些技术的场合。所以我认为美国将继续在这个领域处于领先地位,因为我们的许多组织都希望负责任地使用这项技术。他们希望看看哪些算法是正确的,进行有针对性的教育。他们还放眼海外,关注欧盟人工智能法案等事物,该法案对人工智能的使用施加了限制。我与之交谈的行业人士非常关注这个概念:如果他们作为一个行业团体聚集在一起并制定最佳实践,那么他们就可以继续使用人工智能,但要负责任地使用。我普遍认为,我们将继续在美国的这种思想领导力。我们当然有一些最聪明的人才在这里。无论监管方面发生什么,人们都会继续认识到,以负责任和合乎道德的方式使用人工智能会带来丰厚的回报,无论是在公司的成功方面还是在客户对您品牌的信任方面,这都不可低估。

迈克尔·克里格斯曼:Greg Walters 还在他的问题中问道,“ Whose ethics gets used in the training?”我认为这与 Arsalan Khan 之前提出的问题有关。那么, Whose ethics gets used in the training?

斯科特·佐尔迪:每个公司都有自己的道德标准。这归结为模型开发标准或伦理委员会。例如,当我们开发模型时,我们会了解我们必须关注的监管问题。此外,我们将强调我们如何整合不同类型的供应商关系的标准的。在某种意义上,这归结为伦理委员会和模型开发标准,例如,它会指出,“在这些已学的潜在特征中,受保护的类别之间不能有超过 1% 的差异,”或不同个体群体。这是一个标准,它说,“即使我们可能会在预测方面损失一点点,我们也希望在不同类别之间的差异方面保持这个标准水平。”然而,很少发生的是,人们没有积极地提取这些已学的关系并对其进行测试。这就是我们所做的。我们提取每个潜在特征,并测试它们在我们要监控的伦理方面的群体之间的差异。我设定了一个数学约束,表示它通过或不通过。如果不通过,它将被排除在模型开发之外,我们对此表示尊重。这是一个普遍存在的问题。它又回到了问题本身。我们有很多监管需要处理。通常,监管并没有规定什么是合乎道德的。这是每个组织的工作。如果它没有被定义或写下来,那就是一个问题,因为它没有得到统一的应用。短期来看,我认为这取决于每个组织。如果有一个概念是群体想要走到一起并作为一个群体来定义,那是另一种很好的方法。但在大多数监管中,并没有定义何时合乎道德,何时不合乎道德。

迈克尔·克里格斯曼:Arsalan Khan 又回来了,他独立地说——他问的是我们刚才从 LinkedIn 收到的问题——他说,“如果每个组织都有自己的公司指南,那会不会导致每个组织都有自己的道德解释版本?这难道不是联邦/行业范围指南的理由吗?”

斯科特·佐尔迪:在标准方面,您可能会有好、坏,甚至可能有些丑陋。我更倾向于 ISAC,即行业团体,共同合作并定义它。问题在于:我们用人工智能解决某些类型的模型和问题,我们必须高度关注伦理,而我们使用人工智能的其他类型的事情可能不太担心。也许它实际上并没有影响到人们。这是人工智能的不同用途。一套广泛的法规可能会带来问题。如果这些标准存在很大差异,这可能是一个最终结果。但我希望组织能够趋同于最佳实践。我可以告诉您,有首席执行官和其他人联系我,询问 FICO 的标准,他们会分享他们的标准,我们互相学习。所以这正在有机地发生。我真的希望它能这样继续下去,这样政府就不需要介入并规定,因为他们可能没有充分理解每个行业的需要。这可能会有害。

迈克尔·克里格斯曼:我们的一位上议院议员曾作为嘉宾出现在 CXOTalk 上。他写了一本关于算法公平和偏见的书。他提出的一个观点呼应了您刚才所说的,那就是您需要关注人工智能的应用,因为有些问题需要更大的审查和潜在的监管,而有些则不需要。他正处于帮助、支持和推广监管的职位。所以他也呼应了您刚才所说的。

斯科特·佐尔迪:如果您看看,例如,欧盟人工智能法案,您就有高风险和极高风险的人工智能。这是组织现在真正应该认真考虑的另一件事:这些应用有哪些类型?伦理委员会的首要任务是确定哪些应用风险更高、影响更大,哪些风险较低。这绝对会改变算法方面的考虑。

迈克尔·克里格斯曼:Arsalan Khan 又回来了。他问的问题很棒,他说,“我们应该收集哪些尚未收集的数据来使人工智能更合乎道德?”顺便说一句,我甚至不知道“使人工智能更合乎道德”是什么意思。

斯科特·佐尔迪:我们应该始终努力确保我们能够从人工智能的角度进行所需的测试。我们面临行业方面的挑战:当我们开发模型时,我们通常没有,或者可能没有,关于这个人是谁、他们的种族或性别的好信息。我们以“色盲”的视角开发模型。所以,对于许多模型,您没有所有这些信息,并且有一些其他功能可以在事后进行测试——如果发生测试的话。因此,应该考虑如何进行这些验证,或者提供可用的数据集,以更有效地测试这些假设。这是其中一个方面。除此之外,我非常喜欢可解释的机器学习。我认为我们需要摆脱那些拥有数十亿个权重的庞大黑箱的神秘感,转而使用那些可能只有 70 个权重就能产生类似结果的实用模型,但我们拥有完全的理解和控制。今天,这是最好的途径之一,因为我们并不总是能获得所有这些额外数据。但我确实认为,思考如何安全地共享受保护类别的信息,并以所有模型开发者都能获得的方式进行,将使更多人能够将其作为常规开发过程的一部分来研究。

迈克尔·克里格斯曼:您能举一个您所说的例子吗?您将如何收集这类数据以便以积极的方式使用它,同时避免过去出现的问题,而这正是受保护数据受到保护且通常不被收集的原因?

斯科特·佐尔迪:您可以拥有一套信息,您可以在其上开发模型,并且仅在受保护的区域内,在您进行模型开发时,您才能访问,比如说,用于测试目的的受保护类别信息?所以这几乎就像一次盲目验证。“嘿,是的,这很有效。”或者,“如果,比如说,我浮现出 20 个潜在特征,我需要测试它们是否显示出受保护类别之间的任何差异,我加载这些信息,允许算法附加,比如说,种族和性别以及其他项目,然后只为我生成指标。”我实际上永远无法从 GUI 的角度访问,比如说,那些敏感信息,但我们开发的算法可以访问它来生成我的指标,但不能用于我操纵我的模型或暴露这些信息。这解决了诸如“conclaves”和其他受保护区域的概念,模型可以获取这些信息来生成指标,但不能用于泄露这些信息。因此,您继续保护个人身份信息和隐私。

迈克尔·克里格斯曼:您所谈论的内容存在巨大的风险,因为问题在于,良好的意图可能会被怀有良好意图的坏人所稀释。

斯科特·佐尔迪:当然有。这就是为什么我谈论像这样的“conclave”,在那里开发人员实际上无法访问,并且必须有一些函数以安全且受监控的方式来完成。

迈克尔·克里格斯曼:您能带我们了解一下开发内置道德人工智能框架的产品的生命周期吗?

斯科特·佐尔迪:我们有模型开发标准。该标准规定了我们正在开发哪种类型的模型,以及对于该类型的模型,从分析伦理的角度来看有哪些要求。我们如何定义可接受的数据,并确保我们拥有来自不同群体视角的正确数据覆盖范围?我们如何定义我们试图预测的结果?我们如何收集足够的结果数据?它是正确的结果数据吗?我们是否验证了该结果数据?从那里,我们规定了您可以使用哪些算法。所以,对我们来说,它是可解释的机器学习技术,我们确保我们能够解释每个已学的潜在特征。从那里,该过程说,“太好了,对于您从模型开发中提取的每个潜在特征,您去确保数据科学家相信它是合乎道德的,这取决于他们可以进行的测试和检查。”然后您将其带到一个更大的委员会,其中包含数据科学家以外的人员来做出这些判断。基于此,您允许或不允许某些潜在特征,这意味着您必须再次进入您的算法并说,“嘿,我们不允许再使用这种关系了,”然后您一遍又一遍地重复这个过程。所以,您使用机器学习作为工具,而不是解决方案,来浮现这些潜在特征,直到您识别出暴露了所有这些您可以解释和解读的潜在特征的模型。此外,您已经就这种关系及其影响进行了伦理讨论,并且您对其进行了测试,以证明它是合乎道德的或不是。在那一点上,您就可以继续展示该模型在部署方面的外观。此外,您将进行哪些监控?这些潜在特征中的每一个都有监控要求,因此,如果事情开始偏离我们开发它的假设,并且我们已经证明它是合乎道德的,我们就必须重新审视它。这就是真正深入到黑箱中间的生命周期。我的意思是,对我们来说,它不再是黑箱了。它是一个白箱,我们主动允许或不允许已学的关系。这就是我们所说的,作为道德过程的一部分:我们不会自动运行。

迈克尔·克里格斯曼:在我看来,您刚才描述的目标之间存在固有的紧张关系,一方面是这些目标,另一方面是商业人士试图“轻轻地操纵天平”的诱惑,因为他们想要特定的结果,而他们不希望数据科学家告诉他们,“嘿,你知道,你不能这样做。”他们说,“不,不,这就是我们需要做的。”那么您如何管理这种固有的紧张关系呢?

斯科特·佐尔迪:同样,这是文化。但除了文化之外,它是一个建立在标准之上的模型。这就是我使用区块链的原因之一。假设您是那个想操纵天平的商业人士,而我是那个想坚持我认为适用的事情的数据科学家。在我们开始构建之前,我们会达成一致。我们会说,“好吧,成功标准是违约检测率提高 15%。”好的,我们同意了。然后我们会说,“嘿,我们说,潜在特征对待一个群体与另一个群体之间的差异不能超过 2%。我们同意吗?”“是的,我们同意。”好的,这已经记录在区块链上了。在那一点上,我们无法将其从区块链上移除。我们事先就达成了协议。现在,在过程的后期,如果我的一个潜在特征,比如说,性能非常好,为我们赚了很多钱,但它违反了这一点——比如说,非裔美国黑人和白种人之间的差异是 3%——那么您就没有机会说,“听着,这太诱人了,”因为我们事先就同意了我们的标准。在那一点上,我们将不得不将其移除。这涉及到审计性和区块链等事物。我们使用它来追究人们的责任。所以,如果我们事先同意了标准,它就符合我们两人都受雇的公司中的公司标准。后来,我们就没有权利了。这将是明显违反我们已经建立的原则。那么我们就不会有“来吧,斯科特,就看在这个份上吧”,为了公司或为了利润。但最终,尽管这是一个真正的担忧,我在实践中也看到,道德可以与极其高性能的模型相结合。如果我发现一些可疑的东西并禁止它,人工智能就会找到另一种关系,它可能同样好,甚至更好,并且没有道德上的担忧。所以很多时候并不是,“哦,我们的模型盈利能力差了很多,但它合乎道德。”更多的是,“嘿,我们的利润差不多,而这个模型我们可以感到满意。”这就是每个人都应该追求的。

迈克尔·克里格斯曼:所以您使用区块链作为一种不可磨灭的墨水,可以说。

斯科特·佐尔迪:它是一种执行工具。它是标准的执行工具。这就是为什么我将其称为公司事务。这是每个人都需要事先同意的事情,但大多数人都会同意。这就是我们坦率地说,从“不做坏事”的口号,到“我们将不展示坏事,也不证明坏事”的转变。它是不可磨灭的墨水。它是不可变的。采取这种方法的组织会激发极大的信心,因为它们在追究自己的责任。它们不一定需要监管机构来追究它们的责任。您不一定需要客户来追究您的责任——它们在追究自己的责任。坦率地说,再次强调,通常会有一个皆大欢喜的结果,您可以两者兼顾。您可以实现业务目标,也可以负责任地实现。您只需要做到这一点——对话的早期部分——您必须将其列为最重要的成功标准之一,而不是事后才考虑的事情,而这在一些地方经常发生。

迈克尔·克里格斯曼:Lisbeth Shaw 有一个问题,我认为您刚刚回答了,那就是,“您如何平衡利润动机与人工智能决策的道德使用?”

斯科特·佐尔迪:我们事先从公司角度确定了双方的期望。我们使用区块链的一个美妙之处在于,字面上说,除非满足所有预先同意的成功因素,否则模型就无法发布。所以,如果它们没有满足,您就得回到原点。这可能意味着我们将不得不接受较低的利润,因为我们不想不道德或对此感到不适。所以有一个文化维度,您已经暗示了。

迈克尔·克里格斯曼:Arsalan Khan 又回来了,他说,“人工智能会改变文化,还是文化会改变人工智能?有什么建议吗?”

斯科特·佐尔迪:我认为文化会改变人工智能,我当然希望如此。我的建议坦率地说,我们需要确保人类参与其中。我最大的恐惧之一是,我们对生成式人工智能和大型语言模型等事物过于着迷,以至于我们赋予它们比它们应得的更多的可信度。为了我们作为地球上人类的福祉,我们需要主张我们的控制权,并与人工智能合作作为一种工具。我认为这可能是如何两者和平共处、盈利、富有成效,以及解决世界上一些最大挑战的正确结果,除了利润之外——例如安全、健康和繁荣,这些是我们人类关心的事情。

迈克尔·克里格斯曼:Greg Walters 在 LinkedIn 上又回来了,他说,“区块链是一个伟大的实现。非常有趣。”他想知道这是否是人工智能行业的培训标准,或者是否有其他人使用区块链来实现您所描述的这种目的?

斯科特·佐尔迪:使用区块链的人并不多。有人在跟踪模型开发;他们有检查点。有人试图通过数据库结构来实现它。但我看到越来越多的人对区块链在人工智能中的使用感兴趣。事实上,今年早些时候或去年有一篇文章发表,关于人工智能和区块链是确保模型合乎道德地构建的完美组合。我们对此深信不疑,以至于我们正在将其用于我们在这里开发的整个人工智能决策平台。它不仅仅是模型,而是整个决策过程。我认为我们将看到区块链在此目的上的更多采用。此外,展望未来,当我们考虑基于代理的人工智能时,区块链将有助于为这些技术提供护栏。那些推动负责任人工智能计划的公司并不都使用区块链,但它们有类似的检查和平衡概念。对我来说,最大的部分是不可变性或不可更改性的概念。我们不能改变我们在构建模型时就达成的关于什么是合乎道德的协议。如果我们能通过其他技术证明这一点,那就太好了,但对我来说,区块链一直是一个极好的工具,因为它已经为这个目的而构建。

迈克尔·克里格斯曼:如果我错了,请纠正我。在我看来,在决定以这种方式使用区块链时,您正在解决我们作为人固有的、内在的偏见——在这种情况下,是想要我们想要的偏见,并说,“好吧,我们当时并没有真正那个意思,所以我们可以改变我们最初的决定。”

斯科特·佐尔迪:在开始模型开发之前,我们应该花大量时间来定义什么是成功,价值主张和目标,这样我们就不会以一种懒惰或粗心的方式来做,并且没有经过这项练习。这就是为什么这些标准如此重要。除此之外,我还会提出另一点。人们可能听到这个并说,“嘿,这让我们不那么有创造力了。”当我将其用于所有要素时,我看到了一些伟大的事情发生。一,您遵循了标准,这对于公司有信心数据科学和开发组织正在遵循标准很重要。二,错误大大减少,因为没有 Sam 的道德观与 Sally 的不同,或者 Sam 想使用这项技术而其他人使用另一项技术,然后您要求治理团队来弄清楚,而他们对任何一项技术都不了解。因此,组织变得更有效率,审计消失了,从道德角度来看,标准得到了满足,然后,坦率地说,所有这些数据科学的创造力、研究和开发都投入到了下一步。我认为这是使团队更有效率和更有效率的好方法。研究不应该以牺牲对人类的决策为代价。研究应该以安全和受保护的方式进行,然后带入改进的流程。所以这是关于大多数组织面临的挑战:如何将人工智能投入实际应用?部分原因是这是硬技术。您必须满足所有伦理问题,所有监管问题,但您还有部署问题,以及技术方面的专业知识。这带来了巨大的好处。坦率地说,这是许多数据科学组织所缺乏的。如果他们没有这些流程和标准,他们就无法以规模化生产高质量、高度合乎道德的模型,而这正是每个组织都想追求的目标。

迈克尔·克里格斯曼:来自 Twitter 的问题:“您能重复一下——她认为——您在开头描述的五步框架吗?”

斯科特·佐尔迪:如果我记得那部分,它是关于负责任人工智能及其四个主要组成部分:健壮的人工智能,即您如何恰当地开发模型,对数据进行所有工作,确保您拥有代表性的数据,正确标记的数据,具有稳定性和健壮性测试,并且花费数周或数月,而不是数小时,来恰当地、谨慎地开发模型。这是第一点。第二是可解释的人工智能,或可解释的人工智能,但我们专注于可解释的人工智能:我理解每个已学的关系,以便您可以表达与该分数相关的理由或结果。第三是道德人工智能;这是它自己的支柱。您需要为您的组织定义它的含义。您必须制定测试和流程。第四点是可审计的人工智能,对我来说,它围绕区块链展开,并且能够以不可变的方式回溯并理解所采取的每一步,所做的每个决定,以及谁做出了这些决定。此外,向需要看到它的人开放这个区块链,让他们看到开发过程的真相,以实现完全的透明度。对我们来说,这概括了负责任人工智能的四个广泛原则。

迈克尔·克里格斯曼:最后,来自 Twitter 的另一个问题:“如果平均 CXO 任期是三年,您是否不得不与新领导层重新讨论人工智能能做什么?这应该是与低级别、基于‘易于实现的成果’,还是与大型银行一起进行?”

斯科特·佐尔迪:我建议去了解那些愿意分享其标准的组织的最佳实践,并将其作为选项之一来采纳,然后在您担任该职位期间不断发展。这是复制粘贴。关键在于制定标准并维护标准。如果您从 CXO 转移到 CXO,您可以回顾标准是什么,而无需重新开发或重新发现它。幸运的是,这方面有如此多的热情,我认为很多人都乐于,就像我一样,谈论所做的事情和最佳实践。您可以通过与您可能尊敬的行业人士交谈来获得一个起点,与您认为做得好的人交谈,并找出您可以复制的内容。

迈克尔·克里格斯曼:在最后一刻,Arsalan Khan 又回来了:“我们是否应该为人工智能是否合乎道德设定 CMMI 类型的级别?”对于不知道 CMMI 的人来说,它基本上是软件开发的成熟阶段。

斯科特·佐尔迪:这肯定无害。我认为我们正处于非常早期的成熟阶段。建立这样一个评分系统在设定前期标准方面可能会非常有帮助。我经常感叹,在软件开发方面,软件的开发有非常高的标准,但在机器学习或人工智能开发方面,则不然。我喜欢这个想法。我需要再仔细考虑一下,但任何能够评级并建立成熟度的东西都将是一件好事。

迈克尔·克里格斯曼:您基本上是在谈论标准。说到这里,我们就没时间了。非常感谢 Scott Zoldi。Scott,感谢您再次来到 CXOTalk 并与我们分享您精湛的专业知识和见解。我非常感激您。

斯科特·佐尔迪:谢谢,迈克尔。

迈克尔·克里格斯曼:也感谢所有观看的观众,特别是那些提出这些精彩问题的人。你们太聪明了。在您离开之前,请订阅我们的时事通讯。访问 CXOTalk.com 查看我们即将播出的节目。我们有精彩的节目即将播出。我们正在计划一个关于人工智能伦理的整个系列,所以请告诉您的朋友和家人,并订阅我们的 YouTube 频道。下次再见。下周再见。祝大家一天愉快。保重。再见。