Transcription
欢迎来到 CXO Talk 第 856 期。我是 Michael Krigsman,我们正在探讨人工智能和数据科学,哪些有效,哪些无效,哪些会失败。我们的嘉宾是两位杰出的首席数据科学家。Satiam Priori 博士是哈里伯顿的前首席数据科学家和技术研究员,现任 Reignite Future 的首席执行官。Anthony Scrano 博士是邓白氏的前首席数据科学家,现任史汀生中心的高级研究员。
Anthony,商业领袖们不知何故认为人工智能是魔法,能够立即产生结果,而我们和用户,你知道,我们也这么认为。作为一名数据科学家,您对此有何看法?
就数据科学家而言,目前的大部分情况并没有什么新鲜事,只是我们拥有更多的计算能力和更多的数据。随之而来的是某种能够充分模仿人类行为的东西,以至于我们开始喜欢它。与它交流更容易,我们得到的答案更容易理解,它在大众中变得越来越受欢迎。从某些方面来说,这是一件好事,但同时也是一件非常危险的事情。药房里某些药物需要处方是有原因的,因为如果使用不当,就会发生坏事。情况也是如此。
人工智能和数据之间的关系如何?你知道,这是显而易见的,每个人都知道你需要数据来运行你的人工智能,但它是如何运作的?组织内部是否存在一些隐藏的问题,这些问题不一定会浮出水面,不是因为你们数据科学家试图隐藏什么,而是天知道,如果你想隐藏,你就可以。不,实际上,数据科学家什么都不隐藏。他们会讲述数据告诉他们的故事,无论他们存储了多少数据,无论是少是小还是大,无论他们想用什么术语。模型实际上会呈现一个模式,这个模式实际上会讲述一个故事,而这个故事有时会让商业领袖感到困扰,因为我说的是,许多这些领导者几十年来一直存在效率低下的问题,而数据讲述了这个故事。然后他们说,哦,不,不,不,你不能这么说。你是一名数据科学家,而不是主题专家。你怎么能这么说?但是,你知道,数据从不说谎。数据会捕捉到任何被修改或改变过的事物,它会出现在我们正在创造的故事或模式中。这就是为什么人们会说我们没有数据,我们数据太少,我们数据不好,数据质量不高。但是,如果你看看许多复杂的行业,它们已经收集了几十年的数据,那为什么它们没有使用呢?所以这是一个挑战。我们都面临着许多挑战,无论这是数据科学还是任何涉及分析的领域。你会遇到所谓的确认偏误,也就是说,我相信某事是真的,然后去数据中寻找支持我所相信的真实性的数据。如果你足够深入地查看数据,你就会找到支持你认为真实性的任何东西。因此,如果你问一群数据科学家,在不了解他们正在做的工作以及他们正在做出的假设的情况下,数据根本不在乎你的感受,它会给你一个答案。但是那些在提问之前就认为自己知道真相的人会开始反击,说那不可能是答案,你知道,去更努力地工作。如果你足够长时间地折磨数据,它就会承认你想要的任何东西。所以我们必须非常非常小心所谓的先验假设,也就是在你进入任何分析过程之前出现的假设。你必须相信你正在查看的数据能够代表你正在投射到的框架。你必须相信曾经真实的数据现在仍然真实。你甚至必须相信你拥有数据来源,你知道你从哪里获得的数据,并且你被允许使用这些数据来回答这个问题。在你按下那个人工智能按钮之前,还有很多工作要做。
我发现真正有趣的是数据所讲述的故事的概念。所以,我们可以深入探讨一下吗?Satiam,你之前说过没有什么可隐藏的,我们听到了关于数据问题,数据不足的问题,但公司却拥有如此多的数据。所以,我们可以稍微深入探讨一下这个数据所讲述的故事的概念吗?
人工智能算法应用中最常见的事情之一就是预测性维护,对吧?对于几乎所有复杂的行业,制造业、石油天然气、能源、风能,随便你选哪个,都非常重要。现在,如果你一直在收集一些数据,无论它是 30% 好还是 40% 好,无论是不完整的还是在某种程度上完整的,你都会在此基础上构建一个模型。你的算法会给你讲一个故事,对吧?它会显示一些模式,然后它们会给你讲一个故事。现在,目标是,我能否真正将这些数据转化为智能数据?也就是说,如果数据中有差距,因为你不相信数据所讲述的故事与你的想法不符,因为你认为自己是专家,那么你就告诉我们为什么会出现这种模式。如果需要更多的数据集,那么你需要收集更多的数据。如果你不能,如果你需要增强数据,然后实际上可以解释预测性维护的所有方面。而这个故事基本上是你正在处理不完整的数据,并使其变得智能,以便你能够真正利用完整的自学习模型。
想象一下在新冠疫情期间航空公司发生了什么,当时所有的飞机,所有的航班在很长一段时间内几乎都停飞了。想象一下你有一堆模型试图预测某些飞机何时需要特定类型的维护,以及何时需要订购这些东西,比如润滑脂、油、螺丝、螺母和螺栓。那些预测何时会交付这些东西的配送管理系统,没有一个在工作,因为底层行为发生了变化,而这些系统用来做出预测的纵向数据并未反映这些变化。一些聪明人不得不说,等等,我们需要一些成年人的监督。这些模型中的假设不再有效,我们不能仅仅使用这些模型来完成所有这些配送、订购、维护调度和招聘机械师的工作。所有这些都必须在新冠疫情的混乱之中重新思考。在那场混乱之中,有一艘船卡在苏伊士运河中间,这与新冠疫情无关,对吧?现在人们通过航空运输他们以前通过海运的东西,因为他们以前通过海运,所以突然之间,我们需要更多的航班,对吧?所以你必须跟上局势,你不能只是让这些事情自行发展。
背景非常重要。大多数人都忘记了。作为数据科学家,我们看到的任何数据,我们都知道,我们知道背景。但这是如何发生的?商业领袖和技术领袖如何打破这种使用错误数据并获得次优甚至无意义结果的负面循环?
我将以航空航天为例,这是一个很好的例子。当火箭即将发射时,不是一个系统决定火箭是否发射。你有多个系统在对是否应该发射火箭进行投票,而更智能的系统则使用不同的标准来得出结论。因此,你可以保护自己免受你所提出的担忧的一种方式是拥有多个系统,这些系统从不同的角度观察相同的环境,相同的决策,或者甚至从相同的角度,但使用隔离的设备等等,以确保我们不会遇到某种意外情况。你知道,那个老笑话,很久以前,你曾经有过那些广告说“十个牙医中有九个推荐……”,你知道,如果你选择对了十个,你会发现没有一个说你想要他们说的话。这并不意味着它是真的。所以,你确实需要有代表性的系统,它们正在查看大量数据,并且可能不会相互告知,这样它们就不必出错才能让你出错。
请订阅我们的新闻通讯,访问 cxo talk.com。订阅我们的 YouTube 频道。Twitter 上的 Gus Beck-Dash 说,数据科学和人工智能类似于统计学,问题可以启发或误导。这就是为什么正确的问题很重要。他说,真正的问题是,数据科学家应该做什么?第一,提出正确的问题。第二,这很有趣,处理比他们更大的政治问题。
所以,是的,我喜欢这个问题。我喜欢这个问题。嗯,我一直很难做到这一点,但这是一个如此重要的问题。所以,有两个部分,两个前提,对吧?首先,你能做什么来确保你提出正确的问题?有一个叫做命题演算的整个科学,它从……你必须相信什么?哪些东西将被视为公理化的真实,我们不会去测试?你试图测试的是什么?你认为将要使用的测试方法是什么?你有什么权利使用这种方法?这种方法内置了哪些假设?所有这些都必须发生。这门科学是的,它只是数学,但它不仅仅是任何数学。例如,我们正在谈论很多回归或监督式的东西,你可以查看过去的数据,然后构建一个方程,根据过去来预测未来。在混乱的情况下尝试使用回归方法完全是扫兴的事,因为现在未来看起来不再像过去。所以,在你这样做之前,你必须考虑这种混乱引入的弹性。所以数学指南非常重要。然后,这个政治维度就出现了。第二个前提是,你必须评估许多事情。第一,你必须评估……你知道,你可以是对的,而且绝对是对的。所以,如果非常有权势的人坚持要你得出错误的结论,那更多的是一个道德问题或伦理问题,而不是一个数据科学问题。但我们在工作中都会遇到这些事情,我敢肯定,鉴于你的工作经历,你肯定经历过很多。有很多压力要求给出所有高层想要的答案。你知道,我们必须找到方法,你失去足够的头发,你足够老,你就能找到方法说,你知道,从我的角度和我的经验来看,从我看到的情况来看,或者,你知道,它似乎是这样。这样,当他们对你不满时,他们可以不满,但他们不能对你的感受不满,因为你的感受就是你的感受。有办法传达这些信息,但如果你真的想在这里做真正的科学,你必须非常擅长倡导和伦理,否则你就会是对的,但却死了。
在我过去 20 年的实践中,不仅仅是最后一份工作,而是过去 20 年,我一直都在谈论数据讲述的故事。我相信我将数据科学定义为数据上的科学。它可以只是使用简单的统计数据,它可以是数据挖掘,它可以是机器学习算法,无论方法是什么。我的目标是为企业找出价值以及什么有效。并非所有东西都需要神经网络,也并非所有东西都可以用简单的统计数据来解决。所以我们必须看看我们正在谈论的业务问题,并根据它构建解决方案,并看看它提供了什么价值主张,无论是成本节约还是销售额增长,无论您可能使用的指标是什么。能够与领导层沟通的财务指标。我从来没有接受过领导者的指示说,这就是他们想要的答案。事实上,当我隐藏我的数据科学家时,我会告诉他们,讲述数据所讲述的故事。要有厚脸皮。领域专家应该解释为什么这个结果来自这些数据。如果他们不能解释,那么他们就需要回到原点。我们并没有告诉数据任何事情,我们只是在查看数据并告诉你它是什么。因此,是的,它确实存在政治方面。我认为政治方面在于领导层之间,他们无法就此达成一致。我认为数据科学家只能说,哦,你的结果不是我期望的。然后你解释结果是什么。
那么,说技术和数据使你能够得出某些结论,而这就是数据所讲述的故事,下一步是利用这些信息,利用这个故事的结果来做决定,这是否正确?
是的,决定是基于数据的,而决定也可能基于外部因素,比如政治。但这与数据故事本身非常不同。Satiam,这是正确的描述方式吗?
是的,如果你基于数据做出决定,那么你就有东西可以展示。但如果你说,好吧,我忽略了数据分析的结果,我们称之为“词语”,然后你想做任何你的经验所说的事情,那么可能会有,我该怎么称呼,你杯子里的石头。但是,与此同时,如果你看看挑战发生在哪里,我再举一个例子。当领导者不真正了解它是什么时。所以,想象一下来自两个不同组织的两位领导者正在处理这个问题,他们基于一组特定的数据构建了一个模型。然后模型很棒,准确率很高。但是领导者 B 说,不,不,现在用这个模型在数据集 C 上运行,结果却不出来。他们甚至没有比较数据集中的数据漂移。哦,你建立的模型没有用。但他们实际上提供了来自不同背景的完全不同的数据,即使问题相似。现在,这种数据漂移可能会导致严重的问题。然后他们会说,我的天哪,发生了什么?然后他们会放弃这个项目,而这就会成为人工智能项目失败的统计数据。然后我必须假设他们会回到数据科学家那里说,嘿,你给了我错误的数据,错误的结果。
绝对会的。他们会说,你给了我们错误的模型。这是真的。
等等,等到选举结束后的第二天,50% 的人就会这样做。
让我们转到 Twitter 的另一个问题。这是来自 Tho 的。他说,在人工智能技术日益普及的各个行业都有背景,您认为这对决策,特别是关于预测分析的影响是什么?
Anthony,预测分析和未来的决策。我们将像关注分析一样关注它,对吧?我们会因为人工智能告诉我们这样做而做决定,还是因为我们觉得应该这样做而做决定?这些东西越来越多地成为我们生活的“以太”的一部分,然后我们停止质疑它们是如何工作的,为什么它们会工作。所以我认为,展望未来,我们必须非常非常小心,我们不是在创造一代人,他们只是接受事物是如何运作的,接受它们有效,而不质疑它们是否可能是正确的。当我上第一门物理课时,计算器已经存在了,但我们必须上课,只能用计算尺上课。你知道,每个人都在抱怨,这是什么?嗯,这迫使你在脑子里思考有多少个零,小数点在哪里?答案是,4700 万的 16% 不能超过 4700 万。如今,我们冒着仅仅按一下按钮就说“好了,答案是 9300 万”的风险。你必须非常了解你在做什么以及为什么你认为它应该有效。
有一个很好的例子,Satiam 之前提到过,有两个不同版本的故事。一个发生在朝鲜战争期间,一个发生在第二次世界大战期间。战争是哪一场并不重要。一群非常聪明的人正在分析为什么飞行员被击落。你知道,这两场战争中飞行员的存活率都相当令人担忧。所以他们不知道答案是什么。所以他们开始查看所有不同的因素:飞行员的训练、任务的性质、他们拥有的额外弹药量等等。迟早,因为你不知道哪些因素很重要,有人开始查看返回的飞机上的弹孔在哪里。他们做出的结论是,在这些飞机上,在它们被击中的地方增加更多的加固。我们有这些弹孔在那里,它们在那里,在机翼上,在机翼上增加更多的加固。好吧,飞机越来越重,然后你就能携带更少的东西,飞行也更困难。最终,有人提出了一个绝妙的观察,你只看到了返回的飞机,而不是被击落的飞机。弹孔所在的地方是它们能够幸存并返回的地方。所以,让我们把武器放在弹孔不在的地方。结果是更多的人幸存下来,不是因为人工智能,不是因为分析,而是因为有人提出了一个更好的问题。我们需要训练人们像这样进行分析性思考,而不是仅仅说飞机不同部位每平方英寸有多少弹孔,然后我去密度最高的弹孔那里,因为那在数学上是可辩证的,而且绝对是错误的。你试图让人们真正思考和理解。
给很多人带来很多工作,抱歉,太糟糕了,因为这不应该容易,而且没有人真正关心它有多难。哼哼,除了那些你给他们带来额外工作的人,他们确实关心,他们喜欢它。这是关于领导力。说真的,这是关于你如何定位它,对吧?如果你只是说,看,迈克尔,我要让你做一些事情,而这比它本可以做的要难十倍,然后告诉我你什么时候完成。当然,你会讨厌它。但是,如果我是一个好领导者,如果我能帮助你理解这样做的价值,注意,我之前说的是“不得不做”,然后我改成了“必须做”。这完全取决于你如何看待这个挑战。
这是来自 Twitter 的 Aralon Con。Aralon 问了很好的问题,他说,有时管理层会利用顾问来证明他们自己的议程,例如减少全职当量(FTE)的业务流程再造。政治是人工智能有什么不同吗?
作为一名教授,我说人工智能只是一个学科,它谈论的是模仿人类智能,模仿人类智能的机器。但在营销术语中,我们使用人工智能作为一种技术。所以,我们暂时保留这个术语。但在某种意义上,是的,它不像雇佣顾问和其他人来推销他们的议程所造成的干扰那样。人工智能,人工智能的说法,人工智能是基于数据的,而数据讲述了一个故事,除非数据被人类操纵,否则数据会讲述正确的故事。事实上,我所看到的,人工智能最强大的应用是当你查看数据时,它是为了增强我们人类无法弄清楚的流程或工作流程。但是,构建算法可以帮助你弄清楚存在的差距或效率,我们可以根据它来转化业务。而这正是人工智能最强大的力量所在。从这个意义上说,它实际上是为了领导者正确而快速地使用它而受益。
我知道领导者,我敢肯定我们都认识,他们说,我对你们数据科学家、你们的博士学位、你们的专业知识、你们的知识和你们的模型非常尊敬,但你们给我的结果不是我想要的,而且不仅如此,它们是错误的。我必须做我必须做的事情。我对这样的领导者的回答是,是时候继续前进了,因为那样你的业务就无法转型。如果你真的想生活在工业 4.0 和 5.0 的时代,你不是合适的领导者。
但为什么?解释一下。看看你正在做的播客,你使用了多少不同的技术,你实际上是在提高声音质量,你的视频质量。你不可能用简单的有线耳机做到这一点。如果你真的想要高质量的播客,你想要利用技术。如果你不这样做,谁会来听你的播客?如果成熟的技术在那里,并且它已经在许多地方被证明有价值,那么是时候利用这项技术或这项技术的解决方案了,这样你就可以建立一个有弹性的、可持续的、在市场动态变化、全球市场变化以及消费者期望变化的未来时代能够生存的业务。
这个问题是我看到 Aralon Con 问过很多次,以不同的形式。他是一个经常收听节目的听众。再次,这个问题是,数据科学家产生结果,而我是商业人士,你们是错的。
首先,我也是商业人士。所以不是“我们”和“他们”,我们都在推同一块石头。所以我真的,迈克尔,如果你是我的对手,我希望和你坐在同一边。我们都是企业的一部分。但是,我先暂停一下,因为我知道你不是那个意思。我是一名武术学生。他们教你的一件事是,当你有一个比你强壮得多的对手,尤其是有武器时,如果你只是试图对抗他们,你就会断臂。你会和拿着棒球棒的人打架。你知道,这可能不像伸手拥抱那个人,然后试图与他们摔跤那么聪明。因为现在他们不能用他们的棒球棒了。所以,如果你试图通过说你错了来打败我,我可能会说,也许我是。请帮助我理解你为什么这么想。也许我错了,也许我没有像我理解的那样理解你的问题。数据是这样说的。也许我没有理解。让我们谈谈吧。有时候,如果我以谦逊的态度开始说“请帮助我理解”,即使我有点认为自己是对的,如果我以这种谦逊的态度开始,它有助于缓解你想要用棒球棒打我的倾向。它可能有助于你听我说话,也许我们可以达到一个更好的地方。顺便说一句,也许我错了,也许我没有理解问题。所以,我认为我们必须互相沟通。在这些情况下,我们不能站在桌子的两边。
Gus Beck-Dash 回来了,他说:好的,他说,Anthony 触及了一个大问题。数据科学是关于利用历史来预测和塑造未来,但过去没有什么新的。那么,数据科学是否压制了创新?他接着说,这很复杂。你们两位对此有什么看法?
某些类型的对未来的预测可以从回顾过去中获得信息,而其他一些事情则必然是颠覆性的、前所未见的或史无前例的。这并不意味着我们从过去学到的东西毫无用处,而是意味着它的用途不同。所以,我们必须能够……我们基本上是在谈论监督和无监督的方法,对吧?监督意味着你查看训练数据,你查看过去。无监督通常意味着你试图查看你正在观察的东西,并对其进行聚类和组织,使其从你所看到的、你摆在你面前的数据中出现。它并不那么简单。还有其他方法,它们似乎一只脚在其中一个阵营,另一只脚在另一个阵营。在颠覆的背景下,有一种叫做贝叶斯推理的东西非常有价值,你迈出一小步,然后观察事物,然后迈出另一小步,并不断调整你对正在发生的事情的假设。但最终,如果你想想你开车的方式,你已经学会了你多年驾驶的所有东西,而且你当然能够看着后视镜看到你身后的黄线。没有人会那样开车。你总是看着挡风玻璃,并根据你看到的东西和呈现给你的东西在当下做出决定。所以,我们需要在非常动态和不断变化的情况下,比如开车,采用类似的方法。如果我们试图在一个稳定的环境中预测股市,或者如果我们试图理解长期存在的设备的预测性维护,并且我们理解,那么请使用监督方法。这取决于你想做什么。
Aralon Con 又回来了,他说,当数据科学家过于关注数据时,他们是否会考虑数据本身可能是错误的?数据科学家在谈论人工智能推荐的好的东西之前,是否应该向高管解释这个警告?
作为一名执业数据科学家,我们总是以正确的背景来查看数据,对吧?当你以正确的背景查看数据时,它实际上会解释我们试图找出其中效率低下的现象。如果数据被着色、修改或删除,你的故事将不完整。这就是领导者需要知道的,你一直在浪费钱存储不好的数据。在所有复杂的行业中,有很多很多很多案例,数据被某个人或另一个人操纵,以适应他们想要的答案。当你对历史数据进行适当建模时,这些事情就会显现出来。
回到之前的问题,这与历史数据有关,历史数据对于学习理解过去所做的事情至关重要。没有它,我们就无法构建未来的模型。如果有人认为他们可以,那么我认为,在某种意义上,这是完全没用的。这意味着我可以构建任何合成数据并构建模型,但它可能不是正确的背景。所以,这使得……这是一个例子。我问了一个生成式人工智能系统,我说,你能为我做一个生成式人工智能的传单吗?我稍后会给你看那四张图片。现在这个词是“学习”,而不是“生成式人工智能”。它把“生成式人工智能”这个词变成了不同的形状和大小。所以,问题是,当你没有任何背景时,它只是说,这是几个字母,让我把它们放在不同的地方。所以,我们必须非常小心我们如何做到这一点。与高管的沟通实际上是你分析的结果,并向他们展示,并说,放在正确的背景下。这是我知道的背景,你解释一下为什么会发生这种情况。
迈克尔,如果我能对那个关于真相和数据的问题提供另一个答案,那么真相有几个维度。我在这方面做了很多工作,这叫做真实性判定,或者判断数据的真实性或有用性。我可以提供这些维度。第一个是关于真相,当你去法庭时,你发誓要说实话,全部的真相,以及除了真相之外的任何东西。我经常说这句话的原因是,这三者是不同的。我可以告诉你所有的真相,让你得出错误的结论,这是一种谎言。我可以告诉你全部的真相,但包含一些不真实的成分,这是另一种谎言。所以,我可以操纵你对真相的假设。另一个维度……这里只有几个。另一个维度是代表性。数据是否代表问题?例如,当你调查一群人并询问他们认为你有一个问题时,你就会遇到所谓的“无应答偏误”。你怎么证明你没有与之交谈的人或没有回答的人会像回答的人一样回答?所以你必须做一些数学计算来证明你的数据能够代表你正在研究的系统。
未受干扰是另一个维度。所以,当我们对不稳定的系统使用数学时,我们必须非常小心,尤其是在有人可能篡改了数据的情况下。有一种叫做“对抗性操纵”的东西。我不必摧毁你的系统,我只需要把牛奶弄坏,就像你的人工智能消耗的那样。
真实性。我知道这些数据是它声称的那样吗?很多时候你可以通过元数据分析来做到这一点。
然后是延迟。你知道数据有多老吗?五分钟前收集的数据不是五分钟前的数据,它是在某个时间点创建的。所以,即使数据通过了所有其他测试,它具有代表性,它是真实的,它是真实的,它可能具有所有这些……你知道,五分钟前地震死了多少人?然后你过五周再看,地震死了更多人,因为当时我们还不知道。所以延迟非常重要。所有这些维度以及更多维度对于理解数据对人工智能的真实性和有用性都很重要。如果你忽略它们,你将自担风险。
你们两位都与非常大的组织合作,拥有非常大的预算,在某些情况下,例如咨询公司,花费了数万亿美元来重新培训所有员工以理解人工智能。在多大程度上,这套数据问题普遍存在或存在于大公司内部,假设他们想要好的数据,但他们可能犯了错误?
我总是展示一张幻灯片,这是基于过去 15 年的对话,并且还在继续。许多这些组织有一个,很少有组织拥有所谓的“数据目录”。所以他们根本不知道他们到底有多少数据。所以他们会说,我有 PB 级的数据,实际上问他们在哪里,他们可能不知道。在石油和天然气行业,我们知道他们有多个数据副本,已被证明没有记录,等等。然后大多数人会说,他们的数据只有 40% 到 50% 是完整的。根据你问谁,数据质量是差的还是好的。这些都是复杂行业中数据非常知名的统计数据。但话虽如此,在过去五年里,我可以说,在过去五年里,发生了很多变化。人们已经开始学会如何收集高频数据,然后实际上分析得更快,这要归功于物联网和云等技术,这些技术现在已经有了很大的改进。所以,从这个意义上说,历史数据可能不是正确的维度,但仍然有很多东西可以学习。但同时,我认为其他相关技术正在帮助人们改变他们的行为。
我看到了你精彩的评论,我将尝试提出一个至少是聪明的评论。多年前,当我们开始谈论大数据时,我们谈论的是这些“V”:速度、多样性、价值、数量。基本上,我们现在都在谈论所有这些,只是我们不再使用这些词了。我们谈论大数据。区别在于,现在我们有了在边缘运行的设备,我们有了自动驾驶汽车,我们有了卫星,我们有了所有数据。高光谱传感器包可以生成 PB 级数据。你不能把所有这些都传回地球,你没有时间。所以你必须决定保留什么,以及你从什么推断出来。汽车也是如此。汽车,自动驾驶汽车,每个人都喜欢谈论它们,即使他们不是专家。我当然不是专家。但它们消耗的数据量是惊人的。一架无人机,仅仅是一架无人机,它可用的数据量。所有这些数据都没有被传回母舰并由母舰中的人工智能进行分析。有些数据被传回了,有些没有。在许多情况下,有相关的法律。有隐私,有数据本地化,有跨境数据传输,有物理现象。有很多原因导致数据不能都放在一个地方。所以,在大组织中,是的,它们拥有巨大的数据语料库。通常它们非常分散,并且有些孤立。有大量的法规。所以,我们作为大型组织,在任何一个时间、任何一个地方,我们并不了解组织所知道的一切。它非常分散,并且在组织中非常民主化。
现在是订阅 CXO Talk 新闻通讯的绝佳时机。只需访问 cxo talk.com。你会看到一个烦人的弹出窗口要求你订阅。这样我们就可以通知你有关直播节目,比如这个。Twitter 上有一个推特聊天正在进行,使用标签 #cxo talk。在 LinkedIn 上,将你的问题放入聊天中,我会说,你什么时候还能有机会问问题,审问任何你想问的问题?两位非常著名的科学家。所以,各位,好好利用它。
这是来自 Twitter 的 Elizabeth Shaw 的一个问题,她说:这是给 Priori 博士和 Scano 博士的问题。为什么用合成数据来增强现有数据?使用合成数据有什么影响?什么时候合成数据太多了?
合成数据是算法生成的数据,旨在看起来像具有某些方面的数据。所以,你可能会查看你拥有的所有数据,然后创建更多看起来像它的数据。生成式人工智能实际上是一个产生合成数据的庞大系统。如果你想想它,生成式人工智能正在创造东西,对吧?所以,在人类历史上,世界现在正在产生比以往任何时候都多的合成数据。但在那之上,我们还有其他类型的合成数据。例如,在工厂环境中,你可能没有足够多的测试数据来用于某个算法。你知道统计边界,上限和下限,你可以生成大量数据,这样你的算法就能工作。这没关系,这样做没什么错。你必须小心的是,你拥有的数据中的任何偏见都会在你生成的合成数据中被放大,以两种方式之一:要么你会产生更多的噪音,使异常更难看到,要么你会产生更多的奇怪,因为你的数据没有代表性,如果它是潜在的,它是所有我刚才提到的那些东西之一。所以,你应该使用……我不是反合成数据。我反对在没有足够数据且不了解现有数据的情况下,将合成数据用作拐杖。合成数据当然有其作用。正如 Anthony 刚才提到的,如果你没有足够的数据,但如果你了解某些产品、服务等的物理学、科学或行为方面,但你没有足够的数据,那么你想创造场景。我想在过去,如果你称之为情景规划,你可以利用合成数据进行那种情景规划,说如果发生了这种情况,它看起来会是这样。但这并不意味着这是正确的事情,但你现在有一个选择,你可以看到如果那种数据在现实世界中出现会发生什么。所以合成数据可以非常智能地使用,但要有限制。因为正如 Anthony 提到的,大型语言模型是现在创造合成数据最多的。如果你读到它们产生的内容,在很多情况下都没有意义,因为你提示它的方式。所以,当谈论……让我们称之为数值数据,让我们区分文本和数值数据。数值数据,在物理学或统计学原理的指导下,你可以生成和创造场景,那么它可能非常强大,并且可以减少时间。例如,我建议的一家公司正在研究一个需要查看相似对象然后区分这些对象的流程。而且不可能获得所有真实数据,因为你必须真正坐在工厂里才能获得这些数据。所以你可以生成数据,构建不同的模型,然后当你拿到真实的物体时,你可以进行比较,这些物体以非常快的速度飞过来。然后它就有帮助了,因为现在你可以看到,当它们实时出现时,我如何区分这些物体。所以你实际上已经减少了构建模型的时间,因为现在你这样想,你有一个模型,现在你正在用真实数据来完善模型。
这是来自 Aralon Con 的另一个问题,关于数据。数据何时太多或太少?谁来决定太多或太少?然后他接着说,他有点偏离了主题。他说,决定这一点的人将拥有财务决策权,对他人拥有权力。我们需要在联邦层面采取哪些保障措施来解决这个问题,但又不扼杀创新?
所以,让我们先问一下关于大数据与小数据、足够与太多、稀疏数据的技术问题。Anthony,你想加入吗?还是 Satiam?无论谁都可以。
有三种数据:你拥有的数据,你可以合理获得的,以及你知道存在但你永远无法获得的数据。所以,如果你考虑到这三个数据宇宙,在何时拥有足够数据的问题上,它开始变得非常有趣。回答这个问题的第一种方式是,当你拥有足够的数据时,数据就可以被推断出来,当你使用的算法可以用来产生答案时。有时这被称为“决定性”。所以有一个阈值,我称之为“决定性阈值”。当你拥有足够的数据来决定问题时,这并不一定意味着你拥有足够的数据来做出一个好的决定。它意味着你拥有足够的数据来做出一个决定。所以,现在想象一下你继续收集数据,在某个时候,你并没有变得更聪明。你做出的预测在一定的统计限度内是相当稳定的。这时,一般的最佳实践说,你现在可以发布你的答案,你可以现在给人们你的答案,给他们你的答案中的自由度等等。有一个“弹性”的概念。我能错到什么程度仍然能做出我正在做的决定?所以这必须包含在内。理解自由度。如果你要发射火箭,而你错了,代价非常高,人们可能会丧生。如果你……我不知道,做一些错误成本非常低的事情,比如营销,你知道,你可以尝试一下,再试一次的事情,也许可以错得更多。这些事情……但最终,有一个“过饱和”的概念,你并没有变得更聪明。还有一个“决定性”的概念,你知道,你可以做出决定,但你还没有准备好做出一个决定,你必须找到这两个之间的位置。
现在,这里的大问题是,你必须非常小心那些你正在做出决定的环境变化速度比你正在收集的数据快的情况。因为想象一下……你知道,有一个老布朗尼卡通片,飞机在坠毁,你知道,在坠毁前一刻拉动紧急刹车。没有紧急刹车,对吧?所以,如果你遇到必须做出决定的情况,因为如果你不做出决定,就会发生其他事情,那么你的决定性阈值就在那里。所以,你周围的世界可以迫使你做出一个答案。这些通常是统计方法和决策数学中的主要障碍。以及何时拥有足够数据。
我将深吸一口气,让 Satiam 说话。第二部分是关于保障措施、监督和监管。Satiam,你想快速评论一下吗?因为我们要没时间了,还有很多要谈的。
关于数据数量的问题,我的看法是,我想要最少的数据,以产生最大的产出或我的投资回报。正的价值,当然。所以我不想真的……如果我能用千兆字节的数据和更少的功能构建一个模型,我不想使用太字节的数据,但它实际上能帮助我改进工作流程、产品或服务,并给我带来显著的投资回报,这就是我在商业世界中的看法。在科学世界里,我会认为,一直关注它,直到模型达到渐近极限。
Anthony,你有什么快速评论吗?
这绝对是正确的经济观点。你知道,我想用最少的数据来获得最大的影响力。这几乎与我刚才说的相反。这两者都是正确的。我们必须为数据付费,我们必须为人们付费,我们必须为……有实际的考虑。我们不能只是四处奔跑,成为科学家,人们会让我们做任何正确的事情。有些人会说,看,我们为这些数据付费。
我们正在购买它,它正在花费我的钱,我正在看着你,伙计,对吧?嗯,所以也有那个实际的答案。这是来自 Gus Beck Das 的。当我们给牛喂食牛的残余物时,我们得到了疯牛病。在人工智能中,当人工智能的输出被用作人工智能的输入时,等效的是什么?我不确定它是人工智能输出还是任何东西,它是进入模型的数据。所以,如果你的数据不是在正确的上下文中,那么你就得不到正确的故事。就这么简单。所以,我不会深入研究所有那些嗯,那种细节,但它是你从模型中生成的任何东西,放入另一个模型,它会拥有那个数据的嗯,故事。随着 Gen 开始产生大量输出,然后考虑 Gen 消耗 Gen 输出的输出,对吧?这里有一个嗯,一个循环,我们会回到,你知道,放大所有偏见,忽略所有上下文,以及所有这些。所以,我们,这个问题的真正答案是,我们还不知道,但它肯定正在发生。现在,如果你把错误信息和虚假信息作为一个很好的例子,嗯,错误信息就是,你知道,当你重复一些似乎是真的事情,因为你听到了它,它听起来很合理,所以你重复了它。虚假信息就是当你编造一个谎言,然后把它放到以太网中,对吧?嗯,错误信息和虚假信息以超几何的速度被 Gen 放大,因为 Gen 开始消耗它,然后它开始写文章,发帖,做所有那些看起来像是人做的,但实际上是包含这些错误信息的算法做的。我们现在就生活在其中,我们还不了解这种疾病的影响,但我保证,这很快就会成为一件大事。当我们开始关注它时,它已经是一件大事了。谁知道呢?数据科学家是否更容易公开地传播或创建和传播虚假信息、错误信息或混淆信息?我认为数据科学家只关注从数据中讲故事,讲真话,是的,如果这些数据包含那些,是的,如果这些数据包含那些谎言,那么如果我们不进行真实性判定以及我所说的所有那些事情,绝对我们会成为问题的一部分。好吧,我为对数据科学家进行诽谤道歉,那不是我的意图。数据不在乎你的感受,迈克尔。我现在感觉不好了,我现在感觉受到侮辱了。好吧,嗯,非常快,嗯,来自 Hu Won 的一个问题,她说领导者可以采取哪些实际步骤来在一个组织内培养数据驱动的文化,并有效地承担计算成本?数据驱动的文化在一个生产口香糖的公司和一个销售分析的公司中将大不相同。所以,我认为其中一部分来自于公司本质以及他们最初的产品或服务有多以数据为中心。除此之外,还有组织中领导层的背景。他们有多教条?他们有多不可能拥抱我们在这里谈论的事情?最终,我们是数据领域,地球上可用的数据量正以超几何的速度增长。仅仅销售数据,提供数据,大多数人生活中已经有太多的数据了。所以,我们必须从中提取更多的意义。所以,数据驱动文化的一部分就是从数据中提取有意义的可操作的见解,并在组织中使它们相关,这样他们就会爱上你的数据,然后他们就不会那么担心你的基础设施,因为你增加了很多价值。Saam 之前说的话,你知道,给我看价值,他把它说得更好,但这在企业界基本上就是这样。当你和领导层讨论这些事情时,我认为关键在于将它们置于业务的正确背景下,以及在财务指标方面,你的 KPI 是什么,以实施数据驱动的解决方案。在这种情况下,他们更有可能接受这个概念,你实际上可以围绕它建立一个组织。来自 Arsalon KH 的一个问题,另一个有趣的问题,我喜欢这些发人深省的问题。他说,各种组织收集了大量数据,这些数据可能与其他组织相同,为什么我们不能有一个所有组织的数据中心,所有组织都可以调用这些数据?所以,为什么我们不能有一个中心数据存储库,考虑到许多组织的数据在很多情况下都非常相似?我认为你必须从我们从事什么业务,我们处于什么行业来考虑。它不是一个,它是通用的。你不能说,哦,让我们把所有数据都放在一起。有,如果我们看医疗数据,没有人想让他们的私人信息泄露。但是,即使药剂师有它,医生有它,实验室有它,但没有人想把数据放出去,它是否会被泄露是另一回事,但原则上,没有人想把它放在一个地方。在能源行业也是如此,人们拥有他们的专有信息,他们不想分享。所以,有一些领域,但在某些领域,例如如果我们谈论人脸识别技术,得益于社交媒体或其他方面的公共数据,人脸识别库比 20 年前只有五张照片左右的时候要大得多。所以,有一些领域没有问题,但也有一些领域有很多问题。所以,你必须非常小心。中心存储库实际上并不存在。在学术界,人们尝试过这个,用于研究论文等。所以,有一些领域人们正在尝试,有些是有效的,有些可能在医学领域无效,例如梅奥诊所拥有他们称之为数据平台,它由一位名叫 John Halaka 医生管理,他曾几次做客 CXO Talk。他们正在构建一个联邦数据系统,使参与的医疗中心能够有效地共享他们的数据,以便研究人员可以查询这些关于各种疾病的数据集。这与 Arsalon 所说的有点相似,但当然有保护措施。你谈论的是 HIPAA 数据,无论如何,如果你对这个话题感兴趣,可以看看。我们还有一个来自 Roland Coffee 在 LinkedIn 上的最后一个问题,安东尼,我们如何非常快速地从数据科学家那里移除数据中的偏见,因为我们时间不够了。当你着手消除偏见时,你几乎总是会引入其他偏见。所以,某些类型的偏见,比如你没有收集足够的数据,或者你的数据被操纵了,当然你想根除它。但最终,数据中的偏见应该被理解,并纳入你用来做出分析决策的数学中。如果你试图改变数据,除了标准化和做我们都被教导过的所有统计工作之外,通常你会引入另一种类型的偏见,这将导致其他意外的影响。所以,我的建议是理解偏见,消除偏见,这就是他们所说的随机原因变异或可分配原因变异,以一种你知道它坏了,你可以修复它的方式。除此之外,理解它并在你做出的决策的弹性中进行分析考虑。Saam,你将得到最后的发言权,非常快速地,我们如何从数据科学家那里移除数据和结果中的偏见?首先,数据科学家并不创造偏见,数据科学家只看数据,偏见就在数据中。所以,我们,它不是关于,如果偏见是数据,那么我们需要理解它是如何进入数据的,无论是有人创造的,这又回到了 Anthony 所说的数据的真实性,还是它已经发生,而我们没有理解数据背后的物理过程,所以偏见在那里,因为发生了一些事情,甚至发生了异常值,它存在,而且可能是真实的,但当时我们没有正确解释它,对吧?所以,作为一个数据科学家,我不会纳入任何偏见。一个不那么有原则、不那么小心、经验不足的数据科学家是否有可能自己引入偏见?或者正如 Saam 所说,这些完全是分开的?我的意思是,偏见是一个很大的问题,有太多不同类型的偏见。所以,简短的答案是,是的,当然。我看到你在点头,不,我们可能在想不同类型的偏见,对吧?所以,嗯,你知道,问题本身就包含偏见,年轻的数据科学家或新的数据科学家会以某种方式使用不同的方法。所以,无论说什么,非常快速地,我知道这并不快,那就是人类总会有某种偏见。如果我们没有,我们会发疯。你现在不考虑你的鞋子感觉如何,你正在这样做,你把事情排除在外,你总是选择忽略某些事情,这叫做生活。所以,作为人类,当我们接近一个问题时,我们会把我们的人性带入解决问题的过程中。我们可以尽可能科学,但归根结底,我们是人类,而不是人类在做事。所以,在我们所做的事情中总会存在某种人性。如果我们只是加一堆数字,继续前进,对吧?但如果我们做真正复杂的数据科学和复杂的系统,这些系统是混乱的,是动态的,那么其中总会存在这种偏见,我们必须时刻停下来思考它,并关注它。Saam,你必须完成这个,因为你在这里不同意。我可以肯定地说,我们没有纳入任何东西,所以这就是为什么我说,没有数据科学家可以产生,可以创造偏见,偏见就在数据中。可能有不同的模型,它们可能讲述不同的故事,这是不同的,它是通过使用某些方法从数据中讲述一个故事。所以,偏见要么在数据中,要么在你使用的方法中,但数据科学家本身并没有在故事中创造那种偏见。所以,迈克尔,就是这样,就是这样,两位数据科学家同意,两位数据科学家不同意。好吧,尊重地说,我们说的是不同的事情,但我认为我们同意彼此。我们似乎在激烈地同意。是的,我们似乎在相当激烈地不同意。我们正在谈论大象的不同部分。好了,在你们离开之前,请订阅我们的新闻通讯,访问 cxo talk.com,订阅我们的 YouTube 频道。非常感谢 Anthony Scrip 和ano 博士以及 Satian Priori 博士。绅士们,非常感谢你们花时间在这里与我们在一起。我真的非常感激你们两位。这太棒了。谢谢。也感谢所有提出如此出色问题的人。别忘了订阅新闻通讯,这样我们就可以通知您即将举行的节目。非常感谢大家。请查看 cxo talk.com。我们确实有一些非常精彩的节目即将推出,一些即将到来的人非常棒。所以,大家保重,我们下次再见。保重,再见。 [音乐]