📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

IBIIS-AIMI Seminar | David Ouyang, MD - Development and Deployment of Echocardiography AI

Stanford AIMI1:01:17

Transcription

好的,这是您提供的文本的中文翻译:

完美。 [清嗓子] >> 嗯,好的。欢迎大家参加今年的第一期艾米·艾比斯研讨会系列。我们非常激动能邀请到一位杰出的演讲嘉宾来参加我们的首次研讨会。呃,我很高兴能介绍戴维·欧阳博士。呃,戴维是加州北部凯撒医疗机构研究部门的心脏病专家和研究员,同时也是西达-西奈史密斯心脏研究所的助理教授。我认为戴维拥有非凡的背景,他拥有统计学学士学位,是医学博士,他曾在斯坦福大学进行博士后研究,在心脏病学和人工智能领域处于前沿地位,看到戴维和他的实验室产出的所有研究成果真是太令人惊叹了。你读过的大部分心脏病学人工智能论文,要么是戴维撰写的,要么深受戴维的影响。戴维在开发新颖的心脏病学人工智能算法方面做得非常出色,并且非常注重这些工具的实际应用。所以我们非常高兴戴维今天能加入我们,与我们分享更多关于他的研究。那么,戴维,[清嗓子] 请开始吧。感谢您的到来。 >> 感谢您如此亲切和慷慨的介绍。我非常激动能回到斯坦福大学,我在这里接受了大量的培训,度过了我生命中的六年。所以,我真的很想分享一些我们的经验,这些经验主要集中在心脏病学人工智能方面,但我们也认识到,[清嗓子] 在第一近似下,我们在心脏病学人工智能方面所做的很多工作都受到了放射学人工智能的启发。我认为放射学在人工智能的部署、开发以及集成方面都处于领先地位,您将看到我们正在进行的工作以及心血管人工智能领域普遍存在的工作,与许多在这里的团队正在做的工作有很多相似之处。我将重点介绍一些背景信息,解释为什么会有这种兴趣,以及图像处理和计算机视觉的统一主题,临床需求,尤其是在心脏病学领域,但总的来说,为什么影像学对医学实践如此重要,然后是三个案例研究,重点是精确测量,我们如何实际做到计算机或人类可以做但做得更好的事情,精确检测,我们如何检测到人类遗漏的东西,以及自主人工智能的问题,我们如何通过自动化许多解释任务来实际融入工作流程。但首先,我想放一段视频,这是我们最近发表的一篇论文,我觉得很有趣,这其实是一只鸽子。所以,我不知道你们是否还记得几年前,大概在 2018 年或 2019 年,爱荷华大学的一位动物心理学家发现,鸽子实际上可以阅读病理切片。当你给它们看切片,或者当你第一次教它们或给它们看乳腺癌和非乳腺癌的切片时,随着时间的推移,鸽子实际上可以识别出哪个是癌症,哪个不是癌症。你可以想象鸟类,因为它们必须生活在野外,需要看很远的东西,区分移动和非移动的物体,实际上拥有非常发达的视觉皮层。所以,我们所做的以及心脏病专家和放射科医生所做的很多前提都与鸽子相似。我们正在进行模式识别。我们在没有内在标签的情况下识别什么重要,什么不重要。所以,人们可能会认为这是某种强化学习,或者随着时间的推移,我们实际上会因为发展或理解正确与否而获得奖励。但在这种情况下,鸽子实际上能够随着时间的推移评估什么是正常的心脏,什么是异常的心脏,当你给它们奖励时,在这种情况下是食物。但在我看来,这才是医学影像的真正价值和理论基础,无论是放射学、心脏病学、皮肤病学、病理学,还是所有这些领域,其理念都是“一图胜千言”。这是一张十多年前发表在《新英格兰医学杂志》上的图片,实际上只是一个卡车司机。经过几十年的驾驶,也许每天都走相同的路线,也许太阳离他脸的左侧比右侧更近。他经历了不对称的日晒,导致了不对称的表型,我们可以通过影像学来探究。这很重要,因为它实际上与临床结果相关。对吧?也许对他来说,你可以看到他一侧的脸有点皱纹,但这与皮肤癌的相关性更高。也许罗克珊会告诉他需要多涂防晒霜,但这实际上是影像学的核心教义,对吧?那就是我们可以通过影像学来理解我们的临床结果。尽管心脏病专家非常擅长识别我们认识到的重要指标,但我们并非无所不知。所以,作为心脏病专家,我们使用射血分数来衡量心脏的搏动能力,冠状动脉钙化来评估心血管疾病的风险,MRI 中的延迟增强来评估心脏瘢痕的量,所有这些对心脏病专家和患者都很重要,因为它们与临床结果相关,对吧?无论是心力衰竭、二尖瓣关闭不全,所有这些实际上都将影像学与结果联系起来 [清嗓子],但这只是冰山一角,对吧?这才是人工智能的真正承诺,因为即使对临床医生来说,我们对影像学的理解也在不断发展。这个 DGE,即 MRI 上瘢痕的概念,是心脏病专家和放射科医生在 20 年前甚至不认识的东西,但随着时间的推移,他们认识到这很重要,并且与临床结果相关。但这也正是人工智能如此有潜力且前景广阔的原因,因为它是一种无偏见的方法,可以探究我们已经拥有的海量影像数据,并以一种与人类实际理解不同的视角来理解这种相关性。

同时,我们也必须认识到存在巨大的临床差异。如果你去看两位不同的医生,很可能会得到两种不同的解释。他们甚至可能以不同的方式查看图像,导致不同的治疗计划、不同的诊断和不同的结果。但这种差异发生在各个层面。我想强调的是,这也发生在影像学层面,而不仅仅是诊断后的处理。一个关键的例子是,在心脏病学中,我们评估的一个关键指标是左心室射血分数,简称 EF,或者简单地说,它是衡量心脏收缩能力的一个指标,是诊断心力衰竭、心脏病发作以及其他一系列临床相关特征的方法。但尽管这是一个定量测量,它是心脏大小与收缩期和舒张期最小尺寸的比率,但我们在评估它时实际上存在很大的偏见。所以,在顶部和底部,都是西达-西奈和斯坦福大学在过去 30 年里报告的射血分数。我只是根据数字的最后一位是 0 和 5(红色)还是其他数字(蓝色)来对直方图进行着色。EF 是一个介于 0% 到 150% 之间的指标。但你可以想象,它应该是一个生理指标,所以你应该得到 50、51、52 的测量值,概率相等。我们可以看到,人类实际上更喜欢 0 或 5。也许是人类不确定,所以他们倾向于一个中间数字。或者,可能有很多原因导致心脏病专家在具有挑战性的临床情况下更愿意说 50。我之所以强调这一点,是因为它不符合生理规律,而且从根本上说,计算这个比率的底层数字,即 ESV 和 EDV,并没有这种关系。对吧?ESV 和 EDV 在此方面并没有对零和五的偏好。这怎么可能呢?即使是我们最定量的评估,很多临床医生也使用他们的临床判断来决定这个数字是多少?有时我们不想给出诊断。所以我们低估或高估,有时我们确实想给出诊断。我们会以不同的方式高估。这导致了关键指标的盲法观察者内变异性。这足以诊断心力衰竭或非心力衰竭的比例在 8% 到 13% 之间。而且这也是一个容易出现大量变异的领域,美国超声心动图学会建议我们测量心脏多达五个心动周期,然后取平均值来评估射血分数。但在我到过的任何超声心动图实验室,尤其是在繁忙的超声心动图实验室,即使没有核心实验室或类似的东西,临床医生通常也只测量一个代表性的心动周期。但他们选择代表性的方式是另一个不精确、有偏见和变异的来源。同时,这个关键指标,我称之为非常简单的指标,是所有心力衰竭试验的纳入标准。所以,你所知道的以及社会所知道的关于药物对心力衰竭是否有效的信息,实际上都取决于心脏病专家和放射科医生是否正确地调用了这些测量值来决定临床试验和患者的纳入。而且,因为我们是在放射学听众面前,我喜欢强调这与成像方式无关。我强烈偏爱超声检查,但实际上,在所有不同的成像方式中,这种变异性是相同的。我举的一个例子是心脏 MRI。这显然是一种更昂贵的成像方式,一种非常复杂的方式,有专家解读,但在测量壁厚方面,其变异性与心脏超声检查一样大。我们之所以不做更多关于心脏 MRI 可重复性的研究,是因为它是一种昂贵的检查。很难从同一位患者那里获得多张图像。但当人们这样做时,即使是测量像壁厚这样非常基础的测量值,也存在同样多的变异。你可以看到,放射科医生可以测量心脏的不同部分,可以测量不同阶段的不同部分。有时它不是正好在 90 度,但各种原因最终归结为,目前医学影像准确性的上限是由人类观察者内变异性决定的,而不是由成像方式本身的信噪比决定的。当然,我同意心脏 MRI 更漂亮,血液池与心肌之间的界限更清晰。但这是因为人类评估影像的方式存在如此大的变异性,即使在获取影像之后。这确实是最大的机会领域。

这基本上是我实验室的愿景,也是我确信你们很多人正在做的事情。哦,请继续。 >> 您好。抱歉。我听您说话有点困难。所以您可能已经说过了,但关于射血分数,那是用单层超声心动图测量的吗?还是怎么测量的? >> 是的。不,这是个好问题。对于超声心动图,我们通常使用一种称为“五平面圆盘法”的技术。所以它是在两个轴向切片中测量的,四腔心和两腔心,然后取平均值。呃,我想说,当然,在 MRI 中,它是跨越一个堆栈然后进行轮廓描绘,实际上测量每一帧。但对于这项特定研究,它甚至不是 EF,而是壁厚。所以它实际上是在舒张期测量心脏的厚度。 >> 谢谢。是的。所以我们的第一个项目是,我们能否自动化射血分数测量,特别是对于超声心动图,这实际上是与 KR 你和詹姆斯合作完成的,你们很多人在斯坦福大学都认识,当我还是博士后的时候,但功能上来说,这是最早的基于视频的模型之一,我们实际上分割了左心室,你可以看到蓝色是左心室,黄色是心脏的其余部分,黑白是 [清嗓子] 创建一个回归任务,该任务实际上评估射血分数,并创建一个可以以心脏病专家相同方式测量的轮廓。所以,即使在深度学习之前,也有很多影像学方法来计算分数或分割左心室,超声心动图的图像质量。有很多患者可能稍微胖一点,可能有一些肺部疾病或保留了更多的空气,导致超声心动图图像质量较差,类似于右边的图像。但主要的挑战是,这些图像在临床上仍然可解释,我作为心脏病专家仍然会查看这些图像并得出一个数字,即使边界不是很清楚。所以,通过深度学习卷积神经网络,我们可以证明我们在高质量和低质量图像方面具有同等或相似的准确性,并且这能够逐帧、逐搏地进行,这对于临床医生来说可能具有挑战性。再次,从临床角度来看,超声技师大多数时候只为收缩期的一个心动周期和舒张期的一个心动周期进行轮廓描绘,然后说这就是最终数字。但因为它是软件,你可以对几乎每一帧、每一个心动周期以及整个研究中的多个视频进行操作。这非常有帮助,因为心脏不是一个静态器官,而且搏动与搏动之间存在很大差异。一个例子是房颤,心脏的节律或心率非常不规则。较慢的心跳可能导致较高的射血分数,而较快的心率可能导致较小的射血分数。所以我们可以看到,因为它是自动化的解决方案,我们可以测量每一个心动周期,然后为每一个心动周期提供射血分数的点预测,从而更精确地评估射血分数。所以,这是 2020 年的最新技术,但当时我们对我们的论文感到非常自豪,我们真的很想与斯坦福医院以及许多其他人讨论如何在临床上部署它。我们发现,在那段时间里,大约有 300 种获得 FDA 批准的产品。现在有大约 1300 种,但这并不一定意味着医院在决定采用或购买哪些产品时会考虑所有这些。我们喜欢举的例子是,在我们的分析中,以及与 Roxan 一起,获得 FDA 批准的产品总体上很少,即使是多中心研究也很少。绝大多数只有回顾性数据,而且当时没有一项经过盲法或随机临床试验。我认为,对大多数临床医生来说,他们认识到 FDA 批准很重要,但这是必要条件,而非充分条件。我举的一个例子是,对临床医生来说,我们认为这与我们考虑新的药物治疗或新的器械治疗或植入式器械时的情况相同。但 FDA 对治疗的门槛实际上比 FDA 对诊断的门槛高得多。因此,最新的心脏瓣膜或最新的心力衰竭药物需要一到两次关键的前瞻性试验,通常采用盲法和随机方式来最大限度地减少评估中的偏见。所以在这种情况下,我们实际上进行了一项首批人工智能临床试验之一,这是一项盲法随机比较,将该人工智能模型与超声技师或采集图像的技术人员进行比较,以评估左心室射血分数。我将对此进行一些介绍。在标准的临床工作流程中,超声心动图的优点是,每一张图像都有两个专家接触点,他们都是各自领域的专家。我之所以这样描述,是因为超声技师扫描患者,同时也会创建一个初步报告,心脏病专家在不同的电脑上、不同的时间点完成,而且通常不会与超声技师进行讨论。从很多方面来说,超声技师每天都在做这些事情,他们本身就是临床专家。所以在西达-西奈,当时我们有 25 名超声技师,平均有 14 年的经验,然后我们有 10 名心脏病专家,平均有 13 年的经验,因为超声技师和心脏病专家从两个不同的时间点独立地看待问题。我们认为这是一个进行前瞻性临床试验的绝佳机会。我们实际所做的是,我们将人工智能初步评估与超声技师初步评估进行了洗牌,一对一随机分配,然后将它们全部展示给心脏病专家,而不告诉他们哪些研究是由人工智能完成的,哪些研究是由心脏病专家完成的,然后评估他们改变初步到最终评估的频率。有一个预运行期,以确保这些图像质量足够高,不至于无法解释,但我们主要评估的是他们改变超过 5% 的频率。对于我描述的模型,有三个改变。 [清嗓子] 非常快的问题。所以,嗯,心脏病专家,你有一个条件,你有一个关于评估的条件。如果他们没有这个评估,心脏病专家的结果会不同吗?我知道这不是你在测试的。 >> 是的。 >> 但我只是意识到你有一个条件。 >> 所以,绝大多数,或者我所描述的是重新构建这个。当有初步报告时,存在巨大的锚定效应。>> 对吧?>> 你可以看到,这在医学中普遍存在,如果有人创建了一个初步报告,取决于你对他们的看法,你可能会选择偏爱他们,或者选择忽略他们,或者当我与一名住院医师合作时,如果他是一名优秀的住院医师,我可能会说,“啊,大概还可以。这没问题。”但我们有一个单独的臂,我稍后会描述。但我们确实想看看,我们想确保他们没有被初步报告的代理人所偏见。>> 这正是我要 [清嗓子] 问的。>> 是的。所以,标准工作流程是他们已经有了超声技师的初步报告。所以这并不独特或不同。>> 完美。>> 但在社区实践中,他们通常没有初步报告。所以有一个单独的工作流程,我将在讲座的最后描述,在那里他们没有,并且必须从头开始解释一切。>> 谢谢。>> 是的。但实际上,这是一个完美的引子,可以引出三个幻灯片。但首先,我将讲两张幻灯片,然后进行描述。但 [笑声] 为了使研究盲法,我们只能展示一到两帧的细胞酸。对吧?因为如果我们给他们看左上角这样的东西,他们就会清楚地知道哪个是人工智能,哪个是超声技师。所以我们实际上故意削弱了人工智能,但在某些方面,我们实际上改进了人工智能,因为我们增加了训练量。原始论文是在 10,000 个超声心动图上训练的,然后我们继续训练,在斯坦福大学的 144,000 个超声心动图上训练。我想强调的是,这在人工智能领域是普遍的,你拥有的训练数据越多,效果越好,而许多商业产品,即使是现在,也只在大约一千张图像上训练。最后一点,回到随机化和盲法的问题,我们实际上想研究超声技师和心脏病专家在他们已经使用这个的环境中。所以这是 Seaman Single Dynamics,这是我们使用的 PACS。第一组描绘实际上是由超声技师完成的。但我想强调的是,当我们用 Python 代码评估模型时,我们将其重新注入 PACS,以显示下一组描绘,使其看起来非常相似。我们实际上使用了数据库的后端,所以除了视觉质量之外,心脏病专家无法区分人工智能还是超声技师。这并不完全回答你的问题,但即使你不在乎人工智能,我们感兴趣的一个关键领域是临床医生之间的观察者内变异性,所以我们故意选择了在临床工作流程中已经解释过的研究。这是 2019 年 8 月西达-西奈的超声心动图,这意味着我们实际上在标准临床工作流程中有一个历史心脏病专家报告。忽略橙色部分,只看两个蓝色工作流程,你就会得到一个心脏病专家变异性的点度量,因为这是由超声技师和心脏病专家看到的同一图像的两组。所以我们开始了大约 3800 项研究,大约 7% 的研究质量较低,EF 是通过目测近似的,而不是测量的,导致 3500 项研究被测量。它们被随机分配为一对一。这基本上是西达-西奈大约一个月的超声心动图。它是住院和门诊患者的组合,有很多合并症,因为它是来自心血管中心,西达-西奈是三级转诊中心,以及各种各样的人口统计学特征,代表了很多心脏病患者。我喜欢向影像学听众展示这一点,但即使在我谈论主要结果之前,你可以想象,心脏病专家看到中间的图像,然后他们看到左边或右边的图像 [笑声],他们必须调整这些轮廓以达到他们想要的 EF,但也在每项研究之后,我们要求心脏病专家猜测,你认为这是人工智能完成的还是超声技师完成的?我们这样做的原因是,我们想看看心脏病专家是否真的能分辨出是超声技师还是人工智能,对吧?因为如果盲法研究对我们来说意义更大,而不是非盲法研究。所以心脏病专家正确猜测的次数是三分之一,错误猜测的次数是四分之一,说不确定或可能相等的大约是 43%。这导致了一个称为盲法指数的指标,为 0.88,这被认为是良好的盲法,而且实际上很难 [咳嗽] 区分 [清嗓子] 哪个是哪个,哪个研究是哪个。>> 你看过图像吗?有没有什么明显的迹象表明可能是?>> 是的。不,这是个好问题。嗯,我很好奇你是否能分辨出来,或者你是否从这些图像中得到了一些想法。>> 我记住了,所以我现在能分辨了,但我以前做不到。所以我想说的是,事后看来,当我们进行分析时,你会注意到也许这个轮廓看起来更像我的,你知道,嗯,那个乐高积木还是我的我的世界风格的,对吧?无论谁,或者只是点击了一、二、三、四。它是一个不太平滑的轮廓。是的。而且我想说,这实际上可能是主要的线索,人类是懒惰的。他们会得到他们想要的数字,而不一定是为了在视觉上近似边界。但如果你看看更块状的那些,它们几乎总是。 [铃声] 所以在这种情况下,心脏病专家改变了人工智能组 16.8% 的时间,超声技师组 27% 的时间,这导致 P 值为 0.001,人工智能在非劣效性和优效性方面都占优。所以,我们最初设计试验是为了非劣效性,但我们惊喜地发现它如此之好,以至于它实际上优于超声技师。EF 的平均变化约为 3% 对比 4%。所以,变化不大。所以变化并不大,但心脏病专家更有可能改变超过 5% 的情况,而不是与历史数据相比,它实际上有更多的变异性。所以回到你的问题,就像如果你没有别人所做的锚定,你实际上更有可能有点更具变异性。所以人工智能的差异约为 6.3%,而超声技师为 7.2% 2%,所以它们之间有一点点更大的分散。平均而言,超声技师需要大约两分钟或 119 秒来完成每项研究。心脏病专家需要大约 54 到 64 秒。总的来说,大约有三分之二的研究发生了变化。所以这是一项单中心研究。它是在西达-西奈超声心动图实验室进行的,模型是在斯坦福超声心动图上训练的。为了实现盲法,人工智能被削弱了。所以这是我们认为人工智能能做到的最低限度,而且没有与 CT 或 MRI 进行比较。尽管如此,我们对这项研究感到非常自豪,因为它进行了外部验证。 [清嗓子] 再次,这是一个不同的地点,公开可用的代码。我们在 GitHub 上有这个,并且通过 AM 中心,我们实际上发布了原始模型训练的 10K 数据集。所以它实际上表现非常出色。它是为数不多的人工智能试验之一,进行了随机化,并且有一个活跃的竞争对手,我们认为超声技师本身就是真正的临床专家。盲法是成功的,而且即使你根本不在乎人工智能,这也是最大规模的临床医生 [鼻息] 重复测试研究,约 3500 项研究。嗯,我们看到的最大规模的超声心动图比较研究实际上是 200 项研究。所以这是一项比许多比较研究都要大的研究。>> 另一个后续问题。这是一项了不起的研究。嗯,你有没有遇到过那些我猜是正常的人,或者你的分布是否偏向于某个特定的诊断?抱歉。是的。>> 啊,这是一个很好的比较。所以我们实际上选择了西达超声心动图实验室近一个月的顺序。所以大约是 3500 项研究。他们的平均年龄约为 66 岁,我相信历史上的临床 EF 约为 58%,标准差为 14%。>> 所以基本上你可以认为低于 50 的都是异常的。所以这可能是,我想说,大约 30% 到 40% 是异常的。>> 谢谢。>> 是的。所以这在很多方面都将是临床上或典型的接受超声心动图检查的患者的真实写照,因为它基本上是所有就诊者。完美。>> 我一定会赞同这一点。这些都是了不起的研究。我很好奇,当你考虑软件作为医疗器械的广泛问题时。你认为所有这些都需要临床试验来证明其有效性吗?>> 是的。不,这是一个绝妙的问题,我将向你展示,这是我们有幸向 FDA 提交的,但有趣的故事是,FDA 至少对于放射学设备来说,最熟悉的是回顾性数据。所以他们实际上告诉我们,评估前瞻性数据实际上对他们来说是更多的工作,因为它是一个不同的框架。他们更愿意看到三中心外部验证,并有一个来自地理上多样化的保留集,而不是前瞻性证据。作为临床医生,我认为临床试验总是有帮助的,因为这里显然存在人机交互的部分。嗯,听众真的谈到了,你知道,超声技师锚定患者或提供者,这实际上非常重要,在目前的范式中,FDA 不会对此进行质询,但我认为这是一个如此不断发展的领域,很难说,或者我认为 FDA 永远不会走到需要对所有事物进行临床试验的地步,特别是当我们谈论不太确定性的模型或大型语言模型时,很难考虑样本量或考虑,你知道,存在如此大的变异性,你给它相同的输入,它们可能会产生不同的东西。嗯,那里有更多的复杂性。试验方面是我作为学术界人士所考虑的,那就是当斯坦福部署模型时,也许如果你能建立质量改进或临床研究,那将是一个巨大的优势,但可能每个地方都必须自己测试。>> 哦,请继续。嗯,抱歉,我可能错过了这一点。对于近 4000 例超声心动图研究,这是一个公开的数据集还是你们收集的?>> [清嗓子] A 中心已经发布了来自斯坦福大学的 10,000 例超声心动图,这是训练集的一部分。嗯,这项试验的图像没有发布,但原始的患者级别结果和数据也已在我们的 GitHub 上发布,所以你可以看到每个患者在研究中的初步、最终以及人工智能的解释。>> 谢谢。>> 是的。>> 您好。嗯,考虑到那 274 例超声技师无法描绘的,看起来没有人无法被人工智能分割。是这样吗?>> 所以这些被排除了,它们没有进行随机化或我们没有进行推理。我们选择这种设计的原因是,大约 5% 的时间超声技师只是猜测或写 35-40、45-50、55-60,而他们并没有真正定量测量。这是标准工作流程的一部分,因为有太多潜在的低质量超声图像。但我们认为模型在这些图像上也会做得很好,或者至少回归模型在这些图像上会做得很好,但分割可能不会那么好。谢谢。>> 是的。我可以>> 再问一个问题吗?基于这项研究的结果,你认为未来将如何实施?它会是超声技师的替代品吗?它会是增值附加项吗?你如何看待如何在现实世界中使用它?不,>> 这是个绝妙的问题,我认为这是一个每个人都有强烈意见的领域,对吧?对。我认为超声技师担心他们的工作会被自动化。嗯,有一个问题是,你如何或在哪里整合它?是在成像设备端还是超声端,还是 PACS 端?我经常喜欢说,采集人工智能部分实际上是最难做的,对吧?因为你不知道你不知道什么。因为在 PACS 中,我们从不存储低质量图像或所有未完全正确完成的图像。它们只采集好的图像。我们有一个非常有限的训练数据集。如果我们想做采集人工智能,那最有可能被自动化的是心脏病专家,我本人,对吧?因为这些初步报告或类似的东西非常有帮助,并且可以在繁忙的临床环境中分担超声技师和心脏病专家的工作。你知道,尽管这是标准工作流程,超声技师完成,然后心脏病专家评估,但实际上在许多社区中心并非如此。所以,如果你不在斯坦福,如果你在一个街区外的私人诊所,心脏病专家通常必须从头开始做所有事情,因为超声技师的时间非常宝贵。他们专注于进行更多的扫描。所以我想说,如果能提供一个好的初步报告给心脏病专家,那么在标准化和实际改进报告方面可能有很多增值。我认为我们距离完全自动化还有点距离。但我们认为这可以提供一个非常好的初步报告。好了。我想强调的最后一点是,回到我们有幸提交临床试验数据以及一些回顾性第三方验证的问题,并表明我们现在已经获得了 FDA 批准,这是两年前的事了。但实际上,这说明了部署的漫长过程。所以这个模型现在已经部署在西达-西奈超声心动图实验室,作为临床实践的一部分,我们对此感到非常兴奋,并且这确实是一个多方利益相关者的对话,其中利益相关者希望在实际用于临床实践之前获得批准。我将转向第二个案例研究,它侧重于罕见病的精确检测。但我想先停下来,看看是否有关于 EF 的很多好问题,但看看这里是否有其他问题。我还有最后一个关于图像的问题,实际上我认为临床试验主要使用的是高质量的图像,对吧?我认为一些讨论已经触及了这一点,我也对人工智能在这些低质量图像中的行为感兴趣,你有没有比较过人工智能的预测,我的意思是,当然,超声技师可能无法很好地识别,因为你把它们剔除了,但他们仍然有其他成像模态的数据,例如 MRI,或者他们有 BMP 分析,我们仍然可以获得患者诊断的信息。我只是想知道,对于那些超声技师无法分析的超声心动图,也许你可以部署你的人工智能来分析,然后它们可能会提供一些额外的信息,而不是直接竞争,我们可以从你的系统中获得更多信息。>> 这是一个绝佳的问题,我将从两个方面来回答。首先,我想强调表一,即使在超声技师标注的研究中,图像质量也有很大的差异。所以在历史报告中,我们可以提取出它被描述为差的比例约为五分之一,足够的比例约为一半,好的比例约为 10%,其余未指定。所以,即使在我们随机试验中评估的那些研究中,也有相当糟糕的图像。我怀疑 275 例有时实际上是由于临床医生的懒惰,对吧?说 35-40,而不是真正足够好,这要容易得多。我们还没有进行完整的分析,看看这些是否与差的图像有实质性差异,但实际上,我认为模型在差的图像子集中做得很好,或者我们知道模型在差的图像子集中做得很好,因为我们也进行了子集分析。所以,在许多指标中,我们展示的不是在这个演示文稿中,而是在论文中,我们显示置信区间略宽,但所有点估计在改变频率等方面都倾向于人工智能。所以,即使是对于低质量的图像,人工智能辅助可能也更好。第二点绝对更具主观性,但总的来说,我们进行的比较横断面成像的研究较少,因为我们认为所有成像方式本身都存在固有的偏见。对吧?我认为,当你进行比较并说你使用 MRI 标签时,隐含的意思是 MRI 更好,但所有研究都表明,回声与 MRI 之间并非完美相关,而且从我作为心脏病专家的角度来看,这也不是正确的临床标准,因为如果你考虑参加心力衰竭临床试验的患者,诸如此类,患者基本上是根据他们的超声心动图入组的,人们是根据他们的超声心动图做出临床决策的。接受心脏 MRI 的 1% 到 5% 的患者,这可能很有帮助,但这实际上并不是临床实践的方式。这可能有点大胆,但如果回声和 MRI 之间存在不一致,我就是少数认为你应该使用回声结果而不是 MRI 结果的人之一。并不是说 MRI 定量测量的结果实际上要清晰得多,并且通常在较小的数据集上得到验证。>> 谢谢。所以这绝对是我们在放射学听众中的一个大胆的说法。 [笑声] 我一定会把它说出来。你知道,就当它是什么吧。我们午餐吃番茄。 [笑声] 我们可以晚点喝杯啤酒,然后在酒吧讨论。好了。所以,我将谈论第二个案例研究,它关于罕见病的精确评估。但我将首先从一个患者案例开始。一位 85 岁的男性,有半年的腕管综合征病史,在 2019 年接受了大量检查。他的心电图显示他没有达到低电压标准,因此不符合我正在考虑的特定疾病的经典定义。他的壁厚测量值为 1.3 厘米,这是异常的,但也许如果你从后见之明来看,也许吸烟者低估了这些壁厚,也许如果我来测量,我可能会再挤压一点,这样它就会有更多的左心室肥厚。但我在与 Vindiad 讨论心脏淀粉样变性。这是一个越来越受到关注的领域,因为有新的疗法可以提高预期寿命和生活质量。但在这种情况下,你可以看到,即使在三级护理中心,这位患者也接受了多位专科医生和心脏病专家的影像学检查,人们没有得到心脏淀粉样变性的诊断,因为它是一种罕见病。就像在斯坦福大学,有很棒的临床医生会看这些患者,比如淀粉样变性专家 Ron Watalis,以及其他几位,比如 Paul Chang,还有 Kevin Alexander,还有很多表型模拟疾病,比如肥厚型心肌病也会导致壁厚增加。所以你和许多其他人都会看到这些患者,但即使是专科护理,患者通常也需要看大约四位专科医生,大约两到三年才能获得心脏淀粉样变性的诊断。在这种情况下,即使我们看到所有这些患者都接受了超声心动图检查,但诊断并没有浮出水面,因为作为一名影像学专家,我们有很多提示性的信号,但没有确凿的证据。所以,当我搜索斯坦福超声心动图数据库中的“淀粉样变性”一词时,它在大约 30 万次超声心动图检查中出现了大约 300 次,其中大多数实际上是针对已知患有心脏淀粉样变性的患者,他们正在接受随访超声心动图检查。很少有影像学专家会说考虑心脏淀粉样变性,尽管有影像学发现。所以,在这种情况下,我们实际上创建了一个双向人工智能模型,它做了两件事。首先,我们使用该模型对壁厚进行精确评估。所以,类似于 EF 的想法,你做得越是逐搏、逐帧,你就能获得更精确的测量,从而增加你的预估概率,并且在有左心室肥厚的患者中,我们可以区分病因。也就是说,是主动脉瓣狭窄、高血压和肥厚型心肌病,还是心脏淀粉样变性。我们进行了配对训练,我们训练模型来区分病因,尽管它们都有肥厚。我们发现,与仅仅使用年龄和性别匹配的对照组相比,该模型表现更好,因为如果你的许多对照组实际上没有 LVH,模型就会倾向于忽略 LVH。这实际上使得模型更精确,最终我们同样有兴趣了解它在临床工作流程中的表现。美国的主要挑战是,每年诊断出 7000 到 10000 例。如果你估计发病率,每年可能接近 20 到 220,000 例。这确实是漏斗的顶部,因为几乎没有一位患有呼吸短促或正在接受心脏病专家诊治的患者不接受超声心动图检查。而且,有趣的是,五分之一的 Medicare 受益者每年都会接受超声心动图检查。所以这确实是漏斗的顶部,对吧?你可能只能进一步通过心电图,但这基本上是你们在座的很多人都做过超声心动图检查。所以这是一个很好的筛查方式。Rox,你刚才说有新的治疗方法。这是早期干预会影响结果的那种情况吗?>> 这是个好问题。是的。所以,早期干预有利有弊。所有关于淀粉样变性药物的临床试验,对于 NYHA 1、2、3 级患者,效应量更大。所以,早期诊断更有可能处于可逆阶段。如果你严格限制这些试验只针对最严重的患者,那么试验结果将是阴性的,因为这是心脏的蛋白质沉积。如果你沉积了太多,这些药物就没有多大作用了。缺点是,你知道,要完全认识到这一点,这些药物很昂贵,对吧?这些是你看到如此多的营销和宣传的原因之一,因为这些药物每年花费在 6 万到 25 万美元之间。所以,在这种情况下,我们在四个中心进行了一项前瞻性试验。这在 Paulo VA、西达-西奈、西北大学和俄勒冈州波特兰的 Providence 进行。但总体工作流程是,我们实际上扫描了每个地点过去三年的所有历史超声心动图。这会产生一个直方图,如右上方所示,0 表示不太可能患有淀粉样变性,1 表示高度可能患有淀粉样变性。你可以看到,绝大多数患者不太可能患有淀粉样变性,因为这是一种罕见病。但如果你根据实际患有已知淀粉样变性诊断的比例来展开,你会发现那些得分高于 0.8 的患者患有淀粉样变性的可能性很高。即使是那些从未被诊断为淀粉样变性的患者也是如此。所以,怀疑是这些患者应该由临床专家评估,看看这些患者是否会得到诊断,如果他们看了这些专家并排除了。我们不一定需要看到已经确诊为淀粉样变性的患者。但这类似于许多机会性筛查工作。如果人们因为房颤而接受超声心动图检查,但那个房颤是因为心脏淀粉样变性。这是一种将其浮现到最顶层的方式。我们很幸运地说,这也获得了 FDA 批准。这张幻灯片的张力还在于认识到这项临床试验尚未完成,但不需要临床试验来批准这个算法。我们实际上已经在许多地点进行了回顾性验证。但这确实是关于我们能否利用人工智能来检测我们不擅长识别的事物,或者检测图像实际提供的信息但我们很少将其浮现到顶层。>> 你能理解人工智能关注的是哪些特征吗?现在你知道这是可能的,你也能做同样的事情吗?>> 是的,这是个好问题。我想说,目前我们还在确认这些特征是否是淀粉样变性,但你知道,大多数这些都是组合神经网络,所以你无法做到 Grad-CAM,你可以做各种方法,有点像看茶渣,但我不会说有一个清晰明确的淀粉样变性新标志物,通常是你向临床医生展示时,事后看来,哦,这说得通,对吧?那是肥厚,或者阀门有点增厚,一点点心包积液,但作为影像学专家,你没有足够多地调用它。>> 模型只看图像还是看所有心电图和?>> 只是图像。>> 所以,只是心尖四腔和胸骨旁长轴图像。>> 我能快速问一下这个设备的先前设备是什么吗?>> 所以,这个设备的先前设备实际上是,市场上现在有三个淀粉样变性检测模型。我们是第二个。所以,先前设备实际上是 Ultronics 的淀粉样变性检测模型,它只在超声的四腔视图中工作。它们也进行地标检测,或者抱歉,>> 它们不进行任何地标检测。所以,我们的模型是壁厚和胸骨旁长轴的组合,然后是四腔视图的疾病分类。它们批准了一个模型,该模型仅用于四腔视图的疾病检测。所以我真的很喜欢这个范式,因为它能让我们从已经获得的影像中获得更多价值。显然,淀粉样变性是我们非常感兴趣的领域,我们可以看到其价值。但另一个想法是,我认为这是一种风格或主题上的东西,对于我们正在影像学中遗漏的许多事情来说,这可能是真实的。它回到了关于这是冰山一角的问题,而且实际上是临床医生的局限性,导致我们无法从图像中获得尽可能多的价值或可能的价值。所以,我喜欢举的一个例子是,在超声心动图研究中,也就是心脏超声检查,大约有 100 张图像,其中三到五张实际上包含肝脏图像,但我从未在肝脏上调用过任何东西,即使作为心脏病专家,我看到这看起来不太对,或者看起来有点奇怪,但

你知道,我想坚持我的领域。作为一名心脏病专家,你知道,我希望放射科医生能够解读腹部超声波。但如果你回顾一下,很多这些病人从来没有做过超声波检查,对吧?这些病人,嗯,也许一些心脏病专家称之为肝脏问题,因为心脏看起来完全正常,射血分数也正常,但他们有一点水肿,或者他们有一点肿胀,但实际上回想起来,这实际上都与肝硬化有关。所以这篇论文的目的是,我们实际上训练了一个模型,它进行视图分类,从腹部超声波或心脏超声波中提取所有以肝脏为中心的图像,然后是一个分类器来实际检测是否存在脂肪肝疾病,或者是否存在肝硬化。最终,我们绝不会说病人应该做心脏超声波来筛查肝脏疾病。但对于那些肝脏检查结果异常的 1% 到 5% 的病人来说,这是一种让你更接近肝脏科医生或更接近放射科医生的方法,这样你就能得到你需要的明确诊断。所以我们非常兴奋,美国心脏协会已经认识到肥胖实际上是其核心主题之一,或者说是未来几年的一个想法,那就是代谢健康。而这里确实是一个独特的地方,因为接受超声心动图检查的病人,或者说做超声心动图的病人,实际上患有脂肪肝疾病以及非酒精性脂肪性肝炎或肝硬化的风险因素。他们往往更糖尿病。他们往往更肥胖。他们往往胆固醇更高。所有这些都表明,这些是患有代谢综合征的高风险病人。很多时候,这是他们疾病的早期阶段,他们只是感到有点呼吸急促,或者运动得不太好。但这是一个机会,因为现在有 GLP1 药物,而且确实有针对肝脏疾病的特定疗法。我们实际上正在推广这个算法,在斯坦福大学,与长亚历克斯和各种人以及斯蒂芬妮合作,我们将由一名住院医师来驱动,看看住院病人超声心动图的结果如何,让他们评估病历并考虑必要的转诊。我们也在凯撒医疗机构、麻省总医院和西达斯医疗中心进行这项工作,在那里我们将让肝脏科医生审查结果,以确定他们是否需要进一步的检查,包括腹部超声波。

是的。所以你之前提到,有对发送到 PACS 的图像进行预选。那么在这种情况下,你是扫描时运行这个,还是在发送到 PACS 的选定图像上运行这个,因为我猜想如果图像中有肝脏,它可能不会被发送到 PACS,如果是心脏的话。

这是一个好问题。这是一个好问题。所以肝脏图像总是被发送到 PACS,因为那是我们评估肝脏压力的方式。所以我们实际上会看到下腔静脉的图像,这对于完整的超声心动图报告是必要的,而这些下腔静脉的图像总是会看到肝脏。

但话虽如此,我认为关于这是实时还是非实时的,这是一个非常微妙且重要的问题。所以这就是一个实用性试验。它们会因研究而异,但你可以想象,对于我们的 EML 研究,它不是,我们不需要实时,因为我们可能会召回几个月或几年前的病人。但特别是对于斯坦福的工作流程,我们预计这些将是住院病人。所以实际上更重要的是,我们实际上要实时或近实时地完成这项工作。所以一些细节还在完善中,但目标将是,超声心动图研究可能会被发送到一个研究服务器,然后可能会在病人回家之前,或者他们可能不得不在病人回家后打电话给病人。好了,我在这里暂停,直到我的第三个案例,但关于机会性筛查,有什么问题吗?也许一个关于在超声机上运行这些机器有多困难的快速问题。

机器本身是锁定的,这就是为什么我们的大部分产品都在 PACS 端,那里有标准的 API 可以抓取和拉取。我知道超声制造商有很多兴趣,甚至考虑在电脑上安装 GPU,但总的来说,因为这是一个受限的空间,我们实际上无法在超声车上进行太多研究。

好的,第三个案例实际上是关于“自主 AI”这个想法。随着人工智能越来越强大,我们看到越来越多的模型可以协同工作,我们可以在某种程度上实现更多的自动化,这样心脏病专家或技术人员就可以成为一个协调者,或者从一个更全面的角度看待事物。我们发表了一篇名为“Echo Prime”的论文,它实际上是基于西达斯医疗中心近 1200 万个视频的 27.5 万份研究数据进行训练的。我们使用了一种对比学习方法,我们基本上训练模型将随机打乱的图像和报告文本结合起来,帮助模型确定哪些文本与哪些视频最相关。同时,作为这个过程的内在部分,模型会学习视图分类。所以它识别出哪些是真正重要的视图。例如,x 轴上的视图用于识别 y 轴上的心脏结构的哪些部分,这样模型就可以选择从 100 个视频中抓取哪些视频,并赋予它们不同的权重。这是一个叫做 Echo Prime 的模型。我们很幸运,它去年发表在《自然》杂志上。但总的来说,你可以输入所有 50 到 100 个视频,对于报告文本的每个部分,它实际上可以做到,比如左心室,它会抓取 9 个最相关的视频,然后生成报告文本。例如,这个是关于右心室的,所有这些视频都包含右心室。下一个是关于左心房的。所有这些视频都包含左心房。然后它会得出一个共识评估,即心脏病专家在最终确定报告时会说什么。这是一个可以想象的领域,即使没有直接测量,也能生成一个非常好的初步报告。但我们也对直接测量感兴趣。所以我们有一个同时运行的模型叫做 EchoNet Measurements,我们实际上进行所有的点对点地标检测和地标之间的测量,以创建最常见的壁厚、腔室大小以及使用分割模型的舒张功能评估。我们认为这两个模型的结合实际上是对心脏病专家来说一个非常全面或初步的评估,我们希望除了射血分数带来的好处之外,我们的研究表明这大约能节省两到三分钟的时间,这可以完全缩短或取代心脏病专家的一些中间环节或工作流程,从而真正简化他们的工作流程。目前在凯撒医疗机构,我们正在进行一项非常相似的设计研究,这是一项非劣效性临床试验,我们让超声技师重新解读历史图像,然后将其随机分配给心脏病专家进行盲审。但这项研究有趣的部分是,它回应了最后一个问题,我们增加了一个第三组,我们让心脏病专家在没有任何初步评估的情况下进行审阅,看看是否……如果将其随机分配到第三组。所以是第三组、第三组还是第三组……心脏病专家更喜欢心脏病专家的解读、超声技师的解读还是人工智能的解读。我真的希望心脏病专家的解读不会太差,但这实际上让我有点紧张。但这是我们刚刚完成了所有初步工作,并且已经组织了随机分配,我们希望在今年年底左右能有一个结果。

你们在追踪时间长度吗?除了你们的……是的,没错。没错。所以,就像我们与利益相关者进行的许多对话一样,我们也要证明商业价值和临床价值。所以我们想展示,嘿,这为你们的心脏病专家节省了多少时间等等。回到这个想法,在斯坦福大学,超声技师实际上做了很多初步工作,这很好,但在大多数凯撒北加州地区,没有初步工作。所以这对心脏病专家来说是非常繁琐的工作。所以我们确实想评估在没有任何人协助的情况下会是什么样子。除了影像学,阅读这些图像的人是否同时也能获得完整的病历,包括人工智能系统?

在这个试验中,他们确实没有获得完整的病历,因为它是盲审的,而且我们实际上……从病历号中提取了信息等等。但我想说,这更符合大多数临床医生现在的工作方式。我们被需要报告的研究数量淹没了,很少有人查看病历来帮助判断他们是否相信某事。实际上,对于大多数超声心动图报告工作流程来说,只是图像是否显示了它,或者没有。

我之所以这样问,是因为多模态。这就是人工智能可以发展的方向,我只是想知道。

不,这是一个很好的问题。至少在目前,它是……它是 Echo Prime 和 Measurements 的结合,但它纯粹是基于影像学的。

是的,就输出而言,你们有报告生成的模板吗?你展示的视频,心脏病专家最终看到的是什么?

是的,心脏病专家使用一种叫做结构化报告的东西。与放射学相比,很多报告实际上是结构化的,而且有一些固定的框可以勾选等等。这在一定程度上决定了我们如何训练 Echo Prime,即使它是对比学习,它也是在结构化报告模板上进行微调的。但实际上,它的范围更窄,它不是纯粹的……任何语言都可以作为输出,而且它也有助于盲审。模型不太可能说,我不知道,一些随机的自由文本。

好的,我还有两张幻灯片,很想听听任何问题,但第一张是我想重申一下性能与数据成正比的想法。所以我们很幸运,也是我搬到凯撒医疗机构令人兴奋的部分原因,我们认为我们将拥有性能最好的模型,因为我们拥有大量数据。Echo Prime 已经发表了,但即使在那之前,我们已经训练了一个新的 Echo Prime 版本,用于这个临床试验,它的数据集大小大约是原来的 10 倍,我们希望这能提高模型的性能,并使其更有可能表现出色。第二点我想说的是,我和 Roxanna 一起是《新英格兰医学杂志 AI》的编辑,如果你有任何正在做的事情,请投稿给我们。我们总是很感兴趣,如果我们觉得有趣,我们会很快给你反馈。但我们的北极星实际上是前瞻性的部署,无论是随机对照试验还是临床试验,还是仅仅是质量控制。但我们对跨放射学模型的开发和部署都非常感兴趣。而且,再次强调,心脏病学在很大程度上复制了放射学。我是美国超声心动图学会影像指南注册表的负责人,我们非常钦佩 RSNA 所做的一切。所以我们正在创建一个公开可用的超声心动图图像注册表,我们希望它能成为商业和非商业选项的外部测试集。我们认为这正是社会应该做的。因为目前至少心脏病专家看到很多公司的营销宣传,比如我们的模型是完美的,但有很多犹豫,因为我认为并非所有模型都是完美的,但一个外部基准,它们没有在其上训练,作为社会来说是值得的。

好的。嗯,很高兴来到这里,非常感谢这次采访。

这是一次精彩的演讲。感谢您向我们介绍了如此多的精彩技术开发、临床试验和相关部署。感谢您耐心回答我们所有的问题。

不,不,我喜欢这些问题。我知道我们正式还有一分钟左右的时间,但我认为大卫还有几分钟时间。所以,也许我们可以再进行一些问答。所以,如果你有什么问题,请。是的,这是一次精彩的演讲。我实际上,你能回到关于曲线的最后一张或倒数第三张幻灯片吗?是的,我认为正如你在这里展示的,它是一个学习曲线,似乎很快就达到了平台期。所以你已经用这么大的数据集进行了训练,我只是想知道下一步是什么?你是要继续包含越来越多的……回声数据,还是要去模型方法?因为我认为回声提供了绝对必要的信息,但它只是临床数据的一种模式。我只是想知道你是否考虑包含一些,例如,病人的样本,或者一些……让这个诊断更加准确,不仅仅是暗示性的,而且也许真的能直接帮助临床医生做出诊断。

是的,这是一个非常好的问题,也许这是一个令人不满意的答案,但答案是两者兼有。我们正在创建多模态模型以及具有大型数据集的单模态模型。我们使用的许多多模态方法的限制是,你使用的模态越多,然后你限制所有输入都需要所有模态,数据集就变得越来越小。所以我们所做的就是,我们有一个名为 Cleric 的多模态模型,然后,如果你使用同时拥有心电图、超声心动图、造影剂和胸部 X 光片等所有这些的子集,它就会变得越来越小,因为很多时候人们没有所有这些模态,然后,你可以进行审查,或者你可以使用 NAS 进行许多对比方法,但它变成了一个非常微妙的问题,这是否比仅仅更大规模的单一模态数据更有帮助。我们的内部试验表明,它并不比单一模态的大量数据更优越,但我认为这仍然是一个开放的研究领域。

和你一开始展示的关于鸽子的幻灯片一起。这篇论文的一个有趣之处在于,在这项研究中效果最好的是将多只鸽子串联起来,让它们作为一个群体投票。在机器学习术语中,你创建了一个分类器集成。

我想知道,在同一意义上,你是否尝试过在你的 Echo Prime 方法中使用多个代理协同工作?

这是一个好问题。我认为我们尝试过的最接近的是我们尝试过各种加权方法,因为我们实际上会为每个视频获得一个推理。所以我们很多多实例学习都是关于特定的视图视频,以及……我们实际上有大约一百票,但我们如何优先考虑每个视频的投票,这就是我们正在做的很多工作。我们还没有像从头开始训练不同的权重然后做同样的事情并对它们进行平均那样多的尝试。

是的。在放射学中,有人试图调整采集大小,使其更适合人工智能分析。你说你有 100 个视频,也许你只需要 10 个。你认为将来超声技师能否得到一个信号,你已经完成了你需要的,并缩短了时间?

是的,我认为这非常有可能是目标。我认为,如果你能实际缩短采集时间并进行插值,那么有很多价值,很多影像数据是重叠的。所以我确实相信我们花费的时间比绝对最小值要多。

我能问一个完全相反的问题吗?这是基于你关于 CKM 的幻灯片。我们一直在关注心脏病,或者……你知道,肝脏疾病。但也许对于每一次超声心动图,我们都应该始终评估肝脏,我们都应该始终评估其他器官。你是否认为像这样的方法有价值,特别是当它们由人工智能辅助时,这样我们就不必花费 20 分钟让超声技师来做,但你是否觉得这就是我们应该发展的方向,我们希望尽可能全面地分析整个身体?

是的,我……作为一名临床医生,我……抱歉,作为一名研究人员,我非常赞成这种方法,因为我认为正如你所提到的,很多时候你不知道你不知道什么。这与我对图像采集问题的回答类似,图像采集问题很难,因为我们不存储数据。你作为常规时间安排工作流程的一部分而获得的越多,未来的机会就越多。而且,如果你从全球角度来看,这实际上是我认为美国在医学人工智能领域占主导地位的原因,因为美国实际上比世界其他地方进行了更多的采集和更多的成像。对于超声心动图来说,这可能实际上是……比如说在中国或印度或其他地方,他们只采集两三个图像或 10 个图像,所以这是不够的,他们无法像我们在现实生活中那样训练模型。

好吧,非常感谢大卫抽出时间与我们分享所有这些精彩的研究。让我们再给大卫一次掌声。感谢大家的到来,下次再见。