📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

IFDS Workshop–Global Convergence of Over-Parameterized gradient EM for Learning Gaussian Mixtures

Paul G. Allen School46:37

Transcription

最后,也是最重要的,呃,我们有来自 UDub CSSE 的 Simon Duke。嗯,他在 CMU 读了博士,呃,在普林斯顿做了博士后。嗯,他研究了许多关于深度学习理论、表示学习、呃,强化学习的基础性问题,呃,获得了许多奖项,职业生涯奖、斯隆奖、呃,人工智能奖,呃,请您开始。>> 好的,谢谢介绍,很高兴见到大家。呃,今天我将讨论一个呃经典的混合高斯模型学习问题,使用一个经典的算法呃呃呃 EM 或期望最大化,基本上我们证明呃它确实有效。呃,这是与我的博士后 Mojo、我的博士生 Vhong Shu 以及 Mariam Mo 和 Vehan 的合作成果,他们都由 Mariam 和我共同指导。好的,我们开始吧。呃,这次演讲是关于学习高斯混合模型。嗯,我认为在座的各位都了解它。嗯,它是一个非常基础的呃生成模型,呃,在建模,尤其是多模态数据方面被广泛使用,呃,学习这个模型,可以说呃最流行的算法是呃期望最大化算法或简称 EM,或者像梯度 EM 这样的变体,我稍后会给出精确的公式,但这些可以说是学习高斯混合模型最流行的算法,好的,嗯,让我们深入细节。呃,所以这里我们考虑真实情况,假设我们有一个具有 m 个分量的真实高斯混合模型,好的,那么密度函数可以这样写,嗯,假设 i 从 1 到 m,然后 pi* 是混合权重,然后我们有这个 phi mu* x,mu* 是第 i 个高斯分量的均值。呃,x 是任意点,然后 phi mu* x 在符号上就是这个高斯密度函数,这里我们只考虑单位协方差的情况,最简单的情况,好的,然后我们有这个 pi*,它们加起来等于 1,它们是混合权重,所以这是一个真实模型,我们可以假设我们从中获得了一些样本,我们的学习模型,你可以看到这里我们使用了不同的符号 n 而不是 m。所以这里我们允许分量的数量与真实情况不同。呃,但我们有相同的格式,我们有 i 从 1 到 n,pi i 和 phi mu i x。好的,所以这是我们的学习模型。基本上这里我们想要输入呃 mu i 和 pi i。好的,所以 mu i 和 pi 是学习模型。好的,呃,所以我们的目标是恢复 gu*,它是真实的高斯混合模型,呃,在这里演讲中,呃,红色的星号是真实的高斯均值,蓝色的十字是我们学习的均值。呃,所以这里你可以看到我们 n 可能不等于 m,当 n 大于 m 时,我们称之为过度参数化,因为我们拥有比学习这个高斯混合模型所需更多的参数,呃,当 n 等于 m 时,我们称之为精确参数化,好的,现在我们来谈谈 EM。呃,所以这是我们顶部的模型,它是一个迭代算法,嗯,假设你有一些初始化,对于 E 步,基本上就是计算每个数据点的成员资格或成员资格权重。假设对于数据点 X,我们计算它实际上是从第 i 个分量采样的概率。好的,分量。所以分子中有这个,呃,在 TC 迭代中,在呃分母中,我们有这个呃总概率,然后在呃分子中有对应的权重,对于呃第 i 个分量,即 X 从第 i 个高斯分量采样的概率。所以现在我们有了所有数据的分配权重,然后,给定这些分配权重,我们通过这个 Q 函数更新 pi 和 mu。基本上我们固定这个成员资格函数,然后我们尝试在 pi 和 mu 上最大化似然性。呃,这里你可以直接解决这个优化问题,或者你可以只运行一步梯度来更新你的 pi mu 作为 EM 算法的梯度变体。好的,好的。所以实际上有一系列关于这个主题的工作,例如第一行是 CA 和 Martin Binu 的工作,他们表明,这是我们称之为精确参数化设置,并且 m 和 n 都等于 2,我们想要学习一个二元高斯混合模型,你的模型也是二元高斯混合模型,他们使用凸分析进行局部收敛分析,呃,以及 Bad Daniel 等人的工作,还有一些其他工作也研究了 m=n=2 的情况,但与 Civa 的工作不同,Civa 的工作需要某种程度的良好初始化,你的 mu 已经接近真实情况,在这项 Daniel 的工作中以及其他几项工作中,他们表明你可以对 mu 或均值进行随机初始化,然后你只需要运行 EM 就可以收敛到恢复的真实情况。好的,然后第三行有一些工作,PI 证明,如果你对你的学习均值有良好的初始化,那么局部来说,你实际上可以通过运行 EM 算法来收敛到真实情况。这是第三行,然后第四行实际上是关于过度参数化的。好的,所以我们,真实情况只有一个高斯分布,然后如果你有一个,但但假设你不知道,但你想用两个高斯分布来拟合这个高斯分布,这仍然是一个非常棘手的问题来分析,然后有一项工作,第四行,这两项工作表明你仍然可以实现全局收敛,它实际上比学习一个高斯分布要困难得多,而且你也在使用一个来拟合。呃,还有一些关于过度参数化的工作,例如局部情况,例如这里你可以允许 m=3,n=2,去年我们有一项工作,假设真实情况是一个高斯分布,但我们有任意数量的高斯分布,我们可以建立全局收敛,这是由我的学生 Vhong 和 Mariam 以及我完成的,以及倒数第二行我想提一下也是由 SA 和 Chien Jang Bin 等人完成的,他们表明这实际上是一个负面结果。好的,他们表明了关于精确参数化的一些负面信息,当真实情况有三个或更多的高斯分布时。好的,他们构造了例子表明,如果真实情况有三个高斯分布,你的模型也有三个高斯分布,然后你进行随机化,那么我们会陷入一些局部最小值。所以你不能,或者很有可能,你无法恢复真实情况,如果你只运行随机初始化 EM 或梯度 EM,你会陷入一些局部最小值。所以这就像,如果 m=n 或大于 3,那么存在一些局部最小值,并且你很有可能收敛到那个局部的虚假最小值。好的,这表明了一些负面结果。好的。所以这里,这是 SA 的工作,而我们的结果是最后一行。好的。我们展示了过度参数化的力量。所以这里,假设 m 是任意的,但如果我们的学习模型的高斯分布数量 n 大于或等于 m log m 的尺度,你可以识别一些与优惠券收集器相关的东西,这就是为什么我们有这个 m log m 项在这里,那么实际上我们可以建立从随机初始化的全局收敛,然后你只需要运行梯度 EM,你就可以恢复真实概率分布,好的,看到了,这就是我们的主要结果,嗯,所以这里,基本上这验证了文献中一种长期存在的民间传说,或者优化,比如 n 大于 m,改善了这个优化景观,并使得 EM 或梯度 EM 全局收敛到真实的高斯混合模型。例如,Sanjoy Deshpande 和 Leonard Schulman 的论文,他们研究了 EM 的一个变体,比如两轮,他们表明你可以,在有足够的分离和几个条件的情况下,使用一些截断方法,但他们表明过度参数化是有用的,这与优惠券收集器有关。好的。所以这里,我们的结果是第一个严格的分析和证明,对于 n 大于 m 的一般情况,从随机化到收敛到真实情况,如果你有足够的样本。好的,关于结果有什么问题吗?>> 是的,局部收敛是怎么回事?>> 所以最终在这里,就像你,它是一个负面结果,基本上表明如果你进行随机化,那么你就会陷入一些局部最小值,你没有恢复真实情况,而局部在这里意味着如果你从良好的初始化开始,那么你实际上恢复了真实情况,是的。>> 所以你能评论一下你的分离条件吗?>> 是的,我稍后会在我们的接待中讨论分离条件,它通常比你不需要使用 EM,比如 SOS 或那些算法所需要的要差得多或强得多。>> 不需要任何东西。>> 不,不需要分离。>> 对,你不是在做参数估计。你在做密度估计。所以你不需要任何分离。>> 呃,>> 理论上你不需要任何东西。>> 是的,没错,没错。是的。所以这里我们只是想研究为什么这个特定的算法有效。这与获得更好的依赖性或类似的东西无关。是的。还有其他问题吗?是的。呃,这似乎是你所说的,因为 m=m 的形式是最优的,呃,次优的,然后它是过度参数化的,它会变得更好。>> 呃,它在优化角度上变得更好,就像你可以避免局部最小值并收敛到全局最小值。>> 是的。呃,抱歉,你问的是双下降。Wend 更侧重于近似理论和统计方面,对吧?这是关于过度参数化,优化收益。好的,还有其他问题吗?>> 我是说,随着 n 的增加,对吧,因为你会 >> 呃,所以这里因为我们假设了一个真实的高斯混合模型,所以只要你收敛到全局最小值,意味着你的损失为零。所以,比如说,这里我们主要研究了优化方面。所以我们基本上研究了无限样本的情况。>> 不,但我想,随着你增加 n,如果你运行优化,我想它应该是单调的,对吧?我想你近似得有多好?>> 呃,是的,是的,那是肯定的。呃,是的,还有其他问题吗?好的。嗯,好了。所以现在我们来深入一些技术细节。嗯,所以这是真实情况 P*,这是我们的学习模型。所以首先,一般的观察是,如果你应用梯度 EM,它基本上等同于在 P* 和 P 之间的库尔巴克-莱布勒散度上应用梯度下降,比如说,从这里我将基本上假设我们有无限多的样本,并且只关注优化方面,好的,所以这里我们分析的具体算法,这里我们只进行随机初始化,每个 mu i 的初始化,我们只是从真实情况中随机采样。所以如果你有有限的样本,等价于随机选择 n 个样本,我们使用这些样本作为初始化,这里假设我们有无限多的样本,或者等价地说,初始化是从这个分布中采样的。好的,我们有 n 个呃 mu,这是我们的初始化,然后我们有混合权重 pi i 有 n 个分量,每个我们只是初始化为 1/n,好的,为了更新 pi 和 mu,我们只是固定 mu,然后优化 pi,这实际上是一个凸规划,所以我们假设我们只是解决它,然后对于 mu,我们只是应用一步梯度下降到 mu,固定 pi。好的,这是一个梯度 EM 的变体。所以 pi 的更新是凸的,你可以将这个问题看作是,你有一个无限大的步长,对于 pi,以及一个较小的步长,对于 mu,来模仿这个更新。好的,好的。所以这是我们的假设。呃,首先,我会说这些假设相当强,并且我们相信有很多方法可以改进它们,但让我为了准确起见,陈述一下算法,这里的假设,所以首先,我们假设,所以为了简单起见,这可以在我们的论文中放宽,pi* 和 pi* 的最大值和最小值,它们的比率是数量级为 1,好的,这可以放宽。如果你有其他比率,那么数量或金额或量化将取决于这个比率。好的,但为了简单起见,让我们假设它是 1。然后,嗯,这是我们的假设。好的,首先,我们假设这个 mu*。如果你只是把它们看作一个矩阵,那么这个矩阵是满秩的或线性无关的。这再次是为了技术原因,而且实际上你不需要它,在实践中,或者我相信在理论上你也不需要它,但这里出于技术原因,我们需要它,因为这与我们将其问题归约到一些矩的质量有关,在那里我们使用这个线性无关的一些性质。>> 是的,在我们的界限中,我们对数量有依赖。是的。我们也有一个界限。我们假设这个,比如一些正则性条件,比如 mu*。它们是上限和下限的。我们还有这个分离条件,这再次非常强。它是平方的,你知道,只是学习一个高斯混合,在精确量化的情况下,你需要像 k 的平方根。所以它肯定要强得多,这是一个开放的问题,如何进一步放宽它,或者也有可能 EM 有根本性的问题,你无法学习。真实情况,具有小的分离,但基本上在这项工作中,我们证明了具有这种强分离假设以及其他条件,EM 或梯度 EM 确实有效。>> 所以 mu 的算法,均值,我的意思是,它取决于你如何初始化。>> 采样它们,比如它们。>> 是的,如果你采样它们,比如说,从一些,比如在设置或一些先验中心,如果你喜欢,如果我们假设它们是居中的,那么它们就会没问题。好的,没问题。>> 是的。>> 呃,是的。所以一个满足这些条件的例子是贝叶斯设置,你有一些每个 mu 也从某个高斯分布中采样,带有某个 delta,然后如果你 delta 足够大,它将满足这些条件。好的。所以有了这些假设,这是我们的主要结果。如果 n 是 m log m,并且你使用了足够小的步长,那么梯度下降就会全局收敛到 p*,在初始化 u 上以多项式速率,所以它不是像精确参数化那样是线性收敛,这里是次线性速率,在模拟中我们确实看到了,在过度参数化情况下这是不可避免的,我稍后会展示一些模拟。所以这是第一个全局收敛,用于学习高斯混合模型,对于 n 大于 2,使用梯度。然后如果你想要更复杂的分析,有一个简单的技巧,比如在每次迭代中使用一些新的样本来估计梯度,然后你在每次迭代中都有独立性,所以你可以得到一些,而且因为它是多项式收敛,所以总的来说你仍然有学习它的多项式样本数量。但当然,我们当前的界限不是紧的。所以另一个开放问题或方向是研究 EM 算法的紧样本复杂度。我想将其与 Chin 等人的负面结果进行对比,他们表明,存在分离的高斯混合,EM 无法收敛到全局最小值。所以这与我们的正面结果形成对比,我们确实看到了过度参数化的力量,过度参数化确实有助于你收敛到全局最小值,在设定的条件下。>> 是的,所以当你谈论收敛时,你是在看总变差距离,比如当前和真实情况之间,还是其他什么?>> 基本上是什么样的收敛,损失,基本上。>> 是的,这意味着。>> 好的,这里,让我先讨论一下为什么过度参数化有帮助,基本上是优惠券收集器的直觉。好的,假设分离足够大,好的,基本上在随机初始化下,使用这个初始化,那么,只是通过优惠券收集器的想法,你可以证明,对于每个簇 L,我们总共有 M 个簇,至少有一个 mu i 是从这个高斯分布中采样的,使得 mu i - mu*,这是真实情况的均值,所以以二范数表示小于 d 的平方。这是直觉,假设我们有三个分量,像这样,如果你有 M log M 的数量级,那么对于每个真实情况,你至少有一个初始化接近,在这个意义上,小于 d 的平方接近这个真实情况。这是优惠券收集器,这实际上是一个失败的情况,所以这里你有两个初始化接近这个均值,一个初始化接近这个均值,而这个远离这三个。在这种情况下,实际上如果你运行模拟,你会发现它们会陷入一些局部最小值,在这种情况,被称为许多论文称之为“一个对许多”现象,基本上是这个,因为接近这个均值和这个均值,所以它会卡在这里,而这个 mu 不会移动太多,如果你运行模拟,你会得到这样的现象。这实际上是一个失败的情况。但如果你有,你知道,对于每个高斯分布,你有一个接近它的 mu,那么最终它会学习高斯分布。好的。另一个方面,这实际上与之前的许多工作不同,在之前的许多工作中,他们实际上并没有更新 pi,在精确参数化中,他们只是将 pi 设置为真实情况,或者只是一个,所有都是一个或 m,但在这里,因为我们在过度参数化状态,我们确实需要更新这个 pi。所以,例如,这个 pi 对于这个来说,它可能会收敛到零,如果它没有收敛到任何真实情况。所以这实际上是我们观察到的一个现象,你也可以在模拟中观察到。好的,所以这里,让我更详细地说明一下。好的,所以第一个图,我们比较了精确参数化和过度参数化。所以对于蓝色曲线,我们有五个高斯分量,我们也有五个分量。它们实际上陷入了某个局部最小值,比如这里,你可以看到这里的损失相当大。然后如果你进行过度参数化,损失会减小,对应于橙色和绿色曲线,它们会持续减小,并最终收敛到全局最小值。好的,所以这是损失,你可以看到这里,这不是线性收敛,它实际上也是次线性收敛。好的,现在我们来看中间的图。这是精确参数化的情况。再次,红色的星号是真实情况,而十字是我们学习的均值。你可以看到,对于一些真实情况,我们确实收敛了。例如,这个收敛到真实情况。这个也收敛到真实情况。但对于另一些,它可能不会收敛到真实情况。例如,对于这个真实情况,没有 mu 收敛到这个真实情况。所以这是一个失败的情况,我们没有恢复高斯混合。而对于这个,这是过度参数化的情况 n=10。你可以看到,对于每个高斯真实情况的星号,至少有一个均值的十字收敛到真实情况,例如这个,这个,这个,这个,这个,好的,你也可以观察到一些均值没有收敛到任何真实情况,比如这个,这个。所以这些不是真实情况,它们对应的 pi,它们的混合权重将收敛到零。好的。所以实际上我们有这个 if-else 条件,比如最终你会收敛到真实情况,或者你的混合权重将为零。好的。所以这就是可以观察到的。我还有大约 15 分钟。这里我将讨论主要的技巧挑战,但主要思想来自前面的幻灯片。还有其他问题吗?是的。如果我不关心 m,比如 m,比如我过度参数化更多,可以放松平方假设,比如如果数量是 d,那么 d 将会放松初始值,比如。>> 我认为 m log m 是必需的,因为它是优惠券收集器问题,所以你需要,它有这个一个均值对应一个真实情况均值,你的问题是我们能放松它吗?>> 不,不,比如让它更大,比如 n 等于,但是放松分离假设。>> 哦,我明白了,我明白了,是的,这是可能的,我认为,我们没有,虽然我认为我们当前的证明无法通过,但是的,我认为这是可能的,而且我们当前的,我想说,我们当前的分离条件也比需要的要强。所以它应该可以被收紧。好的。现在我们来深入一些技术细节。所以第一个想法是我们必须有这个 se,我们学习的均值的划分。所以请记住,我们有 n 个均值想要学习,我们将它们分成 m 个集合。好的,基本上对于 SL,对于所有均值 mu i,使得它们是最接近 mu l* 的均值,而不是其他均值。好的,所以基本上你只是划分空间,使得我们把均值或 mu i 分组到它们最接近的底层高斯真实情况。好的,这就是我们的划分。正如你在这里看到的,如果你进行过度参数化,很有可能每个集合至少有一个分量。但如果你不进行过度参数化,那么你可能会有一个空集,这就是我们的分析无法进行的原因。好的,所以有两个挑战与之前的作品不同。一个是,正如我所说的,我们需要更新这个 pi,并且 pi 可能会收敛到零。这实际上是一个复杂的问题,我敢说比之前的作品要复杂得多。嗯,所以这实际上是过度参数化情况下的一个独特之处,你知道 pi 可以为零。二是所谓的交叉项,这有点技术性,但基本上,在你的梯度中,有来自你最接近的真实情况簇的项,也有来自其他簇的项,这些就是我们称之为交叉项,而且它们不为零,即使在全局最小值处。但你也需要找到一种方法来处理它们。好的。嗯,是的,这是主要的两个技术挑战。所以在这里,在我们的证明中,实际上有一个两阶段的证明。一个是全局收敛,一个是局部收敛。对于全局收敛,我们只是想让损失收敛到某个阈值以下,低于某个阈值。然后对于局部收敛,我们真的想收敛到零,并且从某个阈值开始。整体策略与最近关于非凸优化的工作一致,即对梯度进行下界。基本上这是 PL 条件。如果你有一个梯度下界,由损失给出,就像你有这样的形式,那么你就可以证明全局收敛。这是一个标准的 PL 条件,然后收敛速率取决于这个多项式。而证明这一点的一般想法是构造一个下降方向。比如说,这里,让我们考虑关于 mu 的梯度。比如说,我们需要构造 delta 1 到 delta n,使得这是下降方向和我们的梯度之间的内积。你可以证明,这个内积,或者下降方向和梯度的内积大于损失函数的多项式,那么它就意味着 PL 条件的梯度下界,然后我们可以使用 PL 条件来证明全局收敛。好的。关键部分是如何找到这个 delta 1 到 delta n,以及如何建立这样的条件。好的。所以这是我们全局阶段的结果。好的。所以我们的阈值只是指数级的,负的,分离的平方。好的,基本上它是收敛到非常局部的情况,这是我们的第一个阶段目标,我们的结果表明,经过这个数量的迭代,其中 t 是子迭代,你可以收敛到低于这个阈值的损失。好的。下降方向实际上相当自然,它只是你的 mu i 和真实情况 mu* 之间的距离。比如说,这个 mu i 属于这个 SL,你知道,对于 mu l* 的集合。所以下降方向只是 mu i 和 mu* 之间的差异,以及如果你计算这个项和梯度的内积,你可以证明它大于 1/d 或平方 log。好的,所以这里我们有 d,因为这只是为了全局阶段,在局部阶段,实际上我们不需要任何这种硬阈值。我们只想要右侧的损失。但对于全局阶段,基本上当我们收敛到 1/d 时,我们就在这个阈值处。好的。嗯,好了。所以这是我们的目标,基本上,下降方向是这个,抱歉,有点小,它是这个黄线。这些是下降方向。这是我们的均值 mu i 和真实情况 mu* 之间的差异。好的。好的。所以这里有一些技术细节,但基本上我们可以证明这是下降方向和梯度之间的内积。主要有两个项。我们称第二个项为交叉项。所以这里我们有一个符号 s,它只是一个成员资格函数,一个特定 x 的第 i 个分量的成员资格权重。所以你可以观察到,这个 si 随着分离呈指数级的小,如果 i 不属于 sj,那么这个对应的 k 将呈指数级的小。所以你可以看这个项。基本上第二项是指数级的小。它们是,比如指数级的负 d 平方。同样,对于第一项,如果 l 不等于 j,那么你有一些指数级的小项。所以只剩下项,至少对于全局阶段,只剩下 i=j 的项,在第一项的形式中。所以这是我们可以做的一些简化。好的。所以为了分析这个项,我们实际上需要一些关于厄米特多项式的技术。所以这只是一个非常简短的介绍,对于一维情况。基本上这是一系列正交于某个底层分布,比如高斯分布的多项式。你可以就像为了你的分析一样,将任何函数展开成这个多项式基,带有一些系数。而厄米特系数就是你的函数和厄米特基的第 k 个多项式之间的内积。有一个有用的事实是,如果 x 来自高斯分布,那么对于这个求值,第 k 个多项式实际上是 mu 的 k 次幂的张量积,对于多维情况。所以这是我们的主要想法,让我们看看这个项。所以我们只考虑第一个项中的 l=j 项。你可以这样写。好的。所以我认为我们分析的主要收获是,如果你使用厄米特多项式展开的前两项,你最终得到这两项来展开这个项,你得到这两项,然后你可以得到这个不等式,并且你可以使用这个不等式来界定损失。所以我知道这有点技术性,但主要收获是,这里你可以忽略那些指数级小的交叉项,并关注等于 alj 的项,并且为了分析这个项,将其与损失联系起来,你进行厄米特展开,然后你最终得到与均值和 pi 相关的东西,你可以使用这些来界定损失,这是我们分析的主要收获。所以这是全局阶段的第一部分。这是局部阶段,我们想表明,从一个非常小的损失开始,然后随着 t 趋于无穷大,我们可以让损失收敛到零。这与之前的精确参数化工作非常不同,在精确参数化中,基本上可以证明某种强凸性。这里,请记住我们有一些现象,pi 可能会收敛到零。所以它不是真正的强凸,也不是凸的,所以我们需要一些分析。我们需要的下降方向是一个更精细的下降方向,我们只考虑那些已经非常接近真实情况的 mu i。所以,因为其他的,比如说,我们有一些 mu i 不在任何 SL 附近。所以它不接近任何真实情况的均值。对于那些 mu i,它们对应的混合权重 pi ii 将收敛到零。所以这是一个整合,但我们进行了一个精细的分析,我们只看那些已经接近其中一个高斯均值的 mu i。所以这里的关键挑战是如何处理交叉项。所以请记住我们有这个项,我们说它是指数级小的,然而,如果我们想证明它收敛到零,即使它指数级小,我们仍然需要处理它们。所以我们的想法如下。所以我们对这个项进行泰勒展开。我们最终得到一个真实项,它只与真实情况有关,以及一个扰动项,我想证明随着我们应用梯度下降,这个项将收敛到零。第一项,我们称之为线性项。你可以看到这里它只与 pi* 和 mu* 有关。所以这是来自真实情况的 pi 和 mu,我们想证明在这个集合中,它们的 pi 和 mu 的和收敛到这个项。所以我们称之为线性项,只是一个一阶厄米特展开。而在精确参数化的情况下,实际上存在一对一的映射,mu i 和 mu* 之间,但在我们的情况下,我们有过度参数化,所以同一个集合中有多个 i。而且,我们还需要第二项,因为 pi i 可能会收敛到零。所以我们实际上需要第二项来证明,在某些情况下,pi 可能会收敛到零。这就像我们称之为厄米特展开的第二项。这是一个加权的,称为加权个体距离平方。但你可以看到这里是 pi 乘以 mu i - mu* 的平方。所以在这种情况下,要么 mu i 收敛到 mu*,要么它对应的 pi 将收敛到零。所以这就是你需要,为了精确参数化或精确恢复真实情况。而这显示了过度参数化。所以这些是直觉,我们想表明,这些很小,这是某种可识别性条件,即要么 pi 趋于零,要么 mu 收敛到 mu* 之一。所以这些就是我们称之为可识别性,以建立这个。所以基本上我们想表明,当损失趋于零时,pi 和 mu 收敛到 pi* 或 mu*,意思是 pi i 趋于零或 mu 收敛到 mu* 之一。所以关键思想是我们需要一些技术思想,一个是用这个测试函数。好的,我们需要将这个损失与我们之前谈到的参数误差联系起来。所以这里我们使用一些,一般的想法是使用一些测试函数 G,使得测试函数 G 的平方根界定了,你可以看到这里基本上是 G 的期望值 P 和 P* 之间的差异,我们进一步将这个期望差异与参数误差联系起来。而参数误差就像我们所说的,它是可识别性条件,比如线性项收敛到零,这个二次项收敛到零。所以我们如何处理这个?库尔巴克-莱布勒散度通常很难下界。所以这里我们使用,我认为术语上称为同伦方法。基本上我们选择一些 theta 来插值 P 和 P*,在我们的情况下,theta 可以选择为 1/2,只要是一个常数,我就可以得到一个多项式界限。这是一个现有的不等式,非常有用,你可以对库尔巴克-莱布勒散度进行下界,它被界定为 1 - theta log 1 / (1 - theta),然后我可以将损失库尔巴克-莱布勒散度与一个二次项联系起来,我们知道它更容易处理。好的。所以这里我们基本上使用这个不等式。所以,比如说,我们有一些测试函数 g,我们将其除以 pa,然后我们放上期望值,然后我们使用柯西不等式来界定这个项,作为这个部分和 g 平方在某些 p theta 期望下的平方根。而对于这部分,我们用 L 来界定。所以这里我们使用像这样的不等式,这部分被损失界定,如果我们选择 theta 为某个常数。也与某些 p theta 范数下的测试函数 G 相关。但只要 theta 是常数,G 的范数就是有界的。所以我们有一些,如果你不关心多项式速率,那么我们就有损失的平方根界定了这个期望 G 在 P 和 P* 之间的差异。所以主要收获是这是一个非常有用的不等式,你可以用它来界定或下界 KL,并且与测试函数思想结合,它给出了一个非常有用的界限。其次,我们如何选择这些测试函数,我们实际上只是选择定义测试函数为厄米特多项式和一些基本上是单位的或均匀的向量。好的。所以如果你选择像这样的测试函数,k 次厄米特多项式和一些单位向量,那么根据厄米特多项式的这个性质,我们可以重写这个函数 g 的期望差异,作为均值和 pi* 的矩的差异。好的,所以这就是主要思想,这里你可以使用厄米特多项式,这是一个非常有用的工具,可以将那些损失与 pi 和 mu 的矩联系起来,然后其余的基本上是一些,我们可以使用现有的关于使用质量矩来界定这些项的想法,并且这是一个工作,你知道,使用而不是使用 EMA,而是使用质量矩来学习高斯混合,并且我们可以建立条件或联系,使用厄米特多项式,并且我们可以重用其中的一些想法来建立我们的最终界限。这就是我们的主要想法。嗯,我认为时间已经到了,所以我可以回答一些问题。 [掌声] 所以,如果你在这个人口景观上运行了 Kines,那么你就会陷入像 e 的负平方这样的东西,对吗?>> 你运行 Kines?>> 是的,然后我不知道如何将其转换为密度,但可能有一些方法可以做到。我认为可以证明,如果你进行过度尝试,你仍然可以非常接近真实情况。>> 是的,因为在我们的模拟中,这与 EM 类似,它是一种硬截断,所以你失去了尾部的差距,这是否会停止?>> 哦,我明白了,我明白了,这是个好问题。是的,这是可能的。我们没有尝试过,但这是可能的。>> 是的。>> 有什么能阻止你在欠参数化情况下使用这个分析来理解参数会收敛到哪里吗?>> 所以,有些部分将无法通过,因为会有一些空的 SL 集,比如在划分中,而那些,没有好的方法来分析,我认为那是难点,比如你有一个空集,以及如何,我认为。>> 在这里我们仍然可以在这个框架中进行分析,因为我们可以分析不同簇之间的相互作用。是的。是的,我认为是的,我们可能已经是的,我们可能已经得到了欠参数化情况下的某些表征,即使在精确参数化的情况下,我想取决于初始化。>> 我只是想感谢大家的参与,代表组织者,Rob、Maria 和我,感谢大家的到来。 [掌声]