📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

ABFR Webinar with Semyon Malamud and Paul Schneider

AI & Big Data in Finance Research Forum1:02:07

Transcription

[音乐]

您好,欢迎大家参加本次关于金融领域人工智能和大数据研讨会。我们非常荣幸今天能有两位杰出的演讲嘉宾。首先是来自瑞士学院的 Simon Mamut,他将介绍他的论文《AP 或 AIP:大型因子模型的惊人主导地位》。然后是来自洛桑大学的 Paul Schneider,他将就这篇论文进行讨论。

我们的会议结构是:首先是 30 分钟的演讲,然后是 20 分钟的讨论,最后是问答环节。如果您有任何问题,请在问答区提交。本次演讲正在录制中。演讲结束后,我们将进入未录制环节,愿意留下来的朋友可以继续参与。

Simon,请开始。

感谢 Serge,感谢大家的邀请。我非常高兴能在这里做这次演讲。

有些人可能已经看过这个演讲的不同版本,特别是这篇论文以前有一个不同的标题。

这篇论文的标题是《AP 或 AIP:大型因子模型的惊人主导地位》。这是与 Anto Digim(现任墨尔本大学)、Bar Kay 和 Brian Kelly 的合作成果。

正如你们在这里看到的,我们提到了大型因子模型,这明显暗示了大型语言模型,以及更广泛地说,我们今天观察到的那些主导机器学习领域的“大模型”。

关于这些模型最重要的观察是它们很大,拥有非常非常多的参数,而且这些模型效果非常好。这似乎与经济学中占主导地位的奥卡姆剃刀原则相悖。我们都是这样受训的,我们被训练去构建真正简洁的模型,试图用最简洁的方式来解释我们观察到的现实。

正如我们所知,今天的大型机器学习模型,例如巨大的 GPT-4,拥有大约两万亿个参数。如果你想一想,这简直是荒谬的,你怎么可能训练出这样的模型?它们怎么不会严重过拟合数据?它们怎么能进行样本外预测(无论你如何定义它,比如语言模型)?

你到处都能看到这一点。在图像识别、音频识别、政府使用的监控软件中,它们都使用巨大的模型,并且非常成功,能够进行样本外预测。

此外,人类似乎也做同样的事情。我们所有人,即使只有很少的观察数据,也会试图构建非常复杂的模型来理解世界,寻找因果关系,并找到我们观察到的、用于解释数据的特征。

所以,似乎我们的大脑也被设计成基于很少的观察来构建拥有大量参数的大型模型,这与机器学习今天的做法是一致的。

在金融领域,也发生了类似的发现。今天许多分析师实际上已经发表了提供经验和理论证据的论文,证明了这一点。你可以构建拥有大量参数的大型机器学习模型,它们在解释横截面股票收益方面确实能够进行样本外预测。

我们最近与 Brian Kelly 和他的学生 Kino 合作的一篇论文,已发表在 JF 上,我们表明在某些技术条件下(请记住,任何理论结果总是在技术条件下出现的),简单机器学习模型的样本外性能实际上会随着参数数量的增加而增加。如果你想最大化样本外性能,你应该将参数数量推向无穷大。

当然,在这里你可以问,这些信号从何而来?你从哪里获得无穷多的信号?在这些模型中,你可能只有少数几个实际起作用的信号,比如股票特征,但你可以构建这些特征的非线性变换。这就是你可以饱和、任意增加特征数量的方式。

事实上,你会说,但许多这些特征可能非常嘈杂,也许信息量不大。但有趣的是,在这里的某位(他今天也在场)最近发表了一篇精彩的论文,表明噪声甚至不是问题。事实上,你甚至可以,也许应该将噪声添加到你的特征列表中,以提高样本外性能。

这些都是非常有趣的结果。通常在经典的机器学习问题中,我们考虑的是预测问题,比如你有一张猫或狗的图片,你想根据观察到的像素来预测它是猫还是狗。在资产定价中,这更多的是关于构建随机贴现因子,而不是预测。这是一个相关的问题,但并不完全相同。

在经济学领域,奥卡姆剃刀原则仍然存在,它体现在 40 或 50 年前由 Stephen Ross 开发的资产定价理论(APT)中。其思想是,在 APT 的技术条件下,贴现因子应该是简洁的,也就是说,只有少数因子是重要的,其余的都是相关的。

因此,在这篇论文中,我们引入了我们称之为 AIP 的东西——一个很酷的市场营销工具,只是一个文字游戏。AIP 是人工智能定价模型。其思想是,与 APT 相反,我们不是试图找到少数因子来解释贴现因子,而是构建非常非常多的因子。

这里我们实际上是在暗示,现代人工智能模型拥有天文数字般的特征、因子,它们用来解释数据。

我们在数学上证明了,投资组合的贴现因子性能随着模型复杂度的增加而增加,模型复杂度定义为参数的数量,从而实现了更高的夏普比率和更小的定价误差。我们为该理论找到了非常强的实证支持。

对于那些有理论头脑的人来说,我们使用的关键技术工具是随机矩阵理论。它基本上是数学的一个特殊领域,允许你使用高维方法进行回归。正如你们可能都知道的,每当你想要进行某种回归,甚至梯度下降(梯度下降只是非线性回归的一种高级形式)时,你总是被迫(有时是明确地,有时是隐含地)处理高维矩阵,某种协方差矩阵。描述这些矩阵的行为需要一个称为随机矩阵理论的数学领域。我稍后会详细介绍。

让我展示一张我们现在认为可能是论文最新版本中最重要的一张精美图片。这个世界发生了什么?想象一下,你有大约 300 个月度观测值,或者 600 个月度观测值,这可能是一个典型的特征数据集,大约 60 年的数据,等等。我们有足够多的特征,你可以列举出来。

所以,你有大约 600 个月度观测值,你想构建,我不知道,10,000 个非线性股票特征。你取标准的特征,然后将它们通过某种非线性变换。

那么问题是,你现在有了这些几千个特征,你可以用它们来构建一系列因子。标准的资产定价方法叫做特征管理投资组合。所以,我将构建这些。现在我有几千个这样的因子。

APT 会告诉你,当然,你有这几千个因子,但大多数都不重要,它们只是噪音。它们没有很高的夏普比率。如何摆脱它们?你可以做主成分分析(PCA)。你可以对协方差矩阵进行特征值分解,取你的因子,构建协方差矩阵,观察它的特征值分布,然后选择最大的几个特征值。

通常,我们通过观察分布来检测因子结构,检测我们是否处于 APT 的世界。我们看到有几个大的特征值,其余的都是噪音,我们忽略它们。

现在,我将进行一个模拟。我将构建几千个因子,模拟它们。我将模拟一组因子,其中真实的、不可观测的因子协方差矩阵具有因子结构。这就是我称之为 APT 世界的。真实的 APT 是橙色线。我将构建另一组因子,APT 失效。基本上,所有这些因子,我将假设真实的协方差矩阵是单位矩阵。

你可以看到这里的橙色线急剧上升,然后变平。这只是一个说明,只有少数特征值很重要,其余的都趋近于零。绿线是一条直线,因为所有特征值都等于一。

现在,我将对这两个截然不同的模拟进行取样,它们具有截然不同的经济结构。我将观察经验特征值分布,这就是蓝线。

所以,你在这里看到的是,蓝线是我们使用论文中描述的机器学习方法时观察到的实际经验特征值分布。紫线和红线(红线在后面,但你看不到,因为它们是相同的)是来自这两个完全不同的模拟的经验特征值分布,一个 APT 有效,另一个 APT 完全无效。

所以,这里的关键观察是,红线和紫线是重合的,并且与蓝线非常相似。这意味着,在复杂的世界里,如果你只看经验特征值结构,你无法区分你是在 APT 的世界里,还是在这个我们称之为 AI 的世界里。

这是高维模型、这些大型机器学习模型的一个普遍的、也许是直观的、也许是反直觉的特征。当你试图学习东西时,你有大约 600 个观测值,你试图估计,比如说,几千个参数,比如你想估计权重,或者你的贴现因子中有几千个因子。你无法做到。你无法用 600 个观测值估计 10,000 个权重。

所以,发生的是,你引入了太多的噪声到你的观测值中,以至于你无法再区分模型了。这是一个非常重要的见解,鉴于世界真实结构的复杂性,有很多东西你就是无法通过观察来学习,因为你没有足够的数据。如果我们有几十亿年的观测数据,那么红线和蓝线最终会发散,我们就能弄清楚是什么。但我们可能活不到几十亿年。

这是另一个精彩的实验。你可能会问自己,好吧,你试图估计,假设你试图用很少的观测值来估计几千个参数,这有多现实?答案是,大多数时候你做不到。

这是一个很棒的模拟,我每次教机器学习课时都会告诉我学生,他们应该这样开始思考:做一个模拟来选择一个非线性函数,我称之为 W(x)。我希望输入数据 D 具有足够高的维度,比如五。五其实是相当高的维度。你将模拟这个函数,累积几百个观测值,然后你想生成标签 y = Wx。没有噪声。所以,原则上,在这个模拟世界中,信噪比是无限的。没有噪声。所以,原则上,有足够的观测值,你应该能够学习真实的函数 W。

事实证明,在典型的模拟中——典型的意思是一个复杂的哲学问题,典型的意味着什么?因为典型的意味着一个典型的人类,我不知道那是什么,但大多数我谈过的人,我的学生或其他学生,他们会想出一些不可在有限样本中学习的 W 函数。

这是一个非常惊人的发现,当你第一次看到它时。数据中没有噪声,你的标签完全由特征描述。但如果数据的性质足够非线性,你就无法学习。

鉴于这个结果,考虑到金融世界的现实,这个世界可以说是高度非平稳的,数据中存在巨大的噪声,但我们却能构建出极其复杂的机器学习模型,并且它们确实能够进行样本外预测,我们实现了正的 R 方。在预测问题中,我们谈论的是月度回报率的 R 方,可能是 0.5% 或 1%,有人可能会说这低得离谱。但每当你争论它低得离谱时,就回到这张幻灯片,想想看,在一个没有噪声的世界里,你甚至可以得到零的 R 方。在资产定价的世界里,1% 其实是极其高的。它告诉我们,金融市场的真实结构以我们作为生物文明在过去几十年中开发的特定机器学习方法是可学的。这真的很惊人。它意味着股票市场的真实结构,我们在资产定价世界中试图学习的那个隐藏结构,是特殊的。它不仅仅是关于资产定价。

如果你想进一步推演这些哲学上的联想,你可以想想图像,甚至人类语言。你可以说,两万亿个参数很多,但实际上,这甚至不算多。GPT 训练的观测数量非常少,如果你考虑到数据的真实复杂性。这很惊人,因为它告诉你,我们在这个世界上观察到的一切——语言、图像、视频、音频、结构,无论什么类型的数据——它们都有结构,它们有数学结构,可以用我们作为文明在过去几年中发展起来的相对简单的数学算法来学习。

让我再举一个精彩的例子。时间不多了。你可以采用非常简单的动量信号,然后你会发现,在金融危机之后,许多人都知道的动量信号就不再起作用了。然后,如果你将这个动量信号通过非常简单的机器学习算法,它就能起作用。

令人惊奇的是,这是完全样本外的。我在 70 年代、80 年代和 60 年代训练了我的机器学习模型,然后在 1990 年代之后进行了测试,它奏效了。而且没有出现阿尔法侵蚀。这意味着,不仅数据中存在可学习的非线性,这本身就非常 remarkable(回想一下模拟示例中的幻灯片),而且意味着这种非线性结构是平稳的,随时间稳定,至少有一部分是如此。

无论 60 年代、70 年代和 80 年代的股票市场存在何种非线性,模型都能在样本外学习它们,并在 90 年代和 2000 年代奏效,甚至在 COVID 之后仍然奏效,效果差不多。这很惊人。它告诉我们,数据中存在一些普遍的非线性“按钮”,它们就在那里。这确实也给了我们这些做机器学习的人很大的希望。这很令人惊讶,因为它意味着我们正在做一些非常重要的事情。

通常,如果你开始思考人类如何学习,以及我们如何构建机器学习模型,它几乎总是归结为这个非常重要的哲学概念,称为归纳偏见。归纳偏见是一组假设,学习算法使用这些假设来做出预测或泛化到训练数据之外。

我们发现,我讨论的这个结果,即大模型有效,表明我们应该重新考虑归纳偏见和奥卡姆剃刀原则。奥卡姆剃刀原则是一种特定的归纳偏见,它是一种成功的偏见。作为经济学家,我们在这个专业领域走得很远。但现在是时候重新考虑它了。新的归纳偏见,即复杂模型,似乎能更好地解释股票市场数据。

为什么这很重要?为什么转向这种新的归纳偏见?在我看来,它提出了三个基本问题。

第一个问题是:这些复杂的统计模型到底学到了什么?这个问题到底意味着什么?让我们思考一下。我给了你那个例子,你有 600 个观测值,你想估计 10,000 个系数。你不可能用 600 个观测值估计这 10,000 个系数。你至少需要几百万个观测值。但你到底学到了什么?

事实证明,这个问题可以用现代数学技术来回答。你可以证明以下 remarkable 的结果。

任何过度参数化的机器学习模型(也就是说,它的参数数量超过了训练它的观测值数量)都会学习到现实的真实性质,或者你想学习的任何真实的非线性函数,在某个流形上的投影。这个流形的维度实际上总是小于观测值的数量,或者等于观测值的数量。

这提出了一个非常有趣、非常重要的问题,人类已经思考了很长时间。最著名的是柏拉图,这位伟大的希腊哲学家,生活在 2000 多年前。他提出了著名的“柏拉图的洞穴”寓言。

柏拉图的洞穴是什么?柏拉图认为,我们受限于我们的感官等等,我们无法真正看到现实的真实性质。我们看到的是现实在我们被锁链绑在地板上的洞穴墙壁上的影子。

今天,终于,得益于机器学习的发展,我们可以将柏拉图的这个想法严谨化。

想象一下,金融市场的真实非线性结构,我们试图学习它,把它想象成某种复杂的三维物体。我们构建的每一个新的机器学习模型,每一个新的神经网络,每一个新的学习算法,每一个新的梯度下降算法,都像是柏拉图洞穴中的一面新墙。然后,我们把这个物体投射到这面墙上,我们看着它,说:“哦,有趣,我们发现了新东西。”原则上,这些墙可以是完全正交的,在这种情况下,投射到这些墙上的东西将毫不相关。

我和其他人会争论,我会说,“看,我投射到墙上的东西告诉我这个。”然后你会说,“不,不,我有一个不同的机器学习模型,它告诉我完全不同的东西。”但事实上,如果这个函数的性质非常非线性、非常高维,那么每一面墙都会给你不同的视角,因为你只是在投射。

所以,这是一个有趣的问题:这些投射看起来是什么样的?我们投射的是什么?这是第一个问题。

第二个问题是:它们为什么效果这么好?还记得我告诉过你,我们样本外得到 1% 的 R 方其实很惊人吗?它告诉我们一些关于描述金融市场的函数性质的信息,即这个函数的真实性质是平滑的。描述市场的函数在某些潜在的、可以被严格数学化的意义上是相对平滑的。这很惊人,为什么会这样?为什么它没有太多的拐点或跳跃不连续性?

第三个问题,我特别觉得非常有趣。我现在正在与 Brian 和一些其他学生一起写一篇论文,关于如果代理人使用复杂模型,会发生什么?为什么这个问题如此重要?

想想看,得益于 Seri、Marcos、Andy、Xian 和所有演讲者以及许多其他人的精彩工作,我们已经说服了很大一部分学者和从业者,机器学习是有效的。从业者可能已经知道这一点,但现在他们更加确信了。

现在,想象一下,我们生活在一个许多经济代理人意识到使用复杂模型——拥有大量参数的模型——效果很好。也就是说,它们在样本外最大化效用。如果你想最大化效用,你应该使用复杂模型。经济学家可能会抱怨说,“我无法理解,它不可解释,它是什么意思?它是一个黑箱。”但如果我是一个最大化效用的经济代理人,我不在乎。如果我确信样本外使用复杂模型能最大化我的效用,我就会这样做,因为我不是经济学家,我只想赚钱。

一旦你接受了这一点,你就会意识到,你需要理解会发生什么。问题是,所有这些人都会构建“有机”模型。还记得柏拉图的洞穴例子吗?他们将开始将现实投射到不同的墙壁上,在柏拉图的洞穴里。

事实证明,你可以使用我提到的随机矩阵理论来证明,任何这样做的代理人都会在他们回应数据的方式、他们学习的方式上引入非常特定、普遍的偏差。这些偏差可以用随机矩阵理论来描述,并且是普遍的,因为其中一些偏差不依赖于数据的内在结构。无论数据是什么,都会出现特定的偏差。

由于这些均衡模型,这些偏差将影响均衡价格,特别是它们将影响信息如何被纳入价格。在这个高维学习的世界里,惊人的事情会发生。例如,想象一下,世界的真实性质涉及学习十亿个参数。要真正学习真相,你需要几万亿年的历史。你可能永远不会有,因为宇宙不会那么长久。这意味着你永远无法学习真相。

在这个极其复杂的环境中,你可以证明价格永远不会吸收信息,因为人们会迷失方向,他们无法弄清楚哪个信号实际上很重要。这将导致非常特定的、普遍的预测,由随机矩阵理论中的“普遍性”驱动,这再次意味着在高维世界中的某些对象会变得普遍,它们不依赖于底层数据生成过程的真实性质。

这就是大概的图景。我希望激发了你们一些人的好奇心。

现在,让我快速提醒你们一下我们在这里做什么。我们正在构建这个贴现因子,基本上我们正在尝试构建条件有效的投资组合。所以,你在这里看到的方程一,是我的回报和条件协方差矩阵的条件期望。我们通过构建特征管理投资组合来简化它。然后,我们基本上不是构建条件有效的投资组合,而是构建我的特征管理投资组合,然后以无条件的方式使用它们。换句话说,我获取条件信息,这些信息包含在特征中,将其嵌入到因子中,即特征管理投资组合,然后以无条件的方式使用它们。

有趣的是,我们有一个定理说,在某些技术条件下,这是正确的做法。也就是说,因子的无条件有效投资组合实现了与股票的条件有效投资组合相同的夏普比率。再次,我们处于这个复杂的高维度世界中,这非常有用。

我只有五分钟时间,我真的没有时间详细讨论它。

那么,我们该怎么做呢?我们构建了大量的投资组合,即特征管理投资组合。然后,我们做了一些完全朴素的事情:构建这些投资组合的马科维茨投资组合。想想看,这些因子的维度是几万,我们基于 600 个观测值计算这个均值,这很荒谬。我们基于 600 个观测值计算这个 10,000 维的协方差矩阵,这也是很荒谬的。然后我们基本上证明了它奏效了。

此外,鉴于我只有五分钟时间,我不会详细讨论,但你可以问自己,你试图基本上获得不可行的有效投资组合。你看,这是真实的期望,但你无法做到。所以,你构建了可行的版本,在这里我们只是取经验均值和经验协方差。但你可以说,但也许当 T 很大时,你会得到近似相同的结果。但事实并非如此。你看到这个近似符号和一个叉号。如果我能做到,我会把这个叉号变成红色,以真正强调它,但我不知道怎么做。

但你可以问自己,好吧,但这个差距有多大?这是一个棘手的问题。但你可以回答以下问题:假设我构建了这个不可行的投资组合,我想知道它会有一些期望回报,那么可行投资组合的回报与不可行投资组合的期望回报有多大差距?

事实证明,你可以回答这个问题。答案非常美妙。不可行投资组合的行为就像它是可行投资组合一样,但它不是使用“丰富惩罚”Z,而是使用更大的“丰富惩罚”,我们称之为隐式收缩。

而且,令人惊奇的是,这种隐式收缩可以通过这个对象通过解析来表征。你看经验协方差矩阵,然后你计算。基本上,它告诉你,证明并不完全是微不足道的,它使用了随机矩阵理论。但基本上,它告诉你,你可以使用这些数学技术来理解你离这个不可行且本质上不可学的“地面真相”有多远。

如果你感到好奇,细节和精确的表述都在论文中。

现在,让我向你们展示一些实证结果。我们实际上是如何实现这一切的?我们选取了大约 130 个股票特征。我们构建了一系列非线性变换。这里我们对数据的随机线性组合应用 sign 函数。所以,你看到我们取随机线性组合,然后应用这个称为非线性激活的东西。你会认出这实际上看起来像一个神经网络。我们在这个神经网络的隐藏层中构建了这些特征。我们使用 sign 激活的事实并不是特定的,与其他激活函数的结果相似,这实际上非常令人惊讶,并且告诉我们很多关于数据的真实非线性结构。但我只有两分钟时间,请记住这一点。

然后,基本上,让我向你们展示论文的主要结果。实证结果。我将构建非常非常多的这些非线性特征,然后我将绘制我的投资组合的样本外夏普比率作为这些特征数量的函数。

你在这里看到的是,随着这些非线性特征数量的增加,样本外夏普比率,让我们看看橙色线,单调增加,并在大约复杂度等于 100 时饱和。复杂度定义为这些特征的数量除以我们使用的观测值数量。我们使用 30 年的滚动窗口,这意味着 T 是 360 个月度数据。复杂度为 100 意味着 P 大约是 36,000。

所以,如果你看这张图,你想做一个投机性的陈述,比如为报纸写点什么,这不是一个正确的陈述,这是一个投机性的陈述,听起来很酷,告诉别人。你可以说,这张图意味着,为了解释美国股市,你需要 36,000 个因子。这有点荒谬,因为我的数据集中的实际股票数量只有几千只,可能两三千只。你怎么能需要 36,000 个因子来解释 3,000 只股票呢?

原因是,我们试图无条件地解释股票收益的条件结构。当然,如果你有 3,000 只股票,无条件地你最多可以有 3,000 只,但条件上你可以拥有任意多的股票。它取决于什么?它取决于条件预期收益向量是否移动很多。想想看,你有 3,000 只股票,取条件预期收益向量,这是一个 3,000 维向量。这个 3,000 维向量随着时间(300 个月观测值)的变化非常巨大。它变化如此之大,以至于如果你想描述这个巨大的 3,000 维向量的运动,你需要 36,000 个线性关系。这就是这个结果的本质。

我看到时间快到了。结论是,复杂性是存在的,我们应该使用大模型,我们也应该尝试在理论上理解正在发生的事情。在接下来的几年里,随着我们继续进行这个激动人心的项目,这一切都会发生。

感谢您的关注。

好的,非常感谢 Simon。这非常有趣。Paul 现在将讨论这篇论文。

好的,谢谢大家,也感谢组织者给我讨论这篇论文的机会。这是一篇重要的论文,无论是在其内容还是页数上。我必须承认,我没有看所有的证明。

我将做的是,鉴于 Simon 给了如此长、可以说是非正式的介绍,我想介绍一下他们解决的问题,并将其与已有的研究联系起来。我将提出三类问题,也许 Simon 可以在剩余的时间里澄清。

这篇论文围绕着这个贴现因子投影 Mt+1 展开,Mt+1 是一个贴现因子投影。它必须具有对收益进行定价的性质,即这个贴现因子乘以超额收益的期望等于零。

正如 Simon 所引导的,人们一直在努力使这个对象尽可能低维。有一些研究关注当资产数量变大时会发生什么。这是一个古老的文献,始于 Ross 的 APT,然后是 Chamberlain、Rothschild、Chamberlain 和 Richardson 等人非常有影响力的论文。但基本上,这篇文献仍然是黄金标准,变化不大。

人们已经研究了当资产数量变大时会发生什么。这篇论文关注的是当对象变得越来越复杂时会发生什么。

这看起来是一种非常违反直觉的方法,正如 Simon 也提到的,因为我们都被训练成尽可能使事物简单化。

由于 Simon 没有太多时间来介绍他的结果,我想给出一个简短的、非技术性的总结。在技术条件下……最大夏普比率贴现因子,或者其极限,它达到了真实的、不可观测的贴现因子投影,它依赖于真实的、未知的条件矩。这是一个非常非常非常有趣且强大的结果,也有些违反直觉,但无疑是强大的。

所以,我们必须记住,这个不可观测的最大夏普比率贴现因子,它依赖于我们不知道的许多矩。但仍然,通过使用复杂性,我们可以构建一个收敛到这个解的估计器。这是我们从 Simon 的演讲中学到的第一个重要收获。

另一个引人注目的结果是一系列结果,再次以非常非技术性的方式呈现。当因子数量变大,时间序列观测值变大,并且因子数量与时间序列之比收敛到一个严格大于零的常数时会发生什么。这是高维统计学的经典设置。作者为来自他们的估计器的最大夏普比率投资组合的期望和方差,逆夏普比率,以及 Hans 和 J 距离提供了强大的结果。

非常强大的结果。我想将它们稍微置于背景中,并谈谈我们已经生活了 30-40 年的非常古老的文献。我想选择 Chamberlain 和 Rothschild 的论文。他们想理解 APT 何时成立。他们有一个非常通用的设置,其中有毛回报率 Xi,每个都有有限的二阶矩和一些均值 Y。然后他们研究了平方可积的投资组合族。他们没有假设太多。他们所有的结果都来自于这两个统计套利条件,这些条件似乎也非常合理。

当投资组合的方差趋于零,成本趋于零时,价格的期望在极限处也趋于零。他们想理解 APT。为了生成 APT 结果,他们引入了他们称之为近似的,实际上他们称之为 K 因子结构。我称之为 P 因子结构。

在左侧,你有一个序列的协方差矩阵。然后有一个归因于因子的部分,这里是因子方差的特征值分解,以及一个余数,这是一个半正定矩阵序列。重要的是,这个余数的最大特征值有一个上限。这是一个有界的特征值。

然后结果是:假设存在这种近似的 P 因子结构,并且这两个统计套利条件成立,那么即使你没有假设太多,你也可以近似资产的均值,用一个低维的近似。这里我也忘了将 K 换成 P。

我之所以展示这个,是因为有一些问题我想问,这些问题与这些结果有关。我想讨论一些假设,也许 Simon 可以告诉我我是否理解正确,或者。

他们偏离了这种人口中的因子结构,左侧是一个越来越大的向量,然后是你的特征,然后是你的因子,然后是你的残差。这些假设是相当经典的。唯一可能有点不寻常的是这个:因子二阶矩矩阵(这不是协方差矩阵,而是二阶矩矩阵),即这个矩阵序列的迹,其上限由某个数字约束。这在近似方面是好的,因为这个谱以非常快的速度衰减。但它也有影响。

其中一个影响是,因子变得渐近为零的随机变量。因为迹是有界的,这意味着这个矩阵序列的迹也收敛于零。因此,因子形成了一个很快变得非常不有趣的序列。

我想问一下对这个设置的解释,将其与 Chamberlain 和 Rothschild 的因子结构联系起来。我必须说,实际上论文中关于收益协方差矩阵的讨论很少,但关于因子和残差协方差矩阵的讨论更多。

还有一个问题,我认为应该很有趣,应该澄清。是什么概率结构支配了残差和这些因子之间的关系?我认为,隐含地假设这个协方差对于每一个 n(对于每一个横截面)都等于零,但我不太确定。无论如何,我将在我的下一个问题中使用这个假设。

如果做了这个假设,即这两个是正交的,那么收益协方差矩阵就分解为因子部分和残差部分。并且根据之前的假设,如果我们看这个收益协方差矩阵的迹,并考虑一个 Chamberlain 和 Rothschild 的经济体(当我提到 Chamberlain 和 Rothschild 的经济体时,我指的是存在一个非线性,或者说近似的 P 因子结构,这意味着最大的 P 个特征值随着横截面增大而发散),这意味着收益协方差矩阵的迹也发散。这很好,这在 Chamberlain 和 Rothschild 的论文中也是如此。

有点有趣的是,这个因子部分似乎是有界的。这意味着在极限情况下,几乎所有的作用都来自这个特质部分。因此,将这个设置与 Chamberlain 和 Rothschild 的设置进行比较会非常有趣,因为这是每个人都在研究的。

下一个评论可能不那么有趣,它是一个技术性的评论,但仍然有一些兴趣。这也是关于命题二,它讨论了因子扩展。一个因子投资组合能否产生整个横截面可以产生的最大夏普比率。这是一个建立在横截面资产数量和因子数量都趋于无穷大的基础上的结果。

这里有一个关于可交易因子模型的问题,即因子本身是资产的投资组合。也就是说,如果我们假设(我认为这是论文中的一个维持假设),因子部分和残差部分是不相关的,并且不是零矩阵,那么残差的协方差矩阵就不可能具有满秩。这是命题二的证明中所假设的。再次,如果我的理解是正确的,如果不是,也许你可以更全面地写出这些假设。

还有一个新的文献,比如我和 Damia 的一个项目,关于具有秩分解收益协方差矩阵的因子扩展。这直接引出了 Stefan 和他合作者那篇有影响力的论文所开启的问题。

最后一个问题,我想我时间安排得还不错。是关于随机三特征的设置。这篇论文基本上直接走向了右侧的这个表示。这些被称为随机傅里叶特征。任何径向核(径向意味着任何只依赖于两个参数之差的核)都有这样的表示。这里的 Omega 随机变量是从原始核函数的傅里叶变换中提取的独立同分布实现。我认为作者使用了一个高斯核。

他们从这个离散集合中抽取了所谓的长度尺度,并模拟了核函数傅里叶变换的随机变量。这里的复杂度指的是 P 越来越大。

所以,我的问题是,因为任何一组傅里叶特征也有一个极限,即核函数,你可以将其解释为无限复杂度的对象。如果我们只用普通的核函数而不是随机傅里叶特征来做实证结果,那会是什么样子,这将很有趣。

这就是我所拥有的。这是一篇非常雄心勃勃、非常强大的论文,涉及一组非常有趣、理论性的问题。它有非常大的实证动机,以及大量的敏感性研究等等。他们有两个强大的结果:夏普比率问题,渐近夏普比率扩展,因子扩展,以及这些泛化结果。

正如我所说,现在有一些非常好的非参数模型可用,既可以用于条件分布(这也可以是相当高维的),特别是,我们还有一个关于非平衡面板的条件均值和协方差估计器的新论文。这些可能对未来的研究有用。

这就是我所拥有的。非常非常非常酷的论文。非常感谢。阅读它是一种荣幸。

好的,非常感谢 Paul。我们还有几分钟时间,Simon,你想利用这几分钟来回应 Paul 吗?

当然,非常乐意。也许一些技术问题。

我们下次见面时,我们能私下聊聊吗?

抱歉,我没听清。

你会参加在苏黎世的年会吗?

好的,非常感谢 Simon。

也许你来借了一个所有这些天,是的,我,我,所以将有很多机会,是的,我确定,但我会回应,谢谢,首先谢谢,精彩的讨论,超级深入,重要的观点,但大多数这些观点至少需要我一个小时来回应,但我会简要回应其中一个,与张伯伦和罗伊的联系有关,张伯伦和罗伊,首先,他们只做无条件的,对吧,所以,所以,直接将其链接到有条件的并不完全清楚,但即使在无条件的世界里,他们也总是隐含地假设所有这些假设,对吧,假设你知道,在我们的世界里,所有股票或因素的真实数据生成过程的系数,特别是,你知道,所有股票或因素的真实均值和真实协方差矩阵,我相信那里存在任意的机会,想象一下,你有一个因素投资组合,在我的世界里,我有 36,000 个因素,这些因素很重要,想象一下,在我的世界里,有一个投资组合,仅 36,000 个因素中的一个,其方差为零,年化回报率为 300%,你将如何找到它,你如何找到它并找到样本,所以事实上,我们知道这基本上是不可能的,或者至少让我们这样说,用机器学习估计器,一个相对小的家族,我们的生物文明在过去几十年里已经想出了一个,我们试图构建它们,对吧,没有人能够找到这个投资组合,它很可能存在,但我们不知道如何找到它,它被噪音所淹没,以至于我们不知道在哪里寻找它,你可能会偶然发现它,但概率非常非常低,也许这就是 R 技术发生的事情,也许他们只是偶然发现了 56,000 维向量,这是一个笑话,只有一点点,你知道,也许只是偶然发现了这个向量,对吧,但我们没有一种通用技术来找到它,它将被如此淹没,因为方差如此之小,所以实际上,你不知道因素的平均回报,你不知道真实的协方差矩阵,记住我给你看,基本上,价值分布独立于真实分布,所以从这个意义上说,不幸的是,张伯伦和罗伊的结果有点完全没用,它是一个非常好的理论,就像在我童年时期,关于物理学家证明真空中的无限维度桌子的结果的笑话一样,这是一个有趣的研究对象,但它没有现实世界的类比,我听不到你,抱歉,你应该,你应该放下麦克风,啊,抱歉,我只是说我同意你,这是一篇关于人口统计的论文,但有很多论文研究了这方面的估计方面,所以有一个非常非常大的文献,所以,我不会,我认为完全抛弃它,因为它已经,我的意思是,它有实质内容,我认为进行比较是有意义的,但那些结果,我都知道那些文献,但那些结果在 P 除以 T 远大于零的世界里都不起作用,更不用说 P 除以 T 等于一了,那些结果都不适用,你做的第一件事,是的,第一批有力的、有用的统计结果,在这个 T 与 T 可比的世界里,归功于马库斯和马丁·利尔,那是第一篇将机器学习技术带入定价世界的论文,那是几年前,他们是第一个引入这个想法的人,例如存在低方差的特征值,对吧,所以低方差的主成分完全被噪音淹没,你根本看不到它们,你不知道那里发生了什么,马库斯在他的工作中称之为相变,有一个阈值,超过这个阈值你就看不到了,好的,所以其中一些主成分可能具有十亿的夏普比率,你看不见它们,它没用,你如何找到它们,但我的意思是,我认为它仍然是一个有效的基准,对吧,所以你有渐近线,至少你有这个,然后你还有,对于有限数量的因素,我认为这是公平的,对吧,所以你应该,我的意思是,你也确实,部分地,你也确实关注了 AP 的实证,但我认为,在理论上,也值得,值得与张伯伦·沃奇菲尔德中的内容进行比较,因为他们确实没有假设太多,所以它非常强大,我特别来这里,抱歉,我不想打断,但我的观点是,我的意思是,萨蒙之前也提到过一些,对吧,现实世界只有有限的数据,你使用理论来近似有限维度的数据集,如果你有 1000 种资产,你说,嗯,这是系统性的,在这个意义上,它有一个特征值为 100,它是否以 N 的速率增长,资产的数量,它是否以平方根 N 的速率增长,或者它实际上是有限的,但它只是有一个大的比例常数,而且我认为你无法在任何有限的数据集中以可信的方式区分,好的,它是哪个速率,或者它只是一个大的常数,对吧,所以我的观点是,你可以推导出一个统计模型,模型做出预测,然后你可以看到这些预测与你在数据中看到的一致,但我认为我完全同意,罗斯·张伯伦的理论很美,但我认为从实际角度来看,很难区分这里不同的情况,还有另一件事,我的意思是,我们在我们的论文中提出了这一点,与马丁以及一些与张伟和斯通的工作,后来也发现了同样的观点,当我们谈论什么是系统性时,我们选择我们的测试或基础资产是什么,而且,在很大程度上是任意的,在这个意义上,你选择了一定数量的股票,在这些股票中,某些东西可能看起来不太系统性,但如果你添加更多未包含在样本中的资产,它就会变得更系统性,对吧,所以有一个问题,我的意思是,在什么类型的经济意义上是系统性的,所以,我在这里想说的是,我认为当它,拥有这个理论很棒,我同意讨论它也很好,但从实际角度来看,系统性负荷在某种程度上影响某些资产的速率意味着什么,这真的很难量化,无论如何,公平地说,我确实讨论了理论结果,我认为特别是它们应该与已有的内容进行基准比较,我认为,特别是命题二,我相信是,我认为这是最具争议的,也许我们来讨论一下,是的,我认为谢谢保罗,我们当面讨论,是的,让我问一个问题,观众中有几个问题,我将滥用我的职位,因为其中一些问题与我想问的有关,所以有一个问题是如何看待大量因素,所以 P 大,versus 像有效的,你知道,有效自由度数量,因为即使在我自己的论文中,我们也有收缩横截面论文,我们通过包含多项式将这些特征扩展到数千个,然后我有一篇核技巧论文,我们基本上有无限数量的,但然后我们都进行岭回归,如果你阅读 HTI Tip Shiran Friedman,如果你进行岭回归,他们基本上告诉你,嗯,你应该看看有效自由度数量,在这种情况下,它仍然很小,对吧,所以,我认为我思考它的方式是,这些仍然是低,你实际上有很少的因素,但你认为它是大量因素,所以,你对此有什么看法,绝对,所以首先关于岭惩罚,当 P 趋于无穷大时,就像在,当我们有 36,000 个左右时,你用最好的岭惩罚获得的比例与我们用岭获得的比例是一致的,你可以从我刚才展示的图表中看到,现在它不在那里了,但如果你看论文中的图表,你会看到无约束极限,相同的夏普比率,岭惩罚很重要,当复杂性很小时,一旦复杂性足够大,岭惩罚就无关紧要了,但有一个非常深层的原因,记住我可能花了 20 秒来介绍的理论结果,我的演示文稿,抱歉,在理论上,我证明了事实上,当 P 大于 T 时,模型表现得好像有收缩,但它不是 Z,而是与 Star 相同的,这种隐式收缩,即使在 Z 趋于零的区域极限中,Z Star 也收敛到一个大的正数,事实上,当 P 趋于无穷大时,这个数字会爆炸,所以当 P 是无穷大时,你在收缩,而不知道模型在为你收缩,它表现得好像你可以计算收缩,而且非常像马库斯和马丁的精彩工作,发生的是,这种有效的收缩定义了这个相变阈值,超过这个阈值你就看不到了,所以基本上发生的是,你有一个积分算子核,或者其他什么,保罗在他的讨论中精美地描述了,这个核有特征函数,那些是驱动横截面的真正的、正交的、独立的因素,基本上只有那些特征值大于阈值 Star 的因素才能存活下来,所有低于 Star 的值都被噪音淹没,是看不见的,所以事实上,你构建的 SDF 由有限因素模型描述,这些因素是真正的、不可观测的,我将再次强调,是核积分运算的真正的、不可观测的特征函数,现在你会告诉我,你能估计这些因素吗,答案是不能,世界上没有人,直到今天,知道如何估计这个积分算子的真正特征函数,原因非常深奥,原因是,为了估计真正的因素,真正的有限数量的因素,可能只有很少的数量,你需要知道所有股票和所有特征的真实联合概率分布,所以你谈论的是 2000 只股票,每只股票有 130 个特征,所以你需要一个概率分布,在一个,嗯,2000 乘以 100 乘以 2 乘以 130 维度的空间,我们目前还没有技术来模拟这些概率分布,这就是为什么我们仍然没有自动驾驶汽车,这就是为什么大型模型,大型语言模型会产生幻觉,所以作为一个人类,我说,看,我知道有这个有限数量的因素,但我绝对没有统计技术来估计它们,我该怎么办,我买 36,000 个愚蠢的、白痴的、天真的因素,就像一只猴子扔飞镖一样,你知道,希望我的一个飞镖能击中我的目标,我的观点是,这是我们迄今为止最强大的统计技术,作为生物物种,我们发现处理非线性的方法是通过扔飞镖,通过构建数万个因素,很可能在 100 年后,我们的后代会嘲笑我们说,他们在做什么,只有一个因素,对吧,但嗯,我们目前还没有这种技术,只是一个统计工具,谢谢,实际上还有更多问题,但我们时间不多了,所以我们将结束这个录制部分,然后进入一个未录制的部分,在那里任何留下的人,我们将继续讨论,在我们离开之前,我只是想提一下,我们将在 11 月 21 日举行下一次网络研讨会,将是来自伯克利的 Mitri Livdon,所以请在那天加入我们,现在我们将进入未录制的部分