Transcription
[音乐] 欢迎来到人工智能与大数据金融网络研讨会。我们非常荣幸今天能有两位杰出的演讲嘉宾。首先,来自沃顿商学院的 Jules van Binsbergen 将展示他的论文《近 200 年的新闻经济情绪分析》。之后,来自佐治亚州立大学的 B. Jang Yang 将进行评述。Jules 将有 30 分钟的演讲时间。大约 15 分钟后,我会简要地与您沟通,让听众有机会澄清任何简短的问题。然后我们将进入讨论环节,B. Jang 将用 20 分钟进行讨论。之后,我们将开放给普通听众进行问答环节。如果您在此期间有任何问题,请通过问答功能提交,我将在提问环节点到您。另外,请记住,请尊重您的评论。本次演讲和讨论将被录制,并将与幻灯片一起发布在我们的网站上。在主要网络研讨会之后,我们将有一个未录制的讨论环节,届时我们将把所有人都升级为发言人。那么,废话不多说,Jules,请您开始吧。非常感谢 Andy。首先,请允许我感谢您和组织者今天邀请我来展示这篇论文。这篇论文是与 Ana Mayuk 和 Swana 一起完成的,Swana 也在线上。我还要感谢 Bong 花时间审阅了这篇论文并在本次演讲后进行讨论。在这篇论文中,我们主要想深入探讨如何从更大的文本来源获取情绪指标。我认为,关于预期和情绪的重要性及其对商业周期的影响,几乎不需要过多解释。我认为那里列出的几篇论文都论证了它们之间存在重要的联系。那么问题来了,我们能否改进情绪的衡量方式,以及我们将如何着手衡量?我认为,基本上有两种方法。一种是使用结构化模型,尝试从中反推出情绪冲击,并以此来衡量情绪。另一种是使用基于调查的指标,例如广泛使用的消费者信心指标。我们今天将要采用的方法试图克服其中的一些挑战。一个挑战是数据可用性,因为现有的调查指标寿命很短,而且只针对很少的对象。第二个挑战是如何衡量新闻的情绪信息含量?这就是我们在这篇论文中要解决的问题。因此,在这篇论文中,我们将构建一个基于地方和国家新闻的经济情绪指标,覆盖近 200 年,即 170 年。我认为,从数据角度来看,我们即将采用的方法有两个好处:我们将极大地扩展时间序列,同时也会扩展横截面。我们将稍微讨论一下到目前为止我们在横截面中能够提取出什么,并且原则上,在横截面方面,在细粒度方面没有限制。今天,我们将采用州级(美国州级)指标。我们将使用的数据是世界上最大的报纸文章语料库之一,包含 1.93 亿页,20 亿篇文章,大约是英文维基百科数据库的 100 倍。然后,我们将使用 Mayuk 在早期论文中开发的一种方法来提取对经济新闻的看法和态度,并尝试从中提取时间序列和横截面数据。现在,我们将使用带有神经网络的 Word2Vec。一个不可避免的问题是,鉴于我们目前的数据量,我们是否不能使用更先进的指标或方法,如 BERT 或 LLM?目前还不可能使用这些更先进的方法,但未来情况可能会有所不同,届时研究这些更先进的指标能提取出什么将非常有趣。我很快就会向您展示我们具体提取了什么。我认为我们追求的是一个相对直接的东西,我们相信 Word2Vec 将非常适合。因此,我们将获得的指标是国家和州级别的经济情绪指标。我们还将进行一些工作,提出这个问题:我们能否将经济新闻与新闻报道的整体趋势分开?正如您将从数据中看到的,这是一个需要认真对待的问题,原因在于新闻报道的整体情绪似乎确实存在趋势。我们不会对导致我们看到的报道中积极和消极趋势的原因采取特定立场。但为了给您一点预示,如果您看看新闻报道的整体消极性,我认为我们样本中的最后一个数据点是我们这整个 170 年期间最消极的数据点。换句话说,在 2020 年底,我们看到了历史上最消极的新闻报道,在我们数据库中是这样。而且,这不仅仅适用于经济新闻,也适用于一般新闻。这确实引发了一个问题:这些趋势从何而来?是什么导致了这些趋势?这些趋势对经济新闻重要吗?还是我们应该从经济新闻中剔除这些趋势?我们将展示这对经济新闻有什么影响。另外一件我认为需要立即澄清的重要事情是:一旦我们在金融和经济领域谈论情绪,我们大多数人会立即将其与某种行为或非理性预期类型的框架联系起来。而在我们这里,我们只是简单地查看报纸文章,看看这些新闻有多积极或消极。因此,这里仍然有一个问题,我们需要将“情绪”一词的定义,纯粹作为描述新闻有多积极或消极的词语描述,与我们在经济学和金融学中通常谈论情绪时的含义区分开来,即偏离理性预期的行为。我们将在幻灯片中对此进行一些探讨。事实证明,这实际上相当微妙,因为通过查看情绪指标是否预测股票回报,是否预测现金流,是否能超越分析师预测等等,我们可以看到一个相当微妙的图景,即我们是在谈论我们应该考虑的预期错误或过度乐观,还是我们仅仅应该在理性预期框架内考虑预期。鉴于预期本身可能具有自我实现的预言效应,一开始就很难区分这两者。但我们也会花一些时间来讨论这个问题。所以,这里是……这样我就可以在时间用完之前把所有发现都讲完,因为我只有 30 分钟。所以,首先,情绪具有清晰的商业周期模式。我们可以将其与现有指标进行关联,尽管这些现有指标的样本时间要短得多,例如密歇根调查。我们发现,在两者重叠的样本中,我们有相当大的正相关性,尽管即使在那里,也有一些有趣的偏差,我认为值得思考它们的来源。但我确实认为,与密歇根调查的总体高相关性为我们正在衡量的东西增加了可信度。此外,我将非常小心地避免任何因果陈述。我主要将描述我们在论文中所做的工作,即简单地看看这个情绪指标是否具有预测能力。为了做到这一点,我们看看它是否能在其他现有预测因子的基础上进行预测,而我们不必对确切的原因发表任何看法。我们发现,我们的情绪指标领先于专业预测者调查,它能预测 GDP 增长、就业、消费和服务,即使控制了过去的宏观基本面和许多人用来预测 GDP 增长的过去预测因子,例如收益率差。我们还发现,我们的情绪指标似乎对预测美联储基金利率有影响。我们将讨论一个“泰勒规则”类型的模型,看看在我们通常用于这类规范的信息集之外,我们的情绪指标是否具有额外的预测能力。我们将发现,尤其是在下行方面,它似乎具有这种额外的预测能力。同样,我们将对这意味着什么以及我们应该如何考虑因果关系进行相当细致的讨论。再次,我们将非常小心地尽量避免因果关系,因为这是一个极其复杂的问题,很难理清这些事情。现在,我们数据的一个独特之处在于,我们还可以查看州级的情绪指标。我认为,在我看来,最有趣和最令人惊讶的发现是,情绪在地区之间存在巨大的异质性,这意味着是的,存在与我们看到的商业周期模式相关的全国性的起伏,但在这种共同模式周围,存在大量有趣的协变性。其有趣之处在于,州级情绪变异性的只有 35% 来自总体,来自这种共同趋势。在论文中,我们考察了几个例子,例如关于“.com”泡沫的破裂,我们预计它会对情绪产生影响,这更多是加州的问题还是纽约的问题?或者,如果我们以 2008-2009 年的经济大衰退为例,我们发现这更多是东海岸纽约的问题,而不是加州的问题,而“.com”泡沫的破裂更多是加州的问题。因此,似乎不同事件对不同州的情绪有不同的影响。最后,一个有趣的事情是,情绪的离散度似乎对未来的 GDP 增长是不利的。如果我们看到某些州的情绪非常高,而另一些州的情绪非常低,并且离散度高于往常,这似乎对未来的 GDP 增长具有负面的预测意义。再次,没有因果陈述,只是我们在这里的预测陈述。好了,我们有跨州的新闻报道。正如我们所说,我们拥有的一个好处是,我们有地方性报纸。因此,这不仅仅是少数几家全国性报纸,除了全国性报纸之外,还有更多的地方性报纸。它们在一定程度上也报道全国性新闻,但显然也报道未进入全国性报纸的地方性新闻。不过,最后有一件事需要讨论,那就是这对某些方面有影响,那就是,显然,如果我们回到我们样本的开始,170 年前,您可以想象,在那个特定地区,地方性报纸对当地新闻非常重要,而全国性新闻的作用则不那么重要。当您到达样本末尾时,您可以想象,有许多其他不同的新闻来源可供选择。特别是如果我们想在未来扩展我们的分析,例如未来 100 年,那么问题当然是报纸是否还普遍相关,以及是否应该包含其他新闻来源。现在,正如您可能已经想象到的,在消极性方面,我非常担心使用 Twitter 或其他信息来源来提取新闻,因为这将具有比我们报纸报道末期最消极的数据点更高的消极性。因此,我认为总的来说,在当今世界,什么才是可靠的新闻来源,以及您从哪里获取新闻,这不是我们要提供答案的问题。我们在这里展示的论文主要是对地方性报纸情绪如何告诉我们国家和地方经济增长数字的历史分析。但关于从哪里开始,未来如何发展,有一个有趣的讨论。好了,我们将遵循三个主要步骤。首先,创建一个与主题相关的词典。我们有一些用于经济主题的种子词,也有一些用于一般新闻的种子词。然后,我们识别出积极或消极的词语,然后我们将应用它来衡量特定文档中积极和消极情绪的强度。我们将能够分析页面级别的数据,而不是文章级别的数据。但我们仍然会衡量这些特定页面上报道的整体基调。现在,这些词语……我稍后会向您展示,但这些种子词并没有什么令人惊讶的,而且我敢肯定它们是相当无争议的。因此,我们将使用 Word2Vec,正如我之前所说。使用 BERT 或大型语言模型目前还不可能。但我预计,鉴于我们真正追求的文档的简单积极性或消极性,这不会有太大区别。对于更高级的应用,我确信一旦在计算上可行,语言模型将是使用此特定数据库的绝佳选择。好的,Word2Vec 实际上是获取这些词语的向量表示,然后使用余弦相似度来衡量词语之间的距离。这也是我们在这里使用的技术。好的,我现在跳过这个。这里我们看到一些与经济观点相关的情绪种子词。例如,积极的词语有扩张、繁荣、增长、利润、乐观、机会、成功、成功等等。消极的词语有衰退、破产、萎缩、失业、损失、破产、裁员等等。再次,我认为这些种子词相对直接。另一件让我们担心的事情是,随着时间的推移,不同词语是否会被用来表达对事物的乐观或悲观。事实上,即使您只是为了好玩,我做了这个,如果您回到《国富论》,只是看看经济活动或其他事物的描述方式,以及用哪些词语来描述好坏,您会惊讶地发现这些词语是多么相似。当然,在很大程度上是因为早期文献基本上定义了我们今天的领域,包括我们使用的术语。所以,我们做了一些分析来思考这个问题,但目前我并不特别担心这种随时间的变化。好的,我们设定了所有这些。然后,我们将获得文档的向量表示。然后,我们将把我们拥有的信息分成两类页面:我们有报道经济新闻的页面,也有报道一般新闻的页面。这样我们就可以获得情绪指标,这些指标对于经济新闻页面与描述一般新闻的页面可能不同。这样我们也可以看到,我们随时间演变的整体消极性是经济特有的,还是例如,尤其是在过去 50 年里,由于自 70 年代以来我们看到的长期停滞时期,经济新闻报道的长期下降趋势可能是有道理的,或者可能是因为一般报道所表现出的消极性也渗透到了经济新闻的报道方式中。因此,我认为区分这两者很重要。因此,原则上,我们可以以各种细粒度级别衡量事物。我们目前在论文中将重点放在州和国家层面。我们还将对指标和 GDP 增长进行季节性调整。那么,关键优势是什么?我认为,在数据可用性方面,我认为这篇论文最大的卖点是它拥有如此长的时间序列和如此广泛的横截面。我还认为,我们目前使用的方法将能够很好地捕捉情绪水平,因为该方法反映了词语和短语使用的上下文,它会自动处理否定,它还有一个连续的尺度,我认为这很重要,它不仅仅是加一减一这样的事情,而是在某事有多积极方面存在一个连续的尺度。好了,让我们来看看结果。首先,让我看看我还有多少时间。介绍用了五分钟,安迪,所以我还有大约 15 分钟。这不行。好的,谢谢。好了,首先,这里您可以看到我们 170 年的季度原始经济情绪指标。从这张图中,有几点很重要,很多人我认为没有意识到。首先,看看 1850 年至 1930 年之间灰色条的发生率与之后灰色条的发生率。这只是一个指标,表明在我们样本的后半部分,衰退的发生率比前半部分要少得多。所以,那些是阴影区域。其次,看看这条线本身,您会看到情绪有很大的波动。而且,在某些情况下,它恰好发生在您确切期望发生的地方。例如,大萧条在 1930 年代非常明显,您可以看到经济情绪大幅下跌。我们还看到经济大衰退,您可以看到大幅下跌。我们看到“.com”泡沫的破裂,您可以看到该系列大幅下跌。对我来说,也有一些更令人惊讶的事情发生了。例如,如果您看看第二次世界大战期间,您会看到,总的来说,对新闻的积极性正在上升。您可以看到,报道是积极的。当然,这有两个可能的原因。第一个是,战争努力可能由于美国的经济活动支出而产生了积极影响。这是其中一种。另一种可能的解释是,在此期间,人们期望报纸对前景和战争局势持积极态度。所以,这又回到了这个问题:我们捕捉到的,如果我们看这条原始经济情绪指标,我们捕捉到的是经济特有的东西,还是我们也可能在我们的系列中捕捉到整体的积极性或消极性?因此,我们可以做的是,我们可以看看没有报道经济新闻的页面,然后看看非经济页面在情绪方面实际是什么样的。我认为这就是您看到的红线。同样,这里有几点有趣之处。其中一点,尤其令人不安的是,从 70 年代中期开始,我们看到一个非常强劲的下降趋势。蓝线和红线在最近几年都达到了最低点。我认为蓝线确实是在样本末期达到了最低点,而红线接近我们整个样本的最低点。那么问题是,为什么经济和非经济新闻报道都变得如此消极?许多记者联系我们谈论这篇论文,他们最感兴趣的是问这个问题,他们也希望我们对此发表看法。当然,在论文中,我们没有测试理论,也没有展示支持该理论的实证证据。但一个与我们看到的数据一致的理论是,如果坏消息能卖出去,并且由于替代品的出现,报纸的竞争压力也增加了,那么越来越多的负面报道可能是我们所见情况的解释。我认为,对这个问题进行独立研究似乎很重要,而对这个问题进行后续研究是弄清楚这一点的第一要务。如果我们有了这两个指标,我们可以做的一件事就是将一个指标与另一个指标进行正交化,这样我们就可以得到一个基于经济新闻的系列,它不受您看到的趋势的影响,然后您就会得到这个系列。好了,我还有 10 分钟。首先,这里您可以看到密歇根调查与我们的净值之间的关系,即经济情绪的净值(正交化版本)。您可以看到,相关性相当高,约为 71%。但我也认为,在某些地方,我们与它存在有趣的偏差,包括样本末期。您可以看到,密歇根调查比我们这里的净经济情绪指标要消极得多。地方情绪也有很大的波动。例如,这里您可以看到个别州的时间序列,加州和纽约的。您可以看到它们之间存在很大差异,它们达到峰值的时间也不同。但更普遍地说,我们可以看看全国趋势解释了每个州横截面变异性的多少。正如我之前所说,这只有 35%。这里您可以看到很多不同的州,有很多变动,而这些变动不是共同的,不是全国性的。但也有一个有趣的地方是,尽管向下的冲击可能发生在不同的时间点,但这种向下的趋势似乎在多个州之间共享。所以,我们看到的这种负面趋势,无论是原始经济情绪还是非经济新闻指标,都不是由某个特定州驱动的。这种消极性似乎在多个州之间共享。好了,非常快速地过一下结果,我不会详细介绍每一个。第一个是,情绪的变化对 GDP 增长具有预测能力,即使我们包括了其他几个预测因子,特别是滞后 GDP 增长以及期限利差。您可以看到我们的指标在这种情况下仍然有效。我们对多个数据子集进行了分析。我们对季度数据进行了分析,这是我们目前正在查看的表格,但我们也将对其进行年度数据分析,因为显然,在样本的早期,高质量的 GDP 数据是不可用的。因此,对于年度数据,我们也发现了相同的情绪可预测性。现在,另一件重要的事情是,由于一些人所说的,在样本末期,这稍微少了一些。但我确实认为,尤其是在样本早期,您看到了这些非常长期的衰退,GDP 增长变异性的数量,因此衰退的严重程度,在样本的不同部分显然是不同的。因此,如果我们看看我们得到的系数估计值,那么这些系数估计值在不同时间点可能不同,这并不奇怪。另一件我们可以根据我们拥有的基于文本的指标做的事情是,我们可以区分关于现在的新闻和关于未来的新闻。因此,如果我们真的相信我们的情绪指标具有预测能力,那么它应该是关于未来的陈述才具有预测能力。这确实是我们也能证实的事情。好的,我现在跳过这个。另一个我认为值得关注的重要问题是,这深入探讨了我们的论文是否只是一个确认理性预期的练习,人们只是在最优地调整对未来 GDP 增长的预期,而我们在报纸上看到的情绪聚合起来只是消费者或模型中代理人真实理性预期的更好反映,还是其中也有一些行为因素?因此,至少我们可以说的是,我们的指标在分析师预测的基础上具有额外的预测能力,并且我们的情绪指标似乎领先于他们的预测,至少从分析师的角度来看,这似乎与理性预期的解释不符。如果这些新闻实际上在他们的信息集中,那么他们应该已经调整了他们的预测,这应该已经反映在其中了。最后,我们将运行一系列不同的泰勒规则规范,并提出问题:我们得出的情绪指标是否对美联储的政策具有任何预测能力?事实上,我们发现,我们经济情绪指标的一个标准差下降,在下行方面,大约等于一次额外的 25 个基点的降息。我认为这不可小觑,所以这里也有一些有趣的地方。现在仍然存在一个问题,即我们的情绪指标是否可能因为它具有 GDP 预测能力,从而可能以这种方式影响预期,并通过这种渠道进入美联储的利率设定,或者仅仅是美联储本身受到新闻报道中情绪的影响,因此相应地调整利率。我认为这里也有一些有趣的地方。最后,如果我们对 GDP 进行分解,我们可以将其视为劳动所得的收入和资本所得的收入。因为这是两个主要投入,问题是,如果我们有预测能力,这是劳动渠道还是资本渠道?我认为我们目前论文中的结果大多与情绪通过劳动市场渠道而非资本市场渠道起作用一致。因此,似乎就业和招聘受到情绪指标的影响,而不是公司的资本投资方面。正如我之前提到的,也有这个问题:我们的指标是否预测股票回报?许多金融人士会问这个问题。我们没有发现对通胀或股票回报预测能力有太大影响。我们主要发现情绪对基本面有预测能力,即 GDP,特别是通过劳动渠道。好了,让我总结一下。我认为这是第一篇论文,它说让我们只使用一个非常大的地方性报纸语料库来反推出一个情绪指标,该指标简单地衡量新闻有多积极或消极。我们可以将经济新闻与非经济新闻分开,这样我们就可以在州一级构建非常长的时间序列的经济情绪。我们发现,这种情绪指标在时间序列和横截面方面都存在巨大的变异性。我们发现,这种情绪指标对 GDP 具有预测能力。我还没有向您展示的两个结果与我们拥有的州级证据有关:第一个是,我们发现地方情绪在州一级可以预测地方 GDP 增长。因此,不仅仅是全国情绪预测全国 GDP 增长,而且结果也适用于州一级。这是第一个。第二个,我们发现情绪的离散度对总体 GDP 增长具有预测能力。大的离散度意味着未来 GDP 增长较低。我们发现,情绪指标既对预测货币政策有影响,也对预测专业预测者调查的预测有影响。我认为,我们的情绪指标领先于此,这是一个值得思考的问题,它至少对我们样本中分析师的理性预期意味着什么。我们目前正在改进一些工作,以回应审稿人的意见。但希望届时能向您展示更多结果。非常感谢您。我认为我提前了一分钟,所以比计划早了一分钟。再次感谢您,B. Jang,非常感谢您讨论这篇论文。非常感谢 Jules,感谢您这次精彩的演讲。那么,B. Jang 现在将讨论这篇论文。您能看到我的屏幕吗?太好了,太好了。首先,非常感谢 Andy 和组织者邀请我来讨论这篇非常有趣的论文。我真的很喜欢阅读这篇论文,并从中获益良多。那么,让我先谈谈这篇论文做了什么。Jules 当然已经很好地总结了这篇论文,所以我会非常简短。这篇论文有很多令人惊叹之处。首先,它使用了自 1850 年以来非常早期的美国报纸文章的大量数据,这是一个非常早期的时期。他们的数据包含来自 13,000 家地方报纸的约 10 亿篇文章,非常令人印象深刻。这确实是本次论坛的大数据主题。现在,有了这些大量数据,Jules 和他的同事设计了一个新的经济情绪指标。这相当有趣。首先,他们定义了一个经济词典,该词典是基于 Word Embedding 方法构建的。基本上,从经济种子词开始,您可以使用词嵌入技术构建同义词,然后收集所有同义词。根据我的理解,他们还构建了一个连续的情绪指标,分配给不同的短语。因此,一个积极的词语,一个非常积极的词语,其情绪得分为 1,一个非常消极的词语得分为负 1,而中性词语接近零。基本上,这是一个连续的尺度。我认为这在金融文献中并不常见,因为大多数词典只分配积极或消极的二元分类,而不是连续指标。这可能会增加一些细微之处。基于这些情绪和经济词典,他们构建了一个经济情绪指标。还有更详细的流程,例如,他们构建了一个基于文件每一页的向量,然后计算该向量与词典的情绪加权向量之间的相似度。相关性被定义为该页面的经济情绪。这里有很多设计。但最终,当他们构建国家指标时,经济指标与密歇根消费者调查的反应高度相关。我认为这是他们指标的一个有力验证。这很有道理,而且词典看起来也很不错。现在,这个新的经济情绪指标实际上可以……他们进行了一系列测试。也许最重要的测试是,它是未来 GDP 增长的预测因子。现在,这个指标可以在国家和州级别,甚至更细的级别上定义,这得益于数据。这是一个巨大的优势。而且,有趣的是,他们可以将经济情绪与非经济情绪分开。我认为这也是他们指标的一种验证。经济情绪应该对 GDP 增长和经济周期更重要,这里似乎也是如此。蓝线实际上显示了对经济周期的更好预测能力,尽管总体上它们具有相似的长期趋势。他们还表明,是关于未来事件的情绪很重要,而不是当前事件。所以,这更多是关于对未来的预期或关于未来的信息。最后,如果经济情绪可以预测未来的 GDP 增长,那么这种预测能力来自哪里?他们将 GDP 分解为不同的组成部分,发现大部分力量来自就业、消费和服务。这可能产生很多影响,例如,如果这种情绪可以预测 GDP 增长,那么它也可能影响美联储的货币政策,无论是通过其中包含的信息,还是也许美联储本身受到情绪的影响,从而相应地调整利率,Jules 已经提到了这一点。现在,我喜欢这篇论文的地方,以及它有很多新颖之处的地方,首先是数据集非常独特。这是我在金融文献中第一次看到。它是一个非常丰富的新数据,具有非常长的时间序列和非常大的空间维度,在时间序列和横截面方面都很大。这些数据,我稍后会评论,可能还有进一步的用途,可以为研究人员提供丰富的其他目的。他们构建了一个新的经济情绪指标,这是一个很大程度上自动化的过程,这非常好。这个指标可以用来反推出消费者情绪或市场整体情绪,可以用于历史研究。它还提供了州级甚至更细粒度的情绪数据,这对于决策者,例如州决策者来说可能很有用。他们还通过一系列测试表明,情绪包含了除历史数据和专业预测者调查之外与商业周期相关的新信息。这可能对经济学家和监管机构都有用。总的来说,我认为这是一篇非常好的论文,执行得很好,有很多创新和重要的意义。它已经在 GSU 等地方得到了很好的展示。我们还有 FCH 会议,所以我已经在那个时候了解了这篇论文。它已经相当完善了,所以我不太确定我能提供多少新评论。首先,我将退一步,从方法论的角度审视文本分析或自然语言处理的文献,因为我认为这是这篇论文的关键部分,他们发明了一种新方法。文本分析在金融领域已经存在了近 20 年,最早的论文之一是 Peloog 的论文。一开始,方法都是基于词典的,人类定义一组词典,关于情绪、前瞻性术语或风险相关词语。即使现在,我们仍在一些分析中使用许多词典。这有一个优点,就是透明度很高,我们可以看到所有词典,而且是专家定义的。向前看,有许多研究使用基于词语的方法,例如机器学习模型,例如基于词袋模型。抱歉,请稍等。基于词袋模型,即文档中所有词语的集合,您可以构建机器学习模型来预测例如股票回报,或者专利分类,或者其他东西,例如讨论的主题等等。这是一类。然后是词嵌入,这些词嵌入将词语转换为向量。这种转换利用了词语在文档中的上下文。作者主要使用 Word2Vec,这是基于 Google 发明的方法。这已经介于词语和句子之间了。然后是大型语言模型,BERT,由 Google 于 2018 年发明。BERT 和其他大型语言模型将文本转换为向量,这些向量可用于各种机器学习模型。最后,我们看到通用人工智能方法,如 ChatGPT 等。由于通用人工智能的强大功能,我们可以直接向它们提出具体问题。例如,在我的一篇论文中,我们查询了电话会议以获取管理层对投资政策的具体预期,它们发展迅速。现在,如果您从上到下列出这五类,它们从更透明到更黑盒。顶部是所有人类确定的,底部是非常先进的人工智能。通用人工智能是全自动的,而且非常复杂。因此,无论您选择哪种方法,性能、解释能力和可解释性之间都会存在权衡。我认为这里存在一种张力。我们现在正越来越多地走向底部,因为当我们拥有更先进的模型时,我们想使用它们,但同时我们也想记住,非常先进的模型更难解释。这是我们应该记住的。这篇论文处于中间位置,正如提到的,由于可行性,计算限制,他们选择了 Word2Vec 和基于词典的方法,这似乎效果很好。关于方法论的一点评论,当他们构建情绪指标时,他们从一组 10 个积极词和 10 个消极种子词开始,然后使用词嵌入和相似度来为词典中的每个词分配连续分数。我认为这个过程大部分是自动的,但仍然有一些主观的人类选择,包括初始种子词。我不确定这有多重要,但也许您可以看看,因为一个潜在的问题是,一些词语实际上可能具有中性含义,如利润、可能性、增长或失业。您可以有一个积极的利润或消极的利润。您可以有一个强劲的增长或温和的增长。所以我看到种子词可能有不同的解释,这可能会影响结果。因此,一旦人类做出决定,您如何确定哪个词语最消极或最积极?这是一个问题,因为您将分配连续分数。而且,起始种子词可能很重要,无论它们是否处于光谱的两端。以及如何确定非经济的积极和消极词语?论文中没有给出,但我假设会有一个类似的方法,您给出一个积极和消极种子词的列表。关于这一点,我实际上在想,是否有可能结合 GPT 或生成式人工智能来帮助定义种子词列表?也许人工智能可以帮助您筛选出最消极和最积极的词语,这将是一个自动化的过程,您不必依赖人类来确定哪些词语将包含在种子词列表中。另一种可能性是,您可以使用生成式人工智能来验证您生成的词典。也许使用生成式人工智能来完成所有事情是不可行的,但也许只是为了词典,这是可能的。您有几千个词语,使用生成式人工智能来评估每个词语有多积极或消极,并与您的定义进行比较。如果它们非常相似,那么这将为您提供对该方法的进一步验证。关于数据,我认为数据很棒。您拥有大量的报纸数据。实际上,在人工智能领域,数据就是石油,至关重要。数据质量也很重要,因为我们知道“垃圾进,垃圾出”。质量可能很重要。您有很多报纸,我认为它们的影响力和质量可能存在很大差异。例如,邻里的小报可能不如大型全国性报纸有影响力。您能否考虑根据报纸的发行量或影响力来加权这些指标?我不知道该怎么做,但肯定在您构建指标时,全国性报纸和州级报纸之间应该存在一些差异。也许应该更侧重于有影响力的全国性报纸,而不是非常小的当地报纸。这些数据可能提供更多关于不同问题的见解,例如政治、文化和其他方面。其中一些可能不直接与金融相关,但我认为您可以用这些数据研究非常重要的问题,可能在不同的论文中。但这些数据似乎非常惊人。另一个关于情绪指标的问题是,这个指标到底捕捉了什么?它反映了基本面信息还是信念?我理解您的论文没有对此发表立场,因为这可能非常难以区分。但我认为,更多的证据或测试可能对我们有帮助。例如,一些词语与基本面更相关,如损失、利润、违约,而其他词语则更……
关于像乐观错误或悲观错误这样的信念,能否将词汇表分成更客观的词语与更主观的词语呢?这可以是一种将情感分解成更基本的信息与信念的方法。而且,如果有一些证据表明这可能至少包含一个信念成分,那么这些信念是关于消费者、投资者还是记者呢?你的市长与密歇根消费者调查高度相关,所以它可能反映了消费者的偏好,但也可能仅仅来自记者本身的情感,因为他们在总结信息。他们有个人信念被放入新闻报道中。并且可能存在一个自我实现的预言,当新闻报道说市场不好,人们现在都相信市场会不好,然后卖出股票,市场真的就变坏了。那么是否存在像市场交易这样的行为模式呢?我只是想知道你是否可以检验这一点,因为我们知道新闻媒体确实会驱动股市回报,所以这可能是你可以检验的一个方面。这个故事不是你论文的主要部分,但一些额外的证据可以帮助我们更深入地理解情感到底意味着什么。
我也有一些关于你测试的经济机制的评论。你发现大部分力量来自于就业和消费部分,而不是投资和生产。现在我想知道为什么会这样?为什么报纸情感只预测就业和消费?也许有些报纸更侧重于就业和消费话题?也许一些地方报纸更关心当地的就业或消费行为?也许你可以研究报纸报道的话题,并试图看看是否是这种情况。也许当地报纸的读者主要是消费者,他们的行为受到这些报纸的影响?这里又是一个反馈循环。也许你可以尝试区分全国性报纸和地方性报纸的影响,它们可能有不同的影响。也许全国性报纸可以预测投资或生产,我不知道,但这是可以思考的。但总的来说,我认为这是一篇非常好的论文,写得很好,数据、方法和实证分析都很好,有很多创新和启示。一些进一步的要求会让这篇论文更好。我强烈推荐大家阅读这篇论文,并祝你在出版过程中好运。谢谢。
好的,非常感谢张博士。现在我们有一些时间来回答听众的提问,但首先让我们为我们的演讲者献上热烈的虚拟掌声。请留在Zoom房间里,当我们把所有人都升级为嘉宾时,这样我们就可以开始提问了。朱尔斯,你当然也可以花些时间回应讨论。
我主要想说的是,关于讨论,非常感谢,精彩的讨论。你给了我们一些值得思考的东西,我认为这些都很重要。我认为,我们应该把那些用于一般情感的种子词写进论文,比如“好”、“可爱”、“优秀”、“幸运”和“愉快”,而负面的词是“坏”、“糟糕”、“可怕”、“差”、“不幸”和“不愉快”。所以,你知道,在情感方面,它们是“惯犯”。
关于这一点,我也在聊天中看到了一些问题。我的意思是,这是一个连续的衡量标准,对吧?所以,一旦你说失业是一个坏词,这意味着高失业率比失业更糟糕,而就业是好的一面,对吧?所以,我不确定这是否完全解决了你提出的问题,我对此表示同情,有些词可能比我们意识到的更中性。但是,只要方向是正确的,那么这个尺度就会随着我们正在考虑的其他词语的相似性而调整。所以,我认为我们在这方面做得很好,但我们会确保更仔细地考虑这一点。
我是否错过了任何我们需要回应的事情?一切都很好,嗯,好的。
我们收到了很多问题,我认为最好从罗克珊娜开始,她有几个问题。她似乎还没有进入Zoom房间。所以,我认为问题都提得很好。也许朱尔斯,你能看到……哦,她在这里了。所以,也许她可以直接问,这样会更容易。
你好,罗克珊娜。你好,朱尔斯,你好,张博士,大家好。我有一些问题,但我觉得没有时间一一回答,所以我将回答我认为最有趣的一个问题,那就是你是否可以区分期望,比如信念,与不确定性成分?因为当我们想到新的信息时,我们会想到信号的质量。然后,一些报纸在这方面更不确定,或者语言可能更不确定。你是否将这部分纳入你计算的指数中?如果没有,你能否考虑进去?如果你对不确定性指数感兴趣,是否需要运行算法来创建它?
我非常喜欢这个问题,我认为这是一个很棒的问题。在某种意义上,连续的衡量标准将捕捉到你想要的一部分,因为如果做出了明确的、强有力的陈述,你可以认为它们是以非常小的确定性传达的。但总的来说,你知道,作为一个标准的贝叶斯主义者,我们会用隐含的不确定性来衡量每个数据点,而这种不确定性是以其传达的方式来衡量的。我完全赞同这一点,而且可能存在不确定性的时间变化,这可能具有重要的预测能力。我认为这是一个非常值得深入研究的好事情。我不确定这个问题是否是这篇论文应该探讨的地方,或者说,这种方法是否可以用来直接衡量不确定性。特别是考虑到最近西德尼·隆的研究,我们正在考虑各种不确定性措施的主成分。如果有可能基于文本构建不确定性措施,那将是太棒了。感谢你的建议,我非常感激。
非常感谢你的回答。