Transcription
[音乐] 欢迎来到金融领域的 AI 和大数据网络研讨会。今天我们非常荣幸地邀请到两位杰出的演讲嘉宾。我的同事 Assaf Manila 来自 Wu Olan,他将展示他的关于时间一致性大型语言模型的论文,而 Super team Sakar 来自哈佛大学,将担任评议人。现在,Assaf 将有 30 分钟的时间进行他的演讲,然后 Super team 将进行 20 分钟的评议。我可能会在大约 15 分钟时暂停一下,以便进行一些澄清性提问。Assaf 的合著者们也在听众席中,他们或许可以回答聊天中出现的任何问题。讨论结束后,我们将向听众开放更广泛的提问。所以,请在问答环节提交您的问题,我将在提问环节点名。另外,作为惯例提醒,请尊重您的评论。本次演讲和讨论将被录制,并与幻灯片一起发布在我们的网站上。在网络研讨会的主要部分结束后,我们将进行一次未录制的讨论,届时我们将把所有人都升级为小组成员,并希望能进行一次激动人心的思想交流。那么,话不多说,Assaf,请开始吧。 好的,谢谢邀请。我一直期待着在这个精彩的论坛上发表演讲。非常感谢。让我尝试分享我的幻灯片。如果你们能看到幻灯片,请给我一个赞。 好的。谢谢。这篇论文是与 Song Lining 和 Jimmy 的合作成果,他们都是 Wu 的优秀金融学博士生。你们应该在即将到来的新秀市场中关注他们,毫无疑问。大型语言模型很棒,这一点我无需向你们证明。作为研究人员,我们都想使用它们。问题在于它们是在近期数据上训练的,这会引入前视偏差。例如,如果我向你们展示一个模型,其训练数据中包含了《格雷体育年鉴》2015 年版的图片,你们可能会觉得它在 20 世纪 50 年代赢得体育博彩的能力有些可疑,对吧?在金融领域,我们对前视偏差尤其敏感,因为许多实证检验都依赖于有效市场假说。我们如何依赖那些不断通过人类反馈进行微调,并且能够搜索解决方案的 ChatGPT 和 Claude 之类的模型呢?我们的解决方案相当直接。我向 Mariam 保证,五分钟内你就能理解整篇论文。就是这样。所以,我们在论文中所做的是训练两个系列的在时间上一致的大型语言模型,并且仅使用之前文本。我认为这对金融领域的人来说是很自然的事情。我们一直都在这样做,只是没有达到这个规模。所以,我们创建了两种非常流行的大型语言模型架构的时间一致性变体。第一个是 BERT。BERT 是谷歌在 2018 年开发的骨干模型,实际上是一个有趣的历史转折点,当时语言模型开始超越普通人在语言理解方面的能力。我还要感谢 Leah Stern 和小组成员,他们在 2018 年给了我关于 BERT 的提示。另一种架构是 GPT2,这是 OpenAI 发布的最新的开源模型。所以,我们瞄准了两种这样的变体,并且对于每个系列,我们都有从 1999 年到 2024 年的模型。它们之间的主要区别在于,BERT 被训练来填充序列中的掩码词,就像一个子句问题一样,而 GPT 是一个自回归模型,它被训练来预测序列中的下一个词。但你真的不必选择,因为我们已经将这两个模型系列发布在 Hugging Face 上,你现在可以下载它们的时间一致性版本了。这听起来很简单,对吧?我认为我们意识到的难点在于训练这些模型,使它们能够与拥有更多训练数据的大型模型竞争。我将详细解释我们是如何做到这一点的。但在深入探讨之前,请允许我预览我们的发现。我们发现,Chronob 和 Chronog 在语言理解方面优于同等规模的模型,并且在预测次日股票收益的资产定价应用中,其表现与规模大得多的 Llama 3.1 模型相当。我们发现 Chronob 的夏普比率为 4.8,与最先进的模型相当,这个词在这个领域贬值非常快,但与 Llama 相当,Llama 的夏普比率为 4.9。事实上,这个差异如此之小,意味着在这个特定的环境中,前视偏差仅为适度。这不是一个定理。它并没有说前视偏差在任何地方都不重要,只是说这是事实,这是我们在我们的应用中的情况。但是,Levy 和 Lopez Lero Tangenju 最近的证据表明,例如在收益数据中,前视偏差可能更严重。所以,这是一个经验性的开放问题,这些时间一致性模型在其他环境中是否也能做得同样好。关于大型语言模型的前视偏差的文献正在迅速增长,因为我们都想使用它们,但我们非常清楚它们存在前视偏差。我的评议人 Super team 在解释前视偏差如何在这种环境中产生以及我们能做什么和不能做什么来克服它们方面做出了非常重要的早期贡献。我认为我们对这个文献的贡献有两个。第一个是开发并公开发布了没有前视偏差且同时具备高级语言理解能力的大型语言模型。这确实是我们努力的目标,我认为这是难点。我们希望通过这样做,我们可以承担估计这些模型的固定成本,并且社会科学家会发现它们对研究有用。第二个是我们使用这些模型来量化新闻收益可预测性应用中的前视偏差,并发现它相当适度。现在你们知道了我们做什么,让我来谈谈我们怎么做。训练大型语言模型通常分为两个阶段。这是一个术语,所以让我澄清一下,以便我们达成共识。有一个预训练阶段,在预训练模型时,模型学习预测文本序列中的缺失词。想象一下,取长文本序列并掩盖或隐藏其中的特定词,然后训练一个旨在填充和预测该缺失词或词元(实际上是词的一部分)的模型。这确实是训练大型语言模型计算和数据密集型部分。第二个阶段是微调,即模型针对特定应用(如聊天、问答、推理或预测次日收益)进行进一步训练。我们所做的是,我们仅在时间 t 之前可用的文本上预训练 Chronob_t 和 Chrono_gpt。例如,2005 年抓取的网页将用于预训练 Chronob,以 Chronob 作为一种热启动点。现在,确保这些模型能够与规模大得多的模型竞争,这带来了两个挑战。第一个是计算能力有限。所以,如果你一直在关注,我不知道,研究资金正在枯竭。我非常怀疑我们能否获得 OpenAI、Anthropic 和 Google 等公司的计算资源。所以,在这方面我们非常有限。但是,即使我们能够克服这个计算障碍,我们仍然受到限制,因为我们只能使用历史数据。如果你曾经看到过社会多年来创造的知识或文本的图表,那是一条指数曲线。所以,如果我们现在限制自己使用 1999 年之前的数据,我们就会大大缩小我们可以用于训练模型的文本量。现在,对我们有利的是,在提高预训练大型语言模型效率方面已经做了很多工作。这也是为什么自几年前 GPT 问世以来,使用它们的 API 成本下降了几个数量级的原因。所以,我们所做的是仔细筛选多样化的高质量数据,并按出版日期过滤,以最大限度地从我们有限的语料库中获取信息。我们还进行多次迭代训练,以最大限度地从可用语料库中学习。我们最初的 1999 年模型,这是我们感觉有足够数据可以发布的第一批模型。它们在多次迭代中训练了大约 70 亿个词元。多次迭代意味着模型要多次遍历数据。但由于其中存在随机梯度下降,这并不意味着你真正复制了所有观察结果。我们不应该惊讶于模型会随着多次迭代而改进。我们做的第二件事是,一旦我们有了那些我们投入了大量精力研究的 1999 年模型,我们就从 2000 年到 2024 年进行增量训练,并在 12 月份每年生成一个模型快照,总共使用 2000 年到 2024 年的 650 亿个词元语料库。好的,这就是我们认为值得大书特书的模型所拥有的数据量。但我们首先要从 1999 年之前的数据中榨取每一滴精华。我们训练 Chronob 1999。这就是我在这里展示的,准确性(红色)和交叉熵(蓝色)。我们仅使用足够多的词元来训练 Chronobart 1999,直到其语言理解能力(这里显示在右侧)与原始 BERT 一样好。原始 BERT 是这里的虚线红线。BERT 的优势在于谷歌拥有直到 2018 年的数据来训练它。所以,仅凭 1999 年的数据,我们就能达到大致相同的语言理解水平。我们同样训练 Chrono GPT99,直到其语言理解能力(右侧显示)与 GPT2 一样好。对于自回归或 GPT 类型模型,有一个略有不同的评估指标。这里我们使用 Hella Swag,这是一个常用的基准。一旦我们有了这些 1999 年的模型,我们就用它们作为训练 2000 年到 2024 年模型的起点。在这里,你可以看到 X 轴是每个模型的年份,你可以看到这些模型在多年来的语言理解能力是如何提高的。你会期望这条曲线有所上升,因为我们向模型展示了更多的文本,你会期望它的语言理解能力更好。它不像 1999 年和 2024 年之间有显著的差异,尽管如果你仔细看,你可以看到一条拟合的上升曲线。这是 Chronog 模型曲线的样子。Chronog 模型实际上在这些年里看到了一个更陡峭的曲线,尽管同样,在数量上,我不知道这是否是一个很大的区别。在这张表中,我们报告了 Chrono 和 Chronog 以及几个基准模型的规模、上下文和知识截止日期。我们的模型在规模上与 BERT 相似,与仅在金融文本上训练的 FinBERT 相似,或者与 GPT2 相似,就参数数量而言,它们非常相似,尽管我们的模型具有更大的上下文窗口。这是这些模型更现代架构的一部分。在接下来的幻灯片中,我还将与 Meta 发布的大得多的 Llama 3.1(80 亿参数)进行基准测试。它的知识截止日期是 2023 年 12 月。所以,我将比较这些时间一致性模型与规模大得多的、时间不一致的 Llama 模型或 BERT。但我不能跳过 Super team 的 Stories LLM 模型,该模型比我们早几个月发布了一系列时间一致性模型。Stories LLM 我认为是一个模型系列。我应该把它作为一个系列来展示,但据我记忆,它的最后一个模型知识截止日期是 1963 年 12 月。所以,我也会与该模型进行比较。好的。GLUE 是一个常用的 NLP 基准套件,Chronob,你可以在底部看到,在 GLUE 平均得分约为 85,而 Chronog 得分约为 75。我想让你记住这些数字 85 和 75,因为我将切换到下一张图表,其中包含其他基准模型。Llama 3.1 的 GLUE 得分为 86.3。谷歌的原始 BERT 得分为约 85。FinBERT 得分为 76,Stories LLM V1 得分为略低于 80。所以,我的结论是,Chronob 和 Chronog 在语言理解方面优于同等规模的模型,并且其表现令人惊讶地与规模大得多的 Llama 模型相当。我认为看起来问答环节没有问题,所以也许我们可以继续,当问题出现时,我相信 Jimmy 和 Ling 能够及时解决。听起来不错。这是一篇非常简单的论文,我告诉过你们了。所以,现在我想退一步,承认即使在我们的时间一致性模型中也可能存在错误,因为我们使用我们认为在特定日期可用的数据来整理我们的训练数据。但这并不意味着这个过程是完美的。例如,如果我们查看一个通过 OCR 扫描的出版日期,那么该过程可能存在错误。我们对此持开放态度,并且我们坦诚相待。例如,如果一个出版日期实际上是,比如说 2009 年,而 OCR 将其识别为 100 年前,那么我们的模型可能仍然会留下一些前视偏差的痕迹。接下来我将展示一些句子补全练习,我们称之为时间一致性模型,它们应该在知识截止日期内的事实上表现良好,而在未来的信息上表现不佳。例如,我将开始让 Chronob 补全这样的句子,我们提供年份和年份加一,并要求它填写在下一年美国总统大选后的就职总统是谁。所以,你们都可以很容易地解决这个问题,但你们站在 2025 年。假设你站在 2020 年,你能多好地解决这个问题?我将向你们展示几张这样的图表。如果你有更好的展示方式,欢迎提出。但我们的做法是,蓝色部分是模型正确预测的部分。阴影部分,比如这里的词,是模型知识截止日期之外的词。例如,BERT 的训练数据直到 2018 年。所以 2020 年和 2024 年的选举被阴影化,因为它们超出了其知识截止日期。所以,一个好的 Chrono 模型应该在阴影区域之外全是蓝色,在阴影区域内全是黑色。我希望这足够清楚了。如果我第一次理解这些图表花了五分钟,也许你们会比我快。所以,我们发现 Chronobart 只知道它应该知道的关于美国总统选举的事情。唯一的例外是,如果你看 Chronobart 模型这里的阴影区域,我们的模型实际上,我们的 2020 年模型实际上预测了特朗普在 2024 年的连任。你可能会问自己,它怎么可能做到这一点?所以,这可能是因为我们有一个超级智能模型。更有可能的是,它只是看了它训练集中的最后一个总统,然后向前推断。好的。然后我们尝试了一系列其他重要的事实,比如 2001 年的安然丑闻。所以,如果你问,在 2001 年,安然事件促成了 2002 年《萨班斯-奥克斯利法案》的通过,那么在 2002 年之前,它会猜测“修正案”,之后则猜测“丑闻”,这大致是它的工作方式。我们尝试了 2003 年的 SARS 疫情,2008 年的次贷危机,2016 年的英国脱欧公投,2020 年的冠状病毒大流行,以及 2022 年的 ChatGPT 这个 AI 奇迹。所以,如果你提示 GPT 标记了生成式 AI 的一个主要里程碑,它直到 2024 年都不知道你在说什么。好的。所以,我们以此作为证据,表明在这些测试中我们没有发现任何前视偏差的证据,这是 76 个测试中的 0 个,并且在知识截止日期内预测相当准确。所以,80 个中有 72 个是正确的。好的。所以,有了我们时间一致性模型,我们现在可以量化前视偏差在新闻收益预测应用中的重要性,这在某种程度上贴近我们作为资产定价师的心。对于每个公司日观测值,我们使用一个大型语言模型,无论是 Chrono 版本还是非一致性版本(如 Llama),来嵌入一系列标题的数值向量表示。这个术语叫做嵌入。所以,我们使用不同的 LLM 创建这些嵌入,然后拟合一个正则化的 FMA MCBTH 回归,将新闻嵌入映射到收益预测 R。现在我应该说,我们在这一步没有任何创新。我们完全采用了 Chen、Kelly 和 Chu 在他们最近关于使用 LLM 解决这个问题的论文中的方法,我们只是想复制他们的练习,但使用时间一致性 LLM,并将它们的性能与规模大得多的 Llama 类型模型和其他基准模型进行比较。所以,Chen、Kelly 和 Chu 很谨慎,我们也是如此,以避免引入进一步的前视偏差。为了避免引入进一步的前视偏差,我们估计这些回归是在前一个月的数据上进行的。好的,资产定价、新闻数据和嵌入数据,以获得系数 beta。然后,我们使用这些系数估计来形成样本外基于新闻的收益预测 R 帽子。然后,我们取这些 R 帽子并形成预期收益的十分位数组合,然后我将在下一张幻灯片中展示的基本上是这些十分位数组合的多空组合。明白了吗?希望如此。这里我们报告了 Chronobart 和 Chrono GPT 的实时预测结果,并将其与规模大得多且在时间上不一致的 Llama 3.1 进行了比较。如果你关注最后一行,你会惊奇地发现,Chronobart 的表现几乎和 Llama 一样好。这是 Llama 的夏普比率。这是 Chronobart 的夏普比率,包括平均超额收益和之前展示的夏普比率。所以,6.1 对比 6.06。如果我们比较 Chronog,我们会发现 Chronog 在这项任务上的表现不如 Chronobart,尽管它的表现仍然相当令人印象深刻。现在,Chronogart 能够如此接近,这告诉我们,在这个特定的应用中,前视偏差相当适度。好的,前视偏差应该存在于 4.8 和 4.9 的夏普比率之间。好的。所以,这是 BERT 的其他变体在同一任务上的表现。我们看到,时间上不一致的 BERT 的夏普比率较低。FinBERT,它在更多金融数据上训练,表现不佳。Stories LLM,它经过精心构建,不包含 1963 年之后的数据,表现相似。现在,这些是要求你比较点估计的陈述。我们进行了正式的统计检验,发现 Chronobart 的确与最先进的、不一致的 Llama 模型相当。所以,我们无法拒绝它们的夏普比率相同的说法,但你可以拒绝大多数其他模型的夏普比率与 Llama 截然不同。现在有一个有趣的问题,是什么在起作用?是我们使用了最新的知识,还是我们训练模型以获得更好的语言理解能力?所以,为了衡量最新知识的重要性,我们报告了不同年份模型的夏普比率。那么,这张图表展示了什么?虚线蓝线是 Chronobart 实时。我之前在表格中展示的,我们总是使用最新的 Chrono 模型年份。相比之下,实线上的每个点,例如,实线上的 2004 年点,显示的是同一个交易策略的表现,但我们使用 Chronobart 2004,仅用这个模型来嵌入所有新闻。所以,其中一些是前视偏差。其中一些是它拥有更好的信息。但你可以从这张图表中看到,模型年份的改进相当适度。我们预计会有一定的改进,但同样,我认为这种改进并不那么显著。这可能来自两个方面。它可能来自这样一个事实:嗯,最新的知识并不那么重要。它也可能来自这样一个事实:BERT 仍然是一个相对较小的 LLM。所以,如果我们的 LLM 大得多,它可能能记住更多事实,那么这里的曲线会更陡峭。事实上,我们没有从 Chrono GPT 中看到类似的改进。同样,我认为这个模型可能太小,无法记住事实,我们目前正在努力扩大它的规模,并希望很快能发布结果。好的。那么我们学到了什么?我们了解到训练没有前视偏差的 LLM 非常容易。例如,如果你训练了一个总是预测 Assaf 的模型,那么该模型将没有前视偏差,你会说,太好了。但我们了解到,训练时间一致的 LLM 以获得足够的语言理解能力以使其有用,实际上非常困难。所以,我们希望为这个行业节省这项固定成本。所以,我们在 Hugging Face 上发布了 Chronobart 和 Chronog,并希望你们觉得它们有用。从经济学信息来看,在金融资产定价领域,新闻收益预测环境中,前视偏差似乎相对适度,但同样,你的体验可能不同。所以,我们鼓励研究人员在其他应用中尝试 Chrono 模型,并在那里量化前视偏差。现在,在我把话题交给 Sakar 之前,我想推介一种不同的方法。你可能会想,嗯,你的模型太笨了,与 ChatGPT 和 Anthropic 相比,我非常理解这一点。能够达到与 Llama 相同的资产定价预测水平真是太了不起了。所以,在与 Joey Will 和 Luca 的互补工作中,我们深入思考了如何处理可能给 LLM 提供关于前视偏差线索和痕迹的文本,并将其进行掩盖。我们称之为实体中性化。所以,我们通过利用 LLM 对抗自身来移除识别线索。我就是这样想的。我们指示 LLM 将名称、日期、产品等替换为通用标记。我们表明,与过去记录的更简单的掩盖方法不同,这种方法在文本中性化方面非常有效,因为 LLM 无法识别公司,也无法识别新闻发布的时间,这使我们能够在很大程度上避免估计收益预测中的前视偏差。我不会在这里花更多时间。我只是想提出这个想法。这些论文都在网上,我鼓励你们去看看。好的。这是我说的全部。非常感谢。我将把话筒交给 Supra team。我感谢你对我们论文的评议,我期待你的评论。嗯,非常感谢 Assaf 的精彩演讲,现在我们将把话筒交给 Supra team。我们很期待你的评议。现在我没有静音。非常感谢邀请我,也非常感谢这篇精彩且非常有趣的论文。我很乐意谈谈这篇论文。我认为这篇论文的工程贡献非常酷。但首先,让我先简单介绍一下背景,重新梳理一下前视偏差的问题,以及这些时间下标模型或时间一致性模型如何解决它。所以,让我回到 Assaf 提到的预训练,对吧?预训练是一种让语言模型或其他类型的模型接触各种历史数据源的方式,对吧?在语言领域。这使得语言模型了解语言的结构,对吧?词语是如何组合的?概念是如何联系在一起的?此外,这个预训练语料库还为模型提供了关于数据中嵌入的事件的信息。假设你有一条标题说世界大战结束了,或者肯尼迪在达拉斯街上,对吧?这些是关于历史事件的信息,也嵌入在用于训练语言模型的数据中。现在,在预测分析中,有些信息不能进入,对吧?我们有一个信息集,我们期望的信息集,我们不希望来自信息集之外的信息进入预测分析,为了更明确一点,对吧?假设我们使用历史新闻数据训练一个模型,如果我们预测股票价格,比如 IBM 的股票价格,对吧?IBM 的股票价格可能在预测窗口之后的一个时期被提到。还有间接信息,对吧?假设 IBM 的商业模式已经改变,现在它被讨论得类似于咨询公司,它的估值更像咨询公司。现在,这也在模型的表示空间中产生了关联,这可能导致信息泄露到任何预测任务中,对吧?所以,正如我们所提到的,在预测中,有些信息必须不进入分析。在资产定价、宏观预测和其他涉及预测的领域,研究人员已经小心翼翼地不包含信息截止日期之后的数据 X,对吧?我们知道这会泄露信息并导致夸大的绩效声明。现在,当人们开始使用这些预训练模型时,也值得指出的是,这些预训练模型可能会引入信息截止日期之后的信息。对吧?来自预训练的此类信息可能会使涉及语言模型的预测无效。对吧?假设我们有一个陈述,一个训练了历史事件信息的模型可以预测历史事件。我们如何解释这样的陈述?所以,让我介绍一点形式化或一个例子。对吧?这是 Kean 和我在我们的论文《前视偏差和预训练语言模型》中展示的一个例子。我们以 Zoom 的收益电话会议为例。我们提示模型,仅考虑截至收益电话会议及之前的信息来预测风险。尽管有这样的指示,但当我们实际生成这些风险时,我们会得到像 COVID-19 大流行和向远程工作转变这样的内容,这些内容不太可能包含在信息集中,或者至少在那时发生的可能性很高。对吧?COVID-19 这个词在那时还没有被发明出来。对吧?更广泛地说,在许多领域都有关于预训练模型前视偏差的证据。对吧?Paul 和 Kaden 有一篇很好的论文展示了股票收益。Kia 和我展示了语言序列和选举获胜者。我展示了我的求职论文中的总统完成情况,Bradford 展示了收益公告和收益增长。对吧?所以,有大量的证据表明,这些类型的模型可能会在进行预测练习时引入不应包含在信息集中的信息。所以,一点形式化,对吧?预测练习的目标是从某些语言 X 预测某些结果 yt+1,限制在所需的信息集 it。这可以帮助我们定义一个我们可以称之为不可约误差的对象。对吧?我们无法使用直到时间 t 的信息来预测什么结果 y。那么,什么是 LLM?它是一个函数,它接收语言 X 并由预训练数据和优化过程引起的某些参数 M 参数化。对吧?当由参数引起的信息不包含在感兴趣的信息集中时,这些模型的泄露信息就会发生。所以,现在假设我们的研究人员使用一个 LLM 并构建一个预测模型 muhat。对吧?所以,f 是 LLM 的输出。g 是一个分析过程,它作用于由 theta 参数化的 LLM 输出。这可以帮助我们定义前视偏差。这是当不可约误差与研究人员预测模型的输出相关时。对吧?传统上,我们可能会认为前视偏差是分析过程的 theta 与不可约误差之间的某种相关性。对吧?我们正在训练一个基于历史信息的模型,该信息会潜入我们然后用于预测未来信息的参数中。此外,预训练的前视偏差也是一个类似的问题。对吧?不是我们作为研究人员通常发现训练的模型。但这些参数包含历史信息,这些信息可以进入分析过程,并且通过将 fx 条件于 M 的输出视为数据,我们就有可能错过这种信息的重要引入。对吧?那么,我们如何解决这个问题?这个想法是,这些语言模型的参数可能包含我们在预测中不应使用的信息。一种已被提出的方法是改变 X,改变语言本身。所以,掩盖我认为是这些程序的统称,它通过从 XT 中移除信息来形成一些 XT_mask,一些移除公司名称、时间标记、产品等的方法,对吧?这个程序的隐含目标是什么?它试图掩盖 X,以便预测与不可约误差之间的相关性达到零。我们如何做到这一点?一种方法正如我提到的,就是退化为常数,对吧?总是输出一件事,对吧?那么,你不会有前视偏差,我们也可能不会有一个特别有用的预测模型。如果掩盖恰好抵消了泄露,你也可以做到这一点,但很难理解在哪些领域我们可以审查足够多的 X 信息,使其不会不恰当地与语言模型中的某些信息 M 配对以进行前视。这里的想法是,我们是否应该相信直觉?机器学习可以从退化的数据中重建标签。有一篇很好的论文在医学图像的背景下展示了这一点,放射科医生无法提取信号,他们认为图像已经损坏得足够多,但机器可以。所以,我们怎么知道数据已经损坏得足够多?我认为这导致了解释上的问题,一方面是因为它减少了信息,另一方面我们仍然不确定在各种问题上它能避免前视潜力的程度。但很可能会解决这个问题的是改变 f,即语言模型,实际上是使用预训练数据来自信息截止日期之前的语言模型。对吧?Gemini 是用直到现在的信息训练的,其中包含关于 COVID 或全球金融危机等信息。但为什么我们不使用一个只在特定时间点之前的信息训练的语言模型呢?对吧?这可能会让我们更接近我们的目标,即与不可约误差没有相关性。一种方法是通过这些历史 LLM,人们已经发布了。还有一种方法是通过 Kean 和我称之为带时间下标的 LLM 的方式,以更实时的方式做到这一点。有 Stories LLM,我几个月前发布的。Bradford Levy 有一个模型,他即将发布。我认为这些模型可以帮助研究人员通过保证没有泄露来解决这个问题,因为没有数据来自或选择自预测期之后的窗口。那么这篇论文做了什么?它是一种很棒的方式来完成这项任务,即改变 f,实际上是构建一系列使用时间下标的语言模型。所以,通过持续学习,他们将训练两个模型系列 Chronob 和 Chronog,他们发现首先,这些模型在标准语言基准上相对于同类模型表现良好。此外,当他们查看这些模型的输出时,他们发现证据与模型在训练到所需知识截止日期时没有信息泄露的证据一致。最后,他们发现他们的模型以及其他模型的收益预测性能相似。所以,让我简单回顾一下这篇论文。我认为 Assaf 很好地介绍了它。对吧?有两个模型系列。一个是掩码语言建模,这是一个编码器模型。另一个是用于生成的因果语言建模。他们在 1999 年训练了一个基础模型,并逐年训练到 2024 年,对吧?他们还尝试使用在分类器上具有高分的数据进行预训练数据过滤,该分类器已被证明有时能产生更高质量的文档。所以,从视觉上看,他们将使用 1999 年之前的数据。他们将使用这些数据来生成第一个年份的模型。然后,他们将滚动更新该模型。所以,你将保留最后一个模型中的参数,然后引入 2000 年及之后的数据,并生成这个模型系列,其属性是,假设数据经过精心策划,并且不是基于当前信息选择的。你知道,这个数据集将保证你不会泄露关于未来的信息。那么,他们如何使用这个模型?他们做的第一件事是尝试验证其在语言基准上的性能。对吧?所以,他们发现 Chronob 在 GLUE 基准上与 BERT 和 Llama 3.1 相当,GLUE 是一个包含许多语言任务的集合。值得注意的是,这个模型比 FinBERT 和 Stories LLM V1 表现更好,我真的很高兴我们通过这些时间一致性语言模型系列在语言理解方面做得越来越好。然后,他们使用该模型并尝试验证其预训练数据是否被正确截止,对吧?是否被正确指定。他们表明,确实如此,在特定时间点之前训练的模型似乎不会泄露关于未来的信息,这是验证这种时间下标时间一致性性质的一种好方法。然后,他们转向收益预测练习。对吧?基本上,他们在这里所做的是找到嵌入空间中的方向来预测收益。所以,让我用一个图来解释一下。他们将为一家公司每天取一堆标题或连接的标题,并将它们放入 Chronob 或其他模型中,并在嵌入空间中构建一些嵌入。然后,他们将学习一些回归。我将只做一个简单的分类,更容易可视化,但学习一些基于收益的回归,以及基于嵌入的回归,使用过去的数据。对吧?他们在这里非常注意数据卫生,就像我们来回邮件讨论的那样。对吧?所以,想法是,你将学习一种方法来获取这个嵌入并产生一些信号。然后,他们将该信号用于构建一个投资组合排序,然后形成一些统计数据。对吧?我们有这个模型,我们有这个嵌入,我们历史上学习了嵌入和收益之间的关系。现在,让我们将其应用于今天的嵌入,并尝试预测明天的收益。通过这个,他们发现与一些可比模型相比,性能相当,甚至优于一些纯模型,并且与一些其他当代模型如 Llama 3.1 相比,性能也相当。这表明这些模型具有良好的性能。我将把作者的幻灯片发送给他们,以便进行更多的基准测试。现在,我想稍微谈谈这个练习的解释。对吧?我认为“前视偏差是适度的”这个说法是一个很大的主张,而且我并不清楚研究人员如何支持这个主张,除了特定的研究设计。对吧?即使你考虑新闻对收益的预测,在架构、数据、预测程序、预训练语料库等方面也存在差异,这些都是特定研究设计的一部分,当你比较模型之间的损失时。我认为更广泛地说,作为一种职业,对前视偏差采取对抗性视角很重要。对吧?资产定价研究以多种方式转换数据。假设在一个领域中,收益可预测性存在适度差异。研究人员对 LM 性能泛化能力几乎没有直觉,一般来说,人们似乎对 LM 性能泛化能力没有直觉。有什么保证,如果你在一个领域中具有适度的性能,你不会在另一个领域中具有非常好的表面性能?为了更明确地说明这一点,让我稍微谈谈研究设计。让我谈谈它如何映射到另一种类型的论证的漫画。对吧?假设有人来找你,说嘿,我构建了一个交易策略,使用了直到今天的数据,关于我的排序变量,或者实时数据,关于我的排序变量,只到预测期,我发现投资组合 A 和投资组合 B 的表现相似,因此我可以声称,任何使用直到今天的数据的交易策略都没有前视偏差。对吧?是什么让我们觉得这个说法有点不安?首先,什么是排序变量?也许是公司名称的首字母。也许是公司的账面权益,对吧?我们可能直觉上认为,未来的账面权益会影响未来估值的变化,对吧?所以,我们可能对哪些排序变量不太合适有一些直觉。但作为一个领域,资产定价已经摒弃了我们可以“挑剔”哪些信息可以接受前视的观点,而是真正尝试使用实时数据。对吧?我们确实反对使用任何关于未来的信息。对吧?我与对冲基金的人交谈过,他们提到预测本质上是低信号的,任何前视潜力都可能淹没预测分析中的真实信号。对吧?所以,为了明确说明研究设计如何因试图完成相同的任务(即从标题到预测收益)而异的研究人员而异,对吧?让我们回到论文中的研究设计,并谈谈其他研究人员如何修改它,对吧?有模型选择,有数据选择,有分析程序选择。让我们从模型开始。所以,Assaf 提到,对吧?与目前的尖端模型相比,这是一个相对较小的模型,对吧?它可能是具有时间下标属性的最大模型之一,但它是一个较小的模型。在其他领域也有证据,Paul 和 Kaden 以及 Bradford 的研究表明,对于比这更大的模型,在预训练截止日期周围存在可预测性的差异,无论是收益还是收益增长。对吧?模型不知道同期事件,预测收益或预测收益增长对某些大型模型来说变得更加困难,在他们特定的研究设计中。所以,为了理解这如何改变这里的解释,对吧?假设我们使用 GPT5(一旦发布)来嵌入标题,对吧?会发生什么?嵌入空间中的事物可能会移动,对吧?有更多的信息泄露空间,而且你拥有非常丰富的模型类别的非常现代的信息。这在嵌入空间中移动。即使你对数据卫生非常了解,告知分类器“买入”与“卖出”,但事实是,嵌入空间已经被这个在未来训练的非常丰富的模型所移动,这意味着你仍然有这种未来信息污染你最终学习的统计数据的潜力。对吧?所以,表示空间随着模型变化而变化的观点会引起不同的记忆问题。让我们来看看数据 X 的选择。对吧?所以,新闻标题很有信息量,但内容也有限。对吧?所以,Kean 和我表明,更多的输入数据内容也会泄露更多信息,对吧?显然,你可以采取对抗性方法来尝试越来越严格地审查数据,但你仍然会发现更多信息泄露得更多,并可能产生与前视偏差更一致的信号,对吧?所以,假设你使用 Chronob 来嵌入所有同期新闻语言,所有媒体,全文,使用一些巧妙的聚合程序,对吧?同样,这里发生的是,你正在移动预测公司在空间中的嵌入位置,对吧?即使你的决策边界是绿色的,它是好的,它是使用良好的数据实践找到的,预训练程序包含更多信息,你使用的数据,也可能改变嵌入,这应该有助于你重建你可能无法获得的信号,对吧?所以,数据选择对我们的研究设计非常重要。最后,分析程序的选择。我认为这里有巨大的差异,人们将语言模型应用于该场景的方式,对吧?所以,在作者的设置中,以及他们正在构建的论文中,他们根据同期新闻的表示形成一些分类器。对吧?人们还使用模型来提问,对吧?这家公司会受到大流行的影响吗?我们知道关于大流行的讨论已经改变了。这家公司是否被高估了?我们认为这些讨论可能会随着估值的实现或估值变化而改变,对吧?所以,即使在固定模型和固定数据的情况下,分析程序也有很大的空间可以移动。对吧?你可以根据过去的收益绘制一个决策边界。你也可以绘制一些决策的表示,关于大流行问题,或者关于高估问题,或者关于任何其他问题,这再次创造了从语言到信号的任意映射。仅仅因为一个特定的研究设计似乎没有更多的泄露,并不意味着每个人都会。对吧?所以,这可能会导致任意信息进入分析。所以,我只是想明确这一点。我认为,当我们考虑前视偏差时,重要的是建立一些心理模型,在哪些情况下,它的潜力可能会增加或减少,并且在研究人员试图确定如何应用这些模型时,有很多设计选择,我认为我们需要理解其灵活性。所以,我只是想说明一点,即使对于相同的研究任务,前视潜力也不一定在所有研究设计中都是均匀的。所以,让我举一个例子,使用当前模型和当前数据,以及如何考虑重建一个可能将信息与未来联系起来的研究设计。所以,让我回到我之前提到的,对吧?在低预测环境中,前视偏差会淹没信号。所以,让我回到作者们展示的内容,对吧?右边是关于总统姓氏的东西。左边是关于安然以及安然发生的事情的图。再次,你在生成的语言中看到了一些不同的东西,这表明在公司之间的关联和联系方式上存在差异。
表示空间取决于模型的年代。这意味着什么?现在,当你对同一种语言有两种不同的表示,而这取决于模型的年代时,这就像是关于来自未来的信息改变了嵌入空间形成方式的精确体现。对吗?所以假设你形成了一个交易策略,你试图做空那些被过度炒作的股票,你构建了一些分类器,不是基于整体的映射,而是基于非常具体的映射,你在其中引入了额外的领域语言。对吗?假设Theranos的嵌入在后来的年代模型中变得更像安然而不是苹果。对吗?再次。因此,根据研究人员使用特定模型的方式,他们总能重建一些信号,这些信号可能与他们不希望与不适当信息相关的回报相关,这取决于他们如何设置模型。对吗?
所以总的来说,我想说的是,作者们简化了模型,这非常棒。我花了很多时间谈论更广阔的图景,但我真的想强调,我认为这是一个非常酷的工程贡献。嗯,我有点鼓励作者们在数据管道方面提供更多细节。我稍后会将这些更多细节发送给作者们。但让我总结一下,对吗?
所以这是LMS和时间下标的巨大进步。它拥有其他时间主题模型尚未拥有的最新预训练数据。并且它在基准测试上的语言性能优于其同行,这对于更好的语言理解来说非常棒。通过向公众发布这些模型,社区现在可以使用这些模型及其适当的数据截止点,以避免前瞻性偏差的潜力。我认为我对作者的两组评论是,再次,我还要赞扬作者的一点是,他们展示了通过改变模型实际上可以解决前瞻性偏差。嗯,我想向作者强调两件事。第一,更清楚地说明关于前瞻性偏差潜力的主张适用于哪些情况。我认为,作为一个社区,我们正在努力弄清楚这一点,我们对哪种测试在哪些假设下提供哪种保证越明确,我认为我们在理解偏差的整体潜力方面就会做得越好。嗯,第二,我认为这篇论文的工程贡献再次非常重要和有趣,我认为提供更多关于模型构建方式的信息会有所帮助。
但我只想说,我认为作者们训练了这些模型,并将其发布给研究社区,这令人惊叹。我认为我对我们能够继续这种工程倾向的能力非常乐观,对吗?基础模型提供商并不总是针对经济学家或金融研究人员所需的东西,但我们不必是消费者。我们可以像这些作者一样成为生产者,这是一个非常有前景的未来工作方向。谢谢。太棒了。非常感谢超级团队的精彩讨论。
嗯,阿萨夫,你想在进入一般问答环节之前,花几分钟简短回应一下吗?
哦,我只是想借此机会感谢超级团队的深思熟虑的讨论。我认为我们同意你所说的一切,我想我曾多次强调,我们关于前瞻性偏差适度的结果是依赖于应用的。嗯,我想我有一个想法,当您展示这些关于嵌入空间和模型的美丽图表时,我们论文中有一个观点,也许我们应该把它放大,那就是您在嵌入之上叠加的预测模型,如果您考虑该模型的目标是什么,研究人员试图用该模型做什么,研究人员试图构建一个能够样本外泛化的模型,从他们的角度来看,前瞻性偏差是一种麻烦,对吧,这对他们来说是一个问题,我认为使用我们用于任何机器学习的粗略相同技术,只是样本分割,并选择能够很好地样本外泛化的模型,可以纠正一些偏差,或者至少我希望我们能够做到,我看不出我们为什么不能,所以我不知道您对此有何看法,但嗯,我,我不知道,我想我更希望我们能够在许多设置中解决前瞻性偏差。嗯,但我绝不会声称,而且我认为我们也没有在论文中做出这样的声明,即前瞻性偏差不是问题。事实上,我们鼓励研究人员使用这些模型,并在他们自己的领域、他们作为领域专家的研究空间中进行评估。所以感谢这些很棒的评论。感谢这篇精彩的论文。非常感谢。
嗯,我们现在有时间回答观众的问题。我想Srun已经在聊天中回答了一些问题。所以,但如果你有更多问题,请提交它们,然后我会请你来回答。
嗯,那么,我将请Burnt发言。嗯,你想自己解除静音并提问,还是我应该直接读给观众听?嗯,我来读。所以,Burnt Rubin正在问几个非常简单的问题。你能稍微谈谈数据集吗?当你说我们在某一天汇总了一只股票的所有新闻文章标题时,具体做了什么?另外,数据集是否按股票代码提供标题?另外,请多谈谈回归。嵌入向量的维度是多少等等。
那么,你想解除静音并解释新闻回报预测练习具体是如何运作的吗?
是的,当然。嗯,所以对于新闻回报预测,我们主要使用道琼斯通讯社的数据,我们,嗯,所以,那是一个大多数机构投资者都可以获得的实时通讯社,所以它有一个非常精确的时间戳,表明新闻何时对市场可用。所以,嗯,所以对于那一部分,我们可能不会使用该数据进行回报预测。
我想补充一点,你问到“汇总”,这意味着如果你考虑一家普通公司或特别是像微软这样的大公司,它在任何一天都有很多关于它的新闻。所以你必须以某种方式将其汇总成一份,你知道,一天的,嗯,新闻,嗯,你将其用于回报管理,这就是我们所做的汇总。我们基本上会获取某一天所有关于微软的标题,并将它们连接成一个单一的文本片段,然后将其输入到LLM中。这就是那里“汇总”的意思。我希望这很清楚。
嗯,我想马库斯也有一个问题。你想继续吗?
是的,非常感谢精彩的演讲和讨论。嗯,我有一个问题,虽然部分提到了,但总的来说,当你考虑任何类型的预测或模型估计时,你都会面临偏差-方差权衡。现在,使用更多数据可以降低方差,这里存在一个偏差问题。我们有一个特定的偏差,即前瞻性偏差,感谢超级团队也从数学上定义了我们应该如何理解它,然后通常你可以说,我如何才能最佳地权衡偏差和方差,因为我认为萨夫的观点是在一个非常具体的应用练习中,嗯,你没有得到很多前瞻性偏差,因此你实际上可以通过使用大量数据在某种意义上大大减少方差,我的意思是,这就是我解释它的方式,对吗?我只是想知道你是否对如何更普遍地思考这种偏差-方差权衡有更多评论。我认为你的工作,你简要提到的第二篇论文可能朝这个方向发展,对吧,如何在使用更多数据的同时仍然尝试思考偏差减少问题。
嗯,我,我,我喜欢这个想法,我们应该在当前的论文中更多地探讨它。另一篇论文,也许是因为我知道我花了一分钟时间谈论它。嗯,另一篇论文并不是真正关于使用更多数据,而是关于使用,嗯,我想在某种程度上,它是关于使用最大的LLM,对吧,尽可能最先进的LMS。也许这就是你所说的为它们的训练使用更多数据。但那篇论文完全是关于,嗯,掩盖或消除你将LLM应用于的文本中的前瞻性偏差。嗯,但我认为你的评论对两者都适用,对吧。这在某种程度上是思考这种权衡的好方法。嗯,我们应该在一个简单的背景下更多地思考这个问题。你知道,在一个高度风格化的模型中,我有一个预测模型。我施加了一些结构。我实际上可以给你公式,说明如何思考局部头部偏差与方差的权衡。你可以使用所有数据并进行某种形式的偏差校正。再次,你需要大量的结构来推导这类东西,然后你得到一个具有低方差和对对数偏差有一定控制的预测模型,我完全理解在大型语言模型的情况下,在估计完整模型后没有简单的方法进行这种校正,但是,嗯,我的意思是,我的观点是,沿着权衡这两件事的思路进行更多思考会很有趣,我相信也许在特定应用的背景下。这就是我解释你结果的方式。如果你有一个非常具体的应用,你就可以测试这一点。你可以看看通过使用不同的信息集来训练模型会产生多少前瞻性偏差。这提供了一种非常粗糙的方式来进行这种权衡。
我完全同意这一点。嗯,如果你对我们应该施加什么结构有想法,嗯,我很乐意,你知道,听听你的想法。嗯,在实体中性化论文中,我们所做的,你知道,定义前瞻性偏差是采用了,嗯,有一篇很棒的理论论文,我认为是Ludwig Molina和,我忘了最后一个合著者,我稍后会请求他的原谅,嗯,但你知道他们,嗯,他们提出了一个计量经济学框架,用于思考他们称之为“训练泄漏”的概念,这与前瞻性偏差不完全相同,但非常非常相似,你知道,我会说它是前瞻性偏差的兄弟,嗯,我们能做的就是,你知道,使用那个计量经济学框架来思考,嗯,前瞻性偏差作为LLM泛化能力中的一种问题,就像你知道有这个LLM,它训练的数据集是一个黑盒子。你不知道它是什么,里面有什么,你必须形成先验知识,并用它们来判断你认为里面有什么或没有什么。我们展示的是,嗯,如果你对中性化模型对原始文本所做的事情做出我们认为相当合理的假设,那么你就可以得出前瞻性偏差的经验界限。嗯,通过比较你的预测模型在原始文本上的表现与你的预测模型在匿名化或遮蔽文本上的表现。嗯,但你完全正确。这需要更多假设。这不是你可以在没有更多假设的情况下直接做的事情。但你知道,我认为这就是计量经济学家的生活。是的。
但我的意思只是一个想法。所以我也做了关于方差与前瞻性偏差权衡的工作。但一个非常天真的想法是,如果你有一个用所有数据训练的模型,并且你有一个时间序列模型。我猜你可以通过查看两者之间的差异来识别偏差,即前瞻性偏差。如果你假设,并且有一些假设,它们大致估计相同的东西,周围有方差,但本质上,使这两个模型不同的任何东西,并且有很多假设介入,可能与某种形式的,嗯,你得到一个负载偏差有关,然后你可以尝试去除它。考虑一个简单的预测任务来减去偏差要容易得多。在这里显然更复杂,但也许有一种方法可以做到这一点,即识别偏差,然后使用所有数据,去除偏差,从而获得两全其美的效果,但这肯定需要做更多的工作。我同意他们正在做更多这样的练习,你可以去或者修复数据,或者修复知识截止点,然后改变应用,或者做其他事情。我认为我们需要很多这样的练习,对吗?
嗯,但我,我不知道我当时试图小心翼翼。我希望我在描述我们所做的事情时是小心翼翼的。但是我们查看不同年代模型的练习并不能让我们完全识别前瞻性偏差,因为我们,那里有不同的知识在起作用。嗯,但我们应该在这方面做更多工作。谢谢你的评论。对吗?非常感谢。
嗯,我想,你知道,几乎所有的问题都或多或少地在直接回答中得到了处理。
嗯,所以我想再次借此机会感谢我们的演讲者阿萨夫和超级团队,带来了一场非常非常有趣的演讲和讨论。
并且,在我们进入讨论的未录制部分之前,我想宣传我们下一次网络研讨会,时间是5月29日,届时将邀请芝加哥大学布斯商学院的Michael Weber,他将谈论Chad GPT和公司政策,佛罗里达大学的Alejandro Lopez Lera将担任评论员,我们非常期待在那里见到大家。
所以,再次感谢大家,并送上热烈的虚拟掌声,嗯,请大家留在Zoom上,我们将把所有人升级为小组成员。