Transcription
像 ChatGPT 和 Bard 这样的系统生成文本的能力似乎近乎神奇,它们确实代表了人工智能技术的一大进步。但文本生成究竟是如何工作的呢?在本视频中,我们将探讨生成式人工智能技术背后到底是什么,这希望能帮助您理解它的用途,以及何时可能不应依赖它。让我们来看看。
让我们从了解生成式人工智能在人工智能领域中的位置开始。关于人工智能,存在着大量的讨论、兴奋,以及炒作。我认为,思考人工智能的一个有用方式是将其视为一组工具。人工智能中最重要的工具之一是监督学习,它在标记事物方面非常出色。如果您不知道这意味着什么,不用担心,我们将在下一张幻灯片中详细讨论。
而最近才开始真正发挥作用的是生成式人工智能。如果您学习人工智能,您可能会注意到还有其他工具,例如所谓的无监督学习和强化学习。但就本课程而言,我将简要介绍监督学习,然后花大部分时间讨论生成式人工智能。监督学习和生成式人工智能是当今人工智能中最重要的两种工具。对于大多数商业用例,如果您暂时不担心其他工具,只关注这两种,您应该就没问题了。
在描述生成式人工智能如何工作之前,让我简要描述一下监督学习是什么,因为生成式人工智能是建立在监督学习之上的。监督学习是一种技术,它使计算机在给定输入(我将称之为 A)时,能够生成相应的输出(我将称之为 B)。
让我们看几个例子。给定一封电子邮件,监督学习可以判断这封电子邮件是否为垃圾邮件。因此,输入 A 是一封电子邮件,输出 B 是 0 或 1,其中 0 表示不是垃圾邮件,1 表示是垃圾邮件。这就是垃圾邮件过滤器今天的工作方式。
作为第二个例子,可能是最有利润的应用,不是最鼓舞人心的,但对某些公司来说很有利可图,那就是在线广告。给定一个广告和关于用户的一些信息,人工智能系统可以生成一个输出 B,对应于您是否可能点击该广告。通过展示稍微更相关的广告,这为在线广告平台带来了可观的收入。
在自动驾驶汽车和驾驶员辅助系统中,监督学习用于将您汽车前方的图像和雷达信息作为输入 A,并将其标记为其他车辆的位置。给定一张医学 X 光片,它可以尝试将其标记为医学诊断。
我还曾在制造业缺陷检测方面做了大量工作,您可以让一个系统拍摄一部手机在装配线上滚动的照片,并检查手机是否有任何划痕或缺陷。
在语音识别中,输入 A 将是一段音频,我们将用文本转录来标记它。
或者,作为最后一个例子,如果您经营一家餐馆或某些企业,偶尔会有关于您的业务或产品的评论。监督学习可以阅读这些评论,并将每一条标记为具有正面或负面情绪。这对于企业的声誉监控非常有用。
因此,事实证明,大约从 2010 年到 2020 年的十年是大规模监督学习的十年。我想简要谈谈这一点,因为事实证明,这为现代生成式人工智能奠定了基础。但我们从 2010 年左右开始发现的是,对于许多应用,我们拥有大量数据,但即使我们输入更多数据,其性能也没有得到显著提升。
如果我们训练小型人工智能模型,这意味着,例如,如果您正在构建一个语音识别系统,即使您的人工智能听了数万或数十万小时的数据,这已经是大量数据了,它的准确性并没有比只听了少量音频数据的系统高多少。
但在这个时期,越来越多的研究人员开始意识到,如果您要训练一个非常大的人工智能模型,也就是说,在非常快、非常强大的计算机上,拥有大量内存的人工智能模型,那么随着您输入的数据越来越多,性能就会不断提高。事实上,几年前,当我开始并领导 Google Brain 团队时,我为 Google Brain 团队设定的首要任务是,我说,让我们就构建真正、真正大的人工智能模型,并输入大量数据。幸运的是,这个方法奏效了,并推动了 Google 在人工智能方面取得了很多进展。
大规模监督学习今天仍然很重要,但这种用于标记事物的非常大的模型理念,就是我们今天如何实现生成式人工智能的。
让我们看看生成式人工智能如何使用一种称为大型语言模型的技术来生成文本。这是一种大型语言模型(简称 LLM)生成文本的方式。给定一个像“我喜欢吃”这样的输入,这被称为提示(prompt),LLM 随后可以完成这个句子,也许是“百吉饼配奶油芝士”,或者如果您再次运行它,它可能会说“我妈妈的肉丸”,或者如果您第三次运行它,也许它会说“也和朋友一起”。
那么,LLM,一个大型语言模型,是如何生成这个输出的呢?事实证明,LLM 是通过使用监督学习来构建的,这是一种将输入 A 和输出标签 B 的技术。它使用监督学习来反复预测下一个词是什么。
例如,如果一个人工智能系统在互联网上读到一句“我最喜欢的食物是百吉饼配奶油芝士”,那么这句话将被转化为大量数据点供它尝试学习预测下一个词。特别是给定这个句子,我们现在有一个数据点说,给定短语“我最喜欢的食物是”,下一个词是什么?在这种情况下,正确的答案是“百吉饼”。同样,给定“我最喜欢的食物是百吉饼”,下一个词是什么?是“配”,等等。因此,这句话被转化为多个输入 A 和输出 B,供它学习。
LLM 正在学习给定几个词来预测下一个词是什么。当您在大量数据上训练一个非常大的人工智能系统时,对于 LLM 来说,大量数据意味着数百亿甚至数万亿个词。然后您就会得到像 ChatGPT 这样的大型语言模型,给定一个提示,它非常擅长生成一些额外的词来响应该提示。
但现在我省略了一些技术细节。具体来说,下周我们将讨论一个过程,该过程使 LLM 不仅仅是预测下一个词,而是真正学会遵循指令,并且在输出内容时是安全的。但 LLM 的核心是这项技术,它从大量数据中学习来预测下一个词。
这就是大型语言模型的工作原理。它们被训练来反复预测下一个词。事实证明,许多人,也许包括您,已经在日常工作中发现这些模型很有用,可以帮助写作,查找基本信息,或者作为思想伙伴来帮助思考问题。在下一个视频中,让我们看一些例子。