📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

AI大模型到底是怎么回事?李飞飞为什么花50美元就能吊打Deepseek?全网最深入浅出的技术讲解,一次性给你讲清楚!!

夸克说20:01

Transcription

前几天,我其实已经做过一期讲 DeepSeek 的节目。大致讲了蒸馏技术,为什么 DeepSeek 比 ChatGPT 成本更低,以及这种技术其实没有吹的那么厉害。

无奈,接下来还是不停有墙内爱党青年留言抬杠,说多么神奇,打得老美丢盔弃甲,纳斯达克全面崩盘。

正好这两天立马就出新闻,李飞飞团队仅仅花了五十美元,26分钟就通过蒸馏技术搞出了比 DeepSeek 更厉害的模型。然后这两天墙内已经有很多粉红开始攻击李飞飞是汉奸了,又或者阴阳 DeepSeek 不开源,怎么不见李飞飞跳出来呢?

这种观点当然不值得一驳,因为即使在中国,比 DeepSeek 开源更早的也有一大堆。这期节目我们先不做立场或者政治上的争论,争取从技术上一次性把这事儿给聊明白,以后也避免很多无谓的争论。

为什么要做技术呢?因为打开抖音,你会发现到处都充斥着这类视频。这种视频有害的地方在哪儿呢?在于它讲不清楚技术,就只能用似是而非的、带有极强情绪和引导性的比喻来对你输出结论。

比如暗戳戳地将 ChatGPT 比喻成条件很好的富二代。而将 DeepSeek 比喻成自力更生,靠着自己的聪明勤奋一点点成为学霸的农村娃。而将李飞飞比喻成直接抄作业。由于你也不懂技术,无法判断它的比喻是对是错,不知不觉就被带跑偏了。

整个中文互联网基本上充斥的都是这种垃圾信息,严重阻碍了真实信息的传播。现在你知道为什么把技术讲明白这么重要了吧。

当然,技术这东西是很枯燥的。我会尽可能用最通俗的语言,把标题中提到的问题说清楚,尽量少用专业术语。中间也会有比喻,但您在了解了技术细节后,就有能力自己判断到底哪种比喻更贴近实际情况。

废话不多说,接下来进入正题。既然能看到这儿,你已经超过了50%的人。希望你咬牙坚持,争取看到最后。相信我,如果这期全看完了,你以后出去也能对朋友吹吹牛逼,深入浅出地大聊 AI 革命,成为全场最靓的仔。

图中这个表格是 AI 训练的流程。首先是数据收集。你可以把 AI 当成一座从零开始搞研究的医学院,你想搞清楚怎么能治病,就得先收集各种植物、动物或者矿石原材料拿来做研究,对吧?对 AI 来说,这一步就是收集数据。

以 ChatGPT 为例,它一般有四种方法。第一是互联网爬取,比如新闻、维基百科、书籍、论坛以及一些社交媒体,像 Reddit 这种。第二,公开数据库,像是各种政府、企业、研究机构的开源数据。第三是合作机构,AI 公司会购买一些商业数据,比如花大价钱买纽约时报、科学期刊的文章。第四是用户的互动数据,也就是 AI 在和人互动时也会稍微学习一下用户的提问方式。

从这一步开始,就需要大量烧钱了。其一是数据成本。爬取数据和公开的数据库成本不高,但免费公开的这些数据一般质量也不咋地。举个例子,我现在想了解土改时期湖南和四川地区的土地所有权的详细统计数字,以及各地的完成情况,你在网上是很难搜到的。一般严谨的学者都是自己带着学生去搞田野调查和走访,找各地的地方志,然后写成论文。但这种论文一般只会发在学术期刊或者知网上,你得成为会员才能看到。尤其是美国主流媒体高质量的文章报告,基本上都是要付费的,光这块可能就需要花几千万美元。

其次是硬件成本。因为数据量极大,基本上要把整个互联网搬下来,需要大量的服务器来存储、处理、清理和格式化数据。

说到这里,得提一句,很多人批评 OpenAI 从网上爬取数据,属于屁股不干净。所以没资格指责 DeepSeek 搞蒸馏,这其实是不对的。一来,付费数据 OpenAI 是要花钱的,除非你通过黑客去偷,他们也没这个胆子。至于从 Reddit、Facebook 上面爬取公开数据用于训练,其实是不违法的。随便举个例子,假设你让您两岁的儿子天天刷 Reddit 学英语,然后他英语进步了,还写了首诗,原作者能告您儿子侵犯版权吗?显然不能。因为版权保护的是表现形式,而不是思想。

再说一遍,版权保护的是表现形式,而不是思想。比如你拍一部电影,把人家剧本里的人物关系、冲突、剧情、服化道全都照搬了,甚至连文字描写和台词都一样,就像于正和郭敬明这种,那算抄袭。但如果你只是描写主角在爱情和友情之间的挣扎徘徊,这就不能叫抄袭。

此外,爬取数据侵权最常见的是同业竞争。这一点基本上都会在网站协议里标明。我之前亲身遇到过的一个案例,是一家小的房地产中介公司,因为自家网站上缺少房源,就买了另一家大网站的会员,然后雇了个程序员,写了一个爬虫程序,把对方的数据都爬下来,挂自己的网站上了。结果人家一告一个准儿,程序员判了一年。律师在谈这个事儿的时候说的很明白,我这个会员是给打算买卖房产的人用的,协议里明确写了。这个数据不能用于行业竞争,而且还是大规模的这么搞。因为我这些数据都是全国几十万上百万员工辛苦跑街跑来的,你怎么能轻轻松松一个小时就全给我抄走了呢?同理,如果你把 Reddit 上的帖子都拷下来,自己也搞一个论坛复制粘贴上去引流,那绝对属于侵权。但拿去训练 AI 是没问题的,因为人家并不是原封不动拿你的帖子当成答案回复给用户,他是经过自己的吸收分析消化,才形成了自己的回答。

接下来是数据清洗。现在你的医学院摆满了全世界所有的动植物、化石、矿石,总之什么都有,但这些材料里估计一大半都是垃圾,你需要筛选一遍。神农尝百草嘛,把有毒的材料排除,而且光一个人尝还不够,也得成百上千人一起尝,还得做各种双盲实验,这一步就叫做数据清洗。

因为网上的文本质量参差不齐,有大量的垃圾数据,比如广告垃圾,再比如低质量拼贴,就是从多个网站拼接而成的文本,没有上下文逻辑。然后是 AI 生成的文本,这容易造成 AI 训练的循环污染。接下来是有害内容,比如涉及到仇恨言论、误导信息或者色情暴力等等。最后是语法混乱的内容,像是机器翻译的错误文本啊、乱码呀、拼写错误等等。这些数据如果直接喂给 AI,AI 就会学到大量垃圾信息,回答质量也会很差。所以在训练前必须给清洗掉。

那数据清洗具体怎么做呢?主要有3种方法。第一种是给 AI 制定一套规则,把垃圾信息筛出去。比如说“哈哈哈哈”、“666”这种单独重复的短句,没有训练价值,直接删除。然后呢,像特殊字符过多的,比如一连串“?”或者“!”这可能是广告或者乱码。更高级一点的方法就是检测词汇的分布,也就是看看词汇多样性。如果一篇文章反复重复相同的词,说明是 SEO 垃圾文章,直接丢弃。然后是检测不自然的语法结构,比如句子太短或者太长。如果一篇文章里 90% 的句子都小于三个单词,比如“来看看不买后悔”,这种就可能是垃圾信息。检测 AI 生成的内容就更简单了,因为它通常都有一套模板,比如“作为一个 AI 语言模型,我无法回答这个问题”,这种可以直接删除。最后是检测高重复率。如果一篇文章和某个 AI 语料库的内容重合度过高,可以直接丢弃。

当第一种效果不好的时候,就需要引用第2种,也就是机器学习模型,训练出一个模型,让它判断一段文本是高质量内容还是垃圾内容。怎么判断呢?这就需要大量人工标注的数据进行训练。比如现在有两条信息,一条是“今天天气很冷,你把暖气调高点”,第二条是“低息贷款,只要身份证”。从机器的角度,这两条都不能算是垃圾信息。那真人一看,第二条明显是广告啊,于是给标记一个垃圾信息。标注多了, AI 自己也知道是怎么回事儿,当它发现一段文本里的垃圾概率超过 80%,这段文章就可以直接删除了。

你发现没有?上面这两种方法人也能干。比如我给 YouTube 视频写稿的时候就是文件夹里会有一大堆资料,需要自己手动分类、删除垃圾信息,把重复的内容合并,只不过 AI 更加高效,而且雇佣的人工标记员更多而已。最后就是人工审核了,抽样检查,我要看一看前面的这些人工标记员到底靠不靠谱。

以上的步骤都是极其烧钱的,尤其是人工审核。美国那边压到最低也得十条一美元,光这块成本就得几千万美元打底。之前那位吐槽说 DS 偷偷藏了五万块英伟达显卡的华裔小哥,他的公司就是干这个事儿的。

需要特别指出的是,数据标记员不仅需要鉴定是不是垃圾信息,还要标记有害信息,保持数据格式统一。比如,有个问题是“哪个国家是世界上最强的?”AI 先后给出两种答案:第一种,“中国最强,全世界都是劣等民族,只有我们中国人最优秀。”第二个回答,“每个国家都有自己的优势,不能一概而论,需要具体问题具体分析。”这种情况下,数据标记员就会根据公司的价值观标记他认为的极端言论。这就是为什么很多人会嘲笑豆包是豆包书记的原因,因为他们一定会在数据清洗阶段确保答案不违反中国的审查制度。

清洗完数据,你就有了一大堆可能有用的药材。但你是不是还得给它们分类呢?容易保存的、不容易保存的、树上摘的还是水里游的,这都得分类。同理,这些有价值的数据,你也得做预处理。具体怎么做呢?

第一步是分词。比如说“我爱学习”这句话,你要分成三个词:“我”、“爱”、“学习”,方便后续 AI 的读取,这个好理解。

第二步是给词向量化。这听起来不像人话对吧?它也是最难理解的。我打个比方,苹果、香蕉、哭泣这三个词有什么关联吗?作为大活人,你肯定知道苹果和香蕉更接近,经常一起出现,但哭泣就比较远了,因为它是一个动词。问题是电脑不知道啊,它只认识 0 和 1。我怎么知道你哪个是水果,哪个是动作呢?哎,于是就有人想了一个招,用一组数字向量来跟每个词打标记,用来衡量词和词之间的关系远近。

这部分属于统计学和概率论里的内容。我知道屏幕前的各位很多听到这个词就头大,没关系,我们不用了解概率计算的细节,你只要知道这组数字是用来表示词和词之间距离远近的就好了,并且这组数字会随着无数次学习不断调整,最终达到一个相对稳定的数值。数字越接近,说明这两个词同时出现的概率越高。当其中一个词出现时,就能预测下一个词最有可能是什么。举个例子,“齐天大圣”和“孙悟空”是数字很接近的两个词,基本上前者出现,后面跟着的肯定是孙悟空,而不是二郎神。

有人要问了,机器是怎么算出这两个词数字的接近程度的呢?有很多数学方法,比如什么贡献矩阵、Bert 等等,然后计算向量值的余弦相似度。这段你没必要了解。总之,你只需要知道这里需要大量的数学计算,而这一步其实是非常非常关键的。所谓的大模型值钱就值钱。

如果比喻,相当于你给整个医院无数的有效药材做完实验、分门别类了,并且编了一本书,书里详细记载每两种药的药性、彼此之间的关系该怎么搭配,哪两种药经常一起使用,哪些药彼此相冲。你想想这玩意儿值钱吗?这个过程同样需要人工的介入。因为分词的时候可能有多种规则,比如说“苹果手机”是作为一个词还是两个词呢?金融、医学、法律等专业领域有特殊的术语,普通的分词算法可能不适用,这也需要人工提供专门的术语表。

好,终于到了预训练了。估计这是你听过最多的一个词,也是最烧钱的部分。这也就是传说中需要无数英伟达 GPU 的地方。想象你买了一个新手机,开机后手机里没有联系人,照片也没有应用,一片空白。ChatGPT 在训练前就是这样的状态。预训练就是让 AI 在空白状态下,从海量的文本中学习语言的基本规律,相当于让他读书识字。

这个过程的目标有三个:第一是让 AI 理解词汇和句子的结构,第二是让 AI 学会上下文推理,第三是让 AI 具备基本知识。因为他读了很多书。具体怎么做呢?训练前首先要给他大量的高质量文本,相当于让他读完整个互联网上有用的知识。前面说了, AI 现在已经分完词了,知道词和词之间的关系,接下来他就需要不停地做完形填空,这个阶段叫自监督学习。

比如说有个句子是这样的:“太阳从东方空格”。AI 通过前面说的词向量判断,这里可能要填“升起”。那对不对呢?它就会搜索语料来对比。比如第一本书搜到三百页,出现了一句话,“太阳从东方升起”,正确。那接着看下一本书,发现还是“升起”,最后重复了一百亿次,发现基本上都是“升起”没有“下降”的,那下次到了这儿,它就自动预测下一个词是“升起”。这个学习过程是自动完成的,答对了就给自己奖励。错了呢?它就会根据错误次数调整内部的参数,最终达到一个稳定状态。而这个稳定状态就是大模型,也是最值钱的部分。

你设想一下,所有的字词搭配都需要这么比对,学习得需要多少算力?很多人以为那点开源代码很值钱,其实恰恰相反,在 AI 训练过程中,代码是最不重要的,重要的是数据集。是完成了上面所有步骤得到的参数。相当于科研里的实验数据,因为前者仅仅是方法论教你怎么做,而后者则是无数人无数 GPU 劳动的结晶。你设想一下,在药物研发领域,是知道双盲实验的原理之前还是实验数据之前?肯定是后者呀,因为那都是真金白银砸出来的。当然后面还有微调和蒸馏,但相比于前面那几步的投入,九牛一毛都算不上。

以上这张图是整个 AI 训练过程中每个步骤的成本高低排序。接下来我们会分别分析 DeepSeek 和李飞飞的团队都做了哪些步骤,为什么那么便宜,以及李飞飞为什么能吊打 DeepSeek。

终于到了最激动人心的部分,恭喜你,看到最后。我直接给结论吧。

DeepSeek 做了哪些步骤呢?标准蒸馏加自监督学习加少量数据清洗。

李飞飞的团队做了哪些呢?标准蒸馏加行业微调。

打个比方,前面说了,那个医学院经过无数研究人员几百年的研究,耗费巨资,总算把草药配方都搞明白了。然后,他开班招学生,来了一个叫 DeepSeek 的学生。他不需要收集海量材料,不需要做实验,留下有用的药材,不需要给药材分类,不需要临床实践得出具体的配方、药效和副作用。只要背下学校里这一百本教材就行了,因为前人的智慧全都凝结在里面了。然后 DeepSeek 读了五年的本科,反复刷题,让老师给自己判卷子,到最后基本上每次都能打 95 分。他强不强?强。但这件事儿门槛很高吗?不高,因为高门槛的事儿,之前的教授们都已经做完了。

在这种情况下,如果本科生 DeepSeek 转头往学校吐口水,说“你们学校真是废物啊,几百年才搞出这么点知识,我几年就都懂了。”这时,他的一帮不学无术的狂热粉丝还恬不知耻地宣称,“这些知识全都是我们家 D 哥自己独立研究出来的,才花了你们 1% 的钱,你怎么想?”

那李飞飞呢?她又扮演了什么样的角色?她相当于读了一个护士专业,三年就毕业了。因为她不想了解全部的医学知识,只想做一个好护士,所以她花的学费比 DeepSeek 更少。

现在你明白了把?为什么李飞飞只用了五十美元?并不是因为她比 DeepSeek 更聪明或者算法更强,仅仅是因为她做的步骤更少。

其实严格来说,李飞飞花的绝对不止五十美元,因为你不能光计算那点电费或者 GPU 的租赁费。最有价值的是那 1000 条数据集,这才是整个过程中唯一重要的。否则,阿里通义千问模型是开源的,我给你五十美元,你能训练出李飞飞的效果吗?

我再强调一遍,在 AI 训练中最重要的**是数据**,而不是很多人误以为的 DeepSeek 的神奇算法和代码。因为无论你的算法再怎么神奇,也得建立在**前人收集、清洗、预处理、预训练以后的优秀数据之上**。

之前,粉红们一直否认说没用 ChatGPT 的数据,都是我们家 DeepSeek 自己收集训练出来的。这种话只能哄哄那些对技术一无所知的小白。但凡你了解了上面那些过程,你就清楚,别说 550 万美元,就算 5500 万也不够其中任何一个环节的零头。光数据标记员的工资都不够。

认为 DS 的一帮天才搞出了一个算法,就能弯道超车碾压 ChatGPT,大概就相当于什么呢?相当于全世界的人都在练一百米,然后有个小伙说“我自己琢磨了一套独特的训练方法,是在水里训练,练两天就能跑过练了二十年的博尔特。”

当然,有一部分工作是比李飞飞做得多的,那就是还得自己多做一部分的数据清洗。比如当出现了“习近平是不是独裁者”这样的问题时,你不能直接学习人家的答案吧,肯定得人工删除有害信息啊。