📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

DeepSeek : la Chine réécrit-elle les règles de l’IA ? | Avec David Gurlé

Grand Angle Nova33:59

Transcription

在2024年12月,我们看到了深度之眼(DeepSeek)的UFO降临在人工智能(IA)星球上。实际上,我看到的是,没有人真正理解。 [音乐] 所以,这就是深度之眼(DeepSeek)的奇迹。 [音乐] 你好,大卫,感谢你今天来到Grandang Nova。在2024年12月,我们看到了深度之眼(DeepSeek)的UFO降临在人工智能(IA)星球上,当时以及之后,我一直在努力弄清楚到底发生了什么。实际上,我看到的是,没有人真正理解,或者说没有人能够解释,而每个人都在重复着一些陈词滥调。主题是,深度之眼V3(DeepSeek V3)拥有当时大型模型的性能,但训练成本据说只有500万美元,这比所有美国竞争对手的成本要低得多,简直是天文数字。我们应该记住,实际上地球上不仅仅是美国在做人工智能(IA),中国也在做。当时,所有人都认为中国在这方面已经落后了。这是当时人们的说法。而当深度之眼(DeepSeek)出现时,我认为是英伟达(Nvidia)下跌了15%,或者说股市上真的出现了价值崩溃,人们惊呼:“哦,我的天,中国人,他们把一切都搞砸了,他们有一种革命性的方法,美国人其实没那么厉害等等。” 深度之眼(DeepSeek)到底发生了什么?他们只是窃取了资源,还是只是通过节省精力而复制?是什么造成了这种差距?或者,这些人只是很聪明,找到了一个新的方法来解决同一个问题?

首先,确实有很多国家在研究人工智能(IA)。对吗?我以经验为例,即使在阿联酋(UAE),他们也有阿拉伯研究人员,他们的模型是猎鹰(Falcon),他们正在全力以赴地研究,而且非常出色。对吗?所以,今天,我们可以说,通用人工智能(GNI)和大型语言模型(LLM)的权利,不仅仅是美国的权利。这有点像是世界权利。我敢肯定,俄罗斯人也在研究,只是我们不知道发生了什么。嗯,说到深度之眼(DeepSeek),中国研究人工智能(IA)已经很长时间了。所以,这并不是说这个模型是两年前才开始的,然后最终做出了什么。特别是在人工智能(IA)的其他领域,比如视频识别,无论是人脸识别还是自动驾驶汽车等等,中国都比西方领先得多。对吗?为什么?因为他们拥有比我们在这里西方更多的、更容易获取的数据。所以,迟早中国人会做出更好的东西,或者至少是同样好的东西。我们姑且说至少同样好,因为我们还没有确定他们做出了更好的东西。而令人疯狂的是它的性价比。

好了,发生的事情确实是历史上经常发生的事情。是几个因素,单独来看它们什么也做不了,但当你把它们结合起来,你就得到了深度之眼(DeepSeek)。我们先从这个团队的资金来源开始。我们从来不谈论这个,但实际上这是一个决定性因素。这是一个中国的私募股权公司,决定资助整个深度之眼(DeepSeek)团队。总的来说,他们被告知,你们有全权决定权,你们可以做任何你们想做的事情,在你们的限制范围内。他们没有任何限制,除了要生产一个自主模型,按照中国的标准,而不是按照……所以是独立的,并且要利用他们拥有的基础设施和资源来完成,而不是像美国或欧洲的风险投资公司那样,我们有典型的限制,他们期望在24个月内看到回报。是的。是的。所以,根本没有这些。没有估值,什么都没有。所以,你们自己看着办,做你们想做的事情。你们是最棒的,自己看着办。正是如此。他们没有找那些平庸之辈。他们找了最顶尖的人,我猜。我猜。我不知道这个团队,但显然有什么不同寻常之处。所以,这一点非常重要,因为它创造了一种完全不同的心态和文化,与我必须面对的文化不同,当我不得不面对风险投资公司时。我必须做出选择来取悦风险投资公司,做出选择来取悦技术。你看?所以,这是两个非常不同的概念。所以,如果你给我钱,而我是一个有野心、有能力的团队,我想要做的事情会与我做相反的事情截然不同。

有趣的是,这与创新形成了对比,因为我们总是说创新就是不断失败直到成功,而风险投资公司参与了这个虚拟的循环。但是,你看,在中国,他们以不同的方式做事,而且效果很好。所以,这是第一点。第二点,实际上是美国人施加的限制。所以,美国人限制了对美国计算资源的访问,也就是英伟达(Nvidia),而他们确实拥有这些,但数量很少,所以他们不可能获得其他人所拥有的基础设施,他们绞尽脑汁。他们说,这是著名的H100,H1 GPU禁止出口。是的。A和H。是的。所以,而且,像马斯克(Musk)这样的人,我认为他说:“这不可能,他们一定是从左边右边偷来的,转用的,因为没有H100和H1,你不可能取得这样的成果。” 而那些人说:“是的,是的,是的,我发誓,它有效。” 所以,存在这种限制。这种限制对他们来说是一个巨大的限制,因为他们别无选择,只能更聪明,因为现在我们确定他们没有基础设施。这不是他们通过柬埔寨或其他什么地方转用设备的问题。是的,因为他们带走了他们的模型等等。对。所以,他们说:“好吧,我们没有能力,所以我们看不到规模,看不到大规模。所以,要充分利用这个东西。” 这让我想起,你知道,电影《火星救援》里,马特·达蒙独自一人在火星上。独自一人在火星上,他说:“我将竭尽全力解决这个问题并生存下来。” 大概是这样。是的。总的来说,我有一个破旧的帐篷,一个半坏的基地,我要种土豆,我想,在基地里。我将利用我所拥有的东西生存下来。我将生存两年。是的,是的,正是如此。这正是这种心态。所以,这是你所拥有的一切。就像13号一样,他们拥有他们所拥有的一切,他们必须回来,这同样如此。所以,当是这样的时候,你有时间,你有资金,你有耐心,突然之间,人类的大脑就会释放出很多东西。所以,在我看来,这是两个最关键的因素,使得团队能够创造一个非常不同的训练模型。首先,让我们来算算账。对吗?与它竞争的ChatGPT 3.5的训练成本是5000万美元。对吗?嗯,500万到600万,是10倍,10倍少,这太大了,已经是10倍少了,检查一下。好的,那么质量,你刚才说过了,检查一下。那么,他们是怎么做到的呢?他们说,好吧,我们的思维是如何工作的?我们的思维是如何工作的?嗯,我们的思维不是同时处理所有事情。所以,即使在这一刻,我的眼睛在工作,我的耳朵在工作,我的嘴巴在工作,我的大脑在协调这一切,但我并没有同时尝试做饭或穿衣服,你看。所以,我的大脑会为给定的任务组装一些必要资源,而忽略所有其他东西。对吗?所以,它会进行一种过滤,而在美国模型,或者甚至可能是欧洲模型中,嗯,Mistral刚刚采用了这个模型,试图复制深度之眼(DeepSeek)的模型。他们正在进行这个过程。是的。是的。是的。正是如此。他们正在进行这个过程。复制,正是如此。但在你提到的美国模型中,它们没有硬盘空间问题,没有GPU问题,没有钱的问题。也就是说,强加给中国人的物理限制在他们的经历中根本不存在。所以,它们将所有东西都加载到内存中,以尽可能高的精度来训练模型。因此,能源消耗和计算能力明显高于深度之眼(DeepSeek)所采用的专业化模型哲学。所以,如果你愿意,这可以说是这个模型训练的最关键因素。第二个要素是“好是坏的敌人”。我正在寻找“更好的是坏的敌人”。所以,在美国模型中,他们说:“是的,我们将实现最大精度。所以,我们将使用FP 16,我们将以最大精度训练模型,因为我们将获得更精确的结果。” 对吗?而这会占用更多的内存,因此需要更多的GPU,因为我们受到每个GPU内存的限制,更多的服务器,更好的数据中心等等。所以,他们说:“我们能用FP8做什么?” FP8,也就是8位精度,而不是16位精度。所以,实际上,他们发现,通过结合我刚才提到的专家模型,也就是基本上将其碎片化,并使用相对较低的精度,较低的质量,而不是做4K,他们做高清。你看,实际上,他们获得了非常好的结果,因此,这又减少了,你看,它们的内存使用量。好的。

接下来,不仅要建模算法,还要进行验证。所以,后面有人工干预等等,就像我们在Grok的背景下看到的。所以,他们也带着非常非常聪明的方法来了。再次,限制是发明的母亲。所以,这是另一个时刻。他们用他们能够获得的巨大的人力资源训练了模型,因此他们能够减少训练时间和纠正成本,这得益于中国的规模。所以,这又是一个非常关键的因素。我没明白他什么时候减少了。是因为他们使用了人力操作。人力操作。是的。正是如此。手动完成那些更耗时的事情。正是如此。正是如此。所以,这加上时间,而他们有时间,他们有钱,所以,你看,这又是一次,一些强加的限制,一些消除的限制,创造了另一个路径。所以,你把所有这些都放在一起,你就得到了深度之眼(DeepSeek),这是中国市场的标准。我们熟悉的圣人(Shengren)甚至放弃了自己的人工智能(IA)研究。啊,是的,是的。一夜之间。他们去了,他们说:“好吧,我们采用深度之眼(DeepSeek),没必要了。” 宝尼(Pony)也决定,放弃吧,放弃吧。正是如此。啊,是的。所以,这就是深度之眼(DeepSeek)的奇迹,这种限制和创造力的结合,以及我所说的“工程规模”。这种解决问题的能力,非常非常中国化。所以,中国人非常非常能干。他们会去修理东西,而不是重建东西,因为他们能够做到。所以,而且他们想这样做,这确实是他们文化的一部分,并且他们完全将其应用于深度之眼(DeepSeek)。所以,今天,深度之眼(DeepSeek)遵循这种哲学,他们将继续遵循这种哲学,而对于OpenAI或XAI来说,要回到深度之眼(DeepSeek)的模型将极其困难,因为他们是基于历史上的霸权。他们没有从一开始就按照深度之眼(DeepSeek)设计的模型来设计他们的所有模型、所有框架、所有模板。因此,我们正在目睹一场关于两种非常不同的工程类型的战争。一种工程类型是基于“用硬件解决问题”,另一种是“用人力解决问题”。所以,所以,这确实是这样,而且非常典型地是美国人的做法。所以,如果我们回顾历史,如果你愿意,美国人拥有巨大的资源,他们拥有非凡的才能,他们能够投入数十亿美元。现在,人们投入数亿美元。所以,通常他们依靠金钱来超越。实际上,他们投资超过任何人。这就是你看,里根(Regan)通过数十亿美元赢得了冷战,这是一台经济战争机器。正是如此。这是经济体系的对抗,特别是他通过“星球大战”项目将其推向了终点,他说我们要做一个项目,我不知道是多少千亿美元,然后俄罗斯人就无法承受了。虽然这几乎是胡说八道,但这是美国人非常典型的策略,也是征服南极的策略,我不知道你是否知道阿蒙森(Amundsen)的故事,有两支队伍在竞争,阿蒙森,我记得,是的,是的,还有一支美国队伍,他们带着大型拖拉机,总之,他们找到的任何机械和昂贵的东西。而阿蒙森正是带着当地的皮毛和习俗去的。有这种资本驱动的粗暴方法,以及人力和文化的方法。然后,我们知道谁赢了,是阿蒙森到达了南极。但在历史上,我们经常发现这种方法。

在今天的太空竞赛中,SpaceX通过Starlink创造了自己的市场,将巨额资本注入了没有人愿意涉足的领域。是的。为什么Arian Space不发射可重复使用的火箭?首先,他们没有远见,这是显而易见的,其次,他们没有每天发射火箭的市场。而美国人说:“我们将创造它,我们将……我们将建立一个太空互联网,因此我们需要每天发射火箭。” 所以,你看,有一种非常不同的资本驱动的方法。所以,这种方法是美国式的。我们可以说,这是美国的印记。中国的方法则非常不同。而且,作为一名工程师,对我来说,我认为这是一场非常美丽的战斗,因为这确实是一场大脑、工程文化的战斗。我更倾向于中国方面,或者说,我更相信中国方面。不是说我相信中国人会赢,而是我总是更愿意用我们的大脑来对抗我们的金钱,只要有可能,就能取得成功。因为,因为这在这些场景中更能闪耀人类的光芒。

那么,美国公司什么时候会开始模仿,说:“好吧,他们获得了巨大的效率提升,我们将利用这种效率比,投入美国资源,然后你就会有一个巨大的乘数。” 他们可以做到,他们会做的,如果他们面临资本的压力。这确实是一个资本问题,因为它需要……不,因为它需要改变一切。啊!你不能只利用多出来的三行代码,说:“但这确实是……你也不能忘记,深度之眼(DeepSeek)利用了ChatGPT中已经完成的东西,利用了Llama中已经完成的东西等等,所以他们不是从零开始的。” 对。所以,确实有……我称之为“站在巨人肩膀上”。是的,站在轻盈的肩膀上。正是如此。所以,确实有这种效应,我们不能忘记提及,因为我不想让听众觉得,中国人已经……不,不,不,他们是从……他们总体上拥有的资源比美国人少。我们同意。在中国,人工智能(IA)的资源比美国少。在视野中。所以,我不知道数量。根据我们所知,根据我们所不知道的,我们不知道。是的,正是如此。所以,我不能告诉你。

那么,我们之前谈到的AZR,ASI,也就是说,那些不需要数据集就能自我革新的模型,它们是否会把这一切都扔进垃圾桶,说:“好吧,实际上,我们又回到了起点,或者差不多,你看,因为我们正在改变范式。” 这是AlphaGo的时刻,你看,说:“好吧,这是历史的一个阶段,他们赢得了这场战斗,但这并不是战争。” 这只是一场战斗。但这就是为什么你看,这些论文是由中国人写的。这太可怕了。啊,是的?为什么?因为他们正是想独立自主,不受数据、不受模型的影响。所以,他们将无法获得西方的数据。这是主权保护的一部分,他们可以访问中国的数据,但这还不够。他们需要更多的数据。所以,如果你愿意,我认为深度之眼(DeepSeek)是在148亿太字节(terrab)的数据上训练的。这还是很多。这还是很多。这相当于多少个互联网?我不知道,但这还是很多。这还是很多。但有人说,总有一天,我们将拥有“outpilable data”,也就是说,我们离拥有可用数据不远了。哦,我想,甚至在2024年11月,埃隆·马斯克(Elon Musk)说,到2024年底,我们已经吞下了所有东西,没有了,现在必须制造。因此,合成数据将在另一个视频中讨论。但是,是的。

那么,深度之眼(DeepSeek)是一个插曲,它确实是历史的一个插曲。也就是说,这不足以赢得全球霸权。不,因为它允许优化,使其看起来处于同一水平,但实际上差距巨大。是的,但别忘了,就像我们在中国看到的那样,它让中国人拥有了自己的ChatGPT。这是真的,我们去的时候看到了。深度之眼(DeepSeek)被集成,我不知道是比亚迪(BYD)还是蔚来(NIO)在使用深度之眼(DeepSeek),因为另一个似乎在使用Harmony。总之,有两个品牌,其中一个运行的是深度之眼(DeepSeek)。我们在自动翻译器上也看到了。你有一个大大的“深度之眼”(DeepSeek)标志,到处都是。到处都是。所以,这创造了他们的ChatGPT,他们的标准,所以,对我来说,这是一个巨大的时刻,因为,你看,中国人口正在进入同一个……正在进入同一个转折点。他们正在比赛中。比赛中,正是如此。啊,是的。他们有自己的跑道。正是如此。他们有自己的跑道。他们已经巩固了他们的……可以说,本地的霸权。现在,他们正在研究其他方面,无论是电子产品、微电子产品、能源等等。他们正在建设巨型工厂。是的,是的,是的。此外,他们还在建造……巨大的大坝。他们将在未来几年内建造超过50个核电站。所以,从这个角度来看,他们有……他们。

而腾讯也加入了深度之眼(DeepSeek)的阵营。那么,但是,一夜之间,就像一个人一样。啊,是的。为什么?因为有协调,他们互相交谈,说:“好吧,你做这个,我做那个。” 或者只是腾讯方面说:“没必要,没必要花数十亿美元,因为我们可以拥有这个。” 所以,这是一个……我所说的,这是一个务实的决定,因为,因为深度之眼(DeepSeek)是一个开放的模型。这是……这是中国的Llama,我们可以这么说,这是中国的Llama。是的。也就是说,Llama是由Meta开发的开源的,而深度之眼(DeepSeek)是由我不知道谁开发的开源的。这是一个实验室。但是,这些家伙是谁?我不知道实验室的名字。而且,无论如何,它不是一个科技巨头,深度之眼(DeepSeek)……嗯,现在它们本身就是巨头。在中国的规模上。这是“同志资本主义”的奇迹,它能够催生出我们意想不到的公司。正是如此。

为什么他们不以封闭的方式进行?为什么他们不做像OpenAI那样的模型,或者说,有趣的是,OpenAI,因为这是中国人……我不想用“污染”这个词,但我找不到合适的词来传播,传播他们的技术,以一种不可思议的方式,通过开源,是的,因为你不能说里面有什么东西。是的,这是唯一的方式,这样做非常聪明。

那么,为什么在美国,我们会有这种开放模型(如Llama、Mistral,也许还有不是美国的,但也是开放的)和封闭模型(如XAI)之间的二元性呢?是的。我不知道美国除了Llama之外,还有什么大型开放模型。嗯,现在有OSS 117 GPT OSS。是的。那么,为什么会有像XAI这样的封闭模型呢?埃隆·马斯克(Elon Musk)最初创立OpenAI是因为他相信开放模型,然后他被微软……基本上,他被微软打败了。微软关闭了……锁定了这个东西,他想:“好吧,在这种情况下,我将创建我自己的XAI,我自己的Grok,它是封闭的。” 那么,开源和开放模型之间的二元性是什么?你看到,在技术世界里,我们谈论的是非常非常大的规模。非常非常大的规模,全球规模。对吗?有几种方法可以实现。你可以成为一家商业公司,比如微软,然后采取必要的措施,确保所有出厂的电脑都配备Windows。这样,你就达到了全球规模,数十亿台电脑,你从中获得税收,并且你拥有一个平台,可以在上面构建其他业务模型,如Office等。对吗?这个模型除了少数例外,但它确实有效。Facebook是另一个例子,LinkedIn是另一个例子,等等。所以,有一些例子表明这个模型是有效的。而且,这个模型非常庞大,因为它是“赢家通吃”。你拥有一切,你拥有全部,你什么都没有,你拥有全部。对吗?这是2000年代人们批评微软的地方,就是它到处都是封闭的。我们谈论的是……等等。啊。

任何想要赚钱的公司,这就是他们梦想的。说实话。好的。所以,除了反垄断法等等,反托拉斯法,你如何与之抗争?嗯,最好的方法就是将人们拥有的东西商品化。那么,这意味着什么?把它变成一种商品。例如,我们只谈论Windows和Linux。好的。Unix系统是计算机领域的老古董了。但是,当Linux出现时,它重写了Unix的内核,也就是说,它去掉了Unix的所有知识产权,使其成为一个专有系统,并将其发布。它一下子消除了所有Unix软件供应商。好的。这使得Linux成为互联网基础设施和其他许多地方的首选操作系统。而Linux的创造者Linus Torvalds也因此享誉全球。闻名。正是如此。而正是这种开源方法,实际上使得与微软的斗争和胜利成为可能。微软绝对想处于Linux在服务器上的地位,但他们从未成功过。他们从未成功过,因为有人将他们的知识产权商品化,免费提供,并明确表示他们不会从中赚钱。之后,Linus Torvalds是一位革命家,他有一种反叛的心态,他根本不在乎钱。所以,我们看到像Richard Stallman和所有这些人,但我年轻时有点支持Linux,但我们看不到Meta,他们不是……他们不是……所以,Meta是如何做到这一点的?我认为是Yann LeCun说服了Zuckerberg将Llama开源,他们期望从中获得什么好处,与Grok或ChatGPT这样的封闭模型相比。

现在,我将进行猜测,因为我不在马克·扎克伯格(Mark Zuckerberg)的内部。他们的目标是,通过开源,他们将拥有一个社区,这个社区将协作,以改进他们的模型,并使其成为一个标准,这在事实上的条件下非常重要,以允许Llama繁荣发展。这是真的,因为我们在这里,在Antimatter,我们大力推广Llama。是的,正是如此。而原因呢?因为,实际上,全世界都同意这一点。它相当强大,它是免费的,而且它运行得相当好。所以,因此,如果你愿意,对于Meta来说,这给了它一个……它需要花费很多钱来开发这个模型,但这是他们今天在竞争激烈的大型模型市场中与私有模型抗衡的唯一方式。

但是,这给他们带来了什么商业利益?他们如何将其货币化?实际上,这是我现在的……他们货币化的是研发。他们货币化的是,实际上,他们不货币化,他们……他们利用贡献者的研发。所以,有些人会免费贡献这个模型。有些人会使用和测试它。所以,实际上,与其拥有这些资源在你身边,不如拥有它们在全世界。这意味着他们可以在Facebook、Meta、我不知道什么地方,重新利用Llama来服务他们自己的服务。在……正是如此。所以,一般来说,这就是模型。所以,在其他模型中,你有服务模型,我认为Meta也会这样做,但例如,你看,Red Hat,我提到了它,这是一家价值数十亿美元的公司。所以,他们非常成功地提供服务,服务于所有Linux用户。正是如此。正是如此。所以,这一切在计算机世界里都是众所周知的,而且总是通过封闭与开放的斗争来实现的。而且,我认为这也是OpenAI最终发布其开源版本的原因。而且,不久前。是什么时候?我不记得了。是……是八月初。七月。是的,因为我们第二天就部署了它,甚至在同一天,而且,这是预料之中的,并不是说它不会发生等等。但是,这是为了……对于OpenAI来说,这是对抗Llama的方式,因为模型的成功是由开发者创造的,而不是用户。是吗?是的。因为想象一下,未来几年将会有数百万个应用程序被开发出来。数百万。而这些数百万应用程序中的每一个都将使用人工智能。如果你自己不发明,你会使用哪一个?你会使用一个开源模型。啊,是的,不是吗?是的。但是,我认为他们开放的版本是ChatGPT的降级版本。不,这是一个……这是一个足够好的版本。是的。所以,降级了。它能做咖啡,但它不是ChatGPT 4。是的,但你不需要ChatGPT,因为在很多事情上。在很多事情上你不需要。所以,而Llama更强大。这是他们最好的模型。这是……这取决于。他们有好几个。他们有好几个。他们有Llama 4,Llama 3.3,如果我没记错的话,或者3.2,4050亿参数。所以,他们有一个非常强大的Llama。所以,他们正在研究Llama 4,它已经在这里或那里分发了,而GPT OS的参数要少得多,我认为少得多,但因为它被设计成一个微型LLM,也就是说,是的,它是为了……为了个人电脑。微型,是的,就像Falcon 8B一样。有Falcon 8B。所以,它也是一样的,80亿或70亿。中国的?不,不,UAE。啊,是的,是的,就是这样。好的。

所以,深度之眼(DeepSeek)是……这是开启人工智能(IA)主权之路的。中国,正是如此,这是中国想要的,而不是澳大利亚。是的,是的,是的。嗯,而他们突然有了……我的意思是,这对中国来说是巨大的,这对中国来说是巨大的,因为软件,这并不容易。这真的不容易。而你在生活中使用了多少中国软件?所以,我想,也许你使用微信,也许……我在中国,但……是的,但我的意思是,这是……这是……这是中国人在软件方面能够与软件之王美国人平等竞争的证明。但这只是一场战斗,因为还有很多战斗要来赢得胜利。还有很多战斗。还有很多战斗。非常感谢你,大卫。不客气。