Transcription
哈喽大家好,欢迎来到明月三千里的频道。
首先,我想先请大家回想一下,两年前,或者是就在半年前,马克·扎克伯格在大家心目中是个什么形象?是不是那个高举着开源大旗的自由斗士?是不是那个喊着“AI属于全人类”,誓言要把Llama做成AI界的安卓系统,那个开源教父?我还记得那时候,甚至有人把他P成了拿着光剑的绝地武士,或者是那个冲浪的酷盖,对吧?
但是,就在前两天,有外媒爆出的猛料,可能要把这个人设给彻底砸碎了。根据最新的爆料,Meta正在秘密研发下一代旗舰模型,代号叫牛油果(Project Avocado)。这名字听着挺健康,但这背后的操作可是相当的重口味。
首先,这个牛油果模型,还极有可能是闭源的。没错,你没听错,那个要把开源进行到底的Meta,准备把大门关上了。以后想用,请掏钱买API吧。
但这还不是最炸裂的。最炸裂的是,媒体爆料称,Meta在这个新模型的训练过程中,不仅仅是用了自家的Llama数据,他们还引入了外援。这外援是谁呢?名单里赫然写着Google的Gemma,OpenAI的GPT-oss,还有来自中国阿里巴巴的Qwen大模型。
听到这儿,我知道屏幕前很多朋友的DNA可能动了。你第一反应可能是:“卧槽,扎克伯格这是要偷咱们的技术?”或者是,“你看,中国AI果然站起来了,连Meta都要抄咱们的作业,咱们赢麻了!”
哎,先别急着下结论,也别急着自嗨。如果咱们只把这件事看成是谁抄谁,或者是民族自豪感的胜利,那就把这场万亿美金级别的博弈看得太简单了。今天,我们就一起来扒开这层皮,看看这件事背后真正残酷的真相。
这不仅仅是一个关于借用数据的技术八卦。对,这里我先用“借用数据”,这是全球AI行业从当年的理想主义狂欢,彻底转向生存主义厮杀的信号弹。这背后是高达700亿美元巨额账单逼出来的恐慌,是数据枯竭带来的窒息感,更是整个开源世界权力版图的一次暴力重构。
好,我们马上开始拆解。首先,咱们得把Meta用Qwen这事儿给聊透了。很多人一看到“用Qwen训练”,下意识就觉得是Meta把Qwen的模型权重给偷走了,或者是直接把Qwen的代码拿来改了个名,甚至有人会说,“这不就是咱们以前常被诟病的套壳吗?现在轮到美国巨头套壳咱们了!”
我必须要纠正一个技术概念。这里所谓的“用”,在专业术语里叫“基于合成数据的监督微调”,这和传统的知识蒸馏或者套壳,还真不是一回事儿。咱们打个比方,这就像是Meta家里有个孩子叫Llama,这孩子语文挺好,能说会道,但偏科极其严重,数学和写代码经常不及格。扎克伯格这个当爹的急啊。这时候他发现隔壁老马(对,就是我们的Jack Ma)家里有个叫Qwen的孩子,数学那是真牛,代码写得飞起。扎克伯格怎么做呢?他不是把Qwen的脑子挖出来装进Llama头里,那是恐怖片。他是让Qwen当老师,或者是当出题人,让Qwen去生成成千上万道高难度的数学题,并且把每一步的解题步骤,也就是思维链,都写得清清楚楚。然后,Meta把这些Qwen写好的完美习题集拿回来,逼着自家的Llama去疯狂刷题,去模仿Qwen的解题逻辑。所以,这事儿的本质,不是偷技术,而是买教材。
那问题来了,Meta号称拥有地球上最多的H100 GPU,拥有最顶级的科学家,为什么非得找阿里的Qwen当老师?自家的Llama不能自己生成数据,自己学吗?这就要说到一个让扎克伯格非常扎心的数据了。据第三方的技术评估,对比Llama 3.1和Qwen 2.5的硬核指标,在MATH这个高难度竞赛级数学测试集上,Meta引以为傲的Llama 3.1 70B得分只有68.0%。而同等量级的Qwen 2.5 72B是83.1%。很明显,68分对83分,这在AI领域不是略有差距,这叫代差,这叫降维打击。这中间差了整整15个百分点。甚至Qwen 72B的分数,比Meta那个参数量大五倍的Llama 405B还要高。
再看代码能力,那个只有32B参数量的Qwen 2.5 Coder版本,在HumanEval代码生成测试上,居然也击败了70B的Llama 3.1。这就意味着,在数学逻辑和编程思维这块,Qwen确实掌握了一些Llama还没搞懂的独门秘籍。Llama如果只靠自己产生的数据去训练,那是近亲繁殖,它永远跳不出自己那个逻辑陷阱。它必须引入外部更强的逻辑流,才能把这个短板补上。
所以,扎克伯格这次是极度务实的。他不跟你谈什么血统纯正,也不谈什么美利坚AI尊严,因为他知道,他的下一个模型牛油果,是要拿出去卖钱的。企业级客户是非常现实的,人家不管你这模型是纯美国血统还是混血,人家只看一点:我让你写个Python脚本,你能不能一次跑通?我让你算个复杂的金融模型,你能不能别瞎编?如果Llama做不到,而Qwen的数据能帮它做到,那扎克伯格就会毫不犹豫地用。
而且,大家千万别觉得这是Meta一家的骚操作。这在硅谷的算法工程领域,已经是行业标准了。现在的硅谷大厂,不管是Google、OpenAI还是Meta,大家都在私底下互相吃对方的数据。据保守估计,现在顶级大模型的训练数据里,有超过60%已经是AI生成的合成数据了。Google在训练Gemini的时候,肯定也参考了GPT-4的输出。OpenAI在优化GPT 5.0的时候,说不定也看了DeepSeek的推理路径。这就好比现在的AI圈,已经不是那个大家各自闭门造车,比谁家的原始数据大的时代了。现在是炼金术时代,谁能把别人炼好的高质量模型输出拿来,快速提纯,融进自己的丹炉里,谁就能赢。
所以,Meta用Qwen,与其说是阿里的胜利,不如说是撕下了硅谷最后一块遮羞布。在算力瓶颈和数据枯竭面前,没有人能永远保持优雅。活下去,赢下来,才是唯一的真理。
但是,如果只是为了补技术短板,Meta完全可以像以前一样,悄悄用完就算了,继续把Llama 4开源,继续做他的教父,对吧?为什么这次,连开源这个金字招牌都要砸了?为什么要搞个闭源的牛油果出来?这就要聊到第二个层面了,这也是更触目惊心的一个层面:钱。
大家可能不知道,Meta现在面临的财务压力有多大。你们觉得搞AI烧钱,到底是烧多少?几亿?几十亿?根据最新的华尔街分析报告,Meta在2025年的资本支出,也就是买GPU、建数据中心、交电费的钱,预计将达到恐怖的700亿到720亿美元。700亿美元是什么概念?波音公司现在的市值也就大概这个数。等于说,扎克伯格一年要烧掉一家波音公司来搞AI基建。而且CFO还说了,2026年这个数字还会显著增加。
这钱花得像流水一样,那赚回来了多少呢?这是一个让所有Meta股东都想摔杯子的数据。我们扒了一下财报,Meta目前每投入100美元搞AI基建,通过AI软件和服务直接收回来的钱,大概只有3.5美元。这是个什么生意?这简直就是慈善事业啊!
以前,扎克伯格可以跟股东讲故事,说没事,我们开源模型是为了建立生态,是为了让全世界的开发者帮我们优化代码,最后反哺给我们的广告业务。但是现在,这个故事讲不通了。因为隔壁的OpenAI,人家靠着闭源卖API,年化收入眼看着就要冲破200亿美元了,其中很大一部分就是企业给的钱。这就让Meta非常眼红,也非常的恐慌。
你想想,Meta花了最多的钱买GPU,建了最大的算力集群,结果做出来的Llama开源了,被全世界免费白嫖。无数创业公司拿着Llama改一改,做成产品卖给企业赚钱,甚至连Meta的死对头都在用Llama的架构加速研发。这就就像什么?这就就像Meta是个勤勤恳恳的老农,花巨资修了条高速公路Llama,结果告诉大家免费通行。隔壁OpenAI修了个收费站,赚得盆满钵满。现在Meta回头一看,自己兜里没钱了,路都要修不起了。
所以,扎克伯格急了。那个叫牛油果的新模型,它的使命根本不是什么造福人类,它的使命非常俗气,就是两个字:搞钱。而且,为了确保这个搞钱计划能成功,Meta内部发生了一场非常残酷的权力清洗。大家可能听说过杨立昆(Yann LeCun),他是图灵奖得主,也是Meta的首席AI科学家,他是坚定的开源派。但是现在,他的声音正在被边缘化。取而代之的是谁?是一个叫汪滔(Alexandr Wang)的年轻人。
这个汪滔是谁?他是Scale AI的创始人,这家公司是干嘛的?专门做数据标注,专门给美国国防部和企业做AI服务的。他是一个极致的商业主义者,也是一个数据资产化的信徒。Meta花高价把他挖过来,让他领导新的超级智能实验室,这本身就是一个强烈的信号。这意味着,在Meta内部,工程师文化正在向商人文化低头。汪滔带来的逻辑很简单:高质量的模型和数据是公司的核心资产,是金矿,绝对不能免费送人。所以,牛油果必须闭源,必须建立围墙,必须像OpenAI一样收费。只有这样,扎克伯格才能拿着漂亮的财务报表,去安抚那些快要暴走的华尔街投资人。
这才是Meta人设崩塌背后的金钱逻辑。这不是背叛,这是断臂求生。
第三个层面:科学危机。更是让整个AI行业真正感到窒息的隐形杀手。大家有没有想过一个问题?现在的AI模型,比如GPT-5,比如Gemini,它们之所以这么聪明,是因为它们吃了全人类几十年积累下来的高质量文本、书本、论文、代码、新闻。但是,这些数据是有限的。有个著名的预测机构Epoch AI发过一个报告,说人类高质量的公共文本数据,大概率会在2026年到2032年之间被彻底吃光。
那吃光了怎么办?现在的逻辑是,“没关系,我们有AI啊,让GPT-4生成数据,然后喂给Llama 3吃,Llama 3生成数据,再喂给下一代的GPT-5吃。”这就是所谓的合成数据训练。听起来好像是永动机对吧?但在科学上,这其实是一个恐怖的衔尾蛇结构,一条蛇在吞噬自己的尾巴。
剑桥大学和牛津大学的研究团队发过一篇极其硬核的论文,提出了一个概念叫“模型坍塌”。这篇论文通过数学证明告诉我们,如果模型只学习上一代模型生成的数据,会发生什么?会发生熵减,也就是信息的丰富度和多样性会逐渐丢失。论文里有一张图,我印象特别深,最开始数据的分布是丰富多彩的,像一片广阔的星云。但是经过几代近亲繁殖的递归训练后,所有的数据点全部挤在了一起,变成了一个极小的、单调的点。这意味着,如果你不小心,你的AI就会变得越来越平庸,越来越傻,最后变成只会说漂亮废话的复读机,甚至开始胡说八道。这就叫坍塌。
那问题来了,既然这事儿这么危险,为什么Meta还要用Qwen的数据?扎克伯格不怕他的牛油果坍塌吗?这就要回到我们开头说的那个技术细节了。Meta看中Qwen的到底是什么?大家注意,Meta并不是要把Qwen生成的所有废话都拿来练。他看中的是Qwen在数学和代码领域的特殊能力。
为什么Qwen在数学上那么强?根据技术报告,Qwen团队搞了一套很牛的机制,叫“批评者模型”(Critic Model)。简单说就是,Qwen在生成数学题答案的时候,它自己内部有个质检员。这个质检员会检查这个解题步骤逻辑对不对,代码能不能跑通。如果Qwen生成了一段代码,系统会立刻把它扔到一个沙箱里运行一遍。报错了,直接扔掉;死循环了,直接扔掉。只有那些跑通了、结果正确的代码,才会被留下来。
这个逻辑太重要了!这实际上是在用客观真理来清洗数据。Meta之所以要用Qwen,就是看中了Qwen经过这种严格清洗后的高质量数据。这就就像是在污浊的信息河流里,Qwen是一台高效的净水器。Meta不仅是在借数据,更是在借Qwen的验证能力。
所以,我认为AI的下半场,拼的不是生成,拼的是验证。可能这将是未来几年AI发展的关键。谁能定义什么是正确,谁就能产生高质量的合成数据,谁就能打破模型坍塌的诅咒。而在这一点上,不得不承认,阿里的Qwen走在了前面。
好了,聊完了科学危机,我们最后再回到现实,聊一聊这场变局,对我们每个人,对全球开发者,尤其是对地缘政治格局的深远影响。
过去这几年,Meta虽然是商业公司,但在开发者心里,它是有一层光环的。因为Llama的存在,让全世界的穷学生、创业者、科研机构都能用上顶级的AI模型。扎克伯格被称为开源教父,不是白叫的。但是,随着牛油果要闭源的消息传出,这层滤镜碎了一地。在一些AI开发者社区里,出现了铺天盖地的愤怒。有开发者直接说,这就是一场“抽梯子”戏码。什么意思?就是你先把大家骗上车,等大家都依赖你的生态了,你突然把梯子一抽,把大家摔个半死,然后开始收钱。
大家原本指望着Llama 4能继续带飞,结果据说内部测试的Llama 4 Maverick版本,表现极其拉胯,性能没提升,显存占用还巨高。这就造成了一个巨大的权力真空。当以前的Meta不想带大家玩了,或者带不动了,开发者会怎么办?会哭吗?会求扎克伯格吗?不。开发者是最无情的精英唯才主义者。谁的模型好用,谁的代码写得溜,我就用谁的。我管你是美国的、中国的,还是法国的。
于是,我们看到了一个极具讽刺意味的画面:一个正在发生的“地缘政治倒置”。就在Meta准备关门闭源的同时,来自中国的模型,正在疯狂填补这个真空。
首先是DeepSeek。这家公司在海外开发者圈子里已经封神了。为什么?因为它的DeepSeek-V3和R1模型,在代码生成和逻辑推理上,不仅吊打Llama,甚至在某些指标上超过了GPT-5和Claude 4.0。而且,DeepSeek的MoE混合专家架构,让推理成本极低,开发者在自己家里的双GPU电脑上就能跑得飞起。现在在Github上,越来越多的开源项目开始默认支持DeepSeek,而不是Llama。
然后是Qwen。如果说DeepSeek是特种部队,那Qwen就是正规军。Qwen 2.5全系列开源,而且用的是最宽松的Apache 2.0协议。这意味着你可以随便用,哪怕你拿去商用、改名、赚钱,阿里都不管你。对于那些被Meta闭源威胁吓坏了的创业公司来说,Qwen简直就是救命稻草。现在Hugging Face上,基于Qwen微调的模型数量正在井喷,它正在取代Llama,成为新的默认基座模型。
当然,还有欧洲的Mistral。对于那些既不敢用中国模型(怕合规风险),又不想被Meta收割的欧美大企业,Mistral成了唯一的避风港。
大家想一想这幅图景:Meta闭源,原本是为了构建护城河,是为了防御,是为了不让中国和竞争对手白嫖它的技术。结果呢?结果是它主动退出了开源领袖的位置。它这一退,直接把定义开源标准的话语权,拱手让给了中国公司。
现在的局面是,美国的巨头(OpenAI、Meta、Google)都在筑墙,都在搞闭源收费。而中国的巨头(阿里、DeepSeek),正在向全世界输出开源技术,输出标准。当硅谷的开发者在用Qwen的数据训练模型,当欧洲的黑客在用DeepSeek写代码,当全球的创业者在基于中国模型构建应用时,所谓的“技术封锁”,是不是这就成了一个笑话了呢?
这不仅仅是商业上的失策,这可能是科技史上一次罕见的软实力转移。
这次Meta的牛油果事件,还有它背后的偷师阿里,这看似是一场闹剧,但它其实是AI行业的“成人礼”。它标志着那个草莽狂奔,靠堆GPU、堆公开数据就能拿第一的时代,彻底结束了。未来的竞争,将变得更加残酷,也更加精细。
第一,数据为王,但必须是真理数据。谁能建立起像Qwen那样高效的验证机制,谁能生产出纯净的合成数据,谁就能掌握AI进化的钥匙。
第二,实用主义至上。不管是开源还是闭源,不管是美国还是中国,最后的赢家,一定属于那些能真正解决问题,能真正帮企业降本增效的模型。
对于我们普通人,或者对于开发者来说,这其实是件好事。因为巨头的垄断被打破了,我们的选择更多了。Llama倒下了,但千千万万个Qwen和DeepSeek站起来了。在这个多极化的AI世界里,没有永远的神,只有不断进化的代码。
那么,当硅谷巨头都开始筑起高墙,你觉得开源AI的火种,是会熄灭,还是会在东方,以另一种形式燎原?DeepSeek和Qwen,真的能扛起Llama的大旗,成为全球AI的新基建吗?欢迎在评论区留言讨论。
好的,今天这期话题就先聊到这里,记得点赞转发热推,咱们下期再见。