Transcription
最近,很多人都在谈论阿里巴巴旗下的平头哥半导体官宣了一款叫真武810E的高端AI芯片。而且,请注意这个词,悄然上线。
通稿里最吓人的一句话是,这款芯片的累计出货量已经达到数十万片,直接点名超过了寒武纪,位列国产GPU第一梯队。看到这儿,估计不少朋友的第一反应是:哎哟,不错哦,国产之光,阿里牛逼!然后可能就在评论区打个“遥遥领先”或者“支持国产”就划走了。
但是朋友们,如果你只看到了“国产突破”,那你大概率是把这条新闻当成了科技频道的样板戏。但如果你通过这数十万片的出货量,再联想一下最近阿里要分拆平头哥上市的传闻,你会突然感到恍然大悟。因为这根本不是一场简单的产品发布,这是一次资本市场的暴力验资,更是一场对整个国产芯片行业的清场行动。
为什么这么说?首先,咱们得问一个问题:为什么是现在?大家都知道,平头哥做芯片不是一天两天了。之前的含光800,早在几年前就发布了。为什么偏偏在这个时间点,把真武810E这个底牌亮出来?而且还非要强调数十万片这个具体的量级?
这里面,有两个维度的逻辑。第一个维度,是给资本市场看的。阿里最近在搞“1+6+N”拆分,平头哥要独立上市,这已经是公开的秘密。你想想看,如果要上市,招股书里最核心的故事是什么?是有技术吗?不。在二级市场,特别是在现在的港股或者美股,光有技术没用。投资人已经被前几年的各种PPT造芯给骗怕了。现在的资本市场极其现实,他们只看一样东西:Commercialization(商业化落地)。
所以,阿里抛出数十万片这个数字,其实是把枪拍在桌子上,告诉所有人:别拿我和那些还要靠融资续命的独角兽比。我的芯片不是躺在实验室里的,是已经卖出去,装进了服务器,正在跑通义千问大模型的。这叫什么?这叫去伪存真。
但是,仅仅为了上市吗?不,这就太小看阿里的格局了。这就要说到第二个维度,也是更残酷的维度:这是一次行业标准的重新定义。
在过去三年,国产GPU赛道非常热闹。壁仞、摩尔线程、沐曦、燧原,各路神仙打架。大家比什么?比单卡算力,比FP32浮点运算有多少TFLOPS,比谁的PPT做得更像英伟达。但是今天,阿里把桌子掀了。它用数十万片,和后面我们要讲的万卡集群这两个核弹级数据,向行业释放了一个信号:跑不通大规模落地的芯片,在大模型时代,就是电子垃圾。
好,铺垫了这么多,我知道你们最关心的是什么。你们肯定会问:你也别光吹,这数十万片到底是真的假的?现在台积电7nm产能这么紧,CoWoS封装更是紧缺到连英伟达都要排队。阿里是从哪儿变出这几十万片芯片的?
问得好!这才是真正的硬核问题。要回答这个问题,我们不能靠猜,我们得像侦探一样,去挖一挖供应链的深层逻辑。我找了几份非常详尽的供应链分析报告,咱们今天就来好好拆解一下这背后的物理学真相。
首先,我要告诉大家一个可能让你意外的结论:对于国产高端AI芯片来说,真正的瓶颈,也就是那头随时可能冲撞过来的灰犀牛,其实并不是大家天天盯着的7nm光刻机。虽然7nm很难,但不管是通过“那个谁”的国产产线,还是通过一些复杂的海外代工渠道,国内其实是有一定流片能力的。
真正的死穴,在后端,在先进封装,也就是我们常说的CoWoS(Chip on Wafer on Substrate)或者类似的2.5D封装技术。为什么?因为像真武810E这种对标英伟达A800甚至H20级别的芯片,它必须得挂HBM(高带宽内存)。而要把处理器和HBM封装在一起,必须用先进封装。
现在的行情是,国内能做这个的头部大厂,比如盛合晶微、通富微电,产能虽然在扩,但依然是极其有限的。根据我拿到的供应链数据测算,如果平头哥真的要实现年出货30万片这个量级,它至少要切走国内某头部封测厂将近20%的先进封装产能。20%啊朋友们!这是一个什么概念?这意味着其他的国产芯片厂商,比如寒武纪、比如海光,他们的产能会被严重挤压。
所以,这不仅仅是有钱就能解决的问题,这是对供应链极致掌控力的问题。阿里能拿到这个产能,本身就说明了它在产业链上的话语权。
但这里面,还有一个更深层的技术秘密,这才是阿里能做到数十万片,而别人做不到的核心原因。这也是我今天特别想跟大家分享的一个干货:架构决定良率。
咱们来看一下平头哥的对手们。壁仞也好,摩尔线程也好,他们走的是什么路线?是GPGPU(通用图形处理器)路线。他们的逻辑是:我要做中国的英伟达,所以英伟达有的功能我都要有,我要能跑AI,还要能做图形渲染,能打游戏,能做科学计算。这种思路听起来很宏大,像一把瑞士军刀,什么都能干。
但是,为了通用,你就必须在芯片上保留大量的图形渲染单元、显示控制单元。这些东西对于跑大模型训练来说,不仅没用,还是累赘。它们占用了宝贵的芯片面积(Die Size)。而芯片制造有一个铁律:芯片面积越大,良率越低。尤其是在国产工艺还不够成熟,缺陷密度(Defect Density)比较高的情况下,你做一个超大面积的通用GPU,晶圆上一旦有一个灰尘或者缺陷,这颗芯片可能就废了。
那阿里平头哥干了什么?它非常鸡贼,哦不,非常聪明。它走的是DSA路线(Domain Specific Architecture),也就是专用领域架构。真武810E它不叫GPU,它叫PPU(Parallel Processing Unit)。它的逻辑是:我就是为了阿里云跑大模型用的,我不打游戏,我不做渲染。所以,阿里大刀阔斧地把所有跟AI无关的单元全部砍掉。
这就好比,别人在造一把复杂的瑞士军刀,阿里造了一把极简的手术刀。当然,我知道肯定有杠精会跳出来说:“哎呀,平头哥这玩意儿不行啊,连《黑神话:悟空》都跑不动,甚至连个像样的桌面都显示不出来。”废话!马云也不需要用它来玩猴子,人家是拿来炼丹的,也就是训练通义千问大模型的。术业有专攻嘛,把打游戏的功能砍得越干净,它干正事儿的效率就越高。
这个极简带来了什么物理上的后果?根据行业供应链的测算数据,在同样的工艺节点下,由于剔除了图形单元,DSA架构的芯片面积大幅缩小。同时,因为电路结构相对简单,它对缺陷的容忍度更高。最终的结果是,单片晶圆上切出来的合格芯片数量,平头哥的DSA架构是同级别国产通用GPU对手的2.7倍!兄弟们,2.7倍啊!
这是什么概念?这意味着,大家抢同样的台积电或者中芯国际的晶圆产能,抢同样的CoWoS封装产能,阿里能产出27万片芯片的时候,对手只能产出10万片。这就是为什么阿里敢喊出数十万片的底气。这不是吹牛,这是基于架构选择带来的物理学降维打击。当别人还在为良率挣扎的时候,阿里已经通过做减法,实现了量产的飞跃。这也给所有国产芯片创业者上了一课:在工艺受限的年代,盲目追求全功能通用,可能就是死路一条。极致的专用,才是生存之道。
好,基本搞清楚了“能不能造”的问题。咱们再来聊聊更刺激的:能不能卖,以及值不值钱?这就要说到钱了。
现在市面上,大家能买到的较划算的英伟达合规芯片是什么?是英伟达的H20。别跟我说H200哈,因为那个监管层还没完全批准,而且就算批准了,也是配额制的。咱们就以H20举例。咱们也不谈H20那被阉割得惨不忍睹的算力,咱们就谈钱。
你知道现在一张H20在黑市或者正规渠道,大概卖多少钱吗?大概是1.2万到1.3万美元左右。但是,你猜猜这张卡的硬件BOM成本,也就是物料清单成本,是多少?抛开英伟达那高昂的研发均摊不谈,光看物理物料成本,只有3000美元出头。也就是说,你每买一张H20,你就要额外支付将近1万美金。
这1万美金里,有一部分是英伟达的品牌溢价,但更多的是什么?我把它称为“合规税”或者“智商税”。是因为美国封锁,导致你不得不花高价买一个性能被阉割的产品。这对于像阿里云、腾讯云这样动辄要买几万甚至数十万张卡的大厂来说,简直就是在割肉。
这时候,阿里的真武810E入场了。根据对平头哥估值与阿里云TCO(总拥有成本)拆解分析显示,真武810E的自研硬件成本同样控制在3000美元左右。这时候,一个惊人的商业闭环出现了。
对于阿里云来说,如果它采购英伟达H20,它要付1.3万。但如果它用自家的真武810E,它只需要承担3000块的制造成本,加上一定的研发摊销。这意味着什么?意味着在同样的算力规模下,算上研发均摊,阿里云的硬件采购成本直接下降了55%到65%!朋友们,听懂了吗?这意味着阿里云每部署一台服务器,它的成本比那些还在苦哈哈排队买英伟达H20的友商,少了一半还不止。
如果你觉得这个数字还不够刺激,咱们再换个算法。根据平头哥估值与阿里云TCO的极端模型分析测算,如果一家大模型公司不去买卡,而是直接租用阿里云基于真武810E搭建的算力集群,相比于在市场上租用稀缺的A800算力,它的综合使用成本(TCO)最高能节省85%!85%啊!
在大模型训练这个烧钱如流水的游戏里,这节省下来的不仅仅是钱,是命。所以,你看懂阿里的商业逻辑了吗?抛开国家间的科技博弈因素,它做平头哥根本不是为了去跟寒武纪抢那几千张卡的市场份额,也不是为了卖芯片赚那点硬件利润。它是为了把芯片变成阿里云的各种税收割机。
这就就像当年的亚马逊AWS。亚马逊收购Annapurna Labs做Graviton芯片,是为了卖芯片吗?不是。是为了让AWS的服务器成本比微软Azure、比谷歌云更低,利润更高。放眼全球,能把自研芯片真正变成印钞机的,除了开山鼻祖谷歌和带头大哥亚马逊,在中国,阿里是唯一彻底跑通这条闭环的玩家。
这时候,我们再回过头来看那个传闻中的IPO估值:550亿美元。很多人听到这个数字,第一反应是:疯了吧?平头哥凭什么值这么多钱?英伟达那么强,寒武纪现在市值才多少?
好,咱们来算一笔账。华尔街的分析师是怎么给这种云端芯片公司定价的?他们的模型里有一个非常有意思的公式:平头哥的价值等于0.8个寒武纪的稀缺性溢价,加上3个AWS Annapurna的业务规模倍数。为什么是3个Annapurna?因为平头哥背靠的是中国这个全球最大的单一数字市场,以及阿里云在亚太地区的绝对统治力。
寒武纪虽然有稀缺性,但它得一家一家去磕客户,去求着别人用它的卡。而平头哥呢?它有一个自带的超级大客户——阿里云。也就是俗话说的“含着金汤匙出生”。只要阿里云的服务器还在扩容,只要通义千问还在迭代,平头哥的订单就是确定的。这种确定性,在充满不确定性的二级市场里,就是最昂贵的资产。
所以,550亿美金,折合人民币接近4000亿。这个估值不是泡沫,它是阿里把未来十年的算力成本优势,通过资本运作,一次性变现了。这哪里是造芯片?这分明就是一台印钞机。
但是,请注意,我要说但是了。资本的故事讲得再好,如果技术落地是个渣,那最后也就是个乐视。虽然阿里在成本上赢麻了,但在技术圈,尤其是在硬核的AI基础设施圈子里,一直流传着一个质疑:平头哥的芯片,单卡跑分也许凑合,但真到了万卡集群(10,000 GPUs Cluster)这种规模,它还能跑吗?
大家别小看这个问题。在大模型时代,万卡集群这四个字已经被营销号炒烂了,好像谁家只要凑齐了一万张卡,就能训练出ChatGPT一样。图样图森破了。
我咨询了一位资深的AI基础设施架构师,他跟我说了一句非常形象的话:万卡集群的难点,从来不在于芯片本身,而在于你能不能“打赢概率论”。
什么意思?想象一下,把一万张显卡连在一起。这里面涉及到数十万个光模块,上万根线缆,几千台交换机。在这个规模下,硬件故障不再是意外,而是常态。根据AI集群与软件栈迁移评估的实测数据,在一个标准的万卡集群里,光模块的故障率是极其恐怖的。
对于传统的网络架构来说,一个光模块坏了,或者一条链路抖动了,整个训练任务,可能就会直接崩掉。你需要停机、回滚(Checkpoint Resume)、重新加载数据。这中间的耗时,少则几十分钟,多则几个小时。如果你的集群一天崩个三四次,那这一天基本就白干了。
这就是为什么很多号称有万卡算力的公司,实际上训练效率极其低下,因为他们的算力都在等待重启中被浪费了。这就是为什么英伟达那么贵,大家还不得不买,因为英伟达有NVLink,有Infiniband,它把网络这块骨头啃下来了。
那阿里平头哥怎么办?它没有NVLink,它怎么解决这个“概率论”的死局?这里就要揭秘阿里这次被媒体严重低估的一个黑科技了:HPN 2.0(High Performance Network)。
通稿里轻描淡写地说“已在阿里云实现多个万卡集群部署”。这背后的潜台词是,阿里搞定了一套非英伟达体系下的高性能网络架构。这套HPN架构最牛的地方在于,它设计了一种“双平面网络”(Dual-Plane Network)以及“去堆叠双上联”机制。
听不懂没关系,大概翻译一下就是:以前的网络像是一条单行道,前面一辆车(也就是光模块)抛锚了,后面所有的车都得停下来等拖车。阿里的HPN像是什么呢?它给每辆车都修了备用车道,而且有一套上帝视角的交通指挥系统。当某个光模块坏掉的瞬间,系统能在毫秒级内感知,然后把流量无缝切换到备用链路上。
对于正在跑训练的AI模型来说,它根本感觉不到断网了,它只能感觉到网络稍微慢了一丢丢,性能抖动,但训练任务不会中断,不需要回滚,不需要重启。
这个技术突破带来的结果是什么?数据非常硬核。在传统的非英伟达集群里,平均无故障时间(MTBF)可能只有4个小时。而在阿里这套架构下,平均无故障时间(MTBF)被硬生生拉升到了24小时以上。
这就解释了为什么小鹏汽车敢把它的扶摇智算中心交给阿里。大家想一想,小鹏是造车的,它的核心资产是自动驾驶数据。如果训练三天两头中断,何小鹏能睡得着觉吗?小鹏之所以敢把命交给平头哥,不是因为平头哥的芯片单卡比英伟达强,而是因为在买不到英伟达的极端环境下,阿里是唯一一个能用烂牌打出王炸效果的。它用工程化的网络能力,弥补了国产芯片单点的稳定性不足。这才叫护城河。护城河不是你有一块完美的砖,而是你能用一堆有瑕疵的砖,砌出一面攻不破的墙。
说到这儿,可能还有朋友不服气,会说:“硬件稳了没用啊,软件才是硬伤。大家都用CUDA,你平头哥搞一套自己的东西,谁愿意给你做迁移?程序员不要脱发吗?”
这确实是个痛点。我在做这期选题的时候,特意去扒了小鹏汽车迁移到阿里平台的真实案例。根据小鹏技术团队披露的内部数据,他们从英伟达平台迁移到阿里平头哥的平台,确实经历了一个阵痛期。但是,注意这个但是,工作量并没有我们想象的那么大。
为什么?因为阿里为了卖卡,或者说为了推云,它自己干了一件非常苦逼但极其重要的事情:造轮子。阿里开发了一套叫HALO的编译器和Sinian(思念)软件栈。这套东西的作用是什么呢?它就像一个翻译官。对于90%的通用AI算子,比如跑个ResNet,跑个LLaMA,或者是通用的Transformer结构,你根本不需要重写代码。HALO编译器自动帮你把CUDA代码翻译成平头哥能懂的指令。
真正需要程序员去脱发重写的部分,只有那10%的为了极致性能而深度定制的算子。还是以小鹏为例,刚才咱们说了它图稳,现在咱们说说它图快。他们确实为了适配这10%的核心算子,比如XNet里的特殊卷积,投入了专门的团队去攻坚C++代码。
这听起来很累对吧?但我们来看看他们换回了什么。在完成迁移,并配合阿里的万卡集群优化后,小鹏的自动驾驶模型训练速度,相比于之前的单机多卡模式,提升了整整170倍!把一个需要跑7天的训练任务,压缩到了1个小时。朋友们,这是什么概念?这就好比你以前坐绿皮火车去北京,晃晃悠悠要一天一夜,腰都坐断了。现在你改坐复兴号高铁,刚把泡面泡好,还没来得及吃,哎,广播响了:北京到了。
这种体验上的降维打击,谁用谁知道。当你看到这个170倍的时候,你就明白为什么商业客户会倒戈了。在商业世界里,情怀不值钱,麻烦也可以忍受,只要你给出的利益足够大,大到能把7天变成1小时。这就是商业的残酷,也是商业的美妙。
讲到这儿,我们已经把平头哥的技术底牌和商业账本翻得差不多了。我们看到了它的产能底气,看到了它的暴利模式,也看到了它搞定万卡集群的工程肌肉。这时候,如果我们把视线拉高,跳出阿里这家公司,去看看整个中国AI芯片的战场,你会发现一副非常惊悚的画面。
如果说阿里平头哥是这场游戏的终结者,那么现在还在水下摸着石头过河的那些独立芯片公司,壁仞、摩尔线程、沐曦,甚至包括还在亏损泥潭里挣扎的寒武纪,它们的命运将会如何?
根据第三方机构对云厂商自研芯片战略分析的判断,未来三年,也就是2026年、2027年,全球AI芯片市场将进入一个极其惨烈的“双寡头+云大厂”时代。什么意思?在高端通用市场,英伟达依然是神,这一点短期内没人能撼动。但“在海量的基于云端的AI训练和推理市场”,像阿里、亚马逊、谷歌、微软这样的云巨头,正在用自研芯片构建一个封闭的,但效率极高的“围墙花园”。
在这个花园里,芯片不是用来卖的,是用来“送”的。你想想看,阿里云可以对客户说:“你来买我的云服务,我免费给你用真武芯片的算力,或者只收你成本价。”这对于独立芯片公司来说,这就是一场降维打击。这就像是高维文明对低维世界扔了一张“二向箔”。
你壁仞、摩尔线程、寒武纪,卖芯片是为了赚钱,你们要保证30%甚至50%的毛利,才能养活昂贵的研发团队,才能给一级市场的投资人一个交代。但是阿里不需要。在阿里的账本里,芯片不是商品,是基础设施。它可以对客户说:“兄弟,你只要买我的云服务,芯片算力,我按成本价给你,甚至我不赚钱交个朋友。”
面对这种“羊毛出在猪身上”的打法,独立芯片厂商怎么玩?你跟它打价格战,你就是找死,因为它是你的几分之一成本。你不打价格战,客户凭什么买你的卡?
这就是华尔街顶级科技分析师们得出的那个最残酷结论:在云原生时代,芯片公司只有两种结局:要么你自己变成云巨头的一部分,要么你被云巨头卷死。
大家把眼光放向全球,这不仅仅是发生在中国的故事。去看看谷歌,现在谷歌内部90%的AI负载都跑在自研的TPU上。去看看亚马逊,AWS的Trainium芯片正在疯狂蚕食英伟达的市场份额。微软也在搞Maia。全球的科技巨头都在干同一件事:构建“云-端-芯”的封闭花园。因为只有这样,才能把大模型训练的成本压到极致。
那么,2026年,将会是国产GPU行业的“大清洗元年”和“并购元年”。那些手里拿着几十亿融资,还在讲PPT故事,没有云厂商做“干爹”的独立芯片公司,如果不能在某个极细分的领域,比如边缘计算或者特种安防,找到不可替代的位置,那么它们的归宿只有两条:
第一,资金链断裂,倒闭清算,成为历史的尘埃。
第二,被字节跳动、腾讯或者其他渴望算力的大厂,低价收购,成为大厂内部的一个硬件部门。
这就是商业的终局。
而对于像小鹏、微博这些客户来说,他们选择平头哥,选择站队阿里,其实还有一层更隐秘的考量,那就是供应链保供(Security of Supply)。在这个动荡的年代,买英伟达H20、H200,你头顶始终悬着一把达摩克利斯之剑。监管层哪天心情不好,一个文件下来,你的算力供应链就断了。
对于何小鹏来说,把企业的命运寄托在别人手里,是睡不着觉的。选择平头哥,哪怕迁移有点痛,哪怕生态有点封闭,但它至少保证了一点:即使是在国产替代、自主可控的宏观政策下,它也是断不了的。这种安全感,在这个时代是无价的。
最后,让我们回到平头哥的本身。阿里支持平头哥独立上市,表面上看,是一个资本运作,是阿里为了拆分上市做准备。但从产业维度看,这是中国科技巨头补齐的一块拼图。过去我们谈互联网巨头,谈的是流量,是平台。但从今天开始,平头哥的真武,加上阿里云的飞天,再加上通义千问大模型,这个铁三角,标志着中国科技企业开始进入硬科技的深水区。
在这场战役里,没有情怀,只有效率。没有“国产替代”的遮羞布,只有TCO成本的硬碰硬。谁能把大模型训练的成本打下来10倍,谁就是下一个时代的王。至于你是中国的英伟达,还是平头哥,资本市场不在乎。
说了那么多,这里一个问题,也想问问大家:既然平头哥这么猛,你觉得目前还在国产AI芯片第一梯队的寒武纪,它的护城河到底还剩多少?它是会成为中国的英伟达,还是会成为这场云厂商战争中的炮灰?欢迎在评论区留言讨论。记得点赞、转发、订阅,咱们下期再见。