📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

梁文锋又赌赢了?DeepSeek新论文mHC发布,一条让硅谷看不懂的“破封锁”之路。

明月三千里23:40

Transcription

当大多数人还沉浸在 2026年元旦跨年的 香槟和烟火里,当硅谷的工程师们 可能还在太浩湖滑雪的时候,在大洋彼岸的中国,DeepSeek又默默地甩出了一篇,看似枯燥的技术论文。

题目叫mHC Manifold-Constrained Hyper-Connections,直译过来就是 流形约束超连接。你先别被这个拗口的名字劝退,哪怕你完全不懂数学,也请先记住这句话:这可能是中国AI 突破芯片封锁的唯一解。

为什么敢把话说这么重?如果是别的公司在元旦发论文,我可能看都不看一眼,顶多觉得这帮人太卷了。但是,当点开这篇论文的作者列表,排在最后一位的那个名字,立马就会让人瞬间清醒:梁文锋(Liang Wenfeng)。

熟悉DeepSeek这家公司发家史的朋友,都知道一个不成文的铁律,我把它称为 梁文锋定律。这位量化交易出身,极其低调的创始人,现在几乎隐形了。但是,只要他的名字,亲自出现在技术报告的作者栏里,那绝对不是来挂名的。

回想一下,2023年11月的DeepSeek-LLM,确立了转型的第一步。2024年5月的DeepSeek-V2,拿出了MLA架构解决显存墙。2024年底的DeepSeek-V3,搞定了FP8混训和多Token预测。每一次,注意是每一次,他的署名都意味着,DeepSeek的核心架构,发生了代际突变。

所以,这份元旦贺礼,根本不是什么普通的学术探索,这是一份宣战书。它直接告诉我们,DeepSeek的下一代核武器,也就是传说中的DeepSeek-V4,它的心脏,已经造好了。我觉得这篇论文更是解开了一个,困扰了中国AI行业,整整两年的死结。

我们把视角拉高一点。过去这一年,全球AI的战局其实非常诡异。美国那边,OpenAI和Google杀红了眼,手里拿的是什么牌?是成千上万张NVIDIA H100,甚至是更先进的B200。他们的打法叫力大砖飞,拼命把模型做深,几百层上千层地堆。因为他们有全世界最好的芯片,有带宽最高的NVLink互联,他们不在乎效率,只在乎智能的涌现。

但是我们呢?我们手里是什么牌?这就不得不提那把,悬在我们头顶的达摩克利斯之剑:芯片禁令。为了合规,我们只能买到那个,被戏称为太监版的NVIDIA H20。或者,我们用国产的希望:华为昇腾910B。

这两张牌,说实话,都很难打。说这个H20,这简直是半导体历史上,最奇葩的一个怪胎。美国人为了限制中国的算力,把它的计算核心砍得,只剩下H100的15%,不到300TFLOPS。但是,注意这个但是,为了不让这卡彻底卖不出去,黄仁勋保留了它完整的显存系统。这就导致H20拥有一项,极其恐怖的数据:它的显存带宽高达4.0TB/s,比满血版的H100还要高出20%。

大家能想象这是个什么概念吗?这就像是一个,拥有爱因斯坦的大脑容量,博尔特的神经反应速度,但手脚却被捆住,只能像树懒一样慢动作计算的,畸形儿。业界有个专业术语,叫富显存,穷算力。

再看另一张牌,华为910B。它的算力其实不错,能跟H20掰掰手腕,甚至更强。但它的软肋在互联。我们都知道,大模型训练不是一张卡在战斗,是几千张卡连在一起。910B的片间互联带宽,只有NVLink的一半不到。一旦跨服务器通信,走RoCE网络,那个延迟更是让人头皮发麻。

这就是我们的战场。要么是脑子转得慢的H20,要么是嘴巴张不开的910B。在这样的硬件上,如果你还要硬着头皮去学OpenAI,去搞那种几百层的深模型,下场只有一个:堵死。

为什么?想象一下,传统的深层模型,就像是一列首尾相接的,重型卡车队。这一百辆车,必须排成一字长蛇阵。第一辆车没到终点,第二辆车就不能动。如果你用H20跑这种模型,情况就是,这条高速公路明明修了16个车道,宽得能跑飞机。但是,因为你的车队是单列纵队,而且每一辆车的引擎,都被美国人锁死了,开得巨慢无比。结果就是,你只占用了一条车道,在那儿龟速挪动,剩下的15条车道全是空的。空荡荡的马路,那是白花花的银子啊,也是被浪费的时间。

这就是为什么很多人抱怨,H20虽然带宽大,但训练大模型效率极低,因为根本喂不饱它。如果用910B跑呢?现在流行的MoE模型,需要数据在不同的GPU之间飞来飞去,这叫All-to-All通信。在910B的集群上,这就像是让这一百辆大卡车,在高峰期的北京三环上,频繁变道,掉头。路本来就窄,一变道,全堵死了。GPU大部分时间不是在计算,而是在等数据,这叫通信墙。

路堵死了,怎么办?美国人说,买H100吧,路不够宽我给你修路。但我们买不到。这时候,DeepSeek站了出来。梁文锋带着他的团队,看着手里这把烂牌,突然把牌桌一掀,说:谁告诉你们模型一定要做深的?既然路这么宽,既然单车速度慢,我们为什么不换一种跑法?

DeepSeek在这篇元旦论文里,提出的mHC架构,听着很拗口是吧?别管那些数学名词,它的核心逻辑,极其简单粗暴。我把它称为 摩托车暴兵流。DeepSeek的思路是,既然我的车跑不快,那我就把那辆重型大卡车,拆解成一千辆,一万辆灵巧的高性能摩托车。以前是一列纵队,现在,我有几千辆摩托车,我直接把你那闲置的15条车道,全占满。我几千辆车并排跑。虽然每一辆摩托车的极速,还是被锁死的,因为单核算力依然是H20的水平。但是,因为我同时跑在路上的车,变多了几十倍,单位时间内运送的货物总吞吐量,直接起飞。

这就是mHC架构的精髓:用极致的宽度,去换取被封锁的深度。它把H20那个原本只能用来,在那儿这儿空转的4.0TB/s带宽,彻底吃干榨净。这简直就是为了H20这种畸形硬件,量身定做的战术,把你的算力低劣势规避掉,把你的带宽大优势放大到极致。

而且,这套摩托车战术,对国产的910B同样是救命稻草。刚才说了,MoE模型最怕跨卡通信。但是mHC这种宽模型,它的数据混合是在哪里完成的?是在摩托车队内部。DeepSeek设计了一种极其巧妙的拓扑结构,让这些并行的计算流,主要在单台服务器内部,甚至是一个GPU的内部进行交互。通俗点说,这叫肉烂在锅里。原本需要跨越千山万水,去别的服务器找专家的数据,现在在本地就消化了。跨节点的通信量,直接被砍掉了一大半。All-to-All这种让国产卡窒息的操作,直接被规避掉了。

听到这儿,你可能会拍案叫绝。这逻辑太通了。既然这么简单,为什么OpenAI不做?为什么Google不做?难道美国人傻吗?把模型做宽,并行度更高,这道理谁不懂啊?这就问到点子上了。

事实上,把模型做宽,在AI这一行,长期以来是一个禁区,是一个被无数先烈用尸体证明了的,死胡同。OpenAI最近甚至专门发了篇论文,说宽度是低效的。这就是所谓的《谱缩放定律》。为什么?因为宽模型有一个致命的缺陷:失控。

你想想看,一列纵队的大卡车,虽然慢,但它守规矩。这辆跟在那辆后面,不出乱子。但是,如果你突然把它们变成一万辆摩托车,还要它们在高速公路上并排飞驰,互相之间还要交换货物,也就是信息交互。如果没有一套神级的交通指挥系统,结果是什么?瞬间连环车祸。在数学上,这叫梯度爆炸,或者信号坍塌。当你简单粗暴地增加网络的宽度,也就是增加所谓的超连接时,信号在层与层之间的传播噪音,会被指数级放大。就像是一百个人同时在屋子里大喊大叫,最后谁也听不清谁在说什么。

过去几年,无数尝试做宽模型的人,最后都倒在了训练数值溢出的血泊里。所以,OpenAI选择了不做。他们有H100,他们有资本去堆深度,他们不需要冒这个险。但是DeepSeek没得选。在被锁死的算力孤岛上,他们必须走通这条死路。而这一次,梁文锋和他的团队,之所以敢在元旦发这篇论文,是因为他们找到了那个传说中的,上帝交通指挥系统。他们用一种令人叹为观止的数学手段,给这一万辆狂飙的摩托车,装上了智能刹车和导航。

这就是论文标题里那个最晦涩,但也最性感的词:流形约束。这到底是个什么黑科技?为什么我说它是数学的暴力美学?各位,我们来做一次思维实验。想象一下刚才那一万辆摩托车,如果没有红绿灯,它们在公路上是什么状态?是混乱,是无序,是随时可能发生的碰撞。在数学上,这对应的是一个充满了,高熵和热噪声的矩阵。如果你这时候去看后台的数据监控,你会看到一团乱麻一样的红线,那就是失控的梯度,它们在疯狂地震荡,直到把整个训练过程搞崩。

这时候,DeepSeek引入的流形约束,就像是一只无形的上帝之手。它并没有简单粗暴地去阻拦车流,而是制定了一条铁律:能量守恒。这听起来像物理名词对吧?但在mHC架构里,它的意思是,不管你这几千条并行通道怎么跑,也不管你们怎么交换信息,你们每一行输出的信号总强度,必须严格等于1。你们每一列接收到的信号总强度,也必须严格等于1。这叫做双随机矩阵。

这听起来是不是有点像以前那种,既要又要的无理要求?你既要让出发大厅的人流不拥堵,又要让到达大厅的人流不积压,而且这两边是联动的,按下一头翘起另一头。怎么可能同时满足?这就是DeepSeek这帮数学疯子,最精彩的地方。他们搬出了一个在量化金融,和最优传输理论里才用的算法:Sinkhorn-Knopp算法。

这个算法在论文里,就是几个冷冰冰的公式。但在DeepSeek的工程实现里,它就是一场视觉奇观。如果这个时候,我们能看到神经网络内部的微观世界,你会看到这样一幕,这绝对是最硬核的画面描述。请大家跟上我的思路。最开始,是一片混沌的黑暗,只有无数杂乱无章的霓虹线条,在闪烁。那是初始的随机权重,充满了噪音,像是无序的热噪声。

突然,第一次闪烁发生了。一道横向的光波瞬间扫过整个矩阵。这道光波强制要求,所有的出发地必须流量守恒。啪的一下,所有横向的线条瞬间被拉直,对齐。不管你之前多强多弱,现在必须服从规则。这时候,出发端整齐了,但到达端可能乱套了。紧接着,第二次闪烁。一道纵向的光波反向扫了回来。它强制要求所有的目的地,必须流量守恒。这一下,把刚才好不容易排好的横向队伍,又稍微打乱了一点,但是纵向的队伍整齐了。

这时候,奇迹发生了。这两道光波开始在横纵之间,快速交替闪烁,像呼吸一样。频率越来越快,每一次闪烁,那种混乱的噪音就少一分,秩序就多一分。大概只需要迭代三次,注意,仅仅只需要三次。原本那团像乱麻一样的线条,突然之间,结晶了。所有的杂音消失,画面定格成了一张完美,晶莹剔透,纵横正交的网格。

这就是Sinkhorn算法的魔力。它不是在计算,它是在雕刻。它从混沌的数据洪流中,强行雕刻出了秩序。通过这几次简单的迭代,DeepSeek给那一万辆狂飙的摩托车,戴上了最严苛的紧箍咒。不管模型做多宽,不管并行度多高,只要经过这个上帝交通管制系统的过滤,输出的信号永远是稳定,清晰,受控的。

这就是为什么DeepSeek敢做宽模型,敢去挑战OpenAI不敢碰的禁区。而且,你们猜猜,加上这套复杂的数学控制系统,会增加多少计算成本?很多人第一反应肯定是,完了,这肯定很慢吧?又要迭代,又要归一化。论文里给出的数据是,训练时间仅仅增加了6.7%。为什么这么便宜?因为在H20这种带宽过剩的GPU上,这种纯粹的数据搬运和归一化操作,几乎是免费的。H20那4.0TB/s的带宽,处理这点矩阵变换,简直是杀鸡用牛刀。

DeepSeek的工程师,利用算子融合技术,把这些数学操作,藏在了矩阵乘法的间隙里。也就是说,车队在卸货的时候,顺便就把交通指挥做完了。这真的是一种穷人的智慧,或者说是被逼出来的极致。美国人因为算力富裕,所以他们习惯了大力出奇迹,习惯了浪费。而我们因为算力受限,必须把每一分算力都掰成两半花,必须用最高级的数学,去换取哪怕一点点的工程空间。

说到这儿,我们已经算是把mHC的技术原理,讲清楚了。但是,如果DeepSeek仅仅是做了一个省钱的模型,那它还不足以被称为,非对称武器。接下来这部分,才是真正它背后的战略野心。

你们有没有发现,现在的AI江湖,其实已经开始分道扬镳了。如果你仔细去读OpenAI最近的一系列论文,特别是2025年底那篇关于《谱缩放定律》的文章,你会发现一个很有意思的现象:OpenAI正在变得越来越像一个,逻辑学家。OpenAI的研究员们悲观地认为,单纯增加模型的宽度是没用的。他们发现,如果你把网络做宽,增加的那些参数,大部分都变成了尾部噪声,并没有学到真正的知识。所以,GPT-5和o系列这些模型,都在死磕深度,死磕思维链。他们试图通过增加推理的时间长度,来弥补模型容量的不足。所以OpenAI的路线是:深,窄,慢。他们要做的是一个,像爱因斯坦那样深思熟虑的大脑。

但是,DeepSeek走到了十字路口的另一边。mHC架构的提出,实际上是DeepSeek站出来,狠狠地打了OpenAI一个耳光。DeepSeek说:不是宽度不行,是你们的连接方式太原始。如果你能用流形约束控制好噪音,宽模型不仅不笨,反而是一个吞吐量惊人的超级怪兽。所以,DeepSeek的生态位非常清晰。它不做那个坐在扶手椅上,沉思的哲学家。它要做一台极致高效,暴力吞吐的,超级工业计算器。

这种差异化竞争,最后会导致什么结果?这就得算一笔恐怖的经济账了。这笔账算清楚了,你就明白为什么我说这是,降维打击。在DeepSeek的这篇论文里,有一个不起眼但极具杀伤力的结论:他们用一个27B,也就是270亿参数的mHC模型,跑出了相当于更大参数量,传统模型的性能。注意这个词,是相当于更大。在AI圈子里,如果你能用60%的参数量,达到对手100%的性能,这不叫节省,这叫屠杀。

我们来做一个大胆的推演。假设,我是说假设,DeepSeek把这套mHC架构,应用到了他们即将发布的,对标GPT-5级别的DeepSeek-V4上,会发生什么?首先是,显存成本的雪崩。现在的GPT-5.2,虽然从未公开过架构,但业界普遍猜测它是一个巨大的MoE模型,每次推理激活的参数量,可能在1000亿以上。这意味着每生成一个字,GPU都要搬运巨量的数据。而DeepSeek-V3已经把活性参数,压缩到了37B。如果V4加上mHC的加持,因为它的参数效率更高,也许只需要20B到25B的活性参数,就能达到同样的智力水平。这意味着生成同样的Token,DeepSeek需要调用的显存带宽,只有OpenAI的,四分之一甚至更少。

DeepSeek选择在这个时候亮剑,就是要在给全球AI市场,一记重锤。但这记重锤,砸的可不仅仅是OpenAI的发布会节奏。它真正要砸碎的,是硅谷巨头们精心编织的,商业美梦。我们刚才聊了OpenAI,聊了他们越来越像逻辑学家。其实在这个战场上,还有另一个巨头:Google。如果你去翻翻Google DeepMind在2025年底发的论文,你会发现他们走的是另一条路,叫嵌套学习。Google的这帮天才们,试图模仿人脑的结构,搞什么快权重和慢权重。他们想解决的是AI的记忆问题,想让AI像人一样,能记住你几年前说过的话,能产生情感羁绊。说白了,Google在搞仿生学,他们想造的是一个完美的,类人伴侣。

而DeepSeek呢?mHC架构没有任何这种浪漫的色彩。它完全是基于冷冰冰的计算物理学,基于热力学定律。它不关心AI像不像人,它只关心一件事:如何在被阉割的H20集群上,用最少的电费,最快的速度,把Token吐出来。这就是我说的,错位竞争。当OpenAI和Google还在为了更像人,而在这个无底洞里烧钱的时候,DeepSeek已经造出了一台,完美的数字热机。在写代码,做报表,解数学题,这些企业级应用场景里,客户不需要AI有感情,只需要它够快,够便宜,够准。

而在这些维度上,搭载了mHC的DeepSeek-V4,会不会又对美系模型,构成绝对的成本碾压呢?我觉得,这个问题还是留给大家。你觉得大模型的终局,会是OpenAI那种越来越像人的路线赢?还是DeepSeek这种,越算越像机器的路线赢?或者更残酷一点,当推理成本被打到地板价之后,真正的护城河到底还剩什么?欢迎在评论区留言、讨论。最后,记得点赞,转发,热推。咱们下期再见。