📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

DeepSeek V4发布前夕亮出底牌!抛弃英伟达原生驱动,全新架构提前省下10亿美金

明月三千里26:05

Transcription

就在外界翘首 期盼

DeepSeek-V4大模型发布之际

DeepSeek团队却在前几天

放出重磅技术成果

大家先看这张张图

这是DeepSeek团队

联合北京大学

清华大学

在发布的顶会级重磅论文

《DualPath》里

直接甩出来的一组

真实物理探针数据

在目前最主流的

大模型推理系统里

负责阅读你

长篇大论提示词的

前台节点

它用来连接

外部存储的网卡带宽

已经被彻底干到了

百分之百的满载

红灯狂闪

数据根本拉不过来

但你猜怎么着

就在同一台机器里

它那颗价值好几万美金

代表着人类硅基文明

最高结晶的GPU计算核心

利用率只有可怜的

百分之四十

百分之四十啊朋友们

这意味着你花天价

买回来的算力

有百分之六十的时间

是在睡大觉

是在原地发呆

而更荒谬的是

旁边负责逐字生成回答的

解码节点

它的GPU倒是跑到了80%

但它那根极其昂贵的

高速存储网卡

利用率竟然是零

一边是堵死

一边是闲死

这就是2026年

AI基础设施最真实的现状

也是制约所有AI公司

活下去的致命绝症

但DeepSeek抛出这篇论文

可不是为了抱怨的

他们在这篇论文里

一行底层的显卡

物理硬件代码都没改

硬生生靠着一套

叫做DualPath的

变态级暗道调度系统

把整个大模型在线推理的

吞吐量

直接拉高了1.96倍

1.96倍是什么概念

几乎是翻倍了

相当于没花一分钱

凭空白嫖了

将近一万张顶级显卡

这早就不是什么

普通的学术修补了

这是一场价值几亿美金的

资本拯救行动

今天这期视频

我就用最通俗的语言

带你看懂DeepSeek的

这项新技术

看懂了这期视频

你就会明白

在AI算力方面

用极致的抠门统筹学

和系统工程

也可以达到

大力出奇迹的效果

我们先来算一笔

极其血腥的财务账

看看这百分之六十的

算力空转

到底意味着什么

很多人对万卡集群没有概念

觉得那不过是个机房

你想想看

在现在的市场定价下

你要组建一个

拥有一万张英伟达H100的

超算集群

你以为只要买一万张卡

就行了吗

当然不止

你必须采购高度集成的

8卡服务器节点

配上顶级的双路CPU

海量的DDR5内存

一台这样的服务器

造价就要三十五万美金

一万张卡

就是一千二百五十台服务器

光这笔钱就是4.3亿美金

这还不算完

一万张卡要互相通信

你得拉满400G的高速网络

买成百上千个

交换机和光模块

这又得砸进去几千万美金

好就算你财大气粗

凑齐了接近5亿美金的

初始采购费

也就是所谓的CapEx

这机器一开机

真正的噩梦才刚刚开始

一万张满载的H100

加上配套设备

整体功耗直接飙到

15兆瓦以上

15兆瓦什么概念

相当于一个小城镇的用电量

算上散热空调

场地租金

顶级运维工程师的工资

还有极其夸张的硬件折旧

这个万卡集群

只要通着电

每天的运营成本

也就是OpEx

保守估计就要烧掉

100万美金

每天100万美金啊

计费表转得比印钞机还快

结果呢

因为我们刚才看的那张图

因为数据堵在网卡上进不来

你这每天烧掉的100万美金里

有整整60万美金

是直接扔进水里

连个响都听不到的

这就好比你是

一个超级物流公司的老板

花重金组建了一支

数百辆特斯拉Semi

电动卡车队伍跑运输

这些Semi电动卡车

都是很牛的

结果你发现

一路上所有能给

Semi电动卡车充电的

充电桩数量极少

而且调度还极其混乱

导致你这支运输车队

每天有百分之六十的时间

只能死死地排队等待充电

货没拉多少

你的资金就已经快烧光了

这就叫存储带宽墙

你以为你买的是算力

其实你花天价买来的

是极其昂贵的等待时间

肯定有懂行的朋友会问了

以前ChatGPT刚出来的时候

怎么没听说有

这么严重的排队问题

为什么偏偏到了2026年

到了大模型全面进化成

Agent智能体的时候

这个存储墙

突然就变成了绝症呢

这就要说到AI进化

带来的一个

极其变态的业务场景了

以前我们玩ChatGPT

那是单轮对话

你问一句它答一句

这种情况下

大模型在脑子里

也就是在GPU那点

极其有限的HBM显存里

临时开辟一块小黑板

把你刚才问的问题存下来

这块小黑板上的数据

在专业上就叫KV-Cache

也就是键值缓存

等你这个问题聊完了

AI马上就把小黑板

擦得干干净净

把宝贵的显存空间

让给下一个用户

这时候

GPU的算力是被完全拉满的

它算得飞快

根本不需要等数据

但是

现在的AI早就不是那种

一问一答的聊天机器人了

现在全网都在搞自动化智能体

比如能自己写代码的

SWE-agent

或者能自己去扒数据

写财报的金融Agent

这种智能体干活

可不是一句话就能搞定的

它需要在一个沙盒环境里

不停地试错

不停地执行命令

DeepSeek团队在这篇论文里

直接给出了他们在

真实生产环境里

抓取到的恐怖数据

一个典型的代码智能体

为了修一个Bug

平均需要和环境交互多少轮

157轮

在这场157轮的马拉松里

智能体平均会积累下

高达32700个Token的

超长上下文

但是

请注意这个极其反直觉的数据

在这长达三万多Token的

历史背景下

智能体在每一轮真正新思考

新写出来的代码

平均只有区区429个Token

这就导致了一个

极其滑稽的数学事实

在智能体干活的时候

它对于历史记忆

也就是KV-Cache的命中率

高达98.7%

98.7%的时间

它都在疯狂地读取旧数据

为了让你一秒钟

听懂这个原理有多崩溃

我们来想象一个

极其接地气的场景

现在的AI智能体就像个

算力无敌

但没有长期记忆的实习生张三

每次为了修一个Bug

他都得跑去地下室

把厚达三万多字的

历史账本

死命搬到他那狭小的办公桌

也就是GPU显存上

看一眼

写下区区几百字的新代码

然后把账本搬回去

下一轮报错

他又要跑去把加上新报错的

更厚的账本再搬一次

为了修一个Bug

他来来回回搬了157次

最后

张三那个超级大脑

99%的时间都在发呆

因为体力全耗在狭窄的楼梯

也就是网卡带宽上搬砖了

这就是带宽被彻底撑爆的真相

现在我们把目光

从地下室拉回真实的万卡机房

为了解决张三

搬账本搬到吐血的问题

现在的AI大厂们是怎么干的呢

他们搞了一套叫做

前台与后厨分离

也就是专业上说的

Prefill和Decode分离架构

这套架构听起来很聪明

分工极其明确

前台节点

专门负责当那个苦逼的张三

去硬盘里疯狂拉取

那几万页的旧账本

读完了

把整理好的上下文

递给后厨节点

后厨节点呢

就是那个打字员

只负责基于这些上下文

一个字一个字地往外蹦新代码

结果呢

灾难发生了

大家这就明白了吧

这套看似聪明的分工

正是导致开头那张图里

前台网卡堵死

后厨网卡结蜘蛛网的罪魁祸首

在分布式系统设计里

这简直是暴殄天物的死罪

这时候

DeepSeek的团队们

实在看不下去了

既然前台的网卡撑爆了

后厨的网卡闲着

为什么不把这百分之百

闲置的资源利用起来

于是DualPath

也就是双路径加载架构

横空出世

DeepSeek的做法极其鸡贼

也极其聪明

他们直接给后厨节点

下了一道死命令

你那块网卡闲着也是闲着

你现在立刻去外部存储仓库

帮前台把那些沉重的

历史账本拉回来

拉回来之后怎么办

DeepSeek在集群内部

挖了一条暗道

这条暗道

就是计算节点之间极速的

RDMA网络

后厨把账本拉到自己这里

然后顺手一记乾坤大挪移

通过这条内部极速暗道

瞬间塞给前台

就这么一个看似简单的

流量重定向

瞬间把整个万卡集群的

I/O吞吐能力完美均摊

前台再也不堵了

GPU瞬间满血复活

算力被彻底榨干

听到这里

可能有懂行的朋友

或者大厂的架构师要问了

既然这招这么好用

Google OpenAI里面

那么多顶级天才

Meta扎克伯格砸了那么多钱

他们以前怎么想不到

难道是硅谷的工程师

脑子转不过弯吗

朋友们

这根本不是想不想得到的问题

这是底层算法代差带来的

物理锁死

你想想看

那些基于传统MHA

或GQA架构的常规大模型

它们产生的历史账本有多大

大到让你绝望

随便一个长上下文任务

KV-Cache的体积

就能膨胀到几个TB

几个TB的数据啊

如果Meta敢用后厨

去拉这几个TB的数据

然后再通过内部网络传给前台

那根本不叫帮忙

那叫直接用泥石流

把整个机房的网络给冲垮

物理链路根本承受不起

这么庞大且未经压缩的

数据汪洋

那DeepSeek凭什么敢这么干

因为他们采用的是MLA

多头潜在注意力机制

DeepSeek把原本不可移动的

重达千吨的KV-Cache巨石

通过极其变态的

低秩联合压缩算法

强行压缩了整整57倍

57倍啊

原本需要几百GB

才能存下的记忆

现在只需要十几GB

就能塞进去

这就像是把石头变成了

可以在管道里高速流动的液体

正因为有了MLA

把数据压缩到了极致

底层系统工程师才有了

物理上的底气

敢于通过DualPath这条暗道

进行跨节点的疯狂搬运

巨头们不是不想走暗道

而是他们背负的数据包袱

实在太重

连暗道的门都挤不进去

好现在数据能走暗道了

但这绝不是你想借道就能借的

稍微懂点底层网络的极客

马上会反应过来

抛出一个致命风险的拷问

那条内部的RDMA网络

可是模型同步计算的生命线啊

如果把搬运账本的重型泥头车

开进救护车道

万一堵了零点几毫秒

导致几千万美金的算力

死锁卡顿怎么办

这个问题问得极其专业

这正是这篇论文里

最大的亮点地方

为了防止搬账本的泥头车

冲垮救护车

DeepSeek的网络工程师

在最底层的网络交换层里

硬生生地切出了虚拟车道

也就是Virtual Lanes

他们在硬件级别下达了

极其悬殊的99比1的死命令

什么意思

整条高速公路

99%的带宽权重

被划为绝对不可侵犯的

VIP救护车道

只准模型推理的

核心计算流量走

而你后厨搬运KV-Cache的流量

对不起

你只能在剩下那百分之一的

低优先级车道里

或者等救护车道完全空闲的时候

见缝插针地往前蹭

这就叫不仅借了你的道

还绝不给你添半点堵

在动辄几万个端口的

交换网络里

在微秒级的深渊里走钢丝

确保哪怕泥头车堵死

救护车依然能全速狂飙

这种精细到纳秒级别的

流量隔离

简直就是给高速运转的

V8引擎做心脏搭桥手术

但是

这群性能极客觉得这还不够

为了把延迟压榨到物理极限

他们做出了一个极其疯狂的决定

他们不仅抛弃了

业界奉为神明的高级工具

甚至直接抛弃了英伟达官方

原生的CUDA驱动

转而去手搓底层的硬件寄存器

懂行的朋友肯定听过

英伟达引以为傲的黑科技

GDS

也就是GPUDirect Storage

这玩意儿原本的作用

是让外部硬盘的数据

彻底绕过CPU这个中间商

直接顺着PCIe总线

一股脑地灌进GPU的显存里

听起来很完美对吧

但在Agentic智能体这种

极端场景下

DeepSeek的底层系统工程师

敏锐地发现

GDS简直就是一个

随时会引爆机房的定时炸弹

为什么

因为GDS是个纯粹的

瞎子加莽夫

它根本感知不到GPU内部

是不是正在进行极其紧急的

模型张量并行计算

想象一下

城市的管理者为了图省事

允许外部送货的重型泥头车队

也就是GDS流量

直接开进戒备森严的

中央计算仓库内部

在核心过道上随意倾倒货物

这群毫无组织纪律的重卡

会瞬间堵死仓库内部

负责传递最高级紧急情报的

特种通信车

这直接导致整个大模型的

推理引擎

因为等不到上一个神经元的

同步结果

而陷入致命的卡顿

为了彻底根除这个隐患

DeepSeek的极客们做出了一个

看似历史倒退

实则极尽精妙的决定

他们主动废掉了GDS的一镜到底

重新把宿主机的CPU内存

当做跳板

并且把整个单机系统数据流的

最高指挥权

交给了那张负责计算的网卡

也就是CNIC

从此以后

所有搬运KV-Cache的动作

都必须听从CNIC的统筹调度

一旦GPU爆发出

紧急的计算请求

CNIC就会像个铁面无私的交警

瞬间无情地降速

甚至暂停数据搬运

为核心算力让出一条

宽阔无阻的物理通道

但是夺回了控制权还不够

如果你用英伟达标准的

CUDA异步拷贝接口去传数据

底层那个高度闭源的

黑盒驱动栈

每次调用都会产生

5到7微秒的延迟

你可千万别小看这5微秒

在DualPath的设计里

为了配合Transformer

逐层计算的节拍

庞大的KV-Cache被切碎成了

数以万计的纳米级层级块

专业术语叫Layer Block

像流水线一样疯狂投喂给GPU

这5微秒的延迟

一旦被循环放大一万次

就会像黑洞一样

吞噬掉架构层面积攒下来的

所有时间红利

为了消灭这5微秒

DeepSeek的系统团队直接杀疯了

在标准RDMA

绕过操作系统的常规操作之上

DeepSeek把硬件微操

压榨到了极限

他们搞出了一招巧妙的

门铃批处理(Doorbell Batching)

CPU就像一个极其冷酷的特种兵

它在主机的发送队列里

悄无声息地排布好

一长串复杂的数据搬运单

只有当攒够了最优数量

才精准地触发一次写入

啪地一声

一次性敲响硬件的门铃

就这一组极限微操

硬生生把5到7微秒的提交延迟

无情地碾压到了

1微秒以下的物理极限

朋友们

这就是系统工程的极致浪漫

这就是为什么DualPath这篇论文

能在真实的Agentic生产环境里

把离线推理吞吐量拔高1.87倍

把在线服务并发容量

硬生生拔高了1.96倍的终极秘密

1.96倍啊

绝对不是一个实验室里的

跑分指标

这简直就是一张

价值十亿美金的免死金牌

我们回到视频开头的那个万卡集群

假设一家AI独角兽企业

业务量突然爆发

并发请求翻倍

如果按照以前那种前台堵死

后台闲死的低效架构

老板别无选择

只能硬着头皮去进行水平扩展

也就是说

他得再掏钱

去市场上抢购9600张H100显卡

9600张卡

配上1200台顶级服务器

加上300个机柜的网络设备

这笔新增的CapEx资本支出

直接干碎4.3亿美金

折合人民币超过30亿

而且这还没算完

这多出来的9600张卡

在未来三年的生命周期里

每天的电费场地费维保费

这种OpEx运营支出

还要再吃掉你6.3亿美金

现在DeepSeek

用一行行直插硬件心脏的代码

没让你多买哪怕一根网线

就直接把这超过10亿美金的

成本黑洞给彻底填平了

在现在这种风险投资

捂紧钱袋子的寒冬里

省下这笔巨款

足以让一家独角兽企业

避免一次极其屈辱的流血融资

更残酷的现实是

就算你账上躺着几十亿美金

你买得到卡

你买得到电吗

在超算领域的真实商业博弈中

算力中心总监们面临的

终极困境

往往是有钱也买不到电

扩容一万张卡

你需要额外寻找15兆瓦以上的

稳定电力供应

特别是像美国一些区域的

PJM电网区域

AI算力大爆发早就把

电网容量彻底抽干了

容量价格暴涨了近10倍

如果你现在去申请一个

15兆瓦的新变电站

你要面临长达两年甚至三年的

漫长排队期

在AI模型几个月就迭代一次的

白热化竞争里

等两年才通电

无异于商业自杀

而DeepSeek的DualPath架构

本质上就是一座超级虚拟发电厂

它在不增加一千瓦时外部电力

不排放一丁点额外碳足迹的

物理足迹内

可以实现了产能的翻倍

讲到这里

我们再回过头来看看当下的

中美AI路线之争

你会发现一个极其讽刺

甚至让人拍案叫绝的历史分水岭

美国政府搞小院高墙

挥舞着制裁的大棒

掐断了顶级算力芯片的供应

华盛顿的决策者们傲慢地以为

只要掐住高端英伟达GPU集群

中国的AI就会因为算力枯竭

被永远锁死在上一代的技术水平

但他们万万没想到

这种极端的计算稀缺

反而成了一座极其残酷的

高压演化炉

硅谷的巨头们

深陷在大力出奇迹的路径依赖里

遇到内存墙

遇到I/O瓶颈

第一反应就是砸几百亿美金

去买更贵的Blackwell B200

买更粗的光模块

而中国工程师

在重重围堵之下

硬是被逼出了一套极其变态的

抠门统筹学

这种抠门统筹学

最致命的战略价值

就在于它极大降低了

模型对底层硬件的挑剔程度

赋予了国产芯片发展更多的可能性

就拿华为的昇腾芯片来说

客观承认

受限于制程工艺等

它在浮点算力和效率是

确实和英伟达存在较大差距

如果沿用那种暴力堆叠的路线

把几千上万亿参数的巨无霸模型

强行塞进国产集群

那推理延迟和成本

绝对是灾难性的

但是

DeepSeek通过MLA算法的降维压缩

MoE专家的精确制导

再加上今天咱们拆解的

DualPath流量乾坤大挪移

也可以把极其复杂的推理负载

逐渐平移到基于国产芯片的架构上

结果就是

在国产算力底座上

DeepSeek把输入Token的定价

疯狂压缩到了惊人的

每百万Token只要1块钱人民币

也就是区区0.14美元

而在大洋彼岸

那些完全依赖英伟达GPU

暴力堆算力的西方旗舰大模型

跑同等任务的综合成本

依然高达好几美元

这中间

是几十倍的恐怖差价

朋友们

物理规律和经济学常识

正在对盲目的算力崇拜

进行无情的侵蚀

黄仁勋正满世界拼命推销

他那些功耗上千瓦

价格几万美金的最新显卡

试图维系大力出奇迹的算力神话

而另一边

DeepSeek正在用极致的

抠门统筹学和系统工程

在算法底层

给这些患上了I/O饥渴症的

显卡刺客们悄悄地解毒

屏幕前的你觉得

中美AI的未来决胜点

究竟是光刻机里的纳米精度

还是这种榨干每一滴算力的

底层架构革命

欢迎在评论区留下你的看法

咱们一起好好讨论一下

最后别忘了点赞订阅哦

咱们下期再见