Transcription
就在外界翘首 期盼
DeepSeek-V4大模型发布之际
DeepSeek团队却在前几天
放出重磅技术成果
大家先看这张张图
这是DeepSeek团队
联合北京大学
清华大学
在发布的顶会级重磅论文
《DualPath》里
直接甩出来的一组
真实物理探针数据
在目前最主流的
大模型推理系统里
负责阅读你
长篇大论提示词的
前台节点
它用来连接
外部存储的网卡带宽
已经被彻底干到了
百分之百的满载
红灯狂闪
数据根本拉不过来
但你猜怎么着
就在同一台机器里
它那颗价值好几万美金
代表着人类硅基文明
最高结晶的GPU计算核心
利用率只有可怜的
百分之四十
百分之四十啊朋友们
这意味着你花天价
买回来的算力
有百分之六十的时间
是在睡大觉
是在原地发呆
而更荒谬的是
旁边负责逐字生成回答的
解码节点
它的GPU倒是跑到了80%
但它那根极其昂贵的
高速存储网卡
利用率竟然是零
一边是堵死
一边是闲死
这就是2026年
AI基础设施最真实的现状
也是制约所有AI公司
活下去的致命绝症
但DeepSeek抛出这篇论文
可不是为了抱怨的
他们在这篇论文里
一行底层的显卡
物理硬件代码都没改
硬生生靠着一套
叫做DualPath的
变态级暗道调度系统
把整个大模型在线推理的
吞吐量
直接拉高了1.96倍
1.96倍是什么概念
几乎是翻倍了
相当于没花一分钱
凭空白嫖了
将近一万张顶级显卡
这早就不是什么
普通的学术修补了
这是一场价值几亿美金的
资本拯救行动
今天这期视频
我就用最通俗的语言
带你看懂DeepSeek的
这项新技术
看懂了这期视频
你就会明白
在AI算力方面
用极致的抠门统筹学
和系统工程
也可以达到
大力出奇迹的效果
我们先来算一笔
极其血腥的财务账
看看这百分之六十的
算力空转
到底意味着什么
很多人对万卡集群没有概念
觉得那不过是个机房
你想想看
在现在的市场定价下
你要组建一个
拥有一万张英伟达H100的
超算集群
你以为只要买一万张卡
就行了吗
当然不止
你必须采购高度集成的
8卡服务器节点
配上顶级的双路CPU
海量的DDR5内存
一台这样的服务器
造价就要三十五万美金
一万张卡
就是一千二百五十台服务器
光这笔钱就是4.3亿美金
这还不算完
一万张卡要互相通信
你得拉满400G的高速网络
买成百上千个
交换机和光模块
这又得砸进去几千万美金
好就算你财大气粗
凑齐了接近5亿美金的
初始采购费
也就是所谓的CapEx
这机器一开机
真正的噩梦才刚刚开始
一万张满载的H100
加上配套设备
整体功耗直接飙到
15兆瓦以上
15兆瓦什么概念
相当于一个小城镇的用电量
算上散热空调
场地租金
顶级运维工程师的工资
还有极其夸张的硬件折旧
这个万卡集群
只要通着电
每天的运营成本
也就是OpEx
保守估计就要烧掉
100万美金
每天100万美金啊
计费表转得比印钞机还快
结果呢
因为我们刚才看的那张图
因为数据堵在网卡上进不来
你这每天烧掉的100万美金里
有整整60万美金
是直接扔进水里
连个响都听不到的
这就好比你是
一个超级物流公司的老板
花重金组建了一支
数百辆特斯拉Semi
电动卡车队伍跑运输
这些Semi电动卡车
都是很牛的
结果你发现
一路上所有能给
Semi电动卡车充电的
充电桩数量极少
而且调度还极其混乱
导致你这支运输车队
每天有百分之六十的时间
只能死死地排队等待充电
货没拉多少
你的资金就已经快烧光了
这就叫存储带宽墙
你以为你买的是算力
其实你花天价买来的
是极其昂贵的等待时间
肯定有懂行的朋友会问了
以前ChatGPT刚出来的时候
怎么没听说有
这么严重的排队问题
为什么偏偏到了2026年
到了大模型全面进化成
Agent智能体的时候
这个存储墙
突然就变成了绝症呢
这就要说到AI进化
带来的一个
极其变态的业务场景了
以前我们玩ChatGPT
那是单轮对话
你问一句它答一句
这种情况下
大模型在脑子里
也就是在GPU那点
极其有限的HBM显存里
临时开辟一块小黑板
把你刚才问的问题存下来
这块小黑板上的数据
在专业上就叫KV-Cache
也就是键值缓存
等你这个问题聊完了
AI马上就把小黑板
擦得干干净净
把宝贵的显存空间
让给下一个用户
这时候
GPU的算力是被完全拉满的
它算得飞快
根本不需要等数据
但是
现在的AI早就不是那种
一问一答的聊天机器人了
现在全网都在搞自动化智能体
比如能自己写代码的
SWE-agent
或者能自己去扒数据
写财报的金融Agent
这种智能体干活
可不是一句话就能搞定的
它需要在一个沙盒环境里
不停地试错
不停地执行命令
DeepSeek团队在这篇论文里
直接给出了他们在
真实生产环境里
抓取到的恐怖数据
一个典型的代码智能体
为了修一个Bug
平均需要和环境交互多少轮
157轮
在这场157轮的马拉松里
智能体平均会积累下
高达32700个Token的
超长上下文
但是
请注意这个极其反直觉的数据
在这长达三万多Token的
历史背景下
智能体在每一轮真正新思考
新写出来的代码
平均只有区区429个Token
这就导致了一个
极其滑稽的数学事实
在智能体干活的时候
它对于历史记忆
也就是KV-Cache的命中率
高达98.7%
98.7%的时间
它都在疯狂地读取旧数据
为了让你一秒钟
听懂这个原理有多崩溃
我们来想象一个
极其接地气的场景
现在的AI智能体就像个
算力无敌
但没有长期记忆的实习生张三
每次为了修一个Bug
他都得跑去地下室
把厚达三万多字的
历史账本
死命搬到他那狭小的办公桌
也就是GPU显存上
看一眼
写下区区几百字的新代码
然后把账本搬回去
下一轮报错
他又要跑去把加上新报错的
更厚的账本再搬一次
为了修一个Bug
他来来回回搬了157次
最后
张三那个超级大脑
99%的时间都在发呆
因为体力全耗在狭窄的楼梯
也就是网卡带宽上搬砖了
这就是带宽被彻底撑爆的真相
现在我们把目光
从地下室拉回真实的万卡机房
为了解决张三
搬账本搬到吐血的问题
现在的AI大厂们是怎么干的呢
他们搞了一套叫做
前台与后厨分离
也就是专业上说的
Prefill和Decode分离架构
这套架构听起来很聪明
分工极其明确
前台节点
专门负责当那个苦逼的张三
去硬盘里疯狂拉取
那几万页的旧账本
读完了
把整理好的上下文
递给后厨节点
后厨节点呢
就是那个打字员
只负责基于这些上下文
一个字一个字地往外蹦新代码
结果呢
灾难发生了
大家这就明白了吧
这套看似聪明的分工
正是导致开头那张图里
前台网卡堵死
后厨网卡结蜘蛛网的罪魁祸首
在分布式系统设计里
这简直是暴殄天物的死罪
这时候
DeepSeek的团队们
实在看不下去了
既然前台的网卡撑爆了
后厨的网卡闲着
为什么不把这百分之百
闲置的资源利用起来
于是DualPath
也就是双路径加载架构
横空出世
DeepSeek的做法极其鸡贼
也极其聪明
他们直接给后厨节点
下了一道死命令
你那块网卡闲着也是闲着
你现在立刻去外部存储仓库
帮前台把那些沉重的
历史账本拉回来
拉回来之后怎么办
DeepSeek在集群内部
挖了一条暗道
这条暗道
就是计算节点之间极速的
RDMA网络
后厨把账本拉到自己这里
然后顺手一记乾坤大挪移
通过这条内部极速暗道
瞬间塞给前台
就这么一个看似简单的
流量重定向
瞬间把整个万卡集群的
I/O吞吐能力完美均摊
前台再也不堵了
GPU瞬间满血复活
算力被彻底榨干
听到这里
可能有懂行的朋友
或者大厂的架构师要问了
既然这招这么好用
Google OpenAI里面
那么多顶级天才
Meta扎克伯格砸了那么多钱
他们以前怎么想不到
难道是硅谷的工程师
脑子转不过弯吗
朋友们
这根本不是想不想得到的问题
这是底层算法代差带来的
物理锁死
你想想看
那些基于传统MHA
或GQA架构的常规大模型
它们产生的历史账本有多大
大到让你绝望
随便一个长上下文任务
KV-Cache的体积
就能膨胀到几个TB
几个TB的数据啊
如果Meta敢用后厨
去拉这几个TB的数据
然后再通过内部网络传给前台
那根本不叫帮忙
那叫直接用泥石流
把整个机房的网络给冲垮
物理链路根本承受不起
这么庞大且未经压缩的
数据汪洋
那DeepSeek凭什么敢这么干
因为他们采用的是MLA
多头潜在注意力机制
DeepSeek把原本不可移动的
重达千吨的KV-Cache巨石
通过极其变态的
低秩联合压缩算法
强行压缩了整整57倍
57倍啊
原本需要几百GB
才能存下的记忆
现在只需要十几GB
就能塞进去
这就像是把石头变成了
可以在管道里高速流动的液体
正因为有了MLA
把数据压缩到了极致
底层系统工程师才有了
物理上的底气
敢于通过DualPath这条暗道
进行跨节点的疯狂搬运
巨头们不是不想走暗道
而是他们背负的数据包袱
实在太重
连暗道的门都挤不进去
好现在数据能走暗道了
但这绝不是你想借道就能借的
稍微懂点底层网络的极客
马上会反应过来
抛出一个致命风险的拷问
那条内部的RDMA网络
可是模型同步计算的生命线啊
如果把搬运账本的重型泥头车
开进救护车道
万一堵了零点几毫秒
导致几千万美金的算力
死锁卡顿怎么办
这个问题问得极其专业
这正是这篇论文里
最大的亮点地方
为了防止搬账本的泥头车
冲垮救护车
DeepSeek的网络工程师
在最底层的网络交换层里
硬生生地切出了虚拟车道
也就是Virtual Lanes
他们在硬件级别下达了
极其悬殊的99比1的死命令
什么意思
整条高速公路
99%的带宽权重
被划为绝对不可侵犯的
VIP救护车道
只准模型推理的
核心计算流量走
而你后厨搬运KV-Cache的流量
对不起
你只能在剩下那百分之一的
低优先级车道里
或者等救护车道完全空闲的时候
见缝插针地往前蹭
这就叫不仅借了你的道
还绝不给你添半点堵
在动辄几万个端口的
交换网络里
在微秒级的深渊里走钢丝
确保哪怕泥头车堵死
救护车依然能全速狂飙
这种精细到纳秒级别的
流量隔离
简直就是给高速运转的
V8引擎做心脏搭桥手术
但是
这群性能极客觉得这还不够
为了把延迟压榨到物理极限
他们做出了一个极其疯狂的决定
他们不仅抛弃了
业界奉为神明的高级工具
甚至直接抛弃了英伟达官方
原生的CUDA驱动
转而去手搓底层的硬件寄存器
懂行的朋友肯定听过
英伟达引以为傲的黑科技
GDS
也就是GPUDirect Storage
这玩意儿原本的作用
是让外部硬盘的数据
彻底绕过CPU这个中间商
直接顺着PCIe总线
一股脑地灌进GPU的显存里
听起来很完美对吧
但在Agentic智能体这种
极端场景下
DeepSeek的底层系统工程师
敏锐地发现
GDS简直就是一个
随时会引爆机房的定时炸弹
为什么
因为GDS是个纯粹的
瞎子加莽夫
它根本感知不到GPU内部
是不是正在进行极其紧急的
模型张量并行计算
想象一下
城市的管理者为了图省事
允许外部送货的重型泥头车队
也就是GDS流量
直接开进戒备森严的
中央计算仓库内部
在核心过道上随意倾倒货物
这群毫无组织纪律的重卡
会瞬间堵死仓库内部
负责传递最高级紧急情报的
特种通信车
这直接导致整个大模型的
推理引擎
因为等不到上一个神经元的
同步结果
而陷入致命的卡顿
为了彻底根除这个隐患
DeepSeek的极客们做出了一个
看似历史倒退
实则极尽精妙的决定
他们主动废掉了GDS的一镜到底
重新把宿主机的CPU内存
当做跳板
并且把整个单机系统数据流的
最高指挥权
交给了那张负责计算的网卡
也就是CNIC
从此以后
所有搬运KV-Cache的动作
都必须听从CNIC的统筹调度
一旦GPU爆发出
紧急的计算请求
CNIC就会像个铁面无私的交警
瞬间无情地降速
甚至暂停数据搬运
为核心算力让出一条
宽阔无阻的物理通道
但是夺回了控制权还不够
如果你用英伟达标准的
CUDA异步拷贝接口去传数据
底层那个高度闭源的
黑盒驱动栈
每次调用都会产生
5到7微秒的延迟
你可千万别小看这5微秒
在DualPath的设计里
为了配合Transformer
逐层计算的节拍
庞大的KV-Cache被切碎成了
数以万计的纳米级层级块
专业术语叫Layer Block
像流水线一样疯狂投喂给GPU
这5微秒的延迟
一旦被循环放大一万次
就会像黑洞一样
吞噬掉架构层面积攒下来的
所有时间红利
为了消灭这5微秒
DeepSeek的系统团队直接杀疯了
在标准RDMA
绕过操作系统的常规操作之上
DeepSeek把硬件微操
压榨到了极限
他们搞出了一招巧妙的
门铃批处理(Doorbell Batching)
CPU就像一个极其冷酷的特种兵
它在主机的发送队列里
悄无声息地排布好
一长串复杂的数据搬运单
只有当攒够了最优数量
才精准地触发一次写入
啪地一声
一次性敲响硬件的门铃
就这一组极限微操
硬生生把5到7微秒的提交延迟
无情地碾压到了
1微秒以下的物理极限
朋友们
这就是系统工程的极致浪漫
这就是为什么DualPath这篇论文
能在真实的Agentic生产环境里
把离线推理吞吐量拔高1.87倍
把在线服务并发容量
硬生生拔高了1.96倍的终极秘密
1.96倍啊
绝对不是一个实验室里的
跑分指标
这简直就是一张
价值十亿美金的免死金牌
我们回到视频开头的那个万卡集群
假设一家AI独角兽企业
业务量突然爆发
并发请求翻倍
如果按照以前那种前台堵死
后台闲死的低效架构
老板别无选择
只能硬着头皮去进行水平扩展
也就是说
他得再掏钱
去市场上抢购9600张H100显卡
9600张卡
配上1200台顶级服务器
加上300个机柜的网络设备
这笔新增的CapEx资本支出
直接干碎4.3亿美金
折合人民币超过30亿
而且这还没算完
这多出来的9600张卡
在未来三年的生命周期里
每天的电费场地费维保费
这种OpEx运营支出
还要再吃掉你6.3亿美金
现在DeepSeek
用一行行直插硬件心脏的代码
没让你多买哪怕一根网线
就直接把这超过10亿美金的
成本黑洞给彻底填平了
在现在这种风险投资
捂紧钱袋子的寒冬里
省下这笔巨款
足以让一家独角兽企业
避免一次极其屈辱的流血融资
更残酷的现实是
就算你账上躺着几十亿美金
你买得到卡
你买得到电吗
在超算领域的真实商业博弈中
算力中心总监们面临的
终极困境
往往是有钱也买不到电
扩容一万张卡
你需要额外寻找15兆瓦以上的
稳定电力供应
特别是像美国一些区域的
PJM电网区域
AI算力大爆发早就把
电网容量彻底抽干了
容量价格暴涨了近10倍
如果你现在去申请一个
15兆瓦的新变电站
你要面临长达两年甚至三年的
漫长排队期
在AI模型几个月就迭代一次的
白热化竞争里
等两年才通电
无异于商业自杀
而DeepSeek的DualPath架构
本质上就是一座超级虚拟发电厂
它在不增加一千瓦时外部电力
不排放一丁点额外碳足迹的
物理足迹内
可以实现了产能的翻倍
讲到这里
我们再回过头来看看当下的
中美AI路线之争
你会发现一个极其讽刺
甚至让人拍案叫绝的历史分水岭
美国政府搞小院高墙
挥舞着制裁的大棒
掐断了顶级算力芯片的供应
华盛顿的决策者们傲慢地以为
只要掐住高端英伟达GPU集群
中国的AI就会因为算力枯竭
被永远锁死在上一代的技术水平
但他们万万没想到
这种极端的计算稀缺
反而成了一座极其残酷的
高压演化炉
硅谷的巨头们
深陷在大力出奇迹的路径依赖里
遇到内存墙
遇到I/O瓶颈
第一反应就是砸几百亿美金
去买更贵的Blackwell B200
买更粗的光模块
而中国工程师
在重重围堵之下
硬是被逼出了一套极其变态的
抠门统筹学
这种抠门统筹学
最致命的战略价值
就在于它极大降低了
模型对底层硬件的挑剔程度
赋予了国产芯片发展更多的可能性
就拿华为的昇腾芯片来说
客观承认
受限于制程工艺等
它在浮点算力和效率是
确实和英伟达存在较大差距
如果沿用那种暴力堆叠的路线
把几千上万亿参数的巨无霸模型
强行塞进国产集群
那推理延迟和成本
绝对是灾难性的
但是
DeepSeek通过MLA算法的降维压缩
MoE专家的精确制导
再加上今天咱们拆解的
DualPath流量乾坤大挪移
也可以把极其复杂的推理负载
逐渐平移到基于国产芯片的架构上
结果就是
在国产算力底座上
DeepSeek把输入Token的定价
疯狂压缩到了惊人的
每百万Token只要1块钱人民币
也就是区区0.14美元
而在大洋彼岸
那些完全依赖英伟达GPU
暴力堆算力的西方旗舰大模型
跑同等任务的综合成本
依然高达好几美元
这中间
是几十倍的恐怖差价
朋友们
物理规律和经济学常识
正在对盲目的算力崇拜
进行无情的侵蚀
黄仁勋正满世界拼命推销
他那些功耗上千瓦
价格几万美金的最新显卡
试图维系大力出奇迹的算力神话
而另一边
DeepSeek正在用极致的
抠门统筹学和系统工程
在算法底层
给这些患上了I/O饥渴症的
显卡刺客们悄悄地解毒
屏幕前的你觉得
中美AI的未来决胜点
究竟是光刻机里的纳米精度
还是这种榨干每一滴算力的
底层架构革命
欢迎在评论区留下你的看法
咱们一起好好讨论一下
最后别忘了点赞订阅哦
咱们下期再见