Transcription
哈喽大家好,欢迎来到明月三千里的频道。
昨天 DeepSeek 更新发布了两个新模型,分别是 DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。简单翻译一下,V3.2 是新一代主力模型,官网、App、API 全面接管。Speciale 则是专门为推理和竞赛打造的疯批版本,主攻高难数学、算法竞赛、复杂推理。官方在暗示,在很多纯推理指标上,已经可以和 GPT-5、Gemini 3 Pro 掰手腕,甚至部分项目反超。
很多朋友一看到这种说法,本能反应是:又来了,某某杀手。但这次的区别在于,DeepSeek 不是光靠嘴,是拿了成绩单、报了底牌、亮了价格,还顺手把权重开源扔上网,直接把整个牌桌的气压拉低了一大截。
我们先把这条新闻铺平讲清楚,再聊它背后几件更刺痛人的事。
第一,在算力被卡的情况下,中国怎么打出这张非对称战争的牌?
第二,这一波究竟是开源追上了闭源,还是在别的维度反而把差距拉得更大?
第三,对普通人、开发者、投资者来说,这到底是红利,还是一颗慢慢发作的炸弹?
先从大家最关心的那句开始:它到底有多强?
这次的主角其实是 Speciale。它不是日常陪你闲聊、写文案的那种模型,而是一个专门为认真思考生出来的怪物。它有一个特征:慢。你跟它说想一想,它真能在那儿想很久,首 token 慢到让你怀疑网络是不是断了。但一旦进入那种长思考状态,在数学证明、复杂逻辑、棘手 bug 定位、竞赛算法题这些场景,它给出来的东西往往非常硬。
怎么看它到底有多硬?最直观的就是考试成绩。现在全球有一批专门考数学怪才的竞赛,正常人连题目都看不懂的那种,平时给国家队选手当练手卷子用。Speciale 在这些考试里的得分,已经能跟 GPT-5、High Gemini 3 Pro 这种顶级模型掰手腕,甚至有的还略高一截。
再看编程这块,把世界级程序设计大赛的真题拿出来让它重做一遍,它能做出来的题目数量,基本已经跟拿金牌的人类队伍站在同一档位。你可以不把这当成是 AI 真人上场比赛,但有一点是铁打的:在这种纯靠推理、算逻辑的空间里,人类原来那点安全感,差不多已经没有了。
与此同时,DeepSeek 又把 V3.2 定位成能下地干活的工程师。它比 Speciale 稍微保守一点,但更均衡。速度可以接受,能做对话,能帮你写代码,能当 Agent 跑工具流程,也能在必要的时候切换到思考模式。对大部分用户来说,你每天接触到的就是这个版本。
更关键的是价格。按目前公开的定价区间算,同样一百万 token 的输入输出,V3.2 大概只要 GPT-5 的十分之一左右的费用。还有缓存折扣、本地部署这种组合拳。这在开发者视角里是什么概念?就是原来你算一笔账,用最强模型肉疼,用便宜模型又不甘心。现在突然多了一个又便宜又够强的选项。
你看,光是成绩单和价格表这两件事,就足够让 OpenAI 和 Google 心里咯噔一下。但今天这期视频,我不打算停在狂夸国产模型这个层面。我们还是那句话,吹不难,难的是把底层逻辑说清楚。真正值得聊的是三个问题:
第一,DeepSeek 这套东西,技术上到底厉害在哪儿?
第二,在算力和商业模式上,它动了谁的奶酪?
第三,这一波对监管和安全意味着什么?
先聊技术,但放心,我不会给你念论文,我用打工人的语言讲。
第一件事:MoE 混合专家。你可以脑补一个场景:公司里所有事都要 CEO 自己拍板,开会都开全员大会,效率肯定低,成本肯定爆。传统大模型就是这样,每个 token 都要全体参数一起上阵。DeepSeek 走的路是专家外包制。模型被拆成一堆不同专长的专家,有的擅长数学,有的擅长代码,有的擅长闲聊。每次只叫最相关的那几个出来干活。结果是,表面上看,这个模型有 6710 亿参数,是个超级巨无霸,但每次推理真正动起来的,大概只有三四百亿那一块。你家书架可以摆满几千本书,但你每次只翻最需要的那几本。这就是为什么,在推理能力很强的前提下,它的成本还能压住。
第二件事:MLA 多头潜在注意力。说白了,就是记笔记的方式不一样。传统 Transformer 要把之前所有说过的话,都以 KV Cache 的方式存起来,方便后面每一个词去回头看。上下文越长,显存越爆。MLA 干的是,我不再原样存所有细节,而是存一种更压缩、更抽象的高维笔记,等需要的时候再展开。你可以把它理解成,从三小时会议完整录音,变成高质量会议纪要,该记的东西一个不落,但重要的噪音全剪掉。这样一来,在同样显存里,它能撑起更长的上下文,也就能支持更长的思维链。对 Speciale 这种要长时间发呆思考的模式来说,这一步非常关键。
第三件事:DSA 自研稀疏注意力。传统注意力是全场打招呼,每来一个词,都要跟前面所有词建立联系,复杂度是平方级的。DSA 的思路是,别瞎聊,先搞一个快的索引器,粗扫全局,找出真正重要的那些位置。后面的大部分计算,只在这些关键节点和新词之间进行。就像你在读一份三百页的合同,不可能每一行都逐字精读,你会先把目录、关键条款、金额部分扫一遍,标记最可能出问题的十几页,精读只对这些。对长文本推理来说,DSA 这种聪明的偷懒,能在基本不掉质量的情况下,把算力消耗砍掉一半。
MoE、MLA、DSA 叠在一起,你就会看到一个有点魔幻的结果:DeepSeek-V3.2 在很多推理、编程、长上下文任务上,效果能摸到 GPT-5、Gemini 那条线,但训练成本被控制在几百万美元级别,远低于海外那些动辄上亿美元的怪物。注意,这不是说中国这边的算力不重要,而是说,在被限芯的前提下,工程和算法卷到了一个新的高度。在别人还在比谁卡多的时候,DeepSeek 已经开始比谁更会用破卡。
技术说完,我们看看算力账本。这几年,欧美监管喜欢拿一个指标说事:训练 FLOPs。欧盟 AI 法案甚至直接说,训练算力超过 10 的 25 次方,你自动被视为高风险基础模型,要接受一堆评估和限制。逻辑很简单:谁训练越猛,潜在能力越强,就越值得盯紧。但 DeepSeek 这一波,正好卡在一个很微妙的位置。从各种技术报告和侧面估算来看,V3 系列的预训练算力,大概在几乘以 10 的 24 次方,刚好在红线下面一截。可从能力上看,它在很多推理 benchmark 上,已经摸到了 GPT-4.5 甚至部分 GPT-5 那个段位。什么意思?就是你画了一条按身高管理危险人物的线,结果突然出现一帮一米八的小伙子,个个弹跳惊人,轻松摸到两米二的横梁。身高没超标,能力已经溢出来了。这对监管者来说,是一个很糟心的信号,原有那套用训练算力估计能力的框架,开始失效。
再往下看算力利用率。美国那边的玩法是 F1 车队,H100、H200、TPU v5、v7、Blackwell 一代一代堆。数据中心设计成超级工厂,单次训练就是上亿美元的投入。中国这边拿到的是打折版硬件,国产 GPU 单卡性能也差一截。表面上看,完全不是一个量级。DeepSeek 做的,是用工程把这块差距尽量抹平。比如重写通信算子,优化并行策略,把很多原本会浪费在等待同步上的算力抠回来。再叠加 MoE、稀疏注意力,把不得不用的那部分开销进一步压缩。你可以把它理解成,同样是一屋子 GPU,别人家的卡一半时间在闲着,你家被逼着每天加班到凌晨两点。
从商业视角看,这种算力效率差距非常要命。之前资本市场有一个默认假设:只有掌握了足够多高端 GPU 的巨头,才玩得起最前沿的大模型。别人要么去买服务,要么去做本地小模型,护城河很清晰。现在 DeepSeek 把这个故事打破了。你就算芯片被卡,预算被砍,只要愿意在工程上拼命,依旧有机会拿到相近的能力。这意味着什么?意味着闭源巨头多年来讲给市场听的那套“只有我们这种量级的玩家才能站在食物链顶端”的叙事,被迫要改词。
接下来,我们再从商业的角度来聊一聊。Google 这两年最重要的一步棋,其实不是发了一个多么牛的模型,而是把 Gemini 焊死在了自己所有的产品栈里:Android、Chrome、搜索、Gmail、YouTube、Workspace。它真正要守的是搜索广告和企业云,不是卖 API 那点钱。为了防守这个地盘,它干了一件焦土操作:把中低端模型价格打到接近成本。你想做一个 AI 功能?没关系,用 Gemini Flash,便宜、快、和我家生态高度适配。别的独立模型公司,想在这个价位带赚钱,几乎没戏。
OpenAI 这边的思路是闭源平台化。一边靠 GPT-4.5、GPT-5 收高溢价,卖企业版、卖 Teams、卖 API。另一边拼命往 AI 操作系统方向长,搞商店、搞 Agents、搞各种工具调用,希望开发者都在它的轨道上打转。这两套打法,有一个共同前提:开源模型永远差一截,只能做隐私场景、本地玩具,抢不走核心商业订单。
DeepSeek 上来干的事情,就是把这个前提撕开一道口子。一方面,它把高推理能力的模型权重,直接开源。意味着什么?意味着银行、券商、制造业、政企这种极度敏感的行业,有了一个技术上够强、法律上可控的国产选项,可以在本地、在国内云上搭自己的大脑,不用冒数据出境的风险。另一方面,它在 API 和 C 端产品上,打的是极致性价比。粗暴一点比喻,GPT-5 更像奢侈品牌旗舰店,体验好但贵。DeepSeek 更像同款质感的工厂店,不讲究装修,但货真价实。对于资金紧张的创业公司、个人开发者、海外用户来说,这个选择非常有吸引力。
这种组合拳的结果是什么?对闭源巨头来说,压力不只是多了一个竞争对手,而是定价权开始松动。以前你可以理直气壮收高价,因为大家觉得反正开源差着一大截。现在如果开源在推理这条线上追平了,你再想保持原来的定价,就必须拿出别的维度的说服力:多模态更强?生态更闭环?企业服务更稳?
也正是在这个点上,我们要冷静地看另一面。差距在缩小的,是智商。差距可能在拉大的,是世界和基础设施。多模态和真实世界建模这条线,DeepSeek 目前还是典型的文本大脑外挂视觉的架构,主要靠外接视觉模型和工具来弥补感知。而 Gemini、OpenAI 这类闭源怪物,从一开始就是在视频、图片、音频、交互数据里泡大的,对物理世界、对人类行为模式的掌握,是一种在场的经验。
再看基础设施。谷歌、微软、亚马逊在做的是十几吉瓦级别的数据中心规划,是从芯片、电力、网络、冷却一路打到底的全栈工程。这种基础设施铺开后,边际优势是可怕的。你可以更频繁地重训,可以更快地把新数据吃进去,可以更低成本地服务全球用户。在这一层,DeepSeek 这种工程极限玩家,其实是在用牺牲舒适度的方式弥补差距。别人是豪宅里装中央空调,你是老小区里换了窗户加两台风扇,靠细致施工把体感温度拉到差不多。你不能因为天气一凉,就说看,大家体感都一样。真正决定未来十年格局的,还是谁掌握了那套从地基到屋顶的基础设施。
说到这儿,我们再从监管和安全这条线聊一聊。对欧盟来说,DeepSeek 是一个规则边缘案例。你按训练算力去划线,它在下面;你按能力去定级,它在上面。于是讨论开始从“算力门槛多少?训练花了多少钱?”转向“模型在特定能力维度上的极限是什么?能不能自动写 exploit?能不能自主演化 agent?”
对美国来说,焦虑更明显。此前的战略是两条腿走路:一条是管芯片,通过出口管制把高端 GPU 卡在自己掌控范围内;另一条是搞自家生态,确保世界上最好用的闭源模型都在美国公司手里。DeepSeek 这种在残血硬件上卷出高能力的模型,等于告诉他们,光管芯片已经不够了,得开始想,要不要管权重?要不要管模型能力?这就是为什么最近你会看到越来越多关于模型权重出口管制、高能力开源模型风险的讨论。闭源可以调 API、加访问限制、做审计。开源一旦扔出去,就变成了谁有 GPU 谁都能玩的工具。
你可以说,这是技术的民主化。你也必须承认,这是风险的民主化。中国这边的监管逻辑,则是典型的双轨制。对内,要严格做内容安全、算法备案、敏感话题过滤。对外,在合规框架内,尽可能开放能力,让模型在全球开发者圈子里形成影响力。很多西方安全专家对这种双面性非常敏感,会用“特洛伊木马”这种词去形容。但站在企业的角度,如果你既要活在国内监管环境里,又想在全球市场上活下去,这种双轨几乎是唯一能走的路。
最后,我们落回到你我最关心的那一层:这一切,对普通人、开发者、投资者,各意味着什么?
对普通用户来说,这是一个智力红利期。你用到的 AI 助手,会越来越聪明,价格会越来越低,本地部署的门槛会一步步被打穿。但是,同一套能力,也会被不那么善良的人利用。未来几年,你在社交媒体上、在邮箱里、在即时通讯里遇到的钓鱼、诈骗、操控,逻辑会更顺,故事会更完整,情感拿捏会更精准。很大一部分就是这些高推理模型在背后写剧本。
对开发者和企业来说,真正的考题不是选哪一家,而是怎么搭一个可以“换心脏”的身体。也就是,你的系统架构是不是足够解耦?可以同时接入闭源和开源?同时适配国内和海外?同时在成本、性能、安全之间做动态平衡?能用 DeepSeek 的地方,就别傻乎乎全用最贵的。必须上 GPT-5、Gemini 的地方,也别为了省几块钱,搞得体验一塌糊涂。决胜点在于,你能不能把这些模型当成零件,而不是当成宗教信仰。
对投资者来说,有两句扎心话:第一,纯讲我们有更聪明的模型的公司,未来会越来越难讲故事。第二,真正值得长期盯着的,是那些掌握算力基础设施和行业深度整合的玩家。模型本身,会越来越像操作系统里的内核版本号,对专家重要,对普通用户重要但不至于决定一切。
DeepSeek 这波的意义,在我看来有点像当年安卓对 iOS。它未必马上取代谁,但它把一个原来被少数巨头控制的能力,下放给了更广泛的群体。代价是混乱、是风险、是监管的滞后。收益是创新的爆炸、是更多边缘玩家突然有了一次上桌的机会。
那么,面对这样一个既强大又充满争议,既是国产之光,又是特洛伊木马的 DeepSeek,你觉得它是会成为那个打破垄断的普罗米修斯,还是会像流星一样,在巨头的围剿中昙花一现?国产 AI 接下来的路,到底是该继续搞大模型,还是像 DeepSeek 这样死磕高效率?欢迎在评论区留言讨论。
好了,今天的话题就先聊到这里,记得点赞、关注、热推,咱们下期再见。