Transcription
请想象一下,人工智能领域无可争议的领导者,那个被所有人模仿、被所有人畏惧的领导者,不再是美国人。再想象一下,这位新领导者没有将他的技术锁起来,而是拿出价值数十亿美元的服务器,免费提供给所有人。大约两年前,[音乐] 没人知道他的名字,Jeep Sick。如今,这股力量正在撼动整个行业的根基。怎么做到的?通过实现不可能:以极低的预算,创造出能与巨头匹敌的人工智能。这是一种无法用金钱购买,但可以共享的力量。[音乐] 其后果是惊人的。这是第一次,一家初创公司,一所大学实验室,[音乐] 甚至一个国家,都能掌握与数字帝国相同的技术武器,无需订阅,无需依赖他们的服务器,甚至无需拥有他们的资源。[音乐] 这不是一次简单的更新。这不仅仅是一个新的挑战者,[音乐] 这是一场规则的改变,可能是自互联网诞生以来最重大的变革。那么,迫切的问题来了。这个几乎从零开始的团队,是如何在某些领域追赶并超越了几十年的积累和海量的资金的?他们发现了什么别人没有看到的秘密?最重要的是,一个完全出乎意料的未来,现在正在我们眼前被书写。欢迎。今天,我们将深入了解 Deepsic 的故事,不仅仅是它的性能或代码,更是它的灵魂,孕育它的疯狂愿景,以及它并非终点,而是更大起点——3.2 版本。请坐好,您即将发现的内容将重新定义您对人工智能竞赛的认知。我们开始吧。现代人工智能的历史在 2017 年发生了转折。那一年,由 Ashish Vaswini 等人领导的 Google Brain 实验室团队发表了一篇题为“Attention is all you need”的研究论文。当时没人知道,这 11 页纸奠定了当前革命的基础。这是机器第一次能够通过观察词语之间的关系,而不是它们的简单顺序来处理语言。这是 Transformer 架构的诞生,也是我们今天几乎所有生成式 AI 的核心。从那时起,一切都加速了。[音乐] 2018 年,Open AI 发布了 GPT1,次年发布了 GPT2,其中一部分模型因担心恶意滥用而被列为机密。请记住,当时 GPT 和 Open AI 被认为是免费开放的,尤其侧重于研究。2020 年,GPT3 确立了美国在全球舞台上的主导地位。2022 年,TGPT 成为我们今天所知的全球现象。而在 2023 年,TJPT4 的能力达到了如此之高,以至于其训练成本估计高达 1 亿美元。这笔资金很大程度上得益于 Open AI 和微软之间的战略联盟。当西方庆祝其惊人的进步时,一件至关重要的事情几乎被忽视了:其他人无法跟上。这些模型需要庞大的基础设施,数千个 Nvidia GPU,兆瓦级的电力,以及数百甚至数千名专业工程师。人工智能因此变成了一个封闭的俱乐部,只有少数资金雄厚的科技巨头才能制定未来准入规则。很快,这种依赖性开始引起担忧。欧盟在 2023 年提到了美国生成式 AI 带来的战略依赖风险。世界各地的政府、企业和研究人员都意识到,他们只能作为租户才能访问 AI。他们被提供了一个接口,一个 API,但从未获得技术的访问密钥。他们必须使用为美国语言、经济和文化现实设计的系统,而无法真正适应自己的情况。一场无声的裂痕由此开始。未来存在,但需要授权。它在进步,但主要是为了那些有能力引导其方向的人。它在建设,但缺乏对世界需求的公平代表。总而言之,要么我们根据美国的现实来描绘我们的未来,要么我们根据美国的现实来描绘我们的未来。是的,真的没有其他选择。正是在这个裂缝中,一个意想不到的答案出现了,一个简单得近乎挑衅的想法。如果人工智能应该服务于全人类,那么它就不可能只属于少数几家公司。这个想法并非诞生于硅谷。它来自中国,名为 Gypsic。但要理解它为何不同,我们首先需要理解它所挑战的体系。Jeepsic 的出现[音乐] 不仅让科技界感到惊讶,它还揭示了人工智能设计方式中一个早已存在的裂痕。自 2017 年以来,美国一直主导着该领域,并有着非常明确的愿景:AI 是一项战略资源。Open AI、Google、Anthropic 和 Meta 只分享他们选择分享的内容。模型是封闭的,数据是保密的,访问是通过付费 API 和远程服务器控制的。在这种系统中,用户永远无法真正拥有工具。他们租用一种智能,并被要求信任它,却从未能理解其运作方式或验证内部发生的事情。中国也发展了自己的技术巨头。百度有文心一言,阿里巴巴有通义千问,华为有盘古,腾讯有混元。这些强大的模型能够支持超过十亿用户的需求,并优化整个经济部门。但这些创新,尽管规模宏大,仍然被整合在封闭和集中的生态系统中。它们的目标首先是工业性的:支持增长,提高生产力,巩固技术主权。AI 为国家服务,不一定为世界服务。这正是发生根本性改变的地方。与锁住技术的美国大公司不同,与将技术保留给自己市场的中国巨头不同,Jeepsic 做出了一个激进的选择:比其他所有行业参与者都更加开放,提供开发自己 AI 所需的权重、架构和工具。塞内加尔的一所大学可以将其适配到当地语言。一家巴西的中小企业可以在自己的服务器上安装它,而无需通过他人的基础设施。一位法国研究人员可以修改算法以用于自己的研究。这是一种不依赖任何商业或国家力量的 AI。GIFS 不是当前竞赛的替代品。它是一条新路。当西方出售,中国发展工业力量时,Dieps 直接向人类提出了一个问题:如果 AI 的未来属于那些自己构建它的人呢?再一次,要理解这种不同的愿景从何而来,我们需要回到 Gipsic 的起源,以及中国支持如此一项倡议的深层原因。Jeepic 的出现并非偶然。它恰好发生在中国面临其历史上最大的技术挑战之一的时候。2022 年 10 月,美国实施了一系列制裁,旨在阻止中国 AI 行业获取最强大的 Nvidia GPU,如 H100 和 B1,这些 GPU 对于训练新一代模型至关重要。一夜之间,中国意识到,仅仅依靠进口外国技术,它将无法跟上这场竞赛。必须发明另一条道路。我不知道您是否意识到,但这些美国对中国的制裁将他们逼入了绝境,并且通常没有摧毁他们,反而促使他们重新发明自己。继续。正是在这种背景下,2023 年,Hanzu Liang Wengfeng 和一小群在金融应用领域开发复杂 AI 模型方面的专家决定创立 Deepsik AI。他们拥有所谓的“反硅谷”文化,专注于纯粹的研究和吸引年轻人才。因为通常不为人知的是,公司其余团队的大部分成员是来自中国顶尖大学的年轻毕业生,他们在大型科技公司缺乏工作经验。这是一种旨在鼓励创新思维的战略。内部文化是水平化的,以研究为导向,促进思想的向上流动,并采取以通用人工智能的基础和长期研究为中心的做法,而不是立即商业化。他们将共同迎接一项挑战:在不依赖西方基础设施的情况下构建最先进的 AI。他们的结论是无情的。西方正在构建越来越大、越来越昂贵、越来越耗能的模型。例如,GPT4 的训练预算超过 1 亿美元。只有微软、谷歌或亚马逊支持的巨头才能获得这种计算能力。这仅仅是训练成本,而不是包括研发、数据整理和硬件采购在内的整个基础设施成本。中国无法在蛮力方面与之竞争。因此,它必须在效率方面进行创新。Devik 因此采取了激进的优化理念,无论是模型基础设施还是训练方法。2023 年底内部开发的第一个模型 V1 作为概念验证。其训练预算和计算能力远低于西方标准,估计略低于 30 万美元,而 GPT4 为 1 亿美元,并且是在旧的 Nvidia 芯片上完成的,这表明即使没有过度设计的基础设施,也可以出现高性能的大型模型。尽管 V1 未向公众发布,但它验证了诸如高级剪枝、数据优化和在功能较弱但经过优化的 GPU 集群上积极使用混合精度等关键技术。这个基础成为了一个试验场。他们进行实验,改进训练工程,并为此做好准备,以一种不依赖蛮力,而是依赖一丝不苟的算法效率的方式进行升级。2024 年,Deeps 2 问世,一切都变了。该模型公开了,权重是可用的,开源社区开始接管。这一举动不仅是技术上的,更是政治上的,甚至是革命性的。这是中国 AI 第一次不仅可以在全球范围内使用,而且可以被修改、重新训练,并独立于美国服务器。据说 V2 的训练资源是同等性能的美国模型的十分之一。这一说法立即引起了分布式计算和内存优化领域研究人员的注意。与此同时,中国正在加速对创新的支持。北京向该行业注入了巨额投资。数十亿美元专门用于人工智能技术和 Nvidia GPU 的硬件替代品。Jeipsic 因此成为一个象征,一个不依赖力量而是依赖精度的智能的象征。当世界对 GPT4 感到着迷并已准备好 GPT5 时,它却走上了不同的道路。[音乐] 它不试图追赶美国。它改变了游戏规则。它没有构建一个能源消耗巨大、每次推理都需要数千个 H1 GPU 的巨头,而是设计了一个动态激活模型——[音乐] MOE,即混合专家模型,其中模型参数的一小部分,[音乐] 通常不到 20%,被激活来处理给定的请求。这种[音乐] 极具成本效益的架构与[音乐] 路由器训练和负载平衡等创新训练技术相结合,能够以无法比拟的低能耗和计算成本达到与[音乐] 大型密集模型相当的性能。游戏不再是扩大模型,而是使其在资源分配方面更智能。它开辟了一条每项计算都至关重要的道路。一条每个人都可以走的道路。当世界在庆祝 GPT 时,安祖的一支小团队在幕后工作,坚信存在另一条道路。他们证明了每一瓦节省的能源,每一次优化的计算都是对不可能的胜利。而那时,没有人理解,但它正在准备一次正面攻击。一次名为 3.2 的攻击。从 V3 开始,它不再仅仅追求存在。它追求以更少的资源,但更强的智能来主导。而这正是将令整个行业感到恐惧的。真正的到来是在 2025 年底。9 月 29 日,Jeepsik 首先发布了基于 V3.1 1 的实验性版本 deepsic 3.2 EXP,并引入了一项关键创新:leck Spars attention DSA,一种稀疏注意力机制,旨在处理非常长的上下文,同时降低计算成本。几周后,即 2025 年 12 月初,完整的公共版本 Gypsic V3.2 2 及其高端变体 3.2 special 正式发布。立即引起关注的不仅是性能,还有其定位。Jeepsick 声称其 3.2 模型基于与 3 版本相同的理念:混合专家架构结合了 MLA,即多头潜在注意力等技术。让我们稍微解释一下这两个术语的含义。混合专家架构使用多个专门的子网络,即专家,以及一个控制网络或路由器来动态选择处理输入的专家,从而使大型模型能够通过仅激活一部分参数来高效地适应任务。这与使用所有参数的密集模型不同,后者具有更高的容量、更快的训练速度和更好的性能,例如在 LLM,大型语言模型方面。现在,MLA 是一项由 Deepsic 专利的革命性架构创新,它解决了当前 AI 的最大问题:键值缓存的巨大内存消耗。与存储每个 token 的海量数据的传统模型不同,MLA 使用低秩压缩将键和值压缩成一个微小的潜在向量,从而将内存使用量减少 93%。这使得模型能够以惊人的速度处理更长的上下文窗口,而不会牺牲智能,从而为您提供卓越的性能和更长的 AI 对话。这两种理念已在 Jeepsic [音乐] 3 的技术报告中详细说明。该报告描述了一个拥有 6710 亿参数的模型,其中每个 token 仅激活 370 亿参数。在 14.8 万亿个 token 上训练,总训练时间估计为 2.78 亿小时,使用 H800 GPU。这个数字已经远远低于美国大型模型公布的数字。V3.2 通过继承和扩展这些理念,延续了这种激进的优化。仅激活必要的专家。节省每一瓦,每一 GPE。每一次通过。因此,在纸面上,Gypsy 3.2 的目标不是成为世界上最大的模型,而是最高效的模型之一。正是这种效率使其达到了不可避免的比较水平。在其自身的宣传中,该公司强调了在推理、数学和代码生成方面的高水平性能。它基于一个旨在降低推理成本并允许上下文长度高达 128000 token 的架构。Gypsy 3.2 2 及其专业变体的模型性能现在已与 GPT5 和 Gini 3 Pro 等全球基准相媲美。无论是来自公开基准测试、独立技术分析还是 Gypsic 自身的宣传,评估都指向一个共同的结论:在复杂的推理、高级数学或代码纠错等要求苛刻的任务上,这些模型达到了,有时甚至超越了最新的专有解决方案。在数学奥林匹克数据集上发布的得分将 Jeeps 3.2 的专业版本置于金牌类别,其水平与行业领导者相当。这项技术壮举通过一项激进的战略选择而得到放大:以 MIT 类型开放许可发布,允许对模型进行无限制的使用和修改。这与美国巨头的封闭经济模式直接形成对比。一种基于效率和开放原则构建的新兴力量已经出现,并正在残酷地扰乱人工智能既定的等级制度。这三个因素的结合使得。性能处于与最先进的西方模型相同的联盟的顶峰。计算效率依赖于为中国市场设计的 H800 硬件以及激进的优化技术,这延续了 R1 模型以仅 30 万美元成本训练的方法,最重要的是,开放的选择。Dipsic 3.2 和 3.2 special 被提供为开放权重模型,权重可用且许可宽松。而 GPT5、G Mini 3 Pro 或 Cloud 仍然由其发布者严格控制。具体来说,这意味着一所大学、一家初创公司甚至一个小国理论上都可以拥有一个接近前沿水平的 AI,将其安装在自己的服务器上,适配到当地语言、法律、经济,而无需依赖美国 API 或外国云。而 GPT5 和 GMini 3 Pro 仍然是服务,Jeepsic 成为一种技术原材料。它不再仅仅是一个被消费的产品,而是一个可以构建的基础。因此,根本性的突破不仅仅在于基准测试数字,尽管它们令人印象深刻,而在于其传播模型。当传统领导者[音乐] 押注稀缺性时,它押注的是受控的丰富性。当其他人强制访问时,它提供复制。信息很明确:您不再需要租用人工智能。您可以开始拥有它。这是第一次,一个被定位为 GPT5、Gemini 或 Claude 的竞争对手的模型,不仅仅是力量的展示,更是一种参与的邀请。从那时起,真正的问题不再是 Deepsic 的力量有多大,而是谁会抓住它,以及用来做什么?因为这是没有人预料到的。通过使 AI 易于访问,Jeepsick 将引发比单纯的技术革命更强大的东西。Deepsic 的力量不仅在于其技术性能,更主要在于其可访问性。与 GPT4 或 Gemini 1.5 等封闭模型不同,其核心是不可见的且无法访问的,divic 以开源方式提供其权重、代码和文档。将权重视为模型在训练过程中积累的知识的数值表示。它们构成了决定 AI 如何处理信息以产生结果的关键参数。这意味着任何开发人员、研究人员或学生都可以修改模型,根据自己的需求进行调整,甚至重新训练它,而无需外国跨国公司的许可。事实证明,一个生态系统已经开始出现。在 GitHub 上,这是开源项目诞生的首选网站,Deepsic 的许多项目每周都会出现。本地运行的代码助手、针对中小企业的专用聊天机器人、适配中文方言的翻译工具,以及文档分析系统。这是第一次,高性能人工智能不再需要昂贵的订阅,也不需要不成比例的计算架构。以下是一些具体案例。2025 年,非洲的 AI 开发人员和研究机构迅速集成了 Dieck 的开源模型,特别是 Jeepsic V3 和 R1,以摆脱西方专有系统的昂贵成本和基础设施障碍。借助这些开放权重,来自卢旺达 CMU Africa、乌干达 Makerere 大学和肯尼亚内罗毕大学等中心的 शोध者 正在针对本地化数据集微调模型,以支持斯瓦希里语、科萨语和阿姆哈拉语等语言。这种轻量级的方法对于内罗毕的 Kala 等初创公司以及 NCBA Group 等金融机构尤其重要,它们利用了其效率。构建可持续的本地货币经济模型,每百万个输入 token 的成本仅为 0.27 美元。此外,模型的低能耗使其能够部署在本地设备上,从而满足非洲的资源限制,促进农业和医疗保健的进步,同时通过本地处理确保本地数据主权。中国科技公司也看到了战略机遇。阿里巴巴和腾讯的云服务正逐步整合对 Deepsic 模型的兼容性,使行业能够测试实际应用:自动化客户关系、物流优化、业务对话代理。部署大规模部署的道路已经打开,尤其是在受数据主权限制的行业。学术界也正在拥抱这个工具。Tingua NLP Group 或 FDAN LAAB 等实验室已经将其用作研究基础,开发医学、法律或机器人变体。过去,大学只能使用美国 API,现在它们拥有了一个可以自行控制的模型。因此,尽管 DIFC 3.2 在所有领域尚未赶上美国巨头,但它已经引起了重大突破。先进的人工智能不再仅限于大型科技公司。它已成为一个国家、一个社区甚至一个个人都可以拥有的工具。这也许比其基准测试更能体现 Jeepsck 的革命性。但在这令人印象深刻的崛起背后,它从未有过轻松的道路。因为要挑战巨头,首先必须在阴影中生存。要理解 Jeepsic 的成功,我们需要看看聚光灯下的事情。想象一下,用性能较弱的显卡,极低的预算,以及全世界的怀疑来挑战巨头,而这正是他们的超能力。与建立在无限预算和庞大基础设施上的美国公司不同,Dieps 在持续的限制区域中成长。从一开始,公司就遇到了第一个障碍:缺乏对市场上最先进 GPU 的访问。美国制裁限制了 Nvidia A1、H100 和 B100 等显卡向中国的出口,这些显卡被认为是训练现代大型语言模型所必需的。而 Open AI 可以在一个训练阶段投入超过 1 亿美元,Jeepsic 却不得不以少得多的资金完成同样的事情。这种强制限制因此成为创新的驱动力。工程师们优化每一次计算,降低能源成本,发明一种不依赖于过度,而是依赖于效率的 AI。除了硬件限制,还有严格的监管框架。中国对传播生成式 AI 的公司施加了直接责任。控制滥用,调整当地社会规范,过滤敏感内容。对 Poursic 而言,这意味着要快速前进,但绝不能冒险。每一次改进都必须与持续的合规性兼容,这会减缓某些实验,并使访问多样化数据源变得复杂。然后是国际压力。长期以来,Jeepsik 被视为中国 AI。而且,远远落后于美国基准。每一次公告都会被仔细审查、比较、质疑。信誉从未获得。它必须通过一次又一次的基准测试来赢得。因此,该公司在持续的怀疑气氛中前进,失败只会加强美国优越论的叙事。面对这种意想不到的崛起,西方世界做出了回应。MTA 在其使用许可中进一步保护 Lama。Google 锁定了 Gemini 和 Nvidia 的某些功能访问权限,同时在官方保持中立的情况下,努力维护其美国最大客户的优先权。未公开的信息是明确的:可以有竞争,但不能以重新分配全球 AI 平衡为代价。最终,sig 不是在理想环境下产生的,而是恰恰相反。它诞生于匮乏而非舒适,诞生于制裁而非巨额补贴的环境中。一种必须证明可以通过非蛮力方式进行创新的 AI。也许正是因为如此,它才成功了,因为障碍变成了引擎,限制变成了效率的起点。但如果这些限制塑造了 Dips 的技术和战略稳健性,那么其崛起的真正影响现在可以通过其对整个全球 AI 生态系统的变革力量来衡量。那么,Dipsy 具体改变了 AI 的未来以及我们所有人的未来?[音乐] 首先,它改变了访问人工智能的本质。到目前为止,开发一个高性能模型需要巨额资源,数千个 GPE,九位数的预算和强大的行业合作伙伴关系。有了 Jeepsy 3.2,这种障碍正在瓦解。小型企业、大学研究中心甚至独立开发者都可以拥有一个高级 AI,对其进行修改、重新训练并集成到他们的项目中。这是一种技术民主化,让人想起 2000 年代开源 Web 的出现。从一个仅限于巨头的生态系统,我们进入了一个对所有人开放的游乐场。其次,一个可信的中国替代品的出现正在重塑全球竞争的步伐。Open AI、Google 和 Meta 不能再满足于一种垄断式的舒适。它们现在有了一个真正的竞争对手,它发展迅速,成本更低,并吸引了一个热情的国际社区。这种压力加速了前所未有的步伐。更多的创新,更多的迭代,更多的专业模型,而不仅仅是通用模型。这不再是一场线性竞赛,而是一场永无止境的冲刺。美国独自制定节奏的时代即将结束。现在,硅谷必须考虑到北京。最后,对于普通用户来说,这种转变比看起来更具体。开源 AI 使小型企业能够创建适合其现实或他们希望为客户解决的问题的工具。例如,学校里的助手,当地医院的自动化诊断。被科技巨头忽视的语言的语言模型,自动化行政工作以减少繁琐的任务。Dipsic 带来的不仅仅是一个替代品,更是每个人塑造符合自身情况的人工智能的能力。一种适应人类及其环境的人工智能,而不是反之。有了 deepsic,一件前所未有的事情发生了。多年来,人工智能似乎属于少数几家有能力投资并为世界其他地区设定节奏的公司。我们将通用人工智能视为一场遥远的表演,一种只属于硅谷秘密实验室的魔法。现在,另一种声音出现了。一种知识成为共享工具的声音,一种创新不仅取决于财务特权,还取决于每个人的想象力。重听每个人的想象力。[音乐] Jeepsic 3.2 不仅仅是一项技术壮举。它证明了 AI 可以成为一种真正普遍的工具,也是中国在 2017 年启动的“新一代人工智能发展计划”的具体成果,旨在通过开源和技术自主性使中国成为 2030 年全球人工智能领导者,而主要大国却在争夺第一名。一个问题变得更加重要:人类将如何利用这种现在触手可及的智能?更快地学习,更好地创造,想象出在封闭实验室中从未出现过的应用,或者仅仅是用更强大的力量重蹈过去的错误。未来没有写在任何机器里。它写在我们的选择中,写在我们的警惕中,尤其写在我们让 AI 成为一种机会,而不是威胁的雄心壮志中。一个确定性是:[音乐] 人工智能将不再仅限于少数人。它已经进入了一个新时代,一个每个人都可以成为其发展参与者的新时代。如果这次未来真正属于所有人,LIA 刚刚找到了它的独立宣言,而历史的其余部分,则由我们来书写。这个故事现在也属于您。您是第一批理解 LIA 改变了面貌的人之一。如果这种开放和可访问的人工智能的愿景与您产生共鸣,您想用这股新的力量开发什么具体应用?如果这种愿景激励了您,请订阅以不错过这个新篇章。如果您和我一样相信最好的技术是我们可以分享的技术,请点赞。感谢您一直看到最后,一如既往的愉快,我们很快就会再次见面,进行一次新的技术探索。Vid Non. [音乐] [音乐] [音乐]