📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

算力被卡脖子?DeepSeek发布“光学压缩”,成本再暴降90%,用算法冲破英伟达封锁!

明月三千里23:19

Transcription

哈喽,大家好!欢迎来到明月三千里频道。

今天是10月20日,DeepSeek团队又发布了一项研究,通过光学映射来压缩长上下文的新方法,并同步发表了这篇研究论文。DeepSeek-OCR Contexts Optical Compression,直译过来就是“上下文光学压缩”。这个名字听起来有点拗口,其实,它背后的核心,就是如何用更少的算力处理更多的信息的一种研究。

传统的OCR,也就是光学字符识别技术,只是让机器识字。它致力于将扫描文档、PDF文件或图像中的印刷或手写字符,转换成可编辑的、机器可读的文本格式。但是,DeepSeek-OCR做的,却是让AI像人一样看图理解。它不再把一份长文本视为一串离散的、需要逐一处理的字符Token,而是将其压缩成一张信息浓缩图。

你可以想象一下,你有一篇长达几万字的报告,传统的AI需要一个字一个字地读,对应一个又一个离散的文本Token,计算量巨大。而DeepSeek的做法呢?它先把这篇报告拍成一张高分辨率的图片,然后让AI直接看这张图,从视觉模态中提取语义和结构。这听起来是不是有点反直觉?但DeepSeek的实验结果证明,这种方式能实现惊人的效率提升。在保证高准确率的前提下,它可以把文本信息压缩到原来的十分之一,甚至二十分之一。

这就像什么?就像你以前阅读一份文件,需要把所有文字从头到尾仔细输入电脑。而现在,你只需要看一眼截图,就能抓取到所有的核心信息。对于大模型的世界来说,这种能力,就是在算力受限的瓶颈上砸开了一个算法突破口。

为什么说这个突破,对于今天的中国尤其重要?这就要提到我们当前的大背景了。大家都清楚,由于众所周知的原因,中国AI企业不再能够大规模采购最先进的英伟达GPU,比如A100、H100。我们正处在一个算力国产化的大潮中。大量的计算任务需要转向华为昇腾、寒武纪、壁仞、沐曦等国产芯片和自研算力中心。国产算力正在快速崛起,这是我们自主可控的关键。

但同时,我们也面临挑战。我们必须在有限的计算资源和显存下,完成以前需要顶配硬件才能完成的任务。因此,硬堆硬件已经不是最优解,甚至不是可行解。DeepSeek-OCR这项研究,就是在告诉我们,面对硬件上的限制,我们可以通过极致的算法和架构创新来突围。它为中国AI提供了一条现实、高效、自主可控的降本增效路线。

那么,DeepSeek是如何实现这种“看图速读”的魔法的?它背后的“光学上下文压缩”原理,到底是什么?我们接下来,就深入聊聊这篇论文。

大模型的成功,是建立在海量算力基础上的。它们处理长文本时,面临的核心挑战是固有的二次方计算复杂度。当输入文本序列长度增加一倍时,所需的计算资源会以平方级增长。这意味着处理超长上下文,显存和计算很快就会达到极限。对于我们中国AI行业来说,这个问题更迫切。我们需要让AI在有限的国产GPU上,学会更聪明地使用显存。

所以,DeepSeek的思路是:与其堆硬件,不如优化数据结构。既然文本Token的表示效率太低,我们就换一个高效率的压缩媒介——视觉模态。这项研究最创新的地方,就在于它提出了一个全新的范式:上下文光学压缩。它的逻辑非常直接:将需要处理的长文本,先渲染成一张高分辨率的图像,然后让模型从这张图像中提取核心语义。

为什么图像能压缩文本呢?传统文本Token是离散的,基于字词单元的,表达信息效率相对较低。而一张文档图片,经过视觉编码器处理后,可以被转化为数量少得多的视觉Token。视觉Token是连续值向量,可以在每个Token中承载比离散文本Token显著更多的比特信息,处于语义空间中,因此压缩效率极高。这正是“一张图片胜过千言万语”的信息论基础。

DeepSeek-OCR的架构,由两个核心组件组成。首先是负责执行上下文光学压缩的核心引擎——DeepEncoder。其次是负责从压缩后的视觉Token中解码,恢复出文本内容的解码器——DeepSeek3B-MoE-A570M。我们重点来了解一下DeepEncoder,它就是实现节俭的核心所在。

为了高效压缩,DeepEncoder必须具备几个能力:能处理高分辨率图像,同时在高分辨率下保持低激活内存,并且能输出数量极少的视觉Token。DeepEncoder采用了巧妙的串联式设计,就像一个高效的流水线。

首先,它使用像SAM-base这样的组件,主要通过窗口注意力机制。这一步负责对高分辨率输入进行局部感知,比如将1024x1024的图像分割成大量的Patch,比如4096个。由于是局部处理,即使Token数量大,计算激活内存也是可接受的,非常省显存。

接着,就是魔法发生的地方了。在这些局部特征准备进入全局理解模块之前,DeepEncoder通过一个2层的卷积模块,对其进行16倍的下采样压缩。原本的4096个Patch Token,瞬间被锐减到了256个Token。

最后,这少量压缩后的Token,也就是256个,再进入CLIP-large组件,通过密集的全局注意力机制,来提取视觉知识和全局语义。由于Token数量已经极少,全局注意力的计算开销也变得可控,实现了内存和Token的双重压缩。

这个过程,用大白话讲,就是AI用局部视野快速扫描文档中的所有文字,然后对这些文字信息进行高度浓缩(16倍压缩),最后用全局的智慧,理解这些浓缩后的信息点之间的关系和整体含义。

搞清楚了核心技术,我们来看看效果到底怎么样。DeepSeek的量化分析结果是相当震撼的。研究人员测试了文本Token数量与视觉Token数量的比例,也就是压缩比。他们发现:

第一,在压缩比小于10倍时,模型的OCR解码精度可以达到惊人的97%到98.5%以上。这被称为“近乎无损的OCR压缩”。

第二,即使在超高的20倍压缩比下,准确率仍然能够保留约60%。这意味着什么?这就像是在算力极其紧张时,AI用10%的能量完成了原本100%的工作。

这个成果,不仅是学术上的新方向。对于正处在算力国产化转折点的中国AI行业来说,DeepSeek的成果证明,通过架构创新和算法优化,可以在不依赖外部先进硬件的情况下,找到一条现实可行并且具备高天花板的降本增效路线。它打破了堆砌硬件的传统思路,转向了效率的极致提升。

有了这个突破性的基础,我们现在就来聊聊DeepSeek-OCR带来的哪些影响和亮点。

DeepSeek-OCR的价值,远超更快、更准的OCR本身。它代表着中国AI在新的算力环境下,对效率和架构哲学的全新思考。

首先,我们看到的是一场“节能革命”,让AI更省算力。长期以来,AI发展遵循“大力出奇迹”的思路,也就是通过堆砌更多的参数和更强的硬件来获得性能飞跃。但是,当硬件供给受限时,DeepSeek-OCR的出现,以实际的实验和架构创新,证明了不用英伟达最顶级的硬件,也能通过算法架构的创新,实现效率和性能的提升。它与中国当前追求的“算力国产化”、“自主可控”的方向高度契合。

大家知道,大模型计算消耗主要发生在处理Token序列时。DeepSeek的上下文光学压缩技术,相当于提供了一个算力乘数。它极大地减少了需要喂给解码器的Token数量。DeepEncoder在进入大模型解码前,就已经将文本信息完成了7倍到20倍的瘦身。这意味着,在使用像华为昇腾、寒武纪、壁仞、沐曦等国产芯片时,DeepSeek的算法能让这些国产GPU在处理这些瘦身后的数据流时,以更高的效率完成推理任务,让有限的国产算力集群发挥出更大的价值。

而且,它的生产力非常惊人。在实际生产中,DeepSeek-OCR展现出惊人效率。在单块A100-40G显卡上,每天就能生成超过20万页的大模型视觉语言模型训练数据。如果将这个效率部署到大型国产算力中心,它能以极低的成本,快速消化海量的历史文档和报告,为新的国产大模型训练提供高质量、结构化、视觉-文本对齐的数据。

DeepSeek-OCR的第二个亮点,就是它具备“智能分辨率机制”。为什么需要这个机制?因为不是所有文档都需要消耗等同的计算资源。这就好比我们人眼看书一样,如果你看一本小说的普通章节,你会快速扫视,低分辨率处理。但如果你在看一份复杂的财务报表或报纸,你需要聚精会神,高分辨率地逐个数字核对。

DeepSeek-OCR就是让AI学会了这种自适应的扫视能力。DeepEncoder设计了多种模式,比如Tiny模式和Small模式。其中,Tiny模式只使用64个视觉Token,适用于像演示文稿。Small模式使用100个视觉Token,适用于像书籍和报告这类文档,因为大部分这类文档的文本Token数量在1000以内,100个视觉Token刚好能实现约10倍的黄金压缩比。

但如果遇到报纸这样的,动态分辨率模式Gundam模式,可以动态地由n个局部视图和一个全局视图组成,确保了对超高分辨率输入的处理能力,避免了图片被过度分割成细小的碎片。在国产GPU算力有限的环境下,这种自适应压缩能力至关重要。它可以根据任务的难易程度,动态地调整AI消耗的算力,确保算力用在刀刃上,避免了对简单任务使用“杀鸡用牛刀”的全尺寸大模型。

DeepSeek-OCR的第三个亮点,在于它超越了传统OCR的范畴,实现了深度解析能力。传统的OCR目标是识别字符,而DeepSeek-OCR,作为视觉语言模型的内在能力,它追求的是文档智能。它不仅是识别文字,还要理解图表的结构、公式的语义。这是文档理解的更高阶段,被称为OCR 2.0。

它可以处理金融研究报告中的图表,它可以将柱状图、饼图等转换成HTML表格等结构化数据。这对于需要从报告中提取数据进行量化分析的金融机构和研究人员来说,价值不可估量。它还能识别化学文档中的化学公式,并将其转换为SMILES格式。SMILES是一种广泛用于化学信息学的线性记法。这意味着AI能够读懂化学知识本身,而不仅仅是识别字符。甚至对于数学题中的几何图形,DeepSeek-OCR也具备结构化复制的能力,捕捉线段间的复杂依赖关系。

简而言之,DeepSeek-OCR能够把PDF、报表、学术论文转成结构化数据,让AI真正读懂知识,而非字符。同时,得益于其训练数据包含了互联网上抓取的近100种语言的PDF文档,DeepSeek-OCR在多语言识别方面表现出色,能够处理包括阿拉伯语、僧伽罗语在内的多种少数民族语言和复杂脚本。

再来看看DeepSeek-OCR的第四个亮点,是它在架构上体现的“小模型的大智慧”。DeepSeek-OCR的解码器部分,采用了DeepSeek-MoE架构。MoE架构是提升大模型效率的关键技术之一。传统的大模型,在处理任何任务时,模型的所有参数都会被激活和参与计算。而DeepSeek-3B-MoE这个模型,虽然参数总量有30亿,但在推理时,它只会激活其中的一小部分专家,大约5.7亿的激活参数。这意味着,它拥有3B大模型的表达能力和知识容量,但在推理速度和成本上,却能达到500M小模型的效率。

当这种高效的MoE解码器与DeepEncoder压缩器相结合时,效率的提升就是几何级数的。DeepEncoder首先将输入序列长度缩短10倍,MoE解码器在处理这少量Token时,又只激活了少量的专家,进一步减少了计算量。这种组合确保DeepSeek-OCR能够在国产GPU集群上高效运行,以最小的资源消耗,处理最复杂的文档智能任务。

这项研究最引人遐想的第五个方向,是它为我们描绘了一幅“AI记忆革命”的图景。我们知道,人脑的记忆是动态的、节能的。重要的信息我们记得非常清晰,而久远,不重要的信息会逐渐变得模糊、衰退。这就是一种高效的资源分配和遗忘机制。

DeepSeek的研究人员,将上下文光学压缩与人类记忆的衰退过程,进行了精妙的类比。近期上下文,就像近处的物体,清晰可见。AI可以将其渲染成高分辨率图像,用较多的视觉Token来保存高保真信息。远期上下文,就像远处的物体,逐渐模糊。AI可以渐进式地缩放这些图像,使其变得更小、更模糊,从而用极少的视觉Token来表示,实现了信息的自然遗忘和压缩。

通过这种机制,AI可以动态地为不同时期的上下文分配不同数量的计算资源。这为解决大模型长期以来面临的超长上下文难题,提供了一个充满希望的新方向。理论上,它可以构建出一种无限长上下文的架构,因为它通过压缩,解决了长序列带来的二次方计算开销。未来的AI也许能把我们的长对话记录、阅读的资料、网页截图等,都变成视觉档案保存。需要时,随时翻阅清晰的档案;不需要时,就让它们在后台变成模糊的旧照片,静静地,以极低的Token消耗,存在于记忆深处。这种节能且高效的机制,无疑是AI走向AGI道路上的关键一步。

最后,我们来看DeepSeek-OCR的实战表现,也就是它如何通过压缩智慧,对抗算力鸿沟。DeepSeek-OCR在权威的文档理解基准测试上,展现了其卓越的实用性能。这个测试的目标是评估模型在真实文档解析任务中的表现,包括文本、公式、表格和结构化数据提取。

DeepSeek-OCR取得了超越行业领先模型的成绩,而它所依赖的视觉Token数量,却少得惊人。在测试中,DeepSeek-OCR的Small模式,在整体性能上,就已经超越了像GOT-OCR2.0这样的优秀端到端模型。更让人印象深刻的是,DeepSeek-OCR即使在要求极高的Gundam模式下,平均使用的视觉Token数量也不到800个。要知道,行业内公认的强大模型MinerU2.0,平均每页需要超过6000个视觉Token。DeepSeek-OCR用不到对手八分之一的Token数量,却能实现更优的性能。

这打破了一个长久以来的认知:高效能一定要用大量的计算Token堆出来。DeepSeek-OCR通过DeepEncoder的巧妙设计,在图像进入大模型解码器之前,就已经完成了高效率的语义提炼。它证明了,只要编码得足够聪明,就可以大幅减少后续计算的压力,同时保持甚至超越那些使用更多Token的模型性能。

这一成果的意义,不仅为DeepSeek自己的视觉和语言模型训练,提供了极大的成本优势和数据生产效率,也为整个行业,尤其是正在推进自主创新的中国AI界,树立了一个标杆。算法创新,是超越硬件限制的最强武器。在算力国产化的历史性转折点上,DeepSeek-OCR无疑提供了一份极具说服力的国产方案。它让我们看到,AI的进化,不仅是追求参数量的无止境增长,更是对信息表达效率和资源节俭的深刻理解。这是一种更聪明、更可持续,也更符合中国当前国情的AI发展哲学。

好了,今天关于DeepSeek-OCR论文的这个话题,就先聊到这里。当中国AI告别英伟达,靠自研芯片和新算法突围,你认为这是限制,还是一次真正的独立自主的开端呢?欢迎在评论区留言讨论。

最后,再次提醒一下大家,记得点个赞,关注一下明月三千里的频道,打开小铃铛。咱们下期再见!