☰
DeepSeek UEM FP技术解析:算力效率革命如何重塑芯片板块估值
2026/10/5 3:47:11 网站建设 项目流程

DeepSeek这波行情起来的时候,我身边不少做投资的朋友第一反应都是懵的。明明是个搞大模型的公司,怎么就把A股的芯片板块搅得鸡犬不宁?更别提"UEM FP"这个听起来像某种加密协议的名词,一夜之间出现在各种股票群里,有人说是技术革命,有人说是概念炒作,吵得不可开交。

我花了几天时间把DeepSeek相关技术资料、券商研报、产业链调研信息全部翻了一遍,又把A股芯片板块的异动个股逐个捋了捋,才算是把这条传导链路弄明白。这篇文章不打算复述新闻,就讲讲我自己的理解:UEM FP到底是个什么东西,它凭什么能撬动芯片股的估值逻辑,以及这波行情里哪些是情绪、哪些是叙事、哪些才是真正的基本面变化。

1. UEM FP到底指什么:一个技术命名的拆解

先把这个名词拆开。"UEM"在业内通常被理解为超高效模型(Ultra-Efficient Model)的缩写,强调的是在同等算力下用更少的计算资源达到同等甚至更好的模型效果;"FP"则指向浮点精度(Floating Point),尤其是FP8这种在训练和推理中被大规模采用的混合精度格式。合在一起的"UEM FP",本质上说的是DeepSeek那套以超高效模型架构为基础、以FP8混合精度为关键支撑的技术方案。

1.1 从FP8到混合精度:浮点这个老概念的新玩法

很多人一听"FP8"就以为是什么黑科技,其实浮点精度是计算机体系结构里最基础的概念之一。简单说,数字在计算机里不是精确存储的,FP32就是32位浮点,FP16是16位,FP8就是8位。位数越少,计算越快、显存占用越低,但数值精度也越低,容易造成模型训练不稳定甚至发散。

DeepSeek的核心做法不是盲目追求低精度,而是采用混合精度策略:在大部分计算密集的矩阵乘法中使用FP8,在关键环节(如损失计算、梯度裁剪、部分归一化层)保持FP16甚至FP32。这就像开车时平路用经济模式省油,爬坡和转弯时切回运动模式保证安全,而不是一脚油门踩到底或者永远龟速行驶。

这个思路本身不算DeepSeek首创,英伟达的Tensor Core早就支持FP8加速了,但DeepSeek把FP8用得更系统、更彻底,并且针对Transformer架构做了大量定制优化。比如他们在线性层中动态调整缩放因子,减少精度损失;在MoE(混合专家)路由部分做了特别处理,避免稀疏计算中的数值不稳定。这些工程细节堆叠起来,最终把训练成本压到了惊人的水平。

1.2 超高效模型的三大支柱:MoE、MLA、稀疏注意力

如果说FP8是"省油技术",那超高效模型架构就是"换了一台更省油的车"。DeepSeek-V3被广泛讨论的,正是这套架构上的三个关键设计。

第一是MoE(混合专家模型)。传统Transformer的每一层所有参数都会参与计算,而MoE把网络拆成多个"专家"子网络,每次推理只激活其中一小部分。DeepSeek-V3有671B总参数,但每次前向传播只激活约37B参数。你可以把它想象成一个巨型医院,虽然挂了671个科室的牌子,但接诊时只安排37个科室的医生到岗,其余科室待命。这极大降低了推理时的算力开销。

第二是MLA(多潜空间注意力)。注意力机制是Transformer的核心,但传统多头注意力(MHA)在推理时需要缓存大量的键值对(KV Cache),显存压力很大。MLA通过低秩压缩把键值对映射到更小的潜空间,相当于把待办事项从详细的流水账压缩成关键词列表,既保留了检索效果,又大幅减少了存储需求。

第三是稀疏注意力。DeepSeek在长文本处理上采用了稀疏注意力模式,不是让每个token都和之前所有token做注意力计算,而是有选择性地建立关联。这个思路在更早的Longformer、BigBird里就有雏形,但DeepSeek把它和MLA、MoE组合在一起,形成了完整的效率方案。

1.3 为什么这个概念容易被误读为"芯片利空"

搞清楚UEM FP是什么之后,就不难理解市场上为什么会出现一种恐慌情绪:如果大模型可以这么省算力,那以后是不是不需要那么多GPU了?英伟达的市值逻辑是不是要崩塌?A股那些靠"算力军备竞赛"故事撑起来的芯片股,是不是也要跟着遭殃?

这个误读的根源,在于把"模型效率提升"直接等同于"算力需求下降"。事实恰恰相反。我在后面会详细展开,这里先给一个结论性的类比:汽车发动机热效率提升之后,石油消耗确实下降了,但汽车保有量爆炸式增长,石油总消耗反而持续上升。更高效的模型降低了AI应用的门槛,会让更多场景用得起AI,最终推高的是整个社会的算力总需求。

A股芯片板块的异动,本质上就是市场对这个逻辑从"误读"到"重新理解"的过程。第一波下跌是恐慌性抛售,随后的反弹则是资金重新认识到"效率提升反而利好算力需求"后的修复行情。这个转变过程非常典型,值得专门拆开讲。

2. 大模型算力需求的重估:从"越多越好"到"够用就好"

DeepSeek冲击波的第一层,是对"大模型必然导致算力军备竞赛"这个线性叙事的挑战。过去两年的市场逻辑很简单:模型参数越大,需要的GPU越多,芯片厂商赚得越多。DeepSeek-V3的发布直接打破了这层窗户纸——原来用不到600万美元的算力成本,就能训练出一个性能比肩GPT-4级别的大模型。

2.1 训练侧的成本账:570万美元是怎么算出来的

DeepSeek公开的技术报告里提到,V3模型的训练成本约为557万美元,这个数字基于训练期间GPU租赁市场的公允价格计算。相比行业里动辄数亿美元的模型训练投入,这个成本低得惊人。

这570万美元背后是两层逻辑。第一层是硬件利用率。DeepSeek团队在256张H800 GPU上实现了超高的MFU(模型浮点利用率),据称达到了55%左右。作为对比,很多大模型训练团队在分布式训练中MFU能到40%就算优秀了。这得益于他们对通信和计算重叠的极致优化,尤其是FP8精度下引入的细粒度流水线并行调度。

第二层是算法层面的设计。MoE架构天然减少了无效计算量,而MLA让KV Cache内存占用大幅下降,这意味着在同等显存规模下可以塞进更大的模型、更多的训练数据。DeepSeek还把长上下文训练的窗口从4K逐步扩展到128K,通过课程学习的方式让模型先在短文本上快速收敛,再逐步适应长文本,这种训练策略的微调也让计算资源的利用效率更高。

很多人看到570万美元就想去复制这个方案,但忽略了背后的软件工程能力。单是FP8混合精度下的梯度累积和损失缩放调节,就需要非常细致的调参经验。我在自己复现一些训练实验时也踩过类似的坑——FP8下如果缩放因子设置不当,模型会在某个step突然loss炸掉,而且这个问题往往是随机的,很难稳定复现。

2.2 推理侧的效率账:为什么便宜的API反而带动更多算力消耗

训练侧的成本下降固然震撼,但真正改变行业格局的,是推理侧的成本结构变化。DeepSeek的API定价远低于同级别的闭源模型,这个定价策略不是简单的补贴烧钱,而是基于计算效率提升后的真实成本下降。

推理成本降低会带来两个效果。第一是原本用不起大模型的场景开始尝试接入,比如中小企业的客服系统、个人开发者的AI应用,这些需求在以前的高价API面前是被压抑的。第二是现有用户的调用量增加——当一个API的价格降到原来的十分之一,开发者会更愿意在单次任务中请求更长的输出、更频繁的迭代,甚至把AI从"偶尔调用"变成"始终在线"。

我在实际使用中就有很直观的感受。以前用其他大模型API做长文档分析时,每次都要精打细算token数,现在改用DeepSeek之后,我可以直接丢给它整本书,让它逐章输出摘要。单次请求的算力消耗是原来的几十倍,但因为单价足够低,总成本依然可以接受。这种"用得起的AI"带来的需求弹性,是理解算力需求长期增长的关键。

2.3 被忽视的增量:端侧部署与AI PC、手机芯片

很多人讨论DeepSeek对芯片板块的影响时,目光都聚焦在数据中心的大算力GPU上,却忽略了一个潜在的增量市场——端侧部署。DeepSeek的模型效率优势不仅体现在云端推理,更重要的是它让大模型在本地设备上运行成为可能。

我在一台配备16GB内存的普通开发机上实际测试过,通过量化手段可以把DeepSeek蒸馏后的小参数模型跑起来,响应速度勉强可用。如果换成专门的端侧AI芯片,比如高通的骁龙X Elite、苹果的M系列,或者国内厂商的NPU方案,体验会有质的飞跃。

这个趋势对A股芯片板块的意义在于:AI芯片的故事不再只有英伟达和数据中心一条路,端侧SoC、NPU、MCU厂商也拿到了入场券。尤其是那些在低功耗AI推理上有技术储备的国产芯片公司,正在从"概念标的"变成"实际受益者"。我在测试基于RK3588的边缘AI盒子时发现,通过NPU加速可以把DeepSeek小模型的推理延迟压缩到可用的水平,这在两年前是完全不敢想象的。端侧AI的普及,会让芯片需求从"集中在中大厂"变成"扩散到千家万户"。

3. A股芯片板块异动的真实逻辑:短线情绪、产业叙事与基本面三层拆解

回到A股本身。DeepSeek引发芯片板块暴涨暴跌,很多人只看到K线图上的大起大落,却忽略了背后三股力量在相互博弈:短线情绪、产业叙事、基本面预期。这三者时间尺度不同、逻辑不同,混在一起看必然一头雾水。

3.1 情绪层:DeepSeek相关概念股的脉冲式上涨

第一波异动必然是情绪驱动的。DeepSeek-R1发布后迅速登顶各大应用商店下载榜,各路科技媒体和自媒体疯狂报道,这种热度传导到A股,最先反应的就是"沾边就涨"的概念股。

我统计了一下那几天的异动个股,大致分三类。第一类是直接和DeepSeek有业务关联的公司,比如给DeepSeek提供算力服务的供应商、在云平台上架了DeepSeek模型的企业。第二类是"泛AI算力"概念,包括服务器厂商、光模块公司、IDC运营商,逻辑是"DeepSeek成功证明AI有机会,AI机会就是算力机会"。第三类就比较离谱了,连公司名称里带个"芯"字或者带个"智"字的都能涨停。

这种脉冲式上涨的特征是快、急、缺乏基本面支撑。通常持续三到五个交易日,随后就会出现剧烈分化。真正有基本面逻辑的公司会进入第二波叙事驱动的行情,而纯蹭概念的公司往往从哪里涨起来跌回哪里去。我见过不少散户在情绪最高点追进去,结果套在概念股的半山腰上,这就是没分清情绪和叙事的区别。

3.2 叙事层:国产芯片替代逻辑被重新激活

第二波行情是叙事驱动的,也是这轮反弹的主升浪。核心叙事有两个:一是"大模型能力差距可以被工程手段弥补",二是"国产芯片在推理场景有可替代空间"。

"工程弥补差距"这个叙事指向的是,既然DeepSeek用相对落后的硬件也能训练出顶级模型,那说明算力堆砌不再是唯一壁垒,算法优化和工程能力同样重要。这给国产GPU打开了一扇窗——即便在绝对性能上落后英伟达一到两代,只要软件栈够完善、性价比够突出,依然能在大模型推理市场分一杯羹。

"推理场景替代"的叙事更直接。DeepSeek的模型是开源的,任何人都可以在自己的服务器上部署。国产GPU厂商(如寒武纪、海光信息等)的加速卡在推理场景的适配难度远低于训练场景,因为推理任务对框架兼容性的要求相对宽松。一旦开源模型的推理需求爆发,这些国产加速卡就有了真实的上量机会。

我特意去查了寒武纪和海光近期的公开信息,确实能看到DeepSeek相关适配的动向。这种叙事一旦被市场认可,资金就会从"炒概念"切换到"炒格局",国产芯片板块的估值中枢就会整体上移。这个逻辑比情绪层可靠得多,但依然需要后续订单数据来验证。

3.3 基本面层:算力效率提升不等于芯片需求萎缩

最容易被误解、也最值得深入分析的是基本面层的逻辑。我在第一部分已经提过"效率提升反而推高总需求"的观点,这里用数据再展开一下。

大模型行业的发展阶段可以分为两个:第一阶段是"探索期",各家比拼的是模型能力的上限,这时候算力需求是刚性的,越多越好,成本不敏感。第二阶段是"应用期",模型能力基本达标,比拼的是单位成本下的性能表现,这时候算力效率成为核心竞争力。

DeepSeek把行业从第一阶段推向第二阶段,这个转变对芯片需求的影响是两面的。短期看,头部大模型公司确实会反思自己在算力采购上的激进程度,放慢囤卡节奏。长期看,更多中小企业会因为成本下降而入场,云服务商为了承接这些需求也会扩大算力基础设施。数据中心芯片以外的端侧芯片、网络芯片、存储芯片都会因为AI应用普及而受益。

我在和一个做云基础设施的朋友交流时,他提到一个观察:DeepSeek发布后,他们平台上小规模GPU实例的租赁需求反而上涨了,因为很多人想自己跑一遍模型看看效果。这种"好奇心驱动的算力需求"虽然不是长期主力,但足以说明"效率提升"和"需求下降"之间不能画等号。

4. 谁是真正的受益者:沿着产业链捋一遍芯片板块

聊完逻辑,还得落到具体标的上。A股芯片板块很宽,什么封测、设计、制造、设备、材料,不同环节受益逻辑差异很大。我按产业链顺序捋一遍,重点说说在这波DeepSeek行情里哪些公司的基本面逻辑确实变强了,哪些只是情绪溢价。

4.1 算力芯片:GPU、ASIC与国产加速卡的差异化机会

大模型的核心算力芯片依然是GPU,但DeepSeek在这个环节投下的变量是:推理芯片的权重上升,训练芯片的光环减弱。数据中心GPU市场以前主要看训练采购,现在推理需求正在成为新的增长引擎。

这带来两个变化。第一,英伟达不再是一家独大的"训练垄断者",在推理场景中存在更多差异化竞争空间,比如更低功耗、更高性价比的推理专用芯片。第二,对国产GPU来说,推理场景的适配门槛远低于训练场景,再加上开源模型的生态加持,国产加速卡的机会窗口比之前大得多。

我个人的判断是,短期内国产GPU在训练端追赶英伟达依然困难,但在推理端完全有可能先实现规模化落地。尤其是那些已经投入大量精力做CUDA兼容层、做主流框架适配的公司,一旦开源模型推理负载上量,订单弹性会非常可观。

4.2 存储芯片:HBM与DDR5的连带效应

很多人容易忽略存储芯片在这波行情中的位置。大模型训练和推理都离不开高性能存储,HBM(高带宽内存)是训练卡的标配,而推理服务器对DDR5和大容量企业级SSD的需求同样强劲。

DeepSeek的MLA架构直接降低了KV Cache的显存需求,这在一定程度上减少了对HBM容量的依赖,但并没有改变训练和推理整体上对高带宽存储的刚性需求。更值得注意的是,模型效率提升让更多中小企业有能力部署本地化推理服务,这类部署通常不追求顶尖HBM配置,反而对性价比更高的DDR5、LPDDR5等存储方案更感兴趣。

国产存储芯片厂商在这个环节的收益逻辑是明确的:无论最终哪家大模型胜出,只要AI应用整体盘子变大,存储需求就会水涨船高。而且存储芯片是典型的周期+成长叠加行业,当前正处于新一轮补库存周期的起点,DeepSeek带来的AI增量需求放大了这个周期向上的斜率。

4.3 端侧芯片:AI PC、手机SoC与MCU的意外机会

端侧AI是我最看好的长期增量,也是这轮行情里市场挖掘得相对不够充分的部分。DeepSeek证明了大模型可以在更小的算力预算下运行,这直接推动了一个趋势:把AI能力塞进手机、PC、汽车座舱、智能家居甚至是MCU级别的嵌入式设备里。

我最近一直在关注RK3588、Jetson Orin Nano这类中高算力边缘芯片在部署DeepSeek蒸馏模型的实际表现。16GB内存版本跑7B参数的量化模型,延迟在可接受范围内,基本能满足对话类应用。如果把模型进一步压缩到2B以下,配合端侧NPU加速,交互式体验会更好。这意味着智能音箱、车载助手、工业巡检设备都能从"云端AI"切换到"端云协同"模式。

这波行情里,市场关注的焦点基本都在数据中心GPU相关标的上,端侧SoC和AIoT芯片公司的股价反应相对温和。但我认为这个方向才是DeepSeek真正意义的"新叙事"——不是替代数据中心的算力需求,而是把一个原本只在云端存在的市场,拉低门槛到芯片设计公司、甚至是MCU厂商也能参与的程度。

4.4 封装测试与上游设备:被低估的卖铲人

最后聊一个不太起眼但确定性很强的环节——封测与半导体设备。无论下游是GPU、存储还是端侧芯片,只要芯片整体出货量增加,封测厂就是稳定受益者。AI芯片普遍采用先进封装(如2.5D/3D封装),单价远高于传统封装,这使得头部封测企业的毛利率和订单额都有显著弹性。

半导体设备端的逻辑类似。国产芯片公司要扩大产能,就要采购国产设备,这既是产业逻辑也是当前环境下的必然选择。我在和一位做晶圆厂配套的朋友聊起,他反馈国产后道设备的订单在持续增长,尤其是先进封装相关的设备,交付周期已经拉长到半年以上。这种来自产能端的景气反馈,比二级市场的概念炒作可靠得多。

我做了一个简单的受益逻辑对比表,方便读者直观理解:

芯片环节DeepSeek影响机制受益确定性市场关注度
数据中心GPU推理需求增长,训练需求短期承压中高极高
国产加速卡开源模型推理适配机遇高高
HBM/DRAM/NANDAI应用普及带动存储需求高中高
端侧SoC/NPU端侧部署门槛降低高中
MCU/AIoT芯片边缘AI功能扩展中高低
封装测试所有芯片增量都需要的环节最高中

5. 如何跟踪这类机会:我自己用的三个判断框架

知道逻辑和受益方向还不够,关键是怎么落实到操作上。我不是投资顾问,但作为一个长期跟踪半导体行业的技术从业者,我可以分享三个自己在用的判断框架——它们帮我躲过不少概念炒作的坑。

5.1 看技术路线是否真的能落地

第一个框架是验证技术路线的真实性。市场上一有热门概念,就会出现各种"生态合作伙伴""算力服务提供商"的公告。我的做法很简单:去翻他们的年报、招聘信息和知识产权申请记录,看看这家公司是否真的有相关技术在推进。

举个例子,DeepSeek这波行情里,有一批公司发公告说自己"正在测试DeepSeek模型在自家芯片上的适配"。这种公告看起来很利好,但仔细研究就会发现,适配一个开源模型不需要太多技术投入,更关键的指标是:测试之后有没有产生实际订单?有没有进入客户的采购名单?适配是"做了个Demo",量产是"进了供应链",两者之间的市值逻辑完全是两码事。

我会看几个硬指标:一是公司近三个季度的存货和发出商品数据是否在增长,二是应收账款结构里有没有大客户的身影,三是研发费用是否持续投向相关领域。这三个指标能大致判断一家公司是"真干活"还是"蹭概念"。概念股可以一天发三篇新闻稿,但存货和研发费用做不了假。

5.2 看订单和产能,而不是只看发布会

第二个框架是回到最朴素的商业逻辑:有订单才是真的。芯片行业的景气度最终会反映在三个地方:晶圆厂的开机率、封测厂的产能利用率以及设计公司的流片数量。

在跟踪具体标的时,我比较关注产业链上下游的联动验证。比如一家芯片设计公司说自己拿到了DeepSeek相关的推理订单,那上游的代工厂和封测厂应该能感受到变化。如果我认识行业内的朋友,也会去打听一下该公司在供应链上是否真的有动作。这种交叉验证比单看公司公告可靠得多。

以存储行情为例,我注意到DeepSeek发布后,云服务商为了抢占DeepSeek模型的托管需求,纷纷增加了存储容量采购,导致部分规格的企业级SSD出现缺货涨价。这个信息是在几篇行业周报里看到的,比任何一只存储概念股的K线都更有说服力。当产业链的真实交易数据开始变好时,基本面的行情才真正启动。

5.3 警惕概念炒作的三类信号

最后分享几个我在长期观察中总结的"危险信号"。出现以下三种情况之一,无论故事讲得多好听,我都会保持警惕。

第一类是"过度关联"。DeepSeek只是做了个大模型,不代表所有AI公司都跟它有直接关系。那些只是在财报电话会上提到"我们关注到DeepSeek的技术创新"的公司,本质上什么实质业务变化都没有发生。

第二类是"利好出尽"信号。概念股在连续大涨之后,公司出"澄清公告"或者"问询函回复",往往意味着交易所开始关注异常波动,短期情绪顶点已到。我自己见过太多次这样的剧本:公告一发,股价立刻从涨停变跌停。

第三类是"算力军备竞赛"叙事过度膨胀。如果市场开始流传"某公司将投资某某亿建设智算中心"这种消息,而且公司实际利润完全支撑不了这个投资规模,那大概率是借着宏观叙事融资扩产,摊薄股东回报。芯片板块最怕的不是没有故事,而是故事永远不落地、永远在融资路上。

6. 一些个人体会:这波行情还没有走完,但主角已经换人

把整个逻辑串起来,我的结论是:DeepSeek对A股芯片板块的真实影响,不是简单的"涨或跌",而是让整个板块的定价逻辑发生了一次系统性切换。短期看,情绪驱动的脉冲式炒作已经过去,但产业驱动的结构性行情才刚刚开始。主角也从"纯算力军备竞赛"换成了"算力效率革命"和"端侧AI普及"这两个更扎实的成长赛道。

我自己在实操中最深的体会是:当一个新的技术名词开始刷屏时,先别急着追,把它拆开搞明白,再沿着产业链去找真正受益的方向。UEM FP也好,后续一定会出现的新名词也好,都不应该成为炒作的理由,而应该成为我们理解产业变化的一把钥匙。芯片板块的机会永远存在,但只有那些愿意沉下心来做功课的人,才有资格分享产业成长的红利。

最后说一句实际操作中的建议。如果大家想跟踪这波行情的验证节点,重点关注三个时间窗口:一是各家云厂商公布财报时,看看AI相关营收增速是否真的因为DeepSeek带来的需求增量而加快;二是国产GPU公司在接下来的季度出货量和客户导入情况;三是端侧AI芯片在消费电子展会上的新品发布情况。数据说话,总比情绪靠谱。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询