云厂商自研芯片:从AWS Trainium看算力竞争下沉
2026/9/12 12:09:14 网站建设 项目流程

9月12日,科技日报发了一篇观察文章,讲云服务商纷纷下场自研芯片,算力竞争进入"芯片定义时代"。触发点是8月31日英伟达出资35亿美元认购联发科海外可转换公司债,双方在AI基建、边缘AI、车用电子三个方向深度合作。而更值得关注的,是文章里提到的一个事实:据英国《金融时报》报道,AWS自研Trainium芯片支撑的算力服务营收保持快速增长,在其AI算力业务中的占比持续提升,已经成为和英伟达GPU算力并行的核心产品线。

云厂商造芯片不是新鲜事,但"自研芯片的收入能和GPU算力并列",这个信号比以前强得多。

一、云厂商为什么要亲自造芯片

过去几十年,云计算的玩法是"通用芯片采购 + 软件层调度优化":买通用GPU和CPU,靠虚拟化把算力切给不同用户。这套模式能跑,是因为通用芯片什么都能干。

但大模型改变了需求形状。训练和推理的本质是海量并行的矩阵运算,对并发度、时延、功耗都极其敏感。通用芯片为了兼容全场景,保留了大量和AI计算无关的硬件模块,在推理这种高并发场景下,实际算力利用率据科技日报的表述不足七成。

这就带来两个后果:一是利用率低,只能靠多买芯片来补,成本降不下来;二是高端AI芯片供给集中在少数厂商,价格和交期都不由云厂商自己说了算。

自研ASIC(专用集成电路)的逻辑,就是把和AI无关的模块砍掉,只保留需要的那部分电路。据科技日报报道,定制化AI芯片在大模型推理场景下的能效比可以达到同级别通用GPU的1.5–3倍,单位算力成本降低35%以上。AWS官方资料显示,Trainium3单芯片提供2.52 PFLOPS的FP8算力,配144GB HBM3e内存,内存带宽4.9TB/s;一台完整UltraServer最多集成144颗芯片,合计可提供362 PFLOPS的FP8算力。

二、变了什么,没变什么

变的是竞争的位置。以前云厂商比的是谁的软件调度做得细、谁的可用区覆盖广;现在要比的是谁能从芯片架构开始做定制优化。竞争从软件层下沉到了芯片层。

没变的是,通用芯片不会消失。科技日报的观点很明确:定制芯片和通用芯片长期是互补共存,而非替代关系。ASIC只擅长特定的计算模式,一旦业务模型变了、算子变了,灵活性远不如GPU。这也是为什么AWS一边推Trainium,一边仍然大量采购英伟达的卡。

还有一件没变的事:软件生态的门槛依然很高。CUDA攒了十几年的库和工具链,是英伟达最深的护城河。自研芯片要真正被开发者用起来,不止是把晶体管做出来,还得把编译器、框架适配、算子库一层层补齐。这是慢功夫。

三、对普通开发者和从业者意味着什么

如果不在芯片行业,这件事看起来离得很远,其实有几个实际影响。

第一,推理价格还有继续下降的空间。云厂商自研芯片的核心动力就是降本,成本降下来后,一部分会传导到API和实例价格上。据报道,AWS管理层曾表示Trainium已获得Anthropic、OpenAI等客户的多年期采购承诺,并称其性价比较同类GPU有优势;也有报道提到亚马逊正考虑把自研芯片业务对外开放销售。对开发者来说,这意味着在选云、选实例时,除了GPU型号,"有没有可用的ASIC实例"也要放进比价清单了。

第二,供应风险会被分散。自研芯片让云厂商在供给侧多了一条腿,地缘政策、产能波动带来的单一来源风险会缓解一些。对做长期容量规划的人来说,这算是利好。

第三,选型要多问几个问题。看到"算力便宜一半"这类说法,先别急着迁移,要问清楚:支持的算子覆盖度够不够?训练和推理分别是什么表现?迁移要改多少代码?社区和文档齐不齐?ASIC类的算力通常是"性价比高但适配成本高",只有在负载足够标准、规模足够大的时候才划算。小团队、实验性项目,优先选生态成熟的通用方案更稳。

四、一个容易被忽略的角度

硬件之外,真正的瓶颈往往在互联和存储。科技日报引用半导体媒体EE Times的数据:在万卡级AI训练集群里,网络通信开销已经占到总算力开销的32%。而存储这边,算力性能大约每两年提升3倍,存储读写速度年增速却不足20%,算力单元等待数据的时间占比超过30%。

换句话说,芯片算得快,不等于集群跑得快。通信墙和存储墙不解决,单芯片再强,整体效率也上不去。这也是为什么云厂商的芯片布局都是"计算—通信—存储"三条线一起推,而不是只造计算芯片。

结尾

云厂商自研芯片这件事,短期看是财报上的一个增长数字,长期看是算力产业话语权的重新分配。对普通开发者来说,最直接的体感可能只是账单上少了一点点。

你在选云或者选实例的时候,会考虑非英伟达的算力方案吗?评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询