上个月我在整理一次行业分享的PPT时,突然意识到一个很有意思的信号:OpenAI 和 Anthropic 对外发布的内容,重心正悄悄从模型评测和榜单,转向算力基础设施与芯片合作的消息。过去一年还在“GPT 还是 Claude 谁更强”的口水仗里打转的两家公司,不约而同地把手伸向了 AI 硬件——准确说,是在争夺 AI 硬件的“定义权”。
这个定义权不是谁家芯片跑分高那么简单。它关系到下一代模型能长多大、推理成本能降到多低、终端设备上能不能跑得动本地 AI、甚至开发者每个月要为大模型 API 付多少钱。作为一个每天要调 API、关注模型选型的从业者,我觉得这场硬件战争比模型参数竞赛更值得关注,因为它会实实在在改变你我的技术选型和成本结构。这篇文章会把两家公司的硬件布局、背后逻辑以及对开发者和企业的影响拆开讲清楚。
1. 从模型竞赛到硬件竞赛:换轨的真实原因
1.1 模型能力的“卷”正在撞上边际效益递减
过去两年多,OpenAI 和 Anthropic 的竞争主战场一直在模型层。GPT-4 的多模态能力、Claude 3 的超长上下文、o1 的推理范式、Claude 4 的智能体能力……每隔几个月就有一轮“最强模型”头衔的交替。但从 2025 年上半年开始,一个明显的信号出现了:模型竞赛的边际效益在递减。
不是说模型不再进步,而是说在都达到“顶尖水平”的前提下,用户和企业的选择标准变了。我接触过不少技术负责人,选型时的核心问题已经从“谁能写诗写得好”变成“谁能把成本降下来”“谁的 API 更稳定”“谁的延迟更低”。这些问题的答案,很大程度上取决于后端硬件,而不是模型参数。换句话说,大家默认模型能力已经够用,接下来的差距在成本和效率上。
这个转变对 AI 公司的战略影响是巨大的。过去你只要砸钱堆参数、堆数据,就能在评测榜单上拿第一;现在你必须在物理世界里把每一瓦电、每一块芯片的效率压榨到极致。这已经不是纯软件问题,而是从芯片设计到数据中心运营的全栈问题。
1.2 推理算力需求暴涨,硬件成为真正的瓶颈
从技术路线看,推理模型是这轮硬件竞赛的直接催化剂。OpenAI 的 o 系列推理模型和 Anthropic 的 Claude 3.7 系列,都引入了“思考时间”的概念——模型在给出最终答案之前,会先生成数千甚至数万个内部推理 Token 来“想清楚”再回答。这个机制对推理算力的消耗,是传统模型一次性输出的几十倍。
我用一个具体的数字来说明:一次包含 2 万内部思考 Token 的 o1 推理请求,实际消耗的算力大约相当于传统 GPT-4o 请求的 15 到 30 倍。如果把这个比例放大到全球企业每天的 API 调用量,推理算力的需求可以说是指数级增长。
这就带来一个很直白的数学问题:同样一次 API 调用,算力消耗变成原来的 20 倍,API 定价要么大涨,要么倒逼硬件效率提升 20 倍。市场显然选择了后者——各家都在拼命优化推理硬件。这也是 OpenAI 和 Anthropic 不约而同开始定制芯片的根本原因。他们比的不是谁家 GPU 多,而是谁能用最低的硬件成本跑出最高质量回答。
1.3 英伟达的“一家独大”让所有 AI 公司不安
换轨的另一个推手是供应链风险。过去两年 H100、A100 一片难求,让所有依赖英伟达的 AI 公司都感受到了命运被捏在别人手里的滋味。英伟达数据中心业务的毛利率长期保持在 70% 以上,这意味着 AI 公司每赚 1 美元,就有相当比例变成英伟达的利润。
对 OpenAI 和 Anthropic 这种头部公司来说,这绝对不能接受。它们的应对策略很清晰:要么推高融资规模去抢购 GPU,要么自己动手重新定义硬件。于是我们看到一个趋势——越有实力的 AI 公司,越不甘心只做英伟达的“下游组装厂”。自研或定制芯片,本质上是在夺回对自身成本结构和产品形态的控制权。
2. OpenAI 的硬件棋局:定制芯片、星际之门与人才争夺
2.1 与 Broadcom 合作:目标明确,对标 TPU 模式
OpenAI 的硬件布局虽然官方披露不多,但从 2024 年底开始,与博通合作开发定制推理芯片的信息已经比较扎实。这款芯片据传将采用台积电先进制程,专注于推理而非训练,预计未来一两年内量产。
为什么选博通?这个细节很关键。博通不是 AI 芯片领域的新玩家,Google 的 TPU 从第一代开始就是与博通深度合作的产物。博通扮演的角色更像“定制芯片架构设计服务商”,不直接卖通用 GPU,而是帮客户把特定工作负载的逻辑固化到芯片里。OpenAI 选择这条路,说明它需要一个比通用 GPU 更高效、更贴合自己模型结构的推理加速方案。
通用 GPU 要考虑所有模型的通用性,很多算力被花在了与具体模型无关的灵活性上。而定制 ASIC 可以为 Transformer 架构做硬件级优化——比如把注意力机制中的矩阵运算固化到特定电路模块,把 KV Cache 的内存管理做成专用逻辑。这些优化看似细微,叠在一起就是数量级的推理效率提升。
2.2 Stargate 项目:从单点芯片到千亿美元基础设施
芯片只是 OpenAI 硬件版图的一块拼图,真正的重头戏是 Stargate(星际之门)项目。这是 OpenAI 联合软银、甲骨文等合作伙伴推进的大规模数据中心建设计划,预计总投资规模达到数千亿美元,规划了多个专用于大模型训练和推理的超大规模数据中心。
要注意,Stargate 不是简单“多买几万张 GPU”,而是一个覆盖电力供应、数据中心设计、芯片部署、液冷散热、网络互联的完整基础设施计划。我之前参观过一些传统数据中心,它们的架构是为云计算设计的,网络拓扑、供电密度、散热能力都不适配大规模 GPU 集群。Stargate 这类项目相当于从零开始,为 AI 计算重新设计一整座“算力工厂”。
为什么说这也是硬件定义权?因为模型的能力上限不仅取决于芯片本身,还取决于芯片之间的互联带宽、内存层次、数据吞吐能力。OpenAI 通过 Stargate 掌控的,是算力从物理世界到模型能力的全部转化链路。这种深度不是短期能追赶的。
2.3 从 Google 和各大芯片厂挖人:自研不再是传闻
另一个值得关注的动向是人才。OpenAI 在 2024 到 2025 年引进了多位具备芯片设计背景的资深工程人员,包括从 Google TPU 团队、苹果芯片团队和多家半导体公司挖来的核心角色。这些人的履历背后,是一场围绕“硬件人才”的争夺战。
我在招人时有一个体会:芯片设计人才和纯软件算法工程师是两种完全不同的物种。算法工程师可以靠一个周末的重写快速迭代,但芯片设计要提前 2 到 3 年做架构决策,落地周期极长,容错率极低。OpenAI 能在自研芯片上快速推进,很大程度上依赖这些资深芯片人的经验,而不是单纯靠“砸钱买卡”。
Stack Overflow 上有开发者问过一个问题:OpenAI 为什么要同时做模型和芯片?答案其实很简单——模型迭代和芯片设计周期之间存在巨大的时间差。今天设计的芯片,要等到模型已经迭代了三四代之后才能真正部署。要让芯片始终贴合最新模型架构,就必须让芯片设计团队和模型算法团队在同一个组织内深度协同,而不是依赖外部供应商寄过来的通用方案。
3. Anthropic 的算力棋盘:TPU 绑定、AWS 自研芯片与第三选择
3.1 押注 Google TPU:不买卡也能训练出顶级模型
Anthropic 的硬件路线与 OpenAI 有所区别,它的一个重要筹码是与 Google 的深度绑定。Claude 系列模型从训练到推理都大规模使用 Google 的 TPU 集群,Google 在硬件和云资源上的倾斜,是 Anthropic 能够以相对可控成本训练顶级模型的关键。
选择 TPU 并不是一个“妥协”的决定,反而有非常强的工程逻辑。TPU 的架构从一开始就是为大规模矩阵运算设计的,在训练 Transformer 模型时效率极高。TPU v4 和 v5p 的集群互联技术在大规模并行训练上的表现,甚至在某些场景下优于英伟达的 InfiniBand 方案。Anthropic 的做法,某种程度上是在“英伟达体系”之外开出了一条真正可用的替代路线。
这也让我想到一个行业现象:很多创业公司在选择训练算力时,默认只考虑英伟达,但真正的头部实验室早就开始走多硬件路线。Anthropic 验证了“不买一张 H100 也能训练出世界顶级模型”这个命题,这本身就有巨大的行业示范效应。
3.2 AWS 投资与 Trainium/Inferentia 芯片的布局
除了 Google,Anthropic 还接受了亚马逊的大规模投资,并承诺使用 AWS 的自研芯片——Trainium 用于训练,Inferentia 用于推理。亚马逊投资 Anthropic,本质上也是一场硬件生态的争夺:AWS 需要一家明星模型公司来验证自己的自研芯片,Anthropic 则获得了摆脱单一大客户依赖的选择空间。
这意味着 Anthropic 实际上在同时使用两套非英伟达硬件体系:Google 的 TPU 和 AWS 的 Trainium/Inferentia。这种“双重押注”在商业上是非常聪明的策略。它让 Anthropic 在硬件谈判中拥有巨大的议价空间——任何一家云厂商都知道,如果自己提供的算力价格或性能没有竞争力,Anthropic 可以把负载转移到另一家平台。
我经常在技术社区里看到开发者抱怨 AWS Trainium 的生态还不够成熟,SDK 和调试工具与 CUDA 相比差了一截。但作为“被生态绑定的开发者”,我们可能低估了头部模型公司愿意投入多少工程资源来补齐这些短板。当一家公司每年要在云上消耗数十亿美元算力时,它有极强的动力去帮芯片厂商打磨生态,而这恰恰是整个行业降低对单一家族芯片依赖的关键。
3.3 自研芯片的想象空间:Anthropic 不想被任何协议绑死
TPU 和 Trainium 之外,关于 Anthropic 自研芯片的传闻一直没有断过。从招聘信息到专利申请,都能看到它在硬件领域的布局迹象。对于一个志在成为下一代基础模型公司的企业来说,长期把核心算力完全寄托在投资方身上,显然不是最稳妥的选择。
我判断 Anthropic 的自研策略会非常谨慎,短期内不会有 OpenAI 与博通合作那种激进动作。更合理的路径是:先在 TPU 和 Trainium 上积累硬件协同设计的经验,完成下一代模型的算法与硬件适配预研,等到模型架构相对稳定、研发投入有足够利润支撑之后,再考虑真正的自研流片。
但不管自研的节奏是快是慢,Anthropic 的真实意图已经很清晰:在英伟达体系之外,为自己保留一条“随时可以自立门户”的硬件通道。定义权不一定是“我的芯片完全自主”,也可以是“谁都不能占我的主导权”。
4. 硬件定义权为什么这么重要:三层逻辑拆解
4.1 第一层:算力成本结构决定商业生死
最直接的一层是成本。AI 公司本质上是在“卖算力”——模型参数量、推理深度、上下文长度,每一项背后都是实打实的硬件开销。如果两家公司的 API 定价相同,而你的单次推理成本是对方的两倍,那利润空间就被彻底吃掉了。
我给大家算一笔大概的账:假设一个标准中长文本请求,在英伟达 H100 集群上的推理成本约为 0.002 美元;如果换成深度定制后专门为这类请求优化的 ASIC 芯片,同样的请求成本可能降到 0.0004 美元,也就是五分之一。在 API 价格战打得火热的当下,这种成本优势就是降价的底气。
这也解释了为什么 OpenAI 在 API 价格上能够频繁调整,而一些依赖租用算力的中小模型公司毫无还手之力。硬件定义权,实质上是对 AI 服务报价能力的定义权。
4.2 第二层:模型架构的自由度来自硬件自主
第二层很多人容易忽略:硬件决定模型架构的可选空间。芯片的内存容量和带宽决定了模型的上下文窗口能做到多大;算力单元的设计决定了模型能不能高效使用稀疏注意力、条件计算等新架构。
举例来说,如果你想开发一个拥有 500 万 Token 上下文窗口的模型,你需要的不是更大的存储,而是巨大的 KV Cache 相关内存带宽。通用 GPU 在设计时不会为这种极端场景做专门优化,但定制硬件就可以。这不仅意味着能力上限不同,更意味着“哪些研究方向值得投入”的战略自由度不同。
在自有硬件平台上的团队,可以大胆尝试革命性架构;依赖外部硬件的团队,只能被动适配通用平台的“舒适区”,这在一两年的竞争里也许看不出来,但在三到五年的维度上是决定性的。
4.3 第三层:端侧 AI 的入口之争
第三层是关于终端的。AI 硬件不只是数据中心里的芯片,还包括手机、PC、汽车、智能家居等端侧设备。
OpenAI 一直想推自己的端侧 AI 设备,同时和苹果等厂商谈判深度集成;Anthropic 也在探索大模型在端侧的部署方案。端侧硬件的真正瓶颈不是算力够不够,而是如何在极低功耗、极小体积下跑出可用的大模型。
谁能定义端侧 AI 芯片的规格,谁就能在“本地优先的智能体验”时代占据主动权。从这个角度看,硬件定义权之争,是对未来 AI 入口的提前占领。这场战争的结果,会直接决定我们在五年后是用语音助手、智能眼镜,还是某种现在还想象不到的硬件形态与 AI 交互。
5. 对开发者与企业用户的实际影响:我的几点判断
5.1 API 定价的下行空间比想象中更大
如果你像我一样每天都在调大模型 API,这两个公司的硬件争夺战对你最直接的影响是价格。
过去一年,无论是 OpenAI 还是 Anthropic,API 价格都在经历一轮又一轮的下调。这里既有市场竞争的因素,但更核心的推动力是硬件效率的提升。
我的建议是:企业在做预算和产品规划时,不要仅仅基于当前 API 价格做成本模型,一定要考虑到未来 18 到 24 个月的降价趋势。现在定了三年的价格模型,两年后可能预算表上的支出会砍半。这是一种“规划冗余”,对商业决策很重要。
5.2 端侧 AI 部署会迎来真正的机会
对做端侧 AI 方案的团队来说,这场硬件争夺战是重大利好。随着头部模型公司对特定量级的端侧推理硬件进行定制优化,算力门槛会大幅下降。
早期我做端侧部署时,在手机芯片上跑一个像样的 70 亿参数模型,基本要经过各种量化、剪枝、蒸馏,最后效果还差强人意。但如果头部模型的推理引擎能被针对主流端侧芯片做底层适配,端侧 AI 的体验将有质的飞跃。
对于重视隐私、需要离线能力、关注单次调用成本的业务场景,我建议大家密切关注端侧模型的推理能力和成本平衡。未来两年可能会迎来端侧 AI 真正落地的窗口期。
5.3 选型时的三个观察指标
最后给开发者和技术决策者一些实操建议。既然 OpenAI 和 Anthropic 都在争夺硬件定义权,那我们在做技术选型和供应商评估时,应该重点观察什么?
我把自己的考察维度和优先级整理成了一张表:
| 观察指标 | 关注点 | 为什么重要 |
|---|---|---|
| 算力自研程度 | 供应商是否有自研/定制芯片并大规模部署 | 决定未来成本下降空间 |
| 多硬件冗余能力 | 是否依赖单一 GPU 供应商 | 决定供应链抗风险能力 |
| 生态兼容性 | API 是否方便切换,是否有闭源锁定风险 | 决定你的迁移成本和谈判空间 |
这三个指标背后是一个核心判断:不要只看“谁家模型跑分高”,更要看“谁家的成本结构能在未来持续支撑低价高质量的服务”。一家拥有可持续成本优势的 AI 公司,才能成为你业务的长久伙伴。
5.4 基础设施稳定性,正在从“已知风险”变成“被优化对象”
另外,很多开发者在实际工作中遇到过的连接问题、响应延迟波动,也值得重新审视。我自己就曾遇到过类似的情况,排查到最后发现是模型服务商在算力调度高峰期出现的暂时性拥堵。这类问题的背后,往往与 AI 公司的基础设施规模、算力调度策略和硬件冗余度直接相关。
虽然在博文里不便展开具体报错细节,但我想提醒大家:当一家公司在硬件基础设施上投入越大、算力储备越充足,这类稳定性问题的发生频率和恢复速度往往会更有保障。因此,“基础设施的稳健度”也应纳入供应商综合评估,而不只是在 geming 文档里查看 SLA 数字。
6. 写在最后的个人体会
这几年我最大的感受是:AI 行业的竞争,正在从“写代码的人”之间的竞争,变成“造芯片的人”和“建数据中心的人”之间的竞争。OpenAI 和 Anthropic 在争夺的,不只是模型排行榜的第一名,而是定义 AI 硬件规格、成本和产品边界的能力。
这个过程对从业者提出了一些新的要求。过去我们只需要关注模型能力,现在还要去理解芯片架构、算力调度和数据中心设计这些“看着很远”的东西。但反过来,这也意味着 AI 工程师的职业边界在变宽,懂硬件、懂推理部署、懂算力成本的复合型人才,在未来几年会越来越值钱。
关于这场定义权争夺,我的判断是:短期内英伟达仍然会占据主导位置,因为无论是定制芯片还是云厂商自研方案,都还需要时间验证和迭代。但长期来看,一家 AI 公司的护城河,将越来越多地取决于它对硬件的控制能力。作为技术人,我们最好的应对方式,是保持对新架构、新硬件、新部署方式的敏感度——因为下一次技术浪潮,可能就藏在“谁在定义硬件”的这个答案里。