被对手甩开整整24分后,这家巨头两个月抢通下一代超级模型
在人工智能技术角逐的最前沿,出现了一个打破常规的快节奏动作。
正常情况下,打造一款足以代表行业最高水平的基座大模型,就像建造一座工程浩大的超级建筑。从零开始搭建底层架构、在海量数据中完成基础训练,往往要耗费相当漫长的时间周期与庞大的算力资源。然而,就在2026年9月24日,刚刚履新不久的 Google DeepMind 高级副总裁 Koray Kavukcuoglu 在一场行业峰会上公开证实:Google 下一代顶级旗舰模型 Gemini 4 已经正式进入“后训练”阶段。
这个时间节点让外界颇感意外。从2026年7月21日 Google 首次宣布启动该项目的底层预训练,到如今转入后训练精调,中间仅仅耗费了大约两个月的时间。更关键的是,管理层明确表示,希望把这款重量级产品的发布时间大幅提前,争取在远早于2026年年底的窗口期推向市场,并且在推出早期版本之后继续保持高频的快速迭代。
面对如此紧凑的研发排期,很多人难免好奇:这家在底层技术和计算设施上积累深厚的科技巨头,为什么突然按下了加速键?答案就藏在过去大半年里,几张写满压力的数据成绩单与剧烈变动的竞争格局之中。
一、24分的断层:旗舰空窗期下的排名滑落
如果把行业内的独立评测比作一场全方位的大考,Google 过去几个月交出的成绩单显然面临着严峻的挑战。
在业界密切关注的智能指数最新评测版本中,Anthropic 推出的新旗舰 Claude Opus 5.5 拿下了57.6分的顶尖成绩,OpenAI 旗下的 GPT-6 Astra 与 GPT-6 Sol 也分别取得了52.7分和47.5分的高分。相比之下,Google 参与排名的 Gemini 3.6 Flash 仅获得34.0分。这意味着,Google 与第一名之间存在着整整24分的明显差距。在顶级技术梯队的比拼中,这种差距已经不仅是细微的参数差异,而是代表着能否稳居行业最前沿的核心分水岭。
造成这种局面的直接原因,是 Google 在顶级旗舰产品线上经历了一段较长时间的空窗期。回顾整个产品演进路线,Google 上一次推出重大旗舰还是2025年11月的 Gemini 3 Pro,随后在2026年2月更新了微调版。原定于2026年夏天作为中间过渡的 Gemini 3.5 Pro,自从6月起就一直停留在合作方测试环节,最终并未正式公开发布。为了保证产品线的日常运转,团队在2026年大部分时间里都在密集推出轻量化的 Flash 系列,比如9月2日刚刚发布的 Gemini 3.8 Flash。
这些轻量模型虽然在日常响应速度、实时语音交互和基础多步骤任务上表现亮眼,但面对深度逻辑推理、极端复杂的长流程任务时,其能力边界依然无法替代重型旗舰。这一产品断档直接导致在2026年7月,Google 在相关智能指数榜单上首次跌出了全球前五名,落后于多家竞争对手以及开源阵营的模型。
与此同时,竞争对手正在对商业价值极高的细分领域发起猛烈攻势。在企业级市场,编程已经成为驱动企业技术支出的最核心场景,GPT-5.5 以及 Anthropic 的 Claude Code 几乎成为了开发者首选的默认工具,而 Google 在这一场景中几乎处于缺席状态。在消费端,Meta 推出的智能体应用在9月中旬迅速登顶移动应用商店免费榜,并在随后的发布活动中展示了仅有约两英寸、可挂在钥匙扣上的独立硬件设备,以及即将推出的智能眼镜。前有技术基准的拉大,后有终端应用场景的争夺,这让 Google 必须依靠一款真正具备跨代性能的基座模型来重振声势。
二、精细调校车间:大模型出厂前的护栏与考验
在了解 Gemini 4 的研发节奏时,需要理清大模型开发的不同阶段。“进入后训练”并不等于产品明天就能直接推向用户,它标志着底层的通用知识学习已经结束,模型进入了发布前最关键的精细打磨车间。
在底层预训练阶段,模型通过消耗海量的数据与算力,建立起对语言逻辑和通用世界的认知框架。这个阶段耗资巨大,行业内针对此类超大规模训练的电力与硬件投入往往达到数千万甚至数亿美元。根据 Alphabet 管理层此前的表态,Gemini 4 是公司迄今为止最具雄心的一次底层训练,整体体量比以往的产品“明显更大”。
当基础模型跑通并锁定之后,研发重心就会全面转向后训练。在这个阶段,工程师们不再是让模型漫无目的地吸收新知识,而是要针对真实世界的应用场景给它立规矩。这包括注入严格的行为护栏,进行密集的安全测试、红线对齐与内部评估,全力消除模型可能出现的虚假幻觉、偏见以及潜在的滥用风险,确保它在执行复杂任务时给出可靠、可信的输出。
目前,Google 内部已经在利用 Gemini 4 驱动名为 Antigravity 的系统进行内部测试,这也表明模型正在向实际可用阶段靠拢。但历史经验表明,后训练往往是模型研发过程中充满变数的一段路,安全对齐与各项合规评估的严格程度,随时可能对最终上线时间产生影响。这也是为什么管理层虽然表达了尽早发布的意愿,但始终没有给出一个精确到某一天的时间表。
即便 Google 尚未公布 Gemini 4 的底层架构、具体参数量、定价标准以及各项详细跑分,但其技术主攻方向已经非常明确:全面补齐在深度编程领域的短板,大幅强化自主智能体的执行力,以及提升应对超长流程工作任务的能力,为企业与开发者提供具备更高推理精度的生产力底座。
三、千亿资本开支:云端增长背后的兑现压力
驱使 Google 不惜代价加快技术迭代的,除了维持技术第一梯队的声誉,还有财报数据所带来的现实经营考量。
在 Alphabet 公布的2026年第二季度财务业绩中,各项核心业务数据呈现出极高的扩张态势:单季度总营收达到1198亿美元,同比增长24.2%;作为增长核心引擎的 Google Cloud 业务表现尤为突出,单季营收达到248亿美元,同比增速从前几个季度的48%、63%一路上扬至81.8%,云业务的运营利润率也从去年同期的20.7%大幅攀升至35.6%,单季实现运营利润88亿美元。
然而,这套高速运转的商业机器伴随着前所未有的资源投入。财报显示,管理层在当季将2026全年的资本开支指引大幅上调至1950亿至2050亿美元的创纪录区间,而仅仅在三个月前,这个数字的预期还是1800亿至1900亿美元。单季度449亿美元的基础设施开支不仅约为去年同期的两倍,更首次超过了业务本身产生的现金流入,导致该季度的自由现金流呈现负59亿美元。
把两千亿美元级别的资金持续砸向数据中心构建与自研芯片系统,根本逻辑在于下游需求的极度旺盛。财报披露,Google Cloud 积压的已签约未确认订单总额达到了5140亿美元,其中超过一半预计将在未来24个月内转化为实际收入。在过去一年里,有近500家大客户各自处理了超过一万亿次模型输出基本单位。为了应对自建产能暂时无法完全满足的旺盛需求,公司甚至不得不通过租用第三方计算容量来进行过渡。
这种商业模式的平稳运转,高度依赖于底层大模型的核心竞争力。企业客户之所以愿意签下长期的云服务订单,核心诉求是调用行业顶尖的智能模型来重构自身业务。如果 Google 的旗舰模型在性能上长期落后于主要竞争对手,不仅可能影响这5140亿美元积压订单的履约转化速度,更可能导致高价值的企业客户在模型选型时流向其他平台。
面对来自技术基准和外部市场的多重考量,2026年8月接替日常管理工作的 Koray Kavukcuoglu 在公开露面时释放了明确的信号:Google 在自建基础设施和底层算力储备上依然拥有巨大优势,公司完全处在行业最前沿。当下的核心策略,就是打破以往较长的发布周期,以最快速度把经过后训练的早期旗舰版本推向市场,随后通过接近月度的高频迭代来持续扩大领先优势。
这场围绕大模型推理能力、任务执行效率与云端落地成本的技术长跑,正在进入一个节奏空前紧凑的新阶段。Gemini 4 能否在接下来的后训练中顺利完成各项测试并交出预期的答卷,不仅将决定 Google 能否迅速抹平那24分的基准差距,更将深刻影响整个行业智能体生态与开发者市场的未来格局。