Kubernetes SIG Autoscaling 2025 年度报告解读:VPA、Cluster Autoscaler 与 Karpenter 的自动缩放演进全景
2026/9/16 13:56:52 网站建设 项目流程

Kubernetes SIG Autoscaling 2025 年度报告解读:VPA、Cluster Autoscaler 与 Karpenter 的自动缩放演进全景

【免费下载链接】communityKubernetes Community Documentation项目地址: https://gitcode.com/GitHub_Trending/com/community

SIG Autoscaling 是 Kubernetes 社区中负责自动化负载与节点缩放的核心小组,覆盖垂直/水平 Pod 自动缩放(VPA/HPA)、集群级节点自动缩放(Cluster Autoscaler、Karpenter)以及系统组件按集群规模自动伸缩(addon-resizer)等领域。本文基于该 SIG 在 annual-report-2025.md 中发布的 2025 年度报告,结合 README.md、charter.md 与根目录 sigs.yaml 中的组织元数据,系统梳理 2025 年三个核心子项目的版本发布、增强提案、KEP 进展、生态扩张与治理变动,帮助读者快速掌握 Kubernetes 自动缩放生态在 2025 年的完整演进脉络与关键技术信号。

一、SIG Autoscaling 的职责边界与组织形态

根据 charter.md 的定义,SIG Autoscaling 的职责范围包括:

  • 自动化负载缩放:垂直与水平 Pod 自动缩放(VPA / HPA),以及容器资源粒度的自动缩放;
  • 初始资源评估:为工作负载提供初始资源请求估算;
  • 集群按比例缩放:集群内系统组件随集群规模自动伸缩(cluster-proportional scaling);
  • 集群自身缩放:对 Kubernetes 集群的节点层面进行自动化伸缩(节点自动缩放)。

其核心交付物是 HorizontalPodAutoscaler 与 VerticalPodAutoscaler 等自动缩放 API 对象,以及 Cluster Autoscaler 这类自动缩放工具,并负责保障 scale 子资源接口的可用性,以便其他 SIG 能构建可缩放对象。年度报告明确,2025 年该 SIG 持续运营 5 个子项目(Subprojects):addon-resizercluster-autoscalerhorizontal-pod-autoscalerkarpentervertical-pod-autoscaler,且全部为「Continuing」状态,无新增或退役子项目。

在治理层面,sigs.yaml 记录的组织数据与年度报告中的领导层变动完全吻合:Chairs 为 Jack Francis(Microsoft)与 Kuba Tużnik(Google),Technical Leads 为 Adrian Moisey、Omer Aplatony 与 Kuba Tużnik,Emeritus Leads 包括 Guy Templeton、Maciek Pytel、Marcin Wielgus 与 Ray Wainman。

二、2025 年度工作亮点总览

年度报告在「What work did the SIG do this year that should be highlighted?」中给出了一份密度极高的成绩单,按子项目拆分如下:

子项目2025 年版本发布关键技术动作
vertical-pod-autoscaler1.3.0、1.4.0、1.5.0(3 个 minor 版本)In-Place Pod Resizing 晋升 Beta(InPlaceOrRecreate特性)
cluster-autoscaler1.33.0、1.34.0(2 个 minor 版本)DRA 成熟度推进(预计 2026 年 GA);性能优化
karpenter1.2.0 ~ 1.8.0(7 个 minor 版本)Static Capacity alpha、Reserved Capacity alpha/beta、Node Overlay alpha、可观测性增强

三线并行是 2025 年的最显著特征:VPA 侧重原地(In-Place)更新能力,CA 侧重DRA 与规模化性能,Karpenter 则围绕**容量管理语义(Capacity)节点叠加(Node Overlay)**快速迭代,全年合计发布了 12 个 minor 版本。

三、Vertical Pod Autoscaler:三个 minor 版本与原地更新 Beta

VPA 在 2025 年保持高频发版节奏,接连发布 1.3.0、1.4.0、1.5.0 三个 minor 版本,其中最值得关注的能力变化是In-Place Pod Resizing 晋升为 Beta(InPlaceOrRecreate特性)(由 @adrianmoisey 推动)。该特性允许 VPA 在 Pod 原地更新资源请求/限制,而无需重建 Pod,从而减少因重启带来的服务抖动——这一方向正是 2024 年度报告(annual-report-2024.md)中「enable in-place pod resource updates compatibility with Vertical Pod Autoscaler」工作的延续与落地。

围绕 VPA,2025 年还推进了三项增强提案(AEP,Autoscaler Enhancement Proposal):

  • AEP-7862:CPU Startup Boost(@kamarabbas99)——为启动阶段提供 CPU 突增能力,解决启动慢/启动卡死类应用的资源供给问题;
  • AEP-8026:允许按 VPA 实例配置组件参数(@omerap12)——将组件级配置参数下沉到单个 VPA 对象粒度,增强多工作负载场景下的灵活性;
  • AEP-8818:InPlace Update Mode 工作启动(@omerap12)——在InPlaceOrRecreate之外探索纯 In-Place 更新模式,进一步减少对 Pod 重建的依赖。

从命名与编号看,这三项提案均沉淀在 autoscaler 仓库的vertical-pod-autoscaler/enhancements/目录下,构成 VPA 2025 年「原地更新 + 启动优化 + 配置细化」三条主线。

四、Cluster Autoscaler:DRA 迈向 GA 与规模化性能优化

Cluster Autoscaler(CA)在 2025 年发布 1.33.0 与 1.34.0 两个 minor 版本,年度报告点名的关键进展有两点:

  1. DRA(Dynamic Resource Allocation)成熟度推进,预计 2026 年毕业到 GA。DRA 与自动缩放的结合意味着节点伸缩需要感知动态分配的资源(如设备、加速器),这是 CA 走向通用硬件调度的重要一步;
  2. 规模化性能改进,报告明确列举了两项具体优化:
    • 并行化 ClusterSnapshot 创建:快照创建是调度决策前的关键路径,并行化可显著缩短大规模集群下每次伸缩评估的耗时;
    • 同构 Pod 的更快装箱(faster binpacking):对资源规格相同的 Pod 群体做批量装箱计算,减少重复计算开销。

这些优化方向与 CA 作为大规模集群默认节点伸缩器的定位一致,解决的是「集群越大、评估越慢」的经典痛点。

此外,CA 在 2025 年提交了两份增强提案:

  • Granular Resource Limits(CapacityQuota API)(@norbertcyran):通过引入 CapacityQuota API 支持更细粒度的资源上限管理;
  • Spare Capacity(CapacityBuffer API)(@jbtk):提供备用容量缓冲,在业务突发前预先保有节点资源。

两份提案共同指向一个主题:让 CA 不只做「按需扩容」,还能管理容量配额与缓冲,这是节点自动缩放从被动响应走向主动容量规划的信号。

五、Karpenter:一年 7 个 minor 版本与新容量语义

Karpenter 是 2025 年节奏最快的子项目,全年发布 1.2.0 至 1.8.0 共 7 个 minor 版本,并围绕「容量管理」与「节点形态」推出多项新能力:

  • Static Capacity(alpha):支持静态容量声明,为固定容量需求的场景提供确定性供给;
  • Reserved Capacity(alpha → beta):在 2025 年内完成了从 alpha 到 beta 的快速演进,提供预留容量语义;
  • Node Overlay(alpha):引入节点叠加层能力,改变节点供给的默认形态;
  • 可观测性增强:新增 Metrics、Conditions 与 Events,让运维者能更清晰地观测节点供给状态与异常原因。

与版本发布配套的是六份 RFC 设计文档,构成 2025 年 Karpenter 的技术蓝图:

RFC 主题负责人
Static Capacity@sumukha-radhakrishna
NodeRegistrationHealthy Status Condition@jigisha620
Node Overlay@engedaam
Karpenter Integration Test Migration(集成测试迁移)@engedaam
DRA KWOK Driver@alimaazamat
GTE/LTE Operators for Requirements(需求条件的大小于等于运算符)@ellistarn

其中「GTE/LTE Operators」意味着 Karpenter 的需求(Requirements)表达将支持>=/<=这类比较语义,从而更灵活地表达节点约束;「DRA KWOK Driver」则是为 Karpenter 的 DRA 测试提供 KWOK(Kubernetes WithOut Kubelet)驱动的轻量验证路径。这两项连同 CA 侧的 DRA 进展,共同表明DRA 已成为 2025 年整个 SIG 的跨子项目重点

六、KEP 工作:v1.33 / v1.34 / v1.35 的自动缩放特性

年度报告第四部分列出了 2025 年交付窗口(v1.33、v1.34、v1.35)内由 SIG Autoscaling 推进的 KEP 进展,2025 年内共两项进入阶段里程碑:

  • Alpha(v1.35):KEP 5030 ——将 CSI 卷挂载限制与 Cluster Autoscaler 集成。该特性让 CA 在扩容决策时考虑节点的 CSI 卷挂载数量上限,避免因节点挂载能力不足导致 Pod 调度失败;
  • Beta(v1.35):KEP 4951 ——HPA 可配置容差(Configurable tolerance for HPA)。允许用户调整 HPA 的默认容忍度阈值,在「过度敏感导致频繁伸缩」与「响应迟钝导致资源浪费」之间取得可配置的平衡。

对比 2024 年(v1.30/v1.31/v1.32 窗口)KEP 1610「Container Resource based Autoscaling」在 v1.30 转为 Stable,可以观察到一条清晰的能力演进链:容器级资源缩放(2024)→ HPA 容差可配置 + 挂载限制感知(2025)——自动缩放从「能不能缩」走向「缩得准、缩得稳」。

七、生态健康度:Provider 扩张与领导梯队建设

年度报告用「Healthy Ecosystem」概括 2025 年的生态进展,具体体现在三个层面:

1. Karpenter Provider 成熟度提升

  • IBM Cloud Provider(karpenter-provider-ibm-cloud)加入,扩大了对 IBM 云环境节点供给的支持;
  • Cluster API Provider(karpenter-provider-cluster-api)就位,让 Karpenter 可以与 Cluster API 管理的基础设施协同工作。

2. Cluster Autoscaler Provider 增长

  • 新增CoreWeave Provider(位于 autoscaler 仓库cluster-autoscaler/cloudprovider/coreweave目录);
  • 新增Utho Provider(位于cluster-autoscaler/cloudprovider/utho目录)。

Provider 的持续扩张意味着两种节点伸缩器在多云与专业基础设施(GPU/云主机)上的覆盖越来越广,用户选择面更大。

3. 工程领导梯队成长

  • @DerekFrank 与 @engedaam 被增补为 Karpenter 项目 approvers,为项目引入了更多代码审查与决策力量。

八、治理变动:Chair 更迭与 HPA 维护者缺口

年度报告披露了 2025 年 SIG 层面的重要人事变动:

  • Maciek Pytel 卸任 Chair(报告特别致谢 @maciekpytel);
  • Kuba Tużnik(@towca)晋升为 Chair
  • Jack Francis(@jackfrancis)晋升为 Lead
  • Ray Wainman 由 Lead 转为 Emeritus(致谢 @raywainman);
  • Adrian Moisey(@adrianmoisey)晋升为 Lead

这一变动后的领导结构(2 位 Chair + 3 位 Tech Leads)已同步反映在 README.md 与 sigs.yaml 中,两个文件与年度报告完全一致。

与此同时,报告在「需要帮助的领域」中明确发出求助信号:HPA(horizontal-pod-autoscaler)子项目需要至少再多一位常态化维护者。虽然 @omerap12 在维护 VPA 之余显著加强了对 HPA 的支持,但单人支撑的风险仍然存在,相关进展被跟踪在 kubernetes/kubernetes#128948 议题中。这是社区读者可以关注的直接贡献入口。

九、社区动态与工作组版图变化

在社区传播层面,2025 年 SIG 在KubeCon NA 2025上发布了 SIG Update 演讲,作为面向整个社区的年度总结窗口。

工作组(Working Groups)方面,年度报告记录了版图的调整:

  • 新增(2025 年)WG Node Lifecycle——该工作组的目标是改善节点与 Pod 生命周期管理,包括更好的节点排水/维护、Pod 中断/终止处理,并明确将「改进节点与 Pod 自动缩放」列为目标之一(见 wg-node-lifecycle/README.md),其 Stakeholder SIG 列表将 SIG Autoscaling 列于首位;
  • 继续运行:WG Batch、WG Device Management、WG Serving;
  • 退役预告WG Serving 将于 2026 年 2 月退休。该工作组聚焦加速工作负载的推理服务支持(见 archive/wg-serving/README.md),其退休表明相关工作已进入收尾或移交阶段。

十、运营健康度:治理流程全绿

年度报告末尾的「Operational」部分逐项核对了 SIG 治理要求(依据 committee-steering/governance/sig-governance.md)的完成情况:

  • README.md 准确性审核与更新;
  • CONTRIBUTING.md 准确性审核与更新;
  • 其他贡献类文档(devel 目录、贡献者指南)审核与更新;
  • sigs.yaml 中子项目列表及关联 OWNERS 文件审核与更新;
  • sigs.yaml 中 SIG 领导(chairs、tech leads、subproject leads)信息准确且活跃;
  • 2025 年会议纪要与录像已从 README.md 链接并更新/上传。

全部治理项勾选完成,说明 SIG Autoscaling 在快速迭代产品的同时保持了良好的文档与元数据卫生,这为外部贡献者提供了可靠的入口信息。

十一、总结:2025 年自动缩放生态的四个关键词

综合 annual-report-2025.md 的全文,可以用四个关键词概括 SIG Autoscaling 的 2025 年:

  1. In-Place:VPA 的InPlaceOrRecreate进入 Beta,加上 AEP-8818 InPlace Update Mode 启动,原地更新成为负载缩放的主旋律;
  2. Capacity 语义:Karpenter 的 Static/Reserved Capacity 与 CA 的 CapacityQuota/CapacityBuffer 提案,共同把节点伸缩从「按需扩容」推向「容量规划」;
  3. DRA 贯通:CA 的 DRA 成熟度推进(2026 年 GA 在望)与 Karpenter 的 DRA KWOK Driver,显示动态资源分配正在成为两个节点伸缩器的共同基础设施;
  4. 规模化性能:CA 的 ClusterSnapshot 并行化与同构 Pod 快速装箱,以及 Karpenter 的可观测性增强,为大规模集群的伸缩可靠性提供了底座。

对于希望深入参与的开发者,报告给出了清晰的切入点:HPA 子项目正在公开招募常态化维护者;VPA 的 AEP、CA 的 proposals、Karpenter 的 RFC 均处于活跃设计期;新增的 WG Node Lifecycle 也与自动缩放强相关。读者可从 README.md 的会议信息(每周四 17:00 Poland 时区例会)、Slack 频道与邮件列表进入社区,从根目录 sigs.yaml 获取子项目 OWNERS 与领导层的权威清单。

【免费下载链接】communityKubernetes Community Documentation项目地址: https://gitcode.com/GitHub_Trending/com/community

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询