Kubernetes SIG Autoscaling 2025 年度报告解读:VPA、Cluster Autoscaler 与 Karpenter 的自动缩放演进全景
【免费下载链接】communityKubernetes Community Documentation项目地址: https://gitcode.com/GitHub_Trending/com/community
SIG Autoscaling 是 Kubernetes 社区中负责自动化负载与节点缩放的核心小组,覆盖垂直/水平 Pod 自动缩放(VPA/HPA)、集群级节点自动缩放(Cluster Autoscaler、Karpenter)以及系统组件按集群规模自动伸缩(addon-resizer)等领域。本文基于该 SIG 在 annual-report-2025.md 中发布的 2025 年度报告,结合 README.md、charter.md 与根目录 sigs.yaml 中的组织元数据,系统梳理 2025 年三个核心子项目的版本发布、增强提案、KEP 进展、生态扩张与治理变动,帮助读者快速掌握 Kubernetes 自动缩放生态在 2025 年的完整演进脉络与关键技术信号。
一、SIG Autoscaling 的职责边界与组织形态
根据 charter.md 的定义,SIG Autoscaling 的职责范围包括:
- 自动化负载缩放:垂直与水平 Pod 自动缩放(VPA / HPA),以及容器资源粒度的自动缩放;
- 初始资源评估:为工作负载提供初始资源请求估算;
- 集群按比例缩放:集群内系统组件随集群规模自动伸缩(cluster-proportional scaling);
- 集群自身缩放:对 Kubernetes 集群的节点层面进行自动化伸缩(节点自动缩放)。
其核心交付物是 HorizontalPodAutoscaler 与 VerticalPodAutoscaler 等自动缩放 API 对象,以及 Cluster Autoscaler 这类自动缩放工具,并负责保障 scale 子资源接口的可用性,以便其他 SIG 能构建可缩放对象。年度报告明确,2025 年该 SIG 持续运营 5 个子项目(Subprojects):addon-resizer、cluster-autoscaler、horizontal-pod-autoscaler、karpenter、vertical-pod-autoscaler,且全部为「Continuing」状态,无新增或退役子项目。
在治理层面,sigs.yaml 记录的组织数据与年度报告中的领导层变动完全吻合:Chairs 为 Jack Francis(Microsoft)与 Kuba Tużnik(Google),Technical Leads 为 Adrian Moisey、Omer Aplatony 与 Kuba Tużnik,Emeritus Leads 包括 Guy Templeton、Maciek Pytel、Marcin Wielgus 与 Ray Wainman。
二、2025 年度工作亮点总览
年度报告在「What work did the SIG do this year that should be highlighted?」中给出了一份密度极高的成绩单,按子项目拆分如下:
| 子项目 | 2025 年版本发布 | 关键技术动作 |
|---|---|---|
| vertical-pod-autoscaler | 1.3.0、1.4.0、1.5.0(3 个 minor 版本) | In-Place Pod Resizing 晋升 Beta(InPlaceOrRecreate特性) |
| cluster-autoscaler | 1.33.0、1.34.0(2 个 minor 版本) | DRA 成熟度推进(预计 2026 年 GA);性能优化 |
| karpenter | 1.2.0 ~ 1.8.0(7 个 minor 版本) | Static Capacity alpha、Reserved Capacity alpha/beta、Node Overlay alpha、可观测性增强 |
三线并行是 2025 年的最显著特征:VPA 侧重原地(In-Place)更新能力,CA 侧重DRA 与规模化性能,Karpenter 则围绕**容量管理语义(Capacity)与节点叠加(Node Overlay)**快速迭代,全年合计发布了 12 个 minor 版本。
三、Vertical Pod Autoscaler:三个 minor 版本与原地更新 Beta
VPA 在 2025 年保持高频发版节奏,接连发布 1.3.0、1.4.0、1.5.0 三个 minor 版本,其中最值得关注的能力变化是In-Place Pod Resizing 晋升为 Beta(InPlaceOrRecreate特性)(由 @adrianmoisey 推动)。该特性允许 VPA 在 Pod 原地更新资源请求/限制,而无需重建 Pod,从而减少因重启带来的服务抖动——这一方向正是 2024 年度报告(annual-report-2024.md)中「enable in-place pod resource updates compatibility with Vertical Pod Autoscaler」工作的延续与落地。
围绕 VPA,2025 年还推进了三项增强提案(AEP,Autoscaler Enhancement Proposal):
- AEP-7862:CPU Startup Boost(@kamarabbas99)——为启动阶段提供 CPU 突增能力,解决启动慢/启动卡死类应用的资源供给问题;
- AEP-8026:允许按 VPA 实例配置组件参数(@omerap12)——将组件级配置参数下沉到单个 VPA 对象粒度,增强多工作负载场景下的灵活性;
- AEP-8818:InPlace Update Mode 工作启动(@omerap12)——在
InPlaceOrRecreate之外探索纯 In-Place 更新模式,进一步减少对 Pod 重建的依赖。
从命名与编号看,这三项提案均沉淀在 autoscaler 仓库的vertical-pod-autoscaler/enhancements/目录下,构成 VPA 2025 年「原地更新 + 启动优化 + 配置细化」三条主线。
四、Cluster Autoscaler:DRA 迈向 GA 与规模化性能优化
Cluster Autoscaler(CA)在 2025 年发布 1.33.0 与 1.34.0 两个 minor 版本,年度报告点名的关键进展有两点:
- DRA(Dynamic Resource Allocation)成熟度推进,预计 2026 年毕业到 GA。DRA 与自动缩放的结合意味着节点伸缩需要感知动态分配的资源(如设备、加速器),这是 CA 走向通用硬件调度的重要一步;
- 规模化性能改进,报告明确列举了两项具体优化:
- 并行化 ClusterSnapshot 创建:快照创建是调度决策前的关键路径,并行化可显著缩短大规模集群下每次伸缩评估的耗时;
- 同构 Pod 的更快装箱(faster binpacking):对资源规格相同的 Pod 群体做批量装箱计算,减少重复计算开销。
这些优化方向与 CA 作为大规模集群默认节点伸缩器的定位一致,解决的是「集群越大、评估越慢」的经典痛点。
此外,CA 在 2025 年提交了两份增强提案:
- Granular Resource Limits(CapacityQuota API)(@norbertcyran):通过引入 CapacityQuota API 支持更细粒度的资源上限管理;
- Spare Capacity(CapacityBuffer API)(@jbtk):提供备用容量缓冲,在业务突发前预先保有节点资源。
两份提案共同指向一个主题:让 CA 不只做「按需扩容」,还能管理容量配额与缓冲,这是节点自动缩放从被动响应走向主动容量规划的信号。
五、Karpenter:一年 7 个 minor 版本与新容量语义
Karpenter 是 2025 年节奏最快的子项目,全年发布 1.2.0 至 1.8.0 共 7 个 minor 版本,并围绕「容量管理」与「节点形态」推出多项新能力:
- Static Capacity(alpha):支持静态容量声明,为固定容量需求的场景提供确定性供给;
- Reserved Capacity(alpha → beta):在 2025 年内完成了从 alpha 到 beta 的快速演进,提供预留容量语义;
- Node Overlay(alpha):引入节点叠加层能力,改变节点供给的默认形态;
- 可观测性增强:新增 Metrics、Conditions 与 Events,让运维者能更清晰地观测节点供给状态与异常原因。
与版本发布配套的是六份 RFC 设计文档,构成 2025 年 Karpenter 的技术蓝图:
| RFC 主题 | 负责人 |
|---|---|
| Static Capacity | @sumukha-radhakrishna |
| NodeRegistrationHealthy Status Condition | @jigisha620 |
| Node Overlay | @engedaam |
| Karpenter Integration Test Migration(集成测试迁移) | @engedaam |
| DRA KWOK Driver | @alimaazamat |
| GTE/LTE Operators for Requirements(需求条件的大小于等于运算符) | @ellistarn |
其中「GTE/LTE Operators」意味着 Karpenter 的需求(Requirements)表达将支持>=/<=这类比较语义,从而更灵活地表达节点约束;「DRA KWOK Driver」则是为 Karpenter 的 DRA 测试提供 KWOK(Kubernetes WithOut Kubelet)驱动的轻量验证路径。这两项连同 CA 侧的 DRA 进展,共同表明DRA 已成为 2025 年整个 SIG 的跨子项目重点。
六、KEP 工作:v1.33 / v1.34 / v1.35 的自动缩放特性
年度报告第四部分列出了 2025 年交付窗口(v1.33、v1.34、v1.35)内由 SIG Autoscaling 推进的 KEP 进展,2025 年内共两项进入阶段里程碑:
- Alpha(v1.35):KEP 5030 ——将 CSI 卷挂载限制与 Cluster Autoscaler 集成。该特性让 CA 在扩容决策时考虑节点的 CSI 卷挂载数量上限,避免因节点挂载能力不足导致 Pod 调度失败;
- Beta(v1.35):KEP 4951 ——HPA 可配置容差(Configurable tolerance for HPA)。允许用户调整 HPA 的默认容忍度阈值,在「过度敏感导致频繁伸缩」与「响应迟钝导致资源浪费」之间取得可配置的平衡。
对比 2024 年(v1.30/v1.31/v1.32 窗口)KEP 1610「Container Resource based Autoscaling」在 v1.30 转为 Stable,可以观察到一条清晰的能力演进链:容器级资源缩放(2024)→ HPA 容差可配置 + 挂载限制感知(2025)——自动缩放从「能不能缩」走向「缩得准、缩得稳」。
七、生态健康度:Provider 扩张与领导梯队建设
年度报告用「Healthy Ecosystem」概括 2025 年的生态进展,具体体现在三个层面:
1. Karpenter Provider 成熟度提升
- IBM Cloud Provider(karpenter-provider-ibm-cloud)加入,扩大了对 IBM 云环境节点供给的支持;
- Cluster API Provider(karpenter-provider-cluster-api)就位,让 Karpenter 可以与 Cluster API 管理的基础设施协同工作。
2. Cluster Autoscaler Provider 增长
- 新增CoreWeave Provider(位于 autoscaler 仓库
cluster-autoscaler/cloudprovider/coreweave目录); - 新增Utho Provider(位于
cluster-autoscaler/cloudprovider/utho目录)。
Provider 的持续扩张意味着两种节点伸缩器在多云与专业基础设施(GPU/云主机)上的覆盖越来越广,用户选择面更大。
3. 工程领导梯队成长
- @DerekFrank 与 @engedaam 被增补为 Karpenter 项目 approvers,为项目引入了更多代码审查与决策力量。
八、治理变动:Chair 更迭与 HPA 维护者缺口
年度报告披露了 2025 年 SIG 层面的重要人事变动:
- Maciek Pytel 卸任 Chair(报告特别致谢 @maciekpytel);
- Kuba Tużnik(@towca)晋升为 Chair;
- Jack Francis(@jackfrancis)晋升为 Lead;
- Ray Wainman 由 Lead 转为 Emeritus(致谢 @raywainman);
- Adrian Moisey(@adrianmoisey)晋升为 Lead。
这一变动后的领导结构(2 位 Chair + 3 位 Tech Leads)已同步反映在 README.md 与 sigs.yaml 中,两个文件与年度报告完全一致。
与此同时,报告在「需要帮助的领域」中明确发出求助信号:HPA(horizontal-pod-autoscaler)子项目需要至少再多一位常态化维护者。虽然 @omerap12 在维护 VPA 之余显著加强了对 HPA 的支持,但单人支撑的风险仍然存在,相关进展被跟踪在 kubernetes/kubernetes#128948 议题中。这是社区读者可以关注的直接贡献入口。
九、社区动态与工作组版图变化
在社区传播层面,2025 年 SIG 在KubeCon NA 2025上发布了 SIG Update 演讲,作为面向整个社区的年度总结窗口。
工作组(Working Groups)方面,年度报告记录了版图的调整:
- 新增(2025 年):WG Node Lifecycle——该工作组的目标是改善节点与 Pod 生命周期管理,包括更好的节点排水/维护、Pod 中断/终止处理,并明确将「改进节点与 Pod 自动缩放」列为目标之一(见 wg-node-lifecycle/README.md),其 Stakeholder SIG 列表将 SIG Autoscaling 列于首位;
- 继续运行:WG Batch、WG Device Management、WG Serving;
- 退役预告:WG Serving 将于 2026 年 2 月退休。该工作组聚焦加速工作负载的推理服务支持(见 archive/wg-serving/README.md),其退休表明相关工作已进入收尾或移交阶段。
十、运营健康度:治理流程全绿
年度报告末尾的「Operational」部分逐项核对了 SIG 治理要求(依据 committee-steering/governance/sig-governance.md)的完成情况:
- README.md 准确性审核与更新;
- CONTRIBUTING.md 准确性审核与更新;
- 其他贡献类文档(devel 目录、贡献者指南)审核与更新;
- sigs.yaml 中子项目列表及关联 OWNERS 文件审核与更新;
- sigs.yaml 中 SIG 领导(chairs、tech leads、subproject leads)信息准确且活跃;
- 2025 年会议纪要与录像已从 README.md 链接并更新/上传。
全部治理项勾选完成,说明 SIG Autoscaling 在快速迭代产品的同时保持了良好的文档与元数据卫生,这为外部贡献者提供了可靠的入口信息。
十一、总结:2025 年自动缩放生态的四个关键词
综合 annual-report-2025.md 的全文,可以用四个关键词概括 SIG Autoscaling 的 2025 年:
- In-Place:VPA 的
InPlaceOrRecreate进入 Beta,加上 AEP-8818 InPlace Update Mode 启动,原地更新成为负载缩放的主旋律; - Capacity 语义:Karpenter 的 Static/Reserved Capacity 与 CA 的 CapacityQuota/CapacityBuffer 提案,共同把节点伸缩从「按需扩容」推向「容量规划」;
- DRA 贯通:CA 的 DRA 成熟度推进(2026 年 GA 在望)与 Karpenter 的 DRA KWOK Driver,显示动态资源分配正在成为两个节点伸缩器的共同基础设施;
- 规模化性能:CA 的 ClusterSnapshot 并行化与同构 Pod 快速装箱,以及 Karpenter 的可观测性增强,为大规模集群的伸缩可靠性提供了底座。
对于希望深入参与的开发者,报告给出了清晰的切入点:HPA 子项目正在公开招募常态化维护者;VPA 的 AEP、CA 的 proposals、Karpenter 的 RFC 均处于活跃设计期;新增的 WG Node Lifecycle 也与自动缩放强相关。读者可从 README.md 的会议信息(每周四 17:00 Poland 时区例会)、Slack 频道与邮件列表进入社区,从根目录 sigs.yaml 获取子项目 OWNERS 与领导层的权威清单。
【免费下载链接】communityKubernetes Community Documentation项目地址: https://gitcode.com/GitHub_Trending/com/community
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考