hpa通过动态调整pod副本数实现负载自适应伸缩。它依赖metrics server采集指标,要求目标deployment设置resources.requests,依据cpu/内存等利用率与目标阈值比较,按公式计算期望副本数并取各指标结果最大值执行扩缩容。

要让容器在负载升高时自动增加副本、负载下降时自动减少,关键就是正确配置 Horizontal Pod Autoscaler(HPA)。它不改单个容器资源,而是动态调整 Pod 数量,适合无状态服务的弹性应对。
前提条件必须到位
HPA 不是开箱即用的功能,依赖底层指标采集能力:
- 集群中必须已部署并正常运行 Metrics Server,它是 HPA 获取 CPU、内存等基础指标的唯一来源;可通过
kubectl get apiservices | grep metrics和kubectl top pods验证 - 目标工作负载(如 Deployment)必须明确设置 resources.requests,例如
cpu: 100m、memory: 256Mi;HPA 计算利用率时以 requests 为分母,没设 requests 就无法生效 - 确保 Deployment 的
replicas初始值大于 0;若为 0,HPA 不会触发任何扩缩动作
核心配置项说明
一份典型的 HPA YAML 中,以下字段决定伸缩行为是否合理:
-
scaleTargetRef:指定要控制的对象,必须与目标 Deployment 的
apiVersion、kind、name完全一致 -
minReplicas / maxReplicas:设定副本数上下限;
minReplicas保障最低可用性,maxReplicas防止突发流量引发资源耗尽 -
metrics:可同时配置多个指标,HPA 会分别计算所需副本数,取最大值执行;常见组合包括:
–type: Resource+name: cpu+averageUtilization: 70
–type: Resource+name: memory+averageUtilization: 80
实际配置示例
以下 YAML 将为名为 my-app 的 Deployment 设置双指标 HPA:
apiVersion: autoscaling/v2
kind: HorizontalPodAutoscaler
metadata:
name: my-app-hpa
spec:
scaleTargetRef:
apiVersion: apps/v1
kind: Deployment
name: my-app
minReplicas: 2
maxReplicas: 10
metrics:
- type: Resource
resource:
name: cpu
target:
type: Utilization
averageUtilization: 70
- type: Resource
resource:
name: memory
target:
type: Utilization
averageUtilization: 85保存为 hpa.yaml 后执行 kubectl apply -f hpa.yaml 即可启用。几分钟后可通过 kubectl get hpa 查看当前指标值与推荐副本数。
几个易忽略但关键的细节
配置完成后,还需注意这些实际运行中的要点:
- HPA 默认每 15–30 秒 拉取一次指标,每 2 分钟 才评估是否需要调整副本;缩容有默认 5 分钟冷却期,避免抖动
- 当同时配置 CPU 和内存指标时,只要任一指标触发阈值,HPA 就按该指标计算出的副本数执行扩容;但缩容需所有指标均低于目标值才进行
- 如果使用自定义指标(如 QPS、延迟),需额外部署 Prometheus Adapter,并将指标类型改为
type: External或type: Pods - 一个 Deployment 建议只绑定一个 HPA;多个 HPA 同时作用会导致副本数被反复覆盖,产生不可控波动











