kubernetes 中可部署多个调度器实现业务隔离,如 ai 训练用拓扑感知、批处理用资源紧缩调度;需构建自定义镜像、配置 kubeschedulerconfiguration v1、创建专用 serviceaccount 与最小权限 clusterrole,并在 deployment 中指定 --scheduler-name 和配置路径,pod 通过 schedulername 字段选择对应调度器。

在 Kubernetes 集群中让多个调度器并行运行,是为了让不同业务负载走不同调度逻辑——比如 AI 训练 Pod 走拓扑感知调度,而批处理任务走资源紧缩型调度,互不干扰。
准备自定义调度器镜像
先获取可执行的 kube-scheduler 二进制文件。推荐直接复用官方构建产物,避免从头编译:进入 Kubernetes 源码目录后执行 make quick-release-images,生成的二进制位于 _output/dockerized/bin/linux/amd64/kube-scheduler(ARM 架构需替换路径中的 amd64)。
创建 Dockerfile,基础镜像选 registry.k8s.io/pause:3.9 更安全,它比 busybox 或 alpine 更贴近 kube-system 容器运行时行为:
FROM registry.k8s.io/pause:3.9<br>ADD ./kube-scheduler /usr/local/bin/kube-scheduler<br>ENTRYPOINT ["/usr/local/bin/kube-scheduler"]
构建并推送到私有仓库:docker build -t my-registry/my-scheduler:v1.28.0 . && docker push my-registry/my-scheduler:v1.28.0。注意镜像标签必须与集群主版本对齐,否则可能因 API 兼容性失败。
创建调度器专属 ConfigMap
新建 my-scheduler-config.yaml 文件,内容必须使用 KubeSchedulerConfiguration v1 版本,v1beta3 已在 v1.29+ 彻底移除,继续使用将导致 Pod 启动失败:
apiVersion: kubescheduler.config.k8s.io/v1<br>kind: KubeSchedulerConfiguration<br>clientConnection:<br> kubeconfig: /etc/kubernetes/scheduler.conf<br>profiles:<br>- schedulerName: my-scheduler<br> plugins:<br> score:<br> disabled:<br> - name: ImageLocality<br> enabled:<br> - name: MyTopologySpread<br> weight: 30
把这个文件挂载为 ConfigMap:
kubectl create configmap my-scheduler-config \<br> --from-file=my-scheduler-config.yaml \<br> -n kube-system
部署第二个调度器 Deployment
第一步:创建专用 ServiceAccount 并绑定权限。默认 kube-scheduler 使用的 ClusterRole 是 system:kube-scheduler,不能复用——必须新建:
apiVersion: v1<br>kind: ServiceAccount<br>metadata:<br> name: my-scheduler<br> namespace: kube-system
第二步:绑定最小必要权限。只需 get/list/watch pods、nodes、persistentvolumes 等核心资源,以及 patch pods 的 binding 子资源。不要直接 bind cluster-admin,否则违反最小权限原则。
第三步:编写 Deployment,关键点有三处:
① command 参数必须显式指定配置文件路径和 schedulerName:
- --config=/etc/my-scheduler-config/my-scheduler-config.yaml<br>- --scheduler-name=my-scheduler<br>- --authentication-kubeconfig=/etc/kubernetes/scheduler.conf<br>- --authorization-kubeconfig=/etc/kubernetes/scheduler.conf
② 容器安全上下文设为非 root:
securityContext:<br> runAsNonRoot: true<br> runAsUser: 65534
③ 挂载 ConfigMap 到容器内固定路径:
volumeMounts:<br>- name: config<br> mountPath: /etc/my-scheduler-config<br>volumes:<br>- name: config<br> configMap:<br> name: my-scheduler-config
让 Pod 使用新调度器
方法一:直接在 Pod spec 中声明:
apiVersion: v1<br>kind: Pod<br>metadata:<br> name: gpu-job<br>spec:<br> schedulerName: my-scheduler<br> containers:<br> - name: main<br> image: nvidia/cuda:12.2.0-base
方法二:通过 PodPresets 或 MutatingWebhook 注入 schedulerName,适合大规模统一管控场景。但注意:PodPreset 在 v1.29+ 已被废弃,仅建议临时过渡使用。
方法三:用 PriorityClass + 调度器插件联动——当 Pod 的 priorityClassName 匹配特定值时,在 preFilter 阶段重写 schedulerName 字段。这需要你已实现自定义插件并注册到配置中。
验证是否生效:创建 Pod 后立即执行 kubectl get pod gpu-job -o wide,若 NodeName 显示正常且事件中出现 Scheduled 来自 my-scheduler,说明已成功接管调度。











