velero是专为跨云跨机房灾备设计的一键还原工具,需依赖已存在的completed备份、目标集群正确安装velero并配置相同backupstoragelocation,且kubectl上下文须指向目标集群,再通过velero restore命令执行还原并逐项验证资源状态。

当生产集群因机房断电、云服务商区域故障或误删操作彻底不可用时,你需要在另一朵云或另一个机房的空集群上,用一条命令把原集群的应用配置、命名空间结构、ConfigMap/Secret、Deployment/Service 甚至 PVC 中的数据库文件完整拉起——Velero 就是为此设计的跨云跨机房一键还原工具。
前提:确保源集群已做过至少一次成功备份
这一步不可跳过。Velero 还原依赖对象存储中已存在的备份快照,不是从头重建。检查命令:velero backup get 必须返回 STATUS=Completed 的记录;同时登录 MinIO/OSS 控制台,确认 backups/<backup-name>/</backup-name> 目录下存在 backup.json 和 resources/ 子目录。若无有效备份,后续所有还原操作均无效。
还原目标集群必须已安装 Velero 服务端(velero install),且配置了与源集群相同的 BackupStorageLocation(即指向同一个 S3 兼容存储桶),否则 velero restore 会报 【BackupStorageLocation not found】 错误并立即退出。
准备目标集群的 kubeconfig 并切换上下文
在执行还原的管理机上,确认当前 kubectl config current-context 指向的是待还原的目标集群(例如 prod-shanghai),而不是源集群(如 prod-beijing)。如果未配置,先将目标集群的 kubeconfig 文件复制到本地,再运行:kubectl config use-context prod-shanghai。
这一步出错会导致所有资源被错误地创建回源集群,或因权限不足直接失败。切勿省略验证:kubectl get ns default 应返回目标集群的默认命名空间信息。
执行一键还原操作
方法一:还原最近一次成功备份(最常用)
运行:velero restore create --from-backup $(velero backup get --output json | jq -r '.items[] | select(.status.phase == "Completed") | .metadata.name' | head -n1)。该命令自动选取最新 Completed 备份名,避免手动输入拼写错误。
方法二:指定备份名称还原(推荐用于灾备演练)
运行:velero restore create --from-backup nginx-backup-20260928-1422。注意备份名必须与 velero backup get 输出完全一致,大小写和连字符都不能错。
方法三:带过滤的精准还原(适用于仅恢复部分命名空间)
运行:velero restore create --from-backup full-prod-20260928 --include-namespaces app-db,app-api。此操作只恢复指定命名空间,跳过监控、日志等辅助命名空间,缩短还原时间。但【PVC 数据不会被自动绑定到新 Pod,需额外检查 PV/PVC 状态】。
监控还原进度直至完成
第一步:查看还原任务状态
velero restore get → 等待 STATUS 列变为 Completed(非 InProgress 或 Failed)。
第二步:逐项验证关键资源
检查命名空间:kubectl get ns app-db app-api;检查 Deployment 是否就绪:kubectl -n app-db get deploy -o wide;检查 PVC 绑定状态:kubectl -n app-db get pvc -o wide,STATUS 必须为 Bound,否则数据库无法挂载。
第三步:验证应用连通性
进入任一 Pod:kubectl -n app-db exec -it <pod-name> -- sh</pod-name> → 执行 ls /var/lib/mysql/ 确认数据库文件存在 → 用 curl http://localhost:8080/healthz 验证服务响应。











