spring batch可通过分区+外部协调实现跨jvm分布式批处理:主节点切分任务并分发,工作节点按共享数据标识(如id范围、时间、哈希)执行分片;需共用jobrepository、消息队列及动态itemreader。

Spring Batch 本身不原生支持跨 JVM 的分布式节点调度,但可以通过“分区(Partitioning)+ 外部协调机制”实现真正的多节点并行批处理。关键不是让 Spring Batch 自己跑在多个机器上,而是由一个主节点(Master)切分任务、分发指令,多个工作节点(Workers)按约定方式拉取并执行各自分片——这属于 逻辑分布式,而非框架内置集群。
分片策略要能跨节点识别数据边界
分片不能依赖本地内存或单机文件路径,必须基于可共享、可定位的数据标识,例如:
- 数据库主键范围:按
id BETWEEN ? AND ?划分,所有节点都能查同一库 - 时间分区字段:如
create_time >= '2026-09-01' AND create_time - 业务唯一键哈希取模:如对
order_no做hashCode() % 10,确保相同键总落在同一分片
自定义 Partitioner 需返回带明确上下文的 ExecutionContext,比如:"minId": 1000001, "maxId": 2000000, "dataSource": "shard_2" —— 这些参数会被序列化后传给 Worker 节点。
Worker 节点需支持“被动接收分片任务”
标准 Spring Batch 的 PartitionStep 默认只在本 JVM 内启线程,要跨节点,必须改造执行方式:
在 Java 中初始化和管理阿里云 SDK客户端。包括单例模式、线程安全、endpoint 与 region 配置、VPC 终端节点、同步与异步等。
- 主节点不直接调用 Worker 的 Step,而是把分片参数发到消息队列(如 RabbitMQ/Kafka)或注册中心(如 Nacos/Eureka)
- 每个 Worker 启动时监听指定队列或主动轮询任务列表,拿到分片上下文后,用
JobOperator#startNextInstance()或JobLauncher#run()带参启动专用的 Slave Job - Slave Job 的
ItemReader必须能解析传入的JobParameters(如minId/maxId),动态构造 SQL 查询条件
主从协同与状态一致性保障
避免重复执行或遗漏分片,需统一元数据管理:
- 所有节点共用同一个
JobRepository数据库(如 MySQL),确保JobExecution和StepExecution状态全局可见 - 主节点通过
JobExplorer监控各分片完成状态;失败时可触发重试(仅重试对应分片,不影响其他) - 建议为每个 Slave Job 设置唯一命名规则,如
slave-process-orders-partition-7,便于日志追踪和运维排查
实际部署结构示意
典型生产架构如下:
-
1 台 Master 节点:运行含
PartitionStep的 Job,负责分片、发任务、聚合结果 - N 台 Worker 节点:不运行 Master Job,只监听任务并执行 Slave Job;可水平扩缩容
- 1 套共享中间件:RabbitMQ(任务分发)、MySQL(JobRepository + 业务库)、Redis(轻量协调/锁)
注意:Spring Cloud Task 或 Spring Cloud Data Flow 可进一步封装该模式,提供可视化编排与生命周期管理,但底层仍是上述逻辑。
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南










