预分配数组长度是java处理大规模数据集最直接有效的性能优化方式。arraylist未预分配时因1.5倍扩容机制导致多次o(n)复制和gc压力,推荐构造时指定容量、ensurecapacity或用集合初始化,并按常见批量规模合理设值。

预分配数组长度是 Java 处理大规模数据集时最直接、最有效的性能优化动作之一。它不依赖复杂框架,也不需要改写业务逻辑,只需在创建集合前明确容量预期,就能避开大量隐性开销。
为什么 ArrayList 不预分配会变慢
Java 的 ArrayList 底层是 Object[] 数组,每次 add() 超出当前容量,就会触发扩容:申请新数组 → 用 System.arraycopy 复制全部旧元素 → 丢弃旧数组。这个复制过程是 O(n) 时间复杂度,10 万条数据可能触发约 17 次扩容,累计复制超 120 万次元素。
- 默认初始容量为 10,第 11 个元素就触发第一次扩容(→15)
- 后续按
old + old >> 1(1.5 倍)增长,路径为:10 → 15 → 22 → 33 → 49 → … - 扩容不仅耗 CPU,还制造短生命周期对象,加重 GC 压力
三种推荐的预分配方式
核心原则:**知道大概要存多少个,就提前告诉 ArrayList**。
在 Java 中初始化和管理阿里云 SDK客户端。包括单例模式、线程安全、endpoint 与 region 配置、VPC 终端节点、同步与异步等。
-
构造时指定容量:如批量处理 5000 条日志,直接写
new ArrayList<string>(5000)</string> -
先声明再 ensureCapacity:适用于无法在构造时确定容量的场景,例如解析流式输入前预估大小后调用
list.ensureCapacity(estimatedSize) -
用已知大小的集合初始化:如从另一个集合批量加载,优先用
new ArrayList(sourceCollection),它会自动取sourceCollection.size()作初始容量
容量设多少才合适
不是越大越好,也不是越准越好,关键是“贴近常见批量规模”:
- 分页查询结果(每页 20 条,最多查 10 页)→ 设 200
- 日志聚合、MQ 批量消费(通常一次收 300–800 条)→ 设 512 或 1024
- 完全不可控场景(如用户上传 CSV 行数未知)→ 至少设 64 或 128,比默认 10 更友好
- 避免传小整数如
new ArrayList(100):内部会被提升为 128,但 100 ÷ 0.75 = 133,实际仍会在第 96 个元素时首次扩容
配合预分配的实用细节
光设容量还不够,几个关键点决定效果能否落地:
- 后续添加尽量用
add()顺序追加,避免中间插入或随机索引赋值导致结构不稳定 - 如果后续要
addAll()一个大集合,确保该集合本身也是预分配过的(如用new ArrayList(n)构造) - 对固定结构数据(如 JSON 解析字段),可搭配
jsoniter等库,把反序列化目标直接指向预分配好的 List,跳过中间对象创建 - 别和
LinkedList混用:它没有容量概念,也不支持预分配,大数据量下随机访问和内存局部性远不如 ArrayList
Java免费学习笔记:立即使用
解锁 Java 大师之旅:从入门到精通的终极指南










