java stream distinct() 去重依赖 equals() 和 hashcode(),未正确实现时按引用比较导致失效;推荐用 ide 自动生成、处理 null、使用 record 或 distinctbykey 等方式确保逻辑去重。

Java Stream 的 distinct() 默认只对基本类型或重写了 equals() 和 hashCode() 的对象生效;对于复杂对象,若未正确实现这两个方法,distinct() 会按引用比较,导致去重失效——这是最常见的坑。
确保对象正确重写 equals 和 hashCode
这是最基础也最关键的一步。Stream 的 distinct() 内部使用 LinkedHashSet 缓存已见元素,依赖的就是 equals() 判等和 hashCode() 分桶。
- 两个对象逻辑相等(如 id 相同)时,
equals()必须返回true,且它们的hashCode()必须相同 - 推荐用 IDE 自动生成(如 IntelliJ 的
Alt+Insert→ “Generate…” →equals() and hashCode()),勾选真正用于判重的字段(例如id或name + email) - 避免在
equals()中调用可能为null的字段方法,应先判空;hashCode()中也需处理null值(可用Objects.hash(field1, field2)简化)
用 distinctByKey 实现按指定字段去重(无需修改原类)
当无法修改对象类(如第三方库实体、DTO 不可侵入)时,可借助 Collectors.toMap() 或自定义无状态谓词实现“按某字段去重”,更灵活高效。
Java Linux版下载入口,提供 Oracle JDK 26.0.2 官方 Linux 安装包、Java 环境配置、JDBC 数据库连接和 Java 服务端开发相关信息。
- 常用技巧:用
ConcurrentHashMap::new作为 map 工厂,配合Function.identity()和取第一个值的 merge 函数 - 示例(按
userId去重,保留首次出现的对象):
List<user> uniqueUsers = users.stream()
.collect(Collectors.collectingAndThen(
Collectors.toMap(
User::getUserId, // key: 去重依据
Function.identity(), // value: 整个对象
(u1, u2) -> u1 // 冲突时保留第一个
),
map -> new ArrayList(map.values())
));</user>
注意 distinct 的性能与顺序特性
distinct() 是有状态中间操作,内部维护一个 Set,时间复杂度约为 O(n),空间复杂度也为 O(n);它保持原始流中**首次出现元素的顺序**,这点和 toMap 方式一致。
- 大数据量时,若仅需去重不关心顺序,可考虑先
sorted()再用reduce()或自定义迭代器,减少内存占用(但通常没必要) - 避免在并行流(
parallelStream())中对非线程安全对象使用distinct()—— 它本身是线程安全的,但前提是元素类型的equals/hashCode无副作用且稳定 - 如果对象字段可变(如后续会修改
id),去重结果可能不可靠;建议去重前确保对象不可变,或使用不可变封装(如record)
用 record 简化判重逻辑(Java 14+)
若能定义新类型,优先用 record。它自动基于所有组件字段生成 equals() 和 hashCode(),语义清晰、不易出错。
- 例如:
record UserKey(Long id, String email) {},再将原对象映射为UserKey流进行distinct() - 也可直接用 record 表达业务上“唯一性”的含义,替代传统 POJO,天然适合 Stream 去重场景
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










