java stream的distinct()依赖对象的equals()和hashcode()实现去重,必须成对重写并遵循契约;若未重写,则按引用地址比较,导致相同字段的不同实例无法去重;推荐用ide生成或lombok注解精准控制业务字段。

Java Stream 的 distinct() 方法本身不关心对象内容,它底层依赖的是对象的 equals() 和 hashCode() 方法。所以要想精准去重,关键不是“怎么调用 distinct”,而是“怎么让对象的 equals 和 hashCode 行为符合你的去重逻辑”。
distinct 去重的本质是基于 Object 的默认行为
distinct() 内部使用的是 LinkedHashSet 来记录已见过的元素,而 HashSet 判断是否重复,完全依赖 obj1.equals(obj2) 返回 true 且两者 hashCode() 相等。如果你没重写这两个方法,那比较的就是引用地址——两个不同实例哪怕字段一模一样,也会被当作不同元素。
重写 equals 和 hashCode 必须成对、一致、符合契约
只重写 equals() 不重写 hashCode(),或反之,都会导致 distinct() 失效(比如漏掉本该去重的项,或误判为重复)。核心规则:
- 如果两个对象 equals 返回 true,它们的 hashCode 必须相同
- 如果两个对象 hashCode 相同,equals 不一定为 true(允许哈希碰撞)
- equals 方法必须满足自反性、对称性、传递性、一致性,且对 null 返回 false
推荐用 IDE(如 IntelliJ)自动生成,或使用 Lombok 的 @EqualsAndHashCode 注解(注意指定 include 或 exclude 字段,避免把无关字段(如 ID、时间戳)纳入判断)。
按业务字段精准控制去重逻辑
比如你有一个 User 类,只想根据 username 和 email 去重,其他字段(如 id、createdAt)忽略:
Java JDK 25 来自 OpenJDK 官方归档,版本为 JDK 25,本条下载地址已指向官方 Windows x64 zip 安装包直链,适合调试旧项目或兼容旧版 Java 运行环境。
✅ 正确做法:在 equals 和 hashCode 中只涉及 username 和 email
@Override
public boolean equals(Object o) {
if (this == o) return true;
if (o == null || getClass() != o.getClass()) return false;
User user = (User) o;
return Objects.equals(username, user.username) &&
Objects.equals(email, user.email);
}
@Override
public int hashCode() {
return Objects.hash(username, email);
}
❌ 错误做法:包含 id(数据库主键通常唯一),会导致所有对象都被视为不同
distinct 在 Stream 中的典型用法
只要对象正确重写了 equals 和 hashCode,直接链式调用即可:
List<user> uniqueUsers = users.stream().distinct().collect(Collectors.toList());</user>
注意:distinct() 是有状态操作,它会缓存已出现的元素,内存占用随去重集合大小线性增长。如果数据量极大且无法全量加载,考虑先排序 + 手动 dedupe,或借助数据库去重。
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










