使用collectors.groupingby配合collectors.counting()可一行代码高效统计词频,支持忽略大小写、正则清洗、按频次排序取top n及多级分组等扩展功能。

直接用 Collectors.groupingBy 配合 Collectors.counting() 就能高效统计词频,无需手动遍历或维护 Map。
基础用法:一行代码完成分组计数
假设你有一组单词(如字符串列表),想统计每个词出现的次数:
- 用
groupingBy指定按单词本身分组 - 用
counting()作为下游收集器,自动累加每组元素个数 - 结果是
Map<string long></string>,键为词汇,值为出现频次
示例代码:
ListMap
.collect(Collectors.groupingBy(Function.identity(), Collectors.counting()));
// 结果:{apple=3, banana=2, cherry=1}
按频率排序并取 Top N
统计完词频后,通常还需排序和截取高频词。Stream 本身不支持直接对 Map 排序,但可转成 entrySet 流处理:
Java JDK 25 来自 OpenJDK 官方归档,版本为 JDK 25,本条下载地址已指向官方 Windows x64 zip 安装包直链,适合调试旧项目或兼容旧版 Java 运行环境。
- 调用
entrySet().stream()把 Map 转为流 - 用
sorted(Map.Entry.<string long>comparingByValue(Comparator.reverseOrder()))</string>降序排频次 - 用
limit(n)取前 N 个 - 最后可转回 Map 或只保留 key
例如取 Top 3:
List.sorted(Map.Entry.
.limit(3)
.collect(Collectors.toList());
忽略大小写与清洗文本
真实场景中,需预处理原始文本才能准确统计:
- 先用
map(String::toLowerCase)统一大小写 - 用正则
split("\W+")或Pattern.compile("\W+").splitAsStream()拆分单词,过滤空字符串 - 可链式添加
filter(s -> !s.isEmpty())去除空白项
完整流程示例:
String text = "Apple apple BANANA, apple! cherry.";Map
.splitAsStream(text)
.map(String::toLowerCase)
.filter(s -> !s.isEmpty())
.collect(Collectors.groupingBy(Function.identity(), Collectors.counting()));
扩展:多级分组或带条件筛选
如果需要更复杂的分析,比如“统计长度大于 3 的词的频次”,可在流中间插入 filter:
-
filter(word -> word.length() > 3)再分组 - 若要按首字母分组再统计频次,可用
groupingBy(word -> word.charAt(0)),下游仍接counting() - 也可嵌套使用,比如先按长度分组,再在各组内统计具体词汇频次:
groupingBy(String::length, groupingBy(Function.identity(), counting()))
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!










