std::map 是统计纯 ascii 字符频次最稳妥的选择,自动排序、避免负 char 下标越界;utf-8 多字节字符需先解码为 unicode code point 再统计,不可直接遍历 char。

用 std::map<char int></char> 统计 ASCII 字符频次最稳妥
对纯 ASCII 字符(英文、数字、标点),std::map 是最直观且不易出错的选择。它自动按字符排序,遍历时顺序可预测,也避免了手动管理数组边界的问题。
常见错误是直接用 char 当数组下标——char 可能为负(如在某些平台 char 默认 signed),导致越界访问或未定义行为。
- 遍历字符串每个
c,执行countMap[c]++即可,std::map会自动初始化新键为0 - 若只关心出现与否(非频次),可用
std::set<char></char>,插入后取size() - 注意:中文、Emoji 等 UTF-8 多字节字符不能直接按
char拆分统计,此时std::map仍按字节计,结果无意义
统计 UTF-8 字符需先做 Unicode 解码
直接遍历 std::string 的每个 char 对 UTF-8 是无效的。一个汉字在 UTF-8 中占 3 个字节,会被拆成 3 个“不同字符”计入统计。
真正按“字符(code point)”统计,必须解析 UTF-8 编码。标准库不提供现成函数,推荐用轻量级第三方库 utf8cpp 或手写解码逻辑。
- 用
utf8::next()(来自utf8.h)逐个提取uint32_tcode point,再喂给std::map<uint32_t int></uint32_t> - 自己解析时,需判断首字节高位模式:
0xxxxxxx(1 字节)、110xxxxx(2 字节)、1110xxxx(3 字节)、11110xxx(4 字节) - 别用
std::wstring+std::wcout想当然解决——Windows 下wchar_t是 16 位,无法完整表示 BMP 外字符(如部分 Emoji)
std::unordered_map 在大数据量时更快,但无序
如果字符串很长(比如 MB 级日志文本),且不需要字符按 ASCII 序输出,std::unordered_map 的平均 O(1) 插入比 std::map 的 O(log n) 更高效。
但它的遍历顺序完全不确定,调试或需要稳定输出时容易误判结果是否正确。
- 声明写法:
std::unordered_map<char int> countMap;</char>,其余操作和map一致 - 若后续要排序输出,得先把 key 拷到
std::vector再std::sort,别试图对unordered_map原地排序 - 注意哈希冲突极少影响正确性,但极端情况下(如大量相同字符)性能会退化,不过日常场景几乎不会遇到
忽略大小写统计?别用 std::tolower 直接转 char
std::tolower 参数是 int,传入 char 可能因符号扩展出错。例如 char c = '\xe9';(é 的 Latin-1 编码),在 signed char 平台上传给 tolower 会变成负数,触发未定义行为。
- 安全写法:先转
unsigned char,再转int:std::tolower(static_cast<unsigned char>(c))</unsigned> - 更可靠的做法是用 locale-aware 版本:
std::use_facet<:ctype>>(std::locale()).toupper(c)</:ctype>,但开销略大 - 如果只处理 ASCII,可手动映射:
c >= 'a' && c ,简单且无副作用
实际编码时,多数情况只需区分 ASCII 字符类型,std::map<char int></char> 足够;一旦涉及国际化文本,UTF-8 解码这一步绕不开,跳过它得到的“字符数”只是字节数。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











