核心思路是遍历字符串时用std::unordered_set记录已见字符,仅保留首次出现的字符构造新字符串;需注意utf-8多字节字符需按码点处理,ascii场景可用std::array优化。

用 std::unordered_set 遍历去重最直接
核心思路是边遍历边记“见过谁”,只保留第一次出现的字符。相比 std::set,std::unordered_set 平均 O(1) 插入和查找,更适合纯判重场景。
常见错误是把去重逻辑写成“删完再扫一遍”,结果反复调用 erase 导致迭代器失效或性能暴跌(O(n²))。
- 遍历原字符串,对每个字符
c:如果seen.find(c) == seen.end(),就追加到结果串,并插入seen.insert(c) - 不要修改原字符串,而是构造新字符串——避免迭代器失效和内存移动开销
-
std::unordered_set<char></char>足够,不需要存位置或计数;ASCII 字符范围小,哈希冲突极少
std::string removeDuplicates(const std::string& s) {
std::unordered_set<char> seen;
std::string result;
result.reserve(s.size()); // 预分配防多次扩容
for (char c : s) {
if (seen.find(c) == seen.end()) {
seen.insert(c);
result += c;
}
}
return result;
}</char>
需要保持原始顺序且区分大小写?默认就满足
上面代码天然保持首次出现顺序,且 'A' 和 'a' 被视为不同字符——这正是多数场景要的效果。如果需求相反(比如忽略大小写、按字母表序排),就得先预处理或换数据结构。
容易踩的坑是误用 std::tolower 时没考虑 locale 或非 ASCII 字符,导致 std::string 中的 UTF-8 字节被截断出错。
- 若真要忽略大小写,建议先转全小写再处理,但仅限 ASCII 输入;否则用 ICU 库
- 不推荐在循环里反复调用
std::tolower+std::toupper判等,效率低且易出错 - 排序需求(如按 ASCII 码输出)应单独
std::sort去重后字符串,别混在遍历里
输入含中文、emoji 等 UTF-8 字符怎么办
标准 std::string 是字节容器,直接按 char 遍历会把一个汉字拆成 2–4 个字节,导致“重复”判断完全错误。这时候不能用 char 当单位。
没有银弹:C++ 标准库至今无原生 UTF-8 字符串支持。硬解就是按 UTF-8 编码规则手动解析字节序列,或引入第三方库(如 utf8cpp)。
- 简单规避:确认输入纯 ASCII,或由上游保证不传多字节字符
- 轻量方案:用
utf8::next(来自 utf8cpp)逐 Unicode 码点提取,塞进std::unordered_set<:uint32_t></:uint32_t> - 别用
std::wstring+std::wcout混搭,Windows 和 Linux 下wchar_t宽度不同,移植性差
性能敏感场景下 std::array<bool></bool> 更快
如果确定输入只有 ASCII(0–127)或扩展 ASCII(0–255),用布尔数组替代哈希表,能省掉哈希计算和内存分配,实测快 2–3 倍。
但一旦越界访问(比如某个 char 是负值,转成 unsigned char 再索引),就会崩——这是最常被忽略的细节。
- 必须把
char c显式转成static_cast<unsigned char>(c)</unsigned>再当数组下标 - 初始化数组用
std::array<bool> seen = {}</bool>,确保全false - 超出 256 的字符(如某些带符号扩展的高位字节)会被截断,务必确认输入范围
复杂点从来不在算法本身,而在于你是否清楚自己处理的是字节、码点,还是抽象字符——边界模糊时,宁可慢一点,也别假设。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











