不能用std::string::find做实时脱敏,因其暴力遍历导致时间复杂度达o(n×m),不支持最长匹配优先与重叠匹配,且无法处理utf-8编码边界和html标签跳过。

敏感词匹配为什么不能用 std::string::find 做实时脱敏
因为暴力遍历 + find 会反复扫描主串,时间复杂度接近 O(n×m),当敏感词库超 1000 条、文本长度超 10KB 时,单次替换可能卡住几十毫秒。更糟的是,它无法处理“南京”和“南京市”共存时的最长匹配问题,容易漏掩或重复掩码。
实操建议:
- 改用 AC 自动机(Aho-Corasick)——C++ 标准库不提供,但
aho-corasick(GitHub 开源轻量实现)可直接集成,构建一次自动机后,单次扫描完成所有匹配 - 若不允许第三方依赖,手写简化版 AC:只保留 failure 边 + output 链表,不用动态内存分配,全部用
std::array和栈数组预分配(例如最大状态数设为 10240) - 敏感词插入前统一转小写(或按需保留大小写),避免同一词因大小写重复建状态
掩码替换要区分「原位覆盖」和「新串构造」两种模式
原位覆盖(in-place)快但危险:如果掩码长度 ≠ 原词长度(比如 “***” 替 “张三”),就会踩内存或破坏 UTF-8 编码边界;新串构造安全但多一次内存分配。
实操建议:
- UTF-8 场景下,绝不要用
std::string::replace原位操作 —— 它按字节索引,而中文字符占 3 字节,pos若落在中间字节上会截断成乱码 - 先用
utf8cpp::distance或手动解析 UTF-8 字节序列,把匹配到的start_byte和end_byte转为 Unicode 码点位置,再映射回字节区间 - 推荐新串构造:用
std::string_builder(C++20)或预估容量(原文长度 + 3 × 匹配数)调用reserve(),避免多次 realloc
如何让引擎支持「跳过 HTML 标签」和「保留格式」
纯文本引擎一遇到 <p>用户说</p><div class="aritcle_card flexRow artxards">
<div class="artcardd flexRow">
<a class="aritcle_card_img" rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架"><img
src="https://img.php.cn/upload/skill/000/000/081/178988956499722.jpg" alt="C++ 算法竞赛自动化测试数据生成与校验框架" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
<div class="aritcle_card_info flexColumn">
<a rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架" class="overflowclass">C++ 算法竞赛自动化测试数据生成与校验框架</a>
<p class="overflowclass">根据原题生成新题面、验证器及完整测试数据,自动套用 testlib 模板,用于用户要求生成测试数据时。</p>
</div>
<a rel="nofollow" href="/xiazai/skill4025" title="C++ 算法竞赛自动化测试数据生成与校验框架" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span>
</a>
</div>
</div> 就可能把 <p></p> 当作普通字符串去匹配,导致标签被错误替换或掩码插入破坏结构。
实操建议:
- 不推荐正则预清洗(如
std::regex)——性能差且难以处理嵌套标签,C++17 的std::regex还有栈溢出风险 - 采用状态机式预扫描:维护一个
in_tag布尔标记,遇到' 切换状态,仅在 <code>!in_tag时喂给 AC 自动机 - 若需保留原始标签位置,记录每个匹配的 byte offset,并在构造结果串时,把未匹配段(含标签)和掩码段交替拼接
- 对富文本(如 Markdown),同理识别
[text](url)中的text区域,跳过括号和括号外内容
std::string_view 能否用于加速?哪些地方必须复制
能,但仅限只读场景。AC 自动机内部状态转移必须基于字节流,std::string_view 可避免构造临时 std::string;但一旦涉及替换、拼接、UTF-8 解析,就必须转为 owned string 或明确生命周期管理。
实操建议:
- 敏感词加载阶段:用
std::vector<:string_view></:string_view>接收词表,构建 AC 时只读取其data()和size(),不拷贝 - 文本输入参数用
std::string_view,但进入 UTF-8 解析前,确认其指向内存不会在函数返回前释放(尤其别传临时std::to_string().c_str()) - 输出结果必须是
std::string—— 因为掩码逻辑可能插入新字节,string_view无法持有所有权 - 若追求零拷贝输出(如写入 socket),可改为接受
std::function<void></void>回调,在每次匹配段/非匹配段就绪时直接投递
真正难的不是匹配算法本身,而是怎么在不破坏编码、不撕裂 HTML、不拖慢响应的前提下,把“掩掉什么”和“留下什么”算清楚。多数人栽在 UTF-8 边界和标签状态同步上,而不是 AC 自动机写得够不够快。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










