c++oding="utf-8" ?>
std::regex_replace 可用于替换常见 html 实体,但需注意 gcc libstdc++ 旧版本对 unicode 支持弱,clang libc++ 更可靠;仅处理 &、、"、' 等 ascii 实体较稳妥。

用 std::regex_replace 处理常见 HTML 实体(如 &、)
标准库的 std::regex_replace 是最直接的选择,但要注意 C++11 起 regex 实现质量参差不齐——GCC libstdc++ 在较老版本(如 GCC 4.9)中对 Unicode 和多字节实体支持弱,Clang libc++ 更可靠。只处理 ASCII 范围内的基础实体(&、、<code>>、"、')基本没问题。
示例:把 & 替换为 &, 替换为 <code>
std::string s = "a & b
- 多个实体要分步替换,且优先处理长实体(比如先
再&),避免&提前被干掉导致解析失败 - 正则中
&本身不是特殊字符,但;是字面量,无需转义;不过...或{这类数字实体需单独匹配 - 性能敏感场景慎用:每次
std::regex_replace构造 regex 对象开销不小,可提前编译std::regex对象复用
手动遍历解析更可控,适合嵌套或非法 HTML 实体
正则在遇到 &unknown;xxx、(超出 char 范围)、&(双重编码)时容易漏判或崩溃。手动扫描能逐字符判断边界、跳过无效序列,并支持递归解码(比如先解 & 成 &,再解成 &)。
核心逻辑:找 &,向后扫描直到 ;,中间内容匹配预定义表或解析数字
std::string unescape_html(const std::string& s) {
std::string out;
size_t i = 0;
while (i '; }
else if (entity == "quot") { out += '"'; }
else if (entity == "apos") { out += '\''; }
else if (entity.size() > 2 && entity[0] == '#' && entity[1] == 'x') {
// ÿ 十六进制
char c = static_cast<char>(std::stoi(entity.substr(2), nullptr, 16));
out += c;
} else if (entity.size() > 1 && entity[0] == '#') {
// A 十进制
char c = static_cast<char>(std::stoi(entity.substr(1)));
out += c;
} else {
// 无法识别的实体,原样保留(如 &unknown;)
out += s.substr(i, end - i + 1);
}
i = end + 1;
} else {
out += s[i++];
}
}
return out;
}
</char></char>
- 不依赖 regex 库实现,兼容性高,所有 C++11 编译器都稳
- 明确控制哪些实体 decode、哪些 passthrough,比如可跳过
©保持原样 - 注意
std::stoi解析失败会抛异常,实际使用应加try/catch或用std::from_chars(C++17)避免异常开销
处理 ...; 和 { 数字实体时的整数溢出风险
😀(?)这类 Unicode 码点远超 char 范围,硬转 char 会截断或触发未定义行为。C++ 标准库无内置 UTF-8 解码,若输入含真实 Unicode 实体,必须用外部库(如 ICU、utf8cpp)或手动拼 UTF-8 字节序列。
- 仅当确定输入全是 Latin-1(U+0000–U+00FF)时,用
static_cast<char></char>才安全 - 用
std::stoi(..., nullptr, 0)可自动识别0x前缀,比分别写十六进制/十进制分支更简洁 - 超过 255 的值(如
Ā)存入char是 implementation-defined,多数平台截断为 0,结果不可靠
别忽略双重编码和实体内嵌空格
真实 HTML 中常见 <(即 的编码),还有 <code>。手动解析器若不递归或多次 pass,会漏掉这一层。另外,规范允许实体内有空白(如 <code> 含空格),但浏览器实际忽略,而你的解析器若严格匹配 <code>" 就会失败。
- 简单做法:循环调用 unescape 直到字符串不变(最多 2–3 次,防死循环)
- 更稳妥的是在匹配 entity 时跳过中间空白:
while (i - 生产环境建议用成熟解析器(如
htmlcxx或lxml绑定),自己写的逻辑很难覆盖所有 HTML5 实体变体
真正麻烦的从来不是 & 或
前端入门到VUE实战笔记:立即使用
在学习笔记中,你将探索 前端 的入门与实战技巧!











