非法xml字符是xml 1.0规范禁止的unicode码点,包括u+0000–u+0008、u+000b–u+000c、u+000e–u+001f等控制字符;不能直接用iscntrl删除,因其不区分合法/非法unicode控制符且utf-8下行为不可靠;推荐转为u32string后用正则精确过滤。

什么是非法XML字符,为什么不能直接删
XML 1.0 规范只允许特定 Unicode 范围内的字符:U+0009、U+000A、U+000D(制表、换行、回车)和 U+0020–U+D7FF、U+E000–U+FFFD,以及 U+10000–U+10FFFF。U+0000–U+0008、U+000B–U+000C、U+000E–U+001F 这些控制字符(除上述三个外)是非法的,会被 libxml2、tinyxml2 或 .NET 的 XmlDocument 拒绝解析,报错如 Invalid character 或 XML_ERR_INVALID_CHAR。
不能简单用 std::remove_if 配合 iscntrl —— 因为 iscntrl 在宽字符/多字节下行为不可靠,且会误杀合法的 Unicode 控制符(比如 U+2028 行分隔符在 XML 中是合法的)。
用正则过滤非法字符(C++11 及以上)
最稳妥的做法是显式匹配并移除所有非法码点。C++11 std::regex 支持 Unicode 字符类,但注意:标准库 regex 对 UTF-8 编码的字符串做逐字节匹配,不理解 Unicode 码点 —— 所以必须先将 std::string(UTF-8)转为 std::u32string,再用 std::regex 处理码点。
- 先用
std::wstring_convert<:codecvt_utf8>, char32_t></:codecvt_utf8>(或更推荐的std::from_bytes+ C++20std::text_encoding,但暂未普及)转换 UTF-8 字符串到std::u32string - 定义非法范围正则:
R"([\x{0}-\x{8}\x{B}-\x{C}\x{E}-\x{1F}\x{7F}-\x{84}\x{86}-\x{9F}])"(覆盖 U+0000–U+0008、U+000B–U+000C、U+000E–U+001F、U+007F–U+0084、U+0086–U+009F) - 用
std::regex_replace替换为空 - 再转回 UTF-8
std::string
示例片段:
std::string sanitize_xml_string(const std::string& s) {
// UTF-8 → u32string
std::u32string u32 = utf8_to_u32(s);
// 正则匹配非法码点(注意:需编译器支持 \x{...} 语法,GCC 10+/Clang 12+)
std::wregex re(LR"([\x{0}-\x{8}\x{B}-\x{C}\x{E}-\x{1F}\x{7F}-\x{84}\x{86}-\x{9F}])", std::regex_constants::icase);
std::u32string clean = std::regex_replace(u32, re, L"");
return u32_to_utf8(clean);
}
不用正则的轻量级方案(适合嵌入式或旧编译器)
如果不能用 std::regex(比如 GCC utf8cpp 库(头文件 only,无依赖)的 utf8::next:
- 包含
utf8.h,用utf8::iterator或utf8::next逐个提取码点 - 对每个
uint32_t cp,检查是否满足:(cp >= 0x00 && cp = 0x0B && cp = 0x0E && cp = 0x7F && cp = 0x86 && cp - 只把合法码点用
utf8::append写入结果字符串
这样避免了正则开销,也绕过了 std::regex 在不同 STL 实现中对 Unicode 支持不一的问题。
常见坑:Windows 控制台、BOM、换行符处理
容易忽略的点:
- 从 Windows 文件读取时,
\r\n是合法的,但若原始字符串含孤立\r(即\r后非\n),它属于非法字符(U+000D 单独出现是允许的,但 XML 规范要求“只有 CR、LF、CRLF 被视为行结束”,实际解析器常宽松;不过严格起见,建议保留\r和\n,只删\r前置的非法控制符) - UTF-8 BOM(
\xEF\xBB\xBF)不是非法字符,但某些 XML 解析器会因 BOM 报错 —— 这属于格式问题,不是字符合法性问题,应单独剥离,不要混在非法字符清理里 - 日志或调试输出时,用
printf("%02x ", (unsigned char)c)查看原始字节,比std::cout 更可靠,因为终端可能隐藏或替换控制符
真正麻烦的是混合编码:如果输入字符串不是严格 UTF-8(比如 GBK 混入),任何基于 UTF-8 的清理都会出错。务必确认源数据编码,必要时先转码。
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!











