tinyxml2解析xml后需手动映射为json,因其无内置转换功能;正确做法是dom遍历,统一处理属性(_attr)、文本(_text)、同名兄弟节点(转数组)、编码(仅utf-8)、命名空间(不支持)等边界情况。

用 tinyxml2 解析 XML,再手动映射成 JSON 结构
没有标准库直接支持 XML → JSON 转换,必须组合解析器 + 序列化器。tinyxml2 是最轻量、无依赖、易嵌入的选择,比 pugixml 或 libxml2 更适合简单转换场景。它不生成 JSON,只负责把 XML 拆成树,后续得自己遍历节点、构造 std::map 或 json::value(比如用 nlohmann/json)。
常见错误是直接按标签名硬编码拼接 JSON 字符串——一旦遇到属性、文本混合、空元素或 CDATA 就崩。正确做法是统一走 DOM 遍历:每个 XMLElement 对应一个 JSON object,GetText() 提取内容,Attribute() 读属性,子节点递归处理。
- 根节点必须存在且唯一,
doc.FirstChildElement()返回空时要提前判空,否则调用nullptr->NextSiblingElement()崩溃 - XML 中同名兄弟节点(如多个
<item></item>)需转为 JSON 数组,不能当单个 object 处理;需先统计同级同名节点数,再决定用 array 还是 object - 文本节点和子元素共存时(如
<a>text<b></b></a>),tinyxml2 默认把 text 当作firstChild的XmlText,但b是另一个 child,顺序不能错
nlohmann/json 写 JSON 时怎么处理 XML 的 attribute 和 text 冲突
XML 元素同时有属性和文本内容时,JSON 没有原生对应结构。常见方案是把属性塞进 _attr 字段,文本放 _text 键(或直接用 content),避免覆盖。比如 <price unit="USD">9.99</price> → {"_text": "9.99", "_attr": {"unit": "USD"}}。不推荐把属性平铺到顶层,容易和子元素名冲突。
若 XML 设计规范(如 RSS、SOAP),可约定规则:所有属性转 @xxx 键(类似 XML to JSON RFC 7396 的简化版),文本用 #text,这样能 round-trip 回 XML。但多数内部系统不需要这么严格,_attr/_text 更直观。
详细的 Three.js 3D 图形参考,涵盖场景设置、相机、几何体、材质、光照、动画、控制器、加载器、数学工具和调试。
- 空元素(
<flag></flag>)在 JSON 中建议输出{"_attr": {}}或直接{},不要留"_text": null——nlohmann/json 默认序列化nullptr为null,但语义不清 - 数值文本(如
<id>123</id>)是否自动转 int?别自动转。XML 本质是字符串,JSON 库(如 nlohmann)会按字符串写,除非你显式调用std::stoi并 catch 异常——多数场景保持 string 更安全 - 如果用了
json::object_t手动构造,注意 key 必须是std::string,不能传const char*未转存,否则临时指针释放后 JSON 里出现乱码或 crash
遇到 namespace 或 processing instruction 怎么办
tinyxml2 默认忽略 XML namespace(xmlns:xsi 等)和 PI(<?xml-stylesheet ...?>)。如果你的 XML 依赖 namespace 区分语义(如 SOAP),就得改用 pugixml——它支持 node.attribute("xmlns").value() 提取前缀绑定,tinyxml2 不暴露 namespace 信息。
processing instruction 在 tinyxml2 中是 XMLDeclaration 或 XMLUnknown 类型节点,doc.FirstChildElement() 跳过它们,但若你手动遍历 FirstChild(),需加类型判断:if (node->ToDeclaration() || node->ToUnknown()) continue;,否则 node->Value() 可能返回空或触发断言。
-
XMLComment节点默认被忽略,但若需保留注释,tinyxml2 没提供开关,只能 patch 源码或换库 - 带 DTD 的 XML(
..>)会被 tinyxml2 拒绝加载,报错XML_ERROR_PARSING_DTD,必须提前删掉或用TinyXML2::XMLDocument::SetParseFlags(TIXML2_DEFAULT_XML_FLAGS & ~XML_DOCUMENT_ALLOW_DOCTYPE) - 编码问题:tinyxml2 只支持 UTF-8 输入。若 XML 声明是
encoding="GB2312",必须先用 iconv 或 boost.locale 转 UTF-8,否则中文全乱码
性能瓶颈通常卡在哪几个环节
真正慢的不是解析 XML 或生成 JSON,而是字符串反复拷贝和 map 查找。tinyxml2 的 Value() 和 GetText() 返回的是内部缓冲区指针,直接用于 nlohmann/json 构造函数会隐式 copy;而 json["key"] = std::string(node->Value()) 触发两次分配——一次 std::string,一次 JSON 内部 string buffer。
优化关键:用 json["key"] = json::string_t(node->Value(), strlen(node->Value())) 避免 strlen 重复计算;对固定结构 XML,预分配 json::object_t 容器并用 emplace() 插入;避免递归中频繁 new/delete json 对象,改用栈上对象 + 移动语义(std::move(obj))。
- DOM 树深度超 50 层时,递归函数可能栈溢出,改用显式栈(
std::stack<xmlelement></xmlelement>)迭代遍历 - XML 文件 >10MB 时,tinyxml2 加载耗时明显,可考虑流式解析(SAX)方案,但 nlohmann/json 不支持流式 build,得自己维护 partial json object tree
- 多线程调用?tinyxml2 文档非线程安全,每个线程必须持独立
XMLDocument实例;nlohmann/json 的json::parse()是纯函数,可共享
C++免费学习笔记(深入):立即使用
在学习笔记中,你将探索 C++ 的入门与实战技巧!










