xmltodict是解析xml最省心的选择,它将xml字符串一键转为嵌套字典,自动处理属性(@前缀)、文本(#text键)、重复标签(转列表)及命名空间,安装即用:pip install xmltodict,核心函数parse()和unparse()支持双向转换。

用 xmltodict 解析 XML 是最省心的选择
绝大多数场景下,直接安装并使用 xmltodict 库就能把 XML 字符串转成嵌套字典,无需手动遍历节点。它底层基于标准库的 xml.etree.ElementTree,但屏蔽了命名空间、文本/子元素混排、重复标签等常见坑。
安装和基础用法很简单:
pip install xmltodict
然后:
import xmltodict xml_str = '<root><item id="1">foo</item><item id="2">bar</item></root>' d = xmltodict.parse(xml_str)
结果 d 是:{'root': {'item': [{'@id': '1', '#text': 'foo'}, {'@id': '2', '#text': 'bar'}]}}。注意属性会带 @ 前缀,文本内容默认键为 #text —— 这是它的约定,不是 bug。
- 如果 XML 里有同名多个子元素(如上面的两个
<item></item>),xmltodict默认转成 list;若确定只会有一个,可传force_list={}控制 - 含命名空间的 XML 会把 ns URI 当作 key 的一部分,比如
{http://example.com}tag,此时建议先用process_namespaces=True+namespaces=...参数简化 - 大文件慎用:它是一次性加载全部 XML 到内存再解析,超 100MB 的 XML 容易 OOM
遇到超大 XML 文件时,必须用 iterparse 流式处理
当 XML 文件远大于可用内存(例如几百 MB 日志或导出数据),xmltodict.parse() 会直接失败。这时得退回到标准库的 xml.etree.ElementTree.iterparse(),边读边处理。
关键不是“转成完整字典”,而是按需提取字段,例如只取所有 <record></record> 下的 id 和 name:
from xml.etree import ElementTree as ET
for event, elem in ET.iterparse('huge.xml', events=('start', 'end')):
if event == 'start' and elem.tag == 'record':
# 记录开始,可以初始化临时 dict
record = {}
elif event == 'end' and elem.tag == 'record':
# 记录结束,此时 elem.text 和 elem.attrib 都可用
record['id'] = elem.get('id')
record['name'] = elem.find('name').text if elem.find('name') is not None else None
# 处理 record 字典,比如写入数据库或 yield 出去
process_record(record)
elem.clear() # 必须调用,否则内存不释放
-
elem.clear()是硬性要求,漏掉会导致内存持续增长 -
iterparse不自动处理命名空间,若 XML 有xmlns,需提前用ET.register_namespace()或手动 strip 前缀 - 不能直接拿到“整棵树的字典”,你得自己定义结构映射逻辑 —— 这正是流式处理的代价
lxml 比标准库快,但引入额外依赖
如果性能是瓶颈(比如每秒要解析上千个小 XML),lxml 的 etree.fromstring() + 手动遍历通常比标准库快 2–5 倍,也比 xmltodict 快(后者多一层转换开销)。
示例:提取所有 <user></user> 节点的 email 属性
from lxml import etree
tree = etree.fromstring(xml_bytes) # 或 etree.parse(file_path)
emails = [u.get('email') for u in tree.xpath('//user[@email]')]
-
lxml支持 XPath 1.0 和部分 2.0 特性,写查询逻辑更简洁 - 它对畸形 XML 更宽容(比如未闭合标签),但这也可能掩盖数据问题
- Windows 用户装
lxml可能遇到编译错误,推荐用conda install lxml或预编译 wheel - 如果你只需要提取几个字段,别为了“转字典”而把整个树构建成 dict —— 直接 XPath + 字典推导更高效
别忽略编码和特殊字符问题
XML 声明里的 encoding 属性和实际字节流不一致时,xmltodict.parse() 或 ET.fromstring() 会抛 UnicodeDecodeError 或解析出乱码。
- 始终先用
open(..., 'rb')读二进制,再交给解析器,别用open(..., encoding='utf-8')后 decode —— 解析器自己会按声明处理 - 如果 XML 没声明 encoding(或声明错误),且你知道真实编码(如
gbk),可用xmltodict.parse(xml_bytes.decode('gbk').encode('utf-8'))强制转码 - 含 CDATA 或实体引用(如
&)的内容,xmltodict和lxml默认会自动解码,但ElementTree在某些旧版本中可能保留原始字符串,需手动调用html.unescape()
真正难的不是选哪个库,而是想清楚:你要的是“一次性全量结构化”,还是“按需抽取字段”。前者图省事就用 xmltodict,后者必须直面 iterparse 或 xpath —— 没有银弹,只有权衡。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











